Executable checks for generated software
几篇论文把大语言模型(LLM)输出放到任务特定测试下,而不是接受流畅代码。ConCovUp 通过寻找共享内存访问对、向后推理输入,并运行生成的多线程驱动程序,来针对并发 C/C++ 行为。它把 9 个库上的平均共享内存访问对(SMAP)覆盖率从 Claude Code 基线的 36.6% 提高到 68.1%。
RubricRefine 在真实工具执行前做同样的检查。它为任务和工具注册表生成评分标准,检查输出形状、路由、参数来源和调用顺序,然后在任何环境动作前修复代码。在 M3ToolEval 上,它在 7 个模型上的平均成功率是 0.86,而单次运行的 CodeAct 是 0.62。SmartEval 把这种评估压力扩展到 Solidity 合约,在 9,000 个生成合约上按规格一致性、状态机正确性、业务逻辑和代码质量打分。