生成代码的可执行证据
执行是检验代码生成主张的主要筛选条件。Semantic Voting 表明,在生成的输入上运行候选程序,比文本层面的投票给出强得多的选择信号:在 18 个 HumanEval+ 和 MBPP+ 设置中,基于执行的选择器比输出模式多数投票高出 19 到 52 个百分点。Sketch-and-Verify 对较弱的代码模型给出相近结论。它要求模型尝试不同的算法草图,再用执行指纹检查候选程序。在 Gemini 3.1 Flash Lite 的 19 个困难 HumanEval+ 案例上,较小的草图设置解决了 19 题中的 11 题;相同候选数量下,平铺采样解决了 19 题中的 5 题。
同样的执行标准也出现在测试工作中。ConCovUp 针对普通单元测试漏掉的并发 C/C++ 行为。它结合静态共享内存分析、LLM 引导的路径推理和运行反馈,在九个真实库上把平均共享内存访问对覆盖率从 Claude Code 基线的 36.6% 提高到 68.1%。