基于执行的代码选择
几篇代码生成论文把执行轨迹当作选择或拒绝大语言模型(LLM)输出的主要信号。Semantic Voting 按候选程序在生成输入上的沙盒行为聚类;在 18 个 HumanEval+ 和 MBPP+ 设置中,基于执行的选择器比基于输出模式的多数投票高 19 到 52 个百分点。SketchVerify 加入了结构化候选生成:它先要求不同的算法草图,再填充草图,最后用执行指纹验证候选程序。在 Gemini 3.1 Flash Lite 的 19 道困难 HumanEval+ 题上,K=2,M=5 解出 11 题,而平坦的 N=10 采样只解出 5 题。
不确定性工作走的是同样的实用路线。语义距离估计(SDE)和定向 SDE 用 fuzz 后输入上的分级行为距离比较采样程序。定向版本在 LiveCodeBench pass@1 失败预测上给出 GPT-4o-mini 的 AUROC 0.844,在汇总表里超过了 DiffTrust 和 Semantic Entropy 等基线。