Execution-fingerprint selection for generated code candidates
已经会采样多个方案的编程助手,在返回一个答案前应增加一个沙箱执行步骤。具体做法很直接:生成一组多样化输入,对每个候选加入超时后运行,把输出、异常类型和超时记录成执行指纹,然后从最大的“全部成功”行为簇里选出结果。
Semantic Voting 是这类改动最清楚的例子。它在 18 种 HumanEval+ 和 MBPP+ 配置上显示,基于执行的选择器比基于输出模式的多数投票高 19 到 52 个百分点,而且在消融实验里,基于草图生成的输入是最好的输入来源。Sketch-and-Verify 给低成本模型层增加了一个有用的候选生成规则:先要求不同的算法草图,再把每个草图填充几次,并用执行结果验证这些候选。在 Gemini 3.1 Flash Lite 的 19 个困难 HumanEval+ 题目上,K=2,M=5 解出 11 题,而平铺采样 N=10 只解出 5 题。
一个可行的首个测试,是把这个选择器放到最近内部已经生成多个候选的编码助手任务上。跟踪通过率、沙箱成本,以及没有出现全部成功簇的情况。DSDE 还能在头号候选的行为簇与其他候选差距很大时给出风险分数,在完整验证前给审查者一个不依赖参考答案的信号。