Execution checks are moving earlier and getting more concrete
基于执行的编码是这一时期最清晰的信号。SolidCoder 用沙箱运行和基于性质的断言替代模型自检,然后保留修复过程中找到的每个失败测试。结果很具体:在 GPT-4o 上,pass@1 在 CodeContests 上达到 77.0%,高于 CodeSIM 的 72.7%;在 APPS 上达到 26.7%,高于 23.3%。消融中下降最大的是代码生成前的边界情况规划,去掉后 CodeContests 表现从 77.0% 降到 53.3%。代价是推理工作更多,所以这条路线更适合正确性比 token 预算更重要的场景。