Execution-time feedback in code generation
代码模型在生成循环里获得更紧的反馈。Think-Anywhere 训练模型在写代码时在困难位置插入推理,并报告平均 pass@1 为 70.3,高于基础模型的 61.0 和一个 GRPO 基线的 68.4。ConSelf 用执行行为判断哪些自生成训练问题值得学习,再按行为一致性加权偏好学习;它报告的提升较小,为 2.73% 到 3.95%,但这种方法不需要教师模型或测试判题器。共同模式很直接:更多训练信号来自做决定时的可执行行为,而不是先写好的单一计划。