Execution feedback as training signal
DuST 将生成的代码样本当作成对监督的来源。基础模型为每个问题采样 64 个候选程序,沙箱为每个候选程序标记通过或失败,混合分组再用 Group Relative Policy Optimization(GRPO)训练同一个模型,让它把正确程序排在错误程序前面。奖励只评估排序质量,但生成效果仍然提升。
在 LiveCodeBench v6 上,Qwen3-30B-Thinking 的 pass@1 从 65.4% 升到 68.5%。它的判断分数从 70.1 的 NDCG 升到 76.3,Best-of-4 准确率从 68.7% 升到 72.6%。这给出了一个明确做法:把推理阶段的测试时扩展数据拿来继续训练。