Execution-scored RL for engineering agents
强化学习之所以更可用,是因为训练目标更窄,环境更快。Scaling Coding Agents via Atomic Skills 把软件工作拆成五个可验证技能,并报告在十个任务上的平均提升为 18.7%,其中 SWE-bench Verified 从 0.507 提升到 0.585。SandMLE 把同样的先执行后评估逻辑用到机器学习工程:合成任务把运行时间从约 200 秒降到 15 秒以内,然后在 MLE-bench-lite 上把 Any Medal 率提高 20.3%,达到 66.9%。共同模式很直接:让每一步都便宜、容易评分,然后再扩展 on-policy RL。