Trajectory evidence for training coding agents
P2T 将开发者补丁当作私有筛选数据,然后构建由事实、里程碑、编辑和验证步骤组成的过程图。学生代理只能看到经过约束的轨迹前缀。这针对监督微调中的一个常见失败:复制包含重复文件查看、循环或没有依据的推理的长教师轨迹。
报告的提升很实际。在 SWE-bench Verified 上,P2T 相比按结果过滤的监督微调,Pass@1 最高提升 10.8 个点,同时把平均推理成本每个实例降低约 15 美元。ACC 走了另一条长上下文训练路线。它把完成的 Search、软件工程和 SQL 代理运行整理成问答样例,样例来自分散的工具输出。用这些整理后的上下文对 Qwen3-30B-A3B-Thinking 做微调后,MRCR 从 50.19 提升到 68.28,GraphWalks 从 69.92 提升到 77.51。