基于轨迹的训练和更难的编码任务
Socratic-SWE 将求解轨迹当作可复用的训练材料。它把重复的失败模式和修复模式提炼成技能,再用这些技能生成有针对性的仓库修复任务。在 36k 任务预算下,它在三轮迭代后于 SWE-bench Verified 上报告 50.40%,并且在四个基准上相对 Qwen3.5-9B 基础代理平均提升 6.22 个百分点。
BenchEvolver 通过构造任务来应对基准饱和。它先修改可执行的参考解,再围绕这个解编写题面和测试。它的 91 题基准让前沿模型的 Pass@1 落在 27.5% 到 62.6% 之间,Hard 切分在评测模型上的平均成绩从 87.0% 降到 45.7%。