AST-level patching with edit-size review for repository repair agents
仓库修复代理现在可以围绕 AST 级别的读取和编辑工具来组织,审查重点放在命名代码实体和补丁大小上。CodeStruct 报告称,这种接口让前沿模型在 SWE-Bench Verified 上的 Pass@1 提升 1.2 到 5.0 个点,GPT-5-nano 从 19.6 跳到 40.4,同时空补丁失败率从 46.6% 降到 7.2%。PRepair 在训练侧指向了同样的操作变化:奖励小而正确的编辑,因为只看通过率会掩盖过度编辑。在 HumanEvalFix 上,Qwen2.5-Coder-7B 的 fix_1@1 从 47.44 升到 81.62,pass@1 只提高 1.37 个点。对交付内部代码代理的团队来说,这个做法很具体:把函数、类和方法暴露为可编辑单元;在工具层拒绝会破坏语法的编辑;记录每个成功补丁的编辑距离;审查代理时看最小的可接受 diff,而不只看测试是否通过。最先受影响的是仓库维护团队,因为坏补丁会在格式上出错、碰到太多无关代码,或者拉长审查周期。