Structured actions and small edits are becoming the practical recipe for code agents
代码代理工作正在更明确地收紧模型能接触的内容。CodeStruct 用抽象语法树(AST)实体,比如函数和方法,取代了按行范围读取和字符串编辑。在 SWE-Bench Verified 上,这让前沿模型的 Pass@1 提升 1.2 到 5.0 个百分点,GPT-5-nano 从 19.6 跳到 40.4,空补丁失败率则从 46.6% 降到 7.2%。PRepair 把同样的思路放进训练:把修复的正确性和编辑规模一起打分。在 HumanEvalFix 上,Qwen2.5-Coder-7B 的 fix_1@1 从 47.44 升到 81.62,而 pass@1 只小幅提升,说明模型在用更少的无谓重写来修 bug。同一时期的故障定位研究也支持更紧的上下文而不是更大的堆砌,这和同一模式一致:边界更清楚,编辑更干净,误伤更少。