Edit-budget checks for agent-generated bug fixes
使用编码代理做漏洞修复的团队,可以在代码评审前加一道编辑预算门槛。这个门槛应当把代理补丁和最小可行修复做比较,然后标出“测试通过,但补丁改了无关代码”的情况。PDB 给了直接理由:在 PDB-Single-Hard 上,GPT-5.1-Codex 的单测得分是 76.1%,编辑精度只有 39.7%,多漏洞程序里也能看到同样的差距。即使是代理式设置,也更多提升了通过率,而不是精度,所以只问“CI 绿了没有”的流程会漏掉大范围、风险更高的改动。
一个实用的初版很简单。照常运行代理,然后按受影响文件、修改行数,以及与失败测试或堆栈跟踪中可疑区域的重叠程度给 diff 打分。超出预算的补丁可以送到第二轮,让模型给出更窄的修改;或者连同原始失败上下文一起交给人工评审。对大型仓库里的团队来说,这个控制很有用,因为评审成本和回归风险比基准分数更重要。
便宜的检查方式是抽样最近通过 CI 的代理修复,统计评审后来删减或回退无关改动的比例。如果这个比例高,编辑精度已经是本地流程里的运营问题。