面向缺陷修复代理的补丁前运行时诊断包
缺陷修复代理在编辑代码前需要一条可执行的证据链。一个可落地的工作流可以包装现有代理:把 issue 解析为预期行为,为每个行为生成一个定向的缺陷复现测试,在调试器下运行每个失败测试,并把诊断包附加到代理提示中。诊断包应包括疑似故障位置、失败症状、传播路径、观察到的运行时值,以及预期补丁影响。
SWE-Doctor 是具体参照。它报告在 SWE-bench Verified 上的平均解决率为 75.7%,在 SWE-bench Pro 上为 59.4%;相比基线代理,它在 SWE-bench Pro 上提升了 8.0 到 8.9 个百分点。它的初步研究也说明,简单走“生成一个失败测试,再让代理修复”的路径可能表现更差:在一项包含 100 个 issue 的 SWE-bench Verified 研究中,直接使用高级 BRT 生成器解决的 issue 少于原始 mini-SWE-agent。
团队无需改变整个开发流程即可测试这一做法。可以在最近一批已关闭缺陷上运行这个包装器,将补丁接受率、评审返工和回归失败与当前代理路径对比,并检查诊断包是否把评审者指向了他们手动处理时使用的同一批文件和运行时事实。