带代码和测试补丁联动生成的仓库修复
仓库修复代理可以开始把测试当作可编辑的证据,而不是固定的门槛。Agent-CoEvo 是最清楚的例子:它把代码补丁和测试补丁放在一起运行,在同一个执行矩阵里评分,只保留那些能解释问题报告、并且在有缺陷的仓库上先失败、在修复后的仓库上再通过的候选项。实际中的痛点很常见:团队接到的 bug 报告里,现有测试不完整、过时,或者力度不够,无法锁定行为变化,所以只改代码的修复循环要么对着坏测试过拟合,要么卡住。
一个可落地的产品形态,是给大型 Python 或 Java 仓库维护者用的 CI 修复工作器。它会打开一个草稿 PR,里面有两份关联的 diff:一份是实现补丁,一份是用来说明补丁的测试改动。便宜而明确的检查方式是:抽取那些维护者在修复时确实改过测试的问题,然后把只改代码的代理和共演化循环在合并率、审阅者拒绝率上做对比。论文报告在 SWE-bench Lite 上解决率为 41.33%,在 SWT-bench Lite 上为 46.4%,而且测试质量高于列出的基线,这足以支持在有稳定 bug 积压和现有 CI 覆盖的仓库上试这个流程。