仓库 issue 代理
仓库上下文正在变成可测试、可编辑、可复用的对象。Probe-and-Refine 先生成仓库指导,运行合成的缺陷修复探针,再把失败信息折回到一份紧凑的指导文件中。在 500 个 SWE-bench Verified 实例上,它报告的平均解决率为 33.0%,相比之下,静态仓库指导为 28.3%,无上下文为 25.5%。增益主要来自更多可评估补丁,这说明更好的指导能帮助代理找到代码库中的正确区域。
Phoenix 把类似的工程思路用于 GitHub issue 解决。它把工作拆给规划器、复现器、编码器、测试器、失败分析器和拉取请求代理。它的测试器会比较干净基线运行和打补丁后的运行,只有在变更没有新增失败测试时才打开拉取请求。在一个经过筛选的 24 任务 SWE-bench Lite 切片上,Phoenix 报告有 18 个任务经 oracle 判定已解决,并且成功运行中没有 PASS_TO_PASS 回归。