面向仓库特定代码智能体的失败测试版 AGENTS.md 文件
使用代码智能体的团队可以把仓库指导纳入测试流程。一个可行做法是先写一个简短的 AGENTS.md 文件,为该仓库生成合成缺陷修复探针,让智能体尝试修复,并且只在失败运行显示指令缺失或误导时修改指导。最终文件应以紧凑形式列出子系统入口点、测试命令、已知脆弱路径和质量门禁。
Probe-and-Refine 给出了这个流程的具体形式。在 500 个 SWE-bench Verified 实例上,精炼后的指导达到 33.0% 的平均解决率;静态知识库为 28.3%,无上下文为 25.5%。报告中的提升主要来自更多可评估补丁,而不是更高的单补丁精度。这对维护者有用,因为糟糕的指令文件经常把智能体带到错误文件,或让它在生成有意义补丁之前卡住。
低成本采用测试可以这样做:让同一个智能体在一小组近期已修复缺陷上运行三种指导版本:无文件、手写文件、探针精炼文件。跟踪智能体是否找到正确文件、运行正确测试,并产出可进入评审的补丁。如果精炼文件只增加通用建议,就应像其他无用仓库产物一样被拒绝。