CI 执行凭证,面向代理生成的补丁
仓库级编码代理应该返回补丁,以及证明它有效的精确执行记录。AgentForge 最能支持把这件事当作产品要求,而不是研究层面的附带优化:每次代码变更都会先在网络隔离的 Docker 沙箱中运行,系统在 SWE-bench Lite 上达到 40.0% 的解决率,比单代理基线高 26 到 28 个百分点。这里更实用的交付物是一个面向 CI 的执行凭证层,保存补丁、生成的测试、沙箱配置、stdout 和 stderr,以及每次尝试的 fail-to-pass 和 pass-to-pass 结果。
这适合已经在试仓库代理、又被评审时间拖慢的团队。评审者不需要再看一段“为什么这个修复应该有效”的总结;他们需要的是可回放的记录,能看出实际运行了什么、有没有引入回归。第一个便宜的测试范围要收窄:先要求代理在一种任务上附带执行凭证,比如 flaky test 修复或小型 bug 修复,再把评审通过率和合并时间,和只提供文本与 diff 的代理输出做对比。AnalysisBench 从另一个角度支持同样的边界。它的最佳代理只有在出现工具特定证据后才停止,而自验证仍把成功率高报了 15%,这说明不能让代理在没有外部工件检查的情况下自己宣布完成。