基于证据门控的修复与故障诊断
仓库级编码代理正在按其对执行证据的使用情况接受评估。TrajAudit 面向失败的代理运行,预测最早的决定性错误步骤。它的 RootSE 基准包含 93 个失败实例、超过 4,500 个执行步骤,以及约 2,700 万字符。论文报告说,在比基线至少少用 18% token 的情况下,定位准确率提升超过 24.4 个百分点。
EviACT 在自动程序修复(APR)中采用同样的方法。它把失败测试证据带入定位阶段,在测试验证前拒绝格式错误或无法构建的补丁,并在完整回归前重新运行最初失败的测试。使用 GPT-4o 时,它在 Defects4J 2.0 和 SWE-bench 变体上给出领先的修复率;在有基线成本可比时,每个 bug 的 API 成本低 70.1–88.6%。
MocklessTester 为 Java 测试加入了同类思路的更底层版本。它挖掘真实的依赖使用,编译并运行生成的 JUnit 测试,并在符号和类型状态约束下修复失败。它在 Defects4J 上报告的平均行覆盖率为 88.82%,分支覆盖率为 83.74%,执行到的真实依赖代码比基于 mock 的基线更多。