来源笔记

BUILD-AND-FIND: An Effort-Aware Protocol for Evaluating Agent-Managed Codebases

Code IntelligenceCoding AgentsAgent EvaluationMulti Agent Software EngineeringRepository Understanding

Build-and-Find 评估的是:一个代理写出的代码库,是否让后来的代理能找回它原本想表达的行为和设计选择,以及这种找回要花多少仓库检查成本。

  • 标准的编码代理基准主要测试代码是否通过行为检查,而由代理管理的代码库还需要把设计意图传递给后来的代理。
  • 一个代码库可以行为正确,但让下游代理花更多功夫去找出特性、配置或结构当初为什么这样选。
  • 这对多代理软件工作很重要,因为后来的代理会把生成的代码库当作主要上下文来审计、扩展或修改代码。
  • 构建者代理先看到一个隐藏的仓库规格,然后创建一个自包含的代码库。
  • 查找者代理只看到生成的代码库和一个跟规格追踪的多项选择题库,然后回答有关预期行为和设计选择的问题。
  • 该协议报告审计后的恢复准确率、全对率、可重复性、构建者实现覆盖率,以及新代理检查字节数。
  • 只有在恢复和稳定性检查之后才解释努力成本,所以当答案不可靠时,低检查成本不算好证据。
  • 控制项包括仅问题、仅规格、编译失败、低先验、证据审计,以及构建者-查找者亲和性分析。
  • 这项已发布研究使用了 2 个仓库任务家族、每个任务 15 个问题、48 次构建、1,728 条基于工件的查找记录,以及 25,920 行原始问题记录;通过编译的主面板包含 41 次构建、1,476 条查找记录和 21,312 行有评分的查找者答案记录。
  • 仅问题准确率为 94.5%,仅规格准确率为 99.9%,通过编译的工件条件恢复准确率为 98.9%,比仅问题高出 4.4 个百分点。
  • 有工件时的可重复性高于仅问题控制:正式的工件条件 3 次试验一致率为 97.5%,可靠问题为 96.7%,而仅问题分别是 86.7% 和 66.7%。
  • 构建者侧的实现覆盖率在 85.0% 到 100.0% 之间,其中 4 个构建者达到 100.0%;下游对已实现黄金主张的恢复率为 97.3% 到 99.5%。
  • 在低先验子集上,仅问题准确率为 88.9%,工件条件恢复率为 97.9%,提高了 9.0 个百分点;scratch_minidb 从 90.0% 升至 96.8%,scratch_nanoweb 从 87.8% 升至 98.9%。
  • 条件努力排名把 GPT-5.5 的工件列为低成本、全覆盖样本,高努力面板中的 R_b 为 1.033,GPT-5.5-low 的 R_b 为 1.151;GPT-5.4-mini-high 在高努力面板中排第二,R_b 为 1.320。