---
source: arxiv
url: https://arxiv.org/abs/2605.06136v1
published_at: '2026-05-07T12:35:27'
authors:
- Jhen-Ke Lin
topics:
- code-intelligence
- coding-agents
- agent-evaluation
- multi-agent-software-engineering
- repository-understanding
- human-ai-interaction
relevance_score: 0.88
run_id: materialize-outputs
language_code: zh-CN
---

# BUILD-AND-FIND: An Effort-Aware Protocol for Evaluating Agent-Managed Codebases

## Summary
## 摘要
Build-and-Find 评估的是：一个代理写出的代码库，是否让后来的代理能找回它原本想表达的行为和设计选择，以及这种找回要花多少仓库检查成本。

## 问题
- 标准的编码代理基准主要测试代码是否通过行为检查，而由代理管理的代码库还需要把设计意图传递给后来的代理。
- 一个代码库可以行为正确，但让下游代理花更多功夫去找出特性、配置或结构当初为什么这样选。
- 这对多代理软件工作很重要，因为后来的代理会把生成的代码库当作主要上下文来审计、扩展或修改代码。

## 方法
- 构建者代理先看到一个隐藏的仓库规格，然后创建一个自包含的代码库。
- 查找者代理只看到生成的代码库和一个跟规格追踪的多项选择题库，然后回答有关预期行为和设计选择的问题。
- 该协议报告审计后的恢复准确率、全对率、可重复性、构建者实现覆盖率，以及新代理检查字节数。
- 只有在恢复和稳定性检查之后才解释努力成本，所以当答案不可靠时，低检查成本不算好证据。
- 控制项包括仅问题、仅规格、编译失败、低先验、证据审计，以及构建者-查找者亲和性分析。

## 结果
- 这项已发布研究使用了 2 个仓库任务家族、每个任务 15 个问题、48 次构建、1,728 条基于工件的查找记录，以及 25,920 行原始问题记录；通过编译的主面板包含 41 次构建、1,476 条查找记录和 21,312 行有评分的查找者答案记录。
- 仅问题准确率为 94.5%，仅规格准确率为 99.9%，通过编译的工件条件恢复准确率为 98.9%，比仅问题高出 4.4 个百分点。
- 有工件时的可重复性高于仅问题控制：正式的工件条件 3 次试验一致率为 97.5%，可靠问题为 96.7%，而仅问题分别是 86.7% 和 66.7%。
- 构建者侧的实现覆盖率在 85.0% 到 100.0% 之间，其中 4 个构建者达到 100.0%；下游对已实现黄金主张的恢复率为 97.3% 到 99.5%。
- 在低先验子集上，仅问题准确率为 88.9%，工件条件恢复率为 97.9%，提高了 9.0 个百分点；scratch_minidb 从 90.0% 升至 96.8%，scratch_nanoweb 从 87.8% 升至 98.9%。
- 条件努力排名把 GPT-5.5 的工件列为低成本、全覆盖样本，高努力面板中的 R_b 为 1.033，GPT-5.5-low 的 R_b 为 1.151；GPT-5.4-mini-high 在高努力面板中排第二，R_b 为 1.320。

## Problem

## Approach

## Results

## Link
- [https://arxiv.org/abs/2605.06136v1](https://arxiv.org/abs/2605.06136v1)
