用于 monorepo 中 coding-agent 变更的内部回放基准
在生产代码库上评估 coding agent 的团队,可以用真实助手会话、已落地的 diff 和稳定的测试子集,搭建一个内部回放基准。ProdCodeBench 把这套做法写得足够具体,可以直接照着做:保留原始开发者提示词,从当前仓库状态中回退已落地的改动,然后用重复执行的 fail-to-pass 和 pass-to-pass 测试来给候选 agent 打分。这里有用的不只是更贴近真实环境,也在于速度。论文将其定位为一种更快的离线检查方式,用于模型替换、harness 变更和基础设施更新;这些情况否则往往要等到缓慢的 A/B 测试之后才能判断。第一个可用版本可以收窄范围:先做一个服务、monorepo 中一个语言占比较高的区域,以及只包含那些已经有稳定相关测试的提示词。如果这一小块数据在三次重复运行中都能复现模型之间的相对排名,而且不需要大量人工分诊,它就可以变成 agent 发布流程中的常规闸口。