Private replay benchmark for agent-assisted code changes
已经在使用编码代理的团队,可以先做一个内部基准,来源是真实的已接受代理会话,保留原始提示词,把已落地的 diff 从仓库中回退,并用稳定测试集按 fail-to-pass 和 pass-to-pass 评分。ProdCodeBench 说明,这种方法可以在变化中的 monorepo 里运行,并且在模型和执行框架变化时仍然给出可重复的离线评估。对要在代理配置、工具接线和模型升级之间做选择的团队来说,这很有用,因为线上 A/B 测试要花几周,还会把真实开发者暴露在糟糕运行结果里。
真正有用的不是公开排行榜,而是绑定到你自己的仓库和提示分布的滚动私有评估流水线。先从某个团队已经合并的代理辅助改动开始,去掉无法通过执行检查的请求,再加入变更前和变更后重复跑测试,用来筛掉不稳定测试。把它用于代理更新的发布门禁,以及提示词、检索或工具改动后的回归检查。一个便宜的验证方法,是回放最近几十个已接受会话,看看分数变化是否比你现在的基准组合更贴近审阅者偏好和 CI 结果。