Production evaluation for coding agents
当下最强的工作,是尝试用能经受真实工程条件的信号来评价编码代理。ProdCodeBench 从工业单体仓库里的真实开发者-助手会话构造任务,保留原始提示,回推出已落地的 diff,并用稳定的 fail-to-pass 和 pass-to-pass 测试给代理评分。这让离线评估更接近团队在实践中面对的约束。ClickHouse 从部署侧补了一份现场报告:当代理能读代码、运行工具,并留在评审和测试循环里时,它们就有用。那里的数字是运行层面的,不是基准层面的,但它们说明了为什么生产团队会在意扎实的评估。