Benchmarks are being pressed to measure precise work, not just passing outputs
评估对“真正修复”这件事的要求越来越严格。PDB 表明,当模型重写了太多代码时,高单元测试分数会掩盖糟糕的调试行为。在 PDB-Single-Hard 上,GPT-5.1-Codex 的单元测试分数达到 76.1%,但编辑精度只有 39.7%;Claude-4.5-Sonnet 的精度达到 71.8%,Gemini-2.5-Pro 为 71.4%。多 bug 程序也有同样的模式,最高的单元测试分数仍然伴随着偏弱的精度。应用构建也给出了一条类似信号:在一台 GH200 上的一项 React Native 任务里,SWE-Bench 排名并不能预测最终交付结果。Kimi-K2.5 Q3 是唯一被判定为在应用层完全符合规格的模型,而 GLM-5.1 和 DeepSeek-V3.2 因为具体的运行问题,开箱无法运行。