有状态评估正在成为默认标准
评估正在更接近真实仓库中的工作方式。SWE-STEPS 在六个 Python 仓库上测试相互依赖的拉取请求链,显示孤立的 PR 评分最多会把成功率高估 20 个百分点。Claude Sonnet 4.5 在一个切分上的成绩从 66.25% 降到 43.75%,Gemini 3 Flash 从 56.52% 降到 36.59%。同一篇论文还报告说,代理写出的代码让仓库健康状况更差,认知复杂度和技术债都高于人工基线。ABTest 从另一个角度推进了同样的思路:它把 400 个已确认的用户失败转成 647 个可执行案例,在 Claude Code、Codex CLI 和 Gemini CLI 上找到了 642 个新的真实异常。核心信息很直接:编码代理的质量现在取决于长时间跨度内的行为、工作区状态,以及对混乱交互的恢复能力,而不只是单个补丁能否一次通过测试。