交互式编码智能体评估
基准测试开始把用户重新纳入评估流程。SWE-Together 从 11,260 个已记录会话中重建了 109 个仓库级任务,并同时评估最终正确性和 User Correction,即智能体需要多少明确纠正或较软性的反馈。Claude Opus 4.8 在报告的智能体中领先,pass@1 为 63%,而参考补丁基线约为 78%。
SWE-INTERACT 让交互成本更清楚。在相同的底层任务上,Opus 4.8 的解决率从单轮设置的 50.7% 降到多轮设置的 26.7%。GPT 5.5 从 48.0% 降到 24.7%,同时每次试验成本从 $2.78 升至 $9.84。失败还包括长期交互后的遗忘需求和实现错误,目标遗漏只是其中一类。