交互式编码代理基准
两个基准把用户重新纳入软件工程评测。SWE-Together 从真实用户-代理会话中重建 109 个仓库任务,同时评分最终代码质量和 User Correction;后者衡量明确纠正和较轻的提示。Claude Opus 4.8 在已报告的运行中以 63% pass@1 领先,而参考补丁基线约为 78%。
SWE-INTERACT 显示,模糊请求和延迟给出的需求会让任务难很多。在相同的底层任务上,Opus 4.8 从单轮 50.7% 的解决率降到交互设置下的 26.7%。GPT-5.5 从 48.0% 降到 24.7%,同时每次试验成本从 $2.78 升到 $9.84。失败标签说明了问题:许多代理找到了大部分目标,之后仍会遗漏需求或引入实现 bug。