面向编码智能体用户负担的多轮发布测试
编码智能体评估应在模型或智能体策略发布前加入一次重放的开发者会话。测试应从一个不完整请求开始,让用户模拟器检查工作区,要求智能体修改计划,并记录最终验证器状态、用户纠正轮次和遗忘需求。
SWE-Together 给出了一种可用的测量方式:它在从真实会话重建的 109 个仓库任务上,评分最终仓库正确性和 User Correction。SWE-INTERACT 说明了为什么这类测试应进入发布检查。在相同底层任务上,Opus 4.8 的单轮解决率从 50.7% 降到交互设置下的 26.7%,GPT-5.5 从 48.0% 降到 24.7%,每次试验成本从 $2.78 升到 $9.84。
一个小规模采用测试可直接执行:取 20 个近期内部智能体会话,要求它们有足够的仓库状态可重放,把最终需求集隐藏在评审脚本或模拟器中,然后比较候选智能体的通过率、纠正轮次、用户消息数、成本和失败标签。这样可以发现那些能找出大多数目标、但仍会漏掉需求或提交实现缺陷的智能体。