用于编码智能体 rollout 的回放式多轮评审测试
团队在扩大使用编码智能体前,应先用自己代码库中的回放式评审会话来测试候选智能体。测试应保留最初不完整的请求、代码库状态、后续用户修正和最终验证器。评分时把最终正确性和修正次数放在一起看,因为两个智能体可能提交相近的补丁,但需要开发者投入的评审量不同。
SWE-Together 给出了一种可执行的做法:它从 11,260 个记录会话中筛出 109 个代码库级任务,通过状态条件化的用户模拟器回放反馈,并在通过率之外报告 User Correction。SWE-INTERACT 加入了延迟需求带来的压力:在多轮会话中,Opus 4.8 和 GPT 5.5 的解决率从单轮约 50% 降到 26.7% 和 24.7%,GPT 5.5 的单次试验成本从 $2.78 升到 $9.84。一个实用的内部版本可以从最近 20 到 50 个有智能体辅助的工单开始,团队需要能恢复提交、回放首个请求,并把最终测试结果与评审者介入次数进行比较。