持久智能体会话中的工具故障转移发布测试
使用冗余 API 的智能体平台团队应将无提示后端切换加入发布测试,并在每个受支持的 harness 上运行这些测试。AgentCompass 表明,改变 harness 可能使同一模型的 SWE-bench-Pro 得分相差数个百分点,并暴露不同的轨迹故障。set-shifting 基准揭示了另一项运行风险:在持久会话中可靠性发生变化后,即使存在等效的可用工具,智能体仍可能锁定在过时的工具例程上。因此,发布报告应包含按模型和 harness 划分的矩阵,记录切换后的工具调用占比、任务完成率、重复调用次数和恢复延迟,而不只是汇总任务成功率。成本最低的检查方式,是重放一小组接近生产环境的会话,在中途无提示地使首选后端失效,并与新会话对照组比较恢复情况;这可以判断损失是由会话历史还是后端故障本身造成的。