面向使用工具的代理的可回放 episode 评估
构建客服、运维或浏览器代理的团队,现在可以为一种评估框架提供理由,这种框架会记录整个运行过程,并对状态变化、工具使用和用户可见工件打分。只看转录内容的审查不够。sim/eval 论文给出了一套具体做法:把场景设计、模拟和评分分开;记录世界状态、工具轨迹、转录文本,以及截图或遥测;终态和过程优先用确定性检查;只有在范围很窄的问题上才使用模型裁判。CUJBench 提供了一个难度很高的运维例子。它把浏览器和后端证据冻结成确定性的事故快照,而六个前沿模型的准确率仍只有 19.7%,主要失败点是跨模态综合。这里一个可行的实现,是给退款、改订单、失败结账诊断这类单一流程做一个可回放的 episode 运行器,并对后端状态和必需的工具调用设置通过/失败门槛。一个低成本的初步检查,是拿最近十个支持或事故案例,在沙箱里回放,比较只看转录的分数和按结果、工具轨迹检查的分数。如果排名不同,当前评估栈就漏掉了生产中重要的失败。