评估正在从对话记录检查转向整轮运行证据
评估工作正在向完整代理行为靠近。最强的例子是一个面向 agentic systems 的 sim/eval 栈,它在一次运行中测试多步动作、工具使用、后端状态和用户可见结果。它把场景设计、模拟和评分分开,再记录世界状态、工具轨迹、对话记录和表层产物。CUJBench 把同样的证据要求用在故障诊断上。它把浏览器和后端证据冻结成可复现的事故快照,而当前代理的准确率仍只有 19.7%。共同的结论很直接:对于通过工具和状态变化来行动的系统,只看对话记录打分远远不够。