带危险 commit 跟踪的长时程分阶段评测
长时程操作的基准测试需要失败日志,不能只看一个成功率数字。LongBench 给出了一个具体模板:按失败机制拆分任务,按阶段给进度打分,并把完全可观测的任务与需要记住早期上下文的任务分开。对已经在做桌面或实验室操作的机器人团队,实际可做的是搭建一套评测工具。它应当给每个 episode 标注机制标签,例如 phase dependence、error accumulation、temporal windows 和各类 ambiguity,然后报告策略在哪一步停滞或漂移。相比单一任务完成率,这对模型选型更有用,因为 LongBench 显示,即使所有模型都使用同样的 16-step open-loop interface,不同失败机制上的差距仍然很大。这种打分方式也适合做安全审查。HazardArena 说明了为什么终点成功率会掩盖风险:一个策略可能已经到达危险前提条件,或几乎完成了一个不安全动作,但最后没有做完。因此,面向部署的测试平台应为常见任务的不安全 twin 添加动作级别的 attempt、commit 和 success 计数。向家庭、实验室或仓库交付 VLA 系统的团队,可以先用现有的 teleoperation 和 replay 栈搭起这套评测,再考虑增加新的模型复杂度。一个成本很低的第一步,是用分阶段指标和危险前提条件指标,重新给当前某个 benchmark 或内部任务集打分,看看候选策略的排序会不会变化。