用于内部模型测试的按阶段长时程机器人评估
机器人团队现在已经有足够证据,把单一成功率换成按阶段计分的长时程评估,用在每周模型测试里。LongBench 说明了这样做的必要性:长任务会通过不同机制失败,包括执行漂移、阶段切换错误、错过时间窗口,以及需要依赖早先上下文的歧义状态。一个简单的通过/失败数字会把这些差异掩盖掉。
可落地的做法是做一个内部评测工具,按完成的子步骤给每个任务计分,并按失败机制打标签。做桌面操作策略的团队可以先从很窄的一组任务开始:一个时间窗口任务、一个误差累积任务、一个上下文相关任务。重点是看模型是否每次都卡在同一阶段、是否在回合后段退化,或者是否把外观相近的状态混淆了。这样比汇总成功率更能给模型和数据团队明确目标。
LongBench 也直接指出了当前策略的薄弱点。在完全可观测任务上,pi_0 的平均阶段分数是 86.3,Diffusion Policy 是 51.2,OpenVLA-OFT 是 32.7。动态抓取是最严苛的压力测试:pi_0 达到 73.3,而其余列出的系统都在 0.0 到 13.3 之间。一个成本不高的验证步骤,是把现有的一项内部任务重新跑一遍,加入阶段标注,再把排序和当前的通过/失败榜单对比。如果排序或失败原因发生变化,旧评测就在藏信号。