面向长时程 VLA 评估的不利状态恢复试验
评估 VLA 策略的机器人团队应在普通任务 rollout 之外,加入受控的接触漂移试验。一个小型测试集可以注入夹爪过早闭合、抓取滑移、抓取位置偏移和抓取姿态不匹配,然后记录策略是否在没有手写重试规则的情况下修复状态。RePO-VLA 使用带有不同标签的成功、失败和恢复 rollout,报告平均对抗成功率从 20% 升至 75%;其 FRBench 协议描述了 46 个任务中的 23,453 个仿真双臂 episode,并定义了错误类型。
这也会改变数据处理方式。失败 rollout 如果包含有用前缀,就应保留;恢复片段应切分出来,让模型从不利状态学习纠正。对于更长的任务序列,ECHO 提供了一个相关测试:存储成功的子目标片段,并在 LIBERO-Long 风格任务上测量检索效果。它报告在 LIBERO-Long 上达到 93.5% 成功率,而原版 π0 为 80.7%;消融实验显示,结构化记忆相对于只用短期缓冲区或扁平记忆有收益。