失败 VLA rollout 的 hindsight 重标注
早期成功率较低的 VLA 团队应在 RL 后训练中加入重标注阶段。VLM 检查失败的 rollout,为机器人实际完成的行为写出指令,再根据该指令为 rollout 打分;策略随后同时使用原任务信号和重标注样本进行训练。Learning from Hindsight 让 70%–80% 的 rollout 组可用于训练,在约 5 个训练步内达到标准 GRPO 在 LIBERO-PRO 上的最终性能,而标准 GRPO 接近需要 30 步;在 160 次实体机器人 rollout 中,其成功率达到 56%,GRPO 为 22%。
在收集更多机器人数据前,可以先对已保存的失败样本进行低成本检查。重标注几百条轨迹,人工检查分层抽样样本中的指令和奖励准确性,再将可用组比例及留出任务成功率与当前奖励流程进行比较。部署时应只对行为完整且连贯的片段进行重标注,并拒绝含义不明确的片段,因为错误的 hindsight 指令会让策略学习错误标注的动作。