Recovery-labeled rollout buffers for contact-rich VLA tasks
做双臂或高接触操作的 VLA 团队,应该把失败和恢复回合放进训练缓冲区,并用单独标签区分,然后用注入的抓取错误来评估策略。RePO-VLA 给了一个清楚的做法:从完整回合里切出恢复片段,为这些片段重置观测历史,保留失败 rollout 中仍然有用的前缀并做可靠性衰减,同时把终端漂移标成低价值。这个部署路径也很实用,因为论文里的策略直接用固定的高价值条件,不需要在线失败检测器,也不需要手写重试规则。
先做一个低成本测试就行,围绕已经会让机器人出错的几种失败模式:提前闭合、抓取滑脱、抓取位置偏移、抓取姿态不匹配。RePO-VLA 报告平均对抗成功率从 20% 提高到 75%,它的 FRBench-Sim 数据包含 46 个任务上的 23,453 个双臂回合,其中 6,392 个是已验证的失败-恢复回合。这个规模一开始通常不会被大多数实验室照搬,但流程已经足够清楚,可以先在几个高价值任务上试,再扩大采集。