Fleet replay loop for deployed VLA manipulators
运行多个机械臂的机器人团队应该把部署日志当作训练输入,包括自动尝试失败、部分进展、恢复过程和人工介入。LWD 给出了一种具体做法:把当前检查点发送到共享机队,收集 rollout 放入在线回放缓冲区,与离线数据混合,再用能把稀疏奖励传播到长任务中的价值学习来重新训练共享的 VLA 策略。
采用这类方法时,成本较低的验证办法很窄:挑两到三个在物体、摆放或用户指令有小变化后会失败的任务,然后跑一个带成功、失败和介入标签的短回放循环。LWD 仍然是研究结果,但它的评估用了 16 台双臂机器人、8 个真实世界任务,包括 3 到 5 分钟的操作任务,并报告在几小时的在线交互后平均成功率达到 95%。这已经足够说明,在再买一轮干净演示数据之前,先把数据管道搭起来是值得的。