Fleet-scale online reinforcement learning
LWD 在这组结果里给出了最强的真实部署表现。它先从一个预训练的 VLA 策略出发,把检查点发送到共享车队,收集自主 rollout 和可选的人类介入,再用离线与在线回放混合数据重新训练。报告中的评估用了 16 台双臂机器人,覆盖 8 个操作任务,包括 Gongfu tea、cocktails 和 fruit juice 这类需要 3–5 分钟的任务。一个通用策略在几小时在线交互后达到 95% 的平均成功率。
关键的研究信号是把失败试验和部分进展当作训练数据。Distributional Implicit Value Learning 先在回放动作上拟合一个价值分布,再把自适应的高分位目标用于时序差分学习。这个设计的目标是在长任务中传播稀疏奖励,同时不要求每次 rollout 都是完整示范。