闭环 VLA 训练
多篇论文把监督模仿视为机器人策略的不完整训练信号。dVLA-RL 将近端策略优化(PPO)用于离散扩散 VLA 的采样去噪路径,让策略在多步动作生成中得到可用的似然。论文报告 LIBERO 平均成功率为 99.7%,并把 RoboTwin 2.0 上的 MM-ACT 骨干平均成功率从 61.4% 提高到 92.0%。
Flatness Preserves Instruction Following 处理另一类失效:小规模机器人数据集会让 VLA 忽略变更后的语言指令。在微调中加入 sharpness-aware minimization(SAM)后,无需新数据即可改善反事实指令跟随;其中 LIBERO-CF 成功率为 47.8%,默认 π0.5 微调为 13.2%。RECALL 加入部署循环:在高不确定性状态收集恢复演示,再用回放训练以避免遗忘。它的最强设置达到 72.4% 的 LIBERO-10 总体成功率,匹配的被动收集为 60.2%。