Reachability checks for latent world-model planning
在 VLA 里加世界模型的团队,应该先测试潜在轨迹能不能被规划器使用,再相信预测损失。OneWM-VLA 给出了一条可行的实现路径:冻结 π0 的大部分参数,把每个相机视图和每一帧压缩成一个语义潜在 token,然后用一个 flow-matching 模型同时生成未来潜在 token 和动作片段。文中报告的提升足够支撑做一个小型原型,包括在 LIBERO 上 98.1% 的平均成功率,以及在真实 Piper 机械臂干净条件下 71.7% 的平均成功率。
缺的检查是可规划性。RC-aux 说明了原因:短视野的潜在预测仍然会产生潜在捷径,目标在潜在空间里看起来很近,动作预算内却到不了。一个低成本评估方法,是在世界模型测试集中加入有限预算可达性标签和时间硬负样本,然后在有障碍或长时程任务上,把动作成功率和终端潜在距离对比起来。对于 Wall 任务,RC-aux 把成功率从 LeWM 控制器的 50.4 ± 6.5 提高到 83.6 ± 3.6,规划器消融也显示,可达性感知规划器在训练之外还能带来额外收益。