Compact and plannable world models
世界模型研究聚焦于更小的潜在状态和更好的规划信号。OneWM-VLA 将每个相机视图和每一帧压缩成一个语义 token,然后把未来潜在 token 和动作块一起生成。它报告在 MetaWorld 上平均成功率为 61.3%,高于 π0 的 47.9%;在 LIBERO 上平均成功率为 98.1%;在真实 Piper 机械臂、清洁条件下成功率为 71.7%,高于 π0 的 50.0%。
RLA-WM 使用 Residual Latent Action(RLA),这是一个描述 DINO 特征变化的紧凑编码。它以每次推理 3.5T FLOPs 预测未来视觉特征,并在 ManiSkill 和 IWS 的预测指标上优于列出的 feature 和 flow 基线。RC-aux 给潜在世界模型加入可达性监督,说明准确的短期预测仍然可能误导规划器。在 Wall 任务上,它把成功率提升到 83.6 ± 3.6,而 LeWM 对照组是 50.4 ± 6.5。