世界模型训练与适配
世界模型现在被用作训练空间和控制先验,同时减少任务特定机器人数据的压力很明确。HarmoWAM 将视频世界模型与预测式、反应式动作专家结合起来,再在移动阶段和交互阶段之间路由控制。它报告的域外增益是在六个真实世界任务上比先前 VLA 模型高 33 个百分点,比先前世界动作模型(WAMs)高 29 个百分点。
RAW-Dream 给出了本周最明确的数据效率主张。它在一个任务无关的视频世界模型中用强化学习训练 OpenVLA-OFT,并使用 Qwen3-VL 做奖励判断。在 LIBERO 上,它用 10 个目标演示、且不使用目标 rollouts 训练世界模型,将 1-shot 监督微调基线从 43.4% 提高到 52.3%;加入域内世界模型调优后,达到 66.0%。