机器人 rollout 和训练中的世界模型
世界模型工作是今天的技术核心。RAW-Dream 在一个与任务无关的视频世界模型中用强化学习训练 VLA 策略,然后用 Qwen3-VL 作为零样本奖励判别器。在 LIBERO 上,它的零样本世界模型把平均成功率提高到 52.3%,对比 1-shot 监督微调的 43.4%,而且世界模型训练只用了 10 条目标演示,没有目标轨迹回放。
OrbiSim 走的是另一条路。它预测显式物理状态,再用这些状态渲染像素,因此学习到的模拟器可以为策略和参数优化提供梯度。在 robosuite Push 上,它的轨迹误差低于 Vid2World 和 AdaWorld,长时视频指标也优于去掉动力学和视觉分离的版本。
WAM 综述给这类工作定了共同定义。它把 World Action Models(WAMs)定义为同时预测未来观测和动作的模型,然后区分级联式设计和联合式设计。CoME 给扩散世界模型补上了记忆这一维,使用短期、长期和空间专家,让生成的未来与先前观测保持一致。