适用于可部署机器人控制的世界-行动模型
世界-行动模型现在被当作控制系统来评估,而不只是预测器。MotuBrain把未来视频潜变量和动作 token 放进一个扩散模型里,然后把报告的端到端延迟从 4.90 秒降到 0.09 秒。它在 RoboTwin 2.0 上的得分在干净和随机化设置下都保持在 95% 以上,这让延迟结果成了这项主张的核心。
Being-H0.7 走的是更轻的路线。它在训练时用未来观测训练潜变量 token,然后在推理时去掉感知未来的分支。这个策略保留了面向动作的潜在状态,避免了测试时的视频展开,报告的部署延迟是每步 3–4 毫秒。综述论文给出了这些系统背后的共同定义:机器人世界模型会在当前状态、动作和可选语言条件下预测未来状态或观测。