趋势

机器人世界模型正进入动作闭环,结果比结构更强

日 · 2026-03-31 · Embodied AI

这一天讲的是世界模型正在变成机器人控制面的组成部分。DIAL 通过潜在未来状态把 VLM 接到动作上,并宣称在 VLA 训练里带来很大的数据效率提升。HCLSM 直接用 slot、层次结构和因果边处理场景结构,但它自己的结果也说明,稳定的对象中心世界建模仍然很难。

潜在意图成了 VLA 设计的重点

DIAL 把未来视觉特征当作控制接口。视觉-语言模型(VLM)在 horizon 16 处预测一个潜在未来,另一个策略把这个预测和当前观测一起变成一个 16 步动作块。直接的收益是数据效率:论文在 RoboCasa GR1 Tabletop 上报告了 state-of-the-art 结果,使用 2,400 条轨迹,而之前的全量数据运行用了 24,000 条。它还把这套方法扩展到一个机器人设置之外,使用 27,419 条 EgoDex 人类轨迹做 zero-shot 泛化测试,并在 IRON-R01-1.11 类人机器人上报告了真实世界迁移。

对象中心世界模型变得更明确了,但仍然脆弱

HCLSM 把世界建模推进到对象和事件结构上,但证据并不一致。模型把场景拆成多个 slot,分别对连续运动、事件帧和更高层目标建模,并在对象之间加入学习到的交互边。它的两阶段训练很关键:先强制 slot 专门化,再打开未来预测。 在 PushT 上,分阶段方法报告的下一状态预测误差是 0.008,吞吐量达到每秒 2.9 步。论文也展示了当前的限制。slot 仍然很分散,学到的因果图没有变得有用,而且因为 bf16 NaN 不稳定性,4 次运行里只有 2 次完成。

较新软件研究正在围绕代码可验证的信号展开较早机器人学习工作对运行时瓶颈和脆弱评测越来越认真