趋势

结构化动作接口支撑具身世界模型

日 · 2026-07-21 · Embodied AI

围绕动作相关状态的前一日信号仍在延续,但今天的五篇论文更直接地将结构引入世界建模。视觉轨迹、物理分解和可模拟的回放记录,将动作与预测后果连接起来。证据来自异质的预印本,且评估大多彼此独立,因此它表明了一种共同的设计方向,而不是已经确定的最优架构。

视觉动作表示

RoboInter1.5 和 Masked Visual Actions 都将具有明确空间含义的信号置于意图与预测结果之间。RoboInter1.5 在超过 230,000 个回合中提供物体对齐、可供性、接触点和运动轨迹。Masked Visual Actions 则将实体的像素空间轨迹提供给预训练视频模型;同一个检查点既能预测场景响应,也能根据目标物体运动推断机器人运动。在 DROID 上,它报告的 LPIPS 为 0.0945,而 Ctrl-World 为 0.362。综合来看,这些论文支持将视觉结构作为一种能够适配不同具身形态的控制接口,但所查阅的 RoboInter1.5 摘录没有提供下游对比指标。

物理原因与可回放状态

两篇论文都明确区分物理原因,而不是让一个潜在状态转移吸收所有变化。DWM 将动作驱动的影响与重力、漂移等持续存在的环境影响分开;在三个经过修改的模拟基准上,它使规划成功率平均提高 13.1 个百分点。Agentic Real2Sim 将记录的交互重建为基于物理的回合孪生体,其中包含几何、物体状态、对齐和回放指标。其测试中表现最好的后端成功回放了 100 个 DROID 回合中的 48 个,既显示出自动转换的实用性,也表明其当前仍较为脆弱。

作为可用系统的世界模型

这些论文还将延迟、硬件成本和下游用途视为世界模型质量的一部分。ABot-World-0 报告称,在一块 RTX 5090 上可持续生成最高 16 FPS 的 720P 视频,首个动作条件帧的延迟为 1.2 秒,峰值内存约为 19 GiB。Masked Visual Actions 使用想象回放进行策略评估和候选排序,Agentic Real2Sim 则同时比较模型成本与回放成功率。这些结果将评估范围扩展到视觉保真度之外,但基准覆盖仍不均衡,所查阅的 ABot-World-0 文本也缺少数值基线对比。

  • Fan Jiang, Zhaoxu Sun, Mengchao Wang, Ziyu Zhu, Chiyu Wang, Yunpeng Zhang, Wenlin Liu, Yun Wang, Xue Zheng, Rui Sun, Junfeng Ni, Hongyu Pan, Zhongxu Sun, Fei Yu, Zengye Ge, Mengmeng Du, Nianfei Fan, Mingchao Sun, Yu Liu, Yongchang, Yanqing Zhu, Jiahang Wang, Ning Ying, Yuze Xuan, Di Yang, Zhicheng Liu, Zhe Gao, Tingbing Xu, Jiacheng Sui, Wenjin Yang, Junnan Lai, Shufeng Liu, Yuan Liu, Zheng Zhou, Yingliang Peng, Dawei Cao, Kaifeng Sheng, Yuxiang Cai, Fei Lu, Mu Xu, Ning Guo
  • Hadi Alzayer, Wenlong Huang, Haonan Chen, Christopher Luey, Lvmin Zhang, Maneesh Agrawala, Gordon Wetzstein, Li Fei-Fei, Yilun Du, Jiajun Wu, Jia-Bin Huang
  • Guanxiong Chen, Qianjun Xia, Jiawei Peng, Heng Zhang, Bole Ma, Justin Qian, Ziyi Jiao, Bingyang Zhou, Luoxin Ye, Kaifeng Zhang, Kunyi Wang, Weijia Zeng, Yunuo Chen, Pengzhi Yang, Ziqiu Zeng, Huamin Wang, Chao Liu, Alan Yuille, Fan Shi, Changxi Zheng, Yunzhu Li, Chenfanfu Jiang, Peter Yichen Chen
较新可执行反馈优于仅依赖提示的编码工作流较早结构化上下文和执行反馈减少编码代理的浪费