来源笔记

From World Models to World Action Models: A Concise Tutorial for Robotics

这篇教程主张,机器人世界模型应定义为以动作为条件、预测未来观测或状态的模型。它还提出了世界动作模型的概念,即把预测出的未来与机器人可执行动作连接起来。

  • 机器人学论文用“世界模型”指代许多不同系统,包括潜在动力学模型、视频预测器、物理模拟器和以动作为条件的生成模型,这使得比较变得困难。
  • 只展示某个可能未来的预测器,本身不会告诉机器人该执行哪个动作,因此视觉预测需要连接到控制。
  • 预测目标、观测类型和动作类型的选择,会影响视觉保真度、空间结构、物理含义和控制用途。
  • 论文将世界定义为与任务相关的机器人、物体和环境,并将世界模型定义为一种模型:它基于观测历史和动作来预测未来观测或状态。
  • 它把世界模型分为 2 个主要类别:预测未来观测的观测空间模型,以及预测紧凑或结构化状态的状态空间模型。
  • 它用 2 个轴来组织观测空间模型:观测的空间显式性,例如 RGB、RGB-D 和点云;以及动作抽象层级,例如低层机器人指令、潜在动作和语言指令。
  • 它按状态类型来组织状态空间模型:潜在向量、点轨迹、神经符号谓词和物理变量。
  • 它将世界动作模型定义为同时建模未来观测和动作序列的策略,然后把它们分为 4 种范式:先想象再执行、以视频特征为条件的动作预测、联合视频-动作建模,以及用于策略学习的辅助视频预测。
  • 摘录没有提供新的定量基准结果、准确率数值、成功率或数据集规模测量。
  • 主要的具体产出是一个由 2 部分组成的世界模型分类法:观测空间预测和状态空间预测。
  • 观测空间分类法使用 4 个观测层级:RGB、多视角 RGB、RGB-D 和点云。
  • 动作条件分类法使用 4 个动作层级:低层机器人动作、接口动作、潜在动作和语言指令。
  • 状态空间分类法列出 4 种状态选择:潜在状态、点轨迹、神经符号谓词和物理状态。
  • 世界动作模型分类法列出 4 种把预测未来连接到机器人动作的方式:两阶段视觉子目标执行、以特征为条件的动作预测、联合视频-动作生成,以及策略训练期间的辅助视频预测。