来源笔记

Veo-Act: How Far Can Frontier Video Models Advance Generalizable Robot Manipulation?

Veo-Act 测试前沿视频生成模型 Veo-3 能否在没有任务示范的情况下提升机器人操作。论文发现,单靠视频预测可以给出较好的高层规划,但低层控制仍然偏弱;把视频规划器和 VLA 结合的分层系统,能提高灵巧抓取与放置任务的成功率。

  • 论文研究开放场景中的通用机器人操作。在这类场景里,现有的视觉-语言-动作(VLA)策略仍会在目标歧义、视角变化和接触密集的灵巧控制上失败。
  • 纯视频到动作流程可以保留大规模视频模型的泛化能力,但动作恢复不够精确,难以稳定完成接触丰富的操作。
  • 这很重要,因为收集专家机器人数据成本高,而如果系统能用网络规模的视频先验、只依赖很少或不依赖示范数据,就能以更低的数据成本提升机器人泛化能力。
  • 作者先测试一个零样本流程:Veo-3 根据当前图像和语言指令生成未来视频,再由逆动力学模型(IDM)把帧间变化转换为机器人动作。
  • IDM 只用随机游玩数据训练,不使用专家示范。它使用 DINOv3 视觉编码器和两个输出头:一个预测动作,另一个预测机器人是否处于交互阶段的门控值。
  • Veo-Act 把生成的视频当作高层运动规划,转换成一个动作块,对动作块做平滑处理,然后执行,直到门控检测器判断机器人应该切换到反应式的低层 VLA 策略。
  • 执行过程中,如果交互阶段结束,系统可以从 VLA 策略切回剩余的规划动作序列,并删除与门控交互窗口重叠的那一段计划。
  • IDM 的训练数据包括 30 万组仿真帧对、10 万个额外的随机运动仿真样本和 15 万个真实世界样本,并使用 STEM-OB 增强来缩小仿真到真实的差距。
  • 主要结果:论文报告,Veo-Act 在他们测试的仿真和真实灵巧手环境中,把强基线 VLA 方法 (\pi_{0.5}) 的平均成功率从 45% 提高到 80%
  • 在仿真中,手腕相机不可见 设定下,总体任务成功率从 (\pi_{0.5}) 的 10/30 = 0.33 提高到 Veo-Act 的 20/30 = 0.67。指令遵循率从 11/30 = 0.37 提高到 25/30 = 0.83
  • 在仿真中,面对 相似物体干扰 时,总体成功率从 12/30 = 0.40 提高到 28/30 = 0.93。在 路过交互 场景下,总体成功率从 0/30 = 0.00 提高到 14/30 = 0.47
  • 在真实机器人测试中,面对 相似物体干扰 时,总体成功率从 8/16 = 0.50 提高到 12/16 = 0.75。在 路过交互 场景下,从 2/13 = 0.15 提高到 11/13 = 0.85
  • 在带有 更丰富语义 的真实机器人测试中,总体成功率从 2/19 = 0.11 提高到 15/19 = 0.79,指令遵循率从 4/19 = 0.21 提高到 18/19 = 0.95
  • 零样本 Veo-3+IDM 基线显示出部分能力,但控制较弱:在仿真中,基于视频的基线 VPP 在手腕相机不可见设定下总体达到 15/30 = 0.50,在相似物体干扰下达到 6/30 = 0.20,在路过交互下达到 1/30 = 0.03。这支持了论文的判断:当前视频模型能生成大致正确的任务轨迹,但缺少精确的低层控制。