来源笔记
GazeVLA: Learning Human Intention for Robotic Manipulation
摘要
GazeVLA 从第一视角人类视频中学习人类意图,并把这个信号迁移到机器人操作任务中。它用凝视作为意图信号,在动作前先预测意图,并报告在小样本表现和分布外泛化上都优于以往只用机器人或人类预训练的基线。
问题
- 视觉-语言-动作模型仍然需要大量机器人示教数据,而这类数据采集成本高,也很难扩展。
- 人类第一视角视频更容易采集,但直接迁移很难,因为人和机器人的身体结构以及动作空间不同。
- 以往工作主要学习要做什么动作。这篇论文关注为什么要做这个动作,用意图作为桥梁。
方法
- 论文提出 VLIA(Vision-Language-Intention-Action),用 人类凝视 建模意图,并把它放在感知和动作之间作为中间步骤。
- 它先在一个整理过的第一视角人类数据集上预训练,这个数据集来自 13 个数据集,总计 超过 1.5 亿帧,使用凝视和手部标注以及语言信息。
- 模型以 PaliGemma 作为视觉-语言骨干,并使用 conditional flow matching 动作专家生成连续动作。
- 在推理时,它按意图-动作链运行:先根据图像和指令预测离散化的凝视 token,再根据这个预测出的意图生成后续动作。
- 在后训练阶段,它以 1:1 采样比例 混合少量机器人数据和人类数据;机器人数据没有意图标注,所以意图知识只通过人类监督迁移过来。
结果
- 在人类预训练评估中,意图预测误差是图像对角线长度的 4.8%,在 224×224 图像上约为 11 像素。手部运动重建的平均关键点误差为 4.71 cm,腕部旋转误差为 12.31°。
- 在 AV-ALOHA 仿真基准上,平均成功率在同分布设置中为 49,高于 pi0.5: 41、LFA: 43、H-RDT: 39 和 DP: 28。
- 在带干扰物的 AV-ALOHA 分布外设置中,平均成功率为 28,高于 pi0.5: 22、LFA: 14、H-RDT: 14 和 DP: 7。
- 在光照变化的 AV-ALOHA 分布外设置中,平均成功率为 27,高于 pi0.5: 23、H-RDT: 6 和 LFA/DP: 0。论文说,这在分布外设置里比 pi0.5 有 22% 的相对提升。
- 在单项仿真任务上,它在立方体转移同分布任务上达到 100,在插槽插入分布外干扰任务上达到 56;对应的 pi0.5 分别是 94 和 47。
- 在真实机器人实验中,摘录提到每个任务只用 10 条机器人轨迹 和 50 条人类轨迹,在夹爪任务和灵巧手任务上都表现更强。文中给出的一个明确数值是简单抓取放置任务上的 85% 成功率,并说明拧螺丝任务的成功率是 pi0.5 的 2 倍。摘录没有给出图 6 的完整数值表。