跨具身运动预训练
一篇论文针对通用 VLA 训练中的数据瓶颈:机器人动作标签稀缺,而人类第一视角操作视频数量充足。该方法用解耦 VQ-VAE 学习带掩码的潜在动作 token,并用物理掩码把前景运动与场景背景分开。随后,一个 Prismatic-7B 视觉语言模型在机器人适配前预测这些 token。
报告的提升很具体。在 LIBERO 上,完整方法达到 91.8% 的平均成功率,高于 OpenVLA 的 76.5% 和 Diffusion Policy 的 72.4%。在 RoboTwin 2.0 双臂仿真中,它在 10 个任务上的平均成功率达到 67.7%。下游设置中每个任务约使用 50 条轨迹,因此该主张指向用无标签视频预训练后降低适配成本。