来源笔记

JoyAI-RA 0.1: A Foundation Model for Robotic Autonomy

Vision Language ActionRobot Foundation ModelCross Embodiment TransferGeneralist Robot PolicySim2real

JoyAI-RA 0.1 是一个用于机器人操作的视觉-语言-动作基础模型,结合了网页数据、第一视角的人类视频、仿真轨迹和真实机器人示范。论文声称,这种数据组合加上统一动作空间,提升了跨具身迁移能力,并提高了在仿真和真实人形机器人上的成功率。

  • 机器人操作模型在开放世界泛化上表现吃力,因为机器人数据集采集成本高、任务覆盖窄,而且对长尾交互支持不足。
  • 人类、仿真器和不同机器人的身体结构与动作格式不同,这让行为在不同具身之间的迁移变得困难。
  • 这很重要,因为通用机器人自主能力需要策略能够处理新任务、新场景和新硬件,而不必每次都收集大量新的机器人数据。
  • JoyAI-RA 用四类数据训练一个 VLA 模型:多模态网页数据、内部构建的第一视角人类操作数据集 EgoLive、仿真数据集,以及真实机器人数据集,包括 JDAgibot 和开源语料。
  • 核心机制是显式统一动作空间:将动作和本体感觉映射到固定的共享表示中,主要使用相机坐标系下的末端执行器坐标,并用掩码处理不同机器人缺失的自由度。
  • 模型包含一个用于语义和空间理解的视觉-语言主干,以及一个基于 Perceiver 的动作专家,用流匹配目标预测连续动作片段。
  • 训练分三个阶段:在多模态任务上做 VLM 共同预训练,在对齐的异构数据上做带动作学习的 VLA 共同预训练,然后在目标机器人具身上做后训练。
  • 来自 EgoLive 的人类手部轨迹被估计并重定向到 ALOHA、Fourier 和 Agibot G1 等机器人具身上,以支持跨具身学习。
  • 在 RoboTwin 2.0 上,JoyAI-RA 在 Easy 上报告 90.48% 的成功率,在 Hard 上报告 89.28%,超过了 π0(65.92/58.40)、π0.5(82.74/76.76)、Motus(88.66/87.02)和 LingBot-VLA(88.56/86.68)。
  • 在 RoboCasa GR1 Tabletop 上,JoyAI-RA 报告 63.2% 的平均成功率,领先于 ABot-M0(58.3%)、DualCoT-VLA(55.1%)、TwinBrainVLA(54.6%)、Being-H0.7(49.2%)、GR00T-N1.6(47.6%)和 Qwen3PI(43.9%)。
  • 在真实世界的 AgiBot 基准上,跨任务平均成功率从 π0.5 的 0.62 提升到 JoyAI-RA 的 0.74,覆盖六个任务,每个任务 20 次试验。
  • 论文强调了 RoboCasa 长时程任务上的较大提升:CanToDrawerClose +16.0MilkToMicrowaveClose +24.0TrayToPot +18.0,均高于此前最佳结果。
  • 在 RoboTwin 2.0 上对 EgoLive 的消融显示,JDAgibot + full EgoLive 的成功率为 87.42%,相比之下,无预训练为 81.64%,仅用 JDAgibot 为 77.62%JDAgibot + 10% EgoLive81.40%
  • 这段摘要给出的是数据集规模细节,而不是预训练 token 总数或模型大小。它说明 EgoLive 覆盖 1,969 个物体类别、1,796 个动作类别,以及家居、零售和物流场景中的 10k 以上任务。