Open VLA models and robot datasets
MolmoAct2 是这一时期最明确的面向部署的发布。论文描述了一个开放的 VLA 系统,公开了权重、代码和训练数据。它的骨干模型 Molmo2-ER 是一个 4B 视觉-语言模型(VLM),先在一个包含 330 万样本的具身推理语料上训练,再通过动作分词器和连续动作专家连接到机器人动作。
数据公开是这项主张的重要部分。作者报告了 720 小时的双臂 YAM 数据、一个经过筛选的 SO-100/101 社区数据集,包含 38,059 个 episode,以及一个经过筛选的 DROID Franka 子集,包含 74,604 个成功 episode。他们还报告,Molmo2-ER 在 13 个具身推理基准上的平均性能为 63.8%,比 Molmo2 高 17 个点。给出的摘录说 MolmoAct2 在模拟和真实世界基准上都超过了强基线,但没有给出底层任务成功率。