机器人对齐的 VLM 数据打分,放在 VLA 微调前
VLA 预训练中的数据筛选环节已经足够具体,可以单独做成一个训练工具。任务很明确:给大规模 VLM 语料按与机器人轨迹的相似度打分,保留最对齐的样本,再在动作微调前做一段简短的中间训练。EmbodiedMidtrain 给出了这套方法里最清楚的做法。它先在冻结的 VLM 特征上训练一个轻量二分类器,把 VLA 样本和通用 VLM 样本分开,再用这个分数给候选数据排序。结果在小型骨干上提升很大:InternVL3.5-1B 在 SimplerEnv-Bridge 上从 36.5 提升到 56.3,在 Libero-10 上从 39.0 提升到 54.2,而且使用的样本数比复现的基线更少。论文还显示,这个学习到的筛选器优于随机选择和几种替代打分规则。
最先会用到它的是那些已经在微调开放 VLM 骨干做操控任务、但仅靠增加机器人数据收效不大的团队。这里需要的不是另一套完整的 VLA 栈,而是一个接入现有预训练流程的语料打分和筛选层,导出排序后的子集,并记录哪些上游来源提供了有用的具身样本。一个成本很低的验证方法很直接:选一个开放骨干,在相同 token 预算下分别跑一次选中子集的中间训练和一次随机子集对照,然后在 Libero-10 或 SimplerEnv-Bridge 这样的基准上比较闭环成功率。如果差距还在,这就会变成小型实验室里 VLA 训练的实用环节,因为它们没法把机器人采集速度再提得更快。