使用预训练 VLM 和 MLP 动作头的受控 VLA 基线
许多 VLA 团队现在可以用一个更实用的基线:预训练 VLM 加一个小的连续 MLP 动作头,并在不同任务上用同一套固定流程评估。StarVLA-α 报告了在 LIBERO 上平均 98.8、RoboTwin 2.0 clean* 上 88.2、RoboCasa-GR1 上 53.8 的结果,流程简化,没有针对具体基准做调参。用同一套设置时,MLP 头的表现和更重的动作头相当或更好:RoboCasa-GR1 上 53.8,对比 GR00T 风格头的 52.8 和扩散风格头的 48.9;SimplerEnv Google VM 上 76.0,对比 FAST 的 60.1。
工作流上的改动很直接。在加入机器人预训练、动作分词器、扩散头或额外接口特征之前,团队可以先保留一个固定基线,这个基线由强预训练 VLM、原始 RGB、语言指令、训练集内的动作归一化和连续 MLP 头组成。新组件只有在同一骨干和同一数据上超过这个基线时才值得加入。消融结果支持这种做法:额外的机器人预训练会提升一个基准、拖累另一个,而常见的数据工程改动在任务数据量变大后只带来很小的收益。
一个低成本检查是,把当前的一项内部模型对比在骨干和数据集固定的情况下重跑,然后只比较动作头和一个额外训练技巧。如果简单头能保持在几分之内,或者直接胜出,团队就可以降低模型复杂度,让评测更干净。