在受控评估下,简单的 VLA 基线依然站得住
StarVLA-α 提出了这一时间段里最清楚的判断:只要训练方案受控,一个普通的视觉-语言模型(VLM)加一个小型 MLP 动作头,就能追平或超过更重的视觉-语言-动作系统。它的专用模型在 LIBERO 上报告平均 98.8,在 RoboTwin 2.0 clean* 上是 88.2,在 RoboCasa-GR1 上是 53.8;同一设置下,简单的 MLP 头与更复杂的头持平,甚至更好。消融结果和主指标一样重要。额外的机器人预训练对一些基准有帮助,对另一些有害;当任务数据足够多时,常见管线增补只带来很小的收益。当天最扎实的结果不是新架构,而是更清楚地说明了什么会真正改变结果。