VLA 预训练的数据整理
EmbodiedMidtrain 把数据选择放到 VLA 训练的核心位置。论文先测量通用视觉语言模型数据和机器人轨迹之间的真实不匹配,然后在更接近机器人数据的样本上进行 mid-training。对小型骨干模型,提升很大:InternVL3.5-1B 在 SimplerEnv-Bridge 上的成功率从 36.5 提高到 56.3,在 Libero-10 上从 39.0 提高到 54.2。Qwen3VL-2B 也在 Calvin、SimplerEnv-Bridge 和 Libero-10 上都有提升。这个日子的结论很直接:更好的机器人策略来自更好的动作前数据对齐,而不只是更大的 action head 或更多机器人微调。