Task-specific latent action supervision tests for VLA training
使用混合机器人数据集的 VLA 训练团队,应在确定训练方案前先做一轮小规模的 latent action 监督对比。实用的划分很直接:面向长时程场景推理的基于图像的 latent action token,和面向动作格式不一致、且偏重运动控制任务的基于动作的 latent action token。
From Pixels to Tokens 里的受控比较让这个测试可以直接执行,因为它固定了基于 Qwen3-VL-2B 的 VLA 基线,只比较四种集成方法。LA-Direct 在 LIBERO-Long 上达到 96.6%,基线是 85.8%;LA-Tok 在 RoboTwin 2.0 上的平均成功率是 78.0%,基线是 60.5%。一个成本较低的内部版本可以用冻结的 latent-action 模型训练同一个 backbone,跑一个长时程基准和一个偏运动控制的基准,然后在扩数据前按任务类型选监督路径。