Action-channel capacity audit for VLA policies with discrete action tokens
离散动作分词是在继续投入更好的机器人感知之前,应该先检查的一个具体环节。新的证据显示,一条常见的升级路径会在动作接口处卡住:在 LIBERO-10 上,Diffusion Policy 在 M 规模下把编码器从 ResNet-18 换成 SigLIP 后,成功率从 36.4% 提升到 57.6%;OAT 在同样升级下只从 53.8% 提升到 57.4%。编码器扫面更明显。Diffusion Policy 从 ResNet-18 的 36.4% 上升到 DINOv2 ViT-L/14 的 63.8%,而 OAT 只在较窄区间内波动,甚至在一些更强的编码器上下降。
对于训练带离散动作代码的 VLA 风格策略的团队,实用做法是在下一轮编码器刷新之前先做动作通道容量测试。保持数据集和策略规模不变,在一小组编码器质量上做替换,观察成功率是否随编码器提升而变化。然后增加 codebook 容量,或者在同一任务上对比连续动作基线。如果编码器变强后策略几乎不变,瓶颈多半在动作表示,而不是视觉部分。
这对机器人基础模型路线图是一个有用的落地调整,因为它把一个含糊的扩缩问题变成了一个低成本的门槛实验。判断很直接:只有当控制质量随着编码器质量一起上升时,才继续投入编码器;否则把精力转向 tokenizer、codebook 大小,或者连续动作头。