Two-stage VLA training with a horizon-16 latent future interface
对于 VLA 团队,一个实用的下一步是两阶段训练流程:先设定明确的潜在未来目标,再训练一个以该目标为条件的短时域动作块策略。DIAL 给出了一套具体做法:用 VLM 在 16 步的时域上预测视觉特征,先用真实的未来特征训练控制器,再切换到联合训练,让动作损失在不把感知栈直接推到低层控制的前提下修正它。按论文报告的结果,这个收益足以支持一次内部复现。在 RoboCasa GR1 Tabletop 上,论文报告了 state-of-the-art 结果,使用 2,400 条轨迹,而先前的全量数据运行用了 24,000 条。
直接受益的是那些已经有 VLM 驱动的操作策略、但在端到端微调时要消耗大量示教并且训练不稳定的机器人团队。实现方式很具体:增加一个未来特征头,让潜变量和感知保持在同一个 ViT 特征空间里,并检查当未来预测变成必需输入而不是辅助损失时,控制器是否仍然受益。一个成本较低的检查方法,是在固定数据预算下重跑一个 tabletop 基准,比较直接动作预测和潜在未来接口的成功率与训练稳定性。如果这种收益在几千条示教上仍然成立,就会改变团队为操作训练分配数据采集预算的方式。