潜在意图成了 VLA 设计的重点
DIAL 把未来视觉特征当作控制接口。视觉-语言模型(VLM)在 horizon 16 处预测一个潜在未来,另一个策略把这个预测和当前观测一起变成一个 16 步动作块。直接的收益是数据效率:论文在 RoboCasa GR1 Tabletop 上报告了 state-of-the-art 结果,使用 2,400 条轨迹,而之前的全量数据运行用了 24,000 条。它还把这套方法扩展到一个机器人设置之外,使用 27,419 条 EgoDex 人类轨迹做 zero-shot 泛化测试,并在 IRON-R01-1.11 类人机器人上报告了真实世界迁移。