预测式长上下文控制
预测正成为策略状态的一部分,而不再是独立的规划输出。RoboTTT 将最多 8K 个时间步压缩为快速权重,同时使延迟不随上下文长度增长。在三个双臂装配任务上,其平均完成率为 79%,而单步基线为 42%。FoMoVLA 则预测未来特征状态和稀疏点轨迹;它在 LIBERO-Long 上达到 97.6%,中位额外开销为 9.4 ms。Lumo-2 提供了第三种形式,将潜在世界动态与动作、视觉和语言对齐,但现有证据没有提供数值任务差距。
近几周持续关注执行问题,但现有证据如今更加完整。视觉-语言-动作(VLA)策略利用未来状态预测、长历史和异步组件,同时控制运行时成本。RoboTTT 和 Jetson-PI 展示了这一设计带来的实际收益。IMBench 则弱化了这一信号:模型能够识别物理约束,但仍很少能将其转化为成功的闭环动作。现有结果来自仿真和有限的机器人试验,因此尚不能证明其已具备广泛部署的准备条件。
预测正成为策略状态的一部分,而不再是独立的规划输出。RoboTTT 将最多 8K 个时间步压缩为快速权重,同时使延迟不随上下文长度增长。在三个双臂装配任务上,其平均完成率为 79%,而单步基线为 42%。FoMoVLA 则预测未来特征状态和稀疏点轨迹;它在 LIBERO-Long 上达到 97.6%,中位额外开销为 9.4 ms。Lumo-2 提供了第三种形式,将潜在世界动态与动作、视觉和语言对齐,但现有证据没有提供数值任务差距。
部署研究日益将观测过时和动作不连续视为策略失败,而不仅是系统开销。Jetson-PI 预测与已提交执行动作相对应的未来表示,在 Jetson Orin 上达到 6.06 Hz,而朴素 π₀.₅ 为 0.70 Hz。ChunkFlow 训练重叠动作块,使它们在交界处保持一致,并在 LIBERO-Long 上达到 93.4% 的成功率,平均推理延迟为 4.43 ms。在驾驶任务中,较慢的 7B 场景模型与快速动作专家配合,通过每个控制周期发出新控制,将短路线完成率从 37.0% 提高到 94.0%。但其长路线驾驶得分仍只有 2.96,说明更高的控制频率并不能证明安全性。
两项训练研究针对的是那些会被较高的分布内得分掩盖的捷径。语义锚定在机器人微调期间保留预训练任务结构;在双臂机器人上,它将分布外成功率从 49.5% 提高到 71.0%。AC-VLA 将示范分解为可复用的子任务,并在放置过程中抑制腕部视角捷径,使真实世界分布外成功率从 35.0% 提高到 82.5%。IMBench 说明了这些干预措施的意义:领先的视觉-语言模型约有 74% 的时间能够识别约束,但仅使用视觉输入时,闭环 GPT-5.5 只能在 11.3% 的任务上成功。该基准仅包含仿真,因此它确立的是评估差距,而不是普遍的能力上限。