Compact spatial foresight for VLA manipulation
ConsisVLA-4D 将空间一致性当作推理预算问题来处理。它保留 32 个与指令相关的视觉 token,在多个摄像头视角之间对齐这些 token,并把几何信息存到紧凑的潜变量 token 中。报告中的提升同时来自准确率和速度:在 LIBERO 上比 OpenVLA 提升 21.6%,推理速度快 2.3 倍;在真实机器人平台上提升 41.5%,推理速度快 2.4 倍。
T³VF 处理的是视觉前瞻 VLA 模型中的另一个失效点。它把预测的未来图像和之后观测到的图像做比较,然后在动作方差较低时只更新可学习的查询 token。在带扰动训练的 LIBERO-Plus 上,它把 Mantis 的平均成功率从 49.3% 提高到 52.1%,在摄像头和光照扰动上的提升更大。