潜在前瞻与动作编码
多篇论文训练视觉-语言-动作模型(VLA),让策略内部携带紧凑的动作相关信号。InternVLA-A1.5 使用 50 个前瞻 token,在训练期间以这些 token 作为冻结视频生成器的条件;推理时移除视频分支,并输出包含 50 步的连续动作块。CAC-VLA 根据图像和语言 token 预测潜在动作,再通过门控交叉注意力用这些动作作为连续动作专家的条件。GeoMoLa 采用更偏几何的方法:通过预测未来点云变化学习离散运动编码,再用这些编码执行 6-DoF 操作。
当任务要求泛化,而不只是模仿时,报告的收益最大。CAC-VLA 在 LIBERO 上报告了 98.3% 的平均成功率,在 LIBERO-Plus 监督微调中达到 89.5%。GeoMoLa 在单视角 RLBench 的 10 个任务和 166 个变体上报告了 84.7% 的平均成功率,高于 RVT2 的 80.4%。InternVLA-A1.5 声称在六个仿真基准上取得总体最佳结果,但现有摘录没有提供准确的基准表格。