Geometry-guided VLA policies
视觉-语言-动作(VLA)论文围绕那些让动作具有物理意义的信号展开。3DThinkVLA 将 Qwen3-VL 的视觉特征与 VGGT 3D 特征对齐,并把一个空间推理锚点蒸馏到普通动作提示中。它在 LIBERO 上的平均成功率为 98.7%,在 LIBERO-PLUS 上为 81.0%,推理时只用 2D 图像。
VISTA 处理的是同一问题的数据侧。它通过在 800 万样本的鱼眼 VQA 集上训练,并按完整性、连续性、自碰撞风险和执行保真度筛选轨迹,来适配 Universal Manipulation Interface(UMI)演示数据。ForesightFlow 提供了一条更轻的策略改进路径:每个动作块都带有生成的成功潜力分数,从而可以直接做 best-of-K 选择,不需要单独的 critic。它在真实世界双臂任务上的成功率是 35.4%,高于 IDQL 的 32.6%,训练计算量从 287 个 GPU 小时降到 178 个 GPU 小时。