VLA 操作中的 3D 锚定
空间对齐是主要的性能杠杆。Dex-BEV 将视觉几何、本体感知和输出动作放入共享的鸟瞰视角坐标系。它在官方 LIBERO 上报告 97.8% 的平均成功率,在 RoboTwin 2.0 Clean 上为 76.0%,在修改了相机和姿态设置的 LIBERO 上为 89.9%,而列出的 2D 基线低于 10%。
GeoAlign 加入由 RGB 推导的几何特征,并由机器人状态进行查询。收益在几何敏感任务上最清楚:真实 ALOHA 的平均成功率为 78.8%,RGB-only 基线为 65.0%;透明瓶任务成功率为 75.0%,RGB-only 为 35.0%。3DThinkVLA 采用更轻的部署路线。它训练潜在 3D 感知和推理适配器,推理时仍使用 2D 图像,同时在 LIBERO 上达到 98.7%,在 LIBERO-PLUS 上达到 81.0%。