趋势

机器人 VLA 工作正按控制速度、任务迁移和真实机器人证据来评估

日 · 2026-05-28 · Embodied AI

当天的研究集中在可部署的机器人控制上。视觉-语言-动作(VLA)模型获得了更大的任务覆盖、更快的推理路径、更丰富的空间落地,以及更多真实机器人检查。Qwen-VLA 的统一化主张最广,BORA 给出了最清楚的灵巧适应结果,PhAIL 则质疑真实机器人成功率该如何衡量。

Generalist VLA policies

Qwen-VLA 是规模化和统一化的核心。它使用 Qwen3.5-4B 做视觉-语言理解,并用 DiT 流匹配动作解码器生成连续动作。模型读取机器人描述、图像和指令,然后在操作、导航和轨迹预测中预测动作块或轨迹块。报告结果覆盖 LIBERO、Simpler-WidowX、RoboTwin、R2R、RxR、ALOHA 分布外试验和 DOMINO 动态操作。

VLA-Pro 走的是模块化迁移路线。它把任务特定的 LoRA 适配器和结构化过程状态一起存储,在推理时检索相关记忆,并为当前动作块融合权重。在报告的设定里,提升幅度很大:π0.5 在 6 个保留的 UR7e 任务上的真实世界成功率从 5.8% 升到 65.0%,RoboTwin 结果在 X-VLA、RDT 和 π0.5 骨干上都有提升。

Real-world adaptation and human intent

BORA 关注灵巧手,接触误差会很快累积。它先离线训练一个动作条件 critic,然后在部署时冻结基础 VLA,并在有人类干预下学习一个小的残差 actor。在 5 个 Franka 机械臂加 12 自由度手部任务上,BORA-Full 的平均成功率达到 86.0%,而一致性策略基础模型只有 53.0%。在未见物体上,它达到 70.0%,同一基础模型为 27.0%。

Gaze2Act 把人眼注视当作目标选择和部件级交互的控制信号。它把第一人称视角的注视映射到机器人相机视图,在机器人观测上加入 mask 和 heatmap 提示,并在 GROOT N1.5 扩散动作头上增加一个注视分支。在 Unitree G1 类人机器人上,它在 15 个主要真实机器人任务中报告了 83.5% 的任务成功率,结果强于仅语言基线和语言约束空间基线。

Perception and inference efficiency

VisualThink-VLA 为物体框、边缘、运动和关系加入稀疏视觉证据 token。路由器在每个决策步骤选择证据通道,而 VLA 主干保持冻结。在 BridgeData V2 上,它报告每步 0.367 秒、89.49% 的成功率;ECoT 的结果是 85.09% 和 8.377 秒。

3DVLA 为预训练 VLA 策略加入 3D 空间记忆、以物体为中心的实例 token 和遮挡补全。它在 LIBERO-Plus 上的提升较小,但在 RoboTwin 2.0 上更广,那里 π0+3DVLA 把 Easy 成功率从 46.4% 提高到 54.5%,把 Hard 成功率从 16.3% 提高到 23.2%。

ElegantVLA 通过学习何时重新计算视觉编码器、语言模型和动作头来降低计算量。在基于 GR00T 的真实世界测试中,它报告计算量减少 2.18×,控制频率从 13.8 Hz 升到 26.3 Hz,平均成功率从 61.67% 升到 65.00%。

Evaluation, diagnosis, and confidence

这些评估论文针对的是单一成功率看不到的失败模式。PhAIL 在 Franka FR3 上测量成功所需时间分布,并把评分锚定到同一装置上的人工遥操作。在它的基准中,按 RMST 比率算,评测表现最好的 VLA 比人工参考慢大约 7 倍,而且没有任何推理模型在任何物体上超过 19% 的 Human-Relative Throughput。

VLA-Trace 检查 VLA 策略在动作解码时如何使用图像和文本。在 LIBERO-10 上,当生成时去掉图像访问,π0.5 的成功率从 93.5% 降到 0.0%;去掉文本访问时,成功率还剩 39.0%。OpenVLA 呈现出不同的依赖模式,在报告的 LIBERO 设定里,去掉文本会把成功率降到 0.0%。

VLAConf 用冻结的 VLA 特征和只做成功预测的 confidence head 增加了校准后的任务成功置信度。它面向在线失败预判,在 OpenVLA-OFT 上的推理成本明显低于 ConfidenceVLA:平均查询时间 64.9 ms,对比 712.9 ms。

较新编码代理在工具、审查和分发上面临现实限制较早编码代理正在接受操作性证据、审查门控和可执行检查的评判