趋势

机器人 VLA 工作正在接受时间、接触和缺失证据的检验

周 · 2026-W24 · Embodied AI

本周的机器人视觉-语言-动作(VLA)工作按执行细节来检验:记忆、恢复、遮挡、接触时序和任务特定标签。MemoryVLA++、UMI-Bench 1.0 和 DAM-VLA 提供了最强证据。

时间状态与恢复

几篇论文把机器人策略失败视为时序问题。MemoryVLA++ 加入长期记忆和隐空间未来预测,让策略记住早先交互并预判物体运动。论文报告,在通用、依赖记忆、依赖想象的任务组中,真实机器人增益分别为 9、26 和 28 个百分点。

B2FF 处理的情况更窄:冻结的 VLA 策略在受扰动后偏离名义轨迹。它先生成未来视觉里程碑,再在执行时选择恢复目标。在注入失败的 LIBERO 上,平均成功率从 56.3% 升至 74.0%。共同结论很实用:当前相机视图不完整时,策略需要访问过去状态和可信的近期未来状态。

遮挡与物理基准

评测工作集中在标准操作基准可能掩盖真实难度的情况。LIBERO-Occ 向 LIBERO 加入场景导致的遮挡物,并显示当物体或目标区域被遮住时,现有 VLA 策略的表现会大幅下降。它的 Viewpoint Imagination 方法在没有真实互补视角的情况下达到 65.05% 平均成功率,高于列出的最强基线 57.10%。

UMI-Bench 1.0 处理另一个会导致弱结论的来源:真实机器人执行差异。它为 10 个桌面任务固定了腕部视角观测设置、重置流程、动作接口、日志记录和评分。报告结果显示,布局、位姿和动力学变化造成的损害大于外观和物体变化;在两个长时程任务上,三个被评测模型的完整成功率都为 0%。

接触与传感器时序

接触密集型操作论文对许多 VLA 策略采用的单一时钟设计提出压力。DAM-VLA 为语言、视觉、力和本体感知分别保留隐变量缓冲区,然后让动作头在每个控制步读取这些缓冲区。这个设计把较慢的语言和视觉更新与更快的力和状态信号配合起来。

本周报告的数字中,这组结果很具体。在七个真实 Franka 任务上,DAM-VLA 达到 95.2% 平均成功率;最强同步基线为 40.95%。朴素的 100 Hz 同步设置降至 21.9%,支持了论文的主张:在接触密集型任务中,更新时间与传感器选择同样关键。

面向具体任务的数据 grounding

本周还增加了让机器人数据匹配任务的基础设施。SPARC 用物体框、轨迹和操作阶段自动标注机器人演示,再用交互证据评估标注可靠性。在 IA-Bench 上,它达到 80.2% 的被交互物体定位准确率;基于检测器置信度的基线为 58.1%。

LabVLA 和 GIVE 展示了两种专门化的 grounding。LabVLA 构建合成实验室场景和工作流,让 VLA 策略能跨机器人形态执行书面实验台协议。GIVE 为交接任务加入手势线索;在真实世界试验中,它报告 80.0% 交接成功率,而基线为 0.0%。这些论文对数据提出同一项要求:标签、指令和观测必须携带机器人在执行时真正需要的线索。

较新AI 编码代理正通过轨迹、门禁和证明检查接受评判较早编码 agent 正在按控制、记忆和成本来衡量