趋势

机器人 VLA 进展正在由真实控制压力下的执行表现来评判

周 · 2026-W20 · Embodied AI

本周最强的信号是机器人视觉-语言-动作(VLA)模型的执行质量。HarmoWAM、RAW-Dream 和 Pelican-Unified 的工作将策略增益与想象 rollouts、阶段感知动作控制和共享的推理-动作状态联系起来。

世界模型训练与适配

世界模型现在被用作训练空间和控制先验,同时减少任务特定机器人数据的压力很明确。HarmoWAM 将视频世界模型与预测式、反应式动作专家结合起来,再在移动阶段和交互阶段之间路由控制。它报告的域外增益是在六个真实世界任务上比先前 VLA 模型高 33 个百分点,比先前世界动作模型(WAMs)高 29 个百分点。

RAW-Dream 给出了本周最明确的数据效率主张。它在一个任务无关的视频世界模型中用强化学习训练 OpenVLA-OFT,并使用 Qwen3-VL 做奖励判断。在 LIBERO 上,它用 10 个目标演示、且不使用目标 rollouts 训练世界模型,将 1-shot 监督微调基线从 43.4% 提高到 52.3%;加入域内世界模型调优后,达到 66.0%。

动作时机与空间定位

几篇论文都瞄准决定 VLA 策略是否成功的具体时刻和场景特征。GuidedVLA 将动作解码器注意力头分配给对象定位、技能阶段识别和基于深度的几何信息。在 LIBERO-Plus 上,完整模型达到 75.4% 的平均成功率,高于其 π0 基座的 68.2%;在真实世界试验中,它在域内、场景变化和光照变化设置下都优于基座策略。

FrameSkip 将密集演示视为不均衡的监督信号。它保留 20% 的唯一帧,保护夹爪转换帧和动作变化大的帧,并将 RoboCasa-GR1、SimplerEnv 和 LIBERO 上的宏平均从 66.50% 提高到 76.15%。Evo-Depth 和 AffordVLA 加入互补的空间信号:前者使用 RGB 推导的深度来改进放置和抓取,后者在训练时对齐接触区域的 affordance,无需增加推理模块。

长程与多任务控制

长程执行被当作带共享状态和受保护任务知识的控制问题来处理。Pelican-Unified 训练一个具身模型,通过共同的潜在状态进行语言推理、预测未来视频并输出动作块。它报告在包含 50 个任务的 RoboTwin 双臂基准上达到 93.5% 的平均成功率,在 WorldArena 上 EWM Score 为 66.03。

DyGRO-VLA 关注模仿训练后的强化学习。它冻结一个基础 VLA,并学习带路由的残差专家来修正动作块,从而减少多任务调优对共享表征的损伤。它报告在 LIBERO 上达到 97.1% 的平均成功率,在 LIBERO-Long 上比其离线基座提高 9.8 个百分点。

安全性与行为级验证

评估开始检查 rollout 过程中发生了什么,而不只看最终任务状态。SafeManip 使用有限迹线性时序逻辑监控器,在碰撞、稳定抓取、包含、清洁和固定装置访问等谓词上定义时序安全属性。在 50 个 RoboCasa365 任务中,π0.5 相比 π0 将任务成功率从 8.1% 提高到 9.3%,但其安全违规率从 69.7% 上升到 82.8%。

本周的接触感知 VLA 工作也有同样的关注点。AffordVLA 训练策略关注功能性接触区域,5 月 17 日的趋势笔记将行为级检查列为 VLA 可解释性和安全性的一部分。这些证据指向更严格的部署门槛:成功率需要与接触、顺序、恢复和不安全状态暴露测量一起报告。

较新编码 agent 正在作为受控执行接受测试较早代码智能体需要可执行证明、有边界的工作循环和可审计轨迹