趋势

机器人 VLA 主张现在需要真实执行证据

周 · 2026-W21 · Embodied AI

本周具身 AI 研究把机器人策略视为必须承受真实控制条件的系统。视觉-语言-动作(VLA)模型通过视觉扰动、3D 接触线索、记忆、延迟和可复现硬件运行来测试。StableVLA、GaussianDream 和 AVP 给出了最清晰的信号。

不完整感知下的执行可靠性

VLA 工作现在要看执行时的表现:模糊、光照变化、延迟、扰动和细粒度任务阶段。StableVLA 用 Information Bottleneck Adapter 直接处理这个问题,在不增加机器人数据的情况下过滤有噪声的视觉通道。报告中的提升很具体:在 severity-5 扰动下的 LIBERO Spatial 上为 82.0% 对 58.5%,在真实 Pack Doll 任务中相对 VLA-Adapter 基线为 50% 对 20%。本周的日常趋势证据也显示,延迟和照明测试是常见的可靠性检查。

动作预测中的 3D 接触线索

多篇论文把显式几何加入策略路径,而非只放在感知模块。GaussianDream 用 3D Gaussian 重建和短时域未来预测训练 VLA 策略,推理时只保留学到的前缀 token。它报告在 LIBERO 上平均成功率为 98.4%,在 RoboCasa Human-50 上为 52.6%,在真实机器人评估中为 50.0%。PointACT 将分层点云特征送入动作解码器,在 LIBERO 上达到 96.0% 平均成功率,并在报告表格中比 SpatialVLA 高 17.9 个点。这些结果把 3D 结构纳入动作接口。

闭环操作的空间定位与记忆

最强的具身定位论文加入了机器人可执行的中间状态。AVP 让视觉语言模型先输出视觉 primitive token,再进行动作预测,然后使用 flow-matching 动作专家。在中国象棋操作任务上,它报告平均成功率为 90.28%,π₀.₅ 为 62.67%,同时每条指令运行时间为 0.27 秒。SOMA 为当前相机视野外的物体加入持久空间记忆。在五个真实世界视野外任务上,完整 SOMA 达到 28.3% 平均成功率,并且相较 GR00T-N1.5 缩短了各任务的抓取用时。共同点很实际:策略在执行期间需要目标状态、场景记忆和快速动作检查。

可复现的真实世界基准成为基础设施

评估工作正在让实体机器人测试更容易复现。VLA-REPLICA 使用现成硬件、固定照明、相机对齐工具、参考摆放位置,以及覆盖 10 个操作任务的 500 条专家演示。报告称完整装置约为 $1050,新用户可在一小时内完成组装。它的 90 个测试场景覆盖同分布和分布外评估,π₀.₅ 达到报告中最好的同分布平均成功率 0.54。这类基准降低了检查策略能否在模拟器外工作的成本。

较新编码代理正在按记忆质量、仓库推理和可执行安全来接受评判较早团队信任自主性之前,编码代理现在需要运行时证明