趋势

机器人 VLA 可靠性正在用 rollout、标定和安全成本来衡量

周 · 2026-W26 · Embodied AI

本周机器人视觉-语言-动作(VLA)研究聚焦于可在执行期间检查的策略。FORCE、ICWM 和 LIBERO-Safety 提供了主要信号:机器人论文正在把进展绑定到在线 rollout、配置标定和不安全成功指标上。

部署适应

多篇论文把已部署机器人视为需要在任务前或任务中获取本地证据的系统。ICWM 让策略先运行一段短暂探测阶段,再把观测到的动作到图像变化作为上下文,用于在新相机视角或新机体配置下控制机器人。FORCE 用在线 rollout 通过校准过的 critic 微调 VLA 策略,并报告真实 Franka 的成功率从行为克隆下的 45.0% 提高到微调后的 98.3%,在线阶段没有人工干预。PhysReflect-VLA 加入执行时可行性检查,并在观测到状态不匹配后进行修正,在长时程任务上带来幅度较小但稳定的真实机器人收益。

几何与动作结果

几何正在作为执行信号加入,而不只是视觉特征。Reflective VLA 存储观察-动作-结果三元组,让策略在推理时推断相机标定、执行偏差和机器人配置影响。G3VLA 通过射线嵌入、投影位置编码和跨视角融合,把相机内参和外参注入视觉 token,同时保留基础动作路径。两条路线指向同一个实际需求:机器人策略需要知道,在当前相机和机体条件下,自己的动作会如何改变场景。

作为轨迹指标的安全

安全研究正在加入更多诊断指标。LIBERO-Safety 在 75 个任务和 19,664 条经过筛选的无碰撞演示上,测试 VLA 策略能否在没有不安全接触或不安全指令服从的情况下完成操作。ForesightSafety-VLA 将每次 rollout 评为安全成功、不安全成功、安全失败或不安全失败,再加入累计安全成本和风险暴露时间等过程指标。关键证据是,任务成功可能掩盖有风险的运动:ForesightSafety-VLA 报告最强的列出基线也存在不安全成功,而 LIBERO-Safety 显示更难的物理安全等级上成功率大幅下降。

动作数据和新技能

本周也有更多工作在降低动作监督成本,并提高其复用性。InSight 将现有演示切分为具名原语,让视觉语言模型选择缺失的原语尝试,并把成功的机器人 rollout 回灌到 VLA。它报告称,在为每项技能加入 20 个成功获取的原语 episode 后,真实 xArm 任务上的扭转成功率为 92%,倒液成功率为 96%。LA4VLA 采用数据优先路线:它从 DROID 中导出 33,116 个语言-动作 episode,并在没有图像的情况下用指令条件运动预训练策略,提升了一个 1B 参数 VLA 在仿真和真实世界任务上的表现。

较新编码代理研究正在测量用户负担、运行时成本和工具风险较早编码智能体正被作为受控生产软件来评判