趋势

机器人 VLA 工作正在优先处理部署反馈、几何和世界模型评分

日 · 2026-06-23 · Embodied AI

这一时期的机器人论文集中讨论如何让视觉-语言-动作(VLA)策略在部署后可用。InSight 通过机器人 rollout 增加新的操作原语。Reflective VLA 记录动作后果。G3VLA 将相机校准注入视觉 token。共同重点是在新技能、新相机和不完美数据下获得可测量的行为。

VLA 策略的部署反馈

InSight 将缺失的机器人技能视为可在初始示范集之后获取的原语。它把已有示范切分成带标签的动作,让视觉-语言模型提出缺失原语,收集成功的机器人 rollout,并重新训练策略。论文报告的真实 xArm 结果很具体:扭转成功率 92%,倒液成功率 96%,在没有端到端示范的 14 原语“先扭转再倒液”任务上成功率 80%。

Reflective VLA 加入了另一条反馈路径。它存储观察-动作-后果三元组,使策略能在部署期间推断相机几何、校准误差和执行偏差。在 LIBERO-Plus 上,它报告的平均成功率为 87.7%,匹配的反应式基线为 82.3%;列出的最大增益来自 Robot shift,成功率为 72.9%,基线为 50.0%。

用于操作的几何和接触信号

多篇论文在不替换基础策略的情况下,为机器人感知加入物理结构。GRA 只将生成的机器人视频用于 2D 末端执行器路点监督,然后在真实示范上训练动作。每个任务使用 25 个真实示范和 75 个生成视频时,它在三个 Franka 拾取放置任务上的平均成功率达到 68.9%,而真实数据同等预算基线为 61.1%。

G3VLA 通过射线嵌入、投影位置编码和跨视角融合,将相机校准写入 VLA 视觉 token。在使用 pi0 的 LIBERO 上,真值几何监督把平均成功率从 84.6% 提高到 88.1%。NoContactNoWorries 将同一实用思路扩展到灵巧手,通过腕部 RGB-D 和关节状态预测指尖接触。在真实 LEAP Hand 上,它在测试物体上的 F1 分数为 0.71 到 0.84。

作为进度评分器和规划器的世界模型

这一时期的世界模型工作与控制决策相关。World Value Models 使用预训练视频世界模型估计操作视频中的任务进度,包括犹豫和重试片段。新的 Suboptimal-Value-Bench 包含 3 种具身形态、15 个任务中的 800 条人工标注轨迹。WVM 报告的平均 Hesitation-RMSE 为 0.05,Retry-VOC 为 0.78,优于列出的价值模型基线。

NavWM 将未来预测用于视觉导航。它预测多条候选路径及这些路径对应的未来图像,然后把这种预见用于图像目标导航。在 Go Stanford、SCAND、RECON 和 HuRoN 上,它的平均轨迹误差从 UniWM 的 0.302 降至 0.207。未来帧 PSNR 达到 17.340,已见环境导航成功率从 66% 升至 72%。

机器人任务的步骤级评估

MANGO 针对 VLA 测试中的一个实际弱点:终态检查常常掩盖长时程任务失败的具体步骤。它从自然语言指令构建原子任务库,将打开、拾取、放置、关闭等步骤映射到仿真器检查,并使用 Generator、Assessor 和 Judge 智能体改进可执行 oracle。

证据更偏诊断性,而非大量基准结果。论文在 LIBERO_10 和 RoboCasa Humanoid Tabletop 上评估,并报告生成的 oracle 能检测出与手写符号 oracle 相近数量的失败,同时定位失败的原子步骤和顺序违规。可用摘录中没有精确率、召回率和运行时间数字。

较新编码 agent 正在按状态、恢复和回归控制来衡量较早编码代理需要普查数据、成本控制和安全证据