趋势

机器人 VLA 论文正在优化可部署的前瞻能力

日 · 2026-05-08 · Embodied AI

这段时间窗口里的机器人论文把 Vision-Language-Action(VLA)策略当作可部署的控制系统来处理。紧凑的世界状态、接触反馈、失败数据和低预算适配都接受了具体测试。OneWM-VLA、AT-VLA 和 ForgeVLA 给出了最清楚的量化信号。

Compact and plannable world models

世界模型研究聚焦于更小的潜在状态和更好的规划信号。OneWM-VLA 将每个相机视图和每一帧压缩成一个语义 token,然后把未来潜在 token 和动作块一起生成。它报告在 MetaWorld 上平均成功率为 61.3%,高于 π0 的 47.9%;在 LIBERO 上平均成功率为 98.1%;在真实 Piper 机械臂、清洁条件下成功率为 71.7%,高于 π0 的 50.0%。

RLA-WM 使用 Residual Latent Action(RLA),这是一个描述 DINO 特征变化的紧凑编码。它以每次推理 3.5T FLOPs 预测未来视觉特征,并在 ManiSkill 和 IWS 的预测指标上优于列出的 feature 和 flow 基线。RC-aux 给潜在世界模型加入可达性监督,说明准确的短期预测仍然可能误导规划器。在 Wall 任务上,它把成功率提升到 83.6 ± 3.6,而 LeWM 对照组是 50.4 ± 6.5。

Contact and failure signals for VLA control

有些论文加入只在执行时出现的反馈通道。AT-VLA 增加了触觉门控和双流结构:较慢的视觉-语言推理,加上更快的触觉修正。论文报告闭环触觉响应时间为 0.04 秒。在真实机器人接触密集任务中,AT-VLA 将 Unzip Bag 的成功率提高到 0.33,而 GO-1 是 0.20,π0.5 是 0.00;Wipe Vase 提高到 0.67,而前两者分别是 0.07 和 0.33。

AFIL 用失败 rollout 作为扩散和 flow 型 VLA 策略的负向引导。它训练分开的成功动作生成器和失败动作生成器,同时共享一个视觉-语言骨干。现有摘要没有表格数值,所以这里能确定的是架构层面的结论:失败数据变成了在线训练信号和采样时的排斥项。

Data-constrained VLA training

这些训练论文关注的是私有、稀疏或特定领域的数据。ForgeVLA 在分布式视觉-动作日志上训练,不集中原始数据,也不添加人工语言标注。每个客户端在本地分配伪指令,随后由对比式规划损失和服务器聚合来处理非独立同分布的机器人数据。在 LIBERO-Goal 上,它达到 55.2% 的成功率和 100% 的 Pass@50,而 FedAvg 分别是 28.8% 和 80%。

ACA 通过在选定锚点条件下重复演示,然后收集策略偏离的边界数据,来应对小规模真实机器人适配预算。在 Franka Panda 设置下使用 100 条轨迹时,π0.5 加 ACA 的平均成功率达到 72.5%,而 π0.5 自身是 31.7%。BioProVLA-Agent 把同样的部署压力带到湿实验室:它把生物协议解析成已验证子任务,在动作前后做视觉检查,并运行在一个报告为 800–850 美元的硬件平台上,不过摘录没有给出精确成功率。

Physical consistency as a world-model criterion

LaWM 和 Sword 把 rollout 质量当作控制要求。LaWM 通过学习到的最小作用量目标和展开求解器来定义下一个潜在状态。它最强的结果出现在受控物理运动上:PIS-vx 达到 0.9938 ± 0.0045,速度一致性 PIS-ax 达到 0.8964 ± 0.0275,高于 NewtonGen 的 0.6568 ± 0.013。

Sword 为带视觉风格变化的 LIBERO rollout 训练动作条件世界模型。Dynamic Latent Bootstrapping 会缓存预测得到的 VAE latent,并逐步把它们送入训练,把上下文帧存储压到 20 GB 以下。在 LIBERO-Mixed 上,Sword 报告 FID 为 32.59、FVD 为 111.19,而 WoVR 分别是 119.62 和 198.84。

较新编码代理正在接受克制、证明和仓库纪律的评判较早Repository-grade coding exposes where agents still break