趋势

机器人论文正在集中到时间记忆、恢复和可用控制回路上

日 · 2026-06-08 · Embodied AI

视觉语言动作(VLA)机器人工作的效果最好的是那些让策略保留时间状态、在出错后恢复、或接受低延迟人工输入的场景。MemoryVLA++、MotionWAM 和 YUBI 体现了当天的重点:让策略在更长时域上行动,收集更大的真实数据,并让修正尽量贴近执行。

机器人策略的时间记忆和世界模型

一些论文把时间当作机器人控制的一级输入。MemoryVLA++ 保存过去的感知和任务 token,再把它们和潜在的未来预测结合起来生成动作。它在需要记住先前交互或预测运动的任务上提升最大,包括真实机器人上依赖记忆和依赖想象的任务组分别提升 26 和 28 个百分点。

iMaC 用机器人运动学和接触热图让动作条件视频展开在空间上更精确。它的世界模型估计与真实策略成功在 8 个长时程真实机器人任务中的 6 个上相关。Echo-Memory 还给出一个提醒:只看重放指标,可能看不出世界模型在相机离开再返回后是否保住了物体身份。

冻结 VLA 策略周围的失败恢复

恢复工作保持基础 VLA 不变,只在运行时或通过残差训练加入定向纠正。ReCoVLA 用视觉语言模型识别失败类型和恢复阶段,编译分阶段奖励,并在仿真中训练残差策略。它把 Fetch 任务的平均仿真成功率从 36.7% 提高到 66.7%,零样本实体成功率达到 61.7%。

B2FF 预先生成未来图像里程碑,并在执行偏离时选择一个恢复目标。在注入失败的 LIBERO 上,它把 UD-VLA 的平均成功率从 56.3% 提高到 74.0%。ProbeAct 更轻量:它读取隐藏状态探针来跟踪物体,并在多次失败后使用控制障碍区域,讓 LIBERO-plus 成功率从 69.6% 提高到 74.1%。

执行时调控和安全过滤器

执行循环正在加入更明确的用户和安全通道。Flow Control 用一个简单的键盘方向来修改 flow-matching 动作采样器的初始条件。在 Two-Block 任务中,调节初始条件后,左块获取在更长的调节时域内几乎达到完美,而抓取放置成功率在报告设置中保持接近 100%。

另一篇安全过滤论文读取冻结 VLA 内部的注意力头,在控制过程中识别当前目标物体。在动态 SafeLIBERO Level III 上,它把平均碰撞率从仅用初始化过滤器时的 70.75% 降到 26.88%,并把安全成功率从 25.5% 提高到 55.75%。共同点很直接:少量运行时信号可以在不重新训练的情况下约束大型策略。

真实世界数据和全身控制正在接受具体规模测试

YUBI 用更轻的手指对齐夹爪和固定支架的 VR 跟踪来缓解数据瓶颈。报告的数据集规模对开放式 UMI 风格设置来说很大:8,434 小时、120 万个回合、680 万个视频-语言-动作三元组,以及由 179 名操作员采集的 119 个任务。一个基于 π0.5 的策略在 YUBI 的腕部数据上训练后,可以在 UR、Franka 和 Toyota ELEY 机械臂之间迁移,并使用同一个末端执行器。

MotionWAM 把 world-action 建模扩展到 Unitree G1 人形机器人的行走与操作。它使用一个第一人称摄像头和统一的全身运动潜变量,在 9 个真实任务上的平均成功率达到 76.1%,而列出的最强基线为 43.9%。TORL-VLA 为接触密集任务加入触觉在线强化学习,在真实机器人子任务试验中达到杯子 30/30、锁扣 29/30 和鸡蛋 30/30 的成功。

较新编码代理需要仓库级测试和上下文防护较早AI 软件论文优先关注可测量的置信度和受控的 agent 运行时