机器人策略执行与鲁棒性
本周的 embodied AI 工作指向构建和评估上的三个具体变化。一个是能减少真实机器人 VLA 停顿的运行时执行层。另一个是在演示预算很紧时提升操作训练效果的潜在未来状态接口。第三个是面向指令跟随的释义压力测试,因为当前 VLA 策略在措辞变化时仍会损失大量任务成功率。
本周的 embodied AI 工作指向构建和评估上的三个具体变化。一个是能减少真实机器人 VLA 停顿的运行时执行层。另一个是在演示预算很紧时提升操作训练效果的潜在未来状态接口。第三个是面向指令跟随的释义压力测试,因为当前 VLA 策略在措辞变化时仍会损失大量任务成功率。
这一天最强的是把具体失效点封住的具身控制工作。证据集中在动作瓶颈、层级规划、预测视频控制和 sim-to-real 迁移。和前几天相比,这些工作更少在泛泛地诊断风险,而是直接在机器人和驾驶任务上展示可量化的控制指标提升。
最清楚的实用变化出现在动作接口、规划栈和推理循环三个地方。一篇论文表明,当 VLA 策略把控制压缩成离散动作 token 时,更好的视觉编码器会停止带来收益,这说明在继续做编码器之前,先做一次简单的动作容量审计更合适。另一篇展示了在只有目标图像的长时程机器人任务上,层级潜在规划能带来真实收益,这给 world model 团队一个直接测试自动 subgoal 的办法。
这一天最强的模式是实用的动作学习。论文通过缩短预测、动作和控制细节之间的距离,改进了机器人和驾驶系统。最明显的提升来自经过验证的世界模型、更平滑的动作分布,以及几何感知规划。与此同时,Tex3D 表明当前 VLA 模型仍然很容易被物体级视觉攻击打偏。
近期工作支持三项具体流程改动:把动作容差和控制器增益当作同一个机器人微调循环的一部分;在规划路径里用显式几何来评估驾驶 world-action model;在 VLA 操作发布门禁里加入物体表面对抗测试。证据最强的地方,是论文把指标直接连到部署选择上,包括基于 FAN 的微调在 ManiSkill 上的成功率提升、深度优先驾驶模型在 Navsim 上的规划提升,以及 Tex3D 攻击带来的大幅失效率上升。
这一天讲的是世界模型正在变成机器人控制面的组成部分。DIAL 通过潜在未来状态把 VLM 接到动作上,并宣称在 VLA 训练里带来很大的数据效率提升。HCLSM 直接用 slot、层次结构和因果边处理场景结构,但它自己的结果也说明,稳定的对象中心世界建模仍然很难。
潜在未来表示正在成为操作模型的具体控制接口,论文报告了示教效率的提升,也有早期迹象表明人类数据和机器人数据混合后可以支持跨具身迁移。对象中心路线推进得更慢:分阶段训练有帮助,但当前模型在进入机器人规划或控制之前,仍需要对 slot 质量、因果可用性和数值稳定性做明确评估。
这一天的机器人论文都很务实。最强的工作同时收紧了 VLA 的执行和评测。FocusVLA 和 StreamingVLA 报告了操作质量和控制速度的提升,而 LIBERO-Para 和 ManipArena 在把措辞和真实世界设置变严格之后,让现有模型显得没那么成熟。关于世界模型、仿真和触觉遥操作的支撑性论文传达了同样的信息:更好的机器人性能依赖于从训练数据到运行时控制,全程保留与任务相关的信号。
机器人学习工作正在更接近部署里真正会出问题的地方:控制器时序、指令鲁棒性和物理评测。最近最明确的变化是一个测量停顿间隙的异步 VLA 运行时、一个给指令跟随策略用的改写测试门槛,以及一个固定机器人本体和任务条件的共享真实世界评测流程。