研究想法

机器人策略执行与鲁棒性

周 · 2026-W14 · Embodied AI

本周的 embodied AI 工作指向构建和评估上的三个具体变化。一个是能减少真实机器人 VLA 停顿的运行时执行层。另一个是在演示预算很紧时提升操作训练效果的潜在未来状态接口。第三个是面向指令跟随的释义压力测试,因为当前 VLA 策略在措辞变化时仍会损失大量任务成功率。

3 个想法

用于分块 VLA 机器人策略的异步执行层

现有 VLA 策略的流式控制封装现在看起来已经可以做。实际运行中的痛点是,真实机器人在观察、动作生成和执行彼此等待时,会出现走走停停的执行。StreamingVLA 给出了一个具体模板:让这些阶段重叠运行,把分块预测改成 action flow matching,这样机器人可以立刻执行下一个小动作,并用显著性预测器来控制是否提前观察。在 LIBERO 上,以 pi_0.5 为基础模型时,论文报告平均成功率与基线相同,都是 97.1%,同时把每步动作时间从 74.5 ms 降到 33.7 ms,把停顿间隔从 232.3 ms 降到 76.1 ms。更激进的 AFM+AEO 版本把每步时间降到 31.6 ms,停顿间隔降到 36.0 ms,但成功率降到 94.9%,这给了一个可调的延迟-质量权衡。

近期可做的产品不是新的基础模型,而是一个运行时层,面向已经在边缘硬件或移动操作臂上运行分块 VLA 策略的团队。一个低成本验证方法是,先给一条已部署策略加上逐步时间戳,测量动作簇之间的停顿时间,再在一个较窄的任务切片上加入异步观察和单步动作生成,例如 pick-and-place。如果机器人停下来的次数变少,同时任务失败没有上升,这个封装层在任何重新训练计划开始前就已经有价值。

面向低数据机器人操作训练的潜在未来状态适配器

在 VLM 和底层控制器之间加入潜在意图适配器,正变成一个对拿不到大量机器人演示数据的操作团队来说可落地的方案。DIAL 用 world-model 目标预测 H=16 时域上的未来视觉特征,再把这个潜在未来输入到一个生成 16 步动作块的策略中。采用它的关键不只是架构设计更工整。论文报告,在 RoboCasa GR1 Tabletop 上,它用少 10× 的机器人演示数据取得了 state-of-the-art 结果:只用 2,400 条轨迹,对比完整数据设置下的 24,000 条轨迹;论文还报告,把机器人数据和 27,419 条 EgoDex 人类轨迹混合后,zero-shot 迁移也有提升。

这说明一个具体的流程变化:把未来状态预测作为高层意图的监督接口,再联合微调控制器,让动作梯度继续影响规划器。做桌面操作或类人机器人 pick-and-place 的团队,不需要重写整个平台就能测试这一点。可以先用真实未来特征训练控制器,再换成预测得到的潜在未来,并在固定演示预算下比较成功率。如果低数据量设置在未见过的物体或物体组合上还能保持效果,这个适配器对数据受限的机器人训练就有直接价值。

面向微调后 VLA 策略的释义鲁棒性回归测试

指令鲁棒性测试需要进入接近部署的 VLA 系统默认评估流程。LIBERO-Para 表明,当前模型在训练和测试措辞一致时常常看起来表现稳定,但遇到保留原意的改写就会失效。在七种 VLA 配置中,释义改写会让成功率下降 22.8 到 51.9 个百分点。VLA-Adapter 在 LIBERO-Goal 上是 98.2%,到了 LIBERO-Para 上降到 46.3%。论文还发现,80% 到 96% 的失败来自规划层面的轨迹偏离,这说明问题出在接触控制之前。

可直接构建的东西是一个释义回归测试工具,围绕指令模板、同义词替换和间接命令形式来做,并同时用原始成功率和 PRIDE 打分。团队可以在微调后、真实世界演示前运行它。最先需要它的是评估和安全负责人,他们需要知道策略是否只是记住了措辞。一个低成本检查方法是,拿一条高表现策略,在一小组任务里只对物体指代做释义改写,然后在完整任务成功之前比较轨迹类别或第一个航点选择。如果物体名称替换会在早期改变规划,语言鲁棒性就会马上成为落地使用的阻碍。