来源笔记

Adaptive Action Chunking at Inference-time for Vision-Language-Action Models

Vision Language ActionRobot Policy InferenceAction ChunkingRobot ManipulationUncertainty Estimation

AAC 是一种在推理阶段使用的方法,面向视觉-语言-动作模型,按需选择动作块大小,而不是在整个回合里固定一个值。它根据采样候选轨迹的动作熵来判断预测何时不确定,并在不确定时使用更短的块,在稳定时使用更长的块。

  • VLA 策略通常按动作块执行:先规划接下来的一串动作,再在每一步不重新规划的情况下运行这些动作。
  • 固定块大小会带来权衡。较大的块能减少对新观测的响应时间,而较小的块会造成不连续、动作发抖,以及在重新规划之间更容易发生模式跳变。
  • 最优块大小会随任务变化,甚至会在同一任务的不同阶段变化,所以用一个固定值手动调参会限制性能和可扩展性。
  • AAC 只在推理阶段运行,不改训练过程,也不改模型结构。
  • 模型并行采样 N 个候选动作块,然后用熵估计每个未来时间步的不确定性:对连续的平移/旋转动作使用高斯微分熵,对离散的夹爪动作使用标准熵。
  • 对每个可能的执行长度 h,AAC 计算预测块前 h 步的平均动作熵。
  • 它在平均熵随块长度变化最大的位置选择块大小,并设置下限 ξ,这样机器人在重新规划前仍会先执行最少数量的动作。
  • 实际上,熵高时会缩短执行并更频繁地重新规划;熵低时会延长执行,让动作更平滑,也减少模型调用次数。
  • RoboCasa 上,采用默认固定块大小 h=16 的 GR00T 平均成功率为 59.7%,而 GR00T + AAC 达到 62.0%,在 24 个任务 上提升 2.3 个百分点
  • 在 RoboCasa 的 Rotation 任务上,AAC 将成功率从 57.6% 提升到 61.4%。在 Container 任务上,从 80.3% 提升到 82.2%。在 Relocation 任务上,从 42.1% 提升到 44.4%
  • LIBERO 上,采用固定 h=16 的 GR00T 平均成功率为 94.1%,而 AAC 达到 95.0%。在更难的 LIBERO-Long 套件上,性能从 88.8% 提升到 92.8%,提升 4.0 个百分点
  • 与 RoboCasa 上的其他固定块大小相比,AAC 的 62.0% 平均成功率高于 h=2: 47.0%h=4: 56.2%h=8: 61.2%h=12: 60.2%h=16: 59.7%
  • 换用不同骨干模型时,pi-0.5 在 LIBERO 上的平均成功率从 97.0% 提升到 97.9%;列出的最大提升出现在 Long 任务上,从 92.5% 提升到 95.2%
  • LIBERO-Pro 的 OOD 扰动测试中,GR00T 的平均成功率从 3.9% 提升到 6.3%pi-0.530.9% 提升到 34.8%