---
source: arxiv
url: http://arxiv.org/abs/2604.04161v1
published_at: '2026-04-05T16:03:32'
authors:
- Yuanchang Liang
- Xiaobo Wang
- Kai Wang
- Shuo Wang
- Xiaojiang Peng
- Haoyu Chen
- David Kim Huat Chua
- Prahlad Vadakkepat
topics:
- vision-language-action
- robot-policy-inference
- action-chunking
- robot-manipulation
- uncertainty-estimation
relevance_score: 0.94
run_id: materialize-outputs
language_code: zh-CN
---

# Adaptive Action Chunking at Inference-time for Vision-Language-Action Models

## Summary
## 摘要
AAC 是一种在推理阶段使用的方法，面向视觉-语言-动作模型，按需选择动作块大小，而不是在整个回合里固定一个值。它根据采样候选轨迹的动作熵来判断预测何时不确定，并在不确定时使用更短的块，在稳定时使用更长的块。

## 问题
- VLA 策略通常按动作块执行：先规划接下来的一串动作，再在每一步不重新规划的情况下运行这些动作。
- 固定块大小会带来权衡。较大的块能减少对新观测的响应时间，而较小的块会造成不连续、动作发抖，以及在重新规划之间更容易发生模式跳变。
- 最优块大小会随任务变化，甚至会在同一任务的不同阶段变化，所以用一个固定值手动调参会限制性能和可扩展性。

## 方法
- AAC 只在推理阶段运行，不改训练过程，也不改模型结构。
- 模型并行采样 **N** 个候选动作块，然后用熵估计每个未来时间步的不确定性：对连续的平移/旋转动作使用高斯微分熵，对离散的夹爪动作使用标准熵。
- 对每个可能的执行长度 **h**，AAC 计算预测块前 **h** 步的平均动作熵。
- 它在平均熵随块长度变化最大的位置选择块大小，并设置下限 **ξ**，这样机器人在重新规划前仍会先执行最少数量的动作。
- 实际上，熵高时会缩短执行并更频繁地重新规划；熵低时会延长执行，让动作更平滑，也减少模型调用次数。

## 结果
- 在 **RoboCasa** 上，采用默认固定块大小 **h=16** 的 GR00T 平均成功率为 **59.7%**，而 **GR00T + AAC** 达到 **62.0%**，在 **24 个任务** 上提升 **2.3 个百分点**。
- 在 RoboCasa 的 **Rotation** 任务上，AAC 将成功率从 **57.6%** 提升到 **61.4%**。在 **Container** 任务上，从 **80.3%** 提升到 **82.2%**。在 **Relocation** 任务上，从 **42.1%** 提升到 **44.4%**。
- 在 **LIBERO** 上，采用固定 **h=16** 的 GR00T 平均成功率为 **94.1%**，而 **AAC** 达到 **95.0%**。在更难的 **LIBERO-Long** 套件上，性能从 **88.8%** 提升到 **92.8%**，提升 **4.0 个百分点**。
- 与 RoboCasa 上的其他固定块大小相比，AAC 的 **62.0%** 平均成功率高于 **h=2: 47.0%**、**h=4: 56.2%**、**h=8: 61.2%**、**h=12: 60.2%** 和 **h=16: 59.7%**。
- 换用不同骨干模型时，**pi-0.5** 在 LIBERO 上的平均成功率从 **97.0%** 提升到 **97.9%**；列出的最大提升出现在 **Long** 任务上，从 **92.5%** 提升到 **95.2%**。
- 在 **LIBERO-Pro** 的 OOD 扰动测试中，**GR00T** 的平均成功率从 **3.9%** 提升到 **6.3%**，**pi-0.5** 从 **30.9%** 提升到 **34.8%**。

## Problem

## Approach

## Results

## Link
- [http://arxiv.org/abs/2604.04161v1](http://arxiv.org/abs/2604.04161v1)
