自适应测试时动作选择
VLA-ATTC 为 VLA 机器人策略加了一个决策门。它采样两个动作块,测量它们的动态时间规整距离,并把高距离当作动作不确定性。低不确定性的步骤直接执行。高不确定性的步骤在共享的视觉-语言预填充后采样候选动作块,然后由 Relative Action Critic 通过成对比较选出首选动作。
报告中的提升最大,出现在一个错误动作就可能毁掉长任务的场景。在 LIBERO-LONG 上,PI0 在自适应设置下的平均成功率从 82.8% 提升到 90.6%。PI0.5 从 90.6% 提升到 94.0%,完整 deliberation 设置把 PI0.5 的失败率降低了 51.1%。在真实的 Agilex Piper 任务上,PI0 在自适应 VLA-ATTC 下从 46.0% 提升到 58.7%。论文还报告了 20.8 Hz 的控制频率,这很重要,因为候选搜索如果用得太广,会打乱机器人的时序。