适用于长时程操作的不确定性门控候选动作选择
运行 PI0 风格策略的机器人团队,可以在花额外推理算力做动作候选之前先加一个小的决策门控。VLA-ATTC 用不同随机种子采样两个动作块,测量它们的动态时间规整距离,并把较大的距离当作动作不确定性。低不确定性的步骤直接执行。高不确定性的步骤复用一次视觉-语言 prefill,采样多个动作块,再交给 Relative Action Critic,通过两两比较选出胜者。
这是一项面向长时程操作的具体部署改动,因为一次错误动作就可能毁掉整个任务。论文报告显示,在自适应设置下,PI0 在 LIBERO-LONG 上的平均成功率从 82.8% 提升到 90.6%,PI0.5 从 90.6% 提升到 94.0%。在真实的 Agilex Piper 任务上,PI0 从 46.0% 提升到 58.7%。报告中的 20.8 Hz 控制频率很关键,因为候选搜索只有在不超过机器人时序预算时才有用。
一个有用的起步测试,是在已有机器人 rollout 上记录动作块分歧,设定一个离线分位数阈值,只把分歧高的步骤重新走一遍候选采样。是否采用,应看成功率是否提升,同时控制器频率是否仍然满足要求。