面向不确定 VLA 动作和执行错误的 rollout 门控
操作团队可以先在现有 VLA 策略外加一层 rollout 门控,再重训整个模型。门控在执行时应观察两个信号:采样 action chunks 之间的分歧,以及可见的任务状态错误,例如抓取失败、拿错物体或位姿滑移。低风险步骤可以继续由基础策略执行。高分歧状态或错误状态可以触发候选动作采样、relative action critic 或恢复计划。
VLA-ATTC 给出了一种实现方式:采样两个 action chunks,用 Dynamic Time Warping 距离作为不确定性信号,只在距离超过阈值时增加计算量。在真实 Agilex Piper 任务上,PI0 使用自适应版本后平均成功率从 46.0% 升至 58.7%,同时报告了 20.8 Hz 控制频率。Sentinel-VLA 给出互补的状态监控方式:预测 Initial、Normal、New-subtask 或 Error,保留任务记忆,并在检测到错误时生成恢复行为。它报告在三个真实 Agilex Piper 任务上的平均成功率为 60.0%,在 RTX4090 上为 13 ms/action。
一个有用的首个测试,是回放近期失败 rollout,并注入抓取、位姿和语义错误。验收标准应包括成功率提升、错误恢复触发的误报,以及每个动作增加的延迟,因为恢复层即使改善了离线轨迹,只要超出控制预算,在机器人上仍会失败。