用于动作块 VLA 策略的视觉潜变量漂移监控器
采用动作块的 VLA 部署应加入一个小型推理时监控器,检查摄像头流的变化是否符合当前动作块的预测。实际触发条件很简单:如果观测到的视觉潜变量变化持续偏离预期变化,就停止执行队列中剩余的动作,并让策略生成一个修正后的动作块。
VLA-Corrector 给出了一个具体模板。它冻结 VLA 主干,在示范数据上训练一个 40M 的潜在动力学 MLP,比较预期和实际的视觉潜变量变化,并用中位数和 MAD 阈值检测持续不匹配。发生中断后,它把下一次 flow-matching 去噪步骤引向修正方向。在 MetaWorld 上,pi0.5 的平均成功率从 48.70% 升至 64.35%;SmolVLA 在 horizon 10 下从 61.90% 提升到 73.00%,同时平均策略调用次数从 19.27 降至 15.64。
低成本测试是在涉及接触、打滑或位姿漂移的任务上做一次动作块审计。记录预期视觉潜变量变化、观测变化、中断率、成功率,以及每个 episode 的策略调用次数。如果中断集中出现在真实执行错误附近,并减少失败的长动作块,这个监控器就可以成为固定 horizon VLA 控制器的部署防护机制。