VLA rollout 的执行前动作验证和不确定性日志
运行 π0 风格或其他随机式 VLA 策略的机器人团队,可以加一个小型运行时层:采样多个短动作片段,在运动前打分,执行得分最高的候选,并把被拒绝的候选连同最终结果一起记录。VERITAS 给出了最具体的做法:生成 N 个候选片段,使用与像素空间路标点绑定的视觉验证器,并保留成功的已验证 rollout,用于后续行为克隆微调。论文报告的设置使用 N = 5、15 Hz 控制;在一次性生成 VLM 轨迹后,几何验证开销低于 1 ms。
这适合一种操作工位:错误的第一次动作代价高,但多采样几次策略很便宜。同一个日志层还可以加入基于流的 VLA 的速度场分歧,把不确定的起始状态送入专家示范队列。这样,部署遥测会变成一份分流清单:成功的已验证 rollout 成为自训练数据,高分歧案例成为下一批需要收集的示范。