执行前的动作块验证
测试 VLA 策略的机器人团队应该在机器人移动前加一个执行前验证器,对每个候选动作块的有效性和预期价值打分。实际目标是在分布偏移下识别低质量动作块:碰撞、物体掉落、运动学违规,以及策略已经提交到坏片段后才出现的长时程失败。
Pre-VLA 给出了一种具体设计:把指令、视觉观测、本体感觉状态和候选动作块编码进去,再用一个小型双头网络预测二分类安全置信度和来自 critic 的优势值。它的运行时调度器会过滤被拒绝的动作块,在计算预算内重采样,并在需要时回退到预测优势最高的候选。 在 LIBERO 上,它报告了 0.9542 的有效性准确率、0.0200 的无效动作误放行率,以及 RynnVLA-002 闭环成功率从 30.79% 提升到 37.62%,每个动作块平均验证时间为 183.9 ms。
一个成本低的采用测试,是先在失败的 rollout 日志上离线运行验证器,再在同一任务集上开启过滤重放。关键指标是无效动作块的误放行、闭环成功率、被拒绝动作块比例和新增墙钟时间。CrossVLA 的延迟分解也指向了流匹配策略该优化的地方:π₀.₅ 的 sample_actions 调用大约 280 ms,其中约 220 ms 花在去噪循环里,所以验证器成本必须和动作生成与重采样成本一起看,不能只看前缀计算。