在快速操作单元中为扩散式 VLA 重规划做 speculative 验证
应在重规划边界衡量延迟,而不只是看模型吞吐。Realtime-VLA FLASH 给使用扩散式 VLA(如 π0)的团队一条可落地路径:训练或挂接一个小型草稿模型来提出未来动作块,让主 Action Expert 并行验证草稿块,执行最长的已接受前缀,并在夹爪切换或其他高精度阶段回退到完整推理。
低成本的采用测试是做一次回放或台架运行,按任务记录三个数:完整路径延迟、草稿前缀接受率,以及在阶段感知回退后的成功率。论文报告,LIBERO 上 Torch-π0 的任务级延迟从 58.0 ms 降到 FLASH+Triton-π0 的 19.1 ms,平均成功率从 94.1% 降到 93.8%。它还报告了在输送带分拣中,方法在 15 m/min 的带速下仍能成功抓取,而对比方法失败。对有移动物体、短抓取窗口或过时开放环动作块的机器人团队,这已经足够用来先做验证门,再改任务策略。