用于分块 VLA 机器人策略的异步执行层
现有 VLA 策略的流式控制封装现在看起来已经可以做。实际运行中的痛点是,真实机器人在观察、动作生成和执行彼此等待时,会出现走走停停的执行。StreamingVLA 给出了一个具体模板:让这些阶段重叠运行,把分块预测改成 action flow matching,这样机器人可以立刻执行下一个小动作,并用显著性预测器来控制是否提前观察。在 LIBERO 上,以 pi_0.5 为基础模型时,论文报告平均成功率与基线相同,都是 97.1%,同时把每步动作时间从 74.5 ms 降到 33.7 ms,把停顿间隔从 232.3 ms 降到 76.1 ms。更激进的 AFM+AEO 版本把每步时间降到 31.6 ms,停顿间隔降到 36.0 ms,但成功率降到 94.9%,这给了一个可调的延迟-质量权衡。
近期可做的产品不是新的基础模型,而是一个运行时层,面向已经在边缘硬件或移动操作臂上运行分块 VLA 策略的团队。一个低成本验证方法是,先给一条已部署策略加上逐步时间戳,测量动作簇之间的停顿时间,再在一个较窄的任务切片上加入异步观察和单步动作生成,例如 pick-and-place。如果机器人停下来的次数变少,同时任务失败没有上升,这个封装层在任何重新训练计划开始前就已经有价值。