Latency budget harness for VLA acceleration patches
一个实用的短期构建方向,是给 VLA 控制回路做一个延迟预算测试框架,在同一套策略上测试可互换的加速补丁。现有证据已经支持把动作头压缩、提前退出和 token 剪枝当作同一个部署栈里的模块来处理。SnapFlow 把 pi0.5 的端到端延迟从 274 ms 降到 83 ms,同时把 LIBERO 成功率保持在 98.75%,高于 10 步教师的 97.75%。A1 通过把提前退出和截断流匹配结合起来,把每回合延迟最多降 72%,把骨干计算量降 76.6%。VLA-InfoEntropy 为 OpenVLA 级系统提供了一条无需训练的路径,把延迟从 51.91 降到 31.25,同时把 LIBERO 成功率从 75.0% 提到 76.4%。
缺少的是比较式部署工具,而不是另一个基础模型。机器人团队在碰硬件前,需要一种可重复的方法回答一个简单问题:哪种加速方法组合能在固定控制周期预算内运行,同时不破坏长时任务。一个有用的初版工具,应记录端到端延迟、动作头延迟、骨干延迟、各任务集成功率,以及长任务上的失败集中情况。一个低成本检查办法,是把同一个标准策略放进 LIBERO 跑四种模式:基线、动作步压缩、骨干提前退出和 token 剪枝,然后看是否有任意组合能低于目标周期时间,并保住 Long 任务上的成功率。这类工具基础设施可以缩短已经在用 pi0.5、OpenVLA 或类似 VLA 的团队,从模型到机器人落地的交接时间。