Action-generation latency benchmark for VLA manipulation policies
测试 VLA 操作策略的机器人团队应增加一个发布门槛,测量动作采样延迟、NFE、端到端 observe-infer-act 时间,以及同一操作套件上的任务成功率。这个门槛应先在目标机器人计算机上运行,再在编译、缓存、采样器更改或动作头更改后重复测试。
CF-VLA 给出了一个具体基线。它在 NFE=2 时报告 LIBERO 平均成功率 96.5%,动作采样延迟减少 75.4%,真实机器人实验平均成功率 83.0%。Libra-VLA 指向了类似的实现方式:让更重的语义规划器少运行一些,把粗粒度意图存进 FIFO 缓冲区,并让动作细化器保持控制频率。硬件分析论文说明了这为什么要放进部署流程。对 pi0 来说,编译前测得的延迟在 RTX 4090 上为 102.3 ms,在 Jetson Thor 上为 246.0 ms,在 AGX Orin 上为 920.6 ms,而能耗和成本在不同设备上变化不同。
一个低成本的验证跑法是做两列对比:当前采样器对比粗到细或带缓冲的变体,同时记录成功率和延迟。一个能省毫秒但降低接触任务成功率的采样器应该被门槛拦下。