Time-to-success logging for real-robot VLA comparisons
比较 VLA 策略的机器人实验室应把每次 rollout 都记成完成时间、硬失败或安全停止,然后报告带置信区间的 time-to-success 分布。PhAIL 提供了一个具体模板:用 Kaplan-Meier CDF、相同工装下的人类遥操作作为 Human-Relative Throughput 基线,以及按对象做 KS 检验来比较模型。
这套流程解决了一个常见的落地障碍:两种机器人策略在固定时间成功率上看起来接近,但其中一个更慢,或者失败尾部更差。在 PhAIL 的 Franka FR3 基准中,表现最好的 VLA 按 RMST 比值算大约比人类参考慢 7 倍,而且任何对象上都没有推理模型超过 19% 的 Human-Relative Throughput。一个低成本的起点是复用已有的 rollout 视频和日志,给任务完成和不可恢复失败补上时间戳,然后看当成功率换成完整完成时间分布后,排序是否变化。