机器人策略团队可以针对三个具体问题采取行动:基于流的 VLA 控制中的动作头延迟、串联家庭技能之间薄弱的就绪检查,以及模仿学习中低效的示范数据池。每个问题都有一条小规模实施路径,可以用当前策略日志或基准运行轨迹进行测试。

3 个想法

为基于流的 VLA 控制循环缓存动作块

部署基于流的 VLA 策略的团队,应在推理路径中加入外部动作块缓存,并在相同任务分布下测量成功率与延迟的关系。ActionCache 使用紧凑的多模态键保存过去的中间动作块,为当前上下文检索相近动作块,然后直接执行,或用一到两步流迭代进行细化。实际测试规模不必大:用成功运行轨迹构建缓存,设置回退到完整生成的相似度阈值,再在重复操作任务上比较控制延迟、缓存命中率和任务成功率。

报告中的数据足以支持一次直接的工程试验。在 VLABench 上使用 π0.5 时,完整模型的成功率为 38.8%,动作头延迟为 18.8 ms。不做细化时,ActionCache 的成功率为 32.9%,延迟为 1.6 ms;使用一步细化时,成功率为 32.4%,延迟为 3.6 ms。不使用检索的简单一步生成,成功率降至 6.8%。因此,关键收益来自复用相似上下文中的动作,而不只是减少流迭代步数。对于动作头占据控制循环较大延迟预算、且重新训练主干网络成本较高的实验室,这种方案很适合进行测试。

  • Document 819

为长时程 VLA 技能库检查下一技能就绪状态

将 VLA 技能组合到家庭任务中的机器人团队,应在评测工具中加入类型化技能契约和下一技能就绪检查。一次技能调用需要包含的不只是局部成功标签,还应包括参数、步数预算、验证间隔、预期后置条件,以及下一技能可以启动的条件。在抓取前执行导航时,条件可以包括目标可见性和机械臂可达性。在放置后执行另一个操作步骤时,条件可以包括物体位姿和相机视野检查。

BEHAVIOR-1K 的交接研究说明了评测中需要这一支持层的原因。在干净快照上单独评测时,多个技能得分很高,例如 pick_up_from 为 96.5%,place_on 为 100.0%;但组合任务谓词成功率接近于零。在 30 次运行中,平均进度为 19.5%。在一条包含 10 次运行的轨迹中,工具记录了 130 次失败的技能尝试,涉及抓取控制、执行、放置、目标定位或场景搜索,以及导航就绪等类别。低成本的采用步骤是:使用多视角 VLM,每隔固定数量的模拟器步数验证现有的链式运行轨迹,然后记录每次失败来自当前技能、交接状态,还是下一技能的启动条件。

  • Document 822

在运行 VLA 模仿学习前进行原语级示范筛选

在大型机器人示范数据池上训练 VLA 策略的团队,应在投入完整训练算力前进行一次原语级数据筛选。SIEVE 根据夹爪或手部状态变化切分轨迹,对得到的视觉运动片段进行聚类,将每条轨迹表示为有序原语序列,并在这些序列分组中选择中心轨迹。这样,数据整理团队可以按以下流程操作:切分日志,聚类可复用的行为单元,为原语转换覆盖分配筛选预算,然后分别使用筛选子集和随机子集训练同一个策略,后者作为对照。

Bridge-V2 的结果足够具体,可以进行复现检查。使用 Qwen3-VL-4B-GR00T 时,SIEVE 只使用 50% 的示范数据和 25K 个训练步数,就在 SimplerEnv-WidowX 上达到 56.3% 的平均成功率,高于使用全部数据和 50K 个训练步数时的 51.8%。该方法针对机器人数据流水线中的常见问题:重复轨迹、噪声动作和任务覆盖不均会增加计算量,同时让行为克隆得到不一致的监督信号。最适合首先测试这一流程的是拥有大量遥操作日志、但训练预算有限的团队,因为它可以在不改变 VLA 模型的情况下测试筛选器。

  • Document 817