---
kind: ideas
granularity: day
period_start: '2026-07-07T00:00:00'
period_end: '2026-07-08T00:00:00'
run_id: materialize-outputs
status: succeeded
topics:
- robotics
- vision-language-action models
- world models
- 3D manipulation
- imitation learning
- dexterous manipulation
- robot planning
tags:
- recoleta/ideas
- topic/robotics
- topic/vision-language-action-models
- topic/world-models
- topic/3d-manipulation
- topic/imitation-learning
- topic/dexterous-manipulation
- topic/robot-planning
language_code: zh-CN
---

# VLA 策略执行检查

## 摘要
机器人策略团队可以针对三个具体问题采取行动：基于流的 VLA 控制中的动作头延迟、串联家庭技能之间薄弱的就绪检查，以及模仿学习中低效的示范数据池。每个问题都有一条小规模实施路径，可以用当前策略日志或基准运行轨迹进行测试。

## 为基于流的 VLA 控制循环缓存动作块
部署基于流的 VLA 策略的团队，应在推理路径中加入外部动作块缓存，并在相同任务分布下测量成功率与延迟的关系。ActionCache 使用紧凑的多模态键保存过去的中间动作块，为当前上下文检索相近动作块，然后直接执行，或用一到两步流迭代进行细化。实际测试规模不必大：用成功运行轨迹构建缓存，设置回退到完整生成的相似度阈值，再在重复操作任务上比较控制延迟、缓存命中率和任务成功率。

报告中的数据足以支持一次直接的工程试验。在 VLABench 上使用 π0.5 时，完整模型的成功率为 38.8%，动作头延迟为 18.8 ms。不做细化时，ActionCache 的成功率为 32.9%，延迟为 1.6 ms；使用一步细化时，成功率为 32.4%，延迟为 3.6 ms。不使用检索的简单一步生成，成功率降至 6.8%。因此，关键收益来自复用相似上下文中的动作，而不只是减少流迭代步数。对于动作头占据控制循环较大延迟预算、且重新训练主干网络成本较高的实验室，这种方案很适合进行测试。

### 资料来源
- Document 819: 概述 ActionCache 的缓存与细化方法、无需重新训练的设置，以及其在 π0.5 和 GR00T-N1.6 上的成功率与延迟结果。
- Document 819: 说明闭环机器人控制中迭代扩散或流生成带来的动作头延迟瓶颈。

## 为长时程 VLA 技能库检查下一技能就绪状态
将 VLA 技能组合到家庭任务中的机器人团队，应在评测工具中加入类型化技能契约和下一技能就绪检查。一次技能调用需要包含的不只是局部成功标签，还应包括参数、步数预算、验证间隔、预期后置条件，以及下一技能可以启动的条件。在抓取前执行导航时，条件可以包括目标可见性和机械臂可达性。在放置后执行另一个操作步骤时，条件可以包括物体位姿和相机视野检查。

BEHAVIOR-1K 的交接研究说明了评测中需要这一支持层的原因。在干净快照上单独评测时，多个技能得分很高，例如 pick_up_from 为 96.5%，place_on 为 100.0%；但组合任务谓词成功率接近于零。在 30 次运行中，平均进度为 19.5%。在一条包含 10 次运行的轨迹中，工具记录了 130 次失败的技能尝试，涉及抓取控制、执行、放置、目标定位或场景搜索，以及导航就绪等类别。低成本的采用步骤是：使用多视角 VLM，每隔固定数量的模拟器步数验证现有的链式运行轨迹，然后记录每次失败来自当前技能、交接状态，还是下一技能的启动条件。

### 资料来源
- Document 822: 介绍类型化契约执行工具、验证循环、单独技能结果、接近于零的组合成功率和失败次数。
- Document 822: 解释语义交接问题，并给出超出局部后置条件的下一技能就绪条件示例。

## 在运行 VLA 模仿学习前进行原语级示范筛选
在大型机器人示范数据池上训练 VLA 策略的团队，应在投入完整训练算力前进行一次原语级数据筛选。SIEVE 根据夹爪或手部状态变化切分轨迹，对得到的视觉运动片段进行聚类，将每条轨迹表示为有序原语序列，并在这些序列分组中选择中心轨迹。这样，数据整理团队可以按以下流程操作：切分日志，聚类可复用的行为单元，为原语转换覆盖分配筛选预算，然后分别使用筛选子集和随机子集训练同一个策略，后者作为对照。

Bridge-V2 的结果足够具体，可以进行复现检查。使用 Qwen3-VL-4B-GR00T 时，SIEVE 只使用 50% 的示范数据和 25K 个训练步数，就在 SimplerEnv-WidowX 上达到 56.3% 的平均成功率，高于使用全部数据和 50K 个训练步数时的 51.8%。该方法针对机器人数据流水线中的常见问题：重复轨迹、噪声动作和任务覆盖不均会增加计算量，同时让行为克隆得到不一致的监督信号。最适合首先测试这一流程的是拥有大量遥操作日志、但训练预算有限的团队，因为它可以在不改变 VLA 模型的情况下测试筛选器。

### 资料来源
- Document 817: 概述 SIEVE 的轨迹切分、聚类、中位轨迹选择，以及 Bridge-V2 的成功率结果。
- Document 817: 说明大型机器人示范数据集中的数据质量问题，并指出使用 50% 数据和 50% 训练步数可以超过全量数据训练。
