用于缺失操控技能的部署后 primitive 采集循环
在固定工作单元中运行 VLA 的操控团队,可以为策略缺失的技能加入一个小型采集循环。流程很具体:把现有遥操作数据集切分成带名称的 primitives,让 VLM 为失败的新任务制定计划,找出缺失的 primitive 标签,用受限的低层控制器为这些 primitives 采集机器人 rollouts,用 VLM oracle 接受成功片段,然后重新训练策略,使新的 primitive 后续可以被调用。
InSight 给出了一个可执行的形态。在真实 xArm 扭转和倒水任务中,它从 50 条 pick-and-place 演示开始,加入 20 个成功采集到的 primitive episode,并报告了 92% 的扭转成功率和 96% 的倒水成功率。它还在没有端到端演示的情况下,为一个先扭转再倒水的任务串联了 14 个 primitives,并达到 80% 成功率。论文报告的采集成本低到可以做实验室试验:采集 20 个扭转 primitives 需要 23 次试验和 39.7 分钟;采集 20 个倒水 primitives 需要 31 次试验和 85.3 分钟。
同一个部署流程应在 rollouts 期间保存策略自身的 observation-action-consequence 三元组。Reflective VLA 说明了这类日志的作用:三元组通过已执行动作的可见结果暴露相机几何、校准误差和执行偏差。在 LIBERO-Plus 上,Reflective VLA 报告的平均成功率为 87.7%,匹配的反应式基线为 82.3%;列出的最大增益来自 Robot 偏移,72.9% 对 50.0%。一个低成本检查是:在一个缺失 primitive 和一个相机或机器人偏移上运行该循环,然后测量重新训练后的策略是否在提升新 primitive 的同时保留旧的 pick-and-place 技能。