VLA 策略的部署反馈
InSight 将缺失的机器人技能视为可在初始示范集之后获取的原语。它把已有示范切分成带标签的动作,让视觉-语言模型提出缺失原语,收集成功的机器人 rollout,并重新训练策略。论文报告的真实 xArm 结果很具体:扭转成功率 92%,倒液成功率 96%,在没有端到端示范的 14 原语“先扭转再倒液”任务上成功率 80%。
Reflective VLA 加入了另一条反馈路径。它存储观察-动作-后果三元组,使策略能在部署期间推断相机几何、校准误差和执行偏差。在 LIBERO-Plus 上,它报告的平均成功率为 87.7%,匹配的反应式基线为 82.3%;列出的最大增益来自 Robot shift,成功率为 72.9%,基线为 50.0%。