针对冻结 VLA 操作策略的失败专用恢复包装层
一个有用的下一步是给现有的 VLA 策略外面加一层恢复模块,用来处理常见的偏离轨迹状态,比如空抓、物体掉落、放错位置和未完成的接触步骤。基础策略可以保持不变,恢复系统负责识别失败类型、选择修正目标或残差动作,并在任务回到正轨后把控制权交回去。
ReCoVLA 展示了这种模式的一个更重版本:Qwen3-VL-8B-Instruct 先分类失败和恢复阶段,编译器再生成分阶段奖励,残差策略在仿真中训练。它把 Fetch 任务的仿真成功率从 36.7% 提高到 66.7%,在零样本实物测试中的平均成功率是 61.7%。B2FF 给出了面向前瞻式 VLA 的更轻方案:先生成 12 个未来图像里程碑,在受到扰动后选出其中一个;在注入失败的 LIBERO 上,UD-VLA 的平均成功率从 56.3% 提高到 74.0%。ProbeAct 提供了只在运行时生效的方案,用隐藏状态探针、运动学失败检测和多次失败后的 Control Barrier Function 区域,把 LIBERO-plus 的成功率从 69.6% 提高到 74.1%。
机器人团队可以先把自己的失败操作日志回放到一个小的失败分类里,按抓取、搬运、放置和关节动作失败来分。第一轮测试应当把冻结策略和包装层在注入失败样本、以及一小组真实复测样本上做对比,测任务成功率、恢复成功率和每次恢复多走了多少步。