面向冻结 VLA 策略的规划器控制重试与任务状态记忆
机器人团队可以在冻结的 VLA 外包一层规划器:由解析原语负责自由空间运动、目标定位、暂存和释放,再由 VLA 执行短时的接触密集型动作。每次调用都应记录子目标、耗时、接触或夹爪事件、观测结果和重试次数。规划器可以利用这些回合状态,在空抓后重新暂存,重复局部动作,或推进到下一个子目标。
Harness VLA 在 LIBERO-Pro 上的成功率达到 82.4%,直接使用同一冻结基线时为 50.0%。TFP 提供了将进度存储在策略内部的另一项证据:其事件敏感记忆将真实机器人上的物体交换成功率从 3/20 提高到 15/20。可以先用一个包含物体位置变化和间歇性遮挡的多阶段任务开展小规模试验,再比较直接执行与包装器方案的完成率、无效重复动作次数、恢复率和额外延迟。