冻结 VLA 的任务进度记忆与重试控制
部署预训练 VLA 的团队可以在其外层加入规划器,记录已完成的阶段、接触结果和重试历史。VLA 负责短时的接触密集型动作;显式原语负责目标定位、自由空间运动、重新布置和释放。Harness VLA 采用这种结构后,在不对 VLA 进行微调的情况下,将 LIBERO-Pro 的成功率从直接冻结基线的 50.0% 提高到 82.4%。TFP 还表明,回合内任务状态可以区分视觉上相似但需要不同动作的场景:真实机器人上的物体交换成功率从 3/20 提高到 15/20。
可以先选择一个在空抓取、遮挡或物体交换后经常失败的多阶段任务进行测试。记录一个紧凑状态,包括当前阶段、已用时间、最近一次接触结果和重试次数。在不同布局下,将加入外层规划器的策略与未修改的控制器进行比较,测量完整任务成功率、重复动作错误、重试次数和新增延迟。这项测试可以判断,加入执行状态是否比再收集一批任务专用微调数据更节省成本地提升可靠性。