带记忆条件动作检查和回滚的执行外壳,用于长时程操作
机器人团队在长时程操作上,现在有了一个明确理由,在冻结的 VLA 外面加一层执行外壳。HELM 的结果表明,常见失败模式不是某一个动作做错,而是一个循环问题:策略丢失已完成的子目标,在没有检查的情况下执行不可行动作,然后在任务状态已经被破坏后继续往下走。它的包装层用情景记忆检索、执行前状态验证器和基于回滚的恢复来处理这些问题,LIBERO-LONG 上的提升也很大:OpenVLA 从 58.4% 提升到 81.5%,而只拉长上下文长度在 H=32 时只能到 63.8%,在 H=64 时到 65.1%。同一篇论文还报告,恢复成功率从 12.3% 升到 54.2%。
实际可落地的做法是给已部署的操作策略加一层轻量运行时模块:保存带检查点的任务状态,检索当前子目标对应的一小段结构化历史,在执行前给候选动作打失败分数,并允许有限次数的回滚尝试。这个支持层很多实验室都可以在不重训基础策略的情况下测试。一个成本较低的初步检查,是在现有失败的长时程回放上做研究:统计有多少失败本可以在接触或运动执行前被验证器拦下,然后在一小组多阶段抓取放置任务上加入回滚,对比完成的子目标数,而不只看最终成功率。