来源笔记
HELM: Harness-Enhanced Long-horizon Memory for Vision-Language-Action Manipulation
摘要
HELM 通过加入显式记忆、执行前动作检查和失败后的恢复,提高了长时程视觉-语言-动作操控性能。论文认为,在反应式 VLA 策略中,更大的上下文窗口本身无法修复长时程错误。
问题
- VLA 模型在短任务上表现良好,但在包含多个子目标的较长操控序列上会失效。论文中的例子里,OpenVLA 在 LIBERO-SPATIAL 上达到 91.2%,但在 LIBERO-LONG 上降到 58.4%。
- 论文指出,这很重要,因为长时程任务要求机器人记住已完成的子目标,在动作执行前拒绝错误动作,并在出错后恢复,而不是让错误继续累积。
- 作者把反应式执行中的失败来源分成三类:记忆缺口、验证缺口和恢复缺口。在 83 个失败的 LIBERO-LONG 片段中,41% 有记忆失败,33% 有验证失败,26% 有恢复失败,18% 同时出现多种失败模式。
方法
- HELM 在冻结的 VLA 外围接了三个模块:Episodic Memory Module、学习式 State Verifier 和 Harness Controller。
- Episodic Memory Module 存储关键帧和任务状态记录,用 CLIP embedding 建立索引,检索最相关的前 3 个历史状态,并把这段检索到的历史作为结构化文本追加到 VLA 输入中。
- State Verifier 是主要的学习部分。它是一个小型 3 层 MLP,输入当前观测、候选动作、当前子目标和检索到的记忆上下文,然后在执行前预测该动作失败的概率。
- Harness Controller 用这个失败分数决定是执行、回滚到先前检查点,还是重新规划。它还跟踪子目标,并允许最多 3 次恢复尝试。
- 核心结论是,长时程成功需要带记忆条件的执行前失败预测,而不只是更长的 token 历史。验证器依赖检索到的记忆:把记忆从验证器中移除后,AUROC 从 0.847 降到 0.791。
结果
- 在 LIBERO-LONG 上,带 OpenVLA 的 HELM 将任务成功率从 58.4% 提高到 81.5%,提升 23.1 个百分点。把 OpenVLA 的上下文从 H=8 增加到 H=32 只能达到 63.8%(+5.4 个百分点),即使 H=64 也只有 65.1%。
- 在 LIBERO-LONG 上,HELM 还把子目标完成率从 74.2% 提高到 89.3%,把恢复成功率从 12.3% 提高到 54.2%。
- 在 LIBERO-LONG TSR 上,相比基线,Oracle Memory 为 72.4%,Rule Verifier 为 65.2%,Ensemble x5 为 67.9%,LoRA(50K) 为 69.3%,Reflexion 为 63.1%,HELM-Fwd 为 76.3%,HELM 为 81.5%。
- 在 CALVIN ABC->D 上,OpenVLA 的平均完成链数从 3.02 提高到 HELM 的 3.58。使用 Octo 时,HELM 把 TSR 从 51.2% 提高到 72.8%,提升 21.6 个百分点。
- 在 LIBERO-LONG 上的消融实验显示,每个部分都重要:去掉 EMM,TSR 下降 11.2 个百分点;去掉 SV,下降 8.4 个百分点;去掉回滚,下降 6.3 个百分点;同时去掉 EMM 和 SV,下降 19.1 个百分点。
- 机制结果:CLIP 检索的 TSR 为 81.5%,随机检索为 64.3%,按最近性检索为 71.4%;在 5 步失败预测范围下,SV 的 AUROC 达到 0.847;HELM 每 100 个片段中的记忆失败减少 76%,验证失败减少 61%,恢复失败减少 82%。