来源笔记

Long-Term Memory for VLA-based Agents in Open-World Task Execution

ChemBot 面向长时程化学实验室执行,使用一个 VLA 代理来规划、执行、跟踪进度,并复用过去成功的轨迹。论文的主要观点是,双层记忆、闭环子任务规划,以及带进度感知的 VLA,能提升分解质量和真实任务成功率,优于 VLA 基线。

  • VLA 系统可以把语言和视觉映射为机器人动作,但在长链条、依赖状态的实验室流程中常常吃力,因为错误会在很多步骤中累积。
  • 现有系统通常把规划和执行分开,也不保留成功运行的持久记忆,所以机器人会反复试错,而不是复用已经有效的方法。
  • 这在化学实验室里尤其重要,因为任务分阶段、对安全要求高,而且需要根据当前物理状态精确切换子任务。
  • 该系统名为 ChemBot,采用两层设计:基于 LLM 的代理把任务规划成原子子任务,名为 Skill-VLA 的 VLA 策略在机器人上执行每个子任务。
  • Scene Describer 把当前台面图像转换成结构化面板,包含物体、状态、可供性和空间关系,这样规划时用的是有落地信息的场景,而不是只看原始图像。
  • 规划在闭环中运行,由 Subtask Reasoner 每次提出一个原子步骤,由 Reflector 在把步骤加入队列前检查可行性、冗余和顺序有效性。
  • 记忆系统包含用于当前场景状态、工具输出和任务进度的 短期记忆,以及存储先前成功轨迹、供后续实验语义检索的 长期情景记忆
  • Skill-VLA 基于 GR00T,并加入一个 进度头,预测一个标量子任务完成值,范围为 �[0,1]。当进度超过阈值时,代理结束当前技能并切换到下一个。论文还加入了异步未来状态推理,以减少动作不连续。
  • 在化学任务分解中,针对测试过的基础 VLM,Qwen3-VL-Plus 的文本/结构得分最好,Edit Distance 0.733BERTScore F1 0.744ROUGE-1 0.542ROUGE-2 0.366ROUGE-L 0.471Qwen3-VL-Flash 更快,总耗时 98.8 s16 s/step,而 Qwen3-VL-Plus 为 298.8 s42 s/step
  • 在使用 Qwen3-VL-Flash 的 ChemBot 消融实验中,完整模型 达到 Edit Distance 0.766BERTScore F1 0.694ROUGE-L 0.32498.8 s 运行时间和 22,401 tokens。去掉 Scene Describer 对分解质量影响最大,Edit Distance 升到 0.915,BERTScore F1 降到 0.556
  • 去掉 Subtask Chain 后,消融中的结构崩塌最明显,Edit Distance 1.195,而完整模型为 0.766。去掉 Reflector 后,Edit Distance 为 0.881。去掉 Memory 后,token 长度从 22,401 增加到 28,064,说明记忆主要降低上下文负担,同时把质量维持在接近完整模型的水平。
  • 用于训练 Skill-VLA 的机器人数据集包含 5,459 条专家轨迹,平均 872.2 帧,涵盖 51,580 段原子动作,分布在 12 类化学流程中。
  • 真实世界评估使用了 UR3 机器人、每个任务 16 次试验,以及三个多步骤实验:Precipitation(11 步)Heat and Dissolution(7 步)Neutralization(6 步)。论文指出,采用子任务级训练的 Skill-VLA 在这三个任务上都优于完整轨迹基线 (\pi_{0.5})GR00T
  • 这段摘录没有给出图 8 的确切成功率百分比,所以最强的可支持结论只能是定性的:完整的 ChemBot 策略在真实世界中的成功率、安全性和精度都高于完整轨迹 VLA 基线,作者把提升归因于子任务分解和基于进度的技能切换。