---
source: arxiv
url: http://arxiv.org/abs/2604.15671v1
published_at: '2026-04-17T03:49:41'
authors:
- Xu Huang
- Weixin Mao
- Yinhao Li
- Hua Chen
- Jiabao Zhao
topics:
- vision-language-action
- robot-memory
- long-horizon-planning
- chemical-lab-automation
- closed-loop-control
relevance_score: 0.88
run_id: materialize-outputs
language_code: zh-CN
---

# Long-Term Memory for VLA-based Agents in Open-World Task Execution

## Summary
## 摘要
ChemBot 面向长时程化学实验室执行，使用一个 VLA 代理来规划、执行、跟踪进度，并复用过去成功的轨迹。论文的主要观点是，双层记忆、闭环子任务规划，以及带进度感知的 VLA，能提升分解质量和真实任务成功率，优于 VLA 基线。

## 问题
- VLA 系统可以把语言和视觉映射为机器人动作，但在长链条、依赖状态的实验室流程中常常吃力，因为错误会在很多步骤中累积。
- 现有系统通常把规划和执行分开，也不保留成功运行的持久记忆，所以机器人会反复试错，而不是复用已经有效的方法。
- 这在化学实验室里尤其重要，因为任务分阶段、对安全要求高，而且需要根据当前物理状态精确切换子任务。

## 方法
- 该系统名为 **ChemBot**，采用两层设计：基于 LLM 的代理把任务规划成原子子任务，名为 **Skill-VLA** 的 VLA 策略在机器人上执行每个子任务。
- **Scene Describer** 把当前台面图像转换成结构化面板，包含物体、状态、可供性和空间关系，这样规划时用的是有落地信息的场景，而不是只看原始图像。
- 规划在闭环中运行，由 **Subtask Reasoner** 每次提出一个原子步骤，由 **Reflector** 在把步骤加入队列前检查可行性、冗余和顺序有效性。
- 记忆系统包含用于当前场景状态、工具输出和任务进度的 **短期记忆**，以及存储先前成功轨迹、供后续实验语义检索的 **长期情景记忆**。
- **Skill-VLA** 基于 GR00T，并加入一个 **进度头**，预测一个标量子任务完成值，范围为  [0,1]。当进度超过阈值时，代理结束当前技能并切换到下一个。论文还加入了异步未来状态推理，以减少动作不连续。

## 结果
- 在化学任务分解中，针对测试过的基础 VLM，**Qwen3-VL-Plus** 的文本/结构得分最好，**Edit Distance 0.733**、**BERTScore F1 0.744**、**ROUGE-1 0.542**、**ROUGE-2 0.366**、**ROUGE-L 0.471**。**Qwen3-VL-Flash** 更快，总耗时 **98.8 s**、**16 s/step**，而 Qwen3-VL-Plus 为 **298.8 s**、**42 s/step**。
- 在使用 Qwen3-VL-Flash 的 ChemBot 消融实验中，**完整模型** 达到 **Edit Distance 0.766**、**BERTScore F1 0.694**、**ROUGE-L 0.324**、**98.8 s** 运行时间和 **22,401 tokens**。去掉 **Scene Describer** 对分解质量影响最大，Edit Distance 升到 **0.915**，BERTScore F1 降到 **0.556**。
- 去掉 **Subtask Chain** 后，消融中的结构崩塌最明显，**Edit Distance 1.195**，而完整模型为 **0.766**。去掉 **Reflector** 后，**Edit Distance 为 0.881**。去掉 **Memory** 后，token 长度从 **22,401** 增加到 **28,064**，说明记忆主要降低上下文负担，同时把质量维持在接近完整模型的水平。
- 用于训练 Skill-VLA 的机器人数据集包含 **5,459** 条专家轨迹，平均 **872.2** 帧，涵盖 **51,580** 段原子动作，分布在 **12** 类化学流程中。
- 真实世界评估使用了 **UR3** 机器人、每个任务 **16 次试验**，以及三个多步骤实验：**Precipitation（11 步）**、**Heat and Dissolution（7 步）** 和 **Neutralization（6 步）**。论文指出，采用子任务级训练的 Skill-VLA 在这三个任务上都优于完整轨迹基线 **\(\pi_{0.5}\)** 和 **GR00T**。
- 这段摘录**没有给出图 8 的确切成功率百分比**，所以最强的可支持结论只能是定性的：完整的 ChemBot 策略在真实世界中的成功率、安全性和精度都高于完整轨迹 VLA 基线，作者把提升归因于子任务分解和基于进度的技能切换。

## Problem

## Approach

## Results

## Link
- [http://arxiv.org/abs/2604.15671v1](http://arxiv.org/abs/2604.15671v1)
