带旧任务回归检查的在线 VLA 微调站
试用预训练 VLA 策略的机器人团队,可以围绕在线 rollout、人工纠正、稀疏奖励检测器、回放,以及固定的动作归一化设置,搭建一个小型后训练站。目标用户是操作员:他们看到一个策略在微调后学会了新任务,随后发现早期技能退化了。
EXPO-FT 给出了可执行的模板:把预训练策略保留为基础策略,训练一个轻量编辑策略来修正 action chunk,让 Q-function 在基础 chunk 和编辑后的 chunk 之间选择价值更高的一个,并把在线 rollout 中的人工纠正存入回放。论文报告的真实机器人结果是:平均使用 19.1 分钟在线数据后,在八个操作任务上达到 30/30 成功,最终成功由人工观察者判断。
回归检查很关键,因为顺序 VLA 微调可能抹掉先前任务。在一项真实世界持续学习研究中,普通微调使 Stack Bowl 从 100.0 降到 15.0,使 Hang Cup 从 97.5 降到 25.0;使用 0.2 缓冲区比例、0.2 回放频率和固定动作归一化的回放方法,在四个任务上达到 93.5 的最终平均分。一个实用的采用检查是:在每个微调阶段后运行新任务和所有此前已验收任务,并在整条部署线上使用相同的动作缩放。