Frozen-prior adaptation for few-demonstration VLA deployment
将预训练 VLA 适配到新的机器人工位时,团队应该测试一条可训练的轻量适配路径,同时在训练或 rollout 里保留预训练动作模块可见。PriorVLA 给出了一种实现:保留冻结的 Prior Expert,训练单独的 Adaptation Expert,让学习到的 queries 从冻结路径里读取场景和运动特征。UniSteer 也给出了一种做法,适用于 diffusion 或 flow-matching 策略:冻结 decoder,训练一个轻量 noise actor,再把人类纠正动作映射回 noise target。
实验室部署里的阻碍很常见:全量微调会贴合少量演示数据,同时丢掉大规模预训练得到的行为。PriorVLA 报告在 8 个真实世界任务和 2 种 embodiment 上,使用标准数据时 OOD 成功率为 57%,只有每个任务 10 条演示时 OOD 成功率为 32%。UniSteer 报告在 4 个任务上适应 66 分钟后,真实世界平均成功率从 20% 升到 90%,而且用到的纯人类轨迹少于 DAgger。一个低成本验证方法是,把同样的 OOD 放置和背景测试套件分别跑在全量微调、冻结先验适配器和人类纠正 noise actor 上,并按 ID 和 OOD 情况拆分成功率。