冻结 VLA 的在线适配,用于精度末端阶段
VLA 团队一个实用的部署步骤是加一个只学习最后一段修正的在线适配头。RL Token 把预训练模型冻结,暴露一个紧凑状态,并训练一个小型 actor-critic,在真实机器人练习中调整参考动作块。报告中的收益对应的是阻碍量产的那一段操作:螺丝安装、充电器插入、以太网插入和扎带固定都在几分钟到几小时的在线训练后得到提升,最难阶段的执行速度最高快 3 倍,螺丝插入成功率从 20% 提升到 65%。
这说明,已经有一个大体能用、但在接触密集的末端环节速度慢或不稳定的 VLA 策略时,可以做出一套可落地的工作流。产品不是新的基础模型,而是一层很薄的适配层,带任务局部奖励、相对于基础策略的动作正则化,以及在目标工位上的快速练习循环。一个成本低的验证方法是,挑一个当前需要操作员反复重试或远程操控的精度瓶颈,冻结基础 VLA,测一个小型在线头能否在一个班次内压低节拍时间或失败率。