Sample-efficient adaptation with compact control signals
真实机器人适应正在变得更有针对性。RL Token 把一个预训练的视觉-语言-动作模型冻结起来,暴露一个紧凑状态供强化学习使用,只在线更新一个小型 actor-critic。它在精密操作上的效果很具体:最难阶段的执行速度最高快 3 倍,螺丝插入任务在几分钟到几小时练习后,成功率从 20% 提升到 65%。GazeVLA 从另一个角度解决同一个数据瓶颈。它把人类视线当作意图信号,在超过 1.5 亿帧的第一视角数据上预训练,并报告只用每个任务 10 条机器人轨迹和 50 条人类轨迹时仍有更强的 few-shot 迁移能力,包括简单抓放任务 85% 的成功率,以及在螺丝拧紧上相对 pi0.5 的 2 倍提升。