发布 VLA 操作策略前进行短时在线 rollout 微调
已经有模仿学习训练版 VLA 的操作团队,可以在发布前,在目标机器人上加入一个有边界的在线微调阶段。可落地的做法是做一个 rollout runner:保留示范缓冲区,收集当前策略的尝试,在离线数据和 rollout 数据混合后预热 critic,并在更新策略前按价值筛选候选动作。
FORCE 给出了这个流程的具体测试案例。在六个真实 Franka 任务上,论文报告的平均成功率从行为克隆的 45.0% 升至在线微调后的 98.3%,平均执行步数从 112.8 降至 38.9。报告中的在线阶段没有使用人工干预。一个实用的首次检查,可以在一个高价值工位任务上运行该流程,并在相同 rollout 预算下比较行为克隆、无 actor 更新的 critic 预热,以及完整的价值筛选更新。