Policy-in-the-loop rollout gate for VLA checkpoint promotion
训练 VLA 策略的机器人团队可以在上硬件前加一道门,把每个候选 checkpoint 先跑一遍闭环想象 rollout。策略先预测一个 action chunk,世界模型再预测下一段多视角观测,生成的终端观测再作为策略的下一次输入。这和机器人上的 observe-act 循环一致,也能让团队在花时间做复位、安全检查和重复实机试验之前先做一次更便宜的筛选。
PiL-World 是最清楚的模板。在三个真实双臂任务上,它把真实成功率和想象成功率的平均差距从 Ctrl-World 的 63.2% 降到 12.0%,并报告了跨任务和 checkpoint 设置的 0.94 Pearson 相关系数。一个可行的起点是先在团队已经有真实 rollout 结果的两到三个任务上校准这道门,再看想象 rollout 能否把新 checkpoint 的排序和一小批真实机器人评测保持一致。