用于 VLA 策略发布的闭环神经 rollout 回归测试
机器人团队可以在发布前增加一个回归阶段:把每个候选 VLA 策略放进一个以动作为条件的视频世界模型中运行,用 0–5 分的任务进度 VLM 评分标准给 rollout 打分,只把有争议或高风险的案例送到真实硬件上测试。RoboWorld 报告称,它在八个开放机器人策略上生成了 4,186 次 rollout,并且与 RoboArena 真实世界排名接近一致,Pearson r=0.989,Spearman rho=0.970。在论文报告的排名比较中,它的任务进度评分也优于二元成功评分。
一个可落地的初版可以从团队自己的留出任务开始:通过学到的视频模型重放策略动作,按每次 rollout 评分任务进度,再把得到的排名与每周一小批真实机器人试验对比。系统应单独记录世界模型伪影,因为 RoboWorld 的设计使用腕部视角检查来发现生成视频失败。它的用途是发布分流:在占用稀缺机器人时间之前,先发现策略在物体、相机视角和任务变体上的回归。