Fixed real-robot rollout protocols for UMI-style wrist-view policies
训练 UMI 风格桌面策略的团队,应先加入可重复的实体评测流程,再比较模型版本。UMI-Bench 1.0 给出了一种可直接照用的做法:固定工作站设置、腕部视角 RGB 输入、场景重置图像、场景 JSON、回放日志、人工评分、Full Success Rate,以及 0 到 100 的 Progress Score。真正有用的是按已见和未见因素拆分,因为它能把布局、位姿、动力学、物体身份和外观引起的失败分开。
这对目前用临时重置或换相机方式比较策略的实验室很重要。UMI-Bench 报告,π0.5 在三模型比较中以 55.84 的平均 Overall Score 领先,但更直接的结果是 Progress Score 的下降:Seen/Seen 轮次为 59.62,在位置、布局、位姿或动力学变化下为 45.33,在组合变化下为 40.19。策略发布清单可以照这个结构做,每个任务保留 20 到 50 次回放、保存重置图像、因素标签和每次回放的失败记录。同一张评测表也可以把仿真只留给排名检查,前提是它能保住真实世界的排序;这项 sim-real 研究发现,在测试的模拟器里,REALM 的策略排序相关性最好,模拟器后训练前的 Spearman 为 0.700,之后为 0.875。