带 reset JSON 和进度评分的 UMI 风格真实机器人评估协议
在把模型分数视为可比之前,比较腕部视角操作策略的团队应加入一套共享的物理评估包。UMI-Bench 1.0 给出了具体模板:固定工作站、腕部 RGB 观察设置、动作接口、场景重置、rollout 日志和人工评分。每个 episode 都带有一张重置图像,以及包含任务 ID、物体元数据、位置、姿态、目标区域、split 和任务特定因素的场景 JSON。
这对那些发现策略排名会随相机位置、重置流程或物体姿态变化而变化的实验室有用。UMI-Bench 在 seen 和 unseen 条件单元中报告 Full Success Rate 和 0–100 Progress Score。结果说明了为什么 split 重要:平均 Progress Score 从 Seen/Seen episode 中的 59.62 降至组合偏移下的 40.19,并且位置、布局、姿态或动力学偏移比物体或外观变化造成的损害更大。两个长时程任务中,三个被评估模型的 Full Success Rate 都是 0%,这为评估团队提供了明确的压力测试,用来检查那些在较短任务上看起来可接受的策略。