来源笔记
RoboLab: A High-Fidelity Simulation Benchmark for Analysis of Task Generalist Policies
摘要
RoboLab 是一个高保真仿真基准,用来检验在真实世界训练的机器人策略是否真的能泛化到新任务和新领域。它构建了保留测试用的仿真任务,评估失败模式和动作质量,并显示当前的视觉-语言-动作策略在这种域外评测中表现很差。
问题
- 现有机器人基准常常在重叠的仿真域中训练和测试,成功率容易饱和,也会掩盖泛化能力薄弱的问题。
- 真实世界评测成本高、速度慢,而很多模拟器要么保真度太低,无法反映真实世界策略的表现,要么扩展场景时成本太高。
- 仅看二元成功与否会漏掉有用的失败信号,比如抓错物体、掉落、碰撞,以及对摄像头或场景变化的敏感性。
方法
- 论文提出 RoboLab,这是一个基于 IsaacLab/Isaac Sim 的仿真平台,使用人工编写或 LLM 辅助流程生成照片级场景和语言条件任务。
- 它定义了 RoboLab-120,一个包含 120 个人工验证任务的基准,覆盖三个能力轴:视觉、程序性、关系性,每个轴都分为简单、中等、复杂三级。
- 策略只在 DROID 等真实世界数据上训练,然后在保留的仿真环境中评测,把训练域和测试域分开。
- 评测不只看成功率,还包括分级任务分数、记录的失败事件、轨迹指标(如 SPARC、速度和路径长度),以及用基于仿真的推断做敏感性分析,估计哪些场景变量会驱动成功或失败。
- 生成流程可以扩展场景和任务创建:论文报告生成了 800 多个场景,并评估了 812 个生成任务,覆盖 59 个场景,用于检查指令条件对齐和可执行性。
结果
- 在 RoboLab-120 上,整体表现很低。表 I 报告的总体成功率为 23.3%(π0.5)、15.7%(π0-FAST)、5.2%(π0)、2.0%(GR00T N1.6)和 1.5%(PaliGemma)。
- 论文还写到最佳策略的整体成功率达到 31.9%,而引言里给 π0.5 的近似值是 ~30%。这段摘要里数字不一致,但都指向同一结论:当前强模型在大多数保留任务上都会失败。
- 对 π0.5 来说,按难度划分的成功率是简单 26.3%、中等 23.2%、复杂 11.7%。
- 对 π0.5 来说,关系性子任务比其他多数轴容易得多:表 I 中关系性任务总体成功率为 56.2%,文本给出的细分是连词 76.0%、计数 60.0%、空间关系 23.9%。
- 对 π0.5 来说,视觉指向仍然薄弱:文本报告尺寸 35.0%、颜色 30.0%、语义 21.5%。程序性技能也较弱:重定向 53.3%、可供性 20.0%、堆叠 16.0%。
- 语言稳健性很脆弱。表 IV 显示,π0.5 在不同语言具体性水平上的总体成功率分别为 16.8%、23.3%、25.8%;π0-FAST 为 9.7%、15.7%、15.2%;π0 为 3.4%、5.2%、6.5%。
- 场景复杂度会拉低表现。在一个消融实验里,π0.5 在罐头装箱任务上,目标物体为 1 个时成功率 70%,为 2 个时降到 30%,为 3 个时降到 20%。
- 同一场景里,指令措辞可以改变结果。π0.5 的例子包括“Put the white mugs in the grey bin”成功率 80%,而“Put away mugs”是 0%;“Take all the bananas out of the grey bin and put it on the table”是 50%,而“Empty the grey bin.”是 10%。
- 任务生成流程也有量化验证:在 59 个场景里的 812 个生成任务中,论文报告指令条件对齐 0.91、清晰度 0.96、可执行性 0.92、语义匹配 0.95、完全对齐任务 76%、约 1% 不对齐、物体覆盖率 88%。
- 在 6 个简单任务的真实环境与仿真对比中,表 V 报告所示策略的真实成功率分别为 79.5、34.1、63.2 和 0.0,仿真成功率分别为 74.0、42.0、18.0 和 4.0,支持了一个结论:仿真可以作为有用但不完美的真实行为代理。