遮挡和物理基准暴露了操作策略的脆弱性
几篇论文收紧了视觉-语言-动作(VLA)机器人策略的评测,其中 VLA 指把语言和视觉输入映射到机器人动作。LIBERO-Occ 新增了 2,000 个被遮挡的 LIBERO 任务,并报告当任务物体或容器被遮住时,成绩大幅下降。VIM 通过生成一个互补的手腕或夹爪视角挽回部分损失,在没有真实额外视角的情况下把平均成功率做到 65.05%。
UMI-Bench 1.0 为通用操作接口(Universal Manipulation Interface)策略提供了真实机器人桌面基准,包含固定重置、手腕视角输入、轨迹记录和人工评分。结果显示,布局、位姿和动力学等物理因素带来的影响,比外观或物体类别变化更大。另一项仿真-真实研究发现,REALM 比 VLA-Arena 和 SIMPLER 更能跟上真实机器人的策略排序,在模拟器后训练前后的 Spearman 相关系数分别是 0.700 和 0.875。