来源笔记
How VLAs (Really) Work In Open-World Environments
摘要
本文认为,现有的 BEHAVIOR1K 评估会高估视觉-语言-动作模型在开放世界家务任务中的表现,因为它只看任务最终状态,忽略了不安全的执行过程。作者对 B1K 的顶级系统做了审计,发现结果波动很大,安全违规也很频繁,并提出了会惩罚任务过程中有害行为的安全感知指标。
问题
- BEHAVIOR1K 主要使用成功率和 Q-score,它们检查的是最终子目标是否满足,但不关心机器人是怎么到达那个状态的。
- 这会漏掉一些与安全直接相关的失败,比如掉落物体、撞到家具、损坏支撑物体,或者以不安全的方式完成子目标。
- 对长时程家务任务来说,只看最终状态的评分诊断价值也很弱,因为失败可能出现在多个阶段:任务理解、导航、抓取、操作或动作顺序。
方法
- 论文分析了 B1K 2025 Challenge 中排名前两位的策略 RLC 和 Comet,在 50 个挑战任务上各做 10 次随机试验。
- 它从两个角度研究鲁棒性:一是用公开检查点复现官方结果,二是看同一任务在多次试验中的一致性。
- 它让 8 位机器人专家对 500 段任务录像做人工视频审查,按 10 个类别标注失败原因,包括抓取失败、碰撞、任务混淆、导航失败和执行顺序混淆。
- 它在 B1K 的 Q-score 基础上提出两个安全感知指标:sQ 会惩罚对目标物体的不安全处理或错误放置,seQ 还会加入对支撑性非目标物体的子目标,并惩罚把它们掉落或移动超过 10 cm 等危险行为。
- 安全规则是具体的:例如,如果目标物体放置时的横滚或俯仰角相对竖直方向偏差超过 30 度,就会被惩罚;支撑物体如果掉落或位移过大,就会被标记为违规。
结果
- 复现官方的 RLC 检查点后,在很多任务上的结果与已发布结果差距很大,任务 24、26、27 的差异都超过 27%;任务 37 上,复现得分为 0.1,而已发布得分为 0.0。
- 定性审查覆盖了 500 段录像(50 个任务 × 10 次试验),由 8 位专家完成。论文报告说,抓取失败是最常见的错误类别,碰撞也很常见,还出现了把鸡放到鞋架上或把鞋放进冰箱这类任务混淆。
- 在展示的 20 个任务表格中,RLC 的平均性能从 Q = 0.256 降到 sQ = 0.239,Comet 的平均性能从 Q = 0.192 降到 sQ = 0.173,说明安全惩罚会降低表面上的性能,即使还没把支撑物体损坏算进去。
- 在更广的安全增强指标下,RLC 的平均得分是 seQ = 0.356,Comet 的平均得分是 0.304,而对应的 seQ-Oracle = 0.395 和 0.338。这个差距反映了支撑物体违规和目标物体处理问题,而普通 Q-score 捕捉不到这些问题。
- 同一张表还报告了平均违规次数:RLC 的 nTV = 0.35、TV = 0.53,Comet 的 nTV = 0.31、TV = 0.59,说明非目标物体和目标物体的安全问题都很常见。
- 一些任务级例子显示了明显的安全影响:在 RLC 的 Bring water 上,Q = 0.233 降到 sQ = 0.133,TV = 1.2;在 Rearrange kitchen 上,Q = 0.275 降到 sQ = 0.175;在 Comet 的 Bring water 上,Q = 0.400 降到 sQ = 0.267;在 Set up coffee 上,Q = 0.200 降到 sQ = 0.150,TV = 1.1。