面向 VLA 操作策略的安全专项发布测试
VLA 操作团队应在发布测试中加入安全测试阶段,把不安全接触和不安全指令遵循行为与任务完成率分开衡量。LIBERO-Safety 给出了可用模板:75 个任务覆盖可供性感知抓取、人机交互、桌面空间避让、自由空间手-物避让和语义安全推理,难度级别为 L0-L2。该基准还包含 19,664 条经过人工筛查的无碰撞演示,这些演示由稀疏关键位姿和 CuRobo 碰撞检查生成。
操作原因很直接:一个策略可以完成简单的操作任务,却仍会在杂物、人手或手持物体附近失败。在 LIBERO-Safety 中,OpenVLA-OFT 在高难度可供性感知抓取上的成功率降至 1.3%,π0.5 在同一级别上也只有 35.3%。实用的发布准入检查应让同一个策略同时跑标准任务套件和安全套件,记录成功、碰撞、拒绝和恢复行为,并在 L2 安全案例反复失败的任务上阻止部署。