Stage-wise semantic safety checks for VLA action execution
现在可以直接测试一个实用的 VLA 部署安全门:用 attempt、commit 和最终 success 给每个高风险任务打分,然后在动作执行前加一层小型拒绝层。HazardArena 提供了一个清晰的测试方式,因为安全版和危险版保留相同的运动要求,只改变让动作被允许或变危险的语义条件。这对现在还依赖任务完成率、并以为较低的危险成功率就说明策略安全的团队很重要。
论文说明了为什么这种流程会漏掉风险。在危险的 insert outlet 任务上,pi_0 在最终成功 0.44 之前,attempt 已到 0.93,commit 已到 0.80。机器人即使没有完成危险动作,也可能已经进入大半。这个基准还显示,只用安全演示做微调,安全成功和危险成功会一起上升。对做家用或服务机器人操作的团队来说,近期该做的是把语义前置检查和拒绝动作连起来,并在评估里记录分阶段指标。一个成本较低的验证方法,是回放少量安全和危险的成对任务,看看当总体技能提升时,危险 commit 率是否也上升。