语义安全变成可测量的控制问题
HazardArena把语义安全放到VLA评估的中心。它的安全和不安全双任务保持运动要求不变,只改变让动作被允许或变得危险的语义。这种设计暴露出一个实际失效模式:模型可以同时提升任务能力和不安全完成率。最清楚的例子是 pi_0 在 insert outlet 上的结果,安全成功率从 0.08 升到 0.47,不安全成功率也从 0.02 升到 0.44,跨越多个检查点都如此。论文也说明了为什么只看终点成功率还不够。在不安全的 insert outlet 上,pi_0 在最终成功率 0.44 之前,attempt 达到 0.93,commit 达到 0.80,所以风险进展在完成前就已经可见。作者提出的 Safety Option Layer 是一个有用的防护思路,但这里的主要贡献是基准本身和分阶段的风险视角。