Semantic target-choice and adaptive failure tests for VLA release gates
VLA 评估在机器人单元批准策略前应增加两项检查:模型在能够抓取之后是否选择语义上正确的目标,以及哪些物体、姿态和指令条件会带来成组失败。
RoboSemanticBench 说明了为什么单一任务成功率不足以作为发布门槛。它把数学、常识和事实问题改成抓取与放置任务,从而把抓取和目标选择分开。每个模型和套件都做了 500 个仿真回合,pi0.5 的平均任务成功率最高,为 21.8%,但它的归一化语义落地分数只有 5.2%。有些模型的归一化分数是负的,这表示它们在成功抓取后的目标选择,甚至比随机选择基线还差。
FATE-VLA 给评估团队提供了第二个直接工具:自适应场景生成。它运行候选操作场景,记录成功或失败,再用代理模型和多样性评分选择下一次测试。在 GR00T-N1.6 上,最佳变体把发现失败率提高到 65.3%,而随机测试只有 35.6%。在 EO-1 上,它达到 60.0%,随机测试是 36.7%。
实际落地时,可以把每个新的 VLA 策略候选都变成一次小规模失败发现活动。先选一个与部署相关的任务族,再变化物体身份、物体姿态、工作区位置和指令措辞,并把语义目标准确率和抓取成功率分开报告。输出应当是一张运维人员和模型训练人员都能用的失败地图,而不是一个单独的平均成功率。