在机器人动作选择前验证实体 grounding
在已经能完成简单抓取放置、但会被措辞变化、杂乱场景或扰动打乱的 VLA 系统里,在指令解析和控制之间加一个明确的 grounding 门控。ProGAL-VLA 的结果足够具体,可以把这个做成一个产品模块:先把指令映射成符号化子目标,再把这个子目标和跟踪到的 3D 实体匹配,只把已验证的目标嵌入传给动作策略。实际价值不只是更高的基准分数。它还能让机器人在看不出指令指向哪个物体时停下来,先询问澄清,再去执行,避免抓错。ProGAL-VLA 报告在 LIBERO-Plus 上的鲁棒性是 85.5,对比 OpenVLA-OFT+ 的 79.6;在机器人扰动下,性能从 30.3 提升到 71.5;歧义检测的 AUROC 是 0.81,澄清行为从 0.09 提升到 0.81。RoboLab 说明了这种改动为什么有必要:在留出的语义视觉 grounding 上,π0.5 只有 21.5%,而同一策略在同一场景里,改写措辞就可能把成功率从 80% 拉到 0%。一个低成本的近期测试是:找一条已有的操作流程,里面有两三个相似候选物体,加上已验证实体检查和放弃执行路径,再测错抓率、澄清率,以及在相机或场景扰动下的恢复情况。