Stage-level manipulation evaluation for VLA release checks
机器人团队在评估用于精细操作的 VLA 策略时,应先加入任务图和阶段指标,再把策略用于对部件敏感的任务。MetaFine 说明了原因:按物体算的抓取分数看起来很高,但按部件算的控制会失败。报告中的最佳策略在部件级约束下,Grasp Part 达到 80%,Press Part 达到 68%,Rotate Along 达到 12%;而常规评估会把精细能力高估多达 70%。
一个实用的发布检查是把每个硬件任务拆成语言理解、空间感知和运动行为三个阶段。对于 peg-in-hole 任务,仪表板应分别显示抓取、对齐、插入和轨迹平滑度。MetaFine 在 peg-in-hole 上的结果显示,五个 VLA 的总体成功率都接近于零,但阶段指标仍能分出不同故障点:OpenVLA-OFT 在 47% 的试验中完成抓取,在 19% 中完成对齐;pi_0.5 的抓取率是 39%,对齐率是 0%。
这对模型选择和修复都很有用。MetaFine 报告称,把 pi_0.5 的 SigLIP 编码器换成多尺度交叉注意力编码器,同时冻结 VLM 主干和动作头,能把抓取成功率从 39% 提高到 67%,把对齐率从 0% 提高到 32%。这让评估团队可以直接从失败阶段定位到组件级修复。