交互式可靠性评分用于机器人示范标签
机器人数据团队应在操作示范的自动标注流程里加入可靠性门控。SPARC 给出了一个可直接照着做的流程:通过夹爪阶段、语言解析、目标掩码、跟踪、3D 提升、物体运动、夹爪距离和机器人身体重叠,识别正在被操作的物体。输出是标签加可靠性分数,这样数据团队可以设定精度目标,并保留可用于训练的样本子集。
这正好解决拥挤机器人视频里的一个常见问题:检测器会把高置信度给错物体。一个有用的初始实现,是把现有的检测器和跟踪器标签与基于交互的评分器并行跑在几千条示范上,然后只人工复核接近接受阈值的样本。SPARC 在 IA-Bench 上的交互物体定位准确率是 80.2%,高于 58.1% 的检测置信度基线,并且在 90% 精度工作点下保留了 77.6% 的覆盖率。