Execution-level annotation for VLA demonstration datasets
VLA 数据团队应该在操作演示里加一个简短的执行标注步骤,尤其是那些目标标签遮住关键选择的任务。可用字段很具体:主动手臂、目标物体、接近方向、接触区域、运动路径、姿态、最终配置和恢复行为。FineVLA 给出了一种可执行的流程:先把异构机器人数据集转换成统一格式,用动态时间规整聚类冗余演示,再给有代表性的一部分轨迹做标注,而不是给每条轨迹都标。
这样做的结果是,机器人对同一任务的完成方式更可控。FineVLA 报告,细粒度标签和原始目标标签混合训练效果最好,AlohaMix-OFT 在 RoboTwin 上达到 86.8% Easy 和 82.5% Hard。在真实双臂操作里,细粒度与原始标签按 1:1 混合时得分为 62.7/100,而只用原始标签训练是 49.9。一个低成本的内部测试方法是选一个高频任务,且它有多种可行执行方式,给聚类后的子集做标注,然后在操作员能直接观察的字段上测一致性,比如姿态、接近方向和接触点。