可控 VLA 策略
FineVLA 针对机器人数据集中的一个具体弱点:很多轨迹只说明任务完成了什么,却没有说明怎么完成的。该工作为 47,159 条筛选后的轨迹补充了经人工核验的执行指令,覆盖手臂选择、接近方向、接触区域、最终姿态和其他动作细节。用细粒度标签和原始标签混合训练时,报告结果最好,AlohaMix-OFT 在 RoboTwin 上达到 86.8% Easy 和 82.5% Hard。在真实双臂操作中,同一组证据给出的结果是细粒度:原始 = 1:1 时为 62.7/100,而只用原始标签训练为 49.9。