面向接触密集操作的阶段标注微调
两阶段操作策略现在是小规模机器人示范数据团队可以直接落地的目标。Move-Then-Operate 把粗略接近动作和接触操作分开,为每个阶段训练单独专家,并把每个动作块路由到对应专家。在报告的 RoboTwin2 设置里,50 条每任务示范把平均成功率提高到 68.88%,而 pi_0 是 44.75%;在接触密集任务上提升更大,例如 Click Bell 为 99% 对 44%,Place Cans Plasticbox 为 79% 对 34%。
实际工作流的改动很直接:把示范片段标成接近或接触,然后不要再让一个动作头用同一组梯度同时学这两种行为。论文的标注流程用到了视频、语言、子任务分解和末端执行器速度线索,所以这套检查对现有模仿学习栈来说成本不高。可以先回放现有日志,在接触开始处切分轨迹,微调两个小型适配器或头部,然后看按压、点击、插入和放置任务的末阶段失败率是否下降。这对已经有基础 VLA 策略、但在最后几厘米动作上总是丢失稳定性的实验室和机器人团队最有用。