Behavioral phasing for precise manipulation
Move-Then-Operate 认为,当策略把接近动作和接触操作分开处理时,高精度操作会更好。它的双专家设计用一个专家负责移动、一个专家负责操作,由路由器按动作块选择阶段。在 8 个 RoboTwin2 任务上、每个任务 50 个示范的设置下,它报告的平均成功率是 68.88%,高于 pi_0 的 44.75%、RDT 的 35.63% 和 ACT 的 31.63%。在 Click Bell 这类接触密集任务上,提升很大,pi_0 为 44%,它达到 99%;在 Place Cans Plasticbox 上,pi_0 为 34%,它达到 79%。论文还声称,模型在少 40% 的训练步数下就达到峰值表现。