来源笔记

Mana: Dexterous Manipulation of Articulated Tools

Dexterous ManipulationSim To RealArticulated ToolsRobot Policy LearningTrajectory Generation

Mana 通过把数据生成改成一个由粗到细的动画流程,再用这些仿真轨迹训练视觉-运动策略,解决了细长关节工具的灵巧操作。论文聚焦桌面抓取和手内驱动,目标工具包括夹钳、钳子、晾衣夹和注射器,这些任务很难靠遥操作或端到端强化学习稳定完成。

  • 关节工具需要同时保持稳定抓取和施加强力驱动,通常还要处理毫米级的接触敏感性和 3-7 N 的驱动力。
  • 基于位置的遥操作很难可靠地产生细工具所需的接触力,而从零开始做强化学习也很难找到合适的接触点和受力方向。
  • 任务既包括从桌面拾取,也包括手内操作,策略必须处理长时程行为,而不只是固定的手内握持。
  • 用户在每个工具网格上点击功能可供性区域,每个工具少于 1 分钟。
  • 系统先生成抓取关键帧,再用运动规划连接自由空间移动,并在接触密集阶段用短时程强化学习补全轨迹。
  • 它把一段任务拆成预抓取、抓取和手内驱动三部分,让强化学习只处理最难的力控制部分。
  • 它在仿真轨迹上训练一个以点云为条件的扩散策略,输入分割后的 RGB-D 点云和机器人的本体感觉,输出腕部和手指动作。
  • 训练时加入点云噪声和部件遮罩,提高从仿真迁移到真实机器人的效果。
  • 论文报告了 4 类关节工具上的零样本仿真到真实迁移:夹钳、钳子、晾衣夹和注射器。
  • 每类工具各选 2 个实例,完整方法在抓取、打开、关闭和使用任务上的成功率大约为每 10 次 0.6-0.8,例如夹钳抓取/打开为 0.8,钳子抓取/打开/关闭为 0.7,晾衣夹任务为 0.6-0.8。
  • 使用 GeoRT 的遥操作表现差得多,常见成功率只有 0.0-0.3;在夹钳抓取/打开/关闭上,一个实例是 0.3/0.1/0.3,另一个实例是 0.3/0.2/0.3。
  • 开环基线也更低,通常只有 0.1-0.7,注射器任务上降到 0.0-0.3。
  • 对组合式端到端工具使用任务,论文报告了 10 次中 7 次完成夹钳拾取、5 次完成钳子剪切、6 次完成晾衣夹使用、5 次完成注射器注射。
  • 消融结果显示,更多轨迹、更多抓取关键帧和更强的力/动作随机化都会提升性能,但摘录里没有给出精确的消融数值。