来源笔记

Learning When to See and When to Feel: Adaptive Vision-Torque Fusion for Contact-Aware Manipulation

Robot ManipulationMultimodal FusionForce Torque SensingDiffusion PolicyContact Aware Control

本文研究在使用扩散策略进行接触丰富的机器人操作时,如何把视觉信号和关节力矩信号结合起来。核心结论是:在自由运动阶段应忽略力矩,只在接触阶段通过自适应融合规则加入力矩。

  • 在视觉变化很小或场景被遮挡的任务里,纯视觉操作策略会漏掉接触状态、对齐质量、摩擦和插入进度。
  • 直接把视觉和力矩信号拼接融合会降低性能,因为自由空间中的关节力矩包含噪声和惯性效应。
  • 先前工作提出了辅助损失、路由和门控,但本文认为,在同一扩散策略设置下还没有清晰的逐项对比。
  • 该策略基于扩散策略骨干,输入包括两个 RGB 视角、关节位置,以及来自 Franka Research 3 机器人的 7 个关节外力矩的 10 步历史。
  • 接触门控会检查是否有任一关节外力矩超过阈值。若没有接触,就用一个学习得到的默认向量替换力矩特征;若有接触,就使用真实的力矩特征。
  • 模型训练两个独立的 U-Net:一个处理视觉加本体感知,另一个处理门控后的力矩加本体感知。
  • 在每个扩散去噪步骤中,最终噪声预测由两个专家的学习加权结果组成。一个小型 MLP 根据图像和门控力矩特征预测力矩权重,并在没有接触时把该权重强制置零。
  • 论文将该方法与纯视觉、特征拼接、单独力矩门控、辅助未来力矩预测以及 Mixture-of-Experts 融合进行了比较。
  • 在三个真实世界任务上,所提方法达到82.0% 平均成功率:瓶子放置16/20,连接器拔出7/10,煮蛋器盖打开18/20
  • 表 I 中最强的基线是力矩门控,平均成功率68.0%14/205/1015/20。报告的提升幅度是相对该基线高14 个百分点
  • 纯视觉的平均成功率为30.0%8/200/107/20)。特征拼接也是30.0%3/200/1012/20)。辅助目标为28.0%6/201/107/20)。MoE 为24.0%5/201/107/20)。
  • 在按重量区分的瓶子任务上,所提方法对空瓶和满瓶分别达到9/107/10,总计16/20。纯视觉对空瓶是8/10,对满瓶是0/10,说明它无法推断重量。
  • 在煮蛋器盖单次尝试任务上,力矩门控的首次成功率为20.0%,平均任务时域步数为110.7;所提方法的首次成功率为60.0%,步数为87.1
  • 论文最强的定性结论是,大部分提升来自在自由运动阶段过滤力矩,而自适应指导权重在接触开始后提高了精度。