---
source: arxiv
url: http://arxiv.org/abs/2604.01414v1
published_at: '2026-04-01T21:23:41'
authors:
- Jiuzhou Lei
- Chang Liu
- Yu She
- Xiao Liang
- Minghui Zheng
topics:
- robot-manipulation
- multimodal-fusion
- force-torque-sensing
- diffusion-policy
- contact-aware-control
relevance_score: 0.81
run_id: materialize-outputs
language_code: zh-CN
---

# Learning When to See and When to Feel: Adaptive Vision-Torque Fusion for Contact-Aware Manipulation

## Summary
## 总结
本文研究在使用扩散策略进行接触丰富的机器人操作时，如何把视觉信号和关节力矩信号结合起来。核心结论是：在自由运动阶段应忽略力矩，只在接触阶段通过自适应融合规则加入力矩。

## 问题
- 在视觉变化很小或场景被遮挡的任务里，纯视觉操作策略会漏掉接触状态、对齐质量、摩擦和插入进度。
- 直接把视觉和力矩信号拼接融合会降低性能，因为自由空间中的关节力矩包含噪声和惯性效应。
- 先前工作提出了辅助损失、路由和门控，但本文认为，在同一扩散策略设置下还没有清晰的逐项对比。

## 方法
- 该策略基于扩散策略骨干，输入包括两个 RGB 视角、关节位置，以及来自 Franka Research 3 机器人的 7 个关节外力矩的 10 步历史。
- 接触门控会检查是否有任一关节外力矩超过阈值。若没有接触，就用一个学习得到的默认向量替换力矩特征；若有接触，就使用真实的力矩特征。
- 模型训练两个独立的 U-Net：一个处理视觉加本体感知，另一个处理门控后的力矩加本体感知。
- 在每个扩散去噪步骤中，最终噪声预测由两个专家的学习加权结果组成。一个小型 MLP 根据图像和门控力矩特征预测力矩权重，并在没有接触时把该权重强制置零。
- 论文将该方法与纯视觉、特征拼接、单独力矩门控、辅助未来力矩预测以及 Mixture-of-Experts 融合进行了比较。

## 结果
- 在三个真实世界任务上，所提方法达到**82.0% 平均成功率**：瓶子放置**16/20**，连接器拔出**7/10**，煮蛋器盖打开**18/20**。
- 表 I 中最强的基线是**力矩门控**，平均成功率**68.0%**：**14/20**、**5/10**、**15/20**。报告的提升幅度是相对该基线高**14 个百分点**。
- 纯视觉的平均成功率为**30.0%**（**8/20**、**0/10**、**7/20**）。特征拼接也是**30.0%**（**3/20**、**0/10**、**12/20**）。辅助目标为**28.0%**（**6/20**、**1/10**、**7/20**）。MoE 为**24.0%**（**5/20**、**1/10**、**7/20**）。
- 在按重量区分的瓶子任务上，所提方法对空瓶和满瓶分别达到**9/10**和**7/10**，总计**16/20**。纯视觉对空瓶是**8/10**，对满瓶是**0/10**，说明它无法推断重量。
- 在煮蛋器盖单次尝试任务上，力矩门控的首次成功率为**20.0%**，平均任务时域步数为**110.7**；所提方法的首次成功率为**60.0%**，步数为**87.1**。
- 论文最强的定性结论是，大部分提升来自在自由运动阶段过滤力矩，而自适应指导权重在接触开始后提高了精度。

## Problem

## Approach

## Results

## Link
- [http://arxiv.org/abs/2604.01414v1](http://arxiv.org/abs/2604.01414v1)
