---
source: arxiv
url: http://arxiv.org/abs/2604.21331v1
published_at: '2026-04-23T06:37:22'
authors:
- Zhen Zhang
- Weinan Wang
- Hejia Sun
- Qingpeng Ding
- Xiangyu Chu
- Guoxin Fang
- K. W. Samuel Au
topics:
- dexterous-manipulation
- vision-language-action
- diffusion-policy
- fingertip-vision
- real-world-robotics
relevance_score: 0.91
run_id: materialize-outputs
language_code: zh-CN
---

# FingerViP: Learning Real-World Dexterous Manipulation with Fingertip Visual Perception

## Summary
## 摘要
FingerViP 在五指机器人手的每个指尖各装一个小相机，并训练一个扩散策略，把这些视角和第三人称相机一起用。论文面向狭窄、遮挡严重的场景中的灵巧操作，这类场景里只有腕部视角或外部视角时，接触区域常常看不见。

## 问题
- 标准的灵巧操作设置通常依赖一个腕部相机或远处的外部相机，这两种视角在杂乱或狭窄空间里都可能看丢物体和手指接触点。
- 这会影响真实环境中的灵巧任务，比如插入、按压、在遮挡后取物，以及长时程的手物交互，因为失败常常来自接触附近的局部感知不足。
- 多指手既需要场景级上下文，也需要近距离、与接触相关的观测；之前的相机布置只能提供其中一部分信息。

## 方法
- 该系统在一只 20 自由度机器人手的每个指尖安装了一个内置微型 RGB 相机，提供五个以手为中心的视角和一个第三视角相机。
- 一个全身视觉运动策略接收六张图像、26 个关节角、来自正向运动学的指尖相机位姿，以及每根手指的关节电流，然后预测 26 自由度的臂手动作。
- 这个策略是一个基于 Transformer 的扩散模型，用人类遥操作示范训练。简单说，它学会把最近的观测映射到下一段机器人关节指令，方法是对候选动作去噪。
- 图像特征来自冻结的 CLIP ViT-B/16 编码器。指尖视觉 token 加上相机位姿编码，用来把移动中的视角和机器人状态对齐；再加上手指电流编码，提供负载或打滑之类的接触线索。
- 这个策略把指尖视角用于局部接触信息，把第三视角相机用于全局场景上下文。

## 结果
- 在四个有挑战性的真实任务上，FingerViP 报告的总体成功率为 **80.8%**。
- 在**狭窄盒内按按钮**任务上，模型用 **255** 条平均长度 **7.2 秒** 的示范进行训练；在 **42** 次评估 rollout 中，FingerViP 的总体成功率达到 **73.8%**，并且根据论文结果，超过了腕部相机、第三视角、仅指尖和混合相机基线。
- 硬件和数据流程包括 **5** 个指尖相机、**1** 个第三视角相机、一个 **20 自由度** 手部，以及 **26 自由度** 的全身控制，动作预测时域为 **n=16**，执行长度为 **m=8**。
- 指尖相机以 **30 Hz**、**640×480** 分辨率运行；遥操作跟踪以 **60 Hz** 运行，机器人控制以 **100 Hz** 运行；文中报告的五个指尖相机平均延迟为 **6.7 ms**。
- 摘要列出的四个真实任务是：在狭窄盒内按按钮、从不稳定支撑上取回棒状物体、从遮挡帘后取回物体，以及长时程开柜和取物。
- 提供的摘录没有给出完整的逐任务定量表，除了 **73.8%** 的按按钮结果和 **80.8%** 的总体成功率之外，没有更多逐基线的数值比较。

## Problem

## Approach

## Results

## Link
- [http://arxiv.org/abs/2604.21331v1](http://arxiv.org/abs/2604.21331v1)
