来源笔记
FingerViP: Learning Real-World Dexterous Manipulation with Fingertip Visual Perception
摘要
FingerViP 在五指机器人手的每个指尖各装一个小相机,并训练一个扩散策略,把这些视角和第三人称相机一起用。论文面向狭窄、遮挡严重的场景中的灵巧操作,这类场景里只有腕部视角或外部视角时,接触区域常常看不见。
问题
- 标准的灵巧操作设置通常依赖一个腕部相机或远处的外部相机,这两种视角在杂乱或狭窄空间里都可能看丢物体和手指接触点。
- 这会影响真实环境中的灵巧任务,比如插入、按压、在遮挡后取物,以及长时程的手物交互,因为失败常常来自接触附近的局部感知不足。
- 多指手既需要场景级上下文,也需要近距离、与接触相关的观测;之前的相机布置只能提供其中一部分信息。
方法
- 该系统在一只 20 自由度机器人手的每个指尖安装了一个内置微型 RGB 相机,提供五个以手为中心的视角和一个第三视角相机。
- 一个全身视觉运动策略接收六张图像、26 个关节角、来自正向运动学的指尖相机位姿,以及每根手指的关节电流,然后预测 26 自由度的臂手动作。
- 这个策略是一个基于 Transformer 的扩散模型,用人类遥操作示范训练。简单说,它学会把最近的观测映射到下一段机器人关节指令,方法是对候选动作去噪。
- 图像特征来自冻结的 CLIP ViT-B/16 编码器。指尖视觉 token 加上相机位姿编码,用来把移动中的视角和机器人状态对齐;再加上手指电流编码,提供负载或打滑之类的接触线索。
- 这个策略把指尖视角用于局部接触信息,把第三视角相机用于全局场景上下文。
结果
- 在四个有挑战性的真实任务上,FingerViP 报告的总体成功率为 80.8%。
- 在狭窄盒内按按钮任务上,模型用 255 条平均长度 7.2 秒 的示范进行训练;在 42 次评估 rollout 中,FingerViP 的总体成功率达到 73.8%,并且根据论文结果,超过了腕部相机、第三视角、仅指尖和混合相机基线。
- 硬件和数据流程包括 5 个指尖相机、1 个第三视角相机、一个 20 自由度 手部,以及 26 自由度 的全身控制,动作预测时域为 n=16,执行长度为 m=8。
- 指尖相机以 30 Hz、640×480 分辨率运行;遥操作跟踪以 60 Hz 运行,机器人控制以 100 Hz 运行;文中报告的五个指尖相机平均延迟为 6.7 ms。
- 摘要列出的四个真实任务是:在狭窄盒内按按钮、从不稳定支撑上取回棒状物体、从遮挡帘后取回物体,以及长时程开柜和取物。
- 提供的摘录没有给出完整的逐任务定量表,除了 73.8% 的按按钮结果和 80.8% 的总体成功率之外,没有更多逐基线的数值比较。