来源笔记

Stereo Multistage Spatial Attention for Real-Time Mobile Manipulation Under Visual Scale Variation and Disturbances

Mobile ManipulationStereo VisionSpatial AttentionImitation LearningRecurrent Policy

Stereo Multistage Spatial Attention 通过跟踪双目图像中与任务相关的点,并把这些点送入循环动作预测器,提升了摄像头视角变化下的真实世界移动操作表现。在四个机器人任务上,它在相同的 10 Hz 控制设置下,成功率高于 ACT、Diffusion Policy、π0 和 SmolVLA。

  • 移动操作机器人使用机载摄像头,所以当机器人移动时,物体的大小、位置和可见性都会变化。这些尺度变化会让基于视觉的动作预测变得不稳定。
  • 基于规则的视觉伺服和特征跟踪需要可靠的物体模型、特征或位姿估计,而遮挡、光照变化和纹理不足都会让这些方法失效。
  • 大型模仿学习和 VLA 模型需要的数据和算力,往往超过小型机载实时控制器能承受的范围。
  • 该方法接收左、右 RGB 图像以及机器人电机状态,然后预测下一步电机指令和下一步注意点位置。
  • 一个双目多阶段空间注意力模块从每张图像中提取 6 个与任务相关的注意点。它使用 3 个 CNN 阶段,将每个阶段与输入图像的关键特征比较,平均注意力图,并用温度 0.001 的 soft-argmax 得到位置。
  • 左右图像流之间共享权重,促使两个视角关注同一物体或机器人部件。
  • 分层 LSTM 将左侧注意点、右侧注意点和机器人状态分别送入低层 LSTM,然后把它们的 cell state 合并到高层 LSTM,用于闭环运动预测。
  • 训练时使用联合状态预测损失、权重为 0.1 的运动平滑项,以及双向注意点预测损失;该损失项的系数从 0.0001 提高到 0.1。
  • 在 4 个真实世界任务上,每个任务做 50 次随机试验,完整的双目 MSA 模型平均成功率为 85.0%,99% 置信区间为 77.4 到 90.4。基线分别是 ACT 46.0%、Diffusion Policy 28.5%、π0 3.5B 29.0% 和 SmolVLA 0.45B 12.5%。
  • 该方法在最终任务上的成功率分别为:Place Coffee 72.0%、Open Microwave 98.0%、Take Kettle 92.0%、Retrieve Clothing 78.0%。
  • 消融实验显示双目 MSA 设计很关键:双目 MSA 的平均成功率为 85.0%,双目单阶段空间注意力为 37.5%,单目 MSA 为 33.0%。
  • 在 560 次视觉干扰测试中,该方法总体成功率为 76.8%,ACT 为 24.8%,ACT 加上提取的注意点为 39.6%。
  • 在干扰条件下,该方法在有视觉干扰物的 Open Microwave 上达到 100.0%,在低光条件下达到 86.7%,在未见过的背景下达到 93.3%。ACT 在同样的 Open Microwave 条件下分别得分 6.7%、26.7% 和 3.3%。
  • 数据集每个任务使用 54 次成功演示,15 秒序列,采样频率 10 Hz,3×128×256×2 的双目 RGB 图像,9 自由度右臂,以及 4 自由度移动底座。