---
source: arxiv
url: https://arxiv.org/abs/2605.00471v1
published_at: '2026-05-01T07:18:11'
authors:
- Xianbo Cai
- Hideyuki Ichiwara
- Hyogo Hiruma
- Masaki Yoshikawa
- Hiroshi Ito
- Tetsuya Ogata
topics:
- mobile-manipulation
- stereo-vision
- spatial-attention
- imitation-learning
- recurrent-policy
- visual-disturbance
relevance_score: 0.72
run_id: materialize-outputs
language_code: zh-CN
---

# Stereo Multistage Spatial Attention for Real-Time Mobile Manipulation Under Visual Scale Variation and Disturbances

## Summary
## 总结
Stereo Multistage Spatial Attention 通过跟踪双目图像中与任务相关的点，并把这些点送入循环动作预测器，提升了摄像头视角变化下的真实世界移动操作表现。在四个机器人任务上，它在相同的 10 Hz 控制设置下，成功率高于 ACT、Diffusion Policy、π0 和 SmolVLA。

## 问题
- 移动操作机器人使用机载摄像头，所以当机器人移动时，物体的大小、位置和可见性都会变化。这些尺度变化会让基于视觉的动作预测变得不稳定。
- 基于规则的视觉伺服和特征跟踪需要可靠的物体模型、特征或位姿估计，而遮挡、光照变化和纹理不足都会让这些方法失效。
- 大型模仿学习和 VLA 模型需要的数据和算力，往往超过小型机载实时控制器能承受的范围。

## 方法
- 该方法接收左、右 RGB 图像以及机器人电机状态，然后预测下一步电机指令和下一步注意点位置。
- 一个双目多阶段空间注意力模块从每张图像中提取 6 个与任务相关的注意点。它使用 3 个 CNN 阶段，将每个阶段与输入图像的关键特征比较，平均注意力图，并用温度 0.001 的 soft-argmax 得到位置。
- 左右图像流之间共享权重，促使两个视角关注同一物体或机器人部件。
- 分层 LSTM 将左侧注意点、右侧注意点和机器人状态分别送入低层 LSTM，然后把它们的 cell state 合并到高层 LSTM，用于闭环运动预测。
- 训练时使用联合状态预测损失、权重为 0.1 的运动平滑项，以及双向注意点预测损失；该损失项的系数从 0.0001 提高到 0.1。

## 结果
- 在 4 个真实世界任务上，每个任务做 50 次随机试验，完整的双目 MSA 模型平均成功率为 85.0%，99% 置信区间为 77.4 到 90.4。基线分别是 ACT 46.0%、Diffusion Policy 28.5%、π0 3.5B 29.0% 和 SmolVLA 0.45B 12.5%。
- 该方法在最终任务上的成功率分别为：Place Coffee 72.0%、Open Microwave 98.0%、Take Kettle 92.0%、Retrieve Clothing 78.0%。
- 消融实验显示双目 MSA 设计很关键：双目 MSA 的平均成功率为 85.0%，双目单阶段空间注意力为 37.5%，单目 MSA 为 33.0%。
- 在 560 次视觉干扰测试中，该方法总体成功率为 76.8%，ACT 为 24.8%，ACT 加上提取的注意点为 39.6%。
- 在干扰条件下，该方法在有视觉干扰物的 Open Microwave 上达到 100.0%，在低光条件下达到 86.7%，在未见过的背景下达到 93.3%。ACT 在同样的 Open Microwave 条件下分别得分 6.7%、26.7% 和 3.3%。
- 数据集每个任务使用 54 次成功演示，15 秒序列，采样频率 10 Hz，3×128×256×2 的双目 RGB 图像，9 自由度右臂，以及 4 自由度移动底座。

## Problem

## Approach

## Results

## Link
- [https://arxiv.org/abs/2605.00471v1](https://arxiv.org/abs/2605.00471v1)
