用于透明物体和插入任务的几何条件动作解码
做精细操作的机器人策略团队应该给动作解码器加上一条几何路径,并在语义识别已经不错但控制会失败的任务上测试它:透明瓶、环形零件、紧配合插入、稳定释放,以及依赖接触的对齐。
GeoAlign 给出了一种具体实现方式。它先在机器人 RGB-D 数据上对 Depth Anything V2-Small 分支做后训练,在执行时丢弃深度头,改用从 RGB 提取的几何特征。机器人状态会生成查询槽,从特征网格里选出局部几何信息,然后用这些紧凑的几何 token 作为条件输入给 flow-matching 动作解码器。这样,执行时只需要 RGB、语言和本体感觉输入,但动作头仍然能拿到局部形状线索。
可行的低成本验证方式是挑一组几何敏感物体任务。GeoAlign 在 8 个真实 ALOHA 任务上的平均成功率是 78.8%,同样设置下 RGB-only 基线是 65.0%;透明瓶成功率从 35.0% 提高到 75.0%,胶带卷插入从 40.0% 提高到 65.0%。GeoSem-WAM 在世界动作模型上也给出同样方向的结果:训练时使用未来几何和语义监督,部署时去掉稠密头,真实 Franka 成功率从 Fast-WAM 的 88.9% 提高到 95.4%。