Geometry-aware action prediction
GeoAlign 和 GeoSem-WAM 都把几何当作控制信号,而不只是感知旁路。GeoAlign 从 RGB 中提取几何特征,让机器人状态查询局部空间特征,并把紧凑的几何 token 输入动作解码器。它在 LIBERO 上报告 99.0% 的平均成功率,在 8 个真实 ALOHA 任务上达到 78.8%,在透明瓶和胶带卷插入任务上提升很大。
GeoSem-WAM 把同样的压力加到 World Action Models(WAMs)上,这类模型学习用于动作的预测性潜在状态。它在未来的 RGB、几何和语义图上训练,然后在部署时移除稠密预测头。报告的真实 Franka 成功率升到 95.4%,高于 Fast-WAM 的 88.9%;LIBERO 消融结果也显示,几何和语义监督一起使用时会带来提升。