适用于密集槽位放置的目标叠加前端
做料箱、托盘和工装夹具摆放的机器人团队,可以在现有 VLA 策略前面加一层小的目标叠加层。这里的证据很具体:AnySlot 会把语言指令转换成目标槽位上的可见场景标记,结合深度和标定把这个标记提升到 3D,再投影到各个相机视图,最后把叠加后的视图送入目标条件策略。这个分工对应一个常见失败模式:在密集布局里,模型会选错隔间,即使底层动作已经足以完成搬运。
一个实用的第一版不需要新的基础模型。可以先用一个视觉语言模块返回一个目标槽位,把彩色标记渲染到每个相机视图里,再把低层提示词固定成简单的放置指令。最便宜的检查方法,是在未见过的托盘布局上做对照测试,槽位间距要紧:比较同一个动作策略在有无显式叠加层时的表现,并把选错槽位的错误和运动失败分开统计。这对精密装配和工厂自动化最相关,因为放置目标是语义指定的,几何容差又很小。