显式目标标记支撑零样本机器人放置
这一时期最清楚的结果是:机器人放置被写成了一个带显式目标状态的精确对齐问题。AnySlot 先把自然语言指令变成可见的目标标记,再让带目标条件的 Vision-Language-Action 策略负责执行。论文把这个设计和 SlotBench 结合起来,这是一个严格的槽位放置基准,并在零样本设置下报告了接近 90% 的平均成功率。
这一时期最清楚的结果是:机器人放置被写成了一个带显式目标状态的精确对齐问题。AnySlot 先把自然语言指令变成可见的目标标记,再让带目标条件的 Vision-Language-Action 策略负责执行。论文把这个设计和 SlotBench 结合起来,这是一个严格的槽位放置基准,并在零样本设置下报告了接近 90% 的平均成功率。
这里最清楚的变化是操作层面的:槽位级放置已经有了具体做法,也有了更严格的测试方式。论文支持三个近期动作:在密集放置任务前加一个显式目标叠加阶段;用更窄的容差和会迫使模型真正选槽位的指令类别来评估;当槽位几何本身很重要时,不要把单点目标当成足够的表示。