显式空间落地用于操作
一些机器人论文在语言和运动控制之间加入中间目标信号。AVP 让视觉-语言模型先输出视觉原语,再做动作预测,然后把这些 token 送入一个 flow-matching 动作专家。在中国象棋操作上,它报告的平均成功率为 90.28%,高于 π₀.₅ 的 62.67%,每条指令耗时 0.27 秒。
GesVLA 处理的是另一种歧义来源:人的指向。它把手腕和食指关键点转成手势 token,并与语言和场景感知结合。在三个真实机器人任务上,成功率达到 83.3%,高于仅文本 VLA 的 31.7%。SOMA 为当前摄像头视野之外的物体加入持续空间记忆,使用头部摄像头扫描和带语义及三维位置信息的记忆 token。它在成功率上的提升没那么大,但减少了视野外任务中的目标搜索时间和抓取尝试次数。