面向组合式操作的约束感知腕部相机遮挡
VLA 训练团队应将仅依据夹爪状态的腕部相机遮挡,改为同时考虑当前子任务及其物理约束的门控机制。AC-VLA 在夹爪闭合阶段进行遮挡,以抑制视觉捷径,并促成 LIBERO-OOD 上的大幅提升;但 IMBench 表明,即使模型能够识别约束,对齐、工具使用、隐藏状态、时序和平衡仍是执行瓶颈。这些操作在夹爪闭合后可能需要近距离或力敏感观测,因此单一遮挡规则可能会以传感器信息缺失为代价,换取对轨迹记忆的抑制。
具体做法是为 AC-VLA 自动分割的子任务附加约束标签:在第三人称视角的几何信息足够的搬运阶段抑制腕部视角,但在接触、对齐、工具、隐藏状态和稳定性阶段保留该视角。首先可以在留出的 LIBERO-OOD 和 IMBench 回合中,按阶段进行推理时遮挡消融;如果移除腕部视角对这些约束类别的损害明显更大,训练门控就应依据约束类型,而不只是夹爪状态进行条件控制。