物理推理必须经受执行检验
IMBench 让推理与行动之间的鸿沟变得可测量。领先的视觉语言模型在约束理解上的得分约为 74%,但 GPT-5.5 仅完成了视觉输入任务的 11.3%,在获得特权物体状态信息时也只有 18.8%。若干对齐、工具使用、隐状态和平衡任务的完成率仍为零。
AC-VLA 针对策略层面的相关失效。它将指令分解为可复用的子任务,并在选定阶段屏蔽腕部视角,以减少轨迹记忆和视觉捷径。在 LIBERO-OOD 上,π₀.₅ 变体在 Spatial-OOD 和 Goal-OOD 上的成功率分别达到 64.2% 和 73.3%,提升了 28.7 和 26.7 个百分点。两项研究共同表明,评估和训练应关注可执行的动作重组,而不能只依赖语言能力或分布内能力。