Control quality now depends on the action interface as much as the perception stack
机器人控制论文现在更明确地指出动作质量在哪些地方丢失,以及如何修复。最清楚的证据来自两个方向。一篇论文显示,当动作被压缩成离散 token 时,更好的视觉编码器并不一定能稳定提升 vision-language-action 策略。在 LIBERO-10 上,Diffusion Policy 在 M 规模下从 36.4% 升到 57.6%,方法是把编码器从 ResNet-18 升级到 SigLIP;OAT 则从 53.8% 升到 57.4%。另一篇论文通过把规划拆成潜变量宏动作和低层动作,提升了长时域世界模型控制。HWM 把真实 Franka 抓取放置成功率从 0% 提高到 70%,把抽屉任务从 30% 提高到 70%,同一报告里还给出了更低的规划成本说法。