来源笔记
The Global Neural World Model: Spatially Grounded Discrete Topologies for Action-Conditioned Planning
World ModelDiscrete LatentsAction Conditioned PlanningSelf Supervised LearningTopological Representation
摘要
GNWM 是一种世界模型,它把观测映射到一个离散的二维网格上,并在动作条件下预测未来的网格状态。论文声称,这种离散拓扑能减少滚动预测中的漂移,并在不做像素重建或 BYOL 风格目标网络的情况下生成可解释的状态图。
问题
- 连续潜变量世界模型在自回归滚动过程中会漂移:小的预测误差会累积,潜变量会变得模糊,长时程规划会失去物理结构。
- 现有用于预测式自监督学习的防塌缩方法,常常依赖额外训练机制,例如目标网络、stop-gradient 路径、对比负样本或协方差惩罚。
- 对于规划,作者希望状态空间既足够离散,能在时间上保持稳定,又能端到端通过梯度下降训练。
方法
- GNWM 将每个输入编码为一个二维潜在网格,然后施加固定的高斯空间卷积。这样会把激活扩散到邻近单元,让相邻状态在网格上保持接近。
- 平滑后的网格会被转成概率分布。预测器接收当前潜在状态和动作,预测下一时刻的潜在状态;目标分支则编码真实的下一观测。
- 训练使用三种损失:用于匹配预测状态和目标下一状态的相似性损失、用于避免塌缩的批次级均匀使用损失,以及推动每个状态走向稀疏近似 one-hot 激活的 peaking loss。
- 在推理时,模型可以在下一次循环步骤前把预测分布“snap”到其 argmax 网格单元。论文把这说成一种纠错步骤,用来防止长滚动中的漂移。
- 作者在四个玩具场景上测试了这个方法:被动单球视频、动作条件随机游走控制、双球分解,以及一个合成语法序列任务。
结果
- 在 15x15 网格上的被动观测使用了 225 个神经元中的 173 个,而且这些神经元形成了一个连续的有序块。论文把这当作反对 codebook 塌缩的证据。
- 在 100 步自回归滚动中,一个连续基线的标准差降到 0.066,而带网格 snapping 的 GNWM 保持在 0.016。摘要里没有给出该基线架构的名字,只说它是一个连续基线。
- 在带 4 个动作(上、下、左、右)的主动控制随机游走场景中,模型分配了 41 个活跃神经元,作者认为这与经验访问分布一致。
- 在包含 40 个唯一的 32D 词向量的抽象序列任务中,模型恰好使用了 40 个活跃神经元,并按语法角色聚类:名词、动词、形容词、宾语。
- 论文还声称能把两个独立移动的小球分离到两个潜在通道中,但摘要没有给出这个实验的数值结果。
- 证据主要来自小型合成环境和描述性指标。摘要没有报告标准规划基准、机器人任务、真实世界数据,也没有在常见数据集上与公认世界模型基线进行比较。