---
source: arxiv
url: http://arxiv.org/abs/2604.16585v1
published_at: '2026-04-17T15:12:15'
authors:
- Noureddine Kermiche
topics:
- world-model
- discrete-latents
- action-conditioned-planning
- self-supervised-learning
- topological-representation
relevance_score: 0.8
run_id: materialize-outputs
language_code: zh-CN
---

# The Global Neural World Model: Spatially Grounded Discrete Topologies for Action-Conditioned Planning

## Summary
## 总结
GNWM 是一种世界模型，它把观测映射到一个离散的二维网格上，并在动作条件下预测未来的网格状态。论文声称，这种离散拓扑能减少滚动预测中的漂移，并在不做像素重建或 BYOL 风格目标网络的情况下生成可解释的状态图。

## 问题
- 连续潜变量世界模型在自回归滚动过程中会漂移：小的预测误差会累积，潜变量会变得模糊，长时程规划会失去物理结构。
- 现有用于预测式自监督学习的防塌缩方法，常常依赖额外训练机制，例如目标网络、stop-gradient 路径、对比负样本或协方差惩罚。
- 对于规划，作者希望状态空间既足够离散，能在时间上保持稳定，又能端到端通过梯度下降训练。

## 方法
- GNWM 将每个输入编码为一个二维潜在网格，然后施加固定的高斯空间卷积。这样会把激活扩散到邻近单元，让相邻状态在网格上保持接近。
- 平滑后的网格会被转成概率分布。预测器接收当前潜在状态和动作，预测下一时刻的潜在状态；目标分支则编码真实的下一观测。
- 训练使用三种损失：用于匹配预测状态和目标下一状态的相似性损失、用于避免塌缩的批次级均匀使用损失，以及推动每个状态走向稀疏近似 one-hot 激活的 peaking loss。
- 在推理时，模型可以在下一次循环步骤前把预测分布“snap”到其 argmax 网格单元。论文把这说成一种纠错步骤，用来防止长滚动中的漂移。
- 作者在四个玩具场景上测试了这个方法：被动单球视频、动作条件随机游走控制、双球分解，以及一个合成语法序列任务。

## 结果
- 在 **15x15** 网格上的被动观测使用了 **225** 个神经元中的 **173** 个，而且这些神经元形成了一个连续的有序块。论文把这当作反对 codebook 塌缩的证据。
- 在 **100 步**自回归滚动中，一个连续基线的标准差降到 **0.066**，而带网格 snapping 的 GNWM 保持在 **0.016**。摘要里没有给出该基线架构的名字，只说它是一个连续基线。
- 在带 **4 个动作**（上、下、左、右）的主动控制随机游走场景中，模型分配了 **41 个活跃神经元**，作者认为这与经验访问分布一致。
- 在包含 **40 个唯一的 32D 词向量**的抽象序列任务中，模型恰好使用了 **40 个活跃神经元**，并按语法角色聚类：名词、动词、形容词、宾语。
- 论文还声称能把两个独立移动的小球分离到两个潜在通道中，但摘要没有给出这个实验的数值结果。
- 证据主要来自小型合成环境和描述性指标。摘要没有报告标准规划基准、机器人任务、真实世界数据，也没有在常见数据集上与公认世界模型基线进行比较。

## Problem

## Approach

## Results

## Link
- [http://arxiv.org/abs/2604.16585v1](http://arxiv.org/abs/2604.16585v1)
