---
source: arxiv
url: http://arxiv.org/abs/2604.01346v2
published_at: '2026-04-01T19:57:33'
authors:
- Manoj Parmar
topics:
- world-models
- ai-safety
- adversarial-robustness
- threat-modeling
- alignment
relevance_score: 0.73
run_id: materialize-outputs
language_code: zh-CN
---

# Safety, Security, and Cognitive Risks in World Models

## Summary
## 摘要
本文梳理了世界模型中的安全、安保和人类信任风险，并补充了一个威胁模型和概念验证攻击指标。它的核心观点是，世界模型会在想象滚动中保留失效模式，因此在安全关键系统里需要更强的评估和控制。

## 问题
- 论文研究的是世界模型在机器人、驾驶和智能体 AI 中用于预测未来状态时带来的风险。
- 一点输入扰动或被污染的模型状态会在多步滚动中持续传播，这会让规划失败，而且很难发现。
- 作者还认为，带有世界模型的智能体会带来目标泛化错误、欺骗性对齐和奖励黑客等对齐风险；人类用户也可能过度信任模型预测。

## 方法
- 这篇论文主要是综述和威胁建模，不是新的世界模型训练方法。
- 它定义了 **轨迹持久性**，并用放大比 $\mathcal{A}_k$ 来比较攻击在递归世界模型内部相对单步编码器增长了多少。
- 它将 **表征风险** $\mathcal{R}(\theta,\mathcal{D})$ 定义为真实环境动力学与部署分布上学习到的动力学之间的差距，并给出集成分歧和潜在空间 OOD 分数等实际代理指标。
- 它建立了五类攻击者分类：白盒、灰盒、黑盒、内鬼和供应链，并把威胁映射到世界模型系统层和现有安全参考，例如 MITRE ATLAS 和 OWASP LLM Top 10。
- 它包含针对 GRU/RSSM 风格模型的概念验证实验，以及对 DreamerV3 的检查点探测，用来测试对抗效应是否会在滚动过程中持续存在。

## 结果
- 论文报告了一个针对 **基于 GRU 的 RSSM** 的 **轨迹持久性对抗攻击**，其中 **$\mathcal{A}_1 = 2.26\times$**，这表示第 1 步的攻击误差是单步基线的两倍多。
- 在 **对抗微调** 下，基于 GRU 的设置里报告的攻击效果下降了 **59.5%**。
- 在一个 **随机 RSSM 代理模型** 中，报告的放大倍数降到 **$\mathcal{A}_1 = 0.65\times$**，作者用这一点说明脆弱性取决于架构。
- 对于一个 **真实的 DreamerV3 检查点**，论文通过检查点级探测报告了 **非零动作漂移**，但摘要没有给出完整的端到端任务指标、基准分数或失败率数字。
- 论文提到的前置背景是既有工作，不是新的任务性能提升，包括 **DreamerV3 在 150+ 个任务上的结果** 和一个先前驾驶攻击结果，**最高攻击成功率为 67%**；这些都是背景引用，不是本文的主实验。
- 作者说明，他们的实证结果只是代理模型上的 **概念验证**；对已部署大规模系统的结论主要来自理论和文献综合，而不是完整系统测量。

## Problem

## Approach

## Results

## Link
- [http://arxiv.org/abs/2604.01346v2](http://arxiv.org/abs/2604.01346v2)
