来源笔记

Safety, Security, and Cognitive Risks in World Models

本文梳理了世界模型中的安全、安保和人类信任风险,并补充了一个威胁模型和概念验证攻击指标。它的核心观点是,世界模型会在想象滚动中保留失效模式,因此在安全关键系统里需要更强的评估和控制。

  • 论文研究的是世界模型在机器人、驾驶和智能体 AI 中用于预测未来状态时带来的风险。
  • 一点输入扰动或被污染的模型状态会在多步滚动中持续传播,这会让规划失败,而且很难发现。
  • 作者还认为,带有世界模型的智能体会带来目标泛化错误、欺骗性对齐和奖励黑客等对齐风险;人类用户也可能过度信任模型预测。
  • 这篇论文主要是综述和威胁建模,不是新的世界模型训练方法。
  • 它定义了 轨迹持久性,并用放大比 𝒜k\mathcal{A}_k 来比较攻击在递归世界模型内部相对单步编码器增长了多少。
  • 它将 表征风险 (θ,𝒟)\mathcal{R}(\theta,\mathcal{D}) 定义为真实环境动力学与部署分布上学习到的动力学之间的差距,并给出集成分歧和潜在空间 OOD 分数等实际代理指标。
  • 它建立了五类攻击者分类:白盒、灰盒、黑盒、内鬼和供应链,并把威胁映射到世界模型系统层和现有安全参考,例如 MITRE ATLAS 和 OWASP LLM Top 10。
  • 它包含针对 GRU/RSSM 风格模型的概念验证实验,以及对 DreamerV3 的检查点探测,用来测试对抗效应是否会在滚动过程中持续存在。
  • 论文报告了一个针对 基于 GRU 的 RSSM轨迹持久性对抗攻击,其中 𝒜1=2.26×\mathcal{A}_1 = 2.26\times,这表示第 1 步的攻击误差是单步基线的两倍多。
  • 对抗微调 下,基于 GRU 的设置里报告的攻击效果下降了 59.5%
  • 在一个 随机 RSSM 代理模型 中,报告的放大倍数降到 𝒜1=0.65×\mathcal{A}_1 = 0.65\times,作者用这一点说明脆弱性取决于架构。
  • 对于一个 真实的 DreamerV3 检查点,论文通过检查点级探测报告了 非零动作漂移,但摘要没有给出完整的端到端任务指标、基准分数或失败率数字。
  • 论文提到的前置背景是既有工作,不是新的任务性能提升,包括 DreamerV3 在 150+ 个任务上的结果 和一个先前驾驶攻击结果,最高攻击成功率为 67%;这些都是背景引用,不是本文的主实验。
  • 作者说明,他们的实证结果只是代理模型上的 概念验证;对已部署大规模系统的结论主要来自理论和文献综合,而不是完整系统测量。