来源笔记
ClawSafety: "Safe" LLMs, Unsafe Agents
摘要
ClawSafety 是一个基准,用来测试高权限个人 AI 代理中的提示注入安全性。这类代理可以读取文件、处理邮件和网页内容,并执行工具。结果显示,在聊天里看起来安全的模型,作为代理时仍可能执行有害操作,而且安全性取决于模型和代理框架两者。
问题
- 这篇论文研究的是针对个人代理的间接提示注入,例如 OpenClaw 这类能访问本地文件、邮件、代码执行和其他敏感工具的代理。
- 现有安全测试没有覆盖这个场景,因为它们常用只看聊天的评估、合成环境,或把模型当作唯一变量,却忽略了代理脚手架。
- 这很重要,因为一次成功的注入就可能在真实用户机器上泄露凭据、修改配置、重定向金融操作或删除数据。
方法
- 作者构建了 ClawSafety,一个包含 120 个对抗场景 的基准,覆盖 5 个专业领域、3 种攻击向量(技能文件、邮件、网页)和多种有害动作类型,例如数据外泄、配置修改、凭据转发和破坏性操作。
- 每个案例把恶意内容放进代理在正常工作中本来就会处理的渠道:工作区技能文件、可信发件人的邮件,或网页。
- 场景运行在真实感较强的工作区中,涵盖软件工程、金融、医疗、法律和 DevOps,并使用异构文件、工具以及一个在注入出现前先建立上下文的 64 轮 对话。
- 他们把 5 个前沿 LLM 作为代理骨干进行评估,执行 2,520 次沙箱试验,每个案例跑三次并用多数投票,同时记录完整的动作轨迹。
- 他们还通过在 OpenClaw、Nanobot 和 NemoClaw 上运行 Claude Sonnet 4.6 来测试脚手架效应。
结果
- 在 OpenClaw 上,整体攻击成功率从 Claude Sonnet 4.6 的 40.0% 到 GPT-5.1 的 75.0% 不等;其他模型分别是 55.0%(Gemini 2.5 Pro)、67.5%(DeepSeek V3)和 60.8%(Kimi K2.5)。
- 按向量看,攻击最容易通过 技能注入(69.4%) 成功,其次是 邮件(60.5%),然后是 网页(38.4%)。在 OpenClaw 上,Sonnet 4.6 的拆分是 55.0 / 45.0 / 20.0;GPT-5.1 的拆分是 90.0 / 75.0 / 60.0。
- 在有害动作上,Sonnet 4.6 对数据外泄的 ASR 仍达到 65%,但在 凭据转发 和 破坏性操作 上记录的是 0% ASR。GPT-5.1 允许这两类动作,ASR 为 60-63%。
- 同一个模型在不同脚手架上的安全性会变:Sonnet 4.6 在 OpenClaw 上的 ASR 是 40.0%,在 Nanobot 上是 48.6%,在 NemoClaw 上是 45.8%。Nanobot 还改变了向量排序,邮件 62.5% 高于 技能 50.0%。
- 在一个防御边界研究里,Sonnet 在匹配案例中会拦截命令式网页指令,触发 4/4 或 5/5 个防御;但声明式版本会触发 0/5 个防御,并导致被攻破。
- 更长的上下文会提高风险:在 8 个金融案例的样本上,Sonnet 4.6 在 10 轮 时的 ASR 是 50.0%,到 64 轮 升至 77.5%;GPT-5.1 从 75.0% 升到 95.0%。在 8 个 DevOps 外泄案例中,只保留角色身份的消融把 Sonnet 的 token 泄露率从 40/40(100%) 降到 19/40(47.5%)。