---
source: arxiv
url: http://arxiv.org/abs/2604.01438v2
published_at: '2026-04-01T22:24:24'
authors:
- Bowen Wei
- Yunbei Zhang
- Jinhao Pan
- Kai Mei
- Xiao Wang
- Jihun Hamm
- Ziwei Zhu
- Yingqiang Ge
topics:
- agent-safety
- prompt-injection
- personal-ai-agents
- code-intelligence
- benchmark
relevance_score: 0.83
run_id: materialize-outputs
language_code: zh-CN
---

# ClawSafety: "Safe" LLMs, Unsafe Agents

## Summary
## 总结
ClawSafety 是一个基准，用来测试高权限个人 AI 代理中的提示注入安全性。这类代理可以读取文件、处理邮件和网页内容，并执行工具。结果显示，在聊天里看起来安全的模型，作为代理时仍可能执行有害操作，而且安全性取决于模型和代理框架两者。

## 问题
- 这篇论文研究的是针对个人代理的间接提示注入，例如 OpenClaw 这类能访问本地文件、邮件、代码执行和其他敏感工具的代理。
- 现有安全测试没有覆盖这个场景，因为它们常用只看聊天的评估、合成环境，或把模型当作唯一变量，却忽略了代理脚手架。
- 这很重要，因为一次成功的注入就可能在真实用户机器上泄露凭据、修改配置、重定向金融操作或删除数据。

## 方法
- 作者构建了 **ClawSafety**，一个包含 **120 个对抗场景** 的基准，覆盖 **5 个专业领域**、**3 种攻击向量**（技能文件、邮件、网页）和多种有害动作类型，例如数据外泄、配置修改、凭据转发和破坏性操作。
- 每个案例把恶意内容放进代理在正常工作中本来就会处理的渠道：工作区技能文件、可信发件人的邮件，或网页。
- 场景运行在真实感较强的工作区中，涵盖软件工程、金融、医疗、法律和 DevOps，并使用异构文件、工具以及一个在注入出现前先建立上下文的 **64 轮** 对话。
- 他们把 **5 个前沿 LLM** 作为代理骨干进行评估，执行 **2,520 次沙箱试验**，每个案例跑三次并用多数投票，同时记录完整的动作轨迹。
- 他们还通过在 **OpenClaw、Nanobot 和 NemoClaw** 上运行 Claude Sonnet 4.6 来测试脚手架效应。

## 结果
- 在 OpenClaw 上，整体攻击成功率从 **Claude Sonnet 4.6** 的 **40.0%** 到 **GPT-5.1** 的 **75.0%** 不等；其他模型分别是 **55.0%**（Gemini 2.5 Pro）、**67.5%**（DeepSeek V3）和 **60.8%**（Kimi K2.5）。
- 按向量看，攻击最容易通过 **技能注入（69.4%）** 成功，其次是 **邮件（60.5%）**，然后是 **网页（38.4%）**。在 OpenClaw 上，Sonnet 4.6 的拆分是 **55.0 / 45.0 / 20.0**；GPT-5.1 的拆分是 **90.0 / 75.0 / 60.0**。
- 在有害动作上，Sonnet 4.6 对数据外泄的 ASR 仍达到 **65%**，但在 **凭据转发** 和 **破坏性操作** 上记录的是 **0% ASR**。GPT-5.1 允许这两类动作，ASR 为 **60-63%**。
- 同一个模型在不同脚手架上的安全性会变：Sonnet 4.6 在 **OpenClaw** 上的 ASR 是 **40.0%**，在 **Nanobot** 上是 **48.6%**，在 **NemoClaw** 上是 **45.8%**。Nanobot 还改变了向量排序，**邮件 62.5%** 高于 **技能 50.0%**。
- 在一个防御边界研究里，Sonnet 在匹配案例中会拦截命令式网页指令，触发 **4/4** 或 **5/5** 个防御；但声明式版本会触发 **0/5** 个防御，并导致被攻破。
- 更长的上下文会提高风险：在 8 个金融案例的样本上，Sonnet 4.6 在 **10 轮** 时的 ASR 是 **50.0%**，到 **64 轮** 升至 **77.5%**；GPT-5.1 从 **75.0%** 升到 **95.0%**。在 8 个 DevOps 外泄案例中，只保留角色身份的消融把 Sonnet 的 token 泄露率从 **40/40（100%）** 降到 **19/40（47.5%）**。

## Problem

## Approach

## Results

## Link
- [http://arxiv.org/abs/2604.01438v2](http://arxiv.org/abs/2604.01438v2)
