来源笔记

When Child Inherits: Modeling and Exploiting Subagent Spawn in Multi-Agent Networks

Multi Agent SecurityAgent NetworkSubagent SpawningPrompt InjectionAccess Control

论文认为,子代理生成会通过继承的内存、过宽的资源访问、过时状态和薄弱的终止控制,把一个本地代理妥协扩散出去。它提出了一个形式化的基于角色的模型,以及用于更安全多代理系统的防御方法。

  • 研究的是:当多代理网络中的一个 LLM 代理因提示注入、越狱、投毒数据或恶意技能而被攻破后,会发生什么。
  • 这个风险之所以重要,是因为新生成的子代理可能继承父代理的内存、权限和指令,单个被攻破的代理会影响后续委派和下游动作。
  • 现有代理系统常在运行时创建和终止代理,人工复核有限,这让访问控制和生命周期规则更难执行。
  • 论文把基于角色的多代理网络建模为代理、父子边、角色、能力、资源、内存模式、生命周期模式和交互模式。
  • 它定义了三种内存继承模式:完全继承、部分继承和不继承父内存。
  • 它为终止范围、内存隔离和基于角色的资源访问规定了安全不变量。
  • 它用真实系统检验这个模型,主要目标是 OpenClaw,对比系统是 Hermes 和 Agent Zero。
  • 它提出了防御方法:带策略决策点和执行点的 Agent Capability Registry、按角色划分的内存投影,以及基于修订的内存同步。
  • 摘要提到 4 类漏洞:不受限制的内存继承、缺少资源访问控制、异步内存分歧,以及未授权的跨代理终止。
  • 作者说,他们针对默认 OpenClaw 部署,为每一类漏洞都构建了可运行的概念验证利用。
  • 他们报告说,又在 5 个额外的 LLM 供应商上得到了确认,这支持这样一个判断:问题来自编排层设计,而不是某一家模型提供商。
  • 研究评估了 3 个开源多代理系统:OpenClaw、Hermes 和 Agent Zero。
  • 摘要没有给出攻击成功率、延迟数据、用户研究结果或基准分数;最强的定量说法是 4 类漏洞、3 个测试系统和 5 个额外供应商确认。