来源笔记

Exploiting LLM Agent Supply Chains via Payload-less Skills

LLM AgentsSupply Chain SecurityCode IntelligenceAgent SkillsPrompt Injection

这篇论文表明,自然语言技能文件可以让编码代理生成并运行恶意代码,而不需要嵌入代码载荷。这一点很重要,因为当前扫描器主要捕捉可见脚本和已知威胁文本,而这种攻击把恶意逻辑转移到了代理的运行时代码生成中。

  • LLM 编码代理会加载第三方技能作为指令,然后使用本地文件、shell 命令和网络访问来完成用户任务。
  • 现有的技能扫描器主要关注显式代码、AST 模式、eval()subprocess 之类的命令,以及已知的恶意措辞。
  • 被污染的技能可以把有害行为描述成合规或遥测指导,让代理在正常任务过程中自己合成攻击代码。
  • 论文提出 Semantic Compliance Hijacking(SCH),攻击者不是放入脚本或 shell 命令,而是在技能文件里放入非结构化的自然语言规则。
  • 这些规则把恶意动作改写成例行操作,例如捕获“ambient runtime configuration properties”或采用远程“configuration”流。
  • 代理把技能文本当作任务指导,写出缺失的代码,并用其正常权限执行。
  • 评估在 3 个代理平台 OpenClaw、Claude Code 和 Codex,以及 3 个模型 GPT-5.4 mini、GLM-5 和 MiniMax-M2.7 上测试 SCH,使用了 600 个带上下文的沙箱任务。
  • Multi-Skill Automated Optimization(MS-AO)利用失败的执行轨迹重写对抗性技能文本,并提升后续攻击尝试的效果。
  • SCH 在测试配置中的平均 Complete Leakage Rates 为 36.00% 到 62.11%。
  • SCH 在测试配置中的 Remote Code Execution 成功率为 30.56% 到 64.44%。
  • 在最脆弱的设置下,报告的最高成功率是 77.67% 的机密性泄露和 67.33% 的 RCE。
  • SkillScan 和 LLM Guard 可以拦截最高 99.81% 的基线显式注入攻击,而最初的纯文本 SCH 技能检测率为 0.00%。
  • 经过 MS-AO 优化后,这些技能仍然难以捕捉,报告的最高检测率为 33.33%。
  • 论文指出,更服从指令的模型对这种语义欺骗更容易受影响,但摘要片段没有给出支持这一说法的完整逐模型表。