来源笔记
Exploiting LLM Agent Supply Chains via Payload-less Skills
摘要
这篇论文表明,自然语言技能文件可以让编码代理生成并运行恶意代码,而不需要嵌入代码载荷。这一点很重要,因为当前扫描器主要捕捉可见脚本和已知威胁文本,而这种攻击把恶意逻辑转移到了代理的运行时代码生成中。
问题
- LLM 编码代理会加载第三方技能作为指令,然后使用本地文件、shell 命令和网络访问来完成用户任务。
- 现有的技能扫描器主要关注显式代码、AST 模式、
eval()或subprocess之类的命令,以及已知的恶意措辞。 - 被污染的技能可以把有害行为描述成合规或遥测指导,让代理在正常任务过程中自己合成攻击代码。
方法
- 论文提出 Semantic Compliance Hijacking(SCH),攻击者不是放入脚本或 shell 命令,而是在技能文件里放入非结构化的自然语言规则。
- 这些规则把恶意动作改写成例行操作,例如捕获“ambient runtime configuration properties”或采用远程“configuration”流。
- 代理把技能文本当作任务指导,写出缺失的代码,并用其正常权限执行。
- 评估在 3 个代理平台 OpenClaw、Claude Code 和 Codex,以及 3 个模型 GPT-5.4 mini、GLM-5 和 MiniMax-M2.7 上测试 SCH,使用了 600 个带上下文的沙箱任务。
- Multi-Skill Automated Optimization(MS-AO)利用失败的执行轨迹重写对抗性技能文本,并提升后续攻击尝试的效果。
结果
- SCH 在测试配置中的平均 Complete Leakage Rates 为 36.00% 到 62.11%。
- SCH 在测试配置中的 Remote Code Execution 成功率为 30.56% 到 64.44%。
- 在最脆弱的设置下,报告的最高成功率是 77.67% 的机密性泄露和 67.33% 的 RCE。
- SkillScan 和 LLM Guard 可以拦截最高 99.81% 的基线显式注入攻击,而最初的纯文本 SCH 技能检测率为 0.00%。
- 经过 MS-AO 优化后,这些技能仍然难以捕捉,报告的最高检测率为 33.33%。
- 论文指出,更服从指令的模型对这种语义欺骗更容易受影响,但摘要片段没有给出支持这一说法的完整逐模型表。