来源笔记

DREA: Decoupled Reasoning and Exploration Agents for Repository-Level Vulnerability Detection

Vulnerability DetectionCode IntelligenceLLM AgentsRepository AnalysisSoftware Security

DREA 将专注于推理的 Planner 与按需收集安全相关代码上下文的轻量级 Explorer 结合起来,从而提升仓库级漏洞检测能力。在包含 100 对样本的 RepoPairBench 基准上,相比三种 LLM 骨干模型,DREA 提高了样本对级正确率,同时将大部分探索 token 转移给本地模型。

  • 仅基于函数的漏洞检测器和固定的检索规则经常遗漏跨文件数据流、对象级授权、清理逻辑以及配置细节。
  • 这是因为正确的安全判断可能依赖目标函数之外的仓库证据,而通过昂贵模型进行穷举式探索可能缺乏实用性。
  • 更强的 Planner 先提出漏洞假设,请求有针对性的仓库证据,更新假设,最后作出存在漏洞或无漏洞的判断。
  • 轻量级本地 Explorer 使用只读的 lsglobgrepread_file 工具,检索仓库上下文、代码证据和安全发现。
  • DREA 评估了来自 2021–2025 年、涵盖 48 个 CWE 类别的 100 对经验证的 Python 漏洞—修复样本,其中包含存在漏洞和已修补的仓库快照。
  • 该研究使用 GPT-4.1 作为 LLM 评审员,新增了推理正确性评估,用于区分有充分依据的真阳性和标签正确但理由不准确的预测。
  • 在 RepoPairBench 上,与 Function-Only Baseline 相比,DREA 将 DeepSeek-V3.2 的 Pair-Correctness 从 19% 提高到 42%,将 GLM-4.7 从 26% 提高到 34%,并将 GPT-5.2 从 21% 提高到 30%。
  • 对于 DeepSeek-V3.2,DREA 将召回率从 39% 提高到 80%,将 F1 从 45.6% 提高到 71.1%,并将 Youden’s J 提高 7 个百分点至 35 个百分点;其假阳性率则从 32% 上升到 45%。
  • DREA 将超过 93% 的 token 转移给本地 Explorer,并将预估的可计费 API 成本降低 16–48 倍。
  • 在所有评估系统中,26–55% 的真阳性预测属于 Lucky Hits:标签正确,但理由与已记录的漏洞机制不一致。
  • 推理评审员与两名安全研究人员的一致率分别为 96.0% 和 94.0%,Cohen’s kappa 值分别为 0.92 和 0.88;标注者间一致率为 92.0%,kappa 值为 0.84。
  • 该评估仅涵盖 100 对近期 Python 漏洞—修复样本,并使用 LLM-as-a-Judge 协议评估推理质量,因此其对其他语言、漏洞数据集以及独立人工评估的泛化能力仍不确定。