---
source: arxiv
url: https://arxiv.org/abs/2607.13439v1
published_at: '2026-07-15T04:49:05'
authors:
- Mingyang Sun
- Guozhu Meng
topics:
- vulnerability-detection
- code-intelligence
- llm-agents
- repository-analysis
- software-security
- reasoning-evaluation
relevance_score: 0.86
run_id: materialize-outputs
language_code: zh-CN
---

# DREA: Decoupled Reasoning and Exploration Agents for Repository-Level Vulnerability Detection

## Summary
## 摘要
DREA 将专注于推理的 Planner 与按需收集安全相关代码上下文的轻量级 Explorer 结合起来，从而提升仓库级漏洞检测能力。在包含 100 对样本的 RepoPairBench 基准上，相比三种 LLM 骨干模型，DREA 提高了样本对级正确率，同时将大部分探索 token 转移给本地模型。

## 问题
- 仅基于函数的漏洞检测器和固定的检索规则经常遗漏跨文件数据流、对象级授权、清理逻辑以及配置细节。
- 这是因为正确的安全判断可能依赖目标函数之外的仓库证据，而通过昂贵模型进行穷举式探索可能缺乏实用性。

## 方法
- 更强的 Planner 先提出漏洞假设，请求有针对性的仓库证据，更新假设，最后作出存在漏洞或无漏洞的判断。
- 轻量级本地 Explorer 使用只读的 `ls`、`glob`、`grep` 和 `read_file` 工具，检索仓库上下文、代码证据和安全发现。
- DREA 评估了来自 2021–2025 年、涵盖 48 个 CWE 类别的 100 对经验证的 Python 漏洞—修复样本，其中包含存在漏洞和已修补的仓库快照。
- 该研究使用 GPT-4.1 作为 LLM 评审员，新增了推理正确性评估，用于区分有充分依据的真阳性和标签正确但理由不准确的预测。

## 结果
- 在 RepoPairBench 上，与 Function-Only Baseline 相比，DREA 将 DeepSeek-V3.2 的 Pair-Correctness 从 19% 提高到 42%，将 GLM-4.7 从 26% 提高到 34%，并将 GPT-5.2 从 21% 提高到 30%。
- 对于 DeepSeek-V3.2，DREA 将召回率从 39% 提高到 80%，将 F1 从 45.6% 提高到 71.1%，并将 Youden’s J 提高 7 个百分点至 35 个百分点；其假阳性率则从 32% 上升到 45%。
- DREA 将超过 93% 的 token 转移给本地 Explorer，并将预估的可计费 API 成本降低 16–48 倍。
- 在所有评估系统中，26–55% 的真阳性预测属于 Lucky Hits：标签正确，但理由与已记录的漏洞机制不一致。
- 推理评审员与两名安全研究人员的一致率分别为 96.0% 和 94.0%，Cohen’s kappa 值分别为 0.92 和 0.88；标注者间一致率为 92.0%，kappa 值为 0.84。
- 该评估仅涵盖 100 对近期 Python 漏洞—修复样本，并使用 LLM-as-a-Judge 协议评估推理质量，因此其对其他语言、漏洞数据集以及独立人工评估的泛化能力仍不确定。

## Problem

## Approach

## Results

## Link
- [https://arxiv.org/abs/2607.13439v1](https://arxiv.org/abs/2607.13439v1)
