来源笔记

When Labels Are Scarce: A Systematic Mapping of Label-Efficient Code Vulnerability Detection

Code Vulnerability DetectionLabel Efficient LearningSystematic MappingSoftware SecurityLLM For Code

本文是一项关于代码漏洞检测中标签高效机器学习方法的系统映射研究。它围绕系统如何减少对昂贵漏洞标签的依赖,以及当前评估实践如何阻碍公平比较,来组织这一领域。

  • 代码漏洞检测需要带标签的漏洞代码,但这些标签获取成本高、噪声大,在不同项目、语言和 CWE 类型之间分布不均,而且公共数据集里的标签常常不一致。
  • 现有综述大多按模型类型或表示方式来归类工作,这留下了一个实际缺口:在标签稀缺时,很难比较可用方法、标签预算、计算成本和部署权衡。
  • 在数据划分设计、泄漏控制、标签预算定义、粒度和计算假设方面,报告不充分,使很多宣称的提升难以验证或比较。
  • 论文对标签高效的代码漏洞检测研究做了系统映射,检索范围覆盖 Google Scholar、ACM Digital Library、Scopus 和 ScienceDirect,时间跨度为 2006 年 1 月到 2025 年 9 月。
  • 研究使用明确的纳入和排除标准筛选文献,并构建了两个语料库:46 篇 Main-set 代码漏洞检测研究和 64 篇来自相邻软件工程任务的 Inspiration-set 研究。
  • 文献被分为五类范式:半监督/自监督学习、对比学习、小样本/元学习、提示调优,以及基于 LLM 的提示或参数高效适配。
  • 论文跟踪这些方法如何与四类表示方式交互:基于 token 的表示、基于图/流的表示、混合表示和基于知识的表示。
  • 论文通过 Design Map 和面向约束的 Practitioner Decision Guide 综合证据,重点关注标签预算、数据集设置、计算或运行成本、泄漏风险和失效模式。
  • 检索过程从 9,983 条记录开始,去重并经过精度导向筛选后降至 1,994 条,再缩减到 121 篇全文候选;全文审查保留了 69 篇研究,滚雪球检索又补充了 47 篇。
  • 最终数据集共 110 篇研究:46 篇 Main-set CVD 研究和 64 篇 Inspiration-set 研究。
  • 论文声称这是首个聚焦标签高效 CVD 的结构化映射,采用的是显式的标签预算视角,而不是模型家族视角。
  • 主要的具体结果是分类体系和证据综合,而不是新的检测器基准分数。摘要没有报告 F1、准确率、AUC 或相对于共同基线的提升等整体性能数字。
  • 论文指出多项研究中反复出现的比较问题:缺少预算-性能曲线,预算定义不一致,例如标注比例、K-shot 或仅正样本监督,计算报告不完整,以及数据划分或泄漏问题。
  • 论文公开了一个仓库,包含整理后的论文、提取的元数据,以及用于生成图表和表格的脚本。