安全审查与修复
安全工作有最清楚的实证信号。QASecClaw 先把 Semgrep 作为高召回扫描器,再让一个面向编码的 LLM 用源代码上下文判断每个候选发现。在 OWASP Benchmark v1.2 上,误报从 560 降到 64,召回率只下降 3.1%。对已经被扫描器噪声淹没的团队来说,这是一个划算的取舍。
VulKey 把同样的思路用在修复上。它不会只传入 CWE 标签,也不会只给完整示例补丁。它先预测一个修复模式,这个模式包含一个语法动作和一个安全相关的关键元素,然后把补丁生成过程建立在这个模式上。在 PrimeVul 上,它报告的修复准确率是 31.5%,比摘要里提到的最佳基线高 7.6 个百分点。这个结果支持一个实用结论:安全模型需要紧凑、任务相关的证据,而不只是漏洞名称。