当软件任务给出窄证据时,LLM 更有可信度
当天最强的研究把大语言模型(LLM)当作软件工件的有限审查者来使用。QASecClaw、VulKey 和 ACDL 显示了当前重点:给模型一个具体发现、补丁模式或上下文规范,然后测量或检查结果。关于控制和轨迹的近期工作在这里也很明显。
当天最强的研究把大语言模型(LLM)当作软件工件的有限审查者来使用。QASecClaw、VulKey 和 ACDL 显示了当前重点:给模型一个具体发现、补丁模式或上下文规范,然后测量或检查结果。关于控制和轨迹的近期工作在这里也很明显。
当输入已经被限定时,LLM 采用最可信:一个扫描器告警、一个按固定清单检查的工作流文件,或者一对重构前后的代码。实际做法是加一层小型复核,并设置明确的回退规则,在接触生产门禁之前先做本地准确率检查。
这一天最强的工作都在让 AI 编码更可用,方法是收窄模型可以自由发挥的范围,并增加针对真实行为运行的检查。测试生成、静态分析和运行时监控都变得更有结构。核心思路很直接:让模型提出方案,把约束、执行反馈和验证产物承担更多安全关键工作。
最清楚的近期开发布局,是给模型允许产出的内容加上硬约束,并在生成后继续保留验证。这里最具体的三个例子,是用于静态分析聊天的类型化中间层、从现有测试合成的运行时语义检查器,以及把一个可信测试扩展成场景变体并进行修复和验证的仓库测试机器人。