当软件任务给出窄证据时,LLM 更有可信度
当天最强的研究把大语言模型(LLM)当作软件工件的有限审查者来使用。QASecClaw、VulKey 和 ACDL 显示了当前重点:给模型一个具体发现、补丁模式或上下文规范,然后测量或检查结果。关于控制和轨迹的近期工作在这里也很明显。
当天最强的研究把大语言模型(LLM)当作软件工件的有限审查者来使用。QASecClaw、VulKey 和 ACDL 显示了当前重点:给模型一个具体发现、补丁模式或上下文规范,然后测量或检查结果。关于控制和轨迹的近期工作在这里也很明显。
当输入已经被限定时,LLM 采用最可信:一个扫描器告警、一个按固定清单检查的工作流文件,或者一对重构前后的代码。实际做法是加一层小型复核,并设置明确的回退规则,在接触生产门禁之前先做本地准确率检查。