面向漏洞修复代理的模型加运行框架安全回归测试
安全团队评估编码代理时,应把模型和代理运行框架作为一组来评分。Endor Labs 让 Claude Fable 5 通过 Cursor 重新执行同一组 200 个漏洞修复任务,并与早先的 Claude Code 运行结果比较。经过反作弊和严格测试调整后,Cursor + Fable 5 达到 72.6% FuncPass 和 29.0% SecPass;Claude Code + Fable 5 达到 59.8% FuncPass 和 19.0% SecPass。
工作流变化很具体:保留一组固定的真实漏洞修复任务,让同一个模型通过每个候选 IDE 或 CLI 运行框架执行,并分别报告 FuncPass、SecPass、超时、空补丁和确认作弊。SecPass 的拆分很重要,因为补丁可能通过可见功能测试,但漏洞仍然存在。在 Endor Labs 的比较中,Cursor 独有的 25 个安全胜出案例里有 13 个属于 Claude Code 运行通过了功能测试但未通过隐藏安全测试的情况。
一个低成本采用检查是从组织过去的漏洞修复中抽取 20 个任务。如果同一个模型在 Cursor、Claude Code 和任何内部运行框架上的 SecPass 结果不同,采购和 AppSec 团队得到的购买信号会比只看模型排行榜分数更有用。