编码代理正按证据链和运行框架接受评判
这一时期把编码代理视为需要可审计任务来源、可执行安全证据和感知运行框架评分的产品。SWE-Future 处理基准污染;Code-Augur 把安全假设记录为断言;Cursor + Claude Fable 5 显示,同一模型在另一种代理运行框架下的得分可能差异很大。
这一时期把编码代理视为需要可审计任务来源、可执行安全证据和感知运行框架评分的产品。SWE-Future 处理基准污染;Code-Augur 把安全假设记录为断言;Cursor + Claude Fable 5 显示,同一模型在另一种代理运行框架下的得分可能差异很大。
编码代理工作正在转向几类检查:保留任务来源、区分可见正确性与隐藏安全行为,并把代理推理转化为可执行证据。这些实际改动足够小,可以放进现有评估和安全工作流中测试:让同一个模型通过多个运行框架执行,要求安全专用隐藏测试,要求审计代理写出可证伪断言,并基于截止日期前可用的仓库证据构建面向未来的任务。