趋势

编码代理通过上下文、轨迹和可执行检查获得信任

周 · 2026-W18 · Software Intelligence

本周的编码代理研究设定了一条清晰标准:生成的工作需要上下文、轨迹和可执行检查,之后才值得信任。SWE-Edit、AutoMat 和 LiveFMBench 在编辑、科学复现和形式化规约中都显示了这种模式。

项目上下文和编辑接口

几项结果把代理接口也纳入被衡量的能力。Context-Augmented Code Generation 报告称,加入产品上下文检索系统 Brief 后,在一个 8 任务基准上,Claude Code 的决策遵循率从 46% 提高到 95%。这个结果有用,但论文也指出了一个工作流混杂因素:Brief 改变了可用上下文,并加入了规格说明、验收标准和构建过程中的指导。

SWE-Edit 提出的是范围更窄的系统主张。它把文件查看和补丁编写拆成两个独立子代理,让主代理保留更干净的推理上下文。在 SWE-bench Verified 上,它把解决率从 69.9% 提高到 72.0%,总推理成本降低 17.9%,编辑成功率从 93.4% 提高到 96.9%。共同的实际结论是:代理质量取决于模型能看到什么、被要求写什么,以及编辑如何被应用。

规约和科学工作的证据门槛

本周最有力的评估要求代理留下可检查的产物。AutoMat 测试 85 项计算材料科学论断的复现。测试中表现最好的代理达到 54.1% 的成功率,而仅凭论文进行复现时,各系统的成功率接近于零。薄弱点在于重建说明不足的流程,并判断输出是否支持科学论断。

LiveFMBench 把同样的约束用于 C 程序的形式化规约。它使用 630 个带 ACSL 注释的程序,并过滤掉会修改程序或断言的输出。经过这项忠实性检查后,测得的准确率下降约 20%。Claw-Eval-Live 通过记录工具轨迹、服务审计日志、命令轨迹、文件、测试和服务状态,把基于轨迹的评分扩展到工作流代理。其领先模型通过 105 个任务中的 66.7%,因此这个基准仍暴露出许多真实工作流失败。

测试和安全使用受限的模型审查

安全和测试论文给模型一个受约束的任务,再用具体信号验证输出。FeedbackLLM 把未覆盖的行和分支数据反馈到后续提示中,用于生成 C 和 Python 测试。它在多个 PALS/RERS 程序上报告了较大提升,但摘录也显示了一些较弱案例,并且没有给出总体平均覆盖率。

QASecClaw 保留 Semgrep 作为高召回扫描器,然后让面向编码的大语言模型结合源码上下文判断每个发现。在 OWASP Benchmark v1.2 上,误报从 560 降到 64,召回率下降 3.1%。VulKey 对修复采用类似的受限方法:它使用 CWE 类型、语法动作和安全专用关键元素预测修复模式,然后生成补丁。在 PrimeVul 上,它报告的修复准确率为 31.5%,比摘录中的最佳基线高 7.6 个百分点。

代理基础设施按完整任务行为衡量

本周还把编排和服务纳入代理性能的可衡量部分。SAGA 在 GPU 集群上调度整个代理工作流,而非把每次模型调用都视为独立请求。原因很具体:代理任务可能进行 10 到 100 次带工具间隔的链式调用,而请求级调度器会重新生成缓存,并抬高端到端延迟。

在 64 张 A100 GPU 上,相比带自动前缀缓存的 vLLM,SAGA 在 SWE-bench 上把任务完成时间缩短 1.73 倍,在 WebArena 上缩短 1.55 倍。代价也很明确:峰值吞吐量比面向吞吐优化的批处理低约 30%。这种核算方式符合本周更广泛的标准。代理工作按完整任务时间、已保存轨迹、可复现产物,以及用户可检查的失败模式来评判。

较新机器人 VLA 部署主张面临数据规模和控制延迟测试较早Flutter 这一周内容较少,全栈 Dart 是唯一具体信号