趋势

编码代理的提升来自工程化上下文和可执行检查

日 · 2026-07-13 · Software Intelligence

当天最强的信号延续了近期对受控代理工作流的关注,同时测量证据更加充分。ACQUIRE 在编辑前回答代码仓库问题,从而改善问题解决。TerraRepair 根据 schema 和扫描器结果验证基础设施修复。FlowArk 复用有界且与代码匹配的知识,减少重复分析。共同机制是将精确上下文送达操作发生的时点,随后进行外部检查。

面向编码代理的代码仓库上下文

代码仓库理解正成为一个独立阶段,并需要单独决定检索方式和成本。ACQUIRE 在生成补丁前提出有针对性的问题,使 SWE-bench Verified 上的 Pass@1 比 Mini-SWE-Agent 提高 3.8 至 4.4 个百分点。另一项定位研究发现,按文件角色生成的摘要相比文件路径可将 Hit@5 提高最多 40%,同时所用文本量仅为原始代码的 1/10.4 至 1/20.9。FlowArk 在不同会话之间采用同样的选择性策略:只有代码锚点匹配时才注入经过验证的知识,在分析质量相近的情况下将 Android 分析成本降低 26.83%。

验证与失败复现

代理可靠性研究正在为工具输出和生成的修改增加检查。TerraRepair 查询 Terraform 依赖和已安装的提供商 schema,然后重新运行安全扫描器,再接受补丁。在 Checkov 验证的 AWS 修复中,其修复率达到 78.4%,受控的一次性基线为 26.6%;缺少部署上下文时,系统仍会升级处理。AgentCheck 提供了可重放的工具故障作为补充:代理在 120 个场景中通过了 77 至 105 个,失败通常源于自信地使用错误输出,而不是代理崩溃。一项包含 44 名开发者的研究也显示了这些控制措施的必要性:Copilot 提高了功能正确性,却没有显著改善安全 API 的使用。

可审计的上下文与记忆

代理记忆研究仍倾向于使用确定且可检查的状态。Context Warp Drive 无需再次调用模型即可折叠旧对话,保留精确标识符,并在一次生产部署中报告 92.6% 的缓存读取率;其真实工作负载证据缺少受控对比。Daftari 使用 Git 支持的 Markdown 存储记忆,包含来源信息、替代关系链接和未解决的矛盾,但没有提供正式基准。FlowArk 为选择性复用提供了更强的任务级证据:与代码匹配的有界知识在 100 美元预算内完成了 1,060 个 Android 分析任务,而不复用知识时完成了 776 个。

较新机器人学习通过预测后果和对齐控制坐标获得提升较早机器人策略的进步取决于记忆、失败经验复用和可执行的动作控制