趋势

编码代理控制通过定向上下文和可执行证据提升了精确性

周 · 2026-W29 · Software Intelligence

本周进一步强化了为期三周的证据积累:编码代理的性能取决于模型周围的系统。新的信号在于精确性:系统针对已识别的知识缺口获取上下文,同时将声明绑定到变更代码、确切的源状态或领域风险。结果覆盖基准测试和原型,但广泛部署证据仍然有限。

最低充分的代码仓库上下文

两项研究都支持选择性获取上下文,而不是穷举式探索。ACQUIRE 在修复前提出针对代码仓库的问题,使 SWE-bench Verified 上的 Pass@1 最高提升 4.4 个百分点。E3 估计任务范围,从最小可行执行路径开始,仅在验证失败后扩展;在其受控基准测试中,它保持了 100% 的成功率,同时将 token 数减少了 91%。两项研究共同表明,上下文获取应作为有预算约束的干预措施,而不是默认的全仓库扫描。不过,E3 最强的数值来自模拟器,因此其效率提升仍需更广泛的验证。

感知执行框架、绑定源状态的门控

执行框架如今同时构成测量声明和安全声明的一部分。AgentCompass 发现,改变执行框架会改变基准分数和轨迹失败情况。一项供应链研究同样表明,同一个模型是否识别或安装攻击,取决于其执行框架;而确定性的安装前检查则弥补了大多数已观察到的缺口。Proof-or-Stop 增加了更严格的生命周期边界:只有在新鲜证据经过认证并绑定到当前源状态时,代理的声明才会推进。其测试阻止了虚假完成和被篡改的回执,但评估仅覆盖一个模型系列和一个自托管语料库。

面向相关失败面的验证

可执行检查正变得更聚焦,同时覆盖更完整的领域要求。DiffTestGen 将测试引向变更函数,并在 463 个拉取请求中的 78.2% 中暴露了行为差异。GapForge 针对未覆盖的编译器区域,在报告的基线之上增加了数万行覆盖代码,并发现了 12 个真实失败。Alipay-PIBench 将同样的逻辑应用于支付集成,测试端到端行为、签名和通知处理、幂等性、退款以及业务状态一致性。这些结果表明,当真正有意义的失败面是代码差异、覆盖缺口或领域不变量时,通用的通过信号并不足够。

较新预测进入控制回路,而执行仍是严峻考验较早代理控制正在融入日常工作流界面