趋势

结构化上下文降低智能体成本,但更快的审查仍伴随质量风险

日 · 2026-07-14 · Software Intelligence

证据进一步支持近期的发现:编码智能体的收益取决于经过设计的上下文和可执行检查。新研究报告了更低的 token 使用量、更窄的搜索范围,以及更好的修复或规范生成结果。然而,一项大规模观察性审查研究将更快的智能体辅助决策与更多质量异味联系起来。大多数结果仍局限于特定基准或组织,因此它们支持对工作流的设计选择,而不是对已部署智能体作出广泛判断。

最小充分上下文

三个系统通过在生成前收窄证据范围来改善智能体工作。E3 估计任务范围,仅在验证失败后扩展;在 121 次受控编辑中,它保持了 100% 的成功率,同时将成本降低 85%、token 数降低 91%、检查文件数降低 92%。Harness Handbook 将请求的行为映射到源代码位置,在减少规划器 token 使用量的同时提高规划胜率。CT-Repair 将静态证据和运行时证据压缩为可查询图;其过滤器在多视角诊断前将候选方法范围缩小了 94.85%。这些结果支持选择性披露,而不是不加区分地加载长上下文,但评估仍覆盖特定代码库和基准。

验证界定安全边界

当目标行为可以被检查时,生成结果最可信。Monty 使用语法检查、模糊测试和子句级一致性过滤候选形式化规范;在一个数据集上,精确率从 75% 提高到 91.6%,在另一个数据集上从 64% 提高到 85%。面向使用场景的再生成同样只替换代码库检查所实际涉及的依赖行为。在 180 个代码库—依赖对中,它保留了 99.8% 的已观测验证行为,并将导出 API 面缩减 93.1%。后者并不能证明完全的语义等价:有 14 次尝试失败,问题尤其出现在边界情况和深层框架集成方面。

速度不能证明质量

目前,生产率提升已经覆盖实现和审查,但两者的质量信号并不一致。在一项包含 49 名开发者的受控研究中,具备设计系统感知能力的 AI 在 Angular、iOS 和 Android 上将完成时间缩短了 46.7% 至 69.4%,同时任务完整度达到 96%。相比之下,一项对 102 万个拉取请求的观察性分析发现,涉及智能体的审查通常更快,但审查异味的出现率总体上升。这些研究衡量的是不同任务和结果,但结合起来说明,吞吐量不足以作为部署指标。

较新VLA 部署工作同时针对延迟、连续性和稀缺交互数据较早机器人学习通过预测后果和对齐控制坐标获得提升