结构化上下文降低智能体成本,但更快的审查仍伴随质量风险
证据进一步支持近期的发现:编码智能体的收益取决于经过设计的上下文和可执行检查。新研究报告了更低的 token 使用量、更窄的搜索范围,以及更好的修复或规范生成结果。然而,一项大规模观察性审查研究将更快的智能体辅助决策与更多质量异味联系起来。大多数结果仍局限于特定基准或组织,因此它们支持对工作流的设计选择,而不是对已部署智能体作出广泛判断。
证据进一步支持近期的发现:编码智能体的收益取决于经过设计的上下文和可执行检查。新研究报告了更低的 token 使用量、更窄的搜索范围,以及更好的修复或规范生成结果。然而,一项大规模观察性审查研究将更快的智能体辅助决策与更多质量异味联系起来。大多数结果仍局限于特定基准或组织,因此它们支持对工作流的设计选择,而不是对已部署智能体作出广泛判断。
编码智能体工作流应将验证预算用于证据不完整的地方:向审查者公开行为和状态转换,使用现有测试套件之外的反例测试依赖替代实现,并要求多个智能体检查同一修复时提供彼此不同的诊断证据。
本周,编码智能体的进展取决于大语言模型(LLM)周围的控制层,包括可执行 harness、运行时检查和仓库工作流。TTHE 在模型权重冻结的情况下取得了较大提升,长时域评测则暴露出严重的任务完成限制。产品设计采用了类似的控制措施,但对比证据仍然有限。
编码代理团队可以通过要求提供可执行的缺陷复现、针对保留任务测试控制程序修改,并利用实时覆盖率信号监督测试生成,来改进仓库工作。每项改动都可以在固定模型上试点,并与当前流程进行衡量。
最有说服力的工作把上下文处理当作工程控制。qMLX 在一台 Mac Studio 上减少了长上下文的重复预填充,ContextOps 则在推理前检查输入载荷的结构。AgentTransfer 将同样的操作纪律用于文件交换。现有证据支持可检查的组件,但多个项目仍缺少独立基准测试。
代理团队可以在三个具体边界提高可靠性:跨轮次保留可复用的推理状态,在每次模型调用前检查组装好的上下文,以及验证代理之间传递的文件。每项改动都可以先从本地回归测试开始,再扩大部署范围。