在编码代理重跑前先选结构化摘要
仓库规模的编码代理现在已经值得在 rollout 生成和最终补丁选择之间加一层单独的轨迹压缩。证据很具体:Scaling Test-Time Compute for Agentic Coding 用短的结构化摘要替代完整轨迹,然后用递归锦标赛投票和基于摘要的细化。在 SWE-Bench Verified 上,完整流水线把 Claude-4.5-Opus 从 70.94% 提升到 77.60%。在 Terminal-Bench v2.0 上,它把 Claude-4.5-Opus 从 46.95% 提升到 59.09%,把 Claude-4.5-Sonnet 从 40.62% 提升到 56.82%。论文还报告,使用选出的摘要做细化,可以把平均代理步数减半左右,同时提高 pass@1。
这指向一个可落地的产品改动,适合已经在同一个工单上跑多次编码代理尝试的团队:把每次运行存成紧凑的诊断和修复摘要,在排序补丁之前先排序摘要,再把最好的几份摘要喂给重置环境里的全新重试。目标用户是那些已经为并行尝试付费、又想在不单纯增加采样数的情况下提高通过率的工程组织。一个低成本验证方法是:在一组固定的内部 bug 上跑这层逻辑,用当前代理对比补丁成功率和平均步数,再看摘要质量是否足以强预测最终成功,从而证明额外编排值得做。