Structured search for long-horizon coding
这个窗口里的编码代理进展来自把更多推理算力花在更好的中间表示上,而不只是更多采样。Scaling Test-Time Compute for Agentic Coding 会把每次 rollout 变成一段简短的结构化摘要,然后对选出的摘要做 Recursive Tournament Voting (RTV) 和 refinement。报告中的提升在完整仓库任务上很大:Claude-4.5-Opus 在 SWE-Bench Verified 上从 70.94% 升到 77.60%,在 Terminal-Bench v2.0 上从 46.95% 升到 59.09%;Claude-4.5-Sonnet 在 Terminal-Bench v2.0 上经过 16.20 个百分点的提升后达到 56.82%。SWE-TRACE 从训练侧推进同一个压力点。它构建了一个 60K 可执行语料库,加入基于 rubric 的过程奖励,并在推理时用这个 reward model 及早剪掉薄弱步骤。摘录里没有完整的 benchmark 表,所以这里更扎实的结论是机制和数据规模,而不是标题级分数。