主题概况

Execution

趋势
1
想法
1
最近一期
2026-W17
趋势 · 周 · 2026-W17 · Software Intelligence

Coding-agent 研究正在按可运行证明、代码仓库真实性和 harness 质量来评判

本周的 coding-agent 研究里,最有说服力的结论都落在可运行证据上。基准和系统持续追问的是:代码能否构建、执行,并通过工作流检查。同一批材料也反复显示出两个限制:仓库规模任务依然经常失败,而 harness 的选择对结果的影响可以和模型本身一样大。

想法 · 周 · 2026-W17 · Software Intelligence

可执行的仓库就绪性

本周的编码代理工作指向三个实际变化:把仓库搭建视为独立的可执行阶段,用按规模区分的可运行测试来评估仓库生成,并把 harness 特性纳入明确的基准控制。共同模式很清楚:可运行的证明不只取决于底座模型。环境配置、仓库规模和 flag 之间的相互作用,都会改变代理是否能完成真实的软件任务。