Coding-agent 研究正在按可运行证明、代码仓库真实性和 harness 质量来评判
本周的 coding-agent 研究里,最有说服力的结论都落在可运行证据上。基准和系统持续追问的是:代码能否构建、执行,并通过工作流检查。同一批材料也反复显示出两个限制:仓库规模任务依然经常失败,而 harness 的选择对结果的影响可以和模型本身一样大。
本周的 coding-agent 研究里,最有说服力的结论都落在可运行证据上。基准和系统持续追问的是:代码能否构建、执行,并通过工作流检查。同一批材料也反复显示出两个限制:仓库规模任务依然经常失败,而 harness 的选择对结果的影响可以和模型本身一样大。
本周的编码代理工作指向三个实际变化:把仓库搭建视为独立的可执行阶段,用按规模区分的可运行测试来评估仓库生成,并把 harness 特性纳入明确的基准控制。共同模式很清楚:可运行的证明不只取决于底座模型。环境配置、仓库规模和 flag 之间的相互作用,都会改变代理是否能完成真实的软件任务。
4 月 22 日的研究,最有力的部分出现在编码工作与真实使用、项目脚手架和直接执行检查相交的地方。SWE-chat 用保留代码和用户反对来支撑编码代理的说法。HARBOR 和 AGENTS.md 显示,harness 和文档选择能像模型选择一样改变结果。WebGen-R1 和 LLMVD.js 把同样的压力推进到网站生成和安全领域,在那里,输出是按运行中的系统来打分,而不是按润色过的文本来打分。
编码代理评估正在更接近团队能在自己仓库和流水线里核实的东西。这里最可用的方向是:一份按提交关联的评分卡,用来衡量保留代码和审查阻力;一个窄范围的 AGENTS.md 生成流程,并和最近 PR 的回放评估绑定;以及 Node.js 安全分诊,只放行那些已经执行过概念验证利用的案例。