Coding-agent 研究正在按可运行证明、代码仓库真实性和 harness 质量来评判
本周的 coding-agent 研究里,最有说服力的结论都落在可运行证据上。基准和系统持续追问的是:代码能否构建、执行,并通过工作流检查。同一批材料也反复显示出两个限制:仓库规模任务依然经常失败,而 harness 的选择对结果的影响可以和模型本身一样大。
本周的 coding-agent 研究里,最有说服力的结论都落在可运行证据上。基准和系统持续追问的是:代码能否构建、执行,并通过工作流检查。同一批材料也反复显示出两个限制:仓库规模任务依然经常失败,而 harness 的选择对结果的影响可以和模型本身一样大。
本周的编码代理工作指向三个实际变化:把仓库搭建视为独立的可执行阶段,用按规模区分的可运行测试来评估仓库生成,并把 harness 特性纳入明确的基准控制。共同模式很清楚:可运行的证明不只取决于底座模型。环境配置、仓库规模和 flag 之间的相互作用,都会改变代理是否能完成真实的软件任务。
这一时期最强的工作收紧了生成与可执行证据之间的联系。KISS Sorcar、AgentEval 和 ClawMark 都按系统能完成什么、能追踪什么、能在真实工作流中承受什么来评分。SeGa 和 Optimas 把同样的思路扩展到基于需求的测试和基于性能分析器的优化,并在真实漏洞和测得的加速上取得了具体收益。
可执行证据正在进入日常工程流程。这里最清楚的切口是:agent CI 直接指向失败步骤、基于需求的业务逻辑测试生成,以及用执行结果验证每次修改的 profiler 引导 GPU 优化循环。
4 月 25 日的编码研究,最强的地方在于主张能碰到可执行证据。Simulating and Evaluating Agentic Systems 和 CUJBench 都坚持用完整运行、工具轨迹、状态变化和可复现产物来评判代理。仓库工作仍然很难:RAT 改善了配置,但真实提交研究还是显示生成之后会出现编译、分析和测试失败。
可执行证据正在成为代理评估和编程工作流的实际标准。近期最清晰的落地方向有三个:一个可回放的评估器,用真实状态和工具轨迹来检查;一个仓库接入层,在补丁生成前证明环境能跑起来;以及一个在没有测试用例时使用教师样例的科学编程流程。
今天的编码研究最强的部分是对实际限制的说明。RealBench 显示 repo 级生成在完整项目上仍然会失效,token 成本研究显示 agentic coding 可能比聊天式帮助贵得多。最可信的改进来自更紧的结构:验证器反馈、自适应检索,以及围绕数据库访问的明确防护。
最清楚的短期变化都在执行层面。编码代理产品需要在运行中有明确的 token 控制,仓库规模生成在项目变大后需要按依赖顺序工作流,而维护团队可以为把需求链接到代码、并带上更小上下文和可见证据的追踪层找到理由。
这一天最强的工作都在让 AI 编码更可用,方法是收窄模型可以自由发挥的范围,并增加针对真实行为运行的检查。测试生成、静态分析和运行时监控都变得更有结构。核心思路很直接:让模型提出方案,把约束、执行反馈和验证产物承担更多安全关键工作。
最清楚的近期开发布局,是给模型允许产出的内容加上硬约束,并在生成后继续保留验证。这里最具体的三个例子,是用于静态分析聊天的类型化中间层、从现有测试合成的运行时语义检查器,以及把一个可信测试扩展成场景变体并进行修复和验证的仓库测试机器人。
4 月 22 日的研究,最有力的部分出现在编码工作与真实使用、项目脚手架和直接执行检查相交的地方。SWE-chat 用保留代码和用户反对来支撑编码代理的说法。HARBOR 和 AGENTS.md 显示,harness 和文档选择能像模型选择一样改变结果。WebGen-R1 和 LLMVD.js 把同样的压力推进到网站生成和安全领域,在那里,输出是按运行中的系统来打分,而不是按润色过的文本来打分。
编码代理评估正在更接近团队能在自己仓库和流水线里核实的东西。这里最可用的方向是:一份按提交关联的评分卡,用来衡量保留代码和审查阻力;一个窄范围的 AGENTS.md 生成流程,并和最近 PR 的回放评估绑定;以及 Node.js 安全分诊,只放行那些已经执行过概念验证利用的案例。