AI coding agents are being judged by controls, traces, and full-task cost
当天最强的工作把 AI 编码当作受治理的工程过程来处理。AutoMat 测试科学复现性,SAGA 测量智能体的端到端延迟,RECAP 记录真实的提示到编辑轨迹。共同的要求是在信任生成代码或智能体工作流之前先拿出具体证据。
当天最强的工作把 AI 编码当作受治理的工程过程来处理。AutoMat 测试科学复现性,SAGA 测量智能体的端到端延迟,RECAP 记录真实的提示到编辑轨迹。共同的要求是在信任生成代码或智能体工作流之前先拿出具体证据。
AI 编码代理现在已经有足够的局部证据,可以支持三项具体改动:在真实开发中记录 prompt-to-edit 轨迹,用结论级复现任务测试科学代理,以及按完整任务完成时间衡量代理服务。每一项改动都指向一个常见问题:普通代码指标会把代理工作的成本藏起来。
当天最强的软件工程工作把 LLM 编码当作一个受控工程问题:构建更难的工件,把主张和证据绑定起来,并保留人工审查。ClassEval-Pro、Comet-H 和 Hot Fixing in the Wild 给出了最清楚的测量结果。
LLM 编码工作需要在紧急修复、类级评估任务和研究仓库中的公开声明上设更严的门槛。共同的压力是:模型生成或修改代码之后,谁来负责它的行为。
这一天最强的工作,是让软件代理更容易被约束、检查和评分。CodeStruct 和 SWE-Shield 把代码代理评估收紧到精确编辑和设计规则。Gym-Anything 把计算机使用测试扩展到更长的真实软件任务。安全论文给出了最难反驳的证据:生成代码常常可利用,自主攻击系统在复杂的多步设置里仍会失败。
具体变化已经出现在三个地方:仓库修复代理可以围绕命名代码实体工作,并根据小而有效的 diff 来评估;补丁评估需要在测试通过率之外加入设计约束检查;AI 编写的安全敏感代码需要一个检查可利用性的审查门,而不是只信任提示词或自动攻击循环。