趋势

编码代理正被当作仓库协作者评测,而不只是代码生成器

日 · 2026-07-06 · Software Intelligence

当天最有力的证据把编码代理视为在真实工作流中训练、行动并失败的仓库参与者。KAT-Coder-V2.5、EvoAgentBench 和 EdgeBench 重视可执行环境、长时间运行和可复用程序;GitHub 研究则补充了维护者面临的成本。

可执行仓库训练与长期评测

仓库级编码代理需要可重建的项目、真实测试和长轨迹。KAT-Coder-V2.5 报告称,AutoBuilder 将可执行环境构建成功率从 16.5% 提升到 57.2%,并在 12 种语言中生成了超过 100,000 个可验证环境。其训练流程还会根据探索、本地化、补丁质量、验证、恢复和诚实性筛选轨迹。

长期评测也采用相同的重点。EdgeBench 在 134 个真实世界任务上评测代理,其中包括 36 个系统与软件工程任务,交互时长约 38,000 小时。报告称,12 小时学习曲线符合对数 sigmoid 形式,平均 R² = 0.998。EvoAgentBench 增加了程序迁移测试:每个测试任务都至少与一个训练任务共享一种经过验证的 Ability,但自动记忆方法带来的收益仍不稳定,且有些案例出现明显的负迁移。

开源证据揭示集成成本

面向 GitHub 的研究增加了维护者关心的指标。一项研究将 13,360 次 AI 聊天会话与 1,240 个开源仓库的历史记录关联起来。Code Writing 占会话总数的 34.7%,论文报告称,采用 AI 后,可观察到的代码质量信号或拉取请求合并率没有出现普遍下降。调查回答仍显示出社会层面的成本:开发者认为维护他人生成的 AI 代码比维护自己编写的代码更困难。

代理同时提交拉取请求会带来更明确的运维负担。在 AIDev-pop 中,40.2% 的包含代理作者拉取请求的仓库出现了精确的时间重叠,涉及 79.4% 的代理 PR。合并重放显示,同一代理的 PR 对中有 19.8% 出现文本冲突,跨代理 PR 对中则有 41.7% 出现文本冲突。一篇相关的变更分类论文显示,标注为性能改进的代理 PR 很少,在 AIDev-pop 中占比低于 1%,但其差异模式会随代理和优化目标变化。

代理内部机制和团队设计成为可测量变量

多篇论文把代理行为当作可以探测或配置的对象,而不只是最终评分的结果。Latent Programming Horizons 收集了 22,714 条修复轨迹和 2,240 万个隐藏状态向量。线性探针能够以高于随机水平的准确度解码当前正确性和部分正确性;在 Qwen3.6-35B-A3B 上,最佳 AUC 约为 0.83–0.84。未来标签信号在约 25 个步骤内保持高于随机水平。

团队结构也开始接受测量。pm4aa 原型从 GitHub 事件日志中提取特定项目的角色和约束,然后生成 LangGraph 应用。在 Commitizen 上,它将 589 名用户分配到 8 个角色,并构建了一个由 5 个代理组成的概念验证系统。另一项关于人格和情绪提示的研究发现,在不同模型中,配置文件选择会使代码生成 pass@1 改变 7.1 到 11.3 个百分点;恐惧和高责任心提示会增加修订活动和 token 使用量,但没有带来稳定的性能提升。

连接工具的代理需要更严格的数据边界

安全证据集中在工具响应内部的信任边界。关于代理数据注入的论文显示,攻击者可以在不可信内容中放入分隔符、类似 JSON 的结构、标签或伪造元数据,使大语言模型将其当作可信的代理数据来读取。这种攻击适用于网页代理,例如通过伪造 UI 标识符发起攻击;也适用于编码代理,例如通过伪造 GitHub issue 评论或虚假工具响应发起攻击。

报告的成功率已经足以影响部署决策。在 6 个模型上,针对 JSON 数据的概率分隔符注入攻击成功率达到 31.3%–43.3%,针对 DOM 样式数据的攻击成功率达到 33.3%–100.0%。面对论文引用的防御措施,指令注入成功率只有 0.0%–0.7%,代理数据注入成功率则最高达到 50.0%。作者报告了针对 Claude in Chrome、Antigravity 和 Nanobrowser 的任意点击攻击,以及针对 Claude Code、Codex 和 Gemini CLI 的远程代码执行和供应链攻击路径。

较新机器人策略正在加入明确的前瞻、几何信息与任务记忆较早机器人 VLA 进展按控制环成功来衡量