开源代理活动测量
最明确的实证信号来自对 1.8 亿多个 Git 仓库中 AI 编码代理的多方法普查。结果显示,只查找机器人账号会漏掉大部分活动。在 V2510 快照中,多方法扫描找到 Claude Code 的 850,157 次提交,而机器人账号查找只找到 28,154 次。V2604 快照将 1,772,677 次提交归因于代理,其中 Claude Code 占一半。相比只依赖拉取请求、机器人名称或配置文件等单一渠道痕迹,这为软件供应链研究提供了更可靠的基础。
这一时期的重点是编码代理问责:测量真实使用情况、控制工具成本,并在代码运行后检查安全性。最有力的证据来自 1.8 亿仓库普查、贝叶斯控制和 BigBag;产品项目补充了治理需求,但评估较少。
最明确的实证信号来自对 1.8 亿多个 Git 仓库中 AI 编码代理的多方法普查。结果显示,只查找机器人账号会漏掉大部分活动。在 V2510 快照中,多方法扫描找到 Claude Code 的 850,157 次提交,而机器人账号查找只找到 28,154 次。V2604 快照将 1,772,677 次提交归因于代理,其中 Claude Code 占一半。相比只依赖拉取请求、机器人名称或配置文件等单一渠道痕迹,这为软件供应链研究提供了更可靠的基础。
代理工作正被当作带有明确成本的控制问题处理。贝叶斯控制论文维护一个后验信念,用来估计候选程序能否通过验证,然后决定是运行低成本评审器、重新生成、验证,还是停止。评估覆盖六个生成器和九个编码基准。报告中的收益在验证成本高、低成本评审器信号不完全准确时最强。BigBag 将类似约束用于依赖修复:它要求代理生成可执行的 Java 抽象语法树转换,然后在受同一库更新影响的多个客户端之间复用这些转换。最佳设置在原始损坏客户端上达到 78.6% 的修复率,整体跨项目修复率为 33.3%。
语料中的安全研究要求可执行证明和可读控制。Kauge 使用 OWASP 和 CERT 原则以及漏洞利用测试,将安全编码知识、代码执行能力以及二者之间的差距分开评估。论文报告称,模型常常知道相关原则,却无法在正确的代码边界实施防护。AutoSpec 处理安全问题的另一部分。它用带标签的执行轨迹修订大型语言模型(LLM)代理的符号安全规则,然后保留能提高轨迹级得分的编辑。在代码执行和具身代理领域的 291 条轨迹上,它报告的 F1 分数为 0.98 和 0.93,并将误报最多降低 94%。Postman Passport 提供了产品侧示例:API 调用方收到凭据引用,真实密钥留在客户的保险库中,并通过带范围检查的代理解析。
多项工作将多代理系统用于研究和软件知识工作。Agon 为想法、提案、实验和论文运行可复用的生产者-评审者循环。它的证据来自运行规模:444 次循环迭代、18 个角色、覆盖 10 多个科学领域的项目,以及一个月的调度器运行。论文明确指出,主张判断仍需要人类。LLM4MTLs 提供了一个规模更小、更容易测试的软件工程案例。它在 47 个示例、四种语言和三个大型语言模型上评估生成的模型转换语言代码。少样本示例提高了四种语言的语法表现,但语义正确性取决于语言和任务。