趋势

代理产品正成为运营系统,但证据仍然有限

日 · 2026-07-12 · Software Intelligence

代理产品正被设计成受控的运营系统。OneDev 将编码工作固定在议题、拉取请求和持续集成(CI)中;Avriz 通过影子测试和流量上限控制学习型模型路由;Mango 将记忆和权限保存在用户设备上。实测证据并不均衡。最强的基准测试也只覆盖 10 个合成拉取请求,而大多数产品声明缺乏比较评估。

受监督的编码工作流

OneDev 将代理置于现有的软件流程中:议题保存需求,隔离工作区承载执行过程,关联的拉取请求记录评审和 CI 结果。这种设计让代理的工作可检查,也能在构建失败后触发修改。文章没有提供实测评估。

代码生成速度提高后,人工评审负担也会增加。一篇为期三个月的第一人称记录称,原型可在数小时内完成,但开发者仍需持续做架构决策,承受 mental fatigue,并且难以还原生成代码为何采用特定形式。这些报告共同表明,评审能力和决策节奏会限制编码代理的处理能力。

成本感知的模型选择

模型选择正逐渐成为针对具体工作负载的运行决策。Dam Secure 在 10 个合成拉取请求上测试了 10 个模型,这些请求中植入了访问控制缺陷,并对每个模型重复测试 5 次。GPT-5.6 Sol 的召回率为 100%,F1 为 0.91,每个拉取请求的成本为 $0.70。Grok 4.5 的 F1 为 0.77,成本为 $0.20;Gemini 3.1 Flash Lite 的 F1 为 0.75,成本约为 $0.04。数据集规模小且为私有数据,限制了更广泛的结论,尤其是对完整代码扫描的结论。

Avriz 在实时使用编码代理时处理同一成本问题。它的上下文赌博机使用 11 个不含内容的特征和从计费数据得到的奖励,在 5 个模型层级之间进行选择。学习得到的路由在通过覆盖率门槛前保持影子模式,之后也只能在模型层级上限下获得受限的流量比例。报告提供了实现细节,但没有报告总体节省或质量提升。

代理记忆与用户控制

持久化上下文正被视为一种带有明确所有权规则的数据。Mango 提议采用本地执行、纯文本记忆、可替换模型,以及由客户端确定性控制的权限,用于跨已登录服务执行操作。xysq 面向使用团队的隔离保险库,这些保险库从 Slack、Drive、Notion 和其他工具收集上下文;访问需要获得同意,并支持加密、导出和删除。

这些设计说明了记忆存储在哪里,以及谁有权批准使用记忆。它们的证据来自架构说明和产品宣传。Mango 没有受控安全审计,xysq 也没有提供部署指标、检索评估或对其隐私声明的独立验证。

较新可执行控制与验证正在决定编码智能体的上限较早代理可靠性取决于上下文处理和可验证的交接