代理产品正成为运营系统,但证据仍然有限
代理产品正被设计成受控的运营系统。OneDev 将编码工作固定在议题、拉取请求和持续集成(CI)中;Avriz 通过影子测试和流量上限控制学习型模型路由;Mango 将记忆和权限保存在用户设备上。实测证据并不均衡。最强的基准测试也只覆盖 10 个合成拉取请求,而大多数产品声明缺乏比较评估。
代理产品正被设计成受控的运营系统。OneDev 将编码工作固定在议题、拉取请求和持续集成(CI)中;Avriz 通过影子测试和流量上限控制学习型模型路由;Mango 将记忆和权限保存在用户设备上。实测证据并不均衡。最强的基准测试也只覆盖 10 个合成拉取请求,而大多数产品声明缺乏比较评估。
团队可以通过将代理工作附加到现有审查记录、在范围明确的生产工作负载上评估模型,并把记忆控制作为可观察的产品行为进行测试,更安全地采用代理。现有测量数据有限,因此每次部署都应从范围受限的试验和明确的运营指标开始。
今天的语料把代理视为运营工具,它们需要更安全的凭据、更清晰的工作界面和更严格的监督。DevFortress 提供了最强的风险证据;Iris 和 Notion 展示了产品模式:把小而有边界的工作分配给代理,同时让审查和权限保持可见。
智能体采用在权限、任务范围和评审成为工作流一部分的地方最实用。近期最清楚的变化是用于智能体执行的凭据别名、通过团队工具分配小型工程任务,以及面向同时运行多个 coding-agent 会话开发者的操作队列。
智能体团队现在有了可测试的具体控制模式:用于过期状态故障的确定性重放、用于多文件安全缺陷的发布前源码审计,以及用于常规知识工作的会话锁定模型路由。公开证据大多来自产品或文章主张,因此更有用的做法是开展范围较窄的本地试验,并衡量误报、成本、延迟和回滚行为。
当天最清楚的信号是 agent 基础设施。Autonomy Kernel、Lite-Harness 和 HermesBench 都把 agents 当成长期运行的系统,认为它们需要权限检查、持久状态、审批和可追踪评估。证据主要是设计提案和早期工具,受控测量很少。
代理部署正在进入日常运营工作:定时运行、密钥、沙箱、审批、轨迹和可重复的工作流测试。最实用的做法,是在现有编码代理外面加小型控制层、为个人代理做基于 recipe 的验收测试,以及在文件写入前保留人工审批的 ADR 草稿。