智能体团队现在有了可测试的具体控制模式:用于过期状态故障的确定性重放、用于多文件安全缺陷的发布前源码审计,以及用于常规知识工作的会话锁定模型路由。公开证据大多来自产品或文章主张,因此更有用的做法是开展范围较窄的本地试验,并衡量误报、成本、延迟和回滚行为。

3 个想法

用于生产环境智能体过期状态事件的时间事实账本

生产环境智能体团队可以在事件响应中加入确定性重放步骤,用来处理由事实变化导致的故障。StaleTrace 描述了一个范围较窄的设计:接收智能体的工具调用和已记录的事实事件,把这些事实重放到带有效期窗口的时间事实账本中,并比较智能体使用的事实与当时有效的事实。输出包括根因、影响范围和事件报告。

第一个有用的构建可以是一个面向单个生产环境智能体的适配器,把工具调用、客户或账户状态变化以及时间戳导出为可重放日志。团队应在一小组历史事件上测试它,这些事件中,当前数据库状态掩盖了智能体在决策时看到的内容。值得复用的公开主张是确定性审计路径:不调用 LLM,不使用嵌入,并且相同输入产生相同判定。缺失的衡量项是,重放是否比团队当前的 trace 和日志审查更快发现真实的过期状态故障。

面向多文件安全缺陷的发布前源码审计

安全团队可以把智能体式静态审计作为发布门禁试用,用于普通 SAST 和在线测试经常漏掉的代码路径:授权链、功能开关控制的流程、管理路由、移动应用逻辑,以及多仓库变更。Aikido Code Audit 声称可以跨文件和模块跟踪引用,返回根因和代码证据,并生成 AutoFix 拉取请求。

一个可操作的测试是在重要版本合并前进行为期两周的审计。只把带代码证据的发现转入开发者分诊,然后衡量确认问题率、重复率、修复时间,以及与最近一次渗透测试或人工审查的重叠情况。Aikido 报告称,早期用户每个代码库发现的问题中位数约为 25 个,并声称覆盖完整渗透测试所发现问题的 70–80%,成本约为其十分之一,但摘录没有给出公开数据集或可复现协议。可把供应商数据作为开展受控发布门禁试验的理由,并在本地衡量误报和修复接受情况。

面向办公文档和电子表格任务的会话锁定模型路由测试

如果文档、邮件和电子表格助手的推理费用较高,团队可以测试一个路由器:把常规工作发送给较小模型,把困难工作发送给前沿模型,并在会话期间固定该模型。报告中的 GDPVal-AA 设置在 GPT-5.5 和 GPT-5.4 Mini 之间路由,达到 1759 ELO,而单独使用 GPT-5.5 为 1769 ELO,并把路由开销控制在每次请求 0.01 美元以下。

构建范围应较小:分类任务类型和难度,在会话开始时选择一次模型,记录成本、延迟、缓存命中率和用户修正率,并对一组最终输出样本进行盲审。会话锁定很重要,因为会话中途切换模型可能破坏提示缓存并改变输出行为。证据还显示,经领域调优的小模型可作为专门工作负载的候选,包括约 5B 活跃参数的 MAI-Code-1-Flash,它在 SWE-Bench Pro 上得分 51.2%,高于 Claude Haiku 4.5 的 35.2%,同时最多少用 60% token。