趋势

代理工具正在围绕证明、限定范围的记忆和可问责动作构建

日 · 2026-06-20 · Software Intelligence

这一时期最强的信号是代理的运行纪律。GlueRun-go、Vitrus 和 Callimachus 把代理工作视为需要 lease、引用、本地记忆和可审计控制路径的过程。多数主张来自工程证据、合成测试或产品指标,公开基准覆盖有限。

编码代理执行控制

GlueRun-go 让并行编码代理更容易检查。每个任务在自己的 Git worktree 中运行,持有一个 JSON lease,并写入一个状态包,覆盖拥有的文件、已更改文件、命令、测试和证据。审计器先检查该状态包和 gate 结果,系统再重试、缩小范围、升级或搁置任务。报告中的收益偏向运行层面:分离式调度让 reconcile 在数秒内返回,崩溃检测从 60 分钟的 stale-lease 窗口降到大约一个 reconcile 周期。

Codeflowmap 处理同一问题的评审侧。它通过静态分析构建 import 图和 TypeScript/JavaScript 调用图,然后让可选的大型语言模型 (LLM) 为每个文件添加关于读取、写入、配置、认证和流程的注释。这样图边仍来自确定性分析,模型输出只用于语义标注。该项目没有报告基准测试或准确率分数,因此它的价值在于它暴露出的检查工作流。

带来源和缺口的代理记忆

两个项目关注代理在工作中可以查询的记忆。Vitrus 用 Markdown 保存公司知识,构建一次性索引,并返回带来源、置信度、新鲜度和确定性缺口的答案。它的 thinkverify 命令把答案分类为 grounded、stale、contradicted 或 unsupported。该仓库报告 source-hit 至少 90%,在受控合成语料上的缺口召回率和精确率均为 100%,泄漏测试中未授权结果为零,并有 200 多项测试。

Callimachus 面向编码代理历史。它把来自 11 个来源的会话导入本地 SQLite 存储,混合关键词检索和向量检索,并通过桌面端、命令行、VS Code/Cursor 和 Model Context Protocol (MCP) 工具暴露索引。它的具体证据是覆盖范围和速度:16 个 MCP 工具、21 个命令行命令、本地 384 维嵌入,以及约 90,000 条 Claude 消息在大约 25 秒内完成索引。它没有报告检索准确率或用户研究。

低成本用户记忆的证据大多仍是合成的

FERNme 提出由用户拥有、供执行动作的代理使用的偏好记忆。它存储稀疏的按站点图,用确定性共现规则更新边权重,并为代理提示词检索一张简短的记忆卡。该设计减少每轮 LLM 调用,并给用户检查、编辑、导出和删除控制。

报告中最强的数字有明确限制。该项目报告了 88 项测试、在第 1–3 轮中的 +0.06 precision@5 冷启动增益、模拟店面中的 +16% 相对转化提升,以及在低一到两个数量级成本下达到约为 LLM 上限 80–90% 的建模质量。作者说明,主要证据使用合成数据或 LLM 编写的数据,真人试点仍未完成。

治理偏向身份、范围和明确拒绝理由

Amazon 对代理治理的立场集中在问责和权限范围上。文章认为,在高频、低信号的审查下,反复要求人类批准会降低效果。Amazon 偏好的控制模型为每个代理分配自己的身份,记录该代理及其所代表的人,并按任务风险限制权限。

同样的控制模式出现在 Vitrus 的工具边界。它的 OpenAPI 导入、搜索、验证和调用流程会在执行前检查端点名称、参数、类型、已弃用端点和权限。两个案例都把批准视为多种控制手段之一,审计身份和执行前检查承担了大部分负担。Amazon 文章没有给出基准测试或安全指标,因此该主张是一个治理设计论点,并由具体失败示例支撑。

较新智能体工作正通过学习测试、边界检查和本地收据接受评估较早代理产品宣传控制能力的速度快于公开证据