趋势

编码 agent 正在按控制、记忆和成本来衡量

周 · 2026-W24 · Software Intelligence

本周的大语言模型 (LLM) 编码工作把自主性当作运维问题处理。Claw-SWE-Bench、Trace 和 PROJECTMEM 显示了重点:公平比较 agent harness,在运行时执行用户规则,并在跨会话中保留项目状态。

运行时执行和动作限制

Agent 控制进入了执行循环。Trace 将用户纠正编译成带有适用性检查和验证器的规则,并在所有活动检查通过前阻止任务完成。在 ClawArena 中,它把留出偏好违规率降到分布内 37.6%、分布外 2.0%。

企业安全研究为生产环境 agent 增加了更宽的控制模型。它会在动作到达工具前检查计划、委托链、能力集和会话状态。Agent Joe 给出了一个更小的产品例子:一个仅支持 Rust、没有 shell 访问权限的编码 agent,用来降低执行任意终端命令的风险。Claude Code 的嵌套 sub-agent 说明了这些限制的必要性。嵌套能改善上下文隔离,但引用的例子包括每分钟 887,000 个 token,以及运行 23 个 sub-agent 后产生的 $47,000 账单。

Harness 计量和 agent 基准测试

基准测试工作聚焦 agent harness,而不只看基础模型。Claw-SWE-Bench 固定任务集、提示、Docker 工作区、预算、补丁提取和评估器,让不同 harness 能在同一契约下比较。结果已经足以影响实际运行:使用同一个 GLM 5.1 模型时,最小 OpenClaw 适配器达到 19.1% Pass@1,而完整适配器达到 73.4%。

AgentBeats 处理相关的评估问题,把基准测试本身做成 judge agent。论文报告了一场持续五个月的竞赛,包含 298 个 judge agent 和 467 个 subject agent。EsoLang-Bench 增加了另一个压力测试。它把六个编码 agent 拉开了 88.4 个百分点,远高于同一摘要中 SWE-Bench Verified 报告的 6.6 个百分点差距。

多 agent 编码的持久状态

状态成了工程中的一等对象。PROJECTMEM 在只追加的本地日志中记录问题、尝试、修复、决策和备注。它通过 Model Context Protocol (MCP) 暴露这段记忆;MCP 是一种把 agent 连接到外部上下文和动作的工具接口。它的动作前门控会在 agent 重复失败修复或编辑脆弱文件前发出警告。

DeLM 展示了同一需求的多 agent 版本。Agent 共享关于事实、失败假设、约束和部分解法的已验证要点,然后从队列中异步领取工作。在使用 Gemini 3 Flash 的 SWE-bench Verified 上,它报告每项任务成本 $0.12、65.7% Avg.@1;列出的基线为 $0.24 到 $0.26。Claude Code 的嵌套 agent 提供了独立上下文帧的商业示例,但成本证据支持设置明确的支出上限。

证明信号和更安全的软件工作

多个来源把验证视为 agent 工作循环的一部分。Jane Street 的形式化方法文章认为,agent 编写的代码会增加代码审查压力,而证明工具可以向 agent 提供测试之外的反馈。文章清楚给出了旧成本基线:seL4 花了 25 人年验证 8,700 行 C 代码,每行代码约需 23 行证明。

ComAct 展示了另一条通向更安全动作的路径:让专业软件控制变得可执行、可检查。在 CAD 工作流中,agent 通过 COM 接口编写 Python 脚本,然后用代码有效性和任务成功作为评估信号。报告的 ComCADBench 覆盖 SolidWorks、Inventor 和 AutoCAD 中的 1,000 个任务;摘要中基于 GUI 的 agent 成功率接近零。

较新机器人 VLA 工作正在接受时间、接触和缺失证据的检验较早Agent tools need memory, proof signals, and secretless sandboxes