编码 agent 正在按状态、恢复和回归控制来衡量
这一时期把编码 agent 视为带有状态、测试、故障恢复和可追踪控制的软件系统。i cat-agent 提供了最强的正向结果;ToolBench-X 和 CodeChat-Eval 暴露了 agent 在工具故障和后续编辑下的脆弱行为。
这一时期把编码 agent 视为带有状态、测试、故障恢复和可追踪控制的软件系统。i cat-agent 提供了最强的正向结果;ToolBench-X 和 CodeChat-Eval 暴露了 agent 在工具故障和后续编辑下的脆弱行为。
编码代理的采用已经适合转向更窄的测试架工作:分离的 bug 修复角色、围绕不可靠工具的恢复测试,以及面向库行为重叠团队的基于意图的测试迁移。证据最强的部分来自报告可执行评估、测量回归,或通过工作流水线发现真实缺陷的论文。
这一时期的重点是编码代理问责:测量真实使用情况、控制工具成本,并在代码运行后检查安全性。最有力的证据来自 1.8 亿仓库普查、贝叶斯控制和 BigBag;产品项目补充了治理需求,但评估较少。
编码智能体的采用现在需要运行记录,这些记录要能应对微弱痕迹、高成本验证,以及只停留在静态检查层面的安全声明。实际工作包括仓库多信号普查、智能体运行的验证器预算控制器,以及面向代码和工具使用的漏洞利用支撑评审关卡。
编码代理采用有三个实际压力点:恢复仓库任务真正需要的文件,按已交付的 workplace 制品测试代理,并在部署前检查 AI 构建的应用。证据支持一些小的运营变更,团队可以用现有代码库、会话日志和安全评审队列来试点。
本周的大语言模型(LLM)智能体工作把自主性当作证据问题处理。最有力的声明把任务成功与轨迹、可执行测试、范围化权限和有来源支撑的记忆配对。ProcGrep、SWE-Future 和 Machine Studying 显示了当前重点:根据智能体做了什么、知道什么,以及哪些检查成立来评判它们。
代码智能体采用正在转向具体的验收检查:经过失败测试的仓库指令、围绕智能体工作的轨迹门禁,以及面向陌生语料的分配前考试。有用工作位于模型周围的支持层:智能体被告知了什么、它实际做了什么、它使用了哪些证据,以及在人类评审结果前通过了哪些检查。
当天最明确的信号是围绕智能体的问责。Machine Studying 询问智能体能否在考试前学会一个新语料。ANMA、PeekAI 和 Lupen 让开发者更容易在本地机器上阻断、追踪和审计编码智能体的行为。
代理团队现在有具体检查来处理三个常见失败点:较便宜的编码代理跨越模块边界、编码会话产生不清晰花费,以及代理在没有证明工作知识的情况下进入陌生语料。
这一时期最强的信号是代理的运行纪律。GlueRun-go、Vitrus 和 Callimachus 把代理工作视为需要 lease、引用、本地记忆和可审计控制路径的过程。多数主张来自工程证据、合成测试或产品指标,公开基准覆盖有限。
智能体采用正在转向模型周边的运行控制:任务租约、证据包、带来源的记忆、API 调用检查和带身份信息的日志。实际工作是在现有开发者和内部工具工作流中加入这些控制,使失败可见且测试成本较低。
智能体团队现在有了可测试的具体控制模式:用于过期状态故障的确定性重放、用于多文件安全缺陷的发布前源码审计,以及用于常规知识工作的会话锁定模型路由。公开证据大多来自产品或文章主张,因此更有用的做法是开展范围较窄的本地试验,并衡量误报、成本、延迟和回滚行为。