运行时控制和操作关卡
可靠性工作集中在谁可以执行操作、代理能看到哪些上下文,以及哪些工具调用需要检查。6 月 1 日的趋势把代理可靠性同受管理的权限、诊断和审查路径联系起来。6 月 6 日的趋势把同一问题推到产品层面:可编辑上下文、受保护的桌面操作和支出控制,成为代理执行实际工作时的实际要求。这使控制界面成为代理设计的一部分,而不是部署后才补上的内容。
本周研究把大型语言模型(LLM)代理视为受控的软件工作者。最有力的工作要求提供轨迹、可执行检查、工具限制和审查关卡。Claude Code 说明这已经不只是基准测试问题:编码代理正在进入软件供应链。
可靠性工作集中在谁可以执行操作、代理能看到哪些上下文,以及哪些工具调用需要检查。6 月 1 日的趋势把代理可靠性同受管理的权限、诊断和审查路径联系起来。6 月 6 日的趋势把同一问题推到产品层面:可编辑上下文、受保护的桌面操作和支出控制,成为代理执行实际工作时的实际要求。这使控制界面成为代理设计的一部分,而不是部署后才补上的内容。
训练工作把代理轨迹当作不只是日志。EvoTrainer 会在训练分支失败或改进时调整诊断,使用 rollout、配置、日志和代码 diff 来决定保留、剪枝、回滚还是合并分支。Socratic-SWE 把仓库求解轨迹转成可复用的修复技能,然后生成由执行结果检查的定向任务。报告的提升很具体:EvoTrainer 将 SWE-9B 提高到 38.16 Avg@8 BC%,而人工设计的强化学习设置为 33.77;Socratic-SWE 在三轮迭代后在 SWE-bench Verified 上达到 50.40%。
评估工作关注代理能否处理软件工作的混乱部分:模糊需求、仓库定位、测试、提交和反复反馈。Asuka-Bench 在多轮反馈中评测 Web 应用创建,包含隐藏需求和浏览器渲染行为。TeleSWEBench 基于真实 srsRAN 5G 提交构建 734 个电信任务,并报告最强工具最多能达到 25% 的可发布变更率。这些结果把自主性声明绑定到可执行结果和领域代码上,因为文件定位和功能正确性都很重要。
本周最后出现了一个具体的生产信号。《经济学人》摘录报道了 Anthropic 的说法:Claude 编写了该公司 5 月发布代码的五分之四以上,而 Claude Code 发布前这一比例还只是低个位数。该来源没有给出受控安全结果,但清楚显示了治理问题:编码代理现在可以影响 AI 实验室发布的系统、工具和基础设施。审查、来源记录,以及对递归式软件工作的限制,需要在普通工程工作流中可见。