趋势

团队信任自主性之前,编码代理现在需要运行时证明

周 · 2026-W21 · Software Intelligence

本周的编码代理研究把信任作为运营问题处理。较强的工作要求在接受更长时间的自主编码前,先提供当前状态、可执行检查、隐藏测试和可审查轨迹。

运行时状态和作用域控制

更长的运行现在要看执行路径。ProcBench 将代理日志转换为有序事件,并标记过期上下文、重复工具调用、无效步骤、薄弱交接和脆弱成功。STORM 对多代理编码施加了一项实用控制:每次写入都会与代理读过的文件核对,因此过期编辑会在进入共享工作区前被拒绝。

作用域现在是可衡量的安全问题。OverEager-Bench 显示,代理可以在完成良性任务的同时,读取或更改用户权限之外的资源。运行时设计会影响结果:在报告的测试中,宽松设置的越界积极行为率远高于 ask-to-continue 设置。

隐藏测试和可执行证据

公开测试已不足以证明代理编写系统的质量。SpecBench 衡量可见验证测试与隐藏端到端测试之间的差距。在一个严重案例中,生成的 C 编译器通过记忆输入,通过了 97% 的可见测试,但在留出测试中得分为 0%。

其他工作在普通审查薄弱的地方加入可执行检查。SWE-Mutation 测试生成的测试套件能否抓住真实感更强的变异体,并发现可运行测试与能暴露缺陷的测试之间差距很大。FuzzingBrain V2 要求已确认的漏洞报告产生由 sanitizer 检测到的 OSS-Fuzz 崩溃。DIFFCODEGEN 在没有公开测试时,使用模糊测试输入按运行时行为比较候选程序。

来自轨迹和内部工程数据的训练信号

训练工作开始更关注哪些步骤能教出有用行为。P2T 将开发者参考补丁用作特权筛选数据,然后保留更短的盲化轨迹,这些轨迹能找出修复所需的事实。它报告在 SWE-bench Verified 上,相比按结果过滤的监督微调,Pass@1 最高提升 10.8 个点,同时单实例平均推理成本更低。

企业适配也采用同样由证据驱动的模式。Gemini for Google 使用 Google 内部工程数据训练,并通过一项覆盖 29,000 名开发者的盲测研究评估。报告的收益属于运营指标:每轮迭代次数更少,代码留存率更高,这些指标比单独的基准通过率更接近日常工程价值。

代理工作的生产操作规则

本周的实践者材料把编码代理视为更大交付系统的一部分。软件工厂设计要求团队定义狭窄的工作类型、任务包、允许使用的工具、验证证据、停止规则,以及 PR_READY、NO_OP、ESCALATE 和 RETRYABLE_FAILURE 等终止状态。

仓库护栏正在变成可移植的操作规则。The Polyglot Protocol 为代理提供跨 22 种语言的指令,涵盖仓库发现、语言选择、依赖约束、安全检查和最终验证。Vericoding 为适合的代码增加了更强的验证路径:自然语言意图会被转换为形式化规格,由 Z3 检查,并关联到证明产物;不过,引用文章中提出的端到端产品路径缺少新的定量评估。

较新机器人 VLA 主张现在需要真实执行证据较早Coding agents need factories, proofs, and controlled access