趋势

代码代理正在按完整、可验证的工作来评分

日 · 2026-05-13 · Software Intelligence

这一时期最清楚的信号是:代码代理正在按完整、可检查的工作来评分。SWE-Cycle 和 Phoenix-bench 把环境搭建、测试和领域工具链纳入评分。CRANE 表明,在保护工具调用格式时,模型编辑可以提高代理通过率。

End-to-end software work

SWE-Cycle 让部分进展和完整问题解决之间的差距变得清楚。它要求代理在一个原始仓库里重建环境、实现修复并编写验证测试。摘录中最好的 FullCycle 解决率是 13.50%,而单独的环境重建达到 78.12%,单独的测试生成达到 67.28%。

AI Harness Engineering 对这种模式给出系统层面的解释。它把代理性能看作模型、运行时 harness 和仓库环境共同作用的结果。它提出的 trace 包记录动作、工具使用、上下文、验证、失败归因、干预、熵和结果,因此一个成功的补丁必须附带它是如何产生的证据。

Domain toolchains expose transfer limits

Phoenix-bench 在可执行的电子设计自动化(EDA)检查下,测试面向软件风格的代理处理 Verilog 和 SystemVerilog 维护任务的能力。表现最好的商业代理只解决了 32.7% 到 38.6% 的任务。和 SWE-bench Verified 相比,这些代理低了 37 到 58 个百分点。

失败模式很具体。硬件 bug 会沿着端口、时钟、复位、参数以及实例化模块之间的信号流传播。文件级 oracle 只带来 1.4 个百分点的提升,因为代理还是会改错模块。加入一轮 testbench 日志反馈后,解决率升到大约 42% 到 45%,说明可执行的失败证据比单看文件名更有用。

Verification skills are becoming separate targets

PBT-Bench 把基于性质的测试(PBT)单独拎出来:代理必须推断一个文档里写明的不变量,并编写能触发语义 bug 的 Hypothesis 输入生成器。这个基准覆盖 100 个问题、40 个 Python 库和 365 个注入的 bug。在 PBT 引导提示下,不同模型的召回率范围是 42.1% 到 83.4%。

提示带来的收益并不均匀。Qwen 3.6 Plus 提升 24.5 个百分点,Qwen 3.5-30B-A3B 提升 22.9 个百分点,Step 3.5 Flash 提升 20.3 个百分点。DeepSeek V3.2 和 Grok 4.1 Fast 在同样的 scaffolding 下召回率下降。这说明测试设计能力可以作为可测量的代理技能,而且模型和提示之间要匹配。

Agent reliability is being tuned below the product surface

CRANE 用 Thinking checkpoints 的推理方向编辑 Qwen Instruct checkpoints,然后抑制会干扰工具分隔符、JSON schema tokens 和 chat templates 的更新。在 Roo-Eval 上,它在 30B 时达到 66.2% pass@1,而 Instruct baseline 是 46.7%;在 80B 时达到 81.5%,baseline 是 72.8%。

其他工作在调整周边机制。CANTANTE 根据系统级分数给每个代理分配提示归因,并报告在 MBPP、GSM8K 和 HotpotQA 上的最佳平均排名。SkillOps 把可复用的代理技能维护为带验证器和兼容性链接的类型化契约,在 200 个技能的库上把 ALFWorld 任务成功率做到 79.5%。1Password 的单体重构展示了同样教训在生产环境中的版本:在工程师提供确定性分析器、清单、停止规则和审查点后,代理才帮上忙。

较新代码代理正在围绕可执行反馈和明确的运行限制构建较早机器人 VLA 研究正在收紧围绕动作质量和时序的控制回路