趋势

编程智能体研究正转向证据、运行框架和有界计算

日 · 2026-06-16 · Software Intelligence

当日研究把 AI 编程智能体视为需要运行时证据、有意义测试和关注运行框架评分的系统。PracRepair 和 LoopCoder-v2 显示,在仔细测量修复证据和潜在计算时可以获得增益;评估论文则推动报告组件级结果。

用于代码修复的运行时反馈

自动程序修复(APR)研究正在把执行证据作为一等输入。PracRepair 将静态代码上下文与失败测试轨迹、变量值、分支结果、验证诊断和轨迹差异结合起来。使用 GPT-4o 时,它报告在 Defects4J V1.2 上正确修复 162 个缺陷,在 V2.0 上正确修复 171 个缺陷,还包含许多 ReInFix 没有找到的修复。

另一项代码修正研究在更简单的循环中测试同一思路:生成代码,运行代码,返回编译器错误或失败测试细节,然后修改。GPT-o4-mini 在 450 题核心集上的 pass@1 领先;该研究还发现,语法和运行时失败比逻辑和算法错误更容易修复。

测试生成仍是弱点。在 86,156 个由智能体编写的测试文件补丁中,80.2% 包含弱预言机信号,或没有明确的预言机信号。这个发现很关键,因为测试文件可以执行代码,却仍然不检查任何预期行为。

关注运行框架的智能体评估

基准测试研究正在更谨慎地说明被测对象。一篇立场论文认为,编程智能体分数包含模型、运行框架、工具、环境、任务设置和验证器。论文引用的 Terminal-Bench 示例显示,固定使用 Claude Opus 4.6 时,ForgeCode 得分为 79.8% ± 1.6,Claude Code 得分为 58.0% ± 2.9,不同运行框架之间相差 21.8 分。

智能体技能评估论文把这一问题转化为测量流程。它根据每项技能生成任务和隐藏评分细则,在有无该技能的条件下运行智能体,并为指令遵循和目标完成打分。在约 500 项技能、1,000 个任务、19 种智能体-模型配置和 38,000 条有效轨迹中,相关技能带来的增益随模型而异,增加 5.5 到 22 分。

代码模型和智能体的有界计算

LoopCoder-v2 为代码模型给出了具体的计算扩展结果。这个 7B Parallel Loop Transformer 在循环之间复用共享块,并用共享键值注意力降低缓存成本。在报告的测试套件中,两次循环把平均分从 38.0 提高到 46.5。在 SWE-bench Verified 上,分数从 43.0 升至 64.4,而三次和四次循环的分数大幅下降。

语料中的实践文章也把类似的有界系统视角用于智能体工作站。长时间运行的智能体需要隔离的计算机、独立端口、状态、依赖和 shell 访问。其实践主张是,质量取决于规格说明、测试、类型检查、lint、可观测性和最终 pull request 审查,而非人类持续编辑生成代码。

较新机器人VLA工作集中于真实控制条件下的泛化较早AI 编码代理正通过轨迹、门禁和证明检查接受评判