趋势

Repository-grade coding exposes where agents still break

日 · 2026-05-07 · Software Intelligence

当天最清晰的信号是,对大型语言模型(LLM)软件代理的评估在收紧。生成代码必须满足架构、测试、迁移和真实开发者轨迹的要求。TACT 和 ASTOR 改善了控制。仓库证据仍然显示,很多代理过不了结构和维护要求。

Structural constraints in real codebases

后端生成、企业迁移和架构修复都暴露出同一个薄弱点:代理能生成可运行代码,却过不了工程约束。

Constraint Decay 在 80 个后端任务上固定一个 OpenAPI 契约,并变化架构、数据库和对象关系映射要求。在完整约束下,能力较强的配置在断言通过率上下降约 30 个百分点。数据库选择带来的损失最大。

ScarfBench 让代理在 Spring、Jakarta EE 和 Quarkus 之间迁移 Java 应用。204 个定向迁移里,只有 1 个达到完整行为等价。即使最强的整应用运行也只有 87% 的编译成功率、40% 的部署成功率和 12% 的测试成功率。

SmellBench 加入了设计维护这一面向。专家审查发现,63.1% 的高严重级静态异味检测是误报。表现最好的代理解决了 47.7% 的案例,而最激进的修复设置引入了 140 个新异味。

Tests and developer intent need repository search

两个基准都关注代理无法从单个失败测试中拿到的信息。

TEBench 要求代理在生产代码提交后更新测试。七种配置里,受影响测试识别的 F1 一直在 45.7% 到 49.4% 之间。最难的是过时测试,平均 F1 约为 36%,因为通过的测试也可能需要语义更新。

ProCodeBench 从真实 VS Code 轨迹和仓库上下文中测量主动意图预测。数据集包含约 463 万个集成开发环境(IDE)事件,来自 1,246 名开发者和 5,492 个标注的意图样本。论文报告说,LLM、检索和代理基线在真实轨迹上的表现远差于模拟轨迹,而仓库上下文能帮助预测。

Control methods improve long agent runs

几篇论文都加入了对代理如何分配步骤、选择任务或从错误中恢复的显式控制。

TACT 识别每一步中的过度思考和过度行动,然后在测试时引导隐藏激活。它报告的漂移状态区分 AUC 约为 0.9,在 Qwen3.5-27B 上平均解决率提升 5.8 个百分点,在 Gemma-4-26B-A4B-it 上提升 4.8 个百分点,最长还能减少 26 步。

MAS-Algorithm 用于算法竞赛,包含五个角色:算法选择、检索、规划、编码和评审。在五个 Qwen 模型上,它把平均可接受解率提高了 6.48 个百分点。同一项研究里,只用可接受解做 LoRA 微调只增加 0.89 个百分点。

ASTOR 在代码 I/O 预测、代码生成、单元测试生成和提交信息生成上使用强化学习(RL)。一个共享模型在 Qwen2.5-Coder-7B 上比最好的任务专用模型高 9.0%,在 Qwen3-8B 上高 9.5%。

Generated code must remain inspectable and maintainable

当天还有关于初始生成之后代码的证据。

Build-and-Find 把代理写出的仓库当作后续代理的上下文。builder 根据隐藏规格创建代码库,finder 只用这个产物回答有关预期行为和设计选择的问题。基于工件的编译通过恢复率达到 98.9%,但协议把检查努力的主张限定在可靠恢复上,所以答案不稳定时,快速阅读不算数。

AIDev 数据集上的一项维护研究跟踪了 508 个代理创建的文件和 508 个匹配的人类创建文件,时间至少六个月。代理创建的文件收到的维护提交更少,改动幅度也更小。人类仍然完成了 83.21% 的后续提交,所以合并后的所有权仍主要在人类手中。

较新机器人 VLA 论文正在优化可部署的前瞻能力较早机器人策略按物体身份、接触和模拟器保真度来评判