趋势

当规范变得可执行且可复用时,编码代理的表现会提升

日 · 2026-07-10 · Software Intelligence

当天最有价值的工作将大语言模型(LLM)编码作为受控的工程流程。ReProAgent和TestAgent把仓库上下文与运行时反馈连接起来,DualVeri则将机器检查的证明与针对实际实现的测试结合起来。可复用的任务上下文也成为降低成本、提高完成率的实际手段。

可执行测试与适配代理的缺陷报告

ReProAgent通过仓库探索、代码图检索和运行时验证,将问题报告转换为从失败到通过的测试。它在SWT-bench-lite问题集上复现了58.43%的问题,在SWT-bench-verified问题集上复现了70.30%,平均每个问题的成本为$0.14。TestAgent围绕测试专用仓库图使用规划器、生成器和审查器。在六个Java项目上,它达到了92.34%的代码行覆盖率和83.69%的变异分数;它还以92.22%的精确率检测出154个真实缺陷。

输入报告与执行循环同样重要。对441份SWE-bench Verified缺陷报告的分析发现,受影响代码的位置和建议修复方案与修复成功的正相关性最强。这说明简洁的报告有助于缩小搜索和修复范围。

证明与测试作为互补检查

DualVeri使用共享属性模板进行Lean 4证明,并针对PySpark开展基于属性的测试。在400个候选属性上,模板使证明合成成功率平均提高1.6倍,将证明幻觉减少59%,并将测试意图不匹配的数量从22降至1。证明结果与执行结果之间的不一致暴露了形式化模型与运行时行为之间的缺口。

Diversify2Verify增加了另一种有效控制:在固定契约下生成多个实现。数组、列表、递归式和命令式变体在73个任务中的49个任务上至少生成了一个通过验证的产物,任务成功率为67.1%。因此,即使不同变体针对同一任务,验证成功率也部分取决于实现结构。

面向重复代理工作的选择性复用

选择性持久记忆保存任务规范、数据模式、工具设置和输出约束,同时排除临时轨迹。在24个反复执行的企业任务上,它的完成率达到96%,无状态会话为79%,完整历史记忆为71%。对于兼容的数据刷新,18个任务全部无需再次调用LLM即可完成。

公开技能仓库显示,复用程度仍不均衡。在11,497个软件工程技能中,实现、测试和代码审查占65.4%。只有13.6%包含可执行代码资产,需求、发布和部署合计占10.7%。大多数已发布技能仍以说明文档为主,经过测试的可执行组件仍有很大补充空间。

较新机器人策略的提升取决于能否用好稀缺经验和动作信号较早机器人策略的提升取决于记忆、定向适应和更高难度的灵巧操作测试