趋势

编码代理正在接受项目规则、完整工作流和测量失败的检验

日 · 2026-04-27 · Software Intelligence

当天最强的工作把代码代理当作必须遵守项目上下文、处理多文件工作流并接受可追踪证据检验的系统。Context-Augmented Code Generation 给出了最清晰的产品上下文结果。BenchGuard 和 TraceToChain 关注的是测试和可靠性声明是否可信。

Project context and cross-file contracts

代码生成论文关注的是围绕代码的决策。Context-Augmented Code Generation 报告称,在 Claude Code 中加入 Brief 后,8 个 Next.js 任务、41 个决策点上的加权决策遵循率从 46% 提升到 95%。这个结果有用,但这种设置也会通过规格说明、验收标准和构建过程中的指导改变工作流。

工业 DSL 研究在仓库规模上得出了同样的结论。BMW 将一个 Xtext 领域特定语言项目编码为保留路径的 JSON,然后训练 7B 代码模型输出完整的多文件更新。QLoRA 微调在 105 个留出样本上达到了 1.00 的结构保真度,开发者审查和生成器执行被用作实际检查。

Coordinated software migration and repair

当代理系统在阶段之间传递明确产物时,表现更好。Mono2Sls 先用静态分析提取端点、调用边、异步提示和模式候选项,再让四个代理生成架构、Lambda 代码、AWS SAM 模板和一致性修复。在 6 个 Flask 和 Express 应用上,它报告了 100% 的部署成功率,没有手工修复,端到端正确率为 66.1%。

FGDM 把类似的分阶段设计用于漏洞检测和修复。它将代码转成流图,定位有缺陷的节点,修复图区域,再重建源代码。论文报告了对 100 个 BugsInPy 程序的测试,这些程序被转换到 Python 和 C 中,Python 修复与参考表示的平均余弦相似度为 0.951,C 修复为 0.974。

Benchmark quality and reliability modeling

评估工作正在检查测量工具本身。BenchGuard 通过检查任务说明、参考程序、评估器和环境之间是否冲突,来审计基于执行的代理基准。在 ScienceAgentBench 上,它发现了 102 个任务中的 12 个经作者确认的缺陷。在 BIXBench Verified-50 上,五模型审计与专家识别的 24 个原子问题中的 20 个完全一致。

TraceToChain 走的是另一条路。它把代理轨迹拟合为一个吸收马尔可夫链,让 pass@k、重复运行失败和可靠性衰减共享同一个成功时间分布。在 7 个受控设置上,留出集可靠性曲线与解析曲线的最大误差为 0.053,而且拟合后的链在 7 次试验中都通过了报告的 KS 检验。原始 SWE-bench 和 tau-bench 轨迹验证仍留待后续工作。

Operational probes for autonomous research behavior

两个代理基准在测试模型能否在有限指令或部分发现后构建系统。在 AlphaZero 风格的 Connect Four 任务中,代理只拿到一个简短提示、3 小时和消费级硬件。Claude Opus 4.7 作为先手,在对 Pascal Pons 求解器的 8 次主要试验中赢了 7 次,而其他测试代理都没有超过 2 次胜利。

SciCrafter 在 Minecraft 红石中测试发现和应用能力。最好的基线在 25 个参数化电路任务上的成功率为 26.0%。Oracle 研究提示和一个 scientist 子代理把最高结果提高到 64.0%,但剩余差距仍然很大,说明在这个受控场景里,代理还是难以识别并应用缺失的因果规则。

较新机器人学习正在缩小视觉仿真与接触执行之间的差距较早Flutter 的明确信号是全栈 Dart,而 GenUI 仍以演示为主