可执行仓库训练与长期评测
仓库级编码代理需要可重建的项目、真实测试和长轨迹。KAT-Coder-V2.5 报告称,AutoBuilder 将可执行环境构建成功率从 16.5% 提升到 57.2%,并在 12 种语言中生成了超过 100,000 个可验证环境。其训练流程还会根据探索、本地化、补丁质量、验证、恢复和诚实性筛选轨迹。
长期评测也采用相同的重点。EdgeBench 在 134 个真实世界任务上评测代理,其中包括 36 个系统与软件工程任务,交互时长约 38,000 小时。报告称,12 小时学习曲线符合对数 sigmoid 形式,平均 R² = 0.998。EvoAgentBench 增加了程序迁移测试:每个测试任务都至少与一个训练任务共享一种经过验证的 Ability,但自动记忆方法带来的收益仍不稳定,且有些案例出现明显的负迁移。