性能优化
当代理获得经过测量的运行时证据,而不是宽泛的指令时,仓库级优化效果更好。PerfAgent 使用采样性能分析器识别热点,验证每个补丁,并将加速结果反馈给代理,最多进行五轮。在 GPT-5.1 下,GSO 上与专家表现匹配的补丁比例从 19.6% 提升至 39.2%,SWE-efficiency-Lite 上则从 26% 提升至 74%。
MoST 提供了另一种互补的可执行指导。它将提交和技术文档中的优化知识转换为经过验证的 Semgrep 规则,其中包括跨语言和跨架构迁移的策略。在 351 个历史任务上,它生成的与开发者补丁完全匹配的补丁比 SemOpt 多 24.44%–180.00%。这些研究共同表明,相比无指导生成,针对具体任务的测量和经过验证的规则是更强的优化信号。