仓库推理和可复用经验
当代理必须连接相距较远的文件、运行时目标和常量时,仓库级工作仍然脆弱。RepoMirage 在 SWE-Bench Verified 上通过保持行为不变的扰动直接测试这一点。8 个模型的平均解决率从 66.80% 降至 49.78%,平均访问文件数从 4.77 增至 13.24。结果显示,代理进行了更多探索,但缺少足够结构。
CODESKILL 用可复用的过程性技能处理相关问题。它训练一个小型大型语言模型(LLM),从编码代理轨迹中提取并维护一个紧凑的技能库。以 Qwen3.5-35B-A3B 作为冻结的编码策略时,平均成功率升至 39.26;无技能时为 29.57,最强提示或记忆基线为 35.25。