Repository setup memory with container rollback and independent pass/fail checks
在许多仓库里使用编码代理的团队,可以先把失败的安装修复保存成结构化记录,再在后续安装运行中检索这些记录。一个有用的记录应包括错误文本、包或工具链信号、修复命令、仓库类型,以及后续的通过或失败结果。代理应在可丢弃的容器快照中尝试检索到的修复,回滚失败的安装,并把最终判定和执行修复的代理分开。
SETUPX把这套流程做成了具体实现。它的 eXPerience Units 保存安装信号、自然语言指导、可执行操作和遥测;检索结合了相似度、历史成功率和 LLM 重排序器;Docker 快照支持回滚;Prosecutor-Judge 检查把失败证据和最终判定分开。在 EnvBench 的 100 个 Python 仓库上,带记忆的 SETUPX 报告 92% 的通过率,比不带记忆的版本高 10 个百分点。CODESKILL 也指向同样的操作方向,面向更广的编码任务:带触发条件和操作步骤的紧凑 Markdown 技能,提高了冻结编码策略在 EnvBench、SWE-Bench Verified 和 Terminal-Bench 2 上的平均成功率。
一个低成本试验可以只放在 CI 或开发者上手阶段的仓库初始化环节。通过条件很明确:文档里的命令和测试能在干净容器里运行,修复历史可以复用,破坏性的依赖修改可以回滚。