Reusable agent experience
CODESKILL 将编码代理过去的轨迹当作技能管理器的训练数据。它写出带有触发条件和行动步骤的简洁 Markdown 技能,再通过生成、修订、合并和删除操作把技能库保持得很小。以 Qwen3.5-35B-A3B 作为冻结的编码策略时,它在 EnvBench-Python、EnvBench-Java、SWE-Bench Verified 和 Terminal-Bench 2 上的平均成功率为 39.26,而没有技能时为 29.57。
SETUPX 把同样的思路用在仓库初始化上。它把初始化修复存成 eXPerience Units,在 Docker 快照里尝试这些修复,回滚有害尝试,并用 Prosecutor-Judge 检查避免把表面成功当成真正成功。在 EnvBench 的 100 个 Python 仓库上,带经验记忆的 SETUPX 报告 92% 的通过率,比没有记忆的版本高 10 个百分点。