Code editing interfaces
当文件读取、补丁写入和修复被拆成更小的任务时,仓库代理的收益最大。SWE-Edit 通过 Viewer 处理相关代码块、Editor 执行补丁,把探索性文件内容挡在主推理上下文之外。在 SWE-bench Verified 上,它报告 resolved-rate 从 69.9% 提高到 72.0%,edit success 从 93.4% 提高到 96.9%,总推理成本下降 17.9%。
SAFEdit 把同样的分工用在指令式编辑上。Planner 写编辑计划,Editor 只改目标代码,Verifier 运行真实单元测试,并最多做三轮修复。在 EditBench 上,它报告任务成功率 68.6%,高于其 GPT-4.1 ReAct 基线的 60.0%。Claude Code 的回归报告显示了另一面的运行风险:在一次报告的工作流里,Read 和 Grep 结果中反复出现的恶意软件提醒,让 5 个 Opus 4.7 subagent 里的 3 个拒绝了普通重构任务。