最低充分的代码仓库上下文
两项研究都支持选择性获取上下文,而不是穷举式探索。ACQUIRE 在修复前提出针对代码仓库的问题,使 SWE-bench Verified 上的 Pass@1 最高提升 4.4 个百分点。E3 估计任务范围,从最小可行执行路径开始,仅在验证失败后扩展;在其受控基准测试中,它保持了 100% 的成功率,同时将 token 数减少了 91%。两项研究共同表明,上下文获取应作为有预算约束的干预措施,而不是默认的全仓库扫描。不过,E3 最强的数值来自模拟器,因此其效率提升仍需更广泛的验证。