有状态修复与仓库定位
修复工作正在变得更具体。A-ProS 把代码生成器、独立的调试批判器和实时 Codeforces 反馈配在一起,并在多轮尝试之间保留修复历史。在 367 道 ICPC 和 Codeforces 题目上,GPT-5 工作流的通过数从 39 个初始正确解提升到三轮细化后的 85–90 个。
修复前,仓库上下文也在被收窄。BLAgent 先根据 bug 报告定位可能出错的文件,再把更好的文件上下文送入自动程序修复。在 SWE-bench Lite 上,它用闭源模型报告了 86.7% 的 Top-1 文件准确率,用开源模型报告了 78.6%。核心教训很直接:修复质量取决于下一步动作带上的状态和上下文。