Line-ranked repair candidates for failed coding-agent runs
编码代理的修复循环可以在模型请求下一次编辑前,先给出一组按可能出错程度排序的代码行。FLARE 展示了具体做法:一个轻量诊断模型给词法单元打分,把分数汇总到行级可疑度,再围绕 top-k 可疑行生成修订,运行测试,并保留执行结果最好的候选。设置 k=10 时,FLARE 在 LiveCodeBench 和 BigCodeBench 上提高了五个基础模型的 Pass@1;它的诊断模型在 100 个 LiveCodeBench 任务上的定位准确率达到 Top-1 67% 和 Top-10 89%。
这个流程适合已经在 CI 中收集失败代理补丁的团队。可以保存失败程序、测试输出、如果有的话保存 token 概率、可疑行排名、生成的候选和测试结果。还可以为拟议修改加一个小的行为检查:Neural Change Prediction 报告说,变异-输出对可以训练模型预测代码修改的可能效果,微调后的 GPT-4.1 在单次 Python 变异上的输出变化预测准确率达到 95%。试点可以回放最近失败的生成结果,比较只看执行反馈的修复和按行排名的候选搜索,在通过率和每个接受修复所花的评审分钟数上的差异。