可执行仓库与多次尝试记忆
仓库级代码生成现在要看整个项目能否安装、链接、运行,并且经得起反复尝试。EnvGraph 把运行时失败诊断当作一个跨外部包和内部引用的结构化归因问题,在 RAL-Bench 和 NL2Repo-Bench 上分别报告了 5.72 到 5.87 个百分点的功能正确性提升,以及 4.58 到 8.66 个百分点的非功能质量提升。LiveCoder 从另一个角度处理同一个瓶颈:它在多次尝试之间保留成功记录、失败记录和最好的仓库产物。在 RAL-Bench 上,它报告最高 +22.94 个功能分、最高 81.58% 的仓库复用率,以及最高 53.63% 的成本降低。这里传达的信息很直接:执行反馈已经进入方法本身,而不只是计分板。