开放式编程数据与程序发现
FrontierSmith 将开放式编程当作数据问题来处理。它把封闭的竞赛编程任务改造成优化任务,筛选解法多样性,并构建评分验证器。在 200 个合成问题上训练 Qwen3.5 模型后,9B 版本的 FrontierCS 提升 8.82 分,27B 版本提升 12.12 分,在 ALE-bench 上也有较大提升。
DIO-Agent 解决的是相关问题:只有输入输出示例时的代码合成。它运行一个进化循环,由大语言模型(LLM)编辑代码,执行过程给出具体错误,课程安排再逐步加入更难的案例。在 IO2CodeBench 上使用 DeepSeek V3.2 时,它的平均通过率达到 58.63,超过 CodeEvolve 的 49.60 和 AlphaEvolve 的 47.29。共同结论很直接:更强的编程系统需要比一个提示和一个答案更丰富的任务信号。