使用自生成测试进行无标注代码模型调优
一个让测试与解决方案共同演化的代码生成训练循环,现在已经具体到可以放进内部微调和评测流程里试用。ZeroCoder 表明,自生成代码和自生成测试之间的执行反馈,可以在没有人工编写测试或参考解的情况下同时改进两边。在 Qwen2.5-Coder-7B-Instruct 上,无标注设置让代码生成提升了 14.5%,DyB^4 把这一增幅提高到 21.6%;在三个模型家族和六个基准上,平均增幅达到代码生成 18.8%、测试生成 62.7%。实际实现可以是一个小型运行器:对每个任务采样多个候选程序和测试,执行完整的通过/失败矩阵,丢掉信息量低的任务,并在把测试当作奖励之前检查这些测试是否真的能提高 mutation score。这个做法适合已经有代码任务、但没有大量人工整理单元测试的团队。一个低成本验证方法是,先在一个狭窄的内部任务族上跑起来,再把 Pass@1 和 mutation score 跟普通的仅执行基线对比。