测试正在成为代码生成的控制面
针对编码系统的工作开始把可执行检查放到训练信号的核心。ZeroCoder 不用参考答案或人工测试来改进代码模型,而是让代码生成和测试生成共同演化,再通过执行结果给两者打分。在 Qwen2.5-Coder-7B-Instruct 上,完全无标签的设置让代码生成提升 14.5%,DyB4 把增益提高到 21.6%;在三个模型家族和六个基准上,代码生成的平均提升达到 18.8%,测试生成达到 62.7%。一篇关于 Test-Oriented Programming 的较小论文把同样的想法推进到工作流设计中:开发者先审查生成的测试,再让模型写生产代码。它的 Onion 原型在 10 次运行里都完成了一个小型 BibTeX CLI 任务,且没有直接修改生产代码,但证据范围仍然很窄,因为评估只覆盖了一个小应用。