Class-level code generation
ClassEval-Pro 针对的是孤立函数合成和仓库修复之间的空缺:写出一个完整的 Python 类,包含共享状态、方法依赖和领域逻辑。这个基准共有 300 个任务,覆盖 11 个领域,部分任务来自 2025 年 1 月 1 日之后创建的 GitHub 仓库。它的任务比早期的 ClassEval 集更大,也更连贯。
结果显示,多方法协同仍然很难。五个大语言模型里,整体生成的类级 Pass@1 只有 27.9% 到 45.6%。自底向上生成让较弱模型最高提升 9.4 个百分点,而组合式生成最低只到 1.3%。在 500 个人工标注的失败案例中,逻辑错误占 56.2%,依赖错误占 38.0%,跨方法协同是主要的测量失败模式。