Repository-scale coding benchmarks
DeNovoSWE 将整个代码仓库生成视为一个带可执行检查的训练问题。它的 4,818 个文档到仓库实例来自真实仓库,包含 Docker 环境、测试覆盖率筛选、沙箱清理,以及按能力级别编写的文档。用这个数据集对 Qwen3-30B-A3B 进行微调后,BeyondSWE-Doc2Repo 的表现从 5.8% 提升到 47.2%,这是一个幅度很大的提升,因为这项任务要求处理文件布局、API、依赖关系和组件间行为。
EsoLang-Bench 测的是另一种能力:在不熟悉的可执行接口里适应。最强的代理通常先写 Python、JavaScript 或 Rust 生成器来输出小众语言代码,再用本地解释器调试这些生成器。这个基准把已部署代理拉开了明显差距,六个代理的平均分差距达到 88.4 个百分点。这个结果让工具使用和本地执行在编码能力评测中有了明确位置。