Repository-scale acceptance suite for coding-agent pilots
购买或部署代码代理的团队,应把完整仓库构建作为测试对象,而不只是修复单个 issue 或处理单文件任务。可行的套件可以先选 10 到 20 个内部服务或库,它们已经有稳定的 Docker 构建、有效的单元测试和清晰文档。代理拿到的是能力级文档,必须从零创建仓库结构、API、依赖关系和组件间行为。评分时,代理开始前应清除源代码、测试、包缓存、构建产物和 Git 历史,然后只用可执行检查评分。
DeNovoSWE 给出了这类设置的模板。它挑选 Docker 环境稳定、原始测试通过率高、测试覆盖率达标的仓库,再把测试和跟踪到的函数映射到文档里的能力。这个数据集有 4,818 个文档到仓库实例,用它微调 Qwen3-30B-A3B 后,BeyondSWE-Doc2Repo 的表现从 5.8% 提升到 47.2%。EsoLang-Bench 还适合做内部 DSL 和专有工具的压力测试:给代理一个持久工作区、本地执行和隐藏提交,然后看它能否在一次会话里学会不熟悉的可执行接口。