Full-stack delivery benchmarks
SaaSBench 把企业软件交付当作测试对象。它的任务包括冗长的产品需求、Docker 运行时、按依赖顺序执行的验证节点、多种语言、数据库,以及前后端技术栈。已报告的最佳 Pass@1 是 20.68%,超过 95% 的失败发生在深入业务逻辑之前,常见于环境搭建、配置、集成、过早停止或卡住的调试过程。
WebGameBench 把同样的问题放到用户可见的场景里。代理先构建浏览器游戏,然后运行时评估器通过 Playwright 控制 Chrome,并按需求检查行为。最佳配置的可用率达到 76.9%,但优秀率只有 20.2%。页面可以加载,却仍然缺少规则、输入处理、计分、重启行为或胜负条件。