面向代理构建应用的依赖感知运行时验收门
编码代理试点需要一个发布门,先启动生成的应用,驱动界面,并在人工审查代码前记录哪些需求检查失败。SaaSBench 说明这个门必须覆盖设置和集成:它报告的最佳结果是 20.68% Pass@1,而且超过 95% 的失败发生在深层业务逻辑之前,主要出现在系统设置、配置、集成、过早停止或反复调试循环中。WebGameBench 给出一个面向用户行为的较小样本:浏览器评估器通过 Playwright 控制 Chrome,检查交付的游戏是否真正处理输入、规则、计分、重启流程以及胜负条件。
一个可行的实现是在现有代理运行外面加一层 harness:标准化 Docker 启动,把产品需求编码成按依赖顺序执行的检查,用 Playwright 检查界面行为,并把被阻塞的检查和直接失败分开标记。团队可以先在最近的十个代理生成原型或内部工具上试运行。如果失败检查集中在设置、集成、状态处理和可见行为上,这个 harness 就能在代理输出进入常规代码审查前,给工程管理者一个明确的验收信号。