Repository acceptance runs for code agents with time limits and hidden checks
工程团队可以先用一小组内部任务测试代码代理,再扩大上线范围:一个隔离工作区、固定的时间和 token 预算、除非任务需要否则不接入网络、用于迭代的可见测试,以及用于验收的隐藏检查。运行过程应记录命令、编辑、失败、重试、最终得分和成本。
最近的基准测试指向同一种运行方式。1GC-7RC 给代理 7 个机器学习任务,数据准备被锁定,本地数据,1 张 A100 GPU,无网络,预算为 40 到 120 分钟。AgentKernelArena 通过编译、正确性、计时和隐藏输入形状来控制 GPU 内核任务。TOBench 用可执行任务、MCP 工具、工作区状态和任务专用验证器评估使用工具的代理,而最佳报告模型在 94.0% 的人类基准下达到 41.0% 的任务成功率。
一个可操作的内部版本可以先从一个团队的 10 到 20 个重复性工作开始:依赖升级、修复失败测试、小型特性开关、数据管道补丁,或模型训练改进。验收规则要足够简单,能直接放进 CI。若代理只通过可见检查、做了大范围修改,或为了完成小任务花费过多,团队应在进入生产评审队列前就看到这一点。