带可执行搭建日志的仓库引导 worker
仓库级编码代理需要一个独立的环境搭建阶段,并为它单独设定预算、遥测和通过标准。本周的证据表明,搭建失败是一个独立的运维问题,不是代码生成前的一小段准备工作。RAT 在一个覆盖 2,000+ 个仓库的基准上报告了可执行环境搭建成功率:Python 为 63.2%,Java 为 41.3%,Rust 为 98.7%,JS/TS 为 68.7%,并且相对使用相同底座模型的 SWE-agent 有明显提升。成本也很明确:在一个 Python 设定下,完整 RAT 平均使用约 421.9K tokens,耗时 24.3 分钟。在内部仓库中部署编码代理的团队可以把这转成一个具体的流程变化:把环境配置当作一级步骤来运行,记录仓库是否变为可运行状态,并且当搭建从未成功时,不再继续评估下游补丁质量。
这里可落地的构建是一个仓库引导 worker:检测语言、选择基础镜像、在沙箱中安装依赖,并输出机器可读的搭建记录,其中包含尝试过的命令、修改过的文件、测试或 smoke check 状态,以及失败类别。这类输出既能用于评测,也能驱动面向用户的产品行为。一个低成本测试方法是,从内部仓库中抽取一个混合样本,测量这个 worker 在任何代码编辑代理启动前,把仓库带到可运行状态的比例。如果这个比例很低,那么补丁生成指标就在掩盖主要失败模式。