Lite benchmark runs for coding-agent harness changes
评估编码代理的团队应该把 harness 当作产品组件来打分,而不是把它当作背景管道。Claw-SWE-Bench 说明了原因:在相同的 GLM 5.1 模型下,OpenClaw 使用最小的 direct-diff adapter 时 Pass@1 为 19.1%,使用完整 adapter 时为 73.4%。在固定模型下,harness 选择让 Pass@1 最多相差 27.4 个百分点。
一个可行的落地步骤是,在每次 harness 变更时加入一次小型、固定的基准测试。这个运行应保持任务集、Docker 工作区、提示模板、墙钟时间预算、补丁提取和预测格式不变,然后把 Pass@1、token 成本和墙钟时间一起报告。Claw-SWE-Bench Lite 提供了一个可用模式,因为它的 80 例子子集与 350 例子完整运行的结果很接近,而成本只有完整运行的约 22.9%。这让工程团队可以在把波动归因于模型之前,先发现 adapter、停止规则和补丁提取里的回归。