Coding-agent harnesses and skills
Claw-SWE-Bench 把 harness 本身算进分数里。使用同一个 GLM 5.1 模型时,OpenClaw 在最小 adapter 下的 Pass@1 从 19.1% 提升到完整 adapter 下的 73.4%。论文还报告,在固定模型下,harness 选择会让 Pass@1 最多相差 27.4 个百分点,而 Lite-80 集合只用约 23% 的运行成本,就能跟上完整的 350 实例基准。
几篇配套材料把 agent 运行当成需要持续维护的运行时。Loop-Harness 把 Claude Code 运行安排在隔离的 git worktree 里,然后要求第二个 Claude 会话打印 VERDICT: PASS 才能发出。Agents All the Way Down 更偏向把命令行界面(CLI)agent 用在产品集成里,并引用了一个匹配任务:Model Context Protocol(MCP)用的 token 约为 CLI 的 35 倍。SkillJuror 给出一个更小但有用的结果:把同样的 skill 内容改成 Progressive Disclosure 后,410 次匹配试验里的通过率从 42.0% 提高到 46.1%。