自适应 agent harness
Harness 正在成为优化目标。TTHE 使用运行时错误、工具输出、公开测试和其他无标签轨迹,对可执行控制程序进行分支和编辑。使用 DeepSeek-V4-Flash 时,BIRD 准确率从 12.0% 提升到 50.0%,SWE-bench Verified 从 20.0% 提升到 35.0%。这些增益具有传导性,不完善的代理信号仍可能导致选择错误。
自动化 harness 适配也改变了部署成本。在 21 个任务-模型组合中,优化后的 harness 改进了其中 16 个,并在其中 7 个组合中缩小了小语言模型(SLM)的差距。表现最好的 SLM agent 达到了前沿 LLM 性能的 89.7%,成本仅为其 4%。另一项企业研究将来源、路由、输出和轨迹要求编码为代码;270 次模型边界运行全部通过这些契约,而外接式护栏降低了测得的效用。