趋势

可执行 harness 已开始决定 agent 的成本、可靠性和测试时增益

日 · 2026-07-09 · Software Intelligence

Agent 的性能越来越取决于模型周围的可执行控制层。TTHE 通过根据无标签轨迹编辑 harness 来改进固定的大语言模型(LLM),Long-Horizon-Terminal-Bench 则显示了当前 agent 在持续终端工作中的性能会多快下降。仓库级检查补足了这一点:实用的 agent 需要自适应控制、密集评估和结构验证。

自适应 agent harness

Harness 正在成为优化目标。TTHE 使用运行时错误、工具输出、公开测试和其他无标签轨迹,对可执行控制程序进行分支和编辑。使用 DeepSeek-V4-Flash 时,BIRD 准确率从 12.0% 提升到 50.0%,SWE-bench Verified 从 20.0% 提升到 35.0%。这些增益具有传导性,不完善的代理信号仍可能导致选择错误。

自动化 harness 适配也改变了部署成本。在 21 个任务-模型组合中,优化后的 harness 改进了其中 16 个,并在其中 7 个组合中缩小了小语言模型(SLM)的差距。表现最好的 SLM agent 达到了前沿 LLM 性能的 89.7%,成本仅为其 4%。另一项企业研究将来源、路由、输出和轨迹要求编码为代码;270 次模型边界运行全部通过这些契约,而外接式护栏降低了测得的效用。

长时程终端评估

Long-Horizon-Terminal-Bench 使用 46 个容器化任务和密集的子任务奖励来衡量持续执行能力。每次运行平均使用 990 万个 token,包含 231 个回合,耗时 85.3 分钟。测试中表现最强的模型在 0.95 奖励阈值下完成了 7 个任务。在所有模型中,平均通过率为 4.3%,超时导致了 79% 的未解决运行。

密集评分揭示了失败过程中的差异。690 次运行中有 433 次获得部分奖励,其中 180 次的奖励达到或超过 0.5。有 73 次运行接近完成,而完全通过的运行有 30 次。这些数据让开发者能够了解最终状态评分所掩盖的进展、停滞和验证失败。

仓库上下文与结构一致性

仓库级编码需要与待实现过程相匹配的上下文。ProjAgent 会检索计算步骤相似的函数,即使它们的词汇和应用领域不同,然后使用编译器和静态分析反馈进行修复。该方法在 REPOCOD 上报告了 41.14% 的 Pass@1,但现有证据没有量化其相对于检索基线的优势。

代码生成完成后,还需要检查整个仓库范围内的不变量。Patchwork Problem 将导入、调用、依赖、配置、模式、资源、控制流和路由建模为相互协调的图。该研究涵盖 336 次生成,并在 43 个真实世界的 AI 生成仓库上验证了这些失败类别。论文提供的摘录没有报告精确率、召回率或数值失败率,因此现有证据支持的最主要贡献是验证器的覆盖范围和分类体系。

较新机器人策略的提升取决于记忆、定向适应和更高难度的灵巧操作测试较早编码代理需要更安全的输入、受控工具和可重复的生产路径