自适应 harness 与长时域评测
测试时 Harness 演进(TTHE)使用无标签执行轨迹改写并选择可执行的控制程序。在 DeepSeek-V4-Flash 上,模型权重保持不变时,SWE-bench Verified 性能从 20.0% 提升到 35.0%,BIRD 从 12.0% 提升到 50.0%。该方法仍依赖不完美的代理信号,也可能选中较弱的 harness。
Long-Horizon-Terminal-Bench 展示了剩余的运行限制。在 46 个容器化任务中,智能体平均每项任务使用 990 万个 token,耗时 85.3 分钟。测试中最强的模型在 0.95 奖励阈值下只完成了 15.2% 的任务,超时占未解决运行的 79%。密集的子任务评分揭示了部分进展,也比单一最终通过率为 harness 设计者提供了更有用的失败证据。