Training harnesses and interaction traces
代理训练工作关注训练期间可用的证据,而不只看最终任务分数。EvoTrainer 让策略分支和读取 rollout、日志、配置、代码 diff 的诊断代码一起演化。它报告的最强提升来自仓库级软件工程:SWE-9B 的 Avg@8 BC% 达到 38.16,而人工设计的强化学习方案为 33.77。
终端代理研究通过监督微调得到相近结论。DeepSeek-V3.2 的 Terminal-Bench 2.0 单独分数低于 Claude Opus 4.6,但它的轨迹训练出更强的 Qwen3 学生,因为这些轨迹展示了更多 inspect-act-verify 行为。屏蔽 observation-command 关联后,Targeted Observation Ratio 从 13.4% 降到 5.3%,Qwen3-32B 的表现从 20.6% 降到 13.8%。