Selective traces beat raw volume in coding agents
这段时间里,训练数据质量是代理工作中最清楚的抓手。STITCH 会把长的软件代理轨迹筛成决策关键片段,再在这部分数据上微调。报告里的提升幅度很大:在 SWE-bench Verified 上最高相对提升 63.16%,在带 CodeArts Agent 的 Multi-SWE-bench Java 上提升 43.75%,在 HarmonyOS ArkTS 上用不到 1K 条训练轨迹就达到 61.31% 的编译通过率。与此同时,Gentoo 在推理阶段也显示出同样的偏好,即依赖结构化信号。它的代理会写面向具体目标的 fuzz 生成器,在 7 个 Java 基准中的 6 个上超过人工编写的生成器,平均覆盖率提升 11% 到 21%。对代理写出的生成器来说,覆盖率引导的变异在典型情况下只多带来不到 3% 的提升,这说明价值在于尽早编码正确约束,而不是后面再做更多随机搜索。