轨迹与上下文清理
代理轨迹正从可丢弃的日志变成清理工作的输入。TRIM 会重建修复轨迹,并仅在测试仍然通过时移除编辑,使补丁中的冗余内容减少 17.8%–32.9%。SWE-Pruner Pro 读取编码模型的隐藏状态,丢弃无关的工具输出行;在基本保持基准质量的同时,报告的令牌数最多可减少 39.4%。两者共同展示了减少长时间代理运行所留残余的两种实用方式:精简最终补丁,以及压缩工作上下文。
围绕编码代理控制措施的近期工作仍在继续,但今天的证据主要集中在代理留下的产物上。轨迹感知的清理会移除冗余编辑,而覆盖率检查和明确的需求则能揭示仅凭测试通过可能遗漏的缺口。大多数结果来自单项研究或供应商数据,因此其对生产环境的广泛影响仍不确定。
代理轨迹正从可丢弃的日志变成清理工作的输入。TRIM 会重建修复轨迹,并仅在测试仍然通过时移除编辑,使补丁中的冗余内容减少 17.8%–32.9%。SWE-Pruner Pro 读取编码模型的隐藏状态,丢弃无关的工具输出行;在基本保持基准质量的同时,报告的令牌数最多可减少 39.4%。两者共同展示了减少长时间代理运行所留残余的两种实用方式:精简最终补丁,以及压缩工作上下文。
评估正更具体地界定一个成功补丁必须证明什么。一项对 4,882 个代理生成的拉取请求的分析发现,在修改代码的 PR 中,只有 49.6% 修改了测试;现有测试覆盖了 Java 变更代码行的 61.5% 和 Python 变更代码行的 27.0%。另一项白盒审计显示,详细的 24 项检查清单在 10 次运行中全部通过,而通用自检仅通过 5 次。GitHub 的产品响应是将覆盖率指标和质量门禁直接置于拉取请求中,而 VNVSpec 则把机器可读需求连接到可执行证据。共同的约束是必须提供明确证据:测试通过本身可能掩盖未覆盖的代码或遗漏的需求。