趋势

编码智能体正按审查负担、运行成本和隔离能力接受评判

周 · 2026-W27 · Software Intelligence

本周的证据把编码智能体视为生产系统。最有力的工作衡量了智能体离开单任务演示后的审查负担、token 支出和权限控制。SWE-INTERACT 让顶尖模型的解决率降到单轮结果的大约一半,TraceLab 显示长上下文读取主导服务成本,Securing Agentic Identity 则让可复用 OAuth token 留在智能体运行时之外。

交互式编码智能体评估

基准测试开始把用户重新纳入评估流程。SWE-Together 从 11,260 个已记录会话中重建了 109 个仓库级任务,并同时评估最终正确性和 User Correction,即智能体需要多少明确纠正或较软性的反馈。Claude Opus 4.8 在报告的智能体中领先,pass@1 为 63%,而参考补丁基线约为 78%。

SWE-INTERACT 让交互成本更清楚。在相同的底层任务上,Opus 4.8 的解决率从单轮设置的 50.7% 降到多轮设置的 26.7%。GPT 5.5 从 48.0% 降到 24.7%,同时每次试验成本从 $2.78 升至 $9.84。失败还包括长期交互后的遗忘需求和实现错误,目标遗漏只是其中一类。

代码变更的运行时证据

效果最好的修复工作把模型输出和可执行产物绑定在一起。SWE-Doctor 生成多方面的缺陷复现测试,在调试器下运行这些测试,并把运行时诊断记录输入补丁生成流程。它报告在 SWE-bench Verified 上的平均解决率为 75.7%,在 SWE-bench Pro 上为 59.4%;在 SWE-bench Pro 上比基线智能体高 8.0 到 8.9 个百分点。

本周其他工作把特征图、性能分析轨迹、编译器错误、基准测试和审批记录用作控制点,覆盖仓库级编辑、内存优化和 C 到 Rust 迁移。共同模式是在最终提交代码前提供具体证据:测试、轨迹、诊断和明确的审批产物都成为智能体工作产物的一部分。

智能体成本和仓库质量

成本证据变得更具体。TraceLab 分析了来自 Claude Code 和 Codex 的 4,265 个真实编码智能体会话、357,161 个 LLM 步骤和 432,510 次工具调用。前缀 token 在 54.90B 输入 token 中占 52.56B,并占估算 API 成本的 59.5%。即使全局前缀缓存命中率达到 95.7%,缓存未命中导致的预填充量仍是真正新增输入的 3.8 倍。

仓库质量也表现为运行成本。一项覆盖 660 次 Claude Code 试验的受控最小配对研究发现,更干净的代码没有改变通过率,但更干净的仓库少用了 7% 到 8% 的 token,并让文件重复访问减少 34%。另一份预算 RFC 提出在调用提供商前按运行范围进行原子化支出预留,并提供机器可读的预算状态,让智能体可以降级模型选择、缩短上下文或干净停止。

隔离、身份和动作边界

安全工作集中在智能体被允许触碰什么。UnderSpecBench 测试了 2,208 个 DevOps 提示变体,发现已执行的运行在各个评估配置中有 55.8% 到 67.8% 违反了动作边界。错误目标和越界结果很重要,因为看似合理的清理、回滚或访问变更命令可能打到错误的分支、命名空间、数据库或服务。

身份和执行设计把模型运行时视为需要降低信任的地方。Securing Agentic Identity 提出代理、代理服务和双向 TLS 模式,让真实 OAuth token 永远不进入智能体环境。Fly.io 的 Sprite 模式把长时间运行的智能体循环与一次性命令沙箱分开,并使用单命令 token 注入和检查点回滚。Claude Desktop 红队报告说明了这种隔离的原因:同步偏好设置加上具备命令能力的连接器,可能把账户攻陷变成工作站代码执行。

较新机器人 VLA 进展按控制环成功来衡量较早Antigravity 本周最强信号是可复用编码技能工作,强于基准测试主张