仓库上下文与工作场景交付
智能体评估正在转向决定工作能否交付的条件:正确文件、可用产物、保留的状态和可度量成本。DeepDiscovery 显示,仓库任务需要贯通代码、配置、测试和组织结构的上下文。其报告的 SWE-bench Verified 解题率达到 78.6%,比基线高 8.2 个百分点。
EnterpriseClawBench 补充了工作场景证据。它把真实企业会话转成 852 个可复现任务,包含夹具、交付物、硬性规则、轨迹、运行时间、token 使用量和成本。经过审计的 Lite 集最佳结果为 0.663,产物质量和交付仍有很大提升空间。开源普查提供了规模证据:超过 1.8 亿个仓库中的智能体轨迹需要多种检测信号,因为拉取请求、提交、作者模式和配置文件覆盖的是不同群体。