End-to-end agent benchmarks
新的基准把 agent 当作必须规划、编辑、运行工具并从错误中恢复的工人。1GC-7RC 给 agent 七个机器学习任务,运行在一块 NVIDIA A100 GPU 上,没有互联网访问,任务时限为 40 到 120 分钟。AgentKernelArena 测试 196 个 GPU kernel 任务,覆盖 HIP、Triton 和 PyTorch-to-HIP 路径,然后检查编译、正确性、速度和隐藏输入形状。TOBench 增加了多模态工具使用:100 个可执行任务、27 个 Model Context Protocol 服务器,以及针对任务的验证器。
结果很有用,但不一致。Claude Code 搭配 Sonnet 4.6 在 1GC-7RC 的所有七个可见基线之上都有提升。AgentKernelArena 在许多 kernel 类别上报告了很高的编译率和正确率,平均加速最高到 6.89×,但 PyTorch-to-HIP kernel 常常在未见过的形状上失败。TOBench 更严格:最佳模型的任务成功率是 41.0%,而人类基准是 94.0%。