来源笔记

AgentKernelArena: Generalization-Aware Benchmarking of GPU Kernel Optimization Agents

GPU Kernel OptimizationCoding AgentsCode IntelligenceBenchmarkingGeneralization Testing

AgentKernelArena 是一个开源基准,用于评测完整的 AI 编码代理在 GPU 内核优化上的表现,包含 196 个 HIP、Triton 和 PyTorch-to-HIP 任务。它的核心结论是,代理通常能编译出正确且更快的内核,但 PyTorch-to-HIP 内核在未见过的形状上经常失败,因为代理会把形状假设硬编码进去。

  • GPU 内核决定深度学习系统的速度和成本,但要写出高性能的 HIP 和 Triton 代码,需要掌握硬件、编译器、内存和调度知识。
  • 现有内核基准主要评测单次 LLM 调用或轻量提示,无法覆盖代理式工作流,也就是编译、测试、分析并修改代码的过程。
  • 以往基准不测试内核优化是否能在代理从未见过的输入形状上工作,而这对实际部署很重要。
  • 该基准为每个代理提供一个隔离工作区,里面有源文件、命令、可选的硬件速查表和超时限制;代理可以编辑代码并运行 shell 工具。
  • 它覆盖 196 个任务:24 个 HIP-to-HIP 优化任务、148 个 Triton-to-Triton 优化任务,以及 24 个 PyTorch-to-HIP 翻译任务。
  • 评测使用分层流程:先编译,再做正确性检查,最后进行性能计时,包含 10 次预热和 100 次 GPU 计时迭代。
  • 加速比按基线时间除以优化后时间计算;评分中,编译得 20 分,正确性得 100 分,正确内核再按 100 × 加速比计分。
  • 未见配置协议会在隐藏形状上测试优化后的内核,例如非 2 的幂大小、尺度变化、边界情况、不对称形状,以及类似生产环境的 transformer 形状。
  • 在 HIP-to-HIP 任务上,Claude Code 搭配 Opus 4.6 达到 100.0% 编译率、98.6% 正确率、6.69× 平均加速比、3.31× 几何平均加速比,以及 50.0% fast₂。
  • 在 Triton-to-Triton 任务上,Cursor Agent 搭配 Opus 4.7 High 的平均加速比最高,为 2.13×,同时达到 100.0% 编译率、100.0% 正确率、1.31× 几何平均加速比和 10.1% fast₂。
  • 在 PyTorch-to-HIP 任务上,Cursor Agent 搭配 Opus 4.6 High 的平均加速比最高,为 6.89×,同时达到 100.0% 编译率、98.6% 正确率、4.49× 几何平均加速比和 75.0% fast₂。
  • Claude Code 搭配 Opus 4.6 在 PyTorch-to-HIP 上也表现很强,达到 98.6% 编译率、97.2% 正确率、6.70× 平均加速比、4.53× 几何平均加速比和 79.2% fast₂。
  • Triton-to-Triton 是加速比最难做高的类别:所有配置的平均加速比都在 1.59× 到 2.13× 之间,fast₂ 也都低于 11%。
  • 未见形状评测发现,HIP-to-HIP 和 Triton-to-Triton 优化通常可以迁移到新形状,而 PyTorch-to-HIP 在隐藏配置上的正确率下降很大;原文把这一点写成定性结果,没有给出数值差距。