2026 年最佳 AI GPU 优化智能体:AKO、KernelAgent、AutoKernel、Apex 与 CUDA Agent 横向对比

GPU 优化该选哪款 AI 智能体?本文对比 AKO、KernelAgent、AutoKernel、Apex 与 CUDA Agent 的硬件适配、正确性验证、基准证据和真实成本,为 NVIDIA、AMD 与 PyTorch 团队提供选型建议,以及从热内核占比到 $299.99 试点回本周期的实用评估方法。

Thursday, September 3, 2026Omid Saffari
2026 年最佳 AI GPU 优化智能体:AKO、KernelAgent、AutoKernel、Apex 与 CUDA Agent 横向对比

即使报告称 GPU 内核提速 232x,整个工作负载的成本降幅仍可能不到 5%。因此,最好的 GPU 优化 AI 智能体,不是能制造最大基准测试标题的那个,而是具备正确硬件路径、严苛正确性验证框架和端到端回本门槛的那个。

简短结论:AKO 综合最佳,但硬件会改写排名

若要认真开展 NVIDIA GPU 优化,首选 AI 智能体框架是 AKO 它将覆盖面广的专家基线证据、可重复的项目基础设施和独立审计结合得最完整。AKO 不是一种新模型,而是为 Claude Code 提供一套有纪律的工作环境,让它提出内核方案、运行基准测试、保留有效的优化轨迹,并识破那些只是看起来正确的候选实现。

一旦换成 AMD 硬件,结论就会立刻改变。Apex 是专门面向 ROCm 的选择;针对部分 AMD Instinct 型号,AutoKernel 则是更通用的方案。对于希望利用硬件计数器驱动 NVIDIA 或 Intel XPU 优化循环的 PyTorch 团队,KernelAgent 更合适。CUDA Agent 展示了这里最高的研究上限,但团队目前还无法把它当作现成产品部署。

下表中的价格与可用性均于 2026 年 8 月 16 日核实。这些系统都是可自行托管的开源项目,因此 $0 起价只表示无需支付软件订阅费;模型套餐、API 用量、工程师工时和 GPU 算力都要另计。

工具最适合起价免费试用
AKO经审计的 NVIDIA 优化项目$0 软件费 + 使用成本不适用
KernelAgentPyTorch 与 NCU 引导的调优$0 软件费 + 使用成本不适用
AutoKernel简单的夜间实验循环$0 软件费 + 使用成本不适用
ApexAMD ROCm 优化$0 软件费 + 使用成本不适用
CUDA Agent研究与基准测试分析不对外销售不适用

表中刻意没有重复展示性能倍数。AKO 采用专家基线,KernelAgent 对比 torch.compile,Apex 验证了 7 个内核,CUDA Agent 报告的是 KernelBench 结果,而 232x 来自一场竞赛;它们的分母完全不同。把这些数字从大到小排列,看似精确,实际几乎没有决策价值。

决策流程:NVIDIA 优化可选择 AKO、KernelAgent 或 AutoKernel,AMD ROCm 选择 Apex,研究用途选择 CUDA Agent
先确定硬件路径,再考虑模型;验证器和运行时都排在模型之前。

决策规则很简单:先选择能够在实际加速器上完成性能分析、正确性验证和部署的框架,再在这条硬件路径内比较证据。 理论上再强的优化器,只要不支持目标硬件,商业价值就是零。

232x 的结果对 GPU 账单究竟意味着什么

这轮热度确有依据。在 2026 年 8 月 15 日登上 Hacker News 的一篇第一手记录中,Sankalp 称,他把 NVIDIA B200 上一个 QR 分解基准从约 419,000 微秒降到了 1,805 微秒,这就是报告中的 232x。整个项目持续 14 天,产生了 1,500 多次提交,并在 183 名参赛者中排名第 12。作者记录了 103 个连续刷新的最佳提交,耗时从 108,803 微秒降至 1,805 微秒,降幅为 98.34%。可在这里阅读完整实验设置及其限制

这有力证明了工作流的价值,却不能证明生产模型会便宜 232x。起点是某个特定基准上的粗糙实现,最终成绩则离不开人工引导、领域知识,以及多次跳出局部最优。作者还描述了从约 3,000 微秒推进到 1,800 微秒的难点,并建议同时探索 3 到 5 个候选方案,而不是把希望押在单一路径上。

真正缺失的变量是热内核占比,也就是目标内核在工作负载总耗时中所占的比例。根据 Amdahl 定律,系统中没有被优化的部分会为整体提升设定硬上限。

如果该内核占工作负载耗时的 25%,并被加速 232x,理论上的整体加速也只有 1.3314x,对应理论成本降幅为 24.8922%。如果同一内核只占 5%,整体加速会降至 1.0524x,理论成本降幅仅为 4.9784%。

这也是为什么验证器比一个吸睛的模型演示更重要。候选实现可能利用重复输入、缓存行为、宽松误差或单一形状,照样拿到惊人的局部成绩。生产环境的问题要严苛得多:换成新值后是否仍然正确?能否覆盖线上使用的各种形状?放回真实框架后,能否切实降低端到端延迟或成本?

上述项目自身的成本也很有启发性。当时,作者拥有每月 $200 的 ChatGPT Pro、每月 $20 的 Claude Pro,以及 Modal Starter 每月 $30 的额度。这些订阅降低了实验门槛,但真正有效的工作单元仍是漫长的“基准测试—检查—修改—验证”循环。智能体降低了搜索空间的成本,却没有替人定义正确的搜索空间。

1. AKO:经验证的 NVIDIA GPU 优化项目综合首选

当任务是 NVIDIA 内核优化,且团队可以使用 Claude Code 时,AKO 是综合最佳选择。它的核心优势不是某个神奇模型,而是把现有编程智能体变成一套有记录的优化流程,涵盖基准框架、项目记忆、性能分析和对抗式审计。

AKO GPU 内核优化项目页面
AKO

AKO 提供两个实用入口。AKO4ALL 是可直接接入的 skill,可通过 Triton、CUDA、C++、TileLang、CuTe DSL、Python 或 HIP 优化内核。它会记录完整轨迹和 Git 历史,比一段用完即逝的聊天记录更便于审查。AKO4X 则是规模更大的项目系统:既能运行单轮,也能执行多轮;可保留跨运行归档,选择本地或 Modal 执行,收集 NCU 性能数据,在明确允许时演进验证框架,并开展独立审计。

最后一项能力正是 AKO 排名第一的原因。已公开的材料展示了一个利用缓存的候选实现:它起初看似成功,直到独立检查在复用指针的同时更换了输入值,随后 38 项检查全部失败。这类奖励投机很容易逃过宽松的基准,却往往要等到生产事故发生后才暴露。

AKO 对证据的披露也少见地充分。公开评测使用 NVIDIA B200、CUDA 13.2、PyTorch 2.12、Triton 3.6,以及 Claude Opus 4.7 或 4.8。在 10 个内核家族、471 个工作负载上,作者报告称其中 9 个家族超越了专家实现,几何平均提升介于 1.14x 与 1.43x。突出的案例包括 DSA 稀疏注意力提速 30.71x,23/23 个工作负载全部通过;GDN prefill 提速 2.30x,100/100 全部通过。AKO 公开了工作负载范围与运行环境,因此那些幅度较小的结果和大数字同样有参考价值。

真正值得采购方关注的,恰恰是这些不那么耀眼的结果。GQA decode 的区间为 0.85x 到 1.81x,MLA decode 为 0.84x 到 1.98x,MLA prefill 为 0.82x 到 2.37x,RMSNorm 为 0.96x 到 1.67x。GEMM 保持在 1.00x,因为 cuBLAS 仍未被击败。换句话说,AKO 在个别工作负载上也会落后,有时也无法超越成熟的专家库。相比所有箭头都向上的宣传页,这种结果更可信。

最适合: 需要重复运行并接受审计的 NVIDIA 内核优化团队

突出优势: 独立审计与跨运行项目记忆

价格: 自托管 AKO4X 采用 MIT 许可证,软件费 $0;Claude Code 与 GPU 用量另计,核实日期为 2026 年 8 月 16 日

免费试用: 不适用

优势
做得好的地方
8 points

  • 公布了 10 个家族、471 个工作负载上相对于专家基线的结果
  • 同时提供可直接接入的 skill 和更深入的项目系统
  • 保留优化轨迹,并可跨运行复用知识
  • 通过独立的新输入值审计,直接防范对基准的投机
  • 当前工作流绑定 Claude Code,尚未为所有智能体提供同等的一等支持
  • 已披露的基准环境为 NVIDIA B200,其他加速器仍需自行验证
  • 一次典型运行会消耗大量 token,也仍需投入可观的工程审查
  • cuBLAS GEMM 等成熟内核可能根本没有经济上值得挖掘的空间

AKO 报告称,一次典型 AKO4ALL 运行约需 55 分钟,约使用 15,000 个输入 token、253,000 个输出 token、17.6 million 个缓存读取 token 和 752,000 个缓存写入 token。这意味着缓存计费和模型套餐限制也是实际预算的一部分。开源框架的软件费可以是 $0,但优化项目绝非零成本。

  1. 分析一个生产工作负载

    在启动智能体会话前,先测量完整请求,并找出目标内核在总运行时间中的占比。记录有代表性的形状、dtype、批次大小、预热行为和当前端到端成本。如果它不是热内核,就到此为止。

  2. 在 AKO4ALL 与 AKO4X 之间选择

    一个边界明确的内核适合 AKO4ALL;若任务需要多轮运行、归档、NCU 性能分析或独立项目审计,则使用 AKO4X。不要只因为控制项更多,就一开始选择更大的系统。

  3. 锁定参考实现与输入

    把现有实现作为参考基线。围绕真实生产形状建立正确性检查,并加入可击破缓存输出捷径的新输入值。除非实验明确需要演进验证框架,否则应禁止智能体修改它。

  4. 运行有上限的搜索

    首次尝试可把算力上限设为 32 个 B200 小时,并搭配 $100 的智能体套餐。按 Modal 当前价格计算,这项试点在计入工程师工时前为 $299.99。保留每一个被接受的候选实现及其精确环境。

  5. 开展独立审计

    脱离智能体的工作上下文重新运行胜出方案:更换输入值,在适用时复用指针,覆盖边界形状,并进行多次测试。只在自身训练循环里获胜的候选实现必须淘汰。

  6. 要求端到端回本

    把内核集成回真实模型或服务,再测量整个工作负载的延迟与加速器成本。只有实测月度节省能满足项目开始前设定的回本周期,才允许上线。

2. KernelAgent:最适合 PyTorch 的硬件反馈优化循环

如果 PyTorch 团队希望优化器依据硬件计数器作出判断,而不是反复盲猜代码,KernelAgent 最为合适。这个开源项目把内核生成、性能分析、正确性验证、基准测试和优化整合到一个多智能体循环中。

KernelAgent GitHub 仓库
KernelAgent

它最鲜明的特点是性能分析反馈。系统会收集 28 项 NVIDIA Nsight Compute 指标,并用 roofline 模型判断候选内核是受内存、计算能力还是利用率不足所限,再据此选择下一步优化方向。简单来说,roofline 模型要回答的是:内核瓶颈究竟在算力、内存搬运,还是较差的占用率。先做出诊断,后续修改就更有针对性。

循环会验证输出、使用 CUDA events 进行基准测试,并可在达到设定轮数、收敛,或至少达到理论峰值效率的 95% 时停止。仓库列出了对 NVIDIA CUDA 的完整支持和 Intel XPU 支持,但不支持 AMD ROCm。它可在 Linux 与 macOS 上运行,兼容 Python 3.8 至 3.12,并需要 Triton、PyTorch,以及 OpenAI、Anthropic 或自定义模型提供商。KernelAgent 仓库提供了当前支持矩阵

公开基准覆盖 100 个 KernelBench Level 1 任务。作者报告称,相比早期的一组生成内核快 2.02x,相比默认 torch.compile 快 1.56x;在 100 个任务中的 65 个上胜过 torch.compile,并达到 H100 roofline 的 89%。另一个更早的生成系统曾在 250 个 Level 1、Level 2 和 Level 3 任务上实现 100% 正确率;不能随意把这个正确率归到所有经过优化的 KernelAgent 结果上。

一个具体案例比汇总数据更能说明它的真实价值:某个矩阵—向量实现从 9.52 毫秒降到 1.95 毫秒,而 torch.compile 达到了 2.09 毫秒。智能体大幅加速了原始实现,但最终相对随手可用的编译器,领先幅度要小得多。这正说明,经济性基线应当是“不使用智能体时实际会部署的最佳系统”,而不是智能体能够替换的最慢代码。

最适合: 使用 NVIDIA CUDA 或 Intel XPU、希望获得性能分析器引导迭代的 PyTorch 团队

突出优势: 根据 28 项 NCU 指标进行 roofline 路由

价格: 软件采用 Apache 2.0 许可证,费用为 $0;模型提供商与 GPU 用量另计,核实日期为 2026 年 8 月 16 日

免费试用: 不适用

优势
做得好的地方
8 points

  • 把硬件计数器转化为明确的优化方向
  • 支持 OpenAI、Anthropic 和自定义模型提供商
  • 在循环内完成正确性验证和基于 CUDA events 的计时
  • 为 PyTorch 团队提供从内核生成到硬件引导优化的清晰路径
  • 不支持 AMD ROCm
  • 主要公开优化基准是 KernelBench Level 1,而非生产模型组合
  • 汇总加速倍数取决于选用哪种基线
  • 使用 NCU 做性能分析会增加环境与工具要求

如果看重清晰的 PyTorch 原生架构和模型提供商选择自由,KernelAgent 应是第二选择;若目标本来就在它支持的技术栈中,且团队希望弄清内核为何缓慢,它也可以成为首选。若项目需要开箱即用的跨运行归档与对抗式审计机制,它则不如更完整的自主优化项目框架。

3. AutoKernel:最适合简单的夜间实验循环

当团队想让 Claude、Codex 或其他编程智能体在夜间运行一套直接的“分析—修改—基准测试”循环时,AutoKernel 是最实用的起点。它会分析模型、提取瓶颈、修改 Triton 或 CUDA C++,根据结果保留或回退每个候选方案,最后对完整模型做端到端验证。

AutoKernel GitHub 仓库
AutoKernel

项目记录了一套固定基准,其中包含 5 个阶段的正确性检查和一份 roofline 报告。固定验证框架很关键,否则开放式编程智能体完全可能通过修改测试而非优化内核来提高得分。在 AutoKernel 的循环中,每个候选方案接受相同考验,只有实测性能提升才会被保留。

它的计划吞吐量很容易估算。文档预计每次实验约 90 秒,每小时约 40 次,一夜约 320 次。这些只是预算规划数字,并非吞吐量保证。仓库还提到,在一组 250 多个问题中,每个 KernelBench 问题会进行 50 至 300 多次实验。AutoKernel 文档介绍了当前循环与要求

硬件覆盖面是它的切实优势。经过测试的 NVIDIA 型号包括 H100、A100 和 RTX 4090。1.3 版本新增 AMD ROCm 支持,覆盖 MI300X、MI325X、MI350X 和 MI355X。该工具需要 Python 3.10 或更高版本以及 uv,文档列出了 9 种内核类型。

证据边界同样重要:公开 README 介绍了验证框架、工作流和项目规模,但没有提供覆盖所有受支持目标的最新独立汇总基准。这并不意味着 AutoKernel 弱,而是说它诚实的购买理由在于可部署性与实验设计,而非排行榜冠军。

最适合: 希望获得清晰夜间循环与广泛智能体兼容性的团队

突出优势: 简单的“保留或回退”实验,以及最终端到端验证

价格: 软件采用 MIT 许可证,费用为 $0;编程智能体和 GPU 用量另计,核实日期为 2026 年 8 月 16 日

免费试用: 不适用

优势
做得好的地方
8 points

  • 可与 Claude、Codex 或其他编程智能体配合
  • 支持经过测试的 NVIDIA 显卡及部分新款 AMD Instinct
  • 使用固定的 5 阶段正确性检查
  • 在完整模型中验证结果,而不是止步于孤立内核
  • 尚无覆盖受支持硬件的最新独立汇总结果
  • 实际实验速度会随编译、性能分析和内核复杂度变化
  • 即使硬件覆盖广,也仍需在具体软件栈上本地验证
  • 相比 AKO4X,通用循环的项目记忆与审计深度较弱

对于已经信任现有编程智能体、只缺实验纪律的团队,AutoKernel 是合理的首个试点。与 KernelAgent 相比,如果夜间吞吐量和智能体选择比 NCU 驱动的多智能体设计更重要,就选 AutoKernel;与 AKO 相比,如果团队需要更轻量的循环或列出的 ROCm 型号,也应选它。但不要因为 320 次实验看上去必然优于 40 次就作决定;搜索质量取决于验证框架、候选多样性和基线。

4. Apex:AMD ROCm 专用路线首选

Apex 是优化受支持 AMD ROCm 工作负载的最佳专用方案。这里指的是 AMD-AGI 的智能体优化器,不是 NVIDIA Apex;它的运行前提明确围绕 AMD Instinct 硬件设计。

AMD-AGI Apex GitHub 仓库
Apex

默认目标是 MI355X,同时注明支持 MI300X、MI300A 和 MI250X。运行环境要求 Ubuntu 22.04 或更高版本、Python 3.10 或更高版本、Node.js 18;评分需要 ROCm 6.x 或更高版本。当前安装流程使用 ROCm 7.2 PyTorch wheel。Apex 可以编排 Claude Code、Codex 或 Cursor,但不附带模型访问权限。Apex 仓库列出了当前目标与环境边界

它的工作流很贴近生产:Apex 先对工作负载做基准测试,定位瓶颈,让智能体提出优化,再用 Magpie 评分;超过 1.05x 的候选实现会被集成,最后进行端到端基准测试。它可对 aiter、vLLM、SGLang 中的 Python 或 Triton 路径,以及 aiter HIP 进行热补丁,但无法热补丁系统 C++ 库或单体 _C.so 扩展。这个边界比支持哪些智能体更重要:如果瓶颈藏在 Apex 无法替换的集成层后面,优化项目就触及不到它。

厂商验证覆盖 7 个内核,其中 all_reduce 为 36.35x,fused_moe 为 1.14x,rms_norm 为 1.05x,其余 4 个均为 1.00x。应把 36.35x 视为一个内核上的有效结果,而不是整个内核组合的预期回报。4 个未提升的内核也表明,接受门槛能够正确地让代码保持不变。

最适合: 瓶颈处于受支持 ROCm 热补丁路径内的 AMD Instinct 团队

突出优势: 围绕 ROCm 设计的智能体优化与端到端评分

价格: 软件采用 MIT 许可证,费用为 $0;模型访问和 AMD GPU 算力另计,核实日期为 2026 年 8 月 16 日

免费试用: 不适用

优势
做得好的地方
8 points

  • 为 AMD 团队提供专用路线,不把 ROCm 当作附属选项
  • 支持 Claude Code、Codex 和 Cursor
  • 使用实测 1.05x 集成门槛
  • 以端到端基准测试收尾
  • 仅支持 AMD ROCm
  • 无法对系统 C++ 库或单体 _C.so 扩展做热补丁
  • 公开验证集只包含 7 个内核
  • 不应把 all-reduce 的大幅提升泛化到其他内核

只要生产目标是受支持的 AMD 加速器,且热代码位于可打补丁的范围内,Apex 就会跃升为首选。如果 AutoKernel 1.3 更适合所需的项目机制,或其 MI300X 至 MI355X 路线更匹配,它就是另一种选择。两者都不能只凭“AMD”二字决定;还必须核对具体加速器、ROCm 技术栈和集成点。

5. CUDA Agent:研究上限最高,但不适合采购

CUDA Agent 是本次对比中最值得关注的研究系统,却是最弱的采购选项。ByteDance Seed 与 Tsinghua University 的这个项目使用强化学习训练 CUDA 系统,并公开了一个含 6,000 个样本的数据集、一项编程智能体 skill,以及一个智能体工作目录。

CUDA Agent 研究项目页面
CUDA Agent

作者称它是首个通过强化学习训练、面向 CUDA 开发的系统。其 KernelBench 评测报告总体通过率为 98.8%,96.8% 的问题快于 torch.compile,相对 torch.compile 的几何平均加速为 2.11x。在 Level 3 上,报告的通过率为 94%,90% 的问题快于 torch.compile,几何平均加速为 1.52x。CUDA Agent 项目页提供了基准测试设置

这套设置规模可观:上下文 token 最多 128,000 个,训练 150 轮,评估 200 轮。候选实现必须比 torch.compile 快 5% 以上,通过 5 组输入的正确性检查,不得改动受保护脚本,并且不能使用网络检索。这些控制让公开结果比缺乏约束的编程智能体演示更有信息价值。

采购障碍也很明确:项目网站和公开仓库都没有列出可下载的模型权重或托管端点。数据集和 skill 可以为自研系统提供参考,却不等于标题结果中所描述的已训练产品。在实际模型或服务开放前,CUDA Agent 只能作为研究参考,而非可部署的优化供应方。

最适合: 研究智能体训练、CUDA 优化轨迹与 KernelBench 评测的人员

突出优势: 公开的强化学习设置与强劲的作者自报 KernelBench 成绩

价格: 不对外销售;截至 2026 年 8 月 16 日已有公开研究资料,但未列出商业层级

免费试用: 不适用

优势
做得好的地方
8 points

  • 公开了大规模训练与评估设置
  • 发布含 6,000 个样本的数据集和智能体资料
  • 使用受保护脚本与实测性能提升门槛
  • 报告了覆盖 KernelBench Level 3 的强劲结果
  • 未列出可下载的已训练模型权重
  • 未列出托管端点
  • KernelBench 成绩不能证明生产集成或成本回本
  • CUDA 范围无法回答 AMD ROCm 的选择问题

把 CUDA Agent 放在技术观察名单上,并用它的评测纪律衡量其他声明;但在已训练权重或托管端点可用之前,不要把它当作团队可以买到的模型放进采购对比。分清这一点,才不会把研究上限误写成一款产品。

不同团队该怎么选

如果使用 NVIDIA、可以采用 Claude Code,并希望获得披露最充分的项目管理与审计机制,选择 AKO。当团队面对一组重要内核、需要多轮优化,并且潜在节省足以支撑跨运行保留轨迹时,它尤其有吸引力。

如果团队的主要工作环境是 PyTorch,希望优化器根据 NCU 指标和 roofline 分类决定下一步,选择 KernelAgent。对于受支持的 NVIDIA 或 Intel XPU 工作负载,如果工程师不仅要接受更快的候选实现,还想理解硬件瓶颈,它最为自然。

如果需要更小的落地步骤,选择 AutoKernel:接上现有编程智能体,分析模型,再在夜间运行固定实验序列。当 Codex 很重要,或已列出的 AMD Instinct 型号令 AKO 与 KernelAgent 不再合适时,它也是灵活的中间路线。

如果工作负载运行在受支持的 AMD Instinct 硬件上,而且瓶颈位于可打补丁的 aiter、vLLM、SGLang 或 HIP 路径内,选择 Apex。在 AMD 场景下,硬件匹配的重要性高于 AKO 更广泛的公开项目证据。

在已训练权重或托管端点可用之前,CUDA Agent 只适用于研究、复现规划或评测设计。

明确的筛选顺序是:先看硬件,再看集成面,然后是验证器与基准,模型名称排在后面。如果两套系统都通过了这些筛选,优先选择会披露分母、失败区间和端到端结果的那一个。基线一致、幅度较低的提升,远比挂在错误基线上的惊人数字更有价值。

如果还要选择围绕专业内核框架的编排层,可参考这篇 AI 智能体平台对比了解外围取舍。这个决定应与内核循环本身分开处理。

真实成本:先做 $299.99 试点,再要求回本

开源软件的标价是最不重要的一项成本。真正的 GPU 优化项目还要计算加速器时间、智能体访问、编译与性能分析开销,以及专家审查。

截至 2026 年 8 月 16 日,Modal 上 NVIDIA B200 的实时价格为每秒 $0.001736,即每小时 $6.2496。Starter 套餐月费 $0,算力另计,每月含 $30 算力额度和 3 个席位。Team 套餐每月 $250,算力另计,每月含 $100 算力额度和不限量席位。Enterprise 提供定制算力价格。Modal 公布了当前费率

因此,32 个 B200 小时的成本为 $199.99。再加一个 $100 的智能体套餐,首次项目预算在计入工程师工时前为 $299.99。这个上限既足以尽早淘汰薄弱想法,也足以完成一场不止于表面演示的测试。

当前智能体访问价格提供了几个预算锚点。ChatGPT Plus 每月 $20。ChatGPT Pro 提供相当于 Plus 用量 5x 的 $100 选项,以及用量 20x 的 $200 选项,两者均包含 Codex。Claude 有 $0 的 Free 层;Claude Pro 按年付费时为每月 $17、需预付 $200,按月付费则为 $20;Max 的 5x 为 $100,20x 为 $200。Claude Pro 包含 Claude Code。这些信息于 2026 年 8 月 16 日分别通过 OpenAI Plus 信息页OpenAI Pro 信息页Anthropic 价格页Anthropic 套餐指南核实。API 计费可能不同,因此模型 token 成本应与 GPU 算力分开;最便宜的 AI API 指南解释了这一层。

接下来,把试点投入与生产账单对照。按当前标价,一块 B200 连续运行 720 小时的成本为 $4,499.71。如果目标内核占工作负载的 25%,并被加速 2x,整个工作负载可节省 12.5%,即每月 $562.46。$299.99 的试点约 16 天即可回本。

如果内核只占 5%,同样的 2x 内核提升只能节省 2.5%,即每月 $112.49,回本期会拉长到约 80 天。优化结果没有变化,业务结果却完全不同。

$299.99 GPU 优化试点的回本对比:热内核分别占运行时间的 25% 与 5%
同样是内核提速 2x,回收试点成本可能约需 16 天,也可能需要 80 天,取决于该内核原本占用了多少运行时间。

这个计算一方面刻意保守,另一方面仍不完整:它以加速器标价作为节省基数,但没有纳入工程师工时、模型 token 成本波动、编译开销、预留容量折扣或利用率变化。批准更长项目之前,应把每个输入值都替换为自己的实际账单数据。

这些 AI GPU 优化器是如何入选的

本文对比的是现行文档与证据,并未声称在相同硬件上安装和实测了全部 5 套系统。因此,标题写的是对比,不是实测。每个入选系统都必须提供可用于 GPU 内核工作的具体智能体或框架路径、公开的一手说明,以及足够的实现细节,让读者判断谁适合使用、边界在哪里。

排名采用 6 项标准:

  • 可部署性: 开发者现在能否获得并运行相关系统?
  • 硬件匹配: 是否明确支持目标加速器与软件栈?
  • 对正确性的严苛程度: 验证框架能否防住缓存答案、测试被改动、形状过窄和误差过宽?
  • 基准分母: 是否写明基线,并展示失败或没有提升的案例?
  • 端到端验证: 孤立内核改进后,工作流是否会回到真实模型或服务?
  • 成本清晰度: 团队能否为首个项目设定有边界的 GPU 与智能体预算?

这份排名不会对不同厂商的性能倍数取平均,而是更重视证据质量、运行适配度,以及把局部基准提升转化为经验证生产节省的可能性。因此,AKO 覆盖生产广度的 1.14x 到 1.43x,可能比大得多的孤立数字更重要;CUDA Agent 的 2.11x KernelBench 结果,也无法弥补没有可部署模型这一缺口。

本站当前商业合作池中,没有任何合作伙伴天然适合 GPU 内核优化。硬塞手机、CRM、培训、会计或建站工具,只会损害页面可信度。因此,本榜单不安排联盟推广位,只对真正相关的系统排序。

哪些选择应当避开

不要在 AMD ROCm 上使用 KernelAgent。 它当前支持 NVIDIA CUDA 和 Intel XPU,不包含 AMD ROCm。再好的性能分析器引导设计,也弥补不了运行时不受支持的问题。

不要用 AMD-AGI Apex 处理 NVIDIA 工作负载。 这里的 Apex 为 ROCm 与 AMD Instinct 而设计,也不是 NVIDIA Apex;后者是另一个混合精度与分布式训练项目。分配工程资源前,先确认说的是哪个项目。

不要把 CUDA Agent 当作可采购的托管生产产品。 它公开了数据集、skill 和工作资料,但没有列出已训练权重或服务端点。可以研究它,却不能把它作为已经存在的服务编入预算。

如果 Claude Code 不是获批依赖项,就不要选择 AKO。 AKO 的价值正来自它对现有智能体的约束,但智能体适配仍是采购与安全依赖。

如果决策前必须看到独立汇总基准,就不要选择 AutoKernel。 其公开资料充分解释了循环与支持目标,却没有提供覆盖这些目标的最新独立汇总结果。可以运行有边界的试点,也可以改选证据更接近自身需求的系统。

最重要的是,不要把裸用 Claude Code 或 Codex 的会话包装成完整优化器。两者都能编写和修改内核,AutoKernel 或 Apex 也能编排它们,但真正的产品是外围的性能分析器、不可变参考实现、正确性测试、基准计时、保留或回退逻辑,以及部署检查。没有这套框架,智能体就只是一个热情高涨、却给自己批改试卷的内核作者。

常见问题

Codex 能优化 CUDA 和 Triton 内核吗?

可以。AutoKernel 明确支持使用 Codex 优化 Triton 或 CUDA C++,Apex 也能在受支持的 AMD ROCm 工作负载上编排 Codex。但仅靠 Codex 并不构成完整的优化系统;还需要性能分析器、受保护的正确性验证框架、基准测试,以及保留或回退循环。

KernelAgent 比 AutoKernel 更好吗?

如果优先考虑 PyTorch 原生循环、NCU 指标,以及由 roofline 引导的 NVIDIA 或 Intel XPU 调优,KernelAgent 更好。如果需要更简单的夜间循环、更广泛的智能体选择,或它所列出的 NVIDIA 与 AMD Instinct 目标,AutoKernel 更合适。

Apex 能优化 NVIDIA GPU 吗?

不能。AMD-AGI Apex 是面向受支持 AMD Instinct 硬件的 ROCm 优化器。不要把它与 NVIDIA Apex 混淆,后者是另一个项目,也不是本文排名的智能体优化器。

用于 AMD GPU 优化的最佳 AI 智能体是什么?

对于位于其可打补丁集成面内、使用受支持 AMD Instinct 的工作负载,Apex 是第一专用选择。AutoKernel 1.3 则是覆盖 MI300X、MI325X、MI350X 和 MI355X 的更通用替代方案。

应该如何比较 KernelBench 得分?

每个分数都应同时注明硬件、任务级别、基线、通过定义、正确性输入和几何平均方法。相对 torch.compile 的结果,不能与相对专家实现或粗糙竞赛基线的结果互换。

小团队值得使用 GPU 内核智能体吗?

可以,前提是性能分析表明某个内核占据了足够高的持续性加速器账单。采用 $299.99 试点和热内核回本门槛;一旦实测端到端节省无法在目标周期内收回投入,就应停止。

周一就做这件事

不要把 5 套系统全部安装一遍。周一早上,先分析一个有代表性的生产工作负载,写下最热内核占总运行时间的比例。然后只选一条路径:需要经审计的 NVIDIA 项目就用 AKO,需要 PyTorch 与硬件计数器循环就用 KernelAgent,需要更轻量的夜间搜索就用 AutoKernel,使用受支持 AMD ROCm 则用 Apex。

首次实验上限设为 32 个 B200 小时加一个 $100 智能体套餐,或换算成自己硬件上的等价预算。冻结参考实现与基准测试,加入新输入值正确性检查。胜出内核必须脱离智能体自己的循环后仍可通过验证,并推动完整工作负载,而不只是微基准。

上线规则只有一句:没有实测端到端回本,就不启动第二轮项目。

最近更新

2026年9月3日

分类Build

在 Google 中优先显示本站

将 omidsaffari.com 添加为 Google 搜索的优先来源

把 omidsaffari.com 设为优先来源,Google 会在 Top Stories、AI Overviews 和 AI Mode 中为您优先展示。

更多 Build 文章

查看全部 Build 文章
订阅通讯

每周日,一封信。 写运转中的系统,不写热评。

来自一组 AI 项目组合运营的构建日志、生产系统与一线笔记。

每周一期。无垃圾邮件。随时退订。