2026년 GPU 최적화를 위한 최고의 AI 에이전트 5선: AKO, KernelAgent, AutoKernel, Apex, CUDA Agent 비교

GPU 커널 최적화에 적합한 AI 에이전트를 비교합니다. NVIDIA용 AKO와 KernelAgent, AMD ROCm용 Apex, AutoKernel, CUDA Agent의 성능 근거와 비용, 검증 방식, 실제 도입 판단 기준까지 한눈에 살펴보세요.

Thursday, September 3, 2026Omid Saffari
2026년 GPU 최적화를 위한 최고의 AI 에이전트 5선: AKO, KernelAgent, AutoKernel, Apex, CUDA Agent 비교

보고된 GPU 커널 성능이 232x 빨라져도 전체 워크로드 비용은 5%조차 줄지 않을 수 있습니다. 따라서 GPU 최적화에 가장 적합한 AI 에이전트는 가장 화려한 벤치마크 수치를 내세운 시스템이 아닙니다. 실제 하드웨어에 맞는 경로, 허점을 용납하지 않는 정확성 하네스, 엔드투엔드 투자 회수 기준을 모두 갖춰야 합니다.

한눈에 보는 결론: 최고의 AI 에이전트는 AKO, 다만 하드웨어에 따라 순위가 달라집니다

AKO는 본격적인 NVIDIA GPU 최적화 캠페인에 가장 적합한 AI 에이전트 하네스입니다. 폭넓은 전문가 기준선 데이터, 반복 실행 가능한 캠페인 인프라, 독립 감사 기능을 가장 균형 있게 갖췄습니다. AKO 자체가 새로운 모델인 것은 아닙니다. Claude Code가 커널을 제안하고 벤치마크하며, 성과가 좋은 탐색 경로를 보존하고, 겉으로만 정답처럼 보이는 후보를 걸러낼 수 있도록 체계적인 환경을 제공합니다.

AMD 하드웨어라면 결론은 즉시 달라집니다. Apex는 ROCm에 특화된 선택지이고, AutoKernel은 일부 AMD Instinct 환경에서 활용할 수 있는 범용 대안입니다. 하드웨어 카운터에 기반한 NVIDIA 또는 Intel XPU 최적화 루프가 필요한 PyTorch 팀에는 KernelAgent가 더 잘 맞습니다. CUDA Agent는 이 목록에서 연구 잠재력이 가장 높지만, 현재 팀이 바로 도입할 수 있는 제품은 아닙니다.

아래 가격과 제공 여부는 2026년 8월 16일에 확인했습니다. 모두 셀프 호스팅 방식의 오픈소스 시스템이므로 시작 가격 $0은 소프트웨어 구독료가 없다는 뜻입니다. 모델 요금제와 API 사용료, 엔지니어 투입 시간, GPU 컴퓨팅 비용은 별도입니다.

가장 적합한 용도시작 가격무료 체험
AKO감사 가능한 NVIDIA 캠페인소프트웨어 $0 + 사용료해당 없음
KernelAgentPyTorch 및 NCU 기반 튜닝소프트웨어 $0 + 사용료해당 없음
AutoKernel간단한 야간 실험 루프소프트웨어 $0 + 사용료해당 없음
ApexAMD ROCm 최적화소프트웨어 $0 + 사용료해당 없음
CUDA Agent연구 및 벤치마크 분석판매하지 않음해당 없음

이 표에는 벤치마크 배수를 의도적으로 넣지 않았습니다. AKO의 전문가 기준선, KernelAgent의 torch.compile 비교, Apex의 7개 커널 검증, CUDA Agent의 KernelBench 결과, 그리고 보고된 232x 대회 결과는 각각 분모가 다릅니다. 이 수치들을 단순히 큰 순서대로 나열하면 정밀해 보일 뿐, 실질적인 의미는 거의 없습니다.

NVIDIA 최적화는 AKO, KernelAgent 또는 AutoKernel로, AMD ROCm은 Apex로, 연구 용도는 CUDA Agent로 연결하는 선택 흐름도
먼저 하드웨어 경로를 선택해야 합니다. 모델은 검증기와 런타임을 정한 뒤에 고릅니다.

판단 원칙은 간단합니다. 실제 가속기에서 프로파일링·검증·배포가 가능한 하네스를 먼저 고른 다음, 같은 하드웨어 경로 안에서 근거를 비교해야 합니다. 이론적으로 더 강력한 옵티마이저라도 하드웨어를 지원하지 않으면 비즈니스 가치는 0입니다.

232x라는 결과가 실제 GPU 비용에 미치는 영향

최근의 관심에는 분명한 근거가 있습니다. 2026년 8월 15일 Hacker News에 소개된 직접 경험담에서 Sankalp는 NVIDIA B200의 QR 분해 벤치마크를 대략 419,000마이크로초에서 1,805마이크로초로 개선했다고 밝혔습니다. 이것이 보고된 232x 결과입니다. 캠페인은 14일 동안 진행됐고 1,500건이 넘는 제출물을 만들었으며, 참가자 183명 중 12위로 마쳤습니다. 작성자는 108,803마이크로초에서 1,805마이크로초까지 이어진 103개의 연속 최고 기록을 추적했고, 감소율은 98.34%였습니다. 전체 설정과 주의사항을 포함한 실험 기록을 확인할 수 있습니다.

이는 워크플로의 가능성을 보여주는 인상적인 근거입니다. 하지만 프로덕션 모델의 비용이 232x 낮아진다는 증거는 아닙니다. 출발점은 특정 벤치마크에서 사용한 거친 구현이었습니다. 최종 결과는 사람의 방향 조정과 도메인 지식, 국소 최적점에서 벗어나기 위한 반복적인 시도 끝에 나왔습니다. 작성자는 약 3,000마이크로초에서 1,800마이크로초로 줄이는 과정이 특히 어려웠다고 설명하며, 단일 최적화 경로를 믿기보다 한 번에 3~5개의 후보를 탐색하라고 제안합니다.

빠져 있는 변수는 핫 커널 비중입니다. 최적화 대상 커널이 전체 워크로드 실행 시간에서 차지하는 비율을 뜻합니다. Amdahl의 법칙에 따르면 손대지 않은 시스템 영역이 전체 성능 향상의 상한을 결정합니다.

커널이 워크로드 시간의 25%를 차지하고 232x 빨라져도 이론상 전체 속도 향상은 1.3314x에 불과합니다. 이에 따른 이론상 비용 절감률은 24.8922%입니다. 같은 커널의 비중이 5%라면 전체 속도 향상은 1.0524x, 이론상 비용 절감률은 4.9784%로 내려갑니다.

매력적인 모델 데모보다 검증기가 더 중요한 이유도 여기에 있습니다. 후보가 반복 입력이나 캐시 동작, 느슨한 허용 오차, 제한된 입력 형태를 악용해 놀라운 로컬 점수를 얻을 수 있기 때문입니다. 프로덕션에서는 더 엄격하게 물어야 합니다. 새로운 값과 실제 서비스의 다양한 입력 형태, 실제 프레임워크 환경에서도 정확성을 유지하면서 엔드투엔드 지연 시간이나 비용을 줄이는가?

보고된 캠페인의 자체 비용도 참고할 만합니다. 당시 작성자는 월 $200의 ChatGPT Pro, 월 $20의 Claude Pro, Modal의 월 $30 Starter 크레딧을 사용할 수 있었습니다. 이 구독 덕분에 실험 진입 장벽은 낮아졌지만, 실제 작업 단위는 여전히 벤치마크·검토·수정·검증을 반복하는 장기 캠페인이었습니다. 에이전트는 탐색 비용을 줄였을 뿐, 올바른 탐색 공간을 정의할 필요까지 없애지는 않았습니다.

1. AKO: 검증된 NVIDIA 최적화 캠페인을 위한 최고의 선택

NVIDIA 커널 캠페인을 진행하고 Claude Code를 사용할 수 있다면 AKO가 가장 좋은 종합 선택입니다. AKO의 핵심 강점은 마법 같은 모델이 아닙니다. 기존 코딩 에이전트를 벤치마크 하네스, 캠페인 메모리, 프로파일링, 적대적 감사가 결합된 기록 가능한 최적화 프로세스로 바꿔 줍니다.

AKO GPU 커널 최적화 프로젝트 페이지
AKO

유용한 진입점은 두 가지입니다. AKO4ALL은 Triton, CUDA, C++, TileLang, CuTe DSL, Python 또는 HIP으로 커널을 최적화할 때 바로 적용하는 스킬입니다. 탐색 과정과 Git 기록을 남기므로 사라지는 채팅 로그보다 결과를 훨씬 쉽게 점검할 수 있습니다. AKO4X는 더 큰 캠페인 시스템입니다. 단일 또는 다중 라운드를 실행하고, 실행 간 아카이브를 유지하며, 로컬이나 Modal에서 작업하고, NCU 프로파일을 수집하고, 명시적으로 허용된 경우 하네스를 발전시키며, 독립 감사를 수행할 수 있습니다.

AKO를 최우선으로 꼽은 이유는 마지막 기능에 있습니다. 공개 자료에는 포인터를 재사용한 상태에서 입력값을 바꾸기 전까지 성공으로 보였던 캐시 기반 후보가 나옵니다. 독립 검사에 들어가자 38개 검사에서 모두 실패했습니다. 관대한 벤치마크는 놓치고 프로덕션 장애가 뒤늦게 드러내는 전형적인 보상 해킹 사례입니다.

근거 공개 수준도 이례적으로 높습니다. AKO가 공개한 평가는 NVIDIA B200, CUDA 13.2, PyTorch 2.12, Triton 3.6, Claude Opus 4.7 또는 4.8을 사용했습니다. 10개 커널 패밀리와 471개 워크로드에서 9개 패밀리의 전문가 구현을 앞섰고, 기하평균 개선 폭은 1.14x~1.43x였다고 보고합니다. 특히 DSA sparse attention은 23개 워크로드 중 23개를 통과하며 30.71x를 기록했고, GDN prefill은 100개 중 100개를 통과하며 2.30x를 기록했습니다. AKO는 워크로드 범위와 실행 환경을 공개합니다. 덕분에 화려한 결과뿐 아니라 비교적 작은 개선도 같은 수준으로 평가할 수 있습니다.

실제로 구매 판단에 도움이 되는 것은 그 작은 결과들입니다. GQA decode의 범위는 0.85x1.81x, MLA decode는 0.84x1.98x, MLA prefill은 0.82x2.37x, RMSNorm은 0.96x1.67x입니다. GEMM은 cuBLAS를 이기지 못해 1.00x에 머물렀습니다. 즉 AKO도 개별 워크로드에서는 뒤처질 수 있고, 이미 성숙한 전문가 라이브러리를 개선하지 못할 때도 있습니다. 모든 화살표가 위만 가리키는 페이지보다 오히려 신뢰할 만한 결과입니다.

최적 용도: 반복 실행과 감사가 필요한 NVIDIA 커널 캠페인

핵심 강점: 독립 감사와 실행 간 캠페인 메모리

가격: MIT 라이선스로 셀프 호스팅하는 AKO4X 소프트웨어는 $0이며 Claude Code 및 GPU 사용료는 별도, 2026년 8월 16일 확인

무료 체험: 해당 없음

강점
잘하는 것
8 points

  • 10개 패밀리와 471개 워크로드에 걸친 전문가 기준선 결과를 공개합니다
  • 바로 적용하는 스킬과 심층 캠페인 시스템을 모두 지원합니다
  • 탐색 경로를 보존하고 여러 실행에서 지식을 재사용할 수 있습니다
  • 독립적인 새 입력값 감사로 벤치마크 악용을 직접 겨냥합니다
  • 현재 워크플로는 모든 에이전트를 동등한 핵심 대상으로 지원하지 않고 Claude Code에 연결돼 있습니다
  • 공개된 벤치마크 환경이 NVIDIA B200이므로 다른 가속기에서는 별도의 검증이 필요합니다
  • 일반적인 실행도 토큰 사용량이 많고 상당한 엔지니어링 검토가 필요할 수 있습니다
  • cuBLAS GEMM처럼 성숙한 커널은 경제적으로 의미 있는 개선 여지가 없을 수 있습니다

AKO가 제시한 일반적인 AKO4ALL 실행 규모는 약 55분, 입력 토큰 약 15,000개, 출력 토큰 약 253,000개, 캐시 읽기 토큰 약 1,760만 개, 캐시 쓰기 토큰 약 752,000개입니다. 이 사용 패턴에서는 캐싱 비용 구조와 모델 요금제 한도도 실제 예산에 포함해야 합니다. 오픈소스 하네스가 $0이어도 캠페인 전체가 무료인 것은 아닙니다.

  1. 프로덕션 워크로드 하나를 프로파일링합니다

    에이전트 세션을 열기 전에 전체 요청을 측정하고 커널이 실행 시간에서 차지하는 비중을 파악합니다. 대표적인 입력 형태와 dtype, 배치 크기, 워밍업 동작, 현재 엔드투엔드 비용을 기록합니다. 핫 커널이 아니라면 중단합니다.

  2. AKO4ALL 또는 AKO4X를 선택합니다

    범위가 명확한 커널 하나에는 AKO4ALL을 사용하고, 다중 라운드와 아카이브, NCU 프로파일링 또는 독립 캠페인 감사가 필요하면 AKO4X를 사용합니다. 제어 기능이 더 많다는 이유만으로 처음부터 큰 시스템을 선택할 필요는 없습니다.

  3. 기준 구현과 입력을 고정합니다

    기존 구현을 기준으로 삼습니다. 실제 프로덕션 입력 형태에 맞춰 정확성 검사를 만들고, 캐시된 출력으로 빠져나갈 수 없도록 새 입력값을 추가합니다. 하네스 변경이 명시적인 실험 대상이 아니라면 에이전트가 수정하지 못하도록 보호합니다.

  4. 상한을 정한 탐색을 실행합니다

    첫 실행은 B200 32시간과 $100 에이전트 요금제를 상한으로 잡습니다. 현재 Modal 가격 기준 엔지니어 투입 전 파일럿 비용은 $299.99입니다. 통과한 모든 후보와 정확한 실행 환경을 보존합니다.

  5. 독립적으로 감사합니다

    에이전트의 작업 컨텍스트 밖에서 우승 후보를 다시 실행합니다. 입력값을 바꾸고, 필요한 경우 포인터를 재사용하며, 경계 입력 형태와 반복 시험을 적용합니다. 자체 학습 루프 안에서만 이기는 후보는 탈락시킵니다.

  6. 엔드투엔드 투자 회수를 요구합니다

    실제 모델이나 서비스에 커널을 통합한 뒤 전체 워크로드의 지연 시간과 가속기 비용을 측정합니다. 관측된 월 절감액이 캠페인 시작 전에 정한 회수 기간 기준을 충족할 때만 배포합니다.

2. KernelAgent: PyTorch 네이티브 하드웨어 기반 루프의 최적 선택

코드를 계속 추측하게 하기보다 하드웨어 카운터를 근거로 옵티마이저가 판단하기를 원하는 PyTorch 팀에는 KernelAgent가 가장 잘 맞습니다. 이 오픈소스 프로젝트는 커널 생성, 프로파일링, 검증, 벤치마킹, 최적화를 멀티 에이전트 루프로 결합합니다.

KernelAgent GitHub 저장소
KernelAgent

가장 두드러지는 차별점은 프로파일러 피드백입니다. 시스템이 NVIDIA Nsight Compute 지표 28개를 수집하고 루프라인 모델을 이용해 후보를 메모리 병목, 연산 병목 또는 활용도 부족으로 분류한 뒤 다음 최적화 방향을 정합니다. 루프라인 모델은 커널의 제약 요인이 연산 능력인지, 메모리 이동인지, 낮은 점유율인지 판별하는 방법입니다. 이 진단이 다음 수정을 더 목적에 맞게 만듭니다.

루프 안에서 출력을 검증하고 CUDA event로 벤치마크하며, 설정된 라운드 한도나 수렴 시점 또는 speed-of-light 효율이 최소 95%에 도달하면 중단할 수 있습니다. 저장소에는 NVIDIA CUDA 완전 지원과 Intel XPU 지원이 명시돼 있지만 AMD ROCm은 지원하지 않습니다. Python 3.8~3.12가 설치된 Linux와 macOS에서 실행되며 Triton, PyTorch, OpenAI·Anthropic 또는 커스텀 모델 제공자가 필요합니다. 현재 지원 범위는 KernelAgent 저장소에서 확인할 수 있습니다.

공개 벤치마크는 KernelBench Level 1 작업 100개를 다룹니다. 작성자들은 이전 생성 커널 모음 대비 2.02x, 기본 torch.compile 대비 1.56x를 기록하고, 100개 작업 중 65개에서 torch.compile을 이겼으며 H100 루프라인의 89%에 도달했다고 보고합니다. 그보다 앞선 생성 시스템은 Level 1, Level 2, Level 3 작업 250개 전체에서 100% 정확성을 달성한 것으로 소개되지만, 이 정확성 수치를 최적화된 모든 KernelAgent 결과에 그대로 적용해서는 안 됩니다.

한 가지 실제 사례가 전체 평균보다 정직한 가치를 더 잘 보여줍니다. 행렬-벡터 구현의 실행 시간은 9.52밀리초에서 1.95밀리초로 줄었고, torch.compile은 2.09밀리초를 기록했습니다. 에이전트는 원래 구현을 크게 개선했지만, 바로 사용할 수 있는 컴파일러와 비교한 최종 격차는 훨씬 작았습니다. 따라서 경제성 기준선은 에이전트가 대체할 수 있는 가장 느린 코드가 아니라, 실제로 배포했을 최선의 시스템이어야 합니다.

최적 용도: 프로파일러 기반 반복 최적화를 원하는 NVIDIA CUDA 또는 Intel XPU 환경의 PyTorch 팀

핵심 강점: NCU 지표 28개를 이용한 루프라인 경로 설정

가격: Apache 2.0 라이선스의 소프트웨어는 $0이며 모델 제공자 및 GPU 사용료는 별도, 2026년 8월 16일 확인

무료 체험: 해당 없음

강점
잘하는 것
8 points

  • 하드웨어 카운터를 구체적인 최적화 방향으로 연결합니다
  • OpenAI, Anthropic, 커스텀 모델 제공자를 지원합니다
  • 루프 안에서 검증과 CUDA event 기반 타이밍을 수행합니다
  • PyTorch 팀이 커널 생성부터 하드웨어 기반 개선까지 이어갈 명확한 경로를 제공합니다
  • AMD ROCm을 지원하지 않습니다
  • 주된 공개 최적화 벤치마크가 프로덕션 모델 포트폴리오가 아니라 KernelBench Level 1에 한정됩니다
  • 종합 속도 향상 수치는 선택한 기준선에 따라 달라집니다
  • NCU 프로파일링 때문에 추가 환경과 도구가 필요합니다

깔끔한 PyTorch 네이티브 아키텍처와 모델 제공자 선택의 유연성을 중시한다면 KernelAgent가 두 번째 선택입니다. 대상이 이미 지원 스택에 있고 팀이 단순히 더 빠른 후보를 받는 데 그치지 않고 커널이 느린 이유까지 확인하고 싶다면 첫 번째 선택이 될 수 있습니다. 실행 간 아카이브와 적대적 감사 기능이 기본 제공되는 광범위한 자율 캠페인에는 상대적으로 덜 적합합니다.

3. AutoKernel: 간결한 야간 실험 루프에 가장 적합

Claude, Codex 또는 다른 코딩 에이전트로 밤새 단순한 프로파일링-수정-벤치마크 루프를 돌리고 싶은 팀에는 AutoKernel이 가장 실용적인 출발점입니다. 모델을 프로파일링하고 병목을 추출한 뒤 Triton 또는 CUDA C++ 코드를 수정하며, 후보별로 유지 또는 되돌리기를 결정하고, 마지막에는 전체 모델을 엔드투엔드로 검증합니다.

AutoKernel GitHub 저장소
AutoKernel

프로젝트 문서에는 5단계 정확성 검사와 루프라인 보고서를 포함하는 고정 벤치마크가 설명돼 있습니다. 개방형 코딩 에이전트가 커널 대신 테스트를 바꿔 점수를 올릴 수도 있기 때문에 고정 하네스는 중요합니다. AutoKernel의 루프는 모든 후보에 동일한 시험을 적용하고, 측정된 개선이 있을 때만 결과를 유지합니다.

계획 단계의 처리량도 쉽게 예산화할 수 있습니다. 문서는 실험 한 번에 약 90초, 시간당 약 40회, 하룻밤에 약 320회를 예상합니다. 이는 계획용 수치이지 보장 처리량은 아닙니다. 저장소에는 250개가 넘는 문제 모음에서 KernelBench 문제 하나당 50회부터 300회가 넘는 실험을 수행했다고도 나옵니다. 현재 루프와 요구사항은 AutoKernel 문서에서 확인할 수 있습니다.

폭넓은 하드웨어 지원은 분명한 장점입니다. 테스트를 거친 NVIDIA 대상에는 H100, A100, RTX 4090이 포함됩니다. 버전 1.3에서는 MI300X, MI325X, MI350X, MI355X용 AMD ROCm 지원이 추가됐습니다. Python 3.10 이상과 uv가 필요하며, 문서에는 9가지 커널 유형이 명시돼 있습니다.

근거의 한계도 그만큼 중요합니다. 공개 README는 하네스와 워크플로, 캠페인 규모를 설명하지만 지원 대상 전체를 아우르는 최신 독립 종합 벤치마크를 공개하지는 않습니다. 그렇다고 AutoKernel이 약하다는 뜻은 아닙니다. 정직한 도입 근거가 리더보드 우승이 아니라 배포 가능성과 실험 설계에 있다는 의미입니다.

최적 용도: 폭넓은 에이전트 호환성을 바탕으로 이해하기 쉬운 야간 루프를 원하는 팀

핵심 강점: 간단한 유지·되돌리기 실험과 최종 엔드투엔드 검증

가격: MIT 라이선스의 소프트웨어는 $0이며 코딩 에이전트 및 GPU 사용료는 별도, 2026년 8월 16일 확인

무료 체험: 해당 없음

강점
잘하는 것
8 points

  • Claude, Codex 또는 다른 코딩 에이전트와 함께 작동합니다
  • 테스트를 거친 NVIDIA 카드와 일부 최신 AMD Instinct 대상을 지원합니다
  • 고정된 5단계 정확성 검사를 사용합니다
  • 격리된 커널에서 멈추지 않고 전체 모델에서 결과를 검증합니다
  • 지원 하드웨어 전체를 아우르는 최신 독립 종합 결과가 공개돼 있지 않습니다
  • 문서에 제시된 실험 속도는 컴파일, 프로파일링, 커널 복잡도에 따라 달라집니다
  • 폭넓은 하드웨어 지원도 정확한 소프트웨어 스택에서 로컬 검증이 필요합니다
  • 범용 루프는 AKO4X보다 캠페인 메모리와 감사 깊이가 낮습니다

이미 신뢰하는 코딩 에이전트가 있고 부족한 실험 규율을 보완하려는 팀이라면 AutoKernel이 합리적인 첫 파일럿입니다. 야간 처리량과 에이전트 선택권이 NCU 기반 멀티 에이전트 설계보다 중요할 때 KernelAgent 대신 선택할 수 있습니다. 더 가벼운 루프가 필요하거나 목록에 있는 ROCm 대상이 필요하다면 AKO보다 적합합니다. 320회라는 숫자가 40회보다 자동으로 낫다고 생각해 선택해서는 안 됩니다. 탐색 품질은 하네스와 후보 다양성, 기준선에 달려 있습니다.

4. Apex: AMD ROCm 전용 경로의 최적 선택

지원되는 AMD ROCm 워크로드를 최적화할 때는 Apex가 가장 적합한 전용 선택지입니다. 여기서 말하는 Apex는 NVIDIA Apex가 아니라 AMD-AGI의 에이전트 옵티마이저이며, 운용 전제가 AMD Instinct 하드웨어에 명확히 맞춰져 있습니다.

AMD-AGI Apex GitHub 저장소
Apex

기본 대상은 MI355X이며 MI300X, MI300A, MI250X도 지원한다고 명시돼 있습니다. 실행 환경은 Ubuntu 22.04 이상, Python 3.10 이상, Node.js 18이 필요하고, 채점에는 ROCm 6.x 이상이 필요합니다. 현재 설정은 ROCm 7.2 PyTorch 휠을 설치합니다. Apex는 Claude Code, Codex 또는 Cursor를 오케스트레이션할 수 있지만 모델 사용 권한을 함께 제공하지는 않습니다. 현재 대상과 설정 범위는 Apex 저장소에 정리돼 있습니다.

워크플로도 프로덕션을 염두에 두고 있습니다. Apex는 워크로드를 벤치마크하고 병목을 찾은 뒤 에이전트에 최적화를 요청하고, Magpie로 채점하며, 1.05x를 넘는 후보를 통합하고, 엔드투엔드 벤치마크로 마무리합니다. aiter, vLLM, SGLang의 Python 또는 Triton 경로와 aiter HIP을 핫패치할 수 있습니다. 시스템 C++ 라이브러리나 단일 _C.so 확장은 핫패치할 수 없습니다. 이 제약은 지원 에이전트 목록보다 중요합니다. Apex가 교체할 수 없는 통합 영역 안에 병목이 있으면 캠페인이 해당 코드에 닿을 수 없기 때문입니다.

벤더 검증은 7개 커널을 다룹니다. all_reduce는 36.35x, fused_moe는 1.14x, rms_norm은 1.05x, 나머지 4개는 1.00x로 보고됐습니다. 36.35x는 커널 하나에서 나온 유용한 결과로 봐야지, 포트폴리오 전체의 예상 수익률로 일반화해서는 안 됩니다. 변화가 없었던 4개 커널은 승인 임계값이 코드를 그대로 둘 줄도 안다는 사실을 보여줍니다.

최적 용도: 지원되는 ROCm 핫패치 경로 안에 병목이 있는 AMD Instinct 팀

핵심 강점: ROCm을 중심으로 설계된 에이전트 최적화와 엔드투엔드 채점

가격: MIT 라이선스의 소프트웨어는 $0이며 모델 사용 및 AMD GPU 컴퓨팅 비용은 별도, 2026년 8월 16일 확인

무료 체험: 해당 없음

강점
잘하는 것
8 points

  • ROCm을 부가 기능으로 취급하지 않고 AMD 팀에 전용 경로를 제공합니다
  • Claude Code, Codex, Cursor를 지원합니다
  • 측정값 1.05x를 통합 임계값으로 사용합니다
  • 엔드투엔드 벤치마크로 마무리합니다
  • AMD ROCm만 지원합니다
  • 핫패치로 시스템 C++ 라이브러리나 단일 _C.so 확장에는 접근할 수 없습니다
  • 공개된 검증 세트가 7개 커널로 구성돼 있습니다
  • 큰 all-reduce 결과를 다른 커널에 일반화해서는 안 됩니다

프로덕션 대상이 지원되는 AMD 가속기이고 핫 코드가 핫패치 가능한 영역 안에 있다면 Apex가 최우선 추천으로 올라옵니다. 더 폭넓은 캠페인 구성이나 MI300X~MI355X 경로가 더 적합하다면 AutoKernel 버전 1.3이 대안입니다. 어느 쪽도 단순히 "AMD"라는 이유만으로 선택해서는 안 됩니다. 정확한 가속기와 ROCm 스택, 통합 지점을 확인해야 합니다.

5. CUDA Agent: 구매 대상이 아닌 최고의 연구 잠재력

CUDA Agent는 이 비교에서 가장 흥미로운 연구 시스템이지만 조달 대상으로는 가장 약합니다. ByteDance Seed와 Tsinghua University가 만든 이 프로젝트는 강화학습으로 CUDA 작업용 시스템을 훈련하며, 6,000개 예시 데이터셋과 코딩 에이전트 스킬, 에이전트 작업 디렉터리를 공개합니다.

CUDA Agent 연구 프로젝트 페이지
CUDA Agent

작성자들은 이 시스템을 CUDA 개발을 위해 강화학습으로 훈련된 최초의 시스템이라고 설명합니다. KernelBench 평가에서는 전체 통과율 98.8%, torch.compile보다 빠른 문제 비율 96.8%, torch.compile 대비 기하평균 속도 향상 2.11x를 보고합니다. Level 3에서는 통과율 94%, torch.compile보다 빠른 비율 90%, 기하평균 속도 향상 1.52x를 제시합니다. 벤치마크 설정은 CUDA Agent 프로젝트 페이지에서 확인할 수 있습니다.

실험 설정은 상당한 규모입니다. 컨텍스트 토큰은 최대 128,000개, 훈련은 150턴, 평가는 200턴입니다. 후보는 torch.compile보다 5% 넘게 빨라야 하고, 5개 입력 정확성 검사를 통과하며, 보호된 스크립트를 건드리지 않고, 웹 검색 없이 작동해야 했습니다. 이런 통제 덕분에 공개 결과는 보호 장치가 없는 코딩 에이전트 데모보다 훨씬 유용합니다.

구매를 가로막는 문제는 분명합니다. 프로젝트 사이트와 공개 저장소에는 다운로드할 수 있는 모델 가중치나 관리형 엔드포인트가 나와 있지 않습니다. 데이터셋과 스킬은 자체 시스템 개발에 참고할 수 있지만, 헤드라인 성과를 낸 훈련 모델 자체는 아닙니다. 실제 모델이나 서비스가 제공되기 전까지 CUDA Agent는 배포 가능한 최적화 제품이 아니라 연구 참고 자료입니다.

최적 용도: 에이전트 훈련, CUDA 탐색 경로, KernelBench 평가를 연구하는 팀

핵심 강점: 공개된 강화학습 설정과 작성자 보고 기준의 강력한 KernelBench 결과

가격: 판매하지 않음. 2026년 8월 16일 현재 공개 연구 산출물은 제공되지만 상용 요금제는 명시돼 있지 않음

무료 체험: 해당 없음

강점
잘하는 것
8 points

  • 대규모 훈련 및 평가 설정을 공개합니다
  • 6,000개 예시 데이터셋과 에이전트 산출물을 제공합니다
  • 보호된 스크립트와 측정 가능한 개선 임계값을 사용합니다
  • KernelBench Level 3까지 강력한 결과를 보고합니다
  • 다운로드할 수 있는 훈련 모델 가중치가 명시돼 있지 않습니다
  • 관리형 엔드포인트가 명시돼 있지 않습니다
  • KernelBench 성능만으로는 프로덕션 통합이나 비용 회수를 입증할 수 없습니다
  • CUDA 범위로는 AMD ROCm 관련 판단을 내릴 수 없습니다

CUDA Agent는 기술 관찰 목록에 두고, 그 평가 규율을 다른 주장에 적용하는 기준으로 활용하는 것이 좋습니다. 보고된 모델을 팀이 지금 구매할 수 있는 것처럼 조달 비교표에 넣어서는 안 됩니다. 연구의 상한선을 인용하는 것과 존재하지 않는 제품을 만들어 내는 것의 차이입니다.

어떤 팀이 어떤 툴을 선택해야 할까요?

NVIDIA를 사용하고 Claude Code를 쓸 수 있으며, 공개 수준이 가장 높은 캠페인 및 감사 체계를 원한다면 AKO를 선택합니다. 중요한 커널 패밀리가 있고 최적화 라운드를 반복해야 하며, 여러 실행의 탐색 경로를 보존할 만큼 예상 절감액이 충분할 때 특히 유용합니다.

PyTorch 중심 팀이 NCU 지표와 루프라인 분류에 근거해 옵티마이저의 다음 행동을 정하고 싶다면 KernelAgent를 선택합니다. 지원되는 NVIDIA 또는 Intel XPU 환경에서 더 빠른 후보를 받는 데 그치지 않고 하드웨어 병목의 원인까지 파악하려는 엔지니어에게 가장 자연스럽습니다.

운영 부담이 더 작은 출발점이 필요하다면 AutoKernel을 선택합니다. 기존 코딩 에이전트를 연결하고 모델을 프로파일링한 뒤 고정된 실험 절차를 밤새 실행할 수 있습니다. Codex가 중요하거나, 지원 목록에 있는 AMD Instinct 대상 때문에 AKO 또는 KernelAgent가 맞지 않을 때도 유연한 중간 경로가 됩니다.

지원되는 AMD Instinct 하드웨어를 사용하고 병목이 핫패치 가능한 aiter, vLLM, SGLang 또는 HIP 경로에 있다면 Apex를 선택합니다. AMD에서는 이 하드웨어 적합성이 AKO의 더 폭넓은 공개 캠페인 근거보다 우선합니다.

훈련 모델 가중치나 관리형 엔드포인트가 공개될 때까지 CUDA Agent는 연구, 재현 계획 또는 평가 설계에만 사용합니다.

명확한 우선순위는 하드웨어, 통합 영역, 검증기, 벤치마크 순입니다. 모델 이름은 그다음입니다. 이 필터를 통과한 시스템이 둘이라면 분모와 실패 범위, 엔드투엔드 결과를 공개하는 쪽을 고릅니다. 비교 가능한 작은 개선이 잘못된 기준선에 붙은 화려한 수치보다 가치가 큽니다.

전문 하네스를 둘러싼 오케스트레이션 계층까지 함께 선택해야 한다면 AI 에이전트 플랫폼 비교에서 관련 트레이드오프를 확인할 수 있습니다. 이 결정은 커널 루프 선택과 분리해서 다뤄야 합니다.

실제 비용: $299.99 파일럿으로 시작하고 투자 회수를 요구하세요

오픈소스라는 가격표는 가장 덜 중요한 비용 항목입니다. 실제 캠페인 비용에는 가속기 사용 시간, 에이전트 접근 권한, 컴파일 및 프로파일링 오버헤드, 전문가 검토가 모두 들어갑니다.

2026년 8월 16일 확인 당시 Modal의 NVIDIA B200 실시간 가격은 초당 $0.001736, 시간당 $6.2496였습니다. Starter 요금제는 월 $0에 컴퓨팅 비용이 추가되며, 월 $30 컴퓨팅 크레딧과 3개 좌석을 제공합니다. Team은 월 $250에 컴퓨팅 비용이 추가되고, 월 $100 컴퓨팅 크레딧과 무제한 좌석을 제공합니다. Enterprise는 맞춤형 컴퓨팅 가격을 제시합니다. 현재 요금은 Modal에서 공개합니다.

따라서 B200 32시간은 $199.99입니다. 여기에 $100 에이전트 요금제를 더하면 엔지니어 투입 전 첫 캠페인 예산은 $299.99가 됩니다. 성과 없는 아이디어는 중단할 수 있을 만큼 작고, 단순한 토큰 데모 이상을 실행할 만큼 큰 상한입니다.

현재 에이전트 이용 요금은 계획 수립에 참고할 만한 기준을 제공합니다. ChatGPT Plus는 월 $20입니다. ChatGPT Pro는 Plus 사용량의 5x를 제공하는 $100 옵션과 20x를 제공하는 $200 옵션이 있으며 둘 다 Codex를 포함합니다. Claude는 $0 Free 요금제, 연간 결제 시 월 $17이면서 $200를 선결제하거나 월간 결제 시 $20인 Claude Pro, 그리고 5x에 $100 또는 20x에 $200인 Max를 제공합니다. Claude Pro에는 Claude Code가 포함됩니다. 이 정보는 2026년 8월 16일 OpenAI의 Plus 안내, OpenAI의 Pro 안내, Anthropic 요금 페이지, Anthropic 요금제 안내에서 확인했습니다. API 과금은 다를 수 있으므로 모델 토큰 비용과 GPU 컴퓨팅 비용을 분리해야 합니다. 이 부분은 가장 저렴한 AI API 가이드에서 자세히 설명합니다.

이제 파일럿 비용을 프로덕션 청구액과 비교해 보겠습니다. 현재 표시 가격으로 B200 1대를 720시간 실행하면 $4,499.71입니다. 대상 커널이 워크로드의 25%를 차지하고 2x 빨라지면 전체 워크로드 비용은 12.5%, 즉 월 $562.46 절감됩니다. $299.99 파일럿은 약 16일 만에 회수됩니다.

커널 비중이 5%에 불과하면 같은 2x 커널 개선으로 절감되는 비용은 2.5%, 즉 월 $112.49입니다. 투자 회수 기간은 약 80일로 늘어납니다. 최적화 결과는 같아도 비즈니스 결과는 다릅니다.

핫 커널의 실행 시간 비중이 25%일 때와 5%일 때 $299.99 GPU 최적화 파일럿의 투자 회수 기간 비교
같은 2x 커널 개선도 해당 커널의 실행 시간 비중에 따라 파일럿 비용을 약 16일 또는 80일 만에 회수합니다.

이 계산은 한 측면에서는 의도적으로 보수적이고, 다른 측면에서는 불완전합니다. 표시 가격의 가속기 시간을 절감 기준으로 삼지만 엔지니어 투입 시간, 모델 토큰 비용 변동, 컴파일 오버헤드, 예약 용량 할인, 활용률 변화는 포함하지 않습니다. 장기 캠페인을 승인하기 전에 모든 입력값을 실제 청구액으로 바꿔야 합니다.

AI 기반 GPU 옵티마이저 선정 기준

이 글은 현재 공개된 문서와 근거를 비교한 것으로, 5개 시스템을 모두 같은 하드웨어에 설치해 실행했다는 뜻은 아닙니다. 제목도 테스트가 아니라 비교라고 쓴 이유입니다. 포함된 시스템은 GPU 커널 작업을 위한 구체적인 에이전트 또는 하네스 경로, 공개된 1차 자료, 적합한 사용자와 한계를 판단할 수 있을 만큼의 구현 정보를 모두 제공해야 했습니다.

순위는 6가지 기준으로 정했습니다.

  • 배포 가능성: 지금 관련 시스템을 확보해 실행할 수 있는가?
  • 하드웨어 적합성: 대상 가속기와 소프트웨어 스택을 명시적으로 지원하는가?
  • 정확성 검증의 엄격함: 하네스가 캐시된 답, 수정된 테스트, 제한된 입력 형태, 느슨한 허용 오차를 막는가?
  • 벤치마크 분모: 기준선이 명시돼 있고 실패 또는 변화 없는 사례가 공개되는가?
  • 엔드투엔드 검증: 격리된 커널을 개선한 뒤 실제 모델이나 서비스로 돌아가 검증하는가?
  • 비용 명확성: 첫 캠페인의 GPU 및 에이전트 예산을 제한할 수 있는가?

이 순위는 벤더가 제시한 배수를 평균 내지 않습니다. 근거의 품질과 운영 적합성, 로컬 벤치마크를 검증된 프로덕션 절감으로 전환할 가능성을 높게 평가합니다. 그래서 AKO의 1.14x~1.43x에 이르는 폭넓은 결과가 훨씬 큰 단일 수치보다 중요할 수 있고, CUDA Agent의 KernelBench 2.11x도 배포 가능한 모델이 없다는 한계를 넘어서지 못합니다.

사이트의 현재 상업 파트너 풀에는 GPU 커널 최적화와 자연스럽게 맞는 곳이 없습니다. 전화, CRM, 교육, 회계, 웹사이트 툴을 억지로 끼워 넣으면 글의 신뢰만 낮아집니다. 따라서 이 비교는 제휴 상품을 배치하지 않고 관련 시스템만 평가합니다.

피해야 할 선택

AMD ROCm에 KernelAgent를 사용하지 마세요. 현재 지원 목록에는 NVIDIA CUDA와 Intel XPU만 있으며 AMD ROCm은 없습니다. 프로파일러 기반 설계가 뛰어나도 지원하지 않는 런타임에서는 소용이 없습니다.

NVIDIA 작업에 AMD-AGI Apex를 사용하지 마세요. 여기서 다루는 Apex는 ROCm과 AMD Instinct용입니다. 별도의 혼합 정밀도 및 분산 훈련 프로젝트인 NVIDIA Apex와도 다릅니다. 엔지니어링 시간을 배정하기 전에 정확히 어떤 제품인지 확인해야 합니다.

CUDA Agent를 관리형 프로덕션 제품으로 구매하려 하지 마세요. 데이터셋과 스킬, 작업 산출물은 공개됐지만 훈련 모델 가중치와 엔드포인트는 명시돼 있지 않습니다. 연구 대상으로 살펴볼 수는 있지만 존재하는 서비스처럼 예산을 책정해서는 안 됩니다.

Claude Code가 승인된 의존성이 아니라면 AKO를 피하세요. 기존 에이전트를 제약하는 것이 현재 AKO 하네스의 핵심 가치이지만, 에이전트 적합성 역시 조달과 보안 검토 대상입니다.

파일럿 전에 독립 종합 벤치마크가 반드시 필요하다면 AutoKernel을 피하세요. 공개 자료는 루프와 지원 대상을 잘 설명하지만, 대상 전체를 아우르는 최신 독립 종합 결과는 제공하지 않습니다. 제한된 파일럿을 직접 실행하거나 요구사항에 더 가까운 근거를 가진 시스템을 선택해야 합니다.

무엇보다 단독 Claude Code 또는 Codex 세션을 완성된 옵티마이저로 포장한 접근은 피해야 합니다. 둘 다 커널을 작성하고 개선할 수 있고 AutoKernel이나 Apex가 이를 오케스트레이션할 수도 있지만, 진짜 제품은 주변의 프로파일러와 변경 불가능한 기준 구현, 정확성 테스트, 벤치마크 타이밍, 유지·되돌리기 로직, 배포 검사입니다. 이 하네스가 없으면 에이전트는 스스로 시험지를 채점하는 의욕 넘치는 커널 개발자일 뿐입니다.

자주 묻는 질문

Codex로 CUDA와 Triton 커널을 최적화할 수 있나요?

가능합니다. AutoKernel은 Triton 또는 CUDA C++ 최적화에 Codex를 명시적으로 지원하고, Apex는 지원되는 AMD ROCm 작업에서 Codex를 오케스트레이션할 수 있습니다. 하지만 Codex만으로 완전한 최적화 시스템이 되는 것은 아닙니다. 프로파일러, 보호된 정확성 하네스, 벤치마크, 유지·되돌리기 루프가 함께 필요합니다.

KernelAgent가 AutoKernel보다 좋은가요?

PyTorch 네이티브 루프와 NCU 지표, 루프라인 기반 NVIDIA 또는 Intel XPU 튜닝이 우선이라면 KernelAgent가 더 좋습니다. 더 간단한 야간 루프나 폭넓은 에이전트 선택권, 목록에 있는 NVIDIA 및 AMD Instinct 대상이 필요하면 AutoKernel이 더 적합합니다.

Apex로 NVIDIA GPU를 최적화할 수 있나요?

아닙니다. AMD-AGI Apex는 지원되는 AMD Instinct 하드웨어를 위한 ROCm 옵티마이저입니다. 완전히 다른 프로젝트이며 여기서 평가한 에이전트 옵티마이저가 아닌 NVIDIA Apex와 혼동하면 안 됩니다.

AMD GPU 최적화에 가장 좋은 AI 에이전트는 무엇인가요?

지원되는 AMD Instinct 워크로드가 핫패치 가능한 통합 영역 안에 있다면 Apex가 첫 번째 전용 선택입니다. MI300X, MI325X, MI350X, MI355X에는 AutoKernel 버전 1.3이 더 범용적인 대안입니다.

KernelBench 점수는 어떻게 비교해야 하나요?

모든 점수에 하드웨어, 작업 레벨, 기준선, 통과 정의, 정확성 검사 입력, 기하평균 방식을 함께 명시해야 합니다. torch.compile 대비 결과는 전문가 구현이나 거친 대회 기준선 대비 결과와 서로 바꿔 비교할 수 없습니다.

소규모 팀에도 GPU 커널 에이전트가 가치가 있나요?

프로파일링 결과 특정 커널이 반복적으로 발생하는 가속기 비용에서 충분한 비중을 차지한다면 가치가 있을 수 있습니다. $299.99 파일럿과 핫 커널 투자 회수 기준을 적용하고, 측정된 엔드투엔드 절감액으로 목표 기간 안에 비용을 회수할 수 없다면 중단해야 합니다.

월요일에 바로 할 일

5개 시스템을 모두 설치하지 마세요. 월요일 아침에는 대표 프로덕션 워크로드 하나를 프로파일링하고 가장 뜨거운 커널이 전체 실행 시간에서 차지하는 비중을 적습니다. 그런 다음 감사 가능한 NVIDIA 캠페인은 AKO, PyTorch 및 하드웨어 카운터 루프는 KernelAgent, 가벼운 야간 탐색은 AutoKernel, 지원되는 AMD ROCm은 Apex 가운데 하나만 선택합니다.

첫 실험은 B200 32시간과 $100 에이전트 요금제 또는 현재 하드웨어에서 이에 상응하는 수준으로 제한합니다. 기준 구현과 벤치마크를 고정하고, 새로운 입력값을 활용한 정확성 검사를 추가합니다. 우승 커널은 에이전트 자체 루프 밖에서도 검증을 통과하고 마이크로벤치마크뿐 아니라 전체 워크로드를 개선해야 합니다.

배포 기준은 한 문장입니다. 측정된 엔드투엔드 투자 회수가 없다면 두 번째 캠페인도 없습니다.

마지막 업데이트

2026년 9월 3일

카테고리Build

Google에서 이 사이트를 우선하기

Google 검색에서 omidsaffari.com을 선호 소스로 추가

omidsaffari.com을 선호 소스로 지정하면 Google이 Top Stories, AI Overviews, AI Mode에서 우선적으로 보여 줍니다.

Build의 다른 글

Build 글 전체 보기
뉴스레터

매주 일요일, 한 통의 편지. 뜨거운 의견이 아닌, 돌아가는 시스템.

AI 벤처 포트폴리오 운영에서 나오는 빌드 로그, 가동 중인 시스템, 현장 노트.

주간 발행. 스팸 없음. 언제든 해지 가능합니다.