Optimización de GPU con IA en 2026: AKO, KernelAgent, AutoKernel, Apex y CUDA Agent comparados
Comparamos cinco agentes de IA para optimizar GPU NVIDIA y AMD en 2026: rendimiento, compatibilidad, costos y una regla clara para medir el retorno.

Una aceleración publicada de 232x en un kernel de GPU todavía puede reducir la carga de trabajo completa menos de 5%. Por eso, en la optimización de GPU con IA, el mejor agente no es el que presume la cifra más alta, sino el que ofrece la ruta de hardware adecuada, un sistema de verificación implacable y un criterio de retorno de extremo a extremo.
Respuesta corta: AKO lidera la optimización de GPU con IA, pero el hardware cambia el orden
AKO es el mejor entorno de agente de IA para una campaña seria de optimización en GPU NVIDIA. Reúne la evidencia más sólida frente a implementaciones de expertos, una infraestructura de campañas repetible y auditorías independientes. No es un modelo nuevo: proporciona a Claude Code un entorno disciplinado para proponer kernels, medirlos, conservar las trayectorias útiles y detectar candidatos que solo aparentan ser correctos.
El veredicto cambia de inmediato en hardware AMD. Apex es la opción específica para ROCm, mientras que AutoKernel ofrece una alternativa más general para determinados aceleradores AMD Instinct. KernelAgent encaja mejor en equipos de PyTorch que buscan un ciclo para NVIDIA o Intel XPU guiado por contadores de hardware. CUDA Agent alcanza aquí el mayor potencial de investigación, pero hoy no es un producto que un equipo pueda contratar y poner en marcha.
Los precios y la disponibilidad que aparecen a continuación se verificaron el 16 de agosto de 2026. Todos son sistemas open source autohospedados, así que un precio inicial de $0 significa que no existe una suscripción de software. El plan del modelo, el uso de la API, el tiempo de ingeniería y el cómputo de GPU se pagan por separado.
La tabla omite a propósito los multiplicadores de rendimiento. Las referencias de expertos de AKO, la comparación de KernelAgent con torch.compile, la validación de siete kernels de Apex, el resultado de CUDA Agent en KernelBench y el resultado publicado de 232x en una competencia utilizan denominadores diferentes. Ordenar esas cifras de mayor a menor daría una falsa sensación de precisión y aportaría muy poco.

La regla de decisión es simple: elija el entorno que pueda perfilar, verificar y desplegar en su acelerador real; después compare la evidencia dentro de esa ruta. Un optimizador teóricamente superior sobre hardware no compatible tiene un valor empresarial de cero.
Qué significa realmente el resultado de 232x para la factura de GPU
El entusiasmo actual tiene una base real. En un relato de primera mano que llegó a Hacker News el 15 de agosto de 2026, Sankalp contó cómo mejoró un benchmark de descomposición QR en una NVIDIA B200 desde unos 419,000 microsegundos hasta 1,805 microsegundos. Ese es el resultado publicado de 232x. La campaña duró 14 días, generó más de 1,500 envíos y terminó en el puesto 12 entre 183 participantes. El autor registró 103 nuevas mejores marcas sucesivas, desde 108,803 hasta 1,805 microsegundos, lo que supone una reducción de 98.34%. Lea el experimento con toda su configuración y sus salvedades.
Es una evidencia notable a favor del método de trabajo. No demuestra que un modelo en producción vaya a ser 232x más barato. El punto de partida era una implementación básica de un benchmark concreto. El resultado final llegó después de orientación humana, conocimiento del dominio y varios intentos por escapar de óptimos locales. El autor explica lo difícil que fue pasar de unos 3,000 a 1,800 microsegundos y propone explorar entre tres y cinco candidatos en paralelo, en lugar de confiar en una sola ruta de optimización.
La variable que falta es la proporción del kernel crítico: el porcentaje del tiempo total de la carga de trabajo que se consume dentro del kernel optimizado. La ley de Amdahl establece que la parte del sistema que no cambia impone un límite absoluto a la mejora total.
Si el kernel consume 25% del tiempo de la carga y se vuelve 232x más rápido, la aceleración total teórica es de apenas 1.3314x. La reducción de costos teórica correspondiente es de 24.8922%. Si ese mismo kernel solo consume 5% del tiempo, la aceleración total baja a 1.0524x y la reducción de costos teórica a 4.9784%.
Por eso también importa más un verificador que una demostración vistosa de un modelo. Un candidato puede aprovechar entradas repetidas, el comportamiento de la caché, una tolerancia débil o una forma muy específica y aun así obtener una puntuación local espectacular. La pregunta en producción es mucho más exigente: ¿sigue siendo correcto con valores nuevos, para todas las formas que utiliza el servicio y dentro del framework real, mientras reduce la latencia o el costo de extremo a extremo?
El costo de la propia campaña publicada también resulta revelador. En ese momento, el autor disponía de ChatGPT Pro por $200 al mes, Claude Pro por $20 al mes y el crédito mensual Starter de Modal por $30. Esas suscripciones hicieron accesible la experimentación, pero la unidad de trabajo útil siguió siendo una campaña larga de medir, inspeccionar, editar y verificar. El agente redujo el costo de explorar el espacio; no eliminó la necesidad de definir el espacio correcto.
1. AKO: la mejor opción general para campañas verificadas en NVIDIA
AKO es la mejor elección general cuando el objetivo es una campaña de kernels NVIDIA y el equipo puede utilizar Claude Code. Su ventaja decisiva no es un modelo mágico. AKO convierte un agente de programación existente en un proceso de optimización registrado que incluye un entorno de benchmarks, memoria de campaña, perfilado y una auditoría adversarial.

Hay dos puntos de entrada útiles. AKO4ALL es la skill lista para integrar que permite optimizar un kernel mediante Triton, CUDA, C++, TileLang, CuTe DSL, Python o HIP. Registra la trayectoria y el historial de Git, por lo que el resultado se puede inspeccionar mucho mejor que una conversación que desaparece. AKO4X es el sistema de campaña más amplio: puede ejecutar una o varias rondas, conservar un archivo entre ejecuciones, trabajar de forma local o en Modal, recopilar perfiles de NCU, hacer evolucionar el entorno de pruebas cuando se autoriza de manera explícita y efectuar una auditoría independiente.
Esta última función explica por qué AKO ocupa el primer lugar. El material publicado muestra un candidato almacenado en caché que parecía funcionar hasta que una comprobación independiente cambió los valores de entrada y reutilizó los punteros. Entonces falló las 38 pruebas. Es exactamente el tipo de manipulación de la recompensa que un benchmark permisivo pasa por alto y que un incidente de producción descubre demasiado tarde.
La evidencia se presenta con un nivel de detalle poco habitual. La evaluación publicada de AKO utilizó una NVIDIA B200 con CUDA 13.2, PyTorch 2.12, Triton 3.6 y Claude Opus 4.7 o 4.8. En 10 familias de kernels y 471 cargas de trabajo, los autores informan que superaron la implementación experta en nueve familias, con mejoras de la media geométrica entre 1.14x y 1.43x. Entre los casos más destacados figuran 30.71x para la atención dispersa DSA, con 23 de 23 cargas superadas, y 2.30x para el prefill de GDN, con 100 de 100 aprobadas. AKO publica los rangos de carga y el entorno, lo que hace que los resultados más modestos sean tan valiosos como los grandes.
Esos resultados modestos son precisamente la señal de compra. El decode de GQA incluye un rango de 0.85x a 1.81x; el decode de MLA, de 0.84x a 1.98x; el prefill de MLA, de 0.82x a 2.37x; y RMSNorm, de 0.96x a 1.67x. GEMM se mantuvo en 1.00x porque no logró superar a cuBLAS. Dicho de otro modo, AKO pierde en algunas cargas concretas y, en ocasiones, no consigue mejorar una biblioteca experta madura. Eso resulta más creíble que una página donde todas las flechas apuntan hacia arriba.
Ideal para: equipos con NVIDIA que ejecutan campañas de kernels repetibles y auditadas
Lo más destacado: auditoría independiente y memoria de campaña entre ejecuciones
Precio: $0 por el software AKO4X autohospedado bajo licencia MIT; Claude Code y el uso de GPU se pagan por separado, verificado el 16 de agosto de 2026
Prueba gratuita: no aplica
- Publica resultados frente a implementaciones expertas en 10 familias y 471 cargas de trabajo
- Ofrece tanto una skill lista para integrar como un sistema de campaña más completo
- Conserva las trayectorias y puede reutilizar conocimiento entre ejecuciones
- La auditoría independiente con valores nuevos ataca directamente la explotación del benchmark
- El flujo actual depende de Claude Code, sin ofrecer el mismo nivel de soporte nativo para todos los agentes
- El entorno de benchmark publicado utiliza NVIDIA B200, por lo que otros aceleradores necesitan sus propias pruebas
- Una ejecución habitual consume muchos tokens y todavía puede exigir una revisión de ingeniería considerable
- Los kernels maduros, como GEMM de cuBLAS, pueden no dejar ninguna mejora económica por descubrir
AKO sitúa una ejecución típica de AKO4ALL en unos 55 minutos, cerca de 15,000 tokens de entrada, 253,000 tokens de salida, 17.6 millones de tokens leídos desde caché y 752,000 tokens escritos en caché. Con ese perfil, la economía del almacenamiento en caché y los límites del plan del modelo forman parte del presupuesto real. El entorno open source puede costar $0, pero la campaña no.
Perfile una carga de trabajo de producción
Mida la solicitud completa e identifique qué proporción del tiempo de ejecución pertenece al kernel antes de abrir una sesión con el agente. Registre las formas, los dtypes, los tamaños de lote, el calentamiento y el costo actual de extremo a extremo que sean representativos. Si el kernel no es crítico, deténgase.
Elija AKO4ALL o AKO4X
Utilice AKO4ALL para un solo kernel bien delimitado y AKO4X cuando el trabajo requiera varias rondas, un archivo, perfilado con NCU o auditorías independientes de la campaña. No empiece con el sistema más grande solo porque ofrece más controles.
Bloquee la referencia y las entradas
Considere la implementación existente como referencia. Cree comprobaciones de corrección para las formas reales de producción y agregue valores nuevos que impidan los atajos basados en resultados almacenados en caché. Proteja el entorno de pruebas frente a las ediciones del agente, salvo que su evolución forme parte explícita del experimento.
Ejecute una búsqueda con límites
Para una primera prueba, limite el cómputo a 32 horas de B200 y combínelo con un plan de agente de $100. A los precios actuales de Modal, se trata de un piloto de $299.99 antes de sumar el tiempo de ingeniería. Conserve cada candidato aceptado junto con su entorno exacto.
Audite de forma independiente
Vuelva a ejecutar el ganador fuera del contexto de trabajo del agente, con valores cambiados, punteros reutilizados cuando corresponda, formas límite y varias repeticiones. Se rechaza cualquier candidato que solo gane dentro de su propio ciclo de entrenamiento.
Exija un retorno de extremo a extremo
Integre el kernel en el modelo o servicio real y mida después la latencia de la carga completa y el costo del acelerador. Despliegue únicamente si el ahorro mensual observado cumple el plazo de retorno definido antes de la campaña.
2. KernelAgent: el mejor ciclo nativo de PyTorch guiado por hardware
KernelAgent es la opción que mejor encaja en un equipo de PyTorch que quiere que el optimizador razone a partir de contadores de hardware, en vez de limitarse a probar cambios de código a ciegas. El proyecto open source combina generación de kernels, perfilado, verificación, benchmarking y optimización dentro de un ciclo multiagente.

Su diferencia más importante está en la información que devuelve el perfilador. El sistema recopila 28 métricas de NVIDIA Nsight Compute, utiliza un modelo roofline para clasificar un candidato como limitado por memoria, limitado por cómputo o infrautilizado, y orienta la siguiente optimización en función del diagnóstico. Un modelo roofline es, sencillamente, una forma de determinar si el kernel está restringido por la capacidad aritmética, el movimiento de memoria o una ocupación deficiente. Así, la siguiente edición tiene un propósito más claro.
El ciclo verifica los resultados, mide el rendimiento con eventos de CUDA y puede detenerse al alcanzar el límite de rondas configurado, la convergencia o al menos 95% de la eficiencia respecto al límite teórico. El repositorio indica soporte completo para NVIDIA CUDA e Intel XPU, pero no para AMD ROCm. Funciona en Linux y macOS con Python 3.8 a 3.12, y requiere Triton, PyTorch y un proveedor de modelos de OpenAI, Anthropic o personalizado. El repositorio de KernelAgent contiene la matriz de compatibilidad actual.
El benchmark publicado abarca 100 tareas de KernelBench Level 1. Los autores informan un rendimiento de 2.02x frente a un conjunto anterior de kernels generados, 1.56x frente a torch.compile de forma predeterminada, victorias sobre torch.compile en 65 de 100 tareas y 89% del roofline de H100. A un sistema de generación anterior se le atribuye 100% de corrección en 250 tareas de Level 1, Level 2 y Level 3; esa cifra de corrección no debe trasladarse sin más a todos los resultados optimizados de KernelAgent.
Un caso práctico refleja mejor el valor real que el agregado. Una implementación de matriz-vector bajó de 9.52 milisegundos a 1.95 milisegundos, mientras que torch.compile llegó a 2.09 milisegundos. El agente aceleró de manera drástica la implementación original, pero la ventaja final sobre el compilador disponible fue mucho menor. De ahí que la referencia económica deba ser el mejor sistema que se desplegaría como alternativa, no el código más lento que el agente pueda sustituir.
Ideal para: equipos de PyTorch con NVIDIA CUDA o Intel XPU que buscan iteraciones guiadas por el perfilador
Lo más destacado: decisiones basadas en roofline a partir de 28 métricas de NCU
Precio: $0 por el software bajo Apache 2.0; el uso del proveedor de modelos y de GPU se paga por separado, verificado el 16 de agosto de 2026
Prueba gratuita: no aplica
- Convierte los contadores de hardware en una dirección concreta de optimización
- Admite proveedores de modelos de OpenAI, Anthropic y personalizados
- Integra verificación y medición con eventos de CUDA en el ciclo
- Ofrece a los equipos de PyTorch una ruta clara desde la generación del kernel hasta su mejora guiada por hardware
- No admite AMD ROCm
- El principal benchmark de optimización publicado corresponde a KernelBench Level 1, no a una cartera de modelos en producción
- Las aceleraciones agregadas dependen de la referencia elegida
- El perfilado mediante NCU añade requisitos de entorno y herramientas
KernelAgent debe ser la segunda opción cuando se valora una arquitectura limpia y nativa de PyTorch, además de la libertad para elegir proveedor. Pasa al primer lugar si el objetivo ya se encuentra dentro de su stack compatible y el equipo quiere entender por qué un kernel es lento. Encaja peor en una campaña autónoma amplia que necesite archivos entre ejecuciones y mecanismos de auditoría adversarial desde el primer momento.
3. AutoKernel: el mejor ciclo sencillo de experimentación nocturna
AutoKernel es el punto de partida práctico para un equipo que quiere dejar a Claude, Codex u otro agente de programación ejecutando durante la noche un ciclo directo de perfilar, editar y medir. La herramienta perfila el modelo, extrae los cuellos de botella, modifica Triton o CUDA C++, conserva o revierte cada candidato y verifica al final el modelo completo de extremo a extremo.

El proyecto documenta un benchmark fijo con cinco etapas de comprobación de corrección y un informe roofline. Que el entorno sea fijo es importante: de otro modo, un agente de programación sin restricciones podría mejorar la puntuación modificando la prueba y no el kernel. El ciclo de AutoKernel somete cada candidato al mismo examen y conserva solo las mejoras medidas.
La velocidad prevista facilita la elaboración del presupuesto. La documentación calcula unos 90 segundos por experimento, cerca de 40 experimentos por hora y unos 320 durante la noche. Son cifras de planificación, no un rendimiento garantizado. El repositorio también describe entre 50 y más de 300 experimentos por problema de KernelBench en un conjunto de más de 250 problemas. AutoKernel documenta el ciclo y los requisitos actuales.
La variedad de hardware es una ventaja auténtica. Entre los objetivos NVIDIA probados están H100, A100 y RTX 4090. La versión 1.3 incorporó soporte para AMD ROCm en MI300X, MI325X, MI350X y MI355X. La herramienta requiere Python 3.10 o posterior y uv, y documenta nueve tipos de kernel.
El límite de la evidencia es igual de importante: el README público explica el entorno, el flujo de trabajo y la escala de la campaña, pero no publica un benchmark agregado e independiente actualizado para todos los objetivos compatibles. Esto no convierte a AutoKernel en una herramienta débil. Significa que el argumento de compra honesto se apoya en su facilidad de despliegue y en el diseño de los experimentos, no en una victoria de clasificación.
Ideal para: equipos que buscan un ciclo nocturno comprensible y compatible con varios agentes
Lo más destacado: experimentos sencillos que conservan o revierten cada cambio, más una verificación final de extremo a extremo
Precio: $0 por el software bajo licencia MIT; el agente de programación y el uso de GPU se pagan por separado, verificado el 16 de agosto de 2026
Prueba gratuita: no aplica
- Funciona con Claude, Codex u otro agente de programación
- Admite tarjetas NVIDIA probadas y determinados aceleradores AMD Instinct modernos
- Utiliza una comprobación de corrección fija de cinco etapas
- Verifica el resultado en el modelo completo, en vez de detenerse en un kernel aislado
- No existe un resultado agregado e independiente actualizado para todo el hardware compatible
- La velocidad de experimentación documentada variará según la compilación, el perfilado y la complejidad del kernel
- La compatibilidad amplia con hardware todavía debe validarse en el stack de software exacto
- Un ciclo general ofrece menos memoria de campaña y profundidad de auditoría que AKO4X
AutoKernel es el primer piloto sensato para un equipo que ya confía en su agente de programación y necesita disciplina experimental. Conviene elegirlo antes que KernelAgent cuando importan más el volumen de pruebas nocturnas y la elección del agente que un diseño multiagente guiado por NCU. También puede superar a AKO cuando el equipo busca un ciclo más ligero o necesita uno de los objetivos ROCm enumerados. No debe elegirse porque 320 experimentos parezcan necesariamente mejores que 40: la calidad de la búsqueda depende del entorno de pruebas, la variedad de candidatos y la referencia.
4. Apex: la mejor ruta específica para AMD ROCm
Apex es la mejor opción especializada para optimizar cargas compatibles con AMD ROCm. Se trata del optimizador con agentes de AMD-AGI, no de NVIDIA Apex, y sus supuestos operativos están vinculados de forma explícita al hardware AMD Instinct.

El objetivo predeterminado es MI355X, con soporte declarado para MI300X, MI300A y MI250X. El entorno requiere Ubuntu 22.04 o posterior, Python 3.10 o posterior, Node.js 18 y ROCm 6.x o posterior para la evaluación. La configuración actual instala una distribución de PyTorch para ROCm 7.2. Apex puede coordinar Claude Code, Codex o Cursor, pero no incluye el acceso al modelo. El repositorio de Apex enumera los objetivos y límites actuales de configuración.
El flujo de trabajo está pensado para producción. Apex mide la carga, identifica un cuello de botella, solicita una optimización al agente, la evalúa con Magpie, integra candidatos por encima de 1.05x y termina con un benchmark de extremo a extremo. Puede aplicar hotpatches a rutas de Python o Triton en aiter, vLLM y SGLang, así como a aiter HIP. No puede hacerlo en bibliotecas C++ del sistema ni en extensiones monolíticas _C.so. Ese límite importa más que la lista de agentes: si el cuello de botella queda detrás de una superficie de integración que Apex no puede reemplazar, la campaña no podrá alcanzarlo.
La validación del proveedor contiene siete kernels. Registra 36.35x para all_reduce, 1.14x para fused_moe, 1.05x para rms_norm y 1.00x para los cuatro restantes. El caso de 36.35x es un resultado valioso en un kernel, no el retorno esperado de toda una cartera. Los cuatro kernels sin cambios demuestran que el umbral de aceptación también puede decidir correctamente que el código se quede como está.
Ideal para: equipos con AMD Instinct cuyo cuello de botella sea accesible a través de una ruta compatible con hotpatches de ROCm
Lo más destacado: optimización con agentes y evaluación de extremo a extremo diseñadas alrededor de ROCm
Precio: $0 por el software bajo licencia MIT; el acceso al modelo y el cómputo en GPU AMD se pagan por separado, verificado el 16 de agosto de 2026
Prueba gratuita: no aplica
- Ofrece a los equipos de AMD una ruta específica en lugar de tratar ROCm como un añadido secundario
- Admite Claude Code, Codex y Cursor
- Aplica un umbral de integración medido de 1.05x
- Termina con un benchmark de extremo a extremo
- Solo funciona con AMD ROCm
- Los hotpatches no pueden alcanzar bibliotecas C++ del sistema ni extensiones monolíticas _C.so
- El conjunto de validación publicado contiene siete kernels
- El gran resultado de all-reduce no debe generalizarse a los demás kernels
Apex se convierte en la principal recomendación en cuanto el objetivo de producción es un acelerador AMD compatible y el código crítico se encuentra en una superficie que puede parchear. AutoKernel versión 1.3 es la alternativa cuando resultan más adecuados sus mecanismos generales de campaña o su ruta para los modelos MI300X a MI355X enumerados. Ninguna decisión debe tomarse solo porque aparezca la palabra «AMD»: hay que comprobar el acelerador, el stack de ROCm y el punto de integración exactos.
5. CUDA Agent: el mayor potencial de investigación, pero no una opción de compra
CUDA Agent es el sistema de investigación más interesante de esta comparación y la alternativa menos viable para compras. El proyecto de ByteDance Seed y Tsinghua University entrena mediante aprendizaje por refuerzo un sistema especializado en CUDA, y publica un dataset de 6,000 ejemplos, una skill para agentes de programación y un directorio de trabajo del agente.

Los autores lo describen como el primer sistema entrenado con aprendizaje por refuerzo para desarrollar en CUDA. Su evaluación en KernelBench registra una tasa general de aprobación de 98.8%, con 96.8% de los problemas más rápidos que torch.compile y una aceleración de media geométrica de 2.11x frente a torch.compile. En Level 3, informan una tasa de aprobación de 94%, 90% de resultados más rápidos que torch.compile y una aceleración de media geométrica de 1.52x. La página del proyecto CUDA Agent detalla la configuración del benchmark.
La configuración es considerable: hasta 128,000 tokens de contexto, 150 turnos de entrenamiento y 200 turnos de evaluación. Para aprobar, un candidato debía superar a torch.compile por más de 5%, pasar una comprobación de corrección con cinco entradas, no modificar los scripts protegidos y trabajar sin recuperación de información desde la web. Estos controles hacen que el resultado publicado sea más informativo que una demostración de un agente sin restricciones.
La barrera de compra es concreta. Ni el sitio del proyecto ni el repositorio público incluyen pesos del modelo para descargar o un endpoint administrado. Un dataset y una skill pueden orientar el diseño de un sistema propio, pero no equivalen al producto entrenado que describe el resultado principal. Hasta que el modelo o servicio real esté disponible, CUDA Agent seguirá siendo una referencia de investigación y no un proveedor de optimización que pueda desplegarse.
Ideal para: investigadores que estudian el entrenamiento de agentes, las trayectorias de CUDA y la evaluación en KernelBench
Lo más destacado: configuración publicada de aprendizaje por refuerzo y un sólido resultado en KernelBench informado por los autores
Precio: no se vende; hay artefactos públicos de investigación, sin nivel comercial anunciado al 16 de agosto de 2026
Prueba gratuita: no aplica
- Publica una configuración de entrenamiento y evaluación a gran escala
- Libera un dataset de 6,000 ejemplos y artefactos del agente
- Utiliza scripts protegidos y un umbral de mejora medido
- Informa resultados sólidos hasta KernelBench Level 3
- No se publican pesos del modelo entrenado para descargar
- No se ofrece un endpoint administrado
- El rendimiento en KernelBench no demuestra integración en producción ni retorno económico
- Su alcance en CUDA no resuelve la decisión sobre AMD ROCm
Mantenga CUDA Agent en la lista de seguimiento técnico y utilice su disciplina de evaluación como referencia para juzgar otras afirmaciones. No lo incluya en una comparación de compras como si un equipo pudiera adquirir hoy el modelo evaluado. Esa diferencia separa una referencia válida sobre el potencial de la investigación de un producto inventado.
Qué herramienta conviene en cada caso
Elija AKO si utiliza NVIDIA, puede trabajar con Claude Code y busca la infraestructura de campaña y auditoría mejor documentada. Resulta especialmente convincente cuando existe una familia de kernels importantes, habrá varias rondas de optimización y el ahorro potencial justifica conservar las trayectorias entre ejecuciones.
Elija KernelAgent si el equipo trabaja en PyTorch y quiere que la siguiente decisión del optimizador se apoye en métricas de NCU y una clasificación roofline. Es la opción más natural para entornos compatibles con NVIDIA o Intel XPU en los que los ingenieros desean entender el cuello de botella del hardware, no solo aceptar un candidato más rápido.
Elija AutoKernel si necesita dar un paso operativo más pequeño: conectar un agente de programación existente, perfilar el modelo y ejecutar durante la noche una secuencia fija de experimentos. También es la ruta intermedia más flexible cuando Codex es importante o cuando un objetivo AMD Instinct enumerado hace que AKO o KernelAgent encajen mal.
Elija Apex si la carga se ejecuta en hardware AMD Instinct compatible y el cuello de botella reside en una ruta de aiter, vLLM, SGLang o HIP que admita parches. En AMD, esta correspondencia con el hardware pesa más que la evidencia de campaña más amplia de AKO.
Elija CUDA Agent únicamente para investigación, planificación de réplicas o diseño de evaluaciones, hasta que estén disponibles los pesos entrenados o un endpoint administrado.
El orden de filtros es explícito: primero el hardware, después la superficie de integración, luego el verificador y, por último, el benchmark. El nombre del modelo viene más tarde. Si dos sistemas superan esos filtros, conviene elegir el que muestre el denominador, los rangos de fallos y el resultado de extremo a extremo. Una mejora menor pero comparable vale más que una cifra espectacular calculada frente a la referencia equivocada.
Para la decisión más amplia sobre la capa de coordinación que rodea a un entorno especializado, la comparación de plataformas de agentes de IA analiza los demás criterios. Esa elección debe mantenerse separada del propio ciclo del kernel.
El costo real: empiece con un piloto de $299.99 y exija retorno
El precio open source es la partida menos importante. Una campaña real combina tiempo de acelerador, acceso al agente, sobrecarga de compilación y perfilado, y revisión de especialistas.
Cuando se comprobó el 16 de agosto de 2026, el precio vigente de Modal para una NVIDIA B200 era de $0.001736 por segundo, o $6.2496 por hora. Su plan Starter cuesta $0 al mes más el cómputo, incluye un crédito mensual de cómputo de $30 y admite tres usuarios. Team cuesta $250 al mes más el cómputo, incluye un crédito mensual de cómputo de $100 y admite usuarios ilimitados. Enterprise anuncia precios de cómputo personalizados. Modal publica las tarifas actuales.
Así, 32 horas de B200 cuestan $199.99. Al sumar un plan de agente de $100, el presupuesto de la primera campaña llega a $299.99 antes del tiempo de ingeniería. El límite se ha fijado lo bastante bajo para descartar una idea débil y lo bastante alto para superar una demostración mínima.
Las opciones actuales de acceso a agentes ofrecen varios puntos de referencia para planificar. ChatGPT Plus cuesta $20 al mes. ChatGPT Pro ofrece una opción de $100 con 5x el uso de Plus y otra de $200 con 20x; ambas incluyen Codex. Claude tiene un plan Free de $0, Claude Pro por $17 al mes con facturación anual pagada como $200 por adelantado o por $20 con facturación mensual, y Max por $100 para 5x o $200 para 20x. Claude Pro incluye Claude Code. Estos datos se verificaron el 16 de agosto de 2026 a partir de la información de Plus de OpenAI, la información de Pro de OpenAI, la página de precios de Anthropic y la guía de planes de Anthropic. La facturación de la API puede ser diferente, así que el costo de tokens del modelo debe separarse del cómputo en GPU; la guía de las API de IA más económicas explica esa capa.
Ahora compare el piloto con una factura de producción. Una B200 en funcionamiento durante 720 horas cuesta $4,499.71 a la tarifa de lista vigente. Si el kernel objetivo consume 25% de la carga de trabajo y se vuelve 2x más rápido, el conjunto ahorra 12.5%, o $562.46 al mes. El piloto de $299.99 se amortiza en unos 16 días.
Si el kernel consume solo 5%, la misma mejora de 2x en el kernel ahorra 2.5%, o $112.49 al mes. El retorno se alarga hasta unos 80 días. El resultado de optimización es idéntico; el resultado empresarial no.

El cálculo es deliberadamente conservador en un aspecto e incompleto en otro. Toma como base de ahorro el tiempo del acelerador a precio de lista, pero no incorpora el tiempo de ingeniería, la variación del costo de tokens del modelo, la sobrecarga de compilación, los descuentos por capacidad reservada ni los cambios de utilización. Antes de aprobar una campaña más larga, sustituya cada dato por el de su factura real.
Cómo seleccionamos estos agentes de IA para optimizar GPU
Esta es una comparación basada en documentación y evidencia vigentes, no una afirmación de que los cinco sistemas se instalaron y probaron en hardware idéntico. Por eso, el título dice Comparados, no Probados. Para entrar en la lista, cada sistema debía ofrecer una ruta concreta de agente o entorno para trabajar con kernels de GPU, una descripción pública de primera mano y suficiente detalle de implementación para saber quién debería utilizarlo y dónde están sus límites.
La clasificación utiliza seis criterios:
- Facilidad de despliegue: ¿puede un equipo obtener y ejecutar ahora el sistema correspondiente?
- Compatibilidad de hardware: ¿admite de manera explícita el acelerador y el stack de software objetivo?
- Rigor de la verificación: ¿resiste el entorno a respuestas almacenadas en caché, pruebas modificadas, formas demasiado limitadas y tolerancias débiles?
- Denominador del benchmark: ¿se identifica la referencia y se muestran los fallos o casos sin cambios?
- Validación de extremo a extremo: ¿vuelve el flujo de trabajo al modelo o servicio real después de mejorar el kernel aislado?
- Claridad de costos: ¿puede el equipo asignar un presupuesto acotado de GPU y agente a la primera campaña?
La clasificación no promedia los multiplicadores de los proveedores. Premia la calidad de la evidencia, la adecuación operativa y la posibilidad de convertir un benchmark local en un ahorro verificado en producción. Por eso, los resultados de AKO entre 1.14x y 1.43x en una variedad de cargas productivas pueden importar más que una cifra aislada mucho mayor, y por eso el resultado de 2.11x de CUDA Agent en KernelBench no compensa la ausencia de un modelo desplegable.
Ningún socio del grupo comercial activo del sitio encaja de forma natural en la optimización de kernels de GPU. Introducir aquí una herramienta de telefonía, CRM, formación, contabilidad o creación de sitios web restaría credibilidad al artículo. Por tanto, la comparativa no contiene ubicaciones de afiliados y solo clasifica los sistemas pertinentes.
Qué herramientas conviene evitar
Evite KernelAgent para AMD ROCm. Su lista actual de compatibilidad incluye NVIDIA CUDA e Intel XPU, no AMD ROCm. Un diseño guiado por el perfilador no puede compensar un entorno de ejecución incompatible.
Evite AMD-AGI Apex para trabajos en NVIDIA. El Apex analizado aquí está creado para ROCm y AMD Instinct. Tampoco es NVIDIA Apex, el proyecto independiente de entrenamiento distribuido y precisión mixta. Confirme de qué herramienta se trata antes de asignar tiempo de ingeniería.
Evite CUDA Agent como compra administrada para producción. Su dataset, su skill y sus artefactos de trabajo son públicos, pero no se ofrecen los pesos entrenados ni un endpoint. Estúdielo; no lo presupueste como un servicio que existe.
Evite AKO si Claude Code no es una dependencia autorizada. El entorno actual de AKO aporta valor precisamente porque limita a un agente existente, pero esa elección de agente sigue siendo una dependencia de compras y seguridad.
Evite AutoKernel si la decisión exige un benchmark agregado e independiente antes del piloto. Su material público explica bien el ciclo y los objetivos compatibles, pero no proporciona un resultado agregado e independiente actualizado para todos ellos. Ejecute el piloto acotado o elija un sistema cuya evidencia se aproxime más a sus requisitos.
Sobre todo, evite presentar sesiones sueltas de Claude Code o Codex como si fueran un optimizador completo. Ambos pueden escribir y revisar kernels, y AutoKernel o Apex pueden coordinarlos, pero el producto es el conjunto que los rodea: perfilador, referencia inmutable, pruebas de corrección, medición del benchmark, lógica para conservar o revertir cambios y comprobación del despliegue. Sin ese entorno, el agente es un entusiasta autor de kernels que corrige su propio examen.
Preguntas frecuentes
¿Puede Codex optimizar kernels de CUDA y Triton?
Sí. AutoKernel funciona explícitamente con Codex para optimizar Triton o CUDA C++, y Apex puede coordinar Codex en trabajos compatibles con AMD ROCm. Codex por sí solo no constituye el sistema de optimización completo: necesita un perfilador, un entorno protegido de comprobación de corrección, un benchmark y un ciclo que conserve o revierta los cambios.
¿KernelAgent es mejor que AutoKernel?
KernelAgent es mejor cuando la prioridad es un ciclo nativo de PyTorch, las métricas de NCU y el ajuste en NVIDIA o Intel XPU guiado por roofline. AutoKernel resulta superior cuando se busca un ciclo nocturno más sencillo, mayor libertad para elegir agente o sus objetivos NVIDIA y AMD Instinct enumerados.
¿Apex optimiza GPU NVIDIA?
No. AMD-AGI Apex es un optimizador de ROCm para hardware AMD Instinct compatible. No debe confundirse con NVIDIA Apex, que es un proyecto diferente y no el optimizador con agentes incluido en esta clasificación.
¿Cuál es el mejor agente de IA para optimizar GPU AMD?
Apex es la primera opción específica para una carga compatible con AMD Instinct dentro de su superficie de integración parcheable. AutoKernel versión 1.3 es la alternativa más amplia para MI300X, MI325X, MI350X y MI355X.
¿Cómo deben compararse las puntuaciones de KernelBench?
Cada puntuación debe ir acompañada del hardware, el nivel de las tareas, la referencia, la definición de aprobado, las entradas usadas para comprobar la corrección y el método de la media geométrica. Un resultado frente a torch.compile no es intercambiable con otro calculado frente a una implementación experta o una referencia básica de una competencia.
¿Vale la pena un agente para kernels de GPU en un equipo pequeño?
Puede valerla si el perfilado demuestra que un kernel concentra una parte suficiente de una factura de aceleradores recurrente. Utilice el piloto de $299.99 y el criterio de retorno basado en el kernel crítico; deténgase cuando el ahorro medido de extremo a extremo no permita recuperar la inversión dentro del plazo previsto.
Qué hacer el lunes
No instale los cinco sistemas. El lunes por la mañana, perfile una carga de producción representativa y anote qué proporción del tiempo total consume el kernel más crítico. Después elija una sola ruta: AKO para una campaña auditada en NVIDIA, KernelAgent para un ciclo de PyTorch guiado por contadores de hardware, AutoKernel para una búsqueda nocturna más ligera o Apex para AMD ROCm compatible.
Limite el primer experimento a 32 horas de B200 más un plan de agente de $100, o su equivalente en el hardware disponible. Congele la implementación de referencia y el benchmark. Añada comprobaciones de corrección con valores nuevos. Exija que el kernel ganador sobreviva fuera del ciclo del propio agente y mejore la carga completa, no solo su microbenchmark.
La regla para desplegar cabe en una frase: sin retorno de extremo a extremo medido, no hay segunda campaña.
3 sept 2026







