Grok 4.5 a prueba: gana por precio con agentes, no por código

Grok 4.5 ofrece agentes eficientes por $2/$6 por millón de tokens, pero no lidera en programación. Vea sus benchmarks, costos y límites reales.

Thursday, September 3, 2026Omid Saffari
Grok 4.5 a prueba: gana por precio con agentes, no por código

Grok 4.5 cuesta $2 por millón de tokens de entrada y $6 por millón de tokens de salida, pero no es el nuevo líder en programación. Es el modelo que conviene adoptar cuando el costo de los agentes y la eficiencia de tokens pesan más que ganar todos los benchmarks, siempre que los prompts se mantengan por debajo del salto de precio de 200K.

Grok 4.5: el veredicto en una tabla

Grok 4.5 es la opción con mejor relación calidad-precio entre el modelo de programación más barato y el líder de los benchmarks. Cuesta más que Composer 2.5 de Cursor, queda por debajo de Claude Fable 5 en la mayoría de las pruebas del gráfico de ingeniería de SpaceXAI y, aun así, resulta convincente para agentes de larga duración porque su salida cuesta $6 en lugar de los $50 de Fable dentro de Cursor.

Documentación del modelo Grok 4.5 de SpaceXAI con precios, capacidades y acceso
Documentación del modelo Grok 4.5

La comparación más clara está en la tabla de precios actual de Cursor, porque reúne modelos propios y alternativas de frontera bajo la misma unidad de cobro. Todos los precios siguientes corresponden a un millón de tokens.

Modelo en CursorIdeal paraEntradaLectura de cachéSalidaVeredicto
Grok 4.5Agentes de larga duración sensibles al costo$2$0.50$6El mejor equilibrio entre capacidad de frontera y costo del agente
Composer 2.5Programación rutinaria al menor costo$0.50$0.20$2.50Conviene cuando el precio importa más que la capacidad máxima
Claude Fable 5Mayor tasa de éxito en las pruebas de programación mostradas$10$1$50La prima se justifica cuando una falla cuesta más que los tokens
GPT-5.6 SolEntornos de producción centrados en OpenAI$5$0.50$30Una mejor integración con el ecosistema puede justificar el precio superior

Con una carga mensual de 10 millones de tokens de entrada nuevos y 2 millones de tokens de salida, esas tarifas dejan una cuenta sencilla: $32 con Grok 4.5, $10 con Composer 2.5, $200 con Claude Fable 5 y $110 con GPT-5.6 Sol. Cursor también aplica a los modelos de terceros una tarifa de $0.25 por millón de tokens en Teams y Enterprise, mientras que sus modelos propios Grok y Composer están exentos.

Por eso, Cursor deja muy clara la posición de Grok 4.5: no es el modelo más barato ni el que obtiene la puntuación más alta, sino el punto de equilibrio entre ambos.

Página de modelos y precios de Cursor con las tarifas por token de Grok 4.5 y sus competidores
Precios de los modelos en Cursor

Ese es el veredicto. Lo que falta es demostrar si la carga de trabajo queda del lado correcto de esa decisión.

Qué es Grok 4.5 y dónde está disponible

Grok 4.5 es un modelo de razonamiento creado para programar, trabajar con agentes y abordar tareas de conocimiento; no se trata simplemente de otro ajuste predefinido para chat. Cursor y SpaceXAI lo describen como un modelo de mezcla de expertos entrenado de forma conjunta. En la práctica, cada token activa un subconjunto seleccionado de componentes especializados en lugar de utilizar toda la red en cada paso.

El lanzamiento tuvo dos etapas. Cursor lanzó Grok 4.5 el 8 de julio y SpaceXAI presentó el lanzamiento completo el 16 de julio. Según Cursor, la mezcla de entrenamiento incluyó billones de tokens de interacciones entre desarrolladores y agentes, además de tareas STEM, artículos de investigación y trabajos de conocimiento más amplios.

El identificador actual del modelo es grok-4.5. Acepta texto e imágenes, devuelve texto, ofrece una ventana de contexto de 500,000 tokens y permite configurar el esfuerzo de razonamiento en bajo, medio o alto, con el nivel alto como valor predeterminado. Sus herramientas nativas abarcan llamadas a funciones, búsqueda web, búsqueda en X y ejecución de código mediante Responses API o Chat Completions.

La distribución es inusualmente amplia para un modelo nuevo. Está disponible mediante la API de SpaceXAI, es el modelo predeterminado de Grok Build, funciona en todos los planes de Cursor, impulsa complementos para Word, PowerPoint y Excel, y aparece en OpenRouter, Vercel, Cloudflare, Snowflake y Databricks Mosaic. Dentro de Cursor, se ofrece en escritorio, web, iOS, CLI y el SDK.

Esa cobertura reduce la fricción para adoptarlo, pero no elimina la necesidad de distinguir el modelo del producto que lo rodea. Grok 4.5 mediante la API directa tiene precios de caché distintos a los de Grok 4.5 dentro de Cursor, y Grok Build añade un bucle de agente sobre el modelo. La economía anterior de Grok Build estaba dominada por una suscripción fija como barrera de entrada. Grok 4.5 cambia esa conversación porque tanto el modelo como el agente disponen ahora de vías de consumo medido más claras.

Los benchmarks hablan de valor, no de liderazgo absoluto

Grok 4.5 gana uno de los cinco benchmarks de ingeniería que muestra SpaceXAI, casi empata con los líderes en otro y queda detrás de Claude Fable 5 en los tres restantes. Para llamarlo el nuevo campeón de la programación habría que ignorar las cifras del propio proveedor.

BenchmarkGrok 4.5Mejor puntuación mostradaPosición de GrokSeñal práctica
DeepSWE 1.062.0%Fable 5 con 66.1%TerceroCompetitivo, pero no primero
DeepSWE 1.153%Fable 5 con 70%CuartoBrecha relevante de fiabilidad
SWE Marathon29.0%Grok 4.5 con 29.0%PrimeroMejor resultado en resolución de largo recorrido
Terminal Bench 2.183.3%Fable 5 con 84.3%Tercero, 0.1 por detrás de GPT-5.5En la práctica, dentro del grupo líder
SWE Bench Pro64.7%Fable 5 con 80.4%TerceroÚtil, pero muy por debajo del líder

El gráfico de lanzamiento de SpaceXAI indica que las cifras de los competidores proceden de fichas técnicas de los proveedores o de clasificaciones de benchmarks. Por eso, la tabla sirve como orientación, no como sustituto de una evaluación adaptada a cada carga de trabajo. La configuración de ejecución, el nivel de razonamiento, los reintentos y el presupuesto de tokens pueden mover lo suficiente una puntuación de programación como para cambiar una decisión de compra.

Las diferencias son concretas. Grok queda 4.1 puntos por detrás de Fable 5 en DeepSWE 1.0, 17 puntos en DeepSWE 1.1, 1 punto en Terminal Bench 2.1 y 15.7 puntos en SWE Bench Pro. Su victoria clara está en SWE Marathon, donde 29.0% supera el 26.0% de Opus 4.8 y el 24.0% de Fable 5.

El argumento de la eficiencia es más convincente. SpaceXAI informa de un promedio de 15,954 tokens de salida de Grok por tarea de SWE Bench Pro, frente a 67,020 con Opus 4.8 max: aproximadamente 4.2 veces menos. Son datos publicados por el proveedor, pero apuntan a la unidad económica correcta: una tarea terminada, no el precio de etiqueta de un token.

Una medición independiente mantiene el veredicto con los pies en la tierra. Artificial Analysis otorga a Grok 4.5 una puntuación high de 54, mientras que GPT-5.5 xhigh alcanza 55. El precio combinado con proporción 7:2:1 de caché, entrada y salida es de $1.35 por millón de tokens para Grok, frente a $4.35 para GPT-5.5. La misma comparación en vivo midió cerca de 70 tokens de salida por segundo para Grok y unos 76 para GPT-5.5.

SpaceXAI anuncia 80 tokens de salida por segundo. El resultado independiente ronda los 70. La diferencia no implica un fallo, pero recuerda que la velocidad real del servicio varía y que el rendimiento anunciado durante un lanzamiento no equivale a una garantía de nivel de servicio.

El dictamen de los benchmarks es directo: Grok 4.5 se acerca lo suficiente al rendimiento de frontera como para ser interesante en términos económicos, pero no es tan sólido como para sustituir un control de calidad por una tabla de precios.

El costo real de Grok 4.5

El precio anunciado de $2/$6 para Grok 4.5 solo es exacto por debajo de 200,000 tokens de contexto. Al cruzar ese umbral, SpaceXAI duplica las tarifas de entrada nueva, entrada en caché y salida para toda la solicitud.

API directa de SpaceXAIEntrada nuevaEntrada en cachéSalida
Menos de 200K de contexto$2$0.30$6
200K de contexto o más$4$0.60$12

La diferencia importa porque una ventana de contexto de 500,000 tokens describe capacidad, no capacidad barata. Una solicitud con 250K tokens de entrada y 50K tokens de salida cuesta $1.60 con las tarifas de contexto largo. Con las tarifas de contexto corto, la misma cantidad de tokens costaría $0.80. El umbral duplica la factura de tokens antes de sumar búsquedas web, ejecución de código o reintentos.

Salto de precio de Grok 4.5 por debajo y por encima de 200K tokens de contexto
El umbral de 200K duplica todas las tarifas directas de tokens de la solicitud.

La caché puede empujar el costo en la dirección contraria. Una carga de trabajo con 10 millones de tokens de entrada nuevos y 2 millones de tokens de salida cuesta $32. Si la mitad de esa entrada se sirve desde la caché de la API directa, la factura baja a $23.50: un ahorro de $8.50, o alrededor de 26.6%.

Ese ahorro no es automático. SpaceXAI recomienda configurar prompt_cache_key en Responses API, o x-grok-conv-id con Chat Completions, para que una conversación se dirija al mismo servidor. De lo contrario, un servidor sin caché puede convertir los aciertos previstos en entradas cobradas a precio completo.

El uso de herramientas añade un segundo contador. La búsqueda web, la búsqueda en X y la ejecución de código cuestan $5 por cada 1,000 llamadas. Una ejecución que haga 25 de esas llamadas suma $0.125 antes de contar los tokens del modelo asociados a ellas. La búsqueda en archivos adjuntos cuesta $10 por cada 1,000 llamadas, mientras que la búsqueda en colecciones cuesta $2.50 por cada 1,000.

Qué puede fallar en producción

El primer fallo en producción es un cambio de precio silencioso, no la inteligencia del modelo. Un prompt que abarca todo el repositorio supera poco a poco los 200K, cada token de la solicitud pasa a la tarifa de contexto largo y el cálculo de costos basado en el precio anunciado de $2/$6 queda obsoleto de inmediato.

El segundo es un optimismo excesivo con la caché. Los turnos repetidos de un agente parecen ideales para reutilizarla, pero solo obtienen la tarifa directa de $0.30 por entrada en caché cuando el enrutamiento permite reaprovechar el prefijo anterior. La recomendación explícita de SpaceXAI sobre las claves de caché debe formar parte del diseño de facturación desde la primera solicitud.

El tercero es la acumulación de contexto. Los agentes de larga duración vuelven a leer planes, resultados de herramientas, diferencias de código, pruebas y explicaciones anteriores. La ventana de 500,000 tokens retrasa el fallo, pero no vuelve sensato conservar todos los turnos antiguos. SpaceXAI recomienda compactar el contexto en los bucles largos: reemplazar los detalles obsoletos por un estado de trabajo más pequeño antes de que el agente alcance el salto de precio o pierda atención dentro de su propio historial.

El cuarto es convertir los benchmarks del proveedor en una condición de lanzamiento. Los resultados publicados de Grok 4.5 van desde el primer puesto en SWE Marathon hasta una desventaja de 17 puntos frente a Fable 5 en DeepSWE 1.1. La calidad en producción dependerá del repositorio, el entorno de ejecución, la cobertura de pruebas, los permisos de las herramientas y la definición de éxito.

El quinto es la disponibilidad según la plataforma. La página actual de Grok 4.5 en Cursor señala que el modelo todavía no está disponible en la Unión Europea a través de Cursor. Es una limitación de Cursor, no una prueba de que todas las vías de acceso de SpaceXAI estén bloqueadas, pero basta para impedir que un equipo de la UE planifique hoy una migración a Cursor en torno a este modelo.

Quién debería usar Grok 4.5 y quién debería descartarlo

Grok 4.5 encaja en bucles de agentes sensibles al costo, que se mantengan por debajo de 200K y puedan verificar su propio trabajo. Conviene descartarlo cuando la mejor tasa de éxito mostrada en programación justifica la prima, cuando Composer 2.5 ya es suficiente o cuando los usuarios de Cursor están en la UE.

SituaciónElecciónMotivoQué haría cambiar la decisión
Agente de API de larga duración, con prompts inferiores a 200KGrok 4.5$2 de entrada, $0.30 de entrada en caché y $6 de salidaFable evita suficientes fallos como para compensar la prima
Programación rutinaria en Cursor con un límite de costos estrictoComposer 2.5$0.50 de entrada y $2.50 de salidaLa tasa de éxito de Grok reduce los reintentos lo suficiente para compensar la tarifa superior
Los fallos cuestan mucho más que los tokensClaude Fable 5Lidera cuatro de los cinco benchmarks mostradosGrok lo iguala en un conjunto representativo de tareas
Se necesita la variante Fast específica de CursorGrok 4.5 FastDisponible a $4 de entrada y $18 de salidaGrok estándar cumple el objetivo de latencia
Una solicitud supera 200K con frecuenciaPrimero, compactar o redirigirLas tarifas directas de Grok se duplican para toda la solicitudEl contexto largo elimina suficientes costos de recuperación u orquestación para compensar la diferencia
Los usuarios de Cursor están en la UEEsperar o elegir un modelo disponibleCursor indica que Grok 4.5 no está disponible allíCursor cambia el estado regional
Mapa de decisión para elegir Grok 4.5, Fable 5, Composer 2.5 o esperar
La decisión cambia según el costo del agente, el valor de la tasa de éxito, el nivel de velocidad, el tamaño del contexto y la región.
Lo bueno
Lo que hace bien
8 points

  • El precio de $2 por entrada y $6 por salida hace que el trabajo con agentes cercano a la frontera resulte sustancialmente más barato que con Fable 5 o GPT-5.6 Sol en Cursor.
  • Una ventana de contexto de 500,000 tokens deja espacio para repositorios grandes e historiales de tareas extensos.
  • Las llamadas a funciones, la búsqueda web, la búsqueda en X, la ejecución de código, la salida estructurada y dos interfaces de API estándar reducen el trabajo de integración.
  • Los datos del proveedor muestran una victoria real en SWE Marathon y un uso de tokens de salida muy inferior al de Opus 4.8 max en SWE Bench Pro.
  • Grok 4.5 no lidera cuatro de los cinco benchmarks de ingeniería del gráfico de SpaceXAI.
  • Las tarifas de la API directa se duplican para todos los tokens cuando la solicitud llega a 200K de contexto.
  • Ahorrar de forma fiable con la caché exige disciplina explícita en el enrutamiento.
  • La velocidad independiente queda por debajo de los 80 tokens por segundo anunciados por el proveedor, y Cursor reconoció contaminación en un benchmark excluido.

Un plan de evaluación seguro

La prueba de adopción adecuada compara trabajo terminado con un nivel de calidad controlado, no prompts aislados. El conjunto de tareas, el entorno del agente, los permisos de herramientas y las comprobaciones de aceptación deben ser idénticos entre modelos.

  1. Fijar un conjunto de tareas representativo

    Hay que elegir tareas reales del trabajo que se pretende delegar: corregir un error con pruebas, hacer un cambio en todo el repositorio, completar una investigación con herramientas y producir un documento o una hoja de cálculo si esos entregables son relevantes. Los criterios de éxito y fracaso deben definirse antes de que cualquier modelo vea las tareas.

  2. Controlar el razonamiento y el contexto

    Se debe usar el mismo ajuste de razonamiento en cada ejecución de Grok, registrar el tamaño exacto del prompt y separar las tareas inferiores a 200K de las de contexto largo. Ningún modelo debería acceder a archivos adicionales ni disponer de un presupuesto de herramientas diferente.

  3. Hacer medible la caché

    Configure prompt_cache_key o x-grok-conv-id en conversaciones repetidas. Registre por separado la entrada nueva y la entrada en caché para que la comparación refleje una factura reproducible.

  4. Evaluar la economía de cada tarea terminada

    Registre la tasa de éxito, las correcciones humanas, los reintentos, el total de tokens, las llamadas a herramientas y el tiempo transcurrido. Grok solo debería adoptarse cuando el costo por resultado aceptado sea inferior al del modelo actual sin rebajar el nivel exigido para publicar.

Para una persona fundadora con financiación, ese control puede ser el tiempo de revisión de los desarrolladores. Para un CTO de una empresa mediana, pueden ser los defectos que llegan a producción y la capacidad de auditoría. Para un responsable sénior de operaciones, puede ser si un archivo de Excel o un informe de investigación supera una revisión factual. Para quien construye en solitario con perfil técnico, suele ser si la tarifa más baja permite completar más trabajo sin crear un segundo empleo dedicado a revisar al agente.

Preguntas frecuentes

¿Grok 4.5 es bueno?

Sí, cuando se necesita una gran capacidad para agentes con un costo de tokens más bajo. No es la opción predeterminada más segura si se busca la máxima precisión al programar, porque Fable 5 lidera cuatro de los cinco benchmarks de ingeniería que muestra SpaceXAI, mientras que la victoria más clara de Grok está en el trabajo de largo recorrido con buena eficiencia de costos.

¿Cuánto cuesta Grok 4.5?

La API directa de SpaceXAI cuesta $2 por millón de tokens de entrada nuevos, $0.30 por millón de tokens de entrada en caché y $6 por millón de tokens de salida por debajo de 200K de contexto. A partir de 200K, esas tarifas pasan a $4, $0.60 y $12 para toda la solicitud. Cursor indica $2 por entrada, $0.50 por lectura de caché y $6 por salida en su grupo de modelos propios.

¿Dónde se puede usar Grok 4.5?

SpaceXAI documenta el acceso mediante su API, Grok Build, Cursor, Word, PowerPoint, Excel, OpenRouter, Vercel, Cloudflare, Snowflake y Databricks Mosaic. Cursor lo admite en escritorio, web, iOS, CLI y su SDK, pero actualmente señala que no está disponible en la Unión Europea.

¿Quiere la lista de configuración de Claude Code + Codex? Recíbala con el boletín.

Última actualización

3 sept 2026

CategoríaAI

Prefiera este sitio en Google

Añadir omidsaffari.com como fuente preferida en la Búsqueda de Google

Marque omidsaffari.com como fuente preferida y Google lo destacará para usted en Top Stories, AI Overviews y AI Mode.

Newsletter

Una carta, cada domingo. Sistemas que funcionan, no opiniones calientes.

Build logs, sistemas en producción y notas de campo de un portafolio de ventures de IA.

Semanal. Sin spam. Cancele cuando quiera.