Groq pricing (2026): la capacidad, no los tokens, obliga a pagar
Groq pricing en 2026: compara el plan Free, las tarifas por modelo, Batch, caché y límites para saber cuándo pasar a Developer o Enterprise.

Groq pricing empieza en $0 hasta que los límites del plan Free, específicos para cada modelo, frenan el flujo de trabajo; a partir de ahí, Developer no cobra suscripción y factura únicamente el uso. En una carga calculada con GPT-OSS 120B, el tope diario de tokens de Free equivale a apenas $1.44 al mes en tráfico de pago. Por eso, lo que obliga a subir de plan es la capacidad de procesamiento, no el gasto en tokens.
Groq pricing: precios y planes de un vistazo
Groq no tiene una tarifa mensual de autoservicio por usuario que haya que memorizar. La elección se reduce a un plan Free con límites de uso, un plan Developer de pago por consumo y capacidad Enterprise personalizada.
Estos precios y límites se verificaron el 15 de agosto de 2026 en la página de precios de Groq, la lista de modelos compatibles, las preguntas frecuentes sobre facturación y la documentación de límites de uso.

El token es la unidad que factura el modelo. Los tokens de entrada abarcan las instrucciones, el historial de la conversación, los documentos y las definiciones de herramientas que se envían al modelo; los de salida corresponden al contenido que genera. Groq cotiza ambos por millón de tokens, de modo que el costo mensual suma la entrada, la salida, el audio y cualquier herramienta integrada utilizada.
Developer no exige un compromiso de suscripción mensual ni anual. Groq solicita un método de pago, mide el consumo y normalmente factura a mes vencido. Tampoco existe una tarifa aparte por excedentes: Free bloquea el tráfico que supera el límite correspondiente, mientras que Developer sigue cobrando el uso a las mismas tarifas del modelo hasta que la cuenta o un Spend Limit lo detenga. Enterprise Performance funciona de otra manera: el cliente compra capacidad aprovisionada de entrada y salida, en lugar de pagar la tarifa pública de tokens bajo demanda.
El plan Free sirve hasta que un límite compartido condiciona la producción
El plan Free de Groq alcanza para un prototipo, un asistente interno y una cantidad sorprendente de automatización de bajo volumen. Deja de ser infraestructura gratuita en cuanto un error por límite de uso se convierte en un incidente visible para el cliente.
Los límites se aplican a toda la organización, no a cada clave de API. Crear más claves no multiplica la capacidad. Groq también controla varias dimensiones a la vez: solicitudes por minuto, solicitudes por día, tokens por minuto y tokens por día. El primer tope que se alcance bloquea la siguiente llamada con HTTP 429.
Los límites publicados de Free para los modelos de texto que están actualmente en producción incluyen:
- GPT-OSS 120B y GPT-OSS 20B: 30 RPM, 1,000 RPD, 8,000 TPM y 200,000 TPD.
- Llama 3.3 70B Versatile: 30 RPM, 1,000 RPD, 12,000 TPM y 100,000 TPD.
- Llama 3.1 8B Instant: 30 RPM, 14,400 RPD, 6,000 TPM y 500,000 TPD.
- Compound y Compound Mini: 30 RPM, 250 RPD y 70,000 TPM.
- Whisper Large V3 y Turbo: 20 RPM, 2,000 RPD, 7,200 segundos de audio por hora y 28,800 segundos de audio por día.
Groq presenta esa tabla pública como un resumen general. Para conocer la asignación vigente de una organización concreta, la referencia definitiva es la página Limits de la Console.
El tope diario de tokens suele alcanzarse antes que el número de solicitudes. Pensemos en una llamada a GPT-OSS 120B con 2,000 tokens de entrada y 500 de salida. Con 2,500 tokens totales, el límite de 200,000 TPD permite 80 solicitudes de ese tipo al día. El tope de 8,000 TPM admite tres en un minuto; una cuarta solicitud comparable superaría el límite de tokens, aunque el plan anuncie 30 RPM.
Ese es el punto de equilibrio entre el plan gratuito y el de pago. La misma solicitud cuesta $0.0006 en Developer, por lo que 80 al día durante un mes de 30 días cuestan alrededor de $1.44. No hay una razón financiera de peso para deformar un flujo de producción con tal de no rebasar el límite de Free. El cambio de plan compra capacidad cuando la factura del modelo todavía es menor que la mayoría de los complementos SaaS.

Quién puede quedarse siempre en el plan gratuito
Developer quizá nunca sea necesario si Groq se usa para desarrollo local, evaluaciones ocasionales, un script interno personal o una demo cuyo tráfico se mantiene dentro de los topes aplicables de tokens y solicitudes. Free también funciona cuando un error 429 puede esperar un reintento y nadie depende de un servicio continuo.
Vale la pena pagar cuando el flujo de trabajo ya tiene un usuario, una fecha límite o una cola que no tolera el límite compartido. Developer también incorpora Batch, Flex, soporte por chat y Spend Limits. Esos controles operativos, y no un catálogo de modelos distinto, marcan la frontera práctica.
Precios de todos los modelos actuales de Groq
El catálogo de producción actual de Groq es compacto: cuatro modelos de texto, dos modelos de voz a texto y dos sistemas Compound. Por separado existe un catálogo preview con modelos que podrían desaparecer con poca antelación.
Modelos de texto en producción
- Llama 3.1 8B Instant cuesta $0.05 por entrada y $0.08 por salida por millón de tokens. Es la opción de texto en producción más barata. Su capacidad base en Developer es de 250,000 TPM y 1,000 RPM, con una ventana de contexto de 131,072 tokens.
- GPT-OSS 20B cuesta $0.075 por entrada y $0.30 por salida por millón de tokens. La entrada en caché cuesta $0.0375 por millón. Su capacidad base en Developer es de 250,000 TPM y 1,000 RPM, con una ventana de contexto de 131,072 tokens.
- GPT-OSS 120B cuesta $0.15 por entrada y $0.60 por salida por millón de tokens. La entrada en caché cuesta $0.075 por millón. Su capacidad base en Developer es de 250,000 TPM y 1,000 RPM, con una ventana de contexto de 131,072 tokens.
- Llama 3.3 70B Versatile cuesta $0.59 por entrada y $0.79 por salida por millón de tokens. Su capacidad base en Developer es de 300,000 TPM y 1,000 RPM, con una ventana de contexto de 131,072 tokens.
Cuando se necesita un modelo de pesos abiertos más grande, pero también importa contar con otro proveedor para el mismo modelo, conviene iniciar la evaluación de producción con GPT-OSS 120B. Solo hay que bajar a GPT-OSS 20B o Llama 3.1 8B si una prueba de aceptación demuestra que el modelo menor conserva la calidad del resultado. Llama 3.3 70B se justifica únicamente cuando sus respuestas compensan una tarifa 3.93 veces mayor que GPT-OSS 120B en entrada y 1.32 veces mayor en salida.
Esos múltiplos no prueban que un modelo sea mejor. Indican cuánto debe devolver el resultado mediante menos reintentos, respuestas más breves, menos trabajo de revisión o una capacidad que la opción más barata no ofrece.
Modelos de voz a texto
- Whisper Large V3 cuesta $0.111 por hora de audio. Su capacidad base en Developer es de 200,000 segundos de audio por hora y 300 RPM, con un archivo máximo de 100 MB.
- Whisper Large V3 Turbo cuesta $0.04 por hora de audio. Su capacidad base en Developer es de 400,000 segundos de audio por hora y 400 RPM.
Para 1,000 horas de audio, las partidas son de $111 con Whisper Large V3 y $40 con Turbo: una diferencia de $71. El precio más bajo debe ser el punto de partida, pero un equipo de audio debería conservar el modelo que supere su umbral de aceptación de transcripciones. Una transcripción más barata que exige correcciones no produce un resultado más barato.
Sistemas Compound y modelos preview
Groq Compound y Compound Mini combinan modelos de producción con herramientas del lado del servidor. No tienen una tarifa plana única por token. Groq traslada los cargos de los modelos y las herramientas subyacentes; por eso, una factura de Compound necesita su propio desglose de costos, no una sola estimación por token.
El catálogo preview disponible actualmente incluye:
- Qwen3.6 27B: $0.60 por entrada y $3.00 por salida por millón de tokens.
- Safety GPT-OSS 20B: $0.075 por entrada y $0.30 por salida por millón de tokens.
- Llama Prompt Guard 2 22M: $0.03 por entrada y salida por millón de tokens.
- Llama Prompt Guard 2 86M: $0.04 por entrada y salida por millón de tokens.
- Canopy Labs Orpheus V1 English: $22 por millón de caracteres.
- Canopy Labs Orpheus Arabic Saudi: $40 por millón de caracteres.
- MiniMax M2.7: precio Enterprise disponible al contactar con ventas.
Preview significa evaluación, no una promesa de producción. Groq advierte que estos modelos pueden retirarse con poca antelación. Por lo tanto, un presupuesto que dependa de Qwen3.6 27B también necesita una ruta probada hacia otro proveedor o modelo antes de llegar a los clientes.
La página actual de modelos compatibles de Groq no incluye ningún modelo de DeepSeek ni de Kimi. Las publicaciones y calculadoras antiguas que todavía muestran esos nombres como opciones activas de Groq están desactualizadas. Si DeepSeek es un requisito, hay que calcular su precio con un proveedor vigente, no dar por hecho que sigue en el catálogo de Groq; el análisis de precios de DeepSeek aborda esa decisión por separado.
El costo por resultado es lo que decide el modelo
Las tarifas por token de Groq son tan bajas que, hasta que el volumen se vuelve grande, la forma del tráfico pesa más que el modelo elegido. Una comparación limpia fija una solicitud y calcula el costo de cada alternativa con esa misma carga.
Tomemos una solicitud estándar de 2,000 tokens de entrada y 500 de salida. Con 100,000 solicitudes al mes, antes de caché, Batch, herramientas o reintentos:
- Llama 3.1 8B Instant: $14 en total, o $0.00014 por solicitud.
- GPT-OSS 20B: $30 en total, o $0.0003 por solicitud.
- GPT-OSS 120B: $60 en total, o $0.0006 por solicitud.
- Llama 3.3 70B Versatile: $157.50 en total, o $0.001575 por solicitud.
- Qwen3.6 27B preview: $270 en total, o $0.0027 por solicitud.
El denominador útil no es una solicitud, sino un resultado aceptado. Si un modelo menor necesita reintentos, genera respuestas más largas o deriva más trabajo a una persona revisora, la solicitud barata puede terminar en un flujo costoso. Conviene registrar los resultados aceptados junto con los tokens para que el modelo se gane su lugar por desempeño y no solo por el precio anunciado.
No existe un punto de equilibrio por volumen de pago a partir del cual un modelo de Groq pase automáticamente a ser más barato que otro. Todas las tarifas públicas bajo demanda son lineales y no hay cargo base. GPT-OSS 20B mantiene la mitad del costo calculado de GPT-OSS 120B tanto con una solicitud como con un millón. La decisión solo cambia cuando la calidad del resultado o el comportamiento operativo modifican el trabajo necesario.
Para una startup con financiamiento, esto puede traducirse en GPT-OSS 20B para clasificación y GPT-OSS 120B para casos ambiguos. Para un CTO de una empresa mediana, implica conservar los campos de modelo y tokens en el registro de cada solicitud, de modo que compras pueda ver el costo por flujo aceptado. Para un responsable sénior de operaciones, significa medir correcciones y reintentos, en lugar de tomar una demo exitosa como prueba de la ruta de producción.
Batch supera a la caché en trabajos asíncronos, y los descuentos no se acumulan
Batch de Groq ofrece la tarifa publicada más baja cuando el resultado puede esperar. Cuesta un 50% menos que la API síncrona, se ejecuta fuera de los límites estándar por modelo y permite elegir una ventana de procesamiento de 24 horas a 7 días.
Para la carga de 100,000 solicitudes con GPT-OSS 120B, estas son las opciones:
- Síncrona sin caché: $60.
- Síncrona con el 50% de los tokens de entrada servidos desde caché: $52.50.
- Síncrona con el 80% de los tokens de entrada servidos desde caché: $48.
- Batch: $30.
La regla vigente que modifica el presupuesto es inequívoca: los descuentos de Batch y de caché de prompts no se acumulan. Cada token de Batch se factura con el descuento del 50%, sin importar su estado de caché. Una hoja de cálculo que vuelve a dividir a la mitad el total de $30 de Batch para dejarlo en $15 está equivocada.
La caché de prompts sigue siendo útil para el tráfico síncrono de GPT-OSS. Es automática, no cobra una tarifa por la función y aplica un descuento del 50% a la entrada almacenada en caché. En este momento es compatible con GPT-OSS 20B, GPT-OSS 120B y GPT-OSS Safeguard 20B. Para que haya una coincidencia, el prefijo debe ser exactamente igual; el mínimo que se puede almacenar va de 128 a 1,024 tokens según el modelo, y los datos de caché sin uso caducan después de dos horas. Una coincidencia se ofrece según disponibilidad, sin garantía.
Las instrucciones estables del sistema y las definiciones de herramientas deben colocarse al principio del prompt, seguidas de los datos variables del usuario. Después hay que leer en las respuestas el uso de tokens en caché. Una proporción de caché proyectada no es un dato presupuestario hasta que el uso en producción la confirme.
Batch tiene otras implicaciones operativas. Un archivo JSONL puede contener hasta 50,000 líneas y pesar hasta 200 MB. Los trabajos que no terminan dentro de la ventana elegida caducan, aunque Groq solo cobra las solicitudes completadas correctamente. Los archivos y resultados de Batch pueden permanecer hasta 30 días en los sistemas de Groq, por lo que las cargas sensibles requieren revisar la retención de datos antes de dejar que el ahorro decida la ruta.
Cómo $60 en tokens pueden convertirse en una factura Compound de $560
El costo oculto de Compound no está en el modelo, sino en el bucle de herramientas.
Groq cobra $5 por cada 1,000 solicitudes de Basic Search, $8 por cada 1,000 de Advanced Search, $1 por cada 1,000 de Visit Website y $0.18 por hora de Code Execution. Esos cargos se suman a los tokens del modelo subyacente.
Tomemos 100,000 solicitudes estándar con GPT-OSS 120B. Los tokens del modelo cuestan $60. Si cada solicitud realiza una llamada a Basic Search, la búsqueda añade $500 y la factura combinada asciende a $560. Una llamada a Advanced Search por solicitud lleva el total a $860; una llamada a Visit Website por solicitud, a $160.

Esta es la partida que más probablemente sorprenda a un equipo que trabaja con agentes. Optimizar tokens no salva un flujo en el que el agente busca en cada turno. El primer control debe ser una política de herramientas: definir cuándo hace falta buscar, limitar los bucles, almacenar fuera del modelo los resultados duraderos y registrar las llamadas por cada resultado aceptado.
La factura de pago no exige contrato anual, pero sí tiene condiciones operativas
Developer se factura por uso; no es un contrato SaaS anual disfrazado. Las condiciones menos evidentes son cuándo se cobra el dinero, cómo se comportan los límites y qué ocurre con los créditos.
Las cuentas Developer nuevas utilizan facturación progresiva. Groq puede emitir una factura cuando el consumo acumulado desde la apertura de la cuenta supera $1, $10, $100, $500 y $1,000. Después del umbral de $1,000 comienza la facturación mensual ordinaria. En las cuentas con dirección de facturación en India, se aplican los umbrales de $1 y $10, seguidos de incrementos recurrentes de $100. Groq no exige el pago hasta que el uso alcanza al menos $0.50.
Ese calendario puede generar varios cargos pequeños en la tarjeta al inicio de la adopción. No son tarifas adicionales, pero el área financiera debe conocer el patrón antes de confundirlos con cobros duplicados.
Spend Limits bloquea el tráfico con un pequeño retraso en los datos
Los planes de pago permiten configurar un único Spend Limit mensual para toda la organización. Abarca cada clave de API y endpoint, se reinicia el primer día del mes y bloquea nuevas solicitudes cuando detecta que se alcanzó el límite. Groq admite alertas en puntos como el 50%, 75% y 90% del tope.
El seguimiento del gasto se actualiza con un retraso de 10 a 15 minutos. Por eso, una ráfaga puede llevar la factura final ligeramente por encima del importe configurado antes de que empiece el bloqueo. Groq recomienda comenzar con un límite entre un 20% y un 30% por encima del consumo mensual previsto. En una ruta crítica, ese margen también reduce el riesgo de que un pico normal de tráfico convierta el control presupuestario en una interrupción.
Los créditos caducan y las ventas prepagadas son definitivas
Los Service Credits de Groq caducan un año después de la compra o emisión, salvo que se especifique otro plazo. No se pueden transferir ni canjear por dinero y no son reembolsables. Al cerrar la cuenta, el saldo caduca de inmediato.
Las preguntas frecuentes de facturación de Groq indican que las solicitudes generales de reembolso se estudian caso por caso a través de soporte. Eso no anula las condiciones específicas de Service Credits: tanto los créditos comprados como los promocionales son saldos de venta definitiva. La cantidad adquirida debe responder a una previsión, no a una migración futura sin concretar.
Flex cambia capacidad garantizada por un límite más alto
Flex está disponible para clientes de pago al mismo precio por token que On Demand y ofrece un límite 10 veces mayor. A cambio, la capacidad es de mejor esfuerzo. Si Flex está lleno, puede fallar rápidamente con HTTP 498 y capacity_exceeded.
Flex funciona bien para colas reintentables, evaluaciones y trabajo masivo que pueda absorber un fallo rápido. No debe ser la única ruta de una acción de cliente que no se puede repetir. On Demand ofrece una velocidad predecible, aunque durante los picos puede añadir latencia de cola. Cuando esa variación no es aceptable, Enterprise Performance es la alternativa contratada, con un SLA de disponibilidad del 99.9% y una garantía de latencia del 99% según el acuerdo empresarial.
Groq, Together AI y Fireworks empatan en tokens sin caché de GPT-OSS 120B
Groq no gana por el precio público de tokens de GPT-OSS 120B. Para el mismo modelo, Groq, Together AI y Fireworks AI publican una tarifa de $0.15 por entrada y $0.60 por salida por millón de tokens.
Usemos una carga normalizada: 100 millones de tokens de entrada y 20 millones de salida. Sin descuento por caché, cada proveedor cuesta $27. Ese empate es el dato útil, porque desplaza la decisión hacia la economía de la caché, los límites de uso, las opciones de despliegue, la confiabilidad y la latencia observada.
Together AI
Together AI es un proveedor de inferencia con múltiples modelos. Su opción serverless de GPT-OSS 120B cuesta $0.15 por entrada y $0.60 por salida por millón de tokens. El producto serverless no exige un mínimo ni cobra aprovisionamiento.

La fila actual de GPT-OSS 120B de Together no publica una tarifa para entrada en caché. Su documentación establece que, si un modelo no tiene un precio de caché, toda la entrada se factura a la tarifa estándar. En la carga normalizada, el total permanece en $27 aunque se repita el prompt. Together ofrece precios de Batch hasta un 50% más bajos en modelos serverless compatibles, por lo que sigue siendo viable para trabajo asíncrono cuando ese modelo concreto es elegible.
Together es preferible cuando importa más disponer de un catálogo amplio o de una ruta desde serverless hasta infraestructura reservada que el perfil operativo específico de Groq. No conviene cambiar entre ambos solo por precio hasta que la carga revele una diferencia, porque la partida sin caché de GPT-OSS es idéntica.
Fireworks AI
Fireworks AI publica GPT-OSS 120B a $0.15 por entrada, $0.014 por entrada en caché y $0.60 por salida por millón de tokens, e incluye $1 de crédito serverless al registrarse.

Con el 50% de la entrada en caché, el total normalizado es de $20.20 en Fireworks, $23.25 en Groq y $27 en Together. Fireworks se convierte así en el ganador por precio público para cargas de GPT-OSS 120B con mucha entrada repetida, siempre que la tarifa de caché publicada sea aplicable a la carga medida. Para trabajo asíncrono, Groq Batch sigue siendo más barato: $13.50 con el mismo tráfico normalizado.
OpenAI desarrolló GPT-OSS, pero no lo ofrece mediante la API de OpenAI ni su aplicación de consumo. Una comparación directa con la API de OpenAI cambiaría tanto de proveedor como de modelo y rompería la normalización de precios. Primero debe compararse el mismo modelo entre proveedores de alojamiento; después, los distintos modelos propietarios se evalúan según el resultado aceptado. La selección de las API de IA más baratas cubre el panorama más amplio de modelos y proveedores.
La decisión entre proveedores queda clara:
- Elija Groq cuando su rendimiento síncrono y sus controles operativos ganen en la ruta medida, o cuando el descuento del 50% de Batch convierta el trabajo diferido en la opción más barata.
- Elija Fireworks cuando el contexto repetido de GPT-OSS consiga de forma constante la tarifa publicada de $0.014 por entrada en caché.
- Elija Together cuando importe su trayectoria más amplia de serverless a infraestructura dedicada y la carga no se beneficie de una tarifa de caché para GPT-OSS.
Quién debería elegir Groq y quién debería descartarlo
Groq es una opción sólida cuando un modelo abierto ya supera el umbral de calidad y la velocidad de respuesta influye en el producto. Pierde fuerza cuando el modelo requerido, la garantía de capacidad o el control de despliegue quedan fuera de su catálogo actual de autoservicio.
- El plan Free permite evaluar modelos de producción con suficiente holgura antes de añadir un método de pago.
- Developer no exige suscripción base ni compromiso anual.
- Las tarifas públicas bajo demanda se mantienen por debajo de $1 por millón de tokens en todos los modelos de texto en producción.
- Batch reduce un 50% el costo del trabajo asíncrono elegible sin consumir los límites estándar del modelo.
- La caché de prompts de GPT-OSS es automática y reduce a la mitad las tarifas de la entrada almacenada.
- Spend Limits puede bloquear el consumo de toda la organización antes de que un presupuesto mensual quede sin control.
- Los límites de Free se comparten en toda la organización y pueden agotarse por tokens mucho antes que por solicitudes.
- Los descuentos de Batch y caché no se acumulan.
- Los cargos de las herramientas de Compound pueden superar ampliamente el gasto en tokens del modelo.
- La caché de prompts solo admite la familia GPT-OSS indicada y depende de que el prefijo coincida exactamente.
- Flex puede devolver HTTP 498 cuando no hay capacidad de mejor esfuerzo disponible.
- Los modelos preview pueden retirarse con poca antelación, por lo que no deben sostener una dependencia de producción que no pueda trasladarse.
Una startup con financiamiento debería elegir Groq cuando un modelo abierto rápido mantiene ágil el producto y el equipo puede conservar una alternativa con el mismo modelo. Un CTO de una empresa mediana debería adoptar Developer solo después de centralizar las claves, registrar el uso de modelos y herramientas y fijar un tope para la organización. Para un responsable sénior de operaciones, lo importante es el costo por resultado aceptado, no el llamativo titular de tokens por dólar.
No conviene usar Groq como único proveedor si la aplicación necesita un modelo propietario ausente de su catálogo, una ruta de mejor esfuerzo con garantías o un modelo preview sin sustituto estable. Enterprise Performance puede cubrir la capacidad contratada para los modelos compatibles, pero utiliza precios de aprovisionamiento personalizado y no constituye un nivel público más barato.
La regla de decisión explícita es esta: elija Groq únicamente si un modelo actual de producción supera la prueba de aceptación y su comportamiento síncrono o el costo de Batch vence a la alternativa con el mismo modelo. Si ninguna condición se cumple, la baja tarifa por token no justifica una migración.
El historial de precios de Groq exige verificar los datos vigentes
Los precios de Groq cambian por función y por modelo, aunque la estructura de facturación siga siendo de pago por uso. El lanzamiento de Developer en febrero de 2025 anunciaba Batch con un descuento del 25% frente al precio síncrono. La documentación vigente de Batch eleva ese descuento al 50%.
Groq también redujo los precios de GPT-OSS y empezó a incorporar caché de prompts a la familia en octubre de 2025. El resultado actual es $0.15/$0.60 para GPT-OSS 120B y $0.075/$0.30 para GPT-OSS 20B, con la entrada en caché a la mitad de la tarifa estándar de entrada.
La rotación del catálogo importa tanto como el historial de precios. Los modelos presentes en comparativas anteriores, incluidas las opciones de Kimi y DeepSeek, ya no aparecen en la página actual de modelos compatibles. Todo presupuesto debería guardar la fecha de verificación, el ID del modelo y una alternativa, en lugar de tratar un precio copiado como permanente.
La tarea del lunes: calcular y limitar un flujo aceptado
El lunes, seleccione un flujo de trabajo acotado y prepare un presupuesto que ingeniería y finanzas puedan revisar. No empiece por una migración de todo el proveedor.
Capture la forma del tráfico
Exporte una semana representativa de número de solicitudes, tokens de entrada, tokens de salida, tokens con coincidencia de caché, ID de modelos, llamadas a herramientas, reintentos y resultados aceptados. Separe el tráfico síncrono de los trabajos que pueden esperar.
Calcule tres rutas
Calcule On Demand con las tarifas vigentes del modelo, Batch al 50% para trabajo diferido elegible y las herramientas como partidas independientes. No aplique ahorros de caché a Batch ni dé por válida una proporción de caché que los campos de uso todavía no hayan medido.
Fije el límite de pago
Si los límites de Free interrumpen la ruta, pásela a Developer. Configure un Spend Limit mensual entre un 20% y un 30% por encima de la previsión y coloque alertas en 50%, 75% y 90%. Deje margen para el retraso de 10 a 15 minutos en los datos.
Mantenga activa una alternativa
Ejecute el mismo modelo mediante otro proveedor con un pequeño conjunto de evaluación. Registre el endpoint, la tasa de aceptación observada y el criterio de desvío, para que un cambio de catálogo o un error de capacidad no obligue a una migración de emergencia.
El resultado es una partida presupuestaria por cada flujo aceptado: tokens del modelo, herramientas, reintentos y revisión humana. Hay que recalcularla cuando cambien el catálogo de modelos vigente, los límites de uso o la página de precios.
Preguntas frecuentes
¿Cuánto cuesta Groq AI?
Groq Free cuesta $0. Developer no tiene suscripción base y cobra el uso según el modelo. Los precios actuales de los modelos de texto en producción van de $0.05 por entrada y $0.08 por salida por millón de tokens con Llama 3.1 8B Instant a $0.59 por entrada y $0.79 por salida con Llama 3.3 70B Versatile.
¿Groq se puede usar gratis?
Sí, dentro de los límites por organización específicos de cada modelo. En Free, GPT-OSS 120B y 20B muestran actualmente 30 RPM, 1,000 RPD, 8,000 TPM y 200,000 TPD. Superar un límite aplicable devuelve HTTP 429.
¿Qué modelos de Groq AI se pueden usar gratis?
El plan Free da acceso al catálogo compatible con topes específicos para cada modelo. Para una evaluación duradera conviene utilizar modelos de producción. Groq indica que los modelos preview están destinados a evaluación y pueden retirarse con poca antelación.
¿Cuánto cuesta Groq al mes?
No existe una suscripción pública mensual ni anual de autoservicio. El costo mensual se obtiene sumando el uso de entrada, salida, audio, herramientas y nivel de servicio a las tarifas vigentes. La carga calculada de 100,000 solicitudes con GPT-OSS 120B cuesta $60 de forma síncrona antes de caché o herramientas.
¿Groq ofrece descuento para estudiantes?
Groq no publica un descuento específico para estudiantes en las páginas de precios o facturación verificadas en agosto de 2026. Tanto estudiantes como otros usuarios de bajo consumo pueden usar el plan general Free de $0 dentro de sus límites.
¿Cuál es la política de reembolso de Groq?
Groq estudia las solicitudes generales de reembolso caso por caso a través de soporte. Las condiciones de Service Credits son más estrictas: los créditos comprados y promocionales no son reembolsables ni transferibles y caducan al año, salvo que se indique otro plazo.
¿Han cambiado los precios de Groq?
Sí. Batch se lanzó en febrero de 2025 con un descuento del 25% sobre los precios síncronos y hoy ofrece un 50%. Groq redujo los precios de GPT-OSS y añadió caché a la familia en octubre de 2025. Conviene verificar la página vigente, porque el catálogo y las tarifas de cada modelo cambian.
¿Cómo se comparan los precios de Groq y OpenAI?
OpenAI no ofrece GPT-OSS mediante su propia API, por lo que una comparación directa cambia de modelo. En una carga normalizada de GPT-OSS 120B, Groq, Together AI y Fireworks AI cuestan $27 por 100 millones de tokens de entrada y 20 millones de salida antes de descuentos por caché.
Obtenga el mapa de herramientas de IA para dueños de empresas
El mapa de herramientas de IA para dueños de empresas convierte los precios de los modelos en una ruta de adopción, con el umbral de calidad, la función operativa y el criterio de costo que cada herramienta debe justificar. Suscríbase para recibir gratis la próxima edición.
3 sept 2026







