La API de inteligencia artificial más barata: 8 opciones comparadas
Comparamos 8 API de IA por precio, funciones y privacidad. Descubra cuál cuesta menos, cuál ofrece un plan gratis y cuál conviene para producción.

DeepInfra tiene el precio de lista más bajo de esta comparativa: Mistral Nemo cuesta $0.019 por millón de tokens de entrada y $0.03 por millón de tokens de salida. Sin embargo, DeepSeek V4 Flash es una opción económica más sólida para producción, con un precio de $0.14/$0.28, JSON, llamadas a herramientas y una ventana de contexto de 1M de tokens; para un prototipo gratuito, gana Gemini 2.5 Flash-Lite. La API de inteligencia artificial más barata que realmente conviene es el escalón de menor precio que cumple los mínimos de calidad, privacidad y latencia de la carga de trabajo.
API de inteligencia artificial más barata: veredicto rápido
DeepSeek V4 Flash es la mejor API de IA barata para la mayoría de las cargas de texto en producción. Su tarifa estándar permite procesar 10 millones de tokens de entrada y 2 millones de tokens de salida por $1.96. Además, el mismo modelo admite salida JSON, llamadas a herramientas, una Responses API y una ventana de contexto de 1M de tokens. Esa combinación pesa más que ahorrar la última fracción de dólar.
Hay tres ganadores porque «la más barata» puede referirse a tres necesidades distintas:
- DeepInfra ofrece el menor precio puro por token. Mistral Nemo cuesta $0.019 por millón de tokens de entrada y $0.03 por millón de tokens de salida.
- Google Gemini es la opción más barata para crear un prototipo. Gemini 2.5 Flash-Lite cuenta con un plan gratuito; después, en el plan Standard de pago, cuesta $0.10 por millón de tokens de entrada y $0.40 por millón de tokens de salida.
- DeepSeek es la alternativa más barata como opción solvente para producción. V4 Flash cuesta $0.14 por millón de tokens de entrada sin acierto de caché y $0.28 por millón de tokens de salida, e incluye las funciones de API que necesita la mayoría de los backends.
Todos los precios que aparecen a continuación se comprobaron en la página de precios o la documentación en vivo de cada proveedor el 10 de agosto de 2026. Salvo que una celda indique lo contrario, los importes corresponden a 1 millón de tokens de entrada/salida.
La tabla no es una clasificación por calidad. Un modelo 3B a $0.10/$0.10 y un modelo actual para producción a $0.14/$0.28 son productos distintos, aunque ambos acepten una solicitud de chat completions. El precio de lista sirve para seleccionar candidatos; la elección final debe salir de una prueba de aceptación propia.
Cuánto cuestan 20,000 solicitudes de IA
Con volúmenes pequeños y medianos, todos estos proveedores son tan económicos que una sola mala decisión de flujo de trabajo cuesta más que la factura de tokens. Aun así, comparar una carga normalizada resulta útil porque deja a la vista los precios elevados de salida y las comisiones que una tarifa aislada de entrada oculta.
Supongamos que un producto realiza 20,000 llamadas al mes. Cada llamada contiene 500 tokens de entrada y devuelve 100 tokens de salida. En total son 10 millones de tokens de entrada y 2 millones de tokens de salida:
Costo mensual = 10 × precio de entrada + 2 × precio de salida.

La diferencia parece enorme en porcentajes y mínima en dólares. Para esta carga, DeepSeek cuesta $1.71 más que Mistral Nemo en DeepInfra. OpenAI Luna cuesta $2.44 más que DeepSeek. Si el modelo barato rompe un esquema, pasa por alto una petición de un cliente o crea una cola de revisión manual, el ahorro desaparece enseguida.
Ese es el umbral de calidad: el comportamiento mínimo que una tarea puede aceptar sin trabajo compensatorio. Un endpoint de clasificación limitado a cinco etiquetas tiene un umbral bajo. Una respuesta de soporte al cliente basada en datos de su cuenta exige mucho más. Un agente con permiso para actualizar registros eleva todavía más el umbral, porque el costo de una mala acción no se limita a otra llamada a la API.
El precio de salida merece atención especial. Un resumidor puede leer un documento largo y devolver un resultado breve, de modo que domina la entrada. Un agente de programación, un generador de correos comerciales o un asistente conversacional puede producir mucha más salida. La tarifa de salida de OpenAI Luna, $1.20, multiplica por seis su tarifa de entrada de $0.20; la de Mistral Small 4, $0.60, multiplica por cuatro la entrada de $0.15. Cobrar lo mismo por entrada y salida en modelos diminutos resulta atractivo para tareas con mucha generación, pero solo si esos modelos consiguen terminarlas.
1. DeepSeek: la mejor opción económica para producción
DeepSeek es el candidato inicial más sólido cuando una aplicación en producción necesita tokens baratos sin renunciar a JSON, herramientas ni contexto largo. V4 Flash 0731 cuesta $0.14 por millón de tokens de entrada sin acierto de caché y $0.28 por millón de tokens de salida. La API publica un contexto de 1M de tokens, una salida máxima de 384K, salida JSON, llamadas a herramientas, Responses API y una ruta compatible con Anthropic. Es un conjunto de funciones para producción más amplio que el de la mayoría de los modelos situados al pie de la escala de precios.

El obstáculo es la estabilidad del presupuesto. La propia página de precios de DeepSeek anuncia un aumento general de precios en un futuro cercano y anticipa que será considerable. Una startup puede aprovechar hoy el costo normalizado de $1.96, pero un equipo de compras no debería incorporar esa cifra a una previsión anual sin margen ni una segunda ruta.
Ideal para: Extracción en producción, generación estructurada, agentes económicos y tareas de contexto largo
Punto fuerte: Contexto de 1M, JSON, llamadas a herramientas, Responses API y compatibilidad con la API de Anthropic
Precio: $0.14 de entrada, $0.0028 de entrada con acierto de caché y $0.28 de salida por 1M de tokens para V4 Flash
Prueba gratuita: La página de precios no indica un plan gratuito permanente
- $1.96 por la carga normalizada de 10M de entrada y 2M de salida
- Contexto de 1M de tokens y salida de hasta 384K
- Salida JSON y llamadas a herramientas en el nivel económico
- Límite de concurrencia publicado de 2,500 para V4 Flash
- El proveedor ya ha advertido que los precios subirán de forma considerable
- No se publica un plan gratuito permanente
- Una ruta externa de bajo costo exige igualmente revisar privacidad, fiabilidad y región según el caso de uso del comprador
Por qué DeepSeek ocupa el primer puesto
DeepSeek gana cuando un modelo barato debe hacer algo más que etiquetar texto. Pensemos en un producto SaaS B2B que extrae la fecha de renovación, el valor del contrato, el plazo de preaviso y los riesgos identificados en acuerdos cargados. La salida se puede validar con un esquema, pero el modelo necesita contexto suficiente para leer un documento largo y buen seguimiento de instrucciones para devolver todos los campos requeridos. V4 Flash reúne el costo y las funciones de API adecuados para una primera evaluación.
La tarifa por acierto de caché es excepcionalmente baja: $0.0028 por millón de tokens de entrada. Resulta relevante cuando se repiten las mismas instrucciones estables o el mismo prefijo de referencia. Eso no significa que todos los tokens de entrada cuesten $0.0028; la tarifa solo se aplica a los aciertos de caché. Presupueste los fallos de caché a $0.14 hasta que los datos de uso demuestren la proporción real de aciertos.
Cómo evaluar DeepSeek en una semana
Elija una tarea acotada
Empiece con extracción, clasificación, resumen o una acción de agente de solo lectura. Defina los campos, las salidas permitidas y las condiciones de fallo antes de enviar tráfico.
Cree un conjunto de evaluación de 100 solicitudes
Use solicitudes representativas y depuradas de la carga real. Incluya entradas breves, largas, ambiguas, mal formadas y casos límite para que la ruta más barata no gane por haber visto únicamente ejemplos sencillos.
Exija una salida verificable por máquina
Use salida JSON cuando la tarea tenga un esquema. Registre en cada llamada la tasa de esquemas válidos, la tasa de respuestas aceptadas, la latencia, los tokens de entrada y salida, y los aciertos de caché.
Conserve el modelo actual como respaldo
Envíe a la ruta de confianza actual los fallos de validación, los casos de baja confianza y cualquier acción con consecuencias importantes. El primer despliegue debe poder revertirse.
Configure una alerta de cambio de precio
DeepSeek ha comunicado que los precios subirán. Vuelva a calcular la carga normalizada cuando el proveedor publique la nueva tarifa, en vez de convertir un precio temporal en una premisa arquitectónica.
Elija DeepSeek si V4 Flash supera la tarea y la organización puede asumir variaciones de precio. Descártelo cuando pesen más un precio unitario anual fijo, una región de procesamiento concreta o una relación consolidada con otro proveedor.
2. Google Gemini: la mejor API de IA gratis
Google Gemini es la mejor ruta gratuita para un prototipo que utilice datos depurados. Gemini 2.5 Flash-Lite ofrece tokens de entrada y salida gratuitos en el plan Free. Cuando la aplicación pasa al nivel Paid, la tarifa Standard es de $0.10 por millón de tokens de entrada de texto, imagen o video y de $0.40 por millón de tokens de salida; Batch y Flex reducen ambos importes a la mitad, hasta $0.05/$0.20.

El plan gratuito tiene una implicación de privacidad que debe formar parte de la decisión, no quedarse en una nota al pie. La página de precios de Google indica que el contenido del nivel Free se utiliza para mejorar sus productos, mientras que el del nivel Paid no. Free resulta razonable para prompts sintéticos, documentos públicos y el conjunto de pruebas de un desarrollador; no debe ser la opción predeterminada para registros de clientes, documentos confidenciales ni código aún no publicado.
Ideal para: Prototipos gratuitos, entradas multimodales, procesamiento por lotes y flujos documentales sensibles al costo
Punto fuerte: Ruta gratuita de entrada/salida y entrada de texto, imagen, video y audio en el plan de pago
Precio: Plan Free; Paid Standard a $0.10 para entrada de texto/imagen/video y $0.40 para salida; Batch/Flex a $0.05/$0.20
Prueba gratuita: Sí, un plan Free con acceso limitado a modelos
- Tokens de entrada y salida gratuitos en el plan Free
- $1.80 por la carga normalizada en Paid Standard
- $0.90 por la misma carga asíncrona con Batch o Flex
- El nivel Paid incluye caché de contexto y no usa el contenido para mejorar productos de Google
- El contenido del nivel Free se utiliza para mejorar productos de Google
- El acceso gratuito está limitado por modelo y cuota
- La entrada de audio cuesta $0.30 por millón de tokens en Standard, tres veces más que la entrada de texto/imagen/video
El paso del plan gratuito al de pago
Quien esté validando una función de etiquetado de documentos puede utilizar el nivel Free con documentos públicos o generados, comprobar la forma de la respuesta y conocer el perfil de tokens antes de añadir la facturación. Cuando entren documentos de clientes en el flujo, el salto a Paid no será solo una cuestión de volumen: también cambia las condiciones de uso del contenido y aporta mayores límites de producción, caché de contexto y acceso a Batch.
Para la carga normalizada, Paid Standard cuesta $1.80; Batch o Flex, $0.90. Por precio de lista, Gemini resulta así más barato que DeepSeek para trabajo asíncrono, aunque la decisión correcta sigue dependiendo de qué modelo supere la tarea. Si los resultados no tienen que llegar de inmediato, conviene evaluar la reducción del 50% antes de cambiar de proveedor.
Gemini también acepta imágenes y video con la misma tarifa de entrada Standard de $0.10 que aplica al texto en 2.5 Flash-Lite. Por eso es un candidato más sólido que los modelos pequeños exclusivamente textuales cuando el flujo lee recibos, capturas de pantalla o imágenes de producto. La página de precios presenta Flash-Lite como el modelo de Google más pequeño y rentable a escala, el escalón adecuado para empezar antes de pasar a un modelo Gemini mayor.
Elija Gemini cuando el proyecto necesite empezar gratis, admita entrada multimodal o pueda aprovechar el procesamiento asíncrono a mitad de precio. Evite el nivel Free para datos sensibles y descarte Flash-Lite si la prueba de aceptación exige un modelo más grande.
3. DeepInfra: el precio puro por token más bajo
DeepInfra gana por precio puro: Mistral Nemo Instruct cuesta $0.019 por millón de tokens de entrada y $0.03 por millón de tokens de salida. La carga normalizada de 20,000 solicitudes cuesta $0.25. DeepInfra también ofrece Meta Llama 3.1 8B a $0.02/$0.04 y DeepSeek V4 Flash a $0.09/$0.18, por lo que es posible subir por la escala de modelos del mismo host sin abrir otra cuenta de facturación.

El límite está en el modelo que hay detrás del precio. Mistral Nemo y Llama 3.1 8B son baratos porque son modelos abiertos, pequeños y antiguos. Una tarea rígida de etiquetado quizá no necesite más. Un flujo orientado al cliente no debería heredar ese precio bajo hasta que una evaluación propia confirme que la salida es aceptable.
Ideal para: Clasificación de alto volumen y bajo riesgo, etiquetado, extracción ligera y experimentos de precio entre modelos
Punto fuerte: La menor tarifa publicada por token para generación de texto en esta comparativa
Precio: Mistral Nemo $0.019 de entrada/$0.03 de salida; Llama 3.1 8B $0.02/$0.04
Prueba gratuita: No; DeepInfra indica que se requiere tarjeta o prepago
- $0.25 por la carga normalizada con Mistral Nemo
- Catálogo amplio de modelos de texto, embeddings, imagen, audio y video
- Modalidades Standard, Priority y Flex, esta última más económica
- Escalado automático con un límite publicado de 200 solicitudes simultáneas por cuenta
- La tarifa más baja compra un modelo pequeño, no una opción universal para producción
- Se requiere tarjeta o prepago
- Flex puede ser más lento y no estar disponible en ocasiones
Cuándo usar DeepInfra: respuestas con un espacio limitado
Un marketplace de servicios locales que clasifica los mensajes entrantes como quote, reschedule, cancel, billing u other trabaja con un espacio de salida estrecho. Puede rechazar cualquier valor que no esté entre esos cinco y enviar los casos ambiguos a una ruta de respaldo. Ese es el tipo de tarea en el que un modelo de $0.019/$0.03 merece una evaluación.
Un asistente de soporte que responde preguntas específicas sobre una cuenta plantea otro reto. Debe recuperar el registro correcto, respetar las políticas, conservar los matices y no dar una respuesta equivocada con excesiva seguridad. Ahorrar $1.71 frente a DeepSeek en la carga normalizada no justifica trasladar esa tarea a Mistral Nemo sin un resultado de aceptación más sólido.
Los niveles de servicio de DeepInfra ofrecen otra palanca. Standard aplica la tarifa base de 1×. Priority cuesta 1.5× para acelerar la programación en momentos de alta demanda. Flex cuesta 0.8× a cambio de respuestas más lentas y alguna indisponibilidad ocasional. Reserve Flex para reprocesamientos, enriquecimiento offline o una cola nocturna que admita reintentos. No lo use para una respuesta interactiva al cliente solo por recortar un 20% de una factura que ya se mide en centavos.
Elija DeepInfra cuando una tarea estrecha y un validador sólido permitan repetir el ahorro de un modelo pequeño. Evite la fila más barata para redacción abierta, razonamiento complejo y acciones capaces de modificar datos de clientes o del negocio.
4. Groq: bajo costo cuando importa la latencia
Groq es la alternativa económica para trabajo interactivo que debe sentirse inmediato. Su ruta de producción Llama 3.1 8B Instant figura con unos 560 tokens por segundo, $0.05 por millón de tokens de entrada y $0.08 por millón de tokens de salida. La carga normalizada cuesta $0.66, apenas $0.41 más que el ganador por precio puro de DeepInfra.

La contrapartida está en la profundidad del modelo y la estabilidad del catálogo. La ruta más barata usa un modelo 8B. Groq separa los modelos aptos para producción y advierte que los modelos preview pueden retirarse con poca antelación; por tanto, el precio de una fila preview no constituye un compromiso de producción.
Ideal para: Clasificación de baja latencia, autocompletado, interfaces conversacionales y enrutamiento rápido de primera pasada
Punto fuerte: Unos 560 tokens de salida por segundo en el modelo de producción más barato
Precio: Llama 3.1 8B Instant $0.05 de entrada/$0.08 de salida; GPT OSS 20B $0.075/$0.30
Prueba gratuita: Las páginas de documentación revisadas no especifican públicamente las condiciones de prueba
- $0.66 por la carga normalizada con Llama 3.1 8B
- Unos 560 tokens por segundo con Llama 3.1 8B
- URL base compatible con OpenAI y una estructura de API conocida
- Separación clara entre modelos de producción y preview
- La opción de producción más barata es solo un modelo 8B
- Los límites de tasa específicos de la cuenta deben consultarse en el panel
- La disponibilidad de los modelos preview puede cambiar con poca antelación
La latencia también forma parte del costo del producto
Un producto de voz o chat en vivo paga los retrasos en forma de turnos abandonados e interacciones incómodas, aunque la factura de la API siga siendo baja. Groq resulta creíble cuando el modelo cumple y la velocidad es la restricción principal. Un enrutador de intenciones breve que decide qué flujo debe gestionar el mensaje encaja mejor que una respuesta de soporte sujeta a muchas políticas.
La página del modelo indica una ventana de contexto de 131,072 tokens para Llama 3.1 8B, pero capacidad de contexto no equivale a calidad de contexto. Que un modelo acepte un prompt largo no garantiza que aproveche correctamente todos los detalles relevantes. La primera carga enviada a Groq debería ser breve, acotada y verificable por máquina.
La ruta GPT OSS 20B de Groq aumenta el tamaño del modelo, con unos 1,000 tokens por segundo y una tarifa de $0.075/$0.30. Su costo normalizado es de $1.35, todavía inferior a los $1.96 de DeepSeek, pero la decisión debe resolverse con el mismo conjunto de evaluación. Una cifra más baja no demuestra que siga mejor las instrucciones, use mejor las herramientas ni encaje mejor con el negocio.
Elija Groq cuando el usuario perciba el tiempo de respuesta y un modelo pequeño de producción supere la tarea. Descártelo si la carga requiere razonamiento de primer nivel o depende de un modelo preview sin estado de producción estable.
5. Mistral: el laboratorio directo más barato para modelos pequeños
Mistral ofrece la escala más clara de modelos pequeños directamente desde el proveedor. Ministral 3B parte de $0.10 por millón de tokens de entrada y $0.10 por millón de tokens de salida; el modelo 8B cuesta $0.15/$0.15 y el 14B, $0.20/$0.20. Mistral Small 4 cuesta $0.15/$0.60 y añade un conjunto más amplio de funciones de texto, agentes y multimodalidad.

La fila económica del modelo 3B no es la recomendación predeterminada para trabajo abierto de cara al cliente. Úsela donde un modelo diminuto tenga ventaja, por ejemplo en clasificación, preenrutamiento de moderación o transformación restringida de campos. Mistral Small 4 es un candidato más creíble para aplicaciones generales y cuesta $2.70 en la carga normalizada.
Ideal para: Acceso directo a modelos pequeños, preferencia por tratar con el proveedor, transformaciones por lotes y prompts repetidos con caché
Punto fuerte: Precio inicial uniforme de $0.10/$0.10, más descuentos del 50% en Batch y del 90% en entrada almacenada en caché
Precio: Ministral 3B $0.10/$0.10; Mistral Small 4 $0.15/$0.60
Prueba gratuita: No se indica un plan general gratuito de producción para los principales modelos de texto; algunos endpoints de Labs o moderación son gratuitos
- Precios directos y sencillos en los niveles 3B, 8B, 14B y Small
- Descuento del 50% por lotes para trabajo asíncrono de alto volumen
- Descuento del 90% en entrada almacenada en caché para prefijos estables y repetidos
- Mistral Small 4 admite usos de texto, agentes y multimodalidad
- El precio destacado de $0.10/$0.10 corresponde a un modelo 3B
- La salida de Mistral Small 4 cuesta cuatro veces más que la entrada
- No se indica un plan gratuito amplio de producción para los principales modelos de texto
Cuándo compensa la escala de Mistral
Supongamos que una plataforma de comercio electrónico genera cada noche etiquetas de catálogo a partir de títulos, atributos y descripciones. El proceso es asíncrono, cada artículo sigue un esquema estable y una persona puede revisar una muestra de errores antes de la siguiente actualización del catálogo. Ese flujo puede comenzar con Ministral 3B u 8B, aprovechar Batch para obtener un 50% de descuento y mantener las instrucciones estables de taxonomía en un prefijo con caché.
La economía cambia para un asistente de chat. En la carga normalizada, Ministral 3B cuesta $1.20 y Mistral Small 4, $2.70. La diferencia de $1.50 compra un modelo mayor y concebido para usos más amplios. Si Small 4 reduce las derivaciones al respaldo y la revisión, puede ser el sistema más barato aunque su línea de tokens sea más cara.
Elija Mistral cuando importe trabajar con un laboratorio de modelos de forma directa o contar con una escala de modelos pequeños. Evite la tarifa destacada del 3B en tareas abiertas mientras la evaluación no demuestre que se mantiene por encima del umbral de calidad.
6. SiliconFlow: el nuevo host multimodelo de bajo costo
SiliconFlow es el host multimodelo más barato de esta selección cuando hace falta algo mayor que una ruta 8B. GPT OSS 20B cuesta $0.04 por millón de tokens de entrada y $0.18 por millón de tokens de salida, con una ventana de contexto de 131K. Eso deja la factura de la carga normalizada en $0.76, y las cuentas nuevas reciben $1 en créditos.

La distinción importante está en el nombre del modelo. GPT OSS 20B es un modelo de pesos abiertos 20B, no acceso directo a la familia GPT-5.6 de OpenAI. SiliconFlow también ofrece DeepSeek V4 Flash a $0.13 de entrada, $0.028 de entrada en caché y $0.28 de salida; así, el catálogo permite pasar a una ruta más potente sin abandonar la cuenta.
Ideal para: Desarrolladores sensibles al costo que quieren varios modelos abiertos bajo una sola cuenta de proveedor
Punto fuerte: GPT OSS 20B a $0.04/$0.18 con $1 de crédito inicial
Precio: GPT OSS 20B $0.04 de entrada/$0.18 de salida; DeepSeek V4 Flash $0.13/$0.28
Prueba gratuita: $1 en créditos gratuitos y sin compromiso mínimo
- $0.76 por la carga normalizada con GPT OSS 20B
- El crédito de $1 cubre más que esa carga de prueba normalizada a precio de lista
- La página pública de precios no exige un compromiso mínimo
- Rutas de bajo costo para DeepSeek, Qwen, MiniMax, GPT OSS y otros modelos abiertos
- Los precios más bajos corresponden a modelos de pesos abiertos, no a API propietarias de frontera
- Elegir el modelo sigue trasladando la evaluación de calidad al comprador
- Un host multimodelo más nuevo puede exigir una revisión adicional de compras y fiabilidad
Un presupuesto de evaluación de $1
El crédito inicial de SiliconFlow es especialmente concreto. La carga normalizada con GPT OSS 20B cuesta $0.76, por lo que el crédito de $1 alcanza para una ejecución completa normalizada por precio antes de reintentos u otros modelos. Eso no equivale a un mes gratuito de producción. Significa que se pueden medir la forma de la salida, la latencia y el cómputo de tokens sin comprometer de antemano un saldo mayor.
Para una cola interna de resúmenes, comience con GPT OSS 20B y envíe los fallos o casos de baja confianza a DeepSeek V4 Flash dentro de la misma plataforma. Las tarifas hacen legible esa escala: $0.04/$0.18 para la ruta barata y después $0.13/$0.28 para DeepSeek. La aplicación debe registrar qué modelo respondió, porque una factura combinada sin datos de aceptación por modelo no permite saber si el nivel barato aporta valor.
Elija SiliconFlow cuando una sola plataforma de bajo costo y un catálogo amplio de modelos abiertos simplifiquen la evaluación. Descártelo si el comprador exige un contrato directo con el desarrollador del modelo o ya cuenta con un gateway que ofrece los mismos modelos a un costo total aceptable.
7. OpenRouter: la opción más barata para seguir cambiando
OpenRouter es el mejor gateway económico cuando la posibilidad de cambiar de modelo justifica una pequeña comisión de facturación. Traslada los precios de inferencia del proveedor sin recargo, ofrece variantes gratuitas y reúne numerosos proveedores bajo una sola clave de API. DeepSeek V4 Flash Latest figura a $0.08 por millón de tokens de entrada y $0.252 por millón de tokens de salida, de modo que el gasto normalizado del modelo asciende a $1.304 antes de las comisiones por compra de créditos.

El límite está en la forma de financiar los créditos. OpenRouter cobra un 5.5% con un mínimo de $0.80 al comprar créditos. El mínimo deja de aplicarse a partir de unos $14.55, porque $0.80 dividido entre 5.5% da $14.5455. Por eso, comprar $10 en créditos implica una comisión de $0.80, es decir, un 8% en lugar del 5.5%.
Ideal para: Comparar modelos, conservar rutas de respaldo y cambiar de proveedor sin reescribir la aplicación
Punto fuerte: Precios de los proveedores trasladados sin recargo de inferencia
Precio: Variantes gratuitas a $0; los modelos de pago varían; DeepSeek V4 Flash Latest $0.08/$0.252 antes de la comisión por créditos
Prueba gratuita: Pequeña asignación para cuentas nuevas y variantes gratuitas con límites diarios bajos
- Una sola clave de API para numerosos proveedores y modelos
- Sin recargo sobre la tarifa de inferencia subyacente
- Variantes gratuitas para evaluación
- El primer 1M de solicitudes BYOK de cada mes es gratuito
- Comprar créditos cuesta un 5.5% con un mínimo de $0.80
- Las variantes gratuitas permiten solo 50 solicitudes diarias antes de acumular una compra de créditos de $10; después, 1,000 al día
- Los créditos de pago caducan tras un año sin uso
- El plan de fiabilidad debe contemplar tanto los fallos del gateway como los del proveedor subyacente
Cuándo se amortiza la comisión del gateway
Un desarrollador que prueba DeepSeek, Gemini y un modelo abierto puede dedicar más tiempo de ingeniería a credenciales, facturación, reintentos y formatos de respuesta separados que a la propia inferencia. OpenRouter convierte ese cambio en una configuración de enrutamiento. La comisión es razonable cuando esa comodidad mantiene listo un respaldo o permite al equipo sustituir con rapidez una ruta deficiente.
Las recargas pequeñas distorsionan la economía. Con $10, el mínimo de $0.80 equivale a una comisión del 8%. Con $100, el 5.5% suma $5.50 y el porcentaje se comporta como se anuncia. Un prototipo pequeño debe aceptar el mínimo como costo de conveniencia o utilizar el plan gratuito directo de un proveedor. No compare la tarifa de un modelo en OpenRouter con la tarifa directa olvidando la comisión por créditos.
La ruta BYOK tiene otra regla. El primer 1M de solicitudes al mes con claves propias de proveedores es gratuito; después, OpenRouter cobra el 5% de lo que habría costado esa ruta de modelo y proveedor en OpenRouter. BYOK puede conservar los límites directos del proveedor y centralizar el enrutamiento, pero no elimina la necesidad de vigilar dos superficies de facturación y fallos.
Elija OpenRouter cuando una sola integración y el cambio rápido de modelos justifiquen la comisión. Descártelo si el producto utiliza un único proveedor estable, la API directa ya cumple los requisitos de disponibilidad y el gateway adicional no aporta valor operativo.
8. OpenAI: la ruta convencional de migración más barata
OpenAI no gana por precio de token, pero GPT-5.6 Luna puede ser la ruta económica de menor riesgo para un producto que ya funciona sobre OpenAI. Luna cuesta $0.20 por millón de tokens de entrada de contexto corto, $0.02 por entrada en caché y $1.20 por salida en Standard. Batch y Flex reducen a la mitad las tarifas de entrada y salida, hasta $0.10/$0.60, por lo que la carga normalizada cuesta $2.20 en lugar de $4.40.

Migrar también tiene un costo, aunque nunca aparezca en una factura de API. Los esquemas, prompts, reglas de moderación, herramientas, trazas, mecanismos de respaldo y evaluaciones de carga existentes pueden volver irrelevante una diferencia mensual de $2.44 en tokens. Si la ruta actual de OpenAI ya supera los controles, el producto debería evaluar primero Luna, la caché y Batch/Flex antes de cambiar de proveedor.
Ideal para: Productos que ya usan OpenAI, herramientas convencionales para desarrolladores, prompts estables en caché y tareas asíncronas por lotes
Punto fuerte: GPT-5.6 Luna combina un modelo actual y económico de OpenAI con tarifas Batch/Flex un 50% menores
Precio: Standard $0.20 de entrada/$0.02 en caché/$1.20 de salida; Batch/Flex $0.10/$0.01/$0.60
Prueba gratuita: No se indica un plan gratuito permanente de API
- Costo normalizado de $2.20 con Batch o Flex
- La entrada almacenada en caché cuesta una décima parte de la entrada estándar
- Las aplicaciones existentes de OpenAI pueden evaluar un modelo más barato sin migrar de proveedor
- Tarifas separadas y claras para Standard, Batch, Flex y contexto largo
- La salida Standard cuesta seis veces más que la entrada
- El costo normalizado Standard es de $4.40, el más alto entre las rutas clasificadas
- El procesamiento regional apto tiene un recargo del 10%
- Luna con contexto largo aplica tarifas superiores de $0.40 para entrada y $1.80 para salida
Optimice dentro de OpenAI antes de migrar
El análisis de enrutamiento de GPT-5.6 profundiza en cuándo encajan Luna, Terra y Sol. Para esta decisión de costos, el primer paso es más simple: asigne a Luna el trabajo breve y repetible, almacene en caché los prefijos estables, envíe las tareas no urgentes por Batch o Flex y conserve el modelo actual más potente como respaldo.
Con 10 millones de tokens de entrada y 2 millones de tokens de salida, Luna Standard cuesta $4.40. Batch o Flex cuestan $2.20. DeepSeek V4 Flash cuesta $1.96. La diferencia entre OpenAI optimizado y DeepSeek directo es de $0.24 para la carga normalizada, demasiado poco para justificar por sí sola una migración de proveedor.
El contexto largo y la configuración regional pueden alterar el resultado. Las tarifas Standard de Luna para contexto largo son de $0.40 por entrada y $1.80 por salida, y el procesamiento regional apto añade un 10%. Aplique la tarifa correspondiente a la solicitud y a la modalidad de procesamiento, en lugar de extender el precio destacado de contexto corto a todos los tokens.
Elija OpenAI cuando el producto ya funcione allí, importe una relación directa con un proveedor convencional o Batch/Flex cierre casi toda la diferencia de precio. Evite Standard para tareas offline con reintentos que puedan usar las rutas a mitad de precio.
Qué API de IA elegir en cada caso
Decida primero según las consecuencias y, después, calcule el precio del modelo más barato que pueda asumirlas. Esta única regla evita la mayoría de los falsos ahorros.

Para un prototipo gratuito con datos depurados, elija Gemini 2.5 Flash-Lite. Ofrece el inicio más claro a costo cero y un paso sencillo al precio Paid Standard de $0.10/$0.40. No envíe datos de clientes ni información confidencial a Free, porque sus condiciones de uso del contenido difieren de Paid.
Para producción en vivo de bajo riesgo, empiece con DeepSeek V4 Flash. JSON, llamadas a herramientas, contexto de 1M y un costo normalizado de $1.96 lo convierten en el mejor candidato general. Mantenga un margen ante cambios de precio y una ruta de respaldo, ya que el proveedor ha anunciado una próxima subida.
Para un clasificador estrecho y de gran volumen, evalúe primero DeepInfra. El costo normalizado de $0.25 solo cobra sentido si las salidas permitidas están acotadas y detectar fallos resulta barato. Suba de nivel en cuanto la tarea se vuelva abierta.
Cuando la latencia sea visible, evalúe Groq. La ruta de 560 tokens por segundo con Llama 3.1 8B puede dar sensación de inmediatez a una interfaz por $0.05/$0.08. Úsela como carril rápido con un respaldo más profundo, no como sustituto automático de todos los modelos.
Para colas offline, compare Gemini Batch/Flex, Mistral Batch y OpenAI Batch/Flex. Los tres documentan una reducción del 50%. El mejor proveedor será aquel cuyo modelo supere la prueba de aceptación de la cola, no el que tenga la menor tarifa Standard sin descuento.
Para cambiar con facilidad, elija OpenRouter. Su comisión puede salir más barata que mantener varias integraciones, sobre todo cuando el respaldo y la rotación de modelos forman parte del producto. Con un único proveedor estable, la facturación directa es más simple.
En una aplicación existente de OpenAI, pruebe Luna antes de migrar. Batch/Flex reduce el costo normalizado a $2.20, apenas $0.24 por encima de DeepSeek. Las evaluaciones y operaciones ya creadas pueden valer mucho más que esa diferencia.
La decisión cambia cuando la ruta barata cae por debajo del umbral de aceptación de la carga. Mantenga el modelo de menor precio mientras la validez del esquema, las respuestas aceptadas, la latencia, las condiciones de privacidad y la recuperación cumplan los requisitos. Suba un escalón cuando falle uno de esos puntos. No siga acumulando parches de prompts para ahorrar centavos.
Quien ofrezca a sus clientes una experiencia impulsada por API también debe asumir la autenticación, la facturación, la revisión y la gestión de fallos. La guía para crear con la API de v0 muestra por qué el modelo o agente subyacente es solo una capa del producto.
Cómo seleccionamos estas API
La clasificación premia la decisión de compra fiable más barata, no la cifra aislada más baja de entrada. Cada proveedor se valoró y analizó a partir de sus páginas oficiales en vivo el 10 de agosto de 2026. No se contrataron las API ni se presentaron como si se hubieran probado en producción.
La decisión aplica estos criterios:
- Precio inicial útil: tarifas de entrada y salida de un modelo identificado y disponible en ese momento
- Umbral de calidad: si el nivel del modelo resulta plausible para una tarea restringida o para un flujo de producción más amplio
- Funciones operativas: JSON, herramientas, contexto, lotes, caché, límites de tasa e implicaciones del respaldo
- Consecuencias de privacidad y contrato: tratamiento de los datos gratuitos, estabilidad del precio y posibles comisiones independientes del gateway
- Costo de cambio: trabajo necesario para migrar prompts, esquemas, conjuntos de evaluación, monitoreo y facturación
Ocho proveedores entraron en la selección porque cada uno responde a una decisión de compra distinta. Se excluyeron aquellos cuya ruta de texto para producción más barata quedaba muy por encima de esta franja de costos, cuyo precio no podía normalizarse por token o cuyo papel duplicaba otra opción sin ofrecer una ventaja más clara. También quedaron fuera las API especializadas en imagen, video, voz y embeddings, porque sus unidades no son comparables con los tokens de entrada y salida de texto.
El cálculo de costos es un análisis original basado en una carga explícita; no es un benchmark. El costo por resultado aceptado solo puede obtenerse con solicitudes representativas propias, validadores y un proceso de revisión.
Opciones que conviene evitar
Variantes gratuitas de OpenRouter como dependencia de producción
Evite que una variante gratuita de OpenRouter sea la única ruta detrás del tráfico real de clientes. La cuenta recibe 50 solicitudes diarias a modelos gratuitos hasta que haya comprado al menos $10 en créditos; después, el límite sube a 1,000 al día. Es una asignación de evaluación, no un plan de capacidad fiable.
Gemini Free con datos de clientes o información confidencial
Evite enviar contenido sensible a Gemini Free. Google indica que el contenido del nivel Free se utiliza para mejorar sus productos, mientras que el del nivel Paid no. La factura normalizada de Paid Standard es de $1.80, por lo que no tiene sentido ahorrar esa cantidad a costa de la privacidad.
DeepInfra Mistral Nemo para trabajo abierto de cara al cliente
Evite llevar la ruta de $0.019/$0.03 directamente a soporte abierto, interpretación jurídica o acciones autónomas. Esa tarifa corresponde a un modelo pequeño. Úselo para una tarea restringida y validada, y mantenga un respaldo más potente hasta que los datos de aceptación justifiquen ampliar su alcance.
DeepSeek sin respaldo ante cambios de precio
Evite tratar los $0.14/$0.28 como una tarifa anual fija. DeepSeek anuncia una subida considerable. El modelo puede seguir siendo hoy la mejor opción predeterminada, pero tanto el presupuesto como la arquitectura necesitan una segunda ruta.
OpenAI Standard para tareas offline que admiten reintentos
Evite pagar la tarifa Standard de Luna, $0.20/$1.20, por trabajo que puede esperar. Batch y Flex cuestan $0.10/$0.60 y reducen la carga normalizada de $4.40 a $2.20 sin cambiar de proveedor.
El paso del lunes
La próxima semana, mueva una clase de tarea acotada, no toda la aplicación. Una evaluación con 100 solicitudes basta para descubrir fallos evidentes de esquema, latencia y enrutamiento antes de involucrar tráfico de producción; no sustituye el monitoreo continuo.
Reúna 100 solicitudes representativas
Elija una sola tarea y seleccione entradas normales, difíciles, ambiguas y mal formadas. Elimine datos personales, confidenciales y de clientes antes de usar cualquier plan gratuito.
Ejecute tres rutas
Compare el proveedor actual, DeepSeek V4 Flash y Gemini 2.5 Flash-Lite. Añada DeepInfra o Groq solo cuando el objetivo explícito sea el precio puro o la latencia.
Califique cuatro resultados
Registre la tasa de esquemas válidos, la tasa de respuestas aceptadas, la latencia de extremo a extremo y el costo exacto de tokens de entrada/salida. Mantenga el tiempo de revisión humana como una medida operativa separada.
Enrute una sola clase ganadora
Envíe al proveedor más barato únicamente la tarea acotada que haya superado la prueba. Conserve la ruta anterior para fallos de validación, entradas ambiguas y acciones con mayores consecuencias.
Recalcule tras cada cambio del proveedor
Guarde la fórmula y los supuestos de carga. Vuelva a calcular cuando DeepSeek suba los precios, se retire un modelo o cambien los límites del plan gratuito y del gateway.
Este paso convierte una lista de tarifas en una decisión presupuestaria reversible. Además, produce la única cifra que una tabla pública de precios no puede ofrecer: el costo por resultado aceptado.
Preguntas frecuentes
¿Qué IA tiene la API más barata?
DeepInfra presenta el menor precio puro de generación de texto en esta comparativa: Mistral Nemo a $0.019 por millón de tokens de entrada y $0.03 por millón de tokens de salida. DeepSeek V4 Flash es la mejor opción económica para producción cuando la carga necesita JSON, herramientas y contexto largo.
¿Existe alguna API de IA gratis?
Sí. Google Gemini ofrece tokens gratuitos de entrada y salida en el nivel Free, y OpenRouter cuenta con variantes gratuitas de modelos. Gemini Free puede utilizar el contenido para mejorar productos de Google, mientras que las variantes gratuitas de OpenRouter están limitadas a 50 solicitudes diarias, o 1,000 al día después de comprar al menos $10 en créditos durante la vida de la cuenta.
¿Cuánto cuesta una API de IA?
Para 20,000 llamadas mensuales que suman 10M de tokens de entrada y 2M de salida, las rutas clasificadas van de $0.25 con Mistral Nemo en DeepInfra a $4.40 con OpenAI GPT-5.6 Luna Standard. Batch, Flex, la caché, las comisiones del gateway, los reintentos y el modelo que supere el umbral de calidad modifican la factura final.
¿Cuál es el precio de la API de ChatGPT?
Las suscripciones de ChatGPT y la facturación de la API de OpenAI van por separado. El modelo económico de OpenAI comparado aquí es GPT-5.6 Luna: $0.20 de entrada y $1.20 de salida por millón de tokens Standard de contexto corto, o $0.10/$0.60 mediante Batch o Flex.
Descargue la lista de verificación para auditar flujos de trabajo empresariales con IA y convierta esta escala de costos en una evaluación de proveedores de una semana.
3 sept 2026







