La API de inteligencia artificial más barata: 8 opciones comparadas

Comparamos 8 API de IA por precio, funciones y privacidad. Descubra cuál cuesta menos, cuál ofrece un plan gratis y cuál conviene para producción.

Thursday, September 3, 2026Omid Saffari
La API de inteligencia artificial más barata: 8 opciones comparadas

DeepInfra tiene el precio de lista más bajo de esta comparativa: Mistral Nemo cuesta $0.019 por millón de tokens de entrada y $0.03 por millón de tokens de salida. Sin embargo, DeepSeek V4 Flash es una opción económica más sólida para producción, con un precio de $0.14/$0.28, JSON, llamadas a herramientas y una ventana de contexto de 1M de tokens; para un prototipo gratuito, gana Gemini 2.5 Flash-Lite. La API de inteligencia artificial más barata que realmente conviene es el escalón de menor precio que cumple los mínimos de calidad, privacidad y latencia de la carga de trabajo.

API de inteligencia artificial más barata: veredicto rápido

DeepSeek V4 Flash es la mejor API de IA barata para la mayoría de las cargas de texto en producción. Su tarifa estándar permite procesar 10 millones de tokens de entrada y 2 millones de tokens de salida por $1.96. Además, el mismo modelo admite salida JSON, llamadas a herramientas, una Responses API y una ventana de contexto de 1M de tokens. Esa combinación pesa más que ahorrar la última fracción de dólar.

Hay tres ganadores porque «la más barata» puede referirse a tres necesidades distintas:

  • DeepInfra ofrece el menor precio puro por token. Mistral Nemo cuesta $0.019 por millón de tokens de entrada y $0.03 por millón de tokens de salida.
  • Google Gemini es la opción más barata para crear un prototipo. Gemini 2.5 Flash-Lite cuenta con un plan gratuito; después, en el plan Standard de pago, cuesta $0.10 por millón de tokens de entrada y $0.40 por millón de tokens de salida.
  • DeepSeek es la alternativa más barata como opción solvente para producción. V4 Flash cuesta $0.14 por millón de tokens de entrada sin acierto de caché y $0.28 por millón de tokens de salida, e incluye las funciones de API que necesita la mayoría de los backends.

Todos los precios que aparecen a continuación se comprobaron en la página de precios o la documentación en vivo de cada proveedor el 10 de agosto de 2026. Salvo que una celda indique lo contrario, los importes corresponden a 1 millón de tokens de entrada/salida.

HerramientaIdeal paraPrecio inicialPrueba gratuita
DeepSeekOpción económica predeterminada para producción$0.14 / $0.28No se indica un plan permanente
Google GeminiPrototipos gratuitos y entrada multimodalGratis; plan de pago $0.10 / $0.40Sí, plan gratuito
DeepInfraMenor tarifa pura por token$0.019 / $0.03No; exige tarjeta o prepago
GroqRespuestas económicas y de baja latencia$0.05 / $0.08No se especifica públicamente
MistralAPI directa de modelos pequeños$0.10 / $0.10Solo algunos endpoints gratuitos
SiliconFlowCatálogo multimodelo de bajo costo$0.04 / $0.18$1 en créditos
OpenRouterUna sola clave y cambio sencillo de modeloVariantes gratuitas a $0; planes de pago según el modeloPequeña asignación y variantes gratuitas
OpenAIRuta de migración convencional$0.20 / $1.20No se indica un plan permanente de API

La tabla no es una clasificación por calidad. Un modelo 3B a $0.10/$0.10 y un modelo actual para producción a $0.14/$0.28 son productos distintos, aunque ambos acepten una solicitud de chat completions. El precio de lista sirve para seleccionar candidatos; la elección final debe salir de una prueba de aceptación propia.

Cuánto cuestan 20,000 solicitudes de IA

Con volúmenes pequeños y medianos, todos estos proveedores son tan económicos que una sola mala decisión de flujo de trabajo cuesta más que la factura de tokens. Aun así, comparar una carga normalizada resulta útil porque deja a la vista los precios elevados de salida y las comisiones que una tarifa aislada de entrada oculta.

Supongamos que un producto realiza 20,000 llamadas al mes. Cada llamada contiene 500 tokens de entrada y devuelve 100 tokens de salida. En total son 10 millones de tokens de entrada y 2 millones de tokens de salida:

Costo mensual = 10 × precio de entrada + 2 × precio de salida.

RutaModelo económicoCosto mensualLa contrapartida
DeepInfraMistral Nemo$0.25El menor precio de lista, pero con un modelo pequeño y antiguo
GroqLlama 3.1 8B Instant$0.66La velocidad y el precio priman sobre la profundidad
SiliconFlowGPT OSS 20B$0.76El bajo precio depende de un modelo de pesos abiertos
OpenRouterDeepSeek V4 Flash Latest$1.304 más la comisión por créditosUna sola factura; comisión del 5.5% con un mínimo de $0.80
Google GeminiGemini 2.5 Flash-Lite$1.80 Standard; $0.90 Batch/FlexEl contenido del plan gratuito puede usarse para mejorar productos de Google
DeepSeekDeepSeek V4 Flash$1.96El proveedor advierte de una próxima subida importante
MistralMistral Small 4$2.70Mejor conjunto de funciones que el modelo 3B básico, pero salida más cara
OpenAIGPT-5.6 Luna$4.40 Standard; $2.20 Batch/FlexEs práctico, pero la salida cuesta seis veces más que la entrada
Escalera de costos con cuatro rutas de API de IA: precio puro, velocidad, opción predeterminada y proveedor convencional
La misma carga de 10M de entrada y 2M de salida cuesta entre $0.25 y $4.40 antes de sumar reintentos por calidad o revisión humana.

La diferencia parece enorme en porcentajes y mínima en dólares. Para esta carga, DeepSeek cuesta $1.71 más que Mistral Nemo en DeepInfra. OpenAI Luna cuesta $2.44 más que DeepSeek. Si el modelo barato rompe un esquema, pasa por alto una petición de un cliente o crea una cola de revisión manual, el ahorro desaparece enseguida.

Ese es el umbral de calidad: el comportamiento mínimo que una tarea puede aceptar sin trabajo compensatorio. Un endpoint de clasificación limitado a cinco etiquetas tiene un umbral bajo. Una respuesta de soporte al cliente basada en datos de su cuenta exige mucho más. Un agente con permiso para actualizar registros eleva todavía más el umbral, porque el costo de una mala acción no se limita a otra llamada a la API.

El precio de salida merece atención especial. Un resumidor puede leer un documento largo y devolver un resultado breve, de modo que domina la entrada. Un agente de programación, un generador de correos comerciales o un asistente conversacional puede producir mucha más salida. La tarifa de salida de OpenAI Luna, $1.20, multiplica por seis su tarifa de entrada de $0.20; la de Mistral Small 4, $0.60, multiplica por cuatro la entrada de $0.15. Cobrar lo mismo por entrada y salida en modelos diminutos resulta atractivo para tareas con mucha generación, pero solo si esos modelos consiguen terminarlas.

1. DeepSeek: la mejor opción económica para producción

DeepSeek es el candidato inicial más sólido cuando una aplicación en producción necesita tokens baratos sin renunciar a JSON, herramientas ni contexto largo. V4 Flash 0731 cuesta $0.14 por millón de tokens de entrada sin acierto de caché y $0.28 por millón de tokens de salida. La API publica un contexto de 1M de tokens, una salida máxima de 384K, salida JSON, llamadas a herramientas, Responses API y una ruta compatible con Anthropic. Es un conjunto de funciones para producción más amplio que el de la mayoría de los modelos situados al pie de la escala de precios.

Página de modelos y precios de la API de DeepSeek
DeepSeek

El obstáculo es la estabilidad del presupuesto. La propia página de precios de DeepSeek anuncia un aumento general de precios en un futuro cercano y anticipa que será considerable. Una startup puede aprovechar hoy el costo normalizado de $1.96, pero un equipo de compras no debería incorporar esa cifra a una previsión anual sin margen ni una segunda ruta.

Ideal para: Extracción en producción, generación estructurada, agentes económicos y tareas de contexto largo
Punto fuerte: Contexto de 1M, JSON, llamadas a herramientas, Responses API y compatibilidad con la API de Anthropic
Precio: $0.14 de entrada, $0.0028 de entrada con acierto de caché y $0.28 de salida por 1M de tokens para V4 Flash
Prueba gratuita: La página de precios no indica un plan gratuito permanente

Lo bueno
Lo que hace bien
7 points

  • $1.96 por la carga normalizada de 10M de entrada y 2M de salida
  • Contexto de 1M de tokens y salida de hasta 384K
  • Salida JSON y llamadas a herramientas en el nivel económico
  • Límite de concurrencia publicado de 2,500 para V4 Flash
  • El proveedor ya ha advertido que los precios subirán de forma considerable
  • No se publica un plan gratuito permanente
  • Una ruta externa de bajo costo exige igualmente revisar privacidad, fiabilidad y región según el caso de uso del comprador

Por qué DeepSeek ocupa el primer puesto

DeepSeek gana cuando un modelo barato debe hacer algo más que etiquetar texto. Pensemos en un producto SaaS B2B que extrae la fecha de renovación, el valor del contrato, el plazo de preaviso y los riesgos identificados en acuerdos cargados. La salida se puede validar con un esquema, pero el modelo necesita contexto suficiente para leer un documento largo y buen seguimiento de instrucciones para devolver todos los campos requeridos. V4 Flash reúne el costo y las funciones de API adecuados para una primera evaluación.

La tarifa por acierto de caché es excepcionalmente baja: $0.0028 por millón de tokens de entrada. Resulta relevante cuando se repiten las mismas instrucciones estables o el mismo prefijo de referencia. Eso no significa que todos los tokens de entrada cuesten $0.0028; la tarifa solo se aplica a los aciertos de caché. Presupueste los fallos de caché a $0.14 hasta que los datos de uso demuestren la proporción real de aciertos.

Cómo evaluar DeepSeek en una semana

  1. Elija una tarea acotada

    Empiece con extracción, clasificación, resumen o una acción de agente de solo lectura. Defina los campos, las salidas permitidas y las condiciones de fallo antes de enviar tráfico.

  2. Cree un conjunto de evaluación de 100 solicitudes

    Use solicitudes representativas y depuradas de la carga real. Incluya entradas breves, largas, ambiguas, mal formadas y casos límite para que la ruta más barata no gane por haber visto únicamente ejemplos sencillos.

  3. Exija una salida verificable por máquina

    Use salida JSON cuando la tarea tenga un esquema. Registre en cada llamada la tasa de esquemas válidos, la tasa de respuestas aceptadas, la latencia, los tokens de entrada y salida, y los aciertos de caché.

  4. Conserve el modelo actual como respaldo

    Envíe a la ruta de confianza actual los fallos de validación, los casos de baja confianza y cualquier acción con consecuencias importantes. El primer despliegue debe poder revertirse.

  5. Configure una alerta de cambio de precio

    DeepSeek ha comunicado que los precios subirán. Vuelva a calcular la carga normalizada cuando el proveedor publique la nueva tarifa, en vez de convertir un precio temporal en una premisa arquitectónica.

Elija DeepSeek si V4 Flash supera la tarea y la organización puede asumir variaciones de precio. Descártelo cuando pesen más un precio unitario anual fijo, una región de procesamiento concreta o una relación consolidada con otro proveedor.

2. Google Gemini: la mejor API de IA gratis

Google Gemini es la mejor ruta gratuita para un prototipo que utilice datos depurados. Gemini 2.5 Flash-Lite ofrece tokens de entrada y salida gratuitos en el plan Free. Cuando la aplicación pasa al nivel Paid, la tarifa Standard es de $0.10 por millón de tokens de entrada de texto, imagen o video y de $0.40 por millón de tokens de salida; Batch y Flex reducen ambos importes a la mitad, hasta $0.05/$0.20.

Página de precios de la API para desarrolladores de Google Gemini
Google Gemini

El plan gratuito tiene una implicación de privacidad que debe formar parte de la decisión, no quedarse en una nota al pie. La página de precios de Google indica que el contenido del nivel Free se utiliza para mejorar sus productos, mientras que el del nivel Paid no. Free resulta razonable para prompts sintéticos, documentos públicos y el conjunto de pruebas de un desarrollador; no debe ser la opción predeterminada para registros de clientes, documentos confidenciales ni código aún no publicado.

Ideal para: Prototipos gratuitos, entradas multimodales, procesamiento por lotes y flujos documentales sensibles al costo
Punto fuerte: Ruta gratuita de entrada/salida y entrada de texto, imagen, video y audio en el plan de pago
Precio: Plan Free; Paid Standard a $0.10 para entrada de texto/imagen/video y $0.40 para salida; Batch/Flex a $0.05/$0.20
Prueba gratuita: Sí, un plan Free con acceso limitado a modelos

Lo bueno
Lo que hace bien
7 points

  • Tokens de entrada y salida gratuitos en el plan Free
  • $1.80 por la carga normalizada en Paid Standard
  • $0.90 por la misma carga asíncrona con Batch o Flex
  • El nivel Paid incluye caché de contexto y no usa el contenido para mejorar productos de Google
  • El contenido del nivel Free se utiliza para mejorar productos de Google
  • El acceso gratuito está limitado por modelo y cuota
  • La entrada de audio cuesta $0.30 por millón de tokens en Standard, tres veces más que la entrada de texto/imagen/video

El paso del plan gratuito al de pago

Quien esté validando una función de etiquetado de documentos puede utilizar el nivel Free con documentos públicos o generados, comprobar la forma de la respuesta y conocer el perfil de tokens antes de añadir la facturación. Cuando entren documentos de clientes en el flujo, el salto a Paid no será solo una cuestión de volumen: también cambia las condiciones de uso del contenido y aporta mayores límites de producción, caché de contexto y acceso a Batch.

Para la carga normalizada, Paid Standard cuesta $1.80; Batch o Flex, $0.90. Por precio de lista, Gemini resulta así más barato que DeepSeek para trabajo asíncrono, aunque la decisión correcta sigue dependiendo de qué modelo supere la tarea. Si los resultados no tienen que llegar de inmediato, conviene evaluar la reducción del 50% antes de cambiar de proveedor.

Gemini también acepta imágenes y video con la misma tarifa de entrada Standard de $0.10 que aplica al texto en 2.5 Flash-Lite. Por eso es un candidato más sólido que los modelos pequeños exclusivamente textuales cuando el flujo lee recibos, capturas de pantalla o imágenes de producto. La página de precios presenta Flash-Lite como el modelo de Google más pequeño y rentable a escala, el escalón adecuado para empezar antes de pasar a un modelo Gemini mayor.

Elija Gemini cuando el proyecto necesite empezar gratis, admita entrada multimodal o pueda aprovechar el procesamiento asíncrono a mitad de precio. Evite el nivel Free para datos sensibles y descarte Flash-Lite si la prueba de aceptación exige un modelo más grande.

3. DeepInfra: el precio puro por token más bajo

DeepInfra gana por precio puro: Mistral Nemo Instruct cuesta $0.019 por millón de tokens de entrada y $0.03 por millón de tokens de salida. La carga normalizada de 20,000 solicitudes cuesta $0.25. DeepInfra también ofrece Meta Llama 3.1 8B a $0.02/$0.04 y DeepSeek V4 Flash a $0.09/$0.18, por lo que es posible subir por la escala de modelos del mismo host sin abrir otra cuenta de facturación.

Página de precios de modelos de generación de texto de DeepInfra
DeepInfra

El límite está en el modelo que hay detrás del precio. Mistral Nemo y Llama 3.1 8B son baratos porque son modelos abiertos, pequeños y antiguos. Una tarea rígida de etiquetado quizá no necesite más. Un flujo orientado al cliente no debería heredar ese precio bajo hasta que una evaluación propia confirme que la salida es aceptable.

Ideal para: Clasificación de alto volumen y bajo riesgo, etiquetado, extracción ligera y experimentos de precio entre modelos
Punto fuerte: La menor tarifa publicada por token para generación de texto en esta comparativa
Precio: Mistral Nemo $0.019 de entrada/$0.03 de salida; Llama 3.1 8B $0.02/$0.04
Prueba gratuita: No; DeepInfra indica que se requiere tarjeta o prepago

Lo bueno
Lo que hace bien
7 points

  • $0.25 por la carga normalizada con Mistral Nemo
  • Catálogo amplio de modelos de texto, embeddings, imagen, audio y video
  • Modalidades Standard, Priority y Flex, esta última más económica
  • Escalado automático con un límite publicado de 200 solicitudes simultáneas por cuenta
  • La tarifa más baja compra un modelo pequeño, no una opción universal para producción
  • Se requiere tarjeta o prepago
  • Flex puede ser más lento y no estar disponible en ocasiones

Cuándo usar DeepInfra: respuestas con un espacio limitado

Un marketplace de servicios locales que clasifica los mensajes entrantes como quote, reschedule, cancel, billing u other trabaja con un espacio de salida estrecho. Puede rechazar cualquier valor que no esté entre esos cinco y enviar los casos ambiguos a una ruta de respaldo. Ese es el tipo de tarea en el que un modelo de $0.019/$0.03 merece una evaluación.

Un asistente de soporte que responde preguntas específicas sobre una cuenta plantea otro reto. Debe recuperar el registro correcto, respetar las políticas, conservar los matices y no dar una respuesta equivocada con excesiva seguridad. Ahorrar $1.71 frente a DeepSeek en la carga normalizada no justifica trasladar esa tarea a Mistral Nemo sin un resultado de aceptación más sólido.

Los niveles de servicio de DeepInfra ofrecen otra palanca. Standard aplica la tarifa base de 1×. Priority cuesta 1.5× para acelerar la programación en momentos de alta demanda. Flex cuesta 0.8× a cambio de respuestas más lentas y alguna indisponibilidad ocasional. Reserve Flex para reprocesamientos, enriquecimiento offline o una cola nocturna que admita reintentos. No lo use para una respuesta interactiva al cliente solo por recortar un 20% de una factura que ya se mide en centavos.

Elija DeepInfra cuando una tarea estrecha y un validador sólido permitan repetir el ahorro de un modelo pequeño. Evite la fila más barata para redacción abierta, razonamiento complejo y acciones capaces de modificar datos de clientes o del negocio.

4. Groq: bajo costo cuando importa la latencia

Groq es la alternativa económica para trabajo interactivo que debe sentirse inmediato. Su ruta de producción Llama 3.1 8B Instant figura con unos 560 tokens por segundo, $0.05 por millón de tokens de entrada y $0.08 por millón de tokens de salida. La carga normalizada cuesta $0.66, apenas $0.41 más que el ganador por precio puro de DeepInfra.

Tabla de modelos de producción, velocidad, precio y contexto de Groq
Groq

La contrapartida está en la profundidad del modelo y la estabilidad del catálogo. La ruta más barata usa un modelo 8B. Groq separa los modelos aptos para producción y advierte que los modelos preview pueden retirarse con poca antelación; por tanto, el precio de una fila preview no constituye un compromiso de producción.

Ideal para: Clasificación de baja latencia, autocompletado, interfaces conversacionales y enrutamiento rápido de primera pasada
Punto fuerte: Unos 560 tokens de salida por segundo en el modelo de producción más barato
Precio: Llama 3.1 8B Instant $0.05 de entrada/$0.08 de salida; GPT OSS 20B $0.075/$0.30
Prueba gratuita: Las páginas de documentación revisadas no especifican públicamente las condiciones de prueba

Lo bueno
Lo que hace bien
7 points

  • $0.66 por la carga normalizada con Llama 3.1 8B
  • Unos 560 tokens por segundo con Llama 3.1 8B
  • URL base compatible con OpenAI y una estructura de API conocida
  • Separación clara entre modelos de producción y preview
  • La opción de producción más barata es solo un modelo 8B
  • Los límites de tasa específicos de la cuenta deben consultarse en el panel
  • La disponibilidad de los modelos preview puede cambiar con poca antelación

La latencia también forma parte del costo del producto

Un producto de voz o chat en vivo paga los retrasos en forma de turnos abandonados e interacciones incómodas, aunque la factura de la API siga siendo baja. Groq resulta creíble cuando el modelo cumple y la velocidad es la restricción principal. Un enrutador de intenciones breve que decide qué flujo debe gestionar el mensaje encaja mejor que una respuesta de soporte sujeta a muchas políticas.

La página del modelo indica una ventana de contexto de 131,072 tokens para Llama 3.1 8B, pero capacidad de contexto no equivale a calidad de contexto. Que un modelo acepte un prompt largo no garantiza que aproveche correctamente todos los detalles relevantes. La primera carga enviada a Groq debería ser breve, acotada y verificable por máquina.

La ruta GPT OSS 20B de Groq aumenta el tamaño del modelo, con unos 1,000 tokens por segundo y una tarifa de $0.075/$0.30. Su costo normalizado es de $1.35, todavía inferior a los $1.96 de DeepSeek, pero la decisión debe resolverse con el mismo conjunto de evaluación. Una cifra más baja no demuestra que siga mejor las instrucciones, use mejor las herramientas ni encaje mejor con el negocio.

Elija Groq cuando el usuario perciba el tiempo de respuesta y un modelo pequeño de producción supere la tarea. Descártelo si la carga requiere razonamiento de primer nivel o depende de un modelo preview sin estado de producción estable.

5. Mistral: el laboratorio directo más barato para modelos pequeños

Mistral ofrece la escala más clara de modelos pequeños directamente desde el proveedor. Ministral 3B parte de $0.10 por millón de tokens de entrada y $0.10 por millón de tokens de salida; el modelo 8B cuesta $0.15/$0.15 y el 14B, $0.20/$0.20. Mistral Small 4 cuesta $0.15/$0.60 y añade un conjunto más amplio de funciones de texto, agentes y multimodalidad.

Página de precios de modelos de la API de Mistral
Mistral

La fila económica del modelo 3B no es la recomendación predeterminada para trabajo abierto de cara al cliente. Úsela donde un modelo diminuto tenga ventaja, por ejemplo en clasificación, preenrutamiento de moderación o transformación restringida de campos. Mistral Small 4 es un candidato más creíble para aplicaciones generales y cuesta $2.70 en la carga normalizada.

Ideal para: Acceso directo a modelos pequeños, preferencia por tratar con el proveedor, transformaciones por lotes y prompts repetidos con caché
Punto fuerte: Precio inicial uniforme de $0.10/$0.10, más descuentos del 50% en Batch y del 90% en entrada almacenada en caché
Precio: Ministral 3B $0.10/$0.10; Mistral Small 4 $0.15/$0.60
Prueba gratuita: No se indica un plan general gratuito de producción para los principales modelos de texto; algunos endpoints de Labs o moderación son gratuitos

Lo bueno
Lo que hace bien
7 points

  • Precios directos y sencillos en los niveles 3B, 8B, 14B y Small
  • Descuento del 50% por lotes para trabajo asíncrono de alto volumen
  • Descuento del 90% en entrada almacenada en caché para prefijos estables y repetidos
  • Mistral Small 4 admite usos de texto, agentes y multimodalidad
  • El precio destacado de $0.10/$0.10 corresponde a un modelo 3B
  • La salida de Mistral Small 4 cuesta cuatro veces más que la entrada
  • No se indica un plan gratuito amplio de producción para los principales modelos de texto

Cuándo compensa la escala de Mistral

Supongamos que una plataforma de comercio electrónico genera cada noche etiquetas de catálogo a partir de títulos, atributos y descripciones. El proceso es asíncrono, cada artículo sigue un esquema estable y una persona puede revisar una muestra de errores antes de la siguiente actualización del catálogo. Ese flujo puede comenzar con Ministral 3B u 8B, aprovechar Batch para obtener un 50% de descuento y mantener las instrucciones estables de taxonomía en un prefijo con caché.

La economía cambia para un asistente de chat. En la carga normalizada, Ministral 3B cuesta $1.20 y Mistral Small 4, $2.70. La diferencia de $1.50 compra un modelo mayor y concebido para usos más amplios. Si Small 4 reduce las derivaciones al respaldo y la revisión, puede ser el sistema más barato aunque su línea de tokens sea más cara.

Elija Mistral cuando importe trabajar con un laboratorio de modelos de forma directa o contar con una escala de modelos pequeños. Evite la tarifa destacada del 3B en tareas abiertas mientras la evaluación no demuestre que se mantiene por encima del umbral de calidad.

6. SiliconFlow: el nuevo host multimodelo de bajo costo

SiliconFlow es el host multimodelo más barato de esta selección cuando hace falta algo mayor que una ruta 8B. GPT OSS 20B cuesta $0.04 por millón de tokens de entrada y $0.18 por millón de tokens de salida, con una ventana de contexto de 131K. Eso deja la factura de la carga normalizada en $0.76, y las cuentas nuevas reciben $1 en créditos.

Página de precios de modelos serverless de SiliconFlow
SiliconFlow

La distinción importante está en el nombre del modelo. GPT OSS 20B es un modelo de pesos abiertos 20B, no acceso directo a la familia GPT-5.6 de OpenAI. SiliconFlow también ofrece DeepSeek V4 Flash a $0.13 de entrada, $0.028 de entrada en caché y $0.28 de salida; así, el catálogo permite pasar a una ruta más potente sin abandonar la cuenta.

Ideal para: Desarrolladores sensibles al costo que quieren varios modelos abiertos bajo una sola cuenta de proveedor
Punto fuerte: GPT OSS 20B a $0.04/$0.18 con $1 de crédito inicial
Precio: GPT OSS 20B $0.04 de entrada/$0.18 de salida; DeepSeek V4 Flash $0.13/$0.28
Prueba gratuita: $1 en créditos gratuitos y sin compromiso mínimo

Lo bueno
Lo que hace bien
7 points

  • $0.76 por la carga normalizada con GPT OSS 20B
  • El crédito de $1 cubre más que esa carga de prueba normalizada a precio de lista
  • La página pública de precios no exige un compromiso mínimo
  • Rutas de bajo costo para DeepSeek, Qwen, MiniMax, GPT OSS y otros modelos abiertos
  • Los precios más bajos corresponden a modelos de pesos abiertos, no a API propietarias de frontera
  • Elegir el modelo sigue trasladando la evaluación de calidad al comprador
  • Un host multimodelo más nuevo puede exigir una revisión adicional de compras y fiabilidad

Un presupuesto de evaluación de $1

El crédito inicial de SiliconFlow es especialmente concreto. La carga normalizada con GPT OSS 20B cuesta $0.76, por lo que el crédito de $1 alcanza para una ejecución completa normalizada por precio antes de reintentos u otros modelos. Eso no equivale a un mes gratuito de producción. Significa que se pueden medir la forma de la salida, la latencia y el cómputo de tokens sin comprometer de antemano un saldo mayor.

Para una cola interna de resúmenes, comience con GPT OSS 20B y envíe los fallos o casos de baja confianza a DeepSeek V4 Flash dentro de la misma plataforma. Las tarifas hacen legible esa escala: $0.04/$0.18 para la ruta barata y después $0.13/$0.28 para DeepSeek. La aplicación debe registrar qué modelo respondió, porque una factura combinada sin datos de aceptación por modelo no permite saber si el nivel barato aporta valor.

Elija SiliconFlow cuando una sola plataforma de bajo costo y un catálogo amplio de modelos abiertos simplifiquen la evaluación. Descártelo si el comprador exige un contrato directo con el desarrollador del modelo o ya cuenta con un gateway que ofrece los mismos modelos a un costo total aceptable.

7. OpenRouter: la opción más barata para seguir cambiando

OpenRouter es el mejor gateway económico cuando la posibilidad de cambiar de modelo justifica una pequeña comisión de facturación. Traslada los precios de inferencia del proveedor sin recargo, ofrece variantes gratuitas y reúne numerosos proveedores bajo una sola clave de API. DeepSeek V4 Flash Latest figura a $0.08 por millón de tokens de entrada y $0.252 por millón de tokens de salida, de modo que el gasto normalizado del modelo asciende a $1.304 antes de las comisiones por compra de créditos.

Catálogo de modelos de OpenRouter con precios por token en vivo
OpenRouter

El límite está en la forma de financiar los créditos. OpenRouter cobra un 5.5% con un mínimo de $0.80 al comprar créditos. El mínimo deja de aplicarse a partir de unos $14.55, porque $0.80 dividido entre 5.5% da $14.5455. Por eso, comprar $10 en créditos implica una comisión de $0.80, es decir, un 8% en lugar del 5.5%.

Ideal para: Comparar modelos, conservar rutas de respaldo y cambiar de proveedor sin reescribir la aplicación
Punto fuerte: Precios de los proveedores trasladados sin recargo de inferencia
Precio: Variantes gratuitas a $0; los modelos de pago varían; DeepSeek V4 Flash Latest $0.08/$0.252 antes de la comisión por créditos
Prueba gratuita: Pequeña asignación para cuentas nuevas y variantes gratuitas con límites diarios bajos

Lo bueno
Lo que hace bien
8 points

  • Una sola clave de API para numerosos proveedores y modelos
  • Sin recargo sobre la tarifa de inferencia subyacente
  • Variantes gratuitas para evaluación
  • El primer 1M de solicitudes BYOK de cada mes es gratuito
  • Comprar créditos cuesta un 5.5% con un mínimo de $0.80
  • Las variantes gratuitas permiten solo 50 solicitudes diarias antes de acumular una compra de créditos de $10; después, 1,000 al día
  • Los créditos de pago caducan tras un año sin uso
  • El plan de fiabilidad debe contemplar tanto los fallos del gateway como los del proveedor subyacente

Cuándo se amortiza la comisión del gateway

Un desarrollador que prueba DeepSeek, Gemini y un modelo abierto puede dedicar más tiempo de ingeniería a credenciales, facturación, reintentos y formatos de respuesta separados que a la propia inferencia. OpenRouter convierte ese cambio en una configuración de enrutamiento. La comisión es razonable cuando esa comodidad mantiene listo un respaldo o permite al equipo sustituir con rapidez una ruta deficiente.

Las recargas pequeñas distorsionan la economía. Con $10, el mínimo de $0.80 equivale a una comisión del 8%. Con $100, el 5.5% suma $5.50 y el porcentaje se comporta como se anuncia. Un prototipo pequeño debe aceptar el mínimo como costo de conveniencia o utilizar el plan gratuito directo de un proveedor. No compare la tarifa de un modelo en OpenRouter con la tarifa directa olvidando la comisión por créditos.

La ruta BYOK tiene otra regla. El primer 1M de solicitudes al mes con claves propias de proveedores es gratuito; después, OpenRouter cobra el 5% de lo que habría costado esa ruta de modelo y proveedor en OpenRouter. BYOK puede conservar los límites directos del proveedor y centralizar el enrutamiento, pero no elimina la necesidad de vigilar dos superficies de facturación y fallos.

Elija OpenRouter cuando una sola integración y el cambio rápido de modelos justifiquen la comisión. Descártelo si el producto utiliza un único proveedor estable, la API directa ya cumple los requisitos de disponibilidad y el gateway adicional no aporta valor operativo.

8. OpenAI: la ruta convencional de migración más barata

OpenAI no gana por precio de token, pero GPT-5.6 Luna puede ser la ruta económica de menor riesgo para un producto que ya funciona sobre OpenAI. Luna cuesta $0.20 por millón de tokens de entrada de contexto corto, $0.02 por entrada en caché y $1.20 por salida en Standard. Batch y Flex reducen a la mitad las tarifas de entrada y salida, hasta $0.10/$0.60, por lo que la carga normalizada cuesta $2.20 en lugar de $4.40.

Tabla de precios de la API de OpenAI para GPT-5.6 Luna
OpenAI

Migrar también tiene un costo, aunque nunca aparezca en una factura de API. Los esquemas, prompts, reglas de moderación, herramientas, trazas, mecanismos de respaldo y evaluaciones de carga existentes pueden volver irrelevante una diferencia mensual de $2.44 en tokens. Si la ruta actual de OpenAI ya supera los controles, el producto debería evaluar primero Luna, la caché y Batch/Flex antes de cambiar de proveedor.

Ideal para: Productos que ya usan OpenAI, herramientas convencionales para desarrolladores, prompts estables en caché y tareas asíncronas por lotes
Punto fuerte: GPT-5.6 Luna combina un modelo actual y económico de OpenAI con tarifas Batch/Flex un 50% menores
Precio: Standard $0.20 de entrada/$0.02 en caché/$1.20 de salida; Batch/Flex $0.10/$0.01/$0.60
Prueba gratuita: No se indica un plan gratuito permanente de API

Lo bueno
Lo que hace bien
8 points

  • Costo normalizado de $2.20 con Batch o Flex
  • La entrada almacenada en caché cuesta una décima parte de la entrada estándar
  • Las aplicaciones existentes de OpenAI pueden evaluar un modelo más barato sin migrar de proveedor
  • Tarifas separadas y claras para Standard, Batch, Flex y contexto largo
  • La salida Standard cuesta seis veces más que la entrada
  • El costo normalizado Standard es de $4.40, el más alto entre las rutas clasificadas
  • El procesamiento regional apto tiene un recargo del 10%
  • Luna con contexto largo aplica tarifas superiores de $0.40 para entrada y $1.80 para salida

Optimice dentro de OpenAI antes de migrar

El análisis de enrutamiento de GPT-5.6 profundiza en cuándo encajan Luna, Terra y Sol. Para esta decisión de costos, el primer paso es más simple: asigne a Luna el trabajo breve y repetible, almacene en caché los prefijos estables, envíe las tareas no urgentes por Batch o Flex y conserve el modelo actual más potente como respaldo.

Con 10 millones de tokens de entrada y 2 millones de tokens de salida, Luna Standard cuesta $4.40. Batch o Flex cuestan $2.20. DeepSeek V4 Flash cuesta $1.96. La diferencia entre OpenAI optimizado y DeepSeek directo es de $0.24 para la carga normalizada, demasiado poco para justificar por sí sola una migración de proveedor.

El contexto largo y la configuración regional pueden alterar el resultado. Las tarifas Standard de Luna para contexto largo son de $0.40 por entrada y $1.80 por salida, y el procesamiento regional apto añade un 10%. Aplique la tarifa correspondiente a la solicitud y a la modalidad de procesamiento, en lugar de extender el precio destacado de contexto corto a todos los tokens.

Elija OpenAI cuando el producto ya funcione allí, importe una relación directa con un proveedor convencional o Batch/Flex cierre casi toda la diferencia de precio. Evite Standard para tareas offline con reintentos que puedan usar las rutas a mitad de precio.

Qué API de IA elegir en cada caso

Decida primero según las consecuencias y, después, calcule el precio del modelo más barato que pueda asumirlas. Esta única regla evita la mayoría de los falsos ahorros.

Flujo de decisión que lleva de pruebas gratuitas, tráfico en vivo de bajo riesgo y cargas convencionales a Gemini, DeepSeek y OpenAI
Las consecuencias de la carga determinan qué nivel de precio es seguro evaluar primero.

Para un prototipo gratuito con datos depurados, elija Gemini 2.5 Flash-Lite. Ofrece el inicio más claro a costo cero y un paso sencillo al precio Paid Standard de $0.10/$0.40. No envíe datos de clientes ni información confidencial a Free, porque sus condiciones de uso del contenido difieren de Paid.

Para producción en vivo de bajo riesgo, empiece con DeepSeek V4 Flash. JSON, llamadas a herramientas, contexto de 1M y un costo normalizado de $1.96 lo convierten en el mejor candidato general. Mantenga un margen ante cambios de precio y una ruta de respaldo, ya que el proveedor ha anunciado una próxima subida.

Para un clasificador estrecho y de gran volumen, evalúe primero DeepInfra. El costo normalizado de $0.25 solo cobra sentido si las salidas permitidas están acotadas y detectar fallos resulta barato. Suba de nivel en cuanto la tarea se vuelva abierta.

Cuando la latencia sea visible, evalúe Groq. La ruta de 560 tokens por segundo con Llama 3.1 8B puede dar sensación de inmediatez a una interfaz por $0.05/$0.08. Úsela como carril rápido con un respaldo más profundo, no como sustituto automático de todos los modelos.

Para colas offline, compare Gemini Batch/Flex, Mistral Batch y OpenAI Batch/Flex. Los tres documentan una reducción del 50%. El mejor proveedor será aquel cuyo modelo supere la prueba de aceptación de la cola, no el que tenga la menor tarifa Standard sin descuento.

Para cambiar con facilidad, elija OpenRouter. Su comisión puede salir más barata que mantener varias integraciones, sobre todo cuando el respaldo y la rotación de modelos forman parte del producto. Con un único proveedor estable, la facturación directa es más simple.

En una aplicación existente de OpenAI, pruebe Luna antes de migrar. Batch/Flex reduce el costo normalizado a $2.20, apenas $0.24 por encima de DeepSeek. Las evaluaciones y operaciones ya creadas pueden valer mucho más que esa diferencia.

La decisión cambia cuando la ruta barata cae por debajo del umbral de aceptación de la carga. Mantenga el modelo de menor precio mientras la validez del esquema, las respuestas aceptadas, la latencia, las condiciones de privacidad y la recuperación cumplan los requisitos. Suba un escalón cuando falle uno de esos puntos. No siga acumulando parches de prompts para ahorrar centavos.

Quien ofrezca a sus clientes una experiencia impulsada por API también debe asumir la autenticación, la facturación, la revisión y la gestión de fallos. La guía para crear con la API de v0 muestra por qué el modelo o agente subyacente es solo una capa del producto.

Cómo seleccionamos estas API

La clasificación premia la decisión de compra fiable más barata, no la cifra aislada más baja de entrada. Cada proveedor se valoró y analizó a partir de sus páginas oficiales en vivo el 10 de agosto de 2026. No se contrataron las API ni se presentaron como si se hubieran probado en producción.

La decisión aplica estos criterios:

  • Precio inicial útil: tarifas de entrada y salida de un modelo identificado y disponible en ese momento
  • Umbral de calidad: si el nivel del modelo resulta plausible para una tarea restringida o para un flujo de producción más amplio
  • Funciones operativas: JSON, herramientas, contexto, lotes, caché, límites de tasa e implicaciones del respaldo
  • Consecuencias de privacidad y contrato: tratamiento de los datos gratuitos, estabilidad del precio y posibles comisiones independientes del gateway
  • Costo de cambio: trabajo necesario para migrar prompts, esquemas, conjuntos de evaluación, monitoreo y facturación

Ocho proveedores entraron en la selección porque cada uno responde a una decisión de compra distinta. Se excluyeron aquellos cuya ruta de texto para producción más barata quedaba muy por encima de esta franja de costos, cuyo precio no podía normalizarse por token o cuyo papel duplicaba otra opción sin ofrecer una ventaja más clara. También quedaron fuera las API especializadas en imagen, video, voz y embeddings, porque sus unidades no son comparables con los tokens de entrada y salida de texto.

El cálculo de costos es un análisis original basado en una carga explícita; no es un benchmark. El costo por resultado aceptado solo puede obtenerse con solicitudes representativas propias, validadores y un proceso de revisión.

Opciones que conviene evitar

Variantes gratuitas de OpenRouter como dependencia de producción

Evite que una variante gratuita de OpenRouter sea la única ruta detrás del tráfico real de clientes. La cuenta recibe 50 solicitudes diarias a modelos gratuitos hasta que haya comprado al menos $10 en créditos; después, el límite sube a 1,000 al día. Es una asignación de evaluación, no un plan de capacidad fiable.

Gemini Free con datos de clientes o información confidencial

Evite enviar contenido sensible a Gemini Free. Google indica que el contenido del nivel Free se utiliza para mejorar sus productos, mientras que el del nivel Paid no. La factura normalizada de Paid Standard es de $1.80, por lo que no tiene sentido ahorrar esa cantidad a costa de la privacidad.

DeepInfra Mistral Nemo para trabajo abierto de cara al cliente

Evite llevar la ruta de $0.019/$0.03 directamente a soporte abierto, interpretación jurídica o acciones autónomas. Esa tarifa corresponde a un modelo pequeño. Úselo para una tarea restringida y validada, y mantenga un respaldo más potente hasta que los datos de aceptación justifiquen ampliar su alcance.

DeepSeek sin respaldo ante cambios de precio

Evite tratar los $0.14/$0.28 como una tarifa anual fija. DeepSeek anuncia una subida considerable. El modelo puede seguir siendo hoy la mejor opción predeterminada, pero tanto el presupuesto como la arquitectura necesitan una segunda ruta.

OpenAI Standard para tareas offline que admiten reintentos

Evite pagar la tarifa Standard de Luna, $0.20/$1.20, por trabajo que puede esperar. Batch y Flex cuestan $0.10/$0.60 y reducen la carga normalizada de $4.40 a $2.20 sin cambiar de proveedor.

El paso del lunes

La próxima semana, mueva una clase de tarea acotada, no toda la aplicación. Una evaluación con 100 solicitudes basta para descubrir fallos evidentes de esquema, latencia y enrutamiento antes de involucrar tráfico de producción; no sustituye el monitoreo continuo.

  1. Reúna 100 solicitudes representativas

    Elija una sola tarea y seleccione entradas normales, difíciles, ambiguas y mal formadas. Elimine datos personales, confidenciales y de clientes antes de usar cualquier plan gratuito.

  2. Ejecute tres rutas

    Compare el proveedor actual, DeepSeek V4 Flash y Gemini 2.5 Flash-Lite. Añada DeepInfra o Groq solo cuando el objetivo explícito sea el precio puro o la latencia.

  3. Califique cuatro resultados

    Registre la tasa de esquemas válidos, la tasa de respuestas aceptadas, la latencia de extremo a extremo y el costo exacto de tokens de entrada/salida. Mantenga el tiempo de revisión humana como una medida operativa separada.

  4. Enrute una sola clase ganadora

    Envíe al proveedor más barato únicamente la tarea acotada que haya superado la prueba. Conserve la ruta anterior para fallos de validación, entradas ambiguas y acciones con mayores consecuencias.

  5. Recalcule tras cada cambio del proveedor

    Guarde la fórmula y los supuestos de carga. Vuelva a calcular cuando DeepSeek suba los precios, se retire un modelo o cambien los límites del plan gratuito y del gateway.

Este paso convierte una lista de tarifas en una decisión presupuestaria reversible. Además, produce la única cifra que una tabla pública de precios no puede ofrecer: el costo por resultado aceptado.

Preguntas frecuentes

¿Qué IA tiene la API más barata?

DeepInfra presenta el menor precio puro de generación de texto en esta comparativa: Mistral Nemo a $0.019 por millón de tokens de entrada y $0.03 por millón de tokens de salida. DeepSeek V4 Flash es la mejor opción económica para producción cuando la carga necesita JSON, herramientas y contexto largo.

¿Existe alguna API de IA gratis?

Sí. Google Gemini ofrece tokens gratuitos de entrada y salida en el nivel Free, y OpenRouter cuenta con variantes gratuitas de modelos. Gemini Free puede utilizar el contenido para mejorar productos de Google, mientras que las variantes gratuitas de OpenRouter están limitadas a 50 solicitudes diarias, o 1,000 al día después de comprar al menos $10 en créditos durante la vida de la cuenta.

¿Cuánto cuesta una API de IA?

Para 20,000 llamadas mensuales que suman 10M de tokens de entrada y 2M de salida, las rutas clasificadas van de $0.25 con Mistral Nemo en DeepInfra a $4.40 con OpenAI GPT-5.6 Luna Standard. Batch, Flex, la caché, las comisiones del gateway, los reintentos y el modelo que supere el umbral de calidad modifican la factura final.

¿Cuál es el precio de la API de ChatGPT?

Las suscripciones de ChatGPT y la facturación de la API de OpenAI van por separado. El modelo económico de OpenAI comparado aquí es GPT-5.6 Luna: $0.20 de entrada y $1.20 de salida por millón de tokens Standard de contexto corto, o $0.10/$0.60 mediante Batch o Flex.

Descargue la lista de verificación para auditar flujos de trabajo empresariales con IA y convierta esta escala de costos en una evaluación de proveedores de una semana.

Última actualización

3 sept 2026

CategoríaBuild

Prefiera este sitio en Google

Añadir omidsaffari.com como fuente preferida en la Búsqueda de Google

Marque omidsaffari.com como fuente preferida y Google lo destacará para usted en Top Stories, AI Overviews y AI Mode.

Newsletter

Una carta, cada domingo. Sistemas que funcionan, no opiniones calientes.

Build logs, sistemas en producción y notas de campo de un portafolio de ventures de IA.

Semanal. Sin spam. Cancele cuando quiera.