Gateway de IA: las mejores opciones para reducir costos de inferencia en 2026

Comparamos Vercel, LiteLLM, Cloudflare, TrueFoundry, Portkey y OpenRouter para saber qué gateway de IA reduce realmente el costo de inferencia.

Wednesday, September 2, 2026Omid Saffari
Gateway de IA: las mejores opciones para reducir costos de inferencia en 2026

Vercel AI Gateway es hoy el mejor gateway de IA gestionado para reducir los costos de inferencia: una carga mensual de GPT-5.6 Sol con 100 millones de tokens de entrada y 20 millones de tokens de salida baja de $800 con el precio directo actual de OpenAI a $400 con el precio vigente del nivel Default de Vercel. Ese ahorro de $400 abre una ventana de compra, pero no constituye una promesa anual, porque el descuento del 50% de Vercel termina el 18 de septiembre de 2026.

La conclusión duradera va mucho más allá de una promoción. Un gateway de modelos de IA solo reduce la factura cuando el enrutamiento, la caché de respuestas o los presupuestos obligatorios eliminan más gasto del proveedor que el costo añadido por el gateway en comisiones y operación. Vercel es la opción predeterminada sin carga operativa; LiteLLM, la alternativa autohospedada; Cloudflare, la indicada para respuestas idénticas; TrueFoundry, la elección gestionada con caché semántica; Portkey, la opción de gobernanza por $49; y OpenRouter, el marketplace de proveedores.

Los mejores servicios de gateway de IA, de un vistazo

Todos los nombres de planes, precios públicos y límites que aparecen a continuación se verificaron en las páginas activas de los proveedores el 24 de agosto de 2026. La columna «Prueba gratuita» distingue una modalidad gratis permanente de una evaluación temporal, porque un prototipo sin costo puede convertirse en una dependencia cara en producción si su verdadero límite permanece oculto.

HerramientaIdeal paraPrecio inicialPrueba gratuita
Vercel AI GatewayLa menor partida de plataforma gestionada y el descuento actual de GPT-5.6 SolFree incluye $5/mes; Paid usa créditos de consumo sin recargoNivel Free permanente
LiteLLMAutohospedaje con un equipo de plataforma ya existenteOpen Source $0; Enterprise con contrato anual personalizadoPrueba Enterprise de 30 días
Cloudflare AI GatewayCaché de repeticiones exactas dentro de un stack de CloudflareFunciones principales del gateway por $0; consumo del proveedor aparteFunciones principales gratis de forma permanente
TrueFoundry AI GatewayCaché semántica gestionada y controles empresarialesDeveloper $0; Pro $499/mesPrueba de 7 días más el plan Developer
PortkeyControles gestionados para producción desde $49/mesDeveloper $0; Production $49/mesPlan Developer permanente
OpenRouterEnrutamiento de proveedores ordenado por precio y un solo marketplace de modelosFree $0; los créditos compartidos añaden 5.5%Plan Free permanente

El precio inicial no basta para revelar al ganador. La licencia de LiteLLM puede ser gratuita mientras su plano de control consume horas reales de ingeniería. Las funciones principales de Cloudflare pueden ser gratuitas mientras Unified Billing añade 5%. TrueFoundry puede evitar llamadas completas al modelo mediante reutilización semántica, pero su primer nivel para producción cuesta $499 al mes. La comparación correcta se hace sobre el total que queda en la factura después de que el gateway haya hecho su trabajo.

La ecuación del ahorro antes de comparar opciones

La ecuación útil para el presupuesto es gasto restante del proveedor + comisiones del gateway + controles de pago + costo operativo. Un gateway solo merece su lugar cuando ese total queda por debajo del acceso directo para la misma cantidad de resultados aceptados. La variedad de modelos, un panel atractivo y la amplitud del failover aportan valor, pero no generan ahorro hasta que eliminan gasto o fallas costosas del flujo de trabajo.

Una factura normalizada permite ver la diferencia. OpenAI publica actualmente GPT-5.6 Sol a $4 por millón de tokens de entrada y $20 por millón de tokens de salida. Por tanto, un flujo que consume 100 millones de tokens de entrada y 20 millones de salida cuesta $800 antes de descuentos por entrada en caché, herramientas o multiplicadores por contexto largo: $400 de entrada más $400 de salida.

La actualización de precios de agosto de Vercel sitúa el mismo modelo en $2 de entrada y $10 de salida dentro de su nivel de servicio Default con descuento hasta el 18 de septiembre. El mes normalizado pasa a costar $400, una reducción del 50%. Flex está ahora en $1 de entrada y $5 de salida, mientras que Priority cuesta $4 de entrada y $20 de salida; todos son precios por millón de tokens para solicitudes de hasta 272,000 tokens.

Dos depósitos de invernadero comparan una factura directa de $800 por GPT-5.6 Sol con una factura de $400 en Vercel para 100 millones de tokens de entrada y 20 millones de tokens de salida
El descuento actual de Vercel reduce a la mitad esta factura mensual normalizada de Sol hasta el 18 de septiembre de 2026

La tarifa del modelo es solo la primera palanca. Un acierto en la caché de respuestas exactas puede evitar por completo la llamada al proveedor. Enrutar hacia un modelo más barato reduce el precio unitario, pero únicamente si las respuestas siguen superando el umbral de aceptación. Un tope de presupuesto puede frenar un agente descontrolado: no es un descuento por token, pero puede convertirse en el mayor ahorro del mes. La métrica operativa correcta es el costo por resultado aceptado, incluidos los reintentos y la revisión, no el costo por token de forma aislada.

Para revisar primero los precios de los proveedores, consulte la comparativa de las API de IA más baratas. Este ranking comienza una capa más arriba y analiza si un gateway puede abaratar en la práctica esos precios del proveedor.

1. Vercel AI Gateway: la mejor opción general para un ahorro gestionado

Vercel AI Gateway es la mejor alternativa general para un equipo que busca un gateway gestionado, sin recargo por token y con una reducción real de costos disponible ahora.

Página de precios de Vercel AI Gateway con los niveles Free y Paid y los cargos por complementos
Precios de Vercel AI Gateway, verificados el 24 de agosto de 2026

Su argumento más sólido es excepcionalmente concreto. La página de precios vigente indica que tanto Free como Paid usan las tarifas de lista del proveedor sin recargo, y la promoción actual de GPT-5.6 Sol recorta además otro 50% sobre la tarifa Default del modelo. Un fundador con financiación que traslade un flujo de extracción o soporte de gran volumen puede reducir la partida normalizada del modelo de $800 a $400 sin asumir la operación de un proxy autohospedado.

El nivel Free incluye $5 de crédito mensual, cubre un subconjunto de modelos elegibles, aplica límites de frecuencia inferiores y específicos para cada modelo, y no permite usar claves propias. El nivel Paid funciona con créditos comprados, habilita todos los modelos disponibles, eleva los límites y permite BYOK sin comisión ni compromiso con el gateway de Vercel. Comprar créditos traslada al equipo a Paid, por lo que dejan de aplicarse los $5 mensuales de Free.

BYOK tiene una particularidad de facturación que conviene documentar en el manual operativo. Si falla una solicitud que utiliza la credencial del proveedor del cliente, Vercel puede reintentarla con su credencial del sistema para mantener la fiabilidad; ese fallback se cobra al saldo de créditos del gateway del equipo. Si se espera que todas las solicitudes permanezcan en una cuenta negociada con el proveedor, hay que vigilar ese saldo y conciliar el tráfico de fallback, en vez de asumir que BYOK garantiza que los créditos de Vercel nunca se consumirán.

El mensaje de «cero recargo» tampoco incluye los controles de pago. Custom Reporting cuesta $0.075 por cada 1,000 escrituras de etiquetas, ID de usuario o entidades de cuota, y $5 por cada 1,000 consultas de informes. Una lista de proveedores permitidos para todo el equipo cuesta $0.10 por cada 1,000 solicitudes correctas en Pro y Enterprise, mientras que un filtro de proveedores por solicitud no tiene costo adicional. Aplicar retención cero de datos a todo el equipo cuesta otros $0.10 por cada 1,000 solicitudes, aunque ZDR por solicitud es gratis en Pro y Enterprise.

Los destinos de trazas añaden $0.05 por cada 1,000 trazas más $0.50 por GB de salida, sin asignación incluida en Pro. Con un millón de solicitudes correctas, la lista de proveedores para todo el equipo supone $100, ZDR para todo el equipo añade otros $100 y un millón de trazas cuesta $50 antes de la salida de datos. El gateway aún puede ser la alternativa más barata, pero se debe comparar la factura configurada, no solo el titular sobre el recargo por token.

La limitación más evidente es temporal. El descuento de Sol ofrece una excelente ventana de migración, pero es una base deficiente para una tesis arquitectónica permanente. Vercel seguirá siendo atractivo después de la promoción si su enrutamiento sin recargo, sus presupuestos, failover y observabilidad sustituyen trabajo que, de otro modo, asumiría el equipo. Si el producto utiliza un único modelo estable de un proveedor y no necesita esos controles, la facturación directa puede recuperar la ventaja cuando termine el descuento.

Ideal para: Un equipo pequeño o mediano que busca enrutamiento gestionado, controles de gasto y ningún recargo público por token.
Diferencial: La tarifa Default actual de GPT-5.6 Sol convierte el mes directo normalizado de $800 en $400 hasta el 18 de septiembre.
Precio: Free incluye $5/mes en modelos elegibles; Paid utiliza créditos comprados a las tarifas de lista del proveedor sin recargo; los medidores opcionales de informes, políticas y trazas se cobran aparte.
Prueba gratuita: Un nivel Free permanente, no una prueba temporal.

Lo bueno
Lo que hace bien
8 points

  • Cero recargo público por token tanto en Free como en Paid.
  • El descuento actual de Sol genera un ahorro medible del 50% sobre la carga normalizada.
  • Paid admite BYOK sin comisión del gateway.
  • El filtrado de proveedores por solicitud está disponible sin el medidor de la lista permitida para todo el equipo.
  • El descuento decisivo de Sol termina el 18 de septiembre de 2026.
  • Comprar créditos elimina el crédito Free recurrente de $5.
  • El fallback con la credencial del sistema puede consumir créditos de Vercel si falla una solicitud BYOK.
  • Los informes, las políticas para todo el equipo y las trazas pueden generar partidas de consumo separadas.

La ruta de adopción más segura mantiene la comparación reversible:

  1. Aísle un flujo con resultados evaluables

    Elija una tarea con una condición de aprobación cuantificable, como una extracción estructurada válida o una respuesta de soporte aprobada. Asígnele una clave de gateway independiente para que su gasto y sus fallas no queden ocultos dentro del resto del producto.

  2. Fije la referencia del acceso directo

    Registre una semana representativa de tokens de entrada, tokens de salida, reintentos, latencia y resultados aceptados en la ruta directa del proveedor. El ahorro actual en el precio unitario solo sirve si la tasa de aceptación no cae.

  3. Enrute un 10% acotado

    Envíe el 10% de ese flujo por Vercel, con el mismo modelo y nivel de servicio. Establezca un presupuesto para la clave que corresponda a la muestra, de modo que un error de configuración no convierta la comparación en una cuenta sin límite.

  4. Concilie las cuatro partidas de costo

    Sume el consumo del modelo, cualquier control de informes o políticas de pago, las trazas y el costo de revisión o reintento. Compruebe si una solicitud BYOK fallida consumió créditos del sistema.

  5. Tome la decisión de septiembre

    Mantenga la ruta solo si el costo por resultado aceptado mejora el acceso directo y los controles gestionados justifican su precio posterior a la promoción. Marque el 18 de septiembre en el calendario presupuestario y recalcule antes de la fecha límite.

2. LiteLLM: el mejor gateway autohospedado cuando ya existe un equipo de plataforma

LiteLLM es el mejor gateway autohospedado para una empresa que ya opera infraestructura compartida y quiere mantener en $0 la partida de licencia del gateway.

Página de precios de LiteLLM con los planes Open Source y Enterprise
Precios de LiteLLM, verificados el 24 de agosto de 2026

El plan Open Source es gratuito para siempre y se autohospeda. Expone 100+ proveedores mediante una única API compatible con OpenAI e incluye claves virtuales, usuarios y equipos, seguimiento de gasto, presupuestos, límites de frecuencia, fallbacks, registros y Prometheus. Para el CTO de una empresa mediana cuyo grupo de plataforma ya administra contenedores, métricas, secretos y guardias, permite unificar la lógica de los proveedores sin sumar una licencia mensual de gateway.

La palabra gratis termina en el límite de la licencia. La empresa sigue aportando cómputo, un almacén de datos cuando sea necesario, pipelines de despliegue, actualizaciones, revisión de seguridad, observabilidad y la persona que responderá si falla el gateway. LiteLLM solo gana en costos cuando esas tareas ya forman parte de la carga marginal del equipo de plataforma o cuando el autohospedaje es un requisito innegociable.

El plan Enterprise es un contrato anual personalizado, dimensionado por la capacidad anual de solicitudes del gateway, la arquitectura de despliegue y las necesidades de soporte, nunca por el volumen de tokens. Añade SSO y SCIM, controles OIDC o JWT, registros de auditoría, integración con gestores de secretos y rotación de claves, administración de la organización, opciones multirregión, soporte formal y despliegue aislado de Internet. La página pública ofrece una prueba Enterprise de 30 días sin tarjeta de crédito, pero no publica una cotización en dólares.

Esa base de precios cambia el cálculo del punto de equilibrio. Un equipo con un gasto muy alto en tokens y una capacidad de solicitudes moderada puede evitar un impuesto porcentual sobre modelos caros. En cambio, un equipo con poco gasto en modelos y sin una función de plataforma puede invertir más en atención del personal de lo que cobraría un gateway gestionado. La regla para cambiar no depende solo del volumen de solicitudes: hay que determinar si el costo mensual incremental de operar LiteLLM es menor que las comisiones de la plataforma alojada y el trabajo operativo que reemplaza.

LiteLLM también encaja en una empresa regulada que deba mantener el plano de datos dentro de su propio entorno. Ese control puede justificar la decisión incluso si la factura pura del modelo no baja. Reducir costos sería entonces una consecuencia secundaria del enrutamiento entre proveedores, los presupuestos y los controles centralizados, no una prueba de que autohospedar sea barato por naturaleza.

Ideal para: Equipos con una función de plataforma existente, requisitos de autohospedaje o una escala suficiente para rechazar comisiones porcentuales del gateway.
Diferencial: Una licencia de código abierto por $0 con presupuestos, claves virtuales, fallbacks, registros y 100+ proveedores.
Precio: Open Source cuesta $0 para siempre; Enterprise requiere una cotización anual personalizada según capacidad de solicitudes, arquitectura y soporte.
Prueba gratuita: 30 días para Enterprise sin tarjeta de crédito; Open Source es gratis de forma permanente para autohospedar.

Lo bueno
Lo que hace bien
7 points

  • Sin costo de licencia de código abierto ni impuesto del gateway por token.
  • Presupuestos, claves, fallbacks y registros centralizados para 100+ proveedores.
  • Enterprise admite gobernanza y despliegue aislado de Internet.
  • El consumo de modelos costosos no eleva automáticamente la licencia Enterprise según el gasto en tokens.
  • Con Open Source, el comprador se responsabiliza de la infraestructura, las actualizaciones, la fiabilidad y la respuesta a incidentes.
  • Enterprise no publica su precio, por lo que compras no puede modelarlo solo con el sitio web.
  • Un equipo pequeño sin capacidad de plataforma puede convertir una licencia gratuita en la alternativa operativa más cara.

3. Cloudflare AI Gateway: la mejor opción para tráfico idéntico byte por byte

Cloudflare AI Gateway ofrece el mayor ahorro cuando una proporción significativa de las solicitudes son repeticiones idénticas, seguras para reutilizar, y el equipo puede trabajar con BYOK.

Documentación de precios de Cloudflare AI Gateway con las funciones principales gratuitas, límites de registros, Unified Billing y Logpush
Precios de Cloudflare AI Gateway, verificados el 24 de agosto de 2026

Cloudflare permite calcular el precio de sus funciones principales con una claridad poco habitual. Las analíticas del panel, la caché y los límites de frecuencia son gratis en todos los planes. Workers Free almacena 100,000 registros entre todos los gateways y permite 10 gateways por cuenta. Workers Paid conserva 10 millones de registros por gateway y admite 20 gateways; Logpush, por su parte, solo está disponible en Paid, incluye 10 millones de solicitudes al mes y cobra $0.05 por cada millón adicional.

La caché es el mecanismo que genera el ahorro, y su limitación es muy precisa. La clave de caché predeterminada de Cloudflare incluye el proveedor, el endpoint, el modelo, el encabezado de autenticación del proveedor y el cuerpo completo de la solicitud. Cualquier diferencia en los mensajes, las herramientas o los parámetros del modelo crea otra entrada. Un acierto de caché evita la llamada al proveedor, pero dos prompts que expresan lo mismo con palabras distintas no coinciden, salvo que el equipo diseñe deliberadamente una clave personalizada y pueda demostrar que es segura.

La duración mínima de la caché es de 60 segundos, la máxima es de un mes y una solicitud almacenable puede ocupar hasta 25 MB. Funciona muy bien para tareas de clasificación repetidas, explicaciones estáticas compartidas o prompts deterministas por lotes. No es una buena opción predeterminada para soporte personalizado, fuentes que cambian o resultados creativos y estocásticos, donde una respuesta desactualizada pero barata puede causar más daño que una llamada nueva al modelo.

La modalidad de facturación importa tanto como la tasa de aciertos. BYOK mantiene gratis las funciones principales del gateway y paga directamente a los proveedores. Unified Billing repercute los precios de inferencia del proveedor, pero añade 5% a los créditos comprados; por eso, $100 en créditos cuestan $105. También tiene un límite de 200 solicitudes por cada 60 segundos y por gateway; Cloudflare indica que este límite de frecuencia no se aplica a BYOK.

Apliquemos una hipótesis explícita del 25% de repeticiones exactas sobre la factura normalizada de $800. Si esas solicitudes repetidas mantienen la misma mezcla de tokens y es seguro reutilizarlas, la caché con BYOK deja $600 de gasto en el proveedor y ahorra $200. Unified Billing añade 5% a los $600 restantes, lo que eleva el total a $630 y deja un ahorro neto de $170. Una tasa de aciertos menor puede borrar la ventaja; una mayor, siempre que sea segura, vuelve a Cloudflare difícil de superar.

El análisis DLP es gratis en todos los planes y ofrece dos perfiles predefinidos para cuentas sin suscripción a Zero Trust. Los guardrails no son gratuitos: la evaluación utiliza un modelo de Workers AI y se factura según sus tarifas por token. Es otro ejemplo de por qué hay que definir bien el perímetro contable. La caché puede ser gratis mientras la capa de seguridad añade una inferencia propia.

Ideal para: Usuarios de Cloudflare con solicitudes deterministas y repetidas, y un equipo dispuesto a medir la seguridad de la caché.
Diferencial: Caché gratuita de respuestas exactas que puede eliminar la llamada al proveedor cuando hay un acierto.
Precio: Las analíticas, la caché y los límites de frecuencia principales son gratis; Unified Billing añade 5%; los registros, Logpush y los guardrails tienen límites o medidores separados.
Prueba gratuita: Funciones principales gratis de forma permanente y almacenamiento de registros de Workers Free, no una prueba temporal.

Lo bueno
Lo que hace bien
8 points

  • Las analíticas, la caché y los límites de frecuencia principales del gateway cuestan $0.
  • Un acierto de caché exacto elimina la llamada al proveedor en lugar de descontar solo unos pocos tokens del prompt.
  • BYOK evita la comisión de 5% de Unified Billing y su límite de frecuencia para credenciales gestionadas.
  • El comportamiento y los límites estrictos de la caché están documentados con claridad.
  • La caché predeterminada exige una coincidencia exacta, por lo que las variaciones de una conversación producen fallos de caché.
  • Unified Billing añade 5% y tiene un límite de 200 solicitudes por cada 60 segundos y por gateway.
  • El almacenamiento gratuito de registros se comparte entre gateways y termina en 100,000 entradas.
  • Una clave personalizada insegura puede devolver contenido desactualizado o procedente de otro contexto.

4. TrueFoundry AI Gateway: la mejor caché semántica gestionada

TrueFoundry AI Gateway es la mejor opción gestionada cuando solicitudes redactadas de formas distintas suelen plantear la misma pregunta y la respuesta se puede reutilizar con seguridad.

Página de precios de TrueFoundry con los niveles Developer, Pro, Pro Plus y Enterprise
Precios de TrueFoundry AI Gateway, verificados el 24 de agosto de 2026

La diferencia está en la caché semántica. La documentación de caché de TrueFoundry explica que el modo exacto aplica un hash a la solicitud completa, mientras que el modo semántico convierte el mensaje final en un embedding y compara su significado con solicitudes anteriores. El resto de los parámetros de la solicitud deben coincidir. Un acierto en la caché de respuesta completa evita invocar el LLM y tiene un costo de LLM igual a cero; así, un equipo de soporte que recibe muchas variantes de «¿Cómo restablezco mi contraseña?» puede reutilizar una respuesta aprobada en lugar de pagar por cada redacción.

La caché queda aislada automáticamente por usuario o cuenta virtual, y los namespaces opcionales permiten separar inquilinos o entornos. Es importante porque una tasa de aciertos alta no sirve de nada si la respuesta almacenada de un cliente llega a otro. Una caché semántica autohospedada necesita Redis y un modelo de embeddings; la modalidad SaaS se encarga de esa infraestructura.

La página pública de precios ofrece cuatro niveles. Developer cuesta $0 al mes para 50,000 solicitudes y 3 usuarios. Pro cuesta $499 al mes para 1 millón de solicitudes y 10 usuarios. Sumar otros 2 millones de solicitudes más 5 claves API cuesta $499 adicionales al mes. Pro Plus cuesta $2,999 al mes para 1 millón de solicitudes y 25 usuarios; el uso adicional se cotiza con ventas. Enterprise se personaliza según la capacidad de solicitudes y usuarios, y admite despliegues VPC y aislados de Internet.

La página anuncia una prueba gratis de 7 días, mientras que la página del gateway ofrece gratis las primeras 50,000 solicitudes de cada mes, sin tarjeta, en 1,600+ modelos. Es suficiente para medir una tasa de aciertos realista antes de pasar a Pro. No autoriza a inferir un ahorro en producción a partir de un conjunto sintético de preguntas frecuentes.

Con un gasto moderado, el umbral que debe superar en la factura del modelo es alto. Frente a los $800 normalizados del proveedor, la suscripción Pro de $499 tiene que evitar al menos $499 de gasto del modelo, aproximadamente 62.4%, para ganar únicamente por costos de inferencia. La gobernanza, el aislamiento, la observabilidad y el tiempo del personal aún pueden justificar Pro con una tasa de aciertos menor, pero son beneficios distintos y deben presentarse como tales.

La verdadera barrera es la reutilización incorrecta. Un umbral semántico demasiado permisivo puede devolver una respuesta anterior que parezca pertinente, pero infrinja el contexto o la política del usuario actual. La prueba segura evalúa las respuestas almacenadas y las nuevas con el mismo conjunto de aceptación, segmenta por inquilino y desactiva la caché en preguntas que dependen de una cuenta activa o de contextos legales, médicos o de inventario cambiante.

Ideal para: Flujos de soporte, conocimiento y preguntas frecuentes con una intención repetida pero expresada de distintas maneras.
Diferencial: Caché semántica gestionada de respuestas completas, con aislamiento automático de cuentas y namespaces opcionales.
Precio: Developer $0; Pro $499/mes; Pro Plus $2,999/mes; Enterprise personalizado, con los límites publicados de solicitudes y usuarios ya indicados.
Prueba gratuita: Una prueba de 7 días más un nivel Developer permanente con 50,000 solicitudes/mes.

Lo bueno
Lo que hace bien
8 points

  • La caché semántica puede eliminar llamadas completas al modelo que una caché exacta no detecta.
  • Las entradas de caché quedan aisladas por usuario o cuenta virtual de forma predeterminada.
  • Developer ofrece suficientes solicitudes mensuales para evaluar una tasa de aciertos en una prueba acotada.
  • Enterprise permite despliegues VPC y aislados de Internet.
  • El piso mensual de $499 de Pro exige un ahorro considerable o un valor claro de gobernanza.
  • Pro Plus cuesta $2,999 y aun así publica 1 millón de solicitudes mensuales.
  • Los falsos positivos semánticos pueden convertir un ahorro en un problema de calidad o de límites de datos.
  • Una caché semántica autohospedada añade la operación de Redis y del modelo de embeddings.

5. Portkey: el mejor salto a gobernanza gestionada desde $49

Portkey es la mejor alternativa gestionada y de entrada accesible para un equipo cuyo prototipo ya quedó pequeño, pero que no puede justificar un gateway de producción de $499.

Página de precios de Portkey con los planes Open Source, Developer, Production y Enterprise
Precios de Portkey, verificados el 24 de agosto de 2026

La escala de planes comienza con Open Source, que se autohospeda, no limita las solicitudes e incluye una API universal, reintentos y timeouts, enrutamiento, guardrails, fallbacks automáticos, un panel básico, balanceo de carga y soporte de la comunidad. La página no indica el precio de la licencia de esta modalidad, así que debe evaluarse como LiteLLM: ofrece mucho control, pero la infraestructura y el costo del operador siguen en manos del comprador.

El nivel alojado Developer es Free Forever, admite 10,000 solicitudes al mes, no permite excedentes y se presenta expresamente para prototipos y pruebas de concepto empresariales, no para producción. Production cuesta $49 al mes, incluye 100,000 solicitudes y suma $9 mensuales por cada bloque adicional de 100,000 solicitudes hasta 3 millones. Incluye caché simple y semántica, acceso basado en roles, claves de cuentas de servicio y soporte para producción.

Con un millón de solicitudes mensuales, Production cuesta $130 antes del uso del modelo: $49 por las 100,000 incluidas más nueve bloques de $9 para las 900,000 restantes. Ese es el punto de comparación útil. Portkey debe recuperar más de $130 mediante caché, enrutamiento, aplicación de presupuestos o trabajo operativo para superar a un gateway sin comisión en la carga normalizada.

Enterprise usa precios y capacidad de solicitudes personalizados. Añade SSO, presupuestos y límites de frecuencia granulares, opciones de nube privada o VPC y controles de cumplimiento ampliados. Una organización regulada puede contratar ese nivel por gobernanza aunque la factura del proveedor no cambie.

Hay un detalle de nomenclatura que conviene incluir en la nota de compras. La página de precios vigente llama Production al nivel de $49, mientras que la documentación actual denomina Pro a ese mismo nivel de $49. La página también señala que Portkey ahora es Prisma AIRS AI Gateway. Esos nombres deben aclararse en la orden antes de automatizar verificaciones de planes o redactar una política de renovación en torno a ellos.

Portkey queda por debajo de TrueFoundry en profundidad de caché semántica porque sus materiales públicos no permiten auditar el mecanismo de ahorro con la misma facilidad. Supera a OpenRouter para un equipo que prefiere una tarifa base alojada y predecible frente a un porcentaje sobre cada compra de créditos compartidos. El punto de entrada de $49 permite presupuestar con claridad una prueba controlada en producción.

Ideal para: Un producto de IA en crecimiento que necesita caché alojada, roles, claves, enrutamiento y soporte con un presupuesto mensual de tres dígitos para el plano de control.
Diferencial: Production comienza en $49 y llega a un millón de solicitudes mensuales por $130 antes del uso del modelo.
Precio: Open Source autohospedado; Developer Free Forever; Production $49/mes más $9 por cada 100,000 solicitudes adicionales; Enterprise personalizado.
Prueba gratuita: El nivel Developer permanente ofrece 10,000 solicitudes/mes, pero no es apto para producción.

Lo bueno
Lo que hace bien
8 points

  • El primer nivel alojado para producción comienza en $49 al mes.
  • Production incluye caché simple y semántica.
  • El excedente predecible por bloques de solicitudes resulta más fácil de presupuestar que un porcentaje sobre tokens.
  • Las modalidades Open Source y Enterprise cubren requisitos de control opuestos.
  • Un millón de solicitudes eleva el titular de $49 a $130 antes de la inferencia.
  • Developer se detiene en 10,000 solicitudes sin excedentes y no es una opción de producción.
  • La diferencia de nombres entre Production y Pro crea una ambigüedad innecesaria en compras.
  • La economía de Enterprise sigue oculta tras una cotización de ventas.

6. OpenRouter: el mejor marketplace para enrutar proveedores por precio

OpenRouter es el mejor gateway cuando la tarea consiste en elegir entre muchos proveedores y modelos según el precio, no en minimizar la partida del gateway sin cambiar la ruta.

Página de precios de OpenRouter con los niveles Free, Pay-as-you-go y Enterprise
Precios de OpenRouter, verificados el 24 de agosto de 2026

El plan Free ofrece 25+ modelos gratuitos mediante 4 proveedores gratuitos, con 50 solicitudes al día y soporte de la comunidad. Pay-as-you-go habilita 500+ modelos y 80+ proveedores sin gasto mínimo, pero los créditos compartidos añaden una comisión de plataforma del 5.5%. La comisión por comprar créditos tiene un mínimo de $0.80, y la financiación con criptomonedas conlleva 5%.

Enterprise mantiene el catálogo de 500+ modelos y 80+ proveedores, y añade facturación mediante factura, controles gestionados, límites dedicados opcionales, un SLA contractual y un canal compartido de soporte en Slack. El precio se basa en compromisos de volumen personalizados y puede incluir descuentos en las comisiones. Es un nivel para compras corporativas, no una suscripción pública por usuario.

BYOK cambia la decisión. Pay-as-you-go incluye $25,000 al mes de inferencia BYOK a precio de lista sin comisión de OpenRouter y luego cobra 5% sobre el excedente. Enterprise eleva la asignación sin comisión a $200,000 al mes y después aplica 5%. Por tanto, una empresa que ya tenga cuentas directas con proveedores puede usar la capa de control de OpenRouter sin pagar el porcentaje de los créditos compartidos mientras permanezca dentro de la asignación.

La función que reduce costos es la selección de proveedores. OpenRouter puede ordenar por precio los proveedores elegibles, aplicar un precio máximo y recurrir a un fallback cuando una ruta falla. Su caché de respuestas beta devuelve solicitudes que coinciden exactamente sin uso facturable y funciona entre modelos, pero no es una caché semántica. Ordenar por precio solo ahorra si los proveedores son intercambiables para los requisitos de calidad, política de datos, latencia y disponibilidad de la carga.

En una factura del proveedor sin cambios de $800, los créditos compartidos añaden $44 y dejan un total de $844. Para superar la facturación directa, OpenRouter debe recuperar más de $44 mediante un proveedor elegible más barato, aciertos de caché, menor costo de fallas o una operación más simple. Si un solo proveedor ya atiende la carga de manera fiable con la tarifa contratada, el marketplace es una capa de costo opcional.

Los detalles sobre mínimos de comisiones, reglas BYOK, riesgos de financiación y comparación de rutas están en el desglose de precios de OpenRouter. El veredicto práctico aquí es más acotado: OpenRouter sirve para ahorrar cuando el equipo utiliza activamente su mercado, no cuando coloca la misma solicitud detrás de otra URL.

Ideal para: Equipos que realmente cambian entre proveedores o familias de modelos y pueden medir el ahorro de esa elección.
Diferencial: Enrutamiento por precio entre 500+ modelos y 80+ proveedores, con amplias asignaciones BYOK sin comisión.
Precio: Free $0; Pay-as-you-go cobra los precios de los modelos más 5.5% sobre créditos compartidos; Enterprise es personalizado y puede ofrecer descuentos en las comisiones.
Prueba gratuita: Un plan Free permanente con 25+ modelos gratuitos y 50 solicitudes/día.

Lo bueno
Lo que hace bien
8 points

  • El marketplace de proveedores más amplio de esta selección.
  • El enrutamiento puede ordenar por precio, fijar un precio máximo y recurrir a fallbacks.
  • BYOK no paga comisión del gateway hasta $25,000/mes en Pay-as-you-go o $200,000/mes en Enterprise.
  • Los aciertos de la caché de respuestas exactas registran cero uso facturable.
  • Los créditos compartidos añaden 5.5% aunque la ruta subyacente no cambie.
  • El mínimo de $0.80 encarece las compras pequeñas de créditos frente al porcentaje anunciado.
  • La caché exacta no reconoce solicitudes redactadas con otras palabras.
  • Cambiar de proveedor puede modificar la latencia, la política o la calidad del resultado, incluso con el mismo nombre de modelo.

Qué opción conviene en cada caso

Vercel es la alternativa predeterminada para un equipo que busca enrutamiento gestionado sin recargo público por token. La elección deja de favorecer a Vercel cuando vence el descuento actual del modelo y los demás controles ya no ahorran más que el acceso directo, o cuando la configuración de políticas para todo el equipo y de trazas vuelve significativa la factura de complementos.

LiteLLM es la elección cuando el autohospedaje es obligatorio o un equipo de plataforma ya existente puede absorber el gateway con un costo marginal bajo. La decisión cambia a una opción gestionada si LiteLLM obliga a nombrar un nuevo responsable operativo, crea una nueva guardia o presenta una cotización Enterprise mayor que la factura completa de la alternativa alojada.

Cloudflare gana cuando los cuerpos de las solicitudes se repiten exactamente, es seguro reutilizar la respuesta almacenada y BYOK encaja. La elección pasa a TrueFoundry cuando redacciones diferentes expresan la misma intención y una caché semántica medida supera el umbral de calidad. Vuelve a imponerse no usar caché cuando la actualidad, la personalización o el contexto de cada inquilino hacen que reutilizar sea inseguro.

TrueFoundry gana en reutilización semántica gestionada solo después de que una evaluación real demuestre suficientes aciertos de caché aceptados para cubrir su nivel. Portkey gana si el equipo necesita un plano de control alojado más económico para producción y puede ajustarse a sus costos por solicitudes. OpenRouter gana cuando ordenar proveedores por precio o consolidar BYOK ahorra más que su comisión.

Un diagrama de decisión con forma de invernadero dirige las cargas a Vercel, LiteLLM, Cloudflare, TrueFoundry, Portkey u OpenRouter según sus necesidades operativas y de caché
Elija el gateway según el mecanismo de ahorro que su carga realmente pueda aprovechar

La mejor opción predeterminada todavía puede ser no usar un gateway. Una carga estable y de gran volumen en un solo proveedor, con buenos presupuestos nativos, bajo costo de fallas y poco contenido repetido, no ofrece un ahorro evidente para el gateway. Añada un plano de control únicamente cuando un beneficio concreto de enrutamiento, caché, gobernanza u operación supere su costo total.

Cómo se eligieron estas opciones

El ranking pondera los factores económicos que un comprador puede verificar: 35% para el costo público del gateway y la transparencia de las comisiones, 30% para un mecanismo creíble que elimine gasto del modelo, 20% para la barrera de entrada en producción y 15% para la carga operativa y la fricción de migración.

Las páginas de precios, comparaciones de planes, documentación de funciones, comportamiento de la caché, límites de solicitudes y el cambio de GPT-5.6 Sol se verificaron en vivo el 24 de agosto de 2026. El pipeline de publicación captura una imagen real de la página de precios de cada gateway incluido en el ranking. Las herramientas no se probaron aquí con tráfico de producción, por lo que ningún resultado de latencia, disponibilidad, aciertos de caché o calidad de salida se presenta como una prueba práctica.

Seis gateways llegaron a la selección final porque cada uno cumple una función de costos distinta y auditable. Vercel elimina el recargo de la plataforma gestionada y ahora aplica un descuento a un modelo importante. LiteLLM elimina la partida de licencia mediante autohospedaje. Cloudflare evita llamadas que se repiten exactamente. TrueFoundry se dirige a repeticiones semánticas. Portkey ofrece un salto gestionado con un precio claro. OpenRouter expone la competencia de precios entre proveedores.

Una función no se contó como ahorro solo porque un proveedor la describa como optimización. El cálculo utiliza una carga declarada, un precio concreto y una hipótesis explícita de caché. Antes de firmar un acuerdo anual, cada empresa que aplique el ranking debe sustituir esos datos por su propia mezcla de modelos, su tasa de resultados aceptados y su costo de operación.

Las opciones que conviene evitar

Kong AI Gateway en un despliegue nuevo centrado en costos

Kong AI Gateway no es la primera opción si el único objetivo es reducir los costos de inferencia. Los precios actuales de Kong ofrecen a Konnect una prueba de 30 días; después, los plugins de pago de AI Gateway son un complemento de Plus y cuestan $100 al mes por cada modelo único que pase por plugins de IA, con un límite de cinco modelos. Cinco modelos generan una partida mensual de proxy de $500 antes del consumo de inferencia y otros costos de la plataforma.

Eso no convierte a Kong en una mala plataforma. Una empresa que ya estandariza API, seguridad y gobernanza de servicios con Kong puede descubrir que sus controles incrementales de IA cuestan menos que sumar otro proveedor. La recomendación es más específica: no introduzca una plataforma amplia de API en un stack nuevo de IA solo para ahorrar tokens cuando existen gateways sin recargo y con funciones principales gratuitas.

Un proxy propio sin responsable

Un proxy interno sencillo parece gratis hasta que tiene que hacerse cargo de reintentos, cambios de proveedores, presupuestos, registros, secretos e incidentes. Constrúyalo solo si la carga es lo bastante estable como para mantener una superficie pequeña y un equipo concreto ya se responsabiliza del servicio. De lo contrario, el proxy oculta su costo en horas de ingeniería y ofrece menos controles que las alternativas gestionadas.

Cualquier gateway para una carga de un solo proveedor sin respuestas reutilizables

La amplitud del enrutamiento no aporta valor si el tráfico nunca cambia de ruta. Las cachés exactas y semánticas no sirven cuando cada solicitud necesita una respuesta nueva. Si bastan los presupuestos y registros nativos del proveedor, la API directa tiene menos capas de facturación y una superficie de fallas menor.

Un plan permanente basado en el descuento de septiembre

La promoción actual de Sol en Vercel es la mejor oferta inmediata del ranking y también la más fácil de interpretar mal. Considere el 18 de septiembre una fecha obligatoria para recalcular. La arquitectura debe seguir siendo viable con las tarifas de lista del proveedor, aunque la promoción sea el motivo para iniciar ahora la prueba de migración.

La acción del lunes: lleve un flujo a una hoja de costo por resultado aceptado

Elija un flujo de producción que haya generado una factura significativa del modelo la semana pasada y pueda evaluarse con una regla binaria de aceptación. Exporte sus tokens de entrada, tokens de salida, gasto del proveedor, reintentos y resultados aceptados. Mantenga los datos personales, confidenciales y de clientes fuera de cualquier conjunto de evaluación que no esté autorizado para la ruta elegida.

Enrute el 10% del tráfico de la próxima semana por el gateway cuyo mecanismo coincida con la carga. Use Vercel para aprovechar la ventana del precio gestionado de Sol, Cloudflare para repeticiones exactas ya demostradas, TrueFoundry para preguntas diferentes pero equivalentes, LiteLLM si ya existe una plataforma autohospedada, Portkey para una capa de control gestionada con entrada económica u OpenRouter cuando haya competencia real de precios entre proveedores.

Establezca un presupuesto estricto en la clave aislada y defina una condición de parada antes de enviar la primera solicitud. Detenga la prueba si cae la tasa de resultados aceptados, falla la seguridad de la caché, una ruta de proveedor infringe la política o la partida total del gateway supera el ahorro. Al terminar la semana, divida entre los resultados aceptados la suma del gasto del modelo, las comisiones de plataforma, los controles de pago, los reintentos y el costo de revisión.

El resultado del lunes es una decisión que finanzas e ingeniería pueden compartir: mantener, cambiar o retirar el gateway. Si gana Vercel, añada al calendario un nuevo cálculo para el 18 de septiembre. Si gana una caché, publíquela solo para las clases de solicitudes que superaron la prueba. Si ninguna opción gana, conserve el acceso directo y evite pagar por complejidad opcional.

Preguntas frecuentes

¿Cuánto cuesta Cloudflare AI Gateway?

Las analíticas, la caché y los límites de frecuencia principales de Cloudflare AI Gateway son gratis en todos los planes. Workers Free almacena 100,000 registros entre todos los gateways; Workers Paid conserva 10 millones por gateway. Unified Billing añade 5% a los créditos comprados, mientras que los precios del proveedor se repercuten sin recargo. Logpush y la inferencia de guardrails pueden generar cargos separados.

¿Cuál es el mejor gateway de IA?

Vercel AI Gateway es la mejor opción gestionada general el 24 de agosto de 2026 porque combina cero recargo público por token con un descuento actual del 50% en GPT-5.6 Sol hasta el 18 de septiembre. LiteLLM resulta mejor para equipos que ya operan infraestructura autohospedada; Cloudflare, para caché de repeticiones exactas; TrueFoundry, para caché semántica gestionada; Portkey, para entrar en producción por $49; y OpenRouter, para ordenar proveedores por precio.

¿Cloudflare AI Gateway tiene un plan gratuito?

Sí. Las analíticas, la caché y los límites de frecuencia principales son gratis, y la asignación de registros de Workers Free almacena 100,000 entradas en total entre todos los gateways. La cuenta gratuita admite 10 gateways. La inferencia del proveedor sigue costando dinero, y Unified Billing, los guardrails o las funciones de registro de pago pueden añadir cargos.

Obtenga el mapa de herramientas de IA para empresas

Convierta esta decisión sobre gateways en un stack de adopción completo, con un umbral de costos y un nivel mínimo de calidad para cada herramienta. Suscríbase para recibir gratis el mapa de herramientas de IA.

Última actualización

2 sept 2026

CategoríaAI

Prefiera este sitio en Google

Añadir omidsaffari.com como fuente preferida en la Búsqueda de Google

Marque omidsaffari.com como fuente preferida y Google lo destacará para usted en Top Stories, AI Overviews y AI Mode.

Newsletter

Una carta, cada domingo. Sistemas que funcionan, no opiniones calientes.

Build logs, sistemas en producción y notas de campo de un portafolio de ventures de IA.

Semanal. Sin spam. Cancele cuando quiera.