Gateway de IA para agentes de programación: las 6 mejores opciones

Guía para elegir un gateway de IA: comparamos seis opciones, sus precios, límites de enrutamiento, despliegue y el mejor uso para cada equipo.

Thursday, September 3, 2026Omid Saffari
Gateway de IA para agentes de programación: las 6 mejores opciones

Vercel AI Gateway es el mejor gateway de IA para la mayoría de los equipos que trabajan con agentes de programación: un solo comando configura nueve agentes y su capa base de tokens no añade ningún recargo. Con una factura mensual de modelos de $2,000, la comisión del gateway es de $0 con Vercel, $100 con Requesty y $110 con OpenRouter, antes de sumar controles opcionales. La elección ya no pertenece al terreno de las pruebas: debe formar parte del presupuesto de ingeniería.

Respuesta rápida: ¿qué gateway de IA conviene elegir?

Elija Vercel AI Gateway salvo que existan requisitos concretos de despliegue, atribución de costos o gobernanza. Hoy ofrece la ruta más sencilla para unificar configuraciones separadas de Claude Code, Codex, Cursor y OpenCode en una sola factura de modelos, una política común de fallback y una única vista del gasto.

HerramientaIdeal paraPrecio inicialPrueba gratuita
Vercel AI GatewayConfiguración rápida de varios agentesRecargo de $0 en tokens; crédito mensual de $5Nivel gratuito
RequestyCostos por rama, repositorio y desarrollador$0 en el nivel gratuito; recargo del 5% en Pay as you goNivel gratuito, sin tarjeta
LiteLLMControl con infraestructura propiaCódigo abierto por $0Prueba Enterprise de 30 días
OpenRouterExperimentación con una amplia variedad de modelos$0 en el nivel gratuito; comisión del 5.5% en Pay as you goNivel gratuito
PortkeyEnrutamiento y gobernanza administradosDeveloper por $0; Production por $49/mesPlan Developer gratuito
Cloudflare AI GatewayInfraestructura ya basada en WorkersFunciones básicas por $0; comisión del 5% por Unified BillingFunciones básicas gratuitas

Hay cinco situaciones claras en las que Vercel deja de ser la mejor elección. Use Requesty si finanzas necesita saber qué repositorio, rama o desarrollador originó el gasto. Elija LiteLLM cuando el tráfico de los modelos y las claves de los proveedores deban permanecer en infraestructura propia. Opte por OpenRouter si acceder al catálogo más amplio de modelos y proveedores pesa más que una configuración específica para cada agente. Escoja Portkey cuando el presupuesto se destine a guardrails administrados, circuit breakers y políticas. Elija Cloudflare AI Gateway si Workers, los registros de Cloudflare y su capa de seguridad ya constituyen el plano de control.

Un gateway de IA es la capa de control situada entre un agente de programación y los proveedores de modelos. El agente sigue planificando, editando archivos, ejecutando comandos y usando herramientas. El gateway decide adónde se envían las solicitudes, cuánto pueden costar, qué proveedor las recibe, qué ocurre tras un timeout y qué información queda registrada.

La diferencia es importante. Un gateway no mejora un modelo de programación mediocre, no corrige unas instrucciones deficientes del repositorio ni revisa código inseguro. Sí puede evitar que la caída de un proveedor arruine una ejecución larga, limitar una clave fuera de control y revelar que una rama de migración consumió cuatro veces el presupuesto de modelos de una corrección rutinaria. Se compra control, no inteligencia.

Por qué los agentes de programación convierten el gateway de IA en una partida presupuestaria

Con agentes de programación, una pequeña decisión de enrutamiento pasa a ser una decisión de costos operativos, porque una sola tarea puede desencadenar una cadena de llamadas a modelos. Una respuesta de chat quizá requiera una única petición. Un agente puede inspeccionar un repositorio, buscar símbolos, proponer un parche, ejecutar pruebas, leer los errores, revisar el parche y pedir a un modelo más potente que evalúe el resultado.

El índice de producción de Vercel determinó que el 22.2% de las solicitudes concentraba el 58.9% de los tokens; es decir, las solicitudes que usaban herramientas consumían aproximadamente 2.6 veces más tokens que el resto del tráfico. El mismo conjunto de datos indicó que los fallbacks rescataron el 3.5% de las solicitudes. Si una carga de 10,000 solicitudes reprodujera ese patrón agregado, alrededor de 350 solicitudes terminarían mediante un fallback en lugar de fallar con el primer proveedor. Es un ejemplo, no una tasa de rescate garantizada para otra carga, pero deja claro por qué la fiabilidad debe compararse junto con el precio del modelo.

La comisión base del gateway se entiende mejor si se mantiene fija la factura del proveedor. Con $2,000 al mes de inferencia valorada según las tarifas del proveedor:

  • Vercel añade $0 de recargo por tokens.
  • El recargo del 5% de Requesty suma $100.
  • La comisión del 5.5% de OpenRouter en Pay as you go suma $110.
  • Cloudflare Unified Billing suma $100 cuando los créditos se compran a través de ese servicio.
  • Portkey parte de $49 al mes por 100,000 registros almacenados, una unidad de cobro distinta del consumo de tokens.
  • La licencia de código abierto de LiteLLM añade $0, pero el alojamiento y el tiempo del equipo de operaciones siguen siendo responsabilidad propia.
Comparación de costos de seis gateways de IA con dos mil dólares de gasto mensual en modelos
Costo de la capa de gateway con $2,000 de gasto mensual en modelos, según precios vigentes verificados el 15 de agosto de 2026

La diferencia porcentual no decide todo por sí sola. Los $100 adicionales de Requesty pueden resultar baratos si la atribución por rama impide que un repositorio sin control gaste mucho más. Los $49 de Portkey pueden compensar si un circuit breaker mantiene en marcha un flujo de publicación. Y la licencia gratuita de LiteLLM puede salir cara si un ingeniero de plataforma termina siendo el responsable permanente de guardia del proxy.

El gateway debería abaratar los cambios de modelos, proveedores y agentes. Si únicamente sustituye seis facturas de proveedores por una séptima factura, todavía no se ha ganado un lugar en la arquitectura.

Cómo seleccionamos estos gateways

Las seis opciones se evaluaron según el trabajo real que generan los agentes de programación, no con una lista genérica de funciones de API. Los precios y las páginas de producto se verificaron el 15 de agosto de 2026. Las herramientas no se probaron en producción durante este análisis, de modo que la clasificación se basa en la documentación vigente, una comparación normalizada de costos y las consecuencias de los límites de cada producto.

El orden depende de seis criterios:

  1. Configuración del agente de programación: Un gateway que documenta Claude Code, Codex, Cursor y agentes similares presenta menos riesgo de integración que otro que solo promete un endpoint compatible con OpenAI.
  2. Fiabilidad del enrutamiento: El orden de proveedores, los timeouts, los reintentos, los fallbacks de modelos y los circuit breakers importan porque un agente puede perder una cadena larga en la última llamada al modelo.
  3. Visibilidad de costos: El gasto en modelos debería poder atribuirse a una clave, agente, repositorio, desarrollador, equipo o política, en vez de aparecer como un único total de tokens sin desglose.
  4. Control de políticas: Las listas de proveedores y modelos aprobados, los presupuestos, los controles de retención y los registros de auditoría determinan si un equipo puede pasar de las pruebas individuales a un uso organizado.
  5. Carga operativa: Los gateways administrados cobran por eliminar tareas operativas. Los gateways alojados por el cliente evitan comisiones de plataforma, pero devuelven al comprador la responsabilidad sobre disponibilidad, actualizaciones, almacenamiento y respuesta a incidentes.
  6. Precio vigente: Cada nivel y cada límite proceden de la página actual del proveedor. Los precios de inferencia de los modelos se excluyen de la clasificación porque varían según el modelo y el proveedor, y porque la comparación mantiene constante la factura original.

Helicone se tuvo en cuenta, pero no entró en la clasificación. Es un producto sólido de observabilidad que incluye funciones de gateway, aunque su ventaja más clara está en el seguimiento y el análisis, no en configurar una gama amplia de agentes de programación. También se descartaron los gateways de API genéricos. Pueden actuar como proxy de tráfico HTTP, pero los agentes necesitan fallbacks que entiendan modelos, presupuestos de tokens, controles de prompts y respuestas, y compatibilidad con varios protocolos de comunicación.

El resultado es una lista más breve y una regla de decisión más exigente. Cada producto tiene un terreno en el que gana y un límite a partir del cual otra opción ofrece una compra más acertada.

1. Vercel AI Gateway: el mejor en general para agentes de programación

Vercel AI Gateway es la mejor opción predeterminada porque elimina el trabajo de configuración que antes mantenía los gateways fuera del flujo individual de cada agente. Su CLI actual puede crear una clave, mostrar una vista previa de los cambios y configurar nueve agentes compatibles con vercel ai-gateway coding-agents setup.

Documentación de Vercel AI Gateway para agentes de programación
Vercel AI Gateway

La tabla de compatibilidad vigente incluye Claude Code, Cline, OpenAI Codex, Cursor, Hermes, Kilo Code, OpenClaw, OpenCode y Pi. Vercel también documenta rutas de configuración manual para otras herramientas. Claude Code, Codex y Cursor cuentan con endpoints de compatibilidad específicos porque su comportamiento de comunicación exige algo más que la interfaz genérica de OpenAI. Esa función cambia la decisión de compra: el gateway deja de ser solo infraestructura detrás de una aplicación propia y puede situarse detrás de las herramientas de programación que el equipo ya utiliza.

Para un equipo de producto de 12 personas, el resultado práctico es un presupuesto y una política de fallback comunes para distintas formas de trabajar. Un ingeniero puede seguir con Claude Code, otro ejecutar Codex desde la terminal y un tercero usar Cursor. Sus solicitudes terminan en la misma vista de gasto sin obligar a la empresa a imponer un único editor o laboratorio de modelos.

Ideal para: Equipos que usan varios agentes de programación y buscan la configuración administrada más rápida
Lo más destacado: Un único flujo de CLI para nueve agentes compatibles, además de endpoints específicos para Claude Code, Codex y Cursor
Precio: Crédito mensual gratuito de $5; inferencia de pago a las tarifas de lista del proveedor, sin recargo por tokens
Prueba gratuita: Nivel gratuito permanente en los modelos elegibles; no es una prueba con fecha de vencimiento

El precio de la capa base es especialmente sencillo. La página de precios vigente de Vercel afirma que no aplica recargo ni comisión de plataforma a los tokens. El nivel gratuito incluye $5 de crédito mensual, un subconjunto de modelos elegibles y límites inferiores por modelo. Al comprar créditos, la cuenta pasa a Pay as you go y deja de recibir el crédito mensual gratuito. Bring Your Own Key solo está disponible después de pasar al nivel de pago, y Vercel no cobra comisión por BYOK.

Hay dos salvedades. La primera es que el recargo cero se aplica a la capa de tokens, no a todos los controles. La lista de proveedores permitidos para todo el equipo y la retención de datos cero para todo el equipo cuestan $0.10 por cada 1,000 solicitudes, cada una. Los trace drains cuestan $0.05 por cada 1,000 trazas, más $0.50 por GB de salida de datos. Los informes personalizados tienen sus propias unidades de cobro por escrituras y consultas. Un equipo pequeño puede prescindir de casi todo ello; uno regulado debería presupuestarlo antes de declarar gratuito el gateway.

La segunda es que una solicitud BYOK fallida puede volver a intentarse con credenciales del sistema de Vercel y cargar el consumo del fallback al saldo de créditos del gateway. Es un valor predeterminado razonable para la fiabilidad, pero también un caso límite presupuestario. Si finanzas espera que todas las solicitudes permanezcan dentro de un contrato existente con un proveedor, hay que revisar la ruta de fallback en lugar de darla por sentada.

Los controles de enrutamiento bastan para la mayoría de los equipos de producto. Vercel documenta filtrado, orden y clasificación de proveedores, almacenamiento automático en caché, timeouts del proveedor y fallbacks de modelos. El tráfico normal de finalización de código puede enviarse al proveedor preferido, con una conmutación rápida si la latencia supera la tolerancia y un modelo más caro reservado como última vía de recuperación.

El principal límite es la propiedad del despliegue. Vercel AI Gateway es un servicio administrado. No es la opción adecuada para un equipo que exige ejecutar el proceso del gateway, la base de datos, las claves y los registros dentro de su propia red. Ante ese requisito, LiteLLM gana antes incluso de comparar funciones.

Lo bueno
Lo que hace bien
9 points

  • Un comando de configuración documentado para nueve agentes de programación
  • Endpoints de compatibilidad específicos para Claude Code, Codex y Cursor
  • Cero recargo y cero comisión de plataforma por tokens
  • Orden de proveedores, timeouts, caché y fallbacks de modelos
  • Una factura y una vista de gasto para 200+ modelos
  • No ofrece despliegue del gateway en infraestructura propia
  • BYOK exige el nivel de pago
  • Informes avanzados, trazas, listas de proveedores permitidos y ZDR para todo el equipo tienen unidades de cobro separadas
  • Cursor todavía requiere completar algunos ajustes de cuenta después de que la CLI crea la clave

Cómo configurar Vercel AI Gateway sin convertir la migración en un proyecto

La configuración más segura conserva una ruta de vuelta al proveedor directo y empieza con un solo repositorio. No cambie a todos los desarrolladores y agentes al mismo tiempo.

  1. Cree una clave acotada para el piloto

    Cree una clave del gateway para el repositorio piloto y asígnele un presupuesto semanal o mensual. No reutilice una clave corporativa de aplicación: los ciclos de los agentes de programación necesitan su propio límite.

  2. Ejecute el comando de configuración documentado

    Ejecute vercel ai-gateway coding-agents setup. Permita que la CLI detecte los agentes instalados, seleccione únicamente las herramientas del piloto y revise el diff mostrado antes de aceptar cualquier escritura de configuración.

  3. Mantenga un modelo principal y un fallback

    Empiece por el modelo en el que el equipo ya confía. Añada un único fallback de proveedor o modelo con un comportamiento comparable al usar herramientas. Un árbol de enrutamiento grande dificulta explicar una ejecución fallida.

  4. Verifique la identidad y las etiquetas de gasto

    Ejecute una tarea acotada desde cada agente configurado. Confirme que el panel identifica el agente, el modelo, el proveedor, el consumo de tokens, el costo, la latencia y el estado del fallback tal como espera el comprador.

  5. Conserve la ruta directa

    Mantenga la configuración anterior del proveedor en un archivo de reversión documentado. Si el gateway altera las llamadas a herramientas, el descubrimiento de modelos o la latencia, el piloto debe poder revertirse en cuestión de minutos.

2. Requesty: la mejor atribución de costos por rama, repositorio y desarrollador

Requesty es el mejor gateway cuando el responsable de ingeniería necesita vincular el gasto en modelos con el trabajo que lo generó. Su integración con Claude Code permite etiquetar las solicitudes por rama, repositorio, desarrollador y versión del agente, de modo que una factura de tokens se convierte en información que el equipo puede investigar.

Página de precios del gateway de IA Requesty
Requesty

Para los equipos que ejecutan migraciones, ramas de funcionalidades y revisiones automatizadas en paralelo, esa atribución aporta más que una comisión baja. Un equipo de SaaS B2B podría descubrir que la revisión en segundo plano cuesta poco, mientras el ciclo de pruebas y correcciones de un repositorio consume la mayor parte del presupuesto mensual. Así, la respuesta es concreta: ajustar la política de ese repositorio o modelo, no recortar el acceso de todos los desarrolladores.

Ideal para: Equipos que necesitan desglosar el costo de los agentes por rama, repositorio o desarrollador
Lo más destacado: Etiquetas analíticas para Claude Code, más políticas de enrutamiento, residencia de datos en la UE y un gateway MCP
Precio: $0 con modelos gratuitos; Pay as you go añade un 5% al costo base de los modelos; Enterprise tiene precio personalizado
Prueba gratuita: Nivel gratuito con 200 solicitudes al día y sin tarjeta de crédito

La página de precios actual de Requesty enumera 600+ modelos de 20+ proveedores. Pay as you go no tiene suscripción, tarifa por usuario, consumo mínimo ni cargos separados por enrutamiento, caché, fallbacks y residencia de datos en la UE. Con $2,000 de inferencia mensual valorada según el proveedor, el recargo del 5% asciende a $100.

Esos $100 se justifican con facilidad si los metadatos evitan una ejecución sin control de mayor costo o permiten repartir cargos. Resultan más difíciles de defender para un desarrollador individual que solo quiere otra URL base. OpenRouter anuncia un catálogo más amplio y Vercel ofrece una ruta más limpia, sin recargo, para los agentes compatibles.

El nivel Enterprise de Requesty incorpora SSO, RBAC, registros de auditoría, políticas de modelos aprobados, detección de PII, presupuestos por grupo, cuentas de servicio para CI/CD y SLA personalizados. Estas funciones lo convierten en una opción creíble para una organización de ingeniería grande, pero el precio es personalizado. Ningún equipo puede comparar Enterprise sin pedir una cotización y aportar un perfil representativo de solicitudes.

Conviene conocer una discrepancia en la documentación. La página comercial de precios afirma que hay 600+ modelos, mientras que la página de integración con Claude Code, modificada el 10 de agosto de 2026, todavía habla de 300+ modelos. Aquí se utiliza la cifra mayor para el catálogo de pago porque la página de precios vigente define esa oferta. La diferencia implica que el comprador debería comprobar en la biblioteca de su cuenta los modelos concretos que necesita, sin tomar ninguno de los dos titulares como garantía.

La configuración de Claude Code es más limitada que la CLI multiagente de Vercel, pero profundiza más en la atribución. La CLI de Requesty puede escribir la configuración de Claude y crear una copia de seguridad del archivo existente. Un wrapper opcional de shell inyecta cabeceras de repositorio, rama, usuario y versión del agente al iniciar la sesión. El wrapper queda visible en la configuración del shell y las cabeceras se eliminan antes de reenviar la solicitud al proveedor del modelo.

El límite está en la comisión porcentual. El recargo del 5% crece con el gasto en modelos aunque el trabajo del plano de control del gateway no aumente. Con $20,000 al mes, se convierte en $1,000. Un comprador de mayor tamaño debería contrastar esa factura con el modelo de suscripción de Portkey, el costo operativo de LiteLLM y una cotización personalizada de Requesty Enterprise.

Lo bueno
Lo que hace bien
9 points

  • Atribución de costos por rama, repositorio, desarrollador y versión del agente
  • 200 solicitudes gratuitas al día con modelos gratuitos
  • Enrutamiento, caché, fallbacks, límites de gasto y residencia de datos en la UE en Pay as you go
  • Gateway MCP y cuentas de servicio para CI/CD
  • Sin suscripción, tarifa por usuario ni consumo mínimo en Pay as you go
  • El recargo del 5% aumenta directamente con el gasto en inferencia
  • El precio de Enterprise exige una cotización
  • La configuración multiagente está menos unificada que la CLI de Vercel para nueve agentes
  • Las páginas vigentes discrepan sobre si el catálogo contiene 300+ o 600+ modelos

3. LiteLLM: el mejor proxy LLM alojado en infraestructura propia

LiteLLM es la mejor opción cuando controlar el despliegue y los datos importa más que la comodidad. Su proxy de código abierto puede alojarse gratuitamente en producción y reúne a 100+ proveedores detrás de una sola API compatible con OpenAI.

Página de precios del gateway alojado en infraestructura propia LiteLLM
LiteLLM

Para el CTO de una empresa mediana con una red privada como límite, la ventaja es directa: las claves de los modelos, el tráfico de solicitudes, las claves virtuales, los presupuestos, los registros y las métricas de Prometheus permanecen en infraestructura operada por la empresa. LiteLLM afirma que su producto autoalojado no ve los datos ni el tráfico del cliente. Así se elimina un gateway administrado de la ruta de datos del modelo.

Ideal para: Equipos de plataforma que exigen acceso a modelos autoalojado o aislado de la red pública
Lo más destacado: Proxy gratuito y de código abierto con 100+ proveedores, claves virtuales, presupuestos, fallbacks y Prometheus
Precio: Código abierto por $0; Enterprise es anual y su precio personalizado depende de la capacidad y el despliegue
Prueba gratuita: Prueba Enterprise de 30 días sin tarjeta; la versión de código abierto sigue siendo gratuita

El precio del software es la cifra más sencilla de la comparativa y también la que más se presta a malentendidos. El gateway de código abierto cuesta $0, incluso para uso en producción. Incluye usuarios y equipos, seguimiento de gasto, límites de frecuencia, registro de solicitudes y respuestas, y fallbacks de LLM. LiteLLM no cobra una licencia por token.

El costo operativo no es de $0. Alguien debe desplegar el proxy, administrar su base de datos y sus secretos, escalarlo, supervisarlo, actualizarlo cuando los proveedores cambien sus API, conservar los registros, probar los fallbacks y responder cuando el gateway se convierta en el punto de fallo compartido. LiteLLM transforma una factura de proveedor en una responsabilidad de infraestructura. Puede ser un buen intercambio para un equipo de plataforma y uno muy desfavorable para una startup de cinco personas.

Enterprise añade SSO, SCIM, autenticación OIDC o JWT, registros de auditoría, integraciones con gestores de secretos, rotación de claves, controles de organización, un plano de control multirregión, soporte, SLA y despliegue aislado. El precio es anual y depende de la capacidad de solicitudes, la arquitectura de despliegue y el soporte, no de los tokens. Ese límite es importante: una empresa regulada puede empezar con el código abierto y aun así necesitar Enterprise en cuanto la identidad, las auditorías o el soporte permanente pasen a ser obligatorios.

LiteLLM también presenta dos superficies de producto que los compradores suelen confundir. El SDK de Python es una biblioteca para aplicaciones. Proxy Server es el gateway centralizado que aporta autenticación, gasto multiinquilino, claves virtuales y un panel de administración. Un despliegue de agentes de programación que necesite políticas compartidas debe evaluar el proxy, no limitarse a incorporar el SDK en algunos scripts.

El límite para los agentes de programación está en la documentación y en la responsabilidad operativa. LiteLLM ofrece un endpoint compatible que muchos agentes pueden utilizar, pero no cuenta con el instalador único y actual de Vercel para nueve agentes concretos. Hay que validar por separado las variables de entorno, el formato de respuesta, el descubrimiento de modelos y el uso de herramientas de cada agente. El comportamiento de la Responses API de Codex y el protocolo Anthropic de Claude Code merecen pruebas piloto independientes.

Lo bueno
Lo que hace bien
9 points

  • Licencia de código abierto por $0 para uso en producción con alojamiento propio
  • 100+ proveedores mediante una sola API compatible con OpenAI
  • Claves virtuales, presupuestos, límites de frecuencia, fallbacks, registros y métricas de Prometheus
  • El tráfico y las claves permanecen dentro de la infraestructura operada por el cliente
  • Ruta Enterprise para identidad, auditoría, aislamiento, soporte y control multirregión
  • El comprador se hace cargo de la disponibilidad, las actualizaciones, el almacenamiento, el escalado y los incidentes
  • El precio de Enterprise no es público
  • La configuración específica de cada agente está menos resuelta que en Vercel
  • Un proxy central puede convertirse en un nuevo dominio interno de fallos si se despliega sin rigor

4. OpenRouter: el mejor para explorar modelos y experimentar con rapidez

OpenRouter es el mejor gateway para comparar un gran mercado de modelos desde una única cuenta. Su página vigente de Pay as you go enumera 500+ modelos de 80+ proveedores, el catálogo publicado más amplio de esta selección.

Página de precios del gateway OpenRouter
OpenRouter

Esa amplitud resulta valiosa para un desarrollador técnico independiente o un pequeño equipo muy orientado a la investigación. Un agente de programación puede comparar un modelo de frontera para planificar el repositorio, otro más rápido para búsquedas y clasificación, y un modelo abierto para transformaciones rutinarias, sin abrir una cuenta de facturación con cada proveedor.

Ideal para: Comparar modelos con rapidez y acceder a un mercado amplio de proveedores
Lo más destacado: 500+ modelos, 80+ proveedores y Auto Router, que tiene en cuenta la tarea
Precio: Nivel gratuito por $0; Pay as you go aplica una comisión de plataforma del 5.5%; los descuentos Enterprise son personalizados
Prueba gratuita: Nivel gratuito con 25+ modelos, 4 proveedores y 50 solicitudes al día

La contrapartida comercial es explícita. El plan Pay as you go de OpenRouter no exige un gasto mínimo, pero aplica una comisión de plataforma del 5.5%. Al comprar $2,000 en créditos, esa comisión equivale a $110. Bring Your Own Key ofrece actualmente una asignación de $25,000 mensuales de inferencia a precio de lista antes de aplicar una comisión del 5%. Enterprise eleva esa asignación a $200,000 y ofrece descuentos de comisión mediante cotización.

El plan gratuito sirve para comprobar la compatibilidad, pero se queda corto para trabajar de forma sostenida con agentes. Cincuenta solicitudes al día pueden agotarse dentro de un ciclo de programación largo. Debe tratarse como una prueba de conexión, no como presupuesto de equipo.

Auto Router de OpenRouter es más interesante que el número bruto de modelos. La documentación actual de enrutamiento indica que clasifica los prompts en unas 30 clases de tareas —entre ellas, depuración de código y planificación multiagente de varios pasos— y después ordena los modelos según el gasto agregado de una ventana móvil de siete días. También considera las capacidades, el uso de herramientas, el costo, las restricciones de la cuenta y las opciones de fallback.

Esa señal del mercado facilita la experimentación, pero dificulta la reproducibilidad. El router puede elegir un modelo diferente en cada turno. La afinidad de sesión prefiere el modelo anterior cuando sigue entre los mejores candidatos, aunque un cambio de tarea todavía puede alterar la selección. Si un agente crea un parche durante varios turnos, cambiar de modelo a mitad de la sesión puede afectar la sintaxis de las herramientas, el estilo de razonamiento o la disciplina del resultado.

La solución no consiste en evitar el enrutamiento, sino en decidir dónde aporta valor el enrutamiento dinámico. Puede usarse para evaluación, clasificación de bajo riesgo o una tarea secundaria acotada. Para un parche crítico de una versión, conviene fijar un modelo aprobado y una política de proveedor, salvo que el equipo ya haya probado la continuidad entre modelos.

OpenRouter también ofrece enrutamiento basado en políticas y fallbacks entre proveedores. Es útil cuando varios servicios de inferencia ofrecen el mismo modelo. Aporta menos si el comprador necesita repartir cargos por repositorio, mantener el control en infraestructura propia o aplicar guardrails empresariales administrados. Requesty, LiteLLM y Portkey son más sólidos para cada una de esas necesidades.

Lo bueno
Lo que hace bien
9 points

  • El catálogo publicado más amplio de la selección, con 500+ modelos y 80+ proveedores
  • Una forma rápida de comparar modelos sin abrir cuentas separadas con cada proveedor
  • Auto Router emplea señales actuales de la tarea y del mercado
  • Fallbacks entre proveedores, controles de gasto y enrutamiento basado en políticas
  • Plan gratuito para comprobar la compatibilidad
  • La comisión del 5.5% de Pay as you go crece con el gasto
  • Las 50 solicitudes diarias del plan gratuito son insuficientes para ciclos sostenidos de agentes
  • El enrutamiento dinámico puede cambiar de modelo entre turnos
  • Menos configuración específica de agentes y atribución por repositorio que las dos primeras opciones

5. Portkey: la mejor capa de gobernanza administrada

Portkey es la mejor opción cuando el presupuesto busca un plano de control administrado, no solo un endpoint unificado. Su gateway combina fallbacks, enrutamiento condicional, reintentos, circuit breaker, balanceo de carga, pruebas canary, compatibilidad con MCP, presupuestos, límites de frecuencia, caché y guardrails.

Página de precios del gateway de IA Portkey
Portkey

El conjunto encaja con un equipo de plataforma mediano que pasa de claves individuales para agentes a un acceso aprobado. Una política puede limitar los modelos, un presupuesto puede acotar a un equipo y un circuit breaker puede frenar las llamadas repetidas a un proveedor con fallos. El producto está pensado para el momento en que «dar a los desarrolladores una clave del gateway» se convierte en un problema de identidad, políticas y gestión de incidentes.

Ideal para: Enrutamiento administrado, guardrails y gobernanza en un equipo de plataforma en crecimiento
Lo más destacado: Circuit breakers, pruebas canary, controles MCP, enrutamiento condicional y un gateway local de código abierto
Precio: Developer por $0, Production por $49/mes y Enterprise personalizado
Prueba gratuita: El plan Developer es gratuito para siempre, pero no se considera apto para producción de forma explícita

Los límites de los planes son inusualmente claros. El plan Developer de Portkey registra 10,000 logs al mes, conserva los logs durante tres días y las métricas durante 30 días. La propia página indica de forma explícita que no es adecuado para producción.

Production cuesta $49 al mes y registra 100,000 logs; después cobra $9 por cada 100,000 solicitudes adicionales, hasta el umbral publicado. Conserva los logs durante 30 días y las métricas durante 90 días. Con 200,000 logs registrados, la suscripción cuesta $58 antes de la inferencia del proveedor. La misma página señala que Production no se recomienda cuando hacen falta controles de seguridad personalizados o garantías de residencia de datos.

Enterprise es el nivel necesario para esos requisitos. Su precio es personalizado e incorpora más de 10 millones de logs registrados, retención personalizada, SSO, presupuestos y límites de frecuencia granulares, alojamiento en nube privada y VPC, exportación a data lakes y cumplimiento avanzado. El salto desde una tarjeta de $49 hasta un proceso de compras es considerable.

Portkey también publica un gateway local de código abierto que se ejecuta con npx @portkey-ai/gateway. Ofrece una forma de probar la superficie de enrutamiento o alojar la ruta de datos en infraestructura propia. Aun así, el comprador debe distinguir ese gateway local de la observabilidad, las políticas, el soporte y los controles Enterprise administrados que justifican la posición de Portkey en esta clasificación.

La transición actual del producto exige atención. La documentación de Portkey ya lo denomina Prisma AIRS AI Gateway. Las páginas del gateway y sus precios siguen activas, pero el comprador debería preguntar qué nombre aparecerá en el contrato, qué hoja de ruta se aplicará y cómo se integran las cuentas independientes de Portkey en la cartera de Palo Alto Networks. Es una comprobación propia del proceso de compra, no un motivo para descartar la herramienta.

El límite para los agentes de programación está en la configuración. Portkey puede funcionar detrás de protocolos de agentes compatibles y aporta un plano de control general más profundo que Vercel. Actualmente no ofrece una experiencia equivalente de un solo comando para nueve agentes. Hay que elegirlo cuando la política justifique el trabajo de integración, no porque su lista de funciones sea más larga.

Lo bueno
Lo que hace bien
10 points

  • Enrutamiento administrado completo, con circuit breakers, reintentos, fallbacks y pruebas canary
  • Compatibilidad con MCP, guardrails, presupuestos y límites de frecuencia
  • Nivel Production público de $49 con una unidad clara basada en logs registrados
  • Opción de gateway local de código abierto
  • Ruta Enterprise para SSO, despliegue privado, residencia y cumplimiento
  • El plan gratuito no se considera apto para producción de forma explícita
  • El nivel Production de $49 no es, expresamente, el indicado para controles de seguridad personalizados ni garantías de residencia
  • El precio de Enterprise es personalizado
  • La configuración de agentes de programación está menos resuelta que en Vercel
  • La transición a Prisma AIRS plantea preguntas sobre contratos y hoja de ruta

6. Cloudflare AI Gateway: el mejor para equipos que ya usan Workers

Cloudflare AI Gateway es la opción con menos fricción cuando Cloudflare ya gestiona el edge, los registros y la seguridad de la aplicación. Sus funciones principales de gateway son gratuitas en todos los planes, incluidas las de analítica, caché y limitación de frecuencia.

Documentación de precios de Cloudflare AI Gateway
Cloudflare AI Gateway

El producto resulta atractivo para un equipo cuyo agente o plataforma interna de desarrollo ya funciona sobre Workers. Desde la misma cuenta se puede llamar a modelos de terceros y alojados por Cloudflare mediante una interfaz REST compatible con OpenAI, registrar costos y errores, almacenar en caché las solicitudes repetidas que sea seguro reutilizar, aplicar límites de frecuencia, detectar datos sensibles y volver a intentar las llamadas fallidas.

Ideal para: Equipos que ya utilizan Workers, los registros de Cloudflare o sus controles de seguridad
Lo más destacado: Gateway básico gratuito, integración con el edge, DLP, caché y acceso compatible con OpenAI a modelos de terceros
Precio: Funciones básicas por $0; las compras de créditos mediante Unified Billing añaden un 5%; los guardrails usan las tarifas de Workers AI
Prueba gratuita: Las funciones básicas del gateway son gratuitas, no una prueba con fecha de vencimiento

La página de precios establece un límite concreto para la oferta gratuita. Workers Free almacena 100,000 logs en total entre todos los gateways. Workers Paid almacena 10 millones de logs por gateway. Los logs persistentes, la analítica, la caché y la limitación de frecuencia están disponibles en todos los planes.

Unified Billing añade una comisión del 5% cuando los créditos se compran mediante Cloudflare. Por tanto, una compra de $2,000 en créditos cuesta $2,100, mientras la inferencia del proveedor se sigue trasladando sin recargo. La diferencia importa: el precio del modelo no cambia, pero la consolidación de credenciales y facturación sí tiene una comisión.

El análisis de Data Loss Prevention es gratuito en todos los planes. Las cuentas sin suscripción a Zero Trust reciben dos perfiles DLP predefinidos; el acceso a más perfiles depende de la suscripción a Cloudflare One. Los guardrails no forman parte de las funciones básicas gratuitas: Cloudflare factura la evaluación de prompts y respuestas como inferencia de tokens de Workers AI.

Cloudflare también ofrece controles útiles por solicitud. Su documentación REST admite timeouts por solicitud, métodos de reintento, hasta cinco intentos y un retraso entre reintentos de hasta 5,000 milisegundos. Estos controles evitan que un proveedor lento bloquee indefinidamente el ciclo de un agente.

El límite está en la experiencia de configuración de los agentes. Cloudflare explica cómo llaman las aplicaciones al gateway, pero no ofrece la misma capa de configuración para agentes concretos que Vercel ni el flujo de Claude Code de Requesty. El responsable de la implementación debe confirmar cómo cambia cada agente su URL base, autenticación, descubrimiento de modelos y protocolo. El software puede costar $0 mientras el trabajo de integración recae en el equipo de ingeniería.

Lo bueno
Lo que hace bien
10 points

  • Analítica, caché y limitación de frecuencia básicas gratuitas
  • Acceso compatible con OpenAI a modelos de Cloudflare y de terceros
  • Análisis DLP gratuito en todos los planes
  • Encaja especialmente bien con Workers, los registros de Cloudflare y sus productos de seguridad
  • Controles explícitos de reintentos y timeouts
  • Unified Billing añade un 5% a las compras de créditos
  • El almacenamiento gratuito de logs termina en 100,000 para toda la cuenta
  • Los guardrails generan cargos separados por inferencia de Workers AI
  • No existe una configuración comparable de agentes mediante un solo comando
  • Todos los perfiles DLP pueden exigir una suscripción separada a Zero Trust

¿Qué gateway para agentes de IA conviene a cada equipo?

El mejor gateway es el que elimina el costo de coordinación que hoy soporta el equipo sin crear una carga operativa mayor. Empiece por la restricción que no se puede negociar y compare después las comisiones.

Elija Vercel AI Gateway para un grupo diverso que utilice Claude Code, Codex, Cursor, OpenCode y agentes similares. La decisión cambia si el alojamiento propio es obligatorio o si el costo debe atribuirse al repositorio y al desarrollador, no solo al agente, la clave y el modelo.

Elija Requesty para una agencia, consultora u organización de producto que necesite atribución por rama, repositorio y desarrollador. La decisión cambia si esos metadatos no modificarán ninguna decisión presupuestaria, porque entonces el recargo del 5% compra información que nadie utiliza.

Elija LiteLLM para un equipo de plataforma que ya cuente con prácticas maduras para contenedores, bases de datos, secretos, registros y guardias. La decisión cambia a un gateway administrado cuando un ingeniero de producto acabaría a cargo del proxy de manera informal.

Elija OpenRouter mientras un desarrollador independiente o un equipo de investigación siga comparando modelos y proveedores. La decisión cambia cuando la lista se estabiliza y la comisión recurrente del 5.5% supera el valor de acceder a un catálogo amplio.

Elija Portkey cuando los modelos aprobados, los guardrails, los circuit breakers, las pruebas canary y la gobernanza administrada constituyan el motivo de compra. La decisión cambia cuando la organización solo necesita un endpoint y un panel de gasto.

Elija Cloudflare AI Gateway cuando Workers y la seguridad de Cloudflare ya estén pagados y el equipo sepa operarlos. La decisión cambia si adoptar la plataforma circundante genera más trabajo de integración del que elimina el gateway.

Árbol de decisión que relaciona los requisitos de agentes de programación con seis gateways de IA
Empiece por la restricción innegociable y compare después las comisiones del gateway

Hay una regla adicional: la decisión del gateway debe mantenerse separada de la elección del agente. Claude Code, Codex y Cursor resuelven tareas de ingeniería diferentes, mientras el gateway controla el tráfico de sus modelos. Una empresa puede estandarizar el gateway sin imponer el mismo editor a todos. A menudo, ese es el límite de control más útil.

Para ampliar la selección, consulte la comparativa de los mejores agentes de programación con IA. Para profundizar en SSO, retención, auditoría y despliegue más allá del gateway, utilice la comparativa empresarial de agentes de programación.

Qué conviene evitar para este caso

Evite comprar Helicone como solución principal si el problema inmediato es configurar los agentes de programación. El nivel Hobby de Helicone es gratuito para 10,000 solicitudes, Pro cuesta $79 al mes y Team cuesta $799 al mes. Sus funciones de observabilidad, sesiones, prompts y análisis pueden aportar valor. Solo entraría en la clasificación si la visibilidad fuera el problema central. Para esta búsqueda, no supera la configuración actual de Vercel, la atribución por repositorio de Requesty ni el control de despliegue de LiteLLM.

Evite elegir un gateway de API genérico solo porque la empresa ya dispone de él. Los gateways tradicionales entienden rutas, autenticación y políticas HTTP. El tráfico de los agentes añade modelos específicos de cada proveedor, contabilidad de tokens, compatibilidad con el uso de herramientas, caché de prompts, fallbacks de modelos y varios protocolos de respuesta. Extender un gateway general puede tener sentido para un equipo de plataforma, pero «ya tenemos Kong» no es un plan de implementación.

Evite un proxy de paso desarrollado internamente cuando varios agentes ya dependan de él. Cambiar una URL base es sencillo. Mantener adaptadores de proveedores, reintentos seguros, respuestas en streaming, contadores de presupuesto, aislamiento de claves, retención de logs y modelos que dejan de estar disponibles constituye un producto completo. Solo vale la pena construirlo cuando una política o una restricción de despliegue singular justifique asumir esa responsabilidad de forma permanente.

Evite el enrutamiento dinámico en todos los pasos del ciclo de un agente que trabaja sobre una versión crítica hasta haber evaluado la continuidad entre modelos. Un router puede elegir un modelo eficiente para cada tarea y, aun así, dificultar la reproducción de un parche largo. Fije el modelo en los pasos que generan cambios y reserve el enrutamiento dinámico para tareas de apoyo acotadas.

Por último, evite redirigir a todos los desarrolladores desde el primer día. Un gateway puede modificar la autenticación, el descubrimiento de modelos, la caché, el comportamiento de los errores y la selección de fallbacks sin cambiar la apariencia de la interfaz del agente. Por eso, el despliegue debe incluir un piloto acotado y una ruta de vuelta al proveedor directo.

Preguntas frecuentes

¿Cuál es el mejor gateway LLM?

Vercel AI Gateway es la mejor opción predeterminada para agentes de programación porque combina la configuración de nueve agentes mediante un solo comando con cero recargo por tokens. LiteLLM es mejor cuando el alojamiento propio es obligatorio, Requesty cuando la atribución por repositorio y desarrollador es prioritaria, y Portkey cuando la gobernanza administrada justifica la compra.

¿Cuáles son los precios y las comisiones de OpenRouter en 2026?

El plan Pay as you go vigente de OpenRouter cobra una comisión de plataforma del 5.5%, incluye 500+ modelos y 80+ proveedores, y no exige un gasto mínimo. El nivel gratuito se limita a 25+ modelos, 4 proveedores y 50 solicitudes al día. Su asignación BYOK actual en Pay as you go cubre $25,000 mensuales de inferencia a precio de lista antes de aplicar una comisión del 5%.

¿Cuánto cuesta Cloudflare AI Gateway en 2026?

Las funciones principales de Cloudflare AI Gateway son gratuitas. Las compras de créditos mediante Unified Billing añaden un 5%, Workers Free almacena 100,000 logs para toda la cuenta, Workers Paid almacena 10 millones de logs por gateway y los guardrails se facturan aparte como inferencia de Workers AI.

¿Un solo gateway puede enrutar Claude Code y Codex?

Sí. El gateway debe ser compatible con los protocolos que espera cada agente o proporcionar endpoints específicos de compatibilidad. Vercel documenta endpoints distintos para Claude Code y Codex; con gateways generales o alojados en infraestructura propia, el comprador debe validar la configuración de cada agente.

El plan para empezar el lunes

El lunes no debe dedicarse a migrar toda la empresa. La meta es demostrar que un gateway puede reducir la ambigüedad de costos y el riesgo del proveedor en un repositorio representativo.

Lunes: defina el límite de control

Elija un repositorio, un grupo pequeño de desarrolladores y los dos agentes de programación que ya utilizan. Resuma en una frase el motivo financiado: consolidar la facturación, rescatar fallos del proveedor, atribuir el gasto, imponer modelos aprobados o mantener el tráfico en un despliegue privado. Si la frase mezcla tres objetivos distintos, acote el piloto.

Cree una clave específica del gateway con un límite de gasto estricto. Elija un modelo principal y un fallback con un soporte comparable para herramientas. Conserve la configuración del proveedor directo en un archivo de reversión y anote la factura actual del proveedor antes de desviar el tráfico.

Martes: conecte el gateway y revise el diff

Con Vercel, ejecute el comando documentado y revise cada cambio antes de que se escriba. Con Requesty, cree una copia de seguridad de los ajustes de Claude Code y active solo las cabeceras de atribución que el equipo vaya a utilizar. Con LiteLLM, despliegue el proxy mediante el proceso habitual de infraestructura, no desde una computadora portátil. En todos los casos, confirme que los secretos queden en el almacén aprobado.

Ejecute una tarea acotada desde cada agente. Compruebe la selección del modelo, las llamadas a herramientas, el streaming, los errores, el comportamiento de la caché, el costo y la identidad asociada a la solicitud. Obtener una respuesta correcta no basta si el panel no puede explicar quién gastó el dinero o qué fallback respondió.

Miércoles y jueves: fuerce la ruta de fallo

Provoque un timeout controlado o use una ruta de prueba que envíe el modelo principal a un proveedor no disponible. Confirme que el fallback conserva el formato de comunicación que espera el agente. Compruebe si se factura el intento fallido, si el fallback emplea una credencial distinta y si la traza identifica ambos intentos.

Asigne al piloto una corrección rutinaria, un cambio en varios archivos, un ciclo de reparación de pruebas y una tarea de revisión. Registre el costo por tarea terminada, los fallos de proveedor, las solicitudes rescatadas, el tiempo dedicado a modificar la configuración y la fricción percibida por los desarrolladores. No compare cantidades de prompts sin tener en cuenta el resultado del trabajo.

Viernes: compre el control que haya cambiado una decisión

Adopte el gateway solo si su información o su fiabilidad cambia una decisión operativa. Una solicitud rescatada importa. Un repositorio que excede su presupuesto importa. Una infracción de la política de proveedores importa. Un panel lleno de gráficas de tokens que ningún responsable revisa no importa.

Para la mayoría de los equipos con varios agentes, la elección del lunes es Vercel AI Gateway con una clave piloto, un modelo principal, un fallback y ningún complemento de pago hasta que una política lo exija. La elección pasa a ser Requesty cuando la responsabilidad del gasto debe llegar al repositorio y al desarrollador. Pasa a ser LiteLLM cuando la ruta de datos debe permanecer dentro de la infraestructura de la empresa.

Mantenga la configuración del gateway bajo control de versiones, documente la ruta de reversión y limite la política de modelos. El objetivo no es enrutar a través de más proveedores, sino conseguir que la próxima caída de un proveedor, el siguiente lanzamiento de un modelo y la próxima revisión presupuestaria se resuelvan con un cambio de configuración en vez de una migración de toda la empresa.

Última actualización

3 sept 2026

CategoríaBuild

Prefiera este sitio en Google

Añadir omidsaffari.com como fuente preferida en la Búsqueda de Google

Marque omidsaffari.com como fuente preferida y Google lo destacará para usted en Top Stories, AI Overviews y AI Mode.

Newsletter

Una carta, cada domingo. Sistemas que funcionan, no opiniones calientes.

Build logs, sistemas en producción y notas de campo de un portafolio de ventures de IA.

Semanal. Sin spam. Cancele cuando quiera.