LLM gateway: os 10 melhores para apps multimodelo em 2026
Compare 10 opções de LLM gateway para apps multimodelo, com preços, limites, governança e um plano de saída que evita refazer toda a arquitetura.

LiteLLM é o melhor LLM gateway no geral para um app multimodelo quando há uma pessoa responsável pela plataforma para operá-lo; Vercel AI Gateway é a melhor opção gerenciada por padrão. O acordo noticiado de mais de $8 bilhões para a Stripe adquirir a OpenRouter deixa claro o requisito decisivo: seu app em produção precisa conseguir contornar o gateway sem uma reescrita.
A Axios noticiou em 17 de agosto de 2026 que a Stripe havia concordado em adquirir a OpenRouter por mais de $8 bilhões em dinheiro e ações. A Axios também afirmou que as empresas não tinham se pronunciado e que ainda se esperava um anúncio oficial. Essa diferença importa, mas a lição operacional independe da conclusão do negócio: um gateway só elimina a dependência de um fornecedor de modelos se não virar a próxima dependência.
Resposta direta: qual LLM gateway escolher?
Escolha LiteLLM para ter controle, Vercel AI Gateway pela simplicidade gerenciada, Portkey para governança empresarial e OpenRouter apenas quando a amplitude do catálogo compensar uma tarifa percentual e mais uma dependência de fornecedor. Um gateway de IA é a camada de requisições entre a aplicação e os provedores de modelos. Ele pode padronizar APIs, armazenar credenciais, rotear tráfego, repetir chamadas com falha, registrar custos e aplicar políticas.
Os preços e limites de produto abaixo foram conferidos nas páginas ao vivo de cada fornecedor em 18 de agosto de 2026. O ranking abrange 10 produtos e avalia cada opção pelo obstáculo que o comprador encontrará em produção, não pela quantidade de recursos que cabe em um card.
A primeira decisão não é sobre quantidade de recursos. É sobre quem controla o caminho das requisições. Um gateway auto-hospedado mantém processo, credenciais, banco de dados, logs e políticas no seu ambiente, mas também coloca o plantão nas mãos da sua equipe. Um gateway gerenciado elimina essa carga operacional, porém cada chamada de modelo passa a depender das indisponibilidades, mudanças de preço, aquisições e prioridades de produto desse serviço.
O ponto de equilíbrio de custo é mais simples do que as páginas de recursos sugerem. Considere que um gateway auto-hospedado consuma oito horas mensais da equipe de plataforma, a um custo completo de $150 por hora. Isso representa um custo operacional ilustrativo de $1,200 por mês, não uma cotação de fornecedor. Uma tarifa de 5.5% chega a $1,200 com $21,818 de gasto mensal em modelos; uma tarifa de 5% atinge o mesmo valor com $24,000.

Esse cálculo cobre apenas a linha do orçamento. Limites de implantação, um caminho para dados regulados, contratos com provedores ou uma trilha de auditoria obrigatória podem justificar a auto-hospedagem muito antes do equilíbrio financeiro. Por outro lado, uma startup pequena não deveria criar uma função interna de plataforma para economizar menos do que custa um dia de engenharia.
Por que o gateway virou uma linha do orçamento e um plano de saída
Um gateway tem valor porque os modelos mudam rápido, mas se torna perigoso quando a aplicação já não consegue funcionar sem ele. A notícia sobre a OpenRouter chega menos de três meses depois de a Palo Alto Networks concluir a aquisição da Portkey e informar que a Portkey passaria a ser parte central do Prisma AIRS. Em um único trimestre, dois planos de controle independentes podem migrar para plataformas maiores. Compradores devem encarar mudanças de controle como algo esperado nessa categoria, não como exceção.
A consequência para o negócio é a concentração. Um app multimodelo pode chamar a OpenAI em um fluxo, a Anthropic em outro e um modelo aberto em uma tarefa de alto volume em segundo plano. Colocar os três atrás de um único gateway simplifica código, cobrança, políticas e observabilidade. Também faz com que uma única mudança de preço ou política afete os três ao mesmo tempo.
O padrão seguro tem três camadas:
- Um cliente interno de modelos define o conjunto reduzido de operações de que o app precisa, como geração de texto, saída estruturada, embeddings e uso de ferramentas.
- Um adaptador para o gateway converte essas operações para o gateway escolhido sem espalhar cabeçalhos específicos dele pelo restante do código.
- Um adaptador direto para o provedor continua configurado e documentado, mesmo que normalmente não receba tráfego de produção.
Essa estrutura cria o que este guia chama de saída em 10 minutos: uma pessoa de operações deve conseguir desviar uma carga de produção do gateway por configuração e um deploy controlado, sem alterar a lógica de negócio. Dez minutos são uma meta operacional editorial, não um SLA de fornecedor. Se contornar o gateway exigir reescrever o cliente, redesenhar a identidade ou migrar todos os nomes de modelo, o gateway controla uma fatia maior da aplicação do que os próprios provedores.
É também por isso que recursos como fallback automático merecem atenção. O fallback só ajuda quando preserva o protocolo de resposta, o esquema das ferramentas, a política de dados e o limite de custo esperados pela aplicação. Uma resposta HTTP bem-sucedida de outro modelo ainda pode representar uma falha do app se a saída estruturada mudar ou se a chamada de ferramenta for incompatível.
Para entender melhor a camada de inferência abaixo do gateway, a comparação das APIs de IA mais baratas separa o preço do modelo da tarifa de roteamento. Se o caso de uso imediato envolve ferramentas para desenvolvedores, e não uma aplicação voltada ao cliente, o guia mais específico sobre gateways de IA para agentes de programação aborda a configuração desses agentes e a atribuição por repositório.
Como estes gateways de IA foram selecionados
O ranking prioriza reversibilidade e adequação operacional antes da quantidade de modelos. Um catálogo com centenas de modelos é útil na fase de descoberta e perde importância quando uma aplicação em produção padroniza três rotas aprovadas.
Cada gateway foi avaliado segundo cinco critérios:
- Portabilidade: o app consegue preservar suas próprias contas de provedor, nomes de modelo, políticas e rota direta?
- Resiliência determinística: a equipe de operações consegue controlar novas tentativas, ordem dos provedores, comportamento de fallback e condições que interrompem uma requisição?
- Visibilidade de custos: é possível atribuir o gasto a uma aplicação, cliente, equipe ou chave e prever a tarifa com base no preço público?
- Limite de governança: o gateway atende às exigências de implantação, identidade, retenção, auditoria e residência de dados do comprador?
- Maturidade operacional: o gateway está disponível em geral, oferece suporte e observabilidade e tem preço compatível com a etapa em que será usado?
O trabalho aqui consistiu em verificar preços e documentação, não em disfarçar um teste de produto. Não há alegação de implantação real, teste de carga ou assinatura. Cada plano, limite e recurso específico vem de uma página de fornecedor acessada em 18 de agosto de 2026; as comparações de custo são operações aritméticas aplicadas a esses dados.
A lista foi reduzida aos produtos que hoje podem ocupar o caminho das requisições de um app multimodelo. O catálogo de modelos de uma única nuvem ainda pode ser a plataforma certa, mas não oferece roteamento neutro. Um produto que existe apenas no roadmap não pode ficar acima de um gateway que o comprador já consegue implantar e precificar.
1. LiteLLM: melhor opção geral com controle do próprio app
LiteLLM é o melhor gateway de IA no geral quando existe uma pessoa claramente responsável pela plataforma para operá-lo. O proxy open source reúne 100+ provedores em uma API compatível com OpenAI e inclui chaves virtuais, equipes, acompanhamento de gastos, orçamentos, limites de requisições, fallbacks, logs de requisição e resposta e métricas do Prometheus.

Melhor para: empresas de produto que precisam de um gateway auto-hospedado e sob controle do app
Destaque: amplo suporte a provedores, com orçamentos, chaves, fallbacks e métricas no plano OSS de $0
Preço: Open Source a $0; Enterprise anual e personalizado conforme capacidade, arquitetura e suporte
Teste grátis: 30 dias de Enterprise sem cartão de crédito; o OSS continua grátis
O LiteLLM deixa explícito em sua página de preços ao vivo o limite do software. O Open Source é gratuito para auto-hospedagem em produção. O Enterprise não é cobrado por token; o valor anual depende da capacidade de requisições, da arquitetura de implantação e das necessidades de suporte. O Enterprise acrescenta SSO e SCIM, autenticação OIDC ou JWT, logs de auditoria, integrações com gerenciadores de segredos, rotação de chaves, plano de controle multirregional, implantação isolada e suporte até 24/7.
O rótulo de $0 é correto, mas incompleto. Sua equipe passa a responder pelo proxy, Postgres, segredos, escalabilidade, atualizações, mudanças nas APIs dos provedores, armazenamento de logs, painéis e incidentes. Sob a premissa ilustrativa de oito horas a $150, essa responsabilidade custa $1,200 por mês antes da infraestrutura. O LiteLLM vence financeiramente uma tarifa de 5.5% acima de $21,818 em gasto mensal com modelos, mas uma implantação regulada pode escolhê-lo muito antes por controle, não por economia.
O guia rápido oficial com Docker inicia o gateway e o Postgres com curl -sSL https://docs.litellm.ai/docker-compose.yml | docker compose -f - up -d e expõe a interface administrativa na porta 4000. É um caminho útil para avaliação, não um projeto completo de produção. O mesmo guia alerta que o valor provisório de LITELLM_SALT_KEY deve ser substituído antes de adicionar credenciais persistentes e nunca mais alterado, pois uma chave nova não consegue recuperar credenciais de provedor criptografadas com a anterior.
O obstáculo em produção é a falta de clareza sobre quem é responsável. LiteLLM é um excelente componente de plataforma e um péssimo projeto paralelo. Se o proxy pertencer a “quem quer que o tenha adicionado”, uma mudança de provedor pode transformar uma pessoa da engenharia de aplicação na equipe do gateway, sem orçamento, plantão nem política de atualização.
Comece com uma implantação descartável
Use o guia rápido oficial com Docker Compose em uma conta que não seja de produção. Confirme a inicialização do gateway e do Postgres, substitua os segredos provisórios e mantenha esse ambiente separado do tráfego de clientes.
Exponha duas rotas nomeadas
Adicione apenas o modelo principal e um fallback compatível. Use aliases internos estáveis, como
support-primaryesupport-fallback, para que o código da aplicação não dependa do nome público de modelo de cada provedor.Emita uma chave virtual para a aplicação
Crie uma chave virtual para um serviço, com acesso próprio a modelos, orçamento mensal e limite de requisições. Não distribua a chave mestra do LiteLLM para as cargas da aplicação.
Mantenha um adaptador direto
Configure o mesmo serviço para chamar diretamente o provedor principal por uma feature flag. A rota pelo gateway fica como padrão; a rota pelo provedor é o desvio já testado.
Force uma falha no modelo principal
Acione de forma controlada uma rota indisponível, confirme que o fallback aparece nos logs, ative o adaptador direto e cronometre a troca. Se o desvio não cumprir a meta de saída em 10 minutos, corrija a abstração antes de adicionar tráfego.
- Licença OSS de produção a $0, sem tarifa de gateway por token
- 100+ provedores por uma única API compatível com OpenAI
- Chaves virtuais, orçamentos por equipe, limites de requisições, fallbacks, logs e Prometheus no OSS
- Caminho de dados auto-hospedado, com opções Enterprise isoladas e multirregionais
- Preço Enterprise dimensionado pela capacidade, não pelo gasto com modelos
- O comprador responde por disponibilidade, atualizações, saúde do banco de dados, segredos e incidentes
- O preço Enterprise não é público
- A facilidade do guia rápido pode esconder o trabalho de preparação para produção
- Um proxy compartilhado cria um novo domínio interno de falha
2. Vercel AI Gateway: melhor opção gerenciada por padrão
Vercel AI Gateway é a melhor escolha gerenciada por padrão para uma equipe de produto que quer um único endpoint sem acréscimo sobre tokens. Seus controles de roteamento abrangem filtragem e ordenação de provedores, fallbacks de modelos e seleção de provedor orientada pela disponibilidade e latência recentes.

Melhor para: startups e equipes de produto que valorizam uma adoção gerenciada rápida
Destaque: tokens cobrados pelo preço de tabela do provedor, sem acréscimo do gateway
Preço: Free inclui crédito mensal de $5; Paid usa créditos comprados conforme o preço de tabela do provedor
Teste grátis: plano Free contínuo nos modelos elegíveis, com limites menores por modelo
A página de preços atual separa com clareza as modalidades gratuita e paga. O Free inclui $5 em créditos por mês. Ao comprar créditos, a conta passa para Pay as you go, libera todos os modelos disponíveis, eleva os limites e perde o crédito mensal de $5. Os dois planos usam os preços de tabela dos provedores, sem acréscimo sobre tokens.
Bring Your Own Key só fica disponível quando a conta migra para Paid. A Vercel não cobra tarifa de gateway no BYOK, mas uma requisição que falhar com sua credencial pode ser repetida com credenciais de sistema da Vercel e cobrar esse fallback do saldo de créditos do gateway. Esse comportamento aumenta a disponibilidade, porém pode contrariar a premissa financeira de que todo o uso ficará em um contrato já existente com o provedor. Revise-o antes de tratar BYOK como um atalho de compras.
A camada de tokens não tem acréscimo; alguns controles têm cobrança. Custom Reporting custa $0.075 por 1,000 gravações e $5 por 1,000 consultas de relatório. Uma allowlist de provedores para toda a equipe custa $0.10 por 1,000 requisições bem-sucedidas, enquanto um filtro only por requisição não tem custo adicional. A retenção zero de dados para toda a equipe também custa $0.10 por 1,000 requisições. Trace drains custam $0.05 por 1,000 traces, mais $0.50 por GB de saída de dados.
Com um milhão de requisições, habilitar a allowlist para toda a equipe, ZDR para toda a equipe e um trace por requisição adiciona $250 mais a saída dos traces. O valor ainda é modesto diante do gasto com modelos para muitos apps, mas “zero acréscimo” não significa “todos os controles são grátis”.
O obstáculo é o controle da implantação. A Vercel gerencia o gateway; você não executa o plano de dados dele no próprio cluster. Escolha essa opção quando o limite gerenciado for aceitável e a velocidade operacional tiver peso. Prefira LiteLLM ou Bifrost quando a implantação privada for uma exigência, não uma preferência.
- Zero acréscimo sobre tokens no uso Free, Paid e BYOK
- Crédito Free mensal de $5 para um piloto limitado
- Ordenação e filtragem de provedores, fallbacks e acesso gerenciado a modelos
- Nenhum gateway ou banco de dados para operar
- Controles de provedor e ZDR por requisição podem evitar sobretaxas para toda a equipe
- Não há processo de gateway auto-hospedado
- BYOK exige créditos comprados
- Chamadas BYOK que falham podem recorrer a credenciais cobradas da Vercel
- Relatórios, políticas para toda a equipe e trace drains têm cobranças separadas
3. Portkey: melhor para governança empresarial gerenciada
Portkey é a melhor opção gerenciada quando políticas, guardrails, orçamentos e alternativas de implantação privada justificam a compra. O gateway combina uma API universal com novas tentativas, timeouts, fallbacks, balanceamento de carga, cache, chaves virtuais e observabilidade.

Melhor para: empresas de médio porte e grandes organizações que buscam governança gerenciada
Destaque: plano público de produção e caminho Enterprise para hospedagem em nuvem privada e VPC
Preço: Open Source auto-hospedado; Developer a $0; Production a $49/mês; Enterprise sob consulta
Teste grátis: Developer é grátis para sempre em protótipos e avaliações
A página de preços é especialmente clara sobre a fronteira entre os planos. Developer registra 10,000 logs por mês, retém os logs por três dias e as métricas por 30 dias, além de declarar que o plano não é indicado para produção. Production custa $49 por mês, inclui 100,000 logs registrados, cobra $9 por cada bloco adicional de 100,000 até três milhões, retém logs por 30 dias e métricas por 90 dias.
Com um milhão de logs registrados, o Production custa $130 por mês: a base de $49 mais nove blocos excedentes de $9. Continua sendo um preço acessível para um app em crescimento. A mesma página diz que Production não é recomendado quando há necessidade de controles de segurança personalizados ou garantias de residência de dados. Esses compradores passam ao Enterprise, com 10 milhões ou mais de logs registrados, retenção personalizada, SSO, orçamentos e limites granulares, nuvem privada, hospedagem em VPC, exportações para data lake e conformidade avançada.
O obstáculo do produto não está nos recursos, mas no escopo da compra. Uma startup que precisa apenas de uma URL base e um fallback extrai menos valor organizacional do que a Portkey foi criada para entregar. Já uma equipe de plataforma com várias aplicações, política de modelos aprovados, controles de PII e exigências de auditoria pode usar os mesmos recursos toda semana.
A estrutura societária merece entrar nas perguntas de compras. A Palo Alto Networks concluiu a aquisição da Portkey em 29 de maio de 2026 e disse que a Portkey se tornaria um AI Gateway central do Prisma AIRS. Isso pode reforçar a integração de segurança e o suporte empresarial, mas também pode mudar o empacotamento e as prioridades do roadmap. Pergunte qual nome de produto aparecerá no contrato, como as contas independentes serão vinculadas ao Prisma AIRS e qual caminho de exportação sobreviverá a uma futura consolidação.
- Caminhos Open Source, Developer grátis, Production público a $49 e Enterprise privado
- Fallbacks, novas tentativas, timeouts, balanceamento de carga, cache, chaves e observabilidade
- Limites claros de logs e retenção nos planos self-service
- Alternativas Enterprise de implantação e conformidade
- Exemplo previsível de $130 para um milhão de logs registrados
- Developer é explicitamente um plano que não serve para produção
- Production não é o plano certo para segurança personalizada ou garantias de residência
- O preço Enterprise exige uma cotação
- A integração após a aquisição traz dúvidas sobre empacotamento e roadmap
4. Cloudflare AI Gateway: melhor controle de borda com baixo custo
Cloudflare AI Gateway é a melhor opção de baixo custo quando a Cloudflare já cuida da borda, da segurança ou do runtime Workers da aplicação. Análises, cache e limitação de requisições no núcleo do serviço são grátis em todos os planos.

Melhor para: apps que já usam a rede e os controles de segurança da Cloudflare
Destaque: gateway central a $0, com análise DLP grátis
Preço: núcleo a $0; compras de créditos pelo Unified Billing adicionam 5%; guardrails seguem os preços do Workers AI
Teste grátis: os recursos centrais continuam gratuitos, sem expirar
A documentação de preços ao vivo da Cloudflare define limites concretos de armazenamento para a oferta grátis. O Workers Free armazena 100,000 logs somando todos os gateways da conta. O Workers Paid guarda 10 milhões de logs por gateway. A análise DLP é gratuita, embora uma conta sem assinatura Zero Trust receba apenas dois perfis DLP predefinidos. A avaliação de guardrails é cobrada separadamente como inferência de tokens do Workers AI.
O Unified Billing cobra 5% na compra de créditos, enquanto os preços de inferência de terceiros são repassados sem acréscimo sobre tokens. Com $20,000 em créditos comprados por mês, a tarifa é de $1,000. A cobrança de 5% se aplica aos créditos adquiridos pelo Unified Billing, não ao gateway central de $0.
Há um limite de vazão que precisa ser identificado antes do lançamento. A página de limites atual restringe o tráfego do Unified Billing a 200 requisições a cada 60 segundos por gateway e responde com 429 acima dessa taxa. Esse limite não se aplica ao tráfego BYOK. A Cloudflare também restringe os logs armazenados a 500 por segundo por gateway, as requisições armazenáveis em cache a 25 MB, o TTL do cache a um mês e os metadados personalizados a cinco entradas por requisição.
O obstáculo é a compatibilidade com a plataforma ao redor. A Cloudflare é atraente para uma equipe que já domina seu modelo de contas, logs, DLP, Workers e comportamento de borda. A vantagem diminui se for preciso adotar todos esses conceitos só para evitar uma assinatura de gateway de $49. O gateway com o menor preço anunciado pode gerar a maior conta de integração.
- Análises, cache e limitação de requisições no núcleo a $0
- Análise DLP grátis em todos os planos
- Ótima opção para operações que já usam a borda e a segurança da Cloudflare
- Ampla franquia de logs no plano pago
- BYOK evita o limite de taxa de requisições do Unified Billing
- O Unified Billing adiciona 5% às compras de crédito
- O Unified Billing está limitado a 200 requisições a cada 60 segundos por gateway
- A conta Free para de armazenar após 100,000 logs
- Guardrails e perfis DLP mais amplos podem criar custos em produtos adjacentes
5. OpenRouter: melhor marketplace de modelos, mas não a rota única mais segura
OpenRouter é o melhor gateway enquanto a amplitude de modelos e provedores ainda for a principal dúvida. O plano Pay as you go reúne 400+ modelos de 80+ provedores em uma única conta.

Melhor para: descoberta rápida de modelos, comparação de provedores e acesso a um catálogo amplo
Destaque: roteamento granular de provedores por preço, vazão, latência, política e disponibilidade
Preço: Free a $0; Pay as you go com tarifa de plataforma de 5.5%; Enterprise personalizado com descontos
Teste grátis: plano Free com 25+ modelos, 4 provedores e 50 requisições por dia
A página de preços ao vivo apresenta três planos. Free dá acesso a 25+ modelos gratuitos de quatro provedores, com 50 requisições por dia. Pay as you go adiciona 400+ modelos, 80+ provedores, limites globais altos e nenhum gasto mínimo, com tarifa de plataforma de 5.5%. Enterprise mantém o catálogo e acrescenta descontos na tarifa, faturamento, SSO ou SAML, SLAs contratuais e SLA de suporte com um canal compartilhado no Slack.
O BYOK muda a fronteira das tarifas. Pay as you go inclui $25,000 de inferência a preço de tabela por mês sem tarifa de BYOK e passa a cobrar 5% depois disso. Enterprise eleva a franquia para $200,000 e então cobra 5%. Quem já tem compromissos diretos com provedores deve calcular a franquia BYOK separadamente dos créditos comprados da OpenRouter.
A profundidade do roteamento é o ponto forte da OpenRouter. A documentação de seleção de provedores informa que o padrão evita provedores com indisponibilidade significativa nos 30 segundos anteriores, pondera os provedores estáveis de baixo custo pelo inverso do quadrado do preço e deixa os demais como fallback. A equipe também pode ordenar por preço, vazão ou latência; definir uma sequência de provedores; desativar fallbacks; exigir suporte a parâmetros; bloquear provedores que coletam dados; exigir endpoints com retenção zero de dados; ou limitar o preço.
Esses controles podem melhorar tanto a disponibilidade quanto a economia. Também transformam o comportamento padrão em parte do contrato de produção. Se a aplicação exige saída estruturada ou uso de ferramentas, configure require_parameters e uma allowlist em vez de presumir que todos os endpoints sob um slug de modelo se comportam da mesma forma.
Com $20,000 em créditos comprados, 5.5% corresponde a $1,100 por mês. O valor ainda fica abaixo do custo ilustrativo de $1,200 por mês para auto-hospedagem. A porcentagem continua crescendo mesmo quando o esforço operacional de um gateway auto-hospedado estável pode se estabilizar; por isso, refaça a comparação quando o gasto ultrapassar $21,818.
O acordo noticiado com a Stripe aumenta o custo da dependência, não cria motivo para uma migração às pressas. OpenRouter continua sendo o marketplace mais amplo deste ranking. A resposta prudente é manter um adaptador direto para o provedor, exportar a política e testar o desvio. A análise completa dos preços da OpenRouter aprofunda os limites de tarifas e BYOK.
- 400+ modelos e 80+ provedores nos planos pagos
- Controles sofisticados de ordenação, classificação, política e fallback de provedores
- Nenhum gasto mínimo no Pay as you go
- Franquias BYOK úteis antes do início da tarifa de 5%
- Caminho mais rápido para manter aberta a descoberta de modelos
- A tarifa de 5.5% sobre créditos comprados cresce junto com o gasto
- As 50 requisições diárias do plano Free não formam uma franquia de produção
- As configurações padrão podem rotear entre provedores sem uma política explícita
- A mudança de controle noticiada aumenta o trabalho de contingência de fornecedor
6. Bifrost: melhor alternativa OSS para controlar novas tentativas
Bifrost é a melhor alternativa open source para equipes que querem regras explícitas de novas tentativas, OpenTelemetry e um gateway mais enxuto. O plano OSS é grátis para sempre e pode rodar em Docker, como carga no Kubernetes ou como binário Go.

Melhor para: equipes de plataforma que buscam auto-hospedagem com controles transparentes de resiliência
Destaque: novas tentativas e fallbacks encadeados, com histórico de roteamento por requisição
Preço: OSS a $0; Enterprise sob consulta
Teste grátis: 14 dias de Enterprise
A página de preços do Bifrost inclui no OSS uma única API compatível com OpenAI para 1,000+ modelos, métricas e traces OTel, observabilidade, orçamentos e limites por chave virtual, roteamento personalizado, fallbacks automáticos, cache e um MCP gateway. O Enterprise acrescenta implantação em VPC, on-premises e isolada; modo cluster; balanceamento de carga adaptativo; SAML e OIDC; integrações com cofres; logs de auditoria; RBAC; e suporte respaldado por SLA.
A documentação de novas tentativas e fallback do Bifrost é especialmente precisa. Erros de rede e respostas 5xx repetem a chamada no mesmo provedor. Limites de taxa e falhas por chave podem alternar as credenciais. Somente depois que o provedor principal esgota seu orçamento de tentativas a requisição passa ao próximo fallback, e cada fallback recebe seu próprio orçamento completo.
Essa clareza expõe o obstáculo: as tentativas podem se multiplicar. Um provedor principal com três novas tentativas e dois fallbacks, também com três tentativas cada, pode gerar até 12 chamadas antes de devolver um erro. Em um app interativo, isso pode transformar uma falha do provedor em uma falha de latência e uma conta maior. Defina um orçamento total de latência e faça erros de segurança ou conformidade encerrarem a cadeia, em vez de seguirem adiante.
Bifrost concorre mais diretamente com LiteLLM. LiteLLM leva vantagem pela familiaridade do ecossistema e pela amplitude do seu plano de controle já estabelecido. Bifrost vence quando o footprint nativo em Go, o histórico explícito de roteamento ou as regras de tentativa combinam melhor com o modelo operacional da equipe de plataforma. Ambos perdem quando ninguém tem orçamento para cuidar do proxy.
- Plano OSS a $0
- Opções de implantação com Docker, Kubernetes e binário Go
- OTel, orçamentos, limites, cache, roteamento e fallbacks no OSS
- Regras específicas para novas tentativas, rotação de chaves e fallbacks
- Implantação privada e controles de identidade no Enterprise
- O comprador assume o gateway e seu domínio de falha
- O preço Enterprise é personalizado
- Orçamentos encadeados de novas tentativas podem ampliar latência e gasto
- Ecossistema menor que o do LiteLLM
7. Helicone: melhor gateway com foco em observabilidade
Helicone é a melhor escolha quando depurar sessões e explicar gastos importa tanto quanto rotear. O produto reúne um gateway sem acréscimo com observabilidade, cache, limites de requisições, fallbacks automáticos, gerenciamento de prompts e busca de requisições.

Melhor para: equipes cuja maior dificuldade é entender o comportamento dos modelos em produção
Destaque: o tráfego do gateway chega diretamente a um produto de observabilidade e depuração
Preço: Hobby grátis; Pro a $79/mês; Team a $799/mês; Enterprise sob consulta
Teste grátis: 7 dias nos planos Pro e Team
A página de preços deixa claros os gatilhos de upgrade. Hobby inclui 10,000 requisições, 1 GB de armazenamento, um usuário, uma organização, retenção por sete dias e 10 logs por minuto. Pro custa $79 por mês e inclui usuários ilimitados, uma organização, retenção por um mês, 1,000 logs por minuto e 10 chamadas de API por minuto, com cobrança por uso acima das franquias de requisições e armazenamento.
Team custa $799 por mês e passa a oferecer cinco organizações, retenção por três meses, 15,000 logs por minuto, 60 chamadas de API por minuto, suporte a SOC 2 e HIPAA e um canal dedicado no Slack. Enterprise tem preço personalizado e acrescenta organizações ilimitadas, retenção para sempre, 30,000 logs por minuto, 1,000 chamadas de API por minuto, SAML SSO, implantação on-premises e termos comerciais personalizados.
A documentação da plataforma descreve dois modos de operação: créditos de repasse em 100+ modelos sem acréscimo ou BYOK para equipes que mantêm a cobrança nos provedores. Ambos preservam a observabilidade no nível da requisição. Essa é a vantagem da Helicone sobre um proxy básico. Uma interação com falha pode ser rastreada ao longo da sessão, em vez de se resumir à contagem de erros de provedor.
O obstáculo aparece de imediato no Hobby. Dez logs por minuto bastam para observar um protótipo, mas são pouco para muitas aplicações reais. Os 1,000 logs por minuto do Pro formam o primeiro limite plausível de produção para tráfego moderado. O comprador está escolhendo ao mesmo tempo um plano de observabilidade e um gateway; por isso, compare o valor combinado em vez de tratar a camada de roteamento como gratuita.
- Créditos sem acréscimo ou BYOK
- Gateway, fallbacks, cache, limites e observabilidade no mesmo sistema
- Limites públicos de planos e ingestão
- Usuários ilimitados a partir do Pro
- Opção Enterprise on-premises
- O limite de ingestão de 10 logs por minuto do Hobby é restrito
- Pro e Team cobram pelo uso que ultrapassa as franquias
- O preço salta de $79 no Pro para $799 no Team por mês
- A camada de observabilidade pode ser mais produto do que um app simples precisa
8. Braintrust Gateway: melhor quando avaliações decidem lançamentos
Braintrust Gateway é a melhor opção quando traces precisam virar avaliações, datasets, pontuações e critérios de lançamento. O gateway atende OpenAI, Anthropic, Google, AWS e outros provedores por uma API unificada com cache, observabilidade e suporte multimodelo.

Melhor para: equipes de produtos de IA em que resultados de avaliações governam mudanças de roteamento
Destaque: traces do gateway se conectam diretamente a uma plataforma de avaliação
Preço: Starter a $0; Pro a $249/mês; Enterprise sob consulta; Gateway hospedado grátis durante o beta
Teste grátis: Starter não exige cartão de crédito; o Gateway é grátis enquanto estiver em beta
O preço da plataforma Braintrust começa com Starter a $0. Ele inclui 1 GB de dados processados e depois cobra $4 por GB; 10,000 pontuações e depois $2.50 por 1,000; retenção por 14 dias; além de usuários, projetos, datasets, playgrounds e experimentos ilimitados. Pro custa $249 por mês, com 5 GB de dados processados e depois $3 por GB; 50,000 pontuações e depois $1.50 por 1,000; e retenção por 30 dias, enquanto os dados retidos além da franquia custam $0.50 por GB por mês. Enterprise é personalizado.
O gateway em si está em outra situação. A documentação do Gateway da Braintrust informa que o endpoint hospedado está em beta e é gratuito, com preços a serem anunciados antes da disponibilidade geral. O endpoint global usa roteamento por latência via DNS e verificações de integridade entre regiões hospedadas. O registro pode gravar traces do gateway no plano de dados configurado pela organização.
Essa integração muda o motivo da compra. Se uma equipe coleta amostras de traces de produção, atribui notas às respostas, cria datasets de regressão e bloqueia lançamentos quando a qualidade cai, o gateway elimina etapas de instrumentação e mantém as evidências ligadas ao tráfego. Se a equipe só precisa de novas tentativas e tetos de gasto, fica difícil justificar a plataforma Pro de $249 diante de um gateway mais simples.
O obstáculo é a combinação de preço futuro com status beta. Um beta gratuito pode ter sido projetado para produção e ainda assim não oferecer uma unidade comercial estável. Use-o com um desvio direto ao provedor, estabeleça internamente um teto de preço antes da GA e não deixe um preço provisório de $0 determinar uma arquitetura permanente.
- Traces do gateway se conectam a avaliações, datasets, pontuações e fluxos de lançamento
- Acesso unificado às principais famílias de provedores
- Gateway hospedado grátis durante o beta
- Roteamento global por latência e verificações de integridade
- Usuários ilimitados nos planos Starter e Pro da plataforma
- O gateway hospedado continua em beta
- O preço do gateway mudará antes da disponibilidade geral
- Pro custa $249 por mês antes de excedentes de uso
- Profundidade excessiva de plataforma para equipes que só precisam de roteamento
9. Requesty: melhor plano de controle simples com preço percentual
Requesty é a melhor opção gerenciada com preço percentual para uma equipe pequena que quer roteamento, cache, fallbacks, orçamentos e residência de dados na UE sem assinatura. O Pay as you go oferece 600+ modelos de 20+ provedores.

Melhor para: startups que preferem uma tarifa diretamente ligada ao uso de modelos
Destaque: sem assinatura, cobrança por usuário, gasto mínimo ou tarifa separada para os controles centrais de roteamento
Preço: Free a $0; Pay as you go adiciona 5%; Enterprise sob consulta
Teste grátis: plano Free com 200 requisições por dia em modelos gratuitos, sem cartão
A página de preços oferece no Free 200 requisições diárias em modelos gratuitos, além de roteamento, cache, fallbacks, análise de gastos e residência de dados na UE. Pay as you go aplica um acréscimo de 5% ao custo-base dos modelos e inclui BYOK, políticas de roteamento, cache, fallbacks, limites de gasto, um MCP Gateway, observabilidade avançada e suporte por e-mail. Enterprise acrescenta SSO, RBAC, logs de auditoria, políticas de modelos aprovados, orçamentos por equipe, guardrails, detecção de PII, contas de serviço, suporte dedicado e SLAs personalizados.
A porcentagem simplifica os primeiros orçamentos. Com $2,000 de gasto em modelos, a tarifa é de $100. Com $20,000, chega a $1,000. Com $24,000, iguala o custo mensal ilustrativo de auto-hospedagem de $1,200. Uma startup pode evitar um projeto de plataforma enquanto o tráfego for incerto e reavaliar a decisão quando o uso se estabilizar.
O obstáculo nasce da mesma simplicidade. A tarifa cresce junto com o gasto em modelos, ainda que o trabalho operacional do gateway não aumente. Uma empresa com alto consumo de tokens, equipe de plataforma e contratos existentes com provedores deve comparar a cotação Enterprise da Requesty ou um proxy auto-hospedado antes de aceitar 5% por tempo indeterminado.
Requesty fica abaixo da Helicone porque seu argumento mais forte aqui é o controle gerenciado eficiente, não um ciclo diferenciado de evidências em produção. Ainda pode ser a melhor compra quando a ausência de assinatura e uma porcentagem previsível importarem mais que avaliações profundas ou políticas empresariais.
- Sem assinatura, tarifa por usuário ou gasto mínimo no Pay as you go
- 600+ modelos de 20+ provedores
- Roteamento, cache, fallbacks, orçamentos, MCP e residência na UE
- O plano Free não exige cartão de crédito
- Caminho Enterprise para identidade, auditoria, políticas e controles de PII
- A tarifa de 5% cresce diretamente com o gasto em modelos
- O preço Enterprise é personalizado
- O tráfego Free se limita a modelos gratuitos e 200 requisições por dia
- Perde atratividade quando uma equipe de plataforma financiada consegue operar um proxy
10. Kong AI Gateway: melhor para quem já opera Kong
Kong AI Gateway é a melhor escolha quando a Kong já governa as APIs da empresa e o tráfego de IA deve herdar o mesmo modelo operacional. O Plus inclui uma API universal para LLMs, até cinco modelos únicos atendidos por proxy, tráfego ilimitado entre agentes, proxies ilimitados para servidores MCP, sanitização de PII, guardrails, controle de acesso, limites de requisições por token, cache semântico e análise de custos.

Melhor para: empresas que já executam Kong Konnect ou Kong Gateway
Destaque: política de IA dentro de uma plataforma mais ampla para APIs, identidade, portais e governança de serviços
Preço: teste de 30 dias a $0; Plus cobrado por uso; Enterprise personalizado anualmente
Teste grátis: 30 dias sem cartão de crédito e sem limites de gateway
A página de preços ao vivo da Kong expõe as unidades de cobrança do Plus. Um plano de controle Serverless custa $25 por mês, Hybrid custa $200 e Dedicated Cloud custa $500 mais $0.15 por GB. O Plus inclui um milhão de requisições de API e depois cobra $200 por milhão adicional, até o máximo mensal de 10 milhões.
O proxy de modelos de IA custa mais $100 por mês para cada modelo LLM único, com limite de cinco no Plus. Portanto, um app com quatro modelos em um plano de controle Serverless começa em $425 por mês antes dos tokens dos modelos: $25 pelo plano de controle mais $400 pelos quatro proxies de modelo. Plugins pagos de IA são complementos separados no Plus e estão incluídos no Enterprise.
Enterprise elimina os limites de gateways e modelos, oferece gateways de API totalmente auto-hospedados e adiciona logs de auditoria, SSO, suporte dedicado, serviços profissionais e SLAs mais altos. O preço é personalizado e cobrado anualmente.
O obstáculo é o peso da plataforma. Kong faz sentido quando governança de APIs, planos de controle, identidade, análises, catálogo de serviços e suporte já fazem parte do orçamento. Em um app multimodelo criado do zero, pagar por plano de controle, modelo e requisição adiciona conceitos antes de o produto demonstrar que precisa deles. Vercel, Cloudflare, Requesty ou um proxy OSS levam a uma decisão menor mais rápido.
- Encaixa-se em um modelo operacional e de suporte Kong já existente
- API universal para LLMs com políticas, cache, guardrails e análise de custos
- Caminhos Serverless, Hybrid, Dedicated Cloud e Enterprise auto-hospedado
- As unidades públicas do Plus permitem calcular uma configuração básica
- Caminho robusto para identidade e auditoria empresariais
- $100 por modelo atendido por proxy no Plus
- O exemplo Serverless com quatro modelos começa em $425 antes da inferência
- O Plus limita o proxy de IA a cinco modelos e o tráfego a 10 milhões de requisições
- Complexo e caro demais como padrão para um app novo
Qual gateway de IA combina com cada cenário?
Comece pela restrição que impediria o lançamento e só depois compare tarifas. Roteamento sofisticado não corrige um limite de implantação incompatível, assim como uma tarifa baixa não compensa a ausência de auditoria ou rollback.
Escolha Vercel AI Gateway para uma startup que está lançando um app voltado a clientes, usa um conjunto pequeno de modelos aprovados e não precisa de implantação privada. A escolha muda para Cloudflare quando ela já controla a borda e a camada de segurança, ou para Requesty quando uma tarifa de 5% sobre o uso é mais fácil de financiar que uma assinatura de plataforma.
Escolha LiteLLM para uma empresa de produto com uma pessoa responsável pela plataforma, padrões existentes de contêiner e banco de dados e uma exigência rígida para o caminho dos dados ou gasto mensal em modelos avançando além de aproximadamente $22,000 a $24,000, sob a premissa operacional adotada. A escolha muda para Bifrost quando suas regras de repetição, a implantação em Go ou a abordagem centrada em OTel se encaixam melhor na equipe.
Escolha Portkey para uma empresa de médio ou grande porte que precisa de identidade gerenciada, guardrails, orçamentos, retenção, opções de implantação privada e suporte. A escolha muda para Kong quando a organização já usa Kong como plataforma de APIs e a consolidação do controle justifica a cobrança por modelo.
Escolha Helicone quando investigar requisições, depurar sessões e atribuir gastos fizer parte do trabalho diário. Escolha Braintrust Gateway quando os mesmos traces precisarem alimentar avaliações e critérios de lançamento. Como a Braintrust está em beta, o desvio direto e um teto de preço interno são obrigatórios.
Escolha OpenRouter enquanto uma equipe técnica pequena ainda estiver comparando muitos modelos ou precisar da amplitude de um marketplace de provedores. Mantenha uma rota direta para um provedor. Quando o app padronizar um conjunto pequeno de modelos aprovados, compare a tarifa de crédito de 5.5% com o acréscimo zero da Vercel, os 5% da Requesty ou uma auto-hospedagem devidamente financiada.

A condição explícita para mudar é simples: troque de gateway quando o custo ou o controle ausente superar o esforço de migração e operação da próxima alternativa. Não migre porque um concorrente apresenta uma lista maior de recursos. Migre quando o gateway atual não conseguir cumprir um orçamento de latência mensurável, limite de implantação, exigência de auditoria, teto de tarifa ou meta de saída.
Quais evitar como única rota de produção
Evite qualquer gateway como rota única quando seus limites comerciais ou operacionais ainda estiverem mudando. Três opções específicas exigem esse cuidado por motivos diferentes.
Evite a OpenRouter como única rota de produção durante a mudança de controle noticiada. O catálogo e o roteamento continuam excelentes, e não há base para afirmar que os termos vão piorar. O problema é a concentração: acesso a modelos, políticas de provedores, créditos e comportamento de fallback ficam todos atrás da mesma conta. Mantenha uma chave direta de provedor e um adaptador testado fora dela.
Evite o Braintrust Gateway como única rota enquanto ele estiver em beta. A Braintrust diz que o gateway hospedado foi projetado para produção, acompanha a disponibilidade publicamente e é grátis durante o beta. Também informa que os preços serão anunciados antes da disponibilidade geral. Trate $0 como preço de piloto, defina qual valor motivaria uma mudança e mantenha o desvio pronto.
Evite o Kong AI Gateway como padrão para um projeto novo quando a empresa ainda não opera Kong. Quatro modelos atendidos por proxy em um plano de controle Serverless Plus começam em $425 por mês antes da inferência, e o comprador também herda os conceitos de plano de controle e programa de APIs da Kong. Isso pode representar uma excelente consolidação para um cliente Kong e peso desnecessário de plataforma para um app novo.
Evite também um simples repassador criado internamente depois que mais de uma aplicação passar a depender dele. Um proxy de URL base é fácil. Streaming correto, normalização de erros, parâmetros específicos de provedores, fallbacks, orçamentos, isolamento de chaves, logs e tratamento da descontinuação de modelos formam um produto que precisa ser mantido. Só construa quando a política específica justificar essa responsabilidade permanente.
Próxima segunda-feira: prove que o gateway é reversível
Não comece a próxima semana com uma migração para toda a empresa. Comece por uma única rota com formato de produção e prove a saída em 10 minutos. O resultado deve ser uma decisão operacional medida, não apenas um diagrama de arquitetura mais elegante.
Faça o inventário de uma rota
Escolha um fluxo voltado a clientes e registre o provedor e o modelo atuais, o método de autenticação, o gasto mensal, a meta de latência p95, os requisitos de saída estruturada ou ferramentas e a política de dados. Selecione uma rota representativa o bastante para revelar os pontos difíceis, mas pequena o suficiente para permitir rollback.
Coloque o gateway atrás de um cliente interno
Leve apenas o adaptador do gateway para o caminho das requisições. Não deixe cabeçalhos específicos do provedor, aliases de modelo nem políticas de fallback escaparem para a lógica de negócio. Armazene a configuração direta anterior ao lado da configuração do gateway.
Defina um modelo principal e um fallback compatível
Não comece com uma árvore de roteamento. Escolha um fallback que ofereça o mesmo protocolo de resposta, saída estruturada, ferramentas e limite de dados. Coloque um teto total de latência acima da cadeia de novas tentativas.
Force a falha
Desative ou direcione incorretamente o modelo principal em uma janela controlada. Confirme quais tentativas ocorreram, quais foram cobradas, qual provedor respondeu, quanto tempo a cadeia levou e se a aplicação recebeu o esquema esperado.
Execute a saída em 10 minutos
Contorne o gateway por configuração e um deploy controlado. Se o serviço não conseguir voltar à rota direta do provedor em até 10 minutos, registre a dependência responsável pelo bloqueio e corrija-a antes de ampliar a implantação.
Compre o controle que mudou uma decisão
Adote o gateway somente se ele recuperar requisições, aplicar uma política, revelar quem responde pelo gasto, cumprir um limite de implantação ou reduzir um custo operacional mensurável. Um dashboard que ninguém consulta não é resultado de produção.
Para a maioria das equipes pequenas de produto, o piloto de segunda-feira deve usar Vercel AI Gateway sem complementos pagos até que algum requisito os justifique. Uma equipe de plataforma com limite privado rígido deve usar LiteLLM e nomear uma pessoa responsável antes que o proxy receba tráfego. Em um projeto de governança empresarial, compras e validação técnica devem começar juntas, pois retenção, identidade, implantação, suporte e condições de saída afetam a arquitetura.
A aquisição noticiada é o gatilho, não a decisão. A decisão é saber se a próxima troca de modelo, provedor ou gateway poderá ser resolvida como uma atualização controlada de configuração, em vez de uma reescrita acompanhada de um pedido emergencial de orçamento.
Perguntas frequentes
Qual é o melhor LLM gateway?
LiteLLM é a melhor opção geral quando uma pessoa responsável pela plataforma pode operar o gateway e a empresa valoriza o controle da implantação. Vercel AI Gateway é a melhor escolha gerenciada por padrão. Portkey é mais forte em governança empresarial gerenciada, enquanto OpenRouter se destaca quando a descoberta de muitos modelos ainda é a tarefa principal.
Quais são alguns exemplos de gateways de IA?
Os exemplos atuais incluem LiteLLM, Vercel AI Gateway, Portkey, Cloudflare AI Gateway, OpenRouter, Bifrost, Helicone, Braintrust Gateway, Requesty e Kong AI Gateway. Eles abrangem proxies auto-hospedados, gateways gerenciados, marketplaces de modelos, plataformas centradas em observabilidade e plataformas empresariais de APIs.
Qual é o melhor gateway de LLM open source?
LiteLLM é a melhor opção open source por padrão porque seu plano de $0 combina 100+ provedores, chaves virtuais, orçamentos, limites de requisições, fallbacks, logs e Prometheus. Bifrost é a alternativa mais indicada quando o requisito decisivo envolve regras explícitas de repetição encadeada, um binário Go ou sua implementação de OpenTelemetry.
Qual gateway de IA é melhor para uma startup ou uma empresa de grande porte?
Uma startup normalmente deve começar com Vercel, Cloudflare ou Requesty para não criar uma função interna de plataforma. Uma empresa maior deve escolher pelos limites de governança e implantação: Portkey para controles gerenciados, LiteLLM ou Bifrost para infraestrutura própria e Kong quando a organização já padroniza ali o tráfego de APIs.
3 de set. de 2026







