Gateway de IA: 6 melhores opções para reduzir custos em 2026
Compare Vercel, LiteLLM, Cloudflare, TrueFoundry, Portkey e OpenRouter para reduzir custos de inferência de IA sem comprometer a qualidade das respostas.

O Vercel AI Gateway é hoje o melhor gateway de IA gerenciado para reduzir custos de inferência: uma carga mensal do GPT-5.6 Sol com 100 milhões de tokens de entrada e 20 milhões de tokens de saída cai de $800, no preço direto atual da OpenAI, para $400 no preço vigente da camada Default da Vercel. Essa economia de $400 é uma janela de compra, não uma promessa para o ano inteiro, porque o desconto de 50% da Vercel termina em 18 de setembro de 2026.
A conclusão que fica vai além de uma promoção. Um gateway de modelos de IA só reduz a conta quando o roteamento, o cache de respostas ou os limites obrigatórios de orçamento eliminam mais gastos com provedores do que o gateway acrescenta em tarifas e trabalho operacional. Vercel é a escolha padrão sem carga operacional; LiteLLM, a opção self-hosted; Cloudflare, a melhor para cache de repetições exatas; TrueFoundry, para cache semântico gerenciado; Portkey, para governança a $49; e OpenRouter, para quem busca um marketplace de provedores.
Gateway de IA: as melhores opções em resumo
Todos os nomes de planos, preços públicos e limites abaixo foram conferidos nas páginas ativas dos fornecedores em 24 de agosto de 2026. A coluna "Teste grátis" diferencia uma opção gratuita permanente de uma avaliação com prazo, pois um protótipo sem custo pode virar uma dependência cara em produção quando seu verdadeiro limite não está claro.
O preço inicial, sozinho, não revela o vencedor. A licença do LiteLLM pode ser gratuita enquanto seu plano de controle consome horas reais de engenharia. O núcleo da Cloudflare pode custar zero enquanto o Unified Billing adiciona 5%. A TrueFoundry pode evitar chamadas inteiras ao modelo por meio do reaproveitamento semântico, mas sua primeira camada de produção custa $499 por mês. A comparação correta é quanto sobra na fatura total depois que o gateway faz seu trabalho.
A equação para reduzir custos com IA antes do ranking
A conta útil para o orçamento é gasto restante com o provedor + tarifas do gateway + controles pagos + custo operacional. Um gateway só merece espaço quando esse total fica abaixo do acesso direto para a mesma quantidade de resultados aceitos. Número de modelos, acabamento do dashboard e variedade de failover trazem benefícios, mas nada disso representa economia até remover dinheiro ou falhas caras do fluxo de trabalho.
Uma fatura normalizada deixa a diferença visível. A OpenAI lista atualmente o GPT-5.6 Sol a $4 por milhão de tokens de entrada e $20 por milhão de tokens de saída. Portanto, um fluxo que consome 100 milhões de tokens de entrada e 20 milhões de saída custa $800 antes de descontos por entrada em cache, ferramentas ou multiplicadores de contexto longo: $400 pela entrada e $400 pela saída.
A atualização de preços da Vercel em agosto apresenta o mesmo modelo por $2 na entrada e $10 na saída em sua camada de serviço Default com desconto até 18 de setembro. O mês normalizado passa a custar $400, uma redução de 50%. No momento, Flex custa $1 na entrada e $5 na saída, enquanto Priority custa $4 e $20, respectivamente — sempre por milhão de tokens em requisições de até 272,000 tokens.

A tarifa do modelo é apenas a primeira alavanca. Um acerto no cache de respostas exatas pode evitar por completo a chamada ao provedor. Encaminhar a solicitação a um modelo mais barato reduz o preço unitário, mas somente se as respostas ainda atingirem o nível mínimo de aceitação. Um teto de orçamento pode conter um agente fora de controle; não é desconto em tokens, porém pode gerar a maior economia do mês. A métrica operacional certa é custo por resultado aceito, incluindo novas tentativas e revisão, e não apenas o custo por token.
Para comparar primeiro os preços cobrados pelos provedores, consulte o guia de APIs de IA mais baratas. Este ranking analisa a camada seguinte: se um gateway consegue tornar esses preços mais baixos na prática.
1. Vercel AI Gateway: melhor gateway de IA gerenciado para cortar custos
O Vercel AI Gateway é a melhor escolha geral para equipes que querem um serviço gerenciado, sem markup sobre tokens e com uma redução de custo concreta disponível agora.

Seu argumento mais forte é excepcionalmente objetivo. A página de preços atual informa que Free e Paid usam os preços de tabela dos provedores, sem markup, e a promoção vigente do GPT-5.6 Sol ainda reduz em 50% a tarifa do modelo na camada Default. Um fundador com investimento pode migrar um único fluxo de extração ou suporte de alto volume e cortar a linha normalizada do modelo de $800 para $400 sem assumir a operação de um proxy self-hosted.
A camada Free oferece $5 em créditos mensais, cobre um subconjunto elegível de modelos, impõe limites de uso menores e específicos por modelo e não permite bring-your-own-key. A camada Paid funciona com créditos comprados, libera todos os modelos disponíveis, eleva os limites e habilita BYOK sem tarifa nem compromisso com o gateway da Vercel. A compra de créditos transfere a equipe para Paid; portanto, o crédito mensal de $5 do Free deixa de valer.
Há um detalhe de cobrança no BYOK que precisa constar no runbook. Quando uma requisição feita com a credencial do provedor do cliente falha, a Vercel pode tentar de novo com a própria credencial do sistema para manter a confiabilidade. Esse fallback é debitado do saldo de créditos da equipe no gateway. Quem espera manter todas as requisições em uma conta negociada diretamente com o provedor deve monitorar esse saldo e conciliar o tráfego de fallback, em vez de tratar BYOK como garantia de que os créditos da Vercel nunca serão consumidos.
A promessa de markup zero também deixa de fora os controles pagos. Custom Reporting custa $0.075 por 1,000 gravações de tag, user-ID ou entidade de cota e $5 por 1,000 consultas de relatórios. Uma allowlist de provedores para toda a equipe custa $0.10 por 1,000 requisições bem-sucedidas nos planos Pro e Enterprise, enquanto o filtro de provedor por requisição não tem custo adicional. Aplicar retenção zero de dados em toda a equipe custa mais $0.10 por 1,000 requisições, embora o ZDR por requisição seja gratuito no Pro e no Enterprise.
Os trace drains acrescentam $0.05 por 1,000 traces, mais $0.50 por GB de saída, sem franquia incluída no Pro. Em um milhão de requisições bem-sucedidas, a allowlist para toda a equipe gera uma linha de $100; o ZDR para toda a equipe, outra de $100; e um milhão de traces, $50 antes do tráfego de saída. O gateway ainda pode ser a alternativa mais barata, mas a empresa precisa comparar a fatura configurada, não apenas a chamada de markup zero.
O limite mais evidente é o tempo. O desconto do Sol abre uma excelente janela de migração, mas não sustenta uma tese de arquitetura permanente. A Vercel continua atraente depois da promoção se seu roteamento sem markup, os orçamentos, o failover e a observabilidade substituírem trabalho que a equipe teria de assumir. Se o produto usa um único modelo estável de um provedor e dispensa esses controles, a cobrança direta pode voltar a liderar quando o desconto acabar.
Melhor para: Equipes pequenas ou de médio porte que buscam roteamento gerenciado, controle de gastos e nenhum markup público sobre tokens.
Destaque: A tarifa Default atual do GPT-5.6 Sol transforma o mês direto normalizado de $800 em $400 até 18 de setembro.
Preço: Free inclui $5/mês nos modelos elegíveis; Paid usa créditos comprados aos preços de tabela dos provedores, sem markup; medidores opcionais de relatórios, políticas e traces são cobrados à parte.
Teste grátis: Camada Free permanente, não um teste com prazo.
- Nenhum markup público sobre tokens nas camadas Free e Paid.
- O desconto atual do Sol gera uma economia mensurável de 50% na carga normalizada.
- Paid aceita BYOK sem tarifa de gateway.
- O filtro de provedor por requisição está disponível sem o medidor da allowlist para toda a equipe.
- O desconto decisivo do Sol termina em 18 de setembro de 2026.
- A compra de créditos elimina o crédito recorrente de $5 da camada Free.
- O fallback para a credencial do sistema pode consumir créditos da Vercel após uma requisição BYOK com falha.
- Relatórios, políticas para toda a equipe e traces podem criar cobranças separadas por uso.
O caminho de adoção mais seguro mantém a comparação reversível:
Isole um fluxo com resultado aceito
Escolha uma tarefa com critério de aprovação mensurável, como uma extração estruturada válida ou uma resposta de suporte aprovada. Use uma chave exclusiva no gateway para que os gastos e as falhas não desapareçam no restante do produto.
Congele a linha de base do acesso direto
Registre uma semana representativa de tokens de entrada, tokens de saída, novas tentativas, latência e resultados aceitos na rota direta do provedor. A economia atual no preço unitário só importa se a taxa de aceitação não cair.
Encaminhe 10% com um limite claro
Envie 10% desse fluxo pela Vercel usando o mesmo modelo e a mesma camada de serviço. Defina na chave um orçamento compatível com a amostra para impedir que um erro de configuração transforme a comparação em uma conta sem teto.
Concilie as quatro linhas de custo
Some o uso do modelo, eventuais relatórios ou controles de política pagos, traces e o custo de revisão ou novas tentativas. Confira se uma requisição BYOK com falha consumiu créditos do sistema.
Tome a decisão de setembro
Mantenha a rota apenas se o custo por resultado aceito ficar abaixo do acesso direto e os controles gerenciados justificarem seu preço depois da promoção. Coloque 18 de setembro no calendário do orçamento e refaça as contas antes do prazo.
2. LiteLLM: melhor gateway self-hosted para quem já tem equipe de plataforma
LiteLLM é o melhor gateway self-hosted para empresas que já operam infraestrutura compartilhada e querem manter em $0 a linha da licença do gateway.

O plano Open Source é gratuito para sempre e self-hosted. Ele oferece acesso a 100+ provedores por uma única API compatível com a OpenAI e inclui chaves virtuais, usuários e equipes, acompanhamento de gastos, orçamentos, limites de uso, fallbacks, logs e Prometheus. Para o CTO de uma empresa de médio porte cuja equipe de plataforma já cuida de containers, métricas, segredos e plantão, isso pode centralizar a lógica dos provedores sem acrescentar uma licença mensal de gateway.
A palavra grátis termina na fronteira da licença. A empresa ainda precisa fornecer computação, datastore quando necessário, pipelines de deploy, upgrades, revisão de segurança, observabilidade e a pessoa que responde quando o gateway falha. LiteLLM só vence em custo quando essas tarefas já fazem parte do trabalho marginal da equipe de plataforma ou quando o self-hosting é uma exigência incontornável.
O plano Enterprise é um contrato anual sob medida, dimensionado pela capacidade anual de requisições no gateway, pela arquitetura de implantação e pelas necessidades de suporte — nunca pelo volume de tokens. Ele acrescenta SSO e SCIM, controles OIDC ou JWT, logs de auditoria, integração com gerenciadores de segredos e rotação de chaves, administração da organização, opções multirregião, suporte formal e implantação air-gapped. A página pública oferece 30 dias de teste do Enterprise sem cartão de crédito, mas não divulga um valor.
Essa base de precificação muda o cálculo do ponto de equilíbrio. Uma equipe com gasto altíssimo em tokens e capacidade moderada de requisições pode evitar uma taxa percentual sobre modelos caros. Já uma equipe com pouco gasto em modelos e nenhuma função de plataforma pode desembolsar mais em atenção da equipe do que pagaria por um gateway gerenciado. A regra de virada não depende apenas do volume de requisições, e sim de o custo mensal incremental para operar o LiteLLM ficar abaixo das tarifas da plataforma hospedada e do trabalho operacional que ele substitui.
LiteLLM também atende empresas reguladas que precisam manter o plano de dados no próprio ambiente. Esse controle pode justificar a decisão mesmo que a conta exclusiva do modelo não diminua. Nesse caso, a economia é uma consequência secundária do roteamento entre provedores, dos orçamentos e dos controles centralizados, não uma prova de que self-hosting seja barato por natureza.
Melhor para: Equipes com uma função de plataforma existente, requisitos de self-hosting ou escala suficiente para recusar tarifas percentuais de gateway.
Destaque: Licença open source de $0 com orçamentos, chaves virtuais, fallbacks, logs e 100+ provedores.
Preço: Open Source custa $0 para sempre; Enterprise tem cotação anual personalizada conforme capacidade de requisições, arquitetura e suporte.
Teste grátis: 30 dias no Enterprise sem cartão de crédito; Open Source é gratuito permanentemente para self-hosting.
- Nenhuma tarifa de licença open source nem imposto do gateway por token.
- Orçamentos, chaves, fallbacks e logs centralizados para 100+ provedores.
- Enterprise oferece governança e implantação air-gapped.
- O uso de modelos caros não eleva automaticamente a licença Enterprise pelo gasto em tokens.
- No Open Source, a empresa assume infraestrutura, upgrades, confiabilidade e resposta a incidentes.
- Enterprise não tem preço público; por isso, a área de compras não consegue modelar o custo apenas pelo site.
- Uma equipe pequena e sem capacidade de plataforma pode transformar uma licença gratuita na opção operacional mais cara.
3. Cloudflare AI Gateway: melhor para tráfego repetido byte a byte
Cloudflare AI Gateway é a melhor opção para cortar custos quando uma parcela relevante das requisições consiste em repetições seguras, idênticas byte a byte, e a equipe pode usar BYOK.

A Cloudflare torna o preço de seu núcleo excepcionalmente fácil de entender. Análises no dashboard, cache e limitação de taxa são gratuitos em todos os planos. Workers Free armazena 100,000 logs somando todos os gateways e permite 10 gateways por conta. Workers Paid guarda 10 milhões de logs por gateway e permite 20 gateways; já o Logpush é exclusivo do Paid, com 10 milhões de requisições mensais incluídas e $0.05 por milhão adicional.
O cache é o mecanismo que realmente gera economia, e sua limitação é precisa. A chave de cache padrão da Cloudflare inclui o provedor, endpoint, modelo, cabeçalho de autenticação do provedor e corpo completo da requisição. Qualquer diferença em mensagens, ferramentas ou parâmetros do modelo cria outra entrada. Um cache hit pula a chamada ao provedor, mas dois prompts com o mesmo sentido e palavras diferentes não coincidem, a menos que a equipe projete de propósito uma chave de cache personalizada e consiga demonstrar que ela é segura.
O tempo mínimo de retenção do cache é de 60 segundos e o máximo, de um mês; uma requisição armazenável pode ter no máximo 25 MB. É uma ótima combinação para tarefas de classificação repetidas, explicações estáticas compartilhadas ou prompts determinísticos em lote. Não funciona bem como padrão para suporte personalizado, dados de origem mutáveis ou produção criativa estocástica, em que uma resposta barata e desatualizada pode causar mais dano que uma nova chamada ao modelo.
A forma de cobrança importa tanto quanto a taxa de acerto. Com BYOK, o núcleo do gateway permanece gratuito e os provedores são pagos diretamente. O Unified Billing repassa os preços de inferência dos provedores, mas adiciona 5% aos créditos comprados; assim, $100 em créditos custam $105. Ele também se limita a 200 requisições por 60 segundos em cada gateway. Segundo a Cloudflare, esse limite de taxa não se aplica ao BYOK.
Aplique uma hipótese explícita de 25% de repetições exatas à fatura normalizada de $800. Se essas requisições repetidas tiverem a mesma combinação de tokens e puderem ser reutilizadas com segurança, o cache com BYOK deixa $600 de gasto no provedor e economiza $200. O Unified Billing adiciona 5% aos $600 restantes, levando o total a $630 e a economia líquida a $170. Uma taxa de acerto menor pode eliminar a vantagem; uma taxa segura maior torna a Cloudflare difícil de superar.
A varredura DLP é gratuita em todos os planos, com dois perfis predefinidos para contas sem assinatura Zero Trust. Guardrails não são gratuitos: a avaliação usa um modelo do Workers AI e é cobrada pelas tarifas de tokens do Workers AI. É mais um exemplo da fronteira contábil correta. O cache pode ser gratuito enquanto a camada de segurança acrescenta sua própria inferência.
Melhor para: Usuários da Cloudflare com requisições repetidas e determinísticas e uma equipe disposta a medir a segurança do cache.
Destaque: Cache gratuito de respostas exatas capaz de eliminar a chamada ao provedor em um acerto.
Preço: Análises centrais, cache e limitação de taxa são gratuitos; Unified Billing adiciona 5%; logs, Logpush e guardrails têm limites ou medidores separados.
Teste grátis: Recursos centrais gratuitos e armazenamento de logs do Workers Free permanentes, não um teste com prazo.
- Análises centrais do gateway, cache e limitação de taxa custam $0.
- Um cache hit exato elimina a chamada ao provedor, em vez de apenas descontar alguns tokens do prompt.
- BYOK evita a tarifa de 5% do Unified Billing e seu limite de taxa para credenciais gerenciadas.
- O comportamento e os limites rígidos do cache estão documentados com clareza.
- A chave padrão exige correspondência exata; variações na conversa, portanto, não geram acerto.
- Unified Billing adiciona 5% e tem teto de 200 requisições por 60 segundos em cada gateway.
- O armazenamento gratuito de logs é compartilhado pelos gateways e para em 100,000 registros.
- Uma chave personalizada insegura pode devolver conteúdo desatualizado ou de outro contexto.
4. TrueFoundry AI Gateway: melhor cache semântico gerenciado
TrueFoundry AI Gateway é a melhor escolha gerenciada quando requisições escritas de formas diferentes costumam fazer a mesma pergunta e a resposta pode ser reutilizada com segurança.

O diferencial é o cache semântico. A documentação de cache da TrueFoundry informa que o modo exato gera um hash da requisição completa, enquanto o modo semântico cria um embedding da mensagem final e compara seu significado com requisições anteriores. Todos os demais parâmetros da requisição ainda precisam ser iguais. Um acerto no cache da resposta completa evita a chamada ao LLM e não gera custo de LLM; assim, uma operação de suporte que receba muitas variações de "Como redefino minha senha?" pode reaproveitar uma resposta aprovada em vez de pagar por cada formulação.
O cache é isolado automaticamente por usuário ou conta virtual, e namespaces opcionais podem separar clientes ou ambientes. Isso importa porque uma taxa de acerto alta não vale nada se a resposta em cache de um cliente chegar a outro. Um cache semântico self-hosted requer Redis e um modelo de embedding; na opção SaaS, essa infraestrutura é gerenciada.
A página pública de preços tem quatro camadas. Developer custa $0 por mês para 50,000 requisições e 3 usuários. Pro custa $499 por mês para 1 milhão de requisições e 10 usuários. Mais 2 milhões de requisições e 5 API keys custam outros $499 por mês. Pro Plus custa $2,999 por mês para 1 milhão de requisições e 25 usuários, com uso adicional sob consulta. Enterprise tem preço personalizado conforme capacidade de requisições e usuários e aceita implantações VPC e air-gapped.
A página anuncia um teste gratuito de 7 dias, enquanto a página do gateway oferece gratuitamente as primeiras 50,000 requisições de cada mês, sem cartão, em 1,600+ modelos. É o bastante para medir uma taxa realista de cache hit antes de passar ao Pro. Isso não autoriza deduzir a economia em produção a partir de um conjunto sintético de perguntas frequentes.
A barreira na conta exclusiva do modelo é alta quando o gasto é modesto. Diante da fatura normalizada de $800 do provedor, a assinatura Pro de $499 precisa evitar pelo menos $499 em uso do modelo — cerca de 62.4% — para vencer apenas pelo custo de inferência. Governança, isolamento, observabilidade e tempo da equipe ainda podem justificar o Pro com uma taxa de acerto menor, mas são benefícios distintos e precisam ser apresentados como tal.
O limite real é o reaproveitamento incorreto. Um limiar semântico permissivo demais pode devolver uma resposta anterior aparentemente relevante, mas incompatível com o contexto ou a política do usuário atual. Um teste seguro avalia respostas em cache e novas contra o mesmo conjunto de aceitação, segmenta por cliente e desativa o cache para perguntas que envolvam conta em tempo real, contexto jurídico, médico ou estoque variável.
Melhor para: Cargas de suporte, conhecimento e FAQ com intenção repetida, mas formulações variadas.
Destaque: Cache semântico gerenciado da resposta completa, com isolamento automático de contas e namespaces opcionais.
Preço: Developer $0; Pro $499/mês; Pro Plus $2,999/mês; Enterprise personalizado, com os limites de requisições e usuários publicados acima.
Teste grátis: Teste de 7 dias mais uma camada Developer permanente com 50,000 requisições/mês.
- O cache semântico pode eliminar chamadas inteiras ao modelo que caches exatos não capturam.
- As entradas de cache são isoladas por usuário ou conta virtual por padrão.
- Developer oferece requisições mensais suficientes para avaliar a taxa de acerto em um teste limitado.
- Enterprise aceita implantação VPC e air-gapped.
- O piso mensal de $499 do Pro exige economia ou valor de governança substancial.
- Pro Plus custa $2,999 mesmo listando 1 milhão de requisições mensais.
- Falsos positivos semânticos podem transformar uma economia em falha de qualidade ou de isolamento de dados.
- O cache semântico self-hosted acrescenta a operação de Redis e do modelo de embedding.
5. Portkey: melhor avanço em governança gerenciada por $49
Portkey é a melhor opção gerenciada de entrada para equipes que já superaram a fase de protótipo, mas não conseguem justificar um gateway de produção de $499.

A escada de planos começa pelo Open Source, que é self-hosted, não limita requisições e inclui API universal, novas tentativas e timeouts, roteamento, guardrails, fallbacks automáticos, dashboard básico, balanceamento de carga e suporte da comunidade. A página não informa um preço de licença para essa opção; portanto, ela deve ser avaliada como o LiteLLM: o controle é alto, mas a infraestrutura e o custo do operador ficam com a empresa.
A camada hospedada Developer é Free Forever, permite 10,000 requisições mensais, não oferece excedente e é apresentada explicitamente para protótipos e provas de conceito empresariais, não para produção. Production custa $49 por mês, inclui 100,000 requisições e cobra mais $9 mensais por cada bloco adicional de 100,000 requisições até 3 milhões. Inclui cache simples e semântico, acesso baseado em funções, chaves de contas de serviço e suporte de produção.
Com um milhão de requisições mensais, Production custa $130 antes do uso dos modelos: $49 pelas 100,000 incluídas, mais nove blocos excedentes de $9 para as 900,000 restantes. Esse é o ponto de comparação útil. Portkey precisa recuperar mais de $130 com cache, roteamento, controle de orçamento ou trabalho operacional para superar um gateway sem tarifa na carga normalizada.
O Enterprise usa preços e capacidade de requisições personalizados. Ele acrescenta SSO, orçamentos e limites de taxa granulares, opções de nuvem privada ou VPC e controles ampliados de compliance. Uma organização regulada pode comprar essa camada por governança, mesmo que a conta do provedor permaneça igual.
Há uma inconsistência de nomes que merece entrar nas observações de compras. A página de preços atual chama a camada de $49 de Production, enquanto a documentação vigente chama a mesma camada de $49 de Pro. A página também informa que Portkey agora é Prisma AIRS AI Gateway. Esses nomes devem ser conferidos no pedido antes que a equipe automatize verificações de plano ou redija uma política de renovação baseada neles.
Portkey fica abaixo da TrueFoundry em profundidade do cache semântico porque seus materiais públicos não tornam o mecanismo de economia tão fácil de auditar. Fica acima do OpenRouter para equipes que preferem uma mensalidade base hospedada previsível a uma porcentagem sobre cada compra de créditos compartilhados. O ponto de entrada de $49 torna financeiramente claro um teste controlado em produção.
Melhor para: Um produto de IA em crescimento que precisa de cache hospedado, funções, chaves, roteamento e suporte com um orçamento mensal de três dígitos para o plano de controle.
Destaque: Production começa em $49 e chega a um milhão de requisições mensais por $130 antes do uso dos modelos.
Preço: Open Source self-hosted; Developer Free Forever; Production $49/mês mais $9 por 100,000 requisições adicionais; Enterprise personalizado.
Teste grátis: A camada Developer permanente oferece 10,000 requisições/mês, mas não é adequada para produção.
- A primeira camada hospedada para produção começa em $49 por mês.
- Cache simples e cache semântico estão incluídos no Production.
- O excedente previsível em blocos de requisições é mais fácil de orçar que uma porcentagem sobre tokens.
- Open Source e Enterprise cobrem extremos opostos de requisitos de controle.
- Um milhão de requisições eleva o preço anunciado de $49 para $130 antes da inferência.
- Developer se limita a 10,000 requisições, não permite excedente e não é uma opção de produção.
- A diferença entre os nomes Production e Pro cria uma ambiguidade desnecessária para compras.
- A viabilidade econômica do Enterprise só pode ser avaliada após uma cotação comercial.
6. OpenRouter: melhor marketplace para roteamento de provedores por preço
OpenRouter é o melhor gateway quando o objetivo é escolher entre muitos provedores e modelos pelo preço, e não minimizar a linha do gateway mantendo a mesma rota.

O plano Free oferece 25+ modelos gratuitos por meio de 4 provedores gratuitos, com 50 requisições por dia e suporte da comunidade. Pay-as-you-go libera 500+ modelos e 80+ provedores sem gasto mínimo, mas adiciona uma tarifa de plataforma de 5.5% aos créditos compartilhados. A tarifa de compra de créditos tem valor mínimo de $0.80, e o aporte com criptomoedas custa 5%.
O Enterprise mantém o catálogo de 500+ modelos e 80+ provedores, acrescenta faturamento, controles gerenciados, limites dedicados opcionais, SLA contratual e um canal compartilhado de suporte no Slack. O preço é baseado em compromissos de volume personalizados e pode incluir descontos nas tarifas. É uma camada voltada ao processo de compras, não uma assinatura pública por usuário.
BYOK muda a decisão. Pay-as-you-go inclui $25,000 mensais de inferência BYOK a preço de tabela sem tarifa do OpenRouter e cobra 5% acima disso. Enterprise eleva a franquia sem tarifa para $200,000 por mês e aplica 5% depois desse valor. Assim, uma empresa que já mantém contas diretas com provedores pode usar a camada de controle do OpenRouter sem pagar a porcentagem dos créditos compartilhados enquanto permanecer dentro da franquia.
O recurso de economia está na seleção de provedores. OpenRouter pode ordenar provedores elegíveis por preço, impor um teto de preço e recorrer a fallback quando uma rota falha. Seu cache de respostas em beta devolve requisições exatamente iguais sem uso faturável e funciona entre modelos, mas não é um cache semântico. Ordenar por preço só economiza quando os provedores podem ser trocados sem ferir os requisitos de qualidade, política de dados, latência e disponibilidade da carga.
Sobre uma conta inalterada de $800 no provedor, os créditos compartilhados adicionam $44 e levam o total a $844. Portanto, o OpenRouter precisa recuperar mais de $44 escolhendo um provedor elegível mais barato, obtendo cache hits, reduzindo o custo de falhas ou simplificando a operação para superar a cobrança direta. Se um único provedor já atende a carga de forma confiável na tarifa contratada, o marketplace é um custo opcional.
Os pisos detalhados das tarifas, as regras de BYOK, os riscos de aporte e a comparação de roteamento estão na análise de preços do OpenRouter. O veredito prático aqui é mais específico: OpenRouter economiza quando a equipe usa ativamente seu mercado, não quando apenas coloca a mesma requisição atrás de outra URL.
Melhor para: Equipes que realmente alternam entre provedores ou famílias de modelos e conseguem medir a economia dessa escolha.
Destaque: Roteamento por preço entre 500+ modelos e 80+ provedores, com grandes franquias BYOK sem tarifa.
Preço: Free $0; Pay-as-you-go cobra o preço dos modelos mais 5.5% sobre créditos compartilhados; Enterprise é personalizado e pode oferecer descontos nas tarifas.
Teste grátis: Plano Free permanente com 25+ modelos gratuitos e 50 requisições/dia.
- O marketplace de provedores mais amplo desta seleção.
- O roteamento pode ordenar por preço, impor um teto e acionar fallback.
- BYOK não paga tarifa de gateway até $25,000/mês no Pay-as-you-go ou $200,000/mês no Enterprise.
- Cache hits exatos registram uso faturável zero.
- Créditos compartilhados acrescentam 5.5% mesmo quando a rota subjacente não muda.
- O mínimo de $0.80 torna pequenas compras de créditos mais caras do que sugere a porcentagem anunciada.
- O cache exato não captura requisições redigidas de formas diferentes.
- A troca de provedor pode alterar latência, política ou qualidade da resposta mesmo com o mesmo nome de modelo.
Qual gateway de IA escolher em cada cenário
Vercel é o padrão para equipes que querem roteamento gerenciado e nenhum markup público sobre tokens. A escolha deixa de favorecer a Vercel quando o desconto atual do modelo acaba e os controles restantes já não economizam mais do que o acesso direto, ou quando políticas para toda a equipe e a configuração de traces tornam relevante a conta de adicionais.
LiteLLM é a resposta quando o self-hosting é obrigatório ou uma equipe de plataforma já existente consegue absorver o gateway com baixo custo marginal. A escolha muda para uma solução gerenciada quando o LiteLLM exige um novo responsável operacional, uma nova escala de plantão ou uma cotação Enterprise maior que a fatura completa da alternativa hospedada.
Cloudflare vence quando os corpos das requisições se repetem exatamente, a resposta em cache pode ser reutilizada com segurança e BYOK se encaixa. A escolha muda para TrueFoundry quando formulações diferentes expressam a mesma intenção e um cache semântico medido consegue atingir a qualidade mínima. Volta para a ausência de cache quando atualização, personalização ou contexto do cliente tornam o reaproveitamento inseguro.
TrueFoundry vence no reaproveitamento semântico gerenciado somente depois que uma avaliação real comprova cache hits aceitos suficientes para cobrir a camada contratada. Portkey vence quando a equipe precisa de um plano de controle de produção hospedado mais barato e consegue operar dentro da economia por requisições. OpenRouter vence quando o roteamento por preço ou a consolidação via BYOK economiza mais do que a tarifa.

A melhor escolha padrão ainda pode ser nenhum gateway. Uma carga estável e de alto volume em um único provedor, com bons orçamentos nativos, baixo custo de falhas e pouco conteúdo repetido, não oferece uma economia óbvia para um gateway. Só acrescente um plano de controle quando um benefício específico de roteamento, cache, governança ou operação superar seu custo total.
Como selecionamos os gateways de IA
O ranking pondera os fatores econômicos que uma empresa consegue verificar: 35% para o custo público do gateway e a transparência das tarifas, 30% para um mecanismo plausível de eliminação de gasto com modelos, 20% para o obstáculo à entrada em produção e 15% para a carga operacional e o atrito da migração.
Páginas de preços, comparações de planos, documentação de recursos, comportamento do cache, limites de requisições e a mudança do GPT-5.6 Sol foram verificados ao vivo em 24 de agosto de 2026. O pipeline de publicação registra uma captura real da página de preços de cada gateway no ranking. As ferramentas não foram testadas com tráfego de produção nesta análise; portanto, nenhum resultado de latência, disponibilidade, cache hit ou qualidade de saída é apresentado como teste.
Seis gateways chegaram à seleção final porque cada um cumpre um papel de custo distinto e auditável. Vercel elimina o markup da plataforma gerenciada e hoje oferece desconto em um modelo importante. LiteLLM remove a linha da licença por meio do self-hosting. Cloudflare elimina chamadas repetidas exatas. TrueFoundry busca repetições semânticas. Portkey vende um avanço gerenciado com preço inteligível. OpenRouter expõe a concorrência de preços entre provedores.
Um recurso não contou como economia apenas porque o fornecedor o chama de otimização. O cálculo usa uma carga declarada, um preço identificado e uma hipótese explícita de cache. Toda empresa que aplicar este ranking deve substituir esses dados por sua combinação de modelos, taxa de resultados aceitos e custo do operador antes de assinar um contrato anual.
Gateways que devem ser evitados
Kong AI Gateway em uma implantação nova focada primeiro em custo
Kong AI Gateway não é a primeira escolha quando reduzir o custo de inferência é o único objetivo. O preço atual da Kong oferece 30 dias de teste do Konnect e, depois, trata plugins pagos do AI Gateway como adicional no Plus, cobrando $100 por mês para cada modelo exclusivo intermediado por plugins de IA, com limite de cinco modelos. Cinco modelos criam uma linha mensal de $500 pelo proxy antes do uso de inferência e de outros custos da plataforma.
Isso não torna a Kong uma plataforma ruim. Uma empresa que já padroniza APIs, segurança e governança de serviços na Kong pode concluir que os controles adicionais de IA custam menos que a contratação de outro fornecedor. A recomendação é mais estreita: não introduza uma plataforma ampla de APIs em uma stack nova de IA apenas para buscar economia em tokens quando existem gateways sem markup e com núcleo gratuito.
Um proxy interno sem responsável
Um proxy interno enxuto parece gratuito até assumir novas tentativas, mudanças de provedores, orçamentos, logs, segredos e incidentes. Só desenvolva um quando a carga for estável o bastante para manter uma superfície pequena e uma equipe definida já for responsável pelo serviço. Caso contrário, o proxy esconde o custo em horas de engenharia e oferece menos controles que as opções gerenciadas.
Qualquer gateway em uma carga de um só provedor e sem respostas reutilizáveis
Amplitude de roteamento não tem valor quando o tráfego nunca muda de rota. Caches exatos e semânticos não têm valor se cada requisição exige uma resposta nova. Quando os orçamentos e logs nativos do provedor bastam, a API direta apresenta menos camadas de cobrança e a menor superfície de falha.
Um plano permanente apoiado no desconto de setembro
A promoção atual do Sol na Vercel é a melhor oferta imediata deste ranking — e também a mais fácil de usar de forma errada. Trate 18 de setembro como uma data obrigatória para recalcular preços. A arquitetura precisa se sustentar com as tarifas de tabela do provedor, mesmo que a promoção motive o teste de migração agora.
O passo de segunda-feira: coloque um fluxo em uma planilha de custo por resultado aceito
Escolha um fluxo de produção que tenha gerado uma conta relevante do modelo na semana passada e possa ser avaliado por uma regra binária de aceitação. Exporte seus tokens de entrada, tokens de saída, gasto no provedor, novas tentativas e resultados aceitos. Não inclua dados pessoais, confidenciais ou de clientes em um conjunto de avaliação que não esteja aprovado para a rota escolhida.
Encaminhe 10% do tráfego da próxima semana pelo gateway cujo mecanismo corresponda à carga. Use Vercel para aproveitar a janela de preço gerenciado do Sol, Cloudflare para repetições exatas comprovadas, TrueFoundry para perguntas diferentes mas equivalentes, LiteLLM em uma plataforma self-hosted já existente, Portkey como camada de controle gerenciada de entrada ou OpenRouter quando houver concorrência real de preços entre provedores.
Defina um orçamento rígido na chave isolada e estabeleça uma condição de parada antes da primeira requisição. Pare se a taxa de resultados aceitos cair, a segurança do cache falhar, uma rota de provedor violar a política ou a cobrança total do gateway superar a economia. Ao fim da semana, divida por resultados aceitos a soma dos gastos com modelos, tarifas da plataforma, controles pagos, novas tentativas e revisão.
O resultado de segunda-feira será uma decisão que finanças e engenharia podem compartilhar: manter, trocar ou remover o gateway. Se a Vercel vencer, agende uma revisão de preços para 18 de setembro. Se um cache vencer, coloque-o em produção apenas para as classes de requisições aprovadas. Se nenhum vencer, mantenha o acesso direto e evite pagar por complexidade opcional.
Perguntas frequentes
Quanto custa o Cloudflare AI Gateway?
As análises centrais, o cache e a limitação de taxa do Cloudflare AI Gateway são gratuitos em todos os planos. Workers Free armazena 100,000 logs somando todos os gateways; Workers Paid guarda 10 milhões por gateway. Unified Billing acrescenta 5% aos créditos comprados, enquanto os preços dos provedores são repassados sem markup. Logpush e a inferência dos guardrails podem gerar cobranças separadas.
Qual é o melhor gateway de IA?
O Vercel AI Gateway é a melhor opção gerenciada no geral em 24 de agosto de 2026 porque combina markup público zero sobre tokens com o desconto atual de 50% no GPT-5.6 Sol até 18 de setembro. LiteLLM é melhor para equipes que já operam infraestrutura self-hosted; Cloudflare, para cache de repetições exatas; TrueFoundry, para cache semântico gerenciado; Portkey, para uma entrada em produção de $49; e OpenRouter, para ordenar provedores por preço.
O Cloudflare AI Gateway tem plano gratuito?
Sim. Análises centrais, cache e limitação de taxa são gratuitos, e a franquia de logs do Workers Free armazena 100,000 registros no total entre todos os gateways. O limite da conta gratuita é de 10 gateways. A inferência do provedor ainda custa dinheiro, e o Unified Billing opcional, os guardrails ou os recursos pagos de logs podem acrescentar cobranças.
Receba o Mapa de Ferramentas de IA para Donos de Negócios
Transforme esta decisão sobre gateways em uma stack completa de adoção, com um gatilho de custo e um piso de qualidade para cada ferramenta. Assine para receber gratuitamente o Mapa de Ferramentas de IA.
2 de set. de 2026





