LLM gateway: 6 melhores opções para agentes de programação

Compare Vercel, Requesty, LiteLLM, OpenRouter, Portkey e Cloudflare e escolha o LLM gateway certo para custos, roteamento e governança de agentes de IA.

Thursday, September 3, 2026Omid Saffari
LLM gateway: 6 melhores opções para agentes de programação

O Vercel AI Gateway é o melhor LLM gateway para a maioria das equipes que trabalha com agentes de programação: hoje, um único comando configura nove agentes, e a camada básica de tokens não cobra markup. Em uma conta mensal de modelos de $2,000, a taxa do gateway fica em $0 com a Vercel, $100 com a Requesty e $110 com a OpenRouter, antes de controles opcionais. Ou seja, essa decisão já faz parte do orçamento de engenharia — não deve ficar esquecida na gaveta de experimentos.

Resposta rápida: qual LLM gateway escolher?

Escolha o Vercel AI Gateway, a menos que os requisitos de implantação, atribuição de custos ou governança apontem claramente para outra opção. Hoje, ele oferece o caminho mais simples para trocar configurações separadas de Claude Code, Codex, Cursor e OpenCode por uma única conta de modelos, uma política de fallback e uma visão consolidada dos gastos.

FerramentaIdeal paraPreço inicialTeste grátis
Vercel AI GatewayConfiguração rápida de vários agentesMarkup de $0 sobre tokens; crédito mensal de $5Plano gratuito
RequestyCustos por branch, repositório e desenvolvedor$0 no plano grátis; markup de 5% no Pay as you goPlano grátis, sem cartão
LiteLLMControle em infraestrutura própriaCódigo aberto por $0Teste Enterprise de 30 dias
OpenRouterExperimentação com muitos modelos$0 no plano grátis; taxa de 5.5% no Pay as you goPlano gratuito
PortkeyRoteamento gerenciado e governançaDeveloper por $0; Production por $49/mêsPlano Developer gratuito
Cloudflare AI GatewayStacks que já usam WorkersRecursos essenciais por $0; taxa de 5% no Unified BillingRecursos essenciais gratuitos

A recomendação deixa de ser a Vercel em cinco situações bem definidas. Escolha a Requesty quando o financeiro precisa saber qual repositório, branch ou desenvolvedor gerou o gasto. Prefira o LiteLLM quando o tráfego dos modelos e as chaves dos provedores precisam permanecer em uma infraestrutura operada pela própria empresa. Vá de OpenRouter quando o acesso ao catálogo mais amplo de modelos e provedores vale mais do que uma configuração específica para cada agente. O Portkey faz mais sentido quando guardrails gerenciados, circuit breakers e políticas são requisitos com verba aprovada. Já o Cloudflare AI Gateway é a escolha natural se Workers, os logs da Cloudflare e sua camada de segurança já formam o plano de controle.

Um gateway de IA é a camada de controle entre um agente de programação e os provedores de modelos. O agente continua planejando, editando arquivos, executando comandos e acionando ferramentas. Cabe ao gateway decidir para onde cada requisição vai, quanto ela pode custar, qual provedor a recebe, o que acontece depois de um timeout e quais dados entram nos logs.

Essa distinção é importante. Um gateway não melhora um modelo de programação fraco, não conserta um arquivo ruim de instruções do repositório nem revisa código inseguro. Mas pode impedir que a indisponibilidade de um provedor encerre uma execução longa, limitar uma chave fora de controle e mostrar que uma branch de migração consumiu quatro vezes o orçamento de modelos gasto em uma correção rotineira. O que se compra é controle, não inteligência.

Por que agentes de IA para programação tornam o gateway parte do orçamento

Com agentes de programação, uma pequena decisão de roteamento vira uma decisão de custo operacional, pois uma única tarefa pode disparar uma cadeia de chamadas aos modelos. Uma resposta de chat talvez exija apenas uma geração. Já um agente pode inspecionar o repositório, buscar símbolos, propor um patch, rodar testes, interpretar falhas, revisar o patch e ainda pedir que um modelo mais forte avalie o resultado.

O índice de produção da Vercel constatou que 22.2% das requisições concentraram 58.9% dos tokens. Na prática, requisições que usavam ferramentas consumiram cerca de 2.6 vezes mais tokens do que o restante do tráfego. O mesmo conjunto de dados mostrou que os fallbacks recuperaram 3.5% das requisições. Se uma carga de 10,000 requisições reproduzisse esse agregado, cerca de 350 requisições seriam concluídas via fallback, em vez de falhar no primeiro provedor. É uma ilustração, não uma promessa de taxa de recuperação para outra carga, mas deixa claro por que confiabilidade precisa ser avaliada ao lado do preço do modelo.

A comparação da taxa básica fica mais simples quando a conta dos modelos upstream é mantida constante. Para $2,000 por mês em inferência cobrada ao preço dos provedores:

  • A Vercel acrescenta $0 de markup sobre tokens.
  • O markup de 5% da Requesty acrescenta $100.
  • A taxa de 5.5% do Pay as you go da OpenRouter acrescenta $110.
  • O Unified Billing da Cloudflare acrescenta $100 quando os créditos são comprados por ele.
  • O Portkey começa em $49 por mês para 100,000 logs registrados, uma métrica diferente do gasto com tokens.
  • A licença de código aberto do LiteLLM acrescenta $0; hospedagem e tempo da equipe de operação continuam por conta do usuário.
Comparação de custo entre seis gateways de IA para uma conta mensal de modelos de dois mil dólares
Custo da camada de gateway para $2,000 em modelos por mês, com preços vigentes verificados em 15 de agosto de 2026

A diferença percentual não conta a história toda. Os $100 extras da Requesty podem sair baratos se a atribuição por branch impedir que um único repositório sem controle consuma muito mais. Os $49 do Portkey podem compensar se um circuit breaker preservar um fluxo de release. E a licença gratuita do LiteLLM pode custar caro se um engenheiro de plataforma se tornar o responsável permanente pelo plantão do proxy.

O gateway deve reduzir o custo de trocar modelos, provedores e agentes. Se ele apenas substitui seis faturas de provedores por uma sétima fatura, ainda não justificou seu lugar.

Como estes gateways foram selecionados

Os seis escolhidos foram avaliados pelo tipo de trabalho gerado por agentes de programação, não por um checklist genérico de APIs. Preços e páginas de produto foram verificados em 15 de agosto de 2026. As ferramentas não foram testadas em produção durante esta análise; portanto, o ranking considera a documentação atual, uma comparação normalizada de custos e as consequências práticas dos limites de cada produto.

Seis critérios definem a ordem:

  1. Configuração nos agentes de programação: um gateway que documenta Claude Code, Codex, Cursor e agentes semelhantes oferece menos risco de integração do que outro que apenas promete um endpoint compatível com OpenAI.
  2. Confiabilidade de roteamento: ordem dos provedores, timeouts, novas tentativas, fallback entre modelos e circuit breakers importam porque um agente pode perder uma cadeia longa na última chamada ao modelo.
  3. Visibilidade de custos: o gasto com modelos deve poder ser atribuído a uma chave, agente, repositório, desenvolvedor, equipe ou política — e não aparecer como um total indistinto de tokens.
  4. Controle por políticas: allowlists de provedores, listas de modelos aprovados, orçamentos, controles de retenção de dados e logs de auditoria determinam se uma equipe consegue sair da fase de experimentos individuais.
  5. Carga operacional: gateways gerenciados cobram para assumir a operação. Os self-hosted eliminam a taxa de plataforma, mas devolvem ao comprador a responsabilidade por disponibilidade, upgrades, armazenamento e resposta a incidentes.
  6. Preço atual: todos os planos e limites vêm da página vigente de cada fornecedor. O ranking não inclui os preços de inferência, pois eles variam conforme o modelo e o provedor, enquanto esta comparação mantém constante a conta upstream.

O Helicone foi considerado, mas ficou fora do ranking. É um produto sólido de observabilidade com recursos de gateway, porém seu ponto forte mais evidente está nos traces e na análise, e não na configuração ampla de agentes de programação. Gateways de API genéricos também foram descartados. Eles conseguem intermediar tráfego HTTP, mas agentes de programação precisam de fallbacks cientes de modelos, orçamentos de tokens, controles de prompt e resposta e compatibilidade com vários protocolos.

O resultado é uma lista mais curta e uma regra de decisão mais rigorosa. Cada produto abaixo vence em uma função e encontra uma barreira a partir da qual outra opção se torna a compra mais acertada.

1. Vercel AI Gateway: melhor opção geral para agentes de programação

O Vercel AI Gateway é a melhor escolha padrão porque elimina o trabalho de configuração que antes mantinha os gateways fora dos fluxos individuais com agentes de programação. Hoje, sua CLI consegue provisionar uma chave, exibir uma prévia das mudanças de configuração e preparar nove agentes compatíveis com vercel ai-gateway coding-agents setup.

Documentação do Vercel AI Gateway para agentes de programação
Vercel AI Gateway

A tabela de compatibilidade atual inclui Claude Code, Cline, OpenAI Codex, Cursor, Hermes, Kilo Code, OpenClaw, OpenCode e Pi. A Vercel também documenta caminhos manuais para outras ferramentas. Claude Code, Codex e Cursor têm endpoints de compatibilidade dedicados, já que o comportamento de seus protocolos exige mais do que a interface genérica da OpenAI. Esse é o recurso que muda a decisão de compra: o gateway deixa de ser apenas a infraestrutura por trás de uma aplicação própria. Ele pode operar por trás das ferramentas de programação que os engenheiros já usam.

Para uma equipe de produto com 12 pessoas, o resultado prático é um orçamento e uma política de fallback únicos para estilos de trabalho diferentes. Um engenheiro pode permanecer no Claude Code, outro pode rodar o Codex no terminal e um terceiro pode usar Cursor. Ainda assim, todas as requisições aparecem na mesma visão de gastos, sem obrigar a empresa a padronizar um único editor ou laboratório de modelos.

Ideal para: Equipes que usam vários agentes de programação e querem a configuração gerenciada mais rápida
Destaque: Um único fluxo pela CLI para nove agentes compatíveis, além de endpoints dedicados para Claude Code, Codex e Cursor
Preço: Crédito mensal grátis de $5; inferência paga pelo preço de tabela do provedor, sem markup sobre tokens
Teste grátis: Plano gratuito contínuo para modelos elegíveis, não um teste com prazo

Na camada básica, o preço é excepcionalmente simples. A página de preços atual da Vercel informa que não há markup nem taxa de plataforma sobre tokens. O plano grátis inclui $5 em créditos mensais, um subconjunto de modelos elegíveis e limites menores por modelo. A compra de créditos migra a conta para Pay as you go e encerra o crédito mensal gratuito. Bring Your Own Key só fica disponível após essa migração, e a Vercel não cobra taxa pelo BYOK.

Há duas ressalvas. A primeira: markup zero vale para a camada de tokens, não para todos os controles. Allowlist de provedores para a equipe e retenção zero de dados para a equipe custam, cada uma, $0.10 por 1,000 requisições. Trace drains custam $0.05 por 1,000 traces, mais $0.50 por GB de tráfego de saída. Relatórios personalizados têm métricas próprias de gravação e consulta. Uma equipe pequena pode ignorar a maior parte desses itens; uma equipe regulada deve colocá-los na conta antes de declarar que o gateway é gratuito.

A segunda ressalva: uma requisição BYOK que falha pode ser repetida com as credenciais de sistema da Vercel, debitando o uso do saldo de créditos do gateway. É um padrão sensato de confiabilidade, mas também um caso de borda para o orçamento. Se o financeiro espera que todas as requisições permaneçam em um contrato já existente com o provedor, o caminho de fallback precisa ser revisado — não presumido.

Os controles de roteamento são robustos o bastante para a maioria das equipes de produto. A Vercel documenta filtragem, ordenação e classificação de provedores, cache automático, timeouts de provedor e fallbacks entre modelos. Assim, o tráfego normal de conclusão de código pode ir para um provedor preferencial, um failover rápido pode entrar em ação quando a latência excede a tolerância e um modelo mais caro pode ficar reservado como última rota de recuperação.

O principal limite está na responsabilidade pela implantação. O Vercel AI Gateway é gerenciado. Ele não atende uma equipe que exige que o processo do gateway, o banco de dados, as chaves e os logs rodem dentro da própria rede. Nesse requisito, o LiteLLM vence antes mesmo de começar a comparação de recursos.

O ponto forte
O que faz bem
5 points

  • Um comando de configuração documentado para nove agentes de programação
  • Endpoints de compatibilidade dedicados para Claude Code, Codex e Cursor
  • Markup zero e nenhuma taxa de plataforma sobre tokens
  • Ordenação de provedores, timeouts, cache e fallbacks entre modelos
  • Uma fatura e uma visão de gastos para 200+ modelos
O ponto fraco
Onde deixa a desejar
4 points

  • Não oferece implantação self-hosted do gateway
  • BYOK exige o plano pago
  • Relatórios avançados, traces, allowlists e ZDR para a equipe têm cobranças próprias
  • O Cursor ainda exige cliques finais nas configurações da conta depois que a CLI provisiona a chave

Como configurar o Vercel AI Gateway sem transformar a migração em um projeto

A implantação mais segura preserva uma rota direta para o provedor e começa com apenas um repositório. Não altere todos os desenvolvedores e todos os agentes de uma só vez.

  1. Crie uma chave com limites para o piloto

    Crie uma chave de gateway exclusiva para o repositório piloto e defina um orçamento semanal ou mensal. Não reutilize uma chave corporativa de aplicação: os loops dos agentes de programação precisam de uma condição própria de parada.

  2. Execute o comando de configuração documentado

    Execute vercel ai-gateway coding-agents setup. Deixe a CLI detectar os agentes instalados, selecione apenas as ferramentas do piloto e revise o diff exibido antes de aceitar qualquer alteração na configuração.

  3. Mantenha um modelo principal e um fallback

    Comece com o modelo em que a equipe já confia. Adicione um único provedor ou modelo de fallback com comportamento semelhante no uso de ferramentas. Uma árvore grande de roteamento torna mais difícil explicar por que uma execução falhou.

  4. Valide identidade e rótulos de gastos

    Execute uma tarefa delimitada em cada agente configurado. Confirme se o dashboard identifica agente, modelo, provedor, uso de tokens, custo, latência e status do fallback como o comprador espera.

  5. Preserve a rota direta

    Mantenha a configuração anterior do provedor em um arquivo documentado de rollback. Se o gateway alterar o uso de ferramentas, a descoberta de modelos ou a latência, deve ser possível reverter o piloto em minutos.

2. Requesty: melhor para atribuir custos por branch, repositório e desenvolvedor

A Requesty é o melhor gateway quando o gestor de engenharia precisa relacionar o gasto com modelos ao trabalho que o originou. Sua integração com Claude Code pode marcar as requisições por branch, repositório, desenvolvedor e versão do agente, convertendo uma conta de tokens em dados que a equipe realmente consegue investigar.

Página de preços do gateway de IA Requesty
Requesty

Para equipes que executam migrações, branches de funcionalidades e revisões automatizadas em paralelo, essa atribuição vale mais do que uma taxa baixa. Uma equipe de SaaS B2B pode descobrir, por exemplo, que a revisão em segundo plano custa pouco, enquanto o loop de correção de testes de um único repositório consome a maior parte do orçamento mensal. A resposta passa a ser específica: ajustar a política daquele repositório ou modelo, em vez de cortar o acesso de todos os desenvolvedores.

Ideal para: Equipes que precisam detalhar o custo dos agentes de programação por branch, repositório ou desenvolvedor
Destaque: Tags analíticas do Claude Code, políticas de roteamento, residência de dados na UE e um gateway MCP
Preço: $0 em modelos gratuitos; o Pay as you go acrescenta 5% ao custo-base dos modelos; Enterprise sob consulta
Teste grátis: Plano gratuito com 200 requisições por dia e sem cartão de crédito

A página de preços atual da Requesty lista 600+ modelos distribuídos por 20+ provedores. O Pay as you go não cobra assinatura, licença por usuário, gasto mínimo nem taxa separada por roteamento, cache, fallback ou residência de dados na UE. Para $2,000 mensais em inferência cobrada ao preço dos provedores, o markup de 5% equivale a $100.

Vale a pena pagar esses $100 se os metadados evitarem uma execução descontrolada mais cara ou permitirem a alocação de custos. Para um desenvolvedor solo que só precisa trocar a URL-base, a conta é menos convincente. A OpenRouter divulga um catálogo mais amplo, enquanto a Vercel oferece uma rota mais simples, sem markup, para os agentes de programação compatíveis.

O plano Enterprise da Requesty adiciona SSO, RBAC, logs de auditoria, políticas de modelos aprovados, detecção de PII, orçamentos de grupo, contas de serviço para CI/CD e SLAs personalizados. Isso dá credibilidade ao produto em organizações maiores de engenharia, mas o preço é personalizado. Não é possível comparar o Enterprise sem uma proposta e um perfil representativo de requisições.

Há uma divergência na documentação que merece atenção. A página comercial de preços informa 600+ modelos, enquanto a página de integração com Claude Code, modificada em 10 de agosto de 2026, ainda fala em 300+ modelos. Esta análise usa a contagem maior para o catálogo pago porque é a página de preços vigente que define a oferta. Ainda assim, a inconsistência é motivo para conferir na biblioteca da conta os modelos exatos de que a equipe precisa, sem tratar nenhum dos dois números de marketing como garantia.

A configuração do Claude Code é mais restrita do que a CLI multiagente da Vercel, porém oferece uma atribuição mais detalhada. A CLI da Requesty pode gravar a configuração do Claude e fazer backup do arquivo existente. Um wrapper de shell opcional injeta, no início da sessão, headers de repositório, branch, usuário e versão do agente. O wrapper fica visível na configuração do shell, e os headers são removidos antes do encaminhamento ao provedor do modelo.

O limite está na cobrança percentual. O markup de 5% cresce junto com o gasto dos modelos, mesmo quando o trabalho do plano de controle do gateway permanece igual. Com $20,000 por mês, ele chega a $1,000. Um comprador maior deve comparar esse valor com a assinatura do Portkey, o custo operacional do LiteLLM e uma proposta Enterprise personalizada da Requesty.

O ponto forte
O que faz bem
5 points

  • Atribuição de custos por branch, repositório, desenvolvedor e versão do agente
  • 200 requisições grátis por dia em modelos gratuitos
  • Roteamento, cache, fallback, limites de gasto e residência de dados na UE no Pay as you go
  • Gateway MCP e contas de serviço para CI/CD
  • Sem assinatura, licença por usuário ou gasto mínimo no Pay as you go
O ponto fraco
Onde deixa a desejar
4 points

  • O markup de 5% cresce diretamente com o gasto de inferência
  • O preço do Enterprise exige uma proposta
  • A configuração multiagente é menos unificada do que a CLI da Vercel para nove agentes
  • As páginas vigentes divergem entre 300+ e 600+ modelos no catálogo

3. LiteLLM: melhor LLM gateway self-hosted

O LiteLLM é a melhor escolha quando o controle sobre a implantação e os dados pesa mais do que a conveniência. Seu proxy de código aberto é gratuito para uso self-hosted em produção e reúne 100+ provedores atrás de uma única API compatível com OpenAI.

Página de preços do gateway self-hosted LiteLLM
LiteLLM

Para um CTO de uma empresa média com uma fronteira de rede privada, o benefício é direto: chaves de modelos, tráfego de requisições, chaves virtuais, orçamentos, logs e métricas do Prometheus permanecem na infraestrutura operada pela empresa. Segundo o LiteLLM, o produto self-hosted não vê os dados nem o tráfego do cliente. Assim, nenhum gateway gerenciado fica no caminho dos dados enviados aos modelos.

Ideal para: Equipes de plataforma que exigem acesso a modelos self-hosted ou air-gapped
Destaque: Proxy de código aberto gratuito com 100+ provedores, chaves virtuais, orçamentos, fallback e Prometheus
Preço: Código aberto por $0; Enterprise anual, com preço personalizado por capacidade e implantação
Teste grátis: Teste Enterprise de 30 dias, sem cartão; a versão de código aberto continua gratuita

O preço do software é o número mais simples deste comparativo — e o mais propenso a interpretações erradas. O gateway de código aberto custa $0, inclusive em produção. Ele inclui usuários e equipes, acompanhamento de gastos, limites de requisições, logs de requisição e resposta e fallback entre LLMs. Não existe taxa de licença do LiteLLM por token.

O custo operacional, porém, não é $0. Alguém precisa implantar o proxy, gerenciar banco de dados e segredos, fazer o dimensionamento, monitorar, aplicar upgrades quando os provedores alterarem suas APIs, preservar logs, testar fallbacks e responder quando o gateway virar o ponto compartilhado de falha. O LiteLLM troca uma fatura de fornecedor por uma responsabilidade de infraestrutura. Pode ser um excelente negócio para uma equipe de plataforma e um péssimo acordo para uma startup com cinco pessoas.

O Enterprise acrescenta SSO, SCIM, autenticação OIDC ou JWT, logs de auditoria, integrações com gerenciadores de segredos, rotação de chaves, controles organizacionais, plano de controle multirregional, suporte, SLAs e implantação air-gapped. O preço é anual e depende da capacidade de requisições, da arquitetura de implantação e do suporte, e não dos tokens. Essa fronteira é importante: uma empresa regulada pode começar com o código aberto e ainda precisar do Enterprise assim que identidade, auditorias ou suporte ininterrupto se tornarem obrigatórios.

O LiteLLM também possui duas superfícies de produto que costumam ser confundidas. O SDK para Python é uma biblioteca de aplicação. Já o Proxy Server é o gateway centralizado, com autenticação, gastos multi-tenant, chaves virtuais e dashboard administrativo. Um rollout de agentes de programação que exija política compartilhada deve avaliar o proxy, em vez de simplesmente adicionar o SDK a alguns scripts.

A barreira para os agentes de programação está na documentação e na responsabilidade operacional. O LiteLLM oferece o endpoint compatível que muitos agentes podem usar, mas não entrega o instalador único e atual da Vercel para nove agentes identificados. As variáveis de ambiente, o formato de resposta, a descoberta de modelos e o uso de ferramentas ainda precisam ser validados em cada agente. O comportamento da Responses API no Codex e o protocolo Anthropic do Claude Code merecem testes piloto separados.

O ponto forte
O que faz bem
5 points

  • Licença de código aberto por $0 para self-hosting em produção
  • 100+ provedores por uma única API compatível com OpenAI
  • Chaves virtuais, orçamentos, rate limits, fallback, logs e métricas do Prometheus
  • Tráfego e chaves permanecem na infraestrutura operada pelo cliente
  • Caminho Enterprise para identidade, auditoria, air gap, suporte e controle multirregional
O ponto fraco
Onde deixa a desejar
4 points

  • O comprador assume disponibilidade, upgrades, armazenamento, escala e incidentes
  • O preço do Enterprise não é público
  • A configuração específica de cada agente é menos empacotada do que na Vercel
  • Um proxy central pode criar um novo domínio interno de falha se for implantado sem cuidado

4. OpenRouter: melhor para variedade de modelos e experimentos rápidos

A OpenRouter é o melhor gateway para comparar um grande mercado de modelos por meio de uma única conta. Sua página vigente do Pay as you go lista 500+ modelos de 80+ provedores, o maior catálogo divulgado entre os selecionados.

Página de preços do gateway OpenRouter
OpenRouter

Essa variedade é valiosa para um profissional técnico independente ou uma equipe pequena com forte foco em pesquisa. Um agente de programação consegue comparar um modelo de ponta para planejar o repositório, outro mais rápido para busca e classificação e um modelo aberto para transformações rotineiras, sem abrir uma conta de cobrança com cada provedor.

Ideal para: Comparação rápida de modelos e acesso a um mercado amplo de provedores
Destaque: 500+ modelos, 80+ provedores e um Auto Router orientado pela tarefa
Preço: $0 no plano grátis; o Pay as you go cobra uma taxa de plataforma de 5.5%; descontos Enterprise sob consulta
Teste grátis: Plano gratuito com 25+ modelos, 4 provedores e 50 requisições por dia

A contrapartida comercial é explícita. O plano Pay as you go da OpenRouter não exige gasto mínimo, mas aplica uma taxa de plataforma de 5.5%. Em $2,000 de créditos comprados, são $110. O Bring Your Own Key oferece hoje uma franquia mensal de $25,000 em inferência a preço de tabela antes de aplicar uma taxa de 5%. No Enterprise, a franquia sobe para $200,000, com descontos negociados sobre a taxa.

O plano grátis serve para confirmar a compatibilidade, mas é insuficiente para trabalho contínuo com agentes. Cinquenta requisições diárias podem acabar no meio de um loop longo de programação. Considere-o um teste de conexão, não o orçamento de uma equipe.

O Auto Router da OpenRouter é mais interessante do que a contagem bruta do catálogo. A documentação atual de roteamento informa que ele classifica os prompts em cerca de 30 tipos de tarefa — incluindo depuração de código e planejamento de agentes em várias etapas — e depois ranqueia os modelos pelo gasto agregado em uma janela móvel de sete dias. Capacidades, suporte a ferramentas, custo, restrições da conta e opções de fallback entram na decisão.

Esse sinal de mercado facilita a experimentação, mas reduz a reprodutibilidade. O roteador pode escolher um modelo diferente a cada turno. A afinidade de sessão dá preferência ao modelo anterior quando ele continua entre os melhores candidatos; ainda assim, uma mudança de tarefa pode alterar a seleção. Em um agente de programação que cria um patch ao longo de vários turnos, trocar de modelo no meio da sessão pode afetar a sintaxe das ferramentas, o estilo de raciocínio ou a disciplina da saída.

A solução não é abandonar o roteamento de modelos de IA, mas decidir onde ele deve ser usado. Aplique-o em avaliações, classificações de baixo risco ou etapas de apoio bem delimitadas. Para um patch crítico de release, fixe um modelo aprovado e uma política de provedor, a menos que a equipe já tenha testado a continuidade entre modelos.

A OpenRouter também oferece roteamento baseado em políticas e fallback entre provedores. Isso ajuda quando o mesmo modelo é comercializado por diferentes hosts de inferência. É menos útil se o comprador precisa de alocação de custos por repositório, controle self-hosted ou guardrails Enterprise gerenciados. Requesty, LiteLLM e Portkey são mais fortes nessas funções específicas.

O ponto forte
O que faz bem
5 points

  • Maior catálogo divulgado entre os selecionados: 500+ modelos e 80+ provedores
  • Comparação rápida de modelos sem criar contas separadas nos provedores
  • O Auto Router considera a tarefa atual e sinais de mercado
  • Fallback entre provedores, controles de gastos e roteamento por políticas
  • Plano gratuito para testes de compatibilidade
O ponto fraco
Onde deixa a desejar
4 points

  • A taxa de 5.5% do Pay as you go cresce junto com o gasto
  • O limite de 50 requisições diárias do plano grátis é pequeno demais para loops contínuos de agentes
  • O roteamento dinâmico pode trocar o modelo entre turnos
  • Menos configuração específica de agentes e atribuição por repositório do que as duas primeiras opções

5. Portkey: melhor camada gerenciada de governança

O Portkey é a melhor escolha quando o requisito financiado é um plano de controle gerenciado — não apenas um endpoint unificado. Seu gateway reúne fallbacks, roteamento condicional, novas tentativas, circuit breaker, balanceamento de carga, testes canário, suporte a MCP, orçamentos, rate limits, cache e guardrails.

Página de preços do gateway de IA Portkey
Portkey

Esse conjunto combina com uma equipe de plataforma de médio porte que está migrando de chaves individuais dos agentes para acessos aprovados. Uma política pode limitar os modelos, um orçamento pode impor um teto por equipe e um circuit breaker pode interromper chamadas repetidas a um provedor com falha. O produto foi feito para o momento em que “dar uma chave do gateway aos desenvolvedores” se transforma em um problema de identidade, políticas e gestão de incidentes.

Ideal para: Roteamento gerenciado, guardrails e governança em uma equipe de plataforma em crescimento
Destaque: Circuit breakers, testes canário, controles de MCP, roteamento condicional e um gateway local de código aberto
Preço: Developer por $0, Production por $49/mês, Enterprise personalizado
Teste grátis: O plano Developer é grátis para sempre, mas declarado inadequado para produção

Os limites dos planos são apresentados com rara franqueza. O plano Developer do Portkey registra 10,000 logs por mês, mantém os logs por três dias e as métricas por 30 dias. A própria página avisa de forma explícita que ele não é adequado para produção.

O Production custa $49 por mês e registra 100,000 logs; a cada 100,000 requisições adicionais, cobra $9 até o limite publicado. Os logs ficam disponíveis por 30 dias, e as métricas, por 90 dias. Com 200,000 logs registrados, a assinatura custa $58 antes da inferência upstream. A mesma página informa que o Production não é recomendado quando há exigência de controles personalizados de segurança ou garantias de residência de dados.

Para esses requisitos, o plano necessário é o Enterprise. O preço é personalizado, e o pacote inclui mais de 10 milhões de logs registrados, retenção sob medida, SSO, orçamentos e rate limits granulares, hospedagem em nuvem privada e VPC, exportação para data lake e conformidade avançada. É um salto significativo entre uma cobrança de $49 no cartão e um processo de compras corporativas.

O Portkey também publica um gateway local de código aberto, executado com npx @portkey-ai/gateway. Ele permite testar a superfície de roteamento ou hospedar o caminho dos dados internamente. Ainda assim, é importante separar o gateway local da observabilidade gerenciada, das políticas, do suporte e dos controles Enterprise que justificam a posição do Portkey neste ranking.

A transição atual do produto exige atenção. A documentação agora informa que o Portkey é o Prisma AIRS AI Gateway. As páginas do gateway e os preços continuam disponíveis, mas o comprador deve perguntar qual nome constará no contrato, qual roadmap vale e como as contas independentes do Portkey se encaixam no portfólio da Palo Alto Networks. É uma diligência de compras, não um motivo para descartar a ferramenta.

Para agentes de programação, o obstáculo está na configuração. O Portkey pode operar por trás de protocolos compatíveis e oferece um plano de controle geral mais profundo do que o da Vercel. Hoje, porém, não apresenta a mesma experiência de um comando para nove agentes. Escolha-o quando a política justificar o trabalho de integração, e não apenas porque sua lista de recursos é maior.

O ponto forte
O que faz bem
5 points

  • Roteamento gerenciado completo, com circuit breakers, novas tentativas, fallback e testes canário
  • Suporte a MCP, guardrails, orçamentos e rate limits
  • Plano Production público de $49, com métrica clara de logs registrados
  • Opção de gateway local de código aberto
  • Caminho Enterprise para SSO, implantação privada, residência de dados e conformidade
O ponto fraco
Onde deixa a desejar
5 points

  • O plano gratuito é declarado inadequado para produção
  • O Production de $49 é declarado inadequado para controles personalizados de segurança ou garantias de residência
  • O preço do Enterprise é personalizado
  • A configuração dos agentes de programação é menos empacotada do que na Vercel
  • A transição para Prisma AIRS gera dúvidas sobre contrato e roadmap

6. Cloudflare AI Gateway: melhor para equipes que já usam Workers

O Cloudflare AI Gateway é a alternativa de menor atrito quando a Cloudflare já cuida da borda, dos logs e da segurança da aplicação. Hoje, os recursos essenciais do gateway são gratuitos em todos os planos, incluindo analytics, cache e rate limiting.

Documentação de preços do Cloudflare AI Gateway
Cloudflare AI Gateway

O produto é atraente para uma equipe cujo agente ou plataforma interna de desenvolvimento já roda em Workers. Pela mesma conta, é possível chamar modelos de terceiros e da Cloudflare por uma interface REST compatível com OpenAI, registrar custos e erros, guardar em cache repetições seguras, aplicar rate limits, procurar dados sensíveis e repetir chamadas que falharam.

Ideal para: Equipes que já usam Workers, logs da Cloudflare ou controles de segurança da Cloudflare
Destaque: Gateway básico gratuito, integração com edge, DLP, cache e acesso compatível com OpenAI a modelos de terceiros
Preço: Recursos essenciais por $0; compras de crédito via Unified Billing acrescentam 5%; guardrails seguem os preços do Workers AI
Teste grátis: Os recursos essenciais do gateway são gratuitos, não limitados por prazo

A página de preços define claramente a fronteira da oferta gratuita. O Workers Free armazena 100,000 logs no total, somando todos os gateways. O Workers Paid armazena 10 milhões de logs por gateway. Logs persistentes, analytics, cache e rate limiting estão disponíveis em todos os planos.

O Unified Billing acrescenta uma taxa de 5% quando os créditos são comprados pela Cloudflare. Portanto, uma compra de $2,000 em créditos custa $2,100, enquanto a inferência do provedor continua sendo repassada sem markup. A diferença é importante: o preço do modelo não muda, mas a consolidação de credenciais e cobrança tem uma taxa.

O escaneamento de Data Loss Prevention é gratuito em todos os planos. Contas sem uma assinatura Zero Trust recebem dois perfis DLP predefinidos; os demais perfis dependem da assinatura do Cloudflare One. Guardrails não fazem parte do núcleo gratuito: a Cloudflare cobra a avaliação de prompts e respostas como inferência de tokens do Workers AI.

A Cloudflare também oferece controles úteis por requisição. Sua documentação REST permite timeouts por chamada, métodos de repetição, até cinco tentativas e um atraso de até 5,000 milissegundos entre elas. Esses controles evitam que um provedor lento prenda indefinidamente o loop de um agente.

A barreira está na ergonomia dos agentes de programação. A Cloudflare explica como aplicações chamam o gateway, mas não oferece a mesma camada de configuração para agentes identificados encontrada na Vercel nem o fluxo de Claude Code da Requesty. Cabe ao profissional validar, em cada agente, a troca de URL-base, autenticação, descoberta de modelos e protocolo. A linha de software pode custar $0, enquanto a linha de integração fica com a equipe de engenharia.

O ponto forte
O que faz bem
5 points

  • Analytics, cache e rate limiting essenciais são gratuitos
  • Acesso compatível com OpenAI a modelos da Cloudflare e de terceiros
  • Escaneamento DLP grátis em todos os planos
  • Excelente encaixe com Workers, logs e produtos de segurança da Cloudflare
  • Controles explícitos de repetição e timeout
O ponto fraco
Onde deixa a desejar
5 points

  • O Unified Billing acrescenta 5% às compras de crédito
  • O armazenamento gratuito de logs é limitado a 100,000 no total da conta
  • Guardrails geram cobranças separadas de inferência do Workers AI
  • Não há uma configuração comparável por um comando para agentes de programação
  • O conjunto completo de perfis DLP pode exigir uma assinatura Zero Trust separada

Qual LLM gateway é indicado para cada perfil?

O melhor gateway é aquele que elimina o custo de coordenação atual da equipe sem criar uma carga operacional ainda maior. Comece pela restrição que não pode ser negociada e só depois compare as taxas.

Escolha o Vercel AI Gateway para um grupo heterogêneo que usa Claude Code, Codex, Cursor, OpenCode e agentes semelhantes. A escolha muda quando self-hosting é obrigatório ou quando o custo precisa ser relacionado a repositório e desenvolvedor, e não apenas a agente, chave e modelo.

Escolha a Requesty para uma agência, consultoria ou empresa de produto que precise atribuir gastos por branch, repositório e desenvolvedor. A decisão muda quando esses metadados não influenciam nenhuma escolha orçamentária, pois nesse caso o markup de 5% compra informações que ninguém usa.

Escolha o LiteLLM para uma equipe de plataforma que já tenha práticas consolidadas de containers, bancos de dados, segredos, logs e plantão. A decisão muda para um gateway gerenciado quando a responsabilidade pelo proxy cair informalmente sobre um engenheiro de produto.

Escolha a OpenRouter enquanto um profissional solo ou uma equipe de pesquisa ainda estiver comparando modelos e provedores. A decisão muda depois que a lista se estabiliza e a taxa recorrente de 5.5% passa a custar mais do que o acesso ao catálogo amplo vale.

Escolha o Portkey quando modelos aprovados, guardrails, circuit breakers, testes canário e governança gerenciada forem o motivo da compra. A decisão muda quando a organização precisa apenas de um endpoint e um dashboard de gastos.

Escolha o Cloudflare AI Gateway quando Workers e a segurança da Cloudflare já forem conhecidos e pagos. A decisão muda quando adotar toda a plataforma ao redor gera mais trabalho de integração do que o gateway elimina.

Fluxo de decisão que associa requisitos de agentes de programação a seis gateways de IA
Comece pela restrição inegociável; depois, compare as taxas dos gateways

Há mais uma regra: não confunda a decisão do gateway com a escolha do agente. Claude Code, Codex e Cursor resolvem tarefas de engenharia diferentes, enquanto o gateway controla o tráfego desses agentes para os modelos. Uma empresa pode padronizar o gateway sem padronizar o editor. Muitas vezes, essa é a fronteira de controle mais útil.

Para ampliar a lista de agentes, veja a comparação dos melhores agentes de IA para programação. Para questões de SSO, retenção, auditoria e rollout que ultrapassam o gateway, consulte a comparação de agentes de programação para empresas.

Quais opções evitar neste cenário

Evite comprar o Helicone como solução principal quando o problema imediato é configurar os agentes de programação. O plano Hobby do Helicone é gratuito para 10,000 requisições; o Pro custa $79 por mês, e o Team, $799 por mês. Seus recursos de observabilidade, sessões, prompts e análise podem ser valiosos. O ranking só muda quando a falta de visibilidade é o problema central. Para esta busca, ele não supera a configuração atual da Vercel, a atribuição por repositório da Requesty nem o controle de implantação do LiteLLM.

Evite escolher um gateway de API genérico apenas porque a empresa já o possui. Gateways tradicionais entendem rotas, autenticação e políticas HTTP. O tráfego de agentes de programação acrescenta modelos específicos de provedores, contabilização de tokens, compatibilidade com ferramentas, cache de prompts, fallback entre modelos e vários protocolos de resposta. Estender um gateway geral pode fazer sentido para uma equipe de plataforma, mas “já usamos Kong” não é um plano de implementação.

Evite um proxy passthrough feito internamente quando vários agentes já dependem dele. Trocar uma URL-base é fácil. Manter adaptadores de provedores, novas tentativas seguras, respostas por streaming, contadores de orçamento, isolamento de chaves, retenção de logs e descontinuações de modelos é construir um produto. Só faça isso quando uma política ou restrição de implantação exclusiva justificar a responsabilidade permanente.

Evite roteamento dinâmico de modelos em todas as etapas de um loop crítico de release enquanto a continuidade entre modelos não tiver sido avaliada. Um roteador pode escolher o modelo mais eficiente para cada tarefa e, ainda assim, dificultar a reprodução de um patch longo. Fixe o modelo nas etapas que produzem alterações; use o roteamento dinâmico em trabalhos de apoio bem delimitados.

Por fim, evite migrar todos os desenvolvedores no primeiro dia. Um gateway pode alterar autenticação, descoberta de modelos, cache, comportamento de erros e seleção de fallback sem mudar a aparência da interface do agente. É por isso que um piloto delimitado e uma rota direta de rollback para o provedor fazem parte do rollout.

Perguntas frequentes

Qual é o melhor LLM gateway?

O Vercel AI Gateway é a melhor escolha padrão para agentes de programação porque combina a configuração por um comando para nove agentes compatíveis com markup zero sobre tokens. O LiteLLM é melhor quando self-hosting é obrigatório; a Requesty, quando a atribuição por repositório e desenvolvedor é a prioridade; e o Portkey, quando o motivo da compra é a governança gerenciada.

Quais são os preços e as taxas da OpenRouter em 2026?

O plano Pay as you go vigente da OpenRouter cobra uma taxa de plataforma de 5.5%, inclui 500+ modelos e 80+ provedores e não exige gasto mínimo. O plano grátis é limitado a 25+ modelos gratuitos, 4 provedores e 50 requisições por dia. A franquia BYOK atual do Pay as you go cobre $25,000 mensais de inferência a preço de tabela antes da aplicação de uma taxa de 5%.

Quanto custa o Cloudflare AI Gateway em 2026?

Os recursos essenciais do Cloudflare AI Gateway são gratuitos. Compras de crédito pelo Unified Billing acrescentam 5%; o Workers Free armazena 100,000 logs em toda a conta; o Workers Paid armazena 10 milhões de logs por gateway; e guardrails são cobrados separadamente como inferência do Workers AI.

Um mesmo gateway pode rotear Claude Code e Codex?

Sim. O gateway precisa aceitar os protocolos esperados por cada agente ou oferecer endpoints de compatibilidade dedicados. A Vercel documenta endpoints separados para Claude Code e Codex, enquanto gateways self-hosted e genéricos exigem que o comprador valide a configuração de cada agente.

O que fazer na próxima segunda-feira

Não use a segunda-feira para migrar a empresa inteira. Use-a para provar que um gateway consegue reduzir a incerteza de custos e o risco dos provedores em um repositório representativo.

Segunda-feira: defina a fronteira de controle

Escolha um repositório, um grupo pequeno de desenvolvedores e os dois agentes de programação que eles já usam. Resuma o motivo financiado em uma frase: consolidar a cobrança, recuperar falhas do provedor, atribuir gastos, impor modelos aprovados ou manter o tráfego em uma implantação privada. Se a frase trouxer três objetivos sem relação entre si, reduza o escopo do piloto.

Crie uma chave exclusiva do gateway com um teto rígido de gastos. Selecione um modelo principal e um fallback com suporte semelhante a ferramentas. Preserve a configuração direta do provedor em um arquivo de rollback e registre a conta atual do provedor antes de mover qualquer tráfego.

Terça-feira: conecte e inspecione o diff

Na Vercel, execute o comando documentado de configuração e revise todas as mudanças antes da gravação. Na Requesty, faça backup das configurações do Claude Code e ative somente os headers de atribuição que a equipe realmente usará. No LiteLLM, implante o proxy pelo fluxo habitual de infraestrutura, não em um notebook. Em todos os gateways, confirme que os segredos chegam ao armazenamento aprovado.

Execute uma issue de escopo bem definido em cada agente. Confira seleção do modelo, uso de ferramentas, streaming, erros, cache, custo e a identidade vinculada à requisição. Uma resposta bem-sucedida não basta se o dashboard não consegue explicar quem gastou o dinheiro ou qual fallback respondeu.

Quarta e quinta-feira: force o caminho de falha

Provoque um timeout controlado ou use uma rota de teste que envie o modelo principal a um provedor indisponível. Confirme que o fallback preserva o protocolo esperado pelo agente de programação. Verifique se a tentativa com falha é cobrada, se o fallback usa outra credencial e se o trace identifica as duas tentativas.

Dê ao piloto uma correção rotineira de bug, uma alteração em vários arquivos, um loop de reparo de testes e uma tarefa de revisão. Registre custo por tarefa concluída, falhas de provedores, requisições recuperadas, tempo gasto na configuração e atritos relatados pelos desenvolvedores. Não compare contagens de prompts sem levar em conta o resultado do trabalho.

Sexta-feira: compre o controle que mudou uma decisão

Adote o gateway somente se as informações ou a confiabilidade oferecidas por ele alterarem uma decisão operacional. Uma requisição recuperada importa. Um orçamento de repositório estourado importa. Uma violação da política de provedores importa. Um dashboard cheio de gráficos de tokens que nenhum responsável consulta não importa.

Para a maioria das equipes que mistura agentes, a escolha de segunda-feira é o Vercel AI Gateway com uma chave piloto, um modelo principal, um fallback e nenhum add-on pago até que uma política o exija. A escolha muda para a Requesty quando a responsabilidade pelos custos precisa chegar ao repositório e ao desenvolvedor. E muda para o LiteLLM quando o caminho dos dados precisa permanecer dentro da infraestrutura da empresa.

Mantenha a configuração do gateway versionada, a rota de rollback documentada e a política de modelos enxuta. O objetivo não é passar por mais fornecedores. É fazer com que a próxima indisponibilidade de um provedor, lançamento de modelo ou revisão de orçamento exija apenas uma mudança de configuração, e não uma migração da empresa inteira.

Última atualização

3 de set. de 2026

CategoriaBuild

Prefira este site no Google

Adicionar omidsaffari.com como fonte preferida na Busca do Google

Marque omidsaffari.com como fonte preferida e o Google destaca o site para você em Top Stories, AI Overviews e AI Mode.

Newsletter

Uma carta, todo domingo. Sistemas que funcionam, não hot takes.

Build logs, sistemas em produção e notas de campo de um portfólio de ventures de IA.

Semanal. Sem spam. Cancele quando quiser.