API de IA gratuita ou barata: 8 opções comparadas

Compare 8 APIs de IA gratuitas ou baratas, veja preços por milhão de tokens e escolha a melhor opção para protótipos, produção e baixa latência.

Thursday, September 3, 2026Omid Saffari
API de IA gratuita ou barata: 8 opções comparadas

Para quem procura uma API de IA gratuita ou barata, a DeepInfra tem o menor preço de tabela desta comparação: o Mistral Nemo custa $0.019 por milhão de tokens de entrada e $0.03 por milhão de tokens de saída. Já o DeepSeek V4 Flash é a opção econômica mais sólida para produção, por $0.14/$0.28, com JSON, chamadas de ferramentas e janela de contexto de 1M tokens; para protótipos gratuitos, o Gemini 2.5 Flash-Lite leva a melhor. A API mais barata que realmente serve é aquela que atende ao patamar mínimo de qualidade, privacidade e latência da carga de trabalho.

API de IA gratuita ou barata: o veredito em resumo

DeepSeek V4 Flash é a melhor API de IA barata para a maioria das cargas de texto em produção. A tarifa padrão é baixa o bastante para que 10 milhões de tokens de entrada mais 2 milhões de tokens de saída custem $1.96. O mesmo modelo oferece saída em JSON, chamadas de ferramentas, Responses API e janela de contexto de 1M tokens. Esse conjunto pesa mais do que economizar a última fração de dólar.

Há três vencedores porque “mais barata” pode significar três necessidades diferentes:

  • DeepInfra é a mais barata no preço bruto por token. O Mistral Nemo custa $0.019 por milhão de tokens de entrada e $0.03 por milhão de tokens de saída.
  • Google Gemini é a opção mais barata para protótipos. O Gemini 2.5 Flash-Lite oferece um plano gratuito; depois, no plano Standard pago, custa $0.10 por milhão de tokens de entrada e $0.40 por milhão de tokens de saída.
  • DeepSeek é a alternativa mais barata como padrão competente de produção. O V4 Flash custa $0.14 na entrada e $0.28 na saída por milhão de tokens sem acerto de cache, com os recursos de API exigidos pela maioria dos backends.

Todos os preços abaixo foram conferidos nas páginas oficiais de preços ou documentação dos fornecedores em 10 de agosto de 2026. Os valores são por 1 milhão de tokens de entrada/saída, salvo indicação diferente na célula.

FerramentaMelhor paraPreço inicialTeste grátis
DeepSeekOpção econômica padrão para produção$0.14 / $0.28Nenhum plano permanente informado
Google GeminiProtótipos gratuitos e entrada multimodalGrátis; pago $0.10 / $0.40Sim, plano gratuito
DeepInfraMenor preço bruto por token$0.019 / $0.03Não; exige cartão ou pré-pagamento
GroqRespostas baratas e de baixa latência$0.05 / $0.08Não informado publicamente
MistralAPI direta de modelos pequenos$0.10 / $0.10Apenas alguns endpoints gratuitos
SiliconFlowCatálogo multimodelo de baixo custo$0.04 / $0.18$1 em créditos
OpenRouterUma chave e troca fácil de modelosVariantes grátis por $0; modelos pagos variamPequena franquia e variantes gratuitas
OpenAIMigração convencional de menor risco$0.20 / $1.20Nenhum plano permanente de API informado

A tabela não classifica qualidade. Um modelo 3B de $0.10/$0.10 e um modelo atual de produção de $0.14/$0.28 são produtos diferentes, mesmo que ambos aceitem uma requisição de chat completions. Use o preço de tabela para selecionar candidatos e o seu próprio teste de aceitação para definir o vencedor.

Quanto custam 20,000 requisições de IA

Em volumes pequenos e médios, todos os fornecedores desta lista são baratos o bastante para que uma única decisão ruim de workflow custe mais do que a conta de tokens. Ainda assim, vale comparar uma carga normalizada, pois ela revela preços altos de saída e taxas que uma tarifa isolada de entrada esconde.

Considere um produto que faça 20,000 chamadas por mês. Cada chamada contém 500 tokens de entrada e devolve 100 tokens de saída. O total é de 10 milhões de tokens de entrada e 2 milhões de tokens de saída:

Custo mensal = 10 × preço de entrada + 2 × preço de saída.

RotaModelo econômicoCusto mensalPonto de atenção
DeepInfraMistral Nemo$0.25Menor preço de tabela, mas em um modelo pequeno e antigo
GroqLlama 3.1 8B Instant$0.66Velocidade e preço vêm antes da profundidade
SiliconFlowGPT OSS 20B$0.76O baixo preço depende de um modelo open-weight
OpenRouterDeepSeek V4 Flash Latest$1.304 mais taxa de créditosUma só cobrança; taxa de 5.5% com mínimo de $0.80
Google GeminiGemini 2.5 Flash-Lite$1.80 Standard; $0.90 Batch/FlexConteúdo do plano Free pode ser usado para melhorar produtos Google
DeepSeekDeepSeek V4 Flash$1.96O fornecedor avisa que haverá um aumento expressivo
MistralMistral Small 4$2.70Recursos mais completos que os da opção 3B básica, mas saída mais cara
OpenAIGPT-5.6 Luna$4.40 Standard; $2.20 Batch/FlexConveniente, porém a saída custa seis vezes a entrada
Escada de custos com quatro rotas de API de IA: preço bruto, velocidade, opção padrão e fornecedor convencional
A mesma carga de 10M de entrada e 2M de saída custa de $0.25 a $4.40 antes de considerar novas tentativas por qualidade ou revisão humana.

A diferença parece enorme em termos percentuais e pequena em dólares. Nessa carga, o DeepSeek custa $1.71 a mais que o Mistral Nemo da DeepInfra. O OpenAI Luna custa $2.44 a mais que o DeepSeek. Se o modelo mais barato quebrar um schema, ignorar uma solicitação do cliente ou criar uma fila de revisão manual, a economia desaparece depressa.

Esse é o patamar mínimo de qualidade: o comportamento mínimo que a tarefa aceita sem trabalho compensatório. Um endpoint de classificação com cinco rótulos permitidos tem exigência baixa. Uma resposta de suporte ao cliente baseada em dados da conta exige muito mais. Um agente autorizado a atualizar registros eleva ainda mais esse patamar, porque o custo de uma ação incorreta não se resume a outra chamada de API.

O preço da saída merece atenção especial. Um sumarizador pode ler um documento longo e retornar algo curto, deixando a entrada dominar o custo. Já um agente de programação, um gerador de e-mails comerciais ou um assistente conversacional pode produzir muito mais saída. A tarifa de saída de $1.20 do OpenAI Luna é seis vezes a entrada de $0.20; no Mistral Small 4, os $0.60 da saída equivalem a quatro vezes os $0.15 da entrada. Preços iguais de entrada e saída em modelos minúsculos parecem atraentes para trabalhos com muita geração, mas só quando esses modelos concluem a tarefa.

1. DeepSeek: a melhor opção econômica para produção

DeepSeek é o candidato inicial mais forte quando uma aplicação em produção precisa reduzir o custo por token sem abrir mão de JSON, ferramentas ou contexto longo. O V4 Flash 0731 custa $0.14 por milhão de tokens de entrada sem acerto de cache e $0.28 por milhão de tokens de saída. A API informa contexto de 1M tokens, saída máxima de 384K, JSON, chamadas de ferramentas, Responses API e uma rota compatível com Anthropic. É um conjunto de recursos para produção mais completo que o oferecido pela maioria dos modelos próximos à base da faixa de preços.

Página de modelos e preços da API do DeepSeek
DeepSeek

O limite está na previsibilidade do orçamento. A própria página de preços do DeepSeek informa que pretende aumentar os preços de modo geral em breve e que o reajuste deverá ser expressivo. Uma startup pode aproveitar hoje o custo normalizado de $1.96, mas uma equipe de compras não deve inserir esse número em uma projeção anual sem margem de segurança ou uma segunda rota.

Melhor para: Extração em produção, geração estruturada, agentes econômicos e tarefas com contexto longo
Destaque: Contexto de 1M, JSON, chamadas de ferramentas, Responses API e suporte à API da Anthropic
Preço: $0.14 na entrada, $0.0028 na entrada com acerto de cache e $0.28 na saída por 1M tokens no V4 Flash
Teste grátis: Nenhum plano gratuito permanente informado na página de preços

O ponto forte
O que faz bem
4 points

  • $1.96 pela carga normalizada de 10M de entrada e 2M de saída
  • Contexto de 1M tokens e saída de até 384K
  • Saída em JSON e chamadas de ferramentas na faixa econômica
  • Limite de concorrência publicado de 2,500 para o V4 Flash
O ponto fraco
Onde deixa a desejar
3 points

  • O fornecedor já avisou que os preços subirão de forma expressiva
  • Não há um plano gratuito permanente publicado
  • Uma rota externa de baixo custo ainda exige análise de privacidade, confiabilidade e região para o caso de uso do comprador

Por que o DeepSeek fica em primeiro lugar

O DeepSeek vence quando um modelo barato precisa fazer mais do que rotular textos. Pense em um produto SaaS B2B que extrai data de renovação, valor do contrato, prazo de aviso e riscos identificados em contratos enviados pelos usuários. É possível conferir a resposta contra um schema, mas o modelo ainda precisa de contexto suficiente para ler um documento longo e de boa aderência às instruções para devolver todos os campos. O V4 Flash reúne custo e recursos de API na medida certa para a primeira avaliação.

A tarifa de entrada com acerto de cache é excepcionalmente baixa: $0.0028 por milhão de tokens. Isso faz diferença quando as mesmas instruções estáveis ou o mesmo prefixo de referência se repetem. Não significa que todo token de entrada custe $0.0028; apenas os acertos de cache recebem essa tarifa. Calcule o orçamento com os cache misses a $0.14 até que os dados de uso comprovem a taxa de acerto.

Como avaliar o DeepSeek em uma semana

  1. Escolha uma tarefa delimitada

    Comece por extração, classificação, sumarização ou uma ação de agente somente leitura. Defina os campos, as saídas permitidas e as condições de falha antes de enviar tráfego.

  2. Monte um conjunto de avaliação com 100 requisições

    Use solicitações representativas e sanitizadas da carga real. Inclua entradas curtas, longas, ambíguas, malformadas e casos extremos para que a rota mais barata não vença por receber apenas exemplos fáceis.

  3. Exija uma saída validável por máquina

    Use JSON quando a tarefa tiver um schema. Para cada chamada, registre taxa de schemas válidos, taxa de respostas aceitas, latência, tokens de entrada, tokens de saída e acertos de cache.

  4. Mantenha o modelo atual como fallback

    Encaminhe falhas de validação, casos de baixa confiança e ações com consequências relevantes para a rota atual já confiável. A primeira implantação deve ser reversível.

  5. Crie um alerta de mudança de preço

    O DeepSeek informou que os preços subirão. Recalcule a carga normalizada quando o fornecedor publicar a nova tarifa, em vez de transformar um preço temporário em premissa arquitetural.

Escolha o DeepSeek se o V4 Flash passar na tarefa e a organização tolerar variação de preços. Descarte-o quando uma tarifa unitária anual fixa, uma região específica de processamento ou o relacionamento com um fornecedor já estabelecido pesarem mais que a diferença de tokens.

2. Google Gemini: a melhor API de IA gratuita

Google Gemini é a melhor rota gratuita para um protótipo que trabalha com dados sanitizados. O Gemini 2.5 Flash-Lite oferece tokens de entrada e saída gratuitos no plano Free. Quando a aplicação migra para o Paid, o preço Standard é de $0.10 por milhão de tokens de texto, imagem ou vídeo na entrada e $0.40 por milhão de tokens na saída; Batch e Flex reduzem essas tarifas pela metade, para $0.05/$0.20.

Página de preços da API Google Gemini Developer
Google Gemini

O plano gratuito traz uma consequência de privacidade que precisa entrar na decisão, não ficar escondida em nota de rodapé. A página de preços do Google informa que o conteúdo do plano Free é usado para melhorar seus produtos; o conteúdo do Paid não é. O gratuito faz sentido para prompts sintéticos, documentos públicos e conjuntos de teste de desenvolvedores, mas não deve ser a escolha padrão para registros de clientes, documentos confidenciais ou código ainda não lançado.

Melhor para: Protótipos gratuitos, entradas multimodais, processamento em lote e workflows de documentos sensíveis a custo
Destaque: Entrada e saída gratuitas, além de entrada paga para texto, imagem, vídeo e áudio
Preço: Plano Free; Paid Standard a $0.10 para entrada de texto/imagem/vídeo e $0.40 para saída; Batch/Flex a $0.05/$0.20
Teste grátis: Sim, plano Free com acesso limitado a modelos

O ponto forte
O que faz bem
4 points

  • Tokens de entrada e saída gratuitos no plano Free
  • $1.80 pela carga normalizada no Paid Standard
  • $0.90 pela mesma carga assíncrona em Batch ou Flex
  • O plano Paid inclui cache de contexto e não usa o conteúdo para melhorar produtos Google
O ponto fraco
Onde deixa a desejar
3 points

  • O conteúdo do plano Free é usado para melhorar produtos Google
  • O acesso gratuito é limitado por modelo e cota
  • A entrada de áudio custa $0.30 por milhão de tokens no Standard, três vezes o valor de texto/imagem/vídeo

Da API gratuita ao plano pago

Quem está validando um recurso de etiquetagem de documentos em uma startup pode usar o plano Free com documentos públicos ou gerados, conferir o formato das respostas e entender o perfil de tokens antes de ativar a cobrança. Quando documentos de clientes entram no fluxo, migrar para o Paid não é apenas uma questão de volume: a condição de uso do conteúdo muda, e passam a existir limites maiores de produção, cache de contexto e acesso ao Batch.

Na carga normalizada, o Paid Standard custa $1.80; Batch ou Flex, $0.90. Pelo preço de tabela, isso deixa o Gemini mais barato que o DeepSeek para trabalho assíncrono, embora a escolha certa continue dependendo do modelo que atende à tarefa. Se o resultado não precisar ser imediato, vale testar a redução de 50% antes de trocar de fornecedor.

O Gemini também aceita imagem e vídeo pelo mesmo preço de entrada Standard de $0.10 aplicado ao texto no 2.5 Flash-Lite. Isso o torna um candidato mais forte que pequenos modelos restritos a texto quando o workflow lê recibos, capturas de tela ou imagens de produtos. A página de preços descreve o Flash-Lite como o menor e mais econômico modelo do Google para uso em escala — o ponto de partida certo antes de avançar para um Gemini maior.

Escolha o Gemini quando o projeto precisar começar gratuitamente, receber entradas multimodais ou processar tarefas assíncronas pela metade do preço. Evite o plano Free com dados sensíveis e descarte o Flash-Lite quando o teste de aceitação indicar a necessidade de um modelo maior.

3. DeepInfra: o menor preço bruto por token

DeepInfra vence no preço bruto: $0.019 na entrada e $0.03 na saída por milhão de tokens com o Mistral Nemo Instruct. A carga normalizada de 20,000 requisições custa $0.25. A DeepInfra também lista o Meta Llama 3.1 8B por $0.02/$0.04 e o DeepSeek V4 Flash por $0.09/$0.18, permitindo subir a escada de modelos no mesmo host sem abrir outra conta de cobrança.

Página de preços dos modelos de geração de texto da DeepInfra
DeepInfra

O limite é o modelo por trás do preço. Mistral Nemo e Llama 3.1 8B são baratos porque são modelos abertos, pequenos e antigos. Uma tarefa rígida de rotulagem talvez não precise de mais. Já um workflow voltado ao cliente só deve adotar esse preço baixo como premissa depois que a avaliação própria comprovar que a saída é aceitável.

Melhor para: Classificação de alto volume e baixo risco, etiquetagem, extração simples e experimentos de preço entre modelos
Destaque: A menor tarifa publicada de tokens para geração de texto nesta comparação
Preço: Mistral Nemo a $0.019 na entrada/$0.03 na saída; Llama 3.1 8B a $0.02/$0.04
Teste grátis: Não; a DeepInfra exige cartão ou pré-pagamento

O ponto forte
O que faz bem
4 points

  • $0.25 pela carga normalizada com o Mistral Nemo
  • Catálogo amplo de modelos de texto, embeddings, imagem, áudio e vídeo
  • Agendamentos Standard, Priority e Flex, este último mais barato
  • Escala automática com limite publicado de 200 requisições simultâneas por conta
O ponto fraco
Onde deixa a desejar
3 points

  • A menor tarifa compra um modelo pequeno, não uma opção padrão universal de produção
  • É necessário cadastrar cartão ou fazer pré-pagamento
  • O Flex pode ser mais lento e ficar indisponível ocasionalmente

Quando usar DeepInfra em tarefas de resposta limitada

Um marketplace de serviços locais que classifica mensagens recebidas como quote, reschedule, cancel, billing ou other trabalha com um espaço de saída estreito. O sistema pode rejeitar qualquer valor fora dessas cinco opções e enviar casos ambíguos a um fallback. Esse é o tipo de tarefa em que um modelo de $0.019/$0.03 merece ser avaliado.

Um assistente de suporte que responde a perguntas específicas sobre uma conta é outra história. Ele precisa recuperar o registro correto, seguir políticas, preservar nuances e evitar respostas erradas dadas com confiança. Economizar $1.71 em relação ao DeepSeek na carga normalizada não justifica transferir esse trabalho ao Mistral Nemo sem um resultado de aceitação mais forte.

Os níveis de serviço da DeepInfra oferecem outro ajuste. Standard custa 1× a tarifa-base. Priority custa 1.5× para obter agendamento mais rápido nos horários de pico. Flex custa 0.8× em troca de respostas mais lentas e indisponibilidade ocasional. Use Flex para backfills, enriquecimento offline ou uma fila noturna que aceite novas tentativas. Não coloque nele uma resposta interativa ao cliente só para cortar 20% de uma conta que já é medida em centavos.

Escolha a DeepInfra quando uma tarefa restrita e um validador robusto tornarem repetível a economia dos modelos pequenos. Evite a linha mais barata para escrita aberta, raciocínio complexo e ações capazes de alterar dados de clientes ou da empresa.

4. Groq: barata quando a latência importa

Groq é a escolha econômica para experiências interativas que precisam parecer instantâneas. A rota de produção Llama 3.1 8B Instant aparece com cerca de 560 tokens por segundo, a $0.05 por milhão de tokens de entrada e $0.08 por milhão de tokens de saída. A carga normalizada custa $0.66 — apenas $0.41 acima da vencedora em preço bruto, a DeepInfra.

Tabela da Groq com modelos de produção, velocidade, preço e contexto
Groq

A contrapartida está na profundidade do modelo e na estabilidade do catálogo. A rota mais barata usa um modelo 8B. A Groq separa os modelos prontos para produção e avisa que modelos preview podem ser descontinuados com pouca antecedência; portanto, um preço exibido em uma linha preview não representa compromisso de produção.

Melhor para: Classificação de baixa latência, autocomplete, interfaces conversacionais e roteamento rápido na primeira etapa
Destaque: Cerca de 560 tokens de saída por segundo no modelo de produção mais barato
Preço: Llama 3.1 8B Instant a $0.05 na entrada/$0.08 na saída; GPT OSS 20B a $0.075/$0.30
Teste grátis: Os termos públicos de teste não foram informados nas páginas de documentação consultadas

O ponto forte
O que faz bem
4 points

  • $0.66 pela carga normalizada no Llama 3.1 8B
  • Cerca de 560 tokens por segundo no Llama 3.1 8B
  • URL-base compatível com a OpenAI e formato de API familiar
  • Separação clara entre modelos de produção e preview
O ponto fraco
Onde deixa a desejar
3 points

  • A opção de produção mais barata é apenas um modelo 8B
  • É preciso conferir no painel os limites de uso específicos da conta
  • A disponibilidade de modelos preview pode mudar com pouca antecedência

Latência também entra no custo do produto

Um produto de voz ou chat ao vivo paga pela demora em conversas abandonadas e interações desconfortáveis, mesmo quando a fatura da API continua baixa. A Groq faz sentido se o modelo for bom o bastante e a velocidade for o gargalo. Um roteador curto de intenções, que decide qual workflow cuidará da mensagem, se encaixa melhor do que uma resposta de suporte carregada de regras.

A página do modelo informa uma janela de contexto de 131,072 tokens para o Llama 3.1 8B, mas capacidade de contexto não equivale a qualidade no uso desse contexto. Aceitar um prompt longo não garante que o modelo aproveite corretamente cada detalhe relevante. Mantenha a primeira carga na Groq curta, delimitada e verificável por máquina.

A rota GPT OSS 20B da Groq aumenta o tamanho do modelo, entrega cerca de 1,000 tokens por segundo e custa $0.075/$0.30. O custo normalizado é $1.35, ainda abaixo dos $1.96 do DeepSeek, mas a decisão deve usar o mesmo conjunto de avaliação. O número menor não comprova melhor aderência a instruções, ferramentas ou necessidades do negócio.

Escolha a Groq quando o tempo de resposta for perceptível ao usuário e um pequeno modelo de produção passar na tarefa. Descarte-a quando a carga exigir raciocínio avançado ou depender de um modelo preview sem status estável de produção.

5. Mistral: o laboratório direto mais barato para modelos pequenos

Mistral oferece a escada mais clara de modelos pequenos diretamente pelo fornecedor. O Ministral 3B começa em $0.10 na entrada e $0.10 na saída por milhão de tokens; o modelo 8B custa $0.15/$0.15, e o 14B, $0.20/$0.20. O Mistral Small 4 sai por $0.15/$0.60 e acrescenta uma oferta mais ampla para texto, agentes e multimodalidade.

Página de preços dos modelos da API da Mistral
Mistral

A linha econômica de 3B não é a recomendação padrão para tarefas abertas voltadas ao cliente. Reserve-a para situações em que um modelo minúsculo tenha vantagem, como classificação, pré-roteamento de moderação ou transformação restrita de campos. O Mistral Small 4 é o candidato mais plausível para aplicações gerais e custa $2.70 na carga normalizada.

Melhor para: Acesso direto a modelos pequenos, preferência pelo fornecedor original, transformações em lote e prompts estáveis com cache
Destaque: Preço inicial uniforme de $0.10/$0.10, mais descontos de 50% no Batch e 90% na entrada em cache
Preço: Ministral 3B a $0.10/$0.10; Mistral Small 4 a $0.15/$0.60
Teste grátis: Os principais modelos de texto não oferecem um plano gratuito geral de produção; apenas alguns endpoints Labs ou de moderação são grátis

O ponto forte
O que faz bem
4 points

  • Preços diretos e simples para as faixas 3B, 8B, 14B e Small
  • Desconto de 50% em lote para trabalhos assíncronos de alto volume
  • Desconto de 90% na entrada em cache para prefixos estáveis e repetidos
  • O Mistral Small 4 oferece suporte a texto, agentes e entradas multimodais
O ponto fraco
Onde deixa a desejar
3 points

  • O preço anunciado de $0.10/$0.10 pertence a um modelo 3B
  • A saída do Mistral Small 4 custa quatro vezes a entrada
  • Não há um amplo plano gratuito de produção para os principais modelos de texto

Quando a escada da Mistral compensa

Imagine uma plataforma de ecommerce que gera, todas as noites, tags de catálogo a partir de títulos, atributos e descrições. O processamento é assíncrono, cada item segue um schema estável e uma pessoa pode inspecionar uma amostra de erros antes da próxima atualização do catálogo. Esse workflow pode começar no Ministral 3B ou 8B, usar Batch para obter 50% de desconto e manter as instruções estáveis da taxonomia em um prefixo armazenado em cache.

Para um assistente de chat, a conta muda. Na carga normalizada, o Ministral 3B custa $1.20, enquanto o Mistral Small 4 custa $2.70. A diferença de $1.50 compra um modelo maior e posicionado para usos mais amplos. Se o Small 4 reduzir fallback e revisão, ele pode formar um sistema mais barato mesmo com uma linha de tokens mais cara.

Escolha a Mistral quando importar trabalhar diretamente com o laboratório ou ter uma escada de modelos pequenos. Evite a tarifa chamativa do 3B em tarefas abertas até que a avaliação comprove que ele se mantém acima do patamar mínimo de qualidade.

6. SiliconFlow: a nova opção multimodelo de baixo custo

SiliconFlow é o host multimodelo mais barato desta seleção para quem quer ir além de uma rota 8B. O GPT OSS 20B custa $0.04 por milhão de tokens de entrada e $0.18 por milhão de tokens de saída, com uma janela de contexto de 131K. Isso resulta em $0.76 para a carga normalizada, e novas contas recebem $1 em créditos.

Página de preços dos modelos serverless da SiliconFlow
SiliconFlow

A distinção importante está no nome do modelo. GPT OSS 20B é um modelo open-weight de 20B, não acesso direto à família GPT-5.6 da OpenAI. A SiliconFlow também lista o DeepSeek V4 Flash a $0.13 na entrada, $0.028 na entrada em cache e $0.28 na saída, permitindo avançar para uma rota mais robusta sem abandonar a conta.

Melhor para: Quem busca baixo custo e quer vários modelos abertos em uma única conta de fornecedor
Destaque: GPT OSS 20B a $0.04/$0.18, com $1 em créditos iniciais
Preço: GPT OSS 20B a $0.04 na entrada/$0.18 na saída; DeepSeek V4 Flash a $0.13/$0.28
Teste grátis: $1 em créditos gratuitos, sem compromisso mínimo

O ponto forte
O que faz bem
4 points

  • $0.76 pela carga normalizada no GPT OSS 20B
  • O crédito de $1 cobre mais que essa carga de teste normalizada pelo preço de tabela
  • Nenhum compromisso mínimo na página pública de preços
  • Rotas econômicas para DeepSeek, Qwen, MiniMax, GPT OSS e outros modelos abertos
O ponto fraco
Onde deixa a desejar
3 points

  • Os menores preços são de modelos open-weight, não de APIs proprietárias de fronteira
  • A escolha do modelo ainda deixa a avaliação de qualidade sob responsabilidade do comprador
  • Um host multimodelo mais novo pode exigir análise adicional de compras e confiabilidade

O orçamento de $1 para avaliação

O crédito inicial da SiliconFlow é especialmente concreto. A carga normalizada no GPT OSS 20B custa $0.76, então o crédito de $1 pode cobrir uma execução completa dessa comparação de preços antes de novas tentativas ou outros modelos. Isso não equivale a um mês gratuito de produção. Significa que é possível medir formato da saída, latência e contabilização de tokens sem comprometer de antemão um saldo maior.

Para uma fila interna de sumarização, comece com GPT OSS 20B e encaminhe casos com falha ou baixa confiança ao DeepSeek V4 Flash na mesma plataforma. As tarifas deixam essa escada clara: $0.04/$0.18 na rota econômica e depois $0.13/$0.28 no DeepSeek. A aplicação ainda precisa registrar qual modelo respondeu, pois uma fatura combinada sem dados de aceitação por modelo não revela se a faixa mais barata está ajudando.

Escolha a SiliconFlow quando uma única hospedagem econômica e um catálogo amplo de modelos abertos simplificarem a avaliação. Descarte-a se o comprador exigir contrato direto com o desenvolvedor do modelo ou já tiver um gateway que ofereça os mesmos modelos por um custo total aceitável.

7. OpenRouter: a forma mais barata de continuar trocando de modelo

OpenRouter é o melhor gateway econômico quando a facilidade para trocar de modelo vale uma pequena taxa de cobrança. Ele repassa os preços de inferência dos fornecedores sem margem adicional, oferece variantes gratuitas e reúne muitos provedores atrás de uma única chave de API. O DeepSeek V4 Flash Latest aparece a $0.08 na entrada e $0.252 na saída por milhão de tokens, levando a carga normalizada a $1.304 antes das taxas de compra de créditos.

Catálogo de modelos da OpenRouter com preços atuais por token
OpenRouter

O limite está na forma de comprar os créditos. A OpenRouter cobra 5.5%, com mínimo de $0.80, na compra de créditos. O mínimo deixa de prevalecer por volta de $14.55, pois $0.80 dividido por 5.5% resulta em $14.5455. Portanto, uma compra de $10 em créditos paga uma taxa de $0.80, ou 8%, e não 5.5%.

Melhor para: Comparar modelos, manter rotas de fallback e trocar de fornecedor sem reescrever a aplicação
Destaque: Preços dos fornecedores repassados sem margem sobre a inferência
Preço: Variantes gratuitas a $0; modelos pagos variam; DeepSeek V4 Flash Latest a $0.08/$0.252 antes da taxa de créditos
Teste grátis: Pequena franquia para novos usuários e variantes gratuitas com limites diários baixos

O ponto forte
O que faz bem
4 points

  • Uma chave de API para muitos fornecedores e modelos
  • Nenhuma margem sobre a tarifa de inferência do fornecedor
  • Variantes gratuitas para avaliação
  • Até 1M de requisições BYOK por mês são gratuitas
O ponto fraco
Onde deixa a desejar
4 points

  • A compra de créditos custa 5.5%, com mínimo de $0.80
  • As variantes gratuitas permitem apenas 50 requisições por dia antes de uma compra acumulada de $10 em créditos; depois, 1,000 por dia
  • Créditos pagos expiram após um ano sem uso
  • Tanto falhas do gateway quanto do fornecedor upstream precisam entrar no plano de confiabilidade

Quando a taxa do gateway se paga

Quem testa DeepSeek, Gemini e um modelo aberto pode gastar mais tempo de engenharia com autenticação, cobrança, tentativas e formatos de resposta separados do que com inferência. A OpenRouter transforma a troca em configuração de roteamento. A taxa é razoável quando essa conveniência mantém um fallback pronto ou permite substituir rapidamente uma rota fraca.

Recargas pequenas distorcem a conta. Em $10, o mínimo de $0.80 representa uma taxa de 8%. Em $100, os 5.5% viram $5.50 e o percentual se comporta como anunciado. Em um protótipo pequeno, aceite o mínimo como taxa de conveniência ou use diretamente o plano gratuito de um fornecedor. Não compare a tarifa do modelo na OpenRouter com a direta e esqueça a taxa sobre os créditos.

A rota BYOK segue outra regra. Até 1M de requisições por mês com chaves próprias de fornecedores são gratuitas; depois, a OpenRouter cobra 5% do que aquela combinação de modelo e fornecedor custaria na plataforma. BYOK pode preservar os limites diretos do fornecedor enquanto centraliza o roteamento, mas não elimina a necessidade de acompanhar dois pontos de cobrança e falha.

Escolha a OpenRouter quando uma única integração e trocas rápidas de modelo justificarem a taxa. Evite-a quando o produto usa um só fornecedor estável, a API direta já atende aos requisitos de disponibilidade e o gateway adicional não traz valor operacional.

8. OpenAI: a migração convencional de menor risco

OpenAI não vence no preço por token, mas o GPT-5.6 Luna pode ser a rota barata de menor risco para um produto já construído sobre a OpenAI. No Standard, o Luna custa $0.20 por milhão de tokens de entrada em contexto curto, $0.02 por entrada em cache e $1.20 pela saída. Batch e Flex reduzem as tarifas de entrada/saída pela metade, para $0.10/$0.60, levando a carga normalizada de $4.40 a $2.20.

Tabela de preços da API da OpenAI para o GPT-5.6 Luna
OpenAI

Migrar tem um custo que nunca aparece na fatura da API. Schemas, prompts, regras de moderação, ferramentas, tracing, comportamento de fallback e avaliações já existentes podem tornar irrelevante uma diferença mensal de $2.44 em tokens. Um produto cuja rota atual da OpenAI passa nos testes deve primeiro avaliar Luna, cache e Batch/Flex antes de trocar de fornecedor.

Melhor para: Produtos existentes na OpenAI, ferramentas de desenvolvimento consolidadas, prompts estáveis em cache e tarefas assíncronas em lote
Destaque: GPT-5.6 Luna combina um modelo atual e econômico da OpenAI com tarifas 50% menores em Batch/Flex
Preço: Standard a $0.20 na entrada/$0.02 em cache/$1.20 na saída; Batch/Flex a $0.10/$0.01/$0.60
Teste grátis: Nenhum plano gratuito permanente de API informado

O ponto forte
O que faz bem
4 points

  • Custo normalizado de $2.20 em Batch ou Flex
  • A entrada em cache custa um décimo da entrada padrão
  • Aplicações OpenAI existentes podem avaliar um modelo mais barato sem migrar de fornecedor
  • Tarifas separadas e claras para Standard, Batch, Flex e contexto longo
O ponto fraco
Onde deixa a desejar
4 points

  • No Standard, a saída custa seis vezes a entrada
  • O custo normalizado Standard é $4.40, o mais alto entre as rotas classificadas
  • O processamento regional elegível recebe acréscimo de 10%
  • O Luna em contexto longo usa tarifas maiores: $0.40 na entrada e $1.80 na saída

Otimize dentro da OpenAI antes de migrar

A análise de roteamento do GPT-5.6 aprofunda quando Luna, Terra e Sol fazem sentido. Para esta decisão de custo, o primeiro movimento é mais simples: coloque trabalhos curtos e repetíveis no Luna, armazene prefixos estáveis em cache, envie tarefas não urgentes por Batch ou Flex e preserve o modelo atual mais robusto como fallback.

Para 10 milhões de tokens de entrada e 2 milhões de tokens de saída, o Luna Standard custa $4.40. Batch ou Flex custa $2.20. O DeepSeek V4 Flash custa $1.96. A diferença entre a OpenAI otimizada e o DeepSeek direto é de $0.24 na carga normalizada — pequena demais para justificar sozinha uma migração de fornecedor.

Configurações de contexto longo e região podem mudar o resultado. As tarifas Standard do Luna para contexto longo são $0.40 na entrada e $1.80 na saída, e o processamento regional elegível acrescenta 10%. Use a tarifa correspondente à requisição e à escolha de processamento, em vez de aplicar o preço de contexto curto a todos os tokens.

Escolha a OpenAI quando o produto já funcionar nela, um relacionamento direto com um fornecedor convencional for importante ou Batch/Flex eliminar a maior parte da diferença de preço. Evite Standard em tarefas offline que aceitam novas tentativas e se qualificam para as rotas pela metade do preço.

Qual API de IA escolher em cada cenário

Comece pelo impacto de uma falha e só então escolha o modelo mais barato que sobreviver a esse requisito. Essa regra simples evita a maior parte das falsas economias.

Fluxo de decisão que leva testes gratuitos, tráfego ao vivo de baixo risco e cargas convencionais até Gemini, DeepSeek e OpenAI
O impacto da carga de trabalho define qual faixa de preço pode ser avaliada com segurança primeiro.

Para um protótipo gratuito com dados sanitizados, escolha o Gemini 2.5 Flash-Lite. É o caminho mais simples para começar sem custo e depois migrar para o Paid Standard de $0.10/$0.40. Não envie dados de clientes ou informações confidenciais pelo Free, pois as condições de uso do conteúdo são diferentes das do Paid.

Para produção ao vivo de baixo risco, comece com DeepSeek V4 Flash. JSON, chamadas de ferramentas, contexto de 1M e custo normalizado de $1.96 fazem dele o melhor candidato geral. Mantenha margem para reajuste e um fallback, já que o fornecedor anunciou um futuro aumento.

Para um classificador restrito e de alto volume, avalie primeiro a DeepInfra. O custo normalizado de $0.25 só faz diferença quando as saídas permitidas são limitadas e é barato detectar falhas. Suba de nível assim que a tarefa se tornar aberta.

Quando a latência for visível, avalie a Groq. A rota Llama 3.1 8B de 560 tokens por segundo pode deixar uma interface ágil por $0.05/$0.08. Use-a como faixa rápida, com um fallback mais robusto, e não como substituta automática de todos os modelos.

Para filas offline, compare Gemini Batch/Flex, Mistral Batch e OpenAI Batch/Flex. Cada fornecedor documenta uma redução de 50%. A melhor opção é aquela cujo modelo passa no teste de aceitação da fila, não a que exibe o menor preço Standard antes do desconto.

Para trocar de modelo com facilidade, escolha a OpenRouter. A taxa pode sair mais barata que manter várias integrações, sobretudo quando fallback e rotatividade de modelos fazem parte do produto. Com um único fornecedor estável, a cobrança direta é mais simples.

Em uma aplicação OpenAI existente, teste o Luna antes de migrar. Batch/Flex reduz o custo normalizado a $2.20, apenas $0.24 acima do DeepSeek. As avaliações e operações já prontas podem valer muito mais que essa diferença.

A decisão muda quando a rota mais barata fica abaixo do limiar de aceitação da carga. Mantenha o modelo econômico enquanto validade do schema, respostas aceitas, latência, termos de privacidade e recuperação atendem ao requisito. Suba um degrau quando um desses pontos falhar. Não acumule remendos de prompt para economizar centavos.

Quem oferece ao cliente uma experiência movida por API também precisa assumir autenticação, cobrança, revisão e tratamento de falhas. O guia para criar uma API com v0 mostra por que o modelo ou agente subjacente é apenas uma camada do produto.

Como estas APIs foram selecionadas

A classificação premia a decisão de compra confiável mais barata, não o menor número isolado de entrada. Cada fornecedor teve preços e características analisados em suas páginas oficiais ativas em 10 de agosto de 2026. As APIs não foram assinadas nem apresentadas como se tivessem sido testadas em produção.

A decisão considera estes critérios:

  • Preço de entrada útil: tarifas de entrada e saída para um modelo específico e disponível
  • Patamar mínimo de qualidade: se a faixa do modelo é plausível para uma tarefa restrita ou para um workflow de produção mais amplo
  • Recursos operacionais: JSON, ferramentas, contexto, processamento em lote, cache, limites de uso e implicações de fallback
  • Impacto sobre privacidade e contratos: tratamento dos dados no plano gratuito, estabilidade do preço e cobrança de uma taxa separada pelo gateway
  • Custo de troca: trabalho necessário para migrar prompts, schemas, conjuntos de avaliação, monitoramento e cobrança

Oito fornecedores entraram na seleção porque cada um representa uma decisão de compra distinta. Ficaram de fora aqueles cuja rota de texto em produção mais barata estava muito acima desta faixa de custo, cujo preço não podia ser normalizado por token ou cujo papel apenas repetia outra opção sem vantagem mais clara. APIs especializadas de imagem, vídeo, voz e embeddings também foram excluídas, pois suas unidades não são comparáveis às de tokens de texto de entrada e saída.

O cálculo de custos é uma análise original baseada em uma carga explícita. Não é um benchmark. O custo por resultado aceito só pode ser medido com requisições representativas, validadores e processo de revisão próprios.

Quais opções evitar

Variantes gratuitas da OpenRouter como dependência de produção

Não use uma variante gratuita da OpenRouter como única rota por trás do tráfego real de clientes. A conta recebe 50 requisições gratuitas de modelo por dia até comprar pelo menos $10 em créditos; depois, o limite passa a 1,000 por dia. É uma franquia para avaliação, não um plano confiável de capacidade.

Gemini Free com dados de clientes ou confidenciais

Não envie conteúdo sensível pelo Gemini Free. O Google informa que o conteúdo do plano Free é usado para melhorar seus produtos, ao contrário do conteúdo do Paid. A carga normalizada no Paid Standard custa $1.80, portanto não faz sentido economizar justamente na fronteira de privacidade.

DeepInfra Mistral Nemo para tarefas abertas voltadas ao cliente

Não leve a rota de $0.019/$0.03 diretamente para suporte aberto, interpretação jurídica ou ações autônomas. Essa tarifa pertence a um modelo pequeno. Use-a em tarefas restritas e validadas, mantendo um fallback mais robusto até que os dados de aceitação justifiquem ampliar o escopo.

DeepSeek sem fallback para mudança de preço

Não trate $0.14/$0.28 como tarifa anual fixa. O DeepSeek informa que haverá um aumento expressivo. O modelo ainda pode ser a melhor opção padrão hoje, mas orçamento e arquitetura precisam de uma segunda rota.

OpenAI Standard em tarefas offline que aceitam novas tentativas

Não pague a tarifa Standard de $0.20/$1.20 do Luna por um trabalho que pode esperar. Batch e Flex custam $0.10/$0.60 e reduzem a carga normalizada de $4.40 para $2.20 sem trocar de fornecedor.

O que fazer na segunda-feira

Na próxima semana, transfira uma classe delimitada de tarefas — não a aplicação inteira. Uma avaliação com 100 requisições basta para revelar problemas evidentes de schema, latência e roteamento antes que o tráfego chegue à produção; ela não substitui o monitoramento contínuo.

  1. Separe 100 requisições representativas

    Escolha uma única tarefa e reúna entradas normais, difíceis, ambíguas e malformadas. Remova dados pessoais, confidenciais e de clientes antes de usar qualquer plano gratuito.

  2. Execute três rotas

    Compare o fornecedor atual, DeepSeek V4 Flash e Gemini 2.5 Flash-Lite. Acrescente DeepInfra ou Groq somente quando preço bruto ou latência for o objetivo explícito.

  3. Meça quatro resultados

    Registre taxa de schemas válidos, taxa de respostas aceitas, latência de ponta a ponta e custo exato dos tokens de entrada/saída. Acompanhe o tempo de revisão humana como uma métrica operacional separada.

  4. Direcione uma classe vencedora

    Envie ao fornecedor mais barato apenas a tarefa delimitada que passou no teste. Preserve a rota antiga para falhas de validação, entradas ambíguas e ações de maior impacto.

  5. Refaça as contas a cada mudança do fornecedor

    Guarde a fórmula e as premissas da carga. Recalcule quando o DeepSeek elevar os preços, um modelo for descontinuado ou mudarem os limites do plano gratuito e do gateway.

Esse movimento transforma uma lista de tarifas em uma decisão de orçamento reversível. Também produz o único número que uma tabela pública de preços não consegue fornecer: o seu custo por resultado aceito.

Perguntas frequentes

Qual IA tem a API mais barata?

A DeepInfra tem o menor preço bruto de geração de texto nesta comparação: Mistral Nemo a $0.019 por milhão de tokens de entrada e $0.03 por milhão de tokens de saída. DeepSeek V4 Flash é a melhor opção econômica para produção quando a carga precisa de JSON, ferramentas e contexto longo.

Existe alguma API de IA gratuita?

Sim. O Google Gemini oferece tokens de entrada e saída gratuitos no plano Free, e a OpenRouter tem variantes gratuitas de modelos. O Gemini Free pode usar conteúdo para melhorar produtos Google; as variantes gratuitas da OpenRouter ficam limitadas a 50 requisições por dia ou 1,000 por dia após pelo menos $10 em compras acumuladas de créditos.

Quanto custa uma API de IA?

Para 20,000 chamadas mensais, totalizando 10M tokens de entrada e 2M de saída, as rotas classificadas variam de $0.25 no Mistral Nemo da DeepInfra a $4.40 no OpenAI GPT-5.6 Luna Standard. Batch, Flex, cache, taxas de gateway, novas tentativas e o modelo que atinge o patamar mínimo de qualidade alteram a conta final.

Quanto custa a API do ChatGPT?

Assinaturas do ChatGPT e cobrança da API da OpenAI são separadas. O modelo econômico da OpenAI comparado aqui é o GPT-5.6 Luna: $0.20 na entrada e $1.20 na saída por milhão de tokens Standard de contexto curto, ou $0.10/$0.60 por Batch ou Flex.

Baixe o checklist de auditoria de workflows de IA para empresas e transforme esta escala de custos em uma avaliação de fornecedores com duração de uma semana.

Última atualização

3 de set. de 2026

CategoriaBuild

Prefira este site no Google

Adicionar omidsaffari.com como fonte preferida na Busca do Google

Marque omidsaffari.com como fonte preferida e o Google destaca o site para você em Top Stories, AI Overviews e AI Mode.

Newsletter

Uma carta, todo domingo. Sistemas que funcionam, não hot takes.

Build logs, sistemas em produção e notas de campo de um portfólio de ventures de IA.

Semanal. Sem spam. Cancele quando quiser.