Groq API: preços em 2026 e quando sair do plano grátis
Veja quanto custa a Groq API em 2026, compare os planos Free, Developer e Enterprise e descubra quando os limites de uso tornam o upgrade inevitável.

A Groq API custa $0 até que os limites específicos de cada modelo no plano Free interrompam seu fluxo de trabalho; depois disso, o Developer não cobra assinatura e cobra apenas pelo uso. Em uma carga calculada com GPT-OSS 120B, o teto diário de tokens do Free equivale a apenas $1.44 por mês em tráfego pago. Portanto, é a capacidade de processamento, e não o gasto com tokens, que obriga a fazer upgrade.
Preços da Groq API em resumo
A Groq não tem um preço mensal por usuário no modelo self-service para você decorar. A escolha fica entre o plano Free, sujeito a limites de uso, o Developer, com pagamento conforme o consumo, e a capacidade personalizada do Enterprise.
Estes preços e limites foram conferidos na página de preços da Groq, em Modelos Compatíveis, nas Perguntas Frequentes sobre Faturamento e na documentação de limites de uso em 15 de agosto de 2026.

O token é a unidade usada pelo modelo para calcular a cobrança. Os tokens de entrada incluem instruções, histórico da conversa, documentos e definições de ferramentas enviados ao modelo. Os tokens de saída correspondem ao conteúdo gerado. A Groq informa os dois valores por milhão de tokens; assim, o custo mensal é a soma de entrada, saída, áudio e eventual uso de ferramentas integradas.
O Developer não exige compromisso de assinatura mensal ou anual. A Groq solicita uma forma de pagamento, mede o consumo e normalmente fatura depois do uso. Não existe uma tarifa separada para excedentes: o Free bloqueia o tráfego que ultrapassa o limite aplicável, enquanto o Developer continua cobrando pelas mesmas tarifas do modelo até que a conta ou um Spend Limit interrompa o uso. O Enterprise Performance funciona de outra forma: a empresa compra capacidade provisionada de entrada e saída, em vez de pagar a tarifa pública de tokens sob demanda.
O plano Free serve bem até o limite compartilhado virar dependência de produção
O plano Free da Groq dá conta de um protótipo, de uma ferramenta interna e até de um volume surpreendente de automações leves. Ele deixa de ser uma infraestrutura gratuita no instante em que um erro de limite de uso chega ao cliente.
Os limites valem para a organização, não para cada chave de API. Criar mais chaves não multiplica a capacidade. A Groq também controla várias dimensões ao mesmo tempo: requisições por minuto, requisições por dia, tokens por minuto e tokens por dia. O primeiro teto atingido bloqueia a chamada seguinte com HTTP 429.
Nos modelos de texto atualmente em produção, os limites publicados do Free incluem:
- GPT-OSS 120B e GPT-OSS 20B: 30 RPM, 1,000 RPD, 8,000 TPM e 200,000 TPD.
- Llama 3.3 70B Versatile: 30 RPM, 1,000 RPD, 12,000 TPM e 100,000 TPD.
- Llama 3.1 8B Instant: 30 RPM, 14,400 RPD, 6,000 TPM e 500,000 TPD.
- Compound e Compound Mini: 30 RPM, 250 RPD e 70,000 TPM.
- Whisper Large V3 e Turbo: 20 RPM, 2,000 RPD, 7,200 segundos de áudio por hora e 28,800 segundos de áudio por dia.
A Groq apresenta essa tabela pública como um resumo geral. Para saber a cota vigente de uma organização específica, a referência é a página Limits dentro do Console.
O teto diário de tokens costuma ser atingido antes do limite de requisições. Considere uma chamada ao GPT-OSS 120B com 2,000 tokens de entrada e 500 de saída. Com 2,500 tokens no total, o limite de 200,000 TPD permite 80 chamadas desse tipo por dia. Já o teto de 8,000 TPM comporta três em um minuto; uma quarta chamada equivalente ultrapassaria o limite de tokens, mesmo que o plano anuncie 30 RPM.
Esse é o ponto de equilíbrio entre o gratuito e o pago. A mesma chamada custa $0.0006 no Developer; portanto, 80 por dia durante um mês de 30 dias custam cerca de $1.44. Há pouca justificativa financeira para adaptar um fluxo de produção ao teto do Free. O upgrade compra capacidade quando a conta do modelo ainda é menor que a maioria dos complementos de SaaS.

Quem pode continuar sem pagar
Talvez você nunca precise do Developer se usar a Groq para desenvolvimento local, avaliações ocasionais, um script interno pessoal ou uma demonstração cujo tráfego permaneça abaixo dos tetos aplicáveis de tokens e requisições. O Free também faz sentido quando é possível esperar para tentar de novo após um erro 429 e ninguém depende de serviço contínuo.
Vale pagar quando o fluxo tem um usuário, um prazo ou uma fila que não tolera o limite compartilhado. O Developer também acrescenta Batch, Flex, suporte por chat e Spend Limits. Esses controles operacionais — e não um catálogo diferente de modelos — marcam a fronteira prática entre os planos.
Preços de todos os modelos atuais da Groq API
O catálogo atual de produção da Groq é compacto: quatro modelos de texto, dois de conversão de fala em texto e dois sistemas Compound. Há também um catálogo separado de modelos preview, que podem desaparecer com pouca antecedência.
Modelos de texto em produção
- Llama 3.1 8B Instant custa $0.05 por milhão de tokens de entrada e $0.08 por milhão de tokens de saída. É a opção de texto em produção mais barata. Sua cota básica no Developer é de 250,000 TPM e 1,000 RPM, com janela de contexto de 131,072 tokens.
- GPT-OSS 20B custa $0.075 por milhão de tokens de entrada e $0.30 por milhão de tokens de saída. A entrada em cache custa $0.0375 por milhão. Sua cota básica no Developer é de 250,000 TPM e 1,000 RPM, com janela de contexto de 131,072 tokens.
- GPT-OSS 120B custa $0.15 por milhão de tokens de entrada e $0.60 por milhão de tokens de saída. A entrada em cache custa $0.075 por milhão. Sua cota básica no Developer é de 250,000 TPM e 1,000 RPM, com janela de contexto de 131,072 tokens.
- Llama 3.3 70B Versatile custa $0.59 por milhão de tokens de entrada e $0.79 por milhão de tokens de saída. Sua cota básica no Developer é de 300,000 TPM e 1,000 RPM, com janela de contexto de 131,072 tokens.
Comece uma avaliação para produção com o GPT-OSS 120B quando o projeto exigir um modelo maior de pesos abertos, mas também precisar de um provedor alternativo para o mesmo modelo. Desça para o GPT-OSS 20B ou o Llama 3.1 8B apenas quando um teste de aceitação confirmar que o modelo menor preserva a qualidade do resultado. Migre para o Llama 3.3 70B somente se suas respostas justificarem uma tarifa 3.93 vezes maior que a do GPT-OSS 120B na entrada e 1.32 vezes maior na saída.
Esses múltiplos não provam que um modelo seja melhor. Eles definem o retorno que o resultado precisa gerar com menos tentativas, respostas mais curtas, menos revisão ou uma capacidade inexistente na opção mais barata.
Modelos de conversão de fala em texto
- Whisper Large V3 custa $0.111 por hora de áudio. Sua capacidade básica no Developer é de 200,000 segundos de áudio por hora e 300 RPM, com arquivo de no máximo 100 MB.
- Whisper Large V3 Turbo custa $0.04 por hora de áudio. Sua capacidade básica no Developer é de 400,000 segundos de áudio por hora e 400 RPM.
Em 1,000 horas de áudio, os valores são $111 para o Whisper Large V3 e $40 para o Turbo, uma diferença de $71. O menor preço é o ponto de partida, mas uma equipe de áudio deve ficar com o modelo que superar seu critério de aceitação das transcrições. Uma transcrição barata que precisa ser corrigida não produz um resultado mais barato.
Sistemas Compound e modelos preview
Groq Compound e Compound Mini combinam modelos de produção com ferramentas executadas no servidor. Eles não têm uma tarifa única e fixa por token. A Groq repassa as cobranças do modelo e das ferramentas usadas, por isso uma fatura do Compound precisa separar toda a composição de custos, em vez de aplicar uma só estimativa por token.
O catálogo preview disponível no momento inclui:
- Qwen3.6 27B: $0.60 por milhão de tokens de entrada e $3.00 por milhão de tokens de saída.
- Safety GPT-OSS 20B: $0.075 por milhão de tokens de entrada e $0.30 por milhão de tokens de saída.
- Llama Prompt Guard 2 22M: $0.03 por milhão de tokens de entrada e saída.
- Llama Prompt Guard 2 86M: $0.04 por milhão de tokens de entrada e saída.
- Canopy Labs Orpheus V1 English: $22 por milhão de caracteres.
- Canopy Labs Orpheus Arabic Saudi: $40 por milhão de caracteres.
- MiniMax M2.7: preço Enterprise mediante consulta à equipe comercial.
Preview significa avaliação, não promessa de produção. Segundo a Groq, esses modelos podem ser descontinuados com pouca antecedência. Portanto, um orçamento que dependa do Qwen3.6 27B também precisa de uma rota testada para outro provedor ou modelo antes de chegar aos clientes.
A página atual de Modelos Compatíveis da Groq não lista modelos DeepSeek nem Kimi. Posts e calculadoras antigos que ainda mostram preços desses nomes como opções ativas na Groq estão desatualizados. Se o requisito for DeepSeek, faça o orçamento com um provedor atual, sem presumir que o modelo continua no catálogo da Groq; a análise de preços do DeepSeek trata dessa decisão separadamente.
O custo por resultado define qual modelo escolher
As tarifas de tokens da Groq são tão baixas que, até o uso ganhar escala, o formato do tráfego pesa mais que a escolha do modelo. A comparação mais clara fixa uma chamada e calcula o preço de cada opção sobre ela.
Use como referência uma chamada com 2,000 tokens de entrada e 500 de saída. Em 100,000 chamadas por mês, antes de cache, Batch, ferramentas ou novas tentativas:
- Llama 3.1 8B Instant: $14 no total, ou $0.00014 por chamada.
- GPT-OSS 20B: $30 no total, ou $0.0003 por chamada.
- GPT-OSS 120B: $60 no total, ou $0.0006 por chamada.
- Llama 3.3 70B Versatile: $157.50 no total, ou $0.001575 por chamada.
- Qwen3.6 27B preview: $270 no total, ou $0.0027 por chamada.
O denominador útil não é a chamada, e sim o resultado aceito. Se um modelo menor exigir novas tentativas, gerar saídas mais longas ou transferir mais trabalho para uma pessoa revisar, a chamada barata pode criar o fluxo caro. Acompanhe os resultados aceitos ao lado dos tokens para que o modelo conquiste seu lugar, em vez de vencer apenas pelo preço de tabela.
Não existe um volume pago a partir do qual um modelo da Groq se torne automaticamente mais barato que outro. Todas as tarifas públicas sob demanda são lineares e não há mensalidade básica. O GPT-OSS 20B continua custando metade do valor calculado para o GPT-OSS 120B tanto em uma chamada quanto em um milhão delas. A decisão só muda quando a qualidade do resultado ou o comportamento operacional altera o trabalho necessário.
Para um fundador com investimento, isso pode significar GPT-OSS 20B nas classificações e GPT-OSS 120B nos casos ambíguos. Para o CTO de uma empresa de médio porte, significa manter os campos de modelo e tokens em cada registro de chamada, permitindo que a área de compras acompanhe o custo por fluxo aceito. Para um operador sênior, significa medir correções e novas tentativas, sem tomar uma única demonstração bem-sucedida como prova da rota para produção.
Batch supera o cache em trabalhos assíncronos, e os descontos não se acumulam
O Batch da Groq oferece a menor tarifa publicada quando o resultado pode esperar. Ele custa 50% menos que a API síncrona, roda fora dos limites padrão de cada modelo e permite escolher uma janela de processamento entre 24 horas e 7 dias.
Na carga de 100,000 chamadas ao GPT-OSS 120B, as opções são:
- Síncrono sem cache: $60.
- Síncrono com 50% dos tokens de entrada atendidos pelo cache: $52.50.
- Síncrono com 80% dos tokens de entrada atendidos pelo cache: $48.
- Batch: $30.
A regra atual que muda o orçamento é explícita: os descontos de Batch e cache de prompts não se acumulam. Todos os tokens do Batch são cobrados pela tarifa de 50%, independentemente do status do cache. Uma planilha que reduza novamente os $30 do Batch pela metade, chegando a $15, está errada.
O cache de prompts continua útil no tráfego síncrono de GPT-OSS. Ele é automático, não cobra uma tarifa própria e dá 50% de desconto na entrada armazenada em cache. No momento, o recurso é compatível com GPT-OSS 20B, GPT-OSS 120B e GPT-OSS Safeguard 20B. Um acerto de cache exige um prefixo exatamente igual; o tamanho mínimo que pode ser armazenado varia de 128 a 1,024 tokens conforme o modelo, e os dados não usados expiram após duas horas. O acerto funciona em regime de melhor esforço, sem garantia.
Coloque instruções de sistema estáveis e definições de ferramentas no começo do prompt, deixando os dados variáveis do usuário para depois. Em seguida, consulte nos retornos a quantidade de tokens atendidos pelo cache. Uma taxa de cache projetada só vira dado de orçamento quando aparece no uso em produção.
O Batch tem outras particularidades operacionais. Um arquivo JSONL pode conter até 50,000 linhas e ocupar até 200 MB. Jobs que não terminam dentro da janela escolhida expiram, embora a Groq cobre apenas as chamadas concluídas com sucesso. Os arquivos e resultados do Batch podem permanecer nos sistemas da Groq por até 30 dias; por isso, cargas com dados sensíveis exigem uma análise de retenção antes que a economia determine a escolha.
$60 em tokens podem virar uma fatura de $560 no Compound
O custo oculto do Compound não está no modelo. Está no ciclo de ferramentas.
A Groq cobra $5 por 1,000 chamadas de Basic Search, $8 por 1,000 de Advanced Search, $1 por 1,000 de Visit Website e $0.18 por hora de Code Execution. Esses valores são somados aos tokens do modelo usado.
Considere 100,000 chamadas padrão ao GPT-OSS 120B. Os tokens do modelo custam $60. Se cada chamada fizer uma consulta de Basic Search, a busca acrescenta $500, elevando a fatura combinada para $560. Uma Advanced Search por chamada produz um total de $860. Uma Visit Website por chamada resulta em $160.

Essa é a linha do orçamento com maior chance de surpreender uma equipe que trabalha com agentes. Otimizar tokens não salva um fluxo cujo agente faz buscas a cada turno. O primeiro controle deve ser uma política de ferramentas: defina quando a busca é necessária, limite os ciclos de uso, armazene resultados duradouros fora do modelo e registre as chamadas de ferramentas por resultado aceito.
A conta paga não exige contrato anual, mas tem detalhes operacionais
O Developer cobra pelo uso; não é um contrato anual de SaaS disfarçado. Os termos menos óbvios tratam do momento da cobrança, do funcionamento dos limites e do destino dos créditos.
Novas contas Developer usam faturamento progressivo. A Groq pode emitir uma fatura quando o uso acumulado desde a abertura da conta ultrapassar $1, $10, $100, $500 e $1,000. Depois do patamar de $1,000, entra em vigor o faturamento mensal comum. Contas com endereço de cobrança na Índia passam pelos limites de $1 e $10, seguidos por incrementos recorrentes de $100. A Groq não exige pagamento até que o consumo chegue a pelo menos $0.50.
Esse cronograma pode gerar várias cobranças pequenas no cartão no começo da adoção. Não se trata de uma tarifa adicional, mas o financeiro deve reconhecer o padrão antes de classificar os lançamentos como duplicados.
Spend Limits bloqueiam o tráfego, com um pequeno atraso nos dados
Os planos pagos permitem definir um Spend Limit mensal para toda a organização. Ele abrange todas as chaves de API e todos os endpoints, é zerado no primeiro dia do mês e bloqueia novas chamadas assim que o limite é detectado. A Groq aceita alertas em pontos como 50%, 75% e 90% do teto.
O acompanhamento de gastos é atualizado com atraso de 10 a 15 minutos. Por isso, uma rajada pode levar a conta final um pouco além do valor configurado antes que o bloqueio comece. A Groq sugere iniciar com um limite 20% a 30% acima do consumo mensal previsto. Em um fluxo crítico, essa margem também reduz o risco de que um pico normal transforme o controle de orçamento em indisponibilidade.
Créditos expiram, e compras antecipadas são definitivas
Os Service Credits da Groq expiram um ano após a compra ou emissão, salvo quando houver outro prazo definido. Eles são intransferíveis, não podem ser convertidos em dinheiro e não são reembolsáveis. Encerrar a conta faz o saldo expirar imediatamente.
A FAQ de faturamento da Groq avalia solicitações gerais de reembolso caso a caso por meio do suporte. Isso não substitui os termos específicos dos Service Credits: créditos comprados e promocionais continuam sendo saldos de venda definitiva. Compre uma quantidade de créditos vinculada a uma previsão, e não a uma migração futura indefinida.
Flex troca capacidade garantida por um teto maior
O Flex está disponível para clientes pagos pela mesma tarifa de tokens do On Demand e oferece um limite de uso 10 vezes maior. A contrapartida é a capacidade em regime de melhor esforço. Se o Flex estiver lotado, ele pode falhar rapidamente com HTTP 498 e capacity_exceeded.
Use o Flex em filas que aceitam novas tentativas, avaliações e trabalhos em lote capazes de absorver uma falha rápida. Não faça dele a única rota para uma ação de cliente que não pode ser repetida. O On Demand oferece velocidade previsível, mas pode acrescentar espera em fila nos horários de pico. Quando essa variação é inaceitável, o Enterprise Performance é a opção contratada, com SLA de disponibilidade de 99.9% e garantia de latência de 99% no acordo empresarial.
Groq, Together AI e Fireworks empatam nos tokens sem cache do GPT-OSS 120B
A Groq não ganha apenas pelo preço público dos tokens do GPT-OSS 120B. Groq, Together AI e Fireworks AI cobram os mesmos $0.15 por milhão de tokens de entrada e $0.60 por milhão de tokens de saída para o modelo.
Considere uma carga normalizada de 100 milhões de tokens de entrada e 20 milhões de saída. Sem desconto de cache, cada provedor custa $27. Esse empate é a conclusão útil porque transfere a decisão para a economia do cache, os limites de uso, as opções de implantação, a confiabilidade e a latência observada.
Together AI
A Together AI é uma provedora de inferência com vários modelos. Sua opção serverless de GPT-OSS 120B custa $0.15 por milhão de tokens de entrada e $0.60 por milhão de tokens de saída. O produto serverless não exige gasto mínimo nem tarifa de provisionamento.

A linha atual do GPT-OSS 120B na Together não informa uma tarifa para entrada em cache. A documentação diz que, sem um preço de cache para o modelo, toda a entrada é cobrada pela tarifa padrão. Na carga normalizada, isso mantém o total em $27, mesmo quando o prompt se repete. A Together oferece Batch com preços até 50% menores em modelos serverless compatíveis, então continua sendo uma opção para trabalhos assíncronos quando esse modelo específico estiver qualificado.
Escolha a Together quando um catálogo mais amplo de modelos ou o caminho do serverless até uma infraestrutura reservada pesar mais que o perfil operacional específico da Groq. Não troque uma pela outra apenas pelo preço até que uma carga real revele uma diferença, pois o item sem cache do GPT-OSS é idêntico.
Fireworks AI
A Fireworks AI anuncia o GPT-OSS 120B por $0.15 na entrada, $0.014 na entrada em cache e $0.60 na saída, sempre por milhão de tokens, além de $1 em crédito serverless para novos cadastros.

Com 50% da entrada atendida pelo cache, o total normalizado fica em $20.20 na Fireworks, $23.25 na Groq e $27 na Together. Isso torna a Fireworks a vencedora no preço público para entradas repetitivas do GPT-OSS 120B, desde que a tarifa de cache anunciada se aplique à carga medida. Para trabalhos assíncronos, o Groq Batch ainda é mais barato: $13.50 no mesmo tráfego normalizado.
A OpenAI desenvolveu o GPT-OSS, mas não o oferece pela API da OpenAI nem em seu aplicativo para consumidores. Uma comparação direta com a API da OpenAI mudaria ao mesmo tempo o provedor e o modelo, invalidando a normalização de preços. Primeiro compare o mesmo modelo entre provedores de hospedagem; depois, avalie modelos proprietários diferentes pelo resultado aceito. A lista das APIs de IA mais baratas cobre um conjunto mais amplo de modelos e provedores.
A decisão sobre o provedor é simples:
- Escolha a Groq quando a capacidade de processamento síncrona e seus controles operacionais vencerem na rota medida, ou quando o preço 50% menor do Batch fizer do trabalho postergado a opção mais barata.
- Escolha a Fireworks quando o contexto repetido do GPT-OSS gerar de forma consistente a tarifa anunciada de $0.014 para entrada em cache.
- Escolha a Together quando seu caminho mais amplo do serverless ao dedicado for importante e a carga não se beneficiar de uma tarifa de cache para GPT-OSS.
Quem deve escolher a Groq — e quem deve procurar outra opção
A Groq é uma escolha forte quando um modelo aberto já supera o critério de qualidade e a velocidade de resposta afeta o produto. Ela perde força quando o modelo exigido, a garantia de capacidade ou o controle de implantação estão fora do catálogo self-service atual.
- O plano Free permite avaliar modelos de produção de forma útil antes de cadastrar uma forma de pagamento.
- O Developer não tem assinatura básica nem contrato anual.
- As tarifas públicas sob demanda ficam abaixo de $1 por milhão de tokens em todos os modelos de texto em produção.
- O Batch reduz em 50% o custo do trabalho assíncrono qualificado sem consumir os limites padrão dos modelos.
- O cache de prompts do GPT-OSS é automático e reduz pela metade as tarifas de entrada armazenada.
- Spend Limits podem bloquear o consumo da organização antes que o orçamento mensal fique sem controle.
- Os limites do Free são compartilhados por toda a organização e podem esgotar os tokens muito antes das requisições.
- Os descontos de Batch e cache não se acumulam.
- As ferramentas do Compound podem custar muito mais que os tokens do modelo.
- O cache de prompts aceita apenas a família GPT-OSS indicada e depende da reutilização exata do prefixo.
- O Flex pode retornar HTTP 498 quando a capacidade de melhor esforço estiver indisponível.
- Modelos preview podem ser removidos com pouca antecedência e, por isso, não devem sustentar uma dependência de produção sem portabilidade.
Um fundador com investimento deve escolher a Groq quando um modelo aberto e rápido mantiver o produto responsivo e a equipe conseguir preservar uma alternativa com o mesmo modelo. O CTO de uma empresa de médio porte só deve adotar o Developer depois de centralizar as chaves, registrar o uso de modelos e ferramentas e definir um teto para a organização. Um operador sênior deve observar o custo por resultado aceito, não a manchete chamativa sobre tokens por dólar.
Não use a Groq como única provedora quando a aplicação exigir um modelo proprietário ausente do catálogo, uma rota de melhor esforço com garantia ou um modelo preview sem substituto estável. O Enterprise Performance pode oferecer capacidade contratada para os modelos compatíveis, mas usa preços personalizados de provisionamento, e não um plano público mais barato.
A regra de decisão é direta: escolha a Groq apenas quando um modelo atual de produção passar no teste de aceitação e o comportamento operacional síncrono ou o custo do Batch superar a alternativa com o mesmo modelo. Se nenhuma condição for verdadeira, a tarifa baixa de tokens não justifica a migração.
O histórico de preços da Groq reforça a necessidade de conferir os dados atuais
Os preços da Groq mudam no nível dos recursos e dos modelos, mesmo quando a estrutura de cobrança continua baseada no uso. O lançamento do Developer em fevereiro de 2025 anunciava o Batch com desconto de 25% sobre o preço síncrono. A documentação atual do Batch fixa esse desconto em 50%.
A Groq também reduziu os preços do GPT-OSS e começou a adicionar cache de prompts à família em outubro de 2025. O resultado atual é $0.15/$0.60 para o GPT-OSS 120B e $0.075/$0.30 para o GPT-OSS 20B, com entrada em cache pela metade da tarifa padrão de entrada.
As mudanças no catálogo importam tanto quanto o histórico de preços. Modelos encontrados em conteúdos mais antigos, inclusive as opções Kimi e DeepSeek, não aparecem na página atual de Modelos Compatíveis. Todo orçamento deve registrar a data da verificação, o ID do modelo e a alternativa prevista, em vez de tratar um preço copiado como permanente.
A tarefa de segunda-feira: calcular um fluxo aceito e definir seu teto
Na segunda-feira, escolha um fluxo delimitado e produza um orçamento que engenharia e financeiro consigam analisar. Não comece por uma migração de toda a base de provedores.
Registre o formato do tráfego
Exporte uma semana representativa com quantidade de chamadas, tokens de entrada, tokens de saída, tokens atendidos pelo cache, IDs dos modelos, chamadas de ferramentas, novas tentativas e resultados aceitos. Separe o tráfego síncrono dos trabalhos que podem esperar.
Calcule três rotas
Calcule o On Demand pelas tarifas vigentes dos modelos, o Batch com 50% de desconto para trabalhos postergados qualificados e as ferramentas como itens separados. Não aplique economia de cache ao Batch nem presuma uma taxa de cache que os dados de uso ainda não comprovaram.
Defina a fronteira do plano pago
Se os limites do Free interromperem a rota, leve-a para o Developer. Defina um Spend Limit mensal 20% a 30% acima da previsão e configure alertas em 50%, 75% e 90%. Reserve margem para o atraso de 10 a 15 minutos nos dados.
Mantenha uma alternativa pronta
Execute o mesmo modelo por um provedor alternativo com um pequeno conjunto de avaliação. Registre o endpoint, a taxa de aceitação observada e o gatilho de redirecionamento, para que uma mudança no catálogo ou um erro de capacidade não vire uma migração emergencial.
O resultado é uma linha de orçamento por fluxo aceito: tokens do modelo, ferramentas, novas tentativas e revisão humana. Refaça o cálculo quando mudar o catálogo de modelos, os limites de uso ou a página de preços.
Perguntas frequentes
Quanto custa a Groq API?
O Groq Free custa $0. O Developer não tem assinatura básica e cobra o uso conforme o modelo. Os preços atuais dos modelos de texto em produção vão de $0.05 por milhão de tokens de entrada e $0.08 por milhão de tokens de saída no Llama 3.1 8B Instant a $0.59 na entrada e $0.79 na saída no Llama 3.3 70B Versatile.
A Groq é grátis?
Sim, dentro dos limites por organização específicos de cada modelo. GPT-OSS 120B e 20B indicam atualmente 30 RPM, 1,000 RPD, 8,000 TPM e 200,000 TPD no Free. Ultrapassar um limite aplicável retorna HTTP 429.
Quais modelos de IA da Groq podem ser usados grátis?
O plano Free dá acesso ao catálogo compatível dentro dos tetos de cada modelo. Use modelos de produção quando a avaliação precisar se sustentar no tempo. Segundo a Groq, modelos preview servem para avaliação e podem ser descontinuados com pouca antecedência.
Quanto custa a Groq por mês?
Não existe uma assinatura pública mensal ou anual no self-service. Some mensalmente o uso de entrada, saída, áudio, ferramentas e níveis de serviço pelas tarifas atuais. A carga calculada de 100,000 chamadas ao GPT-OSS 120B custa $60 no modo síncrono, antes de cache ou ferramentas.
A Groq oferece desconto para estudantes?
A Groq não informa um desconto específico para estudantes nas páginas de preços e faturamento verificadas em agosto de 2026. Estudantes e outros usuários leves podem usar o plano Free geral de $0 dentro dos limites de uso.
Qual é a política de reembolso da Groq?
A Groq avalia solicitações gerais de reembolso de cobranças caso a caso por meio do suporte. Os Service Credits seguem regras mais rígidas: créditos comprados e promocionais não são reembolsáveis nem transferíveis e expiram após um ano, salvo quando houver outro prazo definido.
Os preços da Groq mudaram?
Sim. O Batch foi lançado com desconto de 25% sobre o preço síncrono em fevereiro de 2025 e hoje oferece 50%. A Groq reduziu os preços do GPT-OSS e acrescentou cache à família em outubro de 2025. Confira a página atual, pois o catálogo e as tarifas de cada modelo mudam.
Como os preços da Groq se comparam aos da OpenAI?
A OpenAI não oferece o GPT-OSS em sua própria API, então uma comparação direta mudaria o modelo. Em uma carga normalizada de GPT-OSS 120B, Groq, Together AI e Fireworks AI custam $27 por 100 milhões de tokens de entrada e 20 milhões de tokens de saída antes dos descontos de cache.
Receba o Mapa de Ferramentas de IA para Donos de Empresas
O Mapa de Ferramentas de IA para Donos de Empresas transforma preços de modelos em uma rota de adoção, com o patamar de qualidade, o papel operacional e o gatilho de custo que cada ferramenta precisa justificar. Assine para receber gratuitamente a próxima edição.
3 de set. de 2026







