Grok 4.5 vale a pena? O modelo de $2/$6 vence no custo, não no código

Grok 4.5 custa $2/$6 por milhão de tokens e prioriza eficiência. Veja benchmarks, limite de 200K e quando ele compensa para agentes de IA em produção.

Thursday, September 3, 2026Omid Saffari
Grok 4.5 vale a pena? O modelo de $2/$6 vence no custo, não no código

Grok 4.5 vale a pena quando o custo dos agentes e a eficiência de tokens pesam mais do que vencer todos os benchmarks. Ele custa $2 por milhão de tokens de entrada e $6 por milhão de tokens de saída, mas não é o novo líder em programação — e os prompts precisam ficar abaixo do salto de preço de 200K.

Grok 4.5 vale a pena? O veredito em uma tabela

Entre o modelo de programação mais barato e o líder dos benchmarks, Grok 4.5 é a escolha de melhor custo-benefício. Ele custa mais que o Composer 2.5 da Cursor, fica abaixo do Claude Fable 5 na maior parte do gráfico de engenharia da própria SpaceXAI e, ainda assim, é uma opção convincente para agentes de longa duração porque a saída custa $6, contra $50 do Fable dentro da Cursor.

Documentação do modelo Grok 4.5 da SpaceXAI com preços, recursos e formas de acesso
Documentação do modelo Grok 4.5

A comparação mais clara está na estrutura atual de cobrança da Cursor, que coloca modelos próprios e alternativas de ponta sob a mesma métrica. Todos os preços abaixo são por milhão de tokens.

Modelo na CursorMelhor paraEntradaLeitura de cacheSaídaVeredito
Grok 4.5Agentes de longa duração sensíveis a custo$2$0.50$6Melhor equilíbrio entre capacidade de ponta e custo do agente
Composer 2.5Programação rotineira pelo menor custo$0.50$0.20$2.50Escolha quando o preço importa mais que a capacidade máxima
Claude Fable 5Maior taxa de aprovação no conjunto de programação exibido$10$1$50Pague o adicional quando o custo das falhas superar o dos tokens
GPT-5.6 SolStacks de produção centradas na OpenAI$5$0.50$30A melhor integração ao ecossistema pode justificar a tarifa maior

Com uma carga mensal de 10 milhões de tokens novos de entrada e 2 milhões de tokens de saída, essas tarifas geram uma conta simples: $32 com Grok 4.5, $10 com Composer 2.5, $200 com Claude Fable 5 e $110 com GPT-5.6 Sol. A Cursor também cobra $0.25 por milhão de tokens para modelos de terceiros nos planos Teams e Enterprise, enquanto Grok e Composer, seus modelos próprios, ficam isentos.

É na Cursor, portanto, que a posição do Grok 4.5 fica evidente: não é o modelo mais barato nem o que alcança a maior pontuação, mas funciona como válvula de equilíbrio entre os dois extremos.

Página de modelos e preços da Cursor com as tarifas por token do Grok 4.5 e de modelos concorrentes
Preços dos modelos na Cursor

Esse é o veredito. O restante da decisão consiste em comprovar se a sua carga de trabalho está do lado certo dessa conta.

O que é o Grok 4.5 e onde ele está disponível

Grok 4.5 é um modelo de raciocínio voltado a programação, tarefas com agentes e trabalho de conhecimento — não apenas mais uma predefinição de chat. Cursor e SpaceXAI o descrevem como um modelo mixture-of-experts treinado em conjunto: a cada token, apenas um subconjunto selecionado de componentes especializados é ativado, em vez de a rede inteira trabalhar em todas as etapas.

O lançamento ocorreu em duas fases. A Cursor lançou o Grok 4.5 em 8 de julho, e a SpaceXAI apresentou o lançamento completo em 16 de julho. Segundo a Cursor, o conjunto de treinamento reuniu trilhões de tokens de interações entre agentes e desenvolvedores, além de tarefas STEM, artigos científicos e trabalhos de conhecimento mais amplos.

O ID atual do modelo é grok-4.5. Ele recebe texto e imagens, devolve texto, oferece uma janela de contexto de 500,000 tokens e permite esforço de raciocínio baixo, médio ou alto, com alto como padrão. As ferramentas nativas incluem chamadas de função, busca na web, busca no X e execução de código pelas APIs Responses ou Chat Completions.

A distribuição é excepcionalmente ampla para um modelo recém-lançado. Ele está disponível pela API da SpaceXAI, é o modelo padrão no Grok Build, funciona na Cursor em todos os planos, alimenta suplementos para Word, PowerPoint e Excel e também aparece em OpenRouter, Vercel, Cloudflare, Snowflake e Databricks Mosaic. Na Cursor, está presente no desktop, na web, no iOS, na CLI e no SDK.

Essa abrangência reduz o atrito de adoção, mas não elimina a necessidade de separar o modelo do produto que o envolve. O Grok 4.5 acessado diretamente pela API tem preço de cache diferente do Grok 4.5 dentro da Cursor, enquanto o Grok Build acrescenta um loop de agente sobre o modelo. A análise anterior da economia do Grok Build girava em torno de uma assinatura fixa. O Grok 4.5 muda essa discussão porque tanto o modelo quanto o agente agora têm caminhos de cobrança medidos com mais clareza.

Os benchmarks apontam valor, não liderança absoluta

Grok 4.5 vence um dos cinco benchmarks de engenharia exibidos pela SpaceXAI, quase empata com os líderes em outro e fica atrás do Claude Fable 5 nos três restantes. Chamá-lo de novo campeão da programação exige ignorar os próprios números do fornecedor.

BenchmarkGrok 4.5Melhor pontuação exibidaPosição do GrokSinal prático
DeepSWE 1.062.0%Fable 5 com 66.1%TerceiroCompetitivo, mas não o primeiro
DeepSWE 1.153%Fable 5 com 70%QuartoDiferença relevante de confiabilidade
SWE Marathon29.0%Grok 4.5 com 29.0%PrimeiroMelhor resultado em resolução de longo horizonte
Terminal Bench 2.183.3%Fable 5 com 84.3%Terceiro, 0.1 atrás do GPT-5.5Na prática, está no grupo da frente
SWE Bench Pro64.7%Fable 5 com 80.4%TerceiroÚtil, mas bem distante do líder

O gráfico de lançamento da SpaceXAI informa que os números dos concorrentes vêm de system cards dos fornecedores ou de rankings de benchmarks. Isso torna a tabela útil como orientação, mas não substitui uma avaliação voltada à sua carga de trabalho. Ambiente de execução, configuração de raciocínio, novas tentativas e orçamento de tokens podem alterar uma pontuação de programação o bastante para mudar uma decisão de compra.

As diferenças são concretas. O Grok fica 4.1 pontos atrás do Fable 5 no DeepSWE 1.0, 17 pontos no DeepSWE 1.1, 1 ponto no Terminal Bench 2.1 e 15.7 pontos no SWE Bench Pro. A vitória inequívoca está no SWE Marathon, em que seus 29.0% superam os 26.0% do Opus 4.8 e os 24.0% do Fable 5.

A alegação de eficiência é mais convincente. A SpaceXAI registra uma média de 15,954 tokens de saída do Grok por tarefa no SWE Bench Pro, contra 67,020 do Opus 4.8 max — cerca de 4.2 vezes menos. São dados publicados pelo fornecedor, mas apontam para a unidade econômica correta: uma tarefa concluída, não o preço de etiqueta de um token.

Uma medição independente mantém o veredito ancorado na realidade. A Artificial Analysis atribui ao Grok 4.5 a alta pontuação de 54, enquanto o GPT-5.5 xhigh marca 55. No preço combinado de cache/entrada/saída em proporção 7:2:1, o Grok custa $1.35 por milhão de tokens, contra $4.35 do GPT-5.5. A mesma comparação ao vivo mediu cerca de 70 tokens de saída por segundo para o Grok e aproximadamente 76 para o GPT-5.5.

A SpaceXAI anuncia 80 tokens de saída por segundo; o resultado independente fica perto de 70. A diferença não representa uma falha, mas lembra que a velocidade entregue varia e que a vazão do lançamento não é uma garantia de nível de serviço.

O veredito dos benchmarks é direto: o Grok 4.5 chega perto o bastante do desempenho de ponta para ser economicamente interessante, mas não é forte o suficiente para substituir um controle de qualidade por uma tabela de preços.

Quanto o Grok 4.5 realmente custa

O preço de destaque de $2/$6 do Grok 4.5 só é válido abaixo de 200,000 tokens de contexto. Ao cruzar esse limite, a SpaceXAI dobra as tarifas de entrada nova, entrada em cache e saída para a solicitação inteira.

API direta da SpaceXAIEntrada novaEntrada em cacheSaída
Contexto abaixo de 200K$2$0.30$6
Contexto de 200K ou mais$4$0.60$12

A diferença importa porque uma janela de contexto de 500,000 tokens descreve capacidade, não capacidade barata. Uma solicitação com 250K tokens de entrada e 50K tokens de saída custa $1.60 nas tarifas de contexto longo. Pelas tarifas de contexto curto, as mesmas quantidades custariam $0.80. O limite dobra a conta de tokens antes mesmo de considerar buscas na web, execução de código ou novas tentativas.

Salto no preço do Grok 4.5 abaixo e acima de 200K tokens de contexto
O limite de 200K dobra todas as tarifas diretas de tokens da solicitação.

O cache pode puxar a conta na direção oposta. Uma carga de trabalho com 10 milhões de tokens novos de entrada e 2 milhões de tokens de saída custa $32. Se metade dessa entrada vier do cache da API direta, o total cai para $23.50, uma economia de $8.50, ou cerca de 26.6%.

Essa economia não acontece sozinha. A SpaceXAI recomenda definir prompt_cache_key na Responses API, ou x-grok-conv-id no Chat Completions, para encaminhar uma conversa ao mesmo servidor. Sem isso, um servidor com cache frio pode transformar acertos esperados em entradas cobradas pelo preço integral.

O uso de ferramentas cria um segundo medidor. Busca na web, busca no X e execução de código custam, cada uma, $5 a cada 1,000 chamadas. Uma execução que faça 25 dessas chamadas acrescenta $0.125 antes dos tokens que os modelos usam por trás delas. A busca em anexos custa $10 a cada 1,000 chamadas, enquanto a busca em coleções custa $2.50 a cada 1,000.

O que costuma dar errado em produção

A primeira falha em produção é uma mudança silenciosa de preço, não a inteligência do modelo. Um prompt com o repositório inteiro passa aos poucos de 200K, todos os tokens da solicitação migram para a tarifa de contexto longo e a projeção baseada no destaque de $2/$6 fica errada de uma só vez.

A segunda é o otimismo com o cache. Turnos repetidos de um agente parecem ideais para cache, mas só recebem a tarifa direta de $0.30 para entrada em cache quando o roteamento permite reutilizar o prefixo anterior. A recomendação explícita da SpaceXAI para usar uma chave de cache precisa entrar no desenho de cobrança desde a primeira solicitação.

A terceira é o acúmulo de contexto. Agentes de longa duração releem planos, saídas de ferramentas, diffs, testes e explicações anteriores a cada turno. A janela de 500,000 tokens adia o problema; ela não torna sensato carregar todo turno antigo. A SpaceXAI recomenda compactar o contexto em loops longos, substituindo detalhes obsoletos por um estado de trabalho menor antes que o agente atinja o salto de preço ou perca atenção dentro do próprio histórico.

A quarta é usar benchmarks do fornecedor como critério de liberação. Os resultados exibidos do Grok 4.5 vão do primeiro lugar no SWE Marathon a uma diferença de 17 pontos para o Fable 5 no DeepSWE 1.1. A qualidade em produção dependerá do seu repositório, ambiente de execução, cobertura de testes, permissões de ferramentas e definição de sucesso.

A quinta é a disponibilidade na plataforma. A página atual do Grok 4.5 na Cursor informa que o modelo ainda não está disponível na União Europeia por esse canal. É uma limitação da Cursor, não uma prova de que todas as formas de acesso da SpaceXAI estejam bloqueadas, mas já basta para impedir que uma equipe da UE planeje hoje uma migração para ele dentro da Cursor.

Quem deve usar o Grok 4.5 — e quem deve evitá-lo

Use o Grok 4.5 em loops de agentes sensíveis a custo, que permaneçam abaixo de 200K e consigam verificar o próprio trabalho. Evite-o quando a maior taxa de aprovação exibida em programação justificar o adicional, quando o Composer 2.5 já for suficiente ou quando os usuários da Cursor estiverem na UE.

Sua situaçãoEscolhaPor quêO que muda a escolha
Agente de API de longa duração, com prompts abaixo de 200KGrok 4.5$2 de entrada, $0.30 de entrada em cache e $6 de saídaO Fable produz falhas a menos em quantidade suficiente para compensar o adicional
Programação rotineira na Cursor com teto rígido de custosComposer 2.5$0.50 de entrada e $2.50 de saídaA taxa de aprovação do Grok reduz as novas tentativas o bastante para compensar a tarifa maior
Falhar custa muito mais que os tokensClaude Fable 5Lidera quatro dos cinco benchmarks exibidosO Grok se iguala a ele no seu conjunto representativo de tarefas
Você precisa da variante Fast indicada na CursorGrok 4.5 FastDisponível por $4 de entrada e $18 de saídaO Grok padrão atinge a meta de latência
Uma solicitação passa regularmente de 200KCompacte ou redirecione primeiroAs tarifas diretas do Grok dobram para a solicitação inteiraO contexto longo elimina custos de recuperação ou orquestração suficientes para compensar a diferença
Os usuários da Cursor estão na UEEspere ou escolha um modelo disponívelA Cursor informa que o Grok 4.5 não está disponível nessa regiãoA Cursor altera o status regional
Mapa de decisão entre Grok 4.5, Fable 5, Composer 2.5 ou esperar
A escolha muda conforme o custo do agente, o valor da taxa de aprovação, a categoria de velocidade, o tamanho do contexto e a região.
O ponto forte
O que faz bem
4 points

  • O preço de $2 para entrada e $6 para saída torna o trabalho de agentes próximo da fronteira substancialmente mais barato que Fable 5 ou GPT-5.6 Sol na Cursor.
  • Uma janela de contexto de 500,000 tokens abre espaço para repositórios consideráveis e históricos longos de tarefas.
  • Chamadas de função, busca na web, busca no X, execução de código, saída estruturada e duas superfícies de API padrão reduzem o trabalho de integração.
  • Os dados do fornecedor mostram uma vitória real no SWE Marathon e uso muito menor de tokens de saída que o Opus 4.8 max no SWE Bench Pro.
O ponto fraco
Onde deixa a desejar
4 points

  • O Grok 4.5 não lidera quatro dos cinco benchmarks de engenharia no gráfico da própria SpaceXAI.
  • As tarifas da API direta dobram para todos os tokens quando a solicitação chega a 200K de contexto.
  • Uma economia confiável com cache exige disciplina explícita de roteamento.
  • A velocidade independente fica abaixo da alegação do fornecedor de 80 tokens por segundo, e a Cursor revelou contaminação em um benchmark excluído.

Como fazer uma avaliação segura

O teste de adoção correto compara trabalho concluído sob um padrão de qualidade controlado, não prompts isolados. Mantenha idênticos entre os modelos o conjunto de tarefas, o executor do agente, as permissões de ferramentas e as verificações de aceitação.

  1. Congele um conjunto representativo de tarefas

    Escolha tarefas reais do trabalho que você pretende delegar: uma correção de bug com testes, uma mudança em todo o repositório, uma pesquisa que use ferramentas e um documento ou uma planilha, caso sejam relevantes. Defina aprovação e reprovação antes que qualquer modelo veja as tarefas.

  2. Controle o raciocínio e o contexto

    Use a mesma configuração de raciocínio em todas as execuções do Grok, registre o tamanho exato do prompt e separe tarefas abaixo de 200K daquelas com contexto longo. Não permita que um modelo veja arquivos extras nem receba outro orçamento de ferramentas.

  3. Torne o cache mensurável

    Defina prompt_cache_key ou x-grok-conv-id para conversas repetidas. Registre separadamente a entrada nova e a entrada em cache para que a comparação de custos reflita uma conta reproduzível.

  4. Decida pela economia da tarefa concluída

    Registre taxa de aprovação, correções humanas, novas tentativas, total de tokens, chamadas de ferramentas e tempo decorrido. Adote o Grok somente quando o custo por resultado aceito ficar abaixo do modelo atual sem reduzir o padrão de liberação.

Para um fundador com investimento, esse critério pode ser o tempo de revisão dos desenvolvedores. Para o CTO de uma empresa de médio porte, podem ser os defeitos que chegam à produção e a auditabilidade. Para um operador sênior, pode ser a capacidade de uma planilha de Excel ou de um material de pesquisa resistir à checagem dos fatos. Para quem constrói sozinho, em geral a questão é se a tarifa menor compra mais trabalho concluído sem criar um segundo emprego revisando o agente.

Perguntas frequentes

O Grok 4.5 é bom?

Sim, quando você precisa de boa capacidade de agentes por um custo menor de tokens. Ele não é a opção padrão mais segura para obter a máxima precisão em programação: o Fable 5 lidera quatro dos cinco benchmarks de engenharia exibidos pela SpaceXAI, enquanto a vitória mais clara do Grok está no trabalho de longo horizonte com boa eficiência de custo.

Quanto custa o Grok 4.5?

A API direta da SpaceXAI custa $2 por milhão de tokens novos de entrada, $0.30 por milhão de tokens de entrada em cache e $6 por milhão de tokens de saída abaixo de 200K de contexto. Em 200K ou mais, as tarifas passam a $4, $0.60 e $12 para a solicitação inteira. Na Cursor, os valores informados no pool próprio são $2 para entrada, $0.50 para leitura de cache e $6 para saída.

Onde posso usar o Grok 4.5?

A SpaceXAI documenta acesso por sua API, Grok Build, Cursor, Word, PowerPoint, Excel, OpenRouter, Vercel, Cloudflare, Snowflake e Databricks Mosaic. A Cursor oferece suporte no desktop, na web, no iOS, na CLI e no SDK, mas atualmente informa que ele não está disponível na União Europeia.

Quer o checklist de configuração do Claude Code + Codex? Receba pela newsletter.

Última atualização

3 de set. de 2026

CategoriaAI

Prefira este site no Google

Adicionar omidsaffari.com como fonte preferida na Busca do Google

Marque omidsaffari.com como fonte preferida e o Google destaca o site para você em Top Stories, AI Overviews e AI Mode.

Newsletter

Uma carta, todo domingo. Sistemas que funcionam, não hot takes.

Build logs, sistemas em produção e notas de campo de um portfólio de ventures de IA.

Semanal. Sem spam. Cancele quando quiser.