GLM-5.2 em 2026: preço, benchmarks e o veredito após o GLM-5.3 Flash
Entenda se o GLM-5.2 ainda vale a pena em 2026: preços atuais, benchmarks de programação, uso no Claude Code e comparação com o GLM-5.3 Flash.

O GLM-5.2 continua sendo um modelo de pesos abertos para programação, com 753 bilhões de parâmetros e licença MIT. Mas ele já não oferece o melhor custo-benefício nem dentro da própria família. O GLM-5.3 Flash agora tem preço de tabela de $0.15 por milhão de tokens de entrada e $0.50 por milhão de tokens de saída, contra $1.40 e $4.40 no endpoint do GLM-5.2 na Cloudflare. Além disso, traz visão nativa e uma janela de contexto de 1,048,576 tokens na Cloudflare.
Veredito
Não comece uma nova carga de trabalho hospedada no GLM-5.2, a menos que precise manter a compatibilidade com uma implantação existente ou reproduzir com exatidão uma avaliação antiga. Para agentes sensíveis a custo e trabalhos multimodais, o GLM-5.3 Flash é hoje a escolha mais indicada. Quando o desempenho máximo em programação pesa mais do que o custo dos tokens, prefira o GLM-5.3 completo. O papel mais coerente do GLM-5.2 agora é servir como uma base estável que pode ser hospedada em infraestrutura própria.
Essa recomendação é mais categórica do que a conclusão original desta análise. O GLM-5.2 ainda combina pesos abertos sob termos permissivos, contexto longo e desempenho confiável em programação, mas a Z.ai já lançou dois sucessores. A decisão deixou de ser entre o GLM-5.2 e um modelo fechado caro. Na maioria dos casos, a escolha agora é entre o Flash e o GLM-5.3 completo; o GLM-5.2 fica reservado para situações em que o risco da migração vale mais do que a economia.

Desde 30 de agosto de 2026, o Cloudflare AI Search oferece suporte ao GLM-5.3 Flash como modelo nativo de geração do Workers AI, usando o alias @cf/zai-org/glm-5.3-flash e uma janela de contexto de 1,048,576 tokens. Com isso, o Flash pode ser usado dentro de uma pilha gerenciada de recuperação e geração, e não apenas pela Z.ai ou por um plano de programação. As implicações para configuração e custo estão detalhadas em Cloudflare AI Search com GLM-5.3 Flash: como funciona.
Quem já mantém uma implantação própria e estável do GLM-5.2 não precisa migrar apenas porque surgiu uma versão nova. Para uma nova implantação hospedada, porém, a diferença de preço é grande demais para ser ignorada: o valor de tabela dos tokens de saída do Flash é 88.6% menor, e o modelo processa imagens, vídeos e arquivos que o GLM-5.2 não aceita de forma nativa.
O que é o GLM-5.2, na prática
A Z.ai lançou o GLM-5.2 em 16 de junho de 2026 como um modelo de engenharia para tarefas de longa duração. O model card oficial informa 753 bilhões de parâmetros, entrada e saída em texto, pesos abertos e opções de implantação local que incluem SGLang, vLLM, KTransformers, xLLM e Transformers. O modelo oferecido diretamente pela Z.ai comporta um contexto de 1 milhão de tokens e saídas de até 128K tokens. Já o endpoint do GLM-5.2 hospedado pela Cloudflare opera em outro limite, com contexto máximo de 262,144 tokens.
O recurso de arquitetura que chamou atenção no lançamento original foi o IndexShare. Segundo a página de lançamento do GLM-5.2 da Z.ai, um único indexador leve é compartilhado por grupos de quatro camadas de atenção esparsa. Isso reduz a computação por token por um fator de 2.9 quando o contexto chega a 1 milhão de tokens. Em termos simples, o modelo evita repetir, em todas as camadas, parte da busca custosa sobre um prompt enorme. Assim, sessões longas em repositórios ficam mais baratas de processar.
O GLM-5.3 é o sucessor direto para programação. A Z.ai afirma que ele usa o mesmo modelo-base do GLM-5.2 e obtém seus ganhos com pós-treinamento adicional. O GLM-5.3 Flash segue outro ramo, construído sobre uma base nova: são 320 bilhões de parâmetros no total, 18 bilhões de parâmetros ativos, atenção híbrida esparsa e linear e um corpus multimodal de treinamento com 30 trilhões de tokens. A documentação atual informa que o modelo aceita vídeos, imagens, textos e arquivos como entrada, gera texto e oferece um contexto de 1 milhão de tokens, com saída máxima de 128K tokens.
A quantidade menor de parâmetros ativos é a mudança que mais importa para o custo operacional. A Z.ai relata 3.0 vezes menos computação de atenção e um cache de chave-valor 4.4 vezes menor que o do GLM-5.3 completo. Essa redução no processamento e na memória por requisição viabiliza um preço por token muito mais baixo. O Flash não é apenas um GLM-5.2 rebatizado: ele muda a economia da inferência e adiciona feedback visual nativo ao ciclo de programação.
Tanto o GLM-5.2 quanto o GLM-5.3 Flash continuam disponíveis sob a licença MIT. É permitido usá-los comercialmente, modificá-los e hospedá-los em infraestrutura própria. Por isso, ambos seguem relevantes na discussão sobre modelos de pesos abertos, embora o acesso hospedado e o hardware necessário para executar modelos desse porte ainda tenham custo.
Benchmarks: como interpretar os resultados
O conjunto original de benchmarks do GLM-5.2 hoje funciona como uma referência histórica, não como uma classificação atual. No material de lançamento de junho, a Z.ai informou que o GLM-5.2 ficou cerca de um ponto atrás do Claude Opus 4.8 no FrontierSWE, abaixo do Opus 4.8 no PostTrainBench e 13 pontos atrás dele no SWE-Marathon. Eram resultados fortes para um modelo de pesos abertos, mas representam os modelos disponíveis em junho e as tarefas escolhidas pela própria Z.ai.

A comparação mais recente muda a recomendação. Na avaliação do GLM-5.3 Flash publicada pela Z.ai, o Flash marca 84.3 contra 81.0 do GLM-5.2 no Terminal Bench 2.1, 63.4 contra 46.2 no DeepSWE v1.1 e 48.8 contra 26.2 no AutomationBench v1.0.6. No Z.ai Code Bench v1.0, com esforço máximo e execução no Claude Code 2.1.207, o Flash alcança 29.0, enquanto o Opus 4.8 chega a 29.5.
Os números são úteis, mas continuam sendo publicados pelo fornecedor. Os benchmarks públicos apontam na mesma direção em tarefas de programação e agentes, enquanto o Code Bench privado é controlado pela Z.ai. A conclusão defensável é que o Flash supera o GLM-5.2 nas cargas divulgadas pela empresa e se aproxima do Opus 4.8 na avaliação de programação criada pela própria Z.ai. Isso não prova que o Flash iguala o Opus em escrita, análise, obediência a instruções ou em todos os repositórios usados em produção.
Quanto isso realmente custa?
Os preços atuais tornam difícil justificar o GLM-5.2 em uma nova carga hospedada. Os valores abaixo foram conferidos na página atual de preços da Z.ai e na tabela vigente do Workers AI da Cloudflare em 30 de agosto de 2026.
A promoção do Flash vale especificamente para a API da Z.ai e termina às 24:00 de 9 de setembro de 2026, no fuso UTC+8 de Singapura. Na Cloudflare, os preços publicados são os valores padrão de $0.15 para entrada, $0.03 para entrada em cache e $0.50 para saída. Portanto, não use o desconto temporário da Z.ai ao calcular o orçamento de uma implantação na Cloudflare.
Em uma carga simples com 1 milhão de tokens de entrada e 1 milhão de tokens de saída, o GLM-5.2 ou o GLM-5.3 completo custa $5.80. O Flash sai por $0.65 no preço de tabela, uma redução de 88.8%. Durante a promoção da Z.ai, o custo cai para $0.325, ou 94.4% menos. A proporção entre entrada e saída muda em cargas reais, mas a decisão permanece: GLM-5.2 e GLM-5.3 ocupam a mesma faixa de preço, enquanto o Flash fica muito abaixo.

O GLM Coding Plan também mudou. O Lite continua custando $18 por mês, ou $12.60 mensais na cobrança anual, e agora oferece 10,000 créditos por semana. O Pro custa $80 por mês, ou $56 mensais na cobrança anual, com 6 vezes o uso do Lite. O Max custa $168 por mês, ou $117.60 mensais na cobrança anual, com 14 vezes o uso do Lite. A página relaciona mais de 20 ferramentas de agentes, entre elas Claude Code e ZCode, e continua fornecendo o comando de configuração npx @z_ai/coding-helper.
O GLM-5.3 Flash está disponível para todos os assinantes do Coding Plan e oferece 3 vezes a cota utilizável do GLM-5.3 completo. Isso simplifica a escolha do plano: comece pelo Lite se o trabalho semanal couber em 10,000 créditos e suba de categoria quando precisar de mais capacidade. O guia de preços do Claude Code é a comparação mais útil para quem avalia esse plano diante de uma assinatura de modelo de ponta. Dentro do plano, escolha o GLM-5.3 completo apenas quando seu desempenho superior em programação compensar o consumo maior da cota.
O GLM-5.2 é gratuito?
Os pesos podem ser baixados e usados gratuitamente sob a licença MIT. O Hugging Face hospeda os pesos do GLM-5.2, e a Z.ai informa quais frameworks de inferência local são compatíveis. O mesmo vale para o GLM-5.3 Flash.
O processamento não é gratuito. O GLM-5.2 tem 753 bilhões de parâmetros, e o Flash soma 320 bilhões de parâmetros no total. Hospedar qualquer um deles por conta própria exige infraestrutura; não é um atalho para rodar o modelo em um notebook. Hospedado, o GLM-5.2 custa $1.40 por milhão de tokens de entrada e $4.40 por milhão de tokens de saída. O preço de tabela do Flash é $0.15 e $0.50, com o desconto temporário da Z.ai descrito acima.
O Cloudflare AI Search introduz outra diferença. O AI Search é gratuito durante o beta aberto, dentro dos limites publicados: no Workers Free, isso inclui 20,000 consultas por mês e 500 páginas rastreadas por dia. A geração no Workers AI e o uso do AI Gateway, porém, são cobrados à parte. Uma camada de busca gratuita não torna gratuitos os tokens de geração.
GLM-5.2 vs GPT e Claude para programação
A comparação relevante já não é saber se o GLM-5.2 consegue ocasionalmente chegar perto do GPT ou do Claude. A questão é se pesos abertos, custos previsíveis por token e entradas multimodais nativas compensam um ecossistema mais jovem. O GLM-5.3 Flash fortalece os três pontos.
Diante de GPT e Claude, as vantagens mais claras da família GLM são controle e custo. É possível hospedar os pesos por conta própria, e o Flash barateia bastante a geração contínua de saída. Os modelos fechados de ponta ainda são a opção mais simples para quem busca um único assistente bem-acabado para uma mistura de escrita, análise e programação, em vez de escolher um modelo para uma carga específica.
Em programação pura, não transforme o resultado de junho no FrontierSWE em uma afirmação universal. O fato de o GLM-5.2 ter ficado cerca de um ponto atrás do Opus 4.8 em um benchmark histórico nunca significou capacidade equivalente em todos os cenários. O Flash melhora a relação entre custo e capacidade, enquanto o GLM-5.3 completo mira os trabalhos de programação mais difíceis pelo mesmo preço de API do GLM-5.2. Antes de alterar um fluxo de produção, vale consultar o guia de modelos de ponta para programação para uma comparação mais ampla. O review do Kimi K3 apresenta outra alternativa de pesos abertos, construída sobre uma relação diferente entre custo e desempenho.
Para quem faz sentido — e quem deve evitar
Mantenha o GLM-5.2 se uma pilha existente em infraestrutura própria estiver estável, se uma avaliação precisar continuar reproduzível ou se alguma dependência estiver vinculada ao comportamento do modelo. Uma implantação que funciona não se torna errada no dia em que uma nova versão é lançada.
Escolha o GLM-5.3 Flash para novos agentes de grande volume, programação com recursos visuais, processamento de documentos ou geração no Cloudflare AI Search. Os preços de tabela por token ficam perto de um nono dos valores do GLM-5.2; além disso, o Flash aceita entradas visuais e arquivos e oferece a janela de contexto maior na Cloudflare. Prefira o GLM-5.3 completo quando o desempenho em programação complexa importar mais do que a capacidade de processamento. Como seu preço de API não mudou em relação ao GLM-5.2, quase não há motivo para iniciar uma nova carga paga de programação no GLM-5.2 pela mesma tarifa.
Não migre se a carga for tão leve que o custo do modelo seja irrelevante, ou se a troca exigir mais trabalho de validação do que a economia mensal justifica. Benchmarks de fornecedores não substituem uma tarefa representativa do seu próprio repositório.
O próximo passo para segunda-feira é objetivo: rode uma tarefa real do seu repositório no GLM-5.3 Flash, registre os tokens de saída, o tempo transcorrido e as correções necessárias; depois, repita o teste com o GLM-5.3 completo. Se o Flash atingir o nível de qualidade exigido, adote-o como padrão para a rotina e reserve o modelo completo para os casos mais exigentes. Se usar o Cloudflare AI Search, selecione @cf/zai-org/glm-5.3-flash como modelo de geração e mantenha a recuperação sem mudanças na primeira comparação.
O GLM-5.2 é chinês?
Sim. O histórico da empresa publicado pela Z.ai informa que a ZhipuAI foi fundada em 2019 a partir de tecnologia da Universidade Tsinghua. Tanto o GLM-5.2 quanto o GLM-5.3 Flash têm pesos sob licença MIT. Assim, equipes com exigências rigorosas sobre a localização dos dados podem avaliar a hospedagem própria em vez de enviar prompts a um endpoint hospedado.
O GLM-5.2 é gratuito?
Os pesos sob licença MIT podem ser baixados e usados gratuitamente. A inferência hospedada é paga: os preços atuais indicam $1.40 para entrada e $4.40 para saída por milhão de tokens no GLM-5.2. Hardware e operação continuam tornando a hospedagem própria um custo real.
O GLM-5.2 é melhor que o GPT para programação?
Não como afirmação geral. Os dados do lançamento de junho da Z.ai colocaram o GLM-5.2 perto dos principais modelos fechados em benchmarks selecionados de programação de longa duração, mas o GLM-5.3 e o GLM-5.3 Flash já o superaram nas avaliações de programação publicadas pela Z.ai. Hoje, os principais argumentos a favor do GLM-5.2 são os pesos abertos e a compatibilidade, não a liderança mais recente em desempenho.
Posso usar o GLM-5.2 com o Claude Code?
Sim. O GLM Coding Plan oferece suporte ao Claude Code e a mais de 20 ferramentas de agentes. O GLM-5.3 Flash agora está disponível para todos os assinantes do plano com 3 vezes a cota utilizável do GLM-5.3 completo, o que faz dele o melhor primeiro modelo para testar no trabalho rotineiro.
Decidir se o GLM-5.2 deve entrar na sua configuração quase sempre depende da forma como o agente de programação está conectado. Reuni as etapas para apontar um agente a um modelo mais barato sem quebrar o fluxo de trabalho em um checklist gratuito de configuração do Claude Code e do Codex. Assine a newsletter para recebê-lo e acompanhar, toda semana, quais modelos realmente valem a troca.
3 de set. de 2026







