Recensione GLM-5.2 (2026): il modello open weight che fa girare Claude Code alla metà del costo di Opus
Recensione di GLM-5.2 con prezzi, benchmark e confronto con GLM-5.3 Flash: quando conviene usarlo, migrarlo o eseguirlo in self-hosting nel 2026.

GLM-5.2 resta un modello open weight per il coding da 753 miliardi di parametri, con licenza MIT, ma non è più il riferimento per convenienza all'interno della sua famiglia. GLM-5.3 Flash ora costa $0.15 per milione di token in input e $0.50 per milione di token in output, contro $1.40 e $4.40 dell'endpoint GLM-5.2 di Cloudflare. In più, offre visione nativa e una finestra di contesto Cloudflare da 1,048,576 token.
Il verdetto
Per un nuovo workload in hosting, GLM-5.2 non è la scelta da cui partire, a meno che serva la compatibilità con un deployment esistente o la riproduzione esatta di una valutazione precedente. GLM-5.3 Flash è l'opzione predefinita migliore per gli agenti attenti ai costi e per il lavoro multimodale. Quando invece la massima resa nel coding conta più del costo dei token, conviene GLM-5.3 completo. Oggi GLM-5.2 ha soprattutto senso come baseline stabile da eseguire in self-hosting.
È una raccomandazione più netta rispetto alla prima versione di questa recensione. GLM-5.2 continua a unire pesi permissivi, contesto lungo e prestazioni credibili nel coding, ma Z.ai ha ormai rilasciato due successori. La scelta non è più fra GLM-5.2 e un costoso modello chiuso: nella maggior parte dei casi è fra Flash e GLM-5.3 completo. GLM-5.2 resta in gioco soltanto quando il rischio della migrazione vale più del risparmio.

Dal 30 agosto 2026, Cloudflare AI Search supporta GLM-5.3 Flash come modello nativo di generazione per Workers AI, con l'alias @cf/zai-org/glm-5.3-flash e una finestra di contesto da 1,048,576 token. Flash entra così in uno stack gestito di retrieval e generazione, non resta confinato a Z.ai o a un piano per il coding. Configurazione e costi sono analizzati in Cloudflare AI Search con GLM-5.3 Flash: come funziona.
Se un deployment GLM-5.2 in self-hosting funziona già, non serve migrare soltanto perché esiste una nuova versione. Per un nuovo deployment in hosting, però, il divario di prezzo è troppo ampio per ignorarlo: la tariffa di listino dell'output di Flash è inferiore dell'88.6% e il modello gestisce in modo nativo immagini, video e file, che GLM-5.2 non accetta.
GLM-5.2: che cos'è davvero
Z.ai ha rilasciato GLM-5.2 il 16 giugno 2026 come modello ingegneristico per attività di lunga durata. La sua model card ufficiale indica 753 miliardi di parametri, input e output testuali, pesi aperti e opzioni di deployment locale che comprendono SGLang, vLLM, KTransformers, xLLM e Transformers. Il modello fornito direttamente da Z.ai supporta un contesto da 1 milione di token e un output massimo di 128K token. L'endpoint GLM-5.2 in hosting su Cloudflare ha limiti diversi, con un contesto massimo di 262,144 token.
La caratteristica architetturale che aveva reso interessante il lancio originale è IndexShare. La pagina di lancio di GLM-5.2 di Z.ai spiega che un unico indicizzatore leggero viene riutilizzato ogni quattro layer di sparse attention, riducendo di 2.9 volte il calcolo per token con un contesto da 1 milione di token. In termini semplici, il modello evita di ripetere in ogni layer una parte della costosa ricerca all'interno di prompt enormi. Il risultato è un costo di servizio inferiore per le lunghe sessioni su repository.
GLM-5.3 è il successore diretto per il coding. Secondo Z.ai, usa lo stesso modello base di GLM-5.2 e ottiene i miglioramenti da un ulteriore post-training. GLM-5.3 Flash segue invece un ramo diverso, costruito su una nuova base: 320 miliardi di parametri totali, 18 miliardi di parametri attivi, attenzione ibrida sparse e lineare e un corpus multimodale di addestramento da 30 mila miliardi di token. La documentazione attuale elenca input video, immagine, testo e file, output testuale, un contesto da 1 milione di token e un output massimo di 128K token.
La minore quota di parametri attivi è il cambiamento che conta sul piano economico. Z.ai dichiara 3.0 volte meno calcolo per l'attenzione e una cache key-value 4.4 volte più piccola rispetto a GLM-5.3 completo. Sono proprio il calcolo e la memoria inferiori per richiesta a rendere possibile un prezzo per token molto più basso. Flash non è un GLM-5.2 con un'etichetta nuova: cambia l'economia del servizio e porta feedback visivo nativo nel ciclo di coding.
Sia GLM-5.2 sia GLM-5.3 Flash restano disponibili con licenza MIT. Possono essere usati a fini commerciali, modificati ed eseguiti in self-hosting. Per questo mantengono un posto nel panorama dei modelli open weight, anche se l'accesso in hosting e l'hardware necessario per modelli di queste dimensioni continuano ad avere un costo.
Come leggere davvero i benchmark
I benchmark originali di GLM-5.2 sono ormai una baseline storica, non una classifica attuale. Nel materiale di lancio di giugno, Z.ai riportava GLM-5.2 circa un punto dietro Claude Opus 4.8 su FrontierSWE, alle spalle di Opus 4.8 su PostTrainBench e con 13 punti di distacco su SWE-Marathon. Erano risultati solidi per un modello open weight, ma descrivevano l'offerta di giugno e i test scelti da Z.ai.

Il confronto più recente cambia la raccomandazione. Nella valutazione pubblicata da Z.ai per GLM-5.3 Flash, Flash ottiene 84.3 contro 81.0 di GLM-5.2 su Terminal Bench 2.1, 63.4 contro 46.2 su DeepSWE v1.1 e 48.8 contro 26.2 su AutomationBench v1.0.6. Su Z.ai Code Bench v1.0, al massimo livello di effort e con Claude Code 2.1.207, Flash raggiunge 29.0 contro 29.5 di Opus 4.8.
Sono dati utili, ma restano pubblicati dal vendor. I benchmark pubblici convergono nella stessa direzione per il coding e il lavoro con agenti, mentre il Code Bench privato è sotto il controllo di Z.ai. La conclusione difendibile è che Flash supera GLM-5.2 nei workload riportati da Z.ai e si avvicina a Opus 4.8 nella valutazione di coding interna dell'azienda. Non dimostra che Flash eguagli Opus nella scrittura, nell'analisi, nel rispetto delle istruzioni o su qualsiasi repository di produzione.
Quanto costa davvero
I listini attuali rendono difficile giustificare GLM-5.2 per un nuovo workload in hosting. Queste tariffe sono state verificate sulla pagina prezzi aggiornata di Z.ai e sul listino corrente di Workers AI di Cloudflare il 30 agosto 2026.
La promozione di Flash vale solo per l'API di Z.ai e termina alle 24:00 del 9 settembre 2026, nel fuso UTC+8 di Singapore. Cloudflare applica le tariffe standard di $0.15 per l'input, $0.03 per l'input in cache e $0.50 per l'output. Un deployment su Cloudflare non va quindi preventivato sulla base dello sconto temporaneo di Z.ai.
Per un workload semplice da 1 milione di token in input e 1 milione di token in output, GLM-5.2 o GLM-5.3 completo costa $5.80. Flash costa $0.65 a prezzo di listino, l'88.8% in meno. Durante la promozione di Z.ai costa $0.325, il 94.4% in meno. Nei casi reali cambierà la ripartizione fra input e output, ma non la sostanza della decisione: GLM-5.2 e GLM-5.3 condividono la stessa fascia di prezzo, mentre Flash si colloca molto più in basso.

Anche il GLM Coding Plan è cambiato. Lite resta a $18 al mese o $12.60 al mese con fatturazione annuale e ora include 10,000 crediti a settimana. Pro costa $80 al mese o $56 al mese con fatturazione annuale e offre 6 volte l'utilizzo di Lite. Max costa $168 al mese o $117.60 al mese con fatturazione annuale e offre 14 volte l'utilizzo di Lite. La pagina elenca più di 20 strumenti per agenti, fra cui Claude Code e ZCode, e fornisce ancora il comando di configurazione npx @z_ai/coding-helper.
GLM-5.3 Flash è disponibile per tutti gli utenti del Coding Plan e offre 3 volte la quota utilizzabile di GLM-5.3 completo. La scelta del piano diventa quindi più lineare: si parte da Lite se il lavoro settimanale rientra nei 10,000 crediti, poi si passa al livello superiore quando serve più capacità. La guida ai prezzi di Claude Code è il confronto utile per valutare questo piano rispetto a un abbonamento frontier. Nel piano, GLM-5.3 completo conviene solo quando il suo profilo di coding più forte giustifica il maggiore consumo di quota.
GLM-5.2 è gratis?
I pesi possono essere scaricati e usati gratuitamente con licenza MIT. Hugging Face ospita i pesi di GLM-5.2 e Z.ai elenca i framework supportati per l'inferenza locale. Lo stesso vale per GLM-5.3 Flash.
La capacità di calcolo non è gratuita. GLM-5.2 contiene 753 miliardi di parametri e Flash ne contiene 320 miliardi totali: eseguire uno dei due in self-hosting richiede un'infrastruttura vera, non è una scorciatoia da laptop. GLM-5.2 in hosting costa $1.40 per milione di token in input e $4.40 per milione di token in output. Flash costa $0.15 e $0.50 a prezzo di listino, con lo sconto temporaneo di Z.ai descritto sopra.
Cloudflare AI Search introduce un'altra distinzione. AI Search è gratuito durante la beta aperta entro i limiti pubblicati, che su Workers Free comprendono 20,000 query al mese e 500 pagine sottoposte a crawling al giorno; la generazione con Workers AI e l'uso di AI Gateway vengono però fatturati a parte. Un livello di ricerca gratuito non rende gratuiti i token di generazione.
GLM-5.2, GPT e Claude: quale AI per programmare?
La domanda utile non è più se GLM-5.2 possa occasionalmente avvicinarsi a GPT o Claude. Conta piuttosto quanto valgano, per il proprio caso d'uso, un modello aperto, costi per token prevedibili e input multimodali nativi, a fronte di un ecosistema più giovane. GLM-5.3 Flash rafforza tutti e tre questi argomenti.
Rispetto a GPT e Claude, i vantaggi più netti della famiglia GLM sono controllo e costo. I pesi possono essere eseguiti in self-hosting e Flash rende molto più economico produrre output in modo continuativo. I modelli frontier chiusi restano la scelta più semplice per chi vuole un unico assistente rifinito per scrittura, analisi e coding, anziché un modello selezionato per uno specifico workload.
Nel puro coding, il risultato FrontierSWE di giugno non va trasformato in un'affermazione universale. Il fatto che GLM-5.2 fosse circa un punto dietro Opus 4.8 in un benchmark storico non ha mai significato che i due fossero equivalenti ovunque. Flash migliora il rapporto fra costo e capacità, mentre GLM-5.3 completo punta ai compiti di coding più difficili allo stesso prezzo API di GLM-5.2. Prima di cambiare un workflow di produzione, per un confronto più ampio conviene partire dalla guida ai modelli frontier per il coding. La recensione di Kimi K3 esamina un'altra alternativa open weight, basata su un diverso equilibrio tra costo e prestazioni.
Chi dovrebbe usarlo e chi dovrebbe evitarlo
GLM-5.2 va mantenuto quando uno stack esistente in self-hosting è stabile, una valutazione deve restare riproducibile o una dipendenza è bloccata sul suo comportamento. Un deployment che funziona non diventa sbagliato il giorno in cui esce una nuova versione.
Per nuovi agenti ad alto volume, visual coding, lavoro sui documenti o generazione con Cloudflare AI Search, conviene GLM-5.3 Flash. Le sue tariffe di listino per token sono quasi un nono di quelle di GLM-5.2, accetta input visivi e file e offre una finestra di contesto Cloudflare più ampia. GLM-5.3 completo è invece adatto ai casi in cui le prestazioni nel coding complesso contano più del throughput; il prezzo API non cambia rispetto a GLM-5.2, quindi ci sono pochi motivi per avviare allo stesso costo un nuovo workload di coding a pagamento su GLM-5.2.
La migrazione non conviene se il workload è così leggero da rendere trascurabile il costo del modello, oppure se il cambio richiede più lavoro di validazione rispetto al risparmio mensile. I benchmark del vendor non sostituiscono una prova rappresentativa tratta dal proprio repository.
Il test da fare lunedì è concreto: eseguire una vera attività di repository con GLM-5.3 Flash, registrare i token di output, il tempo trascorso e le modifiche da correggere, quindi ripeterla con GLM-5.3 completo. Se Flash supera la soglia di qualità richiesta, può diventare il modello predefinito per il lavoro ordinario, riservando il modello completo alle escalation. Con Cloudflare AI Search, va selezionato @cf/zai-org/glm-5.3-flash come modello di generazione, lasciando invariato il retrieval nel primo confronto.
GLM-5.2 è cinese?
Sì. La storia aziendale di Z.ai indica che ZhipuAI è nata nel 2019 da una tecnologia della Tsinghua University. Sia GLM-5.2 sia GLM-5.3 Flash hanno pesi con licenza MIT, quindi i team con requisiti rigorosi sulla localizzazione dei dati possono valutare il self-hosting invece di inviare i prompt a un endpoint in hosting.
GLM-5.2 è gratis?
I pesi con licenza MIT possono essere scaricati e usati gratuitamente. L'inferenza in hosting è a pagamento: il listino attuale indica per GLM-5.2 $1.40 per l'input e $4.40 per l'output ogni milione di token. Hardware e gestione rendono comunque il self-hosting un costo concreto.
GLM-5.2 è migliore di GPT per il coding?
Non si può sostenerlo in generale. I dati del lancio di giugno di Z.ai collocavano GLM-5.2 vicino ai migliori modelli chiusi in alcuni benchmark selezionati di coding a lungo orizzonte, ma GLM-5.3 e GLM-5.3 Flash lo hanno poi superato nelle valutazioni di coding pubblicate da Z.ai. Oggi i motivi più forti per scegliere GLM-5.2 sono i pesi aperti e la compatibilità, non il primato nelle prestazioni.
Posso usare GLM-5.2 con Claude Code?
Sì. Il GLM Coding Plan supporta Claude Code e più di 20 strumenti per agenti. GLM-5.3 Flash è ora disponibile per tutti gli utenti del piano con 3 volte la quota utilizzabile di GLM-5.3 completo, quindi è il primo modello da provare per il lavoro ordinario.
Decidere se GLM-5.2 meriti un posto nel proprio setup dipende spesso da come è configurato l'agente di coding. Ho raccolto in una checklist gratuita per Claude Code e Codex i passaggi per indirizzare un agente verso un modello più economico senza compromettere il workflow. Iscriviti alla newsletter per riceverla, insieme all'analisi settimanale dei modelli per cui vale davvero la pena cambiare.
3 set 2026







