GLM-5.2 en 2026 : prix, performances et verdict face à GLM-5.3 Flash

Notre avis sur GLM-5.2 en 2026 : prix, benchmarks, licence MIT et comparaison avec GLM-5.3 Flash pour le code, les agents IA et l’auto-hébergement.

Thursday, September 3, 2026Omid Saffari
GLM-5.2 en 2026 : prix, performances et verdict face à GLM-5.3 Flash

GLM-5.2 reste un modèle de code open weight de 753 milliards de paramètres, sous licence MIT, mais il n’offre plus le meilleur rapport qualité-prix de sa propre gamme. GLM-5.3 Flash est désormais affiché à $0.15 par million de tokens en entrée et $0.50 par million de tokens en sortie, contre $1.40 et $4.40 pour l’endpoint GLM-5.2 de Cloudflare. Il ajoute en outre la vision native et une fenêtre de contexte Cloudflare de 1,048,576 tokens.

Notre verdict

Pour une nouvelle charge de travail hébergée, mieux vaut ne plus partir sur GLM-5.2, sauf si la compatibilité avec un déploiement existant ou la reproduction exacte d’une ancienne évaluation l’exige. GLM-5.3 Flash devient le choix par défaut pour les agents sensibles aux coûts et les usages multimodaux. La version complète de GLM-5.3 s’impose lorsque les performances maximales en programmation comptent davantage que le coût des tokens. GLM-5.2 conserve surtout son intérêt comme référence stable et auto-hébergeable.

Le verdict est plus tranché que lors de la publication initiale de ce test. GLM-5.2 associe toujours des poids sous licence permissive, un contexte long et des performances crédibles en programmation, mais Z.ai lui a depuis donné deux successeurs. Le choix ne se résume plus à GLM-5.2 face à un modèle fermé coûteux : il oppose généralement Flash à la version complète de GLM-5.3, GLM-5.2 ne restant pertinent que lorsque le risque d’une migration pèse plus lourd que les économies possibles.

Page produit de GLM-5.2 sur Z.ai
GLM-5.2 (Z.ai)

Depuis le 30 août 2026, Cloudflare AI Search prend en charge GLM-5.3 Flash comme modèle de génération natif de Workers AI, sous l’alias @cf/zai-org/glm-5.3-flash et avec une fenêtre de contexte de 1,048,576 tokens. Flash devient ainsi accessible au sein d’une pile managée de recherche et de génération, et plus seulement via Z.ai ou une offre de programmation. La configuration et ses conséquences sur les coûts sont détaillées dans Cloudflare AI Search avec GLM-5.3 Flash, en clair.

Il n’est pas nécessaire de migrer un déploiement GLM-5.2 auto-hébergé qui fonctionne simplement parce qu’une nouvelle version existe. Pour un nouveau déploiement hébergé, en revanche, l’écart de prix est trop important pour être ignoré : le tarif catalogue de Flash en sortie est inférieur de 88.6%, et le modèle accepte nativement les images, les vidéos et les fichiers, contrairement à GLM-5.2.

GLM-5.2 : de quel modèle s’agit-il ?

Z.ai a lancé GLM-5.2 le 16 juin 2026 comme modèle d’ingénierie conçu pour les tâches de longue durée. Sa fiche officielle indique 753 milliards de paramètres, des entrées et sorties texte, des poids ouverts et plusieurs solutions de déploiement local, dont SGLang, vLLM, KTransformers, xLLM et Transformers. Le modèle proposé directement par Z.ai prend en charge un contexte de 1 million de tokens et jusqu’à 128K tokens en sortie. L’endpoint GLM-5.2 hébergé par Cloudflare fonctionne dans un cadre différent, limité à 262,144 tokens de contexte.

IndexShare est la particularité architecturale qui avait distingué la version initiale. D’après la page de lancement de GLM-5.2 publiée par Z.ai, un indexeur léger est réutilisé toutes les quatre couches d’attention creuse. À 1 million de tokens de contexte, ce dispositif divise par 2.9 le calcul nécessaire pour chaque token. Autrement dit, le modèle évite de répéter dans chaque couche une partie de la recherche coûteuse effectuée sur un prompt immense. Les longues sessions sur un dépôt sont donc moins chères à servir.

GLM-5.3 lui succède directement pour la programmation. Z.ai indique qu’il repose sur le même modèle de base que GLM-5.2 et que ses progrès viennent d’un post-entraînement supplémentaire. GLM-5.3 Flash appartient à une autre branche, issue d’une nouvelle base : 320 milliards de paramètres au total, dont 18 milliards actifs, une attention hybride creuse et linéaire, ainsi qu’un corpus d’entraînement multimodal de 30 billions de tokens. Sa documentation actuelle mentionne des entrées vidéo, image, texte et fichier, une sortie texte, un contexte de 1 million de tokens et jusqu’à 128K tokens en sortie.

Cette empreinte active réduite est le changement qui compte sur le plan économique. Z.ai annonce 3.0 fois moins de calcul pour l’attention et un cache clé-valeur 4.4 fois plus petit que celui de la version complète de GLM-5.3. Réduire le calcul et la mémoire par requête permet précisément de proposer un tarif par token bien plus bas. Flash n’est donc pas un simple GLM-5.2 rebaptisé : il transforme l’économie du service et apporte un retour visuel natif à la boucle de programmation.

GLM-5.2 et GLM-5.3 Flash restent tous deux disponibles sous licence MIT. Leur usage commercial, leur modification et leur auto-hébergement sont autorisés. Ils gardent ainsi leur place parmi les modèles open weight, même si l’accès hébergé et le matériel nécessaire à l’exécution de modèles de cette taille restent payants.

Benchmarks : ce que disent réellement les résultats

Les benchmarks qui accompagnaient GLM-5.2 servent désormais de référence historique, pas de classement actuel. Dans ses documents de lancement de juin, Z.ai indiquait que GLM-5.2 terminait environ un point derrière Claude Opus 4.8 sur FrontierSWE, se classait derrière Opus 4.8 sur PostTrainBench et accusait 13 points de retard sur SWE-Marathon. Ces performances étaient solides pour un modèle open weight, mais elles décrivent la gamme de juin et les tâches choisies par Z.ai.

Comparatif historique de juin 2026 entre GLM-5.2 et les modèles fermés de la même période sur FrontierSWE
Le comparatif publié au lancement de GLM-5.2 est désormais un instantané historique, pas le classement actuel des modèles GLM.

Le comparatif le plus récent change la recommandation. Dans l’évaluation de GLM-5.3 Flash publiée par Z.ai, Flash obtient 84.3 contre 81.0 pour GLM-5.2 sur Terminal Bench 2.1, 63.4 contre 46.2 sur DeepSWE v1.1 et 48.8 contre 26.2 sur AutomationBench v1.0.6. Sur Z.ai Code Bench v1.0 au niveau d’effort maximal, exécuté avec Claude Code 2.1.207, Flash atteint 29.0 contre 29.5 pour Opus 4.8.

Ces chiffres sont utiles, mais ils restent publiés par le fournisseur. Les benchmarks publics vont dans le même sens pour la programmation et le travail agentique, tandis que le Code Bench privé est contrôlé par Z.ai. La conclusion défendable est donc la suivante : Flash dépasse GLM-5.2 sur les charges présentées par Z.ai et s’approche d’Opus 4.8 dans la propre évaluation de programmation de l’entreprise. Rien ne prouve pour autant que Flash égale Opus en rédaction, en analyse, en suivi d’instructions ou sur tous les dépôts de production.

Combien coûte-t-il réellement ?

Les pages tarifaires en vigueur rendent GLM-5.2 difficile à justifier pour une nouvelle charge hébergée. Ces prix ont été vérifiés le 30 août 2026 sur la page tarifaire actuelle de Z.ai et sur les tarifs Workers AI alors publiés par Cloudflare.

ModèleEntrée / 1MEntrée en cache / 1MSortie / 1M
GLM-5.2$1.40$0.26$4.40
GLM-5.3$1.40$0.26$4.40
GLM-5.3 Flash$0.15 tarif catalogue, $0.075 promotion$0.03 tarif catalogue, $0.015 promotion$0.50 tarif catalogue, $0.25 promotion

La promotion Flash est réservée à l’API de Z.ai et se termine à 24:00 le 9 septembre 2026, en heure de Singapour UTC+8. Cloudflare affiche les tarifs standards de $0.15 en entrée, $0.03 pour l’entrée en cache et $0.50 en sortie. Il ne faut donc pas établir le budget d’un déploiement Cloudflare à partir de la remise temporaire de Z.ai.

Pour une charge simple consommant 1 million de tokens en entrée et 1 million en sortie, GLM-5.2 ou la version complète de GLM-5.3 revient à $5.80. Flash coûte $0.65 au tarif catalogue, soit 88.8% de moins. Pendant la promotion Z.ai, le coût tombe à $0.325, soit une baisse de 94.4%. La répartition entre entrée et sortie variera en conditions réelles, mais pas la logique de décision : GLM-5.2 et GLM-5.3 occupent la même tranche tarifaire, bien au-dessus de Flash.

Tarification de l’API GLM-5.2, prix de départ du Coding Plan, remise liée au cache et nombre d’outils pris en charge
Le niveau de référence de GLM-5.2 reste fixé à $1.40 en entrée, $4.40 en sortie et $18 par mois pour Coding Plan Lite ; Flash dispose de sa propre tarification.

Le GLM Coding Plan a lui aussi évolué. Lite reste proposé à $18 par mois, ou $12.60 par mois avec une facturation annuelle, et comprend désormais 10,000 crédits par semaine. Pro coûte $80 par mois, ou $56 par mois avec une facturation annuelle, pour 6 fois l’usage de Lite. Max revient à $168 par mois, ou $117.60 par mois avec une facturation annuelle, pour 14 fois l’usage de Lite. La page répertorie plus de 20 outils agentiques, dont Claude Code et ZCode, et fournit toujours la commande de configuration npx @z_ai/coding-helper.

GLM-5.3 Flash est accessible à tous les abonnés du Coding Plan et offre 3 fois le quota utilisable de la version complète de GLM-5.3. Le choix de l’offre devient plus simple : commencez par Lite si 10,000 crédits couvrent votre semaine, puis montez en gamme si vous avez besoin de capacité. Pour comparer cette offre à un abonnement de modèle frontier, consultez le guide des tarifs de Claude Code. Dans le cadre du plan, ne choisissez la version complète de GLM-5.3 que si son meilleur profil en programmation justifie une consommation de quota plus élevée.

GLM-5.2 est-il gratuit ?

Les poids peuvent être téléchargés et utilisés gratuitement sous licence MIT. Hugging Face héberge les poids de GLM-5.2, et Z.ai répertorie les frameworks d’inférence locale compatibles. Il en va de même pour GLM-5.3 Flash.

La puissance de calcul, elle, n’est pas gratuite. GLM-5.2 compte 753 milliards de paramètres et Flash 320 milliards de paramètres au total : auto-héberger l’un ou l’autre relève donc d’un véritable projet d’infrastructure, pas d’un raccourci sur ordinateur portable. En mode hébergé, GLM-5.2 coûte $1.40 par million de tokens en entrée et $4.40 par million de tokens en sortie. Au tarif catalogue, Flash coûte respectivement $0.15 et $0.50, avant prise en compte de la remise temporaire de Z.ai décrite plus haut.

Cloudflare AI Search ajoute une distinction supplémentaire. AI Search est gratuit pendant sa bêta ouverte, dans les limites publiées, notamment 20,000 requêtes par mois et 500 pages explorées par jour avec Workers Free. La génération via Workers AI et l’utilisation d’AI Gateway sont toutefois facturées séparément. La gratuité de la couche de recherche ne rend pas les tokens de génération gratuits.

GLM-5.2 face à GPT et Claude pour coder

La bonne question n’est plus de savoir si GLM-5.2 peut parfois approcher GPT ou Claude. Il faut plutôt déterminer si un modèle ouvert, des coûts par token prévisibles et des entrées multimodales natives justifient d’adopter un écosystème plus jeune. GLM-5.3 Flash renforce chacun de ces trois arguments.

Critère de décisionGLM-5.2GLM-5.3 Flash
Entrée Cloudflare / 1M$1.40$0.15
Sortie Cloudflare / 1M$4.40$0.50
Contexte Cloudflare262,1441,048,576
Entrées nativesTexteTexte, image, vidéo, fichier
LicenceMITMIT

Face à GPT et Claude, les avantages les plus nets de la famille GLM sont le contrôle et le coût. Les poids peuvent être auto-hébergés, tandis que Flash réduit fortement le prix d’une production soutenue. Les modèles frontier fermés restent le choix le plus simple pour qui cherche un assistant unique et abouti, capable d’alterner rédaction, analyse et programmation, plutôt qu’un modèle retenu pour une charge précise.

Pour la programmation pure, il ne faut pas transformer le score FrontierSWE de juin en vérité universelle. Le retard d’environ un point de GLM-5.2 sur Opus 4.8 dans un benchmark historique n’a jamais signifié que les deux modèles étaient équivalents partout. Flash améliore le compromis entre coût et capacités, tandis que la version complète de GLM-5.3 vise les tâches de programmation les plus exigeantes au même tarif API que GLM-5.2. Avant de modifier un workflow de production, le guide des meilleurs modèles IA pour coder reste le meilleur point de départ pour une comparaison plus large. Le test de Kimi K3 présente une autre solution open weight, fondée sur un compromis différent entre coût et performances.

À qui convient-il, et qui devrait l’éviter ?

Conservez GLM-5.2 si une pile auto-hébergée existante est stable, si une évaluation doit rester reproductible ou si une dépendance est figée sur son comportement. Un déploiement qui fonctionne ne devient pas mauvais le jour où une nouvelle version sort.

Choisissez GLM-5.3 Flash pour de nouveaux agents à fort volume, la programmation visuelle, le traitement de documents ou la génération avec Cloudflare AI Search. Ses tarifs catalogue par token représentent presque un neuvième de ceux de GLM-5.2, il accepte les entrées visuelles et les fichiers, et sa fenêtre de contexte Cloudflare est plus grande. Optez pour la version complète de GLM-5.3 lorsque les performances sur du code complexe priment sur le débit. Son prix API étant inchangé par rapport à GLM-5.2, il reste peu de raisons de lancer une nouvelle charge de programmation payante sur GLM-5.2 au même tarif.

Une migration est inutile si la charge est si faible que le coût du modèle devient négligeable, ou si le changement impose davantage de validation que les économies mensuelles attendues. Les benchmarks des fournisseurs ne remplacent pas une tâche représentative tirée de votre propre dépôt.

L’action à mener dès lundi est simple : exécutez une tâche réelle de votre dépôt avec GLM-5.3 Flash, puis relevez les tokens de sortie, le temps écoulé et les modifications à corriger. Recommencez ensuite avec la version complète de GLM-5.3. Si Flash atteint votre seuil de qualité, adoptez-le par défaut pour le travail courant et réservez le modèle complet aux cas qui nécessitent une montée en gamme. Avec Cloudflare AI Search, sélectionnez @cf/zai-org/glm-5.3-flash comme modèle de génération et ne modifiez pas la recherche lors de ce premier comparatif.

GLM-5.2 est-il chinois ?

Oui. Selon l’histoire de l’entreprise publiée par Z.ai, ZhipuAI a été fondée en 2019 à partir de technologies de l’université Tsinghua. GLM-5.2 et GLM-5.3 Flash proposent tous deux des poids sous licence MIT. Les équipes soumises à des exigences strictes de localisation des données peuvent donc étudier l’auto-hébergement plutôt que d’envoyer leurs prompts à un endpoint hébergé.

GLM-5.2 est-il gratuit ?

Les poids sous licence MIT peuvent être téléchargés et utilisés gratuitement. L’inférence hébergée est payante : les tarifs actuels fixent GLM-5.2 à $1.40 en entrée et $4.40 en sortie par million de tokens. Le matériel et l’exploitation font également de l’auto-hébergement un coût bien réel.

GLM-5.2 est-il meilleur que GPT pour coder ?

On ne peut pas l’affirmer de manière générale. Les données de lancement publiées par Z.ai en juin plaçaient GLM-5.2 près des meilleurs modèles fermés sur une sélection de benchmarks de programmation à long horizon. Depuis, GLM-5.3 et GLM-5.3 Flash l’ont dépassé dans les évaluations de programmation publiées par Z.ai. Les principaux atouts actuels de GLM-5.2 sont ses poids ouverts et sa compatibilité, pas un statut de nouveau leader des performances.

Peut-on utiliser GLM-5.2 avec Claude Code ?

Oui. Le GLM Coding Plan prend en charge Claude Code et plus de 20 outils agentiques. GLM-5.3 Flash est désormais accessible à tous les abonnés avec 3 fois le quota utilisable de la version complète de GLM-5.3 : c’est donc le premier modèle à tester pour le travail courant.

La place de GLM-5.2 dans votre environnement dépend surtout de la manière dont votre agent de programmation est configuré. J’ai rassemblé dans une checklist gratuite les étapes pour connecter un agent à un modèle moins cher sans casser votre workflow Claude Code ou Codex. Abonnez-vous à la newsletter pour la recevoir, avec mon point hebdomadaire sur les modèles qui méritent réellement une migration.

Dernière mise à jour

3 sept. 2026

CatégorieAI

Préférez ce site dans Google

Ajouter omidsaffari.com comme source préférée dans la recherche Google

Marquez omidsaffari.com comme source préférée et Google le met en avant pour vous dans Top Stories, AI Overviews et AI Mode.

Newsletter

Une lettre, chaque dimanche. Des systèmes qui tournent, pas des hot takes.

Build logs, systèmes en production et notes de terrain d'un portefeuille de ventures IA.

Hebdomadaire. Pas de spam. Désabonnement à tout moment.