GLM-5.2 Test: Warum GLM-5.3 Flash heute besser ist

Der GLM-5.2 Test zeigt Kosten, Benchmarks und Einsatzgebiete – und warum GLM-5.3 Flash für neue Coding-Workloads meist die bessere Wahl ist.

Thursday, September 3, 2026Omid Saffari
GLM-5.2 Test: Warum GLM-5.3 Flash heute besser ist

Der GLM-5.2 Test fällt heute anders aus: Das Modell bleibt ein Open-Weight-Coding-Modell mit 753 Milliarden Parametern und MIT-Lizenz, ist in der eigenen Modellfamilie aber nicht mehr der Preis-Leistungs-Sieger. GLM-5.3 Flash wird inzwischen mit $0.15 je Million Eingabe-Token und $0.50 je Million Ausgabe-Token gelistet. Beim GLM-5.2-Endpunkt von Cloudflare sind es dagegen $1.40 und $4.40. Zugleich bietet Flash native Bildverarbeitung und bei Cloudflare ein Kontextfenster mit 1,048,576 Token.

GLM-5.2 Test: Das Urteil

Für einen neuen gehosteten Workload ist GLM-5.2 keine sinnvolle Ausgangswahl mehr – es sei denn, eine bestehende Bereitstellung muss kompatibel bleiben oder eine ältere Evaluation exakt reproduziert werden. Für kostensensible KI-Agenten und multimodale Aufgaben ist GLM-5.3 Flash heute die bessere Standardoption. Wenn maximale Coding-Leistung wichtiger ist als die Tokenkosten, fällt die Wahl auf das vollständige GLM-5.3-Modell. GLM-5.2 überzeugt vor allem noch als stabile, selbst hostbare Referenz.

Diese Empfehlung ist eindeutiger als in der ursprünglichen Fassung dieses Tests. GLM-5.2 verbindet weiterhin freizügig lizenzierte Gewichte, ein langes Kontextfenster und glaubwürdige Coding-Leistung. Inzwischen hat Z.ai jedoch zwei Nachfolger veröffentlicht. Damit lautet die Entscheidung nicht mehr GLM-5.2 oder teures geschlossenes Modell, sondern meist Flash oder das vollständige GLM-5.3-Modell. GLM-5.2 bleibt nur dort sinnvoll, wo das Migrationsrisiko schwerer wiegt als die Einsparung.

Produktseite von Z.ai zu GLM-5.2
GLM-5.2 (Z.ai)

Seit dem 30. August 2026 unterstützt Cloudflare AI Search GLM-5.3 Flash als natives Generierungsmodell von Workers AI. Zum Einsatz kommen der Alias @cf/zai-org/glm-5.3-flash und ein Kontextfenster mit 1,048,576 Token. Flash steht damit in einem verwalteten Stack für Retrieval und Generierung bereit – nicht nur über Z.ai oder einen Coding-Tarif. Einrichtung und Kosten erklärt der Beitrag Cloudflare AI Search mit GLM-5.3 Flash.

Eine bestehende selbst gehostete GLM-5.2-Installation muss nicht allein wegen einer neuen Version umgestellt werden. Bei einem neuen gehosteten Einsatz lässt sich der Preisabstand dagegen kaum ignorieren: Der Listenpreis für die Ausgabe ist bei Flash 88.6% niedriger. Außerdem verarbeitet das Modell Bilder, Videos und Dateien nativ – GLM-5.2 kann das nicht.

Was ist GLM-5.2 eigentlich?

Z.ai veröffentlichte GLM-5.2 am 16. Juni 2026 als Engineering-Modell für lange Aufgabenketten. Die offizielle Model Card nennt 753 Milliarden Parameter, Text als Ein- und Ausgabe, offene Gewichte sowie Möglichkeiten zur lokalen Bereitstellung mit SGLang, vLLM, KTransformers, xLLM und Transformers. Das direkt über Z.ai angebotene Modell unterstützt einen Kontext von 1 Million Token und maximal 128K Ausgabe-Token. Der gehostete GLM-5.2-Endpunkt von Cloudflare hat einen anderen Rahmen und ist auf 262,144 Kontext-Token begrenzt.

Technisch machte bei der ursprünglichen Veröffentlichung vor allem IndexShare auf sich aufmerksam. Laut Launch-Beitrag von Z.ai zu GLM-5.2 wird ein schlanker Indexer über jeweils vier Sparse-Attention-Schichten hinweg wiederverwendet. Bei einem Kontext von 1 Million Token verringert sich der Rechenaufwand pro Token dadurch um den Faktor 2.9. Vereinfacht gesagt muss das Modell einen Teil der aufwendigen Suche durch einen riesigen Prompt nicht in jeder Schicht erneut ausführen. Das senkt die Betriebskosten bei langen Arbeitssitzungen in großen Repositorys.

GLM-5.3 ist der direkte Nachfolger für Coding-Aufgaben. Z.ai zufolge basiert das Modell auf demselben Basismodell wie GLM-5.2 und erzielt seine Verbesserungen durch zusätzliches Post-Training. GLM-5.3 Flash bildet einen anderen Zweig mit neuer Basis: 320 Milliarden Parameter insgesamt, davon 18 Milliarden aktiv, eine hybride Kombination aus Sparse Attention und Linear Attention sowie ein multimodaler Trainingskorpus mit 30 Billionen Token. Die aktuelle Dokumentation führt Videos, Bilder, Text und Dateien als Eingaben auf, dazu Text als Ausgabe, einen Kontext von 1 Million Token und maximal 128K Ausgabe-Token.

Die geringere Zahl aktiver Parameter ist vor allem wirtschaftlich relevant. Z.ai zufolge sind der Rechenaufwand für Attention um den Faktor 3.0 geringer und der Key-Value-Cache um den Faktor 4.4 kleiner als beim vollständigen GLM-5.3-Modell. Weniger Rechenleistung und Speicher pro Anfrage ermöglichen erst den deutlich niedrigeren Tokenpreis. Flash ist also nicht bloß GLM-5.2 unter neuem Namen: Das Modell verändert die Kostenstruktur im Betrieb und ergänzt natives visuelles Feedback für den Coding-Workflow.

Sowohl GLM-5.2 als auch GLM-5.3 Flash stehen weiterhin unter der MIT-Lizenz. Beide dürfen kommerziell genutzt, verändert und selbst gehostet werden. Damit gehören sie trotz der Kosten für gehosteten Zugriff und der Hardwareanforderungen dieser Modellgröße weiterhin in die Debatte über Open-Weight-Modelle.

Benchmarks richtig eingeordnet

Die ursprünglichen Benchmark-Ergebnisse von GLM-5.2 sind heute eine historische Referenz, keine aktuelle Rangliste. Im Launch-Material vom Juni berichtete Z.ai, dass GLM-5.2 im FrontierSWE rund einen Punkt hinter Claude Opus 4.8 lag, im PostTrainBench ebenfalls hinter Opus 4.8 rangierte und im SWE-Marathon einen Rückstand von 13 Punkten hatte. Für ein Open-Weight-Modell waren das starke Ergebnisse. Sie beschreiben jedoch die Modellauswahl vom Juni und die von Z.ai präsentierten Aufgaben.

Historischer FrontierSWE-Vergleich vom Juni 2026 zwischen GLM-5.2 und damaligen geschlossenen Modellen
Der ursprüngliche Launch-Vergleich von GLM-5.2 ist heute eine historische Momentaufnahme, keine aktuelle GLM-Rangliste.

Der neuere Vergleich verschiebt die Empfehlung. In der veröffentlichten Evaluation von GLM-5.3 Flash erreicht Flash im Terminal Bench 2.1 einen Wert von 84.3 gegenüber 81.0 für GLM-5.2, im DeepSWE v1.1 sind es 63.4 gegenüber 46.2 und im AutomationBench v1.0.6 48.8 gegenüber 26.2. Im Z.ai Code Bench v1.0 erzielt Flash bei maximalem Aufwand und mit Claude Code 2.1.207 einen Wert von 29.0; Opus 4.8 kommt auf 29.5.

Diese Zahlen sind hilfreich, stammen aber weiterhin vom Anbieter. Die öffentlichen Benchmarks weisen bei Coding- und Agentenaufgaben in dieselbe Richtung, während der private Code Bench von Z.ai kontrolliert wird. Belastbar ist daher folgende Aussage: In den von Z.ai veröffentlichten Workloads schlägt Flash GLM-5.2 und kommt in der hauseigenen Coding-Evaluation nahe an Opus 4.8 heran. Daraus folgt nicht, dass Flash bei Textarbeit, Analyse, Befolgen von Anweisungen oder in jedem produktiven Repository mit Opus gleichzieht.

GLM-5.2 Kosten: Was der Betrieb wirklich kostet

Die aktuellen Preisseiten machen GLM-5.2 für neue gehostete Workloads schwer vertretbar. Die folgenden Preise wurden am 30. August 2026 mit der aktuellen Preisseite von Z.ai und den aktuellen Workers-AI-Preisen von Cloudflare abgeglichen.

ModellEingabe / 1MZwischengespeicherte Eingabe / 1MAusgabe / 1M
GLM-5.2$1.40$0.26$4.40
GLM-5.3$1.40$0.26$4.40
GLM-5.3 Flash$0.15 Listenpreis, $0.075 Aktionspreis$0.03 Listenpreis, $0.015 Aktionspreis$0.50 Listenpreis, $0.25 Aktionspreis

Die Flash-Aktion gilt ausschließlich für die API von Z.ai und endet am 9. September 2026 um 24:00 Uhr (Singapur-Zeit, UTC+8). Cloudflare nennt die regulären Preise von $0.15 für die Eingabe, $0.03 für zwischengespeicherte Eingaben und $0.50 für die Ausgabe. Eine Cloudflare-Bereitstellung sollte nicht mit dem vorübergehenden Rabatt von Z.ai kalkuliert werden.

Ein einfacher Workload mit 1 Million Eingabe-Token und 1 Million Ausgabe-Token kostet mit GLM-5.2 oder dem vollständigen GLM-5.3-Modell insgesamt $5.80. Bei Flash sind es zum Listenpreis $0.65 und damit 88.8% weniger. Während der Z.ai-Aktion sinken die Kosten auf $0.325, also 94.4% weniger. Das Verhältnis zwischen Eingabe und Ausgabe fällt in der Praxis unterschiedlich aus, an der Entscheidung ändert das nichts: GLM-5.2 und GLM-5.3 liegen in derselben Preisstufe, Flash weit darunter.

GLM-5.2-API-Preise, Einstiegspreis des Coding Plan, Cache-Rabatt und Zahl der unterstützten Tools
Die GLM-5.2-Basispreise bleiben bei $1.40 für die Eingabe, $4.40 für die Ausgabe und $18 pro Monat für Coding Plan Lite; Flash wird separat berechnet.

Auch der GLM Coding Plan hat sich verändert. Lite kostet weiterhin $18 monatlich oder $12.60 pro Monat bei jährlicher Abrechnung und umfasst nun offiziell 10,000 Credits pro Woche. Pro kostet $80 monatlich oder $56 pro Monat bei jährlicher Abrechnung und bietet die 6-fache Nutzung von Lite. Max kostet $168 monatlich oder $117.60 pro Monat bei jährlicher Abrechnung und bietet die 14-fache Nutzung von Lite. Aufgeführt sind mehr als 20 Agenten-Tools, darunter Claude Code und ZCode; für die Einrichtung steht weiterhin der Befehl npx @z_ai/coding-helper bereit.

GLM-5.3 Flash steht allen Nutzern des Coding Plan zur Verfügung und bietet das 3-Fache des nutzbaren Kontingents des vollständigen GLM-5.3-Modells. Dadurch wird auch die Tarifwahl klarer: Lite ist der Einstieg, solange 10,000 Credits für die wöchentliche Arbeit ausreichen; darüber liefern die größeren Tarife mehr Kapazität. Wer diesen Tarif mit einem Frontier-Abonnement abwägt, findet im Preisleitfaden zu Claude Code den passenden Vergleich. Das vollständige GLM-5.3-Modell lohnt sich innerhalb des Tarifs nur dann, wenn sein stärkeres Coding-Profil den höheren Kontingentverbrauch rechtfertigt.

Ist GLM-5.2 kostenlos?

Die Modellgewichte dürfen unter der MIT-Lizenz kostenlos heruntergeladen und genutzt werden. Hugging Face stellt die Gewichte von GLM-5.2 bereit, Z.ai nennt zudem die unterstützten Frameworks für die lokale Inferenz. Dasselbe gilt für GLM-5.3 Flash.

Die benötigte Rechenleistung ist nicht kostenlos. GLM-5.2 umfasst 753 Milliarden Parameter, Flash insgesamt 320 Milliarden. Wer eines der beiden Modelle selbst hostet, betreibt also Infrastruktur – eine Abkürzung für den Laptop ist das nicht. Gehostetes GLM-5.2 kostet $1.40 je Million Eingabe-Token und $4.40 je Million Ausgabe-Token. Flash kostet zum Listenpreis $0.15 und $0.50; der vorübergehende Z.ai-Rabatt ist oben beschrieben.

Bei Cloudflare AI Search kommt eine weitere Unterscheidung hinzu. Während der offenen Betaphase ist AI Search innerhalb der veröffentlichten Grenzen kostenlos. Dazu gehören im Tarif Workers Free 20,000 Abfragen pro Monat und 500 gecrawlte Seiten pro Tag. Die Generierung mit Workers AI und die Nutzung von AI Gateway werden jedoch separat abgerechnet. Eine kostenlose Suchschicht macht die Generierungs-Token nicht kostenlos.

GLM-5.2 vs. GPT und Claude beim Programmieren

Entscheidend ist nicht mehr, ob GLM-5.2 in einzelnen Fällen an GPT oder Claude herankommt. Die eigentliche Frage lautet, ob ein offenes Modell, kalkulierbare Tokenkosten und native multimodale Eingaben den Einsatz in einem noch jungen Ökosystem rechtfertigen. GLM-5.3 Flash stärkt alle drei Argumente.

EntscheidungskriteriumGLM-5.2GLM-5.3 Flash
Cloudflare-Eingabe / 1M$1.40$0.15
Cloudflare-Ausgabe / 1M$4.40$0.50
Cloudflare-Kontext262,1441,048,576
Native EingabenTextText, Bild, Video, Datei
LizenzMITMIT

Gegenüber GPT und Claude punktet die GLM-Familie vor allem mit Kontrolle und Kosten. Die Gewichte lassen sich selbst hosten, während Flash umfangreiche Ausgaben deutlich günstiger macht. Wer dagegen einen einzelnen, ausgereiften Assistenten für Textarbeit, Analyse und Coding sucht, erhält bei den geschlossenen Frontier-Modellen weiterhin das unkompliziertere Gesamtpaket – statt für jeden Workload ein eigenes Modell auszuwählen.

Für reine Coding-Aufgaben darf das FrontierSWE-Ergebnis vom Juni nicht zum allgemeingültigen Urteil werden. Ein Rückstand von rund einem Punkt auf Opus 4.8 in einem historischen Benchmark bedeutete nie, dass GLM-5.2 überall gleich leistungsfähig war. Flash verbessert Kosten und Fähigkeiten, während das vollständige GLM-5.3-Modell beim gleichen API-Preis wie GLM-5.2 auf die schwierigsten Coding-Aufgaben zielt. Vor einer Änderung am produktiven Workflow bietet der Leitfaden zu Frontier-Coding-Modellen den breiteren Vergleich. Der Kimi-K3-Test stellt eine weitere Open-Weight-Alternative mit einem anderen Verhältnis von Kosten und Leistung vor.

Für wen sich das Modell lohnt – und für wen nicht

GLM-5.2 kann bleiben, wenn ein vorhandener selbst gehosteter Stack stabil läuft, eine Evaluation reproduzierbar bleiben muss oder eine Abhängigkeit genau dieses Verhalten voraussetzt. Eine funktionierende Bereitstellung wird nicht allein am Tag einer Neuveröffentlichung zur Fehlentscheidung.

Für neue Agenten mit hohem Volumen, visuelles Coding, Dokumentenarbeit oder die Generierung in Cloudflare AI Search ist GLM-5.3 Flash die bessere Wahl. Seine Listenpreise pro Token liegen bei knapp einem Neuntel der GLM-5.2-Preise, das Modell verarbeitet Bild- und Dateieingaben und bietet bei Cloudflare das größere Kontextfenster. Wenn bei komplexen Coding-Aufgaben die Leistung wichtiger ist als der Durchsatz, passt das vollständige GLM-5.3-Modell besser. Sein API-Preis entspricht dem von GLM-5.2, weshalb es kaum einen Grund gibt, einen neuen kostenpflichtigen GLM-5.2-Coding-Workload zum selben Preis aufzusetzen.

Eine Migration kann ausbleiben, wenn die Modellkosten bei einem leichten Workload kaum ins Gewicht fallen oder der Modellwechsel mehr Validierungsaufwand verursacht, als monatlich eingespart wird. Anbieter-Benchmarks ersetzen keine repräsentative Aufgabe aus dem eigenen Repository.

Der nächste sinnvolle Schritt ist konkret: Eine echte Repository-Aufgabe zunächst mit GLM-5.3 Flash ausführen und dabei Ausgabe-Token, Laufzeit sowie die nötigen Korrekturen erfassen. Anschließend folgt derselbe Durchlauf mit dem vollständigen GLM-5.3-Modell. Erfüllt Flash den eigenen Qualitätsanspruch, wird es zum Standard für Routineaufgaben; das vollständige Modell bleibt Eskalationen vorbehalten. Bei Cloudflare AI Search lässt sich @cf/zai-org/glm-5.3-flash als Generierungsmodell auswählen, während das Retrieval für den ersten Vergleich unverändert bleibt.

Ist GLM-5.2 chinesisch?

Ja. Laut Unternehmensgeschichte von Z.ai wurde ZhipuAI 2019 auf Grundlage von Technologie der Tsinghua University gegründet. Sowohl GLM-5.2 als auch GLM-5.3 Flash besitzen MIT-lizenzierte Gewichte. Teams mit strengen Anforderungen an den Datenstandort können daher Selbsthosting prüfen, statt Prompts an einen gehosteten Endpunkt zu senden.

Ist GLM-5.2 kostenlos?

Die MIT-lizenzierten Gewichte dürfen kostenlos heruntergeladen und genutzt werden. Gehostete Inferenz ist kostenpflichtig: Die aktuellen Preise liegen für GLM-5.2 bei $1.40 für die Eingabe und $4.40 für die Ausgabe je Million Token. Auch beim Selbsthosting entstehen durch Hardware und Betrieb reale Kosten.

Ist GLM-5.2 beim Programmieren besser als GPT?

Pauschal lässt sich das nicht behaupten. In den Launch-Daten von Z.ai aus dem Juni lag GLM-5.2 bei ausgewählten Coding-Benchmarks für lange Aufgaben nahe an führenden geschlossenen Modellen. In den später veröffentlichten Coding-Evaluationen von Z.ai haben GLM-5.3 und GLM-5.3 Flash das Modell jedoch überholt. Für GLM-5.2 sprechen heute vor allem die offenen Gewichte und die Kompatibilität – nicht eine aktuelle Spitzenposition bei der Leistung.

Lässt sich GLM-5.2 mit Claude Code nutzen?

Ja. Der GLM Coding Plan unterstützt Claude Code und mehr als 20 Agenten-Tools. GLM-5.3 Flash steht inzwischen allen Nutzern des Tarifs mit dem 3-Fachen des nutzbaren Kontingents des vollständigen GLM-5.3-Modells zur Verfügung. Für Routineaufgaben ist Flash damit das sinnvollere erste Modell.

Ob GLM-5.2 zur eigenen Umgebung passt, hängt meist davon ab, wie der Coding-Agent angebunden ist. Die Schritte, mit denen sich ein Agent ohne Bruch im Workflow auf ein günstigeres Modell umstellen lässt, habe ich in einer kostenlosen Einrichtungs-Checkliste für Claude Code und Codex zusammengefasst. Newsletter abonnieren, um sie zusammen mit der wöchentlichen Einschätzung zu erhalten, welche Modelle einen Wechsel wert sind.

Zuletzt aktualisiert

3. Sept. 2026

KategorieAI

Diese Seite in Google bevorzugen

omidsaffari.com als bevorzugte Quelle in der Google-Suche hinzufügen

Markieren Sie omidsaffari.com als bevorzugte Quelle, und Google hebt die Seite für Sie in Top Stories, AI Overviews und AI Mode hervor.

Newsletter

Ein Brief, jeden Sonntag. Funktionierende Systeme, keine heißen Takes.

Build-Logs, funktionierende Systeme und Feldnotizen aus einem Portfolio laufender KI-Ventures.

Wöchentlich. Kein Spam. Jederzeit abbestellbar.