Was ist GLM-5.3?
GLM-5.3 ist das neueste coding-orientierte Modell, das über Z.ais abonnementbasierten GLM Coding Plan verfügbar ist. Z.ai, früher bekannt als Zhipu AI, entwickelt die chinesische GLM-Familie aus Sprach-, Vision-, Bild-, Video- und Agentenmodellen.
Die aktuelle offizielle Dokumentation positioniert GLM-5.3 für Coding-Agenten und nicht für gewöhnliche Browser-Chats. Entwickler können es in Tools auswählen, die benutzerdefinierte Modelle unterstützen, darunter Claude Code, Goose, Codex und Cline. Z.ai erklärt außerdem, dass Coding-Plan-Anfragen an die früheren Routen glm-5.2 und glm-5.1 nun automatisch an GLM-5.3 weitergeleitet werden.
Folgendes lässt sich heute bestätigen:
| Punkt |
Bestätigter Status von GLM-5.3 |
| Entwickler |
Z.ai, früher Zhipu AI |
| Aktuelle Verfügbarkeit |
Im Z.ai GLM Coding Plan verfügbar |
| Modell-ID |
glm-5.3 |
| ID für erweiterten Kontext |
glm-5.3[1m] |
| Kontextoption |
Bis zu 1 Million Tokens über die Konfiguration [1m] |
| Reasoning-Aufwand |
Low, high und max; max ist die Standardeinstellung |
| Direkte Bildeingabe |
In der aktuellen Cline-Konfiguration deaktiviert |
| Standard-API-Preis |
Nicht veröffentlicht |
| Offene Gewichte und Lizenz |
Nicht veröffentlicht |
| Offizielle oder unabhängige Benchmarks |
Nicht veröffentlicht |
| GPT Proto-Verfügbarkeit |
Derzeit nicht verfügbar |
Diese Tabelle ist bewusst kürzer als die spekulativen GLM-5.3-Datenblätter, die online kursieren. Architektur, Parameteranzahl, Benchmark-Ergebnisse und eine Lizenz für offene Gewichte sind weiterhin unbekannt. Diese Angaben aus GLM-5.2 zu übernehmen, würde die Tabelle zwar eindrucksvoller machen, aber auch falsch.
Ist GLM-5.3 veröffentlicht? Erscheinungsdatum und Preview-Status
GLM-5.3 wurde innerhalb eines Produkts veröffentlicht: des GLM Coding Plan. Z.ais Leitfaden zum Modellwechsel zeigt nun „GLM-5.3 jetzt verfügbar“ und erklärt, dass Lite-, Pro- und Max-Abonnenten darauf wechseln können.
Ein genaues Veröffentlichungsdatum für GLM-5.3 gibt es weiterhin nicht. Z.ais allgemeine Release Notes enthalten noch keinen datierten GLM-5.3-Eintrag, während die Standard-Modellübersicht und die Seiten mit Tokenpreisen weiterhin GLM-5.2 hervorheben. Die sicherste Beschreibung lautet daher: ein stiller Start im Coding Plan und kein vollständiger öffentlicher Rollout.
Damit ändert sich auch das Verständnis des Begriffs „GLM-5.3 Preview“. Vor der Aktualisierung der Dokumentation war GLM-5.3 im Wesentlichen ein Suchbegriff zur Release-Beobachtung, gestützt durch Diskussionen in der Community. Jetzt ist es ein aufrufbares Coding-Plan-Modell mit offizieller ID. Unvollständig ist weiterhin die Dokumentation rund um das Modell – nicht seine Existenz innerhalb des Plans.
Für Produktionsteams ist diese Lücke wichtig. Eine Route kann aufrufbar sein, bevor Architektur, Abrechnung außerhalb eines Abonnements, Kapazitätsgrenzen, unabhängige Qualität und Bedingungen für Self-Hosting bekannt sind. Die Verfügbarkeit beantwortet die Frage „Kann ich es testen?“, aber noch nicht „Sollte ich damit ein Produktionsmodell ersetzen?“
Welche GLM-5.3-Funktionen sind bestätigt?
Optionaler Kontext mit 1 Million Tokens
Z.ai dokumentiert glm-5.3[1m] für Entwickler, die einen Kontext von 1 Million Tokens benötigen. In Claude Code muss bei der Einrichtung außerdem CLAUDE_CODE_AUTO_COMPACT_WINDOW auf 1000000 gesetzt werden.
Der Suffix ist relevant. Entwickler sollten nicht annehmen, dass jede Anfrage mit der einfachen Zeichenfolge glm-5.3 automatisch dieselbe Kontextkonfiguration erhält. Das lange Kontextfenster ist für große Repositories, lange Agentenverläufe, Migrationspläne und Debugging-Aufgaben über mehrere Dateien hinweg relevant. Der Preis dafür ist ein höherer Kontextverbrauch und möglicherweise längere Reasoning-Zyklen.
Eine Million Tokens garantiert außerdem nicht, dass sich ein Modell an jede Abhängigkeit gleich gut erinnert. Die Kontextkapazität misst, wie viel übermittelt werden kann. Abrufgenauigkeit, Beibehaltung von Einschränkungen und Stabilität von Tool-Schleifen müssen weiterhin auf Aufgabenebene getestet werden.
Niedriger, hoher und maximaler Reasoning-Aufwand
Der GLM Coding Plan ordnet verschiedene Tool-Einstellungen drei tatsächlichen Aufwandsstufen zu:
| Angeforderte Einstellung |
Verwendeter GLM-5.3-Aufwand |
minimal, light oder low |
Low |
medium oder high |
High |
xhigh, max oder ultra |
Max |
| Fehlende oder unbekannte Einstellung |
Standardmäßig Max |
Für kleine Änderungen und einfache Fragen ist ein niedriger Aufwand der sinnvollste Ausgangspunkt. High bildet die mittlere Stufe. Max ist für komplexe Programmier- und Agentenaufgaben gedacht, bei denen tieferes Reasoning wichtiger ist als Antwortkosten oder Latenz.
Derzeit misst kein offizieller GLM-5.3-Benchmark den Unterschied zwischen diesen Einstellungen. Betrachte den Aufwand als Testvariable und nicht als Qualitätsgarantie. Die aussagekräftigere Produktionskennzahl sind die Kosten pro akzeptierter Aufgabe nach Wiederholungen – nicht die Frage, ob jede Anfrage mit Max ausgeführt wurde.
Kompatibilität mit Coding-Agenten
Der offizielle Wechsel-Leitfaden listet drei Zugriffsmuster auf:
Claude Code und Goose verwenden den Anthropic-kompatiblen Endpunkt.
Codex verwendet den Endpunkt /api/v1 von Z.ai.
Cline und andere kompatible Tools können den OpenAI-ähnlichen Coding-Endpunkt verwenden.
Dies ist das deutlichste Signal für den aktuellen Zweck von GLM-5.3. Es wird als Modell für Codegenerierung, Debugging, Fragen zu Repositories und lang laufende Agentenaufgaben bereitgestellt – nicht als neuer multimodaler Assistent für Endverbraucher.
Textbasierter Zugriff, Vision bleibt getrennt
Z.ai weist Cline-Nutzer an, „Bilder unterstützen“ bei der Konfiguration von glm-5.3 zu deaktivieren. Der Coding Plan bietet Vision Understanding separat über einen Vision-MCP-Dienst an.
Einfach gesagt: Die aktuelle direkte GLM-5.3-Route sollte als Eingabe für Text und Code behandelt werden. Ein Screenshot kann zwar über einen anderen Dienst in einen umfassenderen Z.ai-Workflow gelangen, doch das belegt nicht, dass das zugrunde liegende Modell glm-5.3 Bilder nativ akzeptiert.
Dies ist eine der größten Lücken in der frühen Berichterstattung über GLM-5.3. Die Nachfrage der Community nach Vision-Funktionen ist real. Eine Feature-Anfrage ist jedoch keine ausgelieferte Modalität.
GLM-5.3 vs. GLM-5.2: Was wurde tatsächlich verbessert?
Die sichtbarste bestätigte Verbesserung betrifft das Routing: GLM-5.3 ist jetzt das standardmäßige aktuelle Modell innerhalb des Coding Plans, und frühere GLM-5.2-/5.1-Anfragen werden automatisch dorthin weitergeleitet. Z.ai hat noch nicht genügend technische Belege veröffentlicht, um die zugrunde liegende Qualitätsverbesserung zu quantifizieren.
| Bereich |
GLM-5.2 |
GLM-5.3 |
| Position im Coding Plan |
Vorheriges Modell |
Aktuelles Modell |
| Modell-ID |
glm-5.2 |
glm-5.3 |
| Kontext |
1 Mio. dokumentiert |
1-Mio.-Option dokumentiert |
| Reasoning-Konfiguration |
Flexibler Aufwand |
Low, High und Max dokumentiert |
| Architektur |
744B gesamt, 40B aktives MoE |
Nicht offengelegt |
| Offene Gewichte |
Unter MIT auf Hugging Face verfügbar |
Nicht veröffentlicht |
| Standardpreis der Z.ai-API |
$1,40 Eingabe / $4,40 Ausgabe pro 1 Mio. Tokens |
Nicht veröffentlicht |
| Veröffentlichte Coding-Ergebnisse |
Von Z.ai verfügbar |
Keine für 5.3 veröffentlicht |
| Direkte Bildkonfiguration |
Textorientiert |
Bildunterstützung in der aktuellen Einrichtung deaktiviert |
Z.ais GLM-5-Repository berichtet, dass GLM-5.2 im Terminal-Bench 2.1 81,0 und im SWE-bench Pro 62,1 Punkte erreicht hat. Außerdem wird berichtet, dass IndexShare die FLOPs pro Token bei einem Kontext von 1 Million Tokens um das 2,9-Fache reduziert und Änderungen am Speculative Decoding die Akzeptanzlänge um bis zu 20 % erhöht haben.
Das sind von Anbietern gemeldete Ergebnisse für GLM-5.2. Sie liefern eine Ausgangsbasis, aber keine Belege für GLM-5.3. Wir wissen noch nicht, ob 5.3 die Architektur verändert, neue Trainingsdaten hinzufügt, den Tool-Aufruf verbessert, Reasoning-Spuren verkürzt oder lediglich eine neuere Post-Training-Version derselben Familie darstellt.
Eine weitere Korrektur ist angebracht: In einigen frühen Artikeln wird GLM-5.2 als Modell mit 753 Milliarden Parametern bezeichnet. Z.ais aktuelles Repository und die Download-Tabelle führen es als 744B-A40B auf. Für einen Vergleich mit dem Vorgänger ist die offizielle Zahl die sicherere Angabe.
Entwickler, die ein dokumentiertes und derzeit zugängliches Mitglied derselben Familie benötigen, können die GLM-5.2-API auf GPT Proto verwenden, während sie auf eine verifizierte GLM-5.3-Route warten.
GLM-5.3-Preise: Was kostet es?
Auf die Frage nach den GLM-5.3-Preisen gibt es zwei unterschiedliche Antworten – je nachdem, ob mit „Preis“ das Coding-Plan-Abonnement oder eine standardmäßige Pay-per-Token-API gemeint ist.
GLM-Coding-Plan-Abonnement
Die Plan-Dokumentation von Z.ai nennt den Abonnementzugang ab 18 $ pro Monat. Zum Zeitpunkt der Prüfung zeigte die öffentliche Abonnementseite Aktionspreise von 12,60 $ für Lite, 56 $ für Pro und 117,60 $ für Max – gegenüber Listenpreisen von 18 $, 80 $ und 168 $. Aktionen können sich ändern; Teams sollten daher vor der Budgetplanung den Preis beim Checkout überprüfen.
| Plan |
Fünf-Stunden-Guthaben |
Wöchentliches Guthaben |
| Lite |
2.000 |
10.000 |
| Pro |
12.000 |
60.000 |
| Max |
28.000 |
140.000 |
Alle drei Pläne unterstützen GLM-5.3. Max kauft kein anderes Modell namens „GLM-5.3 Max“, sondern ein höheres Nutzungslimit.
Verbrauch von GLM-5.3-Guthaben
Die Übersicht des Coding Plans nennt für GLM-5.3 folgende Guthabenmultiplikatoren:
| Nutzungstyp |
Guthabenmultiplikator |
| Eingabetokens |
6,9 |
| Gecachte Eingabetokens |
1,7 |
| Ausgabetokens |
24 |
Z.ai berechnet während der dokumentierten Nebenzeiten die Hälfte des normalen Guthabensatzes. Das kann die von einem Abonnement unterstützte Arbeitsmenge erheblich verändern, aber Guthaben sind keine Dollar. Die Umrechnung dieser Multiplikatoren in einen erfundenen Preis pro Million Tokens würde zwei Abrechnungssysteme vermischen.
Standardpreis pro API-Token
Z.ai hat GLM-5.3 nicht auf seiner Standard-API-Preisseite aufgeführt. Die Seite bepreist GLM-5.2 derzeit mit 1,40 $ pro Million Eingabetokens, 0,26 $ pro Million gecachter Eingabetokens und 4,40 $ pro Million Ausgabetokens.
Diese Preise dürfen nicht auf GLM-5.3 angewendet werden. Sie dienen lediglich als Vergleichsbasis für den Vorgänger.
Ist „GLM-5.3 Max“ ein separates Modell?
Keine offizielle Quelle nennt derzeit ein separates Modell namens GLM-5.3 Max.
Das Wort „Max“ erscheint an zwei verschiedenen Stellen. Erstens ist Max die höchste Abonnementstufe des GLM Coding Plans mit 28.000 Guthaben pro Fünfstundenzeitraum und 140.000 Guthaben pro Woche. Zweitens ist max die tiefste dokumentierte Reasoning-Stufe für glm-5.3.
Eine Suche wie „GLM-5.3 Max vs. GLM-5.2 Max“ meint daher meist den Vergleich beider Versionen bei maximalem Reasoning-Aufwand. Sie belegt nicht die Existenz zweier separater, mit Max gekennzeichneter Modelle.
Dieser Vergleich lässt sich derzeit nicht zuverlässig durchführen. Für GLM-5.2 gibt es veröffentlichte Anbieter- und unabhängige Ergebnisse, für GLM-5.3 nicht. Ein fairer Test würde dasselbe Agenten-Setup, denselben Aufgabensatz, Kontext, dieselbe Aufwandsstufe, Wiederholungsrichtlinie und Akzeptanzkriterien erfordern. Eine aufpolierte Demo von 5.3 mit einem alten 5.2-Benchmark zu vergleichen, würde wenig aussagen.
GLM-5.3 vs. Kimi K3 vs. Claude Fable 5
GLM-5.3 wird bereits neben Kimi K3 und Claude Fable 5 diskutiert, weil alle drei anspruchsvolle Programmier- oder Langkontextaufgaben adressieren. Die verfügbare Evidenz ist jedoch nicht gleichwertig.
Deshalb gibt es für Suchanfragen wie „GLM-5.3 vs. Kimi K3“ oder „GLM-5.3 vs. Fable 5“ noch keinen evidenzbasierten Sieger.
| Modell |
Veröffentlichungsstatus |
Kontext |
Bildeingabe |
Standardpreis pro 1 Mio. Tokens |
Öffentliche unabhängige Ergebnisse |
| GLM-5.3 |
Im Coding Plan verfügbar; vollständige Release-Details unvollständig |
1-Mio.-Option |
In der aktuellen direkten Konfiguration deaktiviert |
Nicht veröffentlicht |
Noch nicht verfügbar |
| GLM-5.2 |
Vollständig veröffentlicht, mit offenen Gewichten |
1 Mio. |
Nein |
$1,40 Eingabe / $4,40 Ausgabe |
Verfügbar |
| Kimi K3 |
Vollständig veröffentlicht |
1 Mio. |
Ja |
$3 Eingabe / $15 Ausgabe |
Verfügbar |
| Claude Fable 5 |
Vollständig veröffentlicht, proprietär |
1 Mio. |
Ja |
$10 Eingabe / $50 Ausgabe |
Verfügbar |
Unabhängige Tests geben Kimi K3 derzeit einen Wert von 60 im Artificial Analysis Intelligence Index. Dieselbe Quelle verzeichnet Text- und Bildeingabe, einen Kontext von 1 Million Tokens und eine MoE-Architektur mit 2,8 Billionen Parametern und 104 Milliarden aktiven Parametern. Die offizielle Dokumentation von Anthropic nennt für Claude-Fable-5-Preise 10 $ pro Million Eingabetokens und 50 $ pro Million Ausgabetokens sowie einen Kontext von 1 Million Tokens.
Das aktuelle LMArena-Code-Ranking enthält ebenfalls Kimi K3 und Fable 5. GLM-5.3 wurde noch nicht aufgenommen. Bis es in reproduzierbaren Bewertungen erscheint, sind Behauptungen, GLM-5.3 übertreffe eines der beiden Modelle, Vorhersagen und keine Vergleiche.
Für Entwickler, die heute eine Entscheidung treffen:
Wähle GLM-5.2, wenn offene Gewichte und niedrigere dokumentierte Tokenkosten am wichtigsten sind.
Wähle Kimi K3, wenn du einen Kontext von 1 Mio. Tokens, Bildeingabe und eine starke, unabhängig gemessene Programmierleistung benötigst.
Wähle Fable 5, wenn die höchste dokumentierte Anthropic-Stufe wichtiger ist als die Tokenkosten.
Teste GLM-5.3, wenn du bereits einen Z.ai Coding Plan hast, behalte aber eine Ausweichlösung bei, bis Verhalten und Abrechnung zu deinem Arbeitsaufkommen passen.
GPT Proto bietet derzeit Kimi-K3-API-Zugriff für 2,70 $ Eingabe und 13,50 $ Ausgabe pro Million Tokens. Claude Fable 5 ist ebenfalls verfügbar für 8 $ Eingabe und 40 $ Ausgabe pro Million Tokens. Dies sind einsetzbare Alternativen, solange GLM-5.3 noch nicht im GPT Proto-Katalog verfügbar ist.
Kann man über GPT Proto auf GLM-5.3 zugreifen?
Nein. GLM-5.3 ist derzeit nicht auf GPT Proto verfügbar.
Sende glm-5.3 nicht an den GPT Proto-Endpunkt und bezeichne GPT Proto nicht als Anbieter von GLM-5.3. Entwickler, die heute eine GLM-Route benötigen, können stattdessen GLM-5.2 aufrufen. Die folgende Anfrage verwendet GPTPros bestehende OpenAI-kompatible API und die echte glm-5.2-Modell-ID:
curl "https://gptproto.com/v1/chat/completions" \
--header "Authorization: Bearer $GPTPROTO_API_KEY" \
--header "Content-Type: application/json" \
--data '{
"model": "glm-5.2",
"messages": [
{
"role": "user",
"content": "Review this implementation plan and identify the three highest-risk dependencies."
}
]
}'
Wenn GLM-5.3 verfügbar wird, sollte seine Live-Modellseite – nicht ein Gerüchtebeitrag – die maßgebliche Quelle für GPT Proto-Modellstring, Modalitäten, Kontext und Preis sein.
Du kannst auch die GPT Proto AI Model Gallery durchsuchen, um derzeit verfügbare Text-, Reasoning-, Bild-, Video- und multimodale Routen mit einem API-Schlüssel und einem Guthaben zu vergleichen.
Sollten Entwickler jetzt zu GLM-5.3 wechseln?
Wenn du bereits den Z.ai Coding Plan abonniert hast, ist GLM-5.3 jetzt einen Test wert. Durch das automatische Routing erhältst du es möglicherweise bereits, wenn du über dieses Produkt GLM-5.2 oder GLM-5.1 anforderst. Erfasse das aufgelöste Modell, die Aufwandsstufe, die Kontexteinstellung, den Tokenverbrauch, die Latenz, Wiederholungen und ob das Ergebnis die Prüfung bestanden hat.
Betrachte die Routing-Aktualisierung nicht als Beweis dafür, dass sich jede Arbeitslast verbessert hat. Ein neueres Coding-Modell kann Anweisungen besser befolgen und gleichzeitig mehr Ausgabe-Guthaben verbrauchen. Es kann schwierigere Aufgaben erledigen, aber bei maximalem Aufwand langsamer antworten. Die relevante Frage lautet nicht „Ist die Versionsnummer gestiegen?“, sondern „Ist akzeptierte Arbeit günstiger oder zuverlässiger geworden?“
Warte mit GLM-5.3 als Produktionsabhängigkeit, wenn du eines der folgenden Dinge benötigst:
Einen stabilen Pay-per-Token-API-Preis
Öffentliche Rate-Limits und Kapazitätszusagen
Herunterladbare Gewichte und eine bestätigte Lizenz
Native Bildeingabe über dieselbe Modellroute
Unabhängige Ergebnisse zu Coding, Agenten, Latenz und Durchsatz
Eine verifizierte GPT Proto-Modellseite und einen Endpunkt
Für ein Projekt, das heute ausgeliefert werden muss, solltest du ein dokumentiertes Modell verwenden und die Modell-ID konfigurierbar machen. So kannst du GLM-5.3 später bewerten, ohne die umgebende Anwendung neu zu schreiben.
Fazit
GLM-5.3 ist real und aufrufbar, aber sein Release ist begrenzter, als der Modellname vermuten lässt. Es ist derzeit das neueste Modell im GLM Coding Plan von Z.ai – mit einer dokumentierten Kontextoption von 1 Mio. Tokens, den Aufwandsstufen Low/High/Max und Kompatibilität mit mehreren Coding-Agenten.
Ebenso wichtig ist, was wir nicht haben: keinen datierten Startbeitrag, keine GLM-5.3-Model-Card, keinen Standardpreis pro Token, keine offenen Gewichte und keinen Benchmark-Bericht. Damit ist GLM-5.3 ein glaubwürdiger Kandidat für Evaluierungen, aber noch kein Modell, das sich fair nach den Kosten pro erfolgreicher Aufgabe gegen Kimi K3, Fable 5 oder sogar GLM-5.2 einordnen lässt.
Wenn du bereits für den Coding Plan zahlst, teste es. Wenn du jetzt eine dokumentierte API-Route benötigst, beginne mit GLM-5.2, Kimi K3 oder Claude Fable 5 und halte das Modell austauschbar.