1M-Token-Kontext
Verarbeite große Repositories, dateiübergreifende Diffs, umfangreiche technische Spezifikationen und lange Agentenverläufe in einem kombinierten Kontextfenster mit 1M Token.
curl --request POST "https://gptproto.com/v1/chat/completions" \
--header "Authorization: Bearer $GPTPROTO_API_KEY" \
--header "Content-Type: application/json" \
--data '{
"model": "glm-5.3",
"messages": [
{
"role": "user",
"content": "Hello"
}
]
}'Chat, Coding-Agenten und Dokumentenarbeit. Preise pro 1 Mio. Tokens – Eingabe, gecachte Eingabe und Ausgabe werden separat abgerechnet. GPTProto liegt 10% unter den offiziellen Preisen.
| Szenario | Z-AI Liste | OpenRouter | GPTProto | Du sparst / Monat |
|---|---|---|---|---|
| Persönlich10 Mio. Tokens / Monat (4.8 Mio. im Cache) | $14.53 | $15.33 | $13.08 | −$1.45≈ $17.43 / Jahr |
| Team100 Mio. Tokens / Monat (48 Mio. im Cache) | $145.28 | $153.27 | $130.75 | −$14.53≈ $174.34 / Jahr |
| Business500 Mio. Tokens / Monat (240 Mio. im Cache) | $726.40 | $766.35 | $653.76 | −$72.64≈ $871.68 / Jahr |
Führe das neueste Reasoning-Modell von Z.ai über GPTProto aus – für Coding auf Repository-Ebene, Tool-gesteuerte Agenten, Terminal-Workflows und defensive Code-Reviews. GLM-5.3 bietet ein Kontextfenster mit 1M Token, unterstützt bis zu 128K Ausgabetoken und ermöglicht einen Reasoning-Aufwand von „low“, „high“ oder „max“.
1M-Token-Kontext
Verarbeite große Repositories, dateiübergreifende Diffs, umfangreiche technische Spezifikationen und lange Agentenverläufe in einem kombinierten Kontextfenster mit 1M Token.
128K-Ausgabe für lange Aufgaben
Erstelle umfangreiche Patches, Migrationspläne, strukturierte Berichte und mehrstufige Implementierungsergebnisse – mit einem architektonisch festgelegten Limit von 128K Completion-Tokens.
Steuerung des Reasoning-Modus
Reasoning bleibt aktiviert. Wähle „low“ für einfachere Aufgaben, „high“ für ausgewogene Tiefe oder „max“ – die Standardeinstellung – für anspruchsvolle Coding- und Agentenaufgaben.
Tool-Aufrufe und strukturierte Ausgaben
Nutze Function Calling, Caching von Kontexten, JSON-Ausgabe, Streaming-Antworten und gestreamte Tool-Argumente, um mehrstufige Agenten und automatisierte Engineering-Workflows zu erstellen.
Die GLM-5.3-API bietet programmatischen Zugriff auf Z.ai's neuestes Flaggschiff-Textmodell. Z.ai kündigte das Modell am 14. August 2026 an und stellte die Standard-API am 18. August bereit. GLM-5.3 verwendet dasselbe Basismodell wie GLM-5.2; die Leistungsverbesserungen resultieren aus erweitertem Post-Training für komplexe Softwareentwicklung, Terminalarbeit, Agenten mit langem Planungshorizont und defensive Cybersicherheitsaufgaben.
Dieses Modell verarbeitet Text als Eingabe und gibt Text aus. Es akzeptiert keine Bild-, Audio-, Video- oder PDF-Dateien als native Eingabe. Reasoning ist immer aktiviert und bietet die Aufwandsstufen low, high und max. Das Modell unterstützt Function Calling, strukturierte JSON-Ausgabe, Kontext-Caching, Streaming-Antworten und gestreamte Argumente für Tool-Aufrufe.
Auf GPTProto können Sie einen API-Schlüssel und ein Guthaben für GLM-5.3 und mehr als 200 weitere Modelle verwenden. So lassen sich Modelle einfacher per A/B-Test vergleichen, Fallbacks konfigurieren oder unterschiedliche Workloads weiterleiten – ohne für jedes Modell ein separates Anbieter-Konto und Guthaben verwalten zu müssen. Hintergrund zum Launch und bestätigte Updates finden Sie unter Was ist GLM-5.3?.
| Spezifikationen | GLM-5.3 |
|---|---|
| Anbieter | Z.ai (Zhipu AI) |
| Verfügbarkeit | Standard-API verfügbar |
| Veröffentlichungsdatum der API | 18. August 2026 |
| Basismodell | Dasselbe Basismodell wie GLM-5.2; Verbesserungen durch Post-Training |
| Eingabe / Ausgabe | Text / Text |
| Kontextfenster | 1.048.576 Tokens, einschließlich Eingabe und generierter Ausgabe |
| Maximale Ausgabe | 131.072 Tokens |
| Reasoning | Immer aktiviert |
| Reasoning-Aufwand | low, high, max; max ist die Standardeinstellung |
| Agentenfunktionen | Function Calling, Streaming, gestreamte Tool-Argumente, Kontext-Caching, strukturierte JSON-Ausgabe |
| Open-Weight-Status | Eine schrittweise Veröffentlichung ist geplant; am 21. August 2026 standen die Gewichte noch nicht zum Download bereit |
Programmierung auf Repository-Ebene: Geben Sie einem Agenten ausreichend Kontext, um Modulgrenzen, API-Verträge, Tests, Konfigurationen und dateiübergreifende Abhängigkeiten zu prüfen, bevor er eine Änderung vorschlägt oder umsetzt. Das große Ausgabelimit eignet sich für Patches, Testpläne und ausführliche Migrationsberichte.
Agenten-Workflows mit langem Planungshorizont: Nutzen Sie Function Calls und gestreamte Tool-Argumente für Abläufe, in denen eine Codebasis durchsucht, Befehle ausgeführt, Ergebnisse geprüft, ein Plan überarbeitet und die Arbeit fortgesetzt wird, bis die Akzeptanzkriterien erfüllt sind. Legen Sie den Reasoning-Aufwand je nach Aufgabe fest, anstatt für jede Anfrage den maximalen Aufwand zu verwenden.
Terminal- und Infrastrukturarbeit: Setzen Sie das Modell bei Build-Fehlern, der Diagnose von Umgebungen, Abhängigkeitskonflikten, CI-Fehlerbehebung und gezielten Performance-Untersuchungen ein. Regeln Sie Ausführungsberechtigungen, Timeouts und Validierungsvorgaben im umgebenden Agenten-Framework.
Defensive Code-Reviews: Prüfen Sie Authentifizierungsabläufe, Änderungen an Abhängigkeiten, Eingabevalidierung und riskante Kontrollpfade. Behandeln Sie Modellbefunde als Ansatzpunkte für Reproduktion und menschliche Prüfung – nicht als bestätigte Schwachstellen ohne entsprechende Belege.
Technische Analysen und strukturierte Berichte: Verarbeiten Sie umfangreiche textbasierte Spezifikationen, Protokolle, Issue-Verläufe und extrahierte Dokumentation und geben Sie anschließend JSON, Checklisten, Migrationspläne oder andere strukturierte Ausgaben für nachgelagerte Systeme zurück.
GLM-5.3 ist vor allem ein Upgrade des Post-Trainings und kein Nachfolger mit größerem Kontext. Beide Versionen bieten ein Kontextfenster mit 1 Mio. Tokens und bis zu 128K Tokens Ausgabe. Die praktischen Unterschiede sind bessere berichtete Ergebnisse beim Programmieren und bei Agentenaufgaben, eine höhere Effizienz beim Ausgabetoken-Verbrauch in Z.ai's interner Programmierbewertung, erzwungenes Reasoning und eine eingeschränktere Auswahl an Reasoning-Einstellungen. Eine aufgabenspezifische Orientierung finden Sie im vollständigen Vergleich von GLM-5.3 und GLM-5.2.
| Entscheidungsfaktor | GLM-5.3 | GLM-5.2 |
|---|---|---|
| Basismodell | Dasselbe Basismodell wie GLM-5.2, mit erweitertem Post-Training | Ursprüngliches Basismodell, das beide Versionen verwenden |
| Kontextfenster | 1 Mio. Tokens | 1 Mio. Tokens |
| Maximale Ausgabe | 128K Tokens | 128K Tokens |
| Reasoning-Verhalten | Immer aktiviert; low, high oder max |
Kann Reasoning überspringen und akzeptiert eine größere Auswahl an Aufwandsstufen |
| Z.ai Code Bench bei maximalem Aufwand | 34,5 % bei etwa 75K Ausgabetokens pro Aufgabe | 23,4 % bei etwa 96K Ausgabetokens pro Aufgabe |
| Terminal-Bench 3.0 | 28,3 | 4,6 |
| DeepSWE v1.1 | 66,9 | 46,2 |
| Am besten geeignet für | Anspruchsvolle Programmieraufgaben, lang laufende Agenten, Terminal-Aufgaben, defensive Code-Reviews | Stabile bestehende Integrationen, optionale Anfragen ohne Reasoning und aktuelles Self-Hosting |
Die Benchmarkwerte stammen von Z.ai und wurden von GPTProto nicht unabhängig reproduziert. Vergleichen Sie Modelle mit demselben Agenten-Framework, denselben Tools und Prompts, demselben Zeitbudget und denselben Akzeptanztests, bevor Sie den Produktionsverkehr umleiten.
Für den Wechsel von GLM-5.2 reicht es nicht aus, nur den Modellnamen zu ändern, wenn Ihre aktuelle Anfrage Reasoning deaktiviert oder von einer älteren Antwortverarbeitung ausgeht. Prüfen Sie den genauen Modellnamen und die unterstützten Anfragefelder im Tab „API Usage“ und führen Sie anschließend diese Prüfungen durch, bevor Sie Produktionsverkehr weiterleiten:
Entfernen Sie thinking.type: "disabled". GLM-5.3 erfordert, dass Reasoning aktiviert bleibt; verwenden Sie reasoning_effort: "low" für den leichtesten verfügbaren Modus.
Beschränken Sie den Reasoning-Aufwand auf low, high oder max. Die Standardeinstellung ist max, was für einfache Klassifizierungs-, Extraktions- oder Formatierungsaufgaben möglicherweise nicht nötig ist.
Wenn Sie Antworten streamen, verarbeiten Sie Reasoning-Inhalte getrennt von den endgültigen Antwortinhalten, statt jedes Delta als für Nutzer sichtbaren Text zu behandeln.
Aktivieren Sie für gestreamte Tool-Aufrufe sowohl das Streaming der Antwort als auch das Streaming der Tool-Argumente und setzen Sie die Funktionsargumente vor der Ausführung aus den Teilstücken zusammen.
Prüfen Sie die Sampling-Einstellungen. Z.ai nennt temperature: 1.0 und top_p: 0.95 als Standardwerte und empfiehlt, jeweils nur einen der beiden Parameter anzupassen.
Planen Sie das Kontextfenster korrekt: Eingabe und generierte Ausgabe müssen zusammen innerhalb des Limits von 1 Mio. Tokens bleiben; die Ausgabe ist auf 128K Tokens begrenzt.
Führen Sie einen Canary-Test mit echten Repositories und Tool-Schemas durch. Prüfen Sie den Aufgabenerfolg, ungültige Tool-Aufrufe, Latenz, Ausgabetoken-Verbrauch und Regressionstestergebnisse, bevor Sie den vollständigen Rollout starten.
Wählen Sie GLM-5.3, wenn die Aufgabe von einem Verständnis über mehrere Dateien hinweg, umfangreicher Tool-Nutzung, Interaktion mit dem Terminal oder wiederholten Planen-Ausführen-Überprüfen-Schleifen profitiert. Bei Aufgaben, für die eine Codegenerierung im ersten Durchlauf nicht ausreicht und der Agent Ergebnisse prüfen, nach fehlgeschlagenen Schritten weitermachen und auf ein messbares Ergebnis hinarbeiten muss, ist das Modell eine bessere Wahl als GLM-5.2.
Bleiben Sie bei GLM-5.2, wenn Ihre Anwendung Reasoning deaktivieren können muss, bereits über einen validierten Prompt- und Tool-Stack verfügt, der vom Upgrade nicht profitiert, oder wenn Sie heute herunterladbare Gewichte und einen veröffentlichten lokalen Deployment-Pfad benötigen. Wenn Sie unsicher sind, behalten Sie beide Modell-IDs in der Konfiguration und vergleichen Sie sie anhand derselben Aufgaben. Mit dem gemeinsamen Schlüssel und Guthaben von GPTProto lässt sich diese Bewertung einfacher durchführen, ohne ein weiteres Anbieter-Konto anzulegen.
Anleitungen, Vergleiche und Updates zu diesem Modell.
Alle Artikel
GLM-5.3 und GLM-5.2 im Vergleich: Benchmarks, Preise, Frontend-Coding und Agenten-Workflows. Gleicher Preis, gleiche Basis – aber beim Coding ist eines der Modelle 50 % besser. Hier erfahren Sie, welches Sie wählen sollten.

DeepSeek V4 Pro und V4 Flash im Vergleich: API-Preise, Coding- und Agenten-Benchmarks, Parallelitätslimits und Kosten pro Aufgabe. Finden Sie heraus, welches Modell zu Ihrer Arbeitslast passt.

Vergleichen Sie Preise, Modelle, Routing und multimodale APIs von OpenRouter und GPTProto. Erfahren Sie, wo GPTProto günstiger ist – und wo OpenRouter 2026 weiterhin die Nase vorn hat.

GLM-5.3 ist jetzt im Coding Plan von Z.ai verfügbar. Erfahren Sie mehr über den Veröffentlichungsstatus, den 1M-Kontext, die Reasoning-Modi, Preise, Verbesserungen und offene Fragen.