Preise+7% Bonus

Was ist GLM-5.3 Flash? OxAlpha, Preise, Videoeingabe und Benchmarks

GLM-5.3 Flash ist das multimodale OxAlpha-Modell von Z.ai. Erfahre mehr über Veröffentlichungsdatum, Videoeingaben, Benchmarks, Grenzen, Vergleiche und den 90 % niedrigeren Preis von GPTProto.

Was ist GLM-5.3 Flash? OxAlpha, Preise, Videoeingabe und Benchmarks

Der Name „Flash“ lässt dieses Modell wie eine abgespeckte Version von GLM-5.3 klingen. Das hat Z.ai jedoch nicht veröffentlicht.

GLM-5.3 Flash ist ein neues Mixture-of-Experts-Modell mit 320 Milliarden Parametern, von denen pro Token etwa 18 Milliarden aktiviert werden. Außerdem ist es das erste GLM-5-Modell, das als natives multimodales System trainiert wurde und neben Text auch Bilder, Videos und Dateien akzeptiert. Z.ai veröffentlichte es am 26. August 2026, nachdem es anonym unter dem Namen OxAlpha getestet worden war.

Kurz gesagt: GLM-5.3 Flash ist der kostengünstigere, multimodale Zweig der GLM-5-Familie – keine Geschwindigkeitseinstellung für GLM-5.3 und auch nicht Z.ais neues Text-Flaggschiff. Besonders attraktiv sind das Kontextfenster mit einer Million Tokens, die offenen Gewichte und der Listenpreis von 0,15 $ pro Million Eingabe-Tokens und 0,50 $ pro Million Ausgabe-Tokens. GLM-5.3 Flash auf GPTProto wird derzeit zu 10 % dieser Standardpreise angeboten. Unabhängige Messungen ergeben eine Ausgabe von etwa 50 Tokens pro Sekunde. „Flash“ beschreibt also eher die Kosten beim Betrieb als die Streaming-Geschwindigkeit.

Inhaltsverzeichnis

Was ist GLM-5.3 Flash?

Z.ai beschreibt GLM-5.3 Flash als ein Modell für Programmierung, multimodale Agenten und professionelle Aufgaben mit Benutzeroberflächen, Dokumenten, Diagrammen und anderen visuellen Informationen. Anders als GLM-5.3, ein Textmodell, das vor allem durch zusätzliches Post-Training verbessert wurde, basiert Flash auf einem neuen Basismodell, das mit einem multimodalen Korpus aus 30 Billionen Tokens trainiert wurde.

Hier sind die wichtigsten Spezifikationen zum Marktstart:

Spezifikation GLM-5.3 Flash
Entwickler Z.ai / Zhipu AI
Veröffentlichungsdatum 26. August 2026
Architektur Mixture of Experts mit hybrider linearer und sparsamer Attention
Parameter insgesamt 320B
Aktive Parameter 18B pro Token
Transformer-Schichten 45
Kontextfenster 1,048,576 Tokens
Maximale Ausgabe 131,072 Tokens
Eingabe Text, Bilder, Videos und Dateien
Ausgabe Text
Reasoning Immer aktiviert; geringer, hoher und maximaler Aufwand
Offizielle Modell-ID glm-5.3-flash
Lizenz für die Modellgewichte MIT

Die offiziellen Modellgewichte sind unter der MIT-Lizenz verfügbar. Damit ist das Modell mit offenen Gewichten ausgestattet und kann gemäß den Lizenzbedingungen kommerziell genutzt werden. Das bedeutet nicht, dass gehostete Inferenz kostenlos ist: Rechenleistung, Speicher und API-Tokens kosten weiterhin Geld.

Ist GLM-5.3 Flash das Flaggschiffmodell von Z.ai?

Nein. Z.ai bezeichnet GLM-5.3 als sein Flaggschiff-Textmodell. GLM-5.3 Flash nimmt eine andere Rolle ein: kostengünstigere Inferenz und native multimodale Eingabe.

Dieser Unterschied ist wichtig, denn die beiden Modelle haben nicht dieselbe Basis. GLM-5.3 ist ein durch Post-Training verbessertes Modell auf Basis von GLM-5.2. GLM-5.3 Flash wurde als neues multimodales Basismodell trainiert. Flash als günstigere GLM-5.3-Einstellung zu bezeichnen, lässt den wichtigsten architektonischen Unterschied außer Acht.

Wie hängen GLM-5.3 Flash und OxAlpha zusammen?

OxAlpha war der anonyme Vorschau-Name von GLM-5.3 Flash.

Vor der offiziellen Veröffentlichung stellte Z.ai das Modell über OpenCode und eine öffentliche Vorschau-Route unter dem Namen ox-alpha bereit. Das Unternehmen erklärt, man habe den anonymen Start genutzt, um Feedback zu sammeln, ohne den Nutzern die Marke GLM zu präsentieren. Z.ai zufolge wurde OxAlpha während der Vorschauwoche zum meistgenutzten Modell auf diesen Diensten; der Datenverkehr wurde über chinesische KI-Chips verarbeitet.

Dies war nicht der erste anonyme Modelltest von Z.ai. Der Ansatz trennt einen Teil des Nutzerverhaltens von den Erwartungen an eine Marke, doch kostenloser Zugang, die Platzierung in Coding-Tools und Neugier beeinflussen die Nutzung weiterhin.

Das Geheimnis lieferte dennoch nützliche Erkenntnisse. Stripe-CEO Patrick Collison probierte das Modell aus und schrieb: „Es ist sehr beeindruckend“. Ein kleiner Community-Coding-Test meldete acht erfolgreich abgeschlossene Repository-Aufgaben von zehn. Diese Schlagzeile verbreitete sich schnell, doch die Stichprobe war winzig und verglichen wurde ein OxAlpha-Versuch mit vier Versuchen für die Referenzmodelle.

Ein späterer öffentlicher DeepSWE-Community-Test liefert einen besseren Kontext: OxAlpha löste 66 von 113 Aufgaben, also 58,4 %, mit einem dokumentierten Mini-Setup für einen Software-Engineering-Agenten. Einige Aufgaben scheiterten außerdem an der Formatierung von Tool-Aufrufen und nicht an der eigentlichen Code-Lösung. Es handelt sich weiterhin um einen einzelnen Community-Test, nicht um eine allgemeingültige Modellrangliste. Aber 113 Aufgaben sagen mehr aus als zehn.

Auch die Reaktionen auf Reddit folgten demselben Muster. Enthüllungs-Threads in r/LocalLLaMA und r/singularity erhielten Hunderte von Stimmen. Entwickler schätzten die MIT-Lizenz und den Tokenpreis; Nutzer lokaler Modelle wiesen darauf hin, dass ein 320B-Checkpoint nicht in einen Desktop-PC passt. Andere berichteten von inkonsistenter Planung oder langsamen Antworten in der Vorschau. Das sind Einzelfallberichte, aber sie zeigen die richtigen Prüfpunkte: Befolgung von Anweisungen, Zuverlässigkeit von Agenten, Latenz und Gesamtzahl der verwendeten Tokens.

Die praktische Schlussfolgerung ist einfach: OxAlpha und GLM-5.3 Flash gehören zur selben Modellreihe, doch OxAlpha-Ergebnisse stammen aus einer anonymen Vorschauphase. Betrachten Sie diese Berichte als erste Praxiserfahrungen und testen Sie anschließend das veröffentlichte Modell mit Ihrem eigenen Repository und Workflow.

Was hat sich bei GLM-5.3 Flash geändert?

Die Effizienz des Modells beruht nicht nur darauf, dass weniger Experten aktiviert werden.

Erstens kombiniert GLM-5.3 Flash lineare Attention für lokale Abhängigkeiten mit sparsamer Attention, um Informationen aus weit entfernten Teilen des Kontexts abzurufen. Z.ai hat außerdem IndexPool eingeführt, das jeweils vier Schlüsselvektoren des Indexers zu einem zusammenfasst. Dadurch sinken Speicherbedarf und Latenz beim Auffinden relevanter Tokens in einem Prompt mit einer Million Tokens.

Zweitens verwendet das Modell Manifold-Constrained Hyper-Connections, kurz mHC. Einfach gesagt verändert mHC die Art und Weise, wie Informationen über die Schichten hinweg kombiniert werden. So kann Z.ai das Modell skalieren und gleichzeitig Training und Inferenz stabil halten.

Drittens ist Multimodalität Teil des Vortrainings und kein nachträglich hinzugefügter Bildadapter für ein fertig trainiertes Textmodell. Ein Coding-Agent kann eine gerenderte Seite prüfen, ein fehlerhaftes Layout erkennen, den Code bearbeiten und die nächste Darstellung überprüfen. Derselbe Ablauf funktioniert bei der Browser-Nutzung, der Bedienung eines Desktops, Diagrammen und Dokumenten.

Z.ai zufolge benötigt Flash etwa dreimal weniger Rechenleistung für Attention als GLM-5.3 und hat einen durchschnittlichen KV-Cache, der 4,4-mal kleiner ist. Das sind Berechnungen des Anbieters und keine unabhängigen Messungen des Inferenzbetriebs. Sie erklären jedoch, wie ein Modell mit insgesamt 320B Parametern zu einem deutlich niedrigeren Tokenpreis angeboten werden kann.

Ein Satz bringt den Kompromiss auf den Punkt: günstiger im Einsatz, aber nicht unbedingt schneller in der Antwort.

Was kann GLM-5.3 Flash?

GLM-5.3 Flash ist für Aufgaben konzipiert, bei denen sprachliches Schlussfolgern und visuelles Feedback zusammenkommen.

Für Coding-Agenten umfasst das Repository-Analysen, Debugging, Terminal-Aufgaben, Function Calling und lang laufende Änderungen, die mehrere Tool-Schritte erfordern. Die native Bildverarbeitung ermöglicht außerdem die Nachbildung von Frontends anhand von Screenshots, die Prüfung gerenderter Benutzeroberflächen, die Browser-Bedienung, Spieleentwicklung und visuelle Kontrollen von 3D-Szenen. Ein reines Textmodell kann CSS schreiben; ein multimodales Modell kann sich auch das Ergebnis ansehen.

Bei Büroarbeiten kann es PDFs, Tabellen, Präsentationen, Dashboards, Diagramme und Screenshots interpretieren. Es kann ein Diagramm finden, es mit dem umgebenden Text vergleichen, strukturiertes JSON zurückgeben und das Ergebnis an ein anderes Tool übergeben. Das Kontextfenster mit einer Million Tokens bietet Platz für große Repositories oder lange Berichte, doch seine Nutzung erhöht Kosten für Eingaben und Latenz.

Zu den API-Funktionen gehören Function Calling, strukturierte Ausgaben, Streaming, Kontext-Caching, Browser-Nutzung und Computer-Bedienung. Reasoning bleibt aktiviert, mit den Aufwandsstufen low, high und max. Für routinemäßige Datenextraktion ist eine niedrigere Stufe ein guter Ausgangspunkt; die maximale Stufe ist für schwierige Programmier- und Agentenaufgaben gedacht. Mehr Reasoning kann die Qualität einer anspruchsvollen Antwort verbessern, kostet aber zusätzliche Tokens und Zeit.

Unterstützt GLM-5.3 Flash Videoeingaben?

Ja. GLM-5.3 Flash unterstützt native Videoeingaben und gibt Text zurück.

Videoeingaben sind wichtig, wenn Informationen zeitlich verknüpft sind und nicht in einem einzelnen Bildausschnitt enthalten sind. Das Modell kann eine Bildschirmaufnahme analysieren, die Abfolge erkennen, die einen UI-Fehler verursacht hat, eine Demonstration zusammenfassen, Ereignisse in einer Besprechung finden oder aus einem Tutorial eine geordnete Anleitung erstellen. Es kann Videos auch mit Code kombinieren – zum Beispiel eine fehlerhafte Interaktion prüfen und Änderungen am Frontend vorschlagen.

Dabei geht es um das Verstehen von Videos, nicht um deren Erzeugung. GLM-5.3 Flash kann Videoinhalte beschreiben, darüber schlussfolgern und darauf basierend handeln, aber keine neue Videodatei ausgeben.

Preise für GLM-5.3 Flash

Z.ai führte GLM-5.3 Flash mit einer zeitlich begrenzten Aktion von 50 % Rabatt ein. Die Aktion endet am 9. September 2026 um 24:00 Uhr (UTC+8). Der Einführungspreis von GPT Proto basiert auf dem regulären Listenpreis von Z.ai und nicht auf der befristeten Aktion.

Pro 1 Mio. Tokens Z.ai regulär Z.ai-Einführungsaktion GPT Proto-Einführungspreis
Neue Eingaben $0.15 $0.075 $0.015
Gecachte Eingaben $0.03 $0.015 $0.003
Ausgabe $0.50 $0.25 $0.05

Kalkulieren Sie mit dem regulären Preis, nicht mit dem Einführungspreis. Aktionen laufen aus; Produktions-Workloads in der Regel nicht.

Der reguläre Preis liegt deutlich unter dem von GLM-5.3: 1,40 $ für Eingaben und 4,40 $ für Ausgaben. Der Tokenpreis ist jedoch nur ein Teil der Kosten. Artificial Analysis stellte in seiner Intelligence-Index-Auswertung fest, dass das Modell ungewöhnlich ausführlich ist. Wenn ein Modell mehr Reasoning- und Antwort-Tokens ausgibt, kann das einen Teil des scheinbaren Preisvorteils pro Token zunichtemachen. Kontext-Caching hilft, wenn ein Coding-Agent wiederholt denselben Repository-Kontext übermittelt; neue Prompts und generierte Ausgaben werden jedoch weiterhin berechnet.

Bei 0,015 $ pro Million neuer Eingabe-Tokens und 0,05 $ pro Million Ausgabe-Tokens beträgt der Einführungspreis von GPT Proto 10 % des regulären Preises von Z.ai – eine Reduzierung um 90 %. Die aktuelle Verfügbarkeit und Abrechnungsdetails finden Sie auf der API-Modellseite für GLM-5.3 Flash.

Wie gut ist GLM-5.3 Flash?

Darauf gibt es zwei Antworten: die Benchmarks von Z.ai zum Marktstart und die ersten unabhängigen Messungen. Sie sollten nicht zu einer einzigen Aussage vermischt werden.

Veröffentlichte Benchmark-Ergebnisse von Z.ai

Z.ai berichtet die folgenden Ergebnisse. Der Vergleich ist hilfreich, um die vorgesehenen Stärken des Modells zu erkennen, bleibt aber eine vom Anbieter durchgeführte Bewertung.

Benchmark GLM-5.3 Flash GLM-5.2 DeepSeek V4 Vision Exp Claude Opus 4.8
Terminal-Bench 2.1 84.3 81.0 83.9 85.0
DeepSWE v1.1 63.4 46.2 59.3 58.0
Toolathlon Verified 78.4 59.9 75.9 76.2
AutomationBench 48.8 26.2 38.8 41.0
Chartography mit Tools 78.0 — 64.3 75.0

Diese Ergebnisse stützen eine engere Schlussfolgerung als „Flash schlägt Opus“. Das Modell von Z.ai scheint bei Programmierung, Tool-Nutzung und visuellen Agentenaufgaben konkurrenzfähig zu sein, doch Opus 4.8 liegt in einigen Kategorien, darunter Terminal-Bench und NL2Repo, weiterhin vorn. Noch wichtiger: In dieser Tabelle wird Opus 4.8 verglichen – nicht Claude Opus 5.

Was unabhängige Tests zeigen

Stand 27. August bewertet Artificial Analysis GLM-5.3 Flash mit einem Intelligence-Index-Wert von 57. Die gemessene Ausgabegeschwindigkeit lag bei ungefähr 50 Tokens pro Sekunde; die geschätzten Kosten pro Intelligence-Index-Aufgabe betrugen zum Listenpreis etwa 0,09 $. In der Bewertung wurde das Modell außerdem als langsamer als der Durchschnitt und im Vergleichsfeld als sehr ausführlich eingestuft.

Für den Preis ist das ein gutes Ergebnis. Es belegt jedoch nicht, dass Flash das schnellste oder insgesamt leistungsstärkste Modell ist.

GLM-5.3 Flash im Vergleich zu GLM-5.3, DeepSeek V4 Pro und Claude Opus 5

Die folgende Tabelle verwendet, sofern verfügbar, denselben unabhängigen Evaluator und Varianten mit maximalem Reasoning-Aufwand. Da sich diese Momentaufnahmen der Dienste ändern können, sollten Sie die Geschwindigkeitswerte als Messungen und nicht als dauerhafte Spezifikationen betrachten.

Modell Intelligence Index Ausgabegeschwindigkeit Kosten pro Aufgabe Listenpreis Eingabe / Ausgabe
GLM-5.3 Flash 57 ~50 tok/s $0.09 $0.15 / $0.50
GLM-5.3 60 ~87 tok/s $0.68 $1.40 / $4.40
DeepSeek V4 Pro 0813 53 ~67 tok/s $0.27 $1.32 / $3.96
Claude Opus 5 63 ~55 tok/s $2.34 $5.00 / $25.00

Wählen Sie GLM-5.3 Flash, wenn Sie Bild- oder Videoeingaben, offene Modellgewichte oder möglichst niedrige Tokenkosten benötigen. Wählen Sie GLM-5.3, wenn Ihre Arbeit ausschließlich textbasiert ist und die zusätzlichen drei Intelligence-Index-Punkte, höheren Coding-Werte und schnellere Ausgabe den Preis rechtfertigen.

Das ist kein gewöhnlicher Upgrade-Pfad, bei dem das Modell mit der neueren Versionsnummer das ältere ersetzt. Die beiden Modellzweige sind auf unterschiedliche Anforderungen ausgelegt. GLM-5.3 auf GPT Proto ansehen, wenn Ihr aktueller Workload textbasiertes Coding oder Agentenaufgaben mit langem Zeithorizont umfasst.

GLM-5.3 Flash im Vergleich zu DeepSeek V4 Pro

In der unabhängigen Momentaufnahme erzielte GLM-5.3 Flash vier Punkte mehr und kostet zum Listenpreis weniger. Außerdem akzeptiert es visuelle Eingaben, während die getestete DeepSeek-V4-Pro-Route ausschließlich Text verarbeitet. DeepSeek V4 Pro erzeugte Ausgaben schneller und kann für etablierte Text- und Coding-Pipelines weiterhin besser geeignet sein, wenn Multimodalität keinen Mehrwert bietet.

Entscheiden Sie sich nicht allein aufgrund eines zusammengesetzten Werts. Führen Sie dieselbe Repository-Aufgabe mit festgelegten Abnahmetests durch und protokollieren Sie Wiederholungsversuche und Tokens. Sie können DeepSeek V4 Pro auf GPT Proto ansehen, bevor Sie beide Workflows testen.

GLM-5.3 Flash im Vergleich zu DeepSeek V4 Flash Vision Exp

Diese Modelle sind hinsichtlich ihres Produktprofils engere Konkurrenten: Beide zielen auf kostengünstige Coding- und visuelle Aufgaben ab. In der eigenen Bewertung von Z.ai erzielte GLM-5.3 Flash bei DeepSWE 63,4 gegenüber 59,3 und bei Chartography mit Tools 78,0 gegenüber 64,3. Betrachten Sie diese Zahlen als Angaben von Z.ai, bis die Modelle in einem kontrollierten, unabhängigen Vergleich visueller Agenten getestet wurden.

GLM-5.3 Flash bietet MIT-lizenzierte Gewichte, native Video- und Dateieingaben sowie ein Kontextfenster mit einer Million Tokens. DeepSeek V4 Flash Vision Exp ist weiterhin ein experimenteller Vision-Zweig und könnte für Teams sinnvoller sein, die bereits die zugehörige Modellfamilie nutzen. DeepSeek V4 Flash Vision Exp auf GPT Proto ansehen.

GLM-5.3 Flash im Vergleich zu Claude Opus 5

In der unabhängigen Gesamtbewertung liegt Claude Opus 5 mit 63 Punkten weiterhin vor GLM-5.3 Flash mit 57 Punkten. Auch der Listenpreis des Anbieters ist mit 5 $ pro Million Eingabe-Tokens und 25 $ pro Million Ausgabe-Tokens deutlich höher. GLM-5.3 Flash ist die kostengünstige Wahl; Opus 5 ist die erste Wahl, wenn Qualität Vorrang hat und eine fehlgeschlagene Aufgabe mehr kostet als die Tokenrechnung.

Die entscheidende methodische Korrektur lautet: In der Veröffentlichungstabelle von Z.ai wird Flash mit Opus 4.8 verglichen. Sie kann daher nicht belegen, dass GLM-5.3 Flash Opus 5 übertrifft. Informationen zur aktuellen Opus-Option finden Sie unter Claude Opus 5 auf GPT Proto ansehen.

Kann GLM-5.3 Flash lokal ausgeführt werden?

Ja, aber „18B aktiv“ bedeutet nicht, dass das Modell wie ein dichtes 18B-Modell in den Speicher passt.

Stellen Sie sich die 320B Parameter als Lagerhalle und die 18B aktiven Parameter als die Regale vor, auf die bei einer einzelnen Bestellung zugegriffen wird. Der Router reduziert den Rechenaufwand pro Token, aber die Lagerhalle muss trotzdem irgendwo untergebracht werden.

Der FP8-Checkpoint belegt ungefähr 328 GB dezimal beziehungsweise rund 306 GiB. Der modellspezifische KTransformers-Bereitstellungsleitfaden empfiehlt mindestens 350 GB verfügbaren Systemspeicher, ohne den Bedarf anderer gleichzeitig laufender Programme einzurechnen. Z.ai nennt außerdem SGLang, vLLM und TokenSpeed als unterstützte Inferenzoptionen.

Die ehrliche Beschreibung lautet also nicht „ein kleines lokales Modell“. Es ist ein großes, rechnungseffizientes Modell, das Teams mit viel Speicherkapazität selbst hosten können. Für die meisten einzelnen Entwickler und kleinen Teams ist der Zugriff über eine gehostete API einfacher, als den vollständigen Checkpoint zu speichern und bereitzustellen.

Günstig im Einsatz. Teuer im Betrieb.

So erhalten Sie Zugriff auf GLM-5.3 Flash

Zum Marktstart können Entwickler das gehostete Modell von Z.ai mit der ID glm-5.3-flash verwenden, über geeignete Coding-Tarife darauf zugreifen oder die MIT-lizenzierten Gewichte zur lokalen Bereitstellung herunterladen.

Die GLM-5.3-Flash-API auf GPT Proto wird jetzt eingeführt und unterstützt die nativen Text-, Bild-, Video- und Dateieingaben des Modells. Sie nutzt das gemeinsame Guthaben von GPT Proto und kostet 10 % des regulären Listenpreises von Z.ai.

Als Alternativen können Sie GLM-5.3 für textorientiertes Coding, DeepSeek V4 Pro für Text- und Agenten-Workflows oder Claude Opus 5 wählen, wenn Leistung wichtiger ist als der Tokenpreis.

Lohnt sich GLM-5.3 Flash?

Ja – wenn Ihr Workload tatsächlich von der Kombination aus multimodalen Eingaben, großem Kontext und niedrigen Tokenpreisen profitiert.

GLM-5.3 Flash ist eine starke Option für visuelle Coding-Agenten, umfangreiche Dokumente, Videoverständnis und Agentenaufgaben im Batchbetrieb, bei denen GLM-5.3 oder Opus 5 zu teuer wären. Die MIT-lizenzierten Gewichte ermöglichen außerdem Self-Hosting.

Weniger geeignet ist es, wenn Sie die schnellstmögliche sichtbare Antwort benötigen, ein kleines lokales Modell erwarten oder unabhängig vom Preis den höchsten verfügbaren Reasoning-Wert anstreben. In der aktuellen unabhängigen Messung ist GLM-5.3 schneller. Opus 5 erzielt einen höheren Wert. Beide kosten mehr.

Meine Einschätzung: Z.ai hat den richtigen Kompromiss gefunden. GLM-5.3 Flash ersetzt das Flaggschiff nicht. Es macht eine andere Art von Workload wirtschaftlich: multimodale Agenten, die Inhalte betrachten, Schlussfolgerungen ziehen, Tools aufrufen und weitermachen müssen, ohne dass für jedes Token der Preis eines Flaggschiffmodells anfällt.

Häufig gestellte Fragen

Wann wurde GLM-5.3 Flash veröffentlicht?

Z.ai hat GLM-5.3 Flash am 26. August 2026 veröffentlicht. Einige Tage zuvor war das Modell unter dem anonymen Vorschau-Namen OxAlpha erschienen.

Ist GLM-5.3 Flash dasselbe Modell wie OxAlpha?

Ja. Z.ai bestätigte, dass ox-alpha die anonyme Vorschau-Identität von GLM-5.3 Flash war.

Ist GLM-5.3 Flash das Flaggschiff-Modell von Z.ai?

Nein. GLM-5.3 ist das Flaggschiff-Textmodell. GLM-5.3 Flash ist ein separates, kostengünstigeres natives multimodales Modell mit einer neuen Basis.

Wie viel kostet GLM-5.3 Flash?

Der Standardtarif von Z.ai beträgt 0,15 $ pro Million Input-Tokens, 0,03 $ pro Million gecachte Input-Tokens und 0,50 $ pro Million Output-Tokens. Bis zum 9. September 2026 um 24:00 Uhr UTC+8 gilt eine Einführungsaktion mit 50 % Rabatt. Der Einführungspreis von GPTProto beträgt 10 % des Standardtarifs: 0,015 $ für neue Inputs, 0,003 $ für gecachte Inputs und 0,05 $ für Outputs.

Unterstützt GLM-5.3 Flash Videoeingaben?

Ja. Das Modell akzeptiert Videos und gibt Text aus. Dadurch eignet es sich für die Analyse von Bildschirmaufnahmen, die Extraktion von Ereignissen, Videozusammenfassungen und visuell fundierte Programmieraufgaben.

Ist GLM-5.3 Flash Open Source?

Die Modellgewichte sind öffentlich unter der MIT-Lizenz verfügbar. „Open-Weight“ ist die präzisere Bezeichnung, da die Verwendung des Begriffs Open Source für Trainingsdaten und Entwicklungsprozesse von Modellen weiterhin umstritten ist.

Kann GLM-5.3 Flash auf einer Consumer-GPU ausgeführt werden?

Nicht als gewöhnliches Modell für eine einzelne GPU. Die FP8-Gewichte belegen etwa 306 GiB, und der dokumentierte KTransformers-Ansatz empfiehlt mindestens 350 GB verfügbaren Systemspeicher. Community-Builds mit Quantisierung oder CPU-Offloading können die Anforderungen senken, aber Geschwindigkeit und Qualität hängen vom jeweiligen Build ab.

Was ist der Hauptunterschied zwischen GLM-5.3 Flash und GLM-5.3?

GLM-5.3 Flash ist günstiger, bietet Open-Weights und akzeptiert Text, Bilder, Videos und Dateien. GLM-5.3 ist ein Text-Flaggschiff mit höheren Werten bei unabhängigen Messungen der Intelligenz und Ausgabegeschwindigkeit. Die Modelle eignen sich für unterschiedliche Anwendungsfälle und bilden keine einfache Upgrade-Reihe aus altem und neuem Modell.

Verwandte Artikel

Weitere Blogbeiträge
7 beste KI-Gateways für Entwickler im Jahr 2026: Funktionen, Preise und Kompromisse im Produktivbetrieb

7 beste KI-Gateways für Entwickler im Jahr 2026: Funktionen, Preise und Kompromisse im Produktivbetrieb

Preise und Funktionen anhand der veröffentlichten Produktdokumentation am 26. August 2026 geprüft. Der kostspielige Fehler bei einem KI-Gateway besteht nicht darin, sich für das zweitbeste Produkt zu entscheiden. Er besteht darin, ein Gateway zu wählen, das für eine andere Aufgabe entwickelt wurde. Einige KI-Gateways bieten dir einen API-Schlüssel, ein Guthaben und sofortigen Zugriff auf gehostete Modelle. Andere setzen voraus, dass du deine eigenen Provider-Schlüssel mitbringst und das Gateway für Routing, Protokollierung, Caching und die Durchsetzung von Budgets nutzt. Eine dritte Gruppe wurde für Enterprise-Plattformteams entwickelt, die APIs, MCP-Server und den Datenverkehr zwischen Agenten verwalten. Diese Produkte sollten nicht so bewertet werden, als würden sie dasselbe leisten. Ein Schlüssel für dein Team Die kurze Antwort: GPTProto eignet sich am besten für den kostengünstigen Zugriff auf Text-, Bild-, Video- und Audiomodelle, ohne Gateway-Infrastruktur betreiben zu müssen. OpenRouter bietet den umfangreichsten veröffentlichten Modell- und Providerkatalog in diesem Vergleich. LiteLLM ist die erste Wahl als Open-Source-Lösung für Teams, die bereit sind, selbst zu hosten. Cloudflare AI Gateway bietet besonders leicht zugängliche Funktionen für Caching und Analysen sowie Ausgabenkontrollen auf Dollarbasis. Vercel AI Gateway eignet sich für Anwendungen mit AI SDK und Next.js. Portkey, das jetzt unter Prisma AIRS weitergeführt wird , konzentriert sich auf Observability, Leitplanken und unternehmensweite Governance. Kong AI Gateway ist besonders sinnvoll, wenn ein Unternehmen Kong bereits für das API-Management nutzt. Dieses Ranking basiert auf dokumentierten Funktionen, Bereitstellungsoptionen und veröffentlichten Preisen für KI-Gateways. Es handelt sich nicht um einen unabhängigen Benchmark für Latenz oder Verfügbarkeit. Stammt eine Leistungsangabe ausschließlich von einem Anbieter, behandle ich sie als Angabe des Anbieters – nicht als gemessenes Ergebnis.

Schuyler Stacy | 2026-08-26

Qwen 3.8 Max vs. GLM 5.3: Was ist besser für Programmierung, Agenten und Preis?

Qwen 3.8 Max vs. GLM 5.3: Was ist besser für Programmierung, Agenten und Preis?

Qwen 3.8 Max und GLM 5.3 sind zwei eng beieinanderliegende chinesische Spitzenmodelle, aber sie sind nicht austauschbar. GLM 5.3 ist die bessere Standardwahl für textbasierte Coding-Agenten und kostenempfindliche API-Workloads. Qwen 3.8 Max ist die bessere Wahl für Frontend-Generierung, visuelle Eingaben und Anwendungen, die optionales statt obligatorisches Reasoning benötigen. Bei realen Workloads wird der Unterschied deutlicher als bei einem einzelnen Ranglistenwert. GLM liegt bei allgemeiner unabhängiger Intelligenz und der Präferenz für textbasiertes Coding leicht vorn, während Qwen 3.8 Max bei Arena's Ergebnissen für Frontend- und Webentwicklung mit deutlich größerem Abstand führt. Außerdem ist GLM bei einem repräsentativen uncached Workload auf GPTProto etwa 29 % günstiger. Dieser Vergleich basiert auf Modelldokumentation, unabhängigen Ranglisten, von Anbietern gemeldeten Evaluierungen und Entwicklerdiskussionen, die am 24. August 2026 verfügbar waren. Ein Detail zur Bereitstellung ist von Anfang an wichtig: Die GLM-5.3-Route von GPTProto unterstützt nur Text-zu-Text , während Qwen 3.8 Max Text, Bilder und Videos als Eingaben akzeptiert und Text ausgibt.

Tiffany Layne | 2026-08-25

Was ist DeepSeek V4 Flash Vision Exp? Preise, Funktionen, Benchmarks und Einschränkungen

Was ist DeepSeek V4 Flash Vision Exp? Preise, Funktionen, Benchmarks und Einschränkungen

Mehrere Seiten, die unmittelbar nach dem Start von DeepSeek V4 Flash Vision Exp veröffentlicht wurden, nennen bereits den falschen Preis. So schnell geht diese Veröffentlichung vonstatten. DeepSeek V4 Flash Vision Exp ist eine experimentelle Version von V4 Flash, die neben Text auch Bilder akzeptieren kann. Sie kann Screenshots untersuchen, Text in Bildern lesen, Diagramme analysieren und das Ergebnis an Tools weitergeben. DeepSeek hat sie am 21. August 2026 unter der Modell-ID deepseek-v4-flash-vision-exp veröffentlicht. V4 Flash Vision Exp-Schlüssel abrufen Entscheidend ist, was es nicht ist. Es handelt sich weder um einen neuen Bildgenerator noch um ein pauschales Upgrade für jeden V4-Flash-Workload. DeepSeek positioniert es als experimentellen, um Bildverarbeitung erweiterten Zweig mit weitgehend denselben Textfähigkeiten wie V4 Flash. Wenn Ihre Anwendung keine Bilder sendet, ist das standardmäßige Textmodell weiterhin die einfachere Wahl. DeepSeek V4 Flash Vision Exp ist jetzt über GPTProto verfügbar. Entwickler können Text- und Bildeingaben über die GPTProto-Route des Modells senden und dafür dasselbe Konto, denselben API-Schlüssel und dasselbe gemeinsame Guthaben wie für andere unterstützte Modelle verwenden. Auf der aktuellen Modellseite sind Standardpreise von 0,44 $ pro Million Eingabe-Tokens und 1,32 $ pro Million Ausgabe-Tokens angegeben; außerdem gelten zeitabhängige Nebenzeitpreise. Das Modell ist weiterhin experimentell. Bevor Sie Produktions-Traffic darauf umleiten, testen Sie das genaue Bildformat, die Anfragebeschränkungen, die Latenz und das Fallback-Verhalten, die im aktuellen Quick Start von GPTProto beschrieben sind.

Schuyler Stacy | 2026-08-24

Beste KI-API für Entwickler im Jahr 2026: 10 Plattformen im Vergleich

Beste KI-API für Entwickler im Jahr 2026: 10 Plattformen im Vergleich

Kurzfassung Beste direkte APIs: OpenAI ist die sicherste Standardwahl für allgemeine Anwendungen; Anthropic Claude ist am stärksten bei Programmierung und lang laufenden Agenten; Gemini eignet sich für kostengünstiges multimodales Prototyping, und DeepSeek bietet die niedrigsten Preise pro Text-Token. Beste Multi-Modell-Optionen: OpenRouter ist die naheliegendste Wahl, um viele LLMs zu testen. GPTProto eignet sich besser, wenn ein Produkt Text-, Bild- und Videomodelle unter einem API-Schlüssel und mit einem gemeinsamen Guthaben benötigt. Beste Infrastruktur: Amazon Bedrock passt zu von AWS verwalteten Unternehmensumgebungen, während Replicate, fal.ai und Together AI besser für Open-Modelle oder die Inferenz generativer Medien geeignet sind. Es gibt keinen universellen Sieger. Vergleichen Sie die Eignung für Ihre Workloads, die Modellabdeckung, reale Abrechnungseinheiten, Produktionsfunktionen und Wechselkosten. Preise und Verfügbarkeit wurden am 14. Juli 2026 geprüft. Überprüfen Sie die aktuellen Anbieterseiten vor dem Deployment.

Tiffany Layne | 2026-07-15