Qwen3.8-Max-0902 ist die am 2. September 2026 veröffentlichte Überarbeitung von Qwen3.8-Max durch Alibaba Qwen's. Es handelt sich weder um eine neu angekündigte Architektur noch um einen größeren Nachfolger. Qwen beschreibt das Modell als die bestehende Mixture-of-Experts-Architektur mit 2,4 Billionen Parametern, die zusätzlich für Coding und Cowork nachtrainiert wurde. Ziel ist es, komplexe Aufgaben in Unternehmen, wissenschaftliche Forschung und Workflows mit langem Zeithorizont zu verbessern.
Das gehostete Modell behält den dokumentierten Funktionsumfang der Qwen3.8-Max-Familie bei: Texteingabe sowie Bild- und Videoeingabe; Textausgabe; Funktionsaufrufe; strukturierte Ausgaben; Kontext-Caching; sowie Betrieb mit oder ohne Thinking-Modus. Alibaba gibt ein nominelles Kontextfenster von 1.000.000 Tokens an, mit bis zu 991.808 Eingabe-Tokens im Standardmodus, 983.616 Eingabe-Tokens im Thinking-Modus und 131.072 Ausgabe-Tokens.
Der Seitenname und die Request-ID müssen sorgfältig unterschieden werden. Qwen kündigte die Überarbeitung als Qwen3.8-Max-0902 an, während in der öffentlichen Model-Studio-Dokumentation von Alibaba weiterhin die allgemeine API-Modell-ID qwen3.8-max aufgeführt ist. Ein API-Anbieter kann das Update über den Standard-Alias oder einen datierten Snapshot bereitstellen. Verwenden Sie für GPTProto-Aufrufe genau den Modell-String, der in Quick Start angezeigt wird, statt ihn aus dem Seitentitel abzuleiten.
| Spezifikation |
Bestätigte Angaben |
| Anbieter |
Alibaba Qwen |
| Überarbeitungsdatum |
2. September 2026 |
| Art des Updates |
Zusätzliches Nachtraining für Coding und Cowork |
| Veröffentlichte Größe der Modellfamilie |
Insgesamt 2,4 Billionen Parameter, Mixture-of-Experts-Architektur |
| Eingabemodalitäten |
Text, Bild und Video |
| Ausgabemodalität |
Text |
| Kontextfenster |
1.000.000 Tokens |
| Maximale Eingabe im Standardmodus |
991.808 Tokens |
| Maximale Eingabe im Thinking-Modus |
983.616 Tokens |
| Maximale Ausgabe |
131.072 Tokens |
| Funktionsaufrufe |
Unterstützt |
| Strukturierte Ausgaben |
Unterstützt |
| Kontext-Caching |
Unterstützt |
| Feinabstimmung |
Derzeit nicht unterstützt |
| Open-Weights-Status |
Es wurde kein separat gekennzeichneter 0902-Checkpoint identifiziert |
Was hat sich von Qwen3.8-Max zu Qwen3.8-Max-0902 geändert?
Die Version 0902 ist ein Verhaltens-Upgrade und keine Neufassung der Spezifikationen. Parameteranzahl, Kontextfenster von 1 Mio. Tokens, Ausgabelimit und unterstützte Eingabemodalitäten bleiben innerhalb des veröffentlichten Funktionsumfangs der Qwen3.8-Max-Familie. Die wichtigste Änderung ist ein zusätzliches Nachtraining mit dem Ziel, Coding, Cowork, Tool-Nutzung und die Erledigung längerer Aufgaben zu verbessern.
| Entscheidungsfaktor |
Ursprüngliches Qwen3.8-Max |
Qwen3.8-Max-0902 |
| Modellgrundlage |
2,4 Billionen Parameter, MoE-Flaggschiff |
Gleiche veröffentlichte Grundlage der Modellfamilie |
| Kontext und Ausgabe |
1 Mio. Kontext; bis zu 131.072 Ausgabe-Tokens |
Veröffentlichte Limits unverändert |
| Trainingsschwerpunkt |
Coding, professionelle Arbeit, Forschung und agentische Systeme |
Zusätzliches Nachtraining für Coding und Cowork |
| Code Arena: WebDev |
1.669 im von Qwen veröffentlichten Vergleich |
1.691 zum Start, ein Anstieg um 22 Punkte |
| Öffentliche API-Bezeichnung |
Alibaba dokumentiert qwen3.8-max |
Verwenden Sie den vom Anbieter angezeigten Alias oder die Snapshot-ID |
| Offene Gewichte |
Separate Checkpoints der Qwen3.8-Familie sind verfügbar |
Kein separater, mit 0902 gekennzeichneter Checkpoint bestätigt |
Das Ergebnis in Code Arena ist ein hilfreicher Indikator für Frontend- und agentisches Coding, beweist aber nicht, dass sich jeder Workflow mit Repositorys oder Tools verbessert. Testen Sie die alte und die neue Route mit denselben Prompts, demselben Repository-Zustand, denselben Tool-Berechtigungen, Reasoning-Einstellungen und Akzeptanzkriterien, bevor Sie den Produktionsverkehr umleiten.
Anwendungsfälle für Qwen3.8-Max-0902
Coding auf Repository-Ebene
Analysieren Sie Modulgrenzen, gleichen Sie Anforderungen mit vorhandenem Code ab, planen Sie Änderungen über mehrere Dateien hinweg, rufen Sie Entwicklungstools auf und prüfen Sie Testergebnisse. Im Kontextfenster von 1 Mio. Tokens finden Quellcode, Konfiguration, Dokumentation und Agentenverlauf Platz; ausführbare Tests und Checkpoints sind dennoch erforderlich.
Agenten für lang andauernde Aufgaben
Setzen Sie Qwen3.8-Max-0902 für Migrationsagenten, technische Untersuchungen, Datenanalyse-Pipelines und interne Assistenten ein, die mehrere Tools abfragen, bevor sie strukturierte Ergebnisse zurückgeben. Validieren Sie Tool-Argumente und beschränken Sie Berechtigungen auf Anwendungsebene.
Wissenschaftliche Forschung und Wissensarbeit
Führen Sie wissenschaftliche Arbeiten, Berichte, Tabellen, Diagramme und frühere Erkenntnisse in einer Aufgabe zusammen. Verlangen Sie Quellenkennungen und eine klare Trennung zwischen extrahierten Fakten und Schlussfolgerungen. Nutzen Sie Retrieval, wenn der Quellenbestand das Kontextlimit überschreitet oder sich häufig ändert.
Multimodale Prüfung in Unternehmen
Analysieren Sie Screenshots, Diagramme, visuelle Dokumente und aufgezeichnete Workflows mithilfe von Text-, Bild- und Videoeingaben. Der Endpunkt gibt Text zurück; für die Medienerstellung ist daher weiterhin ein spezielles Bild- oder Videomodell erforderlich.
Qwen3.8-Max-0902 im Vergleich zu GPT-5.6, Gemini 3.7 Flash, Kimi K3 und GLM-5.3 Flash
Vergleichen Sie die Kosten pro akzeptiertem Ergebnis und berücksichtigen Sie dabei Reasoning-Tokens, Wiederholungsversuche, fehlgeschlagene Tool-Aufrufe und menschliche Korrekturen – nicht nur den Token-Preis.
| Modell |
Wann Sie hiermit starten sollten |
Vor der Weiterleitung von mehr Datenverkehr überprüfen |
| Qwen3.8-Max-0902 |
Die Aufgabe umfasst anspruchsvolles Coding, langen Kontext, multimodale Belege und zahlreiche Tool-Schritte |
Regressionsverhalten, Latenz und Gesamtzahl der Tokens in Ihrem eigenen Workflow |
| GPT-5.6 |
Ihre Anwendung basiert bereits auf GPT-orientiertem Coding und agentischem Verhalten |
Die genaue Modellstufe, Tool-Kompatibilität, Latenz und Kosten |
| Gemini 3.7 Flash |
Bei multimodalen Aufgaben mit hohem Volumen haben Geschwindigkeit und Token-Kosten oberste Priorität |
Genauigkeit bei komplexen Repositorys und erforderliche Ausgabelänge |
| Kimi K3 |
Für lange Coding- oder Forschungsaufgaben wird eine weitere Frontier-Route für A/B-Tests benötigt |
Erledigung im ersten Durchlauf, Genauigkeit der Tool-Aufrufe und Token-Verbrauch |
| GLM-5.3 Flash |
Bei budgetbewusstem Coding und agentischem Datenverkehr wird eine kostengünstigere erste Route benötigt |
Die anspruchsvollsten mehrstufigen Aufgaben und Aufgaben auf Repository-Ebene |
Beginnen Sie bei kostenbewusster Weiterleitung mit einem Modell der Flash-Klasse wie GLM-5.3 Flash, und leiten Sie anschließend schwierige Aufgaben oder wiederholt fehlschlagende Aufgaben an Qwen3.8-Max-0902 weiter.
Prüfungen vor dem Upgrade
Bevor Sie Datenverkehr vom ursprünglichen Qwen3.8 Max umleiten, dokumentieren Sie den Modell-String, den Prompt, die Reasoning-Einstellungen, die Tool-Schemas, die Latenz, den Token-Verbrauch und das Ergebnis. Führen Sie dieselbe Auswertung mit 0902 durch.
Kopieren Sie die genaue Modell-ID aus GPTProto Quick Start; gehen Sie nicht davon aus, dass der Seitentitel dem Request-String entspricht.
Testen Sie Funktionsschemas, strukturiertes JSON, Streaming und Fehlerbehandlung erneut.
Prüfen Sie die Formatierung von Bild- und Videoeingaben, wenn der Workflow multimodal ist.
Messen Sie die Erledigung im ersten Durchlauf, Wiederholungsversuche, Ausgabe-Tokens, End-to-End-Latenz und menschliche Korrekturen.
Behalten Sie die vorherige Route bei, bis die neue Version die Regressionstests bestanden hat.
Ein niedrigerer Token-Preis bedeutet nicht automatisch geringere Kosten, wenn dadurch mehr Wiederholungen oder manuelle Korrekturen nötig werden. Messen Sie die Kosten pro akzeptiertem Ergebnis.
Wann sollten Sie Qwen3.8-Max-0902 wählen?
Wählen Sie Qwen3.8-Max-0902 für große Repositorys, multimodale Belege, lange Ausgaben, strukturierte Tool-Nutzung oder lang andauernde Aufgaben mit vielen Schritten. Das Modell eignet sich für Coding-Agenten, Forschungsassistenten und Unternehmenssysteme, die überprüfbare Ergebnisse liefern sollen.
Verwenden Sie für kurze, latenzempfindliche Aufgaben ein kleineres Modell oder ein Modell der Flash-Klasse. Mit dem gemeinsamen Schlüssel und Guthaben von GPTProto können Entwickler den Modellkatalog vergleichen, ohne separate Anbieter-Konten einzurichten. Prüfen Sie die aktuellen Preise und Auswertungsergebnisse, bevor Sie ein Standardmodell festlegen.