Aktualisiert am 7. August 2026: Alibaba hat die Produktionsversion von Qwen3.8-Max am 3. August offiziell veröffentlicht und damit das frühere qwen3.8-max-preview als aktuelles Flaggschiff-API-Modell ersetzt. Dieser Artikel wurde mit der bestätigten Architektur, dem Kontextfenster, den Preisen, der API-Verfügbarkeit und dem Zeitplan für offene Gewichte aktualisiert.
Qwen3.8-Max ist das bisher leistungsfähigste Qwen-Modell von Alibaba: ein multimodales Sparse-Mixture-of-Experts-Modell mit insgesamt 2,4 Billionen Parametern und 95 Milliarden aktiven Parametern pro Anfrage.
Das stabile Modell unterstützt Text-, Bild- und Videoeingaben, erzeugt Textausgaben und bietet ein Kontextfenster von bis zu 1 Million Token sowie bis zu 128K Ausgabetoken. Es wurde für komplexe Programmierung, visuelle Analysen, Forschung, professionelle Aufgaben und lang andauernde Agentenaufgaben entwickelt.
Die Veröffentlichung verändert auch die praktische Antwort für Entwickler. Qwen3.8-Max ist nicht länger auf eine sich ständig ändernde Vorschauversion oder einen persönlichen Tarif beschränkt, der nur mit Credits funktioniert. Jetzt gibt es eine reguläre Pay-as-you-go-API, die Alibaba mit 2 $ pro Million Eingabetoken und 6 $ pro Million Ausgabetoken angibt. Außerdem ist es über die Qwen 3.8 Max API auf GPTProto verfügbar.
Meine kurze Einschätzung: Qwen 3.8 Max ist eine echte und ungewöhnlich interessante Vorschau, kein abgeschlossenes Produktrelease. Entwickler sollten es testen, das Datum jedes Ergebnisses festhalten und Produktionsmigrationen vermeiden, die auf Spezifikationen basieren, die Alibaba noch nicht veröffentlicht hat.
Qwen 3.8 Max auf einen Blick
| Spezifikation |
Bestätigte Details zu Qwen3.8-Max |
| Entwickler |
Alibaba Qwen |
| Stabiler Modellname |
qwen3.8-max |
| Vorschauveröffentlichung |
19. Juli 2026 |
| Produktionsrelease |
3. August 2026 |
| Architektur |
Sparse Mixture-of-Experts mit hybrider Aufmerksamkeit |
| Parameter insgesamt |
2,4 Billionen |
| Aktive Parameter |
95 Milliarden |
| Kontextfenster |
Bis zu 1 Million Token |
| Maximale Ausgabe |
Bis zu 128K Token |
| Eingaben |
Text, Bilder und Video |
| Ausgabe |
Text |
| Denkmodus |
Hybrides Denken mit anpassbarem Schlussfolgerungsaufwand |
| Funktionsaufrufe |
Unterstützt |
| Strukturierte Ausgabe |
Unterstützt |
| Websuche |
Unterstützt |
| Kontext-Caching |
Unterstützt |
| Batch-Inferenz |
Derzeit nicht unterstützt |
| Feinabstimmung |
Derzeit nicht unterstützt |
| Offizieller API-Preis |
2 $/M Eingabe- und 6 $/M Ausgabetoken |
| Verfügbarkeit auf GPT Proto |
Jetzt verfügbar |
| Offene Gewichte |
Angekündigt, aber zum 7. August 2026 noch nicht herunterladbar |
Diese Liste ist kürzer als die Spezifikationstabellen in einigen frühen Artikeln zu Qwen 3.8 Max. Das hat einen Grund. Ein Vorschau-Modell erhält kein 1M-Kontextfenster, keine bestimmte Mixture-of-Experts-Struktur und keine Veröffentlichungslizenz, nur weil diese Details neben anderen Flaggschiffmodellen von 2026 plausibel wirken würden.
Ist Qwen 3.8 Max veröffentlicht?
Ja. Qwen3.8-Max wurde am 3. August 2026 als Produktionsversion veröffentlicht.
Alibaba stellte qwen3.8-max-preview erstmals am 19. Juli zur Verfügung. Diese Vorschau konnte sich zwischen den Aufrufen ändern und verfügte nicht über gewöhnliche Pay-as-you-go-Preise. Die stabile Veröffentlichung von qwen3.8-max ersetzt diese Situation der Veröffentlichungswoche durch ein dokumentiertes API-Modell, veröffentlichte Spezifikationen und eine standardmäßige Abrechnung pro Token.
Entwickler können das Modell jetzt über Alibaba Cloud Model Studio aufrufen oder die Qwen3.8-Max API auf GPT Proto zusammen mit anderen Text-, Bild- und Videomodellen unter demselben Konto verwenden.
Was bedeutet die Anzahl von 2,4T Parametern?
Qwen3.8-Max enthält insgesamt 2,4 Billionen Parameter, aber seine Sparse-Mixture-of-Experts-Architektur aktiviert für jede Anfrage ungefähr 95 Milliarden Parameter.
Dieser Unterschied ist wichtig. Die vollständige Parameterzahl steht für die Gesamtkapazität des Modells, während die Zahl der aktiven Parameter die Berechnung während der Inferenz unmittelbarer beeinflusst. Zu einem bestimmten Zeitpunkt sind etwa 4 % der Gesamtparameter aktiv. Dadurch kann Alibaba die Modellkapazität skalieren, ohne die Rechenkosten für die Aktivierung aller 2,4 Billionen Parameter bei jedem Token tragen zu müssen.
Die Parameterzahl allein beweist jedoch nicht, dass ein Modell schneller, günstiger oder genauer ist. Bereitstellungsinfrastruktur, Tokeneffizienz, Länge der Schlussfolgerungen, Caching und die Anzahl der Wiederholungsversuche beeinflussen die tatsächlichen Kosten einer abgeschlossenen Aufgabe.
Ist Qwen 3.8 Max Open Source?
Zum 7. August 2026 noch nicht.
Alibaba hat bestätigt, dass die Gewichte von Qwen3.8-2.4T-A95B veröffentlicht werden. Damit ist dies das erste Qwen-Max-Modell, für das eine Veröffentlichung mit offenen Gewichten vorgesehen ist. Die Veröffentlichungsseite auf ModelScope verweist derzeit auf den 12. August 2026.
Solange der Checkpoint und die Lizenz nicht tatsächlich veröffentlicht wurden, sollte Qwen3.8-Max als API-Modell mit angekündigter Veröffentlichung offener Gewichte beschrieben werden – nicht als bereits herunterladbares Open-Source-Modell.
Selbst nach dem Eintreffen der Gewichte wird ein Checkpoint mit 2,4 Billionen Parametern erhebliche Speicher-, Arbeitsspeicher-, Netzwerk- und Inferenzinfrastruktur erfordern. Für die meisten Entwickler bleibt die gehostete API deutlich einfacher als das eigene Hosting.
Qwen-3.8-Max-API-Preise
Alibabas veröffentlichter Pay-as-you-go-Preis lautet:
| Abrechnungsposten |
Offizieller Listenpreis |
| Eingabetoken |
2 $ pro 1 Mio. Token |
| Ausgabetoken |
6 $ pro 1 Mio. Token |
| Kontextfenster |
Bis zu 1 Mio. Token |
| Maximale Ausgabe |
Bis zu 128K Token |
Damit ist Qwen3.8-Max zum offiziellen Listenpreis günstiger als Kimi K3 mit einem Eingabe-/Ausgabepreis von 3 $/15 $, bleibt aber teurer als einige kleinere reine Textmodelle.
Die Preise von GPT Proto können vom direkten Listenpreis von Alibaba abweichen. Prüfe vor der Schätzung eines umfangreichen Produktionsauftrags die aktuelle Qwen-3.8-Max-API-Seite.
Was zeigen die frühen Benchmarks von Qwen 3.8 Max?
Die Beweislage ist stärker als während der Juli-Vorschau, benötigt aber weiterhin Kontext.
Zum Start berichtete Alibaba, dass Qwen3.8-Max in der Text Arena den fünften, in der Vision Arena den zweiten und in der Frontend Code Arena den vierten Platz belegte. Alibaba veröffentlichte außerdem Beispiele für lang andauernde Programmieraufgaben, die Rekonstruktion visueller Anwendungen, die professionelle Dokumentenanalyse und den autonomen Einsatz von Tools.
Diese Ergebnisse etablieren Qwen3.8-Max als ernst zu nehmendes Frontier-Modell. Sie garantieren jedoch nicht, dass es bei jedem spezifischen Repository oder Agenten-Workflow jede Alternative schlagen wird.
Der frühere StackPerf-Vergleich mit 269 Dateien kann weiterhin nützlich sein, testete jedoch die Vorabversion Qwen3.8-Max Preview. Kimi K3 erzielte 83/100 und die Qwen-Vorschau 80/100, während Qwen alle 44 Tool-Aufrufe erfolgreich abschloss und die bessere Bewertung bei der Tool-Nutzung erhielt. Betrachte dieses Ergebnis als zeitbezogenes Verhaltenssignal – nicht als endgültige Rangliste der stabilen August-Version.
Ein nützlicher früher Test stammt aus einem direkten StackPerf-Vergleich mit Kimi K3. Beide Modelle untersuchten eingefrorene Kopien von 269 Dateien und hatten 60 Minuten Zeit, ein Integrationsdesign auf Repository-Ebene mit Quellenangaben, Migrationsschritten, Tests und einem Belegverzeichnis zu erstellen. Die Berichte wurden vor der Prüfung anonymisiert.
Kimi K3 erzielte nach Abzügen für sachliche Fehler 83/100; Qwen 3.8 Max Preview erzielte 80/100. Qwen erhielt 9/10 für die Tool-Nutzung gegenüber Kimi's 8/10, schloss alle 44 Tool-Aufrufe erfolgreich ab und erstellte den längeren Bericht mit weniger Anfragen. Kimi war schneller fertig, verwendete auf der getesteten Route weniger Token und bearbeitete Überarbeitungen und Neugenerierungen vollständiger.
Das ist glaubwürdige Evidenz für eine bestimmte Art von Softwarearchitekturarbeit mit langem Kontext. Es beweist nicht, dass Kimi K3 allgemein besser ist oder Qwen allgemein besser ist. Die Modelle liefen über unterschiedliche Anbieter, und Routenlatenz, Caching, Auslastung zum Start und Schlussfolgerungseinstellungen beeinflussten das Ergebnis.
Das frühe Bild aus der Community ist ähnlich gemischt. In der zentralen Hacker-News-Startdiskussion berichtete ein Tester, dass eine Aufgabe mit animiertem SVG mehr als zehn Minuten Schlussfolgerungszeit benötigte, während ein anderer Entwickler sagte, die Vorschau funktioniere gut für Programmieraufgaben, sei aber noch zu neu für eine Beurteilung. Das sind Anekdoten, keine Benchmarks. Sie weisen jedoch auf zwei Dinge hin, die du in deinen eigenen Tests messen solltest: die Zeit bis zu einer brauchbaren Antwort und die Aufgabenerfüllung pro Token.
Qwen 3.8 Max vs. Qwen 3.7 Max
Qwen 3.8 Max wirkt wie ein Upgrade beim Fähigkeitsspektrum, aber Qwen 3.7 Max bleibt heute die sicherere API-Wahl.
| Dimension |
Qwen 3.8 Max Preview |
Qwen 3.7 Max |
| Status |
Kontinuierlich aktualisierte Vorschau |
Bestehendes API-Modell |
| Veröffentlichte Parameter |
2,4T insgesamt |
Kein zentrales öffentliches Verkaufsargument |
| Vision |
Laut Alibaba ja |
Nur Text |
| Kontext |
Nicht veröffentlicht |
1 Mio. Token |
| Maximale Ausgabe |
Nicht veröffentlicht |
65.536 Token |
| Gewichte |
Versprochen, nicht veröffentlicht |
Geschlossene Gewichte |
| Preise |
Token-Plan-Credits; kein regulärer Tokenpreis |
GPT Proto-Preis: 0,36 $ Eingabe / 1,44 $ Ausgabe pro 1 Mio. |
| Nutzung im Produktions-Backend |
Individueller Tarif untersagt automatisierte Backend-Nutzung |
Herkömmlicher verbrauchsabhängiger API-Zugriff |
Ich würde kein blindes Upgrade des Modell-Strings von Qwen 3.7 Max auf die 3.8-Vorschau durchführen. Prüfe zunächst Ausgabestabilität, Tool-Schemas, Latenz, die Nutzung von Schlussfolgerungstoken und ob das endgültige Produktionsmodell das Verhalten der Vorschau beibehält.
Wenn du jetzt eine Qwen-API für eine Anwendung benötigst, ist der bestehende Qwen-3.7-Max-Endpunkt die praktische Übergangslösung:
curl "https://gptproto.com/v1/chat/completions" \
-H "Authorization: Bearer $GPTPROTO_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.7-max",
"messages": [
{
"role": "user",
"content": "Review this architecture and list the three highest-risk assumptions."
}
]
}'
Dies ruft Qwen 3.7 Max auf, nicht Qwen 3.8 Max. Diese Unterscheidung verhindert einen häufigen Fehler in der Veröffentlichungswoche: Code für einen Endpunkt zu veröffentlichen, den die Plattform nicht anbietet.
Qwen 3.8 Max vs. Kimi K3, GLM-5.2 und Fable 5
Der faire Vergleich ist asymmetrisch, da für Qwen 3.8 Max mehrere öffentliche Spezifikationen fehlen.
| Modell |
Bester aktueller Grund, es zu testen |
Wichtigster Kompromiss |
| Qwen 3.8 Max Preview |
Neues Qwen-Flaggschiff mit 2,4T Parametern, Vision und starken frühen Agentenergebnissen |
Veränderliche Vorschau, unbekannter Kontext und Tokenpreis, noch keine Gewichte |
| Kimi K3 |
Veröffentlichte 2,8T-MoE-Architektur, multimodaler Kontext mit 1 Mio. Token, herkömmlicher API-Zugriff |
Ständiges Schlussfolgern kann Latenz und Ausgabekosten erhöhen |
| GLM-5.2 |
Offene Gewichte unter MIT-Lizenz, bekannte aktive Parameter, 1M-Kontext, kostengünstigere agentische Programmierung |
Nur Text; die Gesamtkapazität kann bei einigen Aufgaben hinter den neuesten geschlossenen Vorschau-Modellen zurückbleiben |
| Fable 5 |
Der Referenzpunkt, den Qwen in der eigenen Veröffentlichung für Aufgaben mit langem Zeithorizont nennt |
Höherer Preis, und Qwen hat keine Belege für seine Vergleichsbehauptung veröffentlicht |
Beim Vergleich von Qwen 3.8 Max mit Kimi K3 zeigt der beste öffentlich verfügbare direkte Test derzeit einen Vorsprung von drei Punkten für Kimi, während Qwen die bessere Teilbewertung bei der Tool-Nutzung erhält. Beim Vergleich von Qwen 3.8 Max mit GLM-5.2 geht es weniger um eine unbestätigte Qualitätsrangfolge als um die Bereitstellung: Für GLM sind heute herunterladbare Gewichte unter MIT-Lizenz verfügbar, für Qwen nicht. Für den Vergleich von Qwen 3.8 Max mit Fable 5 gibt es nicht genügend öffentliche Belege, um Alibabas Rangfolge zu bestätigen.
Siehe den vollständigen Vergleich von Qwen 3.8 Max und Kimi K3
Sollten Entwickler Qwen 3.8 Max jetzt verwenden?
Ja, wenn die Arbeitslast von komplexer Programmierung, visueller Verarbeitung, langem Kontext oder mehrstufiger Agentenausführung profitiert.
Die Produktions-API, der veröffentlichte Tokenpreis, das 1M-Token-Kontextfenster und der stabile Modellname beseitigen die meisten Bereitstellungseinwände, die für die Juli-Vorschau galten. Entwickler können es jetzt als normales gehostetes Modell bewerten und nicht mehr als experimentellen Endpunkt, der nur über ein Abonnement verfügbar ist.
Es gibt weiterhin Einschränkungen:
Batch-Inferenz und Feinabstimmung werden derzeit nicht unterstützt.
Das Ausgabelimit von 128K kann bei unbedacht hohem Schlussfolgerungsaufwand teure Antworten erzeugen.
Die herunterladbaren Gewichte und die endgültige Lizenz sind zum 7. August noch nicht verfügbar.
Alibabas umfangreichste Beispiele für autonome Arbeit sind vom Anbieter durchgeführte Demonstrationen und keine Garantie für jede Anwendung.
Beginne für den gehosteten Produktionseinsatz mit der Qwen3.8-Max API auf GPT Proto. Warte für das eigene Hosting, bis der angekündigte Checkpoint und die Lizenz tatsächlich veröffentlicht wurden.