Aktualisiert am 7. August 2026: Qwen3.8-Max ist jetzt eine stabile Produktions-API und keine sich ändernde Vorschauversion mehr. Die Empfehlung in diesem Vergleich wurde entsprechend aktualisiert.
Qwen3.8-Max ist jetzt die bessere Standardwahl für neue Workloads mit hoher Komplexität. Das Modell bietet native Bild- und Videoverarbeitung, eine dokumentierte 2,4T-MoE-Architektur mit 95B aktiven Parametern, eine stärkere Ausrichtung auf langfristige Aufgaben und bis zu 128K Ausgabetoken.
Qwen3.7-Max hat weiterhin einen überzeugenden Vorteil: den Preis. Auf GPTProto kostet es derzeit 0,36 $ pro Million Eingabetoken und 1,44 $ pro Million Ausgabetoken. Damit ist es eine praktische Option für textbasiertes Programmieren, Dokumentenanalyse und bestehende Produktions-Workflows, die die multimodalen oder agentenbezogenen Verbesserungen des neuen Modells nicht benötigen.
Kurz gesagt: Wählen Sie Qwen3.8-Max für neues komplexes Programmieren, visuelle Aufgaben und lang laufende Agenten. Behalten Sie Qwen3.7-Max bei, wenn Kosteneffizienz bei reinem Text oder eine bereits getestete Produktionsbasis wichtiger ist als maximale Leistungsfähigkeit.
Qwen 3.8 Max vs. Qwen 3.7 Max auf einen Blick
| Kategorie |
Qwen 3.8 Max |
Qwen 3.7 Max |
| Status |
Stabile Produktions-API |
Stabile Produktions-API |
| Modellname |
qwen3.8-max |
qwen3.7-max |
| Veröffentlichungsdatum |
3. August 2026 |
19. Mai 2026 |
| Architektur |
2,4T MoE, 95B aktiv |
Nicht öffentlich bekannt gegeben |
| Kontextfenster |
Bis zu 1 Mio. Token |
Bis zu 1 Mio. Token |
| Maximale Ausgabe |
Bis zu 128K Token |
Bis zu 128K Token in den aktuellen offiziellen Angaben |
| Eingaben |
Text, Bilder und Video |
Text |
| Reasoning |
Hybrides Reasoning |
Reasoning unterstützt |
| Funktionsaufrufe |
Unterstützt |
Unterstützt |
| Offizieller Listenpreis |
2 $ Eingabe / 6 $ Ausgabe pro 1 Mio. |
2,50 $ / 7,50 $; zeitlich begrenzte Aktion: 1,25 $ / 3,75 $ |
| GPT Proto-Zugang |
Jetzt verfügbar |
Jetzt verfügbar |
| Am besten geeignet für |
Komplexes Programmieren, visuelle Aufgaben, Forschung, lang laufende Agenten |
Textbasierte Produktion zu geringeren Kosten |
| Open Weights |
Angekündigt; am 7. August noch nicht veröffentlicht |
Proprietär |
Die Angabe eines 1-Mio.-Kontexts für 3.8 ist relevant, da mehrere frühe Erklärungen diesen Wert weiterhin als unbekannt aufführen. QwenClouds aktuelle Tabelle der Textgenerierungsmodelle führt nun für beide Modelle 1 Mio. auf. Damit ist eine Spezifikationslücke geschlossen, aber es zeigt nicht, dass 3.8 lange Kontexte genauer nutzt.
Was wurde bei Qwen 3.8 Max tatsächlich verbessert?
In seiner Ankündigung vom 19. Juli bestätigte Qwen die Parameterzahl von 2,4T und kündigte an, dass Open Weights folgen würden. Alibabas Qoder-Versionshinweis beschreibt 3.8 als Verbesserung gegenüber 3.7 beim Programmieren und bei professioneller Produktivität, insbesondere bei Full-Stack-Entwicklung, Datenanalyse, Büroarbeit und anderen langfristigen Aufgaben. Ein späteres Qwen-Update berichtet von einem bemerkenswerten Fortschritt bei der Web-Frontend-Arbeit in der Vorschauversion.
Diese Signale sind hilfreich, aber es handelt sich um Aussagen des Anbieters und nicht um gemessene direkte Vergleichsergebnisse. Keine öffentliche Tabelle zeigt, wie viel besser 3.8 beim Beheben von Repository-Problemen, beim Abschließen toolgestützter Aufgaben oder beim Einhalten von Anforderungen über eine lange Sitzung hinweg ist. Die Zahl der aktiven Parameter ist ebenfalls nicht bekannt, daher sagt die Schlagzeile von 2,4T Entwicklern nichts über die Bereitstellungskosten oder Latenz des Modells.
Die ehrliche Beschreibung des Upgrades ist daher begrenzt: 3.8 zielt auf eine bessere Ausführung der Workloads ab, für die 3.7 bereits vorgesehen war, und bietet gleichzeitig ein größeres Modell sowie einen schnelleren Veröffentlichungsrhythmus. Es handelt sich nicht um ein Upgrade des Kontextfensters. Es ist kein Upgrade der Funktionsaufrufe. Ob es sich um ein Qualitätsupgrade handelt, bleibt eine plausible Hypothese und ist kein verifiziertes Ergebnis.
Es gibt noch einen weiteren Kostenfaktor. Qwen sagt, dass die Vorschau kontinuierlich verbessert wird. Während der Evaluierung klingt das attraktiv, erschwert ein sich veränderndes Modell jedoch Regressionstests. Derselbe Prompt kann sich nach einem unangekündigten Update anders verhalten, und ein heute bestandener Test garantiert nicht dasselbe Ergebnis in der nächsten Woche. Für Produktionsteams ist Versionsstabilität ein Feature.
Qwen 3.8 Max vs. Qwen 3.7 Max beim Programmieren
Qwen3.7-Max bietet überzeugende Argumente für Programmieren auf Repository-Ebene. Es verarbeitet bis zu 1 Mio. Token, unterstützt Reasoning und Tools und kann bereits über eine herkömmliche API aufgerufen werden. Die reine Textschnittstelle ist keine Einschränkung, wenn der Agent Quelldateien, Diffs, Logs und Tool-Ergebnisse als Text erhält.
Unabhängige Messungen liefern uns außerdem eine Vergleichsbasis. Artificial Analysis bewertet Qwen3.7-Max in seinem Intelligence Index mit 46. Die gemessene Ausgabegeschwindigkeit betrug 202,2 Token pro Sekunde, die Zeit bis zum ersten Token über Alibabas API 2,62 Sekunden. Diese Ergebnisse variieren je nach Anbieter und Workload, sind aber dennoch nützlicher als eine Ranking-Aussage ohne Methodik.
Es gibt einen Zielkonflikt. Qwen3.7-Max erzeugte während der Intelligence-Index-Evaluierung 100 Mio. Ausgabetoken, verglichen mit einem Median von 63 Mio. für die Modelle in der Vergleichsgruppe. Einfach ausgedrückt: Das Modell kann ausführlich sein. Eine hohe Tokenerzeugungsgeschwindigkeit bedeutet nicht automatisch eine kurze Antwort oder eine niedrige Gesamtrechnung, insbesondere wenn Ausgabetoken mehr kosten als Eingabetoken.
Qwen3.8-Max-Preview ist für explorative Frontend-Arbeit und lang laufende Agenten interessanter. Qwen hob ausdrücklich umfassende Verbesserungen im Web-Frontend hervor, und Qoder positioniert das Modell für Full-Stack-Entwicklung. Ich würde es bei UI-Generierung, mehrstufigem Debugging und Aufgaben testen, die Code mit Büro- oder Datenarbeit verbinden. Ich würde einen Produktions-Coding-Agenten jedoch nicht allein aufgrund des Modellnamens umstellen.
Eine Diskussion auf r/ClaudeCode in der Veröffentlichungswoche erhielt mehr als 40 Kommentare. Das ist ein Nachfragesignal, kein Leistungsergebnis. Die Begeisterung der Community kann zeigen, für welche Workloads sich Entwickler interessieren; ohne kontrollierte Prompts und veröffentlichte Ausgaben zeigt sie jedoch nicht, welches Modell Produktionsverkehr übernehmen sollte.
Für einen fairen Programmiervergleich zwischen Qwen 3.8 Max und Qwen 3.7 Max sollten Repository-Commit, System-Prompt, Tools, Berechtigungen und Erfolgskriterien identisch bleiben. Erfassen Sie Tool-Fehler, bestandene Tests, menschliche Korrekturen, verstrichene Zeit und Tokenverbrauch. Wenn sich eine dieser Eingaben unterscheidet, ist das Ergebnis eine Demo und kein Vergleich.
Leistung: Gemessene Ergebnisse vs. Aussagen des Anbieters
Alibaba beschreibt Qwen3.8-Max-Preview als eines der führenden Frontier-Modelle und sagt, dass es in der internen Evaluierung nur hinter Fable 5 rangiert. Der erste Teil ist plausibel. Der zweite ist nicht unabhängig überprüfbar, da Alibaba weder die Benchmark-Namen und Punktzahlen noch die Prompts oder das Bewertungsverfahren veröffentlicht hat, auf denen diese Aussage beruht.
| Belege |
Qwen 3.8 Max |
Qwen 3.7 Max |
| Positionierung des Anbieters |
Verbesserungen bei Programmierung und Cowork; internes Ranking hinter Fable 5 |
Auf Agenten ausgerichtetes Spitzenmodell für Programmierung, Produktivität und lange autonome Aufgaben |
| Öffentliche Benchmark-Tabelle |
Nicht veröffentlicht |
Verfügbare Anbieterergebnisse sowie unabhängige kombinierte Tests |
| Artificial Analysis Intelligence Index |
Bis zum 27. Juli 2026 kein Ergebnis gefunden |
46 |
| Unabhängig gemessene Ausgabegeschwindigkeit |
Nicht verfügbar |
202,2 Token/s über Alibabas API |
| Unabhängig gemessene TTFT |
Nicht verfügbar |
2,62 Sekunden über Alibabas API |
| Reproduzierbarkeit |
Vorschauänderungen während des Evaluierungszeitraums |
Stabilerer veröffentlichter Endpunkt |
Diese Lücke bei den Belegen beweist nicht, dass 3.8 schlechter ist. Sie bedeutet, dass die Frage „Welches Modell ist besser?“ zwei Antworten hat. Bei der erwarteten Leistungsfähigkeit ist 3.8 wahrscheinlich überlegen. Bei nachgewiesener, reproduzierbarer Leistung hat 3.7 derzeit die stärkeren Argumente.
Preise von Qwen 3.8 Max vs. Qwen 3.7 Max
Qwen3.8-Max verwendet jetzt eine standardmäßige Token-Abrechnung nach Verbrauch. Der frühere Credits-Plan aus der Preview-Ära ist für diesen Vergleich nicht mehr relevant.
| Preismodell |
Qwen 3.8 Max |
Qwen 3.7 Max |
| Offizieller Eingabepreis |
2 $ pro 1 Mio. Token |
2,50 $ pro 1 Mio. Token |
| Offizieller Ausgabepreis |
6 $ pro 1 Mio. Token |
7,50 $ pro 1 Mio. Token |
| GPT Proto-Eingabepreis |
1,80 $ pro 1 Mio. Token |
0,36 $ pro 1 Mio. Token |
| GPT Proto-Ausgabepreis |
5,40 $ pro 1 Mio. Token |
1,44 $ pro 1 Mio. Token |
Obwohl Qwen3.8-Max einen niedrigeren offiziellen Listenpreis als Qwen3.7-Max hat, bietet GPT Proto derzeit einen deutlich höheren Rabatt auf das ältere Modell. Auf GPT Proto kostet Qwen3.7-Max bei Eingaben 80 % weniger und bei Ausgaben etwa 73 % weniger als Qwen3.8-Max.
Zum Beispiel würde ein Workload mit 10 Millionen Eingabetoken und 2 Millionen Ausgabetoken Folgendes kosten:
Qwen3.8-Max auf GPT Proto: 10 × 1,80 $ + 2 × 5,40 $ = 28,80 $
Qwen3.7-Max auf GPT Proto: 10 × 0,36 $ + 2 × 1,44 $ = 6,48 $
Damit ist Qwen3.7-Max die klare Budgetwahl für textbasierte Workloads mit hohem Volumen. Allerdings bietet Qwen3.8-Max native Bild- und Videoverarbeitung, strukturierte Ausgaben, ein höheres Ausgabelimit und eine stärkere Ausrichtung auf komplexes Programmieren und lang laufende Agenten.
Die günstigste Anfrage ist nicht immer die günstigste abgeschlossene Aufgabe. Teams sollten Erfolgsquote im ersten Durchlauf, Wiederholungen, Tool-Fehler, Tokenverbrauch und Zeitaufwand für menschliche Korrekturen vergleichen. Starten Sie mit Qwen3.8-Max, wenn die neuen Fähigkeiten den Workflow beeinflussen; behalten Sie Qwen3.7-Max bei, wenn der niedrigere Preis die besseren Kosten pro akzeptiertem Ergebnis ermöglicht.
Warum es hier keine Tabelle mit identischen Ausgaben gibt
Ein Screenshot mit einem direkten Vergleich würde überzeugend wirken. Derzeit wäre er jedoch irreführend.
Qwen3.8-Max-Preview ist auf GPT Proto nicht verfügbar, und die offizielle Dokumentation besagt, dass sich das Modell während der Vorschau ändern kann. Ein aktueller Lauf der 3.7-API und ein nicht datierter 3.8-Screenshot aus einem anderen Produkt würden Modellversionen, Infrastruktur, Tools und möglicherweise System-Prompts vermischen. Ich werde das nicht als kontrollierten Test bezeichnen.
Der Test in Veröffentlichungsqualität ist einfach: Führen Sie dieselbe Repository-Aufgabe am selben Tag mit beiden Modellen aus, bewahren Sie den vollständigen Prompt und Tool-Ablauf auf und veröffentlichen Sie die Rohdaten zusammen mit den Bewertungskriterien. Solange dieser Lauf nicht existiert, ist das Fehlen eines Beispiels ehrlicher als ein dekoratives Gewinnerabzeichen.
Welches Modell sollten Sie wählen?
| Ihre Priorität |
Bessere Wahl |
Warum |
| Beste allgemeine Qwen-Leistungsfähigkeit |
Qwen 3.8 Max |
Neues Spitzenmodell mit stärkerer Ausrichtung auf Programmierung, visuelle Aufgaben, Forschung und langfristige Aufgaben |
| Komplexe Repository- oder Agentenarbeit |
Qwen 3.8 Max |
Für längere autonome Ausführung und Tool-Workflows mit geschlossenem Regelkreis entwickelt |
| Bild-, Video- oder visuelle Dokumenteingaben |
Qwen 3.8 Max |
3.7 ist textbasiert |
| Niedrigste GPT Proto-Kosten für Text-Token |
Qwen 3.7 Max |
0,36 $ Eingabe und 1,44 $ Ausgabe pro 1 Mio. Token |
| Bestehende Anwendung mit Regressionstests |
3.7 beibehalten, bis es validiert ist |
Auch eine stabile Veröffentlichung erfordert workloadspezifische Migrationstests |
| Neue Anwendung, die heute startet |
Mit 3.8 starten |
Es gibt keinen Grund aufgrund eines Vorschau-Status mehr, standardmäßig 3.7 zu wählen |
| Heute selbst hosten |
Keines von beiden |
3.7 ist proprietär; die Gewichte von 3.8 sind angekündigt, aber noch nicht zum Herunterladen verfügbar |
Die alte Empfehlung – „3.7 bereitstellen und 3.8 nur evaluieren“ – passt nicht mehr zum aktuellen Produktstatus.
Beginnen Sie bei neuen Projekten die Evaluierung mit Qwen3.8-Max auf GPT Proto. Behalten Sie Qwen3.7-Max bei, wenn der deutlich niedrigere Tokenpreis oder eine bestehende validierte Basis bessere Kosten pro akzeptierter Aufgabe liefert.
Qwen 3.8 Max über GPT Proto testen
Qwen3.8-Max ist jetzt über GPT Protos OpenAI-kompatible API verfügbar.
export GPTPROTO_API_KEY="your_api_key_here"
curl https://gptproto.com/v1/chat/completions \
-H "Authorization: Bearer $GPTPROTO_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.8-max",
"messages": [
{
"role": "system",
"content": "Inspect the existing implementation before proposing changes. Preserve current API contracts and list the verification steps for every edit."
},
{
"role": "user",
"content": "Review this repository architecture and identify the three highest-risk assumptions."
}
]
}'
Die Python-Version verwendet den offiziellen OpenAI-Client:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["GPTPROTO_API_KEY"],
base_url="https://gptproto.com/v1",
)
response = client.chat.completions.create(
model="qwen3.7-max",
messages=[
{
"role": "system",
"content": (
"You are a senior software engineer. Return the smallest "
"safe patch and explain each changed file."
),
},
{
"role": "user",
"content": (
"Review this function for correctness and propose a tested fix: "
"def divide_total(total, count): return total / count"
),
},
],
)
print(response.choices[0].message.content)
Das SDK fügt den Bearer-Autorisierungsheader hinzu. Für den Wechsel zu einem anderen kompatiblen Modell muss nur die Modellzeichenfolge geändert werden. Bewahren Sie einen separaten Evaluierungssatz auf, damit ein bequemer Wechsel nicht zu einer ungetesteten Produktionsänderung wird.
Checkliste für ein sicheres Upgrade
Speichern Sie zunächst eine 3.7-Baseline aus Ihrem realen Workload, nicht aus einem synthetischen Programmierpuzzle. Bewahren Sie Prompt, Repository-Zustand, Tools, erwartete Ausgabe, Latenz und Tokenverbrauch auf. Führen Sie anschließend dasselbe Paket mit 3.8 Preview aus und untersuchen Sie Fehler – nicht nur die am besten aussehende Antwort.
Legen Sie den Migrationsschwellenwert fest, bevor Sie das Ergebnis sehen. Verlangen Sie beispielsweise, dass das neue Modell dieselben Tests besteht, ohne dass die Tool-Fehler zunehmen oder sich die Kosten inakzeptabel verändern. Wiederholen Sie die Evaluierung nach größeren Preview-Updates. Warten Sie schließlich auf eine stabile Modellkennung und einen veröffentlichten Preis, bevor Sie Datenverkehr mit einer Verfügbarkeits- oder Budgetverpflichtung umleiten.
Dieser Prozess ist weniger aufregend, als am Veröffentlichungstag umzuschalten. Er verhindert jedoch, dass ein Modell-Upgrade zu einem Vorfall wird.
Fazit
Qwen3.8-Max ist jetzt das bessere Standardmodell von Qwen für neue komplexe Workloads. Die stabile API beseitigt den größten Einwand des ursprünglichen Vergleichs, während multimodale Eingaben und ein leistungsfähigeres Verhalten bei langfristigen Aufgaben eine höhere Leistungsgrenze bieten.
Qwen3.7-Max ist nicht überholt. Sein GPT Proto-Preis macht es zu einem starken textbasierten Produktionsmodell, insbesondere wenn ein Workload bereits getestet ist und nicht von visueller Verarbeitung oder längerer autonomer Ausführung profitiert.
Starten Sie neue Evaluierungen mit Qwen3.8-Max. Behalten Sie 3.7 dort bei, wo es bei den Kosten pro akzeptierter Aufgabe überzeugt – nicht einfach nur, weil es früher veröffentlicht wurde.