Qwen3.8-Max-0902 vs. Claude Fable 5.1 auf einen Blick
| Kategorie |
Qwen3.8-Max-0902 |
Claude Fable 5.1 |
| Anbieter |
Alibaba Qwen |
Anthropic |
| Am besten geeignet für |
Kostensensible Programmierung, Frontend-Arbeit, Agenten mit hohem Volumen |
Schwieriges Debugging, lang laufende Agenten, Szenarien mit hohen Kosten bei Fehlschlägen |
| Kontextfenster |
1 Mio. Tokens |
1 Mio. Tokens |
| Maximale Ausgabe |
131.000 Tokens |
128.000 Tokens |
| Offizieller Preis für neue Eingaben |
2 $ pro Million Tokens |
10 $ pro Million Tokens |
| Offizieller Ausgabepreis |
6 $ pro Million Tokens |
50 $ pro Million Tokens |
| GPT Proto-Preis für neue Eingaben |
1,80 $ pro Million Tokens |
9 $ pro Million Tokens |
| GPT Proto-Ausgabepreis |
5,40 $ pro Million Tokens |
45 $ pro Million Tokens |
| Offiziell unterstützte Eingabemodalitäten |
Text, Bilder und Videos |
Text und Bilder |
| Denkverhalten |
Denkmodus kann über die API aktiviert werden |
Adaptives Denken ist immer aktiviert |
| Relevantes API-Verhalten |
Funktionsaufrufe und strukturierte Ausgaben |
Erzwungene Tool-Auswahl wird nicht unterstützt |
| Wichtigste Einschränkung der Evidenzlage |
Nur begrenzte unabhängige Evidenz zum exakten 0902-Snapshot |
Aktuelle öffentliche Vergleiche berücksichtigen Qwen 0902 selten |
Der Preisunterschied auf dem Papier ist groß: Neue Eingaben sind bei Fable fünfmal so teuer wie bei Qwen, Ausgaben etwa 8,3-mal so teuer. Bei zwischengespeicherten Eingaben sieht es jedoch anders aus. In den aktuellen GPT Proto-Modellübersichten liegt der Preis für das Lesen des Caches bei beiden bei 0,225 $ pro Million Tokens. Die tatsächlichen Agentenkosten hängen daher vom Verhältnis neuer Eingaben, generierter Ausgaben, zwischengespeichertem Kontext, erneuten Versuchen und menschlichem Korrekturaufwand ab.
Was sind Qwen3.8-Max-0902 und Claude Fable 5.1?
Qwen3.8-Max-0902
Qwen3.8-Max-0902 ist ein aktualisierter Snapshot aus der Qwen3.8-Max-Modellfamilie von Alibaba. Die offizielle Modellseite beschreibt zusätzliche Schwerpunkte auf Programmierung, Multi-Tool-Agenten, langfristiger autonomer Entwicklung und visuellem Verständnis.
Laut der Qwen-Dokumentation akzeptiert das Modell Text, Bilder und Videos. Es bietet ein Kontextfenster von 1 Mio. Tokens, bis zu 131.000 Ausgabetokens, Funktionsaufrufe, strukturierte Ausgaben, Präfixvervollständigung, Caching und Batch-Verarbeitung. Entwickler können den Denkmodus über die API aktivieren, wenn eine Aufgabe mehr Schlussfolgerungen erfordert.
Ein Detail zur Bezeichnung ist wichtig. Obwohl es für andere Qwen-Versionen offene Checkpoints gibt, konnten wir keinen separat veröffentlichten offiziellen Checkpoint für den exakten Snapshot qwen3.8-max-0902 finden. Betrachte 0902 als API-Modellversion, solange Alibaba keine passenden Gewichte veröffentlicht. Diesen exakten Snapshot derzeit als „Open Weight“ zu bezeichnen, würde über die verfügbare Evidenz hinausgehen.
Hintergrund zum Upgrade der Modellfamilie findest du unter Qwen 3.8 Max vs. Qwen 3.7 Max.
Claude Fable 5.1
Claude Fable 5.1 ist Anthropics High-End-Modell für komplexe Programmierung, Wissensarbeit und die Ausführung von Agenten. Es wurde am 1. September 2026 veröffentlicht. Die offizielle Modelldokumentation nennt ein Kontextfenster von 1 Mio. Tokens, eine maximale Ausgabe von 128.000 Tokens, Text- und Bildeingaben sowie einen Wissensstand bis Juni 2026.
Fable 5.1 verwendet bei jeder Anfrage adaptives Denken. Entwickler können den Aufwand anpassen, den Denkmodus aber nicht deaktivieren oder ein manuelles Budget für Denktokens festlegen. Anthropic beschreibt die relative Latenz als „langsamer“ – relevant, wenn ein Workflow schnelle, wiederholte Antworten höher bewertet als einen teureren ersten Versuch.
Anthropic zufolge kann Fable 5.1 bei manchen Workloads die Kosten im Vergleich zu Fable 5 senken, insbesondere bei Agenten-Workloads, die zwischengespeicherten Kontext wiederverwenden. Dabei handelt es sich um einen Vergleich mit der vorherigen Fable-Version, nicht mit Qwen. Außerdem garantiert das keine niedrigere Rechnung für jeden Prompt, da der tatsächliche Tokenverbrauch und das Verhalten bei erneuten Versuchen variieren.
Eine Zusammenfassung der Veröffentlichung findest du unter Claude Fable 5.1 und Mythos 5.1.
Programmierleistung: Frontend, Repository-Arbeit und Debugging
Die Frage, welches Modell „besser fürs Programmieren“ ist, lässt sich nicht mit einem einzelnen Benchmark beantworten. Ein Modell, das eine ansprechende Benutzeroberfläche erstellt, ist nicht unbedingt am besten darin, eine Race Condition aufzuspüren. Ein Modell, das eine schwierige Repository-Migration in einem Durchgang abschließt, kann für Tausende kleiner Code-Transformationen zu teuer sein. Ein sinnvoller Vergleich beginnt damit, die Programmieraufgaben in einzelne Bereiche aufzuteilen.
Frontend-Programmierung und UI-Generierung
Qwen3.8-Max-0902 hat die klareren öffentlichen Hinweise auf seine Fähigkeiten bei der Frontend-Generierung. Alibaba meldete für den 0902-Snapshot einen Wert von 1691 Code Arena WebDev Elo. Auch eine öffentliche Demo eines Finanz-Dashboards zeigt, wie das Modell eine visuelle Anfrage in eine ausgefeilte Benutzeroberfläche umsetzt.

Das sind nützliche Beispiele, aber keines davon ist ein kontrollierter Vergleich zwischen Qwen und Fable 5.1. Ein Social-Media-Video zeigt ein gelungenes Ergebnis, nicht die durchschnittliche Zuverlässigkeit des Modells über wiederholte Prompts hinweg. Auch Alibabas Punktzahl stammt vom Anbieter selbst.
Öffentliche Tests von Fable 5.1 zeigen, dass das Modell umfangreiche Projekte in einem Durchgang abschließen kann. Im Praxistest von Every schätzten die Tester die Fähigkeit, längere Programmieraufgaben durchzuhalten. Einige visuelle Ergebnisse wirkten jedoch generisch, und gelegentlich ignorierte das Modell explizite Vorgaben. Im Artikel wurde der frühzeitige Zugang vor der Veröffentlichung durch Anthropic offengelegt und angegeben, Anthropic habe keinen redaktionellen Einfluss genommen.
Fazit zum Frontend: Qwen3.8-Max-0902 ist leicht zu bevorzugen, wenn Iterationskosten, visuelle Generierung und Ausgabevolumen wichtig sind. Die Zuversicht ist mittel, da es keinen aktuellen gemeinsamen Frontend-Test für beide exakten Modellversionen gibt.
Repository-Verständnis und Änderungen über mehrere Dateien hinweg
Alibaba meldet vielversprechende Ergebnisse für Qwen3.8-Max-0902 in repositorybezogenen Tests, darunter 69.3 bei DeepSWE 1.1, 64.9 bei NL2Repo und 44.8 bei SWE-Marathon. Diese Werte deuten darauf hin, dass das Update 0902 nicht nur auf die Generierung einzelner Code-Schnipsel beschränkt ist.
Für Claude Fable 5.1 gibt es eine andere Art von Evidenz. Anthropic meldet 73.4 bei CursorBench 3.2.0. Das Material zur Markteinführung enthält außerdem Kundenberichte von Organisationen, die Claude für technische Aufgaben unter produktionsnahen Bedingungen einsetzen. Diese Berichte belegen die Relevanz von Fable für komplexe Codebasen, stammen jedoch aus einer Auswahl des Anbieters und sollten nicht als neutrale Bewertungen betrachtet werden.
Die beiden Evidenzgrundlagen lassen sich weder voneinander abziehen noch mitteln. Sie beruhen auf unterschiedlichen Repositories, Aufgabendefinitionen, Tools, Ausführungsumgebungen und Bewertungsregeln.
Fazit zu Repositories: Kein eindeutiger Gewinner. Teste beide Modelle anhand eines repräsentativen privaten Repositorys mit derselben Aufgabe, denselben Tool-Berechtigungen, derselben Testsuite und denselben Abschlusskriterien.
Debugging, Code-Review und Ursachenanalyse
Claude Fable 5.1 hat derzeit die stärkeren öffentlichen Belege für schwierige Aufgaben mit langen Handlungsketten. Anthropics eigene Bewertungen und mehrere Praxistests heben die anhaltende Ausführung, Planung und Erledigung komplizierter Aufgaben ohne häufige Eingriffe hervor. Ein separater Praxistest von Fable 5.1 für Entwickler berichtet von erfolgreichen Arbeiten in einem Durchgang an einem Bildcodec und einem Portfolio-Projekt. Zugleich wird darauf hingewiesen, dass das Modell teuer ist und die wahrgenommene Geschwindigkeit nicht mit einer kontrollierten Zeitmessung erfasst wurde.
Qwens Vorteil liegt bei den Kosten. Mit demselben API-Budget kann ein Team mehr Patch-Kandidaten, Tests und Reparaturschleifen ausprobieren. Das ist wichtig, wenn automatisierte Tests schlechte Antworten schnell verwerfen. Weniger wichtig ist es, wenn jeder fehlgeschlagene Versuch Entwicklungszeit kostet oder das Risiko eines teuren Produktionsfehlers birgt.
Fazit zum Debugging: Wähle Fable 5.1 für schwierige Ursachenanalysen im ersten Durchgang, wenn Fehler teuer sind. Wähle Qwen3.8-Max-0902 für iterative Korrekturen bei begrenztem Budget und zuverlässiger automatisierter Überprüfung.
Warum veröffentlichte Benchmarks keinen direkten Vergleich ermöglichen
Der einfachste Fehler beim Vergleich von Alibaba Qwen3.8-Max-0902 und Anthropic Claude Fable 5.1 besteht darin, nicht zusammengehörige Benchmarkwerte in benachbarte Spalten zu setzen und daraus einen Gewinner abzuleiten.
Alibabas öffentliche Tabelle für 0902 vergleicht Qwen mit Claude Fable 5, nicht mit Fable 5.1. Die Ergebnisse zur Markteinführung von Fable 5.1 von Anthropic umfassen Terminal-Bench, OSWorld, CursorBench, AutomationBench und weitere Bewertungen. Sie wurden jedoch nicht als direkter Test gegen Qwen 0902 unter identischen Bedingungen durchgeführt.
Selbst Benchmarks mit ähnlichen Namen können sich hinsichtlich Version, Tool-Konfiguration, Inferenzaufwand, Bewertungsmethode oder Zeitlimit unterscheiden. Alibaba kennzeichnet beispielsweise ein AutomationBench-Ergebnis als Version 1.0.6, während Anthropics Tabelle zur Markteinführung Teil eines separaten Bewertungspakets ist. Die angezeigten Werte als direkten Vergleich zu behandeln, wäre irreführend.
| Veröffentlichte Hinweise |
Gemeldetes Ergebnis |
Was es belegt |
Was es nicht beweist |
| Qwen Code Arena WebDev |
1691 Elo |
Hinweis auf Frontend- und Webentwicklungskompetenz |
Überlegenheit gegenüber Fable 5.1 |
| Qwen DeepSWE 1.1 |
69.3 |
Hinweis auf Programmierleistung auf Repository-Ebene |
Gleichwertige Leistung in einer anderen SWE-Bewertung |
| Qwen CoWorkBench |
76.1 |
Hinweis auf mehrstufige Aufgabenbearbeitung |
Neutrale Validierung durch Dritte |
| Fable Terminal-Bench 4.0 |
55.8 % |
Hinweis auf Terminal-Agentenleistung |
Direkter Vorteil gegenüber Qwens Test mit anderer Versionsnummer |
| Fable CursorBench 3.2.0 |
73.4 % |
Hinweis auf Coding-Agentenleistung |
Gleiche Ergebnisse in einem Qwen-Benchmark |
| Fable OSWorld 2.0 |
77.9 % teilweise / 41.7 % streng |
Hinweis auf Computerbedienung |
Allgemeine Führungsposition bei Agenten in allen Umgebungen |
Alle Werte in dieser Tabelle stammen von den jeweiligen Anbietern. Die verantwortungsvolle Schlussfolgerung lautet nicht: „Benchmarks sind nutzlos.“ Entscheidend ist vielmehr, dass die Relevanz eines Benchmarks von der Aufgabe abhängt und Werte nur dann Vergleiche stützen, wenn Modellversionen und Testbedingungen übereinstimmen.
Agentenleistung und API-Verhalten
Bei einem KI-Agenten ist die Modellqualität nur ein Teil des Systems. Tool-Auswahl, Gesprächszustand, Caching, Wiederholungslogik und Latenz können das Ergebnis verändern, selbst wenn der Prompt gleich bleibt.
Tool-Aufrufe und strukturierte Ausgaben
Qwen3.8-Max-0902 unterstützt Funktionsaufrufe und strukturierte Ausgaben und eignet sich damit für Agenten, die Daten gemäß einem Schema zurückgeben oder externe Tools aufrufen müssen. Auf der offiziellen Seite werden außerdem Präfixvervollständigung, Batch-Verarbeitung und Websuche aufgeführt.
Fable 5.1 unterstützt den Tool-Einsatz, bietet aber stärker vorgegebene API-Steuerungsmöglichkeiten. Laut Anthropics Migrationsleitfaden werden tool_choice: "any" und die erzwungene Auswahl eines benannten Tools nicht unterstützt. Diese Einstellungen führen zu einem 400-Fehler. Entwickler können die automatische Tool-Auswahl verwenden oder Tools deaktivieren. Ein bestehender Workflow, der bei jedem Schritt ein bestimmtes Tool erfordert, muss jedoch möglicherweise neu gestaltet werden.
Anthropic weist außerdem darauf hin, dass Fable 5.1 in einem Durchlauf möglicherweise nur einen Tool-Aufruf ausführt, wo Fable 5 zuvor mehrere zusammengefasst hat. Je nach Agentenschleife kann das zusätzliche Roundtrips verursachen und die Ende-zu-Ende-Latenz erhöhen.
Fazit zur Tool-Steuerung: Qwen ist die naheliegendere Empfehlung für Workflows, die eine strikte, von der Anwendung gesteuerte Tool-Auswahl erfordern. Fable eignet sich weiterhin, wenn der Agent selbst entscheiden kann, ob und wann er Tools aufruft.
Denkmodus und Gesprächszustand
Bei Qwen kann die Anwendung den Denkmodus für Aufgaben aktivieren, die ihn erfordern. Fable 5.1 verwendet bei jeder Anfrage adaptives Denken; der Versuch, den Denkmodus zu deaktivieren oder ein manuelles Budget für Denktokens anzugeben, führt zu einem Fehler.
Der Unterschied betrifft mehr als den Tokenverbrauch. Anthropic dokumentiert mehrere Regeln für die Zustandsverwaltung:
Frühere Claude-Modelle können Denkblöcke von Fable 5.1 nicht lesen.
Änderungen an früheren Nachrichten, Systemanweisungen oder Tool-Definitionen können bestehende Denkblöcke ungültig machen.
Anwendungen, die den Gesprächsverlauf umschreiben, müssen möglicherweise ungültige Denkdaten entfernen, bevor sie es erneut versuchen.
Fortschrittsmeldungen für lange Denksequenzen erfordern eine Beta-Option.
Diese Regeln sind handhabbar, spielen aber bei dauerhaften Agenten, fortsetzbaren Jobs und Systemen, die während eines Gesprächs das Modell wechseln, eine wichtige Rolle. Ein Router für mehrere Modelle sollte gewöhnliche Nachrichten und Tool-Ergebnisse in einem portablen Format speichern, statt anzunehmen, dass verborgene Schlussfolgerungsdaten zwischen Anbietern übertragen werden können.
Lang laufende Agentenaufgaben
Für lange und schwierige Aufgaben gibt es derzeit stärkere öffentliche Belege für Claude Fable 5.1. Anthropic meldet 52.6 % bei Terminal-Bench-Science 0.1, 55.8 % bei Terminal-Bench 4.0 und 31.4 % bei AutomationBench. Diese Ergebnisse stammen weiterhin vom Anbieter, decken aber relevante agentenähnliche Aufgaben ab.
Auch Erfahrungsberichte aus der Praxis zeigen nützliche Fehlermuster. Die Tester von Every berichteten von Fällen, in denen Fable die geforderten Ausgabelimits ignorierte, bei hohem Aufwand mehr Subagenten als nötig erstellte oder weitermachte, obwohl es hätte aufhören sollen. Bei einer Rechercheaufgabe gab das Modell 43 Zitate zurück, obwohl 8 bis 12 verlangt waren. Die Tester stellten außerdem fest, dass mehrere geprüfte Zitate in der bereitgestellten Quelle nicht vorkamen. Diese Beobachtungen entwerten das Modell nicht, zeigen aber, warum lang laufende Agenten weiterhin Begrenzungen, Quellenprüfungen und explizite Abbruchbedingungen benötigen.
Zu den vom Anbieter gemeldeten Agentenwerten von Qwen gehören 50.8 bei AutomationBench v1.0.6, 73.3 bei Toolathlon Verified und 1468 WorkArena Elo. Der deutlich niedrigere Preis für neue Tokens macht das Modell attraktiv für Workflows mit vielen kurzen oder mittellangen Schritten.
Fazit zu Agenten: Fable hat die stärkeren Argumente für hochwertige Aufgaben mit langem Zeithorizont. Qwen ist die praktische Wahl für Agenten mit hohem Volumen und Systeme, die jeden Schritt automatisch überprüfen können.
Preise: Qwen3.8-Max-0902 vs. Claude Fable 5.1
Der Preis pro Million Tokens ist leicht zu berechnen. Die Kosten pro abgeschlossener Aufgabe sind es nicht.
Offizielle API-Preise und GPT Proto-API-Preise
| Tokenkategorie |
Qwen offiziell |
Qwen über GPT Proto |
Fable offiziell |
Fable über GPT Proto |
| Neue Eingaben |
2.00 $ |
1.80 $ |
10.00 $ |
9.00 $ |
| Ausgabe |
6.00 $ |
5.40 $ |
50.00 $ |
45.00 $ |
| Angegebener Preis für das Lesen des Caches |
0.25 $ implizit / 0.17 $ explizit |
0.225 $ |
0.25 $ |
0.225 $ |
| Angegebener Preis für das Schreiben in den Cache |
2.50 $ für explizites Erstellen |
2.25 $ |
12.50 $ für 5 Minuten / 20 $ für 1 Stunde |
11.25 $ |
Die Preise gelten pro Million Tokens und wurden am 11. September 2026 überprüft. Qwen unterscheidet zwischen implizit zwischengespeicherten Eingaben und expliziten Cache-Lesevorgängen, während Anthropic die Preise fürs Schreiben in den Cache je nach Aufbewahrungsdauer anpasst. Prüfe vor der Schätzung eines Produktionsbudgets die jeweilige Modellseite.
Beispiel für die Kosten pro Aufgabe
Angenommen, ein Agentendurchlauf verwendet:
Bei den aktuellen GPT Proto-Preisen ergibt sich:
| Kostenkomponente |
Qwen3.8-Max-0902 |
Claude Fable 5.1 |
| Neue Eingaben |
0.1800 $ |
0.9000 $ |
| Ausgabe |
0.1080 $ |
0.9000 $ |
| Cache-Lesevorgang |
0.0675 $ |
0.0675 $ |
| Summe pro Versuch |
$0.3555 |
$1.8675 |
Bei dieser Tokenverteilung kostet ein Fable-Versuch etwa 5,25-mal so viel wie ein Qwen-Versuch. Drei gleich große Qwen-Versuche würden etwa 1,07 $ kosten, sechs etwa 2,13 $. In diesem vereinfachten Beispiel sind die API-Kosten von Fable nur dann niedriger, wenn ein erfolgreicher Fable-Durchlauf mehr als fünf gleich große Qwen-Versuche ersetzt.
Das ist eine Berechnung, keine Aussage über gemessene Erfolgsquoten. Die Modelle können unterschiedlich viele Tokens generieren, unterschiedlich viele Tool-Aufrufe benötigen oder verschiedene Prompts erfordern. Auch die menschliche Prüfung beeinflusst die Entscheidung. 1,50 $ an API-Kosten zu sparen, lohnt sich nicht, wenn ein fehlgeschlagener Patch eine Stunde Entwicklungszeit kostet.
Eine bessere Kennzahl für den Produktionseinsatz lautet:
Kosten pro akzeptiertem Ergebnis = gesamte API-Ausgaben + geschätzte Prüf- oder Reparaturkosten, geteilt durch die Anzahl der Ausgaben, die deine Abnahmekriterien erfüllen.
Fazit zur Kosteneffizienz: Qwen ist die klare Wahl, wenn der Preis bei Batch-Programmierung und häufigen Agentenschritten im Vordergrund steht. Fable kann seinen Aufpreis rechtfertigen, wenn es bei schwierigen Aufgaben die Zahl erneuter Versuche oder den manuellen Korrekturaufwand deutlich senkt. Das sollte jedoch anhand des eigenen Workloads nachgewiesen werden.
Was Entwickler berichten
Berichte aus der Community helfen dabei, Schwachstellen zu finden, die in Benchmarktabellen nicht sichtbar sind. Sie sind keine kontrollierten Tests, und die genaue Modellversion muss klar erkennbar bleiben.
Rückmeldungen aus der Qwen-Community
Ein früher Praxistest mit der Qwen3.8-Max-Vorschauversion verwendete dieselben vier Prompts für Einzeldurchläufe bei mehreren Modellen. Der Tester stellte starke Ergebnisse, aber eine sehr langsame Fertigstellung fest: Website-Aufgaben dauerten mehr als 30 Minuten, eine Go-Pokersimulation ungefähr 80 Minuten. Dieser Test wurde vor dem 0902-Snapshot durchgeführt. Er beschreibt daher die Erfahrung mit der frühen Modellfamilie und belegt nicht die aktuelle Latenz von 0902.
Eine Diskussion in der Qwen-Community fiel gemischt aus. Einige Nutzer lobten die Präzision des Codes und die niedrige Syntaxfehlerquote, kritisierten aber die Ausführlichkeit und Geschwindigkeit. Andere berichteten von Abweichungen von der Aufgabe, Halluzinationen oder uneinheitlicher Qualität der Benutzeroberfläche. Auch diese Kommentare beziehen sich auf die Vorschauversion und sollten nicht stillschweigend als Ergebnisse von 0902 ausgegeben werden.
Die neuere Demo des Finanz-Dashboards mit 0902 ist für die aktuelle Version relevanter, aber deutlich enger gefasst. Zusammengenommen legen diese Quellen nahe, dass Teams sowohl die Qualität der Ergebnisse als auch die tatsächliche Laufzeit testen sollten, statt anzunehmen, eine hohe Programmierpunktzahl garantiere einen schnellen Entwickler-Workflow.
Praxiserfahrungen mit Claude Fable 5.1
Die verfügbaren Berichte zu Fable 5.1 sind aktueller. Im Test von Every wurden ausdauernde Programmierarbeit und die Erledigung mehrerer Aufgaben in einem Durchgang gelobt, während zugleich Probleme mit der Befolgung von Anweisungen und dem rechtzeitigen Beenden dokumentiert wurden. Auch Thomas Wiegolds Test stellte starke Ergebnisse in einem Durchgang fest, wies jedoch auf die hohen Kosten hin und vermied präzise Aussagen zur Geschwindigkeit, da keine kontrollierte Zeitmessung vorlag.
Diese Kombination ist aussagekräftiger als reine Testimonials. Fable scheint sich für schwierige Aufgaben zu eignen, die von ausdauerndem Schlussfolgern profitieren. Agenten benötigen dennoch Höchstgrenzen für Schritte, Testschranken, Quellenvalidierung und Budgetkontrollen.
Welches Modell eignet sich besser für die einzelnen Anwendungsfälle?
| Anwendungsfall |
Empfohlenes Modell |
Zuversicht |
Begründung |
| Kostensensible Programmier-API |
Qwen3.8-Max-0902 |
Hoch |
Deutlich niedrigere Preise für neue Eingaben und Ausgaben |
| Frontend-Programmierung |
Qwen3.8-Max-0902 |
Mittel |
Starke WebDev-Hinweise und niedrigere Iterationskosten, aber kein aktueller direkter Test |
| Änderungen am gesamten Repository |
Beide testen |
Niedrig bis mittel |
Öffentliche Belege beruhen auf unterschiedlichen Repositories und Testaufbauten |
| Schwieriges Debugging |
Claude Fable 5.1 |
Mittel |
Stärkere aktuelle Belege für ausdauernde, komplexe Aufgaben |
| Agentenaufrufe mit hohem Volumen |
Qwen3.8-Max-0902 |
Hoch |
Niedrigere Kosten bei wiederholten Schritten mit neuen Tokens |
| Lange unbeaufsichtigte Agentenläufe |
Claude Fable 5.1 |
Mittel |
Bessere aktuelle Belege für Aufgaben mit langem Zeithorizont; Schutzmaßnahmen sind weiterhin erforderlich |
| Workflows mit erzwungener Tool-Auswahl |
Qwen oder Workflow neu gestalten |
Hoch |
Fable 5.1 lehnt eine erzwungene Tool-Auswahl ab |
| Bild- und Videoverständnis |
Qwen3.8-Max-0902 |
Hoch |
Qwen führt offiziell Bild- und Videoeingaben auf |
Die wichtigste Zeile ist möglicherweise „Beide testen“. Ein öffentlicher Benchmark kann weder deine Repository-Konventionen und Tool-Definitionen noch deine Prüfkriterien oder die Fehlerkosten nachbilden. Bei kostspieligen Produktionsentscheidungen solltest du eine kleine Bewertung mit Aufgaben aus abgeschlossener interner Arbeit durchführen.
Eine praktische Routing-Strategie mit zwei Modellen
Teams müssen nicht jede Aufgabe an dasselbe Modell senden. Mit einem einfachen Eskalationssystem lässt sich Qwens Preisvorteil nutzen und Fable den Aufgaben vorbehalten, die am ehesten davon profitieren.
1. Routinetätigkeiten an Qwen3.8-Max-0902 weiterleiten
Geeignete Aufgaben für den Einstieg sind:
Boilerplate-Code und wiederkehrende Transformationen
Frontend-Entwürfe und Komponentenvarianten
Generierung von Unit-Tests
Dokumentation und Code-Erklärungen
Kurze Schritte mit Tool-Aufrufen
Batch-Aufgaben mit automatisierten Abnahmekriterien
2. Schwierige Fehler an Claude Fable 5.1 eskalieren
Mögliche Auslöser für eine Eskalation sind:
Zwei oder drei fehlgeschlagene Qwen-Versuche
Eine uneindeutige Ursache, die mehrere Dienste betrifft
Ein umfangreicher Implementierungsplan mit vielen Abhängigkeiten
Eine wichtige Änderung mit schwacher automatisierter Überprüfung
Eine Aufgabe, bei der die Prüfung durch Entwickler mehr kostet als der API-Aufpreis
3. Akzeptierte Arbeit bewerten, nicht überzeugend klingende Antworten
Erfasse mindestens Folgendes:
Bestandene Tests
Anzahl erneuter Versuche
Zeitaufwand für menschliche Korrekturen
Neue, zwischengespeicherte und ausgegebene Tokens
Anzahl der Tool-Aufrufe
Ende-zu-Ende-Latenz
Ob die Ausgabe Formatierungs- und Abbruchanweisungen befolgt hat
Diese Routing-Strategie ist in der Regel leichter zu begründen, als ein Modell dauerhaft zum Gewinner zu erklären. Außerdem lassen sich künftige Modellupdates leichter bewerten, da jedes Modell eine festgelegte Rolle und messbare Kriterien für eine Aufwertung hat.
So testest du beide Modelle mit einem einzigen GPT Proto-API-Schlüssel
GPT Proto stellt beide Modelle über eine OpenAI-kompatible API bereit. Das folgende Python-Beispiel sendet dieselbe Anfrage an beide Modelle und ändert dabei nur die Modell-ID:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["GPTPROTO_API_KEY"],
base_url="https://gptproto.com/v1",
)
models = [
"qwen3.8-max-0902",
"claude-fable-5-1",
]
prompt = """
Review the following function and identify the root cause of the failing test.
Return:
1. The root cause
2. A minimal patch
3. One regression test
"""
for model in models:
response = client.chat.completions.create(
model=model,
messages=[{"role": "user", "content": prompt}],
)
print(f"\n--- {model} ---")
print(response.choices[0].message.content)
Installiere das offizielle OpenAI-Python-Paket mit pip install openai, setze die Umgebungsvariable GPTPROTO_API_KEY und ersetze den Beispiel-Prompt durch eine echte Aufgabe. Halte Eingabe, Repository-Zustand, verfügbare Tools und Abnahmetests identisch.
Wähle den Gewinner nicht, indem du zwei Ausgaben liest und die überzeugender klingende auswählst. Führe den vorgeschlagenen Patch aus, starte die Tests, zähle die erneuten Versuche und halte die Gesamtzahl der Tokens sowie den Prüfaufwand fest.
Abschließendes Fazit
Qwen3.8-Max-0902 ist die bessere Standardwahl für Entwickler, denen API-Kosten, Frontend-Generierung, Batch-Programmierung und Agentenaufrufe mit hohem Volumen wichtig sind. Der offizielle Preis für neue Eingaben beträgt ein Fünftel des Preises von Fable 5.1, der Ausgabepreis weniger als ein Achtel. Außerdem unterstützt das Modell offiziell ein breiteres Spektrum an Eingabemodalitäten und weist weniger dokumentierte Einschränkungen bei der erzwungenen Tool-Auswahl auf.
Claude Fable 5.1 ist das besser belegte Eskalationsmodell für schwieriges Debugging und lang laufende Aufgaben, bei denen ein Fehlversuch mehr kostet als die Tokens. Der Aufpreis lässt sich am ehesten rechtfertigen, wenn das Modell erneute Versuche, manuelle Korrekturen oder Betriebsrisiken verringert – nicht einfach nur, weil es teurer ist.
Aktuell gibt es keinen verlässlichen Benchmark-Sieger aus einem direkten Vergleich unter gleichen Bedingungen. Für viele Produktionssysteme lautet die beste Antwort daher nicht ausschließlich Qwen oder Fable. Sie lautet: zuerst Qwen, Fable, sobald die Aufgabe einen messbaren Schwierigkeitsgrad oder eine bestimmte Fehlerschwelle überschreitet.