Preise+7% Bonus
Schuyler Stacy2026-07-28

Qwen 3.8 Max vs. Kimi K3: Welches ist bereit für echte Coding-Arbeit?

Vergleichen Sie Qwen 3.8 Max und Kimi K3 bei Coding, API-Preisen, Kontext, multimodalen Fähigkeiten und offenen Gewichten – und sehen Sie, welches Modell bereit für den Einsatz ist.

Qwen 3.8 Max vs. Kimi K3: Welches ist bereit für echte Coding-Arbeit?

Update — 28. Juli 2026: Moonshot AI hat jetzt die vollständigen Kimi-K3-Gewichte, das Model Card, die benutzerdefinierte Lizenz und den technischen Bericht veröffentlicht. Das Release beendet die Verfügbarkeitsfrage auf Kimis Seite. Es macht ein 2,8-Billionen-Parameter-Modell nicht ohne Weiteres selbst hostbar: Das offizielle Repository umfasst etwa 1,56 TB, und Moonshot empfiehlt Supernode-Bereitstellungen mit 64 oder mehr Beschleunigern.

 

Qwen 3.8 Max vs. Kimi K3 wirkt wie ein klarer Wettstreit zwischen zwei gigantischen chinesischen KI-Modellen: Alibabas 2,4-Billionen-Parameter-Preview gegen Moonshot AIs 2,8-Billionen-Parameter-Flaggschiff. Die Zahlen laden zu einer einfachen Schlussfolgerung ein. Das größere Modell sollte gewinnen.

Das ist nicht das, was die verfügbaren Belege zeigen, und es ist nicht der nützlichste Vergleich für Entwickler.

Stand 23. Juli 2026 ist Qwen 3.8 Max weiterhin eine sich verändernde Preview, die über Alibabas Token-Plan vertrieben wird. Kimi K3 hat bereits eine dokumentierte API, veröffentlichte Token-Preise, ein Kontextfenster von 1M Token und einen datierten Plan für die Veröffentlichung der vollständigen Gewichte. Die Lücke bei den Fähigkeiten mag schmal sein. Die Lücke bei der Produktreife ist es nicht.

Mein Urteil ist eindeutig: Kimi K3 ist die sicherere Wahl, wenn Sie heute eine echte Anwendung entwickeln und budgetieren müssen. Qwen 3.8 Max Preview ist einen Test in einem Coding-Workflow wert, besonders solange Alibabas Werbe-Credits Experimente günstig machen, aber es hat noch nicht genügend stabile Informationen geliefert, um eine Produktionsentscheidung zu gewinnen.

TL;DR: Kimi K3 ist heute die sicherere Wahl für die Produktion

Wählen Sie Kimi K3, wenn Sie eine konventionelle API, planbare Kosten pro Token, natives Bild- und Videoverständnis oder ein Modell benötigen, das Sie jetzt in ein kundenorientiertes Produkt integrieren können. Wählen Sie Qwen 3.8 Max Preview, wenn Sie bereits Alibabas Coding-Ökosystem nutzen und ein vielversprechendes neues Modell zu geringen Werbekosten testen möchten.

Der einzige detaillierte, vergleichbare Coding-Test, der zum Zeitpunkt der Veröffentlichung verfügbar war, ergab für Kimi K3 eine Punktzahl von 83 und für Qwen 3.8 Max eine Punktzahl von 80. Dieser Unterschied von drei Punkten ist ein nützliches Indiz, aber keine universelle Rangordnung. Qwen zeigte im Test sauberere Systemgrenzen und eine fehlerfreie Tool-Ausführung; Kimi behandelte Revisionshistorie und Regenerierung vollständiger. Beide machten zudem unbelegte Schlussfolgerungen, die eine sachliche Korrektur erforderten.

Um es deutlich zu sagen: Kimi gewinnt derzeit die Bereitstellungsentscheidung. Qwen hat den Fähigkeitswettbewerb nicht verloren; es ist nur zu früh, um zu erklären, dass es ihn gewonnen hat.

Inhaltsverzeichnis

Qwen 3.8 Max vs. Kimi K3 auf einen Blick

Kategorie Qwen 3.8 Max Kimi K3
Produktstatus Stabile Produktions-API Stabile Produktions-API
Gesamtparameter 2.4T 2.8T
Aktive Parameter 95B 104B
Kontextfenster Bis zu 1M Token 1.048.576 Token
Eingaben Text, Bilder und Videos Text, Bilder und Videos
Offizieller API-Preis $2/M Input, $6/M Output $3/M Input, $15/M Output
GPT Proto-Zugriff Jetzt verfügbar Jetzt verfügbar
Offene Gewichte Angekündigt; noch nicht herunterladbar Veröffentlicht
Am besten für gehostete APIs geeignet Kostensensitives multimodales Coding und lange Agenten Revisionslastige Agenten und Kimi-spezifische Workflows
Am besten für Self-Hosting geeignet Auf Checkpoint und Lizenz warten Kimi K3 mit Hardware im Rechenzentrumsmaßstab

Der Vergleich ist jetzt ausgeglichener – aber die Bereitstellung unterscheidet sich weiterhin

Qwen3.8-Max und Kimi K3 sind jetzt beide tragfähige Produktions-API-Modelle. Der Hauptunterschied ist nicht mehr „Preview gegenüber Produktion“, sondern gehosteter API-Wert gegenüber sofortigem Besitz offener Gewichte.

Qwen 3.8 Max ist jetzt eine stabile Produktions-API

Alibaba hat das stabile Modell qwen3.8-max am 3. August 2026 veröffentlicht und damit die frühere Preview-Positionierung durch normalen Pay-as-you-go-API-Zugriff ersetzt.

Das Produktions-Release dokumentiert eine Sparse-Mixture-of-Experts-Architektur mit 2,4 Billionen Parametern und etwa 95 Milliarden aktiven Parametern pro Anfrage. Es unterstützt ein Kontextfenster von bis zu 1 Million Token, bis zu 128K Ausgabe-Token sowie Text-, Bild- und Videoeingaben.

Das verändert den praktischen Vergleich. Qwen3.8-Max kann jetzt für kundenorientierte Anwendungen, Coding-Agenten, multimodale Analysen und andere Produktions-Workloads evaluiert werden – ohne auf den früheren, auf Credits basierenden Personal-Token-Plan angewiesen zu sein.

Sein offizieller Preis ist zudem niedriger als der von Kimi K3:

Modell Eingabepreis Ausgabepreis
Qwen3.8-Max $2 pro 1M Token $6 pro 1M Token
Kimi K3 $3 pro 1M Token $15 pro 1M Token

Für Teams, die eine gehostete API nutzen, ist Qwen3.8-Max auf GPT Proto jetzt eine ernsthafte Produktionsoption statt eines experimentellen Endpunkts.

Alibabas angekündigter Open-Weight-Checkpoint wurde jedoch noch nicht veröffentlicht. Entwickler sollten nicht davon ausgehen, dass die endgültigen Gewichte, die Lizenz oder die Self-Hosting-Bedingungen verfügbar sind, bis sie offiziell publiziert wurden.

Kimi K3 hat herunterladbare Gewichte veröffentlicht

Kimi K3 ist sowohl über eine gehostete API als auch als herunterladbarer Checkpoint verfügbar. Moonshot AI hat die Modellgewichte, das Model Card, den technischen Bericht, Bereitstellungsleitfäden und die benutzerdefinierte Lizenz veröffentlicht.

Kimi K3 hat insgesamt 2,8 Billionen Parameter und aktiviert etwa 104 Milliarden Parameter pro Token. Die Bereitstellungsdokumentation umfasst Frameworks wie vLLM, SGLang und TokenSpeed und gibt Teams einen klareren Weg zu kontrollierter oder privater Infrastruktur.

Damit ist Kimi K3 die praktischere Wahl, wenn herunterladbare Gewichte, Deployment-Eigentum oder sofortiges Self-Hosting eine feste Anforderung sind.

Offene Gewichte machen Kimi K3 nicht einfach oder kostengünstig lokal lauffähig. Es bleibt ein Multi-Billionen-Parameter-Modell, das Speicher, Arbeitsspeicher, Netzwerk und Beschleunigerkapazität im Rechenzentrumsmaßstab erfordert. Die benutzerdefinierte Lizenz kann zudem Bedingungen für sehr große kommerzielle Produkte oder Model-as-a-Service-Bereitstellungen enthalten.

Was der Bereitstellungsunterschied bedeutet

Bereitstellungsbedarf Besserer Ausgangspunkt Warum
Gehostete Produktions-API Qwen 3.8 Max Stabile API mit deutlich niedrigeren offiziellen Preisen für Ausgabe-Token
Multimodales Coding und visuelle Analyse Qwen 3.8 Max Native Text-, Bild- und Videoeingabe
Heute herunterladbare Gewichte Kimi K3 Ihr Checkpoint und ihre Lizenz sind bereits öffentlich
Private oder kontrollierte Bereitstellung Kimi K3 Teams können das veröffentlichte Modell auf eigener Infrastruktur bereitstellen
Einfache lokale Installation Keines von beiden Beide Modelle erfordern ernsthafte Infrastruktur für Self-Hosting
Direkter API-Vergleich Beide testen Akzeptierte Aufgaben, Wiederholungen, Tool-Fehler, Latenz und Gesamtkosten vergleichen

Der Vergleich ist also nicht mehr ungleich, weil Qwen „nur eine Preview“ ist. Beide Modelle können Produktions-API-Workloads bedienen. Der verbleibende Unterschied ist einfacher: Qwen3.8-Max bietet derzeit das stärkere gehostete Kosten-Leistungs-Verhältnis, während Kimi K3 sofortigen Zugriff auf veröffentlichte Gewichte und mehr Kontrolle über die Bereitstellung bietet.

Wie Entwickler Qwen 3.8 Max gegen Kimi K3 testen sollten

Test Beiden Modellen geben Messen
Architektur-Review des Repository Denselben eingefrorenen Commit, dieselbe Architekturfrage, dieselben Read-only-Tools und dasselbe Zeitlimit Korrekte Dateizitate, übersehene Abhängigkeiten, unbelegte Behauptungen und Review-Zeit
Multi-Datei-Implementierung Dasselbe Issue, dieselben Tests, beschreibbare Dateien und Tool-Berechtigungen Bestandene Tests, geänderte Dateien, Wiederholungen, Regressionen und menschliche Korrekturen
Visuelle Frontend-Reparatur Denselben Screenshot, dieselben Quelldateien, Browser-Tools und das gewünschte Zielverhalten Visuelle Übereinstimmung, gültiger Code, Reparaturschleifen und endgültiges Testergebnis

Halten Sie Agent-Shell und Berechtigungen identisch. Setzen Sie ein festes Zeitlimit. Notieren Sie die vollständige Modell-ID und das Datum, besonders bei Qwens sich verändernder Preview. Erfassen Sie dann Aufgabenabschluss, Echtzeit, Eingabe- und Ausgabe-Token, Cache-Treffer, fehlgeschlagene Tool-Aufrufe, Wiederholungen, menschliche Eingriffe und bestandene Endtests.

Bewerten Sie eine Antwort nicht, weil sie „gründlich aussieht“. Prüfen Sie, ob der Patch funktioniert und ob die Behauptungen des Modells einer Überprüfung standhalten.

Für wichtige Architekturentscheidungen gibt es ein weiteres nützliches Muster: Lassen Sie beide Modelle unabhängig laufen, verbergen Sie ihre Identitäten bei der Überprüfung und vergleichen Sie ihre abweichenden Ergebnisse. Der Test mit 269 Dateien lieferte sein stärkstes Design erst durch die Kombination von Qwens Systemgrenzen mit Kimis Lebenszyklusmodell. Manchmal ist die richtige Antwort auf Qwen versus Kimi: beide – gefolgt von Verifikation.

Qwen 3.8 Max vs. Kimi K3: Preise

Modell Offizieller Eingabepreis Offizieller Ausgabepreis
Qwen3.8-Max $2 pro 1M Token $6 pro 1M Token
Kimi K3 $3 pro 1M Token $15 pro 1M Token
Kimi K3 auf GPT Proto $2,70 pro 1M Token $13,50 pro 1M Token

Zum offiziellen Listenpreis kosten Qwens Ausgabe-Token 60 % weniger als die von Kimi K3. Dieser Unterschied ist wichtig für Reasoning-lastige Coding-Agenten, die lange Pläne, Tool-Traces, Erklärungen und Patches erzeugen.

Der Token-Preis ist nicht die gesamte Kostenbasis. Messen Sie Wiederholungen, fehlgeschlagene Tool-Aufrufe, menschliche Korrekturen, Latenz und akzeptierte Aufgabenabschlüsse. Kimi kann in einem bestimmten Workflow trotzdem günstiger sein, wenn das stärkere Revisions- und Lebenszyklus-Handling teure Reparaturschleifen verhindert.

Prüfen Sie die Live-Qwen3.8-Max-API-Seite für den aktuellen GPT Proto-Preis, bevor Sie ein Produktionsbudget berechnen.

Welches Modell sollten Sie wählen?

Situation Bessere Wahl Warum
Gehostete Produktions-API Qwen 3.8 Max Stabiler Zugang und deutlich niedrigerer offizieller Ausgabepreis
Komplexes multimodales Coding Qwen 3.8 Max Text-, Bild- und Videoeingabe mit starker Frontend- und Visual-Agent-Positionierung
Architekturgrenzen und Tool-Disziplin Zuerst Qwen testen Die Preview hat im Vergleichstest 44 von 44 Tool-Aufrufen abgeschlossen
Revisions- und Regenerierungshistorie Zuerst Kimi testen Kimi hat im Vergleichstest den Lebenszyklus-Zustand vollständiger behandelt
Heute herunterladbare Gewichte Kimi K3 Vollständiger Checkpoint und Lizenz sind bereits öffentlich
Geringste Self-Hosting-Komplexität Keines von beiden Beide sind Multi-Billionen-Parameter-Modelle, die ernsthafte Infrastruktur erfordern
Ein Konto für direkte Vergleichstests Beide über GPT Proto Dieselbe Aufgabe, Tools, Reasoning-Einstellungen und Bewertungskriterien verwenden

Multimodale Eingaben, Reasoning und Agentenverhalten

Fähigkeit Qwen 3.8 Max Preview Kimi K3
Bildverständnis Dokumentiert Dokumentiert
Videoverständnis Nicht eindeutig als aktueller Model-Input dokumentiert Dokumentiert
Denkmodus Immer aktiv Immer aktiv
Reasoning-Stufen low, high, xhigh low, high, max
Standard-Reasoning-Stufe xhigh max
Kontextfenster Auf der aktuellen Produktseite nicht eindeutig angegeben 1.048.576 Token
Strukturierte Ausgabe Preview-Fähigkeiten erfordern weitere Verifizierung JSON-Modus und striktes JSON-Schema dokumentiert
Lange Tool-Verläufe Das Verhalten kann sich mit der Preview ändern Vollständige Assistant-Nachrichten, einschließlich Reasoning-Inhalten, sollten erhalten bleiben

Qwens dokumentierte Bildunterstützung macht es für Debugging anhand von Screenshots relevant. Kimi geht weiter und akzeptiert Video, was nützlich ist, wenn die Eingabe eine Bildschirmaufnahme, Animationsreferenz oder Produktdemo ist, die sich nur schwer Bild für Bild beschreiben lässt.

Kimis umfangreichere dokumentierte Oberfläche erhöht auch den Integrationsaufwand. Das Verhalten „Preserved Thinking“ bedeutet, dass eine Multi-Turn-Anwendung die vollständige Assistant-Nachricht zurückgeben sollte, einschließlich Reasoning-Inhalten und Tool-Aufrufen, statt nur die sichtbare Antwort zu behalten. Dieser Verlauf belegt Kontext und wird abgerechnet. Das 1M-Token-Fenster ist groß, aber es ist kein kostenloser Speicher.

Beide Modelle verwenden standardmäßig ihre höchste Reasoning-Stufe. Für Evaluierungen sollten diese Einstellungen konsistent bleiben. Für die Produktion sollten Sie bei einfacheren Aufgaben geringeren Aufwand testen. Ein Modell, das 99 % der Anfragen mit geringerem Aufwand löst, kann günstiger und schneller sein als eines, das bei jeder Autovervollständigung, Klassifikation oder kurzen Transformation auf maximalem Reasoning läuft.

Welches Modell sollten Sie wählen?

Ihre Situation Bessere aktuelle Wahl Warum
Eine kundenorientierte Anwendung jetzt entwickeln Kimi K3 Konventionelle API und planbarer Token-Preis
Eine lange Repository-Aufgabe mit Bild- oder Videoeingabe ausführen Kimi K3 1M-Kontext und dokumentierte Bild-/Video-Unterstützung
Testen in Qwen Code, Qoder oder einem anderen unterstützten Alibaba-Tool Qwen 3.8 Max Preview Niedriger Verbrauch von Werbe-Credits
Stabile, wiederholbare Benchmarks benötigen Kimi K3, vorerst Qwens Preview kann sich zwischen Läufen ändern
Die sauberste Architektur und Replay-Metadaten benötigen Qwen testen Es zeigte im Vergleichs-Architektur-Review einen echten Vorteil
Starkes Revisions- und Regenerierungs-Handling benötigen Kimi testen Es war im verfügbaren Vergleichstest vollständiger
Heute herunterladbare Gewichte benötigen Kimi K3 Der vollständige Checkpoint ist öffentlich; Qwen 3.8 Max hat noch keine veröffentlichten Gewichte
Mehrere Modellfamilien mit einem Konto vergleichen Kimi K3 auf GPT Proto Ein Schlüssel und ein Guthaben ermöglichen Zugriff auf den breiteren Modellkatalog

Für eine Anwendung, die diese Woche live geht, würde ich Kimi K3 wählen. Es gibt genügend veröffentlichte Informationen, um Kosten zu schätzen, Integrationsverhalten zu definieren und einen Test gegen einen stabilen Modellnamen zu wiederholen.

Für ein internes Coding-Experiment würde ich Qwen nicht ignorieren. Die Preview hat eine lange Repository-Analyse ohne einen einzigen fehlgeschlagenen Tool-Aufruf bewältigt und im Vergleichstest bessere Architekturgrenzen als Kimi gezeigt. Das ist ein ernstzunehmendes Fähigkeitssignal. Es ist noch kein Produktionsvertrag.

So testen Sie Kimi K3 über GPT Proto

Qwen 3.8 Max ist bei GPT Proto noch nicht verfügbar, daher verwendet das aktuelle Integrationsbeispiel nur Kimi K3. Sie können es über den OpenAI-kompatiblen Chat-Completions-Endpunkt von GPT Proto mit dem Modellstring kimi-k3 aufrufen:

curl https://gptproto.com/v1/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: $GPTPROTO_API_KEY" \
  -d '{
    "model": "kimi-k3",
    "messages": [
      {
        "role": "user",
        "content": "Überprüfen Sie diesen Migrationsplan. Identifizieren Sie unbelegte Annahmen, fehlende Rollback-Schritte und die vor der Produktion erforderlichen Tests."
      }
    ]
  }'

Der Endpunkt und die Autorisierungsstruktur folgen der GPT Proto-API-Schnellstartanleitung. Für Multi-Turn-Kimi-Workflows sollten Sie die vollständige, von der API zurückgegebene Assistant-Nachricht aufbewahren, einschließlich Reasoning- und Tool-Call-Feldern, statt nur den endgültigen sichtbaren Text zu speichern.

Sie können die Kimi-K3-API ausprobieren, über 200+ KI-Modelle durchsuchen oder die GPT Proto Unified AI API nutzen, um Kimi mit anderen Text-, Bild-, Video- und Audiomodellen zu vergleichen. Wenn Qwen 3.8 Max hinzugefügt wird, ist der nützliche Test dieselbe Aufgabe, derselbe Prompt, dieselben Tool-Berechtigungen und dieselbe Bewertungsmethode auf beiden Modell-Endpunkten.

Abschließendes Urteil

Kimi K3 gewinnt nicht länger nur, weil Qwen eine Preview ist. Qwen3.8-Max hat jetzt eine stabile API, normale Token-Abrechnung, dokumentierte Spezifikationen und ist direkt über GPT Proto verfügbar.

Für die meisten Teams, die ein gehostetes Modell wählen, ist Qwen3.8-Max der stärkere Ausgangspunkt, denn der offizielle Preis von 2 $/6 $ liegt weit unter dem von Kimi K3 mit 3 $/15 $, besonders bei ausgabeintensiven Agentenaufgaben.

Kimi K3 bleibt die bessere Wahl, wenn herunterladbare Gewichte und Deployment-Eigentum nicht verhandelbar sind. Das stärkere Revisions- und Regenerierungs-Handling im verfügbaren Vergleichstest macht es außerdem eine Evaluierung für zustandsintensive kreative und technische Workflows wert.

Die klare Antwort lautet jetzt: Qwen für gehostete Kosten und breite multimodale Fähigkeiten; Kimi für veröffentlichte Gewichte und lebenszyklusintensive Aufgaben.

Ein Schlüssel, mehr KI-Modelle

Entdecken Sie kostengünstigen Zugang zu führenden KI-Modellen über eine OpenAI-kompatible API.

API-Modelle durchsuchen
Ein Schlüssel, mehr KI-Modelle
Verwandte Modelle
Alle Modelle
MoonshotAI
10% OFF
Qwen
by Qwen
10% OFF
Google
40% OFF
OpenAI
20% OFF

Häufig gestellte Fragen

Ist Qwen 3.8 Max beim Coding besser als Kimi K3?

Es gibt nicht genügend Belege dafür, dass Qwen 3.8 Max generell besser ist. Im verfügbaren Architektur-Test mit 269 Dateien erzielte Kimi K3 83 Punkte gegenüber 80 für Qwen. Qwen lieferte sauberere Systemgrenzen und schloss 44 von 44 Tool-Aufrufen erfolgreich ab, während Kimi Revisionen und Regenerierung vollständiger behandelte. Testen Sie beide an Ihren eigenen Implementierungs- und Reparaturaufgaben, bevor Sie sich entscheiden.

Ist Qwen 3.8 Max oder Kimi K3 günstiger?

Qwen ist derzeit für Werbe-Experimente über Alibabas Token-Plan günstiger, aber die Credits lassen sich nicht in einen veröffentlichten Preis pro Million Token umrechnen. Kimi lässt sich einfacher für die Produktion budgetieren. GPTProto führt Kimi K3 derzeit mit 2,70 $ pro 1M Eingabe-Token und 13,50 $ pro 1M Ausgabe-Token.

Sind Qwen 3.8 Max und Kimi K3 Open Source?

Kimi K3 ist jetzt unter der benutzerdefinierten Kimi-K3-Lizenz als Open-Weight-Modell verfügbar. Diese Lizenz erlaubt breite Nutzung und Modifikation, enthält aber Bedingungen für große Model-as-a-Service-Unternehmen und sehr große kommerzielle Produkte und sollte daher nicht als MIT bezeichnet werden. Qwen 3.8 Max hat offene Gewichte angekündigt, aber seinen Checkpoint und seine Lizenz noch nicht veröffentlicht.

Kann Qwen 3.8 Max in einer Produktions-API verwendet werden?

Die aktuelle Qwen-3.8-Max-Preview ist über Alibabas Token-Plan verfügbar, aber die Bedingungen des Personal-Plans verbieten die Verwendung des Schlüssels für Automatisierungsskripte, benutzerdefinierte Anwendungs-Backends oder nicht-interaktive Batch-Aufrufe. Warten Sie auf einen dokumentierten Produktionsweg und normale kommerzielle Preise, bevor Sie ein kundenorientiertes Backend darauf aufbauen.

Welches Modell ist besser für lange Coding-Aufgaben geeignet?

Kimi K3 ist derzeit die sicherere Wahl, denn es bietet ein dokumentiertes 1M-Token-Kontextfenster, eine konventionelle API und ein besseres Abschneiden im verfügbaren Vergleichstest. Qwen bleibt einen Test wert: Es hat dieselbe 60-minütige Repository-Aufgabe ohne fehlgeschlagene Tool-Aufrufe abgeschlossen. Langkontext-Kapazität allein garantiert keinen Aufgabenabschluss. Messen Sie daher bestandene Tests, Wiederholungen und menschliche Korrekturen.

Kann Kimi K3 Bilder und Videos verstehen?

Ja. Moonshot dokumentiert für Kimi K3 natives Text-, Bild- und Videoverständnis. Das Modell gibt Text zurück und eignet sich daher für Debugging anhand von Screenshots, Videoanalyse, UI-Review und andere multimodale Coding- oder Wissensarbeitsaufgaben.

Können Qwen 3.8 Max oder Kimi K3 lokal ausgeführt werden?

Die Kimi-K3-Gewichte können heruntergeladen werden, aber praktisches Self-Hosting erfordert Infrastruktur auf Rechenzentrumsebene: Das offizielle Repository umfasst etwa 1,56 TB, und Moonshot empfiehlt 64 oder mehr Beschleuniger. Qwen 3.8 Max kann erst selbst gehostet werden, wenn Alibaba seine Gewichte veröffentlicht.

Verwandte Artikel

Weitere Blogbeiträge
Was ist Kimi K3 – und ist es GPT-5.6 und Fable 5 wirklich so nah?

Was ist Kimi K3 – und ist es GPT-5.6 und Fable 5 wirklich so nah?

TL;DR Kimi K3 ist ein multimodales Modell von Moonshot AI mit 2,8 Billionen Parametern für langfristige Programmieraufgaben, Wissensarbeit, logisches Denken und agentische Workflows. Unabhängige Tests sehen das Modell insgesamt nahe bei Claude Opus 4.8 und GPT-5.5, während GPT-5.6 Sol und Claude Fable 5 weiterhin vorne liegen. K3 kommt bei agentischen Benchmarks näher heran und führt einige Automatisierungstests an, doch die gemessene Halluzinationsrate stieg gegenüber K2.6. Kimi K3 ist jetzt mit offenen Gewichten verfügbar. Moonshot AI hat den vollständigen Checkpoint, die Model Card, den technischen Bericht und die benutzerdefinierte Kimi-K3-Lizenz veröffentlicht. Das offizielle Hugging-Face-Repository umfasst über 96 Safetensors-Segmente etwa 1,56 TB, und Moonshot empfiehlt Supernode-Bereitstellungen mit mindestens 64 Beschleunigern. Die offenen Gewichte klären die Frage der Verfügbarkeit. Sie machen K3 jedoch nicht zu einem gewöhnlichen lokalen Modell. Für die meisten Entwickler bleibt die gehostete API der praktische Einstieg. Die Kimi-K3-API auf GPTProto ist derzeit mit 2,70 US-Dollar pro Million Eingabetokens und 13,50 US-Dollar pro Million Ausgabetokens gelistet. Wähle die Gewichte, wenn Datenkontrolle, benutzerdefinierte Inferenz oder Modellanpassungen den Infrastrukturaufwand und die Lizenzprüfung rechtfertigen. Kurz gesagt: Kimi K3 ist GPT-5.6 und Fable 5 nahe genug, um in derselben Diskussion genannt zu werden—und die Veröffentlichung der offenen Gewichte bietet Entwicklern nun eine Bereitstellungsoption, die keines der beiden geschlossenen Modelle bietet.

Michael Johnson | 2026-07-28

GLM-5.2 vs. Kimi K3 für Coding: Welches Modell ist 2026 besser für Entwickler?

GLM-5.2 vs. Kimi K3 für Coding: Welches Modell ist 2026 besser für Entwickler?

Kurzfassung: Kimi K3 ist das leistungsfähigere Coding-Modell, wenn die Aufgabe schwierig, langwierig oder visuell ist. Im von Moonshot veröffentlichten Coding-Vergleich liegt es durchgehend vor GLM-5.2 und akzeptiert über seinen gehosteten Dienst Bilder und Videos. GLM-5.2 bleibt die bessere Standardwahl für alltägliche Repository-Arbeiten: Es kostet deutlich weniger, ist kleiner zu betreiben und nutzt die permissive MIT-Lizenz. Kimi K3 verfügt inzwischen ebenfalls über veröffentlichte Gewichte, doch sein 1,56-TB-Repository, die empfohlene Bereitstellung mit mindestens 64 Beschleunigern und die eigene Lizenz machen Self-Hosting zu einem wesentlich größeren Vorhaben. Wähle Kimi, wenn die Leistungsfähigkeit der Engpass ist; wähle GLM, wenn Kosten und operative Einfachheit täglich wichtig sind. Der interessante Aspekt des GLM-5.2-vs.-Kimi-K3-Codevergleichs ist nicht, dass beide Modelle eine React-Komponente schreiben oder einen kurzen Algorithmus lösen können. Modelle auf diesem Niveau erfüllen diese Anforderungen bereits. Die entscheidende Frage ist, was passiert, wenn die Aufgabe unübersichtlich wird: bei einem Repository-Audit, einer Migration über mehrere Dateien, einem Bug, der nur in einem Screenshot auftritt, oder einem spielbaren Three.js-Prototyp, bei dem mehrere Systeme konsistent zusammenarbeiten müssen. Genau hier beginnt auch der Preisunterschied relevant zu werden. Kimi K3 schneidet bei den schwierigsten öffentlichen Tests besser ab, doch sein offizieller Ausgabepreis liegt mehr als dreimal so hoch wie der von GLM-5.2. Ein Team, das Tausende gewöhnlicher Reviews durchführt, kann mit GLM möglicherweise mehr Arbeit pro Dollar erledigen. Ein Entwickler, der ein schwieriges visuelles Projekt retten muss, zahlt für K3 dagegen möglicherweise gerne.

Tiffany Layne | 2026-07-28

Kimi K3 vs GPT-5.6 Sol: Günstigere Tokens oder günstigere Aufgaben?

Kimi K3 vs GPT-5.6 Sol: Günstigere Tokens oder günstigere Aufgaben?

TL;DR Update — 28. Juli 2026 : Die vollständigen Gewichte von Kimi K3 sind nun öffentlich. Moonshot AI hat den 2,8-T-Checkpoint, den technischen Bericht und die Kimi-K3-Lizenz in seinen offiziellen Repositories veröffentlicht. Die Veröffentlichung stärkt die Argumente für K3 hinsichtlich Kontrolle und Bereitstellung gegenüber GPT-5.6 Sol, ändert jedoch nichts an den unabhängigen Benchmark-Ergebnissen und macht den eigenständigen Betrieb von K3 nicht kostengünstig. Kimi K3 ist pro Token günstiger. GPT-5.6 Sol ist die stärkere Standardwahl für Produktionsagenten mit hohen Anforderungen. Beide Aussagen können zutreffen. Der Abstand ist kleiner, als die Preiskarten vermuten lassen. In Tests von Artificial Analysis erreicht GPT-5.6 Sol max 59 Punkte im Intelligence Index gegenüber 57 für Kimi K3. Die gemessenen Kosten pro Aufgabe liegen jedoch bei etwa 1,04 $ für Sol und 0,95 $ für K3—also nicht bei der durch die offiziellen Output-Preise nahegelegten Verdopplung. Meine kurze Antwort: Wähle GPT-5.6 Sol wenn umfassende Zuverlässigkeit, die Leistung von Coding-Agenten und OpenAIs gehosteter Tool-Stack am wichtigsten sind. Wähle Kimi K3 , wenn Videoeingaben, Arbeiten mit langem Kontext, niedrigere Listenpreise oder der Zugriff auf veröffentlichte offene Gewichte die Entscheidung beeinflussen.

Schuyler Stacy | 2026-07-28

Was ist Qwen 3.8 Max? Veröffentlichung, technische Daten, Preise und offene Gewichte

Was ist Qwen 3.8 Max? Veröffentlichung, technische Daten, Preise und offene Gewichte

Aktualisiert am 7. August 2026: Alibaba hat die Produktionsversion von Qwen3.8-Max am 3. August offiziell veröffentlicht und damit das frühere qwen3.8-max-preview als aktuelles Flaggschiff-API-Modell ersetzt. Dieser Artikel wurde mit der bestätigten Architektur, dem Kontextfenster, den Preisen, der API-Verfügbarkeit und dem Zeitplan für offene Gewichte aktualisiert. Qwen3.8-Max ist das bisher leistungsfähigste Qwen-Modell von Alibaba: ein multimodales Sparse-Mixture-of-Experts-Modell mit insgesamt 2,4 Billionen Parametern und 95 Milliarden aktiven Parametern pro Anfrage. Das stabile Modell unterstützt Text-, Bild- und Videoeingaben, erzeugt Textausgaben und bietet ein Kontextfenster von bis zu 1 Million Token sowie bis zu 128K Ausgabetoken. Es wurde für komplexe Programmierung, visuelle Analysen, Forschung, professionelle Aufgaben und lang andauernde Agentenaufgaben entwickelt. Die Veröffentlichung verändert auch die praktische Antwort für Entwickler. Qwen3.8-Max ist nicht länger auf eine sich ständig ändernde Vorschauversion oder einen persönlichen Tarif beschränkt, der nur mit Credits funktioniert. Jetzt gibt es eine reguläre Pay-as-you-go-API, die Alibaba mit 2 $ pro Million Eingabetoken und 6 $ pro Million Ausgabetoken angibt. Außerdem ist es über die Qwen 3.8 Max API auf GPTProto verfügbar. Meine kurze Einschätzung: Qwen 3.8 Max ist eine echte und ungewöhnlich interessante Vorschau, kein abgeschlossenes Produktrelease. Entwickler sollten es testen, das Datum jedes Ergebnisses festhalten und Produktionsmigrationen vermeiden, die auf Spezifikationen basieren, die Alibaba noch nicht veröffentlicht hat.

Tiffany Layne | 2026-07-23