Zwei Frontier-Releases sind innerhalb von vier Wochen erschienen, beide klar auf denselben Käufer ausgerichtet: den Entwickler, der Agenten statt Chatbots betreibt. Moonshot AI hat Kimi K3 am 16. Juli 2026 veröffentlicht. xAI legte am 12. August mit Grok 4.6 nach. Wenn Sie heute nach "Grok 4.6 vs Kimi K3" suchen, finden Sie Launch-Berichte aus beiden Lagern sowie eine Fülle von Datenblättern – aber kaum jemand hat die beiden aus der Perspektive eines Entwicklers direkt gegenübergestellt. Genau diese Lücke schließt dieser Artikel.
Hier die Kurzfassung, denn Sie sind wegen einer Entscheidung hier, nicht wegen einer Zusammenfassung.
Grok 4.6 gewinnt bei der Effizienz agentischer Abläufe und beim vollständig verwalteten Hosting. Lange, mehrstufige Aufgaben werden mit weniger Schleifen und weniger Tokens abgeschlossen, und Sie müssen sich nie um die Infrastruktur kümmern. Kimi K3 gewinnt bei Kontext, nativer Videoverarbeitung und Kontrolle – mit einem Fenster von 1 Mio. Tokens, Bild- und Videoeingabe sowie herunterladbaren Open Weights, falls Sie das Modell selbst hosten oder vollständig isoliert betreiben müssen. Bei der einen Zahl, die alle zitieren, liegen sie fast gleichauf: Artificial Analysis setzt die Kosten pro Aufgabe für beide auf ungefähr $0.84. Der Unterschied von einem Punkt beim Intelligence Index ist also nicht ausschlaggebend. Die beiden Modelle erreichen dieselben Kosten auf völlig unterschiedlichen Wegen – und das ist die eigentliche Entscheidung, die Sie treffen müssen.
Wenn Sie kostensensible Agenten-Workflows mit hohem Volumen betreiben und einen verwalteten Endpunkt möchten: Grok 4.6. Wenn Sie ein ganzes Repository oder ein Video in ein einziges Kontextfenster laden müssen – oder aus Compliance-Gründen die Gewichte selbst verwalten wollen: Kimi K3. Der restliche Artikel zeigt, wie diese Entscheidung zustande kommt.
Spezifikationen und Preise im direkten Vergleich
Ein paar Hinweise vor der Tabelle. Die zum Launch veröffentlichten Benchmark-Werte stammen aus den Materialien der jeweiligen Anbieter; betrachten Sie sie als 🟡 vom Anbieter gemeldet, bis unabhängige Tests sie bestätigen. Die Zahlen von Artificial Analysis (Intelligence Index, Kosten pro Aufgabe) kommen einem neutralen direkten Vergleich am nächsten und sind entsprechend gekennzeichnet. Der GPT Proto-Tarif ist der Preis, den Sie tatsächlich zahlen, um beide Modelle über einen einzigen Key zu testen; die offizielle Preisliste ist der eigene Preis des Anbieters.
|
Grok 4.6 |
Kimi K3 |
| Anbieter |
xAI |
Moonshot AI |
| Veröffentlicht |
12. Aug. 2026 |
16. Juli 2026 |
| Architektur |
Grok-4.5-Familie, erweitertes ergänzendes Training + agentisches RL |
MoE mit 2,8 Bio. Parametern, 16 von 896 Experten pro Token aktiv |
| Modellzugriff |
Nur über gehostete API (keine herunterladbaren Gewichte) |
Open Weights (Gewichte am 27. Juli 2026 unter einer individuellen Kimi-K3-Lizenz veröffentlicht) |
| Kontextfenster |
500.000 Tokens |
1.048.576 Tokens |
| Eingaben |
Text, Bild |
Text, Bild, Video |
| Ausgabe |
Text (keine feste Ausgabebegrenzung) |
Text; bis zu 1.048.576 im Rahmen des Kontextbudgets, standardmäßig 131.072 |
| AA Intelligence Index 🟡 |
61 |
~57 (Artificial Analysis); Anbieterdiagramme platzieren es knapp unter Grok |
| Kosten pro Aufgabe (Artificial Analysis) |
~$0.84 |
~$0.84 |
| Offizieller Listenpreis /1 Mio. Tokens |
$2 Eingabe / $6 Ausgabe (kurzer Kontext) |
$3 Eingabe / $15 Ausgabe |
| GPT Proto-Preis /1 Mio. Tokens |
3.60 Ausgabe (40 % Rabatt) |
13.50 Ausgabe (10 % Rabatt) |
Die Preiszeilen verdienen einen zweiten Blick, denn die Aussage "Grok ist günstiger" stimmt, ist aber unvollständig. Der Listenpreis von 2/6 $ für Grok 4.6 gilt nur bis 200.000 Tokens. Wird diese Grenze überschritten – was bei einem Agenten für große Codebasen regelmäßig vorkommt –, verdoppelt sich der Preis auf 4/12 $, und zwar für die gesamte Anfrage, nicht nur für den darüberliegenden Anteil. Kimi K3 verlangt mehr pro Ausgabetoken, aber sein vollständiger Kontext von 1 Mio. Tokens ist ohne Aufpreis nutzbar. Welches Modell günstiger ist, hängt also davon ab, wie lang Ihre Prompts sind. Kurze, häufige Aufrufe sprechen für Grok; lange Dokumente oder Arbeiten auf Repository-Ebene verringern den Abstand und können das Verhältnis sogar umkehren.
Intelligenz und Wissensarbeit
Beim kombinierten Intelligence Index von Artificial Analysis – neun Benchmarks, auf eine einzige Zahl verdichtet – erreicht Grok 4.6 einen Wert von 61, während Kimi K3 einige Punkte darunter liegt. Zu diesem Abstand sind zwei Dinge anzumerken. Erstens schwankt der genaue Kimi-Wert je nach Quelle: Artificial Analysis meldet 57, einige Launch-Berichte nennen 60, und xAI schreibt in seinem eigenen Diagramm lediglich "höher als Kimi". Ich orientiere mich am Wert von Artificial Analysis, weil er aus dem einen neutralen Lauf stammt. Eine Abweichung von ein bis vier Punkten bei einem aus neun Benchmarks zusammengesetzten Wert liegt jedoch klar innerhalb der Schwankungsbreite, die allein durch die Gewichtung der Komponenten entsteht. Zweitens – und das ist wichtiger – misst ein kombinierter Score die Qualität einer Antwort. Er misst kaum, ob ein Modell ein Ziel über vierzig Tool-Aufrufe hinweg verfolgen kann, ohne den roten Faden zu verlieren. Genau dieser Fehler beendet Agentenbereitstellungen in der Praxis, und die Indexzahl keines der beiden Anbieter sagt ihn voraus.
Der echte Unterschied liegt in der Effizienz agentischer Abläufe. Im privaten AA-Briefcase-Workload von Artificial Analysis erledigt Grok 4.6 die Aufgabe in etwa 53 Durchläufen und mit ungefähr 0,5 Milliarden Eingabetokens. Zum Vergleich: Claude Opus 5 benötigt für dieselbe Aufgabe rund 103 Durchläufe und 2,0 Milliarden Tokens. Das ist der konkrete Nutzen von xAIs "Selbsttests über lange Trajektorien": Das Modell überprüft seine Arbeit, bevor es den nächsten Schritt ausführt, und benötigt dadurch weniger Schleifen. Kimi K3 ist beim Ergebnis langer Wissensarbeit konkurrenzfähig (im AA-Briefcase-Elo erreicht es die Fable-5-Klasse, ~1548), bewirbt aber nicht dieselbe Disziplin bei der Anzahl der Durchläufe. Wenn Ihre Kosten mit der Zahl der Tool-Aufrufe steigen – und das tun sie bei Produktionsagenten –, ist dies ein echter, messbarer Unterschied und keine Marketingaussage.
Kurz gesagt: Bei der Intelligenz der Antworten liegen sie ungefähr gleichauf, aber Grok 4.6 kommt mit weniger Schritten ans Ziel.
Programmieren: Es hängt davon ab, welche Art von Coding
Hier bricht ein pauschaler Sieger zusammen, daher die Details. Kimi K3 führt in mehreren Coding-Suites: SWE Marathon (42,0 gegenüber Referenzwerten der Frontier-Modelle von 35–40), Program Bench (77,8 und damit knapp vor GPT-5.6 Sol mit 77,6) und liegt bei Terminal-Bench 2.1 mit 88,3 weniger als einen Punkt hinter dem Spitzenwert (erfasst im Coding Agent Index von Artificial Analysis). Beim Web-Browsing-Benchmark BrowseComp führt es das Feld mit 91,2 an. Grok 4.6 erzielte dagegen 88,4 % bei Terminal-Bench v2.1 und ein Elo von 1753 bei GDPval-AA v2. Die stärksten Verbesserungen gegenüber Grok 4.5 zeigen sich bei CursorBench 3.2 (69,9 % gegenüber 66,7 %) und Terminal-Bench v3.0 (26 % gegenüber 15,7 %).
Wer über die Zahlen hinausblickt, erkennt ein Muster. Die Coding-Stärke von Kimi K3 ist breit angelegt und auf Repositories ausgerichtet: Es navigiert durch große Codebasen, debuggt anhand von Logs und Screenshots, und sein 1-Mio.-Fenster ermöglicht es, ein gesamtes Projekt im Kontext zu behalten. Die Coding-Stärke von Grok 4.6 ist auf Trajektorien ausgerichtet: Das Modell wurde innerhalb von Cursor und Grok Build anhand echter Entwicklersitzungen optimiert und ist daher besonders gut darin, eine Coding-Aufgabe aufrechtzuerhalten – eine vage Idee in eine lauffähige erste Version zu verwandeln und sie über viele Schritte hinweg zu verbessern. Der Nachteil – und jedes Modell hat hier einen: Das 500K-Fenster von Grok begrenzt, wie viel eines Monorepos es gleichzeitig sehen kann, und Video-Feedback kann es nicht verarbeiten. Kimis Vorsprung bei reinen Coding-Benchmarks geht mit höheren Ausgabetoken-Kosten und laut der eigenen Launch-Mitteilung von Moonshot mit einer neben den Genauigkeitsgewinnen gestiegenen Halluzinationsrate einher.
Speziell bei Frontend- und interaktiver Arbeit – einer häufigen Variante dieser Suche – führte Kimi K3 beim Launch LMArenas Frontend Code Arena, während Grok 4.6 bei Webentwicklungsaufgaben der Code Arena in der Nähe von GPT-5.6 Sol und Claude Fable landete. Beide sind stark; Kimi hat derzeit das deutlichere unabhängige Signal im Frontend-Bereich.
Kontext, Multimodalität und Bereitstellung
Hier konkurrieren die beiden Modelle nicht auf einem Spektrum – sie sind unterschiedlich konzipiert. Kimi K3 bietet ein Kontextfenster von 1.048.576 Tokens sowie native Eingaben für Text, Bilder und Videos aus einer einzigen Architektur. Genau diese Kombination spricht für das Modell: ein Coding-Agent, der Screenshots liest, um eine Benutzeroberfläche zu verbessern; ein Research-Workflow, der einen vollständigen Dokumentbestand im Kontext hält; ein QA-System, das Interface-Videos mit der Implementierung vergleicht. Grok 4.6 bietet 500K Tokens sowie Text- und Bildeingabe. Für die meisten Aufgaben ist das ausreichend. Wenn Ihre Aufgabe jedoch lautet "analysiere diese 40-minütige Bildschirmaufnahme" oder "halte diese 300 Dateien in einem Prompt", ist Grok nicht das richtige Werkzeug.
Dann ist da noch die Frage des Besitzes, und die Antwort ist eindeutig. Grok 4.6 wird ausschließlich gehostet; es gibt nichts herunterzuladen, und xAI kann den Endpunkt unter Ihnen ändern oder einstellen. Kimi K3 wird mit Open Weights unter einer individuellen Kimi-K3-Lizenz ausgeliefert – Sie können das Modell selbst hosten, feinabstimmen und quantisieren. Für Teams mit Vorgaben zur Datenresidenz, Anforderungen an einen Air Gap oder einer Richtlinie gegen Vendor Lock-in ist das entscheidend. Der ehrliche Vorbehalt: Bei nativer 4-Bit-Präzision benötigen die Gewichte vor jedem KV-Cache rund 1,4 TB Arbeitsspeicher, was einen einzelnen Knoten mit 8 GPUs übersteigt. "Open" bedeutet hier, dass das Modell für Nutzer mit ernstzunehmender Hardware rechtlich und technisch verfügbar ist, nicht, dass es "auf Ihrem Laptop läuft". Für alle anderen ist eine gehostete API ohnehin der praktische Weg zu Kimi K3.
Wann welches Modell die richtige Wahl ist
Keine Unentschlossenheit. Hier ist die Entscheidung nach Workload.
Wählen Sie Kimi K3, wenn mindestens eine dieser Aussagen auf Sie zutrifft: Sie müssen ein ganzes Repository, eine umfangreiche Dokumentensammlung oder ein Video in ein einziges Kontextfenster laden; Sie entwickeln Frontends oder interaktive Anwendungen, bei denen Kimi laut LMArena führend ist; aus Compliance- oder Lock-in-Gründen müssen Sie die Gewichte selbst verwalten; oder Sie möchten native Multimodalität, ohne ein separates Vision-Modell integrieren zu müssen. Pro Ausgabetoken zahlen Sie mehr – berücksichtigen Sie das bei der Budgetplanung für Textgenerierung mit hohem Volumen.
Wählen Sie Grok 4.6, wenn: Sie autonome Agenten mit langem Zeithorizont betreiben und Wert darauf legen, Aufgaben mit weniger Durchläufen und Tokens abzuschließen; Ihre Prompts unter 200K bleiben und Sie dadurch den klaren Listenpreis von 2/6 $ erhalten; Sie einen verwalteten Endpunkt ohne Infrastrukturaufwand möchten; oder Sie bei hoher Frequenz kostensensibel sind. Achten Sie auf die Stufe für langen Kontext: Oberhalb von 200K wird die gesamte Anfrage zum doppelten Preis abgerechnet.
Dass die Kosten pro Aufgabe gleichauf liegen, ist der entscheidende Punkt. Sie wählen nicht einfach das günstigere Modell. Sie entscheiden sich zwischen gehosteter Effizienz bei der Anzahl der Durchläufe und offener Multimodalität mit langem Kontext. Richten Sie die Wahl an Ihrem Workload aus, nicht am Unterschied von einem Punkt beim Index.
Beide Modelle mit einem Key über GPT Proto testen
Der schnellste Weg, einen Streit darüber zu klären, "welches Modell für meine Aufgabe besser ist", besteht darin, Ihre eigene Aufgabe mit beiden Modellen auszuführen. GPT Proto stellt Kimi K3 und Grok 4.6 über einen einzigen OpenAI-kompatiblen Endpunkt und ein gemeinsames Guthaben bereit, sodass Sie beide per A/B-Test vergleichen können, ohne zwei Konten zu finanzieren. Beachten Sie den Auth-Header: Die /v1/-Schnittstelle von GPT Proto erwartet den reinen Key ohne no Bearer-Präfix.
Python:
import openai
client = openai.OpenAI(
api_key="YOUR_GPTPROTO_API_KEY",
base_url="https://gptproto.com/v1",
)
prompt = "Refactor this function for readability and explain each change:\n\n<paste code>"
for model in ["kimi-k3", "grok-4.6"]:
resp = client.chat.completions.create(
model=model,
messages=[{"role": "user", "content": prompt}],
)
print(f"=== {model} ===")
print(resp.choices[0].message.content)
print("tokens:", resp.usage.total_tokens)
cURL, erster Aufruf:
curl https://gptproto.com/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: YOUR_GPTPROTO_API_KEY" \
-d '{
"model": "kimi-k3",
"messages": [
{"role": "user", "content": "Summarize the tradeoffs between MoE and dense LLMs in 3 bullets."}
]
}'
Zwei Besonderheiten von Kimi K3, die bei einem einfachen Austausch des Modellnamens übersehen werden. Das Modell denkt immer nach – setzen Sie reasoning_effort auf low, high oder max (Standardwert: max) auf der obersten Ebene, nicht in der älteren thinking-Konfiguration. Und geben Sie in Multi-Turn- oder Tool-Schleifen die vollständige vorherige Assistant-Nachricht einschließlich reasoning_content zurück, sonst geht die Kontinuität des Denkprozesses in langen Sitzungen verloren. Lesen Sie Ihre endgültige Antwort aus content, niemals aus reasoning_content.
Vollständige Modelldetails und aktuelle Preise: Kimi K3 auf GPT Proto und Grok 4.6 auf GPT Proto.