Grok 4.6 ist ein Reasoning-Modell für Textausgabe, das von SpaceXAI, früher bekannt als xAI, am 12. August 2026 veröffentlicht wurde. Es baut auf Grok 4.5 auf und wurde zusätzlich für langlaufende Agenten, Softwareentwicklung, technische Recherche, interaktive App-Entwicklung, computergestütztes Design und breitere Wissensarbeit trainiert.
Das Modell akzeptiert Text- und Bildeingaben. Entwickler können Quellcode, Dokumentation, Screenshots, Diagramme, Schaubilder und schriftliche Anweisungen in einer Anfrage kombinieren. Die Bildunterstützung dient dem visuellen Verständnis; Grok 4.6 ersetzt nicht direkt die separaten Grok-Imagine-Modelle, die für die Bild- oder Videogenerierung verwendet werden.
Sein Kontextfenster von 500.000 Token eignet sich für große Repositories, ausgedehnte Konversationen, Multidokument-Recherche und Agenten, die eine umfangreiche Aufgabengeschichte behalten müssen. SpaceXAI veröffentlicht kein separates maximales Textausgabelimit; Anfragen unterliegen jedoch weiterhin dem Gesamtkontext des Modells und den API-Betriebsgrenzen.
Grok 4.6 unterstützt außerdem Funktionsaufrufe (Function Calling) und strukturierte Ausgaben. Entwickler können es mit Datenbanken, internen APIs, Suchsystemen, Codeausführungsumgebungen und anderen Anwendungstools verbinden und dann JSON anfordern, das einem definierten Schema folgt.
| Spezifikation |
Grok 4.6 |
| Anbieter |
SpaceXAI / xAI |
| Veröffentlichungsdatum |
12. August 2026 |
| Modellname des Anbieters |
grok-4.6 |
| Eingabemodalitäten |
Text und Bild |
| Ausgabemodalität |
Text |
| Kontextfenster |
500.000 Token |
| Veröffentlichtes Textausgabelimit |
Kein separates Limit veröffentlicht |
| Wissensstand |
1. Februar 2026 |
| Reasoning-Aufwand |
low, medium, high standardmäßig oder xhigh |
| Reasoning-Verhalten |
Immer aktiviert |
| API-Formate |
Responses API und Chat Completions |
| Kernfunktionen |
Funktionsaufrufe, strukturierte Ausgaben und Reasoning |
| Am besten geeignet für |
Coding-Agenten, visuelle Anwendungsarbeit, Recherche und mehrstufige Wissensaufgaben |
In den veröffentlichten Auswertungen von SpaceXAI erzielte Grok 4.6 High 61 Punkte im Artificial Analysis Intelligence Index, gegenüber 56 für Grok 4.5 High. Außerdem verbesserte es sich von 54% auf 65.9% bei DeepSWE v1.1 und von 47.1% auf 57.5% bei APEX-Agents. Diese Ergebnisse deuten auf ein deutliches Upgrade für Agentenarbeit hin, wobei Benchmark-Werte weiterhin gegen Ihr eigenes Repository und Ihre Toolkonfiguration validiert werden sollten.
Grok 4.6 API-Anwendungen
Grok 4.6 ist am nützlichsten, wenn eine Aufgabe mehr als eine einzelne Antwort erfordert. Sein Hauptvorteil liegt darin, Arbeiten über Recherche, Planung, Tool-Aufrufe, Implementierung, Tests und Überarbeitung hinweg aufrechtzuerhalten.
Coding auf Repository-Ebene: Geben Sie dem Modell Quelldateien, Issue-Beschreibungen, Logs, Screenshots und Architekturnotizen. Es kann Verhalten über Komponenten hinweg nachverfolgen, Änderungen vorschlagen, Abhängigkeiten erklären und dabei helfen zu überprüfen, ob ein Fix das ursprüngliche Problem behebt.
Langlaufende Coding-Agenten: Nutzen Sie Funktionsaufrufe, um Terminal-Tools, Test-Runner, Dateisysteme, Datenbanken oder Deployment-Prüfungen anzubinden. Ein niedrigerer Reasoning-Aufwand kann die routinemäßige Tool-Auswahl übernehmen, während high- oder xhigh-Aufwand besser für schwieriges Debugging und Architekturentscheidungen reserviert ist.
Interaktives App-Prototyping: Grok 4.6 ist dafür ausgelegt, breite Produktideen in umfangreiche erste Versionen umzusetzen. Es ist besonders relevant für Dashboards, Simulationen, browserbasierte Tools und Oberflächen, bei denen Layout, Interaktionslogik und iterative Verfeinerung gemeinsam umgesetzt werden müssen.
Visuelles Debugging und QA: Legen Sie Screenshots der Oberfläche zusammen mit Code und Implementierungsanforderungen vor. Das Modell kann Unterschiede zwischen der gerenderten Oberfläche und dem beabsichtigten Design erkennen und dann Textanweisungen, Codeänderungen oder strukturierte Fehlerberichte zurückgeben.
Recherche und Wissensarbeit: Kombinieren Sie lange Berichte, PDFs, Tabellen, Bilder und schriftliche Fragen in einem Arbeitskontext. Mit Tools ausgestattete Agenten können Informationen sammeln, Quellen vergleichen, Ergebnisse organisieren und Ergebnisse in einem Schema zurückgeben, das nachgelagerte Systeme verarbeiten können.
Das Modell ist weniger geeignet für kurze Anfragen mit hohem Volumen, bei denen ein günstigeres Modell die Akzeptanzschwelle bereits erfüllt. Leiten Sie für solche Workloads einfache Klassifizierungs-, Extraktions- oder Umschreibaufgaben an ein kleineres Modell weiter und reservieren Sie Grok 4.6 für Fälle, die anhaltendes Reasoning erfordern.
API-Details, die Sie vor der Migration prüfen sollten
Grok 4.6 unterstützt vertraute OpenAI-artige Anfragemuster, aber das Ersetzen eines Modellnamens ohne Überprüfung des Anfrageverhaltens kann dennoch Fehler verursachen.
Erstens kann Reasoning nicht deaktiviert werden. Die Standardeinstellung ist high, was mehr Reasoning-Tokens verbraucht und eine höhere Latenz als erwartet erzeugen kann. Verwenden Sie low für einfache Tool-Auswahl oder zeitkritische Agenten, medium für Analysen und xhigh nur, wenn die zusätzliche Reasoning-Tiefe die Kosten und Wartezeit rechtfertigt.
Zweitens akzeptieren Reasoning-Modelle nicht jeden standardmäßigen Sampling-Parameter. SpaceXAI dokumentiert, dass presence_penalty, frequency_penalty und stop nicht mit Grok 4.6 verwendet werden können. Anfragen mit diesen Parametern geben einen Fehler zurück. Entfernen Sie sie daher aus gemeinsamen Modellkonfigurationen, bevor Sie Datenverkehr umstellen.
Drittens sollten Sie eine 500K-Token-Anfrage nicht allein anhand des Listenpreises für kurze Kontexte berechnen. SpaceXAI erhebt höhere Direkttarife, wenn ein Prompt 200.000 Token erreicht. Prüfen Sie das Live-Preispaneel von GPTProto, bevor Sie Aufträge mit großem Kontext ausführen, insbesondere wenn ein Agent wiederholt den gesamten Konversations- oder Repository-Verlauf sendet.
Viertens bedeutet Bildeingabe nicht Bildausgabe. Grok 4.6 kann Screenshots, Diagramme, Schaubilder und andere visuelle Referenzen untersuchen, aber die Bild- und Videogenerierung verwendet separate Grok-Imagine-Modelle.
Prüfen Sie schließlich, welche vom Anbieter gehosteten Tools über Ihre gewählte Route verfügbar sind. Standardmäßige Funktionsaufrufe und strukturierte Ausgaben sind portable Anwendungsmuster, während integrierte Websuche, X-Suche oder Codeausführung von der Endpunktunterstützung abhängen können.
Grok 4.6 vs. Grok 4.5
Grok 4.6 ist keine Erweiterung des Kontextfensters und kein günstigerer Ersatz für Grok 4.5. Beide Modelle haben ein 500K-Kontextfenster und dieselben Standardpreise für direkte Eingabe und Ausgabe. Das Upgrade betrifft vor allem die Agentenleistung, erweiterte Aufgabenpersistenz, visuelle und interaktive Arbeit sowie die neue xhigh-Reasoning-Option.
| Entscheidungsfaktor |
Grok 4.6 |
Grok 4.5 |
Praktischer Unterschied |
| Kontextfenster |
500K |
500K |
Keine Kapazitätserhöhung |
| Eingabe und Ausgabe |
Text/Bild → Text |
Text/Bild → Text |
Gleiches Modalitätsprofil |
| Reasoning-Stufen |
Low, medium, high, xhigh |
Low, medium, high |
Grok 4.6 bietet echtes xhigh-Reasoning |
| Standard-Direktpreis |
$2 Eingabe / $6 Ausgabe pro 1M |
$2 Eingabe / $6 Ausgabe pro 1M |
Keine Senkung des Standardpreises |
| Cache-Eingabe unter 200K |
$0.50 pro 1M |
$0.30 pro 1M |
Grok 4.5 ist bei cache-intensiven Workloads günstiger |
| AA Intelligence Index |
61 |
56 |
Grok 4.6 verbessert sich um 5 Punkte |
| CursorBench v3.2 |
69.9% |
66.7% |
Bessere berichtete Coding-Agent-Leistung |
| DeepSWE v1.1 |
65.9% |
54.0% |
Größerer Zuwachs bei Softwareentwicklungsaufgaben |
| FrontierCode v1.1 Extended |
61.3% |
56.6% |
Besseres berichtetes Ergebnis bei langen Coding-Aufgaben |
| APEX-Agents |
57.5% |
47.1% |
Stärkere berichtete Agentenleistung |
| Beste Eignung |
Langlaufende Agenten, interaktive Apps und schwieriges Coding |
Bestehende Coding-Pipelines und cache-intensive Aufgaben |
Upgrade basierend auf dem Workload, nicht allein auf der Modellnummer |
Die obigen Benchmark-Werte stammen aus der Launch-Evaluierung von SpaceXAI für Grok 4.6 und verwenden die High-Reasoning-Einstellung. Sie sind nützliche Richtwerte, aber keine Garantie für jede Codebasis.
Wählen Sie Grok 4.6, wenn der Agent über viele Schritte hinweg effektiv bleiben, seine eigene Arbeit überprüfen, visuelle Referenzen interpretieren oder aus einer breiten Spezifikation eine umfangreiche interaktive Anwendung erstellen muss.
Behalten Sie Grok 4.5, wenn Ihre aktuelle Evaluierung bereits besteht, gecachte Prompts einen erheblichen Anteil an der Nutzung ausmachen oder ein Wechsel keine messbare Verbesserung der Akzeptanzrate bringt. Testen Sie beide Modelle mit denselben Repository-Aufgaben, bevor Sie den gesamten Datenverkehr umstellen.
Wann sollten Sie Grok 4.6 wählen?
Wählen Sie dieses Modell, wenn die Kosten für ein unvollständiges oder falsches Ergebnis höher sind als die zusätzliche Reasoning-Latenz. Gute Kandidaten sind repository-weites Debugging, Feature-Implementierung, toolgestützte Recherche, visuelle Oberflächenarbeit und Agenten, die ihre eigene Ausgabe testen und überarbeiten müssen.
Für Coding ist Grok 4.6 besonders relevant, wenn eine Aufgabe mehrere Aktivitäten kombiniert: unbekannten Code lesen, entscheiden, welche Dateien geändert werden sollen, Tools aufrufen, Testfehler interpretieren und fortfahren, bis das Ergebnis eine definierte Akzeptanzbedingung erfüllt.
Für einfache Zusammenfassungen, Klassifizierung, Übersetzung oder kurze JSON-Extraktion kann ein günstigeres Modell bessere Kosten pro akzeptiertem Ergebnis liefern. Der gemeinsame API-Schlüssel von GPTProto macht diese Routing-Strategie einfacher, weil die Anwendung Grok 4.6 neben anderen unterstützten Modellen testen kann, ohne separate Anbieterguthaben verwalten zu müssen.