Grok 4.6 est un modèle de raisonnement à sortie textuelle publié par SpaceXAI, anciennement connu sous le nom de xAI, le 12 août 2026. Il s’appuie sur Grok 4.5 avec un entraînement supplémentaire pour les agents à longue durée d’exécution, l’ingénierie logicielle, la recherche technique, le développement d’applications interactives, la conception assistée par ordinateur et un éventail plus large de travaux de connaissances.
Le modèle accepte des entrées texte et image. Les développeurs peuvent combiner code source, documentation, captures d’écran, diagrammes, graphiques et instructions écrites dans une seule requête. La prise en charge des images est conçue pour la compréhension visuelle ; Grok 4.6 ne remplace pas directement les modèles distincts Grok Imagine utilisés pour la génération d’images ou de vidéos.
Sa fenêtre de contexte de 500 000 jetons convient aux grands dépôts de code, aux conversations longues, à la recherche multi-documents et aux agents qui doivent conserver un historique de tâches conséquent. SpaceXAI ne publie pas de limite maximale de sortie textuelle distincte, mais les requêtes restent soumises au contexte total du modèle et aux limites d’exploitation de l’API.
Grok 4.6 prend également en charge l’appel de fonctions et les sorties structurées. Les développeurs peuvent le connecter à des bases de données, des API internes, des systèmes de recherche, des environnements d’exécution de code et d’autres outils applicatifs, puis demander un JSON qui suit un schéma défini.
| Spécification |
Grok 4.6 |
| Fournisseur |
SpaceXAI / xAI |
| Date de sortie |
12 août 2026 |
| Nom du modèle fournisseur |
grok-4.6 |
| Modalités d’entrée |
Texte et image |
| Modalité de sortie |
Texte |
| Fenêtre de contexte |
500 000 jetons |
| Limite de sortie textuelle publiée |
Aucune limite distincte publiée |
| Date de coupure des connaissances |
1er février 2026 |
| Effort de raisonnement |
low, medium, high par défaut, ou xhigh |
| Comportement de raisonnement |
Toujours activé |
| Formats d’API |
Responses API et Chat Completions |
| Fonctionnalités principales |
Appel de fonctions, sorties structurées et raisonnement |
| Mieux adapté à |
Agents de codage, travaux d’applications visuelles, recherche et tâches de connaissances en plusieurs étapes |
Dans les évaluations publiées par SpaceXAI, Grok 4.6 High a obtenu 61 à l’Artificial Analysis Intelligence Index, contre 56 pour Grok 4.5 High. Il a également progressé de 54 % à 65,9 % sur DeepSWE v1.1 et de 47,1 % à 57,5 % sur APEX-Agents. Ces résultats indiquent une amélioration significative pour les travaux agentiques, bien que les scores de référence doivent encore être validés sur votre propre dépôt et votre configuration d’outils.
Applications de l’API Grok 4.6
Grok 4.6 est particulièrement utile lorsqu’une tâche exige plus qu’une simple réponse. Son principal avantage est de maintenir le travail sur l’ensemble de la recherche, de la planification, des appels d’outils, de l’implémentation, des tests et des révisions.
Codage à l’échelle d’un dépôt : Donnez au modèle les fichiers sources, les descriptions de tickets, les journaux, les captures d’écran et les notes d’architecture. Il peut suivre le comportement à travers les composants, proposer des modifications, expliquer les dépendances et aider à vérifier si un correctif résout le problème d’origine.
Agents de codage à longue durée d’exécution : Utilisez l’appel de fonctions pour connecter des outils de terminal, des exécuteurs de tests, des systèmes de fichiers, des bases de données ou des vérifications de déploiement. Un effort de raisonnement plus faible peut gérer la sélection d’outils courante, tandis qu’un effort high ou xhigh est mieux réservé aux décisions difficiles de débogage et d’architecture.
Prototypage d’applications interactives : Grok 4.6 est conçu pour transformer des idées générales de produits en premières versions substantielles. Il est particulièrement pertinent pour les tableaux de bord, les simulations, les outils basés sur navigateur et les interfaces où la mise en page, la logique d’interaction et l’affinage itératif doivent être gérés ensemble.
Débogage visuel et assurance qualité : Fournissez des captures d’écran de l’interface en plus du code et des exigences d’implémentation. Le modèle peut identifier les différences entre l’interface rendue et la conception prévue, puis renvoyer des instructions textuelles, des modifications de code ou des rapports de défauts structurés.
Travaux de recherche et de connaissances : Combinez de longs rapports, des PDF, des tableaux, des images et des questions écrites dans un même contexte de travail. Les agents équipés d’outils peuvent rassembler des informations, comparer des sources, organiser les résultats et renvoyer des résultats dans un schéma que les systèmes en aval peuvent traiter.
Ce modèle est moins intéressant pour les requêtes courtes et à fort volume lorsqu’un modèle moins coûteux atteint déjà le seuil d’acceptation. Pour ces charges de travail, orientez les tâches simples de classification, d’extraction ou de réécriture vers un modèle plus petit et réservez Grok 4.6 aux cas qui nécessitent un raisonnement soutenu.
Détails de l’API à vérifier avant de migrer
Grok 4.6 prend en charge les modèles de requêtes classiques de type OpenAI, mais remplacer un nom de modèle sans examiner le comportement des requêtes peut encore créer des erreurs.
Premièrement, le raisonnement ne peut pas être désactivé. Le réglage par défaut est high, ce qui peut utiliser davantage de jetons de raisonnement et produire une latence plus élevée que prévu. Utilisez low pour la sélection simple d’outils ou les agents sensibles au temps, medium pour l’analyse, et xhigh uniquement lorsque la profondeur de raisonnement supplémentaire justifie le coût et le temps d’attente.
Deuxièmement, les modèles de raisonnement n’acceptent pas tous les paramètres d’échantillonnage standard. SpaceXAI documente que presence_penalty, frequency_penalty et stop ne peuvent pas être utilisés avec Grok 4.6. Les requêtes contenant ces paramètres renvoient une erreur ; supprimez-les donc des configurations de modèle partagées avant de basculer le trafic.
Troisièmement, ne calculez pas une requête de 500 000 jetons à partir du seul prix annoncé pour un contexte court. SpaceXAI applique des tarifs directs plus élevés lorsqu’une invite atteint 200 000 jetons. Consultez le panneau de tarification en direct de GPTProto avant d’exécuter des tâches à grand contexte, en particulier lorsqu’un agent envoie à plusieurs reprises tout l’historique de conversation ou du dépôt.
Quatrièmement, une entrée image ne signifie pas une sortie image. Grok 4.6 peut inspecter des captures d’écran, des diagrammes, des graphiques et d’autres références visuelles, mais la génération d’images et de vidéos utilise des modèles Grok Imagine distincts.
Enfin, confirmez quels outils hébergés par le fournisseur sont exposés par la route que vous avez choisie. L’appel de fonctions standard et les sorties structurées sont des modèles applicatifs portables, tandis que la recherche Web intégrée, la recherche X ou l’exécution de code peuvent dépendre de la prise en charge de l’endpoint.
Grok 4.6 vs Grok 4.5
Grok 4.6 n’est pas une extension de fenêtre de contexte ni un remplacement à prix inférieur pour Grok 4.5. Les deux modèles ont une fenêtre de contexte de 500K et les mêmes tarifs directs standard d’entrée et de sortie. La mise à niveau concerne principalement les performances des agents, la persistance des tâches étendues, le travail visuel et interactif, ainsi que la nouvelle option de raisonnement xhigh.
| Facteur de décision |
Grok 4.6 |
Grok 4.5 |
Différence pratique |
| Fenêtre de contexte |
500K |
500K |
Aucune augmentation de capacité |
| Entrée et sortie |
Texte/image → texte |
Texte/image → texte |
Même profil de modalités |
| Niveaux de raisonnement |
Low, medium, high, xhigh |
Low, medium, high |
Grok 4.6 ajoute un véritable niveau de raisonnement xhigh |
| Prix direct standard |
2 $ en entrée / 6 $ en sortie par 1M |
2 $ en entrée / 6 $ en sortie par 1M |
Aucune réduction du prix standard |
| Entrée en cache sous 200K |
0,50 $ par 1M |
0,30 $ par 1M |
Grok 4.5 est moins cher pour les charges de travail à forte utilisation du cache |
| AA Intelligence Index |
61 |
56 |
Grok 4.6 gagne 5 points |
| CursorBench v3.2 |
69,9 % |
66,7 % |
Meilleure performance rapportée pour les agents de codage |
| DeepSWE v1.1 |
65,9 % |
54,0 % |
Gain plus important sur les tâches d’ingénierie logicielle |
| FrontierCode v1.1 Extended |
61,3 % |
56,6 % |
Meilleur résultat rapporté en codage de longue forme |
| APEX-Agents |
57,5 % |
47,1 % |
Performance d’agent rapportée plus élevée |
| Meilleure adéquation |
Agents longue durée, applications interactives et codage difficile |
Pipelines de codage existants et tâches à forte utilisation du cache |
Mettez à niveau en fonction de la charge de travail, pas uniquement du numéro de modèle |
Les chiffres de référence ci-dessus proviennent de l’évaluation de lancement de Grok 4.6 par SpaceXAI et utilisent le niveau de raisonnement High. Ils constituent des preuves directionnelles utiles, mais pas une garantie pour chaque base de code.
Choisissez Grok 4.6 lorsque l’agent doit rester efficace sur de nombreuses étapes, examiner son propre travail, interpréter des références visuelles ou produire une application interactive substantielle à partir d’une spécification large.
Conservez Grok 4.5 lorsque votre évaluation actuelle réussit déjà, que les invites mises en cache représentent une part importante de l’utilisation, ou que le changement n’apporte aucune amélioration mesurable du taux d’acceptation. Exécutez les deux modèles sur les mêmes tâches de dépôt avant de déplacer tout le trafic.
Quand choisir Grok 4.6 ?
Choisissez ce modèle lorsque le coût d’un résultat incomplet ou incorrect est plus élevé que la latence de raisonnement supplémentaire. De bons candidats incluent le débogage à l’échelle du dépôt, l’implémentation de fonctionnalités, la recherche pilotée par outils, le travail sur les interfaces visuelles et les agents qui doivent tester et réviser leur propre sortie.
Pour le codage, Grok 4.6 est particulièrement pertinent lorsqu’une tâche combine plusieurs activités : lire du code inconnu, décider quels fichiers modifier, appeler des outils, interpréter les échecs de tests et continuer jusqu’à ce que le résultat réponde à un critère d’acceptation défini.
Pour la synthèse simple, la classification, la traduction ou l’extraction JSON courte, un modèle moins coûteux peut offrir un meilleur coût par résultat accepté. La clé API partagée de GPTProto facilite cette stratégie de routage, car l’application peut tester Grok 4.6 aux côtés d’autres modèles pris en charge sans maintenir de soldes séparés chez les fournisseurs.