Deux modèles de pointe sont sortis à quatre semaines d’intervalle, tous deux visant exactement le même acheteur : le développeur qui utilise des agents, et non des chatbots. Moonshot AI a lancé Kimi K3 le 16 juillet 2026. xAI a répondu le 12 août avec Grok 4.6. Recherchez aujourd’hui « Grok 4.6 vs Kimi K3 » et vous trouverez des articles de lancement de chaque camp, ainsi qu’une multitude de fiches techniques — mais presque personne n’a comparé les deux modèles côte à côte, du point de vue d’un créateur. C’est la lacune que cet article comble.
Voici la version courte, puisque vous êtes venu chercher une décision, pas un récapitulatif.
Grok 4.6 l’emporte en efficacité par tour pour les agents et en hébergement sans intervention. Il réalise les tâches longues et complexes en moins de boucles et avec moins de tokens, sans que vous ayez à gérer l’infrastructure. Kimi K3 l’emporte en matière de contexte, de vidéo native et de contrôle — une fenêtre d’un million de tokens, des entrées d’image et de vidéo, ainsi que des poids ouverts téléchargeables si vous devez l’héberger vous-même ou l’utiliser dans un environnement isolé. Sur le chiffre que tout le monde cite, les deux modèles sont presque à égalité : Artificial Analysis estime le coût par tâche de chacun à environ $0.84. L’écart d’un seul point sur l’indice d’intelligence ne sera donc pas votre facteur décisif. Les deux modèles empruntent des chemins opposés pour atteindre le même coût, et c’est précisément le choix que vous devez faire.
Si vous exécutez des workflows d’agents à haut volume sensibles aux coûts et souhaitez un endpoint géré, choisissez Grok 4.6. Si vous devez fournir un dépôt entier ou une vidéo dans une seule fenêtre de contexte — ou si des exigences de conformité vous imposent de conserver vous-même les poids — choisissez Kimi K3. La suite de cet article détaille les éléments qui sous-tendent cette décision.
Spécifications et tarifs, côte à côte
Quelques remarques avant le tableau. Les chiffres des benchmarks publiés au lancement proviennent des propres documents de chaque fournisseur ; considérez-les comme 🟡 communiqués par le fournisseur jusqu’à leur confirmation par des évaluations indépendantes. Les chiffres d’Artificial Analysis (indice d’intelligence, coût par tâche) sont ce qui se rapproche le plus d’une comparaison neutre et sont signalés comme tels. Le tarif GPT Proto correspond à ce que vous payez réellement pour tester les deux modèles avec une seule clé ; le tarif officiel est le prix fixé par le fournisseur.
|
Grok 4.6 |
Kimi K3 |
| Fournisseur |
xAI |
Moonshot AI |
| Date de sortie |
12 août 2026 |
16 juillet 2026 |
| Architecture |
Famille Grok 4.5, entraînement supplémentaire étendu + apprentissage par renforcement agentique |
MoE de 2,8 T de paramètres, 16 experts actifs sur 896 par token |
| Accès au modèle |
API hébergée uniquement (aucun poids téléchargeable) |
Poids ouverts (poids publiés le 27 juillet 2026 sous une licence Kimi K3 personnalisée) |
| Fenêtre de contexte |
500 000 tokens |
1 048 576 tokens |
| Entrées |
Texte, image |
Texte, image, vidéo |
| Sortie |
Texte (aucune limite fixe de sortie) |
Texte ; jusqu’à 1 048 576 dans la limite du contexte, 131 072 par défaut |
| Indice d’intelligence AA 🟡 |
61 |
~57 (Artificial Analysis) ; les graphiques du fournisseur le placent juste sous Grok |
| Coût par tâche (Artificial Analysis) |
~$0.84 |
~$0.84 |
| Tarif officiel /1 M de tokens |
$2 en entrée / $6 en sortie (contexte court) |
$3 en entrée / $15 en sortie |
| Tarif GPT Proto /1 M de tokens |
3.60 en sortie (40 % de réduction) |
13.50 en sortie (10 % de réduction) |
Les lignes consacrées aux tarifs méritent un second regard, car l’affirmation « Grok est moins cher » est vraie, mais incomplète. Le tarif catalogue de Grok 4.6, de 2 $/6 $, ne s’applique que jusqu’à 200 000 tokens. Dépassez cette limite — ce qui arrive régulièrement avec un agent travaillant sur une grande base de code — et le tarif double pour atteindre 4 $/12 $, appliqués à l’intégralité de la requête, et pas uniquement au dépassement. Kimi K3 facture davantage par token de sortie, mais sa fenêtre complète d’un million de tokens n’entraîne aucun supplément. Le modèle le moins cher dépend donc de la longueur de vos prompts. Les appels courts et fréquents favorisent Grok ; les documents longs ou le travail à l’échelle d’un dépôt réduisent l’écart et peuvent même inverser le résultat.
Intelligence et travail de connaissance
Sur l’indice d’intelligence composite d’Artificial Analysis — neuf benchmarks condensés en un seul chiffre — Grok 4.6 obtient 61, tandis que Kimi K3 se situe quelques points plus bas. Deux éléments méritent d’être soulignés. Premièrement, le chiffre exact de Kimi varie selon la source : Artificial Analysis indique 57, certains articles de lancement citent 60 et le propre graphique de xAI dit simplement « supérieur à Kimi ». Je m’appuie sur le chiffre d’Artificial Analysis, car il s’agit de l’évaluation neutre, mais un écart d’un à quatre points sur un indice composite de neuf benchmarks reste largement dans la marge de bruit liée à la pondération des composantes. Deuxièmement — et c’est plus important — un score composite mesure la qualité d’une réponse. Il mesure à peine la capacité d’un modèle à poursuivre un objectif au fil de quarante appels d’outils sans perdre le fil. C’est pourtant ce mode d’échec qui fait échouer les déploiements d’agents, et le score d’aucun des deux fournisseurs ne le prédit.
Là où les deux modèles divergent réellement, c’est en efficacité agentique. Sur le workload privé AA-Briefcase d’Artificial Analysis, Grok 4.6 termine en environ 53 tours et quelque 0,5 milliard de tokens d’entrée. À titre de comparaison, Claude Opus 5 nécessite environ 103 tours et 2,0 milliards de tokens pour la même tâche. C’est le bénéfice concret de l’« auto-évaluation sur de longues trajectoires » de xAI : le modèle vérifie son propre travail avant de passer à l’étape suivante, et boucle donc moins. Kimi K3 est compétitif sur le résultat du travail de connaissance à long terme (il atteint le niveau Fable 5 sur l’Elo AA-Briefcase, ~1548), mais ne met pas en avant la même discipline en matière de nombre de tours. Si votre facture dépend des appels d’outils — ce qui est le cas pour les agents en production — la différence est réelle et mesurable, et non une simple formule marketing.
En clair : les deux modèles sont à peu près équivalents en intelligence des réponses, mais Grok 4.6 y arrive en moins d’étapes.
Programmation : tout dépend du type de code
C’est ici qu’un vainqueur absolu cesse d’exister. Voici donc les détails. Kimi K3 domine plusieurs suites de tests de programmation : SWE Marathon (42,0 contre des scores de référence de pointe de 35 à 40), Program Bench (77,8, juste devant les 77,6 de GPT-5.6 Sol) et se situe à moins d’un demi-point du meilleur résultat sur Terminal-Bench 2.1 avec 88,3 (suivi dans l’indice Coding Agent d’Artificial Analysis). Sur le benchmark de navigation web BrowseComp, il arrive en tête avec 91,2. Grok 4.6, de son côté, a obtenu 88,4 % sur Terminal-Bench v2.1 et un Elo de 1753 sur GDPval-AA v2 ; ses plus fortes progressions par rapport à Grok 4.5 apparaissent sur CursorBench 3.2 (69,9 % contre 66,7 %) et Terminal-Bench v3.0 (26 % contre 15,7 %).
Au-delà des chiffres, une tendance se dessine. La force de Kimi K3 en programmation est vaste et adaptée aux dépôts : il navigue dans de grandes bases de code, débogue à partir de journaux et de captures d’écran, et sa fenêtre d’un million de tokens lui permet de conserver un projet entier dans son contexte. La force de Grok 4.6 est liée aux trajectoires : il a été ajusté dans Cursor et Grok Build à partir de sessions réelles de développeurs, et excelle donc à maintenir une tâche de programmation — transformer une idée vague en première version fonctionnelle, puis l’améliorer au fil de nombreuses étapes. Le revers de la médaille, comme pour tous les modèles ici : la fenêtre de 500 000 tokens de Grok limite la quantité d’un monorepo qu’il peut voir simultanément, et il ne peut pas conserver de retours vidéo. L’avantage de Kimi sur les benchmarks bruts de programmation s’accompagne d’une facture de tokens de sortie plus élevée et, selon la propre note de lancement de Moonshot, d’un taux d’hallucination en hausse parallèlement aux gains de précision.
Pour le frontend et le travail interactif en particulier — une variante fréquente de cette recherche — Kimi K3 est arrivé en tête du Frontend Code Arena de LMArena lors de son lancement, tandis que Grok 4.6 s’est placé près de GPT-5.6 Sol et Claude Fable sur les tâches de développement web de Code Arena. Les deux modèles sont performants ; Kimi dispose aujourd’hui du signal indépendant le plus favorable sur le frontend.
Contexte, capacités multimodales et déploiement
Les deux modèles ne se livrent pas ici à une compétition graduelle : ils sont conçus différemment. Kimi K3 offre une fenêtre de contexte de 1 048 576 tokens et accepte nativement le texte, les images et la vidéo, au sein d’une seule architecture. C’est la raison de le choisir : un agent de programmation qui lit des captures d’écran pour améliorer une interface, un workflow de recherche qui conserve tout un corpus documentaire, ou un système d’assurance qualité qui compare une vidéo d’interface à son implémentation. Grok 4.6 propose 500 000 tokens et des entrées texte plus image. C’est suffisant pour la plupart des tâches, mais si votre besoin est « analyse cet enregistrement d’écran de 40 minutes » ou « conserve ces 300 fichiers dans un seul prompt », Grok n’est pas l’outil adapté.
Vient ensuite la question de la propriété, qui est binaire. Grok 4.6 est uniquement hébergé ; rien n’est téléchargeable, et xAI peut modifier ou supprimer l’endpoint sans que vous puissiez agir dessus. Kimi K3 fournit des poids ouverts sous une licence Kimi K3 personnalisée : vous pouvez l’héberger vous-même, l’ajuster et le quantifier. Pour les équipes soumises à des règles de résidence des données, à des exigences d’isolation réseau ou à une politique contre la dépendance à un fournisseur, cette différence est décisive. La réserve à garder en tête : en précision native 4 bits, les poids nécessitent environ 1,4 To de mémoire avant même le cache KV, ce qui dépasse un seul nœud équipé de 8 GPU. « Ouvert » signifie ici légalement et techniquement accessible à ceux qui disposent d’un matériel conséquent, et non « fonctionne sur votre ordinateur portable ». Pour tous les autres, la voie pratique vers Kimi K3 reste une API hébergée.
Quand choisir lequel
Pas de compromis. Voici le choix selon le workload.
Choisissez Kimi K3 si l’un de ces cas vous correspond : vous devez fournir un dépôt entier, un ensemble de documents volumineux ou une vidéo dans une seule fenêtre de contexte ; vous développez des interfaces frontend ou interactives, où son avance sur LMArena est visible ; vous avez une raison liée à la conformité ou à la dépendance fournisseur de conserver les poids ; ou vous voulez une multimodalité native sans intégrer séparément un modèle de vision. Vous paierez davantage par token de sortie — prévoyez-le pour la génération de texte à haut volume.
Choisissez Grok 4.6 si : vous exécutez des agents autonomes à long horizon et souhaitez terminer en moins de tours et avec moins de tokens ; vos prompts restent sous 200 000 tokens afin de bénéficier du tarif catalogue avantageux de 2 $/6 $ ; vous voulez un endpoint géré sans infrastructure ; ou vous êtes sensible aux coûts à haute fréquence. Surveillez le palier de contexte long : au-delà de 200 000 tokens, toute la requête est facturée au double.
L’égalité du coût par tâche est le point essentiel. Vous ne choisissez pas le modèle le moins cher. Vous choisissez entre l’efficacité par tour d’un modèle hébergé et la multimodalité à long contexte d’un modèle aux poids ouverts. Faites correspondre ce choix à votre workload, et non à l’écart d’un point sur l’indice.
Exécutez les deux modèles avec une seule clé GPT Proto
Le moyen le plus rapide de trancher un débat sur le modèle le plus adapté à votre tâche consiste à exécuter votre propre tâche sur les deux. GPT Proto donne accès à Kimi K3 et Grok 4.6 via un endpoint compatible OpenAI et un seul solde, afin que vous puissiez les comparer sans alimenter deux comptes. Notez l’en-tête d’authentification : la surface /v1/ de GPT Proto accepte la clé brute, sans préfixe Bearer Bearer.
Python :
import openai
client = openai.OpenAI(
api_key="YOUR_GPTPROTO_API_KEY",
base_url="https://gptproto.com/v1",
)
prompt = "Refactor this function for readability and explain each change:\n\n<paste code>"
for model in ["kimi-k3", "grok-4.6"]:
resp = client.chat.completions.create(
model=model,
messages=[{"role": "user", "content": prompt}],
)
print(f"=== {model} ===")
print(resp.choices[0].message.content)
print("tokens:", resp.usage.total_tokens)
cURL, premier appel :
curl https://gptproto.com/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: YOUR_GPTPROTO_API_KEY" \
-d '{
"model": "kimi-k3",
"messages": [
{"role": "user", "content": "Summarize the tradeoffs between MoE and dense LLMs in 3 bullets."}
]
}'
Deux éléments propres à Kimi K3 peuvent être manqués lors d’un simple remplacement du nom du modèle. Il raisonne toujours : définissez reasoning_effort sur low, high ou max (valeur par défaut : max) au niveau supérieur, et non dans l’ancienne configuration thinking. Dans les boucles multi-tours ou utilisant des outils, renvoyez le message assistant précédent complet, y compris reasoning_content, sans quoi la continuité du raisonnement sera rompue lors des longues sessions. Analysez votre réponse finale depuis content, jamais depuis reasoning_content.
Détails complets des modèles et tarifs actuels : Kimi K3 sur GPT Proto et Grok 4.6 sur GPT Proto.