Qu'est-ce que Kimi K3 ?
Kimi K3 est le nouveau modèle phare de raisonnement multimodal de Moonshot AI. Il a été conçu pour des tâches pouvant nécessiter des heures de codage, de recherche, d'utilisation d'outils et de révision—et pas seulement pour répondre à une unique invite de discussion.
Le modèle a été lancé le 16 juillet 2026 sur Kimi.com, Kimi Work, Kimi Code et l'API Kimi. Il compte 2,8 billions de paramètres au total, dispose d'une fenêtre de contexte d'un million de tokens et prend nativement en charge les entrées texte, image et vidéo. Sa sortie reste du texte.
Sous le capot, K3 utilise une architecture Mixture-of-Experts avec 896 experts, dont 16 sont activés simultanément. Moonshot a également introduit Kimi Delta Attention, Attention Residuals et Stable LatentMoE afin d'améliorer la circulation de l'information dans les longues séquences et les couches profondes du modèle. Moonshot affirme que ces changements offrent une efficacité de mise à l'échelle environ 2,5 fois supérieure à celle de Kimi K2, bien que ce chiffre provienne du développeur et non d'un test indépendant. Le blog technique Kimi K3 de Moonshot fournit les détails actuels de l'architecture ; un rapport technique plus complet est encore attendu.
| Spécifications |
Kimi K3 |
| Développeur |
Moonshot AI |
| Lancement public |
16 juillet 2026 |
| Paramètres totaux / activés |
2.8T / 104B |
| Architecture |
Mixture-of-Experts |
| Experts |
896 au total, 16 actifs |
| Fenêtre de contexte |
1 million de tokens |
| Entrées |
Texte, image et vidéo |
| Sortie |
Texte |
| Chaîne d'identification du modèle API |
kimi-k3 |
| Mode réflexion |
Toujours activé |
| Disponibilité des poids |
Poids complets publiés dans `moonshotai/Kimi-K3 |
Cela fait de K3 l'un des plus grands modèles d'IA annoncés à ce jour. La taille, toutefois, n'est pas utile en soi. La vraie question est de savoir si Moonshot a transformé ces paramètres en une meilleure réalisation des tâches.
La publication lève également une incertitude de la couverture initiale du lancement : le rapport technique est désormais public. Elle ne supprime pas le besoin d'une évaluation indépendante et ne transforme pas un modèle de 2,8 T en projet d'auto-hébergement simple.
Kimi K3 est-il vraiment proche de GPT-5.6 et de Claude Fable 5 ?
En matière d'intelligence globale, pas tout à fait. Pour plusieurs tâches agentiques et de longue durée, oui.
L'annonce de Moonshot est plus mesurée que nombre des titres qu'elle a suscités. L'entreprise affirme que les performances globales de K3 restent inférieures à celles de Claude Fable 5 et de GPT-5.6 Sol. Elle fait néanmoins état de résultats de niveau frontier en codage, travail de connaissance et raisonnement.
L'optimisation de noyaux GPU en est un exemple. Moonshot a placé chaque modèle dans un bac à sable identique et lui a accordé jusqu'à 24 heures pour optimiser quatre tâches GPU. K3 s'est montré compétitif face à Fable 5 et a surpassé GPT-5.6 Sol, GPT-5.5 et Opus 4.8 lors de ce test. Il s'agit d'un résultat important pour l'ingénierie des performances bas niveau. Cela ne prouve pas que K3 soit universellement plus intelligent.
Les tests indépendants offrent une vision plus large. Artificial Analysis a attribué à Kimi K3 un score de 57 sur son Intelligence Index, le plaçant autour de GPT-5.5 et de Claude Opus 4.8, mais derrière Fable 5 et GPT-5.6 Sol. Ses meilleurs résultats apparaissent dans l'exécution agentique et l'automatisation plutôt que dans toutes les catégories d'intelligence. Artificial Analysis a publié ses résultats sur K3 le 16 juillet.
| Évaluation |
Résultat de Kimi K3 |
Ce que cela nous apprend |
| AA Intelligence Index |
57 |
Proche de GPT-5.5 et Opus 4.8 ; derrière GPT-5.6 Sol et Fable 5 |
| GDPval-AA v2 |
1 668 Elo |
Forte exécution sur des tâches agentiques du monde réel |
| AutomationBench-AA |
53 %, classé premier |
Particulièrement efficace pour l'automatisation des workflows SaaS |
| AA-Briefcase |
1 547 Elo, classé deuxième |
Solide performance dans le travail de connaissance de longue durée |
| Précision Omniscience |
46 % |
En hausse par rapport aux 33 % de K2.6 |
| Taux d'hallucination |
51 % |
Pire que les 39 % de K2.6 |
C'est la dernière ligne qui m'a arrêté. K3 est devenu plus performant, mais Artificial Analysis a également mesuré davantage d'hallucinations. Il a répondu correctement à davantage de questions tout en produisant une proportion plus élevée d'affirmations infondées.
Ce compromis compte en production. Un modèle qui termine un long workflow d'agent mais introduit discrètement une hypothèse incorrecte peut coûter plus cher à vérifier qu'un modèle plus lent aux réponses factuelles plus constantes.
Pourquoi un seul classement ne peut pas trancher la comparaison
K3 a déjà atteint la première place d'au moins un classement de génération frontend. Il est également performant dans l'optimisation GPU, l'automatisation SaaS et le travail de connaissance de longue durée. Ces résultats ne mesurent pas la même capacité.
Une arène frontend mesure les interfaces générées que les utilisateurs préfèrent. AutomationBench mesure la capacité d'un agent à exécuter des workflows logiciels. L'optimisation de noyaux GPU teste l'ingénierie des systèmes bas niveau. Aucun de ces tests ne peut répondre seul à la question de savoir si K3 est meilleur en recherche, rappel factuel, débogage, conception de présentations ou raisonnement général.
La conclusion défendable est plus limitée : Kimi K3 a rejoint le groupe frontier pour le travail agentique, mais GPT-5.6 Sol et Fable 5 restent en tête de la comparaison globale. Les développeurs qui recherchent le plafond actuel des modèles fermés peuvent examiner l'API GPT-5.6 Sol, tandis que Claude Opus 4.8 reste une option plus établie pour les workflows complexes de codage et de recherche.
La question des poids ouverts est réglée ; celle du déploiement ne l'est pas
La question du lancement était de savoir si Moonshot publierait réellement les poids. C'est fait. Le dépôt officiel moonshotai/Kimi-K3 contient désormais le checkpoint complet, la fiche du modèle, le rapport technique, le code d'inférence et la licence Kimi K3.
La formulation exacte reste importante. Kimi K3 dispose de poids ouverts, mais il ne s'agit pas d'une sortie « entièrement open source » sans réserve. Sa licence personnalisée autorise largement l'utilisation, la modification, l'affinage, le déploiement et la redistribution, mais ajoute des conditions pour les grandes entreprises Model-as-a-Service et les très grands produits commerciaux. Les données d'entraînement ne sont pas publiques.
La disponibilité n'est pas non plus synonyme d'utilisabilité. Le dépôt représente environ 1,56 To, et Moonshot recommande des déploiements sur supernœuds avec au moins 64 accélérateurs. K3 concerne donc les équipes chargées de l'infrastructure cloud et d'entreprise, et non un téléchargement courant sur poste de travail.
La publication reste importante. Les organisations disposent désormais d'une véritable possibilité d'inspecter le checkpoint, de personnaliser l'inférence, d'affiner des dérivés et d'exploiter le modèle sans dépendre entièrement d'un unique endpoint hébergé. Le prix à payer est le matériel, l'ingénierie de service et l'examen de la licence.
Qu'est-ce qui a changé entre Kimi K2.7 et Kimi K3 ?
K3 n'est pas simplement Kimi K2.7 avec un numéro de version plus élevé.
Kimi K2.7 Code est un modèle agentique axé sur le codage, basé sur K2.6. Sa fiche de modèle met l'accent sur l'ingénierie logicielle du monde réel, les longues sessions de codage, l'utilisation d'outils et une consommation réduite de tokens de raisonnement. K3 étend ce rôle pour devenir un modèle phare généraliste couvrant le codage, le raisonnement visuel, la recherche et le travail de connaissance de bout en bout.
La fenêtre de contexte passe de 256K à un million de tokens. Le nombre total de paramètres passe d'un billion à 2,8 billions, tandis que le nombre d'experts passe de 384 à 896. Le prix augmente en conséquence.
| Fonctionnalité |
Kimi K3 |
Kimi K2.7 Code |
| Positionnement |
Modèle phare généraliste |
Modèle axé sur le codage |
| Paramètres totaux |
2.8T |
1T |
| Experts |
896, 16 actifs |
384, 8 actifs |
| Fenêtre de contexte |
1M |
256K |
| Entrée standard |
$3.00/MTok |
$0.95/MTok |
| Sortie |
$15.00/MTok |
$4.00/MTok |
| Entrée mise en cache |
$0.30/MTok |
$0.19/MTok |
| Poids |
Disponibles sous la licence Kimi K3 |
Disponibles |
La proposition de valeur de K3 n'est donc pas « une intelligence frontier pour presque rien ». Il s'agit de performances agentiques proches du frontier, avec deux voies de déploiement : une API facturée à l'usage pour une utilisation immédiate et des poids publiés pour les équipes prêtes à prendre en charge l'infrastructure.
La fiche officielle du modèle K2.7 Code contient son architecture, sa méthodologie de benchmark et ses recommandations de déploiement.
Comment Kimi K3 gère-t-il un contexte d'un million de tokens ?
Une fenêtre de contexte d'un million de tokens permet à K3 d'accepter de grandes bases de code, des collections de documents techniques, de longs historiques d'agents et des résultats d'outils intermédiaires dans une seule requête.
C'est particulièrement utile pour les agents de longue durée. Un modèle de codage peut devoir conserver une spécification initiale, la structure du dépôt, la sortie du terminal, les échecs de tests, les modifications précédentes et les retours des évaluateurs au fil de dizaines d'étapes. Perdre l'une de ces contraintes à mi-parcours explique souvent pourquoi un agent semble productif, mais ne parvient pas à terminer.
K3 applique également une mise en cache automatique du contexte. Les développeurs n'ont pas besoin de créer un identifiant de cache ni de définir une valeur distincte de durée de vie. Si un long préfixe reste inchangé entre les requêtes, le système tente automatiquement d'utiliser le cache. L'entrée mise en cache coûte 0,30 $ par million de tokens au lieu de 3,00 $.
Mais la capacité du contexte n'est pas équivalente à une utilisation parfaite du contexte. Fournir un million de tokens à un modèle ne garantit pas qu'il accordera la bonne importance à chaque ligne. Les entrées plus longues peuvent également augmenter le coût, le temps de traitement et la distraction causée par les éléments non pertinents.
L'approche raisonnable consiste toujours à récupérer d'abord les fichiers les plus pertinents, à conserver le contenu de référence stable au début pour la mise en cache et à éviter d'envoyer toute la base de connaissances simplement parce que la limite le permet. Le guide de l'API Kimi explique son contexte d'un million de tokens et son comportement de mise en cache automatique.
La tarification de l'API Kimi K3 n'est plus une tarification économique
L'API Kimi K3 officielle de Moonshot utilise une tarification forfaitaire à l'usage. Le tarif ne change pas lorsqu'une requête franchit un seuil de contexte supérieur.
| Type de token |
Prix par million de tokens |
| Entrée mise en cache |
$0.30 |
| Entrée standard |
$3.00 |
| Sortie |
$15.00 |
Pour une tâche agentique courte utilisant 100 000 tokens d'entrée non mis en cache et produisant 20 000 tokens de sortie, le coût estimé du modèle est :
(0.1 × $3) + (0.02 × $15) = $0.60
Considérons maintenant un workflow à contexte long répété avec 800 000 tokens mis en cache, 50 000 nouveaux tokens d'entrée et 50 000 tokens de sortie :
(0.8 × $0.30) + (0.05 × $3) + (0.05 × $15) = $1.14
La mise en cache rend le deuxième exemple abordable, mais K3 ne suit clairement plus l'ancienne formule « modèle chinois = API extrêmement bon marché ».
Artificial Analysis a mesuré un coût moyen de 0,94 $ par tâche de l'Intelligence Index pour K3, proche de GPT-5.6 Sol à 1,04 $ et environ deux fois inférieur à Opus 4.8 à 1,80 $. GLM-5.2 a réalisé la même charge d'évaluation pour un coût nettement inférieur.
La comparaison change également selon l'endroit où les modèles sont accessibles. L'API Kimi K3 sur GPT Proto coûte actuellement 2,70 $ par million de tokens d'entrée et 13,50 $ par million de tokens de sortie, soit 10 % de moins que le tarif catalogue de 3 $/15 $ de Moonshot. GPT Proto propose également GPT-5.6 Sol et GLM-5.2 via la même clé API et le même solde partagé, ce qui facilite les comparaisons au niveau des tâches sans comptes distincts chez les fournisseurs.
La proposition de valeur de K3 n'est donc pas « une intelligence frontier pour presque rien ». Il s'agit de performances agentiques proches du frontier, avec deux voies de déploiement : une API facturée à l'usage pour une utilisation immédiate et des poids publiés pour les équipes prêtes à prendre en charge l'infrastructure.
API Kimi K3 ou poids ouverts : lequel utiliser ?
Kimi K3 offre désormais aux développeurs un véritable choix de déploiement. La capacité du modèle est l'attrait des deux options ; le modèle d'exploitation est complètement différent.
| API Kimi K3 hébergée |
Poids ouverts de Kimi K3 |
| Payer par token |
Acheter ou louer de la capacité d'accélérateurs |
| Le fournisseur gère la mise à l'échelle, la mise en cache, les mises à jour et les pannes |
Votre équipe gère le service, la mise à l'échelle, la surveillance, les mises à niveau et les pannes |
| Accès le plus rapide à l'évaluation et à la production |
Contrôle maximal des données, de l'inférence et de la modification du modèle |
| Le service hébergé documente les entrées texte, image et vidéo |
Les métadonnées du dépôt public actuel se concentrent sur le texte et l'image ; vérifiez la parité du parcours vidéo avant de le promettre |
| Pas de téléchargement de 1,56 To |
Environ 1,56 To répartis sur 96 fragments de poids |
| Pas de projet de déploiement en cluster |
Moonshot recommande au moins 64 accélérateurs |
Utilisez d'abord l'API si vous vérifiez encore l'adéquation produit-marché, si le trafic est variable ou si l'équipe n'exploite pas déjà une infrastructure de grands modèles. L'API Kimi K3 de GPT Proto facilite également la comparaison de K3 avec GPT-5.6 Sol, GLM-5.2 et d'autres modèles au moyen d'une seule clé et d'un seul solde.
Utilisez les poids lorsqu'un déploiement privé, un affinage, une inférence personnalisée ou l'indépendance vis-à-vis d'un fournisseur présentent une valeur commerciale suffisante pour justifier le cluster. Avant un déploiement commercial, examinez la licence Kimi K3 au lieu de supposer que « ouvert » signifie MIT.
Kimi K3 face à GLM-5.2, GPT-5.6 et Opus 4.8
Le vainqueur d'un benchmark n'est pas automatiquement le modèle adapté à la production. Le bon choix dépend de ce qui peut échouer, de la durée du workflow et de l'importance de posséder les poids.
| Modèle |
À choisir lorsque |
| Kimi K3 |
Vous avez besoin de workflows agentiques multimodaux de longue durée et souhaitez soit une API hébergée immédiatement, soit une voie de déploiement avec poids ouverts sous la licence Kimi K3 |
| GPT-5.6 Sol |
La qualité du raisonnement général et la fiabilité en production comptent davantage que la propriété |
| Claude Fable 5 |
Vous recherchez le plafond mesuré le plus élevé en travail de connaissance agentique et y avez accès |
| Claude Opus 4.8 |
Vous vous appuyez déjà sur des workflows Claude pour le codage complexe, la recherche et le suivi attentif des instructions |
| GLM-5.2 |
Vous avez besoin d'un codage agentique moins coûteux avec des poids déjà disponibles |
| Kimi K2.7 Code |
Votre charge de travail concerne principalement le codage et le prix plus élevé de K3 est difficile à justifier |
K3 présente le cas d'utilisation le plus clair lorsque trois conditions sont réunies : une tâche de longue durée, des entrées multimodales et une raison de contrôler le déploiement du modèle. Sans ces exigences, son ampleur peut devenir une réponse coûteuse à un problème plus limité.
GPT-5.6 Sol reste le meilleur choix lorsque l'intelligence globale et la fiabilité sont prioritaires. Opus 4.8 convient aux équipes disposant de workflows de codage ou de recherche matures basés sur Claude. GLM-5.2 est le concurrent le plus difficile sur le plan économique, car il offre déjà un contexte d'un million de tokens et des poids ouverts pour un coût par tâche inférieur.
Ma règle générale actuelle est simple : choisissez K3 lorsque les poids ouverts et les agents multimodaux de longue durée sont importants. Choisissez GPT-5.6 ou Opus lorsque la fiabilité compte davantage que la propriété du modèle. Choisissez GLM-5.2 lorsque le coût est la contrainte avec laquelle vous ne pouvez pas négocier.
Peut-on déjà utiliser Kimi K3 via GPT Proto ?
Oui. Kimi K3 est désormais disponible via l'API Kimi K3 de GPT Proto.
Le tarif actuel de GPT Proto est de 2,70 $ par million de tokens d'entrée et de 13,50 $ par million de tokens de sortie, soit 10 % de moins que le tarif catalogue actuel de Moonshot, fixé à 3 $/15 $. Utilisez la chaîne de modèle kimi-k3 avec votre clé API GPT Proto pour accéder aux capacités de K3 en codage avec contexte long, analyse multimodale, appels d'outils et sorties structurées.
La même clé et le même solde partagé couvrent également GPT-5.6 Sol, GLM-5.2, Claude Opus 4.8 et plus de 200 modèles texte, image, vidéo et audio. Il devient ainsi pratique de tester K3 par rapport à des alternatives sur le même dépôt ou workflow d'agent avant de modifier le trafic de production.
Vous pouvez essayer Kimi K3 sur GPT Proto ou parcourir la galerie complète de modèles IA GPT Proto. Les poids et le rapport technique du modèle sont désormais publics, mais l'article devra être réévalué à mesure que mûriront les tests de déploiement indépendants, les quantifications, les données de débit et la prise en charge des frameworks.
Verdict final : proche, mais le benchmark reste important
Kimi K3 n'est pas simplement un grand modèle chinois attirant l'attention en raison de son nombre de paramètres. Les tests indépendants permettent une conclusion plus substantielle : il est compétitif avec les systèmes frontier en automatisation, travail de connaissance de longue durée et exécution agentique.
Cela ne le rend pas meilleur que GPT-5.6 Sol ou Claude Fable 5 dans l'ensemble. Cela n'efface pas non plus l'augmentation mesurée des hallucinations. Ce qui a changé le 28 juillet concerne le déploiement : les poids promis, la licence, la fiche du modèle et le rapport technique sont désormais publics.
K3 est donc l'une des options à poids ouverts les plus performantes de sa catégorie, mais cette formulation nécessite deux réserves. Sa licence est personnalisée plutôt que MIT, et son dépôt de 1,56 To ainsi que sa recommandation de plus de 64 accélérateurs rendent l'auto-hébergement inaccessible à une équipe de développement ordinaire.
Mon verdict : utilisez l'API pour déterminer si K3 améliore réellement vos tâches. Passez aux poids uniquement lorsque le contrôle, la personnalisation ou les frontières des données justifient que vous deveniez vous-même le fournisseur de l'infrastructure.