L’API Kimi K3 offre aux développeurs un accès hébergé au modèle phare de Moonshot AI pour le codage sur de longues séquences, l’analyse multimodale, l’utilisation d’outils et les tâches de connaissance de bout en bout. Lancé le 16 juillet 2026, K3 est un modèle Mixture-of-Experts de 2,8 billions de paramètres. Il active 16 experts sur 896 par token et combine Kimi Delta Attention, Attention Residuals et Stable LatentMoE afin de traiter les séquences longues plus efficacement qu’un modèle dense de taille totale similaire.
K3 accepte les entrées textuelles, les images et les vidéos, et renvoie du texte. Sa fenêtre de contexte d’1 million de tokens est destinée aux charges de travail qui ne peuvent pas être réduites à une courte invite : codage à l’échelle d’un dépôt, analyse de plusieurs documents, historiques d’utilisation d’outils longs et boucles de rétroaction visuelles. Le modèle raisonne toujours. Les développeurs peuvent définir reasoning_effort sur low, high, ou max, avec max comme valeur par défaut, plutôt que d’activer ou de désactiver la réflexion.
GPTProto ajoute une couche d’accès différente autour du modèle. Une clé API et un solde Kimi K3 peuvent également être utilisés avec plus de 200 modèles de texte, d’image, de vidéo et d’audio. Le tarif affiché sur cette page est de 2,70 $ par million de tokens d’entrée et de 13,50 $ par million de tokens de sortie, soit 10 % de moins que le tarif actuel 3/15 de Moonshot. K3 est ainsi plus facile à tester aux côtés de GPT-5.6 Sol, Claude Fable 5, GLM-5.2 ou d’autres modèles sans devoir ouvrir et approvisionner un compte auprès d’un fournisseur distinct pour chaque expérimentation.
| Spécification |
Kimi K3 |
| Fournisseur |
Moonshot AI |
| Date de lancement |
16 juillet 2026 |
| Classe du modèle |
Mixture-of-Experts de 2,8 T de paramètres |
| Experts actifs |
16 sur 896 par token |
| Architecture |
Kimi Delta Attention, Attention Residuals, Stable LatentMoE |
| Entrée |
Texte, image et vidéo |
| Sortie |
Texte |
| Fenêtre de contexte |
1 048 576 tokens |
| Limite de complétion |
131 072 tokens par défaut ; configurable jusqu’à 1 048 576 dans la limite du budget total de contexte |
| Raisonnement |
Toujours activé ; low, high, ou max comme niveau d’effort |
| Fonctionnalités de l’API |
Streaming, appels d’outils, tool_choice, outils dynamiques, mode JSON, JSON Schema strict et Partial Mode |
Applications de l’API Kimi K3
K3 est particulièrement utile lorsqu’une tâche combine un vaste ensemble de travail et des actions répétées. Un agent de codage peut inspecter un dépôt, modifier plusieurs fichiers, exécuter des tests, lire des journaux et utiliser des captures d’écran pour améliorer une interface frontend ou un jeu. Un flux de recherche peut conserver un vaste corpus documentaire dans le contexte, appeler des outils externes et renvoyer un résultat conforme à un JSON Schema strict. Un système d’assurance qualité multimodal peut comparer des captures d’écran d’interface aux détails de l’implémentation, tandis qu’un flux vidéo peut analyser des séquences importées et renvoyer des notes de scène, des résumés ou des métadonnées structurées.
Le modèle est moins pertinent pour la classification courte, les conversations simples ou l’extraction à haut volume lorsqu’un modèle plus petit atteint déjà le seuil de qualité requis. K3 raisonne toujours ; même son niveau d’effort le plus faible doit donc être évalué en termes de latence et de coût des tokens de sortie. Commencez par un flux de travail représentatif, mesurez l’achèvement de la tâche plutôt qu’une seule réponse, puis comparez K3 à un modèle plus petit avant de lui acheminer tout le trafic.
Détails de l’API à vérifier avant la migration
K3 fonctionne avec le SDK OpenAI et le format de requête Chat Completions, mais il présente des comportements spécifiques au modèle qu’un simple remplacement de nom de modèle peut ne pas prendre en compte.
Premièrement, Preserved Thinking est toujours activé. Dans les conversations à plusieurs tours et les boucles d’outils, renvoyez le message complet de l’assistant issu de la réponse précédente, y compris reasoning_content et tool_calls. Conserver uniquement le content visible peut interrompre la continuité du raisonnement et rendre les longues sessions instables. Le raisonnement historique consomme également du contexte et est facturé comme une utilisation de tokens ; condensez donc le travail terminé au lieu de conserver indéfiniment chaque tour.
Deuxièmement, utilisez le champ reasoning_effort de niveau supérieur plutôt que l’ancienne configuration thinking de K2.x. K3 prend en charge low, high et max. Ses valeurs d’échantillonnage sont fixes ; les applications ne doivent donc pas dépendre de paramètres personnalisés de température ou de pénalité.
Troisièmement, analysez les résultats structurés depuis le champ content final, et non depuis reasoning_content. K3 prend en charge le mode JSON et le JSON Schema strict via response_format, ce qui est utile pour les pipelines d’extraction, les arguments d’outils et les résultats de recherche lisibles par machine.
Enfin, les requêtes multimodales nécessitent des parties de contenu structurées. L’interface native de Moonshot accepte les images encodées en base64 ou les références à des fichiers importés, plutôt que des URL d’images publiques. Consultez la documentation GPTProto actuelle pour confirmer les champs exacts relatifs aux images et aux vidéos exposés par ce endpoint avant de déployer un flux de travail multimodal.
Quand choisir Kimi K3 ?
La propre publication de lancement de Moonshot indique que K3 reste derrière Claude Fable 5 et GPT-5.6 Sol en termes de performances globales. La raison de choisir K3 n’est pas de prétendre qu’il remporte tous les benchmarks. Son principal atout réside dans la combinaison d’une fenêtre de contexte d’1 million de tokens, de la compréhension vidéo native, du codage sur de longues séquences et d’un prix par token nettement inférieur.
| Facteur de décision |
Kimi K3 |
GPT-5.6 Sol |
Claude Fable 5 |
| Tarif officiel de l’API par million de tokens |
3 $ en entrée / 15 $ en sortie |
5 $ en entrée / 30 $ en sortie |
10 $ en entrée / 50 $ en sortie |
| Fenêtre de contexte |
1 048 576 |
1 050 000 |
1 000 000 |
| Sortie maximale |
Jusqu’à 1 048 576 dans le contexte ; 131 072 par défaut |
128 000 |
128 000 |
| Entrées natives |
Texte, image, vidéo |
Texte, image |
Texte, image |
| Accès au modèle |
API hébergée ; les poids officiels du modèle sont publiés séparément par Moonshot AI
|
API fermée |
API fermée |
| Meilleure adéquation |
Codage soucieux des coûts, agents multimodaux, vastes ensembles de travail |
Codage haut de gamme, utilisation d’ordinateurs et flux de travail avec les outils OpenAI |
Agents fonctionnant sur de longues périodes, vision complexe et tâches de connaissance premium |
Choisissez K3 lorsque son coût d’API inférieur, son entrée vidéo native ou sa fenêtre de contexte d’1 million de tokens comptent davantage que la victoire dans le plus vaste ensemble d’évaluations de pointe. Choisissez GPT-5.6 Sol ou Claude Fable 5 lorsque votre propre évaluation au niveau de la tâche montre que leur taux de réussite supérieur compense leur prix par token plus élevé. Pour une analyse benchmark par benchmark, consultez Qu’est-ce que Kimi K3—et est-il vraiment proche de GPT-5.6 et de Fable 5 ?.