Mise à jour — 28 juillet 2026 : Moonshot AI a désormais publié les poids complets de Kimi K3, sa fiche modèle, sa licence personnalisée et son rapport technique. Cette publication répond à la question de la disponibilité du côté de Kimi. Elle ne rend pas pour autant un modèle de 2,8 billions de paramètres facile à auto-héberger : le dépôt officiel fait environ 1,56 To et Moonshot recommande des déploiements sur supernœuds avec au moins 64 accélérateurs.
Qwen 3.8 Max vs Kimi K3 ressemble à un duel sans ambiguïté entre deux modèles d’IA chinois géants : l’aperçu d’Alibaba de 2,4 billions de paramètres face au modèle phare de Moonshot AI de 2,8 billions de paramètres. Les chiffres invitent à une conclusion simple. Le modèle le plus grand devrait l’emporter.
Ce n’est pas ce que montrent les éléments disponibles, et ce n’est pas la comparaison la plus utile pour les développeurs.
Au 23 juillet 2026, Qwen 3.8 Max reste un aperçu en évolution distribué via le Token Plan d’Alibaba. Kimi K3 dispose déjà d’une API documentée, de tarifs publiés par jeton, d’une fenêtre de contexte d’un million de jetons et d’un calendrier daté pour la publication de ses poids complets. L’écart de capacités pourrait être faible. L’écart de maturité produit ne l’est pas.
Mon avis est simple : Kimi K3 est le choix le plus sûr si vous devez créer et budgétiser une véritable application aujourd’hui. Qwen 3.8 Max Preview mérite d’être testé dans un flux de travail de programmation, notamment tant que les Credits promotionnels d’Alibaba rendent l’expérimentation peu coûteuse, mais il n’a pas encore fourni suffisamment d’informations stables pour s’imposer dans une décision de production.
En bref : Kimi K3 est le choix de production le plus sûr aujourd’hui
Choisissez Kimi K3 si vous avez besoin d’une API conventionnelle, de coûts prévisibles par jeton, d’une compréhension native des images et des vidéos, ou d’un modèle que vous pouvez intégrer dès maintenant à un produit destiné aux clients. Choisissez Qwen 3.8 Max Preview si vous utilisez déjà l’écosystème de programmation d’Alibaba et souhaitez tester un nouveau modèle prometteur à faible coût promotionnel.
Le seul test détaillé de programmation comparatif disponible au moment de la publication a attribué 83 points à Kimi K3 et 80 à Qwen 3.8 Max. Cet écart de trois points constitue un élément utile, pas un classement universel. Qwen a montré des frontières système plus nettes et une exécution parfaite des outils lors du test ; Kimi a géré plus complètement l’historique des révisions et la régénération. Les deux modèles ont également formulé des déductions non étayées qui ont nécessité une correction factuelle.
En clair : Kimi remporte actuellement la décision de déploiement. Qwen n’a pas perdu le concours des capacités ; il est simplement trop tôt pour déclarer qu’il l’a remporté.
Qwen 3.8 Max vs Kimi K3 en un coup d’œil
| Catégorie |
Qwen 3.8 Max |
Kimi K3 |
| Statut du produit |
API de production stable |
API de production stable |
| Nombre total de paramètres |
2.4T |
2.8T |
| Paramètres actifs |
95B |
104B |
| Fenêtre de contexte |
Jusqu’à 1 M de jetons |
1 048 576 jetons |
| Entrées |
Texte, images et vidéos |
Texte, images et vidéos |
| Tarif officiel de l’API |
$2/M en entrée, $6/M en sortie |
$3/M en entrée, $15/M en sortie |
| Accès GPT Proto |
Disponible maintenant |
Disponible maintenant |
| Poids ouverts |
Annoncés ; pas encore téléchargeables |
Publiés |
| Meilleur usage avec une API hébergée |
Programmation multimodale sensible au coût et agents longue durée |
Agents avec de nombreuses révisions et flux de travail spécifiques à Kimi |
| Meilleur choix pour l’auto-hébergement |
Attendre le checkpoint et la licence |
Kimi K3, avec du matériel à l’échelle d’un centre de données |
La comparaison est désormais plus équilibrée — mais le déploiement reste différent
Qwen3.8-Max et Kimi K3 sont désormais tous deux des modèles d’API de production viables. La principale différence n’est plus « aperçu contre production ». Il s’agit maintenant de la valeur d’une API hébergée contre la propriété immédiate de poids ouverts.
Qwen 3.8 Max est désormais une API de production stable
Alibaba a publié le modèle stable qwen3.8-max le 3 août 2026, remplaçant le positionnement antérieur de la version Preview par un accès API normal à la consommation.
La version de production documente une architecture Sparse Mixture-of-Experts de 2,4 billions de paramètres, dont environ 95 milliards sont actifs par requête. Elle prend en charge une fenêtre de contexte allant jusqu’à 1 million de jetons, jusqu’à 128 000 jetons en sortie, ainsi que les entrées texte, image et vidéo.
Cela modifie la comparaison pratique. Qwen3.8-Max peut désormais être évalué pour des applications destinées aux clients, des agents de programmation, des analyses multimodales et d’autres charges de production sans dépendre de l’ancien Personal Token Plan basé sur les Credits.
Son tarif officiel est également inférieur à celui de Kimi K3 :
| Modèle |
Tarif des entrées |
Tarif des sorties |
| Qwen3.8-Max |
$2 par million de jetons |
$6 par million de jetons |
| Kimi K3 |
$3 par million de jetons |
$15 par million de jetons |
Pour les équipes utilisant une API hébergée, Qwen3.8-Max sur GPT Proto est désormais une véritable option de production, plutôt qu’un endpoint expérimental.
Cependant, le checkpoint à poids ouverts annoncé par Alibaba n’a pas encore été publié. Les développeurs ne doivent pas supposer que les poids finaux, la licence ou les conditions d’auto-hébergement sont disponibles tant qu’ils n’ont pas été officiellement publiés.
Kimi K3 a publié ses poids téléchargeables
Kimi K3 est disponible à la fois via une API hébergée et via un checkpoint téléchargeable. Moonshot AI a publié les poids du modèle, sa fiche, son rapport technique, ses recommandations de déploiement et sa licence personnalisée.
Kimi K3 possède 2,8 billions de paramètres au total et active environ 104 milliards de paramètres par jeton. Sa documentation de déploiement couvre notamment vLLM, SGLang et TokenSpeed, offrant aux équipes une voie plus claire vers une infrastructure contrôlée ou privée.
Kimi K3 devient ainsi le choix le plus pratique lorsque des poids téléchargeables, la maîtrise du déploiement ou l’auto-hébergement immédiat constituent une exigence ferme.
Les poids ouverts ne rendent pas Kimi K3 facile ou peu coûteux à exécuter localement. Il reste un modèle de plusieurs billions de paramètres qui nécessite du stockage, de la mémoire, du réseau et une capacité d’accélération à l’échelle d’un centre de données. Sa licence personnalisée peut également imposer des conditions aux très grands produits commerciaux ou aux déploiements Model-as-a-Service.
Ce que signifie la différence de déploiement
| Besoin de déploiement |
Meilleur point de départ |
Pourquoi |
| API de production hébergée |
Qwen 3.8 Max |
API stable avec un tarif officiel des jetons de sortie nettement inférieur |
| Programmation multimodale et analyse visuelle |
Qwen 3.8 Max |
Entrées natives de texte, d’image et de vidéo |
| Poids téléchargeables aujourd’hui |
Kimi K3 |
Son checkpoint et sa licence sont déjà publics |
| Déploiement privé ou contrôlé |
Kimi K3 |
Les équipes peuvent déployer le modèle publié sur leur propre infrastructure |
| Installation locale facile |
Aucun des deux |
Les deux modèles nécessitent une infrastructure importante pour l’auto-hébergement |
| Tests API en comparaison directe |
Tester les deux |
Comparer les tâches acceptées, les nouvelles tentatives, les échecs d’outils, la latence et le coût total |
La comparaison n’est donc plus inégale parce que Qwen est « seulement une Preview ». Les deux modèles peuvent servir des charges de production via API. La différence restante est plus simple : Qwen3.8-Max offre actuellement le meilleur compromis coût-capacités pour une API hébergée, tandis que Kimi K3 offre un accès immédiat à des poids publiés et un contrôle accru du déploiement.
Comment les développeurs doivent tester Qwen 3.8 Max face à Kimi K3
| Test |
Donner aux deux modèles |
Mesurer |
| Examen de l’architecture du dépôt |
Le même commit figé, la même question d’architecture, les mêmes outils en lecture seule et la même limite de temps |
Citations correctes des fichiers, dépendances manquées, affirmations non étayées et temps de revue |
| Implémentation multi-fichiers |
Le même problème, les mêmes tests, les mêmes fichiers modifiables et les mêmes autorisations d’outils |
Tests réussis, fichiers modifiés, nouvelles tentatives, régressions et corrections humaines |
| Réparation d’une interface frontend visuelle |
La même capture d’écran, les mêmes fichiers source, les mêmes outils de navigateur et le même comportement cible |
Conformité visuelle, code valide, boucles de correction et résultat du test final |
Conservez le même environnement agent et les mêmes autorisations. Définissez une limite de temps fixe. Notez l’identifiant complet du modèle et la date, en particulier pour la Preview évolutive de Qwen. Enregistrez ensuite l’achèvement de la tâche, le temps écoulé, les jetons d’entrée et de sortie, les accès au cache, les appels d’outils échoués, les nouvelles tentatives, les interventions humaines et les tests finaux réussis.
Ne notez pas une réponse parce qu’elle « semble approfondie ». Vérifiez si le correctif fonctionne et si les affirmations du modèle résistent à la revue.
Pour les décisions d’architecture à forte valeur, une autre méthode est utile : exécuter les deux modèles indépendamment, masquer leur identité pendant la revue et comparer leurs désaccords. Le test portant sur 269 fichiers n’a produit sa meilleure conception qu’après avoir combiné les frontières système de Qwen avec le modèle de cycle de vie de Kimi. Parfois, la bonne réponse à Qwen contre Kimi est les deux, suivis d’une vérification.
Tarifs de Qwen 3.8 Max vs Kimi K3
| Modèle |
Tarif officiel des entrées |
Tarif officiel des sorties |
| Qwen3.8-Max |
$2 par million de jetons |
$6 par million de jetons |
| Kimi K3 |
$3 par million de jetons |
$15 par million de jetons |
| Kimi K3 sur GPT Proto |
$2.70 par million de jetons |
$13.50 par million de jetons |
Au tarif officiel, les jetons de sortie de Qwen coûtent 60 % moins cher que ceux de Kimi K3. Cette différence compte pour les agents de programmation exigeant beaucoup de raisonnement, qui produisent de longs plans, des traces d’outils, des explications et des correctifs.
Le prix des jetons ne représente pas l’intégralité du coût. Mesurez les nouvelles tentatives, les appels d’outils échoués, les corrections humaines, la latence et l’achèvement des tâches acceptées. Kimi peut malgré tout être moins cher dans un flux de travail donné si sa meilleure gestion des révisions et du cycle de vie évite des boucles de réparation coûteuses.
Consultez la page de l’API Qwen3.8-Max pour connaître le tarif actuel de GPT Proto avant de calculer un budget de production.
Quel modèle choisir ?
| Situation |
Meilleur choix |
Pourquoi |
| API de production hébergée |
Qwen 3.8 Max |
Accès stable et tarif officiel des sorties nettement inférieur |
| Programmation multimodale complexe |
Qwen 3.8 Max |
Entrées texte, image et vidéo avec un positionnement solide pour le frontend et les agents visuels |
| Frontières d’architecture et discipline des outils |
Tester Qwen en premier |
La Preview a réussi les 44 appels d’outils sur 44 lors du test comparatif |
| Historique des révisions et de la régénération |
Tester Kimi en premier |
Kimi a géré plus complètement l’état du cycle de vie lors du test comparatif |
| Poids téléchargeables aujourd’hui |
Kimi K3 |
Le checkpoint complet et la licence sont déjà publics |
| Complexité d’auto-hébergement minimale |
Aucun des deux |
Les deux sont des modèles de plusieurs billions de paramètres nécessitant une infrastructure importante |
| Un seul compte pour les tests comparatifs |
Les deux via GPT Proto |
Exécuter la même tâche avec les mêmes outils, paramètres de raisonnement et critères d’évaluation |
Entrées multimodales, raisonnement et comportement des agents
| Capacité |
Qwen 3.8 Max Preview |
Kimi K3 |
| Compréhension des images |
Documentée |
Documentée |
| Compréhension des vidéos |
Pas clairement documentée comme entrée actuelle du modèle |
Documentée |
| Mode réflexion |
Toujours activé |
Toujours activé |
| Niveaux de raisonnement |
low, high, xhigh |
low, high, max |
| Niveau de raisonnement par défaut |
xhigh |
max |
| Fenêtre de contexte |
Pas clairement indiquée sur la page produit actuelle |
1 048 576 jetons |
| Sortie structurée |
Les capacités de la Preview nécessitent une vérification continue |
Mode JSON et JSON Schema strict documentés |
| Longs historiques d’outils |
Le comportement peut changer avec la Preview |
Les messages complets de l’assistant, y compris le contenu du raisonnement, doivent être conservés |
La prise en charge documentée de la vision par Qwen le rend pertinent pour le débogage basé sur des captures d’écran. Kimi va plus loin en acceptant les vidéos, ce qui est utile lorsque l’entrée est un enregistrement d’écran, une référence d’animation ou une démonstration de produit difficile à décrire image par image.
L’interface documentée plus riche de Kimi ajoute également du travail d’intégration. Son comportement Preserved Thinking signifie qu’une application multi-tour doit renvoyer le message complet de l’assistant, y compris le contenu du raisonnement et les appels d’outils, plutôt que de conserver uniquement la réponse visible. Cet historique occupe de l’espace dans le contexte et est facturé. La fenêtre d’un million de jetons est grande, mais ce n’est pas un stockage gratuit.
Les deux modèles utilisent par défaut leur niveau de raisonnement le plus élevé. Pour l’évaluation, conservez des paramètres cohérents. En production, testez un effort moindre sur les tâches simples. Un modèle qui résout 99 % des requêtes avec un effort réduit peut être moins cher et plus rapide qu’un modèle laissé au raisonnement maximal pour chaque autocomplétion, classification ou transformation courte.
Quel modèle choisir ?
| Votre situation |
Meilleur choix actuel |
Pourquoi |
| Créer dès maintenant une application destinée aux clients |
Kimi K3 |
API conventionnelle et tarif prévisible par jeton |
| Exécuter une longue tâche sur un dépôt avec des entrées image ou vidéo |
Kimi K3 |
Contexte d’un million de jetons et prise en charge documentée des images et vidéos |
| Tester dans Qwen Code, Qoder ou un autre outil Alibaba pris en charge |
Qwen 3.8 Max Preview |
Faible consommation de Credits promotionnels |
| Besoin de benchmarks stables et reproductibles |
Kimi K3, pour le moment |
La Preview de Qwen peut changer d’une exécution à l’autre |
| Besoin de l’architecture la plus claire et de métadonnées de rejeu |
Tester Qwen |
Il a montré un avantage réel lors de l’examen d’architecture comparatif |
| Besoin d’une gestion solide des révisions et de la régénération |
Tester Kimi |
Il s’est montré plus complet lors du test comparatif disponible |
| Besoin de poids téléchargeables aujourd’hui |
Kimi K3 |
Le checkpoint complet est public ; Qwen 3.8 Max n’a toujours pas publié ses poids |
| Besoin de comparer plusieurs familles de modèles avec un seul compte |
Kimi K3 sur GPT Proto |
Une clé et un solde donnent accès à un catalogue de modèles plus vaste |
Pour une application mise en ligne cette semaine, je choisirais Kimi K3. Il dispose de suffisamment d’informations publiées pour estimer le coût, définir le comportement de l’intégration et répéter un test avec un nom de modèle stable.
Pour une expérimentation interne de programmation, je n’ignorerais pas Qwen. Sa Preview a réalisé une longue analyse de dépôt sans aucun appel d’outil échoué et a montré de meilleures frontières architecturales que Kimi lors du test comparatif. C’est un signal de capacité sérieux. Ce n’est pas encore un contrat de production.
Comment essayer Kimi K3 via GPT Proto
Qwen 3.8 Max n’est pas encore disponible sur GPT Proto ; l’exemple d’intégration actuel utilise donc uniquement Kimi K3. Vous pouvez l’appeler via l’endpoint Chat Completions compatible OpenAI de GPT Proto avec la chaîne de modèle kimi-k3 :
curl https://gptproto.com/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: $GPTPROTO_API_KEY" \
-d '{
"model": "kimi-k3",
"messages": [
{
"role": "user",
"content": "Review this migration plan. Identify unsupported assumptions, missing rollback steps, and the tests required before production."
}
]
}'
L’endpoint et la structure d’autorisation suivent le guide de démarrage rapide de l’API GPT Proto. Pour les flux Kimi multi-tours, conservez le message complet de l’assistant renvoyé par l’API, y compris les champs de raisonnement et d’appel d’outils, plutôt que de stocker uniquement le texte final visible.
Vous pouvez essayer l’API Kimi K3, parcourir plus de 200 modèles d’IA ou utiliser l’API d’IA unifiée GPT Proto pour comparer Kimi à d’autres modèles de texte, d’image, de vidéo et d’audio. Lorsque Qwen 3.8 Max sera ajouté, le test utile consistera à exécuter la même tâche, avec le même prompt, les mêmes autorisations d’outils et la même méthode d’évaluation sur les deux endpoints de modèle.
Verdict final
Kimi K3 ne l’emporte plus simplement parce que Qwen est une Preview. Qwen3.8-Max dispose désormais d’une API stable, d’une facturation normale à l’usage, de spécifications documentées et d’un accès direct via GPT Proto.
Pour la plupart des équipes qui choisissent un modèle hébergé, Qwen3.8-Max constitue le meilleur point de départ, car son tarif officiel de $2/$6 est très inférieur à celui de Kimi K3, à $3/$15, en particulier pour les tâches d’agents fortement axées sur la sortie.
Kimi K3 reste le meilleur choix lorsque les poids téléchargeables et la maîtrise du déploiement sont non négociables. Sa meilleure gestion des révisions et de la régénération lors du test comparatif disponible mérite également d’être évaluée pour les flux de travail créatifs et techniques riches en états.
La réponse claire est désormais la suivante : Qwen pour le coût hébergé et les larges capacités multimodales ; Kimi pour les poids publiés et les tâches exigeant une gestion poussée du cycle de vie.