DeepSeek V4 Pro 0813 vs Kimi K3 en un coup d’œil
| Catégorie |
DeepSeek V4 Pro 0813 |
Kimi K3 |
Meilleur choix |
| Indice d’intelligence indépendant actuel |
53 |
60 |
Kimi K3 |
| Vitesse de sortie |
83.2 tokens/s |
40.8 tokens/s |
DeepSeek V4 Pro |
| Délai avant le premier token |
1.63 seconde |
2.97 secondes |
DeepSeek V4 Pro |
| Fenêtre de contexte |
Environ 1 M de tokens |
Environ 1 M de tokens |
Égalité |
| Prix des entrées sur GPT Proto |
$1.044 par million de tokens |
$2.70 par million de tokens |
DeepSeek V4 Pro |
| Prix des sorties sur GPT Proto |
$2.088 par million de tokens |
$13.50 par million de tokens |
DeepSeek V4 Pro |
| Entrées disponibles sur GPT Proto |
Texte |
Texte, image, document |
Kimi K3 |
| Contrôle du raisonnement |
Sans réflexion, élevé, maximal |
Raisonnement permanent avec contrôle de l’effort |
Dépend du flux de travail |
| Licence des poids ouverts |
MIT |
Licence Kimi K3 |
DeepSeek pour un auto-hébergement commercial plus simple |
| Cas d’utilisation idéal |
Codage textuel et agents à grand volume |
Tâches d’agents multimodales et visuelles complexes |
Dépend de la tâche |
Les chiffres de référence, de vitesse et de latence ci-dessus proviennent de l’évaluation comparative d’Artificial Analysis. Son indice d’intelligence utilise le même cadre d’évaluation pour les deux modèles, ce qui le rend plus utile que de placer côte à côte les graphiques de lancement de deux fournisseurs.
Qu’est-ce qui a changé dans DeepSeek V4 Pro 0813 ?
DeepSeek V4 Pro 0813 est la version de production actuelle de V4 Pro, et non un produit API distinct. La documentation de DeepSeek indique que l’alias deepseek-v4-pro pointe désormais vers DeepSeek-V4-Pro-0813 et que la méthode d’appel reste inchangée. La même documentation mentionne une fenêtre de contexte d’un million de tokens, jusqu’à 384 K tokens en sortie, des modes avec et sans réflexion, la sortie JSON et l’appel d’outils.
Cette décision de nommage est importante, car les noms de modèles datés obligent souvent les développeurs à modifier les fichiers de configuration, les règles de routage et les enregistrements d’évaluation. Ici, la mise à niveau s’effectue derrière l’alias stable. Sur GPT Proto, le même principe s’applique : conservez deepseek-v4-pro dans votre requête.
Le résultat indépendant actuel diffère également des chiffres présents dans de nombreux articles comparatifs de juillet. Artificial Analysis attribue désormais au modèle 0813 un score d’indice d’intelligence de 53 avec un effort de raisonnement maximal. Kimi K3 obtient 60 dans l’évaluation actuelle.
Je ne qualifierais pas cela d’amélioration nette de neuf points par rapport à l’ancien score de 44. Le modèle a changé, mais les suites de tests et les versions d’évaluation peuvent également évoluer. La conclusion défendable est plus nuancée : les comparaisons fondées sur l’aperçu ne décrivent plus le modèle actuellement proposé, et les tests indépendants récents placent 0813 plus près de Kimi K3 que ne le suggéraient les articles de l’ère de l’aperçu.
DeepSeek n’a pas modifié la structure fondamentale du produit. Il reste un modèle Mixture-of-Experts de 1,6 billion de paramètres, dont 49 milliards sont actifs par token, avec des entrées textuelles, une capacité de sortie importante et un effort de raisonnement configurable. La version 0813 doit donc être considérée comme une mise à niveau de production et de post-entraînement plutôt que comme une nouvelle branche multimodale.
Benchmarks : Kimi K3 reste en tête, mais pas partout
Kimi K3 domine la comparaison indépendante globale, avec 60 contre 53. Cette différence de sept points compte lorsqu’un flux de travail combine raisonnement, connaissances, codage et planification à long horizon. Elle ne signifie pas que Kimi produira un meilleur résultat sur chaque dépôt ou chaque invite.
Les deux modèles font des compromis différents. Moonshot décrit Kimi K3 comme un modèle d’agent natif multimodal de 2,8 billions de paramètres, conçu pour le codage à long horizon et les tâches nécessitant des connaissances. Sa fiche officielle du modèle documente la compréhension du texte, des images et des vidéos dans le modèle en amont, ainsi qu’une fenêtre de contexte d’un million de tokens. La route Kimi K3 actuelle de GPT Proto répertorie les entrées texte, image et document.
DeepSeek V4 Pro 0813 est uniquement textuel, mais il produit 83,2 tokens par seconde lors des tests d’Artificial Analysis. Kimi K3 atteint 40,8 tokens par seconde. DeepSeek commence également à répondre plus tôt, avec un délai de 1,63 seconde avant le premier token, contre 2,97 secondes pour Kimi.
En termes simples : Kimi obtient un score de capacité globale plus élevé. DeepSeek renvoie du texte environ deux fois plus vite et coûte beaucoup moins cher.
Il existe un autre piège concernant les benchmarks. Les scores de codage des fournisseurs utilisent souvent des configurations d’agents, des paramètres de raisonnement, des instantanés de dépôts ou des critères de réussite différents. Un score Kimi obtenu avec Kimi Code ne peut pas être automatiquement comparé à un score DeepSeek produit avec une autre configuration d’évaluation. Pour sélectionner un modèle, utilisez des évaluations indépendantes et comparables comme référence commune, puis testez la tâche qui influence votre produit.
Cet article ne prétend pas présenter un test de codage privé avec la même invite. Sans un tel test, déclarer l’un ou l’autre modèle vainqueur universel du codage serait aller au-delà de ce que permettent les preuves.
Quel modèle est le meilleur pour le codage et les flux de travail d’agents ?
Pour le codage textuel à grand volume, je commencerais par DeepSeek V4 Pro 0813.
La raison n’est pas qu’il surpasse Kimi sur tous les critères. Ce n’est pas le cas. La raison est que les agents de codage en production consomment de manière répétée du contexte et génèrent du raisonnement, des correctifs, des plans de test et des instructions d’outils. Le prix des sorties s’accumule à chaque boucle. Les modes de raisonnement configurables de DeepSeek permettent également aux développeurs de réserver l’effort maximal aux tâches difficiles, au lieu de payer le même niveau de raisonnement à chaque requête.
DeepSeek constitue donc un excellent choix par défaut pour :
Lecture de dépôts et questions-réponses sur le code
Revue des pull requests
Localisation des bugs
Plans de refactorisation
Génération de tests
Appel d’outils textuels
Agents d’arrière-plan à grand volume
Réponses JSON structurées
Kimi K3 devient plus intéressant lorsque le coût d’une tentative échouée dépasse celui des tokens. Son score d’intelligence indépendant plus élevé en fait un modèle d’escalade raisonnable pour les tâches longues et difficiles que DeepSeek ne parvient pas à terminer. C’est également l’option évidente lorsque la requête contient des éléments visuels.
Un schéma de production pratique ne consiste donc pas à « en choisir un pour toujours ». Acheminez les tâches textuelles courantes vers DeepSeek, puis relancez certaines tâches échouées ou multimodales avec Kimi. Comme les deux modèles sont disponibles via une seule clé API GPT Proto et un solde partagé, le changement peut se limiter au champ model.
DeepSeek V4 Pro vs Kimi K3 pour le codage frontend
Le « codage frontend » recouvre deux charges de travail différentes, qu’il ne faut pas réduire à un seul verdict.
La première est la transformation de texte en code : génération de composants React, de CSS, de structures de pages, de corrections d’accessibilité ou de logique TypeScript à partir d’une spécification écrite. Il n’existe pas encore suffisamment de données publiques comparables pour affirmer que Kimi K3 ou DeepSeek V4 Pro 0813 domine universellement cette catégorie. Le coût inférieur et la vitesse de sortie supérieure de DeepSeek en font la première tentative la plus économique.
La seconde est l’itération frontend visuelle : montrer une capture d’écran au modèle, lui demander d’identifier les problèmes d’espacement ou de mise en page, puis réviser l’interface à partir des commentaires visuels. Kimi K3 est mieux adapté à ce flux de travail, car il accepte les entrées d’image. DeepSeek V4 Pro est uniquement textuel ; un développeur devrait donc traduire la capture en texte ou utiliser d’abord un modèle de vision distinct.
Utilisez DeepSeek pour implémenter à grande échelle des interfaces décrites par du texte. Utilisez Kimi lorsque le modèle doit voir l’interface.
Tarification de l’API : DeepSeek gagne davantage que ne le suggère le titre
GPT Proto facture actuellement DeepSeek V4 Pro à 1,044 $ par million de tokens en entrée et 2,088 $ par million de tokens en sortie. Kimi K3 coûte 2,70 $ en entrée et 13,50 $ en sortie.
| Prix GPT Proto par million de tokens |
DeepSeek V4 Pro |
Kimi K3 |
Multiple du prix de Kimi |
| Entrée |
$1.044 |
$2.70 |
2.59× |
| Sortie |
$2.088 |
$13.50 |
6.47× |
DeepSeek est 61,3 % moins cher en entrée et 84,5 % moins cher en sortie. La différence de sortie est la plus importante pour les agents nécessitant beaucoup de raisonnement, car leur travail interne et leurs réponses finales peuvent devenir longs.
Les prix des tokens restent abstraits ; examinons donc deux charges de travail hypothétiques.
| Charge de travail |
Hypothèse de tokens |
DeepSeek V4 Pro |
Kimi K3 |
| Revue de code volumineuse |
100 K en entrée + 20 K en sortie |
$0.146 |
$0.540 |
| Tâche d’agent à l’échelle d’un dépôt |
1 M en entrée + 250 K en sortie |
$1.566 |
$6.075 |
Dans l’exemple à l’échelle d’un dépôt, Kimi coûte environ 3,88 fois plus cher. Cela ne signifie pas nécessairement que Kimi offre un mauvais rapport qualité-prix. S’il termine une tâche difficile en une seule tentative alors qu’un modèle moins cher nécessite plusieurs nouvelles tentatives et une correction humaine, l’appel plus coûteux peut tout de même revenir moins cher au total.
La bonne mesure de production est le coût du résultat accepté, et non le seul coût des tokens. Enregistrez le modèle, les tokens, les tentatives, la latence, le résultat des tests et l’acceptation par le réviseur pour chaque catégorie de tâche. Un tarif par token faible ne devient une véritable économie que lorsque la sortie est validée.
Vitesse et latence
Artificial Analysis mesure actuellement DeepSeek V4 Pro 0813 à 83,2 tokens de sortie par seconde et Kimi K3 à 40,8. Le délai avant le premier token est de 1,63 seconde pour DeepSeek et de 2,97 secondes pour Kimi.
Ces chiffres favorisent DeepSeek pour les assistants de codage interactifs et les agents parallèles. Un modèle qui renvoie les tokens deux fois plus vite peut réduire l’attente visible, même lorsque les deux modèles finissent par fournir une réponse acceptable.
Cependant, la vitesse d’un fournisseur n’est pas une propriété permanente des poids. Elle dépend également de la charge des serveurs, de la quantification, du traitement par lots, de la longueur de l’invite, de l’effort de raisonnement et de l’emplacement où la requête est traitée. Considérez les mesures actuelles comme un instantané comparable, et non comme une garantie de latence pour chaque appel.
Différences de contexte, de raisonnement et de déploiement
Les deux modèles prennent en charge environ un million de tokens de contexte ; la taille du contexte ne suffit donc pas à décider de cette comparaison. La manière dont ils utilisent ce contexte est plus importante.
DeepSeek prend en charge les modes sans réflexion et avec réflexion, avec des contrôles de l’effort de raisonnement pour les tâches plus difficiles. Il autorise également jusqu’à 384 K tokens en sortie selon la spécification actuelle de l’API DeepSeek. Cette flexibilité convient aux systèmes de routage qui utilisent des réponses rapides pour les tâches simples et un raisonnement plus approfondi uniquement lorsque cela est nécessaire.
Kimi K3 utilise un raisonnement permanent avec un effort configurable. Son architecture plus vaste de 2,8 T et sa conception multimodale ciblent les tâches à long horizon impliquant des documents, du code, des images et l’utilisation d’outils. Le compromis est un coût de sortie plus élevé et une génération mesurée plus lente.
Les deux modèles disposent de poids téléchargeables, mais « poids ouverts » ne signifie pas licences identiques. DeepSeek V4 Pro utilise la licence MIT. Kimi K3 utilise sa propre licence Kimi K3. Les équipes qui prévoient un auto-hébergement commercial doivent examiner les conditions exactes de Kimi plutôt que de supposer qu’elles correspondent à la licence MIT.
Les besoins matériels dépassent également largement ceux d’un poste de travail local ordinaire. Pour la plupart des équipes de développement, l’évaluation via une API hébergée constitue le point de départ réaliste, même lorsque les poids sont disponibles.
Comment accéder à DeepSeek V4 Pro 0813 et Kimi K3 avec une seule clé API
GPT Proto expose les deux modèles via un point de terminaison de complétion de chat compatible avec OpenAI. Commencez avec DeepSeek en définissant MODEL_ID sur deepseek-v4-pro :
export GPTPROTO_API_KEY="your_api_key"
export MODEL_ID="deepseek-v4-pro"
curl --request POST "https://gptproto.com/v1/chat/completions" \
--header "Authorization: Bearer $GPTPROTO_API_KEY" \
--header "Content-Type: application/json" \
--data "{
\"model\": \"$MODEL_ID\",
\"messages\": [
{
\"role\": \"user\",
\"content\": \"Review this function for correctness and return the answer as concise Markdown.\"
}
]
}"
Pour envoyer la même requête textuelle à Kimi K3, modifiez une seule ligne :
export MODEL_ID="kimi-k3"
Exécutez ensuite à nouveau la même requête curl. Vous n’avez pas besoin d’un compte Moonshot distinct, d’un second solde ou d’un suffixe de version DeepSeek.
Pour une comparaison contrôlée, conservez la même invite, le même contexte, le même paramètre de raisonnement et la même limite de sortie. Consignez les champs d’utilisation renvoyés ainsi que la latence, le nombre de tentatives et la réussite ou l’échec des tests. Comparer une réponse particulièrement réussie de chaque modèle ne suffit pas pour prendre une décision de routage en production.
Quel modèle devriez-vous choisir ?
Choisissez DeepSeek V4 Pro 0813 lorsque :
Votre charge de travail porte principalement sur le texte et le code
Le volume de sorties rend le coût des tokens important
Une faible latence améliore l’expérience utilisateur
Vous voulez disposer de modes sans réflexion et de raisonnement approfondi sous un même identifiant de modèle
Vous avez besoin d’une solution d’auto-hébergement sous licence MIT
Vous choisissez un modèle par défaut pour des agents à grand volume
Choisissez Kimi K3 lorsque :
Le modèle doit examiner des captures d’écran, des images ou des documents
Le score d’intelligence indépendant actuel le plus élevé compte davantage que le prix
L’échec d’une tâche coûte plus cher qu’un appel API premium
Vous développez des agents multimodaux à long horizon
Vous souhaitez transmettre les requêtes les plus difficiles après l’échec d’un modèle moins cher
Pour la plupart des développeurs, la meilleure stratégie de routage consiste à utiliser DeepSeek en premier, puis Kimi lorsque cela est nécessaire. Elle permet de profiter de la plupart des avantages de DeepSeek en matière de coût et de vitesse sans renoncer à l’accès aux capacités multimodales de Kimi ni à son plafond de capacité supérieur.
Verdict final
DeepSeek V4 Pro 0813 est le meilleur choix par défaut pour la plupart des charges de travail de codage textuel et d’agents. Il accuse un retard de sept points sur Kimi K3 dans l’indice d’intelligence d’Artificial Analysis actuel, mais produit des sorties environ deux fois plus vite et coûte beaucoup moins cher sur GPT Proto, en particulier pour les boucles d’agents générant beaucoup de sorties.
Kimi K3 est le meilleur spécialiste. Choisissez-le lorsque la tâche comprend des entrées visuelles, lorsque le raisonnement le plus approfondi possible compte davantage que le coût, ou lorsque DeepSeek a déjà échoué et qu’une nouvelle tentative revient moins cher qu’une récupération manuelle.
La mise à jour 0813 ne rend pas Kimi obsolète. Elle clarifie la décision de routage : DeepSeek pour le volume, la vitesse et le texte ; Kimi pour le multimodal et le plafond de capacités mesuré plus élevé.