Tarifs+7% bonus

Les heures de pointe de DeepSeek sont désormais en vigueur : quand l'API coûte-t-elle plus cher ?

Qu'est-ce que la tarification de pointe DeepSeek ? DeepSeek vient de passer son API à une tarification de pointe/creuse. Découvrez quand l'API coûte plus cher, combien, et comment réduire votre facture de moitié.

Les heures de pointe de DeepSeek sont désormais en vigueur : quand l'API coûte-t-elle plus cher ?

Si, à votre réveil le 17 août, la facture de votre API DeepSeek semblait soudainement différente, vous ne rêvez pas. DeepSeek a officiellement lancé Peak Pricing — un modèle de facturation basé sur les heures de pointe et les heures creuses qui fait varier ce que vous payez par token selon le moment où vos requêtes atteignent l'API.

En bref : exécutez vos charges de travail pendant les heures de pointe et vous payez plein tarif. Déplacez-les vers les heures creuses et vous payez la moitié. Ce guide explique exactement ce qu'est DeepSeek Peak Pricing, quand l'API coûte plus cher, combien elle coûte à chaque palier, et ce à quoi vous devez faire attention.

Table des matières

Qu’est-ce que la tarification de pointe de DeepSeek ?

La tarification de pointe DeepSeek est un système de facturation dynamique selon l’heure de la journée pour l’API DeepSeek. Au lieu d’appliquer un tarif unique et fixe 24 h/24, DeepSeek divise désormais chaque journée en deux fenêtres :

  • Heures de pointe — les fenêtres les plus chargées, facturées au tarif plein (plus élevé).

  • Heures creuses — tout le reste, facturé exactement la moitié du tarif de pointe.

La nouvelle tarification est entrée en vigueur à 00:00 heure de Pékin (UTC+8) le 17 août 2026, et s’applique à l’ensemble des modèles actuels de DeepSeek, notamment DeepSeek-V4-Flash et DeepSeek-V4-Pro.

Si vous avez déjà utilisé des services cloud avec des remises « spot » ou « heures creuses », le principe vous semblera familier : le fournisseur incite le trafic non urgent à se déplacer vers les périodes plus calmes en le rendant moins cher, ce qui lisse la demande sur son infrastructure.


Quand l’API DeepSeek coûte-t-elle plus cher ? (Heures de pointe vs heures creuses)

C’est le point le plus important à retenir. La tarification de pointe s’applique pendant ces deux fenêtres quotidiennes :

Fenêtre Heure de Pékin (UTC+8) Tarif
Pointe (matin) 09:00 – 12:00 Plein tarif
Pointe (après-midi) 14:00 – 18:00 Plein tarif
Heures creuses (toutes les autres heures) 18:00 – 09:00 le lendemain, plus 12:00 – 14:00 50 % de réduction

En d’autres termes, l’API coûte plus cher pendant 7 heures par jour au total (09:00–12:00 et 14:00–18:00, heure de Pékin). Les 17 heures restantes sont à moitié prix, y compris la pause déjeuner entre les deux blocs de pointe.

Conseil rapide pour les utilisateurs du monde entier : Convertissez ces fenêtres dans votre fuseau horaire. Les créneaux 09:00–12:00 / 14:00–18:00 à Pékin correspondent à peu près à la journée de travail standard en Chine. Si vous êtes aux États-Unis ou en Europe, une grande partie de votre journée de travail peut en fait tomber dans la fenêtre creuse de DeepSeek — ce qui signifie que vous pourriez bénéficier du tarif réduit sans rien changer.

Tarification de pointe DeepSeek : détail complet des prix

Tous les prix ci-dessous sont indiqués par 1M de tokens, convertis à partir des tarifs officiels de DeepSeek en CNY en dollars USD approximatifs (≈ 1 $ = 7,2 ¥). La tarification des heures creuses est toujours la moitié du tarif de pointe.

DeepSeek-V4-Flash

Le niveau léger et très rapide — idéal pour les tâches à fort volume et sensibles à la latence.

Type de token Heures creuses (par 1M) Heures de pointe (par 1M)
Entrée (cache hit) ~$0.007 ~$0.014
Entrée (cache miss) ~$0.21 ~$0.42
Sortie ~$0.63 ~$1.25

👉 Découvrez DeepSeek-V4-Flash sur GPT Proto →

DeepSeek-V4-Pro

Le niveau de raisonnement phare — conçu pour les charges de travail complexes et exigeant une grande précision.

Type de token Heures creuses (par 1M) Heures de pointe (par 1M)
Entrée (cache hit) ~$0.021 ~$0.042
Entrée (cache miss) ~$0.63 ~$1.25
Sortie ~$1.88 ~$3.75

👉 Découvrez DeepSeek-V4-Pro sur GPT Proto →

(Les montants en USD sont approximatifs et fournis à titre indicatif ; la tarification officielle de DeepSeek est libellée en CNY et peut varier selon les taux de change.)


La tarification de pointe DeepSeek coûte-t-elle plus cher ou moins cher ?

La réponse honnête : tout dépend du moment où vous exécutez vos requêtes.

  • Si votre trafic tombe pendant les heures de pointe → vous payez plus que ne le laisserait croire une comparaison naïve avec les anciens tarifs fixes, car la pointe est au tarif plein (plus élevé).

  • Si votre trafic tombe pendant les heures creuses → vous payez la moitié du tarif de pointe, soit une vraie réduction significative.

La tarification de pointe n’est pas une hausse de prix générale déguisée en fonctionnalité. C’est une redistribution : la même charge de travail peut vous coûter jusqu’à 2× plus cher ou jusqu’à 50 % de moins que le tarif de pointe, uniquement selon le moment. Pour quiconque exécute des traitements par lots, du traitement de données hors ligne, des résumés nocturnes ou des pipelines non urgents, la fenêtre creuse est pratiquement de l’argent gratuit — planifiez le travail en dehors de 09:00–12:00 et 14:00–18:00, heure de Pékin, et réduisez la facture de moitié.

Pourquoi DeepSeek utilise-t-il une tarification de pointe ?

La tarification de pointe résout un problème d’infrastructure classique : la demande est inégale. Pendant les heures de travail en Chine, le trafic de l’API atteint des pics ; la nuit, les serveurs restent relativement inactifs. Un tarif fixe oblige DeepSeek à dimensionner pour les pics et à absorber le gaspillage pendant les creux.

En rendant les heures creuses moins chères, DeepSeek :

  1. Lisse la demande — incite les charges de travail flexibles à se déplacer vers les heures plus calmes, réduisant ainsi la congestion pendant les pics.

  2. Améliore la fiabilité — moins de surcharge aux heures de pointe signifie une latence et une disponibilité plus constantes quand c’est important.

  3. Réduit les coûts pour les utilisateurs flexibles — les équipes qui n’ont pas besoin de réponses en temps réel bénéficient d’une remise intégrée de 50 % en reprogrammant simplement leurs tâches.

  4. Préserve la capacité premium — ceux qui ont réellement besoin d’un débit de pointe l’obtiennent toujours, à un tarif qui reflète la demande plus élevée.

C’est la même logique que les tarifs d’électricité en heures creuses et les instances spot cloud : aligner le prix sur la demande réelle, et chacun peut optimiser en conséquence.

À quoi faire attention quand on utilise la tarification de pointe DeepSeek ?

Avant de penser que vos coûts vont miraculeusement baisser, gardez ces points à l’esprit :

  1. La confusion de fuseau horaire est le piège n°1. Les fenêtres de pointe sont définies en heure de Pékin (UTC+8), pas dans votre heure locale. Si vous vous trompez, vous pouvez programmer un traitement par lots « pas cher » en plein pendant la fenêtre de pointe. Convertissez toujours d’abord.

  2. La pause déjeuner (12:00–14:00) est en heures creuses. Elle se situe entre les deux blocs de pointe : un travail qui commence à 13:00 est donc réduit — mais un travail qui s’étend de 11:30 à 14:30 chevauche pointe → creux → pointe. Surveillez les limites de vos travaux.

  3. La tarification en cas de cache hit est considérablement moins chère — mais elle double quand même aux heures de pointe. Les tokens d’entrée en cache sont de loin le poste le moins cher. Réutiliser les prompts et le contexte (prompt caching) reste l’un des plus gros leviers sur votre facture, quelle que soit la fenêtre horaire.

  4. Le trafic en temps réel / destiné aux utilisateurs ne peut pas toujours être déplacé. Si votre produit sert des utilisateurs en direct pendant les heures de travail chinoises, vous êtes bloqué aux tarifs de pointe pour ce trafic. Seules les charges de travail reportables bénéficient de la planification en heures creuses.

  5. Le choix du modèle reste le plus important. La tarification de pointe est un levier lié aux horaires ; choisir le bon modèle est un levier encore plus important. Si V4-Flash atteint votre niveau de qualité, il ne coûte qu’une fraction du prix de V4-Pro à chaque heure. Adaptez le modèle à la tâche avant d’optimiser l’horloge.

Comment vraiment économiser de l’argent avec la tarification de pointe

Une liste de contrôle rapide et pratique :

  • ✅ Regroupez et planifiez les tâches non urgentes (embeddings, résumés, évaluations, nettoyage de données) dans la fenêtre creuse de 17 heures.

  • ✅ Convertissez les heures de pointe dans votre fuseau horaire local et inscrivez-les au calendrier de votre équipe.

  • ✅ Appuyez-vous sur le prompt caching pour que les tokens d’entrée en cache-hit restent votre principal poste de coût.

  • ✅ Choisissez le modèle à la bonne taille — utilisez DeepSeek-V4-Flash pour le volume et la rapidité, et réservez DeepSeek-V4-Pro pour les tâches qui nécessitent réellement une puissance de raisonnement supplémentaire.

  • ✅ Surveillez et répartissez le trafic — acheminez les requêtes en temps réel selon les besoins, mais reportez tout ce qui peut attendre.

En résumé

La tarification de pointe DeepSeek n’est pas une simple augmentation de prix — c’est un modèle de tarification horaire qui récompense la flexibilité. L’API ne coûte plus cher que pendant les créneaux 09:00–12:00 et 14:00–18:00, heure de Pékin, et elle est à moitié prix les 17 autres heures de la journée. Comprenez les fenêtres, surveillez votre fuseau horaire, utilisez le cache de manière agressive et choisissez le bon modèle : vous pouvez sans difficulté vous retrouver du bon côté de l’équation.

Prêt à développer avec les derniers modèles DeepSeek ? Comparez directement les caractéristiques et les prix :

Foire aux questions

Qu'est-ce que la tarification de pointe DeepSeek ?

La tarification de pointe DeepSeek est un modèle de facturation basé sur le temps pour l'API DeepSeek. La journée est divisée en heures de pointe (facturées au tarif plein) et en heures creuses (facturées à moitié prix). Elle a pris effet le 17 août 2026 à 00h00, heure de Pékin (UTC+8).

Quelles sont les heures de pointe de DeepSeek ?

Les heures de pointe sont 09h00–12h00 et 14h00–18h00, heure de Pékin (UTC+8) — soit 7 heures au total par jour. Toutes les autres heures, y compris la pause déjeuner de 12h00 à 14h00 et toutes les heures de nuit, sont creuses.

DeepSeek coûte-t-il plus ou moins cher avec la tarification de pointe ?

Tout dépend du moment. Les requêtes pendant les heures de pointe sont facturées au tarif plein, tandis que les requêtes en heures creuses coûtent exactement **la moitié** du tarif de pointe. Les charges de travail flexibles planifiées en heures creuses coûtent moins cher ; le trafic en temps réel pendant les heures de pointe coûte plus cher.

Combien puis-je économiser avec la tarification en heures creuses ?

La tarification en heures creuses est **de 50 % du tarif de pointe** pour chaque type de token (entrée avec cache hit, entrée avec cache miss et sortie) pour DeepSeek-V4-Flash et DeepSeek-V4-Pro. Déplacer les tâches pouvant être reportées en heures creuses réduit effectivement de moitié leur coût.

Quel fuseau horaire utilisent les heures de pointe ?

Toutes les fenêtres de pointe sont définies à l'heure de Pékin (UTC+8), pas à votre heure locale. Convertissez-les dans votre propre fuseau horaire avant de planifier vos tâches — c'est l'erreur la plus courante que font les utilisateurs.

La tarification de pointe s'applique-t-elle à la fois à DeepSeek-V4-Flash et DeepSeek-V4-Pro ?

Oui. La tarification de pointe/creuse s'applique à la gamme actuelle de modèles DeepSeek, y compris [DeepSeek-V4-Flash](https://gptproto.com/model/deepseek/deepseek-v4-flash) et [DeepSeek-V4-Pro](https://gptproto.com/model/deepseek/deepseek-v4-pro).

Pourquoi DeepSeek est-il passé à la tarification de pointe ?

Pour équilibrer la demande. En rendant les heures creuses moins chères, on incite les charges de travail flexibles à se déplacer vers les périodes plus calmes, ce qui réduit la congestion en période de pointe, améliore la fiabilité et abaisse les coûts pour les utilisateurs qui n'ont pas besoin de réponses en temps réel.

Comment éviter de payer les tarifs de pointe ?

Regroupez et planifiez les tâches non urgentes dans la fenêtre creuse de 17 heures, appuyez-vous sur la mise en cache des prompts pour que les tokens avec cache hit restent dominants, et adaptez le modèle à la tâche — utilisez V4-Flash pour les travaux à grand volume et réservez V4-Pro pour les tâches qui nécessitent vraiment un raisonnement supplémentaire.

Articles associés

Plus de blogs
Qu'est-ce que GLM-5.3 ? Le lancement discret du plan de codage de Z.ai, tarifs et améliorations confirmées

Qu'est-ce que GLM-5.3 ? Le lancement discret du plan de codage de Z.ai, tarifs et améliorations confirmées

Les résultats de recherche décrivent encore GLM-5.3 comme une rumeur concernant un modèle non publié. La documentation de Z.ai indique désormais le contraire, mais seulement en partie. Au 14 août 2026, GLM-5.3 est disponible dans le GLM Coding Plan de Z.ai . Le guide de configuration officiel identifie glm-5.3 comme le modèle actuel, prend en charge un contexte optionnel d’un million de tokens et documente trois niveaux d’effort de raisonnement : faible, élevé et maximal. Cependant, Z.ai n’a pas publié d’annonce de lancement datée, de fiche modèle complète, de poids ouverts, de tarifs API standard par token ni de résultats de benchmarks pour cette version. Cette distinction est importante. GLM-5.3 n’est plus simplement un surnom utilisé par la communauté, mais ce n’est pas encore non plus une version publique entièrement documentée. J’ai vérifié séparément le guide du Coding Plan, le catalogue général des modèles, la page tarifaire, les notes de version et les dépôts publics de modèles. Ils ne sont pas encore entièrement synchronisés, ce qui explique pourquoi une réponse simple du type « publié ou non publié » serait trompeuse.

Michael Johnson | 2026-08-14

Grok 4.6 vs DeepSeek V4 Pro : codage, tarifs et lequel est le meilleur ?

Grok 4.6 vs DeepSeek V4 Pro : codage, tarifs et lequel est le meilleur ?

rok 4.6 et DeepSeek V4 Pro sont tous deux conçus pour les tâches complexes de raisonnement et de programmation, mais ils ne sont pas interchangeables. Grok 4.6 constitue le meilleur choix lorsqu’une tâche implique des captures d’écran, des maquettes d’interface, du débogage visuel ou les problèmes de programmation agentique les plus difficiles. DeepSeek V4 Pro est plus intéressant lorsque le coût, le contexte long et la programmation textuelle à grande échelle sont prioritaires. La réponse courte est simple : Grok 4.6 est le modèle le plus polyvalent, tandis que DeepSeek V4 Pro est le modèle de programmation le plus économique. Cette comparaison entre Grok 4.6 et DeepSeek V4 Pro couvre la programmation, le développement frontend, les fenêtres de contexte, les résultats de benchmarks publics, les tarifs API et la dernière mise à niveau de DeepSeek V4 Pro. Elle explique également quel modèle est le plus adapté aux différents types de tâches des développeurs. Verdict rapide : Choisissez Grok 4.6 pour le travail frontend visuel, le débogage difficile et les tâches de programmation à fort enjeu. Choisissez DeepSeek V4 Pro pour les grands dépôts, les flux de travail riches en texte et les coûts API réduits. Pour le routage en production, DeepSeek V4 Pro peut gérer la charge par défaut, tandis que Grok 4.6 prend en charge les escalades visuelles ou complexes.

Tiffany Layne | 2026-08-13

DeepSeek V4 Pro vs Kimi K3 : qu’est-ce qui a changé après la mise à jour 0813 ?

DeepSeek V4 Pro vs Kimi K3 : qu’est-ce qui a changé après la mise à jour 0813 ?

La comparaison entre DeepSeek V4 Pro et Kimi K3 a changé le 13 août 2026. DeepSeek a remplacé l’aperçu de V4 Pro derrière son alias API existant par DeepSeek V4 Pro 0813, tout en conservant le nom de modèle déjà utilisé par les développeurs. Voici la réponse courte : Kimi K3 reste en tête en matière d’intelligence globale mesurée et prend en charge les entrées visuelles. DeepSeek V4 Pro 0813 est plus rapide et considérablement moins cher pour le codage textuel et les charges de travail d’agents. Pour la plupart des équipes qui traitent des dépôts, effectuent des revues de code ou exécutent des agents à grande échelle, DeepSeek est désormais le meilleur choix par défaut. Kimi justifie son prix plus élevé lorsque les entrées multimodales ou le niveau de raisonnement maximal disponible comptent davantage que le coût. Un détail d’implémentation est facile à manquer : sur GPTProto, vous n’avez pas besoin du suffixe 0813 . Continuez à appeler deepseek-v4-pro , et la route utilise automatiquement la version actuelle.

Tiffany Layne | 2026-08-13

Grok 4.6 vs Kimi K3 : lequel convient à votre projet ?

Grok 4.6 vs Kimi K3 : lequel convient à votre projet ?

Deux modèles de pointe sont sortis à quatre semaines d’intervalle, tous deux visant exactement le même acheteur : le développeur qui utilise des agents, et non des chatbots. Moonshot AI a lancé Kimi K3 le 16 juillet 2026. xAI a répondu le 12 août avec Grok 4.6. Recherchez aujourd’hui « Grok 4.6 vs Kimi K3 » et vous trouverez des articles de lancement de chaque camp, ainsi qu’une multitude de fiches techniques — mais presque personne n’a comparé les deux modèles côte à côte, du point de vue d’un créateur. C’est la lacune que cet article comble. Voici la version courte, puisque vous êtes venu chercher une décision, pas un récapitulatif. Grok 4.6 l’emporte en efficacité par tour pour les agents et en hébergement sans intervention. Il réalise les tâches longues et complexes en moins de boucles et avec moins de tokens, sans que vous ayez à gérer l’infrastructure. Kimi K3 l’emporte en matière de contexte, de vidéo native et de contrôle — une fenêtre d’un million de tokens, des entrées d’image et de vidéo, ainsi que des poids ouverts téléchargeables si vous devez l’héberger vous-même ou l’utiliser dans un environnement isolé. Sur le chiffre que tout le monde cite, les deux modèles sont presque à égalité : Artificial Analysis estime le coût par tâche de chacun à environ $0.84 . L’écart d’un seul point sur l’indice d’intelligence ne sera donc pas votre facteur décisif. Les deux modèles empruntent des chemins opposés pour atteindre le même coût, et c’est précisément le choix que vous devez faire. Si vous exécutez des workflows d’agents à haut volume sensibles aux coûts et souhaitez un endpoint géré, choisissez Grok 4.6. Si vous devez fournir un dépôt entier ou une vidéo dans une seule fenêtre de contexte — ou si des exigences de conformité vous imposent de conserver vous-même les poids — choisissez Kimi K3. La suite de cet article détaille les éléments qui sous-tendent cette décision.

Schuyler Stacy | 2026-08-13