Tarifs+7% bonus

Qu'est-ce que DeepSeek V4 Flash Vision Exp ? Tarifs, fonctionnalités, benchmarks et limites

DeepSeek V4 Flash Vision Exp expliqué : tarifs actuels, limites de 384 tokens pour les images, benchmarks Opus 4.8, cas d’usage et points faibles.

Qu'est-ce que DeepSeek V4 Flash Vision Exp ? Tarifs, fonctionnalités, benchmarks et limites

Plusieurs pages publiées immédiatement après le lancement de DeepSeek V4 Flash Vision Exp citent déjà le mauvais prix. C’est dire à quelle vitesse cette sortie évolue.

DeepSeek V4 Flash Vision Exp est une version expérimentale de V4 Flash qui peut accepter des images en plus du texte. Il peut inspecter des captures d’écran, lire le texte dans les images, analyser des graphiques et transmettre le résultat à des outils. DeepSeek l’a publié le 21 août 2026 sous l’ID de modèle deepseek-v4-flash-vision-exp.

La distinction importante, c’est ce qu’il n’est pas. Il ne s’agit pas d’un nouveau générateur d’images, ni d’une mise à niveau globale pour toutes les charges de travail V4 Flash. DeepSeek le positionne comme une branche expérimentale compatible avec la vision, avec à peu près les mêmes capacités de texte que V4 Flash. Si votre application n’envoie jamais d’image, le modèle texte standard reste le choix le plus simple.

DeepSeek V4 Flash Vision Exp est désormais disponible via GPTProto. Les développeurs peuvent envoyer du texte et des images en entrée via la route GPTProto du modèle, en utilisant le même compte, la même clé API et le même solde partagé que pour les autres modèles pris en charge. La page du modèle en direct affiche actuellement le tarif standard de 0,44 $ par million de tokens d’entrée et de 1,32 $ par million de tokens de sortie, avec également des tarifs hors pointe basés sur les horaires.

Le modèle reste expérimental. Avant d’acheminer le trafic de production vers lui, testez le format d’image exact, les limites de requêtes, la latence et le comportement de repli indiqués dans le guide de démarrage rapide en direct de GPTProto.

Table des matières

Qu'est-ce qui a changé par rapport à DeepSeek V4 Flash ?

La mise à niveau est ciblée mais utile : V4 Flash peut désormais recevoir du contexte visuel. Une requête peut contenir du texte ainsi qu'une ou plusieurs images JPEG, PNG, GIF ou WebP. DeepSeek expose cette capacité via ses API Chat Completions et Responses compatibles OpenAI, ainsi que son API Messages compatible Anthropic.

Les images peuvent arriver de trois manières :

  1. Une URL de données Base64 intégrée dans la requête.

  2. Une URL HTTP ou HTTPS accessible publiquement.

  3. Un file_id créé via l'API Files.

La troisième option est importante lorsqu'un agent doit inspecter plusieurs fois la même capture d'écran. Téléchargez-la une fois, réutilisez l'identifiant et évitez d'envoyer le fichier entier à chaque requête. DeepSeek indique que les téléchargements via l'API Files sont gratuits, mais pas l'inférence : l'image est toujours convertie en tokens d'entrée et facturée avec le texte qui l'accompagne.

Voici la répartition pratique entre les trois routes V4 actuelles :

Modèle Entrée image Contexte officiel / sortie max Entrée / sortie en cas d'échec de cache au pic Adéquation pratique
DeepSeek V4 Flash Vision Exp Oui 1M / 384K 0,44 $ / 1,32 $ par million de tokens Expériences sur captures d'écran, graphiques, images de documents et agents GUI
DeepSeek V4 Flash Non 1M / 384K 0,44 $ / 1,32 $ par million de tokens Texte à haut volume, extraction, chat et sous-tâches d'agent routinières
DeepSeek V4 Pro Non 1M / 384K 1,32 $ / 3,96 $ par million de tokens Codage plus difficile, raisonnement et tâches d'agent plus longues

Ce sont les tarifs officiels actuels aux heures pleines, et non une promesse que les prix resteront inchangés. DeepSeek se réserve explicitement le droit de les ajuster.

Mon analyse pratique est simple. Choisissez Vision Exp parce que vous avez besoin d'entrée d'image, pas parce que Vision sonne comme un niveau supérieur. Choisissez V4 Flash lorsque le travail est uniquement textuel et sensible aux coûts. Déplacez les tâches textuelles difficiles vers V4 Pro lorsque la qualité de raisonnement ajoutée vaut environ trois fois le prix officiel des tokens.

Fonctionnalités de DeepSeek V4 Flash Vision Exp — et ses limites réelles

La courte liste de fonctionnalités semble généreuse : texte et images mélangés, appels d'outils, sortie JSON, mode de réflexion sélectionnable, trois formats d'API et le même contexte de 1M de tokens que celui affiché pour les autres modèles V4. Les limites déterminent si ces fonctionnalités survivent au contact d'une charge de travail en production.

Méthode d'entrée Limite Utilisation optimale
Base64 ou file_data en ligne Corps entier de la requête : 48 MiB Images locales et requêtes à usage unique
URL externe URL : 8 192 caractères ; image : 32 MiB ; téléchargement : 60 secondes Images publiques déjà hébergées
API Files file_id Image : 64 MiB Images réutilisées ou requêtes qui dépasseraient la limite de corps en ligne

Le placement des images dépend du format d'API. Dans les requêtes Chat Completions et Messages compatibles Anthropic, le contenu image doit figurer dans un message utilisateur. L'API Responses peut également recevoir des images dans les messages développeur et dans les sorties d'appels d'outils prises en charge. Les images placées dans des messages système ou assistant renvoient une erreur 400. L'envoi d'une image aux routes V4 Flash ou V4 Pro uniquement textuelles renvoie également une erreur, car ces modèles n'acceptent pas d'entrée image native.

Vision Exp prend en charge les réglages de détail low, high, original et auto pour les entrées image_url, mais le modèle applique toujours son processus de redimensionnement documenté. Les images en dessous d'une échelle totale d'environ 384×384 pixels sont agrandies. Les images plus grandes sont réduites tout en conservant le rapport d'aspect jusqu'à ce que leur nombre total de pixels soit à peu près équivalent à 800×800.

Ce redimensionnement produit un plafond de 384 tokens d'entrée par image. Cela rend le coût prévisible. Le compromis est la résolution : les petites étiquettes, les feuilles de calcul denses, les annotations fines sur les diagrammes et le petit texte d'interface peuvent ne pas survivre à la réduction. Une source de 5 000×5 000 n'achète pas plus de tokens d'image qu'une source de 2 000×2 000.

Une autre limite est facile à manquer. Vision Exp ne prend pas en charge la complétion FIM, tandis que V4 Flash et V4 Pro la prennent en charge en mode non-réflexion. Les développeurs qui créent des outils de complétion de code en ligne ne doivent pas considérer la route vision comme un remplacement direct.

Tarification de DeepSeek V4 Flash Vision Exp

J'ai consulté le tableau de tarification en direct de DeepSeek le 24 août 2026. Les tarifs sont :

Type de token Heures creuses Heures pleines
Entrée avec succès de cache 0,007 $ par 1M 0,014 $ par 1M
Entrée avec échec de cache 0,22 $ par 1M 0,44 $ par 1M
Sortie 0,66 $ par 1M 1,32 $ par 1M

Les heures pleines s'étendent de 01:00 à 04:00 et de 06:00 à 10:00 UTC, du lundi au vendredi. Toute autre période, y compris les week-ends, utilise le tarif heures creuses à moitié prix.

Certains articles explicatifs récemment indexés citent encore 0,14 $ par million de tokens d'entrée et 0,28 $ par million de tokens de sortie. Ne construisez pas un budget sur ces chiffres. Ils ne correspondent plus au tableau officiel.

Au plafond documenté de 384 tokens par image, le calcul de l'entrée uniquement image est :

Heures creuses : 384 × 0,22 $ / 1 000 000 = 0,00008448 $ par image
Heures pleines : 384 × 0,44 $ / 1 000 000 = 0,00016896 $ par image

Cela représente environ 0,08448 $ à 0,16896 $ pour 1 000 images avant le texte et la sortie. C'est bon marché, mais le titre peut être trompeur. Une réponse de 1 000 tokens coûte 0,00132 $ au tarif de sortie en heures pleines — près de huit fois la charge d'entrée maximale pour une image. Des réponses concises et un max_tokens contrôlé peuvent compter davantage que d'économiser quelques tokens sur l'image.

Le chiffre de 384 est aussi un maximum, pas un coût fixe par image. L'utilisation réelle des tokens dépend des dimensions après l'étape de redimensionnement de DeepSeek.

DeepSeek V4 Flash Vision Exp vs Opus 4.8

DeepSeek affirme que Vision Exp rapproche les performances des agents multimodaux de celles d'Opus 4.8. Son propre graphique de référence soutient une affirmation plus nuancée : les modèles échangent des victoires sur quatre évaluations d'agents multimodaux sélectionnées.

Benchmark d'agents multimodaux Vision Exp Opus 4.8 Score plus élevé
ApexBench, Pass@1 36.5 39.4 Opus 4.8
Agents' Last Exam 27.3 25.7 Vision Exp
Chartography 64.3 65.0 Opus 4.8
ZeroBench, Pass@5 35.0 34.0 Vision Exp

Deux victoires chacun. C'est compétitif, mais cela ne prouve pas que Vision Exp égale Opus 4.8 en termes de précision OCR, de taux d'hallucination visuelle, de lecture de petits textes, de navigation dans l'interface ou d'agents de longue durée.

Les résultats des agents textuels ajoutent du contexte. Le graphique de DeepSeek contient sept évaluations textuelles. Vision Exp ne devance Opus 4.8 que sur DeepSWE, 59,3 contre 58,0. Il est en retard sur Terminal Bench 2.1, NL2Repo, Cybergym, Toolathlon-Verified, DSBench-Hard et AutomationBench.

Ces chiffres proviennent également de DeepSeek, et non d'un évaluateur indépendant. L'entreprise a exécuté ses modèles en mode Minimal avec une longueur de sortie maximale, top_p=0.95 et temperature=1.0. Au 24 août, je n'ai pas trouvé Vision Exp dans les résultats d'Artificial Analysis ou de LMArena. Ma conclusion est donc provisoire : les données de lancement justifient de tester le modèle, pas de déclarer un vainqueur global.

Applications de DeepSeek V4 Flash Vision Exp

Agents de capture d'écran et d'interface graphique

Un agent navigateur ou bureau peut inspecter un écran, décider quel outil appeler et examiner la capture d'écran suivante. Le faible plafond de tokens d'image maintient le coût des observations répétées à un niveau bas. Le coût est la précision visuelle, alors testez les petites étiquettes, le texte d'erreur et les menus denses avant de faire confiance aux clics autonomes.

Analyse de graphiques et d'images de documents

Le modèle peut résumer des graphiques, extraire des faits visibles et les combiner avec des instructions textuelles. Il devrait fonctionner au mieux sur des pages propres et lisibles. Les petits caractères numérisés et les grandes feuilles de calcul sont plus risqués, car les images sont redimensionnées avant l'inférence.

Agents de codage qui examinent les interfaces

Un agent de codage peut générer une page, inspecter le résultat rendu, puis réviser le code. Cela comble une lacune laissée par V4 Flash uniquement textuel. Néanmoins, une capture d'écran n'est pas un arbre DOM : le modèle peut remarquer un bouton mal placé sans identifier la règle CSS exacte qui en est la cause.

Flux de travail avec images répétées

L'API Files convient aux catalogues de produits, à la révision de documents ou à tout flux qui fait référence à une image sur plusieurs tours. Réutiliser un file_id économise de la bande passante de requête. Cela ne supprime pas les frais de tokens d'image lorsque le modèle traite à nouveau ce fichier.

Quand ne pas l'utiliser

Vision Exp est un choix par défaut faible pour le texte pur, l'inspection au niveau des pixels ou les systèmes qui exigent un contrat de modèle stable. Le suffixe -exp compte. Conservez des tests de régression, journalisez le comportement du modèle et maintenez une route de secours si un flux visuel affecte l'argent, les autorisations ou les données client.

Comment utiliser DeepSeek V4 Flash Vision Exp via l'API

DeepSeek V4 Flash Vision Exp est disponible via le point de terminaison compatible OpenAI de GPT Proto. L'exemple Python suivant envoie une image de graphique publique accompagnée d'une instruction textuelle :

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["GPTPROTO_API_KEY"],
    base_url="https://gptproto.com/v1",
)

response = client.chat.completions.create(
    model="deepseek-v4-flash-vision-exp",
    messages=[
        {
            "role": "user",
            "content": [
                {
                    "type": "text",
                    "text": "Lisez ce graphique et listez les trois conclusions les plus importantes."
                },
                {
                    "type": "image_url",
                    "image_url": {
                        "url": "https://api-docs.deepseek.com/img/v4_260821_benchmark_en.png"
                    }
                }
            ]
        }
    ],
)

print(response.choices[0].message.content)

L'exemple utilise l'image de référence publique de DeepSeek, il peut donc être exécuté sans préparer d'image au préalable. Pour un fichier local, encodez-le en URL de données Base64 ; pour un fichier volumineux ou utilisé de façon répétée, téléchargez-le d'abord et envoyez son file_id. Le guide de l'API Vision de DeepSeek documente les trois formats.

Utiliser Vision Exp via GPT Proto

GPT Proto expose désormais DeepSeek V4 Flash Vision Exp comme une route multimodale avec entrée texte et image, et sortie texte. Le tarif standard actuel est de 0,44 $ par million de tokens d'entrée et de 1,32 $ par million de tokens de sortie. Les tokens d'image s'ajoutent à la facture d'entrée texte, DeepSeek documentant un plafond de 384 tokens d'entrée par image.

L'avantage pratique est la consolidation des comptes : la même clé GPT Proto et le même solde partagé peuvent également appeler les modèles uniquement textuels DeepSeek V4 Flash et DeepSeek V4 Pro. Cela facilite le routage des tâches visuelles vers Vision Exp tout en conservant le travail textuel routinier sur le modèle Flash stable.

DeepSeek V4 Flash Vision Exp vaut-il la peine d'être utilisé ?

Oui — pour tester des agents conscients des images où le coût d'entrée et les captures d'écran répétées comptent. Non — comme mise à niveau automatique pour une application uniquement textuelle.

Les forces confirmées sont une large compatibilité API, une utilisation prévisible des tokens d'image, un contexte de 1M de tokens et des résultats rapportés par le fournisseur qui sont au moins compétitifs avec Opus 4.8 sur quatre tests d'agents multimodaux. Les coûts sont un contrat expérimental, un redimensionnement agressif des images, aucun résultat de benchmark indépendant pour l'instant, et des performances mitigées face à Opus plutôt qu'une victoire nette.

Si votre charge de travail est uniquement textuelle, commencez par DeepSeek V4 Flash et faites monter les demandes difficiles de codage ou de raisonnement vers DeepSeek V4 Pro. Si des captures d'écran, des graphiques, des rendus d'interface ou des images de documents contiennent des informations dont l'agent a besoin, testez l'DeepSeek V4 Flash Vision Exp API directement via GPT Proto.

Ne faites pas passer la route expérimentale en production en vous basant uniquement sur quatre benchmarks rapportés par le fournisseur. Testez-la d'abord sur vos propres petits textes, tableaux de bord denses, bugs visuels et workflows d'outils à plusieurs étapes.

Questions fréquentes

Qu’est-ce que DeepSeek V4 Flash Vision Exp ?

Il s’agit d’une version expérimentale dotée de vision de DeepSeek V4 Flash, publiée le 21 août 2026. Elle accepte du texte et des images et utilise l’ID de modèle `deepseek-v4-flash-vision-exp`.

Vision Exp est-il une mise à niveau par rapport à DeepSeek V4 Flash ?

Il ajoute la compréhension d’images, mais DeepSeek décrit ses capacités textuelles comme équivalentes à V4 Flash plutôt que comme un remplacement. Pour les requêtes uniquement textuelles, la route V4 Flash standard reste le choix le plus direct.

Combien coûte DeepSeek V4 Flash Vision Exp ?

Au moment de la vérification, l’entrée en cas de défaut de cache coûte $0.22 en heures creuses ou $0.44 en heures pleines par million de tokens. La sortie coûte $0.66 en heures creuses ou $1.32 en heures pleines. Les prix peuvent changer.

Combien de tokens une image utilise-t-elle ?

Jusqu’à 384 tokens d’entrée après redimensionnement automatique. Il s’agit d’un plafond, et non d’un coût fixe ; chaque image dans une requête multi-images est comptée séparément.

DeepSeek V4 Flash Vision Exp est-il meilleur qu’Opus 4.8 ?

Pas de manière concluante. Dans les quatre tests d’agents multimodaux publiés par DeepSeek, Vision Exp en remporte deux et Opus 4.8 en remporte deux. Aucun résultat indépendant n’était disponible au moment de la vérification de cet article.

Comment se compare-t-il aux autres modèles DeepSeek ?

Vision Exp est l’option V4 actuelle pour l’entrée d’images. V4 Flash cible les charges de travail textuelles économiques, tandis que V4 Pro facture davantage pour le codage et le raisonnement plus difficiles. Les trois affichent un contexte de 1M de tokens et une sortie maximale de 384K dans le tableau tarifaire actuel de DeepSeek.

DeepSeek V4 Flash Vision Exp est-il open source ?

La documentation actuelle de DeepSeek sur les versions et l’API ne confirme pas une publication open-weight pour Vision Exp. Ne partez pas du principe que le statut des autres modèles DeepSeek s’applique à ce point de terminaison expérimental.

DeepSeek V4 Flash Vision Exp est-il disponible sur GPTProto ?

Oui. GPTProto donne désormais accès à `deepseek-v4-flash-vision-exp` avec entrée de texte et d’images et sortie de texte. Les développeurs peuvent utiliser une clé API GPTProto et un solde partagé pour tester le modèle aux côtés de V4 Flash, V4 Pro et d’autres modèles multimodaux pris en charge. Consultez la [page du modèle en direct](https://gptproto.com/model/deepseek/deepseek-v4-flash-vision-exp) pour les tarifs actuels, les modalités et les instructions de démarrage rapide.

Quelles applications conviennent au modèle ?

Les candidats les plus évidents sont les agents de capture d’écran, l’analyse de graphiques et d’images de documents, la revue d’UI et d’autres flux de travail qui combinent des images avec des appels d’outils. Les applications qui dépendent de texte très petit ou de détails en résolution originale nécessitent des tests supplémentaires.

Articles associés

Plus de blogs
DeepSeek V4 Pro vs DeepSeek V4 Flash : lequel est le meilleur pour le code, les agents et votre budget ?

DeepSeek V4 Pro vs DeepSeek V4 Flash : lequel est le meilleur pour le code, les agents et votre budget ?

Réponse rapide : Pour la plupart des charges de travail API courantes — chat, génération de contenu, programmation simple et tâches de traitement par lots à haut volume — DeepSeek V4 Flash est le meilleur choix car il offre une qualité proche de Pro pour environ un tiers du prix, avec une limite de concurrence 5× plus élevée. DeepSeek V4 Pro ne justifie son tarif supérieur que lorsque vous avez besoin d’un développement agentique de pointe, d’un raisonnement complexe en plusieurs étapes ou de refactorisations à l’échelle du dépôt, pour lesquelles l’échec d’une première tentative coûte plus cher que l’écart de prix des tokens de 3×. Si vous êtes développeur et créez des agents de programmation ou des outils frontend, commencez avec Flash et passez à Pro pour les 10 à 20 % de tâches les plus difficiles.

Tiffany Layne | 2026-08-19

DeepSeek V4 Pro contre GLM 5.2 : lequel est le meilleur en 2026 ?

DeepSeek V4 Pro contre GLM 5.2 : lequel est le meilleur en 2026 ?

Deux modèles phares chinois à poids ouverts se trouvent désormais à une erreur d’arrondi de la frontière occidentale — pour une fraction du prix. DeepSeek V4 Pro et GLM 5.2 (de Z.ai, anciennement Zhipu) sont les deux modèles que les développeurs ne cessent de comparer en 2026, et pour cause : tous deux offrent une fenêtre de contexte d’un million de tokens, tous deux sont à poids ouverts, et tous deux coûtent 5 à 10 fois moins cher que Claude et GPT. Mais "lequel est le meilleur" n’a pas de réponse unique — cela dépend de l’importance que vous accordez au codage frontend , au raisonnement algorithmique , à la fiabilité agentique , ou au coût brut par tâche . La plupart des comparaisons s’arrêtent au prix affiché. Celle-ci va plus loin : nous examinons les dépenses réelles par tâche , la tarification dynamique récemment activée de DeepSeek, l’efficacité en tokens et les modes d’échec que chaque modèle dissimule. Si vous souhaitez tester directement l’un ou l’autre modèle, vous pouvez les exécuter côte à côte ici : DeepSeek V4 Pro → gptproto.com/model/deepseek/deepseek-v4-pro GLM 5.2 → gptproto.com/model/z-ai/glm-5.2

Michael Johnson | 2026-08-17

Les heures de pointe de DeepSeek sont désormais en vigueur : quand l'API coûte-t-elle plus cher ?

Les heures de pointe de DeepSeek sont désormais en vigueur : quand l'API coûte-t-elle plus cher ?

Si, à votre réveil le 17 août, la facture de votre API DeepSeek semblait soudainement différente, vous ne rêvez pas. DeepSeek a officiellement lancé Peak Pricing — un modèle de facturation basé sur les heures de pointe et les heures creuses qui fait varier ce que vous payez par token selon le moment où vos requêtes atteignent l'API. En bref : exécutez vos charges de travail pendant les heures de pointe et vous payez plein tarif. Déplacez-les vers les heures creuses et vous payez la moitié . Ce guide explique exactement ce qu'est DeepSeek Peak Pricing, quand l'API coûte plus cher, combien elle coûte à chaque palier, et ce à quoi vous devez faire attention.

Michael Johnson | 2026-08-17

Grok 4.6 vs DeepSeek V4 Pro : codage, tarifs et lequel est le meilleur ?

Grok 4.6 vs DeepSeek V4 Pro : codage, tarifs et lequel est le meilleur ?

rok 4.6 et DeepSeek V4 Pro sont tous deux conçus pour les tâches complexes de raisonnement et de programmation, mais ils ne sont pas interchangeables. Grok 4.6 constitue le meilleur choix lorsqu’une tâche implique des captures d’écran, des maquettes d’interface, du débogage visuel ou les problèmes de programmation agentique les plus difficiles. DeepSeek V4 Pro est plus intéressant lorsque le coût, le contexte long et la programmation textuelle à grande échelle sont prioritaires. La réponse courte est simple : Grok 4.6 est le modèle le plus polyvalent, tandis que DeepSeek V4 Pro est le modèle de programmation le plus économique. Cette comparaison entre Grok 4.6 et DeepSeek V4 Pro couvre la programmation, le développement frontend, les fenêtres de contexte, les résultats de benchmarks publics, les tarifs API et la dernière mise à niveau de DeepSeek V4 Pro. Elle explique également quel modèle est le plus adapté aux différents types de tâches des développeurs. Verdict rapide : Choisissez Grok 4.6 pour le travail frontend visuel, le débogage difficile et les tâches de programmation à fort enjeu. Choisissez DeepSeek V4 Pro pour les grands dépôts, les flux de travail riches en texte et les coûts API réduits. Pour le routage en production, DeepSeek V4 Pro peut gérer la charge par défaut, tandis que Grok 4.6 prend en charge les escalades visuelles ou complexes.

Tiffany Layne | 2026-08-13