Deux modèles, deux philosophies
La plupart des comparatifs directs présentent ces deux modèles comme s'il s'agissait du même produit à des prix différents. Ce n'est pas le cas. DeepSeek a lancé V4 Pro le 24 avril 2026 sous licence MIT, et c'est le spécialiste le plus pointu spécialiste — un modèle de mélange d'experts exclusivement textuel, fortement optimisé pour le codage agentique et le raisonnement STEM. MiniMax a lancé M3 le 1er juin 2026, et c'est le généraliste le plus polyvalent — le premier modèle à poids ouverts à réunir dans un même système le codage de pointe, un contexte d'un million de tokens et l'entrée native d'images et de vidéos.
Cette seule différence — multimodal contre textuel uniquement — détermine davantage le choix que n'importe quel benchmark. Il vaut donc la peine de le dire clairement avant d'aborder les chiffres : vous ne choisissez pas le « meilleur modèle ». Vous choisissez la forme de modèle qui correspond à la tâche. Le reste de cette comparaison vise à vous aider à prendre cette décision à partir de données réelles plutôt que d'une capture d'écran de classement.
Comparaison côte à côte : spécifications et prix
Voici les données de référence sur le papier, avec les tarifs réels de GPT Proto par million de tokens plutôt qu'un chiffre d'appel tiré du billet de lancement de quelqu'un.
| |
MiniMax M3 |
DeepSeek V4 Pro |
| Date de sortie |
1er juin 2026 |
24 avril 2026 |
| Architecture |
MoE, 428 Md au total / 23 Md actifs |
MoE, 1,6 billion au total / 49 Md actifs |
| Conception de l'attention |
MiniMax Sparse Attention (MSA) |
DeepSeek Sparse Attention (DSA) |
| Fenêtre de contexte |
1 M de tokens |
1 M de tokens (384 k maximum en sortie) |
| Modalités d'entrée |
texte, image, vidéo |
texte uniquement |
| Sortie |
texte |
texte |
| Licence / poids |
Poids ouverts (Hugging Face) |
MIT, poids ouverts (Hugging Face) |
| Prix d'entrée GPT Proto |
$0.48 / 1 M de tokens |
$1.3914 / 1 M de tokens |
| Prix de sortie GPT Proto |
$0.96 / 1 M de tokens |
$2.7838 / 1 M de tokens |
Deux éléments de ce tableau comptent davantage que le reste. M3 accepte les images et les vidéos en entrée ; DeepSeek, non. Et DeepSeek active environ deux fois plus de paramètres par token (49 Md contre 23 Md) à partir d'un ensemble total près de quatre fois plus important — c'est le modèle le plus lourd et le plus dense, qui effectue davantage de calcul à chaque token, ce qui se reflète dans ses scores de raisonnement approfondi et, chez la plupart des hébergeurs, dans son prix.
Performances en codage et en mode agentique
C'est généralement ici que la comparaison déraille, alors examinez attentivement les chiffres.
DeepSeek V4 Pro, dans son mode de raisonnement maximal, obtient 80,6 % sur SWE-bench Verified — le meilleur score de tous les modèles à poids ouverts, à égalité avec Gemini 3.1 Pro. Il obtient également 93,5 sur LiveCodeBench et une note Codeforces de 3206. Ce sont des points forts en algorithmique et en programmation compétitive, et les scores de DeepSeek ont été reproduits lors de réévaluations indépendantes, ce qui est important pour la fiabilité.
Les chiffres officiels de MiniMax M3 en codage sont de 59,0 % sur SWE-Bench Pro, 66,0 % sur Terminal-Bench 2.1, 34,8 % sur SWE-fficiency, 28,8 % sur KernelBench Hard et 74,2 % sur MCP Atlas. Sur l'Intelligence Index indépendant d'Artificial Analysis — un score intermodèles, et non un benchmark fournisseur — M3 obtient 44, soit la deuxième place dans le groupe de référence suivi, contre une médiane d'environ 25.
Voici le piège. Vous verrez une douzaine de pages placer le « 59 % » de M3 à côté du « 80,6 % » de DeepSeek et déclarer DeepSeek grand vainqueur du codage. Cette comparaison est invalide. SWE-bench Pro et SWE-bench Verified sont deux benchmarks différents, avec des ensembles de problèmes et des niveaux de difficulté différents — Pro est la variante la plus récente et la plus difficile. Comparer un score Pro à un score Verified ne vous apprend rien sur le modèle le plus performant ; c'est une erreur d'unités déguisée en conclusion. Les deux laboratoires ont simplement communiqué des benchmarks différents, et aucun n'a publié de véritable confrontation directe sur le même benchmark. Mon interprétation : en matière d'intelligence générale mesurée indépendamment, ils sont proches ; pour les scores publiés de raisonnement approfondi et de programmation compétitive, ceux de DeepSeek sont supérieurs et mieux vérifiés ; pour toute tâche qui implique de voir quelque chose, la comparaison n'a pas lieu, car M3 est le seul à en être capable.
La seule capacité qui ne donne pas lieu à égalité
DeepSeek V4 Pro est exclusivement textuel. MiniMax M3 a été conçu comme un modèle multimodal dès la première étape d'entraînement, et il accepte les images et les vidéos en plus du texte sur le même endpoint. Ce n'est pas une simple note de bas de page dans une fiche technique — c'est une différence de catégorie.
Si vous créez un agent qui débogue à partir d'une capture d'écran, transforme une maquette Figma en composant, lit un graphique ou regarde un enregistrement d'écran pour trouver un bug, M3 peut le faire et DeepSeek ne le peut pas. Aucun prompt, aucun prix et aucun fine-tuning ne peut donner des yeux à un modèle exclusivement textuel. Ainsi, pour tout flux de travail où le modèle participe à ce que l'utilisateur voit et avec quoi il interagit — travail sur les interfaces, contrôle qualité visuel, analyse de documents avec diagrammes — le choix est fait avant même d'examiner un seul benchmark. À l'inverse, si rien dans votre pipeline n'est jamais une image, vous payez pour une capacité que vous n'utiliserez jamais, et la spécialisation textuelle de DeepSeek constitue un achat mieux ciblé.
Le coût, honnêtement
Sur GPT Proto, en utilisant les deux modèles avec un même solde, MiniMax M3 est le moins cher des deux — 0,48 $ en entrée et 0,96 $ en sortie par million de tokens, contre 1,3914 $ et 2,7838 $ pour DeepSeek V4 Pro. Aux tarifs de GPT Proto, M3 coûte environ un tiers du prix de V4 Pro par token, dans les deux sens.
Mais je vous induirais en erreur si je m'arrêtais là, car « lequel est le moins cher » dépend fortement de l'endroit où vous exécutez chaque modèle. Les coûts natifs de DeepSeek pour V4 Pro sont agressifs d'une manière qui ne se maintient pas toujours lorsqu'il est hébergé ailleurs : sur l'API propriétaire de DeepSeek, le modèle est facturé environ 0,435 $ en entrée et 0,87 $ en sortie par million de tokens et — l'élément qui change réellement les factures — un accès au cache coûte environ 0,003625 $ par million, soit plus de cent fois moins cher qu'un accès sans cache. Les boucles de codage agentique renvoient le même prompt système et le même contexte de fichiers à chaque tour, de sorte que la majeure partie de leur entrée arrive depuis le cache. Si vous traitez de gros volumes de texte pur et que vous êtes prêt à exécuter DeepSeek en natif, cette tarification du cache est véritablement difficile à battre et constitue l'argument le plus solide en faveur de V4 Pro.
La conclusion honnête sur le coût comporte donc deux niveaux. Avec une seule clé agrégée via GPT Proto, M3 est la ligne la moins chère par token. Pour un débit brut de texte à gros volume, optimisé autour du tarif natif du cache de DeepSeek, les coûts de V4 Pro deviennent plus avantageux. Et en dessous de tout cela : le prix par token n'est pas le prix par tâche. Un modèle qui coûte moins cher par token mais nécessite trois tentatives pour produire un correctif fonctionnel n'est pas l'option la moins chère — il a simplement déplacé le coût vers votre temps de débogage. Évaluez les deux modèles sur vos propres tâches avant de laisser un tableau tarifaire décider.
Contexte et efficacité
Les deux modèles utilisent une fenêtre de contexte d'un million de tokens, et tous deux y sont parvenus en abandonnant l'attention dense standard au profit d'une conception sparse — mais par des voies différentes, et la différence est réelle, pas cosmétique.
La DSA de DeepSeek s'appuie sur une compression importante : dans le contexte d'un million de tokens, V4 Pro n'a besoin que d'environ 27 % du calcul d'inférence par token unique et de 10 % du cache KV de son prédécesseur V3.2. La MSA de MiniMax effectue à la place une sélection au niveau des blocs sur des key-values non compressées, ce qui, selon MiniMax, évite le coût en précision que les schémas fondés sur la compression paient à longue portée ; avec un contexte d'un million, elle réduit le calcul par token à environ 1/20 de celui du précédent modèle M2, avec un préremplissage plus de 9× rapide et un décodage plus de 15× rapide. C'est un point où je qualifierais les affirmations de présentées selon le point de vue des fournisseurs des deux côtés — chaque laboratoire décrit sa propre approche comme étant celle qui évite le compromis. Ce que l'on peut affirmer avec certitude, c'est que les deux modèles sont spécifiquement conçus pour les tâches à long contexte et que leur coût par token à grande échelle est suffisamment faible pour rendre pratique, plutôt qu'utopique, le traitement d'un dépôt complet ou d'un long document.
Ce que la communauté examine réellement
Si vous cherchez les réactions à ces deux modèles — notamment la recherche « MiniMax M3 vs DeepSeek V4 Pro reddit » que beaucoup effectuent avant de s'engager — deux thèmes reviennent davantage que tout argument fondé sur les benchmarks, et tous deux méritent d'être pris au sérieux.
Le premier est la vérification. Les scores de lancement de M3 ont été obtenus sur l'infrastructure de MiniMax avec son propre cadre agentique, ce qui est normal lors d'un lancement, mais constitue exactement le genre d'élément que les développeurs relativisent jusqu'à l'arrivée de chiffres indépendants. Ces chiffres commencent à arriver : les poids ouverts de M3 ont été publiés sur Hugging Face le 7 juin, et l'indice indépendant d'Artificial Analysis confirme désormais qu'il s'agit véritablement d'un modèle de premier plan plutôt que d'un artefact du jour du benchmark. DeepSeek avait ici l'avantage : ses scores ont été réévalués rapidement par des évaluateurs indépendants et ses poids sous licence MIT étaient disponibles dès le premier jour pour que chacun puisse les vérifier. Si les performances vérifiées indépendamment sont une exigence absolue, DeepSeek conserve l'historique le plus solide, même si M3 a désormais comblé la majeure partie de l'écart.
Le second point est que « le moins cher par token » et « le moins cher pour terminer la tâche » sont deux chiffres différents. Un modèle qui écrit du code plausible mais échoue à un test n'est pas économique ; c'est un modèle qui a reporté son coût en aval, sur votre révision. C'est pourquoi le consensus des praticiens revient toujours au même conseil : choisissez en fonction de l'adéquation des capacités et de la fiabilité sur votre charge de travail, et utilisez le prix par token pour départager les options plutôt que pour prendre la décision.
Utiliser l'un ou l'autre avec la même clé
L'avantage pratique d'appeler les deux modèles via GPT Proto est que changer de modèle se résume à une modification d'une ligne — même clé, même format de requête compatible avec OpenAI, chaîne de modèle différente. Voici une complétion de chat avec M3, avec un changement commenté vers V4 Pro :
from openai import OpenAI
client = OpenAI(
api_key="sk-your-key-here", # une clé permet d'accéder aux deux modèles
base_url="https://gptproto.com/v1", # passerelle compatible avec OpenAI
)
def ask(model, prompt):
resp = client.chat.completions.create(
model=model,
messages=[{"role": "user", "content": prompt}],
)
return resp.choices[0].message.content
# Raisonnement textuel uniquement — les deux modèles gèrent cela.
print(ask("deepseek-v4-pro", "Refactorisez cette fonction pour en améliorer la lisibilité :\n<paste code>"))
# Entrée image — seul M3 peut la traiter ; DeepSeek est exclusivement textuel.
def ask_with_image(image_url, prompt):
resp = client.chat.completions.create(
model="MiniMax-M3",
messages=[{
"role": "user",
"content": [
{"type": "text", "text": prompt},
{"type": "image_url", "image_url": {"url": image_url}},
],
}],
)
return resp.choices[0].message.content
print(ask_with_image(
"https://example.com/ui-bug-screenshot.png",
"Cet écran s'affiche mal sur mobile. Quelle est la cause CSS probable ?",
))
Le même premier appel en cURL :
curl https://gptproto.com/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer sk-your-key-here" \
-d '{
"model": "deepseek-v4-pro",
"messages": [
{"role": "user", "content": "Refactor this function for readability."}
]
}'
Pour déplacer une tâche textuelle d'un modèle à l'autre, il suffit de modifier une chaîne — MiniMax-M3 ou deepseek-v4-pro — et la même clé donne accès aux deux modèles ainsi qu'à plus de 200 autres modèles avec un seul solde. Si vous n'avez pas encore de clé, créez-en une depuis le tableau de bord GPT Proto, puis consultez la page des tarifs pour connaître le tarif exact actuel de chacun avant de lancer un traitement par lots.
Lequel devriez-vous utiliser ?
Si votre charge de travail concerne le texte, le code, les journaux et les sorties structurées — agents backend, extraction à gros volume, problèmes algorithmiques de niveau compétitif — utilisez DeepSeek V4 Pro. Il affiche les scores vérifiés les plus élevés en raisonnement approfondi, bénéficie d'un historique indépendant plus solide et d'une économie native avantageuse pour les gros volumes de texte grâce à sa tarification du cache.
Si un élément de votre pipeline est une image ou une vidéo — débogage d'interface, conversion d'un design en code, contrôle qualité visuel, documents riches en diagrammes — utilisez MiniMax M3, car c'est le seul des deux à pouvoir voir et qu'il constitue également l'option la moins chère par token sur GPT Proto.
Et si vous construisez quelque chose de concret, la réponse est souvent les deux : acheminez les tours de texte et de raisonnement pur vers V4 Pro, transmettez les tours visuels à M3 et utilisez-les avec une seule clé afin de ne pas avoir à gérer une deuxième intégration. « MiniMax M3 ou DeepSeek V4 Pro » est une mauvaise façon de présenter le choix pour la plupart des équipes — ce sont des spécialistes de domaines différents, et la configuration la plus performante utilise chacun là où il excelle.