Le chiffre que tout le monde répète est 2,7 billions. Le chiffre qui déterminera réellement si MiniMax M3 Pro compte pour votre équipe n'est pas celui-là — c'est une clause dans un fichier LICENSE que personne n'a encore lu, parce que personne ne l'a encore publié.
La semaine dernière, j'ai cherché une analyse technique de M3 Pro et trouvé une vingtaine d'articles. Ils reprenaient tous la même exclusivité. Aucun ne répondait à la seule question qu'un développeur en activité se pose : alors, qu'est-ce que je fais lundi ? Cet article est ma tentative de réponse.
Une précision avant de commencer, car elle est ici plus importante que d'habitude. Je vais distinguer trois types d'affirmations dans cet article : ce qui a été rapporté (sources limitées, à prendre avec précaution), ce que je pense (mon analyse, n'hésitez pas à la contester), et ce qui relève de la spéculation (je le signalerai explicitement). Presque tout ce qui a été publié sur M3 Pro jusqu'ici mélange les trois dans une même voix assurée. C'est ainsi qu'une rumeur devient une feuille de route.
Qu'est-ce que MiniMax M3 Pro ? (Ce qui est réellement confirmé)
MiniMax M3 Pro est un grand modèle de langage qui n'existe pas encore — du moins pas publiquement.
Voici la version rapportée. MiniMax, le laboratoire de Shanghai à l'origine de la série M, travaille sur un modèle d'environ 2,7 billions de paramètres. Les employés associés au projet le désignent en interne sous le nom de M3 Pro, même si son nom définitif pourrait changer avant son lancement. L'entreprise prévoit de le publier en open source, éventuellement dès le troisième trimestre 2026. S'il sort comme décrit, ce serait le plus grand modèle ouvert jamais publié par un laboratoire chinois.
Passons aux sources, la partie que les reprises ont tendance à omettre. Tout ce qui précède remonte à une unique exclusivité de The Information, datée du 8 juillet 2026, attribuée à deux personnes au fait du projet. Chaque article ultérieur — et ils sont nombreux — découle de ce seul rapport. MiniMax n'a rien déclaré. Le jour de la rédaction, j'ai vérifié le site de l'entreprise, son blog de recherche, sa documentation d'API et son organisation Hugging Face. M3 Pro n'est mentionné nulle part.
| |
Statut |
| 2,7 T de paramètres au total |
Rapporté (source unique) |
| Nommé « M3 Pro » |
Rapporté — nom de code interne, susceptible de changer |
| Publication open source |
Rapportée comme étant prévue |
| Échéance : troisième trimestre 2026 |
Rapportée « au plus tôt » — pas un engagement |
| Nombre de paramètres actifs |
Inconnu |
| Conditions de licence |
Inconnues |
| Fenêtre de contexte |
Inconnue |
| Résultats des benchmarks |
Aucun disponible |
| Disponible sur une API quelconque |
Non |
Voilà l'état honnête des connaissances. Tout le reste de ce que vous lirez actuellement sur M3 Pro, y compris tout ce qui suit, est une déduction fondée sur ces éléments.
MiniMax M3 Pro contre MiniMax M3 : ce que le bond de 6× vous apporte réellement
Pour comprendre pourquoi un modèle de 2,7 T est intéressant, il faut savoir ce que MiniMax a déjà publié.
MiniMax M3 est sorti le 1er juin 2026. C'est un modèle Mixture-of-Experts comptant environ 428 milliards de paramètres au total, dont environ 23 milliards sont activés par jeton. Sa principale innovation technique est la MSA — MiniMax Sparse Attention — qui sélectionne les blocs clé-valeur pertinents au lieu d'appliquer l'attention à chaque jeton de la fenêtre. C'est ce qui fait de son contexte d'un million de jetons une fonctionnalité réellement exploitable plutôt qu'un simple argument de fiche technique : avec un contexte de 1 M, la MSA réduit le calcul par jeton à environ un vingtième de celui de la génération précédente, avec un préremplissage environ 9× plus rapide et un décodage environ 15× plus rapide. Le rapport technique est disponible sur arXiv (2606.13392) et les poids sur Hugging Face.
Ainsi, M3 Pro, avec ses 2,7 T rapportés, serait environ 6,3× plus grand que M3 en nombre total de paramètres. Cela semble décisif. Ça ne l'est pas, et voici pourquoi.
| |
MiniMax M3 (publié) |
M3 Pro (rapporté) |
| Paramètres totaux |
~428 B |
~2,7 T |
| Paramètres actifs par jeton |
~23 B |
Inconnu |
| Architecture |
MoE + attention éparse MSA |
Inconnue |
| Fenêtre de contexte |
1 M (minimum garanti de 512 K) |
Inconnue |
| Publication |
1er juin 2026 |
Prévue au troisième trimestre 2026 |
| Poids |
Publiés |
Prévus |
Dans un modèle Mixture-of-Experts, le nombre total de paramètres indique la quantité de mémoire nécessaire pour le posséder. Le nombre de paramètres actifs indique le coût par jeton. M3 active 23 B paramètres sur 428 B — environ 5 %. Si M3 Pro conserve un ratio similaire, il faudrait compter environ 135 B paramètres actifs, ce qui le placerait dans une catégorie de coûts réellement différente. S'il en active beaucoup moins, son service pourrait être bon marché mais son stockage coûteux. S'il en active beaucoup plus, ce serait l'inverse.
Personne n'a communiqué ce chiffre. Cela signifie que la donnée la plus importante pour quiconque établit un budget autour de ce modèle est précisément celle qui n'a pas fuité.
En clair : le nombre total de paramètres indique le matériel à acheter. Les paramètres actifs indiquent à quoi ressemblera la facture. Seul le premier chiffre a été rapporté, et c'est le moins utile des deux.
Le terme « open source » est ici lourd de conséquences
C'est le moment où je veux ralentir, car je pense que c'est l'aspect sur lequel la couverture médiatique s'est trompée de manière significative.
Tous les titres parlent d'« open source ». Cette expression implique que vous pouvez télécharger le modèle, construire un produit avec lui et le commercialiser. Pour les dernières sorties de MiniMax, cette implication est fausse.
Regardez ce qui s'est réellement passé avec M3. Ses poids sont disponibles sur Hugging Face sous une licence portant le tag minimax-community. Pas Apache 2.0. Pas MIT. Une licence personnalisée assortie de conditions. Quelle est la portée pratique de ces conditions ? NVIDIA a publié sa propre version de M3 quantifiée en NVFP4, et la fiche du modèle précise clairement que le checkpoint est prêt pour un usage non commercial, les conditions applicables renvoyant à la MiniMax Community License et exigeant l'affichage de « Built with MiniMax M3 ».
Il s'agit de NVIDIA — une entreprise disposant d'un important service juridique — qui a lu la licence et choisi cette formulation.
Et la licence de M3 était la version améliorée. La sortie précédente, M2.7, était publiée sous des conditions interdisant toute utilisation commerciale sans autorisation écrite préalable de MiniMax. Les fils de discussion Hugging Face de cette sortie valent la peine d'être lus si vous aimez observer une communauté et une équipe juridique négocier publiquement. MiniMax a assoupli les conditions pour M3 en réaction. Elles ne sont pas devenues permissives.
Je ne vais pas citer de seuils de revenus précis de la licence de M3, car les sources secondaires que j'ai trouvées se contredisent et ce type de détail vaut mieux être omis qu'approximatif. Lisez vous-même le fichier LICENSE avant de construire quoi que ce soit de commercial avec ce modèle. Ce n'est pas une clause de non-responsabilité ; c'est le conseil à suivre.
Voici mon jugement, signalé comme tel. Si M3 Pro est publié sous une licence de la même famille, « le plus grand modèle open source jamais publié » sera un titre intéressant pour les chercheurs et une note de bas de page pour quiconque commercialise un produit. Le téléchargement des poids vous donne la possibilité de les auditer et de vous auto-héberger. Il ne vous donne pas automatiquement le droit de bâtir une activité commerciale dessus. Ce sont deux choses différentes, et c'est dans l'écart entre les deux que de nombreuses équipes vont se retrouver en difficulté au cours des six prochains mois.
Même s'il sort, vous ne pourrez probablement pas l'exécuter
Supposons que la licence soit acceptable. Supposons qu'elle soit Apache 2.0 et que tout le monde se réjouisse. Il reste tout de même un obstacle.
M3 — le modèle de 428 B — n'est pas un modèle que l'on sert depuis une station de travail. Les déploiements en pleine précision documentés fonctionnent sur des systèmes de classe B200 équipés de huit GPU NVIDIA. C'est le modèle actuel, celui que l'on qualifie déjà de « gros modèle ».
M3 Pro serait plus de six fois plus grand.
Téléchargeable et exécutable sont deux mots différents. À mon avis, pour l'immense majorité des équipes — y compris celles qui disposent de moyens importants — les poids ouverts de M3 Pro seront quelque chose dont on lira des informations plutôt que quelque chose que l'on hébergera. La quantification aidera. Elle ne comblera pas un écart de 6× pour quiconque ne dispose pas d'un centre de données.
Ce qui mène à une conclusion légèrement embarrassante, mais qui me semble juste : pour la plupart des développeurs, que M3 Pro soit open source ou fermé ne change presque rien à la décision. Dans les deux cas, vous y accéderez par une API. Les poids ouverts comptent énormément pour les chercheurs, la stratégie nationale en matière d'IA et les laboratoires qui l'évaluent. Pour la personne qui lancera un agent de programmation au prochain trimestre, c'est un titre, pas un plan.
Si vous comptez de toute façon appeler les modèles via HTTP, la question utile devient de savoir lesquels sont accessibles avec une seule clé et un seul solde — c'est le problème du catalogue complet de modèles, et non celui des poids ouverts.
Le calendrier du troisième trimestre comporte un risque que personne ne prend en compte
Voici maintenant l'élément que je n'ai vu personne relier aux autres, et je veux être prudent quant à la force de cette affirmation.
Le 7 juillet 2026, Reuters a rapporté que le ministère chinois du Commerce avait rencontré d'importants acteurs nationaux de l'IA — notamment Alibaba, ByteDance et Z.ai — pour discuter de restrictions concernant l'accès depuis l'étranger aux modèles d'IA les plus avancés du pays. Ces discussions auraient porté sur les modèles fermés et open source, un régime de licences à plusieurs niveaux et un durcissement des sanctions pénales liées à la distillation de modèles.
The Information a publié l'article sur M3 Pro le 8 juillet 2026. Le lendemain.
C'est une spéculation, et je la présente comme telle : je considérerais « troisième trimestre, open source » comme un projet défini avant que la situation ne change, plutôt que comme un engagement sur lequel bâtir une feuille de route. Un modèle ouvert de pointe de 2,7 billions de paramètres correspond précisément à la catégorie d'artefacts visée par les discussions du ministère. Je n'ai aucune information indiquant que l'on ait demandé à MiniMax de ralentir. Je constate simplement que les deux articles sont parus à moins de vingt-quatre heures d'intervalle et qu'aucun des vingt articles que j'ai lus ne mentionnait les deux sujets.
Pour être juste, cette observation ne signifie pas que les modèles chinois constituent un mauvais pari. M3 est disponible dès maintenant, évalué par des tiers indépendants et utilisé en production. Le point plus précis est que fonder votre architecture sur un modèle non publié ajoute un risque politique au risque habituel lié au calendrier. C'est vrai pour tous les laboratoires. C'est simplement plus visible ici.
Ce que vous pouvez réellement construire aujourd'hui : MiniMax M3 via API
Donc, attendre M3 Pro est une mauvaise stratégie. En partie à cause de tout ce qui précède, et en partie parce que M3 est déjà très performant.
Dans l'Intelligence Index d'Artificial Analysis (v4.1) — un indice composite indépendant couvrant GDPval-AA, Terminal-Bench, SciCode, Humanity's Last Exam, GPQA Diamond et d'autres évaluations — la variante de raisonnement de M3 obtient 55. Elle arrive ainsi en tête des modèles à poids ouverts, au même niveau que GPT-5.5 et derrière Claude Opus 4.8. Ses scores détaillés comprennent 37 % à Humanity's Last Exam et 93 % à GPQA Diamond. Attention à la distinction entre les variantes : Artificial Analysis indique un score inférieur pour la configuration sans raisonnement ; vérifiez donc quelle variante est citée avant de reprendre une comparaison.
Les propres chiffres de MiniMax — 59,0 % à SWE-Bench Pro, 66,0 % à Terminal-Bench 2.1 et 83,5 à BrowseComp — sont communiqués par le fournisseur et obtenus sur l'infrastructure du laboratoire. Considérez-les comme indicatifs et non vérifiés indépendamment.
Pour appeler M3 sur GPT Proto, le point de terminaison suit le format de chat OpenAI. Un détail qui vous coûtera vingt minutes si vous le manquez : la clé d'API doit être placée dans l'en-tête Authorization directement, sans préfixe Bearer. La plupart des SDK ajoutent automatiquement ce préfixe.
Premier appel, avec cURL :
curl --location 'https://gptproto.com/v1/chat/completions' \
--header 'Authorization: YOUR_GPTPROTO_API_KEY' \
--header 'Content-Type: application/json' \
--data '{
"model": "MiniMax-M3",
"messages": [
{"role": "user", "content": "Summarize what MSA changes about attention at 1M context, in three sentences."}
],
"stream": false
}'
En Python, avec requests pour que l'en-tête d'authentification soit sans ambiguïté :
import os
import requests
API_KEY = os.environ["GPTPROTO_API_KEY"]
response = requests.post(
"https://gptproto.com/v1/chat/completions",
headers={
"Authorization": API_KEY, # no "Bearer " prefix
"Content-Type": "application/json",
},
json={
"model": "MiniMax-M3",
"messages": [
{"role": "user", "content": "Refactor this function for readability:\n\n" + open("main.py").read()}
],
"stream": False,
},
timeout=600, # long-context prefill is slow; don't use the default
)
response.raise_for_status()
print(response.json()["choices"][0]["message"]["content"])
Si vous préférez le SDK OpenAI, définissez base_url sur https://gptproto.com/v1 et remplacez l'en-tête au lieu de transmettre la clé via api_key, sinon le client ajoutera Bearer automatiquement.
Concernant le coût, la page du modèle MiniMax M3 indique 0,48 $ par million de jetons en entrée et 0,96 $ par million de jetons en sortie. Ce sont les chiffres ; je ne vais volontairement pas les transformer en pourcentage d'économie, car la comparaison honnête dépend de votre ratio entrée/sortie et certaines configurations peuvent donner un résultat différent.
Le détail tarifaire qui vous surprendra réellement n'est pas le prix par jeton. C'est le seuil de contexte. La fenêtre de M3 est de 1 M de jetons, mais le minimum garanti est de 512 K — et dans la tarification de première partie de MiniMax, dépasser 512 K de contenu en entrée fait passer l'intégralité de la requête au double du tarif standard. Pas seulement le dépassement : tout l'appel. Une requête de 600 K jetons ne coûte pas légèrement plus cher qu'une requête de 500 K ; chaque jeton est facturé environ deux fois plus cher.
Cela compte surtout dans les boucles d'agents, où le contexte s'accumule tour après tour sans être élagué. Au quinzième tour, vous pouvez payer le tarif long contexte non pas parce qu'une étape nécessitait un million de jetons, mais parce que vous n'avez jamais réduit le contexte. Épurez votre contexte. C'est un levier plus important sur votre facture que le choix du modèle. (Si vous évaluez M3 spécifiquement pour des charges de travail de programmation, nous avons approfondi les calculs de benchmark et de tarification dans un article distinct.)
Si M3 Pro sort, qu'est-ce que cela changera pour vous ?
Moins que vous ne le pensez, si vous vous organisez correctement dès maintenant.
Au niveau de l'agrégation, changer de modèle consiste à modifier une chaîne de caractères :
MODEL = os.environ.get("LLM_MODEL", "MiniMax-M3") # not hardcoded
C'est toute la migration, à supposer que le format des requêtes reste compatible avec OpenAI — ce qui a été le cas pour toutes les sorties de la série M jusqu'à présent.
Voici donc le coût de ce conseil, formulé honnêtement : ne réorganisez pas toute votre architecture pour un modèle dont les spécifications, la licence, les benchmarks et la date de sortie ne sont pas annoncés ou confirmés. La préparation adéquate à M3 Pro tient en une ligne — sortez l'identifiant du modèle de votre code et placez-le dans la configuration. Tout ce qui dépasse cela revient à planifier autour d'une rumeur.
En une phrase : M3 Pro est un projet annoncé qui mérite d'être surveillé, mais une très mauvaise raison d'attendre ; M3 est un modèle disponible, en tête du classement des modèles à poids ouverts, que vous pouvez appeler aujourd'hui.