Spécifications côte à côte
| |
GLM-5.2 |
DeepSeek V4 Pro |
| Développeur |
Z.ai (anciennement Zhipu AI) |
DeepSeek |
| Sortie |
13 juin 2026 |
24 avril 2026 |
| Paramètres |
753B au total / 40B actifs |
1,6T au total / 49B actifs |
| Fenêtre de contexte |
1M de tokens |
1M de tokens |
| Sortie maximale |
131 072 tokens |
384K tokens |
| Licence |
MIT |
MIT |
| Modes de raisonnement |
Élevé / Max |
Sans réflexion / Élevé / Max |
| Entrée d’images |
Non |
Non |
| Compatibilité API |
Compatible avec Anthropic |
Compatible avec OpenAI et Anthropic |
Sur le papier, ces deux modèles semblent être des frères : tous deux chinois, tous deux des modèles Mixture-of-Experts à poids ouverts sous licence MIT, et tous deux dotés d’une véritable fenêtre de contexte d’un million de tokens. Leurs philosophies architecturales sont toutefois différentes, et cette différence explique une grande partie des tendances que vous allez observer dans les benchmarks.
Pourquoi l’architecture est-elle importante ici ? Parce qu’une fenêtre d’un million de tokens n’est utile que si le modèle peut se permettre de l’exploiter. La réponse de Z.ai s’appelle IndexShare — réutiliser le même indexeur d’attention toutes les quatre couches d’attention clairsemée — ce qui, selon la fiche du modèle, réduit de 2,9× le calcul par token avec un contexte complet d’un million de tokens. La réponse de DeepSeek est un système d’attention hybride qui, selon sa fiche de modèle, fonctionne avec 27 % des FLOPs et 10 % du cache KV de son prédécesseur V3.2 à longueur équivalente. En termes simples : GLM-5.2 a consacré son budget d’efficacité à rester cohérent sur de très longues trajectoires d’agents ; DeepSeek l’a consacré à rendre le service d’un long contexte peu coûteux. Voilà toute la comparaison en miniature, honnêtement.
Benchmarks : ce que disent réellement les chiffres
Commençons par le seul chiffre indépendant et comparable disponible. Artificial Analysis exécute son Intelligence Index v4.1 — neuf évaluations, dont GDPval-AA, Terminal-Bench v2.1, Humanity’s Last Exam et GPQA Diamond — dans des conditions identiques pour tous les modèles. GLM-5.2, avec un effort maximal, obtient 51, le score le plus élevé de tous les modèles à poids ouverts. DeepSeek V4 Pro, avec un effort de raisonnement maximal, obtient 44, à égalité avec MiniMax-M3 à la deuxième place parmi les modèles ouverts. À titre de référence, Claude Opus 4.8 obtient 56 et GPT-5.5 55 ; l’écart entre ces deux modèles ouverts est donc réel, mais aucun des deux n’est très éloigné de la frontière propriétaire. C’est un fait mesuré indépendamment.
Tout ce qui suit est communiqué par les éditeurs, et je le traiterai comme tel.
Lorsque les tableaux des deux éditeurs se recoupent, GLM-5.2 est en tête : 62,1 contre 55,4 sur SWE-bench Pro, 77,0 contre 73,6 sur MCP-Atlas, et 54,7 contre 48,2 sur Humanity’s Last Exam avec outils. À noter : le score de DeepSeek sur SWE-bench Pro n’a aucune entrée indépendante dans le classement SEAL de Scale ; cet écart de 6,7 points repose donc entièrement sur les données de l’éditeur.
Il y a ensuite le territoire incontesté de DeepSeek — les benchmarks que GLM-5.2 n’a tout simplement pas publiés. DeepSeek V4 Pro annonce 93,5 % sur LiveCodeBench, le score le plus élevé de tous les modèles, ouverts ou fermés. Une note de 3206 sur Codeforces. 90,1 % sur GPQA Diamond. 95,2 % sur HMMT. Et 80,6 % sur SWE-bench Verified, la meilleure performance parmi les modèles à poids ouverts. Z.ai a entièrement ignoré Verified pour passer directement à SWE-bench Pro, plus difficile. Mon interprétation est que les deux laboratoires ont évalué leurs points forts et sont restés discrets là où ils auraient perdu — c’est précisément pourquoi le chiffre indépendant d’AA compte davantage que n’importe quel tableau fourni par un éditeur.
Un piège qu’aucune autre comparaison, à ma connaissance, n’a signalé : les chiffres de Terminal-Bench qui circulent ne sont pas comparables. Z.ai annonce 81,0 pour GLM-5.2 sur Terminal-Bench 2.1. La fiche de modèle de DeepSeek annonce 67,9 sur Terminal-Bench 2.0 — une version différente du benchmark. Si vous voyez un article placer ces deux chiffres dans la même colonne, fermez l’onglet.
Programmation : deux cerveaux différents
Le résumé honnête est que ces modèles excellent dans des types de programmation différents, et la distinction est suffisamment nette pour permettre un routage adapté.
GLM-5.2 est conçu pour le long terme. Selon les chiffres communiqués par Z.ai, il atteint 74,4 % sur FrontierSWE — un benchmark mesurant des projets d’ingénierie ouverts à l’échelle de plusieurs heures, voire de dizaines d’heures — devançant GPT-5.5 (72,6 %) et se situant à moins d’un point de Claude Opus 4.8. Son score de 81,0 sur Terminal-Bench 2.1 représente une progression de 19 points par rapport à son prédécesseur GLM-5.1. La tendance observée dans toutes les évaluations à long horizon est claire : ce modèle a été entraîné pour conserver un plan au fil d’une trajectoire complexe en plusieurs étapes sans perdre le fil.
DeepSeek V4 Pro est le spécialiste algorithmique. LiveCodeBench teste des problèmes de programmation compétitive — précis, autonomes, où seule la correction compte — et aucun modèle au monde n’a publié un score supérieur. La note de 3206 sur Codeforces et les 95,2 % sur HMMT racontent la même histoire : avec une spécification complète, il produit une solution correcte et concise.
Imaginez donc les deux charges de travail. « Lisez ce service de 200 fichiers, comprenez les conventions, proposez et exécutez une refactorisation » — c’est le terrain de prédilection de GLM-5.2 et, avec environ 3 000 tokens par fichier, 200 fichiers représentent 600 000 tokens de contexte qu’il peut réellement conserver. « Voici un problème entièrement spécifié, donnez-moi un correctif de 200 lignes correct » — DeepSeek fait cela toute la journée pour une fraction du coût.
Le débat de la communauté sur Hacker News résume mieux le compromis que n’importe quel benchmark. Un camp affirme que DeepSeek est suffisamment bon et peu coûteux pour 95 % du travail quotidien. La réponse de l’autre camp : sur les tâches à long horizon, les échecs se cumulent — un modèle « suffisant pour 95 % » transforme une exécution d’agent de plusieurs heures en désastre, car les 5 % d’erreurs s’empilent. Les deux points de vue sont justes. Ils décrivent simplement des tâches différentes.

Tarification : prix affiché contre facture réelle
C’est ici que la plupart des comparaisons se trompent discrètement, car la tarification de DeepSeek a changé deux fois cette année et la moitié des articles qui apparaissent pour cette recherche citent encore les tarifs d’avril.
Commençons par les faits. DeepSeek a lancé V4 Pro le 24 avril à un tarif de référence de 1,74 $ en entrée / 3,48 $ en sortie par million de tokens, avec une remise de lancement de 75 %. Le 31 mai, cette remise est devenue le tarif officiel permanent : 0,435 $ en entrée / 0,87 $ en sortie par million de tokens, avec une entrée en cache à 0,0036 $ par million (page tarifaire officielle de DeepSeek). Ce tarif de cache est plus important qu’il n’y paraît — DeepSeek met automatiquement en cache les préfixes répétés ; un agent qui renvoie le même contexte de dépôt et le même prompt système à chaque tour paie donc environ 1 % du tarif sans cache pour ces tokens. Pour les charges de travail d’agents fortement dépendantes du cache, la facture d’entrée effective peut être largement inférieure même aux 0,435 $ affichés.
Le tarif catalogue de GLM-5.2 sur l’API autonome de Z.ai est de 1,40 $ en entrée / 4,40 $ en sortie par million de tokens. (Via notre endpoint GLM-5.2, le tarif est de 1,26 $ / 3,96 $ — 10 % sous le prix catalogue.)
Par token, DeepSeek V4 Pro est donc environ 3× moins cher en entrée et 5× moins cher en sortie. Affaire conclue ? Pas tout à fait — et c’est précisément ce que les tableaux de prix en gros titres ne montrent pas.
Le prix par token et le coût par tâche divergent lorsque deux modèles consacrent des quantités différentes de réflexion à l’accomplissement du même travail. GLM-5.2 est un grand consommateur de raisonnement : les données d’Artificial Analysis sur la consommation de tokens le situent autour de 42 000 tokens de sortie par tâche de l’Intelligence Index avec un effort maximal — davantage que GPT-5.5 dans son réglage le plus élevé. Faisons le calcul : 42 000 tokens de sortie au tarif catalogue de 4,40 $ de GLM représentent environ 0,18 $ de sortie par tâche. Les mêmes 42 000 tokens à 0,87 $ chez DeepSeek coûteraient moins de 0,04 $ — mais la consommation réelle de tokens par tâche de DeepSeek n’est pas publiée sous une forme comparable ; tout ratio de coût par tâche doit donc être considéré comme une estimation, et non comme une mesure. La tendance est claire même si le multiple exact ne l’est pas : la prime de coût réelle de GLM par tâche terminée correspond à l’écart de prix par token multiplié par son appétit pour les tokens de raisonnement. Prévoyez la facture, pas le prix affiché.
Mon avis, si cela peut vous être utile : si le coût est votre contrainte principale, cette section a déjà tranché pour vous : c’est DeepSeek. La suite de l’article s’adresse à ceux dont la contrainte est la capacité.
Lequel convient à votre projet ?
Vous développez un agent de programmation à l’échelle d’un dépôt. Choisissez GLM-5.2. L’avance indépendante en intelligence (51 contre 44), la tendance des benchmarks à long horizon et le contexte d’un million de tokens pour lequel il a été spécifiquement entraîné à rester cohérent vont tous dans le même sens. Le coût : vous paierez plusieurs fois plus par tâche et, pour les tâches rapides et bien spécifiées, vous paierez une profondeur dont vous n’avez pas besoin.
Votre charge de travail concerne les algorithmes, les mathématiques ou le raisonnement STEM. Choisissez DeepSeek V4 Pro. Ses résultats sur LiveCodeBench et Codeforces sont les meilleurs publiés à ce jour, pour 0,87 $ par million de tokens de sortie. Le coût : pour les tâches d’ingénierie ouvertes de plusieurs heures, ses scores plus faibles à long horizon suggèrent davantage d’échecs cumulatifs — exactement le mode d’échec décrit par les sceptiques de HN.
Vous êtes soumis à une contrainte de coût et avez besoin d’un haut débit. DeepSeek, sans grande discussion — et structurez vos prompts avec des préfixes stables afin que le tarif de 0,0036 $ en cas de succès du cache fasse le gros du travail. Le coût : vous acceptez le deuxième modèle ouvert en intelligence générale, ce que vous ne remarquerez probablement jamais pour la classification, l’extraction et la programmation courante.
Comment accéder aux deux modèles via une seule API
L’intérêt pratique de les exécuter côte à côte est le suivant : les deux sont disponibles via un seul endpoint et une seule clé, si bien que les tester en A/B sur votre charge de travail réelle ne nécessite qu’une modification d’une ligne. Tous deux utilisent le format de complétion de chat compatible avec OpenAI.
import requests
import json
url = "https://gptproto.com/v1/chat/completions"
def ask(model: str, prompt: str) -> str:
payload = json.dumps({
"model": model,
"messages": [{"role": "user", "content": prompt}],
"stream": False
})
headers = {
"Authorization": "GPTPROTO_API_KEY",
"Content-Type": "application/json"
}
response = requests.post(url, headers=headers, data=payload)
return response.json()["choices"][0]["message"]["content"]
task = "Refactor this function to be idempotent: ..."
# Même requête, deux modèles — comparez-les sur votre propre charge de travail
print(ask("glm-5.2", task))
print(ask("deepseek-v4-pro", task))
Ou avec cURL :
curl --location 'https://gptproto.com/v1/chat/completions' \
--header 'Authorization: GPTPROTO_API_KEY' \
--header 'Content-Type: application/json' \
--data '{
"model": "glm-5.2",
"messages": [{"role": "user", "content": "Who are you?"}],
"stream": false
}'
Remplacez "glm-5.2" par "deepseek-v4-pro" et le même appel interrogera l’autre modèle. Le catalogue complet est disponible sur gptproto.com/model.