Qwen 3.8 Max et GLM 5.2 en un coup d’œil
| Catégorie |
Qwen3.8-Max |
GLM-5.2 |
| État du produit |
Modèle de production stable |
Modèle versionné stable |
| Fenêtre de contexte |
Jusqu’à 1 M de tokens |
Jusqu’à 1 M de tokens |
| Sortie maximale |
Jusqu’à 128 k tokens |
Jusqu’à 131 072 tokens |
| Taille du modèle |
2,4 T au total, 95 Md actifs |
Environ 753 Md au total, 40 Md actifs |
| Entrées |
Texte, images et vidéo |
Texte |
| Appel de fonctions |
Pris en charge |
Pris en charge |
| Tarif officiel/API |
2 $/M en entrée, 6 $/M en sortie |
1,26 $/3,96 $ sur GPT Proto |
| Poids ouverts |
Annoncés ; pas encore disponibles |
Disponibles sous licence MIT |
| Disponibilité sur GPT Proto |
Disponible maintenant |
Disponible maintenant |
| Cas d’utilisation idéal |
Codage haut de gamme, vision, recherche, agents longue durée |
Codage économique, auto-hébergement, déploiement contrôlé par version |
Performances de codage : benchmarks face à un dépôt désordonné
GLM-5.2 possède actuellement le dossier public de benchmarks le plus clair. Z.ai indique des scores de 62,1 sur SWE-bench Pro et de 81,0 sur Terminal-Bench 2.1 avec Terminus-2. Sa documentation officielle publie également des informations sur la configuration de l’évaluation, notamment le moteur d’exécution et les contraintes de ressources.
Ces résultats restent communiqués par le fournisseur. Ils permettent d’identifier les points forts visés de GLM-5.2 en matière de codage et de tâches d’agents sur de longues séquences, mais ne prouvent pas qu’il surpassera Qwen3.8-Max sur tous les dépôts ou flux de production.
Les éléments indépendants restent incomplets. Au 10 août 2026, Artificial Analysis attribue à GLM-5.2 Max un score de 53 sur son Intelligence Index. Toutefois, le modèle Qwen figurant sur cette page comparative est Qwen3 Max Thinking, un modèle plus ancien dont le score est indiqué comme estimé. Cela ne prouve pas que GLM-5.2 surpasse le Qwen3.8-Max actuel.
La sortie stable de Qwen modifie la décision de déploiement, mais ne tranche pas automatiquement la question des benchmarks. Alibaba présente Qwen3.8-Max comme une mise à niveau majeure pour le codage complexe, les usages multimodaux, les tâches professionnelles et les agents longue durée. Son annonce officielle de lancement contient des détails sur l’architecture et des exemples de comportements d’agents prolongés, mais ne fournit pas de résultat directement comparable face à GLM-5.2 sur SWE-bench Pro ou Terminal-Bench 2.1.
La conclusion la plus juste n’est donc pas qu’un modèle a déjà gagné. GLM-5.2 dispose de preuves publiques plus établies en matière de codage, tandis que Qwen3.8-Max propose des capacités plus larges et est désormais suffisamment stable pour une évaluation en production.
Note sur les éléments disponibles : Le test suivant a utilisé Qwen3.8-Max Preview avant la sortie stable d’août. Il reste utile pour observer différents comportements d’ingénierie, mais ne doit pas être considéré comme un benchmark définitif du modèle de production actuel.
Un test réalisé le 22 juillet par 36Kr sur un projet web désordonné et inachevé fournit une comparaison comportementale plus concrète. Le projet comportait un frontend Next.js, Payload CMS, du code d’animation, une documentation obsolète, des fonctionnalités existantes et des bugs frontend et backend imbriqués.
Lors de la tâche initiale de lecture du projet, Qwen3.8-Max Preview est arrivé premier. Il a identifié l’état actuel du projet, lancé le service CMS manquant et terminé son analyse initiale en moins de 10 secondes dans cette configuration particulière.
GLM-5.2 s’est montré meilleur pour une tâche plus ciblée d’implémentation d’un carrousel. Il a conservé la lecture automatique, le contrôle par glissement et la boucle continue, même si la transition présentait encore un saut visuel. Qwen a été plus rapide, mais a supprimé le comportement de glissement et implémenté une imitation prolongée d’une boucle qui finissait par revenir au début.
Ce compromis est plus instructif qu’un gagnant désigné en une ligne. Dans ce test, Qwen a mieux reconnu l’intention actuelle et avancé rapidement, tandis que GLM s’est montré plus prudent lorsque la préservation des fonctionnalités et l’exhaustivité de l’implémentation étaient importantes.
Cependant, un seul projet web inachevé ne peut pas établir un classement universel de la vitesse ou de la qualité du code, notamment parce que le test utilisait la version Preview de Qwen3.8-Max et ne détaillait pas entièrement les routes de service, les budgets de tokens, les conditions de latence ou les révisions exactes des modèles.
Comment interpréter les éléments de preuve de manière équitable
Le test public de code ancien est utile, mais il ne s’agit pas d’un benchmark contrôlé. Utiliser le même projet inachevé et un flux de travail basé sur OpenCode rend la comparaison plus instructive que des captures d’écran sans rapport, mais l’absence de détails de configuration empêche une reproduction exacte.
Le test peut révéler des modes d’échec caractéristiques :
Qwen3.8-Max Preview a avancé rapidement et compris l’intention actuelle du projet, mais a supprimé une interaction demandée et remplacé l’implémentation de la boucle par une version incomplète.
GLM-5.2 a préservé davantage le comportement requis dans la tâche du carrousel, mais s’est montré plus lent lors de l’analyse initiale et a interprété une fois une documentation obsolète comme une tâche actuelle.
Ces résultats décrivent les versions testées dans cet environnement précis. Ils ne prouvent pas que Qwen est toujours plus rapide, que GLM écrit toujours du code plus sûr ou que le Qwen3.8-Max stable reproduira le comportement du modèle Preview.
Les éléments disponibles doivent être interprétés selon quatre niveaux :
Tests indépendants actuels en confrontation directe : Toujours absents pour Qwen3.8-Max stable face à GLM-5.2.
Benchmarks de codage publiés : Plus solides pour GLM-5.2, même si les résultats les plus marquants sont communiqués par le fournisseur.
Tests publics sur le même projet : Utiles pour identifier les différences comportementales, mais le test 36Kr disponible utilisait Qwen3.8-Max Preview.
Affirmations du fournisseur lors du lancement : Utiles pour comprendre les capacités visées, mais insuffisantes pour déclarer un gagnant sans validation externe.
Cette lacune reste un élément de la décision d’achat, mais elle ne signifie plus que Qwen doit être exclu de la production.
Si vous ne pouvez pas effectuer une comparaison privée, GLM-5.2 reste le choix présentant le moins de risques liés aux preuves disponibles pour les équipes qui privilégient les résultats de codage publiés, le coût API inférieur, les poids ouverts et un déploiement reproductible. Qwen3.8-Max est désormais un choix de production valide lorsque les entrées multimodales, la couverture plus large des tâches, le développement frontend ou les capacités d’agents longue durée sont prioritaires.
La recommandation pratique consiste à tester les deux modèles sur le même dépôt. Comparez les tests réussis, les régressions fonctionnelles, les appels d’outils invalides, les nouvelles tentatives, la latence, le coût total des tokens et le temps de correction humaine. Choisissez le modèle affichant le coût par tâche acceptée le plus faible, et non celui qui possède le benchmark isolé ou l’affirmation de lancement la plus impressionnante.
Tarifs et coûts de Qwen 3.8 Max et GLM 5.2
Il s’agit désormais d’une comparaison classique des prix des tokens.
| Modèle |
Prix des entrées |
Prix des sorties |
| Tarif officiel de Qwen3.8-Max |
2 $ par million |
6 $ par million |
| GLM-5.2 sur GPT Proto |
1,26 $ par million |
3,96 $ par million |
| Tarif direct affiché pour GLM-5.2 |
1,40 $ par million |
4,40 $ par million |
Pour une charge utilisant 10 millions de tokens en entrée et 2 millions de tokens en sortie :
Tarif officiel de Qwen3.8-Max : 10 × 2 $ + 2 × 6 $ = 32 $
GLM-5.2 sur GPT Proto : 10 × 1,26 $ + 2 × 3,96 $ = 20,52 $
GLM coûte moins cher selon ces tarifs. Qwen doit offrir un taux de réussite supérieur, moins de nouvelles tentatives, une meilleure compréhension multimodale ou moins de corrections humaines pour justifier la différence.
Cela est plausible pour les tâches visuelles difficiles ou les tâches exécutées sur de longues séquences. Il faut néanmoins le mesurer plutôt que le supposer.
Quel modèle est le meilleur pour les tâches de codage ?
| Besoin de codage |
Meilleur choix |
Pourquoi |
| Codage hébergé offrant les capacités maximales |
Qwen 3.8 Max |
Nouveau modèle phare, mieux positionné pour les tâches longue durée et multimodales |
| Reconstitution visuelle d’un frontend |
Qwen 3.8 Max |
Compréhension native des images et des vidéos |
| Travail sur un dépôt soumis à des contraintes budgétaires |
GLM-5.2 |
Tarifs inférieurs pour les tokens d’entrée et de sortie |
| Agent de codage auto-hébergé |
GLM-5.2 |
Les poids sous licence MIT sont disponibles dès maintenant |
| Déploiement ouvert reproductible |
GLM-5.2 |
Point de contrôle public, architecture et version stable |
| Flux de travail complexe de recherche ou professionnel |
Qwen 3.8 Max |
Conçu pour les tâches en plusieurs étapes mêlant codage, documents, recherche et entrées visuelles |
| Pipeline de production GLM existant |
Conservez GLM jusqu’à l’évaluation |
Une affirmation de modèle plus performant ne remplace pas l’évaluation de la migration |
Qwen3.8-Max l’emporte désormais dans une décision axée sur les capacités. GLM-5.2 reste supérieur lorsque le coût, l’auto-hébergement et le déploiement ouvert sont les critères déterminants.
Comment utiliser GLM-5.2 via GPT Proto
GPT Proto expose GLM-5.2 via un endpoint compatible avec OpenAI. Créez une clé API, ajoutez-la à votre environnement et appelez la chaîne de modèle active glm-5.2. Le même équilibre peut également être utilisé avec la collection de modèles GPT Proto.
Commencez par définir la clé et envoyez une requête cURL :
export GPTPROTO_API_KEY="your_gptproto_api_key"
curl https://gptproto.com/v1/chat/completions \
-H "Authorization: Bearer $GPTPROTO_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.2",
"messages": [
{
"role": "system",
"content": "Inspect before editing. Preserve API contracts and report the tests required for every proposed change."
},
{
"role": "user",
"content": "Plan a safe fix for duplicate refresh-token requests after concurrent 401 responses. State assumptions and verification steps before proposing code."
}
]
}'
L’appel Python équivalent utilise le SDK OpenAI :
python -m pip install openai
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["GPTPROTO_API_KEY"],
base_url="https://gptproto.com/v1",
)
response = client.chat.completions.create(
model="glm-5.2",
messages=[
{
"role": "system",
"content": (
"You are a repository-level coding assistant. Inspect before "
"proposing changes. Preserve existing API contracts, do not add "
"dependencies without approval, and list the verification "
"commands required for every proposed edit."
),
},
{
"role": "user",
"content": (
"An API client occasionally sends two refresh-token requests "
"after several concurrent requests fail with 401. Identify the "
"likely race condition, list the files you would inspect, and "
"return a minimal repair plan before writing code."
),
},
],
)
print(response.choices[0].message.content)
Ce code demande volontairement un plan d’inspection avant toute modification. Un modèle de codage qui invente immédiatement des fichiers ou modifie un contrat API a échoué, même si sa réponse semble soignée.
Qwen3.8-Max est désormais disponible sur GPT Proto ; les développeurs peuvent donc exécuter le même prompt de codage sur les deux modèles avec un seul compte API.
Utilisez qwen3.8-max pour Qwen et glm-5.2 pour GLM, en conservant un prompt, un état du dépôt, des autorisations d’outils, des paramètres de raisonnement et des critères de réussite identiques. Mesurez les tests réussis, les nouvelles tentatives, les appels d’outils invalides, la latence, le nombre total de tokens, les corrections humaines et le coût par tâche acceptée.
Commencez par l’API Qwen3.8-Max, ou comparez-la à l’endpoint GLM-5.2 existant avant d’y acheminer le trafic de production.
Verdict final
La conclusion initiale « GLM pour la production, Qwen uniquement pour l’expérimentation » est obsolète.
Qwen3.8-Max est désormais un modèle de production stable avec une API documentée, un contexte d’un million de tokens, des entrées multimodales, une tarification standard par token et une disponibilité sur GPT Proto. C’est le meilleur point de départ lorsque la capacité, notamment le codage visuel et l’exécution sur de longues séquences, constitue le principal obstacle.
GLM-5.2 reste moins cher et plus facile à contrôler. Ses poids sous licence MIT en font l’option évidente pour l’auto-hébergement, le déploiement privé et les équipes qui ont besoin dès aujourd’hui d’un point de contrôle ouvert et reproductible.
Choisissez Qwen pour la capacité. Choisissez GLM pour le coût et la maîtrise.