Qu'est-ce que GLM-5.3-FlashX ?
GLM-5.3-FlashX est un niveau d'API haute vitesse construit autour de la base de capacités GLM-5.3-Flash. Z.ai liste Flash et FlashX sur la même page de documentation de modèle, avec des identifiants distincts :
glm-5.3-flash
glm-5.3-flashx
Les deux entrées partagent les mêmes spécifications de famille publiées. Cela permet de traiter FlashX comme un choix de service plutôt que comme une nouvelle génération de modèle. Cela ne prouve pas que chaque détail d'implémentation ou fichier de poids soit identique ; Z.ai n'a pas publié de checkpoint FlashX distinct ni de déclaration qui tranche cette question au niveau des poids.
| Spécification |
GLM-5.3-FlashX |
| Développeur |
Z.ai / Zhipu AI |
| Date de sortie |
18 septembre 2026 |
| ID officiel du modèle API |
glm-5.3-flashx |
| Positionnement |
Niveau d'inférence hébergé haute vitesse |
| Vitesse de génération annoncée |
Jusqu'à 200 tokens de sortie/s |
| Architecture |
Mélange d'experts ; attention hybride sparse et linéaire |
| Paramètres totaux / actifs |
320B au total / environ 18B actifs par token |
| Fenêtre de contexte |
1,048,576 tokens |
| Sortie maximale |
131,072 tokens |
| Entrées |
Texte, images, vidéo et fichiers |
| Sortie |
Texte et appels d'outils |
| Réflexion |
Activée ; la configuration hébergée documentée ne permet pas de la désactiver |
| Autres fonctionnalités documentées |
Streaming, appel de fonctions, mise en cache du contexte, sortie structurée |
Z.ai recommande temperature: 1, top_p: 0.95, un effort de raisonnement maximal et un contexte de réflexion conservé. Pour l'utilisation d'outils en streaming, sa documentation recommande d'activer à la fois le streaming des réponses et les arguments d'outils en streaming. Ces réglages décrivent la route de Z.ai. Une passerelle peut exposer des noms de paramètres différents ou omettre certains contrôles, ce qui est une raison pour laquelle un payload copié ne doit pas être étiqueté portable sans le tester sur le point de terminaison exact.
La fonctionnalité pratique est l'entrée multimodale native dans une boucle d'agent à contexte long. FlashX peut inspecter du texte, des captures d'écran, des fichiers et de la vidéo, puis renvoyer du texte ou des appels d'outils. Il ne génère pas d'images ni de vidéo. Le contexte d'un million de tokens décrit aussi une capacité, et non un rappel garanti sur un million complet de tokens ; les tests de récupération et d'acceptation comptent toujours.
Lancement de GLM-5.3-FlashX et l'annonce de 200 tokens/s
Z.ai a lancé GLM-5.3-FlashX le 18 septembre 2026. La documentation anglaise de l'entreprise indique que l'API est active et annonce une vitesse d'inférence de 200 tokens/s. La couverture du lancement décrit ce chiffre comme pouvant atteindre jusqu'à cinq fois la vitesse de GLM-5.3-Flash.
« Jusqu'à 200 tokens/s » est une promesse de débit de sortie maximal. Ce n'est pas la garantie que chaque requête se termine cinq fois plus vite.
Une requête API comporte plusieurs horloges :
Temps jusqu'au premier token : mise en file d'attente, traitement du prompt, prétraitement multimodal et raisonnement initial avant le début de la sortie visible.
Vitesse de sortie soutenue : le débit auquel les tokens arrivent après le début de la génération.
Temps d'achèvement de bout en bout : la requête entière, y compris le raisonnement caché, une réponse longue, les nouvelles tentatives et les appels d'outils.
Latence de queue : comportement p95 ou p99 sous concurrence réelle, plutôt qu'une médiane issue d'un trafic propre.
L'argument principal de FlashX concerne directement la deuxième horloge. Il peut améliorer les autres, mais la page de lancement ne publie pas le prompt de test, la longueur de sortie, la région, la concurrence, le réglage de raisonnement ni le percentile derrière 200 tokens/s.
Le trafic public initial illustre la différence entre un maximum et une distribution. Une place de marché de routage publique affichait environ 80–87 tokens/s en médiane pendant une courte fenêtre après le lancement, tandis que ses observations des percentiles supérieurs approchaient le maximum annoncé. La même page affichait un temps médian jusqu'au premier token d'environ 2.3 secondes. Ces valeurs sont une observation changeante de cette route, pas un benchmark exécuté par GPT Proto et pas une garantie de niveau de service de Z.ai. Elles restent utiles pour une conclusion : un plafond de 200 tokens/s peut coexister avec des requêtes typiques bien plus faibles. Nous ne créons pas de lien vers des pages de comparaison d'agrégateurs d'API dans cet article éditorial ; conservez la source et la date de capture dans la fiche de faits interne.
Les affirmations de tests FlashX indépendants méritent le même examen. Un post communautaire indiquait que des prompts courts maintenaient souvent plus de 160 tokens/s, mais il ne fournissait ni journaux bruts, ni script, ni paramètres de concurrence, ni ensemble de prompts reproductible. Ce chiffre ne doit pas servir à budgétiser. Au 21 septembre, nous n'avons pas trouvé de test développeur public FlashX contre Flash avec suffisamment de preuves originales pour le considérer comme un benchmark contrôlé.
Tarification de GLM-5.3-FlashX
La couverture du lancement publiée le 18 septembre reproduisait le tableau de prix chinois suivant en yuans chinois par million de tokens. La page produit anglaise de Z.ai n'exposait pas le même tableau de tokens lors de la vérification du 21 septembre ; ces chiffres régionaux sont donc attribués aux reportages de lancement plutôt que présentés comme un tarif mondial universel :
| Utilisation |
GLM-5.3-FlashX |
GLM-5.3-Flash |
Prime FlashX |
| Entrée nouvelle |
¥2.00 |
¥0.80 |
2.5× |
| Entrée mise en cache |
¥0.50 |
¥0.20 |
2.5× |
| Sortie |
¥7.00 |
¥2.80 |
2.5× |
| Stockage de cache |
Temporairement gratuit |
Temporairement gratuit |
— |
La mention « temporairement gratuit » pour le stockage de cache est promotionnelle et peut changer. Elle ne doit pas être considérée comme une fonctionnalité permanente à coût nul.
La documentation officielle des modèles de Z.ai n'affiche actuellement pas de tableau de tokens FlashX. Une route publique indiquant Z.ai comme fournisseur affichait $0.37 par million de tokens d'entrée, $0.075 par million de tokens d'entrée mis en cache et $1.25 par million de tokens de sortie lors de la vérification du 21 septembre. Ce sont des prix de route tiers utiles, mais ils ne prouvent pas l'existence d'un prix direct Z.ai universel unique selon les régions, contrats, taxes et devises.
La relation de 2.5× est plus facile à vérifier qu'un chiffre converti en USD. Prenons une charge de travail qui consomme 10 millions de nouveaux tokens d'entrée et deux millions de tokens de sortie, sans aucun hit de cache :
Coût FlashX = 10 × ¥2 + 2 × ¥7 = ¥34
Coût Flash = 10 × ¥0.8 + 2 × ¥2.8 = ¥13.6
Le niveau de vitesse ajoute ¥20.4 pour cette charge de travail. Ce surcoût n'a de sens que si le temps d'attente réduit vaut plus de ¥20.4 pour l'entreprise ou l'utilisateur.
Pour une tâche par lots nocturne, terminer plus tôt peut n'apporter aucune valeur supplémentaire. Pour un agent qui bloque un développeur pendant 12 tours de modèle séquentiels, gagner du temps à chaque étape de génération peut valoir bien plus que le surcoût en tokens. L'équation utile est donc :
valeur du temps gagné > coût supplémentaire en tokens + coût de migration et de validation
N'estimez pas le coût avec les seuls tokens de réponse visibles. Les tokens de réflexion, les nouvelles tentatives, les appels d'outils échoués et les réponses inutilement longues peuvent modifier la facture. La métrique de production doit être le coût par tâche acceptée, et non le prix par million de tokens pris isolément.
GLM-5.3-FlashX vs GLM-5.3-Flash
GLM-5.3-FlashX et GLM-5.3-Flash répondent à des priorités opérationnelles différentes. Les preuves publiques n'établissent pas une amélioration de qualité pour FlashX ; elles établissent un niveau de vitesse plus cher.
| Dimension |
GLM-5.3-FlashX |
GLM-5.3-Flash |
| Principale raison de choisir |
Temps d'attente interactif plus faible |
Coût en tokens plus faible |
| Vitesse de sortie annoncée |
Jusqu'à 200 tokens/s |
Niveau de service standard inférieur ; les rapports de lancement l'utilisent comme référence 1× |
| Prix catalogue en Chine |
¥2 entrée / ¥7 sortie par 1M |
¥0.8 entrée / ¥2.8 sortie par 1M |
| Spécifications publiques |
320B/18B, contexte 1M, entrée multimodale native |
Mêmes spécifications de famille publiées |
| Benchmark d'intelligence distinct |
Aucun publié pour FlashX |
Suite de benchmarks Flash disponible |
| GLM Coding Plan |
Non inclus au lancement |
Inclus avec le quota de forfait documenté |
| Auto-hébergement |
Aucun poids FlashX distinct annoncé |
Les poids Flash de base sont sous licence MIT |
| Meilleur profil de charge de travail |
Interactif, séquentiel, avec humain dans la boucle |
Par lots, asynchrone, à gros volume, sensible au prix |
Choisissez FlashX lorsqu'une personne regarde le flux, que la sortie est assez longue pour que la vitesse de décodage compte, et que le flux de travail enchaîne plusieurs appels de modèle. Les copilotes de codage, les agents de recherche interactifs, les assistants de support en direct et les boucles d'itération visuelle correspondent à ce profil.
Gardez Flash lorsque la tâche s'exécute sans surveillance, que les outils externes dominent le temps écoulé, que les réponses sont courtes, ou que la charge produit suffisamment de tokens pour qu'un tarif 2.5× change matériellement le budget. Un appel à une base de données qui prend huit secondes n'est pas résolu en générant plus vite la phrase suivante. Pas plus qu'un agent de navigateur qui passe la plupart de son temps à attendre des pages, des téléchargements ou des approbations.
La distinction d'auto-hébergement est également importante. GLM-5.3-Flash dispose de poids sous licence MIT, bien qu'un checkpoint de 320B exige encore une infrastructure sérieuse. FlashX est un niveau de performance hébergé, et non un commutateur de vitesse téléchargeable distinct. Les équipes qui ont besoin de contrôle du déploiement ou d'une économie matérielle fixe devraient évaluer les poids Flash de base au lieu de supposer que FlashX peut être auto-hébergé.
GLM-5.3-FlashX est-il bon pour le codage ?
GLM-5.3-FlashX est un modèle de codage plausible lorsque la latence fait partie de l'expérience produit. Une livraison plus rapide des tokens peut améliorer la complétion de code, réduire les pauses pendant les longs patchs et raccourcir les boucles d'agent qui planifient, modifient, exécutent des outils et inspectent les résultats de manière répétée.
Ce que les preuves ne montrent pas, c'est que FlashX écrit du meilleur code que Flash.
Z.ai a publié de solides résultats de codage et d'agent pour la base de capacités GLM-5.3-Flash sous-jacente, notamment 63.4 sur DeepSWE v1.1, 48.8 sur AutomationBench et 29.0 sur Z.ai Code Bench avec un effort de raisonnement maximal. Ce sont des résultats produits par le fournisseur pour Flash, y compris un benchmark interne. Ils ne constituent pas une évaluation de qualité distincte de FlashX. Un service plus rapide peut faire paraître la même capacité meilleure dans un IDE, mais seul un test apparié peut établir la parité de qualité sur un dépôt spécifique.
Une évaluation de codage utile doit garder les éléments suivants fixes entre Flash et FlashX :
commit du dépôt et fichier de verrouillage des dépendances ;
prompt et instructions système ;
outils, schémas et autorisations ;
effort de raisonnement et limites de sortie ;
politique de timeout et de nouvelle tentative ;
nombre et ordre des tâches ;
tests d'acceptation et règles de revue humaine.
Enregistrez ensuite plus que des tokens par seconde :
| Métrique |
Pourquoi c'est important |
| Temps jusqu'au premier token |
Mesure la pause avant le début du travail visible |
| Tokens de sortie soutenus/s |
Teste la vitesse annoncée là où elle s'applique |
| Temps de tâche de bout en bout |
Inclut le raisonnement, les outils, les tests et les nouvelles tentatives |
| Temps de tâche p95 |
Révèle les valeurs aberrantes lentes masquées par les moyennes |
| Patchs acceptés |
Empêche une sortie rapide mais inutilisable de l'emporter |
| Taux d'erreur des appels d'outils |
Capture la fiabilité de l'agent |
| Total de tokens facturés |
Inclut la verbosité et les nouvelles tentatives |
| Temps de correction humaine |
Mesure le travail que le modèle renvoie au développeur |
La règle de décision est stricte : ne passez à FlashX que si Flash satisfait déjà la barre de qualité et que FlashX réduit suffisamment le p95 ou le temps de tâche complète pour justifier le coût plus élevé par tâche acceptée. Un flux plus rapide est agréable ; un patch accepté plus rapide est économiquement utile.
GPT Proto n'a pas encore terminé de test d'intégration FlashX, nous ne publions donc pas d'exemple de requête GPT Proto. L'ID officiel du modèle est connu, mais un ID de modèle seul ne confirme pas un endpoint de passerelle, le comportement d'authentification, le chemin d'envoi multimodal, le mappage des appels d'outils ou la facturation.
GLM-5.3-FlashX vs DeepSeek Flash
Un tableau précis GLM-5.3-FlashX vs DeepSeek Flash nécessite une clarification que beaucoup de pages de comparaison omettent : « DeepSeek Flash » n'est pas un libellé produit stable et non ambigu. Les résultats de recherche actuels mélangent DeepSeek V4 Flash, des variantes expérimentales datées, des noms de route non officiels et des instantanés de prix de différents fournisseurs.
Combiner ces entrées en un seul rival produit une fausse précision. Un benchmark pour un checkpoint, un prix provenant d'une autre route et une limite de contexte d'une version ultérieure ne décrivent pas un modèle que quiconque peut réellement acheter.
Verrouillez la comparaison sur un ID de modèle DeepSeek exact, un fournisseur, une région, une date de prix et une configuration API. Exécutez ensuite la même configuration d'évaluation de dépôt et d'agent que celle utilisée pour FlashX. Comparez les patchs acceptés, la fiabilité des outils, le total de tokens, le temps d'horloge murale, la correction humaine et le coût par tâche acceptée.
GLM-5.3-FlashX présente trois attributs clairement documentés dans ce test : entrée native de texte, d'image, de vidéo et de fichier ; une fenêtre de contexte d'un million de tokens ; et un niveau hébergé haute vitesse dédié. Un candidat DeepSeek peut être moins cher ou plus rapide sur une route particulière, en particulier pour un trafic de codage à forte utilisation de cache, mais cette conclusion doit provenir du point de terminaison sélectionné plutôt que d'un libellé générique « DeepSeek Flash ».
Si votre application est uniquement textuelle et sensible au prix, incluez un candidat DeepSeek. Si l'agent doit inspecter des captures d'écran ou de la vidéo dans le même appel de modèle, GLM-5.3-FlashX part avec une adéquation documentée plus claire. Aucune de ces observations ne remplace le test de charge apparié.
Devriez-vous passer à GLM-5.3-FlashX ?
Passez de Flash à FlashX si ces trois conditions sont réunies :
GLM-5.3-Flash répond déjà à vos exigences de qualité et de fiabilité des outils.
Le décodage du modèle représente une part significative de votre délai de bout en bout.
Un test contrôlé montre que le temps gagné vaut un tarif de tokens 2.5×.
Ne passez pas à FlashX par défaut pour la génération hors ligne, l'analyse planifiée ou le traitement par lots à gros volume. Ne passez pas à FlashX lorsque la récupération, les actions de navigateur, les bases de données, les builds ou l'approbation humaine dominent le temps de tâche. Et ne passez pas à FlashX pour un meilleur raisonnement, sauf si votre propre test le démontre ; Z.ai n'a pas publié de benchmark d'intelligence distinct pour FlashX.
Un déploiement progressif est plus sûr qu'un basculement complet. Acheminez une tranche représentative du trafic vers FlashX, conservez les mêmes prompts et outils, et comparez les flux de travail complets. Si le p95 s'améliore tandis que la qualité des tâches acceptées reste stable, étendez. Si seul le flux de texte animé semble plus rapide alors que le temps d'achèvement et l'acceptation restent identiques, gardez la route moins chère.
GLM-5.3-FlashX est-il disponible sur GPT Proto ?
Pas encore. GPT Proto prévoit d'ajouter GLM-5.3-FlashX, mais la disponibilité en production n'a pas été confirmée au 21 septembre 2026.
Avant de publier une page de modèle ou un exemple de code GPT Proto, l'intégration doit vérifier le point de terminaison, la chaîne de modèle exacte, les entrées texte et multimodales, le streaming, les appels d'outils, les contrôles de raisonnement, la mise en cache du contexte, le comportement en cas d'erreur, les limites et les prix facturés.
Pour les modèles que vous pouvez utiliser dès maintenant, parcourez le répertoire actuel des modèles GPT Proto. Vous pouvez également consulter la page d'accueil GPT Proto pour les mises à jour de la plateforme. Pour une explication plus approfondie de la base de capacités sous-jacente, lisez Qu'est-ce que GLM-5.3-Flash ?.