Qwen3.8-Max-0902 est la révision du 2 septembre 2026 de Qwen3.8-Max par Alibaba Qwen. Il ne s'agit pas d'une architecture nouvellement annoncée ni d'un successeur plus grand. Qwen le décrit comme le modèle existant à 2 400 milliards de paramètres de type mixture-of-experts, après un post-entraînement supplémentaire pour le codage et le travail collaboratif, dans le but d'améliorer les tâches d'entreprise complexes, la recherche scientifique et les workflows à long horizon.
Le modèle hébergé conserve l'enveloppe opérationnelle documentée de la famille Qwen3.8-Max : entrée texte, image et vidéo ; sortie texte ; appel de fonctions ; sorties structurées ; mise en cache du contexte ; et fonctionnement en mode réflexion ou non-réflexion. Alibaba indique une fenêtre de contexte nominale de 1 000 000 de tokens, avec jusqu'à 991 808 tokens en entrée en mode standard, 983 616 tokens en entrée en mode réflexion, et 131 072 tokens en sortie.
Le nom de la page et l'identifiant de requête nécessitent une distinction attentive. Qwen a annoncé la révision sous le nom Qwen3.8-Max-0902, tandis que la documentation publique Model Studio d'Alibaba liste toujours l'ID de modèle API général comme qwen3.8-max. Un fournisseur d'API peut exposer la mise à jour via l'alias standard ou un snapshot daté. Pour les appels GPTProto, utilisez la chaîne de modèle exacte affichée dans Quick Start au lieu d'en construire une à partir du titre de la page.
| Spécification |
Détail confirmé |
| Fournisseur |
Alibaba Qwen |
| Date de révision |
2 septembre 2026 |
| Type de mise à jour |
Post-entraînement supplémentaire pour le codage et le travail collaboratif |
| Taille de la famille publiée |
2,4 T de paramètres au total, architecture mixture-of-experts |
| Modalités d'entrée |
Texte, image et vidéo |
| Modalité de sortie |
Texte |
| Fenêtre de contexte |
1 000 000 de tokens |
| Entrée standard maximale |
991 808 tokens |
| Entrée maximale en mode réflexion |
983 616 tokens |
| Sortie maximale |
131 072 tokens |
| Appel de fonctions |
Pris en charge |
| Sorties structurées |
Pris en charge |
| Mise en cache du contexte |
Pris en charge |
| Fine-tuning |
Non pris en charge actuellement |
| Statut open-weight |
Aucun checkpoint étiqueté 0902 séparément n'a été identifié |
Qu'est-ce qui a changé entre Qwen3.8-Max et Qwen3.8-Max-0902 ?
La version 0902 est une mise à niveau comportementale plutôt qu'une réinitialisation des spécifications. Le nombre de paramètres, la fenêtre de contexte de 1 M, le plafond de sortie et les modalités d'entrée prises en charge restent dans l'enveloppe publiée de la famille Qwen3.8-Max. Le principal changement est un post-entraînement supplémentaire visant à améliorer le codage, le travail collaboratif, l'utilisation d'outils et l'achèvement soutenu des tâches.
| Facteur de décision |
Qwen3.8-Max original |
Qwen3.8-Max-0902 |
| Base du modèle |
Modèle phare 2,4 T MoE |
Même base de famille publiée |
| Contexte et sortie |
Contexte de 1 M ; jusqu'à 131 072 tokens en sortie |
Limites publiées inchangées |
| Objectif d'entraînement |
Codage, travail professionnel, recherche et agents |
Post-entraînement supplémentaire pour le codage et le travail collaboratif |
| Code Arena : WebDev |
1 669 dans la comparaison rapportée par Qwen |
1 691 au lancement, une augmentation de 22 points |
| Nommage de l'API publique |
Alibaba documente qwen3.8-max |
Utilisez l'alias affiché par le fournisseur ou l'ID de snapshot |
| Poids ouverts |
Des checkpoints distincts de la famille Qwen3.8 existent |
Aucun checkpoint étiqueté 0902 séparé confirmé |
Le résultat de Code Arena est un signal utile pour le codage frontend et agentique, mais il ne prouve pas que chaque dépôt ou workflow d'outils s'améliorera. Testez les anciennes et nouvelles routes avec les mêmes prompts, état du dépôt, permissions d'outils, paramètres de raisonnement et critères d'acceptation avant de basculer le trafic de production.
Applications de Qwen3.8-Max-0902
Codage à l'échelle du dépôt
Inspectez les frontières des modules, reliez les exigences au code existant, planifiez des modifications multi-fichiers, appelez des outils de développement et examinez la sortie des tests. Le contexte de 1 M peut contenir le code source, la configuration, la documentation et l'historique des agents, mais des tests exécutables et des checkpoints sont toujours nécessaires.
Agents à long horizon
Utilisez Qwen3.8-Max-0902 pour les agents de migration, les investigations techniques, les pipelines d'analyse de données et les assistants internes qui interrogent plusieurs outils avant de renvoyer des résultats structurés. Validez les arguments des outils et restreignez les permissions au niveau de l'application.
Recherche scientifique et travail de connaissance
Combinez des articles, des rapports, des tableaux, des diagrammes et des conclusions antérieures dans une même tâche. Exigez des identifiants de source et une séparation claire entre les faits extraits et l'inférence. Utilisez la récupération lorsque l'ensemble des sources dépasse la limite de contexte ou change fréquemment.
Révision d'entreprise multimodale
Analysez des captures d'écran, des graphiques, des documents visuels et des workflows enregistrés via une entrée texte, image et vidéo. Le point de terminaison renvoie du texte, donc la création de médias nécessite toujours un modèle d'image ou de vidéo dédié.
Qwen3.8-Max-0902 vs GPT-5.6, Gemini 3.7 Flash, Kimi K3 et GLM-5.3 Flash
Comparez le coût par résultat accepté, y compris les tokens de raisonnement, les tentatives, les appels d'outils échoués et la correction humaine—pas seulement le prix des tokens.
| Modèle |
Commencez ici quand |
Validez avant d'acheminer plus de trafic |
| Qwen3.8-Max-0902 |
La tâche combine un codage difficile, un contexte long, des preuves multimodales et de nombreuses étapes d'outils |
Comportement de régression, latence et tokens totaux sur votre propre workflow |
| GPT-5.6 |
Votre application dépend déjà d'un codage et d'un comportement d'agent orientés GPT |
Le niveau exact du modèle, la compatibilité des outils, la latence et le coût |
| Gemini 3.7 Flash |
Le travail multimodal à haut volume fait de la vitesse et du coût des tokens le premier filtre |
Précision sur dépôt complexe et longueur de sortie requise |
| Kimi K3 |
Les tâches longues de codage ou de recherche nécessitent une autre route frontière pour les tests A/B |
Achèvement au premier passage, précision des appels d'outils et utilisation des tokens |
| GLM-5.3 Flash |
Le trafic de codage et d'agents sensible au budget nécessite une première route moins coûteuse |
Les tâches les plus difficiles à plusieurs étapes et à l'échelle du dépôt |
Pour un routage sensible aux coûts, commencez par un modèle de classe Flash tel que GLM-5.3 Flash, puis envoyez les tâches difficiles ou échouant à répétition à Qwen3.8-Max-0902.
Vérifications de migration avant la mise à niveau
Avant de déplacer le trafic depuis l'original Qwen3.8 Max, enregistrez la chaîne de modèle, le prompt, les paramètres de raisonnement, les schémas d'outils, la latence, l'utilisation des tokens et le résultat. Exécutez la même évaluation sur 0902.
Copiez l'ID de modèle exact depuis GPTProto Quick Start ; ne supposez pas que le titre de la page est la chaîne de requête.
Retestez les schémas de fonctions, le JSON structuré, le streaming et la récupération d'erreurs.
Vérifiez le formatage des entrées image et vidéo si le workflow est multimodal.
Mesurez l'achèvement au premier passage, les tentatives, les tokens de sortie, la latence de bout en bout et les corrections humaines.
Gardez la route précédente disponible jusqu'à ce que la nouvelle révision passe les tests de régression.
Un tarif de token plus bas n'est pas automatiquement plus abordable lorsque les tentatives ou les réparations manuelles augmentent. Mesurez le coût par résultat accepté.
Quand devez-vous choisir Qwen3.8-Max-0902 ?
Choisissez Qwen3.8-Max-0902 pour les grands dépôts, les preuves multimodales, les sorties longues, l'utilisation structurée d'outils ou le travail soutenu sur de nombreuses étapes. Il convient aux agents de codage, aux assistants de recherche et aux systèmes d'entreprise censés produire un livrable vérifiable.
Utilisez un modèle plus petit ou de classe Flash pour les tâches courtes et sensibles à la latence. La clé et le solde partagés de GPTProto permettent aux développeurs de comparer le catalogue de modèles sans comptes fournisseurs séparés. Consultez les tarifs en direct et les résultats d'évaluation avant de définir une valeur par défaut.