Tarifs+7% bonus
Schuyler Stacy2026-06-24

Qu'est-ce que Wan 2.7 ? Guide du modèle en mode réflexion d'Alibaba (2026)

La plupart des guides affirment que Wan 2.7 est open source. Les preuves issues des sources officielles disent le contraire. Ce que le modèle d'avril 2026 d'Alibaba propose réellement — et comment l'exécuter.

Qu'est-ce que Wan 2.7 ? Guide du modèle en mode réflexion d'Alibaba (2026)

Recherchez « wan 2.7 » et vous obtenez deux réponses qui ne peuvent pas être vraies en même temps. Certains guides vous expliquent de télécharger les poids et de l'exécuter sur votre propre GPU. D'autres affirment qu'il n'est accessible que via une API. J'ai voulu déterminer laquelle était correcte, car la réponse décide si vous pouvez réellement auto-héberger ce modèle — et la version courte est que la plupart des articles affirmant avec assurance qu'il est « open source » répètent une habitude, pas un fait. Voici ce qu'est réellement Wan 2.7, ce qu'Alibaba a publié ou non, et comment mettre un modèle Wan en production dès aujourd'hui.

Table des matières

Ce qu'est réellement Wan 2.7

Wan 2.7 n'est pas un modèle unique. Il s'agit d'une vague de sorties du Tongyi Lab d'Alibaba, lancée début avril 2026, qui couvre deux types de médias à la fois. Il y a un volet image — Wan2.7-Image et un Wan2.7-Image Pro distinct, que les documents de lancement datent d'environ le 1er avril — et un volet vidéo, une suite de quatre modèles couvrant la génération texte-vidéo, image-vidéo, référence-vidéo et le montage vidéo à partir d'instructions, déployée au cours des jours suivants. Cette double portée explique précisément pourquoi les résultats de recherche se contredisent sur la question de savoir si Wan 2.7 est un « modèle d'image » ou un « modèle vidéo ». C'est les deux, regroupés sous un même numéro de version.

Le nom lui-même mérite d'être clarifié, car il prête à confusion. « Wan » est l'abréviation internationale de Tongyi Wanxiang (通义万相), la gamme d'IA créative d'Alibaba. Elle côtoie les modèles de langage Qwen sous la même direction d'entreprise, mais constitue une famille de produits différente. Ainsi, lorsqu'une plateforme d'hébergement classe Wan dans un chemin qwen, il s'agit d'un choix de catalogage, et non d'une affirmation selon laquelle Wan serait un modèle Qwen.

En une phrase : Wan 2.7 est la vague de génération d'images et de vidéos lancée par Alibaba en avril 2026, dont la fonctionnalité phare est le mode Thinking.

Comment fonctionne le mode Thinking

Avant le mécanisme, voyons pourquoi il existe. Un modèle vidéo standard transforme directement votre prompt en images. Il ne s'arrête pas pour réfléchir à votre demande : il lit le texte, choisit un chemin dans son espace latent, puis décode. Cela convient à un plan simple et net. La situation devient fragile dès que vous demandez quelque chose de structuré : une séquence composée de plusieurs plans, un personnage qui doit avoir la même apparence au troisième plan qu'au premier, ou un mouvement de caméra qui doit aboutir sur un moment précis. Le modèle se précipite et les raccords deviennent visibles.

Le mode Thinking, tel que le décrit Alibaba, ajoute une étape de planification avant la génération. Le modèle construit d'abord un plan de composition — comprendre l'intention du prompt, déterminer comment les éléments s'articulent dans l'espace et le temps, et définir la logique des plans — puis seulement il génère. La promesse est de réduire les artefacts et d'améliorer la cohérence d'une séquence.

Je considérerais l'ampleur de ce gain comme une question ouverte plutôt que comme un chiffre établi, et j'y reviendrai dans un instant. Mais l'idée de conception est solide, et c'est la véritable nouveauté de cette version. À retenir : le mode Thinking sacrifie un peu de vitesse au profit d'une phase de planification, ce qui compte surtout lorsque votre prompt comporte plusieurs éléments en mouvement.

Fonctionnalités clés — et degré de confiance à accorder à chaque chiffre

C'est ici que la distinction entre les niveaux de confiance est importante, car la liste des fonctionnalités de Wan 2.7 provient presque entièrement des notes de lancement d'Alibaba, et les chiffres fournis par un éditeur doivent être présentés comme tels.

Alibaba annonce les éléments suivants : une cohérence des personnages suffisante pour conserver un visage tout au long d'un clip (sa solution au problème du « visage identique de l'IA »), un contrôle précis des couleurs acceptant les valeurs HEX et les palettes, le rendu de textes longs de plus de 3 000 tokens dans 12 langues, avec tableaux et formules intégrés aux images, le contrôle narratif multi-plan, le guidage par première et dernière image, la conversion référence-vidéo acceptant jusqu'à neuf images de référence, ainsi qu'un son généré nativement au cours de la même passe. Ce sont les affirmations de l'éditeur, présentées comme telles. Je n'ai pas pu les vérifier au moyen d'un test indépendant.

Concernant les caractéristiques techniques précises, le tableau est plus flou que ne le laissent entendre la plupart des articles. La résolution de sortie est annoncée à 720p ou 1080p selon l'endroit où vous l'exécutez, la durée des clips se situe quelque part entre 2 et 15 secondes, et c'est le modèle d'image qui porte le chiffre de 4K. Ces valeurs varient selon l'hébergeur ; considérez donc tout chiffre unique comme « vrai sur cette plateforme », plutôt que comme « vrai pour le modèle ». La génération n'est pas instantanée non plus — les premiers retours pratiques la décrivent comme sensiblement plus lente que celle des modèles vidéo légers, un coût discret de la phase de planification qu'il faut prendre en compte si vous effectuez des rendus en volume.

Et voici la lacune honnête : au moment de la rédaction, je n'ai pas trouvé Wan 2.7 dans un classement indépendant — aucune entrée dans Artificial Analysis Video Arena, ni score VBench publié pour cette version. Cela ne signifie pas qu'il est mauvais. Cela signifie que les affirmations de qualité qui circulent sont encore exclusivement rapportées par l'éditeur. Le point de comparaison vérifiable le plus proche est sa lignée : Wan 2.1 était en tête de VBench lors de son lancement en février 2025, ce qui constitue un résultat réel pour un modèle antérieur, mais pas un substitut à 2.7.

Type d'affirmation Exemples Degré de confiance
Vérifiable aujourd'hui 2.1/2.2 sont à poids ouverts ; 2.1 était en tête de VBench à son lancement Confirmé sur les dépôts officiels et par le benchmark
Rapporté par l'éditeur Gains du mode Thinking, caractéristiques couleur/texte/cohérence Selon Alibaba ; aucun test indépendant pour l'instant
Variable selon l'hébergeur 720p/1080p, 2–15 s, 4K (image) Dépend de la plateforme, et non d'une spécification fixe du modèle

Wan 2.7 est-il open source ?

Réponse courte : pas de la manière à laquelle la série Wan avait habitué tout le monde.

Voici le premier fait. Wan 2.1 (février 2025) et Wan 2.2 (juillet 2025) ont été publiés avec des poids ouverts sous Apache 2.0 — téléchargeables, auto-hébergeables et ajustables, sans restriction commerciale. Vous pouvez le vérifier vous-même sur l'organisation Wan-AI sur Hugging Face et l'organisation Wan-Video sur GitHub. Cet historique de poids ouverts est bien réel, et c'est la raison pour laquelle tant de guides supposent que 2.7 l'est également.

Voici le deuxième fait. Ces mêmes canaux officiels — l'organisation GitHub, l'organisation Hugging Face et le ModelScope d'Alibaba — ne répertorient pas les poids de Wan 2.7. Au moment de la rédaction, la version la plus récente à poids ouverts dans les sources officielles reste la famille Wan 2.2 (les modèles A14B texte-vidéo et image-vidéo, le modèle TI2V 5B, ainsi que les variantes S2V et Animate publiées par la suite). Le journal officiel des actualités de ce dépôt s'arrête bien avant toute entrée 2.7.

Lorsqu'une page vous affirme donc que Wan 2.7 est « à poids ouverts sous Apache 2.0 », vérifiez si elle renvoie vers un véritable dépôt de poids officiel. Dans tous les cas que j'ai examinés, ce n'était pas le cas — l'affirmation s'appuyait sur la réputation de la série, et au moins une source largement citée se contredisait entre ses propres pages. Mon interprétation est que Wan 2.7 suit la voie d'accès par API déjà empruntée par Alibaba avec Wan 2.5 et 2.6, et non la voie ouverte de 2.1 et 2.2. Je considérerais cela comme un jugement, pas comme une vérité absolue — si Alibaba publie les poids la semaine prochaine, la situation changera — mais aujourd'hui, les éléments vérifiables pointent dans une seule direction.

En pratique, cela mène à une décision simple. Si votre projet a réellement besoin des poids — inférence locale, ajustement fin, données qui ne peuvent pas quitter votre infrastructure — Wan 2.7 ne vous les fournira pas aujourd'hui, et votre véritable option ouverte reste Wan 2.2. Si vous pouvez passer par une API, 2.5, 2.6 et 2.7 sont toutes disponibles de cette manière. Ne choisissez pas 2.7 en vous attendant à un téléchargement qui n'existe pas.

Quel modèle Wan devriez-vous réellement utiliser ?

La famille se divise clairement dès que vous cessez de considérer « le plus récent » comme « le meilleur pour vous ».

Version Accès Résolution / durée Particularité À choisir lorsque
Wan 2.2 Poids ouverts (Apache 2.0) 720p, ~5 s MoE, fonctionne sur une 4090 Vous devez auto-héberger ou ajuster le modèle
Wan 2.5 API uniquement 1080p, ~10 s Audio natif Vous voulez de l'audio sans auto-hébergement
Wan 2.6 API uniquement 1080p, jusqu'à 15 s Multi-plan, identité du personnage Vous avez besoin de clips plus longs et multi-plans
Wan 2.7 API uniquement 720p/1080p, 2–15 s Mode Thinking, première/dernière image, image + vidéo Vous voulez une planification et un contrôle par référence via API

Où Wan 2.7 se situe-t-il face aux modèles qui ne sont pas des Wan ? Dans la vidéo open source, la gamme Wan est la référence depuis 2.1 — cette lignée constitue sa véritable force. Parmi les modèles fermés accessibles par API, le différenciateur de 2.7 est le mode Thinking associé à une même pile image-vidéo, et non une avance de qualité démontrée sur les autres acteurs actuels de l'API. Je m'abstiens volontairement d'ajouter ici des chiffres à un tableau comparant Wan 2.7 à Seedance ou Kling, car aucun benchmark indépendant ne permet encore d'étayer une comparaison et je n'en inventerai pas. Si vous voulez une véritable comparaison directe, elle mérite un test dédié plutôt qu'une ligne ajoutée à la hâte dans un article explicatif.

Comment utiliser un modèle Wan via une API aujourd'hui

Soyons directs : si vous lisez ceci sur GPT Proto, notez que 2.7 lui-même ne figure pas au catalogue — le modèle hébergé le plus proche avec le même profil (1080p, multi-plan, audio natif) est Wan 2.6, à 0,45 $ par exécution. Voici une requête qui fonctionne réellement avec ce modèle.

Quelques pièges méritent d'être signalés avant tout copier-coller, car ils ont déjà fait perdre du temps à certains utilisateurs. Premièrement, l'authentification utilise un jeton Bearer — ces points de terminaison Wan se trouvent sur le chemin /api/v3/alibaba/ et attendent Authorization: Bearer $KEY, et non une clé brute. Deuxièmement, l'URL du site classe le modèle sous /qwen/, tandis que le chemin de l'API utilise alibaba — segment différent, même modèle. Troisièmement, il s'agit d'un appel asynchrone en deux étapes : vous envoyez une requête POST pour soumettre le travail et recevez un identifiant, puis vous appelez le point de terminaison de résultat en GET pour effectuer le suivi. Quatrièmement, les paramètres diffèrent selon les modèles — 2.6 accepte audio et shot_type, tandis que 2.2 et les versions ultérieures ainsi que 2.5 utilisent enable_prompt_expansion et n'acceptent pas ces paramètres.

# 1. Submit the job
curl --request POST "https://gptproto.com/api/v3/alibaba/wan-2.6/text-to-video" \
  --header "Authorization: Bearer $GPTPROTO_API_KEY" \
  --header "Content-Type: application/json" \
  --data '{
    "prompt": "A first-person POV gliding through a damp stone tunnel toward a bright exit. [0-3s] fast forward motion, light at the end growing. [3-5s] emerge into a sunlit forest, a waterfall on the right. Sound: heavy breathing, then birdsong.",
    "negative_prompt": "",
    "size": "1920*1080",
    "duration": 5,
    "prompt_extend": true,
    "audio": "",
    "shot_type": "",
    "seed": 1
  }'
# -> returns a prediction id
 
# 2. Poll for the result
curl --request GET "https://gptproto.com/api/v3/predictions/$RESULT_ID/result" \
  --header "Authorization: Bearer $GPTPROTO_API_KEY"

Le même flux en Python, avec la boucle d'interrogation détaillée :

import os, time, requests
 
KEY = os.environ["GPTPROTO_API_KEY"]
HEADERS = {"Authorization": f"Bearer {KEY}", "Content-Type": "application/json"}
BASE = "https://gptproto.com/api/v3"
 
payload = {
    "prompt": (
        "A first-person POV gliding through a damp stone tunnel toward a bright exit. "
        "[0-3s] fast forward motion, light at the end growing. "
        "[3-5s] emerge into a sunlit forest, a waterfall on the right. "
        "Sound: heavy breathing, then birdsong."
    ),
    "negative_prompt": "",
    "size": "1920*1080",
    "duration": 5,
    "prompt_extend": True,
    "audio": "",
    "shot_type": "",
    "seed": 1,
}
 
submit = requests.post(f"{BASE}/alibaba/wan-2.6/text-to-video",
                       headers=HEADERS, json=payload).json()
result_id = submit["id"]
 
while True:
    r = requests.get(f"{BASE}/predictions/{result_id}/result", headers=HEADERS).json()
    if r.get("status") in ("succeeded", "failed"):
        print(r)
        break
    time.sleep(5)

La facturation évolue en fonction de la configuration, et non selon un tarif fixe par clip — la résolution, la durée et l'audio font tous varier le montant, raison pour laquelle l'aperçu en 1080p/10 s est plus cher que le tarif de base de 0,45 $. Chaque modèle Wan hébergé affiche son tarif actuel sur sa propre page, et tous partagent le même solde avec le reste du catalogue, vous n'avez donc pas à gérer des comptes distincts pour tester 2.5 et 2.6.

Rédiger des prompts pour le mode Thinking

Puisque 2.7 planifie avant de générer, les prompts les plus efficaces ressemblent moins à une liste de mots-clés qu'à un brief. Donnez-lui une intention et une structure. Une feuille de route horodatée — [0-3s] … [3-5s] … — fournit à la phase de planification quelque chose de concret à organiser, selon le même modèle que celui utilisé dans le code ci-dessus. L'audio fait partie du même prompt : une courte indication Sound: (« heavy breathing, then birdsong ») pilote la piste audio native au lieu de nécessiter un appel séparé. Utilisez également negative_prompt pour écarter l'échec que vous anticipez réellement — « no glowing plants, no warped hands » — plutôt que de le laisser vide. Rien de tout cela n'est exotique ; il s'agit simplement d'écrire pour un modèle qui lit l'intégralité du brief avant de commencer.

À qui s'adresse ce modèle — et à qui ne s'adresse-t-il pas

Si vous avez besoin de poids ouverts — auto-hébergement, ajustement fin, données qui restent dans votre infrastructure — Wan 2.7 est le mauvais choix aujourd'hui, et Wan 2.2 est le bon. Si vous voulez une génération d'images et de vidéos contrôlable via une API, que vous acceptez un modèle fermé et un rendu plus lent, 2.7 constitue un choix raisonnable, avec la réserve honnête que son avance qualitative reste pour l'instant une affirmation d'Alibaba et non une mesure. Et si vous réalisez un prototype avec un budget limité, les niveaux Wan hébergés moins chers vous permettront de démarrer pour quelques centimes par exécution avant de vous engager. Faites correspondre le modèle à la contrainte, et non au numéro de version.

Studio créatif

Générez images, vidéos et plus avec les API de production.

Commencer à créer
Studio créatif
Modèles associés
Tous les modèles
Qwen
by Qwen
10% OFF
Qwen
by Qwen
10% OFF
OpenAI
20% OFF
Claude
10% OFF

FAQ

Wan 2.7 est-il open source ?

Pas d'après les éléments disponibles. Wan 2.1 et 2.2 sont distribués avec des poids ouverts sous Apache 2.0 ; les poids de Wan 2.7 ne sont pas publiés sur les canaux officiels d'Alibaba sur Hugging Face, GitHub ou ModelScope au moment de la rédaction. Considérez-le comme accessible uniquement via API jusqu'à la publication de poids officiels.

Quand Wan 2.7 a-t-il été lancé ?

Début avril 2026 — les modèles d'image autour du 1er avril, puis la suite vidéo au cours des jours suivants.

Wan 2.7 est-il un modèle d'image ou un modèle vidéo ?

Les deux. La version comprend des modèles d'image (Wan2.7-Image / Image Pro) et une suite vidéo de quatre modèles.

Wan 2.7 et Wan 2.2 — quelle est la différence ?

2.2 est distribué avec des poids ouverts, en 720p, et fonctionne localement. 2.7 est accessible uniquement via API et ajoute le mode Thinking, le contrôle de la première et de la dernière image, la conversion référence-vidéo et la génération d'images. Des outils différents pour des contraintes différentes.

Wan 2.7 est-il meilleur que les autres modèles vidéo ?

Ce point n'est pas démontré par des benchmarks indépendants. Il n'existe encore aucune entrée Artificial Analysis ou VBench pour ce modèle ; toute affirmation selon laquelle il serait « meilleur que X » est donc actuellement rapportée par l'éditeur.

Puis-je exécuter Wan 2.7 localement ?

Pas aujourd'hui — aucun poids n'a été publié. Pour un déploiement local, utilisez Wan 2.2.

Combien coûte son utilisation via API ?

Cela dépend de la résolution, de la durée et de l'audio. Le modèle hébergé le plus proche, Wan 2.6, commence à 0,45 $ par exécution.

Articles associés

Plus de blogs
wan.2.2 : la référence de la vidéo générative

wan.2.2 : la référence de la vidéo générative

TL;DR Le modèle wan.2.2 privilégie l’intégrité visuelle et le respect strict des prompts plutôt que la vitesse brute de génération. Il nécessite un matériel conséquent, mais récompense les créateurs avec une production vidéo IA fiable et exempte d’artefacts. Les modèles vidéo génératifs privilégient souvent la vitesse au détriment de la cohérence visuelle. Vous saisissez une description détaillée de la scène, attendez quelques minutes, puis recevez un clip rempli de visages déformés et de mouvements irréalistes. Les créateurs de wan.2.2 ont adopté une approche différente. Ils ont conçu un système qui respecte les détails esthétiques de votre contenu source et calcule soigneusement les vecteurs de mouvement afin d’éviter la dérive des pixels. L’exécution native de cette architecture nécessite une puissance de calcul considérable. Vous aurez besoin d’un GPU haut de gamme pour traiter efficacement les paramètres, raison pour laquelle de nombreux professionnels externalisent cette charge vers des API robustes. En vous affranchissant des limites du matériel local, vous pouvez intégrer des outils comme ComfyUI, SVI Pro et PainterI2V afin de faire fonctionner le modèle exactement comme vous l’imaginez. Obtenir des résultats cinématographiques implique de dépasser la contrainte initiale de cinq secondes de sortie. En enchaînant les clips et en utilisant l’interpolation native des images, vous pouvez construire des séquences cohérentes en haute résolution qui correspondent réellement à vos prompts textuels initiaux.

Schuyler Stacy | 2026-03-02

Wan 2.5 : l'avenir de la génération de vidéos IA en 4K

Wan 2.5 : l'avenir de la génération de vidéos IA en 4K

Video production is undergoing a seismic shift, and Wan 2.5 is at the epicenter of this transformation. As the demand for high-quality visual content skyrockets, creators need tools that deliver cinematic results without Hollywood budgets. Wan 2.5 answers this call by utilizing advanced AI to convert text and images into stunning 4K video sequences. Developed to overcome the limitations of previous generations, this model offers realistic motion, extended clip durations, and dual-mode flexibility. In this comprehensive review, we dive deep into how Wan 2.5 is redefining the landscape of AI video generation.

Michael Johnson | 2026-03-02

Guide WAN 2.5 : analyse approfondie du tout dernier modèle vidéo d’IA et de ses fonctionnalités

Guide WAN 2.5 : analyse approfondie du tout dernier modèle vidéo d’IA et de ses fonctionnalités

TL;DR : WAN 2.5 représente un tournant majeur dans l’univers de la vidéo générée par IA, en combinant des fonctionnalités professionnelles en 1080p avec un prix abordable qui met au défi des concurrents majeurs comme Sora. L’émergence de WAN 2.5 a suscité un débat important sur l’avenir du développement open source face à la mise à l’échelle par les entreprises propriétaires. Si l’abandon des poids ouverts a frustré certains développeurs, le modèle reste un outil puissant pour les créateurs à la recherche de mouvements cohérents et d’une synthèse vidéo haute fidélité. Sur le plan technique, WAN 2.5 offre une synchronisation impressionnante entre l’audio et les éléments visuels, ainsi qu’une prise en charge avancée des images clés qui donne davantage de contrôle aux réalisateurs. En intégrant ces capacités dans un flux de travail économique, il se positionne comme une solution pratique pour les secteurs modernes du marketing et du jeu vidéo.

Tiffany Layne | 2026-03-17

Wan Video : Maîtriser la génération open source

Wan Video : Maîtriser la génération open source

TL;DR Le marché de l’intelligence artificielle générative force généralement les créateurs à s’abonner à des services propriétaires coûteux pour accéder aux fonctionnalités les plus avancées. Le wan video d’Alibaba brise ce cycle en proposant un modèle open source capable de générer des séquences texte-vers-vidéo et image-vers-vidéo extrêmement fluides. Vous n’avez plus à deviner ce qui se passe à l’intérieur de la boîte noire algorithmique. Les poids étant disponibles publiquement, les développeurs et les artistes numériques peuvent exécuter le logiciel sur des cartes graphiques grand public ou le faire évoluer via de robustes pipelines d’API. Ce niveau d’accès réduit considérablement les barrières à l’entrée pour la narration cinématographique. Obtenir de bons résultats exige encore une intention technique. La réussite dépend fortement de la façon dont vous structurez vos invites, décrivez les mouvements de caméra et gérez les contraintes matérielles pour maintenir une cohérence temporelle sur chaque image.

Schuyler Stacy | 2026-03-17