Entrée multimodale, un seul modèle
Partez d’un texte, d’une image initiale, d’images de début et de fin, jusqu’à 10 images de référence, cinq vidéos de référence, cinq clips audio, d’un document ou d’une page web publique.
curl --request POST "https://gptproto.com/api/v3/alibaba/wan-3.0/text-to-video" \
--header "Authorization: Bearer $GPTPROTO_API_KEY" \
--header "Content-Type: application/json" \
--data '{
"prompt": "A tiny origami fox sailing a teacup across a moonlit puddle",
"negative_prompt": "",
"resolution": "720P",
"ratio": "adaptive",
"duration": 5,
"generate_audio": true,
"audio": "",
"shot_type": "single",
"watermark": false,
"seed": 1
}'Partez du coût d'un échantillon unique et choisissez un budget de test. Les tarifs GPTProto sont 10% sous le prix catalogue.
| Scénario | Liste Qwen | OpenRouter | GPTProto | Économies / mois |
|---|---|---|---|---|
| Pubs produit courtes30 × 5s / mois | $30.00 | $31.65 | $27.00 | −$3.00≈ $36.00 / an |
| Clips sociaux60 × 5s / mois | $60.00 | $63.30 | $54.00 | −$6.00≈ $72.00 / an |
| Génération en masse100 × 5s / mois | $100.00 | $105.50 | $90.00 | −$10.00≈ $120.00 / an |
Accédez à l’API Wan3.0 d’Alibaba via GPTProto et utilisez un seul solde de compte pour Wan et d’autres modèles vidéo. Créez des workflows avec prompt uniquement, image initiale, première et dernière images, guidés par des références, document vers vidéo et page web vers vidéo, sans maintenir un compte fournisseur distinct pour chaque modèle de votre pipeline.
Entrée multimodale, un seul modèle
Partez d’un texte, d’une image initiale, d’images de début et de fin, jusqu’à 10 images de référence, cinq vidéos de référence, cinq clips audio, d’un document ou d’une page web publique.
Jusqu’à 30 secondes en 1080P
Générez des vidéos de 2 à 30 secondes en 480P, 720P ou 1080P et à 30 fps. Utilisez la durée intelligente lorsque le modèle doit choisir la longueur du clip à partir de votre prompt et de vos références.
Cohérence guidée par les références
Guidez les personnages, les produits, les lieux, les accessoires et le style visuel à l’aide de références ordonnées. Wan3.0 est conçu pour préserver des détails reconnaissables d’un plan à l’autre pour des vidéos de marque et narratives.
Révision audio et vidéo
Générez l’audio par défaut, ou désactivez-le sans modifier le prix de génération. Révisez les visuels, l’intrigue et les dialogues via le workflow d’édition de Wan3.0 au lieu de reconstruire toute la séquence.
Wan3.0 est le modèle de génération vidéo tout-en-un en aperçu d’Alibaba. Au lieu d’exposer un modèle distinct pour chaque voie de création, le point de terminaison officiel wan3.0-video prend en charge la génération texte-vidéo, image première frame vers vidéo, vidéo première-et-dernière frame, référence multimodale vers vidéo, l’entrée document ou page web, et les workflows de révision vidéo.
Le modèle peut renvoyer 2 à 30 secondes de vidéo en une génération. Vous pouvez demander une sortie 480P, 720P ou 1080P à 30 fps, choisir un format d’image standard, ou laisser le modèle adapter le ratio au média fourni. L’audio est activé par défaut, tandis que la durée intelligente et l’extension de prompt peuvent aider à transformer un court brief en une séquence plus complète.
Wan3.0 est particulièrement pertinent lorsqu’une vidéo doit préserver plus qu’une ambiance générale. Des références ordonnées peuvent définir un personnage, un produit, un lieu, un langage de caméra, une voix ou une direction musicale. Les entrées de fichier et de lien public permettent aussi aux équipes de transformer une présentation produit, un rapport, un article ou un document de formation en un brief vidéo structuré.
| Spécifications | Détails de l’API Wan3.0 |
|---|---|
| Fournisseur | Alibaba Cloud Model Studio |
| Statut officiel | Aperçu |
| ID de modèle officiel | wan3.0-video |
| Chaîne de modèle GPTProto | wan-3.0 |
| Modes de génération | Texte-vidéo, première frame, première-et-dernière frame, référence vers vidéo, fichier vers vidéo, page web vers vidéo |
| Durée de sortie | 2–30 secondes ; -1 active la durée intelligente |
| Résolution de sortie | 480P, 720P ou 1080P |
| Fréquence d’images | 30 fps |
| Formats d’image | Adaptatif, 16:9, 4:3, 1:1, 3:4 ou 9:16 |
| Limites des références | Jusqu’à 10 images, 5 clips vidéo et 5 clips audio ; la durée totale des vidéos et audios de référence est plafonnée séparément à 15 secondes |
| Entrée fichier | Un fichier DOC/DOCX, XLS/XLSX, PPT/PPTX, PDF, TXT, KEY, Pages, Numbers ou Markdown ; jusqu’à 100 Mo et 50 pages |
| Entrée de page web publique | Une page HTTP ou HTTPS accessible publiquement qui ne nécessite pas de connexion |
| Limite de prompt | 20 000 caractères ; chinois et anglais pris en charge |
| Audio | Activé par défaut ; peut être désactivé sans modifier le taux de génération officiel |
| Paramètre de filigrane | Désactivé par défaut dans l’API d’Alibaba ; vérifiez l’implémentation GPTProto en production avant de formuler une affirmation générale sur la politique de sortie |
Choisir le bon mode est important, car les entrées de contrôle de frame et les entrées de référence riches sont mutuellement exclusives dans l’API officielle. Ne combinez pas first_frame ou last_frame avec des images de référence, des vidéos de référence, de l’audio de référence, un fichier ou une page web dans la même requête.
| Mode d’entrée | À utiliser quand | Exemple pratique |
|---|---|---|
| Texte-vidéo | Vous voulez une nouvelle scène sans élément visuel fixe | Générez plusieurs concepts de campagne à partir de prompts de plans structurés |
| Vidéo avec première frame | La composition d’ouverture ou l’image produit est déjà approuvée | Animez une image héros de catalogue tout en préservant son cadrage initial |
| Vidéo avec première et dernière frame | Les deux extrémités du mouvement ou de la transformation comptent | Passez d’un emballage fermé à une révélation de produit entièrement assemblé |
| Référence vers vidéo | L’identité, le mouvement, la voix, la musique, le décor ou le style doivent provenir d’éléments sources | Conservez le même produit, porte-parole, lieu et direction audio sur un clip de marque |
| Fichier ou page web vers vidéo | L’idée source se trouve dans une présentation, un rapport, une page produit, un article ou un document de formation | Transformez un PPT produit en vidéo de lancement ou un article public en résumé visuel narré |
Wan3.0 peut réduire l’écart entre un élément commercial approuvé et une variation vidéo utilisable. Pour un seul SKU, commencez par une image héros approuvée lorsque la composition d’ouverture exacte compte. Utilisez le mode référence lorsque le produit doit rester reconnaissable sur plusieurs plans, ou fournissez une présentation produit lorsque les fonctionnalités, le positionnement et l’ordre des scènes existent déjà dans un document.
Pour la génération vidéo par lots, créez un modèle pour les données produit, les références, le ratio, la durée, la caméra, l’audio et le CTA de fin. Soumettez chaque variation de manière asynchrone, stockez son ID de tâche et gérez le statut séparément de la soumission pour réduire les tâches en double. Un ensemble source approuvé peut alimenter des versions sociales 9:16, marketplace 1:1 et page produit 16:9. Enregistrez les sorties réussies dans votre propre stockage.
Ces modèles se chevauchent, mais leurs cas d’usage les plus forts sont différents. Le meilleur choix dépend de la durée requise, du volume de références, de la résolution de sortie, de l’entrée document, des contrôles de montage et du coût d’un clip utilisable finalisé — pas seulement du prix annoncé par seconde.
| Facteur de décision | Wan3.0 | Seedance 2.5 | MiniMax H3 |
|---|---|---|---|
| Génération unique maximale | Jusqu’à 30 secondes | Jusqu’à 30 secondes | Jusqu’à 15 secondes |
| Capacité de références publiée | Jusqu’à 10 images, 5 vidéos et 5 clips audio | Jusqu’à 30 images, 10 vidéos et 10 clips audio | Jusqu’à 9 images, 3 vidéos et 3 clips audio ; 12 fichiers mixtes au total |
| Résolution API documentée la plus élevée | 1080P | Vérifiez la résolution exposée par le point de terminaison sélectionné | 2K |
| Entrée document ou page web publique | Oui | Non répertorié comme entrée principale dans la présentation officielle de lancement de ByteDance | Non répertorié dans le tableau actuel des entrées de l’API MiniMax |
| Audio | Sortie audio facultative | Génération audio-vidéo conjointe | Audio stéréo natif |
| Accent sur le montage | Révision visuelle, de l’intrigue et des dialogues ; extension vidéo | Montage audiovisuel au niveau de l’horodatage, écran vert, perspective de caméra et extension multi-tours | Génération de références multimodales, montage et transfert de mouvement |
| Idéal pour | Vidéos longues multimodales ou menées par un document avec un chemin API 1080P clairement documenté | Narration de 30 secondes riche en références nécessitant le plus grand ensemble d’éléments publié | Clips 2K plus courts, son stéréo natif et workflows qui valorisent un écosystème de modèles ouvert |
Choisissez Wan3.0 plutôt que Seedance 2.5 lorsque l’entrée document ou page web publique et une échelle documentée de 480P à 1080P comptent plus que le volume maximal de références. Choisissez MiniMax H3 lorsqu’un plafond de 15 secondes suffit et qu’une sortie 2K ou un audio stéréo natif compte davantage. Comparez le coût en utilisant le même prompt, les mêmes éléments, la même durée, le même ratio et les mêmes critères d’acceptation, y compris les nouvelles tentatives et les générations rejetées.
Utilisez une structure de prompt qui sépare le sujet de la chronologie et de la direction de caméra :
Formule de prompt : sujet et références sources + objectif de scène + actions chronométrées ou étapes narratives + mouvement de caméra + éclairage et style visuel + direction audio + détails à préserver + détails à éviter + frame finale ou CTA
Utilisez l’image 1 comme référence produit et l’image 2 comme référence d’éclairage. Créez une vidéo verticale de lancement de 12 secondes pour une enceinte sans fil noir mat. Commencez par un plan macro de la grille, reculez pendant que l’enceinte tourne, puis montrez des vibrations de basses déplaçant des gouttelettes à proximité. Préservez le logo, les commandes, les proportions et la finition. Éclairage périphérique froid, mouvement de caméra retenu, ambiance électronique basse, aucun texte supplémentaire ni déformation.
Transformez la présentation produit fournie en un film de lancement 16:9 de 20 secondes. Organisez ses trois principaux avantages en problème, démonstration de fonctionnalité et énoncé de valeur final. Préservez les couleurs et matériaux documentés. Utilisez un éclairage de studio propre, des mouvements de caméra mesurés, une voix off concise et aucune affirmation non vérifiée. Terminez avec le produit centré sur le fond de marque.
Alibaba indique que la texture audio et la précision du rendu de texte à l’écran s’améliorent encore. Pour une sortie compatible avec la marque, ajoutez les titres, mentions légales, prix et petites étiquettes en post-production plutôt que de demander au modèle de les rendre parfaitement dans la scène. Examinez attentivement les dialogues et la musique avant publication, surtout si l’élément final sera diffusé comme publicité payante.
Les tâches de première frame et de première-et-dernière frame ne peuvent pas être mélangées avec des entrées de référence, de fichier ou de page web. Validez les médias riches avant soumission, enregistrez les ID de tâche, rendez les nouvelles tentatives idempotentes et stockez rapidement les fichiers terminés.
Guides, comparaisons et mises à jour liés à ce modèle.
Tous les articles
Apprenez à transformer une image d'anime en une vidéo de transformation réaliste avec des images de début et de fin appariées, des prompts, du son et des conseils de montage.

Découvrez Seedance 2.0 vs 2.5 dans le même test de storyboard de 15 secondes. Comparez la qualité cinématographique, l'émotion, le prix, les cas d'usage e-commerce et les fonctionnalités API.

Apprenez à générer des expressions faciales émotionnelles réalistes dans Seedance 2.5 avec des micro-expressions minutées, des techniques cinématographiques et deux exemples vidéo complets.

Comparez les meilleurs modèles vidéo IA chinois de 2026, notamment Seedance, MiniMax H3, Wan 3.0, Kling et Vidu, pour le texte, l'image et la vidéo de référence.
Entrée
Sortie