curl --request POST "https://gptproto.com/api/v3/doubao/doubao-seedance-2-0-260128/text-to-video" \
--header "Authorization: Bearer $GPTPROTO_API_KEY" \
--header "Content-Type: application/json" \
--data '{
"prompt": "A tiny origami fox sailing a teacup across a moonlit puddle",
"aspect_ratio": "16:9",
"duration": 5,
"resolution": "720p",
"generate_audio": true,
"camera_fixed": false,
"seed": -1
}'API Doubao Seedance 2.0 : texte vers vidéo avec audio natif à partir de 0,2957 $/exécution
L’API Doubao Seedance 2.0 est le modèle vidéo de deuxième génération de ByteDance, disponible sur GPTProto avec un accès compatible OpenAI, sans compte Jimeng ou Volcano Ark distinct. Basé sur une architecture audio-vidéo unifiée, doubao-seedance-2.0 accepte du texte, des images, des vidéos et de l’audio en un seul appel, puis renvoie un clip synchronisé avec un son natif — de 4 à 15 secondes, jusqu’en 4K, avec des rapports d’image allant de 16:9 et 9:16 à 21:9. Il s’agit du même moteur Doubao AI Seedance 2.0 que les développeurs utilisent pour des plans cinématographiques, des publicités de produits et de courtes vidéos sociales, accessible via un point de terminaison standard unique.
Pour la génération texte vers vidéo avec doubao seedance 2.0, la génération commence à 0,2957 $ par exécution, et la tarification de l’API doubao seedance 2.0 évolue de manière prévisible selon la résolution et la durée — consultez le tableau complet des tarifs par exécution ci-dessous. Que vous prototypiez rapidement des clips en 480p ou effectuiez le rendu de plans en 1080p et 4K avec audio, seedance 2.0 doubao vous offre une solution à l’usage pour accéder à la dernière génération vidéo de ByteDance, avec une seule clé API fonctionnant sur tous les modèles de la plateforme.
Qu’est-ce que Doubao Seedance 2.0 ?
Lancé en février 2026 par l’équipe Seed de ByteDance, Doubao Seedance 2.0 (également écrit doubao-seedance-2.0 ou seedance 2.0 doubao) repose sur une architecture audio-vidéo unifiée. La différence importante par rapport à la version 1.5 Pro n’est pas un chiffre de résolution plus élevé — c’est que le modèle traite chaque entrée comme un signal de contrôle. Une seule génération peut combiner une consigne textuelle, des images de référence, un clip pour le mouvement de caméra et une piste audio, puis les analyser ensemble avant de produire la première image. Pour ce point de terminaison texte vers vidéo, vous travaillez à partir de texte, mais c’est le même identifiant de modèle qui alimente le flux de travail complet avec références ailleurs.
| Spécification | Valeur |
|---|---|
| Fournisseur | ByteDance (équipe Seed) |
| Chaîne du modèle | doubao-seedance-2-0-260128 |
| Ce point de terminaison | Texte vers vidéo |
| Modalités d’entrée (modèle) | Texte, image, vidéo, audio |
| Capacité de référence (modèle) | Jusqu’à 9 images, 3 clips vidéo et 3 clips audio par appel |
| Audio natif | Oui — généré conjointement avec la vidéo ; synchronisation labiale multilingue |
| Durée | 4–15 s (modèle) ; 4–14 s facturées sur GPTProto |
| Résolution | Jusqu’en 1080p (niveaux 480p / 720p / 1080p) |
| Rapports d’image | 16:9, 9:16, 4:3, 3:4, 21:9, 1:1 |
| Modification / extension | Modifications ciblées de clips, personnages ou actions ; extension de clips |
| Image vers vidéo | Oui — point de terminaison distinct à l’adresse /image-to-video |
| Variantes | Complète + Rapide (doubao-seedance-2-0-fast-260128 sur GPTProto) |
| Open source | Non — propriétaire |
Comment le modèle gère l’audio et le mouvement
Deux éléments distinguent Seedance 2.0 d’un modèle texte vers vidéo standard, et tous deux influencent la manière dont vous devez rédiger vos prompts. Premièrement, l’audio et la vidéo sont générés en une seule passe, plutôt que de produire un clip silencieux auquel on ajoute une bande sonore par la suite. Comme le son et l’image sont générés ensemble, les dialogues sont synchronisés avec les mouvements de la bouche et les effets ambiants suivent l’action — ainsi, un prompt qui nomme le son ("le bruit de la foule s’intensifie lorsque la voiture passe") produit généralement une synchronisation plus précise qu’une simple description visuelle. Deuxièmement, le modèle préserve plus fiablement l’identité d’un sujet lors des changements de mouvement et d’angle que les versions précédentes, ce qui rend les travaux en plusieurs plans et avec des personnages récurrents réellement exploitables, plutôt que ponctuels. Si vous avez renoncé à la vidéo IA parce qu’un visage changeait entre les coupes, c’est l’aspect qui s’est le plus amélioré.
Doubao Seedance 2.0 contre Sora 2
Les deux modèles sont disponibles sur GPTProto ; il s’agit donc d’un choix comparable, et non d’une simple affirmation marketing.
| Doubao Seedance 2.0 | Sora 2 | |
|---|---|---|
| Entrées | Texte, image, vidéo, audio | Texte, image |
| Audio natif | Oui, génération conjointe | Oui, synchronisé |
| Durée maximale | 15 s | 12 s (standard) / 25 s (Pro) |
| Résolution maximale | Jusqu’en 1080p | 720p (standard) / 1080p (Pro) |
| Feuille de route de l’API | Actif | OpenAI arrêtera progressivement l’API Sora 2 le 24/09/2026 |
| Prix GPTProto | à partir de 0,2957 $/exécution (évolue selon rés. × durée) | 0,40 $/exécution (forfaitaire) |
Doubao Seedance 2.0 contre Seedance 1.5 Pro
Si vous utilisez déjà Seedance 1.5 Pro, la mise à niveau concerne le contrôle des entrées, et non une augmentation de la résolution. La version 1.5 Pro générait déjà l’audio et la vidéo ensemble et suivait les instructions en plusieurs plans. Seedance 2.0 ajoute la pile de références — jusqu’à 9 images, 3 clips vidéo et 3 clips audio en un seul appel — ainsi que la modification ciblée et l’extension de clips. Lors de tests tiers sur le mouvement et la physique, il obtient de meilleurs scores que 1.5 Pro, avec un gain particulièrement important en précision physique.
L’écart de coût est important : 1.5 Pro commence à 0,0408 $/exécution, contre 0,2957 $ pour la version 2.0. Règle pratique : restez sur 1.5 Pro pour le texte vers vidéo simple et à volume élevé lorsque le budget est prioritaire ; passez à la version 2.0 lorsque vous avez besoin d’une cohérence guidée par des références, de modifications ou de scènes menées par l’audio. Les deux modèles utilisent le même solde, vous pouvez donc les comparer avec un seul prompt.
| Seedance 2.0 | Seedance 1.5 Pro | |
|---|---|---|
| Entrées de référence | Texte, image, vidéo, audio (9 img / 3 clips / 3 audios) | Texte, image |
| Audio natif | Oui | Oui |
| Modification / extension | Oui | Non |
| Prix GPTProto | à partir de 0,2957 $/exécution | à partir de 0,0408 $/exécution |
Passer de Doubao, Jimeng ou Volcano Ark
Si vous prototypez déjà Seedance 2.0 dans les interfaces de ByteDance, GPTProto vous donne accès au même modèle via une seule API REST : envoyez votre prompt et vos paramètres au point de terminaison texte vers vidéo, puis interrogez /api/v3/predictions/{result_id}/result pour obtenir le résultat. Les noms de paramètres (prompt, aspect_ratio, duration, resolution, generate_audio, camera_fixed, seed) correspondent directement à ceux que vous utilisez déjà ; le transfert d’un prompt consiste donc principalement à le copier-coller. Au-delà de l’accès, le même compte permet d’atteindre la variante Fast, Seedance 1.5 Pro et Sora 2, afin de les comparer avec des prompts identiques à partir d’un seul solde, plutôt que d’ouvrir un compte par fournisseur.
Ce que les développeurs créent avec ce modèle
Les fonctionnalités répondent particulièrement bien à quelques usages : les clips courts pour les réseaux sociaux et les publicités, où l’audio natif évite une étape de doublage distincte ; les séries et mascottes de marque cohérentes, qui doivent rester reconnaissables d’un plan à l’autre ; les scènes dialoguées nécessitant une synchronisation labiale ; ainsi que les montages guidés par la musique ou le rythme, où le son et le mouvement doivent être parfaitement alignés. Pour l’idéation à grand volume, créez vos brouillons avec la variante Fast, puis effectuez le rendu final des versions retenues avec le modèle complet.
Recettes de prompts pour Doubao Seedance 2.0
Seedance 2.0 récompense les prompts qui décrivent le son et la caméra, et pas seulement les éléments visuels — car l’audio est généré conjointement et le langage de caméra sert de signal de contrôle. Ces exemples sont des points de départ à copier et modifier ; adaptez la durée et le rapport d’image à votre plan.
1. Scène guidée par l’audio (utiliser la passe audio conjointe)
Une ruelle de Tokyo sous la pluie, de nuit, avec des reflets néon sur l’asphalte mouillé. Une silhouette vêtue d’un manteau sombre marche vers la caméra. Son diégétique : pluie régulière, circulation lointaine, pas dans les flaques. Lent travelling avant. 16:9.
Nommer le son permet au modèle de synchroniser l’ambiance avec le mouvement en une seule passe, au lieu de vous obliger à l’ajouter ensuite. Laissez generate_audio activé.
2. Plan produit avec caméra fixe (camera_fixed)
Une tasse à café en céramique sur un comptoir en marbre, éclairée par la lumière matinale venant de la gauche, avec de la vapeur qui s’élève. Caméra fixe, aucun mouvement. Faible profondeur de champ. 1:1.
Associez ceci à camera_fixed: true lorsque vous voulez que le sujet bouge tout en maintenant le cadrage — une option utile pour les boucles de commerce électronique et les packshots.
3. Action avec cohérence du personnage
Une jeune femme vêtue d’une veste rouge court sur un toit, franchit un espace, atterrit et continue de courir. Gardez son visage, ses cheveux et sa veste identiques pendant tout le clip. Caméra portée, suivi latéral. Audio de foule et de vent. 16:9, 8 s.
Énoncer la nécessité de cohérence en toutes lettres s’appuie sur la principale amélioration du modèle — préserver un sujet pendant ses mouvements.
4. Plusieurs plans en une seule génération
Plan 1 : plan large d’un chef dressant un plat. Plan 2 : gros plan sur la garniture déposée. Plan 3 : le chef lève les yeux et sourit. Ambiance chaleureuse de cuisine, léger grésillement. Coupes fluides. 16:9, 10 s.
Numéroter les plans donne au modèle une structure explicite à suivre, ce qui fonctionne mieux qu’une description continue et interminable.
Conseils de rédaction des prompts
- Nommez explicitement le son diégétique lorsqu’il est important ; l’audio est généré avec la vidéo.
- Décrivez le mouvement de caméra (travelling, panoramique, caméra portée, fixe) — il est traité comme une directive.
- Pour les sujets récurrents, énoncez la nécessité de cohérence en toutes lettres.
- Créez le brouillon avec la variante Fast, puis effectuez le rendu final de la version retenue avec le modèle complet.
FAQ
Tout ce que vous devez savoir sur l'utilisation de Doubao Seedance 2.0 pour la production vidéo professionnelle.
Qu'est-ce que Doubao Seedance 2.0 ?
Comment fonctionne la tarification de l'API Doubao Seedance 2.0 ?
Seedance 2.0 prend-il en charge la conversion d'image en vidéo ?
Combien coûte concrètement l'API Doubao Seedance 2.0 ?
Seedance 2.0 prend-il en charge la conversion d'image en vidéo ?
Seedance 2.0 génère-t-il de l'audio ?
Quelle peut être la durée des vidéos ?
Seedance 2.0 est-il open source ?
Doubao Seedance 2.0 ou Sora 2 ?
Quelle est la meilleure façon d'économiser des crédits sur Seedance 2.0 ?
Pourquoi le résultat de Seedance 2.0 ne correspond-il pas à mon prompt ?
Comment résoudre les erreurs de connexion à l'API Seedance 2.0 ?
Articles connexes
Guides, comparaisons et mises à jour liés à ce modèle.
Tous les articles
Doubao 1.5 Pro : benchmarks et accès à l’API
Le modèle doubao 1.5 pro de ByteDance utilise une architecture MoE plus légère pour rivaliser avec des modèles plus lourds avec une fraction de leur puissance de calcul. Consultez notre guide pour l’intégrer dès aujourd’hui.

Doubao AI : revue complète des fonctionnalités, avantages, inconvénients et verdict
Découvrez Doubao AI de ByteDance : capacités multimodales, réponses en temps réel, génération d’images et bien plus encore. 50 fois moins cher que ChatGPT. Découvrez les tarifs, les options d’accès et ses différences par rapport à la concurrence.

Dreamina : guide professionnel de la vidéo IA Seedance 2.0
Maîtrisez Dreamina Seedance 2.0 pour créer des vidéos IA réalistes. Découvrez la cohérence des personnages, la physique et les conseils d’accès via VPN. Optimisez votre flux de travail dès aujourd’hui.

Seedance AI : le nouveau standard vidéo de Bytedance
Découvrez comment Seedance de Bytedance révolutionne la vidéo IA grâce à des expressions faciales réalistes et un accès peu coûteux à l’API. En savoir plus dès aujourd’hui.