curl --request POST "https://gptproto.com/api/v3/doubao/doubao-seedance-2-0-260128/text-to-video" \
--header "Authorization: Bearer $GPTPROTO_API_KEY" \
--header "Content-Type: application/json" \
--data '{
"prompt": "A tiny origami fox sailing a teacup across a moonlit puddle",
"aspect_ratio": "16:9",
"duration": 5,
"resolution": "720p",
"generate_audio": true,
"camera_fixed": false,
"seed": -1
}'Doubao Seedance 2.0 API: Text-zu-Video mit nativem Audio ab $0.2957 pro Run
Die Doubao Seedance 2.0 API ist das Videomodell der zweiten Generation von ByteDance, verfügbar auf GPTProto mit OpenAI-kompatiblem Zugang und ohne separates Jimeng- oder Volcano-Ark-Konto. Es basiert auf einer einheitlichen Audio-Video-Architektur: doubao-seedance-2.0 verarbeitet Text, Bild, Video und Audio in einem einzigen Aufruf und liefert einen synchronisierten Clip mit nativem Sound — 4 bis 15 Sekunden, bis zu 4K, in Seitenverhältnissen von 16:9 und 9:16 bis 21:9. Es ist dieselbe Doubao-AI-Seedance-2.0-Engine, die Entwickler für filmische Aufnahmen, Produktspots und kurze Social-Videos nutzen, aufrufbar über einen einzigen Standard-Endpunkt.
Für Doubao Seedance 2.0 Text-zu-Video beginnt die Generierung bei $0.2957 pro Run, und die Preise der Doubao-Seedance-2.0-API skalieren vorhersehbar mit Auflösung und Dauer — siehe die vollständige Tabelle unten. Ob Sie schnelle 480p-Clips prototypisieren oder 1080p- und 4K-Aufnahmen mit Audio rendern, Seedance 2.0 Doubao bietet Ihnen einen Pay-as-you-go-Weg zur neuesten Videogenerierung von ByteDance, mit einem API-Schlüssel, der für jedes Modell auf der Plattform funktioniert.
Was ist Doubao Seedance 2.0?
Veröffentlicht im Februar 2026 vom Seed-Team von ByteDance, basiert Doubao Seedance 2.0 (auch geschrieben als doubao-seedance-2.0 oder seedance 2.0 doubao) auf einer einheitlichen Audio-Video-Architektur. Der entscheidende Unterschied zu Version 1.5 Pro ist nicht eine höhere Auflösungszahl — sondern dass das Modell jede Eingabe als Steuersignal behandelt. Eine einzelne Generierung kann eine Textbeschreibung plus Referenzbilder, einen Clip für die Kamerabewegung und eine Audiospur aufnehmen und sie alle gemeinsam verarbeiten, bevor das erste Bild erzeugt wird. Für diesen Text-zu-Video-Endpunkt arbeiten Sie mit Text, aber dieselbe Modell-ID steuert auch den umfassenderen Referenz-Workflow an anderer Stelle.
| Spezifikation | Wert |
|---|---|
| Anbieter | ByteDance (Seed-Team) |
| Modellbezeichnung | doubao-seedance-2-0-260128 |
| Dieser Endpunkt | Text-zu-Video |
| Eingabemodalitäten (Modell) | Text, Bild, Video, Audio |
| Referenzkapazität (Modell) | Bis zu 9 Bilder, 3 Video-Clips, 3 Audio-Clips pro Aufruf |
| Natives Audio | Ja — zusammen mit dem Video erzeugt; mehrsprachiger Lippen-Sync |
| Dauer | 4–15 s (Modell); 4–14 s auf GPTProto abgerechnet |
| Auflösung | Bis zu 1080p (Stufen 480p / 720p / 1080p) |
| Seitenverhältnisse | 16:9, 9:16, 4:3, 3:4, 21:9, 1:1 |
| Bearbeitung / Erweiterung | Gezielte Clip-/Charakter-/Action-Bearbeitungen; Clip-Erweiterung |
| Bild-zu-Video | Ja — separater Endpunkt unter /image-to-video |
| Varianten | Voll + Fast (doubao-seedance-2-0-fast-260128 auf GPTProto) |
| Open Source | Nein — proprietär |
So verarbeitet das Modell Audio und Bewegung
Zwei Dinge unterscheiden Seedance 2.0 von einem Standard-Text-zu-Video-Modell, und beide beeinflussen, wie Sie Prompts erstellen. Erstens entstehen Audio und Video in einem Durchgang statt als stummer Clip mit nachträglich aufgesetzter Tonspur. Da Ton und Bild gemeinsam erzeugt werden, trifft der Dialog auf den Mund und Umgebungsgeräusche folgen der Handlung — ein Prompt, der die Geräusche benennt („die Geräuschkulisse der Menge baut sich auf, während das Auto vorbeifährt“), erzeugt tendenziell einen engeren Sync als die Beschreibung von Bildern allein. Zweitens hält das Modell die Identität eines Subjekts über Bewegungen und Kamerawinkel hinweg zuverlässiger als frühere Versionen — das ist es, was Multi-Shot- und wiederkehrende Charakterarbeit brauchbar macht statt einmalig. Wenn Sie KI-Videos abgeschrieben haben, weil Gesichter zwischen Schnitten driften, ist dies die Achse, die sich am meisten verbessert hat.
Doubao Seedance 2.0 im Vergleich zu Sora 2
Beide Modelle sind live auf GPTProto, also ist dies ein direkter Vergleich und keine Marketing-Aussage.
| Doubao Seedance 2.0 | Sora 2 | |
|---|---|---|
| Eingaben | Text, Bild, Video, Audio | Text, Bild |
| Natives Audio | Ja, gemeinsame Erzeugung | Ja, synchronisiert |
| Maximale Dauer | 15 s | 12 s (Standard) / 25 s (Pro) |
| Maximale Auflösung | Bis zu 1080p | 720p (Standard) / 1080p (Pro) |
| API-Roadmap | Aktiv | OpenAI stellt die Sora-2-API am 24. September 2026 ein |
| GPTProto-Preis | ab $0.2957/Run (skaliert mit Auflösung × Dauer) | $0.40/Run (pauschal) |
Doubao Seedance 2.0 im Vergleich zu Seedance 1.5 Pro
Wenn Sie bereits Seedance 1.5 Pro nutzen, geht es beim Upgrade um Eingabesteuerung, nicht um eine höhere Auflösung. Version 1.5 Pro erzeugte bereits Audio und Video zusammen und folgte Multi-Shot-Anweisungen. Seedance 2.0 fügt den Referenz-Stack hinzu — bis zu 9 Bilder, 3 Video-Clips und 3 Audio-Clips in einem einzigen Aufruf — sowie gezielte Bearbeitung und Clip-Erweiterung. In externen Bewegungs- und Physiktests schneidet es besser ab als 1.5 Pro, mit dem größten Gewinn bei der physikalischen Genauigkeit.
Der Kostenunterschied ist groß: 1.5 Pro startet bei $0.0408/Run gegenüber $0.2957 für 2.0. Praktische Faustregel: Bleiben Sie bei 1.5 Pro für einfache, mengenmäßig große Text-zu-Video-Aufgaben, bei denen das Budget dominiert; wechseln Sie zu 2.0, wenn Sie referenzgesteuerte Konsistenz, Bearbeitung oder audiogeführte Szenen benötigen. Beide laufen über dasselbe Guthaben, Sie können sie also mit demselben Prompt vergleichen.
| Seedance 2.0 | Seedance 1.5 Pro | |
|---|---|---|
| Referenzeingaben | Text, Bild, Video, Audio (9 Bilder / 3 Clips / 3 Audio) | Text, Bild |
| Natives Audio | Ja | Ja |
| Bearbeitung / Erweiterung | Ja | Nein |
| GPTProto-Preis | ab $0.2957/Run | ab $0.0408/Run |
Umstieg von Doubao, Jimeng oder Volcano Ark
Wenn Sie Seedance 2.0 bereits in den eigenen Oberflächen von ByteDance prototypisieren, bietet Ihnen GPTProto dasselbe Modell über eine REST-API: Senden Sie Ihren Prompt und Ihre Parameter per POST an den Text-zu-Video-Endpunkt und fragen Sie dann das Ergebnis über /api/v3/predictions/{result_id}/result ab. Die Parameternamen (prompt, aspect_ratio, duration, resolution, generate_audio, camera_fixed, seed) entsprechen direkt dem, was Sie bereits verwenden, sodass die Übertragung eines Prompts größtenteils Copy-and-Paste ist. Der Vorteil über den Zugang hinaus ist, dass derselbe Schlüssel die Fast-Variante, Seedance 1.5 Pro und Sora 2 erreicht, sodass Sie sie mit identischen Prompts aus einem einzigen Guthaben A/B-testen können, statt pro Anbieter ein Konto zu eröffnen.
Was Entwickler damit bauen
Die Funktionen zielen auf einige Aufgaben, die es besonders gut kann: kurze Social- und Werbeclips, bei denen natives Audio einen separaten Vertonungsschritt spart; charakterkonsistente Serien und Markenmaskottchen, die über Einstellungen hinweg erkennbar bleiben müssen; Dialogszenen, die Lippen-Sync benötigen; und musik- oder beatgetriebene Schnitte, bei denen Ton und Bewegung zusammenpassen müssen. Für die Ideenfindung in großem Umfang erstellen Sie Entwürfe mit der Fast-Variante und rendern die besten Ergebnisse anschließend mit dem vollständigen Modell neu.
Doubao Seedance 2.0 Prompt-Rezepte
Seedance 2.0 belohnt Prompts, die Ton und Kamera benennen, nicht nur Bilder — da Audio gemeinsam erzeugt wird und die Kamerasprache ein Steuersignal ist. Das sind Einstiegspunkte zum Einfügen und Anpassen; stimmen Sie Dauer und Seitenverhältnis auf Ihre Einstellung ab.
1. Audiogeführte Szene (nutzen Sie den gemeinsamen Audio-Durchgang)
Eine verregnete Tokioter Gasse bei Nacht, Neonreflexionen auf nassem Asphalt. Eine Gestalt in dunklem Mantel geht auf die Kamera zu. Diegetischer Ton: gleichmäßiger Regen, entfernter Verkehr, Schritte in Pfützen. Langsames Heranfahren (Dolly-in). 16:9.
Wenn Sie das Geräusch benennen, kann das Modell die Atmosphäre in einem Durchgang mit der Bewegung synchronisieren, statt sie danach selbst zu vertonen. Lassen Sie generate_audio aktiviert.
2. Produktaufnahme mit fester Kamera (camera_fixed)
Eine Keramik-Kaffeetasse auf einer Marmorarbeitsplatte, Morgenlicht von links, aufsteigender Dampf. Statische Kamera, keine Bewegung. Geringe Schärfentiefe. 1:1.
Kombinieren Sie dies mit camera_fixed: true, wenn sich das Motiv bewegen soll, der Rahmen aber stabil bleiben soll — nützlich für E-Commerce-Loops und Packshots.
3. Charakterkonsistente Action
Eine junge Frau in roter Jacke rennt über ein Dach, springt über eine Lücke, landet und läuft weiter. Ihr Gesicht, ihre Haare und ihre Jacke müssen im gesamten Clip identisch bleiben. Handkamera, seitlich verfolgend. Menschenmenge und Wind als Audio. 16:9, 8 s.
Die Konsistenzanforderung in Worten zu nennen, stützt sich auf das stärkste Upgrade des Modells — ein Subjekt durch Bewegung hindurch stabil zu halten.
4. Multi-Shot in einer Generierung
Einstellung 1: Weitaufnahme eines Kochs, der ein Gericht anrichtet. Einstellung 2: Nahaufnahme des Garniers, das platziert wird. Einstellung 3: Der Koch schaut auf und lächelt. Warme Küchenatmosphäre, leichtes Brutzeln. Weiche Schnitte. 16:9, 10 s.
Die Nummerierung der Einstellungen gibt dem Modell eine klare Struktur, der es folgen kann, und das funktioniert besser als eine einzige fortlaufende Beschreibung.
Prompt-Tipps
- Benennen Sie diegetischen Ton ausdrücklich, wenn er wichtig ist; das Audio wird zusammen mit dem Video erzeugt.
- Beschreiben Sie die Kamerabewegung (Dolly, Schwenk, Handkamera, statisch) — sie wird als Regieanweisung behandelt.
- Für wiederkehrende Subjekte formulieren Sie die Konsistenzanforderung in Worten.
- Erstellen Sie Entwürfe mit der Fast-Variante und rendern Sie den Favoriten mit dem vollständigen Modell neu.
FAQ
Alles, was Sie über den Einsatz von Doubao Seedance 2.0 für die professionelle Videoproduktion wissen müssen.
Was ist Doubao Seedance 2.0?
Wie funktioniert die Preisgestaltung der Doubao Seedance 2.0 API?
Unterstützt Seedance 2.0 Bild-zu-Video?
Wie viel kostet die Doubao Seedance 2.0 API in der Praxis?
Unterstützt Seedance 2.0 Bild-zu-Video?
Erzeugt Seedance 2.0 Audio?
Wie lang können die Videos sein?
Ist Seedance 2.0 Open Source?
Doubao Seedance 2.0 vs. Sora 2?
Wie kann ich bei Seedance 2.0 am besten Credits sparen?
Warum weicht meine Seedance-2.0-Ausgabe von meinem Prompt ab?
Wie behebe ich API-Verbindungsfehler bei Seedance 2.0?
Verwandte Artikel
Anleitungen, Vergleiche und Updates zu diesem Modell.
Alle Artikel
Doubao 1.5 Pro: Benchmarks & API-Zugriff
ByteDances doubao 1.5 pro nutzt eine schlankere MoE-Architektur, um mit einem Bruchteil der Rechenleistung mit schwereren Modellen zu konkurrieren. Lesen Sie unseren Leitfaden, um es noch heute zu integrieren.

Doubao AI: Ein vollständiger Überblick über Funktionen, Vor- und Nachteile & Fazit
Entdecken Sie Doubao AI von ByteDance: Es bietet multimodale Funktionen, Echtzeit-Antworten, Bildgenerierung und mehr. 50x günstiger als ChatGPT. Erfahren Sie mehr über Preise, Zugriffsmöglichkeiten und wie es im Vergleich zu Wettbewerbern abschneidet.

Dreamina: Profi-Leitfaden für Seedance 2.0 Video-KI
Meistern Sie dreamina Seedance 2.0 für realistische KI-Videos. Erfahren Sie mehr über Charakterkonsistenz, Physik und VPN-Zugriffstipps. Optimieren Sie noch heute Ihren Workflow.

Seedance AI: Bytedances neuer Videostandard
Entdecken Sie, wie Seedance von Bytedance KI-Videos mit realistischen Gesichtsausdrücken und kostengünstigem API-Zugriff revolutioniert. Erfahren Sie noch heute mehr.