Multimodale Eingabe, ein Modell
Beginnen Sie mit Text, einem ersten Frame, dem ersten und letzten Frame, bis zu 10 Referenzbildern, fünf Referenzvideos, fünf Audioclips, einem Dokument oder einer öffentlichen Webseite.
curl --request POST "https://gptproto.com/api/v3/alibaba/wan-3.0/text-to-video" \
--header "Authorization: Bearer $GPTPROTO_API_KEY" \
--header "Content-Type: application/json" \
--data '{
"prompt": "A tiny origami fox sailing a teacup across a moonlit puddle",
"negative_prompt": "",
"resolution": "720P",
"ratio": "adaptive",
"duration": 5,
"generate_audio": true,
"audio": "",
"shot_type": "single",
"watermark": false,
"seed": 1
}'Nimm die Kosten für ein einzelnes Beispiel als Ausgangspunkt und leg ein Testbudget fest. Die Preise von GPTProto liegen 10% unter dem Listenpreis.
| Szenario | Qwen Liste | OpenRouter | GPTProto | Du sparst / Monat |
|---|---|---|---|---|
| Kurze Produktwerbung30 × 5s / Monat | $30.00 | $31.65 | $27.00 | −$3.00≈ $36.00 / Jahr |
| Social-Media-Clips60 × 5s / Monat | $60.00 | $63.30 | $54.00 | −$6.00≈ $72.00 / Jahr |
| Massengenerierung100 × 5s / Monat | $100.00 | $105.50 | $90.00 | −$10.00≈ $120.00 / Jahr |
Greifen Sie über GPTProto auf die Wan3.0-API von Alibaba zu und nutzen Sie ein gemeinsames Kontoguthaben für Wan und andere Videomodelle. Erstellen Sie Workflows für Videos aus Prompts, mit erstem Frame, mit erstem und letztem Frame, auf Referenzbasis, aus Dokumenten oder aus Webseiten – ohne für jedes Modell in Ihrer Pipeline ein separates Anbieterkonto verwalten zu müssen.
Multimodale Eingabe, ein Modell
Beginnen Sie mit Text, einem ersten Frame, dem ersten und letzten Frame, bis zu 10 Referenzbildern, fünf Referenzvideos, fünf Audioclips, einem Dokument oder einer öffentlichen Webseite.
Bis zu 30 Sekunden in 1080P
Generieren Sie 2–30 Sekunden lange Videos mit 480P, 720P oder 1080P und 30 fps. Nutzen Sie die intelligente Dauer, wenn das Modell die Länge des Clips anhand Ihres Prompts und Ihrer Referenzen festlegen soll.
Konsistenz durch Referenzen
Geben Sie Figuren, Produkten, Orten, Requisiten und visuellem Stil mithilfe geordneter Referenzen die gewünschte Richtung vor. Wan3.0 ist darauf ausgelegt, wiedererkennbare Details über mehrere Einstellungen hinweg beizubehalten – für Markenvideos und erzählerische Videos.
Audio und Videobearbeitung
Generieren Sie standardmäßig Audio oder deaktivieren Sie es, ohne den Generierungspreis zu ändern. Überarbeiten Sie visuelle Elemente, Handlung und Dialoge mit dem Bearbeitungsworkflow von Wan3.0, statt die gesamte Sequenz neu zu erstellen.
Wan3.0 ist Alibabas Vorschauversion eines All-in-One-Modells zur Videogenerierung. Anstatt für jeden Erstellungsweg ein eigenes Modell anzubieten, unterstützt der offizielle Endpunkt wan3.0-video Text-zu-Video, Bild-zu-Video mit erstem Frame, Video mit erstem und letztem Frame, multimodale Referenz-zu-Video-Generierung, die Eingabe von Dokumenten oder Webseiten sowie Workflows zur Videobearbeitung.
Das Modell kann in einem einzigen Generierungsvorgang Videos mit einer Länge von 2 bis 30 Sekunden erstellen. Sie können eine Ausgabe mit 480P, 720P oder 1080P bei 30 fps anfordern, ein Standard-Seitenverhältnis auswählen oder das Verhältnis vom Modell an die bereitgestellten Medien anpassen lassen. Audio ist standardmäßig aktiviert. Eine intelligente Dauer und die Prompt-Erweiterung können dabei helfen, aus einer kurzen Beschreibung eine vollständigere Sequenz zu machen.
Wan3.0 ist besonders relevant, wenn ein Video mehr als nur eine allgemeine Stimmung bewahren muss. Geordnete Referenzen können eine Figur, ein Produkt, einen Ort, eine Kamerasprache, eine Stimme oder eine musikalische Richtung vorgeben. Datei- und öffentlich zugängliche Link-Eingaben ermöglichen es Teams außerdem, aus einer Produktpräsentation, einem Bericht, einem Artikel oder einem Schulungsdokument ein strukturiertes Videobriefing zu erstellen.
| Spezifikation | Wan3.0-API-Details |
|---|---|
| Anbieter | Alibaba Cloud Model Studio |
| Offizieller Status | Vorschau |
| Offizielle Modell-ID | wan3.0-video |
| GPTProto-Modellbezeichnung | wan-3.0 |
| Generierungsmodi | Text-zu-Video, erster Frame, erster und letzter Frame, Referenz-zu-Video, Datei-zu-Video, Webseite-zu-Video |
| Ausgabedauer | 2–30 Sekunden; -1 aktiviert die intelligente Dauer |
| Ausgabeauflösung | 480P, 720P oder 1080P |
| Bildrate | 30 fps |
| Seitenverhältnisse | Adaptiv, 16:9, 4:3, 1:1, 3:4 oder 9:16 |
| Referenzlimits | Bis zu 10 Bilder, 5 Videoclips und 5 Audioclips; die Gesamtdauer der Referenzvideos und -audios ist jeweils auf 15 Sekunden begrenzt |
| Dateieingabe | Eine DOC/DOCX-, XLS/XLSX-, PPT/PPTX-, PDF-, TXT-, KEY-, Pages-, Numbers- oder Markdown-Datei; bis zu 100 MB und 50 Seiten |
| Eingabe einer öffentlichen Webseite | Eine öffentlich zugängliche HTTP- oder HTTPS-Seite, für die keine Anmeldung erforderlich ist |
| Prompt-Limit | 20.000 Zeichen; Chinesisch und Englisch werden unterstützt |
| Audio | Standardmäßig aktiviert; kann deaktiviert werden, ohne die offizielle Generierungsrate zu ändern |
| Wasserzeichenparameter | In Alibabas API standardmäßig deaktiviert; prüfen Sie die aktuelle GPTProto-Implementierung, bevor Sie pauschale Aussagen zu Ausgaberichtlinien treffen |
Die Wahl des richtigen Modus ist wichtig, da Eingaben zur Frame-Steuerung und umfangreiche Referenzeingaben in der offiziellen API nicht miteinander kombiniert werden können. Kombinieren Sie in derselben Anfrage weder first_frame noch last_frame mit Referenzbildern, Referenzvideos, Referenzaudio, einer Datei oder einer Webseite.
| Eingabemodus | Verwendung | Praxisbeispiel |
|---|---|---|
| Text-zu-Video | Sie möchten eine neue Szene ohne festgelegtes visuelles Material erstellen | Erstellen Sie mehrere Kampagnenkonzepte anhand strukturierter Shot-Prompts |
| Video mit erstem Frame | Die Eröffnungskomposition oder das Produktbild ist bereits freigegeben | Animieren Sie ein freigegebenes Hero-Bild aus dem Katalog und bewahren Sie dabei den ursprünglichen Bildausschnitt |
| Video mit erstem und letztem Frame | Beide Endpunkte der Bewegung oder Transformation sind wichtig | Zeigen Sie den Übergang von einer geschlossenen Verpackung zur vollständigen Präsentation des montierten Produkts |
| Referenz-zu-Video | Identität, Bewegung, Stimme, Musik, Schauplatz oder Stil müssen aus Quellmaterial stammen | Behalten Sie Produkt, Sprecher, Ort und Audiogestaltung in einem Markenclip bei |
| Datei oder Webseite zu Video | Die Ausgangsidee steckt in einer Präsentation, einem Bericht, einer Produktseite, einem Artikel oder einem Schulungsdokument | Machen Sie aus einer Produktpräsentation eine Launch-Ankündigung als Video oder aus einem öffentlichen Artikel eine visuelle Zusammenfassung mit Kommentar |
Wan3.0 kann die Lücke zwischen einem freigegebenen Commerce-Asset und einer brauchbaren Videovariation schließen. Verwenden Sie für ein einzelnes SKU ein freigegebenes Hero-Bild, wenn die genaue Eröffnungskomposition wichtig ist. Nutzen Sie den Referenzmodus, wenn das Produkt in mehreren Einstellungen wiedererkennbar bleiben muss, oder stellen Sie eine Produktpräsentation bereit, wenn Merkmale, Positionierung und Szenenabfolge bereits in einem Dokument festgehalten sind.
Erstellen Sie für die Batch-Videogenerierung eine Vorlage für Produktdaten, Referenzen, Seitenverhältnis, Dauer, Kamera, Audio und abschließenden CTA. Übermitteln Sie jede Variation asynchron, speichern Sie ihre Aufgaben-ID und verwalten Sie den Status getrennt von der Übermittlung, um doppelte Aufträge zu vermeiden. Ein freigegebenes Quellmaterial kann Versionen im Format 9:16 für soziale Medien, 1:1 für Marktplätze und 16:9 für Produktseiten liefern. Speichern Sie erfolgreiche Ausgaben in Ihrem eigenen Speicher.
Diese Modelle überschneiden sich, eignen sich aber besonders für unterschiedliche Anwendungsfälle. Die beste Wahl hängt von der benötigten Dauer, der Anzahl der Referenzen, der Ausgabeauflösung, der Dokumenteingabe, den Bearbeitungsmöglichkeiten und den Kosten für einen fertig nutzbaren Clip ab – nicht nur vom beworbenen Preis pro Sekunde.
| Entscheidungsfaktor | Wan3.0 | Seedance 2.5 | MiniMax H3 |
|---|---|---|---|
| Maximale Dauer einer einzelnen Generierung | Bis zu 30 Sekunden | Bis zu 30 Sekunden | Bis zu 15 Sekunden |
| Veröffentlichte Referenzkapazität | Bis zu 10 Bilder, 5 Videos und 5 Audioclips | Bis zu 30 Bilder, 10 Videos und 10 Audioclips | Bis zu 9 Bilder, 3 Videos und 3 Audioclips; insgesamt 12 gemischte Dateien |
| Höchste dokumentierte API-Auflösung | 1080P | Prüfen Sie die vom ausgewählten Endpunkt bereitgestellte Auflösung | 2K |
| Eingabe von Dokumenten oder öffentlichen Webseiten | Ja | In der offiziellen Einführungsübersicht von ByteDance nicht als Kerneingabe aufgeführt | In der aktuellen API-Eingabetabelle von MiniMax nicht aufgeführt |
| Audio | Optionale Audioausgabe | Gemeinsame Audio- und Videogenerierung | Natives Stereo-Audio |
| Schwerpunkt der Bearbeitung | Überarbeitung von Bildmaterial, Handlung und Dialog; Videoverlängerung | Audiovisuelle Bearbeitung auf Zeitstempel-Ebene, Greenscreen, Kameraperspektive und Verlängerung über mehrere Runden | Multimodale Referenzgenerierung, Bearbeitung und Bewegungsübertragung |
| Am besten geeignet für | Längere multimodale oder dokumentbasierte Videos mit einem klar dokumentierten 1080P-API-Pfad | Referenzintensive Erzählformate mit 30 Sekunden Länge, für die die größte veröffentlichte Asset-Auswahl benötigt wird | Kürzere 2K-Clips, nativen Stereoklang und Workflows, die ein offenes Modellökosystem schätzen |
Wählen Sie Wan3.0 statt Seedance 2.5, wenn die Eingabe von Dokumenten oder öffentlichen Webseiten und eine dokumentierte Auflösungsstaffelung von 480P bis 1080P wichtiger sind als eine maximale Anzahl von Referenzen. Wählen Sie MiniMax H3, wenn eine Obergrenze von 15 Sekunden ausreicht und 2K-Ausgabe oder natives Stereo-Audio wichtiger sind. Vergleichen Sie die Kosten anhand desselben Prompts, derselben Assets, Dauer, desselben Seitenverhältnisses und derselben Abnahmekriterien – einschließlich Wiederholungen und abgelehnter Generierungen.
Verwenden Sie eine Prompt-Struktur, die das Motiv von der Zeitleiste und den Kameraanweisungen trennt:
Prompt-Formel: Motiv und Quellreferenzen + Szenenziel + zeitlich festgelegte Aktionen oder Handlungspunkte + Kamerabewegung + Beleuchtung und visueller Stil + Audiogestaltung + zu bewahrende Details + zu vermeidende Details + letzter Frame oder CTA
Verwende Bild 1 als Produktreferenz und Bild 2 als Beleuchtungsreferenz. Erstelle ein 12-sekündiges vertikales Launch-Video für einen mattschwarzen kabellosen Lautsprecher. Beginne mit einer Makroaufnahme des Gitters, fahre zurück, während sich der Lautsprecher dreht, und zeige dann, wie Bassvibrationen nahegelegene Wassertropfen in Bewegung versetzen. Bewahre Logo, Bedienelemente, Proportionen und Oberfläche. Kühles Kantenlicht, zurückhaltende Kamerabewegung, dezente elektronische Atmosphäre, kein zusätzlicher Text und keine Verformungen.
Mache aus der bereitgestellten Produktpräsentation einen 20-sekündigen Launch-Film im Format 16:9. Ordne die drei wichtigsten Vorteile als Problem, Produktdemonstration und abschließende Aussage zum Mehrwert an. Bewahre die dokumentierten Farben und Materialien. Verwende eine klare Studiobeleuchtung, maßvolle Kamerabewegungen, einen prägnanten Voiceover-Text und keine unbelegten Behauptungen. Beende das Video mit dem Produkt in der Mitte vor dem Marken-Hintergrund.
Alibaba weist darauf hin, dass die Audiotextur und die Genauigkeit der Textrendering-Funktion auf dem Bildschirm noch verbessert werden. Für markensichere Ergebnisse sollten Sie Titel, Rechtstexte, Preise und kleine Beschriftungen in der Nachbearbeitung hinzufügen, anstatt vom Modell eine perfekte Darstellung innerhalb der Szene zu erwarten. Prüfen Sie Dialoge und Musik vor der Veröffentlichung sorgfältig, insbesondere wenn das fertige Asset als bezahlte Werbung eingesetzt wird.
Aufträge mit erstem Frame und erstem und letztem Frame können nicht mit Referenz-, Datei- oder Webseiteneingaben kombiniert werden. Validieren Sie umfangreiches Medienmaterial vor der Übermittlung, speichern Sie Aufgaben-IDs, gestalten Sie Wiederholungen idempotent und sichern Sie fertige Dateien umgehend.
Anleitungen, Vergleiche und Updates zu diesem Modell.
Alle Artikel
Erfahre, wie du ein Anime-Bild mit passenden Anfangs- und Schlussbildern, Prompts, Sound und Bearbeitungstipps in ein realistisches Transformationsvideo verwandelst.

Sieh dir Seedance 2.0 und 2.5 im selben 15-Sekunden-Storyboard-Test an. Vergleiche Kinoqualität, Emotionen, Preise, E-Commerce-Anwendungsfälle und API-Funktionen.

Erfahre, wie du in Seedance 2.5 mit zeitlich abgestimmten Mikroexpressionen, filmischen Techniken und zwei vollständigen Videobeispielen realistische emotionale Gesichtsausdrücke erzeugst.

Vergleiche die besten chinesischen KI-Videomodelle des Jahres 2026, darunter Seedance, MiniMax H3, Wan 3.0, Kling und Vidu, für Text-, Bild- und Referenzvideos.
Eingabe
Ausgabe