Suche nach "wan 2.7" und du erhältst zwei Antworten, die nicht beide stimmen können. In einigen Anleitungen heißt es, man solle die Gewichte herunterladen und das Modell auf der eigenen GPU ausführen. Andere sagen, man könne nur über eine API darauf zugreifen. Ich wollte herausfinden, welche Aussage stimmt, denn davon hängt ab, ob du dieses Modell überhaupt selbst hosten kannst — und die Kurzfassung lautet: Die meisten selbstsicheren Beiträge mit der Aussage "es ist Open Source" wiederholen eine Gewohnheit, keine Tatsache. Hier erfährst du, was Wan 2.7 tatsächlich ist, was Alibaba veröffentlicht hat und was nicht, und wie du ein Wan-Modell heute produktiv einsetzen kannst.
Was ist Wan 2.7? Leitfaden zu Alibabas Thinking-Mode-Modell (2026)
Die meisten Anleitungen behaupten, Wan 2.7 sei Open Source. Die Belege aus erster Hand sagen etwas anderes. Was Alibabas Modell vom April 2026 tatsächlich bietet – und wie du es ausführst.

Was Wan 2.7 tatsächlich ist
Wan 2.7 ist kein einzelnes Modell. Es handelt sich um eine Veröffentlichungswelle von Alibabas Tongyi Lab, die Anfang April 2026 erschienen ist und sich gleichzeitig auf zwei Medien erstreckt. Es gibt eine Bildseite — Wan2.7-Image und ein separates Wan2.7-Image Pro, die laut den Veröffentlichungsmaterialien ungefähr auf den 1. April datiert sind — sowie eine Videoseite: eine Suite aus vier Modellen für Text-zu-Video, Bild-zu-Video, Referenz-zu-Video und anweisungsbasierte Videobearbeitung, die in den darauffolgenden Tagen eingeführt wurde. Genau dieser doppelte Umfang ist der Grund, warum die SERP sich selbst widerspricht, ob Wan 2.7 ein "Bildmodell" oder ein "Videomodell" ist. Es ist beides und wurde gemeinsam unter einer Versionsnummer veröffentlicht.
Der Name selbst sollte genauer betrachtet werden, denn er sorgt häufig für Verwirrung. "Wan" ist die internationale Kurzbezeichnung für Tongyi Wanxiang (通义万相), Alibabas Linie für kreative KI. Sie steht neben den Qwen-Sprachmodellen unter demselben Konzerndach, ist aber eine andere Produktfamilie. Wenn eine Hosting-Plattform Wan also unter einem qwen-Pfad führt, ist das eine Katalogisierungsentscheidung und keine Behauptung, dass Wan ein Qwen-Modell sei.
Version in einem Satz: Wan 2.7 ist Alibabas Bild- und Videogenerierungswelle vom April 2026, deren zentrale Funktion der sogenannte Thinking Mode ist.
So funktioniert der Thinking Mode
Bevor wir auf den Mechanismus eingehen, zunächst der Grund für seine Existenz. Ein herkömmliches Videomodell wandelt deinen Prompt direkt in Einzelbilder um. Es hält nicht inne, um darüber nachzudenken, was du angefordert hast — es liest den Text, wählt einen Pfad durch seinen latenten Raum und dekodiert ihn. Für eine einzelne, klare Aufnahme reicht das aus. Sobald du jedoch etwas Strukturiertes verlangst, wird es anfällig: eine Sequenz mit mehreren Einstellungen, eine Figur, die in Einstellung drei genauso aussehen muss wie in Einstellung eins, oder eine Kamerabewegung, die auf einem bestimmten Takt enden muss. Das Modell arbeitet den Auftrag zu hastig ab, und die Übergänge werden sichtbar.
Der Thinking Mode fügt, wie Alibaba ihn beschreibt, vor der Generierung eine Planungsphase ein. Das Modell erstellt zunächst einen kompositorischen Plan — wie die Absicht des Prompts zu verstehen ist, wie Elemente räumlich und zeitlich zusammenhängen und wie die Logik der Aufnahme aussehen sollte — und generiert erst danach. Das Versprechen lautet: weniger Artefakte und eine bessere Kohärenz über eine Sequenz hinweg.
Wie groß dieser Vorteil tatsächlich ist, würde ich als offene Frage und nicht als feststehende Zahl betrachten; gleich darauf komme ich zurück. Die Designidee ist jedoch sinnvoll und das wirklich neue Element in diesem Zusammenhang. Fazit: Der Thinking Mode tauscht etwas Geschwindigkeit gegen einen Planungsschritt ein. Das ist vor allem dann relevant, wenn dein Prompt mehr als eine bewegliche Komponente enthält.
Wichtige Fähigkeiten — und wie sehr du den einzelnen Zahlen vertrauen solltest
Hier ist es wichtig, zwischen verschiedenen Vertrauensstufen zu unterscheiden, denn die Liste der Fähigkeiten von Wan 2.7 stammt fast vollständig aus Alibabas eigenen Veröffentlichungsnotizen, und Herstellerangaben sollten entsprechend gekennzeichnet werden.
Alibaba berichtet Folgendes: eine ausreichend starke Charakterkonsistenz, um ein Gesicht über einen Clip hinweg beizubehalten (die Lösung für das Problem des "KI-Einheitsgesichts"), präzise Farbsteuerung mit Unterstützung für HEX-Werte und Paletten, die Darstellung langer Texte mit mehr als 3.000 Tokens in 12 Sprachen einschließlich Tabellen und Formeln, die in Einzelbilder eingefügt werden, narrative Steuerung über mehrere Einstellungen, Vorgaben für erstes und letztes Einzelbild, Referenz-zu-Video mit bis zu neun Referenzbildern sowie nativ im selben Durchlauf erzeugtes Audio. Das sind die Angaben des Anbieters, als solche dargestellt. Ich konnte sie bisher nicht anhand eines neutralen Tests überprüfen.
Bei den harten technischen Daten ist das Bild unklarer, als die meisten Beiträge zugeben. Die Ausgabeauflösung wird je nach Ausführungsort mit 720p oder 1080p angegeben, die Clip-Länge liegt irgendwo zwischen 2 und 15 Sekunden, und das Bildmodell ist der Teil, für den die 4K-Angabe gilt. Diese Werte unterscheiden sich je nach Host. Betrachte daher jede einzelne Zahl, die du siehst, als "auf dieser Plattform korrekt" und nicht als "für das Modell allgemein korrekt". Die Generierung erfolgt außerdem nicht sofort — erste praktische Berichte beschreiben sie als deutlich langsamer als leichtere Videomodelle. Das ist der stille Preis der Planungsphase und sollte einkalkuliert werden, wenn du große Mengen renderst.
Und die ehrliche Lücke: Zum Zeitpunkt der Veröffentlichung konnte ich Wan 2.7 auf keinem neutralen Leaderboard finden — weder gibt es einen Eintrag in der Artificial Analysis Video Arena noch einen veröffentlichten VBench-Wert für diese Version. Das bedeutet nicht, dass das Modell schlecht ist. Es bedeutet, dass die kursierenden Qualitätsangaben weiterhin ausschließlich vom Anbieter stammen. Der nächstliegende überprüfbare Bezugspunkt ist die Abstammungslinie: Wan 2.1 führte VBench bei seiner Veröffentlichung im Februar 2025 an. Das ist ein echtes Ergebnis für ein früheres Modell, aber kein Ersatz für 2.7.
| Art der Angabe | Beispiele | Wie viel Vertrauen ist angebracht? |
|---|---|---|
| Jetzt überprüfbar | 2.1/2.2 sind Open Weight; 2.1 führte VBench bei der Veröffentlichung an | Auf offiziellen Repositories und im Benchmark bestätigt |
| Vom Anbieter berichtet | Vorteile des Thinking Mode, Farb-/Text-/Konsistenzangaben | Alibabas Aussage; bisher kein neutraler Test |
| Host-abhängig | 720p/1080p, 2–15 s, 4K (Bild) | Plattformabhängig, keine feste Modellspezifikation |
Ist Wan 2.7 Open Source?
Die kurze Antwort zuerst: nicht in der Weise, wie die Wan-Serie alle daran gewöhnt hat.
Hier ist die Tatsache: Wan 2.1 (Februar 2025) und Wan 2.2 (Juli 2025) wurden als Open Weight unter Apache 2.0 veröffentlicht — herunterladbar, selbst hostbar und feinabstimmbar, ohne kommerzielle Einschränkungen. Du kannst das selbst bei der Wan-AI-Organisation auf Hugging Face und der Wan-Video-Organisation auf GitHub bestätigen. Diese Geschichte offener Gewichte ist real und der Grund, warum so viele Anleitungen automatisch davon ausgehen, dass auch 2.7 offen ist.
Hier ist die zweite Tatsache: Dieselben offiziellen Kanäle — die GitHub-Organisation, die Hugging-Face-Organisation und Alibabas eigenes ModelScope — führen keine Gewichte für Wan 2.7 auf. Zum Zeitpunkt der Veröffentlichung ist die neueste Open-Weight-Veröffentlichung auf der offiziellen Spur weiterhin die Wan-2.2-Familie (die A14B-Text-zu-Video- und Bild-zu-Video-Modelle, das 5B-TI2V-Modell sowie die späteren S2V- und Animate-Varianten). Das offizielle News-Log dieses Repositories endet lange vor einem möglichen 2.7-Eintrag.
Wenn eine Seite dir also sagt, Wan 2.7 sei "Open Weight unter Apache 2.0", prüfe, ob sie auf ein tatsächliches First-Party-Repository mit Gewichten verweist. In jedem Fall, den ich zurückverfolgt habe, war das nicht so — die Behauptung profitierte vom Ruf der Serie, und mindestens eine häufig zitierte Quelle widersprach sich auf ihren eigenen Seiten. Meine Einschätzung: Wan 2.7 folgt dem API-only-Weg, den Alibaba bereits mit Wan 2.5 und 2.6 eingeschlagen hat, und nicht dem offenen Weg von 2.1 und 2.2. Ich würde das als Einschätzung und nicht als unumstößliche Wahrheit betrachten — wenn Alibaba nächste Woche die Gewichte hochlädt, ändert sich die Lage — doch heute weisen die überprüfbaren Belege in eine Richtung.
In der Praxis ergibt sich daraus eine klare Entscheidung. Wenn dein Projekt die Gewichte wirklich benötigt — für lokale Inferenz, Feinabstimmung oder Daten, die deine Infrastruktur nicht verlassen dürfen — bietet Wan 2.7 dir das heute nicht, und deine tatsächliche offene Option bleibt Wan 2.2. Wenn du über eine API arbeiten kannst, sind 2.5, 2.6 und 2.7 auf diesem Weg verfügbar. Wähle 2.7 nicht in Erwartung eines Downloads, den es nicht gibt.
Welches Wan solltest du tatsächlich verwenden?
Die Familie lässt sich klar aufteilen, sobald du aufhörst, "neueste" mit "am besten für dich geeignet" gleichzusetzen.
| Version | Zugriff | Auflösung / Länge | Besonderheit | Wähle es, wenn |
|---|---|---|---|---|
| Offene Gewichte (Apache 2.0) | 720p, ~5 s | MoE, läuft auf einer 4090 | Du musst selbst hosten oder feinabstimmen | |
| Nur API | 1080p, ~10 s | Natives Audio | Du möchtest Audio ohne eigenes Hosting | |
| Nur API | 1080p, bis zu 15 s | Mehrere Einstellungen, Charakteridentität | Du benötigst längere Clips mit mehreren Einstellungen | |
| Nur API | 720p/1080p, 2–15 s | Thinking Mode, erstes/letztes Einzelbild, Bild + Video | Du möchtest Planung und Referenzsteuerung per API |
So verwendest du heute ein Wan-Modell über eine API
Klartext: Wenn du dies auf GPT Proto liest, beachte, dass 2.7 selbst nicht im Katalog enthalten ist — der nächstgelegene gehostete Verwandte mit demselben Profil (1080p, mehrere Einstellungen, natives Audio) ist
Wan 2.6, für 0,45 $ pro Ausführung. Hier ist eine Anfrage, die tatsächlich funktioniert.
Vor dem Einfügen solltest du einige Stolperfallen kennen, denn sie haben bereits viele Menschen Zeit gekostet. Erstens verwendet die Authentifizierung einBearer-Token — diese Wan-Endpunkte liegen unter dem Pfad /api/v3/alibaba/ und erwarten Authorization: Bearer $KEY, keinen reinen Schlüssel. Zweitens führt die Website-URL das Modell unter /qwen/, während der API-Pfad alibaba verwendet — ein anderes Segment, aber dasselbe Modell. Drittens handelt es sich um einen asynchronen Aufruf in zwei Schritten: Du sendest einen POST zum Absenden und erhältst eine ID zurück, anschließend rufst du den Ergebnisendpunkt per GET ab. Viertens unterscheiden sich die Parameter zwischen den Modellen — 2.6 verwendet audio und shot_type, während 2.2-plus und 2.5 enable_prompt_expansion verwenden und nicht.
# 1. Job absenden
curl --request POST "https://gptproto.com/api/v3/alibaba/wan-2.6/text-to-video" \
--header "Authorization: Bearer $GPTPROTO_API_KEY" \
--header "Content-Type: application/json" \
--data '{
"prompt": "A first-person POV gliding through a damp stone tunnel toward a bright exit. [0-3s] fast forward motion, light at the end growing. [3-5s] emerge into a sunlit forest, a waterfall on the right. Sound: heavy breathing, then birdsong.",
"negative_prompt": "",
"size": "1920*1080",
"duration": 5,
"prompt_extend": true,
"audio": "",
"shot_type": "",
"seed": 1
}'
# -> returns a prediction id
# 2. Poll for the result
curl --request GET "https://gptproto.com/api/v3/predictions/$RESULT_ID/result" \
--header "Authorization: Bearer $GPTPROTO_API_KEY"
Derselbe Ablauf in Python, einschließlich der ausgeschriebenen Polling-Schleife:
import os, time, requests
KEY = os.environ["GPTPROTO_API_KEY"]
HEADERS = {"Authorization": f"Bearer {KEY}", "Content-Type": "application/json"}
BASE = "https://gptproto.com/api/v3"
payload = {
"prompt": (
"A first-person POV gliding through a damp stone tunnel toward a bright exit. "
"[0-3s] fast forward motion, light at the end growing. "
"[3-5s] emerge into a sunlit forest, a waterfall on the right. "
"Sound: heavy breathing, then birdsong."
),
"negative_prompt": "",
"size": "1920*1080",
"duration": 5,
"prompt_extend": True,
"audio": "",
"shot_type": "",
"seed": 1,
}
submit = requests.post(f"{BASE}/alibaba/wan-2.6/text-to-video",
headers=HEADERS, json=payload).json()
result_id = submit["id"]
while True:
r = requests.get(f"{BASE}/predictions/{result_id}/result", headers=HEADERS).json()
if r.get("status") in ("succeeded", "failed"):
print(r)
break
time.sleep(5)
Die Abrechnung richtet sich nach der Konfiguration und nicht nach einem pauschalen Preis pro Clip — Auflösung, Dauer und Audio verändern den Betrag. Deshalb liegt die Vorschau für 1080p/10 s über dem Basispreis von 0,45 $. Jedes gehostete Wan-Modell zeigt seinen aktuellen Preis auf der jeweiligen Modellseite an. Alle teilen sich ein Guthaben mit dem übrigen Katalog, sodass du keine separaten Konten benötigst, um 2.5 mit 2.6 zu vergleichen.
Prompting für den Thinking Mode
Da 2.7 vor dem Rendern plant, funktionieren Prompts am besten, wenn sie weniger wie eine Ansammlung von Schlüsselwörtern und mehr wie ein Briefing formuliert sind. Gib dem Modell Absicht und Struktur. Ein mit Zeitstempeln versehenes Ablaufskript — [0-3s] … [3-5s] … — gibt der Planungsphase etwas Konkretes, woran sie sich orientieren kann. Genau dieses Muster verwendet auch der obige funktionierende Code. Audio ist Teil desselben Prompts: Ein kurzer Sound:-Hinweis ("heavy breathing, then birdsong") steuert die native Audiospur, ohne dass ein separater Aufruf nötig ist. Verwende außerdem negative_prompt, um den Fehler einzugrenzen, den du tatsächlich erwartest — etwa "no glowing plants, no warped hands" — statt das Feld leer zu lassen. Nichts davon ist außergewöhnlich; du schreibst einfach für ein Modell, das das gesamte Briefing liest, bevor es beginnt.
Wer es verwenden sollte — und wer nicht
Wenn du offene Gewichte benötigst — für eigenes Hosting, Feinabstimmung oder Daten, die innerhalb deiner Infrastruktur bleiben müssen — ist Wan 2.7 heute die falsche Wahl und Wan 2.2 die richtige. Wenn du steuerbare Bild- und Videogenerierung über eine API möchtest und mit einem geschlossenen Modell sowie langsameren Renderings leben kannst, ist 2.7 eine vernünftige Option. Dabei solltest du ehrlich berücksichtigen, dass der behauptete Qualitätsvorsprung bislang eine Aussage Alibabas und keine gemessene Tatsache ist. Wenn du mit einem begrenzten Budget prototypisierst, bringen dich die günstigeren gehosteten Wan-Tarife für wenige Cent pro Ausführung in Bewegung, bevor du dich festlegst. Stimme das Modell auf deine Einschränkung ab, nicht auf die Versionsnummer.
Creative Studio
Erstelle Bilder, Videos und mehr mit APIs für den Produktionseinsatz.
Mit dem Erstellen beginnen
FAQ
Ist Wan 2.7 Open Source?
Wann wurde Wan 2.7 veröffentlicht?
Ist Wan 2.7 ein Bild- oder ein Videomodell?
Wan 2.7 vs. Wan 2.2 – was ist der Unterschied?
Ist Wan 2.7 besser als andere Videomodelle?
Kann ich Wan 2.7 lokal ausführen?
Wie viel kostet die Nutzung über eine API?
Verwandte Artikel
Weitere Blogbeiträge
wan.2.2: Der Standard für generative Videos
Kurzfassung Das wan.2.2-Modell stellt visuelle Integrität und eine strikte Befolgung von Prompts über eine hohe Generierungsgeschwindigkeit. Es benötigt leistungsfähige Hardware, belohnt Kreative jedoch mit zuverlässigen, artefaktfreien KI-Videoausgaben. Generative Videomodelle priorisieren häufig Geschwindigkeit auf Kosten der visuellen Kohärenz. Du gibst eine detaillierte Szenenbeschreibung ein, wartest einige Minuten und erhältst einen Clip voller verzerrter Gesichter und unnatürlicher Bewegungen. Die Entwickler hinter wan.2.2 verfolgten einen anderen Ansatz. Sie entwickelten ein System, das die ästhetischen Details deines Ausgangsmaterials respektiert und Bewegungsvektoren sorgfältig berechnet, um Pixelverschiebungen zu verhindern. Die native Ausführung dieser Architektur erfordert erhebliche Rechenleistung. Du benötigst eine High-End-GPU, um die Parameter effizient zu verarbeiten. Deshalb lagern viele Profis die rechenintensiven Aufgaben an leistungsfähige APIs aus. Indem du dich von den Grenzen lokaler Hardware löst, kannst du Tools wie ComfyUI, SVI Pro und PainterI2V integrieren, damit sich das Modell genau so verhält, wie du es dir vorstellst. Für filmreife Ergebnisse musst du über die anfängliche Begrenzung auf fünf Sekunden hinausblicken. Durch das Aneinanderreihen von Clips und die Nutzung nativer Frame-Interpolation kannst du zusammenhängende, hochauflösende Sequenzen erstellen, die tatsächlich zu deinen ursprünglichen Text-Prompts passen.
Schuyler Stacy | 2026-03-02

Wan 2.5: Die Zukunft der 4K-KI-Videogenerierung
Die Videoproduktion durchläuft einen gewaltigen Wandel, und Wan 2.5 steht im Epizentrum dieser Transformation. Da die Nachfrage nach hochwertigen visuellen Inhalten explodiert, benötigen Kreative Werkzeuge, die filmische Ergebnisse ohne Hollywood-Budgets liefern. Wan 2.5 beantwortet diesen Aufruf, indem es fortschrittliche KI nutzt, um Text und Bilder in atemberaubende 4K-Videosequenzen zu verwandeln. Entwickelt, um die Einschränkungen früherer Generationen zu überwinden, bietet dieses Modell realistische Bewegung, längere Clip-Dauern und Flexibilität im Dual-Mode. In diesem umfassenden Testbericht gehen wir der Frage nach, wie Wan 2.5 die Landschaft der KI-Videogenerierung neu definiert.
Michael Johnson | 2026-03-02

WAN 2.5-Leitfaden: Ein umfassender Einblick in das neueste KI-Videomodell und seine Funktionen
Kurz gesagt : WAN 2.5 stellt einen bedeutenden Wendepunkt in der KI-Videolandschaft dar, da es professionelle 1080p-Funktionen mit einem erschwinglichen Preis kombiniert und damit große Wettbewerber wie Sora herausfordert. Das Aufkommen von WAN 2.5 hat eine intensive Debatte über die Zukunft der Open-Source-Entwicklung im Vergleich zur Skalierung geschlossener Systeme ausgelöst. Während der Abschied von offenen Gewichten einige Entwickler frustriert hat, bleibt das Modell ein leistungsstarkes Werkzeug für Kreative, die eine konsistente Bewegung und eine hochwertige Videosynthese suchen. Technisch bietet WAN 2.5 eine beeindruckende Synchronisierung von Audio und Bild sowie eine fortschrittliche Keyframe-Unterstützung, die Regisseuren mehr Kontrolle gibt. Durch die Integration dieser Funktionen in einen kosteneffizienten Workflow positioniert es sich als praktische Lösung für die modernen Marketing- und Gaming-Branchen.
Tiffany Layne | 2026-03-17

Wan Video: Open-Source-Videogenerierung meistern
Kurz gesagt Der Markt für generative künstliche Intelligenz zwingt Kreative normalerweise in teure, proprietäre Abonnements, um Zugang zu erstklassigen Funktionen zu erhalten. Alibabas wan video durchbricht diesen Kreislauf, indem es ein Open-Source-Modell bietet, das flüssige Text-zu-Video- und Bild-zu-Video-Sequenzen erzeugen kann. Du musst nicht mehr raten, was in der algorithmischen Blackbox vor sich geht. Da die Gewichte öffentlich verfügbar sind, können Entwickler und digitale Künstler die Software auf handelsüblichen Grafikkarten ausführen oder sie über leistungsstarke API-Pipelines skalieren. Dieses Maß an Zugang senkt die Einstiegshürde für filmisches Storytelling drastisch. Gute Ergebnisse erfordern dennoch technisches Geschick. Der Erfolg hängt stark davon ab, wie du deine Prompts strukturierst, Kamerabewegungen beschreibst und Hardwarebeschränkungen handhabst, um die zeitliche Konsistenz über jedes Bild hinweg zu wahren.
Schuyler Stacy | 2026-03-17