Zuerst: Was bedeutet „Bewegungen kopieren“ eigentlich?
Die meisten Vergleiche vermischen zwei Fähigkeiten, die zwar ähnlich wirken, sich aber völlig unterschiedlich verhalten.
Die erste ist die Bewegungssynthese: Du beschreibst eine Handlung in Worten, und das Modell erfindet die Physik – Gelenkwinkel, Gewichtsverlagerung und Bewegungsfortsetzung. Genau hier sind KI-Videos in der Vergangenheit häufig gescheitert. Schnelle menschliche Bewegungen sind besonders schwer zu fälschen, weil dein Auge darauf trainiert ist. Ein leicht falsch dargestellter Ellbogen wirkt sofort „falsch“, selbst für Nichtfachleute. Wenn Menschen sagen, ein Clip sehe nach „KI“ aus, liegt das meist an einer fehlerhaften menschlichen Bewegung.
Die zweite ist die Bewegungsübertragung: Du gibst dem Modell eine Referenz – ein Bild, einen Clip, manchmal auch eine Stimme – und bittest es, genau diese Bewegung oder Identität in eine neue Generierung zu übertragen. Das Modell erfindet hier keine Bewegung, sondern kopiert sie und passt sie an. Anderes Problem, andere Architektur, anderer Sieger.
Wenn du diese beiden Aspekte getrennt hältst, wird der gesamte Vergleich deutlich klarer. Kling 3.0 wurde darauf ausgelegt, beim ersten Bereich stark zu sein. Seedance 2.0 wurde darauf ausgelegt, beim zweiten stark zu sein. Alles Weitere folgt daraus.
Spezifikationen im direkten Vergleich
Beide Modelle wurden Anfang 2026 innerhalb weniger Tage voneinander veröffentlicht und sind wirklich leistungsfähig. Daher liegen die Spezifikationen näher beieinander, als das Marketing vermuten lässt.
| |
Kling 3.0 |
Seedance 2.0 |
| Lab |
Kuaishou |
ByteDance (Dreamina / Doubao / CapCut) |
| Veröffentlichung |
5. Februar 2026 (Kuaishou) |
Februar 2026; CapCut-Rollout am 26. März (TechCrunch) |
| Maximale Auflösung |
Natives 4K, 3840×2160 (Kuaishou) |
1080p zum Start, später 4K hinzugefügt (BytePlus) |
| Bildrate |
Bis zu 60 fps (Kuaishou) |
Offiziell nicht angegeben |
| Maximale Dauer |
15 s (Kuaishou) |
15 s, sechs Seitenverhältnisse (TechCrunch) |
| Mehrere Einstellungen |
Bis zu 6 Einstellungen in einem Clip, im Stil einer Regieanweisung (Kuaishou) |
Sequenzaufbau über mehrere Referenzeingaben |
| Natives Audio |
Musik, SFX und Lippensynchronisation in 5 Sprachen (Kuaishou) |
Native Dialoge, SFX und Musik (BytePlus) |
| Referenzeingaben |
Text / Bild / Video / Audio (MVL-Architektur) |
Bilder, Videoclips und Audio in einem Durchgang zusammengeführt (BytePlus) |
| Verfügbarkeit in den USA |
Verfügbar |
Beim Rollout nicht in den USA verfügbar (Urheberrechtsprüfung) (TechCrunch) |
Noch eine Anmerkung zur Zeile mit der Auflösung, bevor ihr zu viel Gewicht darauf legt: Klings natives 4K bei 60 fps ist auf dem Papier die höhere Zahl, und Kuaishou stellt klar, dass es gerendert und nicht hochskaliert wird. Aber fast niemand, der kurze Social-Media- oder Werbeclips erstellt, braucht 4K/60 – du bezahlst Renderzeit und Geld für Pixel, die durch die Komprimierung der Plattform ohnehin stark reduziert werden. Betrachte 4K als praktisches Extra für seltene Broadcast- oder Großbildschirm-Projekte, nicht als entscheidenden Faktor dieses Vergleichs.
Runde 1: Menschliche Bewegungen aus einem Prompt generieren – Kling 3.0
Das ist Klings Kernkompetenz und der Grund, warum sich die Frage nach menschlichen Bewegungen überhaupt lohnt.
Kuaishou hat Kling 3.0 auf einer sogenannten Multi-modal Visual Language (MVL)-Architektur neu aufgebaut, die Text, Bild, Audio und Video in einem System verarbeitet, anstatt separate Tools zusammenzufügen. Die Behauptung, die für mich relevant ist – und es handelt sich um eine Aussage des Anbieters, die du entsprechend einordnen solltest –, lautet, dass das Modell die menschliche Anatomie auch bei schnellen, komplexen Bewegungen zusammenhält. Die wiederkehrende Einschätzung unabhängiger Praxistests bestätigt dies: Komplexe Handlungen wie Tanzen, Laufen und Kampfsport weisen deutlich seltener die Fehler mit sich verformenden Gliedmaßen und zusätzlichen Fingern auf, die genau dieses Szenario plagen.
Meine Einschätzung, bei der ich den Konsens der Tester eher als Hinweis denn als unumstößliche Wahrheit betrachte: Wenn dein Prompt lautet „Eine Tänzerin macht eine vollständige Drehung und landet“, ist Kling wahrscheinlich die sicherere Wahl für eine saubere Aufnahme nach den ersten Versuchen. Das Modell folgt Anweisungen außerdem sehr genau – Kamerabewegungen, Beleuchtung und Bildschirmtext –, sodass das Ergebnis vor der Verwendung weniger Nachbearbeitung benötigt.
Der Preis für diese Kontrolle? Kling ist wörtlicher. Gib ihm einen lockeren, ambitionierten „Überrasche mich“-Prompt mit einer chaotischen Szene, bleibt es eher bei der wörtlichen Anweisung als bei der Stimmung, die du eigentlich erreichen wolltest. Es belohnt Regieanweisungen und bestraft vage Prompts mit flachen Ergebnissen.
Runde 2: Bewegungen aus einer Referenz kopieren – Seedance 2.0
Drehen wir die Aufgabe nun um. Du beschreibst die Bewegung nicht in Worten, sondern hast einen Clip mit genau der gewünschten Bewegung und musst sie übertragen.
Das entscheidende Merkmal von Seedance 2.0 ist die multimodale Referenzfusion. ByteDance beschreibt es so, dass Bilder, Videos und Audio als Referenzen in einer einzigen Generierung kombiniert werden können, ergänzt durch Bearbeitung an Ort und Stelle und Videoverlängerung. TechCrunch liefert den konkreten Aspekt: Du kannst eine Generierung nicht nur von einem Standbild, sondern auch von einem Referenzvideo aus steuern, und das Modell rendert daraus realistische Texturen, Bewegungen und Beleuchtung. Einfach gesagt: Wenn die Aufgabe lautet „Passe diese Darbietung an“, ist dies das Tool, das genau dafür entwickelt wurde. Kling kann ein Bild animieren, bietet aber nicht dieselbe Tiefe bei der Anweisung „Fixiere diese Referenz und halte dich daran“. Auf GPT Proto ist der referenzgesteuerte Generierungsmodus ausdrücklich als Seedance-exklusive Funktion dokumentiert – Kling stellt promptgesteuerte Modi bereit, nicht denselben Referenzfusionspfad.
Dieses referenzgesteuerte Design ist auch der Grund, warum Seedance in der unabhängigen Rangliste vorne liegt. Die Artificial-Analysis-Videoarena, die Modelle anhand blinder menschlicher Abstimmungen über identische Prompts bewertet, setzt Dreamina Seedance 2.0 Mitte 2026 bei Text-zu-Video mit Audio auf Platz 1 (Elo etwa 1.219) und bei Bild-zu-Video ebenfalls auf Platz 1 (etwa 1.344) – vor Kling 3.0 Pro, das im Text-zu-Video-mit-Audio-Ranking bei etwa 1.105 liegt. Bei der Qualität der bevorzugten Ergebnisse liegt Seedance somit messbar vorn.
Zwei ehrliche Einschränkungen, denn diese Rangliste erzählt nicht die ganze Geschichte. Erstens: Wenn du Audio deaktivierst, verändert sich die Rangliste deutlich – Seedance fällt auf etwa Platz 4 und Kling auf Platz 5 hinter völlig anderen Modellen zurück. Das zeigt, dass ein Teil von Seedances Vorsprung darauf beruht, dass die Nutzer den integrierten Ton bevorzugen, und nicht ausschließlich auf der visuellen Qualität. Zweitens – und das ist für API-Entwickler besonders wichtig: Seedance war beim Rollout in den USA nicht verfügbar. ByteDance pausierte die breitere Verteilung aufgrund von Urheberrechtsstreitigkeiten mit Hollywood-Studios und baute Schutzmechanismen ein – das Modell generiert nicht aus echten Gesichtern und bettet ein unsichtbares Wasserzeichen ein. Wenn dein Produkt direkt im Consumer-Web für US-Nutzer verfügbar ist, stellt diese Verfügbarkeitslücke eine echte Planungsbeschränkung dar, keine Fußnote.
Runde 3: Emotionen und Mikroausdrücke
Bei der Variante dieser Frage, die mir am häufigsten gestellt wird, geht es eigentlich um Gesichter: Kann das Modell ein glaubwürdiges Lächeln erzeugen, das auch die Augen erreicht, einen kurzen Anflug von Zweifel oder ein echtes Lachen? Hier muss ich die Beweislage klar benennen: Kein Lab veröffentlicht einen Benchmark für „Gesichtsemotionen“, und Artificial Analysis misst die allgemeine Präferenz, nicht speziell Mikroausdrücke. Dieser Abschnitt ist daher eine Einschätzung, die als solche gekennzeichnet ist.
Was ich fundiert sagen kann: Seedances Vorsprung in Blindtests zeigt sich vor allem bei glaubwürdigen kleinen menschlichen Verhaltensweisen – genau der subtilen Nahaufnahme-Realität, die emotionale Szenen trägt. Klings Stärke liegt am entgegengesetzten Ende: Große, körperliche Ganzkörperbewegungen bleiben kohärent. Für eine enge Nahaufnahme, bei der die gesamte Aufnahme vom Gesichtsausdruck abhängt, würde ich zuerst Seedance testen. Für einen emotionalen Moment, der durch Körpersprache über einen ganzen Raum hinweg vermittelt wird, verkauft Kling die Bewegungskohärenz meist besser. Wenn die Gesichtsperformance für deinen Anwendungsfall entscheidend ist, vertraue weder uns noch anderen blind – generiere dieselbe Aufnahme mit beiden Modellen und urteile selbst. Die APIs machen das kostengünstig möglich, und genau darum geht es im nächsten Abschnitt.
Teste beide selbst: der Code
Beide Modelle laufen auf GPT Proto über denselben Endpunkt. Dadurch kannst du exakt dieselbe Aufgabe im A/B-Test vergleichen, ohne zwei Anbieter, zwei Schlüssel oder zwei Abrechnungskonten verwalten zu müssen. Die Videogenerierung ist asynchron: Du sendest eine Anfrage per POST, erhältst eine id zurück und fragst anschließend das Ergebnis regelmäßig ab.
Hier generiert Kling 3.0 menschliche Bewegungen aus einem Text-Prompt – seine Stärke:
import requests, time
BASE = "https://gptproto.com/api/v3"
HEADERS = {"Authorization": "GPTPROTO_API_KEY", "Content-Type": "application/json"}
def generate(path, payload):
r = requests.post(f"{BASE}/{path}", headers=HEADERS, json=payload)
r.raise_for_status()
job = r.json()["data"]
get_url = job["urls"]["get"] # e.g. https://gptproto.com/api/v3/predictions/{id}/result
# poll until the job leaves the queued/running state
while True:
res = requests.get(get_url, headers=HEADERS).json()["data"]
status = res["status"]
if status in ("succeeded", "failed", "expired"):
return res
time.sleep(5)
kling = generate(
"kling/kling-v3.0-std/text-to-video",
{
"prompt": "A martial artist performs a fast spinning kick, "
"full body in frame, weight shifting naturally on landing.",
"aspect_ratio": "16:9",
"duration": 5,
"resolution": "1080p",
"generate_audio": True,
"seed": -1,
},
)
print(kling["status"], kling.get("outputs"))
Und hier ist Seedance 2.0 in seinem Referenz-zu-Video-Modus, der die Bewegung aus einem Referenzclip auf eine neue Figur überträgt – genau die Aufgabe, die das Modell besonders gut beherrscht. Derselbe Helfer, aber ein anderer Pfad und Payload:
# reference-to-video: `videos` carries the motion to copy, `images` the character
seedance = generate(
"bytedance/dreamina-seedance-2-0-260128/reference-to-video",
{
"prompt": "The character performs the exact routine from the reference video, "
"matching timing and body movement, new studio background.",
"videos": ["https://your-cdn.com/motion-reference.mp4"], # motion to replicate
"images": ["https://your-cdn.com/character.png"], # up to 10 references
"aspect_ratio": "9:16",
"duration": 5,
"resolution": "1080p",
"generate_audio": True,
"seed": -1,
},
)
print(seedance["status"], seedance.get("outputs"))
Wenn du für einen schnellen Funktionstest lieber cURL verwendest:
curl --location 'https://gptproto.com/api/v3/kling/kling-v3.0-std/text-to-video' \
--header 'Authorization: GPTPROTO_API_KEY' \
--header 'Content-Type: application/json' \
--data '{
"prompt": "A dancer completes a full spin and lands cleanly.",
"aspect_ratio": "16:9",
"duration": 5,
"resolution": "1080p"
}'
Ersetze GPTPROTO_API_KEY durch deinen echten Schlüssel. Seedances Referenz-zu-Video-Modus verwendet Arrays – videos, images (bis zu 10) und audios –, sodass du einen Bewegungsclip, eine Figur und eine Stimme in einem Aufruf festlegen kannst. Laut der GPT Proto-Dokumentation ist dieser Referenzmodus hier eine Seedance-exklusive Funktion, was der praktische Grund dafür ist, dass das Modell Bewegungen besonders gut kopiert. Kling deckt die Generierung aus Prompts über seine Standard- und Motion-Control-Modi ab. Die Parameterunterstützung variiert je nach Modell. Prüfe daher vor einem produktiven Lauf die genauen Felder auf der jeweiligen Modellseite. Entscheidend ist, dass Endpunktstruktur, Authentifizierung und Abfrage-Schleife identisch sind. Das Testen derselben Aufgabe mit beiden Modellen erfordert also nur eine kleine Änderung.
Welches Modell solltest du also wählen?
- Du möchtest menschliche Aktionen aus Text generieren – Tanz, Sport, Kampfchoreografie, alles, was den ganzen Körper und schnelle Bewegungen umfasst: Kling 3.0. Formuliere den Prompt wie eine Regieanweisung, und das Modell belohnt dich dafür.
- Du musst eine bestimmte Darbietung kopieren und von einem Referenzclip auf eine neue Figur oder Szene übertragen: Seedance 2.0. Die Referenzfusion wurde genau dafür entwickelt, und die Arena mit Blindabstimmungen bestätigt die Qualität der Ergebnisse.
- Deine Aufnahme steht oder fällt mit einem Gesichtsausdruck in Nahaufnahme: Beginne mit Seedance 2.0, aber generiere beide Varianten und urteile selbst – dies ist die eine Dimension, die ich nicht anhand eines Datenblatts entscheiden würde.
- Du benötigst 4K/60 für Broadcast oder Großbildschirm: Kling 3.0 ist heute das einzige Modell mit nativem 4K bei 60 fps.
- Du veröffentlichst für US-Nutzer im offenen Web und benötigst eine uneingeschränkte Verfügbarkeit: Berücksichtige, dass Seedance beim Rollout aus urheberrechtlichen Gründen eingeschränkt war – der Zugriff über eine API-Plattform ist der praktische Weg, sollte aber für deinen konkreten Fall bestätigt werden.
Beide sind derzeit über ein einziges Konto verfügbar: Kling 3.0 und Seedance 2.0. Sieh dir die vollständige Übersicht der Videomodelle an, wenn du sie auch mit Veo oder Hailuo vergleichen möchtest. Auf der Preisseite findest du die aktuellen Kosten pro Generierung.