Am 3. Dezember 2025 veröffentlichte Kuaishous KI-Videoplattform Kling die Version 2.6. Damit setzte das Unternehmen nur zwei Tage nach dem Start von Kling O1 am 1. Dezember einen weiteren Meilenstein. Diese schnelle Abfolge zeigt, wie aggressiv Kuaishou die KI-gestützte Videogenerierung vorantreibt. Während Kling O1 als einheitliches multimodales Erstellungstool positioniert wurde, konzentriert sich Kling 2.6 auf die synchronisierte audiovisuelle Generierung. Kreative können damit vollständige Videos mit Bild, Dialogen, Soundeffekten und Umgebungsgeräuschen in einem einzigen Prozess erstellen.

Die Veröffentlichung löst eines der größten Probleme bei der KI-Videogenerierung: das aufwendige Hinzufügen von Audio nach der Erstellung der Bilder. Herkömmliche Workflows erfordern zunächst die Erstellung stummer Videos. Anschließend müssen Sprecherstimmen, Soundeffekte und Hintergrundgeräusche separat und oft über Stunden hinweg ergänzt werden. Kling 2.6 erzeugt all diese Elemente gleichzeitig.
Die wichtigsten Punkte dieses Artikels:
-
Die wichtigsten Unterschiede zwischen Kling 2.6 und Kling O1
-
Die Unterschiede von Kling 2.6 zu früheren KI-Videomodellen
-
Fünf Audiofunktionen, die die Inhaltserstellung verändern
-
Detaillierte Beispiele mit Prompts für verschiedene Anwendungsfälle
-
Vergleich mit konkurrierenden Plattformen wie Veo und Sora
-
Wie GPT Proto künftig Zugang zu Kling 2.6 bereitstellen wird
-
Praktische Fragen zu Implementierung und Preisen
Was ist Kling 2.6?
Entwicklung früherer Versionen
Die Kling-Modellfamilie hat sich seit Anfang 2023 rasant weiterentwickelt. Jede Version adressierte konkrete Anforderungen von Kreativen und erweiterte die Funktionen, während die filmische Qualität erhalten blieb.

Versionshistorie:
| Version |
Veröffentlichungsdatum |
Wichtige Funktionen |
Dauer |
Auflösung |
| Ursprüngliches Kling |
Anfang 2023 |
Grundlegende Text-zu-Video-Generierung |
3–5 Sekunden |
720p |
| Kling 2.0 |
Mitte 2023 |
Bild-zu-Video, Stilanpassung |
8 Sekunden |
1080p |
| Kling 2.3 |
Ende 2023 |
Verbesserte Physik, Videoerweiterung |
8 Sekunden |
1080p |
| Kling 2.5 |
Anfang 2024 |
Lippensynchronisation, Szenenkohärenz |
10 Sekunden |
1080p |
| Kling O1 |
1. Dez. 2025 |
Einheitliche multimodale Erstellungsplattform |
Variiert |
1080p+ |
| Kling 2.6 |
3. Dez. 2025 |
Synchronisierte audiovisuelle Generierung |
10 Sekunden |
1080p |
Der Durchbruch: synchronisierte audiovisuelle Generierung
Kling 2.6 stellt einen grundlegenden Wandel dar, da Audio und Bild als integrierte statt als getrennte Komponenten behandelt werden. Das Modell erzeugt beides gleichzeitig und gewährleistet dadurch eine natürliche Synchronisation, die in der Nachbearbeitung nur schwer zu erreichen ist.
Die technische Leistung beruht darauf, sowohl zu verstehen, was zu sehen als auch was zu hören sein soll, und beides harmonisch zu erzeugen. Wenn ein Glas zerbricht, ertönt das Klirren exakt im Moment des Aufpralls. Wenn Figuren sprechen, stimmen die Lippenbewegungen mit den erzeugten Phonemen überein. Wenn Regen fällt, entspricht die Intensität der Umgebungsgeräusche der sichtbaren Regendichte.

Zentrale Funktionen und Merkmale von Kling 2.6
Zwei Generierungsmodi:
-
Text-zu-Audio-Video: Natürliche Sprachbeschreibungen eingeben, um vollständige Videos mit passendem Audio zu erzeugen
-
Bild-zu-Audio-Video: Statische Bilder mit passenden Geräuschen animieren und Fotos in dynamische Szenen verwandeln
Fünf Arten von Audioszenarien:
-
Dialog mit einer Person: Produktdemonstrationen, Storytelling und Nachrichtenberichte mit natürlicher Präsentation vor der Kamera
-
Voiceover-Narration: Sportberichterstattung, Dokumentationen und Produkterklärungen mit Ton außerhalb des Bildes
-
Gespräche mit mehreren Personen: Zwei oder mehr Figuren mit natürlichem Sprecherwechsel für Interviews und dramatische Szenen
-
Musikalische Darbietungen: Rap, Gesang und Gruppengesang mit rhythmussynchronisierten Kamerabewegungen
-
Kreative Szenarien: ASMR- und Spezialeffektinhalte mit präziser Klangerzeugung
Technische Spezifikationen:
-
Sprachunterstützung: Nur Chinesisch und Englisch (andere Sprachen werden automatisch ins Englische übersetzt)
-
Dauerbereich: 5–10 Sekunden (10 Sekunden werden für Dialoge empfohlen)
-
Kamerasteuerung: Unterstützt anspruchsvolle Bewegungen wie Dolly-Zooms, Tracking-Aufnahmen und schnelle Bögen
-
Lippensynchronisationsgenauigkeit: Hohe Präzision bei standardmäßiger Aussprache
Stärken und Einschränkungen von Kling 2.6
Vorteile:
-
Vollständiger Wegfall des Audio-Postproduktions-Workflows
-
Natürliche Lippensynchronisation als Teil der Videogenerierung
-
Filmische Kamerasteuerung aus früheren Versionen bleibt erhalten
-
Hohe Prompt-Treue für Bild- und Audioelemente
-
Deutlich verkürzte Produktionszeit
-
Niedrigere Einstiegshürde für Kreative ohne Erfahrung in der Audiobearbeitung
Aktuelle Einschränkungen:
-
Maximal 10 Sekunden Dauer; für längere Inhalte ist eine Erweiterung erforderlich
-
Sprachunterstützung auf Chinesisch und Englisch beschränkt
-
Audioqualität variiert je nach Klarheit des Akzents
-
Höherer Credit-Verbrauch bei detaillierten Prompts
Kling 2.6 vs. Kling O1: Die Unterschiede verstehen
Zwei Modelle, zwei unterschiedliche Ansätze
Kling O1 und Kling 2.6 wurden nur zwei Tage voneinander entfernt veröffentlicht und erfüllen trotz ihres jeweils hochmodernen Entwicklungsstands unterschiedliche Anforderungen von Kreativen. Wer ihre Unterschiede versteht, kann für jedes Projekt das passende Tool auswählen.
Kling O1 konzentriert sich auf eine einheitliche multimodale Erstellungsplattform, die mehrere Möglichkeiten zur Inhaltsgenerierung in einem umfassenden System vereint. Der Schwerpunkt liegt auf Vielseitigkeit und Workflow-Integration über verschiedene Inhaltstypen hinweg. Damit positioniert sich das Modell als All-in-one-Kreativsuite für professionelle Produktionspipelines.
Kling 2.6 ist speziell auf die synchronisierte audiovisuelle Videogenerierung ausgerichtet. Das Modell perfektioniert die Erstellung vollständiger Videos, bei denen Ton und Bild von Anfang an gemeinsam erzeugt werden. Es setzt auf Tiefe statt Breite und konzentriert sich darauf, die Videoproduktion mit nativem Audio so nahtlos wie möglich zu gestalten.
Vergleich der wichtigsten Unterschiede
| Aspekt |
Kling O1 |
Kling 2.6 |
| Hauptfokus |
Einheitliche multimodale Plattform |
Spezialisierte audiovisuelle Videogenerierung |
| Kernstärke |
Integration über verschiedene Inhaltstypen hinweg |
Native synchronisierte Audiogenerierung |
| Audiofunktionen |
Multimodale Audiowerkzeuge |
Fünf spezialisierte Audioszenarien |
| Idealer Anwendungsfall |
Komplexe Produktionen mit mehreren Phasen |
Schnelle Erstellung vollständiger Videos |
| Workflow-Design |
Integration in professionelle Pipelines |
Generierung des fertigen Outputs in einem Schritt |
| Zielgruppe |
Professionelle Studios und Agenturen |
Content-Kreative und Produzenten von Kurzvideos |
| Generierungsphilosophie |
Modularer multimodaler Ansatz |
Einheitliche audiovisuelle Synthese |
Welches Modell sollten Sie wählen?
Wählen Sie Kling O1, wenn Sie Folgendes benötigen:
-
Integrierte Workflows über mehrere Inhaltsformate hinweg
-
Kompatibilität mit professionellen Produktionspipelines
-
Flexibilität bei der getrennten Arbeit mit verschiedenen Modalitäten
-
Komplexes Projektmanagement über mehrere Phasen
Wählen Sie Kling 2.6, wenn Sie Folgendes benötigen:
-
Schnelle Umsetzung vom Konzept zum fertigen Video
-
Native audiovisuelle Synchronisation
-
Kurzvideos für soziale Medien
-
Vereinfachter Workflow ohne Audio-Nachbearbeitung
Beide Modelle spiegeln Kuaishous Strategie wider, unterschiedliche Segmente des Creator-Marktes zu bedienen: O1 richtet sich an professionelle Produktionen, während 2.6 auf eine zugängliche und effiziente Videoproduktion ausgerichtet ist.
Praktische Beispiele und Prompts für Kling 2.6
Beispiel 1: Rap-Auftritt mit hoher Intensität
Rap stellt aufgrund der schnellen Sprache und komplexen Rhythmen besondere Herausforderungen dar. Frühere Modelle hatten Schwierigkeiten, Lippenbewegungen mit dem schnellen Vortrag zu synchronisieren.
Prompt-Konzept: Straßenszene im Freien bei starkem Sonnenlicht. Eine Frau mit Sonnenbrille nähert sich selbstbewusst der Kamera, gestikuliert rhythmisch nach oben und klopft für den Beat mit den Knöcheln. Freestyle-Bewegungen. Die Kamera erzeugt beim Näherkommen eine leichte Unschärfe und schnelle Schnitte zwischen verschiedenen Winkeln. Der Ton enthält kräftige Schlagzeugbeats und tiefe Bässe. Die Figur rappt: "Geh zurück, ich bin das Feuer, das du nicht leugnen kannst. Die Hitze steigt, ich brenne heller als der ganze Himmel."
Ergebnis: Trotz des schnellen Dialogs, komplexer Kamerabewegungen und gleichzeitig stattfindender dynamischer Gesten bleibt die Synchronisation erfolgreich erhalten.
Beispiel 2: Auftritt eines anthropomorphen Tiers
Sprechende Tiere wirken aufgrund mechanischer Mundbewegungen häufig unheimlich. Kling 2.6 behandelt Tierfiguren mit derselben Aufmerksamkeit für Ausdruck und Timing wie menschliche Darsteller.
Prompt-Konzept: Bühne in einer cartoonartigen Tierkneipe mit warmem Licht. Ein Schwein mit rotem Halstuch, ausdrucksstarken Augen und menschlicher Persönlichkeit. Nahaufnahme, während das Schwein tief einatmet, das Kinn hebt und einen ernsten Gesichtsausdruck zeigt. Ein Vorderhuf hebt sich leicht beim Sprechen und tippt in die Luft, um Aussagen zu betonen. Das Schwein verkündet im Ton eines Bürgermeisters: "Liebe tierischen Bürgerinnen und Bürger, bitte aufpassen! Nach sorgfältiger Überlegung habe ich beschlossen, dass heute der stadtweite Feiertag gefeiert wird!"
Ergebnis: Eine natürliche Darstellung mit Persönlichkeit und emotionaler Bandbreite bei gleichzeitig glaubwürdiger audiovisueller Synchronisation.
Beispiel 3: Langer Dialog mit nuancierter Darstellung
Ein längerer Dialog prüft, ob das Modell über größere Zeiträume eine konsistente Darstellung der Figuren, eine emotionale Entwicklung und ein natürliches Tempo aufrechterhält.
Prompt-Konzept: Europäische Teeparty bei sanftem goldenem Licht. Ein adeliges Mädchen mit goldenen Locken hält elegant eine dampfende Teetasse. Die Kamera fährt langsam vom Dampf zu ihrem Gesicht. Sie neigt den Kopf, hebt eine Augenbraue und zeigt beim Sprechen mit sanftem Sarkasmus ein höfliches, aber scharfes Lächeln: "Oh Liebling, in diesem Haus trinken wir Tee mit Anmut. Wir sprechen leise, halten unsere Haltung perfekt und zeigen natürlich niemals, wirklich niemals, wie wir uns fühlen. Ist es nicht das, was uns zivilisiert macht?"
Profi-Tipp: Verwenden Sie in Dialogabschnitten Auslassungspunkte (...) und Satzzeichen. Das Modell erkennt diese Symbole und erzeugt automatisch Sprechpausen und Atemmomente, wodurch lange Dialoge wie natürliche menschliche Sprache klingen.
Beispiel 4: Konfrontation mehrerer Personen in extremer Umgebung
Dieses Szenario testet komplexe Audioebenen: heftigen Regen, Donner, emotionales Rufen mit zwei unterschiedlichen Stimmen und verständliche Sprache trotz überwältigender Umgebungsgeräusche.
Prompt-Konzept: Dunkler Waldweg bei strömendem Regen und kaltem blauem Licht. Ein durchnässter und zitternder Mann steht im Vordergrund. Hinter ihm steht eine ebenso erschütterte Frau. Die Kamera zoomt schnell auf den Mann, der heiser ruft: "Ich kann das nicht mehr ertragen! Ich breche zusammen!" Die Kamera schwenkt zur Frau, die scharf fragt: "Warum hast du es mir nicht früher gesagt?! Wie hätte ich dir helfen sollen?!" Der Ton wird von ohrenbetäubendem Regen dominiert, ohne Hintergrundmusik.
Ergebnis: Zwei unterschiedliche Stimmen werden erfolgreich voneinander unterschieden, die emotionale Intensität bleibt erhalten und der Dialog bleibt trotz der überwältigenden Umgebungsgeräusche verständlich.
Beispiel 5: E-Commerce-Produktdemonstration
Produktvideos benötigen eine klare Sprecherstimme in Kombination mit Umgebungsgeräuschen und eignen sich daher ideal für die synchronisierte Generierung ohne traditionelle Produktionskosten.
Prompt-Konzept: Eine junge Frau in Yogakleidung geht zu einem Entsafter und drückt den Einschaltknopf. Das Gerät startet, Mangostücke rotieren und werden zu einem cremigen Smoothie verarbeitet. Eine junge, energiegeladene Stimme sagt: "Guten Morgen, frischer Saft in zehn Sekunden – eine ganze tropische Obstplantage in deiner Tasche." Danach geht sie weg, während die Kamera den Entsafter fokussiert.
Ergebnis: Das Beispiel zeigt die kommerzielle Eignung für Marken, Produktdemonstrationen zu erstellen, ohne Darsteller zu engagieren oder Studios zu mieten.
Beispiel 6: Kulinarische Inhalte mit mehreren Audioebenen
Bei Food-Inhalten ist der Ton entscheidend, um den Reiz eines Gerichts zu vermitteln. Zischen, Klappern und tosende Flammen erzeugen eine sensorische Fülle, die den Zuschauern Appetit macht.
Prompt-Konzept: Professionelle chinesische Küche mit einem leistungsstarken Herd, aus dem helle Flammen schlagen. Ein Koch hält einen Eisen-Wok und brät Zutaten bei hoher Hitze schnell an. Als die Flammen hochschlagen, hebt der Koch das Handgelenk und vollendet einen großen Wok-Schwenk; Fleischscheiben und Frühlingszwiebeln wirbeln durch die Luft. Ein Pfannenwender schlägt zweimal mit einem klaren metallischen Klang gegen den Wokrand. Fünf Sekunden energiegeladenes Audio: Flammenstoß "whoosh", Pfannenschläge "dang-dang", spritzendes heißes Öl mit einem "chi—"-Geräusch – alles präzise auf die Bewegungen des Kochs abgestimmt.
Ergebnis: Die mehrschichtige Tonspur erzeugt eine unmittelbare Wirkung, die durch separate Bearbeitung nur schwer zu erreichen wäre, und zeigt ein Verständnis für die Dynamik des Kochens.
Zugang zu Kling 2.6 über GPT Proto in Kürze
Einheitliche API-Plattform für modernste KI-Modelle
Da sich KI-API-Plattformen durch Übernahmen, Funktionsänderungen und wechselnde Prioritäten schnell weiterentwickeln, sind Kreative mit Unsicherheiten bei der Verfügbarkeit von Tools und der Preisstabilität konfrontiert. Workflows, die auf einem einzigen Anbieter basieren, werden anfällig, wenn sich dessen Ausrichtung ändert. GPT Proto begegnet dieser Herausforderung als führender KI-API-Anbieter, indem die Plattform über einen einzigen Zugang mehrere führende KI-Modelle bereitstellt.
GPT Proto wird Kling 2.6 in naher Zukunft unterstützen und das Modell zur umfangreichen Bibliothek mit mehr als 200 KI-Modellen hinzufügen. Dadurch können Kreative Kling 2.6 neben anderen Videogenerierungstools, Textmodellen, Bildgeneratoren und Plattformen für Audiosynthese über eine einzige Oberfläche nutzen.

Warum GPT Proto für die Videogenerierung?
Vorteile des einheitlichen Zugangs:
-
Eine einzige Oberfläche für Kling 2.6, Kling O1 und konkurrierende Modelle
-
Keine Verwaltung separater Konten, API-Schlüssel und Abrechnungsbeziehungen erforderlich
-
Nahtloser Wechsel zwischen verschiedenen Videogenerierungsplattformen
-
Zukunftssicherer Workflow, da neue Modelle automatisch hinzugefügt werden
Kosten- und Leistungsvorteile:
| Funktion |
Vorteil |
| Pay-as-you-go-Preise |
Keine Verfallsfrist für ungenutzte Credits und keine Mindestabnahme |
| Mengenrabatte |
Etwa 40 % Kostenersparnis gegenüber einzelnen Anbietern |
| Antwortzeiten |
Unter 200 ms durch weltweit verteilte Server |
| Verfügbarkeitsgarantie |
99,9 % mit automatischem Failover |
| Integration neuer Modelle |
Kling 2.6 wird ohne Neukonfiguration hinzugefügt |
| Flexible Skalierung |
Nutzung entsprechend den Projektanforderungen anpassen |
Praktische Vorteile für Videokreative
Die Bündelung beseitigt die Komplexität bei der Nutzung von Kling 2.6 zusammen mit anderen generativen KI-Tools. Wenn Kuaishou Updates für Kling 2.6 veröffentlicht oder neue Versionen startet, integriert GPT Proto diese Änderungen automatisch, ohne dass Kreative ihre Workflows anpassen oder neue Oberflächen erlernen müssen.
Workflow-Stabilität: Wenn Plattformen den Besitzer wechseln oder ihre Nutzungsbedingungen ändern, können Nutzer mit GPT-Proto-Zugang nahtlos zwischen Kling 2.6, Veo, Sora und anderen Alternativen wechseln, ohne komplette Produktionspipelines neu aufzubauen.
Kling-Modellfamilie und Wettbewerber: umfassender Vergleich
Der Markt für KI-Videogenerierung hat sich 2025 rasant entwickelt. Mehrere Plattformen bieten inzwischen eine native audiovisuelle Synchronisation. Ein Verständnis dafür, wie sich Kling 2.6 gegenüber dem Schwestermodell Kling O1 und Wettbewerbern wie Veo 3.1 und Sora 2 positioniert, hilft Kreativen bei der Auswahl der passenden Tools.
Jede Plattform verfügt über eigene Stärken, die von unterschiedlichen Entwicklungsphilosophien und Zielgruppen geprägt sind. Obwohl die Funktionsgleichheit zunimmt, bestehen weiterhin relevante Unterschiede bei Kamerasteuerung, Audioqualität, Sprachunterstützung und Workflow-Design.
Detaillierter Funktionsvergleich
| Funktion |
Kling O1 |
Kling 2.6 |
Veo 3.1 |
Sora 2 |
| Hauptfokus |
Einheitliche multimodale Plattform |
Synchronisierte audiovisuelle Generierung |
Mehrere Szenen umfassende Erzählungen |
Videogenerierung für allgemeine Zwecke |
| Veröffentlichungsdatum |
1. Dez. 2025 |
3. Dez. 2025 |
Ende 2024 |
2024 |
| Audiogenerierung |
✓ Multimodal |
✓ Nativ synchronisiert |
✓ Nativ |
✓ Nativ |
| Kamerasteuerung |
Gut |
Ausgezeichnet (dynamische Aufnahmen) |
Gut |
Gut |
| Sprachunterstützung |
Mehrere |
Chinesisch, Englisch |
Mehrere |
Mehrere |
| Maximale Dauer |
Je nach Modus unterschiedlich |
10 Sekunden |
Bis zu 60 Sekunden |
Variiert |
| Qualität der Lippensynchronisation |
Hoch |
Hohe Präzision |
Hoch |
Hoch |
| Musikalische Darbietung |
Eingeschränkt |
✓ Rap, Gesang, Instrumente |
Eingeschränkt |
Eingeschränkt |
| Dialog mit mehreren Personen |
Standard |
✓ Stimmendifferenzierung |
✓ Erweitert |
Standard |
| Workflow-Design |
Professionelle Pipeline |
Generierung in einem Schritt |
Standard |
Standard |
| Physiksimulation |
Gut |
Gut |
Ausgezeichnet |
Gut |
| Stilanpassung |
Umfangreich |
Standard |
Eingeschränkt |
Gut |
| Bester Anwendungsfall |
Komplexe Produktionen |
Kurzvideos mit Audio |
Längere Erzählungen |
Allgemeine Videos |
| GPT-Proto-Zugang |
Verfügbar |
Demnächst verfügbar |
Verfügbar |
Verfügbar |
| Preismodell |
Mitgliedschaft in Stufen |
Mitgliedschaft in Stufen |
Enterprise/API |
Variiert |
Detaillierte Analyse der Audiofunktionen
| Audiofunktion |
Kling O1 |
Kling 2.6 |
Veo 3.1 |
Sora 2
|
| Dialogqualität |
Gut |
Ausgezeichnet |
Gut |
Gut |
| Umgebungsgeräusche |
Standard |
✓ Kontextbezogen |
Gut |
Standard |
| Soundeffekte |
Grundlegend |
✓ Physikbasiert |
Gut |
Grundlegend |
| Musikgenerierung |
Eingeschränkt |
✓ Rap, Gesang |
Eingeschränkt |
Eingeschränkt |
| Stimmendifferenzierung |
Standard |
✓ Mehrere Figuren |
✓ Erweitert |
Standard |
| ASMR-/Detailaudio |
Nicht verfügbar |
✓ Hohe Klangtreue |
Eingeschränkt |
Nicht verfügbar |
| Audiovisuelle Synchronisation |
Gut |
Ausgezeichnet |
Gut |
Gut |
Kling 2.6 zeigt eine klare Führungsposition bei der Audioqualität, insbesondere in Szenarien, die eine präzise Synchronisation zwischen physischen Handlungen und den dazugehörigen Geräuschen erfordern. Die Fähigkeit des Modells, physikbasierte Soundeffekte zu erzeugen, die visuellen Ereignissen Bild für Bild entsprechen, hebt es von Wettbewerbern ab, die Audio weiterhin als separate Generierungsebene behandeln.
Häufig gestellte Fragen
Was ist der wichtigste Unterschied zwischen Kling O1 und Kling 2.6?
Kling O1 ist eine einheitliche multimodale Erstellungsplattform für integrierte Workflows über mehrere Inhaltstypen hinweg und eignet sich ideal für professionelle Produktionen. Kling 2.6 ist auf die synchronisierte audiovisuelle Videogenerierung spezialisiert und eignet sich für Kreative, die schnell vom Konzept zum fertigen Video mit nativem Audio gelangen möchten. Wählen Sie O1 für komplexe Projekte mit mehreren Phasen und 2.6 für eine effiziente Erstellung von Kurzvideos.
Welche Sprachen unterstützt Kling 2.6 bei der Audiogenerierung?
Das Modell erzeugt derzeit nur Audio auf Chinesisch und Englisch. Wenn Sie Prompts in anderen Sprachen eingeben, übersetzt das System sie vor der Erzeugung der Stimme automatisch ins Englische. Standardmäßige Aussprache liefert die zuverlässigsten Ergebnisse; starke Akzente oder schnelles Sprechen können zu geringfügigen Synchronisationsproblemen führen.
Kann ich mit Kling 2.6 Videos ohne Audio erzeugen?
Ja, die Audiogenerierung ist optional. Wenn sich Ihr Prompt ausschließlich auf eine visuelle Beschreibung konzentriert und keinen Dialog, keine Narration oder bestimmte Geräusche erwähnt, priorisiert das Modell die Bilderzeugung. Lassen Sie einfach alle Audiobeschreibungen weg, um ein stummes Video zu erhalten.
Fazit
Kling 2.6 markiert eine bedeutende Weiterentwicklung der KI-Videogenerierung, da Audio und Bild in einem einzigen kohärenten Prozess vereint werden. Damit ergänzt das Modell den multimodalen Plattformansatz von Kling O1 durch spezialisierte audiovisuelle Qualität. Die synchronisierte audiovisuelle Generierung macht stundenlange Nachbearbeitung überflüssig und bewahrt gleichzeitig filmische Qualität und eine anspruchsvolle Kamerasteuerung. Wenn GPT Proto in naher Zukunft die Unterstützung für Kling 2.6 hinzufügt, erhalten Kreative stabilen Zugang zu dieser modernen Technologie sowie zu weiteren führenden Modellen. So sind sie weniger von einzelnen Anbietern abhängig, während sich der KI-Videomarkt weiterhin rasant entwickelt.