MiniMax H3 kann ein 15-sekündiges Video in 2K-Auflösung mit nativem Stereoton erzeugen. Das ist eine gute Schlagzeile zum Launch, aber die Auflösung ist nicht das wichtigste Upgrade.
Die entscheidendere Veränderung betrifft die Eingaben, die du dem Modell geben kannst, bevor es überhaupt etwas generiert. H3 akzeptiert Text, Bilder, Video und Audio als Referenzen und nutzt sie anschließend, um einen Clip zu erstellen oder zu verändern. Statt nur zu fragen: “Welches neue Video kann dieses Modell generieren?”, kannst du fragen: “Welche Teile dieses bestehenden Videos sollen bleiben und was soll sich ändern?”
Dadurch wird H3 für Kampagnenanpassungen, Produktvideos, Motion Transfer, Musikvisualisierungen und andere Aufgaben relevant, die zuvor mehrere getrennte Generierungs- und Editing-Schritte erforderten. H3 wird dadurch allerdings nicht zu einem framegenauen Timeline-Editor. Das Video-Editing ist generativ: Das Modell interpretiert die Quelle und rendert ein neues Ergebnis.
MiniMax-H3-Beispiele: Zwei nützliche Tests
Die folgenden Beispiele testen zwei unterschiedliche Seiten von MiniMax H3. Das erste prüft, ob H3 eine bestehende Performance beibehalten und gleichzeitig die künstlerische Ausrichtung ändern sowie exakt vorgegebene Typografie hinzufügen kann. Das zweite prüft, ob das Modell eine komplexe 15-sekündige Actionsequenz zusammenhängend darstellen kann.
Beispiel 1: Ein K-Pop-Video mit kinetischer Typografie bearbeiten
Medienplatzhalter: Füge hier den ursprünglichen Tanzclip und die bearbeitete H3-Ausgabe ein.
Eingabe: Ein bestehendes Video mit genau drei Darstellerinnen
Modus: Referenz-zu-Video
Was sich ändert: Studi Hintergrund, Kleidung, Grafiken, Typografie und Audiobearbeitung
Was bleiben soll: Anzahl und Identität der Darstellerinnen, Choreografie, Timing und Bewegung der Originalkamera
Bearbeite das hochgeladene Quellvideo zu einer High-Fashion-K-Pop-Kampagne.
Bewahre exakt drei weibliche Darstellerinnen, ihre Gesichtsidentitäten, das Timing der Choreografie, Körperpositionen, Gesichtsausdrücke und die ursprüngliche Kamerabewegung. Füge keine Darstellerin hinzu, entferne, dupliziere oder verschmelze keine.
Ersetze die ursprüngliche Umgebung durch ein kontrastreiches weißes Cyclorama-Fotostudio. Style die Darstellerinnen in abgestimmter futuristischer schwarzer, silberner und dunkelroter Techwear mit Metallpaneelen, strukturierten Silhouetten, Utility-Riemen und reflektierenden Accessoires neu.
Füge auffällige kinetische Typografie hinzu, die auf den Rhythmus und die Kameraschnitte reagiert. Rendere ausschließlich die exakt vorgegebenen Wörter “FEARLESS” und “NO LIMITS” in großen, korrekt geschriebenen, schwarzen, schmalen serifenlosen Buchstaben. Zeige jeweils nur eine Phrase. Lass die Typografie gleiten, skalieren und kurz hinter den Darstellerinnen vorbeilaufen, ohne ihre Gesichter oder Hände zu verdecken.
Füge zerrissene Papier-Collage-Elemente, rote redaktionelle Ausschnitte, subtile digitale Scanlinien und kontrollierte Glitch-Signaleffekte im Hintergrund hinzu. Betone Nahaufnahmen selbstbewusster Gesichtsausdrücke, Zeigegesten, Details an Beinriemen und synchronisierte Tanzposen, während die bestehende Shot-Sequenz des Quellvideos beibehalten wird.
High-Key-Editorial-Beleuchtung, klare weiße Highlights, scharfe Details wie in der Modefotografie, deutliche Stofftexturen, stabile Gesichter und Gliedmaßen sowie ein dynamischer, aber kontrollierter visueller Rhythmus. Bewahre die ursprüngliche Videodauer und Synchronisation. Nativer Stereoton mit druckvoller elektronischer Percussion, scharfen Übergangsimpulsen und subtilen Glitch-Akzenten.
Hier geht es nicht nur darum zu testen, ob H3 ein attraktives Musikvideo erstellen kann. Prüfe, ob drei unterschiedliche Personen bei schnellen Bewegungen erhalten bleiben, die Choreografie mit der Quelle synchron bleibt, beide Phrasen korrekt geschrieben werden und die Typografie platziert wird, ohne wiederholt Gesichter oder Hände zu verdecken.
Diese Details sind wichtig, weil “ändere den Look, aber behalte die Performance” das eigentliche Editing-Problem beschreibt. Eine visuell beeindruckende Ausgabe, die die Anzahl der Tänzerinnen verändert oder das ursprüngliche Timing aufgibt, hat die Vorgaben nicht erfüllt.
Beispiel 2: Eine 15-sekündige Miniatur-Skateboard-Verfolgungsjagd
Medienplatzhalter: Füge hier die generierte 15-sekündige H3-Ausgabe ein.
Eingabe: Nur ein Text-Prompt
Modus: Text-zu-Video
Was getestet wird: Lange Bewegungsabläufe, gleichbleibende Größenverhältnisse, Kollisionen, Verdeckungen, Kameraverfolgung und synchronisierte Umgebungsgeräusche
Eine 15-sekündige fotorealistische Miniatur-Verfolgungsjagd, als eine durchgehende Einstellung ohne Schnitte gefilmt.
0–4 Sekunden: Eine extrem niedrige, bodennahe Makro-Trackingkamera folgt direkt hinter einem winzigen Miniatur-Skateboarder, der sich gleichmäßig über einen polierten Holzboden bewegt. Skateboarder und Board bleiben klar sichtbar und behalten dieselbe Größe und dasselbe Aussehen. Warmes Sonnenlicht spiegelt sich sanft auf dem Holz. Geringe Schärfentiefe, realistische Vibration der Räder, subtile Bewegungsunschärfe.
4–9 Sekunden: Riesige, farbenfrohe Spielzeugblöcke fallen plötzlich von beiden Seiten in den Weg. Der Skateboarder lehnt sich, weicht aus und fährt knapp zwischen ihnen hindurch, während ein großer Spielzeugtruck über den Vordergrund rollt. Die Kamera hält Schritt, ohne das Motiv zu verlieren. Die Blöcke kollidieren natürlich und werfen realistische bewegte Schatten.
9–15 Sekunden: Ein riesiges niedliches Baby krabbelt im Hintergrund schnell ins Bild und streckt eine gewaltige Hand nach dem Skateboarder und der Kamera aus. Der Skateboarder beschleunigt unter der herannahenden Hand, während die Kamera weiter wenige Zentimeter über dem Boden verfolgt. Die Hand fährt dicht an der Linse vorbei, ohne sie zu berühren. Beende die Szene damit, dass der Skateboarder unter dem Spielzeugtruck entkommt und das Baby mit einem überraschten Lachen reagiert.
Behalte während der gesamten Einstellung Maßstab, Identität des Skateboarders, Bodenaufteilung, Lichtrichtung und Objektpositionen konsistent bei. Realistische Physik, natürliche Handanatomie, detaillierte Holz- und Spielzeugtexturen, filmische Makroperspektive, warmes helles Tageslicht in Innenräumen und eine energiegeladene, aber gut lesbare Bewegung.
Nativer Stereoton: winzige Skateboardräder, die über Holz rollen, von links und rechts klappernde Blöcke, der im Vordergrund rumpelnde Spielzeugtruck, ein leises Babylachen hinter der Kamera und ein kurzer tiefer Rauschton, wenn sich die riesige Hand nähert.
Die Zeitleiste gibt H3 eine klarere Abfolge als ein einzelner Absatz voller gleichzeitiger Aktionen. Trotzdem ist dies ein schwieriger Prompt. Die Kamera muss ein winziges Motiv verfolgen, während mehrere deutlich größere Objekte ins Bild kommen, kollidieren und die Sicht teilweise verdecken. Eine sinnvolle Prüfung sollte die Kontinuität an den Übergängen bei 4 und 9 Sekunden kontrollieren, statt nur das schärfste Einzelbild zu bewerten.
Was ist MiniMax H3?
MiniMax H3 ist ein multimodales Videomodell für allgemeine Zwecke, das MiniMax am 31. Juli 2026 veröffentlicht hat. Einfach gesagt kann es mehrere Arten kreativer Eingaben gleichzeitig verarbeiten—schriftliche Anweisungen, Standbilder, Videoclips und Audio—und daraus ein neues Video erzeugen.
Diese Definition grenzt H3 von MiniMax M3 ab. H3 ist das hier beschriebene Videogenerierungsmodell. M3 gehört zur Sprach- und Coding-Modellreihe von MiniMax. Ähnliche Namen, unterschiedliche Aufgaben.
Die offizielle API-Modell-ID lautet MiniMax-H3. Die aktuelle Dokumentation von MiniMax nennt drei zentrale Generierungspfade: Text-zu-Video, Bild-zu-Video mit dem ersten und/oder letzten Frame sowie Referenz-zu-Video. Das Modell gibt Videos mit 24 fps aus, unterstützt 4 bis 15 Sekunden in ganzzahligen Sekundenschritten und bietet derzeit 2K-Ausgabe über die öffentliche API. MiniMax-H3-Videodokumentation
| Spezifikation |
MiniMax H3 |
| Offizielle API-Modell-ID |
MiniMax-H3 |
| Ausgabeauflösung |
2K |
| Ausgabedauer |
4–15 Sekunden |
| Bildrate |
24 fps |
| Eingabetypen |
Text, Bild, Video, Audio |
| Hauptmodi |
Text-zu-Video, Bild-zu-Video mit erstem/letztem Frame, Referenz-zu-Video |
| Referenzbilder |
Bis zu 9 |
| Referenzvideos |
Bis zu 3 Clips; insgesamt 15 Sekunden |
| Referenzaudio |
Bis zu 3 Clips; insgesamt 15 Sekunden |
| Gemischte Referenzdateien |
Bis zu 12 |
| Prompt-Länge |
Bis zu 7.000 Zeichen |
| Unterstützte Ausgabeformate |
21:9, 16:9, 4:3, 1:1, 3:4, 9:16 oder adaptiv, sofern unterstützt |
H3 wird möglicherweise auch als “Hailuo 3.0” bezeichnet. Diese Bezeichnung ist als informelle Einordnung nach der Hailuo-2.x-Familie verständlich. In der aktuellen Modellliste und API-Dokumentation von MiniMax wird jedoch MiniMax H3 und nicht Hailuo 3.0 als offizieller Name verwendet.
Was ist neu am MiniMax-H3-Upgrade?
Hailuo 2.3 konzentrierte sich auf bessere physische Aktionen, menschliche Mikroausdrücke, stilisierte Visualisierungen und die Reaktion auf Bewegungsanweisungen. H3 erweitert den Umfang des Produkts. Es geht nicht mehr nur darum, einen kurzen Clip aus Text oder einem Bild zu erzeugen; das Modell kann jetzt bestehende Medien als Arbeitskontext verwenden.
1. 2K-Ausgabe für Clips von bis zu 15 Sekunden
MiniMax H3 erhöht die dokumentierte Obergrenze der älteren Hailuo-API-Modelle von verfügbaren 6- oder 10-Sekunden-Formaten auf flexible 4–15 Sekunden. Außerdem steigt die maximale Auflösung von 1080p auf 2K.
Eine längere Dauer bedeutet nicht automatisch mehr Kohärenz. Eine 15-sekündige Einstellung gibt dem Modell mehr Zeit, ein Gesicht zu verändern, ein Objekt zu verlieren oder ein späteres Ereignis falsch zu interpretieren. Deshalb verwendet das zweite Beispiel oben eine zeitlich gegliederte Sequenz und klare Kontinuitätsvorgaben.
2. Nativer Stereoton
H3 erzeugt den Ton als Teil des Videos, statt einen vollständig separaten Audiogenerierungsschritt zu erfordern. Reuters nennt nativen Stereoton als eine der Funktionen des Releases. Bei kurzen Werbespots, Musikvisualisierungen und Actionclips kann dies Soundeffekte näher an den Ereignissen halten, durch die sie entstehen. Reuters-Bericht zum Launch
Der Nachteil ist die geringere Vorhersagbarkeit. Nativer Ton reduziert Workflow-Schritte, garantiert aber nicht bei jedem Versuch einen exakten Dialog, perfekte Lippen-Synchronisation oder einen produktionsfertigen Mix. Wenn ein Projekt rechtlich freigegebene Musik, einen präzisen Sprechertext oder exakte Lautheitsstandards benötigt, solltest du die generierte Tonspur als Entwurf behandeln, bis sie eine separate Prüfung bestanden hat.
3. Multimodale Referenzgenerierung
Eine Referenz-zu-Video-Anfrage kann bis zu 9 Bilder, 3 Videoclips und 3 Audioclips kombinieren, vorbehaltlich eines Gesamtlimits von 12 Dateien und eines Gesamtlimits von 15 Sekunden für Referenzvideo oder -audio. Jede Anfrage benötigt weiterhin einen schriftlichen Prompt. Audio kann außerdem nicht allein eingereicht werden; mindestens ein Referenzbild oder -video muss es begleiten.
Das ist nützlich, wenn ein einzelnes Asset nicht den gesamten Auftrag abdecken kann. Ein Produktbild kann das Objekt definieren, ein Modelbild die Person, ein Quellclip die Bewegung und ein Audioclip den Rhythmus. Der Prompt erklärt anschließend, welche Eigenschaften beibehalten werden sollen und wie die fertige Szene aussehen soll.
Mehr Referenzen schaffen allerdings auch mehr Möglichkeiten für widersprüchliche Anweisungen. Neun Bilder sind nicht automatisch besser als drei. Wenn zwei Produktaufnahmen unterschiedliche Verpackungen zeigen oder zwei Charakterreferenzen verschiedene Frisuren haben, muss das Modell entscheiden, welche Version Vorrang hat.
4. Steuerung des ersten und letzten Frames
H3 unterstützt einen ersten Frame, einen letzten Frame oder beide. Das ist nützlich, wenn die Eröffnungskomposition des Produkts und das abschließende Markenbild bereits freigegeben sind, die Bewegung dazwischen aber noch generiert werden muss.
Der Modus für den ersten/letzten Frame und der multimodale Referenzmodus sind getrennte API-Pfade. Laut aktueller Spezifikation von MiniMax können sie nicht in derselben Anfrage kombiniert werden. Diese Grenze wird leicht übersehen: Du kannst den Anfang und das Ende mit Bildern verankern oder eine Sammlung aus Referenzbildern, -videos und -audio verwenden, aber nicht beide Eingabestrukturen gleichzeitig. MiniMax-H3-API-Referenz
5. Motion Transfer und Steuerung durch Referenzvideos
H3 kann ein Referenzvideo nutzen, um Bewegung, Kameraverhalten, Editing-Rhythmus und andere zeitliche Informationen zu steuern. Dadurch entsteht ein praktischer Weg für die Übertragung von Choreografien, Produktbewegungen, Kamerafahrten und Szenen-Timing, die sich allein mit Text nur schwer beschreiben ließen.
Das bedeutet nicht, dass die Quellbewegung Frame für Frame kopiert wird. H3 interpretiert die Referenz und generiert das Ergebnis neu. Bei wiedererkennbarer Choreografie oder streng freigegebenen Produktbewegungen solltest du die Ausgabe mit der Quellzeitleiste vergleichen und nicht davon ausgehen, dass “Referenz” eine exakte Reproduktion bedeutet.
6. Generatives Video-Editing
Video-Editing ist die zentrale H3-Funktion, aber der Begriff braucht eine klare Abgrenzung. H3 ist kein konventioneller Editor, in dem du eine Ebene auswählst, ein Wort ersetzt und jedes nicht betroffene Pixel unverändert lässt.
Stattdessen wird das Quellvideo zu einer Referenz. Der Prompt teilt H3 mit, was erhalten bleiben und was sich ändern soll, und das Modell generiert einen überarbeiteten Clip. Das kann große kreative Veränderungen ermöglichen—neue Umgebung, Kleidung, Grafiken, Ton oder Stil—doch dieselben Veränderungen können zu Identitätsabweichungen, verändertem Bildausschnitt, falsch geschriebenem Text oder kleinen Bewegungsänderungen führen.
In einem Satz: H3 bearbeitet durch Regenerierung, nicht durch eine chirurgische Änderung der Originaldatei.
So funktioniert das Video-Editing mit MiniMax H3 tatsächlich
Eine gute H3-Editing-Anweisung besteht aus zwei Ebenen:
-
Erhaltungsbedingungen: Wer bleibt im Clip? Welche Produktdetails, Aktionen, Kamerabewegungen, Zeitabläufe und Kompositionen müssen erhalten bleiben?
-
Transformationsanweisungen: Welcher Hintergrund, welche Kleidung, welcher visuelle Stil, welche Typografie, welcher Ton oder welche Atmosphäre soll sich ändern?
Der K-Pop-Prompt verwendet diese Trennung bewusst. Zuerst werden Anzahl der Darstellerinnen, Gesichtsidentitäten, Choreografie, Timing und Kamerabewegung festgelegt. Erst danach werden ein neues Studio, eine neue Moderichtung, Grafiken und Audiobearbeitung angefordert.
Diese Reihenfolge ist wichtig. “Mache daraus ein futuristisches K-Pop-Video” gibt dem Modell die Erlaubnis, fast alles neu zu interpretieren. “Bewahre exakt drei Darstellerinnen und die Quellchoreografie; ersetze nur die künstlerische Ausrichtung” gibt ihm eine Hierarchie.
Bei schwierigeren Bearbeitungen solltest du jeweils eine große Kategorie ändern. Teste zuerst Hintergrund und Kleidung. Füge dann Typografie hinzu. Verfeinere anschließend den Ton. Eine einzelne Anfrage kann alle drei Schritte erledigen, aber durch die Trennung lässt sich leichter erkennen, welche Anweisung einen Fehler verursacht hat, und Wiederholungen können besser diagnostiziert werden.
Es gibt außerdem ein Kostendetail, das in Launch-Zusammenfassungen häufig fehlt. MiniMax berechnet 0,13 $ pro Sekunde für eine 2K-Ausgabe; ein Referenzvideo wird laut seiner Dauer zum gleichen Sekundensatz berechnet. Eine 15-sekündige 2K-Generierung kostet daher etwa 1,95 $. Wenn die Anfrage zusätzlich ein 15-sekündiges Referenzvideo verwendet, belaufen sich die kombinierten Kosten für Eingabevideo und Ausgabe auf etwa 3,90 $, zuzüglich möglicher Gebühren für mehr als fünf Referenzbilder. MiniMax-Pay-as-you-go-Preise
Das macht Referenz-Editing nicht unvernünftig, verändert aber die Planung von Iterationen. Zehn 15-sekündige Text-zu-Video-Versuche kosten zum angegebenen Tarif etwa 19,50 $; zehn ebenso lange Bearbeitungen mit einem 15-sekündigen Quellvideo kosten etwa 39,00 $. Kurze diagnostische Generierungen sind der sinnvollere erste Schritt.
Welche Arten von Videos kann MiniMax H3 erstellen?
H3 deckt die bekannten Text-zu-Video- und Bild-zu-Video-Aufgaben ab, seine stärkeren Anwendungsfälle sind jedoch solche, die von mehreren Referenztypen oder einer bestehenden Zeitleiste profitieren.
Eine Kampagne überarbeiten, ohne alles neu zu drehen
Eine Marke kann die freigegebene ursprüngliche Performance bereitstellen und anschließend einen neuen Ort, eine neue Kleidungsrichtung, eine saisonale Gestaltung oder ein neues Grafiksystem anfordern. Das eignet sich für regionale oder ereignisspezifische Varianten. Weniger geeignet ist es, wenn jedes Produktetikett, jedes Gesichtsdetail und jede Geste mit Frame-genauer Genauigkeit erhalten bleiben muss.
Aus Produktbildern ein E-Commerce-Video erstellen
Produktfotos können Form, Farbe und Verpackung definieren, während eine Bewegungsreferenz zeigt, wie sich der Artikel drehen, öffnen, ausgießen, falten oder durch die Szene bewegen soll. Ein Abschlussbild kann für eine feste Endkarte nützlich sein, lässt sich derzeit jedoch nicht in derselben Anfrage mit Referenz-zu-Video-Eingaben kombinieren.
Choreografie oder Kamerabewegung übertragen
Ein Referenzclip kann ein Timing vermitteln, dessen Beschreibung Hunderte von Wörtern erfordern würde. Tanz, Sportbewegungen, Verhalten einer Handkamera und Produktenthüllungen sind naheliegende Kandidaten. Vergewissere dich immer, dass du die Rechte zur Nutzung der Quellperformance und des Abbilds besitzt.
Kurze Musik- und Modevisualisierungen erstellen
Die Kombination aus schnellen visuellen Veränderungen, generiertem Ton, Referenzbewegung und Vorgaben zur künstlerischen Ausrichtung eignet sich für Musikteaser und Modekampagnen. Exakte Typografie bleibt ein Punkt der Qualitätskontrolle und sollte nicht einfach vorausgesetzt werden.
Game-Promos und filmische Titelbildschirme animieren
Referenzbilder können dafür sorgen, dass Charakter, Objekt oder Benutzeroberfläche näher an einem freigegebenen Design bleiben, während der Prompt Bewegung, Kamerafahrt, Partikel und Ton ergänzt. Generiertes Material ist für Konzepttrailer nützlich, doch Interface-Texte und spielähnliche Sequenzen benötigen weiterhin eine menschliche Prüfung.
15-sekündige Action- oder Verfolgungssequenzen erstellen
Die längere Dauer bietet einem Prompt genügend Raum für Aufbau, Steigerung und Auflösung. Gleichzeitig wird die Kontinuität schwieriger. Prompts sollten die Handlung in Zeitbereiche aufteilen und die Eigenschaften des Motivs wiederholen, die sich nicht ändern dürfen.
MiniMax H3 für E-Commerce und Werbung
Die nützlichste Sichtweise auf H3 im E-Commerce lautet nicht “Erzeuge eine Anzeige”. Denke stattdessen daran, einen Auftrag aus mehreren Medien-Assets zusammenzustellen.
| Eingabe |
Aufgabe im Workflow |
| Produktbilder |
Form, Farbe, Material und Verpackung des Produkts definieren |
| Logo- oder Verpackungsreferenzen |
Markenzeichen und visuelle Identität einschränken |
| Bilder von Model oder Charakter |
Das Aussehen des Präsentators näher am freigegebenen Look halten |
| Referenzvideo für Bewegungen |
Eine Handgeste, Demonstration, Kamerabewegung oder einen Editing-Rhythmus festlegen |
| Audioreferenz |
Tempo, Stimme oder Klangrichtung vorgeben |
| Schriftlicher Prompt |
Fertige Szene, Erhaltungsregeln, Änderungen und Ausschlüsse angeben |
So könnte eine Kosmetikmarke fünf saubere Produktansichten, eine Modelreferenz, einen sechssekündigen Clip mit einer Handbewegung und eine kurze Audioreferenz bereitstellen. Der Prompt könnte anschließend eine 10-sekündige vertikale Produktenthüllung anfordern und dabei Flaschenform, Etikettenposition, Verschlussfarbe, Identität des Models und Timing der Geste bewahren.
Das ist ein besserer Auftrag als “Erstelle eine Luxus-Kosmetikanzeige”. Es ist jedoch keine Garantie. Produktgeometrie kann sich verformen, kleiner Etikettentext kann sich ändern und ein Logo kann von Frame zu Frame abweichen. Wenn die Ausgabe zu einer bezahlten Anzeige wird, vergleiche das Produkt Frame für Frame mit der freigegebenen Fotografie und ersetze kritischen Markentext bei Bedarf in einem konventionellen Editor.
H3 ist hier vor allem als Produktionsbeschleuniger für Konzepte, Varianten und kurze Kampagnen-Assets nützlich. Es ersetzt keine Markenfreigabe.
MiniMax H3 im Vergleich zu Hailuo 2.3 und Hailuo 02
Der Generationsunterschied ist größer, als die Auflösungsspalte vermuten lässt. Die bisherigen Hailuo-Modelle von MiniMax sind Kurzform-Generatoren, die auf Text- und Bildeingaben ausgerichtet sind. H3 ergänzt ein Referenzsystem, das Video und Audio aufnehmen und diese Materialien für Erstellung, Motion Transfer oder Editing verwenden kann.
| Funktion |
MiniMax H3 |
Hailuo 2.3 |
Hailuo 02 |
| Maximale dokumentierte Auflösung |
2K |
1080p |
1080p |
| Dokumentierte Dauer |
4–15 Sekunden |
6 Sekunden bei 1080p; 6 oder 10 Sekunden bei 768p |
6 Sekunden bei 1080p; 6 oder 10 Sekunden bei 768p/512p |
| Bildrate |
24 fps |
24 fps |
24 fps |
| Text-zu-Video |
Ja |
Ja |
Ja |
| Bild-zu-Video |
Ja |
Ja |
Ja |
| Eingabe für ersten/letzten Frame |
Ja |
Nicht als primärer aktueller Modus aufgeführt |
Ja |
| Referenzvideo und -audio |
Ja |
In der aktuellen Modellspezifikation nicht aufgeführt |
In der aktuellen Modellspezifikation nicht aufgeführt |
| Nativ generierter Ton |
Ja |
Nicht aufgeführt |
Nicht aufgeführt |
| Generatives Video-Editing |
Ja, durch referenzbasierte Regenerierung |
Nicht aufgeführt |
Nicht aufgeführt |
| Am besten geeignet für |
Multimodale Briefings, Editing, Motion Transfer, Audio und längere 2K-Clips |
Kurze T2V/I2V-Clips mit besserer Verarbeitung von Aktionen und Ausdrücken |
Konventionelle Kurzform-Generierung und Optionen mit geringerer Auflösung |
Die praktische Entscheidung ist einfach:
-
Wähle MiniMax H3, wenn die Aufgabe ein bestehendes Video, mehrere Referenz-Assets, nativen Ton, 2K-Ausgabe oder mehr als 10 Sekunden benötigt.
-
Wähle Hailuo 2.3, wenn du lediglich einen kurzen Text-zu-Video- oder Bild-zu-Video-Clip benötigst und das Referenz- und Editing-System von H3 nicht brauchst.
-
Ziehe Hailuo 02 in Betracht, wenn dessen Pfad für den ersten/letzten Frame oder die Preise für geringere Auflösungen zu einem einfachen älteren Workflow passen.
MiniMax H3 ist derzeit nicht über GPT Proto verfügbar. Wenn du ein MiniMax-Videomodell benötigst, das dort bereits verfügbar ist, probiere Hailuo 2.3 Pro für Bild-zu-Video oder Hailuo 2.3 Pro für Text-zu-Video.
Preise und Verfügbarkeit von MiniMax H3
Die offizielle API von MiniMax H3 ist unter der Modell-ID MiniMax-H3 verfügbar. Die öffentliche API-Dokumentation nennt derzeit 2K als verfügbare Ausgabeauflösung. Ein 768p-Tarif ist veröffentlicht, wird von MiniMax jedoch als Closed Beta gekennzeichnet; Nutzer sollen sich vor der Verwendung an den Vertrieb wenden.
| Element |
Veröffentlichter Preis |
| 2K-Ausgabevideo |
$0.13 pro Sekunde |
| 768p-Ausgabevideo |
$0.09 pro Sekunde; Closed Beta |
| Audioreferenzen |
Kostenlos |
| Referenzbilder |
Die ersten 5 kostenlos; 0,04 $ pro zusätzlichem Bild |
| Referenzvideo |
0,13 $ pro Eingabesekunde bei einer 2K-Ausgabe |
| 15-sekündige 2K-Text-zu-Video-Generierung |
Etwa 1,95 $ |
| 15-sekündiges Referenzvideo + 15-sekündige 2K-Ausgabe |
Etwa 3,90 $ |
Die API verwendet einen asynchronen Workflow: Sende eine Generierungsanfrage, erhalte eine Aufgaben-ID, frage den Aufgabenstatus ab und lade das Ergebnis nach erfolgreichem Abschluss herunter. MiniMax H3 ist derzeit nicht auf GPT Proto verfügbar. Deshalb enthält dieser Artikel kein GPT Proto-Codebeispiel und suggeriert nicht, dass bereits ein GPT Proto-H3-Endpunkt verfügbar ist.
Auch der Status der offenen Gewichte muss präzise formuliert werden. MiniMax präsentiert H3 als offenes Modell für allgemeine Zwecke und hat angekündigt, die Gewichte zu veröffentlichen. Reuters berichtete, dass die Dateien innerhalb weniger Tage erwartet wurden. Zum Stand der Prüfung dieses Artikels am 31. Juli waren die herunterladbaren Gewichte, Lizenzbedingungen, Modellgröße und realistischen lokalen Hardwareanforderungen jedoch noch nicht öffentlich bestätigt.
“Offene Gewichte” sind daher die angekündigte Richtung und kein Beweis dafür, dass du H3 heute lokal herunterladen und ausführen kannst.
Was MiniMax H3 weiterhin nicht garantiert
H3 erweitert, was in einer einzigen Generierung versucht werden kann, beseitigt aber nicht die üblichen Fehlerquellen generativer Videos.
Exakter Text kann weiterhin mehrere Versuche erfordern. Das erste Beispiel verwendet bewusst nur zwei kurze Phrasen. Wenn sich diese Wörter über die Frames hinweg verändern, nutze die Generierung für die Bewegung und füge die endgültige Typografie in einem normalen Editor hinzu.
Aggressive Bearbeitungen können die Identität verändern. Wenn Hintergrund, Kleidung, Grafiksystem, Audio und Beleuchtung in einer Anfrage ersetzt werden, hat das Modell mehr Möglichkeiten, die Personen in der Quelle neu zu interpretieren.
Eine komplexe 15-sekündige Einstellung ist schwieriger als eine einfache 6-sekündige Animation. Je länger der Clip ist und je mehr Ereignisse er enthält, desto mehr Kontinuitätsentscheidungen muss das Modell bewahren.
Generatives Editing bewahrt nicht jedes Pixel. H3 erstellt aus Referenzen ein neues Ergebnis. Es ist nicht das richtige Werkzeug für rechtliche, medizinische oder produktbezogene Compliance-Bearbeitungen, bei denen alle unveränderten Pixel identisch bleiben müssen.
Offizielle Beispiele belegen keine verlässlich wiederholbare Produktionsqualität. Ein Launch-Video zeigt, was ein Modell produzieren kann, nicht wie viele Versuche dafür nötig waren. Wiederholbarkeit, Fehlerquote und Prompt-Empfindlichkeit müssen unabhängig getestet werden.
Die Anforderungen für eine lokale Bereitstellung sind weiterhin unbekannt. Solange die tatsächlichen Gewichte, Architekturdetails, Lizenz und Hinweise zum Betrieb nicht vorliegen, ist jede präzise VRAM-Empfehlung Spekulation.
Ein unabhängiges Signal ist ermutigend: Am 31. Juli belegte MiniMax H3 auf der Video-Editing-Bestenliste von Artificial Analysis mit Audio den ersten Platz, mit einem Elo-Wert von 1.130 aus 5.043 Stichproben. Das ist ein nützliches Ergebnis einer Blindpräferenzmessung, aber nur eine Momentaufnahme und keine Garantie für jede Aufgabe. Artificial-Analysis-Bestenliste für Video-Editing
Fazit: Ist MiniMax H3 ein bedeutendes Upgrade?
Ja. MiniMax H3 ist ein größeres Upgrade gegenüber Hailuo 2.3, als “2K statt 1080p” vermuten lässt.
Der wichtigste Grund für H3 ist die referenzgesteuerte Generierung und Bearbeitung. Text, Produktbilder, eine Quellperformance, Bewegungsvorgaben und Audio können jetzt zu einer einzigen Videoanfrage beitragen. Für Werbe- und E-Commerce-Teams verändert das den Auftrag von “Erzeuge etwas Ähnliches” zu “Bewahre diese Assets und dieses Timing und ändere anschließend diese konkreten kreativen Elemente.”
Der Preis dafür ist Kontrolle. Da H3 den Clip neu generiert, können Bearbeitungen Details beeinflussen, die erhalten bleiben sollten. Längere Einstellungen bieten außerdem mehr Raum für Kontinuitätsfehler, und Eingabevideo erhöht die Kosten jedes Versuchs.
Für eine einfache 6-sekündige Bildanimation kann Hailuo 2.3 weiterhin ausreichen. Für eine multimodale Kampagne, Motion Transfer, nativen Ton, die Überarbeitung eines bestehenden Videos oder eine 15-sekündige Actionsequenz ist H3 das relevantere Modell zum Testen.
MiniMax H3 ist derzeit nicht auf GPT Proto verfügbar. Während der Zugang vorbereitet wird, kannst du andere Videogenerierungsmodelle in der GPT Proto-Modellgalerie erkunden oder GPT Proto besuchen, um die bereits über ein Konto verfügbaren Modelle zu vergleichen.