Schuyler Stacy2026-07-31

MiniMax H3 ya está aquí: qué cambia realmente su actualización de edición de vídeo

Descubre qué cambia con MiniMax H3: video en 2K, clips de 15 segundos, audio nativo, edición de video generativa, casos de uso para comercio electrónico, precios y comparaciones con Hailuo.

MiniMax H3 ya está aquí: qué cambia realmente su actualización de edición de vídeo

Resumen: lo que debes saber

  • MiniMax H3 se lanzó oficialmente el 31 de julio de 2026.

  • Genera videos de 4 a 15 segundos en 2K y a 24 fps.

  • Acepta texto, imágenes, videos y audio como entradas multimodales.

  • Admite conversión de texto a video, control del primer y último fotograma, generación basada en referencias, transferencia de movimiento y edición de video generativa.

  • Puede generar sonido estéreo nativo junto con el video.

  • Su API oficial ya está disponible, pero MiniMax H3 aún no está disponible a través de GPTProto.

  • MiniMax planea publicar los pesos del modelo para descargar, pero no estaban disponibles públicamente cuando se revisó este artículo por última vez.

  • H3 supone una importante mejora del flujo de trabajo con respecto a Hailuo 2.3 cuando necesitas referencias de videos de origen, edición, audio o salida en 2K. Hailuo 2.3 sigue siendo suficiente para tareas más sencillas de texto a video y de imagen a video de corta duración.

Tabla de contenido

MiniMax H3 puede generar un video de 15 segundos con resolución 2K y sonido estéreo nativo. Es un buen titular de lanzamiento, pero la resolución no es la mejora más importante.

El cambio más relevante es lo que puedes darle al modelo antes de que genere cualquier cosa. H3 acepta texto, imágenes, video y audio como referencias, y luego los usa para crear o modificar un clip. En lugar de preguntar solamente: “¿Qué video nuevo puede generar este modelo?”, puedes preguntar: “¿Qué partes de este video existente deberían permanecer y qué debería cambiar?”

Esto hace que H3 sea relevante para revisiones de campañas, videos de productos, transferencia de movimiento, visuales musicales y otros trabajos que antes requerían varios pasos independientes de generación y edición. Sin embargo, H3 no se convierte en un editor de línea de tiempo con precisión de fotograma. Su edición de video es generativa: el modelo interpreta la fuente y renderiza un resultado nuevo.

Ejemplos de MiniMax H3: dos pruebas útiles

Los siguientes ejemplos están diseñados para probar dos aspectos diferentes de MiniMax H3. El primero evalúa si H3 puede conservar una interpretación existente mientras cambia su dirección artística y añade una tipografía exacta. El segundo evalúa si puede mantener cohesionada una compleja secuencia de acción de 15 segundos.

Ejemplo 1: Editar un video de K-pop con tipografía cinética

Marcador de medios: Inserta aquí el clip de baile original y el resultado editado con H3.

Entrada: Un video existente con exactamente tres intérpretes
Modo: De referencia a video
Qué cambia: Fondo del estudio, dirección del vestuario, gráficos, tipografía y tratamiento de audio
Qué debe permanecer: Cantidad e identidades de las intérpretes, coreografía, ritmo y movimiento de la cámara original

Edita el video fuente subido para convertirlo en una campaña de K-pop de alta costura.

Conserva exactamente a tres intérpretes femeninas, sus identidades faciales, el ritmo de la coreografía, las posiciones corporales, las expresiones y el movimiento original de la cámara. No añadas, elimines, dupliques ni fusiones ninguna intérprete.

Sustituye el entorno original por un estudio de moda con ciclorama blanco de alto contraste. Cambia el estilo de las intérpretes a un vestuario tecnológico futurista coordinado en negro, plateado y rojo oscuro, con paneles metálicos, siluetas estructuradas, correas utilitarias y accesorios reflectantes.

Añade una tipografía cinética llamativa que reaccione al ritmo y a los cortes de cámara. Representa únicamente las palabras exactas “FEARLESS” y “NO LIMITS” con letras negras grandes, condensadas y sans serif, escritas correctamente. Muestra una frase a la vez. Haz que la tipografía se deslice, cambie de escala y pase brevemente por detrás de las intérpretes sin cubrir sus rostros ni sus manos.

Añade elementos de collage de papel rasgado, recortes editoriales rojos, sutiles líneas de escaneo digital y efectos controlados de interferencia de señal en el fondo. Enfatiza los primeros planos de expresiones seguras, gestos señalando con los dedos, detalles de las correas de las piernas y poses de baile sincronizadas, siguiendo la secuencia de planos existente del video fuente.

Iluminación editorial de alta intensidad, reflejos blancos limpios, detalles nítidos de fotografía de moda, textura de las telas definida, rostros y extremidades estables, y un ritmo visual dinámico pero controlado. Conserva la duración y la sincronización originales del video. Audio estéreo nativo con percusión electrónica contundente, impactos nítidos en las transiciones y sutiles acentos de interferencia.

No se trata simplemente de probar si H3 puede crear un video musical atractivo. Comprueba si puede conservar a tres personas distintas durante movimientos rápidos, mantener la coreografía alineada con la fuente, escribir correctamente ambas frases y colocar la tipografía sin cubrir repetidamente los rostros ni las manos.

Esos detalles importan porque “cambiar el aspecto pero conservar la interpretación” es el verdadero problema de edición. Un resultado visualmente impresionante que cambia la cantidad de bailarinas o abandona el ritmo original no cumple con el encargo.

Ejemplo 2: Una persecución en monopatín en miniatura de 15 segundos

Marcador de medios: Inserta aquí el resultado generado de 15 segundos con H3.

Entrada: Solo indicación de texto
Modo: De texto a video
Qué evalúa: Movimiento prolongado, consistencia de escala, colisiones, oclusión, seguimiento de cámara y sonido ambiental sincronizado

Una secuencia de persecución en miniatura fotorrealista de 15 segundos, filmada en un único plano continuo sin cortes.

0–4 segundos: Una cámara macro de seguimiento ultrabaja, a nivel del suelo, sigue directamente desde atrás a un diminuto patinador en monopatín que se desplaza suavemente sobre un suelo de madera pulida. El patinador y el monopatín permanecen claramente visibles y mantienen la misma escala y apariencia. La luz cálida del sol se refleja suavemente sobre la madera. Profundidad de campo reducida, vibración realista de las ruedas y desenfoque de movimiento sutil.

4–9 segundos: De repente, enormes bloques de juguete coloridos caen desde ambos lados y se interponen en el camino. El patinador se inclina, hace una maniobra evasiva y pasa por poco entre ellos mientras un camión de juguete grande atraviesa el primer plano. La cámara mantiene el ritmo sin perder al sujeto. Los bloques chocan de forma natural y proyectan sombras móviles realistas.

9–15 segundos: Un bebé gigante y adorable entra rápidamente en cuadro por el fondo y extiende una mano enorme hacia el patinador y la cámara. El patinador acelera por debajo de la mano que se aproxima mientras la cámara continúa siguiendo a pocos centímetros del suelo. La mano pasa cerca del objetivo sin tocarlo. Termina con el patinador escapando por debajo del camión de juguete mientras el bebé reacciona con una risa sorprendida.

Mantén una escala miniatura coherente, la identidad del patinador, la disposición del suelo, la dirección de la iluminación y las posiciones de los objetos durante todo el plano. Física realista, anatomía natural de la mano, texturas detalladas de la madera y los juguetes, perspectiva macro cinematográfica, luz diurna interior cálida y brillante, y un movimiento enérgico pero fácil de seguir.

Sonido estéreo nativo: pequeñas ruedas de monopatín rodando sobre la madera, bloques traqueteando desde la izquierda y la derecha, el camión de juguete retumbando al atravesar el primer plano, una suave risa de bebé detrás de la cámara y un breve silbido grave cuando se aproxima la mano gigante.

La línea de tiempo proporciona a H3 una secuencia más clara que un solo párrafo lleno de acciones simultáneas. Aun así, es una indicación difícil. La cámara debe seguir a un sujeto diminuto mientras varios objetos mucho más grandes entran en escena, chocan y obstruyen parcialmente la vista. Una revisión útil debería comprobar la continuidad en las transiciones de los segundos 4 y 9, en lugar de juzgar únicamente el fotograma más nítido.

 

¿Qué es MiniMax H3?

MiniMax H3 es un modelo de vídeo multimodal de propósito general lanzado por MiniMax el 31 de julio de 2026. En términos sencillos, puede leer varios tipos de entrada creativa a la vez—instrucciones escritas, imágenes fijas, clips de vídeo y audio— y utilizarlos para generar un vídeo nuevo.

Esa definición diferencia H3 de MiniMax M3. H3 es el modelo de generación de vídeo del que hablamos aquí. M3 pertenece a la línea de modelos de lenguaje y programación de MiniMax’s. Nombres similares, funciones diferentes.

El ID oficial del modelo para la API es MiniMax-H3. La documentación actual de MiniMax enumera tres vías principales de generación: texto a vídeo, imagen a vídeo con el primer y/o último fotograma, y referencia a vídeo. El modelo genera a 24 fps, admite de 4 a 15 segundos en incrementos de un segundo y actualmente ofrece una salida de 2K mediante la API pública. Documentación de vídeo de MiniMax H3

Especificaciones MiniMax H3
ID oficial del modelo para la API MiniMax-H3
Resolución de salida 2K
Duración de salida 4–15 segundos
Frecuencia de fotogramas 24 fps
Tipos de entrada Texto, imagen, vídeo, audio
Modos principales Texto a vídeo, imagen a vídeo con el primer/último fotograma, referencia a vídeo
Imágenes de referencia Hasta 9
Vídeos de referencia Hasta 3 clips; 15 segundos en total
Audio de referencia Hasta 3 clips; 15 segundos en total
Archivos de referencia combinados Hasta 12
Longitud del prompt Hasta 7,000 caracteres
Relaciones de aspecto de salida compatibles 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 o adaptable cuando sea compatible

También puedes ver que H3 se describe como “Hailuo 3.0.” Esa etiqueta tiene sentido como una forma informal de situarlo después de la familia Hailuo 2.x, pero la lista de modelos y la documentación de la API actuales de MiniMax utilizan MiniMax H3, no Hailuo 3.0, como nombre oficial.

¿Qué novedades incluye la actualización a MiniMax H3?

Hailuo 2.3 se centró en mejorar la acción física, las microexpresiones humanas, los elementos visuales estilizados y la respuesta a comandos de movimiento. H3 cambia el alcance del producto. Ya no se trata únicamente de generar un clip corto a partir de texto o de una imagen; ahora el modelo puede utilizar medios existentes como contexto de trabajo.

1. Salida en 2K para clips de hasta 15 segundos

MiniMax H3 eleva el límite documentado de los formatos de 6 o 10 segundos disponibles en los modelos de API Hailuo anteriores a un intervalo flexible de 4–15 segundos. También aumenta la resolución máxima de 1080p a 2K.

Una mayor duración no significa automáticamente una mayor coherencia. Una toma de 15 segundos da al modelo más tiempo para cambiar un rostro, perder un objeto o malinterpretar un evento posterior. Por eso el segundo ejemplo anterior utiliza una secuencia cronometrada y restricciones explícitas de continuidad.

2. Audio estéreo nativo

H3 genera el sonido como parte del vídeo, en lugar de requerir un proceso de generación de audio completamente separado. Reuters informa que el sonido estéreo nativo es una de las capacidades del lanzamiento. Para anuncios cortos, vídeos musicales y clips de acción, esto puede mantener los efectos de sonido más sincronizados con los eventos que los producen. Informe de lanzamiento de Reuters

La contrapartida es la previsibilidad. El audio nativo reduce los pasos del flujo de trabajo, pero no garantiza un diálogo exacto, una sincronización labial perfecta ni una mezcla lista para producción en todos los intentos. Si un proyecto depende de música con derechos autorizados, un texto de voz en off preciso o estándares exactos de sonoridad, considera la pista generada como un borrador hasta que pase una revisión independiente.

3. Generación multimodal con referencias

Una solicitud de referencia a vídeo puede combinar hasta 9 imágenes, 3 clips de vídeo y 3 clips de audio, sujeta a un total de 12 archivos y a un límite total de 15 segundos para el vídeo o audio de referencia. Toda solicitud requiere además un prompt escrito. El audio tampoco puede enviarse por sí solo; debe acompañarlo al menos una imagen o un vídeo de referencia.

Esto resulta útil cuando un solo recurso no puede abarcar todo el briefing. Una imagen del producto puede definir el objeto, una imagen del modelo puede definir a la persona, un clip de origen puede definir el movimiento y un clip de audio puede definir el ritmo. El prompt explica entonces qué características deben conservarse y qué aspecto debe tener la escena final.

Más referencias también crean más posibilidades de conflicto entre las instrucciones. Nueve imágenes no son automáticamente mejores que tres. Si dos fotos del producto muestran envases diferentes o dos referencias de personajes muestran peinados distintos, el modelo debe adivinar cuál prevalece.

4. Control del primer y último fotograma

H3 admite un primer fotograma, un último fotograma o ambos. Esto resulta útil cuando la composición inicial del producto y el fotograma final de marca ya están aprobados, pero aún es necesario generar el movimiento entre ambos.

El modo de primer/último fotograma y el modo de referencia multimodal son vías de API independientes. La especificación actual de MiniMax indica que no pueden combinarse en la misma solicitud. Este límite es fácil de pasar por alto: puedes anclar las imágenes inicial y final, o utilizar una colección de imágenes, vídeos y audio de referencia, pero no ambas estructuras de entrada a la vez. Referencia de la API de MiniMax H3

5. Transferencia de movimiento y control mediante vídeo de referencia

H3 puede utilizar un vídeo de referencia para guiar el movimiento, el comportamiento de la cámara, el ritmo de edición y otra información temporal. Esto abre una vía práctica para transferir coreografías, gestos de manipulación de productos, movimientos de cámara y tiempos de escena que serían difíciles de describir únicamente con texto.

Esto no significa que el movimiento de origen se copie fotograma a fotograma. H3 interpreta la referencia y vuelve a generar el resultado. Para coreografías reconocibles o movimientos de producto estrictamente aprobados, compara el resultado con la línea temporal de origen en lugar de asumir que “referencia” significa replicación exacta.

6. Edición de vídeo generativa

La edición de vídeo es la característica distintiva de H3, pero el término necesita una delimitación. H3 no es un editor convencional en el que seleccionas una capa, reemplazas una palabra y dejas intacto cada píxel no afectado.

En su lugar, el vídeo de origen se convierte en una referencia. El prompt indica a H3 qué debe conservar y qué debe cambiar, y el modelo genera un clip revisado. Esto puede admitir grandes cambios creativos—un escenario, vestuario, gráficos, sonido o estilo nuevos—pero esos mismos cambios pueden introducir alteraciones de identidad, encuadres modificados, texto mal escrito o pequeños cambios de movimiento.

En una frase: H3 edita mediante regeneración, no modificando quirúrgicamente el archivo original.

Cómo funciona realmente la edición de video con MiniMax H3

Una buena instrucción de edición para H3 tiene dos capas:

  1. Restricciones de preservación: ¿Quién permanece en el clip? ¿Qué detalles del producto, acciones, movimientos de cámara, tiempos y composición deben mantenerse?

  2. Instrucciones de transformación: ¿Qué fondo, vestimenta, estilo visual, tipografía, sonido o atmósfera deberían cambiar?

El prompt de K-pop utiliza esta división deliberadamente. Primero fija el número de intérpretes, sus identidades faciales, la coreografía, los tiempos y el movimiento de cámara. Solo después solicita un nuevo estudio, una dirección de moda, gráficos y tratamiento de audio.

Ese orden importa. “Convierte esto en un video de K-pop futurista” le da al modelo permiso para reinterpretar prácticamente todo. “Conserva exactamente a los tres intérpretes y la coreografía de origen; reemplaza únicamente la dirección artística” le proporciona una jerarquía.

Para ediciones más complejas, cambia una categoría importante a la vez. Primero prueba el fondo y el vestuario. Luego añade la tipografía. Después perfecciona el audio. Una sola solicitud puede hacer las tres cosas, pero separarlas te indica qué instrucción provocó un error y facilita el diagnóstico de los reintentos.

También hay un detalle de costos que los resúmenes de lanzamiento suelen omitir. MiniMax cobra $0.13 por segundo por una salida en 2K, y un video de referencia se cobra con la misma tarifa por segundo según su duración. Por lo tanto, una generación de 15 segundos en 2K cuesta aproximadamente $1.95. Si la solicitud también utiliza un video de referencia de 15 segundos, el cargo combinado por el video de entrada y la salida es de aproximadamente $3.90, antes de cualquier cargo adicional por más de cinco imágenes de referencia. Precios de MiniMax según el uso

Esto no hace que la edición con referencias sea poco razonable, pero sí cambia la forma de planificar las iteraciones. Diez intentos de texto a video de 15 segundos cuestan aproximadamente $19.50 con la tarifa indicada; diez ediciones de la misma duración con un video fuente de 15 segundos cuestan aproximadamente $39.00. Las generaciones de diagnóstico breves son el primer paso más sensato.

¿Qué tipo de videos puede crear MiniMax H3?

H3 puede realizar las tareas habituales de texto a video e imagen a video, pero sus casos de uso más potentes son aquellos que se benefician de varios tipos de referencias o de una línea de tiempo existente.

Revisa una campaña sin volver a filmarlo todo

Una marca puede proporcionar la actuación fuente aprobada y luego solicitar una nueva ubicación, una dirección de vestuario, un tratamiento estacional o un sistema gráfico. Esto resulta útil para crear versiones regionales o específicas para eventos. Es menos adecuado cuando cada etiqueta del producto, detalle facial y gesto debe conservarse con fidelidad a nivel de fotograma.

Convierte imágenes de productos en un video de comercio electrónico

Las imágenes del producto pueden definir su forma, color y empaque, mientras que una referencia de movimiento demuestra cómo debe girar, abrirse, verter, plegarse o desplazarse por la escena. Una imagen final puede ser útil para una tarjeta final fija, aunque actualmente no puede combinarse con entradas de referencia a video en la misma solicitud.

Transfiere una coreografía o un movimiento de cámara

Un clip de referencia puede comunicar una sincronización que requeriría cientos de palabras para describir. La danza, los movimientos deportivos, el comportamiento de una cámara en mano y los movimientos de revelación de productos son candidatos evidentes. Confirma siempre que tienes derecho a utilizar la actuación y la imagen de la fuente.

Crea videos breves de música y moda

La combinación de cambios visuales rápidos, sonido generado, movimiento de referencia y prompts de dirección artística se adapta a los adelantos musicales y las campañas de moda. La tipografía exacta sigue siendo un punto de control de calidad, no algo que deba darse por garantizado.

Anima promociones de videojuegos y pantallas de títulos cinematográficas

Las imágenes de referencia pueden mantener un personaje, objeto o interfaz más cerca de un diseño aprobado, mientras el prompt añade movimiento, desplazamiento de cámara, partículas y sonido. El metraje generado resulta útil para tráilers conceptuales, pero el texto de la interfaz y las secuencias similares a la jugabilidad aún requieren revisión humana.

Genera secuencias de acción o persecución de 15 segundos

La mayor duración le da al prompt suficiente espacio para el planteamiento, la escalada y el desenlace. También dificulta más la continuidad. Los prompts deben dividir la acción en intervalos de tiempo y repetir los rasgos del sujeto que no deben cambiar.

MiniMax H3 para comercio electrónico y publicidad

La forma más útil de pensar en H3 para el comercio electrónico no es “generar un anuncio”. Piensa en ensamblar un brief a partir de varios recursos multimedia.

Entrada Función en el flujo de trabajo
Imágenes del producto Definir la forma, el color, el material y el empaque del producto
Referencias del logotipo o del empaque Delimitar los elementos de marca y la identidad visual
Imágenes del modelo o personaje Mantener la apariencia del presentador más cercana a la imagen aprobada
Video de referencia de movimiento Especificar un gesto de la mano, una demostración, un movimiento de cámara o el ritmo de edición
Referencia de audio Guiar el ritmo, la voz o la dirección sonora
Prompt escrito Indicar la escena final, las reglas de preservación, los cambios y las exclusiones

Por ejemplo, una marca de cosméticos podría proporcionar cinco ángulos limpios del producto, una referencia del modelo, un clip de 6 segundos de movimiento de manos y una breve referencia de audio. Luego, el prompt podría solicitar una presentación vertical del producto de 10 segundos, preservando la forma del frasco, la ubicación de la etiqueta, el color de la tapa, la identidad del modelo y la sincronización del gesto.

Ese es un brief mejor que “crea un anuncio de cosméticos de lujo”. Tampoco es una garantía. La geometría del producto puede deformarse, el texto pequeño de la etiqueta puede cambiar y un logotipo puede desviarse entre fotogramas. Si el resultado se va a convertir en un anuncio pagado, compara el producto con la fotografía aprobada fotograma a fotograma y reemplaza el texto de marca crítico en un editor convencional cuando sea necesario.

H3 resulta especialmente útil aquí como acelerador de producción para conceptos, variantes y recursos breves de campaña. No sustituye la aprobación de la marca.

MiniMax H3 frente a Hailuo 2.3 y Hailuo 02

La diferencia generacional es mayor de lo que sugiere la columna de resolución. Los modelos Hailuo anteriores de MiniMax son generadores de formato corto basados en entradas de texto e imagen. H3 añade un sistema de referencias que puede aceptar video y audio, y después utilizar esos materiales para crear, transferir movimiento o editar.

Capacidad MiniMax H3 Hailuo 2.3 Hailuo 02
Resolución máxima documentada 2K 1080p 1080p
Duración documentada 4–15 segundos 6 segundos a 1080p; 6 o 10 segundos a 768p 6 segundos a 1080p; 6 o 10 segundos a 768p/512p
Frecuencia de fotogramas 24 fps 24 fps 24 fps
Texto a video
Imagen a video
Entrada del primer/último fotograma No aparece como modo principal actual
Video y audio de referencia No aparece en la especificación actual del modelo No aparece en la especificación actual del modelo
Audio generado de forma nativa No indicado No indicado
Edición de video generativa Sí, mediante regeneración basada en referencias No indicado No indicado
Ideal para Briefs multimodales, edición, transferencia de movimiento, audio y clips 2K más largos T2V/I2V cortos con un manejo más sólido de la acción y la expresión Generación corta convencional y opciones de menor resolución

La elección práctica es sencilla:

  • Elige MiniMax H3 cuando la tarea necesite un video existente, varios recursos de referencia, sonido nativo, salida 2K o más de 10 segundos.

  • Elige Hailuo 2.3 cuando solo necesites un clip corto de texto a video o de imagen a video y no necesites el sistema de referencias y edición de H3.

  • Considera Hailuo 02 cuando su flujo del primer/último fotograma o sus precios para resoluciones inferiores se adapten a un flujo de trabajo heredado sencillo.

MiniMax H3 todavía no está disponible a través de GPT Proto. Si necesitas un modelo de video de MiniMax que ya esté disponible allí, prueba Hailuo 2.3 Pro para imagen a video o Hailuo 2.3 Pro para texto a video.

Precios y disponibilidad de MiniMax H3

La API oficial de MiniMax H3 está activa con el ID de modelo MiniMax-H3. La documentación pública de la API indica actualmente que 2K es la resolución de salida disponible. Se ha publicado una tarifa para 768p, pero MiniMax marca esa opción como beta cerrada y recomienda a los usuarios ponerse en contacto con ventas antes de utilizarla.

Elemento Precio publicado
Video de salida 2K $0.13 por segundo
Video de salida 768p $0.09 por segundo; beta cerrada
Referencias de audio Gratis
Imágenes de referencia Las primeras 5 son gratis; $0.04 por cada imagen adicional
Video de referencia $0.13 por segundo de entrada para una solicitud de salida 2K
Generación de texto a video 2K de 15 segundos Aproximadamente $1.95
Video de referencia de 15 segundos + salida 2K de 15 segundos Aproximadamente $3.90

La API utiliza un flujo de trabajo asíncrono: se envía una solicitud de generación, se recibe un ID de tarea, se consulta el estado de la tarea y se descarga el resultado una vez completada correctamente. MiniMax H3 no está disponible actualmente en GPT Proto, por lo que este artículo no incluye un ejemplo de código de GPT Proto ni sugiere que ya exista un endpoint H3 activo en GPT Proto.

El estado de los pesos abiertos también requiere una redacción precisa. MiniMax presenta H3 como un modelo abierto de propósito general y ha anunciado planes para publicar los pesos. Reuters informó que se esperaba que los archivos estuvieran disponibles en cuestión de días. Sin embargo, en la verificación realizada el 31 de julio para este artículo, los pesos descargables, los términos de la licencia, el tamaño del modelo y los requisitos realistas de hardware local aún no se habían confirmado públicamente.

“Pesos abiertos” es, por tanto, la dirección anunciada, no una prueba de que hoy puedas descargar y ejecutar H3 localmente.

Lo que MiniMax H3 aún no garantiza

H3 amplía lo que se puede intentar en una sola generación, pero no elimina los fallos habituales del video generativo.

El texto exacto aún puede requerir varios intentos. El primer ejemplo utiliza deliberadamente solo dos frases cortas. Si esas palabras cambian entre fotogramas, utiliza la generación para el movimiento y añade la tipografía final en un editor normal.

Las ediciones agresivas pueden cambiar la identidad. Sustituir el fondo, el vestuario, el sistema gráfico, el audio y la iluminación en una sola solicitud ofrece al modelo más oportunidades para reinterpretar a las personas de la fuente.

Una toma compleja de 15 segundos es más difícil que una animación sencilla de 6 segundos. Cuanto más largo sea el clip y más eventos contenga, más decisiones de continuidad deberá preservar el modelo.

La edición generada no conserva los píxeles. H3 crea un resultado nuevo a partir de referencias. No es la herramienta adecuada para una edición legal, médica o de cumplimiento normativo de producto en la que todos los píxeles que no se toquen deban permanecer idénticos.

Los ejemplos oficiales no demuestran una fiabilidad de producción repetible. Un video de lanzamiento muestra lo que un modelo puede producir, no cuántos intentos requirió el resultado. La repetibilidad, la tasa de fallos y la sensibilidad a las indicaciones necesitan pruebas independientes.

Los requisitos de implementación local aún se desconocen. Hasta que lleguen los pesos reales, los detalles de la arquitectura, la licencia y las instrucciones de servicio, cualquier recomendación precisa de VRAM será especulativa.

Una señal independiente resulta alentadora: el 31 de julio, MiniMax H3 ocupó el primer puesto en la clasificación de edición de video con audio de Artificial Analysis, con una puntuación Elo de 1.130 basada en 5.043 muestras. Es un resultado útil de preferencia ciega, pero constituye una instantánea, no una garantía para todas las tareas. Clasificación de edición de video de Artificial Analysis

Veredicto final: ¿Es MiniMax H3 una mejora significativa?

Sí. MiniMax H3 supone una mejora mayor respecto a Hailuo 2.3 de lo que sugiere “2K en lugar de 1080p”.

Su razón más importante de existir es la generación y edición basadas en referencias. El texto, las imágenes de producto, una interpretación de origen, la guía de movimiento y el audio ahora pueden contribuir a una sola solicitud de video. Para los equipos de publicidad y comercio electrónico, esto cambia el brief de “genera algo similar” a “conserva estos recursos y esta sincronización, y luego cambia estos elementos creativos específicos”.

El coste es el control. Como H3 regenera el clip, las ediciones pueden afectar a detalles que querías conservar. Las tomas más largas también dejan más espacio para fallos de continuidad, y el video de entrada aumenta el precio de cada intento.

Para una animación sencilla de imagen de 6 segundos, Hailuo 2.3 puede seguir siendo suficiente. Para una campaña multimodal, una transferencia de movimiento, sonido nativo, una revisión de video existente o una secuencia de acción de 15 segundos, H3 es el modelo más relevante que conviene probar.

MiniMax H3 no está disponible actualmente en GPT Proto. Mientras se prepara el acceso, puedes explorar otros modelos de generación de video en la galería de modelos de GPT Proto o visitar GPT Proto para comparar los modelos que ya están disponibles con una sola cuenta.

 

Creative Studio

Genera imágenes, videos y más con APIs de producción.

Comenzar a crear
Creative Studio
Modelos relacionados
Todos los modelos
MiniMax
10% OFF
Claude
20% OFF
Google
40% OFF
Google
40% OFF