MiniMax H3 может генерировать 15-секундное видео в разрешении 2K с нативным стереозвуком. Для заголовка о запуске это звучит эффектно, но разрешение — не самое важное обновление.
Гораздо существеннее то, что можно предоставить модели до начала генерации. H3 принимает в качестве референсов текст, изображения, видео и аудио, а затем использует их для создания или изменения клипа. Вместо того чтобы спрашивать только: “Какое новое видео может сгенерировать эта модель?”, можно спросить: “Какие части этого существующего видео должны остаться, а какие следует изменить?”
Благодаря этому H3 подходит для доработки кампаний, продуктовых видео, переноса движений, музыкальных визуализаций и других задач, которые раньше требовали нескольких отдельных этапов генерации и монтажа. Однако H3 не превращается в редактор таймлайна с точностью до кадра. Его видеомонтаж носит генеративный характер: модель интерпретирует исходник и рендерит новый результат.
Примеры MiniMax H3: два полезных теста
Следующие примеры предназначены для проверки двух разных сторон MiniMax H3. Первый тестирует, может ли H3 сохранить существующее выступление, изменив его художественное направление и добавив точную типографику. Второй проверяет, способен ли он удержать целостность сложной 15-секундной экшен-сцены.
Пример 1: редактирование K-pop-видео с кинетической типографикой
Медиазаполнитель: Вставьте сюда исходный танцевальный клип и отредактированный результат H3.
Входные данные: Одно существующее видео с участием ровно трёх исполнителей
Режим: Из референса в видео
Что меняется: Фон студии, стилистика одежды, графика, типографика и обработка аудио
Что должно остаться: Количество исполнителей, их личности, хореография, тайминг и движение исходной камеры
Отредактируй загруженное исходное видео в формате фэшн-кампании K-pop высокого класса.
Сохрани ровно трёх исполнительниц, их лица и личности, тайминг хореографии, положения тел, выражения лиц и исходное движение камеры. Не добавляй, не удаляй, не дублируй и не объединяй исполнительниц.
Замени исходное окружение на высококонтрастную белую циклораму в модной студии. Одень исполнительниц в согласованные футуристичные чёрные, серебристые и тёмно-красные техно-образы с металлическими панелями, структурированными силуэтами, утилитарными ремнями и светоотражающими аксессуарами.
Добавь выразительную кинетическую типографику, реагирующую на ритм и смену кадров. Используй только точные слова “FEARLESS” и “NO LIMITS”, написанные крупными, безошибочными чёрными буквами узкого гротескного шрифта. Показывай по одной фразе за раз. Пусть типографика скользит, масштабируется и ненадолго проходит за спинами исполнительниц, не закрывая их лица и руки.
Добавь элементы коллажа из рваной бумаги, красные журнальные вырезки, тонкие цифровые линии сканирования и контролируемые эффекты глитч-сигнала на фоне. Подчеркни крупные планы уверенных выражений лиц, жесты с указанием пальцем, детали ремней на ногах и синхронные танцевальные позы, следуя существующей последовательности планов исходного видео.
Яркое студийное освещение, чистые белые блики, чёткая детализация фэшн-фотографии, выразительная текстура ткани, стабильные лица и конечности, динамичный, но контролируемый визуальный ритм. Сохрани исходную продолжительность видео и синхронизацию. Нативный стереозвук с энергичной электронной перкуссией, резкими ударами переходов и тонкими глитч-акцентами.
Это не просто проверка того, способен ли H3 создать привлекательное музыкальное видео. Проверьте, может ли он сохранять различия между тремя людьми во время быстрых движений, удерживать хореографию в соответствии с исходником, правильно писать обе фразы и размещать типографику так, чтобы она неоднократно не закрывала лица или руки.
Эти детали важны, потому что “изменить внешний вид, но сохранить выступление” — вот настоящая задача редактирования. Впечатляющий визуально результат, в котором изменилось количество танцоров или исчез исходный тайминг, не соответствует заданию.
Пример 2: 15-секундная погоня за миниатюрным скейтбордистом
Медиазаполнитель: Вставьте сюда сгенерированный 15-секундный результат H3.
Входные данные: Только текстовый промпт
Режим: Из текста в видео
Что проверяется: Длительное движение, согласованность масштаба, столкновения, окклюзия, сопровождение камерой и синхронизированный окружающий звук
Фотореалистичная 15-секундная сцена погони с миниатюрными объектами, снятая одним непрерывным планом без монтажных склеек.
0–4 секунды: сверхнизкая макрокамера, движущаяся на уровне пола, следует прямо позади крошечного миниатюрного скейтбордиста, плавно едущего по полированному деревянному полу. Скейтбордист и доска остаются хорошо видимыми и сохраняют одинаковые масштаб и внешний вид. Тёплый солнечный свет мягко отражается на древесине. Малая глубина резкости, реалистичная вибрация колёс, лёгкое размытие движения.
4–9 секунд: с обеих сторон на траекторию внезапно начинают падать гигантские разноцветные игрушечные кубики. Скейтбордист наклоняется, уворачивается и едва успевает проскочить между ними, пока большой игрушечный грузовик пересекает передний план. Камера сохраняет темп, не теряя объект из виду. Кубики естественно сталкиваются и отбрасывают реалистичные движущиеся тени.
9–15 секунд: на заднем плане в кадре быстро появляется огромный милый младенец и протягивает одну гигантскую руку к скейтбордисту и камере. Скейтбордист ускоряется, проезжая под приближающейся рукой, а камера продолжает следовать за ним в нескольких сантиметрах над полом. Рука проходит близко к объективу, не касаясь его. Завершите сцену тем, что скейтбордист ускользает под игрушечным грузовиком, а младенец реагирует удивлённым смехом.
На протяжении всей сцены сохраняйте единый масштаб миниатюр, личность скейтбордиста, планировку пола, направление освещения и положения объектов. Реалистичная физика, естественная анатомия руки, детализированные текстуры дерева и игрушек, кинематографичная макроперспектива, тёплый яркий дневной свет в помещении и энергичное, но читаемое движение.
Нативный стереозвук: тихое движение колёс скейтборда по дереву, грохот кубиков слева и справа, гул игрушечного грузовика на переднем плане, мягкий детский смех за камерой и короткий низкий свист приближающейся гигантской руки.
Таймлайн задаёт для H3 более понятную последовательность, чем один абзац с множеством одновременных действий. Тем не менее это сложный промпт. Камера должна следить за одним крошечным объектом, пока несколько гораздо более крупных объектов появляются в кадре, сталкиваются и частично закрывают обзор. При проверке стоит оценивать целостность на переходах в 4-й и 9-й секундах, а не судить только по самому резкому кадру.
Что такое MiniMax H3?
MiniMax H3 — это мультимодальная видеомодель общего назначения, выпущенная MiniMax 31 июля 2026 года. Проще говоря, она может одновременно обрабатывать несколько видов творческих входных данных—текстовые инструкции, статичные изображения, видеоклипы и аудио—и использовать их для создания нового видео.
Это определение отличает H3 от MiniMax M3. H3 — это рассматриваемая здесь модель генерации видео. M3 относится к линейке языковых и кодовых моделей MiniMax. Названия похожи, но задачи разные.
Официальный идентификатор модели API — MiniMax-H3. В текущей документации MiniMax указаны три основных способа генерации: текст-в-видео, изображение-в-видео с первым и/или последним кадром и референс-в-видео. Модель создает видео с частотой 24 кадра/с, поддерживает длительность от 4 до 15 секунд с шагом в одну секунду и в настоящее время предоставляет вывод в разрешении 2K через публичный API. Документация MiniMax H3 по видео
| Спецификация |
MiniMax H3 |
| Официальный идентификатор модели API |
MiniMax-H3 |
| Разрешение вывода |
2K |
| Длительность вывода |
4–15 секунд |
| Частота кадров |
24 кадра/с |
| Типы входных данных |
Текст, изображение, видео, аудио |
| Основные режимы |
Текст-в-видео, изображение-в-видео с первым/последним кадром, референс-в-видео |
| Референсные изображения |
До 9 |
| Референсные видео |
До 3 клипов; всего 15 секунд |
| Референсное аудио |
До 3 клипов; всего 15 секунд |
| Смешанные референсные файлы |
До 12 |
| Длина промпта |
До 7 000 символов |
| Поддерживаемые соотношения сторон вывода |
21:9, 16:9, 4:3, 1:1, 3:4, 9:16 или адаптивное, если поддерживается |
Вы также можете встретить описание H3 как «Hailuo 3.0». Такое обозначение имеет смысл как неформальный способ расположить модель после семейства Hailuo 2.x, однако в текущем списке моделей и документации API MiniMax в качестве официального названия используется MiniMax H3, а не Hailuo 3.0.
Что нового в обновлении MiniMax H3?
Hailuo 2.3 была ориентирована на улучшение физики движений, микроэспрессии людей, стилизованных визуальных эффектов и реакции на команды движения. H3 расширяет область применения продукта. Теперь речь идет не только о создании короткого клипа из текста или одного изображения: модель может использовать существующие медиаданные как рабочий контекст.
1. Вывод в разрешении 2K для клипов длительностью до 15 секунд
MiniMax H3 увеличивает заявленный предел с форматов длительностью 6 или 10 секунд, доступных в старых моделях Hailuo API, до гибкого диапазона от 4 до 15 секунд. Максимальное разрешение также повышено с 1080p до 2K.
Большая длительность не означает автоматически лучшую связность. В 15-секундном кадре у модели больше времени, чтобы изменить лицо, потерять объект или неправильно понять последующее событие. Поэтому во втором примере выше используются последовательность с таймингом и явные ограничения на непрерывность.
2. Нативное стереоаудио
H3 создает звук как часть видео, поэтому полностью отдельный этап генерации аудио не требуется. Reuters сообщает, что нативный стереозвук входит в число возможностей, доступных при выпуске модели. Для короткой рекламы, музыкальных визуализаций и динамичных клипов это может обеспечить более точное соответствие звуковых эффектов событиям, которые их вызвали. Отчет Reuters о запуске
Компромисс заключается в предсказуемости. Нативное аудио сокращает количество этапов рабочего процесса, но не гарантирует точный диалог, идеальную синхронизацию губ или готовый к производству микс при каждой попытке. Если проект зависит от музыки с юридически подтвержденными правами, точной формулировки закадрового текста или строгих стандартов громкости, считайте сгенерированную дорожку черновиком, пока она не пройдет отдельную проверку.
3. Мультимодальная генерация на основе референсов
Запрос референс-в-видео может объединять до 9 изображений, 3 видеоклипов и 3 аудиоклипов при общем ограничении в 12 файлов и общем ограничении в 15 секунд для референсного видео или аудио. Каждый запрос по-прежнему требует текстового промпта. Аудио также нельзя отправить отдельно: вместе с ним должно быть предоставлено как минимум одно референсное изображение или видео.
Это полезно, когда один ресурс не может охватить весь бриф. Изображение продукта может задать объект, изображение модели — человека, исходный клип — движение, а аудиоклип — ритм. Затем в промпте указывается, какие характеристики нужно сохранить и как должна выглядеть итоговая сцена.
Большое количество референсов также создает больше возможностей для конфликта инструкций. Девять изображений не обязательно лучше трех. Если на двух снимках продукта показана разная упаковка или на двух референсах персонажа разные прически, модели приходится угадывать, какой вариант считать приоритетным.
4. Управление первым и последним кадром
H3 поддерживает первый кадр, последний кадр или оба кадра. Это полезно, когда начальная композиция продукта и финальный брендированный кадр уже утверждены, но движение между ними все еще нужно сгенерировать.
Режим первого/последнего кадра и мультимодальный режим референсов — это отдельные пути API. В текущей спецификации MiniMax указано, что их нельзя смешивать в одном запросе. Это ограничение легко упустить: можно зафиксировать начальное и конечное изображения или использовать набор референсных изображений, видео и аудио, но нельзя одновременно использовать обе структуры входных данных. Справочник API MiniMax H3
5. Перенос движения и управление на основе референсного видео
H3 может использовать референсное видео для управления движением, поведением камеры, ритмом монтажа и другой временной информацией. Это открывает практический путь для переноса хореографии, жестов взаимодействия с продуктом, движений камеры и тайминга сцены, которые было бы трудно описать одним текстом.
Это не означает, что исходное движение копируется кадр за кадром. H3 интерпретирует референс и заново генерирует результат. Если хореография должна быть узнаваемой или движение продукта строго утверждено, сравнивайте результат с исходной временной шкалой, а не предполагайте, что «референс» означает точное воспроизведение.
6. Генеративное редактирование видео
Редактирование видео — ключевая особенность H3, но этому термину нужны уточнения. H3 не является обычным редактором, в котором можно выбрать слой, заменить слово и оставить каждый незатронутый пиксель без изменений.
Вместо этого исходное видео становится референсом. В промпте указывается, что H3 должен сохранить, а что изменить, после чего модель генерирует обновленный клип. Это позволяет вносить масштабные творческие изменения—новую обстановку, одежду, графику, звук или стиль—но те же изменения могут привести к смещению идентичности, изменению кадрирования, ошибкам в тексте или небольшим изменениям движения.
Одним предложением: H3 редактирует путем повторной генерации, а не хирургического изменения исходного файла.
Как на самом деле работает редактирование видео в MiniMax H3
Хорошая инструкция для редактирования в H3 состоит из двух уровней:
-
Ограничения по сохранению: Кто остаётся в ролике? Какие детали продукта, действия, движения камеры, временные параметры и композиционные элементы должны сохраниться?
-
Инструкции по преобразованию: Что должно измениться: фон, одежда, визуальный стиль, типографика, звук или атмосфера?
Промпт для K-pop намеренно использует это разделение. Сначала он фиксирует количество исполнителей, черты лиц, хореографию, тайминг и движение камеры. И только затем запрашивает новую студию, направление в одежде, графику и звуковое оформление.
Такой порядок имеет значение. “Преврати это в футуристичное K-pop-видео” даёт модели разрешение переосмыслить практически всё. “Точно сохрани трёх исполнителей и исходную хореографию; замени только художественное оформление” задаёт для неё иерархию.
Для более сложных правок изменяйте по одной основной категории за раз. Сначала протестируйте фон и одежду. Затем добавьте типографику. После этого уточните звук. Один запрос может охватывать все три аспекта, но их разделение позволяет понять, какая именно инструкция вызвала сбой, и упрощает диагностику повторных попыток.
Есть и ещё одна деталь стоимости, которую часто упускают из виду в обзорах запуска. MiniMax взимает $0,13 за секунду за вывод в разрешении 2K, а референсное видео тарифицируется по той же ставке за секунду в зависимости от его длительности. Таким образом, генерация 15-секундного видео в 2K стоит около $1,95. Если в запросе также используется 15-секундное референсное видео, общая стоимость входного видео и вывода составит около $3,90 — до учёта дополнительной платы за более чем пять референсных изображений. Тарифы MiniMax с оплатой по мере использования
Это не делает редактирование по референсу нецелесообразным, но меняет подход к планированию итераций. Десять 15-секундных попыток генерации видео из текста стоят около $19,50 по указанному тарифу; десять редактирований такой же длительности с 15-секундным исходным видео — около $39,00. В качестве первого этапа разумнее использовать короткие диагностические генерации.
Какие видео может создавать MiniMax H3?
H3 подходит для привычных задач преобразования текста в видео и изображения в видео, но особенно полезен в сценариях, где используются несколько типов референсов или уже существующий таймлайн.
Обновление кампании без полной пересъёмки
Бренд может предоставить утверждённое исходное выступление, а затем запросить новую локацию, направление в одежде, сезонное оформление или графическую систему. Это полезно для создания региональных или событийных версий на этапе разработки концепции. Такой подход менее подходит, если каждая этикетка продукта, черта лица и жест должны сохраниться с точностью до каждого кадра.
Превращение изображений продукта в видео для электронной коммерции
Изображения продукта могут определить его форму, цвет и упаковку, а референс движения — показать, как товар должен вращаться, открываться, наливаться, складываться или перемещаться по сцене. Конечное изображение может пригодиться для фиксированной финальной заставки, хотя в настоящее время его нельзя объединить с входными данными для преобразования референса в видео в одном запросе.
Перенос хореографии или движения камеры
Референсный клип может передать тайминг, описание которого заняло бы сотни слов. Очевидные варианты применения — танцы, спортивные движения, поведение ручной камеры и движения камеры при демонстрации продукта. Всегда проверяйте, что у вас есть право использовать исходное выступление и образ исполнителя.
Создание коротких музыкальных и фэшн-видео
Сочетание быстрых визуальных изменений, сгенерированного звука, референсного движения и промптов для художественного оформления хорошо подходит для музыкальных тизеров и фэшн-кампаний. Точная типографика остаётся вопросом контроля качества, а не тем, на что можно безоговорочно рассчитывать.
Анимация игровых промо и кинематографичных титульных экранов
Референсные изображения помогают сохранить персонажа, предмет или интерфейс ближе к утверждённому дизайну, а промпт добавляет движение, перемещение камеры, частицы и звук. Сгенерированные кадры полезны для концептуальных трейлеров, но текст интерфейса и сцены, похожие на игровой процесс, всё ещё требуют проверки человеком.
Генерация 15-секундных сцен действия или погони
Бóльшая длительность даёт промпту достаточно места для завязки, развития и кульминации. Но она также усложняет сохранение непрерывности. В промптах следует разделять действие на временные диапазоны и повторять характеристики объекта, которые не должны изменяться.
MiniMax H3 для электронной коммерции и рекламы
Для электронной коммерции H3 полезнее всего рассматривать не как инструмент, который «создаёт рекламу». Думайте о нём как о средстве сборки брифа из нескольких медиаресурсов.
| Входные данные |
Задача в рабочем процессе |
| Изображения продукта |
Определяют форму, цвет, материал и упаковку продукта |
| Референсы логотипа или упаковки |
Ограничивают использование фирменных знаков и визуальной идентичности |
| Изображения модели или персонажа |
Помогают сохранить внешность ведущего ближе к утверждённому образу |
| Референсное видео движения |
Задаёт жест руки, демонстрацию, движение камеры или ритм монтажа |
| Аудиореференс |
Задаёт темп, голос или звуковое направление |
| Текстовый промпт |
Описывает финальную сцену, правила сохранения, изменения и исключения |
Например, косметический бренд может предоставить пять чистых ракурсов продукта, один референс модели, 6-секундный клип с движением руки и короткий аудиореференс. Затем в промпте можно запросить 10-секундную вертикальную демонстрацию продукта, сохранив форму флакона, расположение этикетки, цвет крышки, личность модели и тайминг жеста.
Это более качественный бриф, чем «создай рекламу элитной косметики». Но и он не даёт гарантии. Геометрия продукта может исказиться, мелкий текст на этикетке — измениться, а логотип — смещаться от кадра к кадру. Если результат станет платной рекламой, сравнивайте продукт с утверждённой фотографией покадрово и при необходимости заменяйте критически важный фирменный текст в обычном редакторе.
Здесь H3 наиболее полезен как ускоритель производства концепций, вариантов и коротких материалов для кампаний. Он не заменяет утверждение со стороны бренда.
MiniMax H3 против Hailuo 2.3 и Hailuo 02
Разница между поколениями больше, чем можно предположить по столбцу разрешения. Предыдущие модели Hailuo от MiniMax — это генераторы коротких роликов, работающие с текстовыми и графическими входными данными. H3 добавляет систему референсов, которая может принимать видео и аудио, а затем использовать эти материалы для создания, переноса движения или редактирования.
| Возможность |
MiniMax H3 |
Hailuo 2.3 |
Hailuo 02 |
| Максимальное заявленное разрешение |
2K |
1080p |
1080p |
| Заявленная длительность |
4–15 секунд |
6 секунд при 1080p; 6 или 10 секунд при 768p |
6 секунд при 1080p; 6 или 10 секунд при 768p/512p |
| Частота кадров |
24 fps |
24 fps |
24 fps |
| Текст-в-видео |
Да |
Да |
Да |
| Изображение-в-видео |
Да |
Да |
Да |
| Входные данные для первого/последнего кадра |
Да |
Не указан как основной текущий режим |
Да |
| Референсные видео и аудио |
Да |
Не указано в текущей спецификации модели |
Не указано в текущей спецификации модели |
| Встроенное генерируемое аудио |
Да |
Не указано |
Не указано |
| Генеративное редактирование видео |
Да, с помощью регенерации на основе референсов |
Не указано |
Не указано |
| Оптимальный вариант |
Мультимодальные задания, редактирование, перенос движения, аудио и более длинные ролики в 2K |
Короткие ролики T2V/I2V с более качественной обработкой действий и мимики |
Обычная генерация коротких роликов и варианты с более низким разрешением |
Практический выбор очевиден:
-
Выбирайте MiniMax H3, если для задачи нужны существующее видео, несколько референсных материалов, встроенный звук, вывод в 2K или ролики длительностью более 10 секунд.
-
Выбирайте Hailuo 2.3, если нужен только короткий ролик из текста или изображения и вам не требуется система референсов и редактирования H3.
-
Рассмотрите Hailuo 02, если для простого устаревшего рабочего процесса подходит сценарий с первым/последним кадром или более низкая цена за разрешение.
MiniMax H3 пока недоступна через GPT Proto. Если вам нужна модель видео от MiniMax, которая уже доступна там, попробуйте Hailuo 2.3 Pro для преобразования изображения в видео или Hailuo 2.3 Pro для преобразования текста в видео.
Цены и доступность MiniMax H3
Официальный API MiniMax H3 уже работает с идентификатором модели MiniMax-H3. В общедоступной документации API в настоящее время указано разрешение вывода 2K. Тариф для 768p опубликован, но MiniMax отмечает этот вариант как закрытую бета-версию и рекомендует связаться с отделом продаж перед его использованием.
| Позиция |
Опубликованная цена |
| Видеовывод в 2K |
$0.13 в секунду |
| Видеовывод в 768p |
$0.09 в секунду; закрытая бета-версия |
| Аудиореференсы |
Бесплатно |
| Референсные изображения |
Первые 5 бесплатно; $0.04 за каждое дополнительное изображение |
| Референсное видео |
$0.13 за входную секунду для запроса с выводом в 2K |
| Генерация 15-секундного видео из текста в 2K |
Около $1.95 |
| 15-секундное референсное видео + 15-секундный вывод в 2K |
Около $3.90 |
API использует асинхронный рабочий процесс: отправьте запрос на генерацию, получите идентификатор задачи, проверяйте статус задачи и скачайте результат после успешного выполнения. MiniMax H3 в настоящее время недоступна в GPT Proto, поэтому эта статья не содержит примера кода GPT Proto и не утверждает, что конечная точка GPT Proto H3 уже работает.
Статус открытых весов также требует точных формулировок. MiniMax представляет H3 как открытую универсальную модель и объявила о планах опубликовать веса. Reuters сообщало, что файлы должны были появиться в течение нескольких дней. Однако на момент проверки 31 июля, проведённой для этой статьи, загружаемые веса, условия лицензии, размер модели и реальные требования к локальному оборудованию ещё не были публично подтверждены.
Таким образом, «открытые веса» — это объявленное направление, а не доказательство того, что H3 уже сегодня можно скачать и запустить локально.
Что MiniMax H3 пока не гарантирует
H3 расширяет возможности, которые можно реализовать в рамках одной генерации, но не устраняет типичные проблемы генеративного видео.
Для точного воспроизведения текста по-прежнему могут потребоваться повторные попытки. В первом примере намеренно используются всего две короткие фразы. Если эти слова меняются от кадра к кадру, используйте генерацию для создания движения, а финальную типографику добавьте в обычном редакторе.
Агрессивное редактирование может изменить идентичность персонажей. Замена фона, одежды, графической системы, аудио и освещения в одном запросе даёт модели больше возможностей переосмыслить людей в исходном материале.
Сложный 15-секундный кадр труднее простой 6-секундной анимации. Чем длиннее ролик и чем больше событий он содержит, тем больше решений о непрерывности должна сохранять модель.
Сгенерированное редактирование не сохраняет пиксели неизменными. H3 создаёт новый результат на основе референсов. Это неподходящий инструмент для юридического, медицинского редактирования или редактирования продукции, где все нетронутые пиксели должны оставаться идентичными.
Официальные примеры не доказывают воспроизводимую надёжность в продакшене. Проморолик показывает, что может создать модель, но не то, сколько попыток потребовалось для получения результата. Воспроизводимость, частоту сбоев и чувствительность к промптам необходимо тестировать независимо.
Требования для локального развёртывания всё ещё неизвестны. Пока не опубликованы реальные веса, сведения об архитектуре, лицензия и рекомендации по обслуживанию, любые точные рекомендации по объёму VRAM остаются предположениями.
Есть один обнадёживающий независимый сигнал: 31 июля MiniMax H3 заняла первое место в рейтинге видеоредактирования с аудио Artificial Analysis, набрав 1 130 Elo на основе 5 043 образцов. Это полезный результат слепого предпочтения, но лишь моментальный снимок, а не гарантия для каждой задачи. Рейтинг видеоредактирования Artificial Analysis
Итоговый вердикт: является ли MiniMax H3 значимым обновлением?
Да. MiniMax H3 — это более существенное обновление по сравнению с Hailuo 2.3, чем можно предположить из формулировки «2K вместо 1080p».
Главная причина существования модели — генерация и редактирование на основе референсов. Текст, изображения продукта, исходное исполнение, указания по движению и аудио теперь могут участвовать в одном запросе на создание видео. Для рекламных команд и команд электронной коммерции это меняет задачу с «сгенерировать что-то похожее» на «сохранить эти материалы и этот тайминг, а затем изменить конкретные творческие элементы».
Цена этого — контроль. Поскольку H3 регенерирует ролик, редактирование может затронуть детали, которые вы хотели сохранить. Более длинные кадры также создают больше возможностей для нарушений непрерывности, а входное видео увеличивает стоимость каждой попытки.
Для простой 6-секундной анимации изображения Hailuo 2.3 может быть достаточно. Для мультимодальной кампании, переноса движения, встроенного звука, редактирования существующего видео или 15-секундной последовательности действий более подходящей моделью для тестирования будет H3.
MiniMax H3 в настоящее время недоступна в GPT Proto. Пока готовится доступ, вы можете изучить другие модели генерации видео в галерее моделей GPT Proto или посетить GPT Proto, чтобы сравнить модели, уже доступные через одну учётную запись.