Лучшие китайские ИИ-модели для изображений: краткий обзор
| Место |
Модель |
Лучше всего подходит для |
Доступ |
Главный компромисс |
| 1 |
Seedream 5.0 Pro |
Лучшей генерации и редактирования в целом |
Только хостинг/API |
Проприетарная |
| 2 |
Qwen Image 2.0 Pro |
Типографики, постеров и инфографики |
Только хостинг/API |
Релиз 2.0 Pro — не открытая контрольная точка Qwen-Image |
| 3 |
HunyuanImage 3.0 Instruct |
Сложных сцен и семантического редактирования |
Открытые веса |
Экстремальные требования к оборудованию |
| 4 |
ERNIE Image |
Развертывания компактной модели с открытыми весами |
Открытые веса, Apache 2.0 |
Ориентирована на преобразование текста в изображение, а не на полноценный процесс редактирования |
| 5 |
HiDream O1 Image |
Единого процесса генерации, редактирования и сохранения сходства объектов |
Открытые веса, MIT |
Более молодая экосистема и неравномерная доступность |
| 6 |
Kling Image 3.0 Omni |
Материалов в 4K и согласованных серий изображений |
Проприетарный продукт |
Ограниченные возможности самостоятельного размещения и гибкости API |
| 7 |
Z-Image Turbo |
Скорости, больших объемов и развертывания на устройствах класса 16 ГБ |
Открытые веса, Apache 2.0 |
Дистилляция снижает разнообразие и гибкость дообучения |
Под «китайской ИИ-моделью для изображений» здесь понимается базовая модель изображений, разработанная компанией или исследовательской лабораторией из Китая. Это не просто модель, принимающая запросы на китайском языке. Разница важна: западная модель может понимать китайский, тогда как модель Alibaba, ByteDance, Tencent, Baidu, Kuaishou или стартапа из Пекина может быть построена на другой архитектуре и иметь иную стратегию выпуска и экосистему развертывания.
Как мы ранжировали модели
Это не копия одного рейтинга. Оценка преобразования текста в изображение не показывает, умеет ли модель сохранять человека при редактировании, отображать двуязычную этикетку товара, работать на доступном оборудовании или надежно вызываться в производственной среде.
Рейтинг учитывает пять факторов:
-
Самостоятельное качество изображений. Результаты слепых тестов человеческих предпочтений от Artificial Analysis и Arena имеют больший вес, чем собственные графики запуска от поставщиков.
-
Редактирование и согласованность с референсами. Производственная модель должна не только создавать привлекательное первое изображение. Она должна выполнять локальные инструкции по редактированию и сохранять защищенные детали.
-
Отображение текста. Мы учитывали типографику на китайском и английском языках, особенно для постеров, упаковки, интерфейсов и инфографики.
-
Скорость, стоимость и развертывание. Открытые веса менее полезны, если модели требуется кластер, который большинство команд не может себе позволить.
-
Фактический доступ. Мы различаем открытые веса, модели только с API и потребительские продукты. «Доступно в приложении» не означает «можно развернуть в собственном стеке».
Так получается рейтинг для реальной творческой работы, а не утверждение, что первое место выигрывает каждый бенчмарк.
1. Seedream 5.0 Pro: лучшая китайская ИИ-модель для изображений в целом
Seedream 5.0 Pro от ByteDance занимает первое место, поскольку лучше любой другой китайской модели в этом списке справляется с большим количеством этапов рабочего процесса. Она может создавать готовые изображения, редактировать референсы, поддерживать сложные макеты и отображать многоязычный текст, не заставляя пользователя переключаться между моделями в середине работы.
Независимые данные убедительны. По состоянию на июль 2026 года Artificial Analysis ставит Seedream 5.0 Pro на восьмое место в мире по качеству преобразования текста в изображение. Arena ставит ее на четвертое место по редактированию одного изображения, после GPT Image 2, Muse Image и MAI Image 2.5. Она не является мировым лидером ни в одной из этих категорий. Однако среди китайских моделей это наиболее сбалансированный вариант в обеих.
В чем Seedream 5.0 Pro превосходит другие модели
Я бы выбрал Seedream для задач, в которых в одном кадре сочетаются несколько требований:
-
товар с читаемой упаковкой;
-
постер с небольшим двуязычным текстом;
-
редактирование персонажа или одежды на основе референса;
-
плотная инфографика с контролируемыми разделами;
-
отполированное рекламное изображение, которое должно выглядеть готовым, а не просто интересным.
Ею также проще пользоваться по всему миру, чем несколькими продуктами, ориентированными прежде всего на Китай. API Seedream 5.0 Pro на GPT Proto сейчас поддерживает результаты в разрешении 1K и 2K по цене $0.0405 и $0.081 за изображение соответственно.
Структура запроса по-прежнему имеет значение. Для новых изображений описывайте весь кадр; при редактировании указывайте целевое изменение и детали, которые должны остаться нетронутыми. В руководстве по запросам Seedream 5.0 Pro это различие объясняется на 17 примерах генерации и редактирования. Если вы предпочитаете просматривать готовые идеи, прежде чем писать запрос с нуля, коллекция запросов Seedream 5.0 Pro объединяет популярные запросы и их визуальные результаты.
Недостатки
Seedream 5.0 Pro является проприетарной моделью. Нельзя скачать ее веса, полностью дообучить модель локально или изучить процесс обучения. Она также не лидирует в каждой независимой категории. GPT Image 2 по-прежнему занимает более высокое место в редактировании изображений, а специализированные типографические модели могут превосходить ее в отдельных задачах по созданию постеров.
Правильный вывод более узкий: Seedream — лучший китайский универсальный вариант, но не лучшая в мире модель для каждой задачи с изображениями.
Кому стоит ее использовать
Выбирайте Seedream 5.0 Pro, если вам нужна одна размещенная на хостинге модель для маркетинговых материалов, фотографий товаров для электронной коммерции, многоязычных постеров, качественного редактирования и готовых к производству ключевых кадров. Не выбирайте ее, если принципиально важны владение моделью, автономный вывод или собственное дообучение.
2. Qwen Image 2.0 Pro: лучшая модель для типографики и структурированного дизайна
Qwen Image получила известность благодаря отображению текста. В исходном релизе Qwen-Image была представлена базовая модель изображений на 20B параметров, ориентированная на сложный текст и точное редактирование. Более поздний релиз Qwen Image 2.0 Pro развивает семейство в направлении нативного вывода в 2K, более плотных композиций, многоязычной типографики и готовых коммерческих материалов.
В категории отображения текста Arena версия Qwen Image 2.0 Pro, выпущенная в июне 2026 года, находится близко к Seedream 5.0 Pro. Ее преимущество связано не столько с общей визуальной привлекательностью, сколько с точным выполнением структурированного задания: заголовок, подзаголовок, подписи, области диаграмм, размещение товара и визуальная иерархия.
Где Qwen работает особенно хорошо
Qwen Image 2.0 Pro — более сильный выбор для:
-
двуязычных постеров на китайском и английском;
-
инфографики и презентационной графики;
-
меню, упаковки и карточек товаров;
-
комиксов с диалогами;
-
изображений, где слова являются частью композиции, а не второстепенной деталью.
Это не означает, что каждый созданный абзац будет идеальным. Длинный текст внутри изображений по-прежнему требует проверки, а дизайнеру следует проверить кернинг, пунктуацию и мелкие символы перед публикацией.
Qwen Image 2.0 Pro — не то же самое, что открытая Qwen-Image
Это ловушка с версиями, которую упускает большинство подобных списков.
Исходная Qwen-Image и некоторые более поздние контрольные точки имеют веса, доступные для скачивания. Не следует автоматически называть Qwen Image 2.0 Pro моделью с открытым исходным кодом или открытыми весами. Это более поздний проприетарный релиз, распространяемый через размещенные сервисы. Название семейства Qwen не гарантирует одинаковую лицензию для каждой версии.
Это различие меняет решение о покупке. Если вам нужен более новый уровень качества Qwen, планируйте использование размещенного вывода. Если требуется локальное развертывание, изучите подтвержденную открытую контрольную точку, например Qwen Image Max 2512 или исходную Qwen-Image, вместо того чтобы считать, что версия с пометкой «Pro» доступна для скачивания.
Недостатки
Qwen Image 2.0 Pro является более узкой рекомендацией, чем Seedream. Она превосходна, когда основное внимание уделяется макету и типографике, но для широкого спектра фотографических задач у нее нет таких же независимых подтверждений стабильности редактирования высшего уровня.
3. HunyuanImage 3.0 Instruct: лучшая для сложных сцен и семантического редактирования
HunyuanImage 3.0 Instruct от Tencent — самая амбициозная модель в этом рейтинге. Она использует унифицированную авторегрессионную мультимодальную архитектуру вместо традиционного конвейера обработки изображений, благодаря чему может понять входное изображение, переписать короткий запрос, рассуждать над необходимым изменением и создать результат в рамках одной системы.
В официальной карточке модели описана смесь экспертов на 80B параметров с 13B активных параметров на токен. Она поддерживает преобразование текста в изображение, преобразование текста и изображения в изображение, переписывание запросов и планирование в стиле пошагового рассуждения.
Это делает ее интересной для сложных запросов:
-
разместить несколько названных объектов в точных пространственных отношениях;
-
изменить объект с учетом освещения и перспективы сцены;
-
объединить несколько референсов, не потеряв роль каждого;
-
превратить короткую инструкцию в более полный визуальный план;
-
проанализировать сцену перед ее визуализацией.
Результат бенчмарка требует контекста
HunyuanImage 3.0 Instruct не занимает верхние позиции в текущем рейтинге преобразования текста в изображение среди моделей с открытыми весами. Artificial Analysis ставит ее ниже HiDream O1 Image Dev и ERNIE Image по предпочтениям при чистом преобразовании текста в изображение. Поэтому третье место в этом рейтинге — это оценка ее широты возможностей семантического редактирования и мультимодального рассуждения, а не утверждение, что она создает самые красивые изображения по любому запросу.
Если ваша задача — простая генерация изображений из текста, ERNIE Image легче обосновать. Если же рабочий процесс включает сложные правки и инструкции с несколькими изображениями, Hunyuan становится интереснее.
Стоимость оборудования очень высока
В официальной таблице развертывания для HunyuanImage 3.0 Instruct рекомендуется как минимум восемь GPU по 80 ГБ. Это не модель для случайного локального использования. Базовая контрольная точка для преобразования текста в изображение легче, но для нее все равно рекомендуются три GPU по 80 ГБ.
Открытые веса снимают одно ограничение и создают другое: инфраструктурное. Если ваша команда уже не управляет серьезным GPU-кластером, рациональным выбором будет размещенный вывод или более компактная модель.
4. ERNIE Image: лучшая компактная китайская модель изображений с открытыми весами
ERNIE Image от Baidu — скрытая жемчужина этого списка. Она имеет основу Diffusion Transformer на 8B параметров, лицензию Apache 2.0 и четкую ориентацию на выполнение инструкций и визуальные материалы с большим количеством текста. В официальной карточке модели выделяется поддержка плотного, длинного текста и текста, чувствительного к макету, для постеров, инфографики, интерфейсов и похожих дизайнов.
Независимые результаты подтверждают это утверждение. В июльском рейтинге моделей с открытыми весами от Artificial Analysis ERNIE Image занимает пятое место в целом и второе среди китайских моделей в открытой группе этой статьи, уступая HiDream O1 Image Dev 2604.
Почему важна эта модель на 8B параметров
ERNIE Image не пытается победить за счет огромного масштаба. Ее привлекательность — в соотношении качества и операционной нагрузки. Модель на 8B параметров проще оценивать, квантизировать и интегрировать, чем систему Hunyuan на 80B параметров с архитектурой MoE.
Она хорошо подходит для:
-
команд, создающих внутренний конвейер обработки изображений;
-
китайского, английского или японского текста внутри графики;
-
самостоятельно размещаемой генерации постеров и инфографики;
-
исследователей, которым нужны проверяемые веса;
-
разработчиков, которым нужна либеральная лицензия.
ERNIE Image и ERNIE Image Turbo
Стандартная модель ориентирована на качество. ERNIE Image Turbo — дистиллированная версия на 8 шагов для более быстрой генерации. Выбирайте Turbo, когда важнее задержка или пропускная способность, чем последний прирост качества; стандартную модель — для финальных материалов.
Компромисс связан с диапазоном возможностей. ERNIE Image в первую очередь является моделью преобразования текста в изображение. Это не самый полный вариант для редактирования по нескольким референсам, персонализации объектов или последовательности разговорных правок.
5. HiDream O1 Image: лучшая новая унифицированная открытая модель изображений
HiDream.ai — лаборатория из Пекина, а HiDream O1 Image — одна из наиболее технически интересных китайских ИИ-моделей для изображений, выпущенных в 2026 году. Ее унифицированный трансформер на уровне пикселей помещает пиксели, текст и условия задачи в общее пространство токенов. В ней нет внешнего VAE и отдельного текстового энкодера.
Согласно официальной карточке модели, модель под лицензией MIT поддерживает генерацию изображений из текста, редактирование по инструкциям, персонализацию на основе объекта, несколько референсов, управление макетом и вывод до 2048 × 2048.
Почему HiDream — больше, чем очередная контрольная точка преобразования текста в изображение
Модель построена вокруг единого непрерывного рабочего процесса. Можно создать объект, отредактировать изображение, сохранить этот объект в новых сценах и использовать дополнительные референсы для управления макетом или скелетом.
Ее контрольная точка Dev 2604 сейчас занимает третье место в таблице моделей с открытыми весами для преобразования текста в изображение Artificial Analysis, опережая ERNIE Image и HunyuanImage 3.0. Поэтому HiDream сложно считать лишь исследовательским экспериментом.
Чего не доказывают бенчмарки
Лучший независимый результат преобразования текста в изображение принадлежит контрольной точке Dev 2604, тогда как полная унифицированная модель занимает более низкое место в том же рейтинге. Разные варианты оптимизированы под разные задачи. Не переносите результат одной контрольной точки на все семейство.
Экосистема также остается молодой. Документация, доступность через хостинг, квантизация и сторонние рабочие процессы еще формируются. Я бы протестировал HiDream для новой открытой визуальной системы, но не переносил бы производственный конвейер без предварительного запуска фиксированного набора регрессионных тестов.
6. Kling Image 3.0 Omni: лучшая для производственных материалов в 4K
Kuaishou больше известна на международном рынке благодаря видео Kling, но ее актуальные модели изображений заслуживают отдельного внимания. В объявлении Kuaishou от февраля 2026 года были представлены Image 3.0 и Image 3.0 Omni с выводом в разрешении 2K и 4K.
Различие между двумя версиями имеет практический характер:
-
Kling Image 3.0 поддерживает генерацию, локальное повторное редактирование, перенос стиля, референсы портретов и смешивание нескольких изображений.
-
Kling Image 3.0 Omni добавляет прямой вывод в высоком разрешении и рабочие процессы с сериями изображений для согласованных персонажей, товаров и окружения.
В официальном руководстве Omni показаны элементы управления ракурсами, кадрированием, фокусным расстоянием, освещением, выражением лица, работой с несколькими референсами и сериями изображений в стиле раскадровки.
Где подходит Kling
Kling Image 3.0 Omni наиболее уместна, когда статичные изображения связаны с более крупной визуальной последовательностью:
-
коммерческими раскадровками;
-
оборотами персонажей и листами с несколькими ракурсами;
-
изображениями для кампаний, в которых используется один и тот же товар;
-
согласованными кадрами, которые впоследствии могут стать референсами для видео;
-
материалами в 4K, для которых не нужен отдельный апскейлер.
Ограничение — доступ
Kling Image 3.0 Omni является проприетарной моделью. Ее ценность связана с продуктовой средой Kling и поддерживаемым коммерческим доступом, а не с локальным развертыванием. Не путайте ее со старыми открытыми исследовательскими проектами и не предполагайте, что API Kling для видео автоматически включает последнюю модель изображений.
7. Z-Image Turbo: лучшая для скорости и недорогого развертывания
Z-Image Turbo создана группой Tongyi-MAI компании Alibaba. Это дистиллированная модель на 6B параметров, которой требуется всего восемь вычислений функции. В официальной карточке модели заявлены вывод менее чем за секунду на H800 и поддержка потребительского оборудования класса 16 ГБ видеопамяти. Модель выпущена под лицензией Apache 2.0.
Такое сочетание делает ее необычно доступной. Z-Image Turbo подходит для:
-
массового создания миниатюр и вариантов для социальных сетей;
-
быстрого перебора запросов;
-
внутренних инструментов, где важна задержка;
-
локальных экспериментов на одной потребительской GPU;
-
генерации двуязычного текста на китайском и английском;
-
приложений, где стоимость инфраструктуры на изображение важнее максимальной точности.
Компромисс в качестве, стоящий за Turbo
Дистилляция — одновременно преимущество и ограничение. В официальном сравнении Turbo описывается как модель генерации за восемь шагов с меньшим разнообразием и без предполагаемого пути дообучения, тогда как базовая контрольная точка Z-Image использует больше шагов и сохраняет больше возможностей управления.
Artificial Analysis сейчас ставит Z-Image Turbo на восемнадцатое место в рейтинге моделей с открытыми весами для преобразования текста в изображение, ниже ERNIE Image, HiDream O1 Image и HunyuanImage 3.0 Instruct. Поэтому честный вывод прост:
Z-Image Turbo — одна из самых простых для развертывания китайских моделей изображений, но не самая красивая китайская модель изображений в 2026 году. Выбирать ее стоит ради скорости.
Лучшая китайская ИИ-модель для изображений по сценариям использования
| Сценарий |
Лучший выбор |
Почему |
| Лучший вариант в целом |
Seedream 5.0 Pro |
Сильная генерация, редактирование, макеты и доступ через хостинг |
| Постеры и многоязычная типографика |
Qwen Image 2.0 Pro |
Структурированная композиция и отображение текста |
| Сложное мультимодальное редактирование |
HunyuanImage 3.0 Instruct |
Понимание изображений, переписывание запросов и семантическое планирование |
| Компактное развертывание модели с открытыми весами |
ERNIE Image |
Модель на 8B параметров, Apache 2.0, сильный результат с большим количеством текста |
| Унифицированная открытая генерация и редактирование |
HiDream O1 Image |
Одна модель для генерации, правок и персонализации объектов |
| Раскадровки и серии изображений в 4K |
Kling Image 3.0 Omni |
Вывод в высоком разрешении и согласованность серии |
| Быстрая локальная генерация |
Z-Image Turbo |
6B параметров, восемь шагов и развертывание на устройствах класса 16 ГБ |
Если вам нужна только одна рекомендация, используйте Seedream 5.0 Pro. Если требуется локальное владение моделью, начните с ERNIE Image для простой системы преобразования текста в изображение или с HiDream O1 Image для более широкого процесса генерации и редактирования.
Открытые веса или размещенный API: что выбрать?
Выбирайте открытые веса, если вам нужны автономный вывод, собственное дообучение, частная инфраструктура или полный контроль над версиями модели. ERNIE Image, HiDream O1 Image, HunyuanImage 3.0 Instruct и Z-Image Turbo предлагают контрольные точки для скачивания, но требования к оборудованию у них сильно различаются.
Выбирайте размещенный API, если вам нужны быстрая интеграция, предсказуемые операции и доступ к проприетарным моделям, таким как Seedream 5.0 Pro. Вариант с API избавляет от закупки GPU и работы по обслуживанию модели, хотя создает зависимость от поставщика и расходы в зависимости от использования.
Одного слова «открытая» недостаточно. Проверьте четыре отдельных пункта:
-
Можно ли скачать веса модели?
-
Подходит ли лицензия для коммерческого использования?
-
Может ли ваше оборудование запускать модель в необходимом разрешении?
-
Включает ли открытый релиз те же возможности, что и флагманская размещенная версия?
Qwen — наиболее наглядное предупреждение. Наличие открытой контрольной точки Qwen-Image не делает Qwen Image 2.0 Pro открытой. Проверка на уровне версии надежнее предположений на уровне семейства.
Китайские ИИ-модели для изображений в сравнении с GPT Image и Gemini
Китайские модели изображений больше не относятся к отдельной нижней категории, однако независимые результаты не позволяют объявить их универсальными победителями.
Seedream 5.0 Pro занимает восьмое место в Artificial Analysis по преобразованию текста в изображение и четвертое место в Arena по редактированию одного изображения. GPT Image 2 возглавляет таблицу редактирования Arena. Это означает, что лучшая китайская модель конкурирует с мировыми лидерами, но все еще уступает им в некоторых широких тестах предпочтений.
У китайских моделей есть три особенно сильные стороны:
-
Двуязычная и нелатинская типографика. Seedream, Qwen, ERNIE и Z-Image явно ориентированы на китайский и английский текст.
-
Разнообразие моделей с открытыми весами. ERNIE, HiDream, Hunyuan и Z-Image дают разработчикам больше возможностей для самостоятельного размещения, чем ведущие проприетарные западные семейства моделей изображений.
-
Специализация на творческих рабочих процессах. Инструменты Kling для серий изображений и работа Seedream с плотными макетами рассчитаны на практические контентные конвейеры, а не только на привлекательные одиночные изображения.
GPT Image и Gemini остаются более безопасным выбором по умолчанию для команд, уже использующих соответствующие экосистемы, или для задач, в которых их возможности редактирования и мультимодального поведения уже проверены. Вопрос не в том, «Китай или Запад?», а в том, «Какая модель реже всего ошибается на моем фиксированном наборе запросов и правок?»
Китайские модели изображений, не вошедшие в топ-7
Kolors
Исходная Kolors от Kuaishou остается важной открытой моделью изображений, но больше не является текущим флагманом компании. Кроме того, часто повторяемое название «Kolors 2.1» не имеет такой же четкой официальной истории выпуска, как Kling Image 3.0. Мы предпочитаем включать в рейтинг подтвержденную актуальную модель, а не повторять сомнительную маркировку версии.
Janus Pro
Janus Pro полезна для мультимодальных исследований, но по качеству генерации изображений теперь значительно уступает более новым специализированным моделям. Artificial Analysis помещает ее ближе к концу текущей таблицы моделей изображений с открытыми весами. Ей место в обсуждении мультимодальных архитектур, а не в рейтинге творческих моделей 2026 года.
Step Image Edit 2
Step Image Edit 2 — заметная китайская модель для редактирования, которая может заслуживать отдельного сравнения в категории «лучшие модели для редактирования изображений». Это не универсальная базовая модель преобразования текста в изображение, поэтому ее включение в этот список означало бы награду специализированной модели за другую задачу.
Старые версии Seedream и Qwen-Image
Seedream 4.5, Qwen Image Max 2512 и исходная Qwen-Image по-прежнему полезны. Они не вошли в основной список, поскольку этот рейтинг отдает предпочтение самой сильной актуальной версии семейства, если только старая открытая контрольная точка не предлагает явно иное преимущество в развертывании.
Как получить доступ к Seedream 5.0 Pro через GPT Proto
GPT Proto в настоящее время не заявляет о размещении каждой конкретной модели из этой семерки. Модель из списка, доступная в качестве прямой рекомендации, — Seedream 5.0 Pro, использующая строку модели dola-seedream-5-0-pro-260628.
Самый простой первый запрос использует синхронный режим:
curl --location \
'https://gptproto.com/api/v3/doubao/dola-seedream-5-0-pro-260628/text-to-image' \
--header "Authorization: $GPTPROTO_API_KEY" \
--header 'Content-Type: application/json' \
--data '{
"prompt": "Square editorial product photograph of a translucent perfume bottle on wet slate, dramatic side light, realistic glass refraction, fine water droplets, restrained charcoal and silver palette, no text",
"size": "1024x1024",
"enable_base64_output": false,
"enable_sync_mode": true
}'
Маршрут /api/v3/ использует исходный ключ GPT Proto в заголовке Authorization без префикса Bearer. Для других китайских моделей изображений проверьте каталог моделей GPT Proto, чтобы узнать точную актуальную строку модели, вместо того чтобы подставлять название семейства из этой статьи.
Итоговый вердикт
Seedream 5.0 Pro — лучшая китайская ИИ-модель для изображений в 2026 году для большинства профессиональных пользователей. Она выигрывает благодаря хорошей работе с несколькими связанными задачами — генерацией, редактированием, макетами, типографикой и референсами — и при этом остается простой для доступа через размещенный API.
Используйте Qwen Image 2.0 Pro, когда важнее всего типографика и структурированный дизайн. Выбирайте ERNIE Image, если нужна компактная открытая контрольная точка с удобными коммерческими условиями. Используйте HiDream O1 Image, если хотите экспериментировать с одной открытой моделью для генерации, редактирования и сохранения сходства объектов. HunyuanImage 3.0 Instruct — амбициозный семантический редактор, но его требования к оборудованию сложно оправдать. Kling Image 3.0 Omni — специалист по производственным материалам высокого разрешения. Z-Image Turbo — выбор для высокой пропускной способности.
Ни один бенчмарк не заменит собственный набор регрессионных тестов. Проверьте на каждой кандидатуре один и тот же постер, снимок товара, сцену с несколькими персонажами, правку с сохранением идентичности и запрос на пакетную генерацию миниатюр. Лучшая модель — та, которая создает меньше всего непригодных результатов при приемлемых для вашего рабочего процесса качестве, скорости и стоимости.