Краткий обзор лучших китайских ИИ-моделей для изображений
| Рейтинг |
Модель |
Лучше всего подходит для |
Доступ |
Главный компромисс |
| 1 |
Seedream 5.0 Pro |
Лучшее общее качество генерации и редактирования |
Только через хостинг/API |
Проприетарная модель |
| 2 |
Qwen Image 2.0 Pro |
Типографика, постеры и инфографика |
Только через хостинг/API |
Релиз 2.0 Pro — не открытый чекпойнт Qwen-Image |
| 3 |
HunyuanImage 3.0 Instruct |
Сложные сцены и семантическое редактирование |
Открытые веса |
Экстремальные требования к оборудованию |
| 4 |
ERNIE Image |
Компактное развёртывание модели с открытыми весами |
Открытые веса, Apache 2.0 |
Ориентирована на преобразование текста в изображение, а не на полноценное редактирование |
| 5 |
HiDream O1 Image |
Единая генерация, редактирование и согласованность объектов |
Открытые веса, MIT |
Молодая экосистема и неравномерная доступность |
| 6 |
Kling Image 3.0 Omni |
Материалы 4K и согласованные серии изображений |
Проприетарный продукт |
Ограниченные возможности самостоятельного развёртывания и API |
| 7 |
Z-Image Turbo |
Скорость, большой объём задач и развёртывание на системах с 16 ГБ памяти |
Открытые веса, Apache 2.0 |
Дистилляция снижает разнообразие и гибкость тонкой настройки |
В этой статье «китайская ИИ-модель для изображений» означает базовую модель изображений, разработанную компанией или исследовательской лабораторией из Китая. Это не просто модель, которая принимает запросы на китайском языке. Различие важно: западная модель может понимать китайский язык, тогда как модель Alibaba, ByteDance, Tencent, Baidu, Kuaishou или стартапа из Пекина может быть создана с расчётом на другую архитектуру, стратегию выпуска и экосистему развёртывания.
Как мы ранжировали модели
Это не копия одного рейтинга. Оценка преобразования текста в изображение не показывает, умеет ли модель сохранять внешность человека при редактировании, отображать двуязычную этикетку товара, работать на доступном оборудовании или стабильно вызываться в производственной среде.
Рейтинг учитывает пять факторов:
-
Независимое качество изображений. Результаты слепых оценок пользователей от Artificial Analysis и Arena имеют больший вес, чем собственные графики запуска поставщика.
-
Согласованность при редактировании и работе с референсами. Производственная модель должна не только создавать привлекательное первое изображение. Она должна выполнять локальные инструкции по редактированию и сохранять защищённые детали.
-
Отображение текста. Мы учитывали типографику на китайском и английском языках, особенно для постеров, упаковки, интерфейсов и инфографики.
-
Скорость, стоимость и развёртывание. Открытые веса менее полезны, если модели требуется кластер, который большинство команд не может себе позволить.
-
Фактическая доступность. Мы различаем модели с открытыми весами, модели, доступные только через API, и потребительские продукты. «Доступно в приложении» не означает «можно развернуть в собственном стеке».
Так формируется рейтинг для реальных творческих задач, а не утверждение, что модель на первом месте выигрывает каждый бенчмарк.
1. Seedream 5.0 Pro: лучшая китайская ИИ-модель для изображений в целом
Seedream 5.0 Pro от ByteDance занимает первое место, поскольку охватывает больше этапов рабочего процесса, чем любая другая китайская модель в этом списке. Она может создавать готовые изображения, редактировать референсы, сохранять сложные макеты и отображать многоязычный текст, не заставляя пользователя переключаться между моделями в середине задачи.
Независимые данные убедительны. По состоянию на июль 2026 года Artificial Analysis ставит Seedream 5.0 Pro на восьмое место в мире по качеству преобразования текста в изображение. Arena ставит её на четвёртое место в редактировании одного изображения, после GPT Image 2, Muse Image и MAI Image 2.5. Она не является мировым лидером ни в одной из категорий. Однако это самая сбалансированная китайская модель по обоим направлениям.
В чём преимущество Seedream 5.0 Pro
Я бы выбрал Seedream для задач, где в одном кадре сочетаются несколько требований:
-
товар и читаемая упаковка;
-
постер с небольшим двуязычным текстом;
-
редактирование персонажа или одежды на основе референса;
-
плотная инфографика с контролируемыми разделами;
-
отточенное рекламное изображение, которое должно выглядеть завершённым, а не просто интересным.
Ею также проще пользоваться по всему миру, чем некоторыми продуктами, ориентированными прежде всего на китайский рынок. API Seedream 5.0 Pro в GPT Proto сейчас поддерживает изображения 1K и 2K по цене $0.0405 и $0.081 за изображение соответственно.
Структура запроса по-прежнему важна. Для новых изображений описывайте весь кадр; при редактировании указывайте целевое изменение и детали, которые должны остаться нетронутыми. В руководстве по запросам Seedream 5.0 Pro это различие объясняется на 17 примерах генерации и редактирования. Если вы предпочитаете просматривать готовые идеи перед написанием запроса с нуля, коллекция запросов Seedream 5.0 Pro объединяет популярные запросы и соответствующие визуальные результаты.
Недостатки
Seedream 5.0 Pro является проприетарной моделью. Нельзя скачать её веса, самостоятельно дообучить полную модель локально или изучить процесс обучения. Она также не лидирует во всех независимых категориях. GPT Image 2 по-прежнему занимает более высокое место в редактировании изображений, а специализированные типографические модели могут превосходить её в отдельных задачах с постерами.
Правильный вывод более узкий: Seedream — лучший универсальный вариант среди китайских моделей, но не лучшая в мире модель для каждой задачи с изображениями.
Кому подойдёт
Выбирайте Seedream 5.0 Pro, если вам нужна одна хостинговая модель для маркетинговых материалов, фотографий товаров для электронной коммерции, многоязычных постеров, качественного редактирования и готовых к производству ключевых кадров. Не выбирайте её, если владение моделью, офлайн-вывод или пользовательская тонкая настройка являются обязательными требованиями.
2. Qwen Image 2.0 Pro: лучшая для типографики и структурированного дизайна
Qwen Image завоевала репутацию благодаря отображению текста. Оригинальный релиз Qwen-Image представил базовую модель изображений на 20 млрд параметров, ориентированную на сложный текст и точное редактирование. Более поздний релиз Qwen Image 2.0 Pro развивает семейство в сторону нативного вывода 2K, более плотных композиций, многоязычной типографики и готовых коммерческих материалов.
В категории отображения текста Arena сборка Qwen Image 2.0 Pro от июня 2026 года находится близко к Seedream 5.0 Pro. Её преимущество заключается не столько в общей привлекательности, сколько в соблюдении структурированного задания: заголовка, подзаголовка, подписей, областей диаграмм, размещения товара и визуальной иерархии.
В чём Qwen особенно хороша
Qwen Image 2.0 Pro лучше подходит для:
-
двуязычных постеров на китайском и английском;
-
инфографики и презентационной графики;
-
меню, упаковки и карточек товаров;
-
комиксных панелей с диалогами;
-
изображений, где слова являются частью композиции, а не второстепенной деталью.
Это не означает, что каждый сгенерированный абзац будет идеальным. Длинный текст внутри изображений всё ещё нужно вычитывать, а дизайнеру следует проверить кернинг, пунктуацию и мелкие символы перед публикацией.
Qwen Image 2.0 Pro — не то же самое, что открытая Qwen-Image
Это ловушка с версиями, которую упускает большинство подобных списков.
Оригинальная Qwen-Image и некоторые более поздние чекпойнты доступны для скачивания. Qwen Image 2.0 Pro не следует автоматически описывать как модель с открытым исходным кодом или открытыми весами. Это более поздний проприетарный релиз, распространяемый через хостинговые сервисы. Название семейства Qwen не гарантирует одинаковую лицензию для каждой версии.
Это различие влияет на решение о покупке. Если вам нужен более новый уровень качества Qwen, рассчитывайте на хостинговый вывод. Если требуется локальное развёртывание, изучите подтверждённый открытый чекпойнт, например Qwen Image Max 2512 или оригинальную Qwen-Image, а не предполагайте, что версия с пометкой «Pro» доступна для скачивания.
Недостатки
Qwen Image 2.0 Pro уже, чем Seedream, если говорить об общей рекомендации. Она превосходна, когда в задании главными являются макет и типографика, но для широкого спектра фотографических задач у неё нет столь же убедительных независимых подтверждений стабильности редактирования высшего уровня.
3. HunyuanImage 3.0 Instruct: лучшая для сложных сцен и семантического редактирования
HunyuanImage 3.0 Instruct от Tencent — самая амбициозная модель в этом рейтинге. Она использует единую мультимодальную авторегрессионную архитектуру вместо обычного конвейера обработки изображений, благодаря чему может понять входное изображение, переписать краткий запрос, рассуждать о требуемом изменении и создать результат в рамках одной системы.
В официальной карточке модели описана модель mixture-of-experts на 80 млрд параметров с 13 млрд активных параметров на токен. Она поддерживает преобразование текста в изображение, преобразование текста и изображения в изображение, переписывание запросов и планирование в стиле цепочки рассуждений.
Это делает её интересной для сложных запросов:
-
размещение нескольких названных объектов в точных пространственных отношениях;
-
редактирование объекта с учётом освещения и перспективы сцены;
-
объединение нескольких референсов без потери роли каждого из них;
-
преобразование короткой инструкции в более полный визуальный план;
-
анализ сцены перед её визуализацией.
Результат бенчмарка требует контекста
HunyuanImage 3.0 Instruct не занимает высоких позиций в текущем рейтинге моделей с открытыми весами для преобразования текста в изображение. Artificial Analysis ставит её ниже HiDream O1 Image Dev и ERNIE Image по предпочтениям в чистой генерации из текста. Поэтому третье место в этом списке — это оценка её широты семантического редактирования и мультимодального рассуждения, а не утверждение, что она создаёт самое красивое изображение по любому запросу.
Если ваша задача — простая генерация изображений из текста, ERNIE Image легче обосновать как выбор. Если же рабочий процесс включает сложные правки и инструкции с несколькими изображениями, Hunyuan становится интереснее.
Стоимость оборудования очень высока
В официальной таблице развёртывания рекомендуется как минимум восемь GPU по 80 ГБ для HunyuanImage 3.0 Instruct. Это совсем не модель для случайного локального запуска. Базовый чекпойнт для преобразования текста в изображение легче, но всё равно требует трёх GPU по 80 ГБ.
Открытые веса снимают одно ограничение и создают другое: инфраструктурное. Если ваша команда уже не управляет серьёзным GPU-кластером, рациональнее выбрать хостинговый вывод или более компактную модель.
4. ERNIE Image: лучшая компактная китайская модель с открытыми весами
ERNIE Image от Baidu — скрытая находка этого списка. Она использует Diffusion Transformer с основой на 8 млрд параметров, распространяется по лицензии Apache 2.0 и чётко ориентирована на следование инструкциям и визуальные материалы с большим количеством текста. В официальной карточке модели подчёркивается поддержка плотного, длинного и чувствительного к макету текста для постеров, инфографики, интерфейсов и подобных дизайнов.
Независимые результаты подтверждают это утверждение. В июльском рейтинге Artificial Analysis для моделей с открытыми весами ERNIE Image занимает пятое место в целом и второе среди китайских моделей в открытой группе этой статьи, уступая HiDream O1 Image Dev 2604.
Почему важна эта модель на 8 млрд параметров
ERNIE Image не пытается победить за счёт огромного масштаба. Её привлекательность — в соотношении качества и эксплуатационной нагрузки. Модель на 8 млрд параметров проще тестировать, квантовать и интегрировать, чем систему Hunyuan на 80 млрд параметров с архитектурой MoE.
Она хорошо подходит для:
-
команд, создающих внутренний конвейер обработки изображений;
-
графики с китайским, английским или японским текстом;
-
самостоятельной генерации постеров и инфографики;
-
исследователей, которым нужны проверяемые веса;
-
разработчиков, которым нужна разрешительная лицензия.
ERNIE Image и ERNIE Image Turbo
Стандартная модель ориентирована на качество. ERNIE Image Turbo — дистиллированный релиз с восемью шагами для более быстрой генерации. Выбирайте Turbo, когда важнее задержка или пропускная способность, чем последний прирост качества; стандартную модель — для финальных материалов.
Компромисс связан с диапазоном возможностей. ERNIE Image — прежде всего модель преобразования текста в изображение. Это не самый полный вариант для редактирования с несколькими референсами, персонализации объектов или последовательности разговорных правок.
5. HiDream O1 Image: лучшая новая единая модель изображений с открытыми весами
HiDream.ai — лаборатория из Пекина, а HiDream O1 Image — одна из наиболее технически интересных китайских ИИ-моделей для изображений, выпущенных в 2026 году. Её Pixel-level Unified Transformer помещает необработанные пиксели, текст и условия задачи в единое общее пространство токенов. В ней нет внешнего VAE и отдельного текстового энкодера.
Согласно официальной карточке модели, модель под лицензией MIT поддерживает генерацию изображений из текста, редактирование по инструкциям, персонализацию объектов, несколько референсов, управление макетом и вывод до 2048 × 2048.
Почему HiDream — это не просто ещё один чекпойнт для преобразования текста в изображение
Модель рассчитана на единый непрерывный рабочий процесс. Можно создать объект, отредактировать изображение, сохранить этот объект в новых сценах и использовать дополнительные референсы для управления макетом или скелетом.
Её чекпойнт Dev 2604 сейчас занимает третье место в таблице моделей с открытыми весами для преобразования текста в изображение Artificial Analysis, опережая ERNIE Image и HunyuanImage 3.0. Поэтому HiDream сложно списать на исследовательское любопытство.
Чего не доказывают бенчмарки
Лучший независимый результат преобразования текста в изображение принадлежит чекпойнту Dev 2604, тогда как полная единая модель находится ниже в той же таблице. Разные варианты оптимизированы под разные задачи. Не переносите оценку одного чекпойнта на всё семейство.
Экосистема также пока молода. Документация, доступность через хостинг, квантованные версии и сторонние рабочие процессы ещё формируются. Я бы протестировал HiDream для новой открытой визуальной системы, но не переносил бы производственный конвейер без предварительного запуска фиксированного набора регрессионных тестов.
6. Kling Image 3.0 Omni: лучшая для производственных материалов 4K
Kuaishou больше известна на международном рынке благодаря Kling для видео, но её текущие модели изображений заслуживают отдельного внимания. В объявлении Kuaishou от февраля 2026 года были представлены Image 3.0 и Image 3.0 Omni с выводом в разрешении 2K и 4K.
Различие между двумя версиями практическое:
-
Kling Image 3.0 поддерживает генерацию, локальное повторное редактирование, перенос стиля, референсы портретов и смешивание нескольких изображений.
-
Kling Image 3.0 Omni добавляет прямой вывод в высоком разрешении и рабочие процессы с сериями изображений для согласованных персонажей, товаров и окружения.
Официальное руководство Omni демонстрирует управление точкой обзора, кадрированием, фокусным расстоянием, освещением, выражением лица, работой с несколькими референсами и сериями изображений в стиле раскадровки.
Где уместен Kling
Kling Image 3.0 Omni лучше всего подходит, когда статичные изображения связаны с более крупной визуальной последовательностью:
-
коммерческим раскадровкам;
-
листам с поворотами персонажей и несколькими ракурсами;
-
изображениям кампании с одним и тем же товаром;
-
согласованным кадрам, которые позднее могут стать референсами для видео;
-
материалам 4K, которым не нужен отдельный апскейлер.
Ограничение — доступ
Kling Image 3.0 Omni является проприетарной моделью. Её ценность связана с продуктовой средой Kling и поддерживаемым коммерческим доступом, а не с локальным развёртыванием. Не путайте её со старыми открытыми исследовательскими проектами и не предполагайте, что API Kling для видео автоматически включает новейшую модель изображений.
7. Z-Image Turbo: лучшая для скорости и недорогого развёртывания
Z-Image Turbo создана группой Tongyi-MAI компании Alibaba. Это дистиллированная модель на 6 млрд параметров, которой требуется всего восемь вычислений функции. В официальной карточке модели сообщается о выводе менее чем за секунду на H800 и поддержке потребительского оборудования класса 16 ГБ VRAM. Модель выпущена по лицензии Apache 2.0.
Такое сочетание делает её необычно доступной. Z-Image Turbo подходит для:
-
массового создания миниатюр и вариантов для социальных сетей;
-
быстрой итерации запросов;
-
внутренних инструментов, где важна задержка;
-
локальных экспериментов на одной потребительской GPU;
-
генерации двуязычного китайско-английского текста;
-
приложений, где стоимость инфраструктуры на изображение важнее максимальной точности.
Компромисс в качестве у Turbo
Дистилляция — одновременно преимущество и ограничение. В официальном сравнении Turbo описывается как модель генерации за восемь шагов с меньшим разнообразием и без предусмотренного пути тонкой настройки, тогда как базовый чекпойнт Z-Image использует больше шагов и сохраняет больший контроль.
Artificial Analysis сейчас ставит Z-Image Turbo на восемнадцатое место в рейтинге моделей с открытыми весами для преобразования текста в изображение, ниже ERNIE Image, HiDream O1 Image и HunyuanImage 3.0 Instruct. Поэтому честный вывод прост:
Z-Image Turbo — одна из самых простых для развёртывания китайских моделей изображений, но не самая красивая китайская модель изображений в 2026 году. Выбирать её стоит ради скорости.
Лучшая китайская ИИ-модель для изображений в зависимости от задачи
| Задача |
Лучший выбор |
Почему |
| Лучший вариант в целом |
Seedream 5.0 Pro |
Сильная генерация, редактирование, макеты и доступ через хостинг |
| Постеры и многоязычная типографика |
Qwen Image 2.0 Pro |
Структурированная композиция и отображение текста |
| Сложное мультимодальное редактирование |
HunyuanImage 3.0 Instruct |
Понимание изображений, переписывание запросов и семантическое планирование |
| Компактное развёртывание модели с открытыми весами |
ERNIE Image |
Модель на 8 млрд параметров, Apache 2.0, сильный результат для текстовых изображений |
| Единая открытая генерация и редактирование |
HiDream O1 Image |
Одна модель для генерации, редактирования и персонализации объектов |
| Раскадровки 4K и серии изображений |
Kling Image 3.0 Omni |
Вывод в высоком разрешении и согласованность серий |
| Быстрая локальная генерация |
Z-Image Turbo |
6 млрд параметров, восемь шагов и развёртывание на системах класса 16 ГБ |
Если вам нужна только одна рекомендация, используйте Seedream 5.0 Pro. Если требуется локальное владение моделью, начните с ERNIE Image для простой системы преобразования текста в изображение или с HiDream O1 Image для более широкого рабочего процесса генерации и редактирования.
Открытые веса или хостинговый API: что выбрать?
Выбирайте открытые веса, если вам нужны офлайн-вывод, пользовательская тонкая настройка, частная инфраструктура или полный контроль над версиями модели. ERNIE Image, HiDream O1 Image, HunyuanImage 3.0 Instruct и Z-Image Turbo предлагают доступные для скачивания чекпойнты, но требования к оборудованию у них сильно различаются.
Выбирайте хостинговый API, если вам нужны быстрая интеграция, предсказуемая эксплуатация и доступ к проприетарным моделям, таким как Seedream 5.0 Pro. API избавляет от закупки GPU и работы по обслуживанию моделей, но создаёт зависимость от поставщика и расходы, зависящие от использования.
Одного слова «открытая» недостаточно. Проверьте четыре отдельных пункта:
-
Можно ли скачать веса модели?
-
Подходит ли лицензия для коммерческого использования?
-
Сможет ли ваше оборудование запускать модель в требуемом разрешении?
-
Включает ли открытый релиз те же возможности, что и флагманская хостинговая модель?
Qwen — самое очевидное предупреждение. Наличие открытого чекпойнта Qwen-Image не делает Qwen Image 2.0 Pro открытой. Проверка на уровне версии важнее предположений на уровне семейства.
Китайские ИИ-модели для изображений против GPT Image и Gemini
Китайские модели изображений больше не относятся к отдельной более слабой категории, но независимые результаты также не позволяют объявить их универсальными победителями.
Seedream 5.0 Pro занимает восьмое место в Artificial Analysis по преобразованию текста в изображение и четвёртое место в Arena по редактированию одного изображения. GPT Image 2 возглавляет таблицу Arena по редактированию. Это означает, что лучшая китайская модель конкурирует с мировыми лидерами, но всё ещё уступает им в некоторых широких тестах предпочтений.
У китайских моделей есть три особенно сильные стороны:
-
Двуязычная и нелатинская типографика. Seedream, Qwen, ERNIE и Z-Image специально ориентированы на китайский и английский текст.
-
Разнообразие моделей с открытыми весами. ERNIE, HiDream, Hunyuan и Z-Image дают разработчикам больше возможностей для самостоятельного хостинга, чем ведущие проприетарные западные семейства моделей изображений.
-
Специализация под творческие рабочие процессы. Инструменты Kling для серий изображений и работа Seedream со сложными макетами предназначены для практических контентных конвейеров, а не только для создания привлекательных отдельных изображений.
GPT Image и Gemini остаются более безопасным выбором по умолчанию для команд, уже работающих в их экосистемах, или для задач, где их поведение при редактировании и мультимодальной работе уже проверено. Важен не вопрос «Китай или Запад?», а вопрос «Какая модель реже всего ошибается на моём фиксированном наборе запросов и правок?»
Китайские модели изображений, не вошедшие в топ-7
Kolors
Оригинальная Kolors от Kuaishou остаётся важной открытой моделью изображений, но больше не является текущим флагманом компании. Кроме того, часто повторяемое название «Kolors 2.1» не имеет столь же ясной официальной истории выпуска, как Kling Image 3.0. Мы предпочитаем ранжировать подтверждённую актуальную модель, а не повторять сомнительную маркировку версии.
Janus Pro
Janus Pro представляет интерес для мультимодальных исследований, но по качеству генерации изображений теперь значительно уступает более новым специализированным моделям. Artificial Analysis помещает её близко к нижней части текущей таблицы моделей изображений с открытыми весами. Ей место в обсуждении мультимодальных архитектур, а не в рейтинге творческих моделей 2026 года.
Step Image Edit 2
Step Image Edit 2 — заметная китайская модель редактирования, которая заслуживает отдельного сравнения в категории «лучшие модели для редактирования изображений». Это не базовая модель общего назначения для преобразования текста в изображение, поэтому её включение в этот список означало бы награждение специалиста за другую задачу.
Старые версии Seedream и Qwen-Image
Seedream 4.5, Qwen Image Max 2512 и оригинальная Qwen-Image остаются полезными. Они не вошли в основной список, поскольку рейтинг отдаёт предпочтение самой сильной текущей версии семейства, если только более старый открытый чекпойнт не предлагает явно иное преимущество при развёртывании.
Как получить доступ к Seedream 5.0 Pro через GPT Proto
GPT Proto в настоящее время не утверждает, что размещает каждую конкретную модель из этой семёрки. Модель, доступная в качестве прямой рекомендации из списка, — Seedream 5.0 Pro с использованием строки модели dola-seedream-5-0-pro-260628.
Самый простой первый запрос использует синхронный режим:
curl --location \
'https://gptproto.com/api/v3/doubao/dola-seedream-5-0-pro-260628/text-to-image' \
--header "Authorization: $GPTPROTO_API_KEY" \
--header 'Content-Type: application/json' \
--data '{
"prompt": "Square editorial product photograph of a translucent perfume bottle on wet slate, dramatic side light, realistic glass refraction, fine water droplets, restrained charcoal and silver palette, no text",
"size": "1024x1024",
"enable_base64_output": false,
"enable_sync_mode": true
}'
Маршрут /api/v3/ использует исходный ключ GPT Proto в заголовке Authorization без префикса Bearer. Для других китайских моделей изображений проверьте галерею моделей GPT Proto, чтобы узнать точную актуальную строку модели, вместо подстановки названия семейства из этой статьи.
Итоговый вывод
Seedream 5.0 Pro — лучшая китайская ИИ-модель для изображений в 2026 году для большинства профессиональных пользователей. Она выигрывает благодаря хорошему выполнению нескольких связанных задач—генерации, редактирования, работы с макетами, типографики и референсов—при удобном доступе через хостинговый API.
Используйте Qwen Image 2.0 Pro, когда важнее всего типографика и структурированный дизайн. Выбирайте ERNIE Image, если нужна компактная открытая модель с удобными коммерческими условиями. Используйте HiDream O1 Image, если хотите экспериментировать с одной открытой моделью для генерации, редактирования и согласованности объектов. HunyuanImage 3.0 Instruct — амбициозный семантический редактор, но его требования к оборудованию трудно оправдать. Kling Image 3.0 Omni — специалист по производственным материалам высокого разрешения. Z-Image Turbo — выбор для высокой пропускной способности.
Ни один бенчмарк не заменит собственный регрессионный набор. Проверьте на каждой модели один и тот же постер, фотографию товара, сцену с несколькими персонажами, правку с сохранением идентичности и запрос на пакетную генерацию миниатюр. Лучшая модель — та, которая создаёт меньше всего непригодных результатов при приемлемом для вашего рабочего процесса качестве, скорости и стоимости.