Что такое Wan 2.6?
Wan 2.6 — мультимодальная модель генерации видео от Alibaba (команда Tongyi / Wan), выпущенная в декабре 2025 года. Она превращает текстовый промпт — или изображения, референсное видео и аудио — в ролик длительностью до 15 секунд с разрешением до 1080p (24fps), одновременно генерируя аудио: диалоги с синхронизацией губ, звуковые эффекты и музыку.
По сравнению с Wan 2.5 в ней появились три важные для реального продакшена возможности. Планирование повествования из нескольких сцен: один промпт может описать несколько монтажных планов (общий → крупный → реакция), а модель выстроит их последовательно вместо того, чтобы вам пришлось генерировать и склеивать отдельные клипы. Генерация на основе референсов: добавьте референсные изображения или видео, и модель сохранит идентичность и внешний вид персонажа в разных сценах. Более высокая точность движения: более плавное и стабильное движение на протяжении увеличенной 15-секундной длительности. Она принимает текст, изображение, референсное видео и аудио в рамках одного рабочего процесса.
Wan 2.6 — модель, доступная только через API: веса не доступны для публичного скачивания. Wan 2.1 и 2.2 — версии с открытыми весами (Apache-2.0); 2.5 и 2.6 доступны только через API. В GPTProto вы вызываете её с помощью строки модели wan-2.6; оплата взимается за каждый запуск в зависимости от разрешения и длительности.
| Параметр | Значение |
|---|---|
| Провайдер | Alibaba (Tongyi / Wan) · выпущена в декабре 2025 года |
| Модальности | Текст-в-видео (эта страница); также изображение-в-видео, референс-в-видео |
| Входные данные | Текст, изображение, референсное видео, аудио |
| Аудио | Нативная синхронизация — голос + синхронизация губ + звуковые эффекты + музыка, за один проход |
| Несколько сцен | Да — планирование нескольких сцен + сохранение идентичности |
| Разрешение | до 1080p (24fps); альбомная / портретная / квадратная ориентация |
| Длительность | 5 / 10 / 15 с |
| Веса | Только API (не с открытым исходным кодом) |
| Строка модели | wan-2.6 |
| Эндпоинт | https://gptproto.com/api/v3/alibaba/wan-2.6/text-to-video |
Как работают несколько сцен и синхронизированное аудио
Wan 2.6 определяют две возможности, и обе меняют подход к составлению промптов.
Синхронизированное аудио за один проход. На этапе генерации кадры и соответствующая аудиодорожка создаются одновременно, поэтому речь совпадает с движениями губ, а фоновые звуки и музыка естественно сопровождают монтаж без отдельного редактирования. Опишите звук в промпте с помощью указания Sound: или передайте собственную дорожку через параметр audio, и модель синхронизирует с ней движение.
Несколько сцен за один запуск. Вместо рендеринга одного непрерывного плана Wan 2.6 может выстроить несколько эпизодов внутри одного клипа. Разделите промпт по времени ([0-5s] … [5-10s] … [10-15s] …), и модель воспримет каждый фрагмент как отдельную сцену, сохраняя персонажей и окружение при переходах. Параметр shot_type определяет, получите ли вы один непрерывный план или композицию из нескольких сцен. Для цельности наиболее стабильны ролики длительностью 8–12 с; 15 с доступны, когда важна максимальная длительность.
Выбор модели в семействе Wan
В GPTProto модели Wan собраны на одной платформе. Выбирайте модель в зависимости от задачи:
- Wan 2.6 — текст-в-видео (эта страница): 1080p, до 15 с, несколько сцен, нативное аудио. Используйте её для более длинных сюжетов или повествований с несколькими монтажными планами, создаваемых по промпту.
- Wan 2.6 — изображение-в-видео / референс-в-видео: оживляйте статичное изображение или задавайте сцену с помощью референсного клипа / нескольких референсных изображений для сохранения идентичности.
- Wan 2.5 (
wan-2.5): 1080p, до 10 с, нативное аудио, одна сцена — более доступный вариант для ежедневного использования, от $0.225 за запуск. - Wan 2.2 (
wan-2.2-plus): без звука, 720p, ~5 с — зато с открытыми весами; выбирайте её, если необходимо самостоятельное размещение.
Конкуренты перечисляют эти модели без пояснения, какую из них выбрать. Коротко: 2.6 — для большей длительности, нескольких сцен и сохранения идентичности; 2.5 — для более дешёвых одно-сценных роликов со звуком; 2.2 — для открытых весов.
Wan 2.6 против Wan 2.5 и Wan 2.2
| Wan 2.6 | Wan 2.5 | Wan 2.2 | |
|---|---|---|---|
| Аудио | Нативная синхронизация | Нативная синхронизация | Нет (только видео) |
| Максимальная длительность | 15 с | 10 с | ~5 с |
| Разрешение | до 1080p | до 1080p | 720p |
| Несколько сцен / референсы | Да | Нет | Нет |
| Открытые веса | Нет (только API) | Нет (только API) | Да (Apache 2.0) |
| Цена в GPTProto | $0.45–$2.025 / запуск | $0.225–$1.35 / запуск | $0.09 / запуск |
Честный вывод: Wan 2.6 стоит дороже за запуск, но именно её стоит использовать, когда нужны ролики длительностью 15 с, сцены из нескольких планов или постоянство персонажа при переходах. Wan 2.5 — более доступный вариант для ежедневного создания одно-сценных роликов длительностью до 10 с со звуком. Wan 2.2 стоит выбирать только при необходимости использовать открытые веса для самостоятельного размещения.
По теме: Wan 2.5 → · Wan 2.2 → · Sora 2 →
Что можно создавать с помощью API Wan 2.6
Короткометражные фильмы и рекламные ролики из нескольких сцен — Один промпт описывает несколько планов с едиными персонажами и аудио при переходах — повествовательный рекламный ролик длительностью 15 с без ручной склейки. Тест из 20 вариантов в разрешении 720p/5 с ≈ $9.00.
Локализованные видео в большом масштабе — Многоязычные промпты и речь с синхронизацией губ превращают одну раскадровку в версии на нескольких языках без повторной съёмки. Особенно хорошо поддерживается китайский язык.
Любое соотношение сторон по одной цене — Квадратный формат (960×960, 1440×1440), портретный формат (720×1280, 1080×1920) и альбомная ориентация имеют одинаковую цену в рамках одного уровня, поэтому формат можно свободно выбирать для каждой платформы.
Изображение / референс-в-видео — Оживляйте статичное изображение или задавайте сцену с помощью референсного клипа на смежных эндпоинтах.
Рецепты промптов для Wan 2.6
Wan 2.6 генерирует аудио и умеет планировать несколько сцен, поэтому лучше всего работают промпты, в которых вместе описаны сцены, движение и звук. В собственном примере платформа разделяет промпт по времени — используйте такой подход для нескольких сцен. Структура каждого эпизода: план + объект + действие + камера + освещение + указание Sound:.
1. Повествование из нескольких сцен (15 с + планирование сцен)
[0-5s] Общий план: одинокий турист достигает окутанного туманом горного хребта на рассвете, медленное приближение камеры.
[5-10s] Средний план: она поднимает камеру и улыбается. Sound: ветер, далёкое пение птиц.
[10-15s] Крупный план: солнце появляется над вершинами, свет заполняет кадр. Sound: мягкое нарастание фоновой музыки, без диалога.
2. Диалог + синхронизация губ (одна сцена)
Средний крупный план бариста за деревянной стойкой, тёплый утренний свет. Она смотрит в камеру и говорит: "Ваш обычный заказ? Уже готовится." Над чашкой поднимается пар. Sound: произнесённая реплика, шипение кофемашины, тихая атмосфера кафе.
3. Товар / промо, квадратный кадр
Квадратный кадр. Кроссовок медленно вращается на матовом постаменте, студийный свет скользит по нему, мягкие отражения. Sound: низкий синтезаторный пульс, мягкий свистящий звук во время движения света, без речи.
Практические советы: для нескольких сцен обозначайте каждый эпизод временным диапазоном и делайте диалог достаточно коротким для этого эпизода; задавайте shot_type для выбора одной или нескольких сцен; 8–12 с — оптимальная длительность для цельности, 15 с — когда важна продолжительность; используйте negative_prompt, чтобы исключить артефакты (например, "no text, no watermark"); prompt_extend: true позволяет модели расширить короткий промпт — отключите эту функцию для точного контроля; зафиксируйте seed, чтобы воспроизвести результат.






