Что такое Wan 2.5?
Wan 2.5 — это модель генерации видео от Alibaba (команда Tongyi / Wan), выпущенная в сентябре 2025 года. Она превращает текстовый промпт — или статичное изображение — в клип длиной до 10 секунд с разрешением до 1080p (24 кадра/с) и генерирует звук за один проход: диалоги с синхронизацией губ, фоновые звуковые эффекты и музыку. Именно такой аудиовизуальный вывод за один проход отличает её от предыдущих версий Wan и большинства открытых видеомоделей, которые создают только беззвучное видео.
Wan 2.5 поставляется исключительно в виде API-превью — её веса недоступны для публичной загрузки. (Wan 2.1 и 2.2 — это версии с открытыми весами по лицензии Apache-2.0, которые можно развернуть самостоятельно; 2.5 и 2.6 доступны только через API.) На GPTProto вы вызываете её с помощью строки модели wan-2.5, оплата списывается за каждую генерацию в зависимости от разрешения и длительности с того же баланса, что и для более чем 200 других моделей.
| Характеристика | Значение |
|---|---|
| Провайдер | Alibaba (Tongyi / Wan) |
| Модальности | Текст-в-видео (эта страница), изображение-в-видео |
| Звук | Нативный синхронизированный — голос + синхронизация губ + спецэффекты + музыка, один проход |
| Разрешение | 480p / 720p / 1080p (24 кадра/с) |
| Макс. длительность | ~10 с |
| Языки | Мультиязычность (уверенная поддержка китайского) |
| Веса | API-превью (не с открытым исходным кодом) |
| Строка модели | wan-2.5 |
| Эндпоинт | https://gptproto.com/api/v3/alibaba/wan-2.5/text-to-video |
Что можно создать с помощью API Wan 2.5
Короткие ролики для соцсетей и рекламы — вертикальные или горизонтальные клипы продолжительностью 5–10 секунд со встроенной озвучкой и звуком, без необходимости отдельного монтажа звука. При стоимости $0.45 за один запуск в разрешении 720p (5 с) A/B-тестирование десятка вариантов рекламы остается недорогим.
Локализованное видео в больших масштабах — Wan 2.5 поддерживает мультиязычные промпты и генерирует речь с синхронизацией губ, поэтому один раскадрованный сюжет превращается в версии на нескольких языках без повторных съемок или переозвучки. Сильная поддержка китайского языка.
Сторителлинг и эксплейнеры — генерируемые одновременно диалоги, фоновый звук и музыка обеспечивают согласованность повествования и визуаряда на протяжении всего клипа — это полезно для интро на YouTube, продуктовых объясняющих видео и учебных материалов.
Анимация статичного изображения — передайте одно изображение в качестве первого кадра и промпт движения, чтобы анимировать его.
Как Wan 2.5 генерирует видео и звук одновременно
Большинство видеомоделей выводят беззвучные кадры; звук — это отдельная задача, которую вы добавляете позже. Модель Wan 2.5 создана с точностью до наоборот. Шаг генерации создает визуальные кадры и соответствующую звуковую дорожку совместно, поэтому речь попадает в нужные движения губ, шаги совпадают со звуком шагов, а музыка органично вписывается в монтаж без какого-либо редактирования с вашей стороны. На практике это сводит двухэтапный пайплайн (видеомодель + синтез речи/шумов) к одному вызову API.
Из этого вытекают два важных момента. Во-первых, ваш промпт должен описывать звук так же, как и движение — укажите реплику диалога, фоновое звуковое сопровождение и нужна ли музыка (см. §6). во-вторых, поскольку аудио и видео создаются за один проход, один запуск является единой тарифицируемой единицей; вы не платите дважды и не склеиваете треки. Если вам нужно использовать собственную музыку или озвучку, параметр audio принимает их, а модель синхронизирует под них движение.
Выбор внутри семейства Wan
На GPTProto представлено несколько моделей Wan на едином балансе. Выбирайте по задачам проекта, а не по номеру версии:
- Wan 2.5 — текст-в-видео (эта страница): 1080p, до 10 с, нативный звук. Стандартный выбор для создания клипа по текстовому промпту со звуком.
- Wan 2.5 — изображение-в-видео: начните со статичного изображения в качестве первого кадра и анимируйте его (кейс «wan 2.5 animate»).
- Wan 2.2 (
wan-2.2-plus): без звука, 720p, ~5 с — но с открытыми весами, поэтому это лучший выбор, если вам необходимо самостоятельное развертывание. - Wan 2.6 (
wan-2.6): 1080p, до 15 с, а также планирование многокадровых сцен и сохранение идентичности на основе референсов — переходите на неё, когда вам нужны более длинные или многоплановые истории.
Эта карта — именно то, что конкуренты упускают: они перечисляют модели, не подсказывая, какую из них выбрать. Используйте 2.5 для однокадровых клипов со звуком, 2.2, если вам нужны веса, и 2.6 для большей длительности и многокадровых сцен.
Wan 2.5 против Sora 2
Обе модели генерируют видео с синхронизированным звуком по тексту или изображению. Практические различия:
| Wan 2.5 | Sora 2 | |
| Звук | Нативная синхронизация (голос / спецэффекты / музыка) | Нативная синхронизация |
| Разрешение | до 1080p | до 1080p |
| Макс. длительность | ~10 с | дольше — до ~25 с (Pro) |
| Языки | Мультиязычность, сильный китайский | Мультиязычность |
| Правила контента / IP | Мягче | Строже — блокирует объекты интеллектуальной собственности и фотореалистичные портреты на некоторых хостингах |
| Открытые веса | Нет (только API) | Нет |
| Цена на GPTProto | $0.225–$1.35 / запуск (зависит от разрешения и длительности) | $0.4 / запуск |
Честное мнение: Sora 2 стоит фиксированные $0.4 за запуск и поддерживает более длинные клипы (до ~25 с на тарифе Pro) — выбирайте её, когда важна длительность. Wan 2.5 начинается с более низкой стоимости в $0.225 за запуск (480p/5с) и позволяет жертвовать разрешением ради экономии, обладая мощной мультиязычной речью и меньшими ограничениями по контенту. Обе модели работают с единого баланса GPTProto.
По теме: Sora 2 → · Wan 2.6 → · Wan 2.2 →
Примеры промптов для Wan 2.5
Wan 2.5 генерирует звук вместе с видео, поэтому хорошие промпты описывают звук наравне с движением. Собственные примеры платформы добавляют звук прямо в текст с помощью метки Sound: — следуйте этому соглашению. Структура: субъект + действие + движение камеры + освещение + метка Sound: + стиль. Копируйте и настраивайте.
1. Диалог + синхронизация губ (демонстрация аудиодвижка)
Medium close-up of an elderly fisherman on a wooden boat at dawn, soft golden
light, gentle water lapping. He looks to camera and says warmly, "The sea always
keeps its promises." Slow push-in. Sound: soft waves, distant seagulls, a calm
spoken line, no music.
2. Окружающая среда / спецэффекты, без диалогов
Rain on a neon-lit Tokyo alley at night, a cat darts under an awning, reflections
shimmer on wet pavement. Static wide shot, cinematic. Sound: steady rain, distant
traffic, no music, no speech.
3. Продукт / маркетинг
Close-up of an iced coffee on a marble counter, condensation beading, morning
kitchen light. A spoon stirs the ice. Slow 180-degree orbit around the glass.
Sound: soft clink of ice, quiet ambient kitchen tone, light background music.
4. Движение / трекинг
A skateboarder rolls across an empty concrete plaza at sunset, low-angle tracking
shot alongside, subtle lens flare. Sound: wheels rumbling on pavement, wind
ambience, no dialogue.
Советы: делайте диалоги достаточно короткими для длительности клипа (примерно одна реплика на 5 секунд); явно укажите движение камеры; напишите «no music», если вам нужны только фоновые звуки; или передайте собственный трек через параметр audio.









