Doubao Seedance 2.0 API: преобразование текста в видео с нативным аудио от $0.2957 за запуск
API Doubao Seedance 2.0 — это видеомодель второго поколения от ByteDance, доступная на GPTProto через совместимый с OpenAI доступ без отдельной учетной записи Jimeng или Volcano Ark. Построенная на унифицированной аудиовизуальной архитектуре, doubao-seedance-2.0 принимает текст, изображения, видео и аудио в одном запросе и возвращает синхронизированный клип с нативным звуком — от 4 до 15 секунд, с разрешением до 4K и различными соотношениями сторон: от 16:9 и 9:16 до 21:9. Это тот же движок Doubao AI Seedance 2.0, который разработчики используют для кинематографичных сцен, рекламных роликов продуктов и коротких видео для соцсетей; вызвать его можно через одну стандартную конечную точку.
Для преобразования текста в видео с doubao seedance 2.0 генерация начинается от $0.2957 за запуск, а стоимость doubao seedance 2.0 api предсказуемо увеличивается в зависимости от разрешения и длительности — полная таблица стоимости одного запуска приведена ниже. Независимо от того, создаете ли вы быстрые клипы в 480p или рендерите сцены в 1080p и 4K с аудио, seedance 2.0 doubao предоставляет возможность оплачивать генерацию ByteDance по мере использования, используя один API-ключ, работающий со всеми моделями платформы.
Что такое Doubao Seedance 2.0
Выпущенная в феврале 2026 года командой Seed компании ByteDance, модель Doubao Seedance 2.0 (также обозначаемая как doubao-seedance-2.0 или seedance 2.0 doubao) построена на унифицированной аудиовизуальной архитектуре. Главное отличие от версии 1.5 Pro заключается не в большем числе, обозначающем разрешение, — модель рассматривает каждый входной сигнал как средство управления. Одна генерация может включать текстовое описание, эталонные изображения, видеоклип для задания движения камеры и аудиодорожку; модель анализирует их вместе до создания первого кадра. Для этой конечной точки преобразования текста в видео вы работаете с текстом, но именно этот идентификатор модели используется и в расширенном рабочем процессе с эталонными материалами.
| Характеристика | Значение |
|---|---|
| Провайдер | ByteDance (команда Seed) |
| Строка модели | doubao-seedance-2-0-260128 |
| Эта конечная точка | Преобразование текста в видео |
| Входные модальности (модель) | Текст, изображение, видео, аудио |
| Количество эталонных материалов (модель) | До 9 изображений, 3 видеоклипов и 3 аудиоклипов за запрос |
| Нативное аудио | Да — генерируется одновременно с видео; многоязычная синхронизация губ |
| Длительность | 4–15 с (модель); 4–14 с оплачиваются на GPTProto |
| Разрешение | До 1080p (уровни 480p / 720p / 1080p) |
| Соотношения сторон | 16:9, 9:16, 4:3, 3:4, 21:9, 1:1 |
| Редактирование / расширение | Точечное редактирование клипов, персонажей и действий; расширение клипа |
| Преобразование изображения в видео | Да — отдельная конечная точка: /image-to-video |
| Варианты | Full + Fast (doubao-seedance-2-0-fast-260128 на GPTProto) |
| Открытый исходный код | Нет — проприетарная модель |
Как модель работает с аудио и движением
От стандартной модели преобразования текста в видео Seedance 2.0 отличают две особенности, и обе влияют на составление запросов. Во-первых, аудио и видео создаются за один проход, а не в виде беззвучного клипа, к которому позже добавляется звуковая дорожка. Поскольку звук и изображение генерируются вместе, диалоги совпадают с движением губ, а фоновые эффекты следуют за действием — поэтому запрос, в котором указан звук ("шум толпы нарастает, пока проезжает машина"), обычно обеспечивает более точную синхронизацию, чем описание только визуальной части. Во-вторых, модель надежнее сохраняет идентичность объекта при изменении движения и ракурса по сравнению с предыдущими версияами, благодаря чему становятся возможными многосценовые ролики и повторяющиеся персонажи, а не только разовые генерации. Если вы отказались от ИИ-видео из-за того, что лицо менялось между склейками, именно этот аспект улучшился сильнее всего.
Doubao Seedance 2.0 и Sora 2
Обе модели доступны на GPTProto, поэтому это прямое сравнение возможностей, а не маркетинговое заявление.
| Doubao Seedance 2.0 | Sora 2 | |
|---|---|---|
| Входные данные | Текст, изображение, видео, аудио | Текст, изображение |
| Нативное аудио | Да, совместная генерация | Да, синхронизированное |
| Максимальная длительность | 15 с | 12 с (стандартная) / 25 с (Pro) |
| Максимальное разрешение | До 1080p | 720p (стандартная) / 1080p (Pro) |
| Планы развития API | Развивается | OpenAI прекращает поддержку Sora 2 API 2026-09-24 |
| Цена на GPTProto | от $0.2957 за запуск (зависит от разрешения × длительности) | $0.40 за запуск (фиксированная) |
Doubao Seedance 2.0 и Seedance 1.5 Pro
Если вы уже используете Seedance 1.5 Pro, обновление связано с управлением входными данными, а не с увеличением разрешения. Версия 1.5 Pro уже создавала аудио и видео одновременно и выполняла инструкции для нескольких сцен. Seedance 2.0 дополняет ее стеком эталонных материалов — до 9 изображений, 3 видеоклипов и 3 аудиоклипов в одном запросе — а также точечным редактированием и расширением клипов. В сторонних тестах движения и физики она набирает больше баллов, чем 1.5 Pro, причем наибольший прирост наблюдается в физической точности.
Разница в стоимости значительна: цена 1.5 Pro начинается от $0.0408 за запуск против $0.2957 для 2.0. Практическое правило: оставайтесь на 1.5 Pro для простого высокообъемного преобразования текста в видео, когда бюджет важнее всего; переходите на 2.0, когда необходимы согласованность на основе эталонных материалов, редактирование или сцены, управляемые аудио. Обе модели используют один баланс, поэтому вы можете сравнивать их на одном запросе.
| Seedance 2.0 | Seedance 1.5 Pro | |
|---|---|---|
| Эталонные входные данные | Текст, изображение, видео, аудио (9 изображений / 3 клипа / 3 аудио) | Текст, изображение |
| Нативное аудио | Да | Да |
| Редактирование / расширение | Да | Нет |
| Цена на GPTProto | от $0.2957 за запуск | от $0.0408 за запуск |
Переход с Doubao, Jimeng или Volcano Ark
Если вы уже создаете прототипы Seedance 2.0 в собственных сервисах ByteDance, GPTProto предоставляет ту же модель через единый REST API: отправьте POST-запрос с вашим запросом и параметрами на конечную точку преобразования текста в видео, а затем опрашивайте /api/v3/predictions/{result_id}/result для получения результата. Имена параметров (prompt, aspect_ratio, duration, resolution, generate_audio, camera_fixed, seed) напрямую соответствуют уже используемым вами, поэтому перенос запроса в основном сводится к копированию и вставке. Помимо доступа, вы получаете возможность использовать тот же ключ с вариантом Fast, Seedance 1.5 Pro и Sora 2, сравнивая их на идентичных запросах с одного баланса вместо создания отдельной учетной записи для каждого провайдера.
Что разработчики создают с ее помощью
Возможности модели особенно подходят для нескольких задач: коротких роликов для соцсетей и рекламы, где нативное аудио избавляет от отдельного этапа озвучивания; серий с постоянными персонажами и брендированными маскотами, которые должны оставаться узнаваемыми в разных сценах; диалоговых сцен, требующих синхронизации губ; а также музыкальных роликов и монтажных сцен, где звук и движение должны совпадать. Для массового создания идей используйте вариант Fast, а лучшие результаты перерендеривайте на полной модели.
Примеры запросов для Doubao Seedance 2.0
Seedance 2.0 лучше реагирует на запросы, в которых указаны звук и камера, а не только визуальные элементы — аудио генерируется одновременно с видео, а описание камеры служит сигналом управления. Ниже приведены заготовки для копирования и редактирования; настройте длительность и соотношение сторон под свою сцену.
1. Сцена с акцентом на аудио (используйте совместную генерацию аудио)
Дождливая токийская улица ночью, неоновые отражения на мокром асфальте. Фигура в темном пальто идет навстречу камере. Диегетический звук: равномерный шум дождя, отдаленный транспорт, шаги по лужам. Медленное приближение камеры. 16:9.
Указание звука позволяет модели синхронизировать атмосферу с движением за один проход, вместо того чтобы добавлять звуковое сопровождение позже. Оставьте generate_audio включенным.
2. Предметная съемка со статичной камерой (camera_fixed)
Керамическая чашка кофе на мраморной столешнице, утренний свет слева, поднимающийся пар. Статичная камера, без движения. Малая глубина резкости. 1:1.
Используйте это вместе с camera_fixed: true, когда объект должен двигаться, а кадр оставаться неподвижным — это полезно для зацикленных роликов электронной коммерции и предметной съемки упаковки.
3. Действие с сохранением идентичности персонажа
Молодая женщина в красной куртке бежит по крыше, перепрыгивает через разрыв, приземляется и продолжает бежать. Ее лицо, волосы и куртка должны оставаться неизменными на протяжении всего клипа. Ручная камера следует за ней сбоку. Звук толпы и ветра. 16:9, 8 с.
Явное указание требования к постоянству использует главное улучшение модели — способность сохранять внешний вид объекта во время движения.
4. Несколько сцен в одной генерации
Сцена 1: общий план повара, сервирующего блюдо. Сцена 2: крупный план, на котором добавляют гарнир. Сцена 3: повар поднимает взгляд и улыбается. Теплая атмосфера кухни, легкое шипение. Плавные склейки. 16:9, 10 с.
Нумерация сцен задает модели явную структуру, которой она следует лучше, чем одному длинному описанию.
Советы по составлению запросов
- Явно указывайте диегетический звук, если он важен; аудио генерируется вместе с видео.
- Описывайте движение камеры (наезд, панорамирование, ручная камера, статичная камера) — модель воспринимает это как указание.
- Для повторяющихся объектов формулируйте требование к сохранению идентичности словами.
- Создавайте черновик на варианте Fast, а лучший результат перерендеривайте на полной модели.







