Michael Johnson2026-07-03

Представляем Gemini Omni Flash: новую видеомодель Google, которой можно управлять разговором

Gemini Omni Flash — новая видеомодель Google, принимающая любые типы входных данных и редактируемая в диалоге: $0.10/с, клипы ~10 с. Возможности, настоящий код API и сравнение Omni с Veo.

Представляем Gemini Omni Flash: новую видеомодель Google, которой можно управлять разговором

Большинство ИИ-моделей для создания видео дают вам ровно одну попытку. Вы пишете промпт, получаете клип, а если вторая половина неудачна, начинаете сначала — и снова платите. Gemini Omni Flash пытается разорвать этот цикл. Вы создаёте клип, а затем продолжаете менять его, разговаривая с моделью: заменяете персонажа, меняете освещение сцены, угол камеры, и модель строит каждое изменение на основе предыдущего результата, а не создаёт всё с нуля.

Это первая модель нового семейства Google Gemini Omni — Google называет его своим первым мультимодальным «any-to-any»-моделем — и примерно 1 июля 2026 года она стала доступна в публичном предварительном просмотре. Ниже мы простым языком разберём, что это такое, сколько это стоит, как именно вызывать модель и в чём она пока уступает.

Содержание

Что такое Gemini Omni Flash?

Одним предложением: Gemini Omni Flash принимает на вход текст, изображения, аудио и видео, а на выходе создаёт видео высокого разрешения с синхронизированным аудио — и позволяет редактировать это видео в формате диалога.

Последняя часть и есть основное преимущество, поэтому её стоит отделять от демонстрационных роликов. Такая модель, как Veo или Sora, предназначена для создания одного качественного клипа по одному промпту. Omni Flash исходит из того, что первый клип — это черновик. Google утверждает, что модель «рассуждает о том, что должно произойти дальше», а не просто рисует пиксели — она опирается на знания Gemini о мире и «интуитивное понимание таких сил, как гравитация, кинетическая энергия и гидродинамика», чтобы определить, как должна продолжиться сцена. Считайте это заявлениями Google, а не независимыми выводами: в карточке модели указано, что бенчмарки будут опубликованы позднее, поэтому пока никто не оценил её способность к рассуждению.

Зачем она нужна, прежде чем разбираться, как она работает

Omni Flash решает проблему не «создания более красивого видео», а затрат на редактирование. В генераторе, работающем за одну попытку, каждое изменение требует нового рендера — вы получаете 90% клипа правильно, просите изменить один жест, заново создаёте весь ролик и надеетесь, что удачные 90% сохранятся. Это медленно, дорого и непредсказуемо.

Ответ Omni Flash — это сохраняющий состояние многошаговый цикл. Вы создаёте результат, проверяете его, а затем говорите: «сделай фон закатным» или «пусть она обернётся» — и модель сохраняет предыдущую сцену вместо того, чтобы пересобирать её. Google предоставляет разработчикам эту возможность с помощью previous_interaction_id, который передаётся между последовательными запросами, связывая изменения. В приложении Gemini этот разговорный интерфейс и есть то, чего Veo и Sora просто не предлагают.

Главная мысль: Omni Flash — это скорее «слой редактирования», чем «улучшенный генератор» — по-настоящему интересной модель становится после создания базового клипа.

Что она умеет (с теми цифрами, которые действительно опубликованы)

Вот подтверждённые данные из карточки модели и документации API, ограниченные характеристиками, которые имеют практическое значение:

  • Входные данные: текст, изображения, аудио и видео. На момент запуска аудиовход ограничен голосовыми референсами; поддержка других типов аудио запланирована.
  • Результат: видео высокого разрешения с исходным синхронизированным аудио, сгенерированным за один проход — оно не добавляется позднее отдельным этапом.
  • Длина клипа: примерно 10 секунд на момент запуска. Google представляет это ограничение как решение для развёртывания, а не жёсткий предел модели, и заявляет, что более длинные ролики появятся позднее — поэтому воспринимайте 10 секунд как «сегодня», а не как «навсегда».
  • Соотношение сторон: 9:16 и 16:9 (по умолчанию 16:9).
  • Согласованность: модель должна сохранять идентичность персонажей, объектов и стиля между монтажными склейками и изменениями, а также синхронизировать экранный текст и графику с движением.
  • Происхождение: каждый клип содержит незаметный водяной знак SynthID, а учётные данные контента C2PA включены по умолчанию. Отключить их нельзя.

Разрешение — единственная характеристика, о которой Google говорит уклончиво: в карточке модели указано лишь «высокое разрешение» без количества пикселей, а поддержка более высокого разрешения через корпоративный API обозначена как «скоро станет доступна». Если для вашего процесса важно точное разрешение, воспринимайте это как пробел, за которым нужно следить, а не как повод делать предположения.

Стоимость

Gemini Omni Flash стоит $0.10 за секунду готового видео. Это единственная точная цифра, опубликованная Google, и она достаточно прозрачна: 10-секундный клип стоит около доллара, поэтому стоимость пакетной задачи можно рассчитать без догадок.

Сразу возникший у разработчиков вопрос касается того, что означает эта ставка во время редактирования. Как заметил один из комментаторов на странице модели в Product Hunt: если вы создаёте 20-секундный клип, а затем говорите «сделай второй кадр медленнее», с вас снова списывают стоимость всего клипа за каждый запрос или система учитывает разницу с предыдущим рендером? Google пока публично этого не объяснила, а в разговорной модели именно здесь расходы могут незаметно резко вырасти. Мой вывод: планируйте бюджет так, будто каждый запрос на изменение требует нового рендера, пока Google не задокументирует обратное.

Для сравнения: по сообщениям, $0.10/с — это та же цена, что и у Veo 3.1 Fast. Такую параллель проводила сама команда Google, хотя я бы считал её сообщаемым ориентиром, а не опубликованным сравнительным тестом.

Как использовать: настоящий вызов image-to-video через GPT Proto

Мы добавляем Gemini Omni Flash в GPT Proto, чтобы вы могли вызывать её с тем же ключом и оплачивать её по той же схеме, что и остальные модели каталога — доступ уже постепенно открывается. GPT Proto использует формат запросов в стиле Vertex, поэтому генерация видео из изображения выполняется одним POST-запросом; затем вы опрашиваете возвращённую операцию и скачиваете результат. Ниже приведён полный пример на Python (подставьте собственный ключ из панели GPT Proto):

import requests, json, base64, time

BASE = "https://gptproto.com/v1beta/models/gemini-omni-flash-preview:predictLongRunning"
HEADERS = {"x-goog-api-key": "GPTPROTO_API_KEY", "Content-Type": "application/json"}

# 1) Turn a still image into a moving clip
with open("frame.png", "rb") as f:
    image_b64 = base64.b64encode(f.read()).decode()

payload = {
    "instances": [{
        "prompt": "The subject slowly turns to face the camera as warm sunset light fills the room.",
        "image": {"mimeType": "image/png", "bytesBase64Encoded": image_b64}
    }],
    "parameters": {"aspectRatio": "9:16"}
}
op = requests.post(BASE, headers=HEADERS, data=json.dumps(payload)).json()
operation_name = op["name"]        # e.g. models/gemini-omni-flash-preview/operations/abc123

# 2) Poll until the render is done
POLL = f"https://api.gptproto.com/v1beta/{operation_name}"
while True:
    result = requests.get(POLL, headers=HEADERS).json()
    if result.get("done"):
        break
    time.sleep(10)

# 3) Download the finished video
uri = result["response"]["generateVideoResponse"]["generatedSamples"][0]["video"]["uri"]
video = requests.get(uri, headers=HEADERS)
open("output.mp4", "wb").write(video.content)
print("Saved output.mp4")

Или тот же первый шаг через cURL:

curl --location 'https://gptproto.com/v1beta/models/gemini-omni-flash-preview:predictLongRunning' \
  --header 'x-goog-api-key: GPTPROTO_API_KEY' \
  --header 'Content-Type: application/json' \
  --data '{
    "instances": [{
      "prompt": "The subject slowly turns to face the camera as warm sunset light fills the room.",
      "image": {"mimeType": "image/png", "bytesBase64Encoded": "BASE64_ENCODED_IMAGE"}
    }],
    "parameters": {"aspectRatio": "9:16"}
  }'

Несколько практических замечаний из документации: генерация видео выполняется как длительная операция, поэтому этап опроса нельзя пропустить; сгенерированные файлы хранятся пару дней, так что скачивайте их без промедления; ошибки соответствуют стандартным кодам HTTP — 401 означает неверный ключ, 403 — недостаточный баланс или отсутствие разрешения, 429 — превышение ограничения частоты запросов.

Краткое руководство по промптам

Omni Flash намеренно предлагает немного настроек — API не поддерживает негативные промпты, temperature, top-p или системные инструкции. Это меняет способ управления моделью:

Задавайте параметры управления в промпте, а не в настройках. Явно описывайте движение и физику («мраморный шар быстро катится, непрерывный плавный кадр»), вместо того чтобы полагаться на параметры. Не пытайтесь уместить все требования в одном мегапромпте — сначала создайте качественный базовый клип, а затем вносите точечные разговорные изменения: именно под такой рабочий процесс и создана модель. Для сохранения непрерывности персонажа используйте референсное изображение, а не описывайте лицо словами. И сохраняйте реалистичные ожидания: собственная карточка Google признаёт, что сложные движения, идеально точный текст и полная согласованность между изменениями пока остаются слабыми местами, поэтому промпты, одновременно опирающиеся на все три аспекта, с наибольшей вероятностью разочаруют.

Честный обзор: где модель хороша, а где даёт сбои

По-настоящему новой особенностью здесь является разговорный цикл редактирования. Итеративная работа с клипом в формате диалога заметно быстрее, чем повторная отправка промптов, и это интерфейс, которого нет у Veo и Sora. Именно ради этого стоит выбрать Omni Flash.

Однако первые отзывы были сдержанными, а не восторженными, и их стоит честно передать. Повторяющийся вывод сообщества заключается в том, что Omni Flash — сильный редактор и лишь приемлемый самостоятельный генератор — несколько пользователей, протестировавших модель на практике, отметили, что она особенно хороша для изменения уже удачного клипа, но менее убедительна при создании оригинального ролика с нуля; слабыми местами называли физику, движение и временную согласованность. Это соответствует собственным признаниям Google. Есть и более жёсткие ограничения: в API видеореференсы длительностью до трёх секунд «принимаются схемой, но обрабатываются некорректно», ссылки на несколько видео не поддерживаются, а редактирование аудио и речи намеренно недоступно на старте — Google ссылается на риск дипфейков. Поэтому это релиз в формате «прототип, который можно попробовать», а не решение, которое стоит без тестирования подключать к продакшену.

Деловая сторона восприняла запуск теплее: среди первых пользователей в продакшене назывались Figma и WPP, что говорит о том, что расчёт стоимости за секунду уже подходит для реальных творческих процессов. Я бы считал это сигналом о привлекательности цены, а не о качестве результата.

Gemini Omni Flash и Veo 3.1: что выбрать?

Именно это чаще всего хотят узнать пользователи, и общий вывод — в том числе от Google — состоит в том, что модели дополняют друг друга, а не заменяют одна другую. Veo заменили на Omni только внутри приложения Gemini; разработчики по-прежнему напрямую вызывают Veo 3.1 через API для задач, требующих высокой точности.

  Gemini Omni Flash Veo 3.1 / 3.1 Fast
Лучше всего подходит для Разговорного редактирования, ремикширования с несколькими типами входных данных Создания высококачественного ролика за одну попытку
Входные данные Текст, изображение, аудио (голосовой референс), видео Текст, изображение (элементы), видео
Длина клипа ~10 с на момент запуска (Google называет это решением для развёртывания) 4 / 6 / 8 с, плюс расширение
Разрешение «Высокое разрешение» — публичных данных пока нет 720p / 1080p / 4K (1080p и 4K доступны только при длительности 8 с)
Исходное аудио Да, в каждом клипе Да
Редактирование Разговорные изменения в несколько этапов Промпт / элементы, расширение
Цена $0.10 / с результата $0.10 / с (Fast, по сообщениям)
Водяной знак SynthID + C2PA SynthID

Практическое правило: выбирайте Veo 3.1 , когда важнее всего разрешение и чистый кинематографичный результат; выбирайте Omni Flash, когда важнее менять, улучшать и ремикшировать клип в формате диалога. Во многих реальных процессах ответом будут обе модели: создайте основу с помощью более чёткого генератора, а затем передайте её Omni Flash для цикла редактирования.

Для кого предназначена модель — и кому стоит подождать

Выбирайте Omni Flash, если ваша работа связана с частым редактированием: изменениями в стиле VFX, трансформациями аватаров и референсных изображений или любыми задачами, где вам предстоит несколько раз дорабатывать один клип. Подождите, если вам уже сегодня необходимо гарантированно высокое разрешение, отдельные клипы длиннее примерно 10 секунд, надёжная работа с видеореференсами или редактирование аудио и голоса — эти возможности либо не определены, либо ограничены, либо отключены на момент запуска.

 


Готовы создавать с её помощью? Получите ключ и изучите актуальный каталог на GPT Proto — доступ к Gemini Omni Flash уже постепенно открывается.

Универсальная творческая студия

Создавайте здесь изображения и видео. API GPTProto обеспечивает быстрые обновления моделей и самые низкие цены.

Начать создание
Универсальная творческая студия
Похожие модели
Все модели
Google
Claude
20% OFF
Google
40% OFF
Google
40% OFF

Часто задаваемые вопросы

Как получить API Gemini Omni Flash?

Зарегистрируйтесь в GPTProto, создайте API-ключ в панели управления и вызовите эндпоинт gemini-omni-flash-preview, показанный выше. Доступ постепенно открывается — вы сможете использовать модель с тем же ключом и системой оплаты, что и остальные модели каталога. Изучите полную библиотеку моделей, чтобы увидеть, что доступно сейчас.

Сколько стоит Gemini Omni Flash?

$0.10 за секунду готового видео — около $1 за 10-секундный клип. Пока не документировано, списывается ли полная стоимость клипа за каждый этап итеративного редактирования, поэтому закладывайте консервативный бюджет.

Какой длины могут быть видео Gemini Omni Flash?

Около 10 секунд на момент запуска. Google описывает это как решение для развёртывания, а не ограничение модели, и заявляет, что более длинные ролики появятся позднее.

Gemini Omni Flash или Veo 3.1 — что лучше?

Ни то ни другое в точности. Veo 3.1 выигрывает по разрешению и качеству готового ролика, созданного за одну попытку; Omni Flash — по разговорному редактированию с несколькими типами входных данных. Многие команды используют обе модели.

Может ли Gemini Omni Flash редактировать голоса или создавать неотфильтрованное аудио?

Нет. Редактирование аудио и речи намеренно недоступно на момент запуска из-за опасений, связанных с дипфейками, а каждый клип содержит несъёмный водяной знак SynthID и учётные данные C2PA.

Похожие статьи

Ещё блоги
Seedance 2.0 Mini и Seedance 2.0: цена, качество и какую модель действительно использовать

Seedance 2.0 Mini и Seedance 2.0: цена, качество и какую модель действительно использовать

Кратко — При одинаковом разрешении Seedance 2.0 Mini примерно на 20% дешевле стандартной Seedance 2.0 на GPTProto — а не «вдвое дешевле», как пишут на большинстве сравнительных страниц. Основная экономия достигается благодаря жёсткому ограничению: Mini работает максимум в 720p, полностью исключая дорогие уровни 1080p и 4K. Выбирайте Mini, когда нужны быстрая итерация в большом объёме и короткие ролики для соцсетей. Стандартную Seedance 2.0 используйте, когда нужны 1080p или 4K, более сложная динамика или финальный ролик для клиента. На практике выгоднее всего запускать обе модели: создавать черновики в Mini, а финальную версию — в стандартной. В остальной части этого руководства по Seedance 2.0 Mini и её полноразмерному собрату приведены реальные цифры, лежащие в основе каждого из этих решений.

Tiffany Layne | 2026-06-30

Вышел ли уже Seedance 2.5? Дата выхода и то, что нам действительно известно (2026)

Вышел ли уже Seedance 2.5? Дата выхода и то, что нам действительно известно (2026)

На этой неделе я обновлял страницу Seed от ByteDance чаще, чем хотел бы признать, ожидая появления Seedance 2.5. Пока безрезультатно. Ни страницы модели, ни спецификаций, ни даты. Именно поэтому я и пишу этот пост: сейчас вокруг Seedance 2.5 появляется множество уверенных публикаций, и в большинстве из них догадки выдаются за факты. Я хочу чётко разделить одно от другого, а затем рассказать, что вы действительно можете запустить уже сегодня.

Tiffany Layne | 2026-06-23

Что такое Wan 2.7? Руководство по модели Alibaba с режимом рассуждений (2026)

Что такое Wan 2.7? Руководство по модели Alibaba с режимом рассуждений (2026)

Введите в поиск «wan 2.7» — и получите два ответа, которые не могут быть одновременно верными. Одни руководства предлагают скачать веса и запустить модель на собственном GPU. Другие утверждают, что получить к ней доступ можно только через API. Я решил выяснить, какой вариант верен, потому что от ответа зависит, сможете ли вы вообще развернуть эту модель самостоятельно. Если кратко: большинство уверенных публикаций о том, что модель «с открытым исходным кодом», просто повторяют устоявшееся предположение, а не опираются на факты. Ниже разберём, чем на самом деле является Wan 2.7, что Alibaba выпустила, а что нет, и как использовать модель Wan в продакшене уже сегодня.

Schuyler Stacy | 2026-06-24

How to Use Kling 3.0 Motion Control: A Developer's Guide (Web + API)

How to Use Kling 3.0 Motion Control: A Developer's Guide (Web + API)

Kling 3.0 Motion Control animates a static character image with the movement from a reference video. You give it two inputs — a picture of your character and a video of someone moving — and it returns a new clip where your character performs that exact choreography while keeping their own face, outfit, and look. This is motion transfer, not text-to-motion. Instead of describing an action in a prompt and hoping the model interprets it, you show it the action frame by frame. That makes it far more reliable for repeatable character animation, dance, and gesture work. This guide covers both paths: the Kling web app for one-off clips, and the GPTProto API for wiring Motion Control into a pipeline. We'll cover inputs and limits, the `pro` vs `std` tiers, prompt technique, full runnable code, pricing, and the failure modes worth knowing before you spend credits.

Michael Johnson | 2026-06-30