Большинство ИИ-моделей для создания видео дают вам ровно одну попытку. Вы пишете промпт, получаете клип, а если вторая половина неудачна, начинаете сначала — и снова платите. Gemini Omni Flash пытается разорвать этот цикл. Вы создаёте клип, а затем продолжаете менять его, разговаривая с моделью: заменяете персонажа, меняете освещение сцены, угол камеры, и модель строит каждое изменение на основе предыдущего результата, а не создаёт всё с нуля.
Это первая модель нового семейства Google Gemini Omni — Google называет его своим первым мультимодальным «any-to-any»-моделем — и примерно 1 июля 2026 года она стала доступна в публичном предварительном просмотре. Ниже мы простым языком разберём, что это такое, сколько это стоит, как именно вызывать модель и в чём она пока уступает.
Что такое Gemini Omni Flash?
Одним предложением: Gemini Omni Flash принимает на вход текст, изображения, аудио и видео, а на выходе создаёт видео высокого разрешения с синхронизированным аудио — и позволяет редактировать это видео в формате диалога.
Последняя часть и есть основное преимущество, поэтому её стоит отделять от демонстрационных роликов. Такая модель, как Veo или Sora, предназначена для создания одного качественного клипа по одному промпту. Omni Flash исходит из того, что первый клип — это черновик. Google утверждает, что модель «рассуждает о том, что должно произойти дальше», а не просто рисует пиксели — она опирается на знания Gemini о мире и «интуитивное понимание таких сил, как гравитация, кинетическая энергия и гидродинамика», чтобы определить, как должна продолжиться сцена. Считайте это заявлениями Google, а не независимыми выводами: в карточке модели указано, что бенчмарки будут опубликованы позднее, поэтому пока никто не оценил её способность к рассуждению.
Зачем она нужна, прежде чем разбираться, как она работает
Omni Flash решает проблему не «создания более красивого видео», а затрат на редактирование. В генераторе, работающем за одну попытку, каждое изменение требует нового рендера — вы получаете 90% клипа правильно, просите изменить один жест, заново создаёте весь ролик и надеетесь, что удачные 90% сохранятся. Это медленно, дорого и непредсказуемо.
Ответ Omni Flash — это сохраняющий состояние многошаговый цикл. Вы создаёте результат, проверяете его, а затем говорите: «сделай фон закатным» или «пусть она обернётся» — и модель сохраняет предыдущую сцену вместо того, чтобы пересобирать её. Google предоставляет разработчикам эту возможность с помощью previous_interaction_id, который передаётся между последовательными запросами, связывая изменения. В приложении Gemini этот разговорный интерфейс и есть то, чего Veo и Sora просто не предлагают.
Главная мысль: Omni Flash — это скорее «слой редактирования», чем «улучшенный генератор» — по-настоящему интересной модель становится после создания базового клипа.
Что она умеет (с теми цифрами, которые действительно опубликованы)
Вот подтверждённые данные из карточки модели и документации API, ограниченные характеристиками, которые имеют практическое значение:
- Входные данные: текст, изображения, аудио и видео. На момент запуска аудиовход ограничен голосовыми референсами; поддержка других типов аудио запланирована.
- Результат: видео высокого разрешения с исходным синхронизированным аудио, сгенерированным за один проход — оно не добавляется позднее отдельным этапом.
- Длина клипа: примерно 10 секунд на момент запуска. Google представляет это ограничение как решение для развёртывания, а не жёсткий предел модели, и заявляет, что более длинные ролики появятся позднее — поэтому воспринимайте 10 секунд как «сегодня», а не как «навсегда».
- Соотношение сторон: 9:16 и 16:9 (по умолчанию 16:9).
- Согласованность: модель должна сохранять идентичность персонажей, объектов и стиля между монтажными склейками и изменениями, а также синхронизировать экранный текст и графику с движением.
- Происхождение: каждый клип содержит незаметный водяной знак SynthID, а учётные данные контента C2PA включены по умолчанию. Отключить их нельзя.
Разрешение — единственная характеристика, о которой Google говорит уклончиво: в карточке модели указано лишь «высокое разрешение» без количества пикселей, а поддержка более высокого разрешения через корпоративный API обозначена как «скоро станет доступна». Если для вашего процесса важно точное разрешение, воспринимайте это как пробел, за которым нужно следить, а не как повод делать предположения.
Стоимость
Gemini Omni Flash стоит $0.10 за секунду готового видео. Это единственная точная цифра, опубликованная Google, и она достаточно прозрачна: 10-секундный клип стоит около доллара, поэтому стоимость пакетной задачи можно рассчитать без догадок.
Сразу возникший у разработчиков вопрос касается того, что означает эта ставка во время редактирования. Как заметил один из комментаторов на странице модели в Product Hunt: если вы создаёте 20-секундный клип, а затем говорите «сделай второй кадр медленнее», с вас снова списывают стоимость всего клипа за каждый запрос или система учитывает разницу с предыдущим рендером? Google пока публично этого не объяснила, а в разговорной модели именно здесь расходы могут незаметно резко вырасти. Мой вывод: планируйте бюджет так, будто каждый запрос на изменение требует нового рендера, пока Google не задокументирует обратное.
Для сравнения: по сообщениям, $0.10/с — это та же цена, что и у Veo 3.1 Fast. Такую параллель проводила сама команда Google, хотя я бы считал её сообщаемым ориентиром, а не опубликованным сравнительным тестом.
Как использовать: настоящий вызов image-to-video через GPT Proto
Мы добавляем Gemini Omni Flash в GPT Proto, чтобы вы могли вызывать её с тем же ключом и оплачивать её по той же схеме, что и остальные модели каталога — доступ уже постепенно открывается. GPT Proto использует формат запросов в стиле Vertex, поэтому генерация видео из изображения выполняется одним POST-запросом; затем вы опрашиваете возвращённую операцию и скачиваете результат. Ниже приведён полный пример на Python (подставьте собственный ключ из панели GPT Proto):
import requests, json, base64, time
BASE = "https://gptproto.com/v1beta/models/gemini-omni-flash-preview:predictLongRunning"
HEADERS = {"x-goog-api-key": "GPTPROTO_API_KEY", "Content-Type": "application/json"}
# 1) Turn a still image into a moving clip
with open("frame.png", "rb") as f:
image_b64 = base64.b64encode(f.read()).decode()
payload = {
"instances": [{
"prompt": "The subject slowly turns to face the camera as warm sunset light fills the room.",
"image": {"mimeType": "image/png", "bytesBase64Encoded": image_b64}
}],
"parameters": {"aspectRatio": "9:16"}
}
op = requests.post(BASE, headers=HEADERS, data=json.dumps(payload)).json()
operation_name = op["name"] # e.g. models/gemini-omni-flash-preview/operations/abc123
# 2) Poll until the render is done
POLL = f"https://api.gptproto.com/v1beta/{operation_name}"
while True:
result = requests.get(POLL, headers=HEADERS).json()
if result.get("done"):
break
time.sleep(10)
# 3) Download the finished video
uri = result["response"]["generateVideoResponse"]["generatedSamples"][0]["video"]["uri"]
video = requests.get(uri, headers=HEADERS)
open("output.mp4", "wb").write(video.content)
print("Saved output.mp4")
Или тот же первый шаг через cURL:
curl --location 'https://gptproto.com/v1beta/models/gemini-omni-flash-preview:predictLongRunning' \
--header 'x-goog-api-key: GPTPROTO_API_KEY' \
--header 'Content-Type: application/json' \
--data '{
"instances": [{
"prompt": "The subject slowly turns to face the camera as warm sunset light fills the room.",
"image": {"mimeType": "image/png", "bytesBase64Encoded": "BASE64_ENCODED_IMAGE"}
}],
"parameters": {"aspectRatio": "9:16"}
}'
Несколько практических замечаний из документации: генерация видео выполняется как длительная операция, поэтому этап опроса нельзя пропустить; сгенерированные файлы хранятся пару дней, так что скачивайте их без промедления; ошибки соответствуют стандартным кодам HTTP — 401 означает неверный ключ, 403 — недостаточный баланс или отсутствие разрешения, 429 — превышение ограничения частоты запросов.
Краткое руководство по промптам
Omni Flash намеренно предлагает немного настроек — API не поддерживает негативные промпты, temperature, top-p или системные инструкции. Это меняет способ управления моделью:
Задавайте параметры управления в промпте, а не в настройках. Явно описывайте движение и физику («мраморный шар быстро катится, непрерывный плавный кадр»), вместо того чтобы полагаться на параметры. Не пытайтесь уместить все требования в одном мегапромпте — сначала создайте качественный базовый клип, а затем вносите точечные разговорные изменения: именно под такой рабочий процесс и создана модель. Для сохранения непрерывности персонажа используйте референсное изображение, а не описывайте лицо словами. И сохраняйте реалистичные ожидания: собственная карточка Google признаёт, что сложные движения, идеально точный текст и полная согласованность между изменениями пока остаются слабыми местами, поэтому промпты, одновременно опирающиеся на все три аспекта, с наибольшей вероятностью разочаруют.
Честный обзор: где модель хороша, а где даёт сбои
По-настоящему новой особенностью здесь является разговорный цикл редактирования. Итеративная работа с клипом в формате диалога заметно быстрее, чем повторная отправка промптов, и это интерфейс, которого нет у Veo и Sora. Именно ради этого стоит выбрать Omni Flash.
Однако первые отзывы были сдержанными, а не восторженными, и их стоит честно передать. Повторяющийся вывод сообщества заключается в том, что Omni Flash — сильный редактор и лишь приемлемый самостоятельный генератор — несколько пользователей, протестировавших модель на практике, отметили, что она особенно хороша для изменения уже удачного клипа, но менее убедительна при создании оригинального ролика с нуля; слабыми местами называли физику, движение и временную согласованность. Это соответствует собственным признаниям Google. Есть и более жёсткие ограничения: в API видеореференсы длительностью до трёх секунд «принимаются схемой, но обрабатываются некорректно», ссылки на несколько видео не поддерживаются, а редактирование аудио и речи намеренно недоступно на старте — Google ссылается на риск дипфейков. Поэтому это релиз в формате «прототип, который можно попробовать», а не решение, которое стоит без тестирования подключать к продакшену.
Деловая сторона восприняла запуск теплее: среди первых пользователей в продакшене назывались Figma и WPP, что говорит о том, что расчёт стоимости за секунду уже подходит для реальных творческих процессов. Я бы считал это сигналом о привлекательности цены, а не о качестве результата.
Gemini Omni Flash и Veo 3.1: что выбрать?
Именно это чаще всего хотят узнать пользователи, и общий вывод — в том числе от Google — состоит в том, что модели дополняют друг друга, а не заменяют одна другую. Veo заменили на Omni только внутри приложения Gemini; разработчики по-прежнему напрямую вызывают Veo 3.1 через API для задач, требующих высокой точности.
| |
Gemini Omni Flash |
Veo 3.1 / 3.1 Fast |
| Лучше всего подходит для |
Разговорного редактирования, ремикширования с несколькими типами входных данных |
Создания высококачественного ролика за одну попытку |
| Входные данные |
Текст, изображение, аудио (голосовой референс), видео |
Текст, изображение (элементы), видео |
| Длина клипа |
~10 с на момент запуска (Google называет это решением для развёртывания) |
4 / 6 / 8 с, плюс расширение |
| Разрешение |
«Высокое разрешение» — публичных данных пока нет |
720p / 1080p / 4K (1080p и 4K доступны только при длительности 8 с) |
| Исходное аудио |
Да, в каждом клипе |
Да |
| Редактирование |
Разговорные изменения в несколько этапов |
Промпт / элементы, расширение |
| Цена |
$0.10 / с результата |
$0.10 / с (Fast, по сообщениям) |
| Водяной знак |
SynthID + C2PA |
SynthID |
Практическое правило: выбирайте Veo 3.1 , когда важнее всего разрешение и чистый кинематографичный результат; выбирайте Omni Flash, когда важнее менять, улучшать и ремикшировать клип в формате диалога. Во многих реальных процессах ответом будут обе модели: создайте основу с помощью более чёткого генератора, а затем передайте её Omni Flash для цикла редактирования.
Для кого предназначена модель — и кому стоит подождать
Выбирайте Omni Flash, если ваша работа связана с частым редактированием: изменениями в стиле VFX, трансформациями аватаров и референсных изображений или любыми задачами, где вам предстоит несколько раз дорабатывать один клип. Подождите, если вам уже сегодня необходимо гарантированно высокое разрешение, отдельные клипы длиннее примерно 10 секунд, надёжная работа с видеореференсами или редактирование аудио и голоса — эти возможности либо не определены, либо ограничены, либо отключены на момент запуска.
Готовы создавать с её помощью? Получите ключ и изучите актуальный каталог на GPT Proto — доступ к Gemini Omni Flash уже постепенно открывается.