대부분의 AI 비디오 모델은 단 한 번의 기회만 줍니다. 프롬프트를 작성하면 클립을 얻지만, 후반부가 잘못되면 처음부터 다시 시작해야 하고 — 다시 비용을 지불해야 합니다. Gemini Omni Flash는 Google이 그 루프를 끊기 위해 내놓은 시도입니다. 클립을 생성한 다음, 말을 걸며 계속 형태를 바꿔 갑니다. 캐릭터를 바꾸고, 장면의 조명을 바꾸고, 카메라 각도를 바꾸면, 모델은 처음부터 다시 생성하는 대신 마지막 편집을 이어받아 각 편집을 만듭니다.
이 모델은 Google의 새로운 Gemini Omni 제품군 중 첫 번째 모델입니다. Google이 자사 최초의 “any-to-any” 멀티모달 모델이라고 부르는 그 제품군이죠. 2026년 7월 1일경 공개 미리보기에 들어갔습니다. 아래에는 이것이 무엇인지, 비용이 얼마인지, 실제로 호출하는 방법과 여전히 부족한 점에 대한 평이한 설명을 정리했습니다.
Gemini Omni Flash란 무엇인가?
한 문장으로 요약하면, Gemini Omni Flash는 텍스트, 이미지, 오디오, 비디오를 입력받아 고해상도 비디오와 함께 동기화된 오디오를 출력합니다. 그리고 그 비디오를 대화를 주고받으며 편집할 수 있게 해줍니다.
마지막 문장이 곧 이 모델의 전체 요점이므로, 데모 영상과는 분리해서 볼 필요가 있습니다. Veo나 Sora 같은 모델은 하나의 프롬프트에서 한 편의 강력한 클립을 렌더링하도록 만들어졌습니다. Omni Flash는 첫 클립이 초안이라고 가정합니다. Google은 이 모델이 단순히 픽셀을 그리는 대신 “다음에 어떤 일이 일어나야 하는지 추론한다”고 설명합니다. 장면이 어떻게 이어져야 할지 결정하기 위해 Gemini의 세계 지식과 “중력, 운동 에너지, 유체 역학 같은 힘에 대한 직관적 이해”에 의존한다는 것입니다. 이는 독립적인 검증 결과가 아닌 Google의 주장으로 받아들이세요. 모델 카드에는 벤치마크가 곧 공개 예정으로 표시되어 있어 아직 그 추론 능력을 평가한 사람은 없습니다.
작동 방식에 앞서, 왜 이런 모델인가
Omni Flash가 겨냥하는 문제는 “더 예쁜 비디오 생성”이 아닙니다. 바로 편집 비용입니다. 원샷 생성기에서는 모든 변경이 처음부터 다시 렌더링되는 것을 의미합니다. 클립의 90%가 마음에 들어 한 가지 제스처만 바꿔 달라고 해도 전체를 다시 돌려서 좋았던 90%가 유지되기를 바랄 수밖에 없죠. 느리고, 비싸고, 결과도 비결정적입니다.
Omni Flash의 해답은 상태를 유지하는 다중 턴 루프입니다. 생성하고, 확인한 다음 “배경을 노을로 바꿔 줘” 또는 “그녀가 뒤돌게 해 줘”라고 말하면, 모델은 장면을 처음부터 다시 만들지 않고 이전 장면을 이어갑니다. Google은 각 턴마다 전달하는 previous_interaction_id를 개발자에게 제공해 편집이 이어지도록 합니다. Gemini 앱 안에서 이런 대화형 편집 표면은 Veo와 Sora에는 없는 기능입니다.
한마디로 기억하세요: Omni Flash는 “더 나은 생성기”라기보다 “편집 레이어”에 가깝습니다. 기본 클립이 이미 있을 때 비로소 흥미로워집니다.
할 수 있는 것들 (실제 공개된 수치 기준)
Google의 모델 카드와 API 문서에서 확인된, 중요한 세부 사항만 추린 내용은 다음과 같습니다.
- 입력: 텍스트, 이미지, 오디오, 비디오. 출시 시점에 오디오 입력은 음성 레퍼런스로 제한되며, 더 많은 오디오 유형이 계획되어 있습니다.
- 출력: 동일한 패스에서 생성된 네이티브 동기화 오디오를 갖춘 고해상도 비디오 — 나중에 덧붙이는 방식이 아닙니다.
- 클립 길이: 출시 시점에는 약 10초입니다. Google은 이 상한을 모델 자체의 한계라기보다 배포상의 선택이라고 설명하며, 더 긴 길이도 곧 지원될 예정이라고 밝혔습니다. 따라서 10초는 “현재”의 기준이지 “영원한” 제한이 아닙니다.
- 화면 비율: 9:16 및 16:9 (기본 16:9).
- 일관성: 이 모델은 컷과 편집 전반에서 캐릭터, 객체, 스타일의 정체성을 유지하고, 화면 속 텍스트와 그래픽을 움직임과 동기화하도록 설계되었습니다.
- 출처: 모든 클립에는 눈에 거의 보이지 않는 SynthID 워터마크가 포함되며, C2PA 콘텐츠 자격 증명이 기본으로 적용됩니다. 해제할 수 없습니다.
해상도는 Google이 애매하게 넘어가는 사양입니다. 모델 카드에는 픽셀 수 없이 “고해상도”라고만 적혀 있고, 엔터프라이즈 API를 통한 더 높은 해상도 지원은 “곧 제공 예정”으로 표시되어 있습니다. 정확한 해상도가 파이프라인에 중요하다면, 이 부분은 가정할 수 없는 수치이자 주목해야 할 공백입니다.
가격
Gemini Omni Flash의 가격은 비디오 출력 1초당 $0.10입니다. Google이 발표한 유일한 확정 수치인데, 깔끔합니다. 10초 클립이 약 1달러이고, 추측 없이 배치 작업 비용을 산출할 수 있습니다.
개발자들이 바로 알아챈 문제는 이 요금이 편집 중에 무엇을 의미하느냐는 것입니다. 한 댓글러가 Product Hunt 페이지에서 지적했듯이, 20초 클립을 생성한 다음 “두 번째 샷을 느리게 해 줘”라고 말하면 매 턴 전체 클립에 대해 다시 비용이 청구되는 걸까요, 아니면 이전 렌더링과의 차이만 계산하는 걸까요? Google은 이 부분을 공개적으로 명확히 밝히지 않았고, 대화형 모델에서 바로 그 지점이 비용이 조용히 불어날 수 있는 곳입니다. 제 판단은 Google이 문서로 명확히 설명하기 전까지 각 편집 턴을 새 렌더링으로 간주하고 예산을 잡는 것입니다.
참고로 이 $0.10/초는 Veo 3.1 Fast와 같다고 알려졌습니다. Google 팀도 그런 비교를 했지만, 공식 발표된 비교라기보다 보도 수준으로 보는 게 맞습니다.
사용 방법: GPT Proto를 통한 실제 이미지-투-비디오 호출
GPT Proto에 Gemini Omni Flash를 추가하고 있어, 카탈로그의 다른 모델과 동일한 키와 결제 방식으로 호출할 수 있습니다. 액세스는 지금 순차적으로 제공되고 있습니다. GPT Proto는 Google의 Vertex 스타일 요청 형식을 따르므로, 이미지-투-비디오 생성은 단일 POST로 이루어지고, 반환된 operation을 폴링한 뒤 결과를 다운로드하면 됩니다. 다음은 전체 Python 플로우입니다(GPT Proto 대시보드에서 본인의 키를 넣으세요):
import requests, json, base64, time
BASE = "https://gptproto.com/v1beta/models/gemini-omni-flash-preview:predictLongRunning"
HEADERS = {"x-goog-api-key": "GPTPROTO_API_KEY", "Content-Type": "application/json"}
# 1) Turn a still image into a moving clip
with open("frame.png", "rb") as f:
image_b64 = base64.b64encode(f.read()).decode()
payload = {
"instances": [{
"prompt": "The subject slowly turns to face the camera as warm sunset light fills the room.",
"image": {"mimeType": "image/png", "bytesBase64Encoded": image_b64}
}],
"parameters": {"aspectRatio": "9:16"}
}
op = requests.post(BASE, headers=HEADERS, data=json.dumps(payload)).json()
operation_name = op["name"] # e.g. models/gemini-omni-flash-preview/operations/abc123
# 2) Poll until the render is done
POLL = f"https://api.gptproto.com/v1beta/{operation_name}"
while True:
result = requests.get(POLL, headers=HEADERS).json()
if result.get("done"):
break
time.sleep(10)
# 3) Download the finished video
uri = result["response"]["generateVideoResponse"]["generatedSamples"][0]["video"]["uri"]
video = requests.get(uri, headers=HEADERS)
open("output.mp4", "wb").write(video.content)
print("Saved output.mp4")
또는 같은 첫 단계를 cURL로 작성하면 다음과 같습니다:
curl --location 'https://gptproto.com/v1beta/models/gemini-omni-flash-preview:predictLongRunning' \
--header 'x-goog-api-key: GPTPROTO_API_KEY' \
--header 'Content-Type: application/json' \
--data '{
"instances": [{
"prompt": "The subject slowly turns to face the camera as warm sunset light fills the room.",
"image": {"mimeType": "image/png", "bytesBase64Encoded": "BASE64_ENCODED_IMAGE"}
}],
"parameters": {"aspectRatio": "9:16"}
}'
문서에 나온 몇 가지 실용적인 참고 사항: 비디오 생성은 오래 걸리는 작업이므로 폴링 단계는 필수입니다. 생성된 파일은 며칠간 보관되므로 바로 다운로드하세요. 오류는 표준 HTTP 코드를 따릅니다. 잘못된 키는 401, 잔액 부족이나 권한 문제는 403, 속도 제한은 429입니다.
간단한 프롬프트 가이드
Omni Flash는 의도적으로 조절 장치가 빈약합니다. API는 네거티브 프롬프트, temperature, top-p, 시스템 지시문을 지원하지 않습니다. 이에 따라 제어 방식이 달라집니다:
제어는 파라미터가 아니라 프롬프트에 넣으세요. 설정에 기대지 말고 움직임과 물리 법칙을 명시적으로 설명하세요(“대리석이 빠르게 굴러가고, 끊김 없이 부드러운 한 컷”). 모든 요구사항을 하나의 거대한 프롬프트에 욱여넣지 마세요. 튼튼한 기본 클립을 먼저 생성한 다음, 대화형으로 수술처럼 정밀한 변경을 가하세요. 이 모델이 실제로 만들어진 워크플로우입니다. 캐릭터 연속성을 유지하려면 얼굴을 말로 설명하는 대신 레퍼런스 이미지를 넣으세요. 그리고 기대치는 현실적으로 유지하세요. Google 자신의 모델 카드도 복잡한 움직임, 완벽하게 정확한 텍스트, 편집 간 완전한 일관성은 여전히 약점이라고 인정합니다. 셋 모두를 한 번에 요구하는 프롬프트가 가장 실망시키기 쉽습니다.
솔직한 평가: 강점과 아쉬운 점
여기서 진짜 새로운 점은 대화형 편집 루프입니다. 클립과 채팅하며 반복 작업하는 것은 프롬프트를 다시 입력하는 것보다 훨씬 빠르며, Veo와 Sora가 제공하지 않는 표면이기도 합니다. Omni Flash를 선택해야 하는 이유입니다.
하지만 초기 반응은 과대광고라기보다 신중했습니다. 커뮤니티의 반복적인 평가에 따르면 Omni Flash는 훌륭한 편집기이자 그저 그럭저럭 쓸 만한 순수 생성기입니다. 직접 사용해 본 여러 테스터는 이미 좋은 클립을 재구성할 때는 빛을 발하지만, 처음부터 원본을 만들 때는 설득력이 떨어진다고 말했고, 물리, 움직임, 시간적 일관성이 약점으로 꼽혔습니다. 이는 Google 스스로 인정한 내용과도 일치합니다. 더 단단한 제한도 있습니다. API에서 최대 3초의 비디오 레퍼런스는 “스키마에는 허용되지만 제대로 처리되지 않으며”, 다중 비디오 레퍼런스는 지원되지 않고, 오디오/음성 편집은 의도적으로 출시에서 제외되었습니다. Google은 딥페이크 위험을 이유로 듭니다. 따라서 이번 출시는 프로토타입으로 사용하기 위한 것이지, 검증 없이 프로덕션에 바로 연결하라는 것이 아닙니다.
비즈니스 측면의 반응은 좀 더 따뜻했습니다. 출시 시점에 초기 프로덕션 도입 사례(Figma, WPP 등이 언급됨)가 함께 소개되었는데, 이는 1초당 가격 계산이 실제 창작 워크플로우 기준을 이미 충족한다는 뜻입니다. 저는 이 신호를 출력 품질보다는 가격 책정에 대한 신호로 보고 싶습니다.
Gemini Omni Flash vs Veo 3.1: 무엇을 사용해야 하나?
대부분의 검색이 실제로 묻는 질문이며, Google의 의견을 포함한 합의는 두 모델이 대체 관계가 아니라 보완 관계라는 것입니다. Veo는 Gemini 앱 안에서만 Omni로 교체되었습니다. 개발자는 고품질 작업을 위해 여전히 API로 Veo 3.1을 직접 호출합니다.
| |
Gemini Omni Flash |
Veo 3.1 / 3.1 Fast |
| 적합한 용도 |
대화형 편집, 다중 입력 리믹싱 |
고품질 원샷 생성 |
| 입력 |
텍스트, 이미지, 오디오(음성 레퍼런스), 비디오 |
텍스트, 이미지(ingredients), 비디오 |
| 클립 길이 |
출시 시 약 10초 (Google은 이를 배포 선택이라고 표현) |
4 / 6 / 8초, 확장 지원 |
| 해상도 |
“고해상도” — 아직 공개된 수치 없음 |
720p / 1080p / 4K (1080p & 4K는 8초에서만) |
| 네이티브 오디오 |
예, 모든 클립 |
예 |
| 편집 |
다중 턴 대화형 편집 |
프롬프트 / ingredients, 확장 |
| 가격 |
$0.10 / 초 출력 |
$0.10 / 초 (Fast, 보도 기준) |
| 워터마크 |
SynthID + C2PA |
SynthID |
실용적인 규칙: 선택하세요. Veo 3.1 은 해상도와 깔끔한 시네마틱 출력이 가장 중요할 때, Omni Flash는 대화로 클립을 변경·정제·리믹스하는 것이 더 중요할 때 선택하세요. 실제 파이프라인에서는 둘 다인 경우가 많습니다. 더 선명한 생성기로 기본 영상을 만든 다음, 편집 루프는 Omni Flash에 맡기면 됩니다.
이런 분들을 위한 모델 — 그리고 기다려야 할 분들
편집 작업이 많은 경우 Omni Flash를 선택하세요. VFX 스타일의 조정, 아바타 및 레퍼런스 기반 변환, 또는 클립을 여러 번 반복해서 다듬어야 하는 작업이 여기에 해당합니다. 오늘 당장 보장된 고해상도, 약 10초 이상의 단일 클립, 안정적인 비디오 레퍼런스 입력, 또는 오디오/음성 편집이 필요하다면 기다리세요. 이러한 기능은 아직 지정되지 않았거나, 상한이 있거나, 출시 시점에 꺼져 있습니다.
지금 바로 만들어 보시겠습니까? GPT Proto에서 키를 발급받고 라이브 카탈로그를 둘러보세요. Gemini Omni Flash 액세스가 지금 순차적으로 제공되고 있습니다.