Michael Johnson2026-07-03

Gemini Omni Flash 소개: 말로 편집하는 Google의 새로운 비디오 모델

Gemini Omni Flash는 채팅으로 편집하는 Google의 새로운 모든 입력형 비디오 모델입니다 — $0.10/초, 약 10초 클립. 기능, 실제 API 코드, Omni vs Veo 비교를 확인하세요.

Gemini Omni Flash 소개: 말로 편집하는 Google의 새로운 비디오 모델

대부분의 AI 비디오 모델은 단 한 번의 기회만 줍니다. 프롬프트를 작성하면 클립을 얻지만, 후반부가 잘못되면 처음부터 다시 시작해야 하고 — 다시 비용을 지불해야 합니다. Gemini Omni Flash는 Google이 그 루프를 끊기 위해 내놓은 시도입니다. 클립을 생성한 다음, 말을 걸며 계속 형태를 바꿔 갑니다. 캐릭터를 바꾸고, 장면의 조명을 바꾸고, 카메라 각도를 바꾸면, 모델은 처음부터 다시 생성하는 대신 마지막 편집을 이어받아 각 편집을 만듭니다.

이 모델은 Google의 새로운 Gemini Omni 제품군 중 첫 번째 모델입니다. Google이 자사 최초의 “any-to-any” 멀티모달 모델이라고 부르는 그 제품군이죠. 2026년 7월 1일경 공개 미리보기에 들어갔습니다. 아래에는 이것이 무엇인지, 비용이 얼마인지, 실제로 호출하는 방법과 여전히 부족한 점에 대한 평이한 설명을 정리했습니다.

목차

Gemini Omni Flash란 무엇인가?

한 문장으로 요약하면, Gemini Omni Flash는 텍스트, 이미지, 오디오, 비디오를 입력받아 고해상도 비디오와 함께 동기화된 오디오를 출력합니다. 그리고 그 비디오를 대화를 주고받으며 편집할 수 있게 해줍니다.

마지막 문장이 곧 이 모델의 전체 요점이므로, 데모 영상과는 분리해서 볼 필요가 있습니다. Veo나 Sora 같은 모델은 하나의 프롬프트에서 한 편의 강력한 클립을 렌더링하도록 만들어졌습니다. Omni Flash는 첫 클립이 초안이라고 가정합니다. Google은 이 모델이 단순히 픽셀을 그리는 대신 “다음에 어떤 일이 일어나야 하는지 추론한다”고 설명합니다. 장면이 어떻게 이어져야 할지 결정하기 위해 Gemini의 세계 지식과 “중력, 운동 에너지, 유체 역학 같은 힘에 대한 직관적 이해”에 의존한다는 것입니다. 이는 독립적인 검증 결과가 아닌 Google의 주장으로 받아들이세요. 모델 카드에는 벤치마크가 곧 공개 예정으로 표시되어 있어 아직 그 추론 능력을 평가한 사람은 없습니다.

작동 방식에 앞서, 왜 이런 모델인가

Omni Flash가 겨냥하는 문제는 “더 예쁜 비디오 생성”이 아닙니다. 바로 편집 비용입니다. 원샷 생성기에서는 모든 변경이 처음부터 다시 렌더링되는 것을 의미합니다. 클립의 90%가 마음에 들어 한 가지 제스처만 바꿔 달라고 해도 전체를 다시 돌려서 좋았던 90%가 유지되기를 바랄 수밖에 없죠. 느리고, 비싸고, 결과도 비결정적입니다.

Omni Flash의 해답은 상태를 유지하는 다중 턴 루프입니다. 생성하고, 확인한 다음 “배경을 노을로 바꿔 줘” 또는 “그녀가 뒤돌게 해 줘”라고 말하면, 모델은 장면을 처음부터 다시 만들지 않고 이전 장면을 이어갑니다. Google은 각 턴마다 전달하는 previous_interaction_id를 개발자에게 제공해 편집이 이어지도록 합니다. Gemini 앱 안에서 이런 대화형 편집 표면은 Veo와 Sora에는 없는 기능입니다.

한마디로 기억하세요: Omni Flash는 “더 나은 생성기”라기보다 “편집 레이어”에 가깝습니다. 기본 클립이 이미 있을 때 비로소 흥미로워집니다.

할 수 있는 것들 (실제 공개된 수치 기준)

Google의 모델 카드와 API 문서에서 확인된, 중요한 세부 사항만 추린 내용은 다음과 같습니다.

  • 입력: 텍스트, 이미지, 오디오, 비디오. 출시 시점에 오디오 입력은 음성 레퍼런스로 제한되며, 더 많은 오디오 유형이 계획되어 있습니다.
  • 출력: 동일한 패스에서 생성된 네이티브 동기화 오디오를 갖춘 고해상도 비디오 — 나중에 덧붙이는 방식이 아닙니다.
  • 클립 길이: 출시 시점에는 약 10초입니다. Google은 이 상한을 모델 자체의 한계라기보다 배포상의 선택이라고 설명하며, 더 긴 길이도 곧 지원될 예정이라고 밝혔습니다. 따라서 10초는 “현재”의 기준이지 “영원한” 제한이 아닙니다.
  • 화면 비율: 9:16 및 16:9 (기본 16:9).
  • 일관성: 이 모델은 컷과 편집 전반에서 캐릭터, 객체, 스타일의 정체성을 유지하고, 화면 속 텍스트와 그래픽을 움직임과 동기화하도록 설계되었습니다.
  • 출처: 모든 클립에는 눈에 거의 보이지 않는 SynthID 워터마크가 포함되며, C2PA 콘텐츠 자격 증명이 기본으로 적용됩니다. 해제할 수 없습니다.

해상도는 Google이 애매하게 넘어가는 사양입니다. 모델 카드에는 픽셀 수 없이 “고해상도”라고만 적혀 있고, 엔터프라이즈 API를 통한 더 높은 해상도 지원은 “곧 제공 예정”으로 표시되어 있습니다. 정확한 해상도가 파이프라인에 중요하다면, 이 부분은 가정할 수 없는 수치이자 주목해야 할 공백입니다.

가격

Gemini Omni Flash의 가격은 비디오 출력 1초당 $0.10입니다. Google이 발표한 유일한 확정 수치인데, 깔끔합니다. 10초 클립이 약 1달러이고, 추측 없이 배치 작업 비용을 산출할 수 있습니다.

개발자들이 바로 알아챈 문제는 이 요금이 편집 중에 무엇을 의미하느냐는 것입니다. 한 댓글러가 Product Hunt 페이지에서 지적했듯이, 20초 클립을 생성한 다음 “두 번째 샷을 느리게 해 줘”라고 말하면 매 턴 전체 클립에 대해 다시 비용이 청구되는 걸까요, 아니면 이전 렌더링과의 차이만 계산하는 걸까요? Google은 이 부분을 공개적으로 명확히 밝히지 않았고, 대화형 모델에서 바로 그 지점이 비용이 조용히 불어날 수 있는 곳입니다. 제 판단은 Google이 문서로 명확히 설명하기 전까지 각 편집 턴을 새 렌더링으로 간주하고 예산을 잡는 것입니다.

참고로 이 $0.10/초는 Veo 3.1 Fast와 같다고 알려졌습니다. Google 팀도 그런 비교를 했지만, 공식 발표된 비교라기보다 보도 수준으로 보는 게 맞습니다.

사용 방법: GPT Proto를 통한 실제 이미지-투-비디오 호출

GPT Proto에 Gemini Omni Flash를 추가하고 있어, 카탈로그의 다른 모델과 동일한 키와 결제 방식으로 호출할 수 있습니다. 액세스는 지금 순차적으로 제공되고 있습니다. GPT Proto는 Google의 Vertex 스타일 요청 형식을 따르므로, 이미지-투-비디오 생성은 단일 POST로 이루어지고, 반환된 operation을 폴링한 뒤 결과를 다운로드하면 됩니다. 다음은 전체 Python 플로우입니다(GPT Proto 대시보드에서 본인의 키를 넣으세요):

import requests, json, base64, time

BASE = "https://gptproto.com/v1beta/models/gemini-omni-flash-preview:predictLongRunning"
HEADERS = {"x-goog-api-key": "GPTPROTO_API_KEY", "Content-Type": "application/json"}

# 1) Turn a still image into a moving clip
with open("frame.png", "rb") as f:
    image_b64 = base64.b64encode(f.read()).decode()

payload = {
    "instances": [{
        "prompt": "The subject slowly turns to face the camera as warm sunset light fills the room.",
        "image": {"mimeType": "image/png", "bytesBase64Encoded": image_b64}
    }],
    "parameters": {"aspectRatio": "9:16"}
}
op = requests.post(BASE, headers=HEADERS, data=json.dumps(payload)).json()
operation_name = op["name"]        # e.g. models/gemini-omni-flash-preview/operations/abc123

# 2) Poll until the render is done
POLL = f"https://api.gptproto.com/v1beta/{operation_name}"
while True:
    result = requests.get(POLL, headers=HEADERS).json()
    if result.get("done"):
        break
    time.sleep(10)

# 3) Download the finished video
uri = result["response"]["generateVideoResponse"]["generatedSamples"][0]["video"]["uri"]
video = requests.get(uri, headers=HEADERS)
open("output.mp4", "wb").write(video.content)
print("Saved output.mp4")

또는 같은 첫 단계를 cURL로 작성하면 다음과 같습니다:

curl --location 'https://gptproto.com/v1beta/models/gemini-omni-flash-preview:predictLongRunning' \
  --header 'x-goog-api-key: GPTPROTO_API_KEY' \
  --header 'Content-Type: application/json' \
  --data '{
    "instances": [{
      "prompt": "The subject slowly turns to face the camera as warm sunset light fills the room.",
      "image": {"mimeType": "image/png", "bytesBase64Encoded": "BASE64_ENCODED_IMAGE"}
    }],
    "parameters": {"aspectRatio": "9:16"}
  }'

문서에 나온 몇 가지 실용적인 참고 사항: 비디오 생성은 오래 걸리는 작업이므로 폴링 단계는 필수입니다. 생성된 파일은 며칠간 보관되므로 바로 다운로드하세요. 오류는 표준 HTTP 코드를 따릅니다. 잘못된 키는 401, 잔액 부족이나 권한 문제는 403, 속도 제한은 429입니다.

간단한 프롬프트 가이드

Omni Flash는 의도적으로 조절 장치가 빈약합니다. API는 네거티브 프롬프트, temperature, top-p, 시스템 지시문을 지원하지 않습니다. 이에 따라 제어 방식이 달라집니다:

제어는 파라미터가 아니라 프롬프트에 넣으세요. 설정에 기대지 말고 움직임과 물리 법칙을 명시적으로 설명하세요(“대리석이 빠르게 굴러가고, 끊김 없이 부드러운 한 컷”). 모든 요구사항을 하나의 거대한 프롬프트에 욱여넣지 마세요. 튼튼한 기본 클립을 먼저 생성한 다음, 대화형으로 수술처럼 정밀한 변경을 가하세요. 이 모델이 실제로 만들어진 워크플로우입니다. 캐릭터 연속성을 유지하려면 얼굴을 말로 설명하는 대신 레퍼런스 이미지를 넣으세요. 그리고 기대치는 현실적으로 유지하세요. Google 자신의 모델 카드도 복잡한 움직임, 완벽하게 정확한 텍스트, 편집 간 완전한 일관성은 여전히 약점이라고 인정합니다. 셋 모두를 한 번에 요구하는 프롬프트가 가장 실망시키기 쉽습니다.

솔직한 평가: 강점과 아쉬운 점

여기서 진짜 새로운 점은 대화형 편집 루프입니다. 클립과 채팅하며 반복 작업하는 것은 프롬프트를 다시 입력하는 것보다 훨씬 빠르며, Veo와 Sora가 제공하지 않는 표면이기도 합니다. Omni Flash를 선택해야 하는 이유입니다.

하지만 초기 반응은 과대광고라기보다 신중했습니다. 커뮤니티의 반복적인 평가에 따르면 Omni Flash는 훌륭한 편집기이자 그저 그럭저럭 쓸 만한 순수 생성기입니다. 직접 사용해 본 여러 테스터는 이미 좋은 클립을 재구성할 때는 빛을 발하지만, 처음부터 원본을 만들 때는 설득력이 떨어진다고 말했고, 물리, 움직임, 시간적 일관성이 약점으로 꼽혔습니다. 이는 Google 스스로 인정한 내용과도 일치합니다. 더 단단한 제한도 있습니다. API에서 최대 3초의 비디오 레퍼런스는 “스키마에는 허용되지만 제대로 처리되지 않으며”, 다중 비디오 레퍼런스는 지원되지 않고, 오디오/음성 편집은 의도적으로 출시에서 제외되었습니다. Google은 딥페이크 위험을 이유로 듭니다. 따라서 이번 출시는 프로토타입으로 사용하기 위한 것이지, 검증 없이 프로덕션에 바로 연결하라는 것이 아닙니다.

비즈니스 측면의 반응은 좀 더 따뜻했습니다. 출시 시점에 초기 프로덕션 도입 사례(Figma, WPP 등이 언급됨)가 함께 소개되었는데, 이는 1초당 가격 계산이 실제 창작 워크플로우 기준을 이미 충족한다는 뜻입니다. 저는 이 신호를 출력 품질보다는 가격 책정에 대한 신호로 보고 싶습니다.

Gemini Omni Flash vs Veo 3.1: 무엇을 사용해야 하나?

대부분의 검색이 실제로 묻는 질문이며, Google의 의견을 포함한 합의는 두 모델이 대체 관계가 아니라 보완 관계라는 것입니다. Veo는 Gemini 앱 안에서만 Omni로 교체되었습니다. 개발자는 고품질 작업을 위해 여전히 API로 Veo 3.1을 직접 호출합니다.

  Gemini Omni Flash Veo 3.1 / 3.1 Fast
적합한 용도 대화형 편집, 다중 입력 리믹싱 고품질 원샷 생성
입력 텍스트, 이미지, 오디오(음성 레퍼런스), 비디오 텍스트, 이미지(ingredients), 비디오
클립 길이 출시 시 약 10초 (Google은 이를 배포 선택이라고 표현) 4 / 6 / 8초, 확장 지원
해상도 “고해상도” — 아직 공개된 수치 없음 720p / 1080p / 4K (1080p & 4K는 8초에서만)
네이티브 오디오 예, 모든 클립
편집 다중 턴 대화형 편집 프롬프트 / ingredients, 확장
가격 $0.10 / 초 출력 $0.10 / 초 (Fast, 보도 기준)
워터마크 SynthID + C2PA SynthID

실용적인 규칙: 선택하세요. Veo 3.1 은 해상도와 깔끔한 시네마틱 출력이 가장 중요할 때, Omni Flash는 대화로 클립을 변경·정제·리믹스하는 것이 더 중요할 때 선택하세요. 실제 파이프라인에서는 둘 다인 경우가 많습니다. 더 선명한 생성기로 기본 영상을 만든 다음, 편집 루프는 Omni Flash에 맡기면 됩니다.

이런 분들을 위한 모델 — 그리고 기다려야 할 분들

편집 작업이 많은 경우 Omni Flash를 선택하세요. VFX 스타일의 조정, 아바타 및 레퍼런스 기반 변환, 또는 클립을 여러 번 반복해서 다듬어야 하는 작업이 여기에 해당합니다. 오늘 당장 보장된 고해상도, 약 10초 이상의 단일 클립, 안정적인 비디오 레퍼런스 입력, 또는 오디오/음성 편집이 필요하다면 기다리세요. 이러한 기능은 아직 지정되지 않았거나, 상한이 있거나, 출시 시점에 꺼져 있습니다.

 


지금 바로 만들어 보시겠습니까? GPT Proto에서 키를 발급받고 라이브 카탈로그를 둘러보세요. Gemini Omni Flash 액세스가 지금 순차적으로 제공되고 있습니다.

크리에이티브 스튜디오

프로덕션 API로 이미지, 영상 등을 생성해 보세요.

만들기 시작하기
크리에이티브 스튜디오
관련 모델
모든 모델
Google
Claude
20% OFF
Google
40% OFF
Google
40% OFF

자주 묻는 질문

Gemini Omni Flash API는 어떻게 받나요?

GPTProto에 가입하고 대시보드에서 API 키를 생성한 뒤, 위에 표시된 gemini-omni-flash-preview 엔드포인트를 호출하세요. 액세스가 순차적으로 제공되고 있으며, 카탈로그의 다른 모델과 동일한 키와 결제 방식으로 사용할 수 있습니다. 현재 사용 가능한 모델을 보려면 전체 모델 라이브러리를 둘러보세요.

Gemini Omni Flash 비용은 얼마인가요?

비디오 출력 1초당 $0.10, 10초 클립 기준 약 $1입니다. 반복 편집 시 매 턴 전체 클립에 대해 다시 청구되는지는 아직 문서화되지 않았으므로 보수적으로 예산을 잡으세요.

Gemini Omni Flash 비디오 길이는 얼마나 되나요?

출시 시점에는 약 10초입니다. Google은 이를 모델 한계가 아닌 배포 선택이라고 설명하며, 더 긴 길이도 곧 지원될 예정이라고 밝혔습니다.

Gemini Omni Flash vs Veo 3.1 — 어떤 것이 더 나은가요?

정확히 말하면 둘 다 아닙니다. Veo 3.1은 해상도와 정제된 원샷 출력에서 앞서고, Omni Flash는 대화형 다중 입력 편집에서 앞섭니다. 많은 팀이 둘 다 사용합니다.

Gemini Omni Flash는 음성을 편집하거나 무검열 오디오를 생성할 수 있나요?

아니요. 딥페이크 우려로 인해 출시 시점에 오디오 및 음성 편집은 의도적으로 제외되었으며, 모든 클립에는 제거할 수 없는 SynthID 워터마크와 C2PA 자격 증명이 포함됩니다.
Seedance 2.0 Mini vs Seedance 2.0: 가격, 품질, 그리고 실제로 사용해야 할 모델

Seedance 2.0 Mini vs Seedance 2.0: 가격, 품질, 그리고 실제로 사용해야 할 모델

한 줄 요약 — 같은 해상도에서 Seedance 2.0 Mini는 GPTProto에서 표준 Seedance 2.0보다 약 20% 저렴합니다. 대부분의 비교 페이지에 나오는 '반값'은 아닙니다. 더 큰 절감은 확실한 상한선에서 나옵니다. Mini는 720p까지만 지원하므로 비싼 1080p 및 4K 요금제를 아예 건너뜁니다. 빠르고 대량으로 반복 작업하고 숏폼 소셜 클립을 만들 때는 Mini를 사용하세요. 1080p나 4K, 더 무거운 모션, 또는 클라이언트용 최종 컷이 필요하다면 표준 Seedance 2.0을 사용하세요. 실제로 비용 효과가 있는 구성은 둘 다 쓰는 것입니다. Mini로 초안을 만들고 표준 모델로 마무리하는 방식입니다. Seedance 2.0 Mini와 정식 모델에 대한 이 가이드의 나머지 부분은 각 선택의 실제 수치를 보여줍니다.

Tiffany Layne | 2026-06-30

Seedance 2.5는 아직 출시되지 않았나요? 출시일과 현재까지 실제로 알려진 내용 (2026)

Seedance 2.5는 아직 출시되지 않았나요? 출시일과 현재까지 실제로 알려진 내용 (2026)

이번 주에 ByteDance의 Seed 페이지를 보고 또 보면서 Seedance 2.5가 올라오기를 기다렸습니다. 지금까지는 아무것도 없습니다. 모델 페이지도, 사양표도, 날짜도 없습니다. 바로 이 공백 때문에 이 글을 작성했습니다. 현재 Seedance 2.5에 관해 확신에 찬 글이 많이 떠돌고 있는데, 대부분 추측을 사실처럼 제시하고 있습니다. 여기서는 둘을 명확히 구분한 다음, 오늘 실제로 사용할 수 있는 것을 안내하겠습니다.

Tiffany Layne | 2026-06-23

Wan 2.7이란? Alibaba의 사고 모드 모델 가이드 (2026)

Wan 2.7이란? Alibaba의 사고 모드 모델 가이드 (2026)

"wan 2.7"을 검색하면 서로 양립할 수 없는 두 가지 답변이 나옵니다. 한쪽 가이드는 가중치를 다운로드해 자신의 GPU에서 실행하라고 하고, 다른 쪽은 API를 통해서만 이용할 수 있다고 합니다. 어느 쪽이 맞는지 알아본 이유는, 그 답에 따라 이 모델을 직접 호스팅할 수 있는지가 결정되기 때문입니다 — 간단히 말해 대부분의 자신만만한 "오픈 소스" 게시물은 사실이 아니라 관행을 반복하고 있습니다. Wan 2.7이 실제로 무엇인지, Alibaba가 무엇을 출시했고 무엇을 출시하지 않았는지, 그리고 오늘날 Wan 모델을 프로덕션에 도입하는 방법을 알아보겠습니다.

Schuyler Stacy | 2026-06-24

Kling 3.0 Motion Control 사용법: 개발자 가이드 (웹 + API)

Kling 3.0 Motion Control 사용법: 개발자 가이드 (웹 + API)

Kling 3.0 Motion Control은 정적인 캐릭터 이미지에 참조 영상의 움직임을 적용합니다. 캐릭터 이미지와 사람이 움직이는 영상, 두 가지 입력을 제공하면 캐릭터가 자신의 얼굴, 의상, 외형은 유지하면서 동일한 안무를 수행하는 새로운 클립을 반환합니다. 이는 텍스트-모션 변환이 아니라 모션 전이입니다. 프롬프트로 동작을 설명하고 모델이 해석하기를 기대하는 대신, 동작을 프레임 단위로 직접 보여줍니다. 따라서 반복 가능한 캐릭터 애니메이션, 댄스, 제스처 작업에서 훨씬 안정적입니다. 이 가이드에서는 두 가지 방법을 모두 다룹니다. 일회성 클립을 위한 Kling 웹 앱과 Motion Control을 파이프라인에 연결하기 위한 GPTProto API입니다. 입력 및 제한 사항, `pro`와 `std` 등급, 프롬프트 작성법, 실행 가능한 전체 코드, 가격, 크레딧을 사용하기 전에 알아두어야 할 주요 실패 사례를 살펴봅니다.

Michael Johnson | 2026-06-30