Michael Johnson2026-07-03

Presentamos Gemini Omni Flash: el nuevo modelo de vídeo de Google que editas hablando

Gemini Omni Flash es el nuevo modelo de vídeo de Google con cualquier entrada, que editas mediante chat: 0,10 $/s y clips de unos 10 s. Descubre qué hace, código real de la API y Omni frente a Veo.

Presentamos Gemini Omni Flash: el nuevo modelo de vídeo de Google que editas hablando

La mayoría de los modelos de vídeo con IA te dan exactamente una oportunidad. Escribes un prompt, obtienes un clip y, si la segunda mitad está mal, tienes que empezar de nuevo — y volver a pagar. Gemini Omni Flash es el intento de Google por romper ese ciclo. Generas un clip y luego sigues dándole forma hablando con él: cambias el personaje, vuelves a iluminar la escena, cambias el ángulo de cámara y el modelo basa cada edición en la anterior en lugar de regenerarlo todo desde cero.

Es el primer modelo de la nueva familia Gemini Omni de Google — que Google denomina su primer modelo multimodal "any-to-any" — y entró en vista previa pública alrededor del 1 de julio de 2026. A continuación presentamos un resumen claro de qué es, cuánto cuesta, cómo usarlo realmente y cuáles siguen siendo sus limitaciones.

Tabla de contenido

¿Qué es Gemini Omni Flash?

En una frase: Gemini Omni Flash acepta texto, imágenes, audio y vídeo como entrada, y produce vídeo de alta resolución con audio sincronizado como salida — además de permitirte editar ese vídeo mediante una conversación de ida y vuelta.

Esa última afirmación es toda la propuesta de valor, así que merece distinguirse del vídeo de demostración. Un modelo como Veo o Sora está diseñado para renderizar un clip potente a partir de un único prompt. Omni Flash parte de la premisa de que tu primer clip es un borrador. El planteamiento de Google es que el modelo "razona sobre lo que debería ocurrir después", en lugar de limitarse a pintar píxeles — se apoya en el conocimiento del mundo de Gemini y en una "comprensión intuitiva de fuerzas como la gravedad, la energía cinética y la dinámica de fluidos" para decidir cómo debe continuar una escena. Interpreta esto como afirmaciones de Google, no como conclusiones independientes: la ficha del modelo indica que los benchmarks están pendientes, así que todavía nadie ha evaluado ese razonamiento.

Por qué existe, antes de explicar cómo funciona

El problema al que apunta Omni Flash no es "generar un vídeo más bonito". Es el coste de edición. En un generador de una sola toma, cada cambio exige un renderizado nuevo — consigues que el 90 % de un clip sea correcto, pides un gesto diferente y vuelves a generar todo esperando que sobreviva ese 90 % bueno. Es lento, caro y no determinista.

La respuesta de Omni Flash es un ciclo con estado y múltiples turnos. Generas, inspeccionas y luego dices "convierte el fondo en una puesta de sol" o "haz que ella se dé la vuelta" — y el modelo mantiene la escena anterior en lugar de reconstruirla. Google ofrece esta función a los desarrolladores mediante un previous_interaction_id que se pasa en cada turno, de modo que las ediciones se encadenan. Dentro de la aplicación Gemini, esta interfaz conversacional es precisamente lo que Veo y Sora no ofrecen.

Una frase para recordar: Omni Flash es menos un "generador mejor" y más una "capa de edición" — resulta interesante cuando ya existe un clip base.

Qué puede hacer (con las cifras que realmente son públicas)

Esto es lo confirmado por la ficha del modelo y la documentación de la API de Google, limitado a los detalles importantes:

  • Entradas: texto, imágenes, audio y vídeo. La entrada de audio está limitada a referencias de voz en el lanzamiento; hay más tipos de audio previstos.
  • Salida: vídeo de alta resolución con audio nativo y sincronizado generado en el mismo proceso — no añadido posteriormente.
  • Duración del clip: aproximadamente 10 segundos en el lanzamiento. Google presenta este límite como una decisión de despliegue y no como una limitación estricta del modelo, y afirma que llegarán duraciones mayores — así que considera los 10 segundos como "lo disponible hoy", no como algo "para siempre".
  • Relaciones de aspecto: 9:16 y 16:9 (16:9 por defecto).
  • Consistencia: el modelo está pensado para mantener la identidad del personaje, el objeto y el estilo entre cortes y ediciones, y sincronizar el texto y los gráficos en pantalla con el movimiento.
  • Procedencia: cada clip incluye una marca de agua imperceptible SynthID, con credenciales de contenido C2PA activadas por defecto. No hay opción para desactivarlas.

La resolución es la única especificación sobre la que Google se muestra evasivo — la ficha del modelo solo dice "alta resolución" sin indicar el número de píxeles, y la compatibilidad con resoluciones superiores mediante la API empresarial figura como "disponible próximamente". Si la resolución exacta es importante para tu flujo de trabajo, es una cuestión que debes vigilar, no una cifra que debas dar por supuesta.

Precios

Gemini Omni Flash cuesta $0.10 por segundo de vídeo de salida. Es la única cifra concreta publicada por Google y es sencilla: un clip de 10 segundos cuesta aproximadamente un dólar, y puedes calcular el coste de un trabajo por lotes sin hacer suposiciones.

El inconveniente que los desarrolladores detectaron de inmediato es qué significa esa tarifa durante la edición. Como comentó alguien en la página del modelo en Product Hunt, si generas un clip de 20 segundos y luego dices "haz más lenta la segunda toma", ¿se te vuelve a cobrar el clip completo en cada turno o se compara con el renderizado anterior? Google todavía no lo ha explicado públicamente y, en un modelo conversacional, ahí es precisamente donde los costes pueden dispararse silenciosamente. Mi interpretación: calcula el presupuesto suponiendo que cada turno de edición es un renderizado nuevo hasta que Google documente lo contrario.

Como referencia, esos 0,10 $/s supuestamente coinciden con Veo 3.1 Fast — una comparación que ha establecido el propio equipo de Google, aunque yo la consideraría información reportada y no una comparación publicada lado a lado.

Cómo usarlo: una llamada real de imagen a vídeo mediante GPT Proto

Estamos incorporando Gemini Omni Flash a GPT Proto para que puedas llamarlo con la misma clave y facturación que ya usas para el resto del catálogo — el acceso se está habilitando ahora. GPT Proto sigue el formato de solicitudes de estilo Vertex de Google, así que una generación de imagen a vídeo consiste en un único POST; después consultas la operación devuelta y descargas el resultado. Este es el flujo completo en Python (sustituye la clave por la tuya, disponible en el panel de GPT Proto):

import requests, json, base64, time

BASE = "https://gptproto.com/v1beta/models/gemini-omni-flash-preview:predictLongRunning"
HEADERS = {"x-goog-api-key": "GPTPROTO_API_KEY", "Content-Type": "application/json"}

# 1) Turn a still image into a moving clip
with open("frame.png", "rb") as f:
    image_b64 = base64.b64encode(f.read()).decode()

payload = {
    "instances": [{
        "prompt": "The subject slowly turns to face the camera as warm sunset light fills the room.",
        "image": {"mimeType": "image/png", "bytesBase64Encoded": image_b64}
    }],
    "parameters": {"aspectRatio": "9:16"}
}
op = requests.post(BASE, headers=HEADERS, data=json.dumps(payload)).json()
operation_name = op["name"]        # e.g. models/gemini-omni-flash-preview/operations/abc123

# 2) Poll until the render is done
POLL = f"https://api.gptproto.com/v1beta/{operation_name}"
while True:
    result = requests.get(POLL, headers=HEADERS).json()
    if result.get("done"):
        break
    time.sleep(10)

# 3) Download the finished video
uri = result["response"]["generateVideoResponse"]["generatedSamples"][0]["video"]["uri"]
video = requests.get(uri, headers=HEADERS)
open("output.mp4", "wb").write(video.content)
print("Saved output.mp4")

O el mismo primer paso en cURL:

curl --location 'https://gptproto.com/v1beta/models/gemini-omni-flash-preview:predictLongRunning' \
  --header 'x-goog-api-key: GPTPROTO_API_KEY' \
  --header 'Content-Type: application/json' \
  --data '{
    "instances": [{
      "prompt": "The subject slowly turns to face the camera as warm sunset light fills the room.",
      "image": {"mimeType": "image/png", "bytesBase64Encoded": "BASE64_ENCODED_IMAGE"}
    }],
    "parameters": {"aspectRatio": "9:16"}
  }'

Algunas notas prácticas de la documentación: la generación de vídeo es una operación de larga duración, por lo que el paso de consulta no es opcional; los archivos generados se conservan durante un par de días, así que descárgalos cuanto antes; y los errores siguen los códigos HTTP estándar — 401 para una clave incorrecta, 403 para saldo o permisos insuficientes y 429 para los límites de frecuencia.

Guía rápida para prompts

Omni Flash ofrece deliberadamente pocos controles — la API no admite prompts negativos, temperatura, top-p ni instrucciones de sistema. Eso cambia la forma de dirigirlo:

Pon el control en el prompt, no en los parámetros. Describe el movimiento y la física explícitamente ("la canica rueda rápido, toma continua y fluida") en lugar de depender de ajustes. No intentes incluir todos los requisitos en un megaprompt: genera primero un clip base sólido y luego realiza cambios quirúrgicos mediante la conversación, que es el flujo para el que realmente está diseñado el modelo. Para mantener la continuidad del personaje, proporciona una imagen de referencia en lugar de describir un rostro con palabras. Y mantén unas expectativas realistas: la propia ficha de Google admite que el movimiento complejo, el texto perfectamente preciso y la consistencia total entre ediciones siguen siendo puntos débiles, por lo que los prompts que dependen de los tres factores a la vez son los que más probablemente decepcionen.

La reseña honesta: dónde gana y dónde falla

Lo verdaderamente novedoso aquí es el ciclo de edición conversacional. Iterar charlando con un clip es significativamente más rápido que volver a escribir prompts, y es una interfaz que Veo y Sora no ofrecen. Esa es la razón para elegirlo.

Pero las primeras reacciones han sido moderadas, no entusiastas, y merece la pena transmitirlas con honestidad. El veredicto recurrente de la comunidad es que Omni Flash es un editor sólido y un generador puro meramente aceptable — varios probadores prácticos afirmaron que destaca al transformar un clip que ya es bueno, pero convence menos al crear el original desde cero; la física, el movimiento y la consistencia temporal se señalaron como sus puntos débiles. Esto coincide con las propias admisiones de Google. También existen límites más estrictos: en la API, las referencias de vídeo de hasta tres segundos están "aceptadas por el esquema, pero no se procesan correctamente"; no se admite la referencia de varios vídeos; y la edición de audio y voz se ha omitido deliberadamente en el lanzamiento — Google cita el riesgo de deepfakes. Por tanto, es un lanzamiento de prototipo con el que experimentar, no algo que debas integrar sin probar en producción.

La recepción en el ámbito empresarial ha sido más positiva: el lanzamiento señaló a primeros usuarios en producción (Figma y WPP entre los nombres mencionados), lo que sugiere que el cálculo de precio por segundo ya supera el umbral para flujos creativos reales. Yo lo interpretaría como una señal sobre el precio, no sobre la calidad de salida.

Gemini Omni Flash frente a Veo 3.1: ¿cuál deberías usar?

Esta es la pregunta que realmente intentan responder la mayoría de las búsquedas, y el consenso — incluido el de Google — es que son complementarios, no sustitutos. Veo solo ha sido reemplazado por Omni dentro de la aplicación Gemini; los desarrolladores siguen llamando directamente a Veo 3.1 mediante la API para trabajos de alta fidelidad.

  Gemini Omni Flash Veo 3.1 / 3.1 Fast
Ideal para Edición conversacional y combinación de múltiples entradas Generación de una sola toma de alta fidelidad
Entradas Texto, imagen, audio (referencia de voz), vídeo Texto, imagen (elementos), vídeo
Duración del clip ~10 s en el lanzamiento (Google lo considera una decisión de despliegue) 4 / 6 / 8 s, más extensión
Resolución "Alta resolución" — todavía no hay una cifra pública 720p / 1080p / 4K (1080p y 4K solo a 8 s)
Audio nativo Sí, todos los clips
Edición Ediciones conversacionales de varios turnos Prompt / elementos, extensión
Precio $0.10 / s de salida $0.10 / s (Fast, según informes)
Marca de agua SynthID + C2PA SynthID

La regla práctica: elige Veo 3.1 cuando la resolución y una salida cinematográfica limpia sean lo más importante; elige Omni Flash cuando importe más cambiar, perfeccionar y combinar un clip mediante una conversación. En muchos flujos reales, la respuesta es ambas cosas: genera la base con el generador más nítido y luego pásala a Omni Flash para el ciclo de edición.

Para quién es —y quién debería esperar—

Elige Omni Flash si tu trabajo requiere mucha edición: retoques al estilo de los efectos visuales, transformaciones basadas en avatares y referencias o cualquier tarea en la que vayas a iterar varias veces sobre un clip. Espera si necesitas alta resolución garantizada hoy, clips individuales de más de unos 10 segundos, entradas de referencia de vídeo fiables o cualquier edición de audio o voz: esas funciones no están especificadas, tienen límites o están desactivadas en el lanzamiento.

 


¿Listo para crear con él? Consigue una clave y consulta el catálogo activo en GPT Proto — el acceso a Gemini Omni Flash se está habilitando ahora.

Creative Studio

Genera imágenes, videos y más con APIs de producción.

Comenzar a crear
Creative Studio
Modelos relacionados
Todos los modelos
Google
Claude
20% OFF
Google
40% OFF
Google
40% OFF

Preguntas frecuentes

¿Cómo obtengo la API de Gemini Omni Flash?

Regístrate en GPTProto, genera una clave de API en tu panel y llama al endpoint gemini-omni-flash-preview que aparece arriba. El acceso se está habilitando progresivamente y podrás usarlo con la misma clave y facturación que el resto del catálogo. Consulta la biblioteca completa de modelos para ver qué está disponible ahora.

¿Cuánto cuesta Gemini Omni Flash?

0,10 $ por segundo de vídeo de salida: aproximadamente 1 $ por un clip de 10 segundos. Todavía no se ha documentado si las ediciones iterativas vuelven a facturar el clip completo en cada turno, así que calcula el presupuesto de forma conservadora.

¿Cuánto pueden durar los vídeos de Gemini Omni Flash?

Aproximadamente 10 segundos en el lanzamiento. Google lo describe como una decisión de despliegue, no como un límite del modelo, y afirma que llegarán duraciones mayores.

Gemini Omni Flash frente a Veo 3.1: ¿cuál es mejor?

Ninguno de los dos exactamente. Veo 3.1 gana en resolución y en resultados pulidos de una sola toma; Omni Flash gana en edición conversacional y con múltiples entradas. Muchos equipos utilizan ambos.

¿Puede Gemini Omni Flash editar voces o generar audio sin censura?

No. La edición de audio y voz se ha omitido deliberadamente en el lanzamiento por motivos relacionados con los deepfakes, y cada clip incluye una marca de agua SynthID no eliminable además de credenciales C2PA.

Artículos relacionados

Más blogs
Seedance 2.0 Mini frente a Seedance 2.0: precio, calidad y cuál usar realmente

Seedance 2.0 Mini frente a Seedance 2.0: precio, calidad y cuál usar realmente

En resumen — Con la misma resolución, Seedance 2.0 Mini cuesta aproximadamente un 20 % menos que el Seedance 2.0 estándar en GPTProto — no la "mitad de precio" que leerás en la mayoría de las páginas comparativas. El mayor ahorro proviene de un límite estricto: Mini se detiene en 720p, por lo que evita por completo los niveles más costosos de 1080p y 4K. Elige Mini cuando quieras iterar rápidamente, generar grandes volúmenes y crear clips sociales cortos. Elige el Seedance 2.0 estándar cuando necesites 1080p o 4K, movimientos más complejos o un corte final para presentar a un cliente. La configuración que realmente compensa es usar ambos: hacer el borrador en Mini y finalizarlo en el estándar. El resto de esta guía sobre Seedance 2.0 Mini y su hermano mayor muestra las cifras reales detrás de cada decisión.

Tiffany Layne | 2026-06-30

¿Ya salió Seedance 2.5? Fecha de lanzamiento y lo que realmente sabemos (2026)

¿Ya salió Seedance 2.5? Fecha de lanzamiento y lo que realmente sabemos (2026)

He actualizado la página de Seed de ByteDance más veces de las que me gustaría admitir esta semana, esperando que aparezca Seedance 2.5. Hasta ahora, nada. Ni página del modelo, ni hoja de especificaciones, ni fecha. Ese vacío es precisamente la razón por la que existe este artículo: ahora mismo circulan muchos textos llenos de confianza sobre Seedance 2.5, y la mayoría presenta suposiciones como hechos. Quiero separar ambas cosas claramente y después mostrarte lo que realmente puedes ejecutar hoy.

Tiffany Layne | 2026-06-23

¿Qué es Wan 2.7? Guía del modelo con modo de razonamiento de Alibaba (2026)

¿Qué es Wan 2.7? Guía del modelo con modo de razonamiento de Alibaba (2026)

Busca "wan 2.7" y obtendrás dos respuestas que no pueden ser ciertas al mismo tiempo. Un grupo de guías te dice que descargues los pesos y lo ejecutes en tu propia GPU. Otro afirma que solo puedes acceder a él mediante una API. Me puse a investigar cuál de las dos es correcta, porque la respuesta determina si puedes alojar este modelo por tu cuenta —y la versión corta es que la mayoría de las publicaciones categóricas que dicen que "es de código abierto" están repitiendo una costumbre, no un hecho. Esto es lo que realmente es Wan 2.7, lo que Alibaba ha publicado y lo que no, y cómo poner hoy un modelo Wan en producción.

Schuyler Stacy | 2026-06-24

Cómo usar Kling 3.0 Motion Control: guía para desarrolladores (Web + API)

Cómo usar Kling 3.0 Motion Control: guía para desarrolladores (Web + API)

Kling 3.0 Motion Control animates a static character image with the movement from a reference video. You give it two inputs — a picture of your character and a video of someone moving — and it returns a new clip where your character performs that exact choreography while keeping their own face, outfit, and look. This is motion transfer, not text-to-motion. Instead of describing an action in a prompt and hoping the model interprets it, you show it the action frame by frame. That makes it far more reliable for repeatable character animation, dance, and gesture work. This guide covers both paths: the Kling web app for one-off clips, and the GPTProto API for wiring Motion Control into a pipeline. We'll cover inputs and limits, the `pro` vs `std` tiers, prompt technique, full runnable code, pricing, and the failure modes worth knowing before you spend credits.

Michael Johnson | 2026-06-30