La mayoría de los modelos de vídeo con IA te dan exactamente una oportunidad. Escribes un prompt, obtienes un clip y, si la segunda mitad está mal, tienes que empezar de nuevo — y volver a pagar. Gemini Omni Flash es el intento de Google por romper ese ciclo. Generas un clip y luego sigues dándole forma hablando con él: cambias el personaje, vuelves a iluminar la escena, cambias el ángulo de cámara y el modelo basa cada edición en la anterior en lugar de regenerarlo todo desde cero.
Es el primer modelo de la nueva familia Gemini Omni de Google — que Google denomina su primer modelo multimodal "any-to-any" — y entró en vista previa pública alrededor del 1 de julio de 2026. A continuación presentamos un resumen claro de qué es, cuánto cuesta, cómo usarlo realmente y cuáles siguen siendo sus limitaciones.
¿Qué es Gemini Omni Flash?
En una frase: Gemini Omni Flash acepta texto, imágenes, audio y vídeo como entrada, y produce vídeo de alta resolución con audio sincronizado como salida — además de permitirte editar ese vídeo mediante una conversación de ida y vuelta.
Esa última afirmación es toda la propuesta de valor, así que merece distinguirse del vídeo de demostración. Un modelo como Veo o Sora está diseñado para renderizar un clip potente a partir de un único prompt. Omni Flash parte de la premisa de que tu primer clip es un borrador. El planteamiento de Google es que el modelo "razona sobre lo que debería ocurrir después", en lugar de limitarse a pintar píxeles — se apoya en el conocimiento del mundo de Gemini y en una "comprensión intuitiva de fuerzas como la gravedad, la energía cinética y la dinámica de fluidos" para decidir cómo debe continuar una escena. Interpreta esto como afirmaciones de Google, no como conclusiones independientes: la ficha del modelo indica que los benchmarks están pendientes, así que todavía nadie ha evaluado ese razonamiento.
Por qué existe, antes de explicar cómo funciona
El problema al que apunta Omni Flash no es "generar un vídeo más bonito". Es el coste de edición. En un generador de una sola toma, cada cambio exige un renderizado nuevo — consigues que el 90 % de un clip sea correcto, pides un gesto diferente y vuelves a generar todo esperando que sobreviva ese 90 % bueno. Es lento, caro y no determinista.
La respuesta de Omni Flash es un ciclo con estado y múltiples turnos. Generas, inspeccionas y luego dices "convierte el fondo en una puesta de sol" o "haz que ella se dé la vuelta" — y el modelo mantiene la escena anterior en lugar de reconstruirla. Google ofrece esta función a los desarrolladores mediante un previous_interaction_id que se pasa en cada turno, de modo que las ediciones se encadenan. Dentro de la aplicación Gemini, esta interfaz conversacional es precisamente lo que Veo y Sora no ofrecen.
Una frase para recordar: Omni Flash es menos un "generador mejor" y más una "capa de edición" — resulta interesante cuando ya existe un clip base.
Qué puede hacer (con las cifras que realmente son públicas)
Esto es lo confirmado por la ficha del modelo y la documentación de la API de Google, limitado a los detalles importantes:
- Entradas: texto, imágenes, audio y vídeo. La entrada de audio está limitada a referencias de voz en el lanzamiento; hay más tipos de audio previstos.
- Salida: vídeo de alta resolución con audio nativo y sincronizado generado en el mismo proceso — no añadido posteriormente.
- Duración del clip: aproximadamente 10 segundos en el lanzamiento. Google presenta este límite como una decisión de despliegue y no como una limitación estricta del modelo, y afirma que llegarán duraciones mayores — así que considera los 10 segundos como "lo disponible hoy", no como algo "para siempre".
- Relaciones de aspecto: 9:16 y 16:9 (16:9 por defecto).
- Consistencia: el modelo está pensado para mantener la identidad del personaje, el objeto y el estilo entre cortes y ediciones, y sincronizar el texto y los gráficos en pantalla con el movimiento.
- Procedencia: cada clip incluye una marca de agua imperceptible SynthID, con credenciales de contenido C2PA activadas por defecto. No hay opción para desactivarlas.
La resolución es la única especificación sobre la que Google se muestra evasivo — la ficha del modelo solo dice "alta resolución" sin indicar el número de píxeles, y la compatibilidad con resoluciones superiores mediante la API empresarial figura como "disponible próximamente". Si la resolución exacta es importante para tu flujo de trabajo, es una cuestión que debes vigilar, no una cifra que debas dar por supuesta.
Precios
Gemini Omni Flash cuesta $0.10 por segundo de vídeo de salida. Es la única cifra concreta publicada por Google y es sencilla: un clip de 10 segundos cuesta aproximadamente un dólar, y puedes calcular el coste de un trabajo por lotes sin hacer suposiciones.
El inconveniente que los desarrolladores detectaron de inmediato es qué significa esa tarifa durante la edición. Como comentó alguien en la página del modelo en Product Hunt, si generas un clip de 20 segundos y luego dices "haz más lenta la segunda toma", ¿se te vuelve a cobrar el clip completo en cada turno o se compara con el renderizado anterior? Google todavía no lo ha explicado públicamente y, en un modelo conversacional, ahí es precisamente donde los costes pueden dispararse silenciosamente. Mi interpretación: calcula el presupuesto suponiendo que cada turno de edición es un renderizado nuevo hasta que Google documente lo contrario.
Como referencia, esos 0,10 $/s supuestamente coinciden con Veo 3.1 Fast — una comparación que ha establecido el propio equipo de Google, aunque yo la consideraría información reportada y no una comparación publicada lado a lado.
Cómo usarlo: una llamada real de imagen a vídeo mediante GPT Proto
Estamos incorporando Gemini Omni Flash a GPT Proto para que puedas llamarlo con la misma clave y facturación que ya usas para el resto del catálogo — el acceso se está habilitando ahora. GPT Proto sigue el formato de solicitudes de estilo Vertex de Google, así que una generación de imagen a vídeo consiste en un único POST; después consultas la operación devuelta y descargas el resultado. Este es el flujo completo en Python (sustituye la clave por la tuya, disponible en el panel de GPT Proto):
import requests, json, base64, time
BASE = "https://gptproto.com/v1beta/models/gemini-omni-flash-preview:predictLongRunning"
HEADERS = {"x-goog-api-key": "GPTPROTO_API_KEY", "Content-Type": "application/json"}
# 1) Turn a still image into a moving clip
with open("frame.png", "rb") as f:
image_b64 = base64.b64encode(f.read()).decode()
payload = {
"instances": [{
"prompt": "The subject slowly turns to face the camera as warm sunset light fills the room.",
"image": {"mimeType": "image/png", "bytesBase64Encoded": image_b64}
}],
"parameters": {"aspectRatio": "9:16"}
}
op = requests.post(BASE, headers=HEADERS, data=json.dumps(payload)).json()
operation_name = op["name"] # e.g. models/gemini-omni-flash-preview/operations/abc123
# 2) Poll until the render is done
POLL = f"https://api.gptproto.com/v1beta/{operation_name}"
while True:
result = requests.get(POLL, headers=HEADERS).json()
if result.get("done"):
break
time.sleep(10)
# 3) Download the finished video
uri = result["response"]["generateVideoResponse"]["generatedSamples"][0]["video"]["uri"]
video = requests.get(uri, headers=HEADERS)
open("output.mp4", "wb").write(video.content)
print("Saved output.mp4")
O el mismo primer paso en cURL:
curl --location 'https://gptproto.com/v1beta/models/gemini-omni-flash-preview:predictLongRunning' \
--header 'x-goog-api-key: GPTPROTO_API_KEY' \
--header 'Content-Type: application/json' \
--data '{
"instances": [{
"prompt": "The subject slowly turns to face the camera as warm sunset light fills the room.",
"image": {"mimeType": "image/png", "bytesBase64Encoded": "BASE64_ENCODED_IMAGE"}
}],
"parameters": {"aspectRatio": "9:16"}
}'
Algunas notas prácticas de la documentación: la generación de vídeo es una operación de larga duración, por lo que el paso de consulta no es opcional; los archivos generados se conservan durante un par de días, así que descárgalos cuanto antes; y los errores siguen los códigos HTTP estándar — 401 para una clave incorrecta, 403 para saldo o permisos insuficientes y 429 para los límites de frecuencia.
Guía rápida para prompts
Omni Flash ofrece deliberadamente pocos controles — la API no admite prompts negativos, temperatura, top-p ni instrucciones de sistema. Eso cambia la forma de dirigirlo:
Pon el control en el prompt, no en los parámetros. Describe el movimiento y la física explícitamente ("la canica rueda rápido, toma continua y fluida") en lugar de depender de ajustes. No intentes incluir todos los requisitos en un megaprompt: genera primero un clip base sólido y luego realiza cambios quirúrgicos mediante la conversación, que es el flujo para el que realmente está diseñado el modelo. Para mantener la continuidad del personaje, proporciona una imagen de referencia en lugar de describir un rostro con palabras. Y mantén unas expectativas realistas: la propia ficha de Google admite que el movimiento complejo, el texto perfectamente preciso y la consistencia total entre ediciones siguen siendo puntos débiles, por lo que los prompts que dependen de los tres factores a la vez son los que más probablemente decepcionen.
La reseña honesta: dónde gana y dónde falla
Lo verdaderamente novedoso aquí es el ciclo de edición conversacional. Iterar charlando con un clip es significativamente más rápido que volver a escribir prompts, y es una interfaz que Veo y Sora no ofrecen. Esa es la razón para elegirlo.
Pero las primeras reacciones han sido moderadas, no entusiastas, y merece la pena transmitirlas con honestidad. El veredicto recurrente de la comunidad es que Omni Flash es un editor sólido y un generador puro meramente aceptable — varios probadores prácticos afirmaron que destaca al transformar un clip que ya es bueno, pero convence menos al crear el original desde cero; la física, el movimiento y la consistencia temporal se señalaron como sus puntos débiles. Esto coincide con las propias admisiones de Google. También existen límites más estrictos: en la API, las referencias de vídeo de hasta tres segundos están "aceptadas por el esquema, pero no se procesan correctamente"; no se admite la referencia de varios vídeos; y la edición de audio y voz se ha omitido deliberadamente en el lanzamiento — Google cita el riesgo de deepfakes. Por tanto, es un lanzamiento de prototipo con el que experimentar, no algo que debas integrar sin probar en producción.
La recepción en el ámbito empresarial ha sido más positiva: el lanzamiento señaló a primeros usuarios en producción (Figma y WPP entre los nombres mencionados), lo que sugiere que el cálculo de precio por segundo ya supera el umbral para flujos creativos reales. Yo lo interpretaría como una señal sobre el precio, no sobre la calidad de salida.
Gemini Omni Flash frente a Veo 3.1: ¿cuál deberías usar?
Esta es la pregunta que realmente intentan responder la mayoría de las búsquedas, y el consenso — incluido el de Google — es que son complementarios, no sustitutos. Veo solo ha sido reemplazado por Omni dentro de la aplicación Gemini; los desarrolladores siguen llamando directamente a Veo 3.1 mediante la API para trabajos de alta fidelidad.
| |
Gemini Omni Flash |
Veo 3.1 / 3.1 Fast |
| Ideal para |
Edición conversacional y combinación de múltiples entradas |
Generación de una sola toma de alta fidelidad |
| Entradas |
Texto, imagen, audio (referencia de voz), vídeo |
Texto, imagen (elementos), vídeo |
| Duración del clip |
~10 s en el lanzamiento (Google lo considera una decisión de despliegue) |
4 / 6 / 8 s, más extensión |
| Resolución |
"Alta resolución" — todavía no hay una cifra pública |
720p / 1080p / 4K (1080p y 4K solo a 8 s) |
| Audio nativo |
Sí, todos los clips |
Sí |
| Edición |
Ediciones conversacionales de varios turnos |
Prompt / elementos, extensión |
| Precio |
$0.10 / s de salida |
$0.10 / s (Fast, según informes) |
| Marca de agua |
SynthID + C2PA |
SynthID |
La regla práctica: elige Veo 3.1 cuando la resolución y una salida cinematográfica limpia sean lo más importante; elige Omni Flash cuando importe más cambiar, perfeccionar y combinar un clip mediante una conversación. En muchos flujos reales, la respuesta es ambas cosas: genera la base con el generador más nítido y luego pásala a Omni Flash para el ciclo de edición.
Para quién es —y quién debería esperar—
Elige Omni Flash si tu trabajo requiere mucha edición: retoques al estilo de los efectos visuales, transformaciones basadas en avatares y referencias o cualquier tarea en la que vayas a iterar varias veces sobre un clip. Espera si necesitas alta resolución garantizada hoy, clips individuales de más de unos 10 segundos, entradas de referencia de vídeo fiables o cualquier edición de audio o voz: esas funciones no están especificadas, tienen límites o están desactivadas en el lanzamiento.
¿Listo para crear con él? Consigue una clave y consulta el catálogo activo en GPT Proto — el acceso a Gemini Omni Flash se está habilitando ahora.