Filtración de Gemini Omni: qué podría significar el modelo de video de Google
Antes de Google I/O 2026, las filtraciones apuntan a un modelo de video Gemini Omni. Qué está confirmado, qué sigue siendo rumor y qué conviene hacer esta semana si creas en OmniArt.

Google I/O 2026 cae el 19 y 20 de mayo, y el rincón del video con IA de internet ya está viviendo la keynote por anticipado. El motivo es una sola cadena de interfaz vista dentro de la pestaña de video de Gemini: "Start with an idea or try a template. Powered by Omni." A partir de esa única línea, tres olas de filtraciones armaron una imagen bastante completa de un modelo de video de Google sin anunciar —llamado provisionalmente Gemini Omni— que podría reemplazar a Veo 3.1, convivir con él o actualizar en silencio todo el stack generativo de Google.
Este artículo es la lectura para quienes crean en OmniArt y quieren decidir qué hacer —si es que algo— antes del martes. Separamos las señales confirmadas de la especulación, recorremos las tres identidades plausibles de Omni y cerramos con la jugada práctica para quien necesita entregar video esta semana.
Qué sabemos de verdad (y qué no)
| Señal | Estado | Qué significa |
|---|---|---|
| La cadena de interfaz "Powered by Omni" en la pestaña de video de Gemini | Confirmada en capturas | Hay un producto llamado Omni preparado para lanzarse detrás de un feature flag |
ID de modelo bard_eac_video_generation_omni | Reportado por inspección de la app | Hay un identificador interno conectado al pipeline de video de Gemini |
| Límite de clip de 10 segundos | Reportado por testers tempranos | Sugiere una restricción de etapa temprana o de nivel consumidor, no de API |
| "Remix your videos, edit directly in chat, try a template" | Texto de funciones reportado | Flujos de edición y remix, no solo de generación |
| Fuerte coherencia de texto (por ejemplo, ecuaciones matemáticas) | Reportado en la cobertura de demos | Avance técnico notable para la tipografía dentro del video |
| Audio nativo | Sin confirmar | Veo 3.1 trae audio nativo; el estado de Omni no está claro |
| Acceso por API | Sin confirmar | Quien desarrolle no debería planear sobre una disponibilidad sin confirmar |
| Si reemplaza, complementa o renombra a Veo 3.1 | Pregunta abierta | La duda más importante para los equipos de producción |
El resumen honesto: un producto de video de Google llamado Omni es lo bastante real como para tener texto de interfaz escrito, pero toda afirmación sobre su arquitectura sigue siendo inferencia a partir de cadenas de la app y reportes de testers.
Las tres identidades plausibles
Casi toda la incertidumbre se reduce a tres escenarios sobre qué es Omni en realidad. Cada uno implica algo distinto para la alineación de herramientas de video con IA en la que se apoyan los creadores.
Escenario 1: renombre de Veo para el consumidor
La lectura más simple: Omni es el reemplazo de cara al público de la marca "Veo" dentro de Gemini, parecido a cómo Google consolidó su generación de imágenes bajo "Nano Banana". Veo sigue siendo el motor de fondo; Omni es la superficie que ve la mayoría.
Si es así, espera: cambios mínimos de capacidad frente a Veo 3.1, los mismos límites de 8 a 10 segundos en el nivel consumidor y Veo continuando por la vía empresarial y de API.
Escenario 2: un modelo de video nativo de Gemini
Una segunda lectura: Omni es una versión de la arquitectura Gemini afinada específicamente para video, corriendo en paralelo a la línea Veo. Veo se queda como el modelo de video dedicado para API y empresas; Omni es el modelo de consumidor que se beneficia de la capacidad de texto y razonamiento de Gemini.
Si es así, espera: mejor adherencia al prompt, mejor tipografía dentro del video (los reportes de ecuaciones matemáticas apoyan esta idea) y una integración más estrecha con la edición por chat de Gemini.
Escenario 3: un modelo omni-modal de verdad
La lectura más ambiciosa: Omni es un sistema unificado único que genera texto, imágenes, video y audio de forma nativa desde un solo modelo. El propio nombre ("Omni") sugiere que este es el escenario hacia el que Google se está posicionando, aunque el lanzamiento se quede corto respecto de la paridad total.
Si es así, espera: desplazamientos reales del flujo de trabajo hacia la edición conversacional, traspasos multimodales dentro del chat y un desafío de largo plazo al stack de un modelo por modalidad que usa el resto del sector.
El resultado más probable en I/O es alguna mezcla de los escenarios 2 y 3: un modelo de video nativo de Gemini con ambiciones omni-modales, pero con límites de nivel consumidor en el lanzamiento.
Por qué importan las funciones reportadas
Tres de las funciones reportadas merecen más atención que la pregunta misma sobre la identidad del modelo, porque señalan hacia dónde va la categoría del video con IA sin importar quién la lance primero.
La edición conversacional como opción por defecto
"Remix your videos, edit directly in chat" es la parte de la filtración que cambia la conversación sobre el flujo de trabajo. Hoy la mayoría de las herramientas de video con IA siguen siendo de generar y descargar: escribes el prompt, esperas, guardas el clip y vuelves a escribir para cambiar algo. La edición por chat replantea al modelo como colaborador continuo: "make the second shot warmer", "swap the background", "extend by three seconds". Si Omni entrega esto con solvencia, presiona a todos los demás modelos a igualarlo.
Las plantillas como rampa de entrada
Las plantillas bajan la barrera del prompt engineering para usuarios nuevos, lo cual es un beneficio real. También aplanan la diversidad de resultados cuando todos parten del mismo prompt compartido. La pregunta interesante no es si habrá plantillas, sino si de verdad superan a un brief bien escrito desde cero.
Texto dentro del video
Los reportes de ecuaciones matemáticas renderizadas limpiamente dentro de video generado son técnicamente notables. La tipografía dentro del video ha sido la debilidad visible de todos los modelos importantes. Si Omni maneja tipografía compleja de forma confiable, se abren flujos de video explicativo, educación y motion graphics que antes exigían una pasada de composición.
Cómo encajaría Omni en la alineación
Para quienes ya trabajan con varios modelos de video con IA, la pregunta relevante es dónde encaja Omni, no si gana. La forma de la respuesta, según las funciones reportadas:
| Capacidad | Gemini Omni (reportado) | Veo 3.1 (confirmado) | V6 / R1 | Sora 2 |
|---|---|---|---|---|
| Duración | 10 s (reportado) | Hasta 8 s | 1–15 s | Hasta 20 s |
| Resolución | Desconocida | Hasta 1080p | Hasta 1080p | 1080p, 4K disponible |
| Audio nativo | Sin confirmar | Confirmado | Incluido | Incluido |
| Edición / remix | Reportado: remix, chat, plantillas | Limitada | Modify, Extend, multiclip | Limitada |
| Acceso por API | Sin confirmar | Disponible | Disponible | Disponible |
| Su punto más fuerte | Edición conversacional (reportado) | 4K nativo, audio espacial | Control cinematográfico, tiempo real | Tomas largas y continuas |
Si el conjunto de funciones filtrado se sostiene, el carril de Omni es el "video conversacional de consumo": un punto dulce para trabajo social rápido e iteración por chat. Los carriles cinematográfico, de emisión y multi-shot se quedan con sus líderes actuales hasta que la evidencia diga otra cosa.
Qué significa esto para los creadores esta semana
La tentación frente a una filtración previa al anuncio es esperar. Nosotros discreparíamos con eso para cualquiera que tenga una entrega en los próximos diez días.
Advertencia
Trata cada función de Omni que aparezca en la prensa como una señal previa al anuncio y no como una capacidad confirmada. Los planes construidos sobre especificaciones reportadas sobreviven a la keynote más o menos la mitad de las veces.
La jugada práctica depende de qué estés entregando.
Si tienes video para esta semana
Usa lo que está activo y probado. V6 para planos cinematográficos, Veo 3.1 para cortes de emisión en 4K nativo, Kling 3.0 para variantes sociales multilingües, HappyHorse 1.0 para iterar rápido. Dentro de OmniArt todos están a un clic de distancia, así que no necesitas comprometerte con una sola herramienta antes de la keynote.
Si estás planeando producción para el Q3
Arma el brief alrededor de capacidades y no de marcas. Documenta lo que de verdad necesitas —duración, resolución, audio, modelo de edición, bloqueo de personaje— y deja que la alineación posterior a I/O vuelva a competir por el trabajo en dos semanas. Si Omni sale y cumple, el brief se enchufa sin reescribir el resto del pipeline.
Si estás investigando y aprendiendo
Mira la keynote. Guarda pruebas, no opiniones. Lo más valioso que puedes tener después del lanzamiento es una comparación pareja —mismo brief, mismas referencias, misma rúbrica de evaluación— entre lo que salga, Veo 3.1 y la alineación establecida.
El cambio de fondo que señala Omni
Sea lo que sea que resulte ser Omni, las filtraciones cuentan una historia más clara sobre la categoría que sobre Google en particular.
La superficie competitiva se está moviendo. La calidad visual de la primera pasada está convergiendo entre los líderes. La diferenciación real se está desplazando hacia la controlabilidad, la consistencia multi-shot, la sincronía audiovisual, la edición conversacional y qué tan bien encaja un modelo en un flujo de trabajo real, no hacia quién gana un benchmark.
Los costos siguen siendo reales. Los reportes repetidos de límites de uso y de pestañas de consumo en la interfaz de Omni confirman que la generación de video de alta fidelidad sigue siendo computacionalmente cara a escala. Las plantillas y los topes de clips cortos son en parte UX y en parte economía.
Los derechos y el remix se complican. Los flujos de remix sobre video generado introducen preguntas de propiedad intelectual, consentimiento y uso comercial que los flujos de texto a video no exponen del todo. Cualquier equipo que ponga resultados basados en remix en medios pagos debería tener lista la lista de verificación de derechos antes de que llegue la función.
Cómo manejó OmniArt el lanzamiento
Este artículo capturó la filtración previa a I/O tal como se veía el 13 de mayo de 2026. Google después lanzó Gemini Omni Flash, abrió el acceso para desarrolladores y desde entonces el modelo se sumó al espacio de video de OmniArt para la generación estándar guiada por texto e imagen.
Ahora convive con Veo 3.1, Sora 2, V6, Kling 3.0, Happy Horse 1.0, Seedance 2.0, Runway Gen-4.5, Hailuo y Grok Imagine: una sola gramática de prompt, un solo saldo, un solo lugar para compararlo contra el resto. Los controles de edición conversacional con estado de Google no están expuestos hoy en OmniArt.
Para conocer el contexto de la alineación de video actual, revisa el recorrido por los modelos de video de OmniArt. Para escribir briefs que se trasladen limpiamente al modelo que termine ejecutándolos, revisa la guía para escribir prompts.
Preguntas frecuentes
¿Gemini Omni está anunciado oficialmente?
Sí. Este artículo se escribió antes del anuncio; después Google lanzó Gemini Omni Flash en I/O 2026 y abrió el acceso para desarrolladores el 30 de junio. Gemini Omni Flash ya está disponible en OmniArt para la generación estándar.
¿Gemini Omni va a reemplazar a Veo 3.1?
No está claro. Los tres escenarios plausibles son: Omni renombra a Veo en las superficies de consumo, Omni corre junto a Veo como modelo de consumo nativo de Gemini, u Omni es un sistema unificado omni-modal de verdad. Una mezcla del segundo y el tercero es lo más probable en el lanzamiento.
¿Qué funciones se reportan para Gemini Omni?
Entre las funciones reportadas están la edición conversacional dentro del chat de Gemini, un flujo de remix, plantillas de prompt, fuerte coherencia de texto dentro del video (ecuaciones matemáticas renderizadas limpiamente) y un límite de clip de 10 segundos. Ninguna está confirmada oficialmente.
¿Conviene esperar a Omni antes de producir video esta semana?
No. Usa los modelos que están activos y estables hoy. La alineación ya cubre planos cinematográficos, emisión en 4K nativo, social multilingüe, iteración rápida, continuidad multi-shot y VFX a nivel de fotograma, y Gemini Omni Flash ya es una de esas opciones disponibles.
¿Cómo se compara Omni con Veo 3.1?
La ventaja de Omni es la edición conversacional y la flexibilidad de entradas; las fortalezas de Veo 3.1 son el audio nativo y la salida en 4K. Los dos ya están disponibles para generación estándar en OmniArt, así que puedes compararlos con el mismo brief; usa las superficies de API de Google cuando la prueba requiera específicamente ediciones conversacionales con estado.
¿Todo listo para crear?
Empieza a generar contenido increíble con IA