IndustryModelos y análisis7 min de lectura

Entrada any-to-any de Gemini Omni Flash: qué hace de verdad

Lo omnimodal es la gran promesa de Gemini Omni Flash, pero la API que salió es más estrecha que el marketing. Esto es lo que la entrada any-to-any sí cambia en el brief.

Equipo OmniArt
Entrada any-to-any de Gemini Omni Flash: qué hace de verdad

La palabra que más peso cargó en el lanzamiento de Gemini Omni Flash fue “Omni”: la promesa de un solo modelo al que puedes darle texto, imágenes, audio y video todo junto, en un mismo prompt. Es una propuesta genuinamente distinta de la de los modelos de video de una sola entrada que vinieron antes, y es la razón por la que el modelo se gana su nombre. Pero la versión que salió en la API para desarrolladores es más estrecha que el encuadre del keynote, y esa distancia importa si planeas trabajo real alrededor de ella.

Este artículo separa lo que any-to-any te da hoy de lo que todavía es aspiracional, y después llega al punto más útil: cómo la entrada multimodal cambia la manera misma de escribir un brief.

Qué significa realmente “any-to-any”

La mayoría de los modelos de video acepta un solo tipo de dirección. Escribes texto, o entregas una sola imagen de referencia, y el modelo trabaja con eso. La entrada any-to-any significa que una misma gramática de prompt acepta varias modalidades juntas y devuelve un resultado coherente que las respeta todas: un fotograma de referencia para el look, un clip corto para el movimiento y una indicación escrita para todo lo demás; combinados, no elegidos uno en vez del otro.

El cambio va de describir un plano con palabras a componerlo a partir de recursos. Esa es la capacidad real, y por eso “omnimodal” no es puro marketing. La pregunta es cuánto de eso está activo.

La promesa frente a la API publicada

Esta es la matriz honesta de la vista previa actual, sacada de la propia documentación de la API:

EntradaEstadoNotas
Prompt de textoCompatibleLa columna vertebral de toda generación
Imagen de referenciaCompatibleTexto a video, imagen a video y referencia de sujeto
Video de referenciaCompatible, con un peroLas referencias de más de 3 s no se procesan por completo
Audio de referenciaNo compatibleNo puedes subir un sonido ni una voz para que el modelo los iguale
Varios videos de referenciaNo compatibleUn clip de referencia por generación
Prompts en otros idiomasSin probarEl inglés es el único idioma totalmente admitido

Advertencia

El hueco de audio es el que más probablemente te desarme un plan. Omni Flash genera una pista de audio por defecto, pero “any-to-any” no incluye entregarle una base musical, una voz en off ni una grabación de ambiente para sincronizar. El audio es una salida que diriges con palabras, no una entrada que aportas.

Entonces, la lectura precisa: hoy any-to-any es texto + imagen + video de entrada, video (con audio generado) de salida. La mitad de entrada de audio de la promesa omnimodal quedó retenida a propósito, en línea con la edición de voz dentro del video y las funciones de avatar que Google reservó en el lanzamiento por motivos de seguridad. Es un cambio real de capacidad frente a los modelos de una sola entrada; simplemente todavía no es el cuadro completo de any-to-any-to-any que sugiere el nombre.

Qué cambia la entrada multimodal en el brief

Cuando compones a partir de recursos en vez de describir en prosa, el brief mismo cambia de forma. Tres entradas hacen trabajos distintos, y la habilidad está en asignarle a cada una aquello en lo que es mejor:

  • La imagen de referencia carga el look: el sujeto, la paleta, el encuadre que ya te gusta.
  • El video de referencia carga el movimiento: un movimiento de cámara o una acción que quieres que se repita.
  • El texto carga la intención y todo lo que los recursos no muestran: el ánimo, los cambios, aquello que no está en ninguna de las dos referencias.

El efecto práctico es que dejas de intentar traducir una imagen a adjetivos. En vez de escribir "a warm, shallow-depth close-up with a slow push-in," entregas el fotograma que ya se ve así y el clip que ya se mueve así, y gastas tus palabras en lo nuevo. Para cualquiera que haya peleado por describir una estética específica con texto, ahí está el desbloqueo del flujo de trabajo.

Los cuatro modos de tarea, y cómo se combinan

La API expone cuatro tipos de task, y encajan limpio con la idea de componer a partir de recursos:

  1. text_to_video: descripción pura, sin recursos. La opción de respaldo cuando partes de cero.
  2. image_to_video: animar una imagen fija. La puerta de entrada más común: una imagen potente se vuelve el primer fotograma del movimiento.
  3. reference_to_video: llevar un sujeto o un estilo desde una referencia hacia una generación nueva.
  4. edit: el modo conversacional y con estado que revisa el clip anterior conservando lo que no cambiaste.

El flujo previsto los encadena: generas o animas una base con alguno de los tres primeros y después pasas a edit para refinar conversando. Es la misma forma que la dupla Nano Banana 2 Lite + Omni Flash de la propia Google —editar una imagen fija y luego animarla—, extendida a lo largo de varios turnos.

El matiz del audio, con todas sus letras

Como no se puede aportar audio, el diseño sonoro se vuelve una tarea de escritura. El modelo produce diálogo, efectos y ambiente según lo que describa tu prompt: "gentle rain on a window, no music" o "a single soft click, then room tone." Tienes control de verdad, pero es control descriptivo, y eso implica dos cosas para la planificación:

  • Si tu proyecto necesita que el video generado calce con una pista existente —una canción con licencia, un sting de marca, una voz en off grabada—, esa sincronización ocurre en un paso de audio aparte, no dentro de Omni Flash.
  • Si solo necesitas un sonido original y adecuado, describirlo bien en el prompt te lleva ahí sin subir nada.

Dónde queda OmniArt hoy

El flujo de componer a partir de recursos no es algo que tengas que esperar a Omni Flash para probar: ya funciona con los modelos activos en el espacio de video de OmniArt y, en un aspecto, van más lejos.

Seedance 2.0, ya disponible en OmniArt, se construyó justo alrededor de esta idea: acepta hasta nueve imágenes, tres clips de video y —esto es lo notable— tres archivos de audio en un mismo prompt, cada uno atado a un rol con la sintaxis @image1 / @video1 / @audio1. Eso incluye la entrada de audio de referencia que Omni Flash retiene. Si tu brief depende de darle al modelo un sonido específico con el que trabajar, ese camino ya existe.

Y la dirección del campo es clara: Seedance 2.5, anunciado en junio, lleva la misma arquitectura de referencias hasta 50 entradas multimodales a la vez. La entrada any-to-any no es la historia de un solo modelo: es hacia dónde va el video dirigido con IA. Omni Flash le puso nombre a la idea; el espacio ya te deja practicarla.

Abre el espacio de video en OmniArt, arma tu conjunto de referencias y deja que los recursos carguen el look y el movimiento mientras tus palabras cargan la intención. Ese es el brief any-to-any, disponible ya.

¿Todo listo para crear?

Empieza a generar contenido increíble con IA

Empezar gratis