Cómo escribir prompts para Gemini Omni Flash y videos de 10 segundos
Gemini Omni Flash tiene una superficie de prompt inusual: sin parámetro negativo, dos formatos de aspecto, solo inglés y dos modos de prompting distintos. Así se escriben bien los dos.

La mayoría de las guías de prompts para video con IA te enseñan a escribir una sola cosa: un párrafo rico y detallado que le entregas al modelo una única vez. Gemini Omni Flash rompe esa premisa. Su API para desarrolladores (activa desde el 30 de junio) se articula en torno a dos actos de prompting distintos: la primera generación y, después, una conversación continua de ediciones que van reconfigurando el mismo clip. Si escribes para uno e ignoras el otro, dejas la mayor parte del modelo sin usar.
La superficie de prompt de Omni Flash también es inusual por lo que quita. No hay campo de prompt negativo, ni control de temperatura, ni instrucción de sistema, y solo hay dos relaciones de aspecto. No son huecos que haya que sortear a ciegas: cada uno cambia cómo deberías formular un prompt. Esta guía cubre ambos modos y las restricciones que los moldean.
Nota
Desde que se publicó esta guía, Gemini Omni Flash se sumó al espacio de video de OmniArt para la generación estándar guiada por texto e imagen. Las secciones de abajo siguen describiendo directamente el flujo conversacional de Google porque OmniArt todavía no expone los controles de la Interactions API que preservan la sesión.
Dos modos de prompt, no uno
Cada sesión de Omni Flash tiene dos tipos de prompt, y cada uno premia una escritura distinta.
El prompt de primera generación es un brief completo para un único beat de 10 segundos: sujeto, movimiento, cámara, luz, sonido, estilo. Se comporta como cualquier buen prompt de texto a video o de imagen a video: pon el detalle adelante, sé específico y describe todo el plano de una vez.
La instrucción de edición conversacional es lo contrario. Es corta, nombra exactamente un cambio y da por hecho que el modelo ya tiene el clip anterior en contexto. "Make the lighting golden hour." "Swap the sedan for a pickup." El modelo aplica el cambio y conserva todo lo que no mencionaste, gracias al previous_interaction_id que arrastra el estado de la sesión a lo largo de hasta tres ediciones consecutivas mediante la Interactions API. Si amontonas tres cambios en una sola instrucción de edición, pierdes justo la precisión que hace que valga la pena usar el modo.
El modelo mental: compón en el primer prompt y dirige en los siguientes. Consigue un clip base sólido y después refínalo como le darías notas a un director en pleno rodaje, de a una por vez.
Las restricciones de la API que moldean tu redacción
La lista de parámetros de Omni Flash es corta a propósito. Cada omisión tiene una consecuencia en el prompt:
| Restricción | Qué significa para el prompt |
|---|---|
| Sin campo de prompt negativo | Formula las exclusiones dentro del propio prompt: "an empty street, no pedestrians, no traffic" en lugar de una lista negativa aparte |
| Sin temperature / top_p / instrucción de sistema | No puedes ajustar la varianza ni fijar una regla de estilo persistente: escribe el tono y el estilo dentro del texto del prompt cada vez |
| Relación de aspecto: solo 9:16 o 16:9 | Elige la orientación desde el principio; no hay opción cuadrada ni panorámica de cine, así que encuadra en vertical u horizontal desde la primera palabra |
| El audio se describe, nunca se sube | No puedes darle una pista para que la siga: describes con palabras el sonido que quieres (ver abajo) |
| Inglés totalmente soportado; otros idiomas sin probar | Escribe los prompts en inglés para obtener resultados predecibles |
| Tope duro de 10 segundos | Una acción clara por generación, no una lista de planos |
Advertencia
Omni Flash no admite subir un audio de referencia. No puedes darle una base musical ni una muestra de voz para sincronizar. Genera una pista de audio por defecto y tu único control son las palabras del prompt, así que el diseño de sonido hay que escribirlo, no adjuntarlo.
Una plantilla para la primera generación
Como 10 segundos alcanzan para un solo beat, los primeros prompts más fuertes describen un momento continuo único con todas sus capas especificadas. Seis casillas cubren casi cualquier plano:
- Sujeto: quién o qué está en pantalla, descrito en concreto
- Movimiento: la única acción que se desarrolla a lo largo del clip
- Cámara: un solo movimiento, no una secuencia ("slow push in", "locked-off wide")
- Iluminación: dirección, calidad, hora del día
- Diseño de sonido: el audio que quieres que se genere, en palabras
- Estilo: paleta, época, referencia fílmica, textura
Un ejemplo trabajado:
"A ceramic pour-over coffee dripper on a pale oak counter, steam rising as dark coffee streams into the glass carafe below. Slow push in on the drip. Soft morning light from a window camera-left, warm and diffused. Sound: gentle water trickle, distant kitchen ambience, no music. Muted editorial palette, shallow depth of field, shot on a fast prime lens."
Fíjate en que las exclusiones viven dentro de la oración ("no music"), la cámara hace un solo movimiento y el sonido está deletreado. Esa es toda la disciplina.
Edición conversacional: el vocabulario que aterriza
Una vez que tienes un clip base, las ediciones son donde Omni Flash se adelanta a los flujos de generar y descartar. Mantén cada instrucción con una sola intención y apóyate en un vocabulario de verbos consistente que el modelo lea con claridad:
- Reiluminar: "make it golden hour", "add a cool rim light from behind"
- Reemplazar: "swap the coffee dripper for a French press"
- Reestilizar: "make it feel like 1970s film stock"
- Recolorear: "change the mug to matte black"
- Retemporizar: "slow the pour down", "let the steam linger longer"
Dos reglas mantienen el hilo coherente. Un cambio por turno: el modelo conserva lo que no mencionas, así que una edición de una sola nota es más predecible y más fácil de deshacer volviendo a escribir el prompt. Y construye sobre el lenguaje del turno anterior: reutiliza los sustantivos que ya estableciste ("the mug", "the pour") para que el modelo se ancle a los mismos elementos en lugar de volver a inferir la escena.
Consejo
La cadena de tres ediciones es un presupuesto, no una sugerencia. Planea el prompt base para que necesite los menos seguimientos posibles: una primera generación fuerte deja tus turnos de edición para cambios creativos de verdad y no para arreglar cosas que el primer prompt podría haber especificado.
Cómo trabajar con los límites actuales
Algunos límites no se resuelven con el prompt, y conviene escribir teniéndolos presentes en lugar de pelearse con ellos:
- Tope de 10 segundos. No hay extensión de escena en la API, así que no escribas prompts que impliquen un arco más largo. Diseña un beat que se sostenga solo.
- La consistencia de personaje entre cambios de escena es una debilidad reconocida. Si el parecido importa, mantén las ediciones dentro de la misma escena en lugar de pedirle al modelo que reubique al personaje en un entorno nuevo.
- Los videos de referencia de más de 3 segundos no se procesan completos. Deja cualquier clip de referencia corto y al grano.
- No hay referencia con varios videos ni edición de voz: ninguna de las dos está soportada, así que planea esos pasos en una herramienta aparte y no en el prompt.
Nada de esto descalifica a una herramienta de iteración rápida y de formato corto. Solo significa que Omni Flash premia los prompts acotados a lo que hace bien: un beat compacto, refinado de forma conversacional.
Qué funciona hoy en OmniArt
Gemini Omni Flash ya está disponible en OmniArt, y casi todos los hábitos de prompting de arriba aplican directamente: un beat claro, especificidad en lugar de sopa de palabras clave y el sonido escrito dentro del prompt. La excepción principal es la edición multiturno que preserva la sesión, que sigue siendo un flujo de la API original y no un control de la interfaz de OmniArt.
- La generación guiada por referencias se corresponde directamente con Seedance 2.0, disponible en OmniArt, que acepta hasta nueve imágenes, tres videos y tres archivos de audio ligados a roles con la sintaxis
@image1/@video1: la idea de "componer a partir de recursos", con más entradas de las que ofrece Omni Flash. - El lenguaje de cámara cinematográfico se corresponde con Veo 3.1, que interpreta con mesura verbos de movimiento como "drift", "glide" y "dolly in".
- La plantilla de seis casillas (sujeto, movimiento, cámara, luz, sonido, estilo) es el mismo esqueleto que produce resultados limpios en todos los modelos de video del espacio.
Abre Gemini Omni Flash en el espacio de video y escribe el primer prompt como un beat completo. Si necesitas el bucle de edición multiturno de Google, continúa esa parte en la Interactions API; para la generación estándar y los flujos con imagen de referencia, la entrada del modelo en OmniArt ya está lista.
¿Todo listo para crear?
Empieza a generar contenido increíble con IA