GuideTutoriales y guías12 min de lectura

8 prompts de Grok Imagine que de verdad funcionan

Ocho prompts listos para copiar de Grok Imagine 1.5 en imagen y video, construidos sobre el estilo de lenguaje natural de FLUX.1 y la estructura Sujeto + Acción + Cámara + Estilo + Audio. Qué hace cada prompt y por qué funciona, dentro de OmniArt.

Equipo OmniArt
8 prompts de Grok Imagine que de verdad funcionan

Grok Imagine 1.5 actualizó su base de imagen a FLUX.1, de Black Forest Labs, y ese cambio tiene una implicación concreta para cómo escribes prompts: el modelo responde a la descripción en lenguaje natural como un fotógrafo lee un brief, no como los modelos viejos analizaban listas de palabras clave. Los ocho prompts de abajo están listos para copiar: pégalos en el espacio de Grok Imagine de OmniArt, ajusta los detalles y genera. Cada ficha incluye el texto exacto del prompt, qué produce y una nota de oficio sobre por qué su estructura funciona.

Para la teoría general del prompt en todos los modelos de OmniArt, revisa cómo escribir mejores prompts. Para un tratamiento más profundo de los seis modos de generación de Grok Imagine y de las cuentas de costo, revisa la guía de Grok Imagine para creadores. Este artículo trata específicamente de Grok Imagine 1.5 —la versión con FLUX.1— y del oficio de prompt que premia.

Qué cambió Grok Imagine 1.5 en el prompting

El modelo base FLUX.1 está entrenado de forma distinta a las arquitecturas anteriores de texto a imagen. Analiza bien la prosa conectada y tiende a responder poco a las pilas de puras palabras clave. Cinco hábitos suben la calidad de la forma más confiable:

  • Lenguaje natural en vez de pilas de palabras clave. Las oraciones completas superan a los adjetivos separados por comas. "A street at blue hour, lit by the hum of a convenience store sign" le gana a "street, night, neon, cinematic, 4K."
  • Referencias específicas en vez de adjetivos vagos. "Shot on a Fujifilm XT4, 23mm f/2" le dice más al modelo que "high quality photo". Los equipos y las películas nombrados tienen peso real en el espacio latente.
  • Palabras de color exactas en vez de "colorful". "Electric blue and hot pink" produce una paleta deliberada. "Colorful" produce ruido promediado.
  • Hora exacta en vez de "golden hour". "Late October, 5:45 pm, sun 6° above the horizon" le dice al modelo el ángulo preciso y la calidez de la luz. "Golden hour" es ambiguo entre estaciones y latitudes.
  • Estructura de video: Sujeto + Acción + Cámara + Estilo + Audio. Pon el sujeto y la acción centrales en las primeras 20 a 30 palabras. Un solo foco de estilo le gana a una mezcla. Itera de forma progresiva: cambia una variable por generación hasta que el resultado se fije y después empuja más lejos.

Para un desglose completo del vocabulario cinematográfico que se traslada al video, la guía de prompts cinematográficos para video con IA cubre en profundidad la elección de lente, los movimientos de cámara motivados y el lenguaje de iluminación.


Los 8 prompts

1. Plano de producto cinematográfico (imagen)

35mm product photography, shot on Fujifilm XT4. A matte black mechanical wristwatch resting on a slab of raw concrete, 
late October afternoon light coming in low from camera left at roughly 20°, casting a long shadow across the concrete 
face. Shallow depth of field, background falling completely soft. Color palette: warm amber highlights, cool blue-grey 
shadow fill. No props, no reflections except the concrete surface itself.

Qué produce: una imagen fija limpia y con dirección de arte que se lee como fotografía profesional de producto y no como salida de IA.

Por qué funciona: la referencia a la Fujifilm XT4 ancla la ciencia de color y el renderizado del sensor en un look concreto del mundo real. El ángulo de la luz está especificado numéricamente, lo que evita que el modelo caiga por defecto en una luz cenital difusa. Mantener la paleta en dos colores —altas luces ámbar cálidas, relleno de sombra azul grisáceo frío— impide que el modelo introduzca un tercer tono que compita.


2. Primer plano de personaje con audio (video)

Medium close-up of a young woman with short silver hair and a worn leather jacket, inside a neon-lit record shop at 
3 am. She looks directly into camera and says: "Every city has one song. I'm still looking for mine." Natural lip 
sync. Camera holds completely still. Light source: one pink neon tube overhead, one cyan neon sign spilling from 
camera right. Atmosphere: quiet, a little melancholic, not cinematic drama. Ambient audio: low vinyl static underneath 
the dialogue. 8 seconds.

Qué produce: un momento de personaje con audio nativo de Grok Imagine 1.5: el modelo genera diálogo, sincronía labial y sonido ambiente en una sola pasada de inferencia.

Por qué funciona: la línea de diálogo es lo bastante corta como para sincronizarse limpiamente dentro de 8 segundos. Dos fuentes de luz de neón separadas y nombradas (rosa cenital, cian desde la derecha) le dan al modelo un mapa de luz claro y evitan el promedio genérico de "ciudad de neón". "Not cinematic drama" es una restricción negativa que guía el ánimo con más precisión de lo que lo haría un adjetivo positivo.

Consejo

Mantén el diálogo hablado en una o dos oraciones cortas en clips de menos de 10 segundos. Las líneas más largas saturan la duración disponible, y el modelo puede apurar la interpretación o cortar el audio antes de tiempo.


3. Entorno atmosférico: clip de ambiente (video)

Wide establishing shot of a fog-filled pine forest in southern Norway, early November, 7 am. No people, no animals. 
Soft diffused dawn light filtering through the canopy, pale grey-white, casting almost no shadow. Slow imperceptible 
push forward, as if the camera is drifting on breath. Audio: deep forest ambience — distant water, occasional bird, 
near-silence underneath. No music. 12 seconds.

Qué produce: un clip ambiental que instala un ánimo, ideal como material de fondo, como transición o como escena de apertura.

Por qué funciona: "early November, 7 am" es más preciso que "foggy morning". El avance se describe como "imperceptible" y "drifting on breath", lo que comunica el ritmo con más exactitud que "slow push in". Pedir que no haya música evita que el audio caiga por defecto en una musicalización: el modelo genera en cambio un ambiente genuino de estilo grabación de campo.


4. Vertical social de ritmo rápido: revelación de producto (video)

9:16 vertical. A pair of electric blue running shoes drops into frame from the top, landing on a wet reflective black 
studio floor. High-speed impact, tiny water spray, shoes bounce once and settle. Immediate cut to product floating 
at centre frame, slow rotation 360°. Fast rhythm: first motion 0–2s, rotation 2–8s. Hard direct light from above, 
electric blue accent light from below floor (subtle). No dialogue. Audio: sharp impact sound on drop, then a clean 
single synthesizer tone during rotation. 8 seconds.

Qué produce: un clip social 9:16 con punch, hecho para TikTok, Reels o Shorts: revelación de producto de corte rápido con audio nativo.

Por qué funciona: especificar 9:16 al principio fija la relación de aspecto antes que cualquier otra cosa del prompt. La línea de tiempo está escrita explícitamente ("0–2s / 2–8s"), lo que ayuda al modelo a repartir bien los dos beats en vez de fundirlos en un solo movimiento. Nombrar los eventos de audio concretos (sonido de impacto, tono de sintetizador) produce un diseño de sonido más intencional que "add sound effects".

Advertencia

Los clips de Grok Imagine 1.5 llegan hasta 15 segundos. Para contenido social, mantenlos en 8 a 10 segundos como máximo: el movimiento del modelo es más limpio en ese rango y las ventanas de atención de las plataformas sociales son cortas. En 720p, un clip de 8 segundos cuesta 120 créditos en OmniArt.


5. Ilustración estilizada (imagen)

Risograph print illustration of a small coastal Japanese fishing village at dusk, mid-December. Two ink colors only: 
deep indigo and warm persimmon orange. Flat graphic shapes, no gradients. Fishing boats pulled up on shore, a single 
wooden dock, lantern light in two window rectangles. Composition: low horizon line, large sky area, boats and dock in 
lower third. The print has slight ink misregistration — indigo shifted 2px left from the orange layer. Texture: 
visible paper grain throughout.

Qué produce: una ilustración gráfica de color limitado que se lee como un proceso de impresión real y no como arte digital genérico.

Por qué funciona: nombrar la técnica de impresión (Risograph) y sus restricciones específicas (dos tintas, formas planas, sin degradados, desregistro de tinta) le da al modelo un brief técnico completo. "Ink misregistration" es el tipo de detalle de proceso físico que ancla la salida en una estética del mundo real: es el equivalente en FLUX.1 a nombrar una película fotográfica. Sin eso, el modelo tiende a agregar degradados o a mezclar colores.


6. Movimiento de cámara dinámico: retroceso con dron (video)

Aerial drone footage. Extreme close-up on the face of a compass resting on a weathered wooden ship's deck, late 
afternoon November light, warm golden horizontal rays from camera left. Slow pull-back revealing the full deck, 
then the ship's hull, then open grey Atlantic ocean horizon. Pull-back runs the full 15 seconds — begin on compass, 
end with ocean filling 80% of the frame. Camera elevation stays constant, no tilt. Real drone color science: flat 
LOG-style color, slight lens vignette. Audio: wind increasing in volume as ocean fills frame.

Qué produce: un plano de revelación sostenido de 15 segundos —la duración máxima del modelo— armado alrededor de un único movimiento de cámara motivado.

Por qué funciona: este prompt usa los 15 segundos completos para un solo movimiento continuo, que es la manera más confiable de obtener un resultado limpio a esa duración. El retroceso está restringido a una elevación constante (sin tilt), lo que evita que el modelo improvise un segundo eje de cámara y genere un movimiento entrecortado. "LOG-style color, slight lens vignette" codifica un look de cámara real sin exigir nombres de equipos específicos.


7. Moda estilizada: retrato en película fotográfica (imagen)

Expired Kodak Portra 400 film scan. Portrait of a woman in her mid-thirties, strong afternoon window light from 
camera right, half of her face in deep shadow. She is wearing a deep forest green linen blazer, no visible jewellery. 
Expression is neutral, looking slightly off-camera left. Grain heavy and warm, slight halation around the window 
highlight, greens shifted slightly toward yellow-olive. Tight crop: from collarbone to just above top of head. 
Aspect ratio 4:5.

Qué produce: un retrato de fotografía analógica con un renderizado de color vintage preciso: grano auténtico, halación y las derivas de color propias de una película vencida.

Por qué funciona: "expired Kodak Portra 400" es una de las referencias de estilo de una sola frase más potentes del espacio latente de imagen: arrastra un conjunto completo de expectativas tonales. Especificar la deriva de color ("greens shifted slightly toward yellow-olive") evita el grano vintage genérico y guía la degradación exacta de paleta asociada a la película vencida. El encuadre cerrado y una relación de aspecto concreta (4:5) producen un retrato que se lee como una copia real.


8. Entorno inmersivo: lluvia (video)

Ground-level POV inside a glass bus shelter, heavy urban rain, Tokyo residential street, late June 22:00. Camera 
holds completely still. Rain streaks down the glass panels in foreground, streetlights smear into vertical bokeh 
streaks behind the wet glass. A cyclist passes in the distance — silhouette only, visible for about 2 seconds in 
mid-clip. No camera movement. Audio: heavy rain on glass, distant car tyre hiss, one distant motorbike engine 
fading right-to-left. No music. 10 seconds.

Qué produce: un clip ambiental inmersivo en un solo punto de vista, fuerte como plano de establecimiento o como pieza de ánimo independiente.

Por qué funciona: "late June 22:00" especifica la estación exacta, la sensación térmica (lluvia húmeda de verano) y el nivel de oscuridad. El ciclista que pasa está plantado como un evento concreto en un momento concreto ("about 2 seconds in mid-clip"), lo que le da al modelo un ancla narrativa sin pedirle una acción compleja de personaje. El audio viene en tres capas separadas (lluvia sobre el vidrio, siseo de neumáticos, motocicleta), lo que suele producir un diseño de sonido más pensado que una sola instrucción de "ambient city rain".


Cómo correr estos prompts en OmniArt

Los ocho prompts corren sobre Grok Imagine 1.5 dentro del espacio de creación de OmniArt, sin necesidad de una suscripción aparte a xAI. Los prompts de imagen (1, 5, 7) van al espacio de imagen; los de video (2, 3, 4, 6, 8) van al espacio de video, bajo Grok Imagine.

Algunas notas prácticas para correrlos en OmniArt:

  • Empieza en 480p para iterar. En 480p, el video cuesta 10 créditos por segundo. Cuando la estructura esté bien, sube a 720p (15 créditos por segundo) para la toma final.
  • Usa el modo Extend para alargar. El clip de ambiente (prompt 3) y el retroceso con dron (prompt 6) se pueden extender hasta 15 segundos adicionales con el modo Extend de Grok Imagine: el mismo modelo, cobrado solo por la parte agregada.
  • Usa el modo Modify para correcciones puntuales. Si la iluminación de un resultado está casi bien pero un elemento falla, el modo Modify te deja describir el cambio en texto sin regenerar el clip completo. Mantén los clips de origen en 480p antes de pasarlos a Modify: el modo topa la entrada en 854×480.
  • Consistencia de personaje entre planos: si estás generando varios planos del mismo personaje (al estilo del prompt 2), usa el modo Reference con un retrato como @Image1 y vuelve a declarar la descripción del personaje en cada prompt nuevo. El modo Reference de Grok Imagine 1.5 es el camino más directo a la consistencia sin depender de un modelo afinado.

Para un desglose completo de los seis modos de generación de Grok Imagine, los escenarios de costo y cuándo conviene cambiar de modelo, revisa la guía completa de Grok Imagine. Para el vocabulario más amplio de fotografía que se traslada a cualquier prompt de video, vale la pena guardar la guía de prompts cinematográficos para video con IA junto a esta.

¿Todo listo para crear?

Empieza a generar contenido increíble con IA

Empezar gratis