De foto de producto a anuncio en movimiento: buenas prácticas de imagen a video con Grok Imagine 1.5
El modo más fuerte de Grok Imagine 1.5 es convertir una foto de producto limpia en un anuncio en movimiento. Reglas para la imagen de origen, una fórmula de prompt en cinco partes, un flujo de 480p a 720p y cuatro ejemplos resueltos dentro de OmniArt.

El modo imagen a video de Grok Imagine 1.5 tiene un trabajo que hace excepcionalmente bien: tomar una foto de producto limpia y convertirla en un clip publicitario en movimiento sin reconstruir el producto a partir de una descripción de texto. El motor Aurora ancla la posición del sujeto, la iluminación y la trayectoria de cámara desde tu imagen de origen, así que el tenis conserva el tono exacto de blanco y la esfera del reloj sigue legible, algo que el texto a video simplemente no puede garantizar para un producto que de verdad vendes.
Esta guía cubre los tres pilares de oficio que deciden si un clip de imagen a video con Grok Imagine 1.5 es usable al primer intento: calidad de la imagen de origen, construcción del prompt y el flujo de resolución de 480p a 720p. Cuatro ejemplos resueltos —un tenis, un reloj, un bolso y un producto de belleza— muestran cada pilar aplicado de punta a punta.
Para el flujo publicitario de e-commerce más amplio, que cubre elección de modelo, formatos por plataforma y audio, lee Convierte fotos de producto en anuncios en video con OmniArt. Este artículo se queda enfocado en sacarle el mejor resultado a Grok Imagine 1.5 en particular.
Qué aporta Grok Imagine 1.5 a la imagen a video
| Especificación | Valor |
|---|---|
| Resolución | Hasta 720p |
| Cuadros por segundo | 24 fps |
| Duración | 1–15 s |
| Audio nativo | Sí, generado en la misma pasada de inferencia |
| Base de imagen | FLUX.1 (Black Forest Labs) |
| Puesto en la arena | N.º 1 de la Image-to-Video Arena (+52 Elo sobre 1.0) |
La base FLUX.1 es la razón por la que acá funciona escribir prompts en lenguaje natural. Describes el plano como se lo explicarías a quien opera la cámara, en vez de apilar palabras clave de un vocabulario OpenCLIP. El motor Aurora usa después la imagen de origen como referencia espacial dominante: mantiene estables la silueta, el color y la posición relativa del sujeto mientras la cámara y la luz se mueven alrededor.
OmniArt expone Grok Imagine dentro del espacio de video junto a todos los demás modelos, así que no hace falta una suscripción aparte a xAI. La tarifa es de 10 créditos por segundo en 480p y 15 créditos por segundo en 720p, o sea que un borrador de 5 s en 480p cuesta 50 créditos y ese mismo final de 5 s en 720p cuesta 75.
Pilar 1: calidad de la imagen de origen
El motor Aurora ancla la composición desde el fotograma de origen. Las entradas fuertes producen movimiento anclado; las débiles introducen deriva, porque el modelo vuelve a interpolar lo que no puede leer con claridad y la fidelidad se resiente.
La lista de verificación de la imagen de origen
| Sí | No |
|---|---|
| Usa un fondo limpio y despejado (blanco, gris claro o un contexto de estilo de vida con aire) | Usar fondos tan cargados que el producto se pierda dentro de ellos |
| Fotografía o recorta para que el producto ocupe entre el 50 % y el 70 % del encuadre | Usar fotos de producto muy recortadas o cortadas por el borde |
| Usa alto contraste entre sujeto y fondo | Usar una foto donde el color del producto coincida con el del fondo |
| Mantén el texto, los logos y las etiquetas enfocados y legibles | Usar imágenes con artefactos fuertes de compresión JPEG |
| Trabaja desde tu origen de mayor resolución (mínimo 1024 × 1024) | Usar una imagen web reducida o de tamaño miniatura |
| Usa un solo sujeto protagonista por encuadre | Usar un flat-lay agrupado con cinco productos |
| Asegúrate de que el detalle definitorio del producto (suela, esfera, broche, tapa) se vea con claridad | Usar una toma en ángulo que esconda la característica clave del producto |
Advertencia
Por qué esto importa más en Grok que en texto a video
Con texto a video describes un producto y el modelo inventa uno que encaja con tus palabras. Con imagen a video el modelo se compromete a respetar tu producto real, pero solo en la medida en que pueda leerlo desde el fotograma de origen. Una foto de baja resolución o visualmente ambigua es, de lejos, la causa más común de que los resultados de imagen a video de Grok Imagine 1.5 decepcionen.
Pilar 2: la fórmula de prompt en cinco partes
Grok Imagine 1.5 usa FLUX.1 como base de imagen, que premia las descripciones en lenguaje natural por encima de las cadenas de palabras clave. Las cinco partes de abajo se corresponden con aquello sobre lo que el motor de movimiento de Aurora puede actuar directamente.
La fórmula
[Action] — [Lighting] — [Pace] — [Background] — [Mood/reference]
Cada parte en detalle:
-
Acción — el movimiento de la cámara o del sujeto. Sé específico: "slow dolly-in from waist height", "orbital pan around the left side", "gentle vertical float, 3 cm up and back down". Términos vagos como "dynamic" le dan al modelo demasiado margen y producen resultados inconsistentes.
-
Iluminación — describe dirección, calidad y fuente de la luz. "Rim-lit from behind with a warm tungsten key at camera-left" le gana a "dramatic lighting". Las temperaturas de color concretas ("3200K", "5600K daylight") o las calidades de luz con nombre ("softbox fill", "hard shadow at 45 degrees") anclan el aspecto.
-
Ritmo — la velocidad y la cadencia del movimiento. "2-second slow push, no acceleration", "0.5× playback feel", "unhurried, editorial". Sin un ritmo explícito, el modelo cae por defecto en un movimiento moderado, demasiado rápido para trabajo de producto protagonista.
-
Fondo — si debe quedarse quieto, desplazarse sutilmente o aportar a la escena. "White cyclorama, no background motion", "Blurred bokeh marble surface, subtle light shift", "Studio void, no environment detail". Dejar esto afuera suele producir una deriva de fondo indeseada.
-
Tono y referencia de cámara — una sola frase que calibra el registro general. Las referencias de equipo son más confiables que los adjetivos: "shot on Fujifilm XT4" le gana a "cinematic"; "luxury print ad feel" le gana a "high-end"; un mes y una hora del día concretos ("January morning, 9 AM studio") le ganan a "golden hour".
Consejo
Qué omitir
No incluyas nombres de marca, rostros de personas ni referencias a lugares reales. No apiles sinónimos como palabras clave ("luxury high-end premium"): el prompt en lenguaje natural de FLUX.1 no gana nada con eso y solo agrega ruido. Una oración clara por parte rinde más que tres adjetivos sueltos.
Pilar 3: el flujo de resolución de 480p a 720p
La diferencia de costo en créditos entre 480p y 720p es de 5 créditos por segundo: modesta para un clip suelto, pero significativa cuando estás iterando prompt y movimiento antes de comprometerte.
Flujo recomendado
| Paso | Resolución | Propósito | Costo (clip de 5 s) |
|---|---|---|---|
| 1. Ideación del prompt | 480p | Probar el movimiento de cámara y la estabilidad del sujeto | 50 créditos |
| 2. Refinamiento del movimiento | 480p | Afinar ritmo, fondo y prompt de iluminación | 50 créditos por iteración |
| 3. Salida final | 720p | Máster limpio para redes o presentación | 75 créditos |
Tres iteraciones en 480p más un final en 720p suman 225 créditos, lo mismo que tres renders en 720p. La disciplina clave es no pasar a 720p hasta que el borrador en 480p tenga el movimiento y la composición que quieres. El motor Aurora escala el mismo clip, así que un resultado aprobado en 480p se vuelve un resultado aprobado en 720p de forma confiable.
Nota
Cuatro ejemplos resueltos
Ejemplo 1: acercamiento protagonista a un tenis
Producto: tenis blanco de caña baja, tomado en tres cuartos sobre una mesa blanca, con reflejos limpios.
Preparación de la imagen de origen: tomada desde un poco arriba, en ángulo de 45 grados, con la suela visible, los nudos de los cordones nítidos y la etiqueta de la lengüeta legible. Exportada a 2048 × 2048, sin compresión.
Prompt:
"Slow dolly-in from mid-distance to close-up on the toe box, stopping when the sole fills one-third of frame. Hard shadow from overhead natural light raking left to right. Unhurried, 0.3× pace feel. White infinity backdrop, no movement. Shot on Leica SL2, luxury footwear editorial register."
Qué aporta el movimiento: el acercamiento gradual revela en secuencia la textura del material de la puntera y el borde de la suela, información que una foto fija no puede comunicar. La sombra de luz natural que barre el panel lateral muestra la calidad de la superficie sin necesidad de una voz en off.
Audio: Grok genera un leve ambiente de sala y un sonido sutil de material cuando la suela entra al encuadre; quítalo o pásalo por debajo de la música según convenga.
Ejemplo 2: órbita de revelación de un reloj
Producto: reloj de vestir de acero inoxidable, en plano cenital sobre papel gris texturado, con la esfera hacia arriba y la correa desabrochada.
Preparación de la imagen de origen: la esfera ocupa el 60 % del encuadre, los índices son legibles y el detalle de la corona se ve a la derecha. Tomada a 2000 × 2000, con luz difusa pareja.
Prompt:
"Slow orbital pan starting at the 9 o'clock position, travelling clockwise around the watch face, completing 180 degrees over 8 seconds. Softbox fill from above, hard specular rim from camera-right at 4500K. No pace acceleration. Pale grey linen surface, stationary background. Studio watchmaker editorial style."
Qué aporta el movimiento: la órbita atrapa el brillo metálico del borde de la caja y las manecillas desde varios ángulos en una sola pasada, un detalle de producto que normalmente exige cuatro fotos separadas. El arco de 180 grados mantiene la esfera legible todo el tiempo.
Audio: el motor Aurora genera un ambiente mecánico tenue, delgado y preciso, apropiado para un contexto relojero. Sirve como cama bajo una voz en off.
Ejemplo 3: bolso que flota y se posa
Producto: bolso de piel estructurado color camel, de pie contra un fondo crema cálido, con la herrería visible.
Preparación de la imagen de origen: la cara frontal centrada en el encuadre, las asas superiores visibles y el tirador del cierre nítido. Tomada a 1800 × 1800.
Prompt:
"Bag floats 6 cm upward from the surface, holds for 2 seconds at peak, then settles softly back down. Light barely moves. Warm 3200K ambient fill from above-left, subtle leather highlight from below-right. Deliberate, considered pace. Cream infinity backdrop, no environment motion. Luxury fashion catalogue register, shot on Hasselblad medium format."
Qué aporta el movimiento: el flotar y posarse crea una sensación de peso y de sustancia material: el bolso se comporta como un objeto físico y no como un recorte. La pausa en el punto alto le da tiempo a quien mira para leer el detalle de la herrería y las costuras.
Audio: el ambiente de sala es mínimo; al posarse se produce un leve sonido de contacto con la superficie que refuerza la fisicalidad.
Ejemplo 4: rotación de un producto de belleza con condensación
Producto: frasco de sérum con acabado mate, de pie, tapa gotero plateada y etiqueta blanca.
Preparación de la imagen de origen: el frasco ocupa el 55 % del encuadre, el texto de la etiqueta es nítido, el detalle de la tapa se ve y el fondo es blanco limpio. Tomada a 1920 × 1920.
Prompt:
"Slow counter-clockwise rotation, full 360 degrees over 10 seconds. Fine moisture condensation forms on the glass surface as the rotation begins and disperses by the halfway point. Soft cool daylight from above at 6000K, rim light from behind. Steady, unhurried pace. White studio background, no drift. Skincare campaign aesthetic, shot on Phase One IQ4."
Qué aporta el movimiento: el efecto de condensación comunica eficacia y frescura, dos ideas conceptualmente caras de transmitir en una fija. La rotación completa muestra el texto de la contraetiqueta y el mecanismo del gotero desde todos los ángulos.
Advertencia
Fallas comunes y cómo arreglarlas
| Problema | Causa probable | Arreglo |
|---|---|---|
| El texto de la etiqueta se desenfoca o se deforma con el movimiento | La imagen de origen está comprimida o la etiqueta es chica en el encuadre | Parte de un origen de mayor resolución; recorta más cerrado para que la etiqueta ocupe más encuadre |
| El sujeto se aparta de su posición inicial | El fondo se parece demasiado al producto | Vuelve a fotografiar sobre un fondo de más contraste, o describe el color del fondo explícitamente en el prompt |
| El movimiento de cámara es demasiado rápido | El ritmo quedó sin especificar | Agrega un descriptor de ritmo explícito: "unhurried", "0.3× feel", o una cuenta en segundos |
| El fondo genera movimiento indeseado | Se omitió la descripción del fondo | Agrega explícitamente "stationary background, no background motion" |
| El color cambia a mitad de clip | La imagen de origen tiene un balance de blancos inconsistente | Corrige el balance de blancos de la imagen de origen antes de subirla |
| El audio nativo suena fuera de lugar | La referencia de tono es vaga | Agrega un registro más específico ("silent studio", "minimal room tone") si no quieres un paisaje sonoro generado |
Cuándo elegir Grok Imagine 1.5 y cuándo otro modelo
Grok Imagine 1.5 es la herramienta correcta cuando tienes una foto fija limpia y quieres un anclaje consistente del sujeto a una tarifa eficiente en créditos. No es la herramienta correcta para todo brief de video.
| Necesidad | Mejor opción |
|---|---|
| Consistencia de personaje entre escenas de varios planos | Seedance 2.0 |
| Parametrización de cámara a nivel de fotograma | V6 |
| Salida 4K para emisión | Veo 3 |
| Mucha energía de movimiento, estilo UGC de vida cotidiana | Modelos PixVerse |
| La mayor duración de clip (hasta 60 s) | Sora 2 |
Para el marco general de elección de modelo en todo el panorama de imagen a video, la guía de fotos de producto a anuncios en video cubre las opciones por objetivo y por presupuesto.
Empezar en OmniArt
Abre el espacio de video de OmniArt, elige Grok Imagine como modelo y sube una foto de producto que pase la lista de verificación de imagen de origen de arriba. Escribe un prompt de cinco partes —acción, iluminación, ritmo, fondo, tono— y genera un borrador de 5 s en 480p. Si el movimiento y el anclaje del sujeto se sostienen, pasa a 720p para el final.
Todo el ciclo —borrador, refinamiento, máster— corre dentro de un mismo espacio de trabajo con el mismo saldo de créditos que usas en cualquier otro modelo de OmniArt. Sin cuenta aparte en xAI, sin exportar archivos a otra herramienta y sin volver a empezar desde texto cuando ya tienes la foto de producto que querías.
¿Todo listo para crear?
Empieza a generar contenido increíble con IA