Grok Imagine: guía para creadores del modelo de video de xAI en 2026
Guía práctica de Grok Imagine: seis modos de generación, patrones de prompt, el costo real en créditos y cuándo elegirlo frente a V6 o Sora 2 en 2026.

Grok Imagine es el modelo de generación de video y audio de xAI, lanzado en enero de 2026 y accesible desde OmniArt sin una suscripción aparte a xAI. Es un producto distinto del chatbot Grok: comparten el nombre y nada más. Esta guía cubre para qué está hecho Grok Imagine, los seis modos de generación que importan, los patrones de prompt que respetan cada modo y las cuentas de lo que cuestan en créditos los proyectos reales.
Qué es Grok Imagine
Grok Imagine genera video de hasta 720p con audio nativo en clips de 1–15 segundos. Su gracia principal no es la resolución: a 720p decide a propósito no pelear con Sora 2 ni con V6 en fidelidad bruta. Su gracia principal es la superficie de trabajo alrededor del modelo: seis modos de generación que comparten un mismo juego de pesos y te dejan generar, extender, reestilizar y modificar sin salir del modelo.
| Especificación | Valor |
|---|---|
| Resolución máxima | 720p (usa V6 para 1080p o más) |
| Duración máxima | 15 segundos por generación |
| Relaciones de aspecto | 16:9, 4:3, 1:1, 9:16, 3:4, 3:2, 2:3 |
| Audio | Nativo, generado junto con el video |
| Costo (480p) | 10 créditos por segundo |
| Costo (720p) | 15 créditos por segundo |
Los seis modos que conviene conocer
Cada modo es una forma distinta de decirle al modelo con qué tipo de entrada está trabajando. Elegir el modo correcto es la mayor parte del trabajo de ingeniería de prompts.
Texto a video
El modo por defecto. Escribes un prompt y obtienes un clip. Ideal para explorar conceptos, armar mood boards y hacer borradores sociales cuando todavía no tienes una imagen de referencia. Cuesta entre 10 y 15 créditos por segundo según la resolución.
Imagen a video
Anima una imagen fija conservando la composición de entrada. El primer fotograma queda fijado a tu imagen. Úsalo para animar ilustraciones, fotografía de producto y mockups de diseño donde el fotograma de origen no se negocia.
Reference Mode: el diferenciador
Reference Mode acepta de 1 a 7 imágenes como anclas visuales sin fijar el primer fotograma. Etiquetas las imágenes con @Image1, @Image2, @Image3 y las mencionas en el prompt. Esto es lo que la mayoría de los otros modelos de video no tiene: casi todos fijan el primer fotograma (imagen a video) o no aceptan ninguna referencia (texto a video). Reference Mode queda en el medio, y es el camino más limpio hacia la consistencia de personaje a lo largo de varios planos.
Cuesta 15 créditos por segundo a 480p y 22.5 a 720p.
Extend Mode
Agrega de 2 a 10 segundos a un clip existente. La entrada es un MP4 de entre 2 y 15 segundos. La salida es un solo clip continuo; el cobro cubre únicamente la parte agregada. El truco entre modelos: Extend Mode funciona con videos generados por cualquier modelo del espacio de video de OmniArt, no solo por Grok.
Modify Mode
Edita un clip existente sin regenerarlo: cambios de fondo, de iluminación, de color en objetos puntuales, efectos de clima. La entrada tiene un tope de 8 segundos y se reescala automáticamente a 854×480, lo que significa que las fuentes de alta resolución pierden detalle en el viaje de ida y vuelta. Usa Modify en clips que de todos modos generaste a 480p.
Editing Suite: Restyle, manipulación de objetos y Sketches to Life
Un cajón de sastre de operaciones posteriores a la generación. Restyle aplica estilos artísticos (Cyberpunk, Anime, Retro, Origami, Watercolor, Mosaic). Object Manipulation agrega, quita o intercambia elementos. Sketches to Life anima dibujos de línea. Add Performance injerta animación de personaje sobre figuras estáticas. Sirve para crear varias variantes a partir de un solo clip de origen.
Prompts que respetan el modelo
Cuatro hábitos suben la calidad más rápido que alargar el prompt.
Usa lenguaje cinematográfico
Grok Imagine trae seis presets de cámara integrados: Zoom In, Zoom Out, Dolly Out, Tilt Up, Pan Right y Timelapse. Se activan con más precisión cuando el prompt usa términos de cinematografía.
| Más débil | Más fuerte |
|---|---|
| "A city street at night with neon signs and people walking" | "Dolly forward through a rain-slicked Tokyo alley, neon signs reflecting in puddles, shallow depth of field, a figure with an umbrella enters frame right, cinematic 2.39:1 framing" |
Etiqueta las referencias de forma explícita
Reference Mode se degrada cuando el prompt es genérico. Ata cada referencia a un rol.
"@Image1 (the red sports car) drifts around a mountain corner with @Image3 (the sunset sky) in the background while @Image2 (the driver character) grips the steering wheel."
Pon la acción al principio
La generación avanza en secuencia a lo largo de la duración. Si el clímax queda al final de un clip de 5 segundos, puede que el modelo no alcance a terminarlo. Adelanta la acción.
| Más débil | Más fuerte |
|---|---|
| "A quiet forest scene with birds, then suddenly a deer leaps across a stream" | "A deer leaps across a forest stream in golden hour light, camera tracking its arc, birds scatter from nearby branches" |
Ritma los clips de 10–15 s en una línea de tiempo
Para los clips más largos, escribe el timing dentro del prompt.
"Slow zoom into abandoned library (0–5s), dust particles catch light beams (5–10s), book falls from shelf (10–12s), pages flutter (12–15s)."
Qué cuesta en la práctica
Tres escenarios reales de plano, cotizados en créditos de OmniArt.
Un video de producto de 15 segundos para TikTok
| Paso | Modo | Resolución | Costo |
|---|---|---|---|
| Generación inicial | Texto a video | 480p, 10 s | 100 |
| Extensión | Extend | 480p, 5 s | 75 |
| Total (con una revisión) | 175–275 |
Un storyboard de marca de 3 planos
| Paso | Modo | Resolución | Costo |
|---|---|---|---|
| Plano 1 con 2 referencias | Reference, 8 s | 720p | 180 |
| Plano 2, mismas referencias | Reference, 8 s | 720p | 180 |
| Plano 3, mismas referencias | Reference, 6 s | 720p | 135 |
| Corrección de luz en el plano 2 | Modify, 8 s | 720p | 180 |
| Total | 675 |
Una pasada de restyle
| Paso | Modo | Resolución | Costo |
|---|---|---|---|
| Restyle a Anime | Restyle, 8 s | 480p | 120 |
Cuándo elegir otro modelo
Grok Imagine es la herramienta correcta para contenido social de formato corto, trabajo de boceto a video y relatos multi-shot guiados por referencias a 480p–720p. Es la herramienta equivocada cuando:
| Necesidad | Mejor opción |
|---|---|
| 1080p o más | V6, BACH, Veo 3 |
| Control avanzado de lente (distancia focal, profundidad de campo, aberración) | V6 |
| Clips de 16–20 segundos en una sola pasada | Sora 2 |
| Diálogo y música de nivel producción | Un modelo de audio dedicado más montaje |
| Conservar una fuente de alta resolución en las ediciones | Evita Modify Mode |
Patrones de flujo que llegan a producción
La forma en que Grok Imagine rinde dentro de OmniArt no es como generador autónomo: es como capa de iteración. Dos patrones son los que más rendimiento dan.
Patrón 1: genera en otro lado, refina aquí. Renderiza el clip maestro con V6 o Sora 2 a mayor resolución y después usa Extend, Restyle y Modify para sacar variantes y material adicional en Grok a menor costo.
Patrón 2: Reference Mode para fijar personajes. Cuando una campaña de marca necesita el mismo personaje en cinco planos, fija la identidad con una imagen ancla en @Image1 y después genera cada plano con la misma referencia en Reference Mode. Sale más barato que volver a tirar Sora 2 para cada plano.
Advertencia
Modify Mode reescala automáticamente cualquier entrada por encima de 854×480 a 480p antes de procesarla. Si necesitas editar un clip de 1080p sin perder resolución, haz la edición en otra parte o hazla antes del paso de escalado.
Cómo empezar en OmniArt
Grok Imagine está disponible en el espacio de video de OmniArt junto con V6, BACH, Sora 2, Veo 3, Kling 3.0, HappyHorse 1.0 y Seedance 2.0. El mismo saldo de créditos, la misma subida de referencias, la misma gramática de prompt. Empieza en Texto a video para aprender los presets de cámara y pasa a Reference Mode cuando ya tengas un personaje o un producto que fijar.
Acompaña esta guía con el desglose de BACH como director de fotografía para trabajo narrativo de mayor fidelidad, o con la lista corta de los mejores modelos de imagen a video si estás eligiendo entre modelos para un plano específico.
¿Todo listo para crear?
Empieza a generar contenido increíble con IA