IndustryModelos y análisis12 min de lectura

Grok Imagine 1.5 contra 1.0: qué cambian de verdad esos +52 Elo

Grok Imagine 1.5 de xAI subió +52 Elo sobre 1.0 y llegó al n.º 1 de la Image-to-Video Arena. Desglosamos la ganancia en cuatro cambios que se sienten: audio nativo, clips de 15 s, consistencia facial y Extend from Frame, con lecturas de antes y después dentro de OmniArt.

Equipo OmniArt
Grok Imagine 1.5 contra 1.0: qué cambian de verdad esos +52 Elo

Grok Imagine 1.5 salió como actualización en vista previa y movió la aguja: +52 Elo sobre 1.0 y salto a la cima de la Image-to-Video Arena por delante de Seedance 2.0, HappyHorse 1.0 y Google Veo en pruebas ciegas con usuarios. Un salto de 52 puntos en una tabla madura es una señal significativa: equivale más o menos a una tasa de victoria del 57 % en pruebas ciegas cara a cara contra 1.0.

El número es el titular. Lo que importa para el trabajo de producción es qué cambios concretos lo empujaron. Estuvimos corriendo 1.5 junto a 1.0 en el espacio de video de OmniArt, y la ganancia se rastrea limpiamente hasta cuatro cosas que quien crea nota de inmediato. Ninguna es sutil.

Si recién llegas a Grok Imagine, empieza por la guía base: cubre en detalle los seis modos de generación, los patrones de prompt y las cuentas de créditos. Este artículo asume que ya publicaste al menos algunos clips con 1.0 y quieres saber qué vale la pena volver a generar.

Comparación rápida de especificaciones: 1.0 contra 1.5

EspecificaciónGrok Imagine 1.0Grok Imagine 1.5
Resolución máxima720p720p
Duración máxima10 s15 s
Relaciones de aspecto16:9, 4:3, 1:1, 9:16, 3:4, 3:2, 2:316:9, 4:3, 1:1, 9:16, 3:4, 3:2, 2:3
AudioNativo, generación conjuntaNativo, generación conjunta, mejorado
Consistencia facialLínea baseNotablemente mejor
Extend from FrameContinuación desde el fotograma finalSelección explícita de fotograma, mejor continuidad
Base de generación de imagenFLUX.1 (Black Forest Labs)FLUX.1 (Black Forest Labs)
Costo (480p)10 créditos/s10 créditos/s
Costo (720p)15 créditos/s15 créditos/s
Puesto en la arenaVarias posiciones por debajo del n.º 1N.º 1 de la Image-to-Video Arena

El tope de resolución y el precio en créditos no cambian. Las ganancias están en lo que el modelo hace dentro de esos límites.

Cambio 1: el audio nativo ahora suena a una sola pasada

Grok Imagine genera audio desde 1.0 —diálogo, sincronía labial, efectos de sonido y música ambiental, todo construido a partir de tokens de video en una sola pasada de inferencia, sin un modelo de audio aparte cosido después—. En la práctica, el audio de 1.0 tenía dos fallas consistentes: tiempos mecánicos en el diálogo (las palabras llegaban a intervalos parejos, con pausas en los límites gramaticales y no en puntos naturales de respiración) y ambiente plano (una escena de café con un murmullo de fondo indiferenciado, sin variación espacial).

1.5 corrige las dos. La misma arquitectura de una sola pasada ahora produce entonación a nivel de oración: las frases cortas y contundentes aterrizan con entonación descendente, y el habla explicativa más larga tiene una subida audible a mitad de oración antes de la resolución. El ambiente se siente por capas: una escena de calle genera tráfico a distancia, pasos cerca y una puerta de local apagada detrás del sujeto. No están posprocesados; se generan con la misma lógica secuencial fotograma a fotograma que el motor Aurora usa para el movimiento, donde cada fotograma informa al siguiente y el entorno acústico sigue a la trayectoria visual.

Prompt en 1.0: "A barista explains the brewing process to a customer across the counter, coffee shop background, warm lighting."

  • Resultado en 1.0: el diálogo llegaba en ráfagas de metrónomo y la máquina de espresso de fondo sonaba a un nivel constante de principio a fin.
  • Resultado en 1.5: la explicación del barista tiene pausas naturales a mitad de oración, la máquina de espresso crece cuando entra otro pedido y la respuesta murmurada del cliente suena más baja y espacialmente más lejos del eje dominante del micrófono.

La diferencia se ve más clara en clips cargados de diálogo. Si venías pasando el video de Grok 1.0 por un modelo de audio aparte para el trabajo de voz, 1.5 cierra casi toda esa brecha de forma nativa.

Cambio 2: de 10 s se pasa a 15 s

Grok Imagine 1.0 topaba los clips en 10 s. 1.5 sube ese tope a 15 s, y admite cualquier duración entera de 1 a 15. Los cinco segundos extra suenan menores. En la práctica son la diferencia entre un clip social que necesita una pasada de Extend y uno que se publica con la primera generación.

Las cuentas de créditos cambian de forma apreciable en los casos de uso estándar:

Caso de uso1.0 (máx. 10 s + Extend hasta 15 s)1.5 (15 s nativos)
TikTok de 15 s, 480p100 (10 s) + 75 (extender 5 s) = 175150
TikTok de 15 s, 720p150 (10 s) + 112.5 (extender 5 s) = 262.5225
Plano de producto de 10 s, 720p150150 (sin cambios)

Para el formato social más común —un clip de 15 s—, 1.5 cuesta alrededor de un 14 % menos en 480p y un 14 % menos en 720p frente al enfoque de generar y después extender de 1.0, y además te ahorras el artefacto de costura que a veces aparece en el punto de unión.

El modo Extend sigue disponible en 1.5 para pasar de los 15 s, pero ahora pagas costos de extensión solo sobre material que de verdad necesita más duración, y no porque la generación base te haya forzado un corte.

Cambio 3: exactitud del rostro y consistencia de personaje

Este es el cambio más difícil de cuantificar y el más mencionado de forma consistente en los comentarios de la comunidad. Grok Imagine 1.0 podía generar un rostro convincente en el primer fotograma y perderlo: rasgos que se transformaban entre fotogramas, sobre todo en giros de cabeza, transiciones de luz o movimiento rápido. Los personajes introducidos por el modo Reference derivaban en proporciones faciales a lo largo de clips más largos.

1.5 ataca esto a nivel de arquitectura. La generación secuencial de fotogramas del motor Aurora —donde cada fotograma se informa del anterior— ahora preserva los puntos de referencia faciales de forma más estable entre rotaciones y cambios de luz. El patrón en los comentarios de la comunidad es consistente: giros de rostro que antes producían una transformación inquietante ahora se completan limpios a velocidad de reproducción normal.

Antes y después con un solo prompt del modo Reference: "[@Image1] walks toward the camera through a fog-filled alley, face clearly visible, turns slightly right at 8 seconds, warm streetlight from above."

  • 1.0: el sujeto mantenía una identidad consistente durante la caminata y después el giro a la derecha producía un cambio notable de ancho de mandíbula en el fotograma medio del giro, que volvía de golpe al resolverse.
  • 1.5: el mismo giro se completa sin ese artefacto de corrección. Las proporciones de mandíbula y pómulos se sostienen a lo largo de la rotación.

Esto importa sobre todo en cualquier caso de uso donde el rostro de un personaje es el sujeto principal: contenido de busto parlante, narrativas centradas en personajes, demos de producto con vocero y cualquier clip que use el modo Reference para anclar una identidad consistente entre varios planos.

Consejo

La consistencia de personaje se acumula a lo largo del modo Extend. En 1.5, un clip extendido preserva la estabilidad de puntos faciales establecida en la generación original. La costura donde se une la extensión es menos detectable que en 1.0 porque ahora los dos segmentos comparten la misma geometría facial de base.

Cambio 4: Extend from Frame, encadenar clips hasta duración de cortometraje

El modo Extend en 1.0 agregaba fotogramas al final de un clip, pero la superficie de control era limitada: le entregabas un clip al modelo y le pedías que continuara. En 1.5, Extend from Frame suma selección explícita de fotograma: eliges el fotograma final exacto desde el que quieres continuar y el modelo retoma desde ese estado visual preciso, con la misma posición del sujeto, la misma dirección de la luz, la misma trayectoria de cámara y las mismas condiciones atmosféricas.

La diferencia importa cuando una generación produce el arranque y el medio correctos, pero los fotogramas finales se apartan de tu intención. En 1.0, un fotograma final imperfecto significaba aceptarlo como semilla de la extensión o volver a tirar el clip entero. En 1.5, puedes elegir un fotograma anterior de la generación —ese momento de composición más limpio desde el que en realidad querías continuar— y extender desde ahí.

El flujo práctico para producciones más largas:

  1. Genera un segmento de apertura de 15 s. Revísalo e identifica el mejor fotograma de cierre.
  2. Usa Extend from Frame, elige ese fotograma y genera los siguientes 15 s.
  3. Repite hasta llegar a la duración que necesitas.

Una cadena de tres segmentos de 15 s cada uno produce 45 s de metraje con el personaje, la luz y el estado de cámara preservados en las uniones. Alcanza para una demo de producto, un anuncio corto o una secuencia narrativa de apertura, con un modelo que cobra por segundo a 10–15 créditos.

Nota

El modo Extend en OmniArt funciona con varios modelos, no solo con Grok Imagine. Puedes generar la apertura con otro modelo y usar Extend from Frame de Grok Imagine 1.5 para continuarla, llevando las mejoras de consistencia de personaje a metraje que se originó en otra parte.

A qué corresponden en realidad esos +52 Elo

La distancia en la arena se descompone en estos cuatro cambios, ponderados por cuánto aparece cada uno en la producción cotidiana:

CambioImpacto en el EloDónde se nota
Naturalidad del audioAltoCualquier clip con diálogo o ambiente por capas
15 s nativosModeradoFormatos sociales de 15 s; flujos que dependían de Extend
Consistencia facialAltoBustos parlantes, personajes con modo Reference, giros de cabeza
Extend from FrameModeradoProducciones de varios segmentos, clips encadenados

La arena evalúa específicamente imagen a video: se anima una foto fija de entrada. En ese contexto, la consistencia facial y la naturalidad del audio son las dos cualidades que más notan quienes votan a ciegas, lo que explica de dónde salió el grueso de la ganancia de Elo. La duración y Extend from Frame importan más a usuarios con experiencia que arman proyectos de varios planos que a quien vota a ciegas mirando un clip de 5 s.

¿Deberías volver a generar tus proyectos de 1.0?

La versión corta: sí para cualquier proyecto donde el rostro era el sujeto principal, y sí para todo lo que armaste con el patrón de generar y después extender para llegar a 15 s. Para el resto, la decisión depende del proyecto.

Vuelve a generar ahora si:

  • Produjiste clips de busto parlante o centrados en personajes en 1.0 y notaste deriva del rostro a mitad de clip. Las mismas entradas del modo Reference deberían dar resultados notablemente más limpios en 1.5.
  • Armaste clips de 15 s como 10 s + extensión de 5 s y te encontraste con artefactos de costura. La generación nativa de 15 s de 1.5 elimina el punto de unión.
  • El audio era el último obstáculo en un clip que por lo demás estaba casi listo. La entonación natural y el ambiente por capas de 1.5 resuelven las quejas más comunes sin volver a escribir el prompt del lado visual.

No vale la pena volver a generar si:

  • El clip era solo movimiento, sin personajes ni diálogo: el techo de calidad visual en 720p no cambió, y las mejoras de comportamiento de Extend son marginales para una salida de un solo segmento.
  • Usas mucho el modo Modify: Modify sigue reescalando automáticamente cualquier entrada por encima de 854×480 a 480p antes de procesar, y ese comportamiento no cambia en 1.5.
  • El original era un plano de recurso atmosférico corto (menos de 8 s) sin personajes. La mejora del audio ambiental es real, pero difícilmente justifique una regeneración al precio actual en créditos.

Advertencia

El límite de reescalado a 480p del modo Modify no cambia en 1.5. Si necesitas editar un clip de 720p sin perder resolución, haz la pasada de Modify antes de tu generación final en 720p, no después.

Empezar en OmniArt

Grok Imagine 1.5 está disponible en el espacio de video de OmniArt junto a V6, BACH, Sora 2, Veo 3, Kling 3.0, HappyHorse 1.0 y Seedance 2.0. No hace falta una suscripción aparte a xAI: el mismo saldo de créditos de OmniArt cubre todos los modelos.

La forma más rápida de calibrar 1.5 es correr un prompt que ya conoces de 1.0. Misma entrada, salidas lado a lado, con las mejoras de rostro y audio inmediatamente visibles contra tu línea base. Empieza por ahí y después decide qué proyectos de 1.0 mueven de verdad la aguja como para regenerarlos.

Para el desglose completo de los seis modos, las cuentas de créditos y los patrones de prompt del modo Reference, lee la guía de Grok Imagine. Para una comparación entre modelos donde el puesto de Grok Imagine en imagen a video se ubica dentro del panorama más amplio de 2026, la lista corta de los mejores modelos de imagen a video tiene los rankings actuales.

¿Todo listo para crear?

Empieza a generar contenido increíble con IA

Empezar gratis