Grok Imagine 1.5 versus 1.0: wat die +52 Elo echt verandert
Grok Imagine 1.5 van xAI sprong +52 Elo boven 1.0 en staat nu op 1 in de Image-to-Video Arena. We splitsen die winst op in vier veranderingen die makers merken — native audio, clips van 15 seconden, consistente gezichten en Extend from Frame — met vergelijkingen binnen OmniArt.

Grok Imagine 1.5 is uit als preview-update en het verschil is meetbaar: +52 Elo boven 1.0, waarmee het in blinde gebruikerstests naar de top van de Image-to-Video Arena springt, vóór Seedance 2.0, HappyHorse 1.0 en Google Veo. Een sprong van 52 punten in een volwassen ranglijst is een serieus signaal — dat komt neer op ongeveer 57% winst voor 1.5 in blinde tests rechtstreeks tegen 1.0.
Het getal is de kop. Voor productiewerk telt welke concrete veranderingen erachter zitten. We draaien 1.5 naast 1.0 in de videowerkruimte van OmniArt, en de winst is netjes terug te voeren op vier dingen die makers meteen merken. Subtiel is geen van vieren.
Ben je nieuw bij Grok Imagine, begin dan eerst bij de basisgids — die behandelt de zes generatiemodi, promptpatronen en de creditberekening in detail. Dit stuk gaat ervan uit dat je met 1.0 al een paar clips hebt opgeleverd en wil weten wat het opnieuw draaien waard is.
Snelle vergelijking van specificaties: 1.0 versus 1.5
| Specificatie | Grok Imagine 1.0 | Grok Imagine 1.5 |
|---|---|---|
| Maximale resolutie | 720p | 720p |
| Maximale duur | 10 seconden | 15 seconden |
| Beeldverhoudingen | 16:9, 4:3, 1:1, 9:16, 3:4, 3:2, 2:3 | 16:9, 4:3, 1:1, 9:16, 3:4, 3:2, 2:3 |
| Audio | Native, samen gegenereerd | Native, samen gegenereerd — verbeterd |
| Consistentie van gezichten | Uitgangspunt | Merkbaar verbeterd |
| Extend from Frame | Voortzetting vanaf het eindframe | Expliciete framekeuze, betere continuïteit |
| Basis voor beeldgeneratie | FLUX.1 (Black Forest Labs) | FLUX.1 (Black Forest Labs) |
| Kosten (480p) | 10 credits per seconde | 10 credits per seconde |
| Kosten (720p) | 15 credits per seconde | 15 credits per seconde |
| Positie in de arena | Meerdere plaatsen onder nummer 1 | Nummer 1 in de Image-to-Video Arena |
Het resolutieplafond en de creditprijs zijn onveranderd. De winst zit in wat het model binnen die grenzen doet.
Verandering 1: native audio klinkt nu als één doorloop
Grok Imagine genereert al sinds 1.0 audio — dialoog, lipsync, geluidseffecten en sfeermuziek, allemaal opgebouwd uit videotokens in één doorloop, zonder dat er achteraf een apart audiomodel aan wordt geplakt. In de praktijk had de audio van 1.0 twee vaste zwakke plekken: mechanische timing op dialoog (woorden kwamen op gelijke afstanden, met pauzes op grammaticale grenzen in plaats van op natuurlijke ademmomenten) en vlakke omgevingsklank (een caféscène met één ongedifferentieerd achtergrondgeroezemoes, zonder ruimtelijke variatie).
1.5 pakt allebei aan. Dezelfde architectuur van één doorloop levert nu intonatie op zinsniveau — kortere, kernachtige zinnen landen met een dalende toon, langere uitleg heeft hoorbaar een stijging halverwege de zin vóór de afronding. De omgevingsklank voelt gelaagd: een straatscène genereert verkeer in de verte, voetstappen dichtbij en een gedempte winkeldeur achter het onderwerp. Die zijn niet nabewerkt; ze worden gegenereerd met dezelfde opeenvolgende logica per frame die de Aurora-engine voor beweging gebruikt, waarbij elk frame het volgende informeert en de akoestische omgeving de visuele baan volgt.
Prompt in 1.0: "A barista explains the brewing process to a customer across the counter, coffee shop background, warm lighting."
- Resultaat in 1.0: de dialoog kwam in metronoomachtige stoten, de espressomachine draaide de hele clip op één constant niveau.
- Resultaat in 1.5: de uitleg van de barista heeft natuurlijke pauzes midden in de zin, de espressomachine zwelt aan als er een nieuwe bestelling begint, en het gemompelde antwoord van de klant klinkt zachter en ruimtelijk verder van de dominante microfoonas.
Het verschil is het duidelijkst bij clips met veel dialoog. Stuurde je video uit Grok 1.0 door een apart audiomodel voor stemwerk, dan dicht 1.5 dat gat grotendeels native.
Verandering 2: 10 seconden wordt 15 seconden
Grok Imagine 1.0 begrensde clips op 10 seconden. 1.5 tilt dat naar 15 seconden, met elke hele duur van 1 tot 15 seconden. Die extra vijf seconden klinken klein. In de praktijk is het het verschil tussen een socialclip die één Extend-ronde nodig heeft en een clip die bij de eerste generatie af is.
De creditberekening verandert merkbaar voor standaardgebruik:
| Toepassing | 1.0 (max. 10 s + Extend tot 15 s) | 1.5 (15 s native) |
|---|---|---|
| 15 s TikTok, 480p | 100 (10 s) + 75 (5 s extend) = 175 | 150 |
| 15 s TikTok, 720p | 150 (10 s) + 112,5 (5 s extend) = 262,5 | 225 |
| Productshot van 10 s, 720p | 150 | 150 (onveranderd) |
Voor het meest voorkomende socialformat — een clip van 15 seconden — kost 1.5 zo’n 14% minder in 480p en 14% minder in 720p vergeleken met de aanpak van genereren en daarna verlengen in 1.0, en je slaat het naadartefact over dat soms op het verlengpunt opduikt.
De Extend-modus zelf zit nog steeds in 1.5 om voorbij 15 seconden te gaan, maar je betaalt alleen verlengingskosten voor beeld dat echt meer speeltijd nodig heeft, en niet omdat de basisgeneratie een snede afdwong.
Verandering 3: gezichtsgetrouwheid en consistente personages
Dit is de verandering die het lastigst te kwantificeren is en die in de reacties uit de community het consequentst wordt genoemd. Grok Imagine 1.0 kon in het openingsframe een overtuigend gezicht genereren en het daarna kwijtraken — trekken vervormden tussen frames, vooral bij hoofdbewegingen, wisselend licht of snelle beweging. Personages die via de Reference-modus binnenkwamen, dreven in langere clips af in gezichtsverhoudingen.
1.5 pakt dat op architectuurniveau aan. De opeenvolgende framegeneratie van de Aurora-engine — waarbij elk frame door het vorige wordt geïnformeerd — houdt gezichtskenmerken nu stabieler vast bij rotaties en wisselend licht. Het patroon in de reacties uit de community is eenduidig: hoofdbewegingen die eerder een griezelige vervorming opleverden, lopen nu op normale afspeelsnelheid netjes door.
Voor en na op één prompt in de Reference-modus: "[@Image1] walks toward the camera through a fog-filled alley, face clearly visible, turns slightly right at 8 seconds, warm streetlight from above."
- 1.0: het onderwerp hield tijdens het lopen een consistente identiteit vast, maar de draai naar rechts leverde halverwege een duidelijke verschuiving in kaakbreedte op die bij het uitdraaien terugsprong.
- 1.5: dezelfde draai loopt zonder dat correctieartefact. De verhoudingen van kaak en jukbeen houden door de hele rotatie stand.
Dit telt het zwaarst bij elke toepassing waarin het gezicht van een personage het hoofdonderwerp is — pratende koppen, verhalen die op personages leunen, productdemo’s met een woordvoerder, en elke clip die de Reference-modus gebruikt om één identiteit over meerdere shots vast te houden.
Tip
Consistente personages stapelen zich op door de Extend-modus heen. In 1.5 behoudt een verlengde clip de stabiliteit van de gezichtskenmerken die in de oorspronkelijke generatie is vastgelegd. De naad waar de verlenging aansluit, valt minder op dan in 1.0, omdat beide segmenten nu dezelfde basisgeometrie voor het gezicht delen.
Verandering 4: Extend from Frame — clips aaneenrijgen tot kortfilmlengte
De Extend-modus in 1.0 plakte frames aan het einde van een clip, maar de bediening was beperkt: je gaf het model een clip en vroeg om verder te gaan. In 1.5 voegt Extend from Frame een expliciete framekeuze toe — je kiest precies het eindframe waarvandaan je verder wilt, en het model hervat vanuit die exacte visuele toestand: dezelfde positie van het onderwerp, dezelfde lichtrichting, dezelfde camerabaan, dezelfde atmosferische condities.
Dat verschil telt wanneer een generatie de juiste opening en het juiste midden oplevert, maar de laatste frames van je bedoeling afdrijven. In 1.0 betekende een niet-kloppend eindframe dat je het als startpunt voor de verlenging accepteerde of de hele clip opnieuw draaide. In 1.5 kun je een frame van eerder in de generatie kiezen — het schonere moment in de compositie waarvandaan je eigenlijk verder wilde — en daarvandaan verlengen.
De praktische workflow voor langere producties:
- Genereer een openingssegment van 15 seconden. Bekijk het en zoek het beste slotframe.
- Gebruik Extend from Frame, kies dat frame en genereer de volgende 15 seconden.
- Herhaal tot je de speeltijd hebt die je nodig hebt.
Een keten van drie segmenten van elk 15 seconden levert 45 seconden beeld op waarin personage, licht en camerastand over de naden heen behouden blijven. Dat is genoeg voor een productdemo, een korte advertentie of een verhalende openingssequentie — uit een model dat per seconde afrekent tegen 10 tot 15 credits.
Let op
De Extend-modus in OmniArt werkt over modellen heen, niet alleen bij Grok Imagine. Je kunt de opening met een ander model genereren en die met Extend from Frame van Grok Imagine 1.5 voortzetten, waardoor de verbeteringen in personageconsistentie ook terechtkomen bij beeld dat elders is ontstaan.
Waar die +52 Elo werkelijk op neerkomt
Het gat in de arena valt uiteen in deze vier veranderingen, gewogen naar hoe vaak elk daarvan in dagelijks productiewerk opduikt:
| Verandering | Effect op Elo | Waar je het merkt |
|---|---|---|
| Natuurlijkheid van de audio | Hoog | Elke clip met dialoog of gelaagde omgevingsklank |
| Native duur van 15 s | Gemiddeld | Socialformats van 15 seconden; workflows die op Extend leunen |
| Consistente gezichten | Hoog | Pratende koppen, personagewerk in de Reference-modus, hoofdbewegingen |
| Extend from Frame | Gemiddeld | Producties met meerdere segmenten, aaneengeregen clips |
De arena test specifiek beeld naar video — een ingevoerde still wordt in beweging gebracht. In die context zijn consistente gezichten en natuurlijke audio de twee eigenschappen die blinde stemmers het sterkst opmerken, en dat verklaart waar het grootste deel van de Elo-winst vandaan komt. Duur en Extend from Frame tellen zwaarder voor ervaren gebruikers die multi-shot-projecten bouwen dan voor de blinde stemmer die naar een clip van 5 seconden kijkt.
Moet je je projecten uit 1.0 opnieuw draaien?
Kort gezegd: ja voor elk project waarin het gezicht het hoofdonderwerp was, en ja voor alles wat je met het patroon van genereren en daarna verlengen op 15 seconden hebt gebracht. Voor de rest hangt de afweging van het project af.
Nu opnieuw draaien als:
- Je in 1.0 clips met pratende koppen of personages maakte en halverwege drift in het gezicht zag. Dezelfde invoer in de Reference-modus zou in 1.5 merkbaar schonere resultaten moeten geven.
- Je clips van 15 seconden bouwde als 10 s plus 5 s verlenging en tegen naadartefacten aanliep. De native generatie van 15 seconden in 1.5 haalt het aansluitpunt weg.
- Audio het laatste struikelblok was op een clip die verder bijna af was. De natuurlijke intonatie en gelaagde omgevingsklank van 1.5 lossen de meestgehoorde klachten op zonder dat je de beeldkant opnieuw hoeft te prompten.
Niet de moeite waard als:
- De clip alleen beweging was, zonder personages of dialoog — het kwaliteitsplafond in 720p is niet veranderd en de verbeteringen in Extend-gedrag zijn marginaal voor uitvoer uit één segment.
- Je veel met de Modify-modus werkt — Modify schaalt elke invoer boven 854×480 nog altijd automatisch terug naar 480p vóór de verwerking, en dat gedrag is in 1.5 onveranderd.
- Het origineel een kort sfeerbeeld was (onder 8 seconden) zonder personages. De verbeterde omgevingsklank is echt, maar rechtvaardigt bij de huidige creditprijs zelden een nieuwe generatie.
Waarschuwing
De grens waarbij de Modify-modus naar 480p terugschaalt, is in 1.5 onveranderd. Moet je een clip van 720p bewerken zonder resolutieverlies, doe de Modify-ronde dan vóór je uiteindelijke generatie in 720p, niet erna.
Beginnen op OmniArt
Grok Imagine 1.5 is beschikbaar in de videowerkruimte van OmniArt, naast V6, BACH, Sora 2, Veo 3, Kling 3.0, HappyHorse 1.0 en Seedance 2.0. Een apart abonnement bij xAI is niet nodig — hetzelfde credittegoed van OmniArt dekt alle modellen.
De snelste manier om 1.5 te ijken is een prompt draaien die je uit 1.0 al kent. Dezelfde invoer, de resultaten naast elkaar, met de verbeteringen in gezicht en audio meteen zichtbaar tegen je eigen uitgangspunt. Begin daar en bepaal daarna welke projecten uit 1.0 echt genoeg opleveren om opnieuw te draaien.
Voor de volledige uitleg van de zes modi, de creditberekening en de promptpatronen voor de Reference-modus, lees je de gids voor Grok Imagine. Wil je zien waar de positie van Grok Imagine bij beeld naar video in het bredere landschap van 2026 past, dan staan de actuele ranglijsten in de shortlist van de beste modellen voor beeld naar video.
Klaar om te maken?
Ga aan de slag en genereer content met AI