Grok Imagine: de makersgids voor het videomodel van xAI in 2026
Een praktische gids voor Grok Imagine — zes generatiemodi, promptpatronen, echte rekensommen in credits, en wanneer je het boven V6 of Sora 2 kiest in 2026.

Grok Imagine is het video- en audiogeneratiemodel van xAI, gelanceerd in januari 2026 en bereikbaar via OmniArt zonder een apart abonnement bij xAI. Het is een ander product dan de Grok-chatbot — ze delen een naam en verder niets. Deze gids behandelt waar Grok Imagine voor gebouwd is, de zes generatiemodi die ertoe doen, promptpatronen die elke modus recht doen, en de rekensom van wat echte projecten werkelijk kosten in credits.
Wat Grok Imagine is
Grok Imagine genereert video tot 720p met native audio in clips van 1 tot 15 seconden. De belangrijkste truc is niet de resolutie — op 720p gaat het bewust de strijd om pure scherpte met Sora 2 of V6 niet aan. De belangrijkste truc is de werkomgeving rond het model: zes generatiemodi die één gewichtenset delen en waarmee je kunt genereren, verlengen, herstileren en aanpassen zonder het model te verlaten.
| Specificatie | Waarde |
|---|---|
| Maximale resolutie | 720p (gebruik V6 voor 1080p en hoger) |
| Maximale duur | 15 seconden per generatie |
| Beeldverhoudingen | 16:9, 4:3, 1:1, 9:16, 3:4, 3:2, 2:3 |
| Audio | Native, samen met de video gegenereerd |
| Kosten (480p) | 10 credits per seconde |
| Kosten (720p) | 15 credits per seconde |
De zes modi die je moet kennen
Elke modus is een andere manier om het model te vertellen wat voor invoer het voor zich heeft. De juiste modus kiezen is het grootste deel van het promptwerk.
Text-to-Video
De standaard. Je schrijft een prompt, je krijgt een clip. Het best voor conceptverkenning, moodboards en socialschetsen waarvoor je nog geen referentieafbeelding hebt. De kosten zijn 10 tot 15 credits per seconde, afhankelijk van de resolutie.
Image-to-Video
Animeert een stilstaand beeld en behoudt de compositie van de invoer. Het eerste frame ligt vast op jouw afbeelding. Gebruik dit voor het animeren van illustraties, productfotografie en ontwerpmockups waarbij het bronframe niet onderhandelbaar is.
Reference Mode — het onderscheidende punt
Reference Mode accepteert 1 tot 7 afbeeldingen als visuele ankers zonder het eerste frame vast te zetten. Je labelt afbeeldingen met @Image1, @Image2, @Image3 en verwijst er in de prompt naar. Dit is wat de meeste andere videomodellen niet hebben — die zetten óf het eerste frame vast (image-to-video) óf accepteren helemaal geen referentie (text-to-video). Reference Mode zit ertussenin, en het is de schoonste route naar een consistent personage over meerdere shots.
De kosten zijn 15 credits per seconde op 480p en 22,5 op 720p.
Extend Mode
Plakt 2 tot 10 seconden achter een bestaande clip. De invoer is een MP4 van 2 tot 15 seconden. De uitvoer is één doorlopende clip; er wordt alleen voor het toegevoegde deel afgerekend. De truc over modellen heen: Extend Mode werkt op video’s die door elk model in de videowerkruimte van OmniArt zijn gemaakt, niet alleen op die van Grok.
Modify Mode
Bewerkt een bestaande clip zonder hem opnieuw te genereren — achtergronden wisselen, licht veranderen, kleuren op specifieke objecten verschuiven, weereffecten. De invoer is begrensd op 8 seconden en wordt automatisch geschaald naar 854×480, wat betekent dat bronnen met hoge resolutie detail verliezen in de rondgang. Gebruik Modify op clips die je toch al op 480p genereerde.
Editing Suite — Restyle, Object Manipulation, Sketches to Life
Een verzameling bewerkingen na de generatie. Restyle past artistieke stijlen toe (Cyberpunk, Anime, Retro, Origami, Watercolor, Mosaic). Object Manipulation voegt elementen toe, verwijdert ze of wisselt ze om. Sketches to Life animeert lijntekeningen. Add Performance ent personageanimatie op statische figuren. Handig om meerdere varianten uit één bronclip te maken.
Prompts die het model recht doen
Vier gewoonten tillen de kwaliteit sneller op dan langere prompts.
Gebruik filmische taal
Grok Imagine heeft zes ingebouwde camerapresets: Zoom In, Zoom Out, Dolly Out, Tilt Up, Pan Right en Timelapse. Ze slaan preciezer aan als de prompt cameratermen gebruikt.
| Zwakker | Sterker |
|---|---|
| "A city street at night with neon signs and people walking" | "Dolly forward through a rain-slicked Tokyo alley, neon signs reflecting in puddles, shallow depth of field, a figure with an umbrella enters frame right, cinematic 2.39:1 framing" |
Label je referenties expliciet
Reference Mode zakt in als de prompt algemeen blijft. Bind elke referentie aan een rol.
"@Image1 (the red sports car) drifts around a mountain corner with @Image3 (the sunset sky) in the background while @Image2 (the driver character) grips the steering wheel."
Zet de actie vooraan
De generatie loopt sequentieel door de duur heen. Zit de climax aan het eind van een clip van 5 seconden, dan maakt het model die misschien niet af. Haal de actie naar voren.
| Zwakker | Sterker |
|---|---|
| "A quiet forest scene with birds, then suddenly a deer leaps across a stream" | "A deer leaps across a forest stream in golden hour light, camera tracking its arc, birds scatter from nearby branches" |
Geef clips van 10 tot 15 seconden een tijdlijn
Schrijf voor langere clips de timing in de prompt.
"Slow zoom into abandoned library (0–5s), dust particles catch light beams (5–10s), book falls from shelf (10–12s), pages flutter (12–15s)."
Wat het echt kost
Drie shotscenario’s uit de praktijk, geprijsd in OmniArt-credits.
Een TikTok-productvideo van 15 seconden
| Stap | Modus | Resolutie | Kosten |
|---|---|---|---|
| Eerste generatie | Text-to-Video | 480p, 10s | 100 |
| Verlengen | Extend | 480p, 5s | 75 |
| Totaal (één revisie) | 175–275 |
Een merkstoryboard van drie shots
| Stap | Modus | Resolutie | Kosten |
|---|---|---|---|
| Shot 1 met 2 referenties | Reference, 8s | 720p | 180 |
| Shot 2, dezelfde referenties | Reference, 8s | 720p | 180 |
| Shot 3, dezelfde referenties | Reference, 6s | 720p | 135 |
| Lichtcorrectie op shot 2 | Modify, 8s | 720p | 180 |
| Totaal | 675 |
Eén restyleronde
| Stap | Modus | Resolutie | Kosten |
|---|---|---|---|
| Restyle naar Anime | Restyle, 8s | 480p | 120 |
Wanneer je een ander model kiest
Grok Imagine is het juiste gereedschap voor korte social content, werk van schets naar beeld en referentiegestuurde multi-shot-verhalen op 480p tot 720p. Het is het verkeerde gereedschap als:
| Wat je nodig hebt | Betere keuze |
|---|---|
| 1080p of hoger | V6, BACH, Veo 3 |
| Geavanceerde lenscontrole (brandpuntsafstand, scherptediepte, aberratie) | V6 |
| Clips van 16 tot 20 seconden in één keer | Sora 2 |
| Dialoog en muziek op productieniveau | Een apart audiomodel plus montage |
| Behoud van een bron met hoge resolutie bij bewerkingen | Vermijd Modify Mode |
Workflowpatronen die het halen
Grok Imagine betaalt zich op OmniArt niet terug als losse generator — maar als de laag waarin je itereert. Twee patronen leveren het meeste op.
Patroon 1 — genereer elders, verfijn hier. Render de masterclip met V6 of Sora 2 op hogere resolutie en gebruik daarna Extend, Restyle en Modify om er in Grok goedkoper varianten en aanvullingen omheen te draaien.
Patroon 2 — Reference Mode om een personage vast te zetten. Heeft een merkcampagne hetzelfde personage in vijf shots nodig, zet de identiteit dan vast met één ankerafbeelding in @Image1 en genereer daarna elk shot met dezelfde referentie in Reference Mode. Goedkoper dan Sora 2 voor elk shot opnieuw draaien.
Waarschuwing
Modify Mode schaalt elke invoer boven 854×480 automatisch terug naar 480p voordat hij die verwerkt. Moet je een clip van 1080p bewerken zonder resolutie te verliezen, doe de bewerking dan elders of vóór de opschaalstap.
Aan de slag op OmniArt
Grok Imagine staat in de videowerkruimte van OmniArt naast V6, BACH, Sora 2, Veo 3, Kling 3.0, HappyHorse 1.0 en Seedance 2.0. Hetzelfde tegoed, dezelfde referentie-upload, dezelfde promptgrammatica. Begin in Text-to-Video om de camerapresets te leren kennen en stap over op Reference Mode zodra je een personage of product hebt om vast te zetten.
Combineer deze gids met de analyse van BACH als cameraman voor verhalend werk met hogere beeldkwaliteit, of met de shortlist voor beeld-naar-video als je voor een specifiek shot tussen modellen kiest.
Klaar om te maken?
Ga aan de slag en genereer content met AI