GuideModellen en inzichten10 min lezen

Native audio in één doorloop: dialoog, lipsync en sfeergeluid in Grok Imagine 1.5

Grok Imagine 1.5 genereert audio- en videotokens in één inferentiedoorloop — dialoog, lipsync, geluidseffecten en sfeermuziek samen. Hoe je sounddesign in je prompt regisseert, met drie uitgewerkte scènes in OmniArt.

OmniArt-team
Native audio in één doorloop: dialoog, lipsync en sfeergeluid in Grok Imagine 1.5

De meeste AI-videomodellen genereren stille clips. Je exporteert de video, haalt hem in een DAW of een aparte audiotool, betrekt dialoog, sfeergeluid en muziek bij verschillende aanbieders, legt alles op één lijn en hoopt dat het synchroon blijft. Grok Imagine 1.5 haalt die pipeline weg: audio — dialoog, lipsync, geluidseffecten en sfeerlagen — wordt in dezelfde inferentiedoorloop gegenereerd als de videoframes. Het resultaat is een clip die meteen klinkt zoals hij eruitziet. Deze gids legt uit hoe het mechanisme voor native audio werkt, waar 1.5 beter is dan 1.0, en hoe je geluid zo in je prompt schrijft dat het model die instructies echt gebruikt.

Hoe het genereren van native audio werkt

Gewone AI-videomodellen behandelen geluid als een nabewerkingsstap. Eerst worden de videotokens gegenereerd; daarna draait er een audiomodel over het resultaat, dat probeert aan te sluiten bij wat er al gerenderd is. Omdat de twee doorlopen los van elkaar staan, komen timingfouten vaak voor — een deur die een frame te vroeg dichtslaat, dialoog die op de verkeerde beat ademhaalt, sfeerlagen die niet reageren op wisselingen in de scène.

Grok Imagine 1.5 genereert video- en audiotokens samen in één inferentiedoorloop. Het model ziet de volledige scènecontext — kadrering, beweging van personages, lichtsfeer — terwijl het bepaalt welke geluiden het maakt en wanneer. Lipbewegingen worden gevormd naast de audiogolfvorm in plaats van er achteraf op gelegd. Sfeerlagen reageren op de visuele omgeving die het model aan het bouwen is, en niet op een geëxporteerd frame dat het achteraf moet interpreteren.

Let op

Genereren in één doorloop betekent niet dat de audiogetrouwheid onbeperkt is — clips gaan tot 720p, 24 fps en 1–15 seconden, net als elke andere generatie in Grok Imagine. Wat verandert, is de samenhang tussen wat je ziet en wat je hoort.

Wat er veranderde van 1.0 naar 1.5

Grok Imagine 1.0 had ook native audio, maar de resultaten hadden twee terugkerende problemen. De timing van de dialoog was mechanisch: personages spraken op een metronomisch tempo zonder natuurlijke pauzes, zonder stijgingen en zonder intonatie op zinsniveau. De sfeerlagen waren vlak: een scène in een drukke straat kreeg generiek menigtegeluid, ongeacht de visuele dichtheid, het weer of het tijdstip.

Grok Imagine 1.5 pakt beide aan. De voordracht van de dialoog respecteert nu het ritme van de zin — korte gedachten landen snel, emotionele momenten vertragen licht, vragen krijgen aan het eind een hoorbare stijging. Sfeerlagen reageren op de scène: een nachtmarkt in de stromende regen klinkt anders dan een droge markt op het middaguur, omdat het model de visuele signalen leest die het zelf genereert en de audiomix daarop aanpast.

MogelijkheidGrok Imagine 1.0Grok Imagine 1.5
Timing van de dialoogMechanisch, gelijkmatig tempoNatuurlijke pauzes, intonatie op zinsniveau
LipsyncHerkenbaar maar stijfGesynchroniseerd met de gegenereerde audiogolfvorm
SfeerlagenVlak, los van de scèneReagerend op de scène, gelaagd
GeluidseffectenAanwezig maar te laag gemixtGeïntegreerd met visuele gebeurtenissen
AchtergrondmuziekAf en toe, generiekAutomatische score op basis van sfeer (optioneel)

De ranglijsten van de arena weerspiegelen die verbetering: Grok Imagine 1.5 won +52 Elo ten opzichte van 1.0 en staat op #1 in de Image-to-Video Arena, vóór Seedance 2.0, HappyHorse 1.0 en Google Veo in blinde tests. De Aurora-engine verwerkt frames opeenvolgend, en dat maakt de beweging samenhangend genoeg om de audiodoorloop bruikbare sync te laten opleveren.

Hoe je geluid in een prompt schrijft

Geluidsregie in een prompt in natuurlijke taal volgt een paar vaste patronen. Het model behandelt audiocues als onderdeel van de scènebeschrijving en niet als een apart instructieblok — dus je verweeft geluid met de cinematografie in plaats van het erachteraan te plakken.

Benoem de dialoogregel en de voordracht

Ga er niet van uit dat het model de juiste woorden verzint. Schrijf de regel expliciet uit en zet er een notitie over de voordracht achter.

Zonder geluidsregieMet geluidsregie
"A barista talking to a customer""A barista says 'Your order will be about five minutes' with a warm, unhurried delivery; ambient café noise underneath"

Notities over de voordracht die goed werken: warm, urgent, flat and tired, slightly breathless, quiet but firm. Eén bijvoeglijk naamwoord is meestal genoeg. Twee of meer gaan met elkaar botsen.

Benoem de sfeerlagen expliciet

Als je het sfeergeluid niet specificeert, kiest het model iets generieks. Lagen benoemen — inclusief de onderlinge niveaus — geeft het model een doel om op te mikken.

"Close-up of a chef plating a dish: the sizzle of the pan in the background, quiet kitchen ventilation, the clink of a spoon on porcelain, no music."

De zinsnede no music is nuttig als je wilt dat de scène alleen op geluidseffecten en ruimtetoon draait. Zonder die zinsnede kan het model er een lichte score aan toevoegen.

Beschrijf tempo en pauzes

Pauzes zijn audiogebeurtenissen. Als een personage aarzelt voordat het antwoordt, of als je twee tellen stilte nodig hebt voordat een geluidseffect landt, zeg dat dan.

"She looks at the letter, two seconds of silence, then exhales sharply."

Bepaal of je automatisch laat scoren of het inperkt

Als je muziek niet noemt, kan Grok Imagine 1.5 de clip automatisch scoren met een cue die bij de sfeer past — lichte strijkers bij een emotionele scène, een stuwend ritme bij actie. Dat werkt prima voor snelle schetsen voor social. Voor precies werk — als je stilte wilt, een specifiek genre, of een beat die op een cut landt — perk je het expliciet in: noem het genre, het tempogevoel, of schrijf no background music om het uit te zetten.

Tip

Eén samenhangende klanksfeer per clip. Vraag niet om “energetic upbeat music but also quiet and contemplative”. Het model kiest er één, en dat wordt niet wat jij voor ogen had.

Drie uitgewerkte scènes

Deze voorbeelden laten het volledige promptpatroon in de praktijk zien. Elk voorbeeld bevat de visuele opzet, de geluidsregie en wat de native audiodoorloop oplevert.

Scène 1: dialoogclose-up met lipsync

Briefing: een personage spreekt één regel naar de camera. Het shot heeft schone lipsync en een natuurlijke voordracht nodig, geen los aangeleverde voice-overtrack.

Prompt:

"Medium close-up of a woman in her late 30s at a kitchen table, morning light from a window to her left. She looks directly at camera and says 'I didn't think it would take this long' with a tired, honest delivery — slight pause after 'think', voice dropping at the end. Background: low refrigerator hum, no music."

Wat je kunt verwachten: het model genereert de dialoogaudio en de mondbewegingen in dezelfde doorloop. De pauze midden in de zin vormt zowel de audiogolfvorm als de zichtbare lipbeweging. Het brommen van de koelkast zit op een laag niveau onder de dialoog zonder ermee te concurreren.

Knoppen om aan te draaien: is de voordracht te vlak, voeg dan emotional weight toe aan de notitie over de voordracht. Is het brommen te prominent, zet er dan barely audible voor.


Scène 2: gelaagde sfeeromgeving

Briefing: een nachtmarkt in de stromende regen — geen dialoog, pure sfeer. De audio moet gelaagd en fysiek aanwezig aanvoelen, niet als één geluidsbestand in een loop.

Prompt:

"Slow dolly through a busy night market in heavy rain. Neon signs reflecting in puddles, steam rising from food stalls. Audio layers: heavy rain on canvas awnings (top layer), sizzling woks from nearby stalls, muffled crowd chatter in the distance, no music. Quiet enough to feel intimate, not overwhelming."

Wat je kunt verwachten: omdat het model de visuele scène opbouwt — luifels, kraampjes, de dichtheid van de menigte — kan het in de audiodoorloop op die elementen reageren. Het sissen van kraampjes die in beeld staan, klinkt doorgaans luider dan menigtegeluid dat ruimtelijk verder naar achteren is geplaatst.

Knoppen om aan te draaien: voeg close-mic'd rain drops toe voor meer textuur. Noem a distant vendor calling out om een verhalend audio-element toe te voegen zonder formele dialoog.

Waarschuwing

Clips duren 1–15 seconden. Een sfeerscène met veel lagen werkt het best op 8–12 seconden — lang genoeg om het model de lagen te laten neerzetten voordat de clip eindigt. Heel korte clips (2–4 seconden) renderen mogelijk alleen de dominante laag.

Scène 3: een beat gedreven door muziek

Briefing: de beweging van een danser moet synchroon lopen met een specifiek ritmisch gevoel — niet toevallig, maar als het centrale ontwerp van de clip.

Prompt:

"Slow-motion close-up of a dancer's feet hitting a wooden floor in a dark studio, single overhead spotlight. Each footfall lands on a beat. Audio: driving minimal techno at roughly 120 BPM, the impact of each footfall mixed into the beat so the physical sound and the music feel like the same event. No ambient room noise — tight, dry acoustics."

Wat je kunt verwachten: het model genereert de muziek en behandelt de voetinslagen als ritmische audiogebeurtenissen daarbinnen. Omdat beweging en audio samen worden gegenereerd, heeft de visuele timing van elke inslag meer kans om op de beat te vallen dan in een workflow met twee doorlopen.

Knoppen om aan te draaien: noem een ander genre — minimal house, orchestral percussion, hip-hop at 90 BPM — om het gevoel te verschuiven. Voeg slight room reverb toe als de droge akoestiek te klinisch aanvoelt.


Samenvatting van de beste aanpak

Wat je doetWaarom het uitmaakt
Schrijf dialoogregels letterlijk uitHet model heeft de exacte tekst nodig om de lipsync tegen te genereren
Benoem sfeerlagen explicietGenerieke beschrijvingen leveren generiek geluid op
Gebruik no music als je stilte of alleen effecten wiltVoorkomt dat de automatische score je bedoeling overstemt
Houd één samenhangende klanksfeer aanBotsende geluidsaanwijzingen leveren uitgemiddelde, ongerichte resultaten op
Beschrijf pauzes als audiogebeurtenissenPauzes vormen zowel de golfvorm als de lipbeweging — ze horen bij de sync
Perk muziek in met genre en tempo“Music” zonder regie valt terug op iets generieks

Kosten in OmniArt-credits

Native audio zit erbij zonder extra kosten per seconde — het credittarief is hetzelfde als bij elke andere generatie in Grok Imagine.

ResolutieCredits per seconde
480p10 credits per seconde
720p15 credits per seconde

Een dialoogscène van 10 seconden op 720p kost 150 credits. Een sfeerscène van 12 seconden op 480p kost 120 credits. Als je specifiek aan de geluidsregie zit te sleutelen — notities over de voordracht of beschrijvingen van sfeerlagen aanpassen — begin dan op 480p, wat een derde minder kost, en ga alleen met de take die je wilt houden naar een hogere resolutie.

Aan de slag op OmniArt

Grok Imagine 1.5 is beschikbaar in de videowerkruimte van OmniArt, naast elk ander model in de bibliotheek — hetzelfde tegoed, dezelfde promptinterface, geen apart abonnement bij xAI nodig. De snelste manier om te leren wat native audio kan, is om één regel dialoog in een prompt voor tekst-naar-video te schrijven, te kijken hoe het model ermee omgaat en van daaruit verder te itereren.

Voor het volledige beeld van de generatiemodi van Grok Imagine, de prijzen en wanneer je het boven andere modellen kiest, bekijk je de makersgids voor Grok Imagine. Haal je extra geluidseffecten, sfeergeluid of muziek buiten de videodoorloop vandaan, dan behandelt de gids voor de AI-geluidseffectgenerator de aparte audiomodellen van OmniArt.

Klaar om te maken?

Ga aan de slag en genereer content met AI

Gratis aan de slag