AI-voice-over voor YouTube-video’s: de workflow van een maker
Zet je script met de AI-stemmodellen van OmniArt om in verzorgde YouTube-vertelstem — modelkeuze, meertalige nasynchronisatie, tips voor ritme en een rekenvoorbeeld in credits.

Een verzorgde voice-over betekende vroeger een studio boeken, een stemacteur casten of genoegen nemen met een blikkerige tekst-naar-spraakrobot uit 2012. Geen van die opties schaalt. De AI-stemmodellen op OmniArt geven je vertelstem van studiokwaliteit vanuit een tekstprompt — kies een vooraf ingestelde stem, plak je script en heb binnen enkele seconden een afgerond audiobestand. Deze gids loopt de hele workflow door: een script schrijven voor het oor, het juiste model kiezen, de voordracht sturen en je video afmaken zonder het platform te verlaten.
De korte versie: schrijf korte zinnen, kies een spraakmodel met hoge geluidskwaliteit, genereer in de audiowerkruimte van OmniArt, stuur bij met leestekens en cues in de tekst, en leg de audio daarna onder je beeld. De lange versie staat hieronder.
Stap 1: schrijf het script voor het oor
Een YouTube-script is geen essay. Kijkers kunnen een zin niet teruglezen — ze volgen het of ze volgen het niet. Dat betekent:
- Houd je zinnen kort. Eén idee per zin. Onder de 15 woorden waar dat kan.
- Gebruik wegwijzers. Met “eerst… daarna… tot slot…” houdt de luisteraar bij waar hij is, zonder inhoudsopgave.
- Vermijd ingebedde bijzinnen. “Het model, dat op meertalige data is getraind en tussenwerpsels in de tekst ondersteunt, gaat goed om met toon” is op 1,25× snelheid niet te volgen. Hak die zin in stukken.
- Lees het hardop voor. Als jij struikelt, struikelt het model ook. Herschrijf tot het gesproken natuurlijk loopt.
- Schrijf naar je luisteraar toe, niet over je onderwerp. “Je wilt het HD-model kiezen” komt warmer binnen dan “Makers zouden het HD-model moeten overwegen”.
Een Shorts-script van 1.500 tekens is ruwweg 90 seconden vertelstem. Dat is een bruikbaar ijkpunt.
Stap 2: kies een model
OmniArt geeft je vijf spraakmodellen die op verschillende klussen zijn afgestemd. Kies het model bij de klus, niet bij wat je gewend bent.
| Model | Plan | Tekenlimiet | Kosten | Het best voor |
|---|---|---|---|---|
| MiniMax Speech 2.8 HD | Free | 10.000 tekens | 1 credit per begonnen blok van 50 tekens | Verzorgde vertelstem, lange essays |
| MiniMax Speech 2.8 Turbo | Free | 10.000 tekens | 1 credit per blok van 100 tekens | Snelle schetsen, alternatieve regels testen |
| Eleven Multilingual v2 | Starter | 10.000 tekens | 50 credits per aanvraag | Meertalige nasynchronisatie, gelokaliseerde kanalen |
| Eleven v3 | Starter | 5.000 tekens | 50 credits per aanvraag | Expressieve voordracht met audiotags |
| Eleven Turbo v2.5 | Starter | 40.000 tekens | 100 credits per aanvraag | Volledige videoessays in één keer |
MiniMax Speech 2.8 HD is de standaardkeuze voor verzorgde YouTube-vertelstem. Het scoort hoog in blinde luistervergelijkingen en gaat netjes om met lange content. Gebruik het voor je definitieve takes.
MiniMax Speech 2.8 Turbo halveert de creditkosten en is snel genoeg om in één sessie twintig alternatieve openingen te testen. Schets met Turbo, maak het af met HD.
Eleven Multilingual v2 is het juiste model als je content nasynchroniseert voor een internationaal publiek. Het houdt de voordracht stabiel over talen heen — handig als je gelokaliseerde versies van dezelfde video bouwt.
Eleven v3 ontgrendelt audiotags tussen rechte haken zoals [excited] of [whispers], die de voordracht verder sturen dan leestekens kunnen. Pak dit model als het script een emotioneel bereik vraagt dat de andere modellen niet halen.
Eleven Turbo v2.5 ondersteunt scripts tot 40.000 tekens in één keer — dat is een documentairevertelstem van 45 minuten. Als je videoessay lang uitvalt, is dit het enige model dat het aankan zonder je script in stukken te hakken.
Tip
Stap 3: genereer in de audiowerkruimte
- Open de audiowerkruimte van OmniArt.
- Kies een spraakmodel in de modelkiezer.
- Kies een vooraf ingestelde stem. Beluister er een paar; die keuze is de grootste variabele in hoe het resultaat aanvoelt.
- Plak je script in het promptveld.
- Genereer en luister.
De eerste take is een nulmeting, geen eindversie. Je luistert naar het ritme, de klemtoon en onnatuurlijke pauzes — dat kun je allemaal in de volgende stap verhelpen.
Stap 4: stuur de voordracht bij met leestekens en tussenwerpsels
Er is geen knop “laat dit minder vlak klinken”, maar je kunt het script aanpassen om de voordracht te sturen.
Leestekens bepalen het ritme. Komma’s maken korte beats. Gedachtestreepjes — zoals hier — voegen een halve pauze toe die anders aanvoelt dan een komma. Beletseltekens… roepen aarzeling op. Een punt sluit een gedachte volledig af. Zet ze bewust in, niet grammaticaal.
Vraagtekens roepen vanzelf een stijgende toon op. Als een zin aan het eind moet oplopen, formuleer hem dan als vraag, ook al is de inhoud mededelend: “Vraag je je af welk model je moet gebruiken?” in plaats van “Dit deel behandelt de modelkeuze”.
Hoofdletters geven klemtoon aan. “Dit is BELANGRIJK” of “Je moet de JUISTE stem kiezen” legt in de meeste modellen de nadruk op het woord in hoofdletters. Spaarzaam gebruiken, anders leest het als schreeuwen.
De tussenwerpsels van MiniMax HD laten je halverwege het script emotionele cues invoegen met notatie tussen haakjes: (laughs), (sighs), (clears throat). Die zetten een natuurlijk geluid in vóór de volgende zin.
De audiotags van Eleven v3 gebruiken rechte haken: [excited], [whispers], [dramatic pause]. Zet ze direct vóór de zin waarop ze effect moeten hebben.
Let op
Uitgewerkt voorbeeld: creditkosten van een Shorts-script
Een typische YouTube Shorts-vertelstem is ongeveer 1.500 tekens. Zo werkt de creditberekening op MiniMax Speech 2.8 HD, dat 1 credit per begonnen blok van 50 tekens rekent:
- 1.500 tekens ÷ 50 tekens per blok = 30 blokken
- 30 blokken × 1 credit = 30 credits voor de volledige Shorts-vertelstem
Als je met Turbo schetst (1 credit per blok van 100 tekens), kost datzelfde script 15 credits per schetsronde. Draai tien schetsen, kies de beste en maak het af met HD voor nog eens 30. Totaal: ongeveer 180 credits om één verzorgde vertelstem te vinden en af te maken.
Meertalige nasynchronisatie voor een internationaal publiek
Een YouTube-kanaal buiten één taal laten groeien is een gok die zichzelf versterkt: dezelfde video, nagesynchroniseerd naar het Spaans, Portugees of Japans, bereikt een ander publiek zonder extra productiekosten buiten de vertelstem.
De workflow is dezelfde:
- Vertaal je script (een vertaaltool, een tweetalige collega of een door een model gemaakte versie die een spreker van de taal nakijkt).
- Ga terug naar OmniArt-audio en kies Eleven Multilingual v2.
- Kies een stem die bij de doeltaal past — verschillende stemmen zijn per taal of regio gelabeld.
- Plak het vertaalde script en genereer.
Eleven Multilingual v2 houdt het ritme en de voordracht consistent over talen heen, en dat telt als de nagesynchroniseerde audio moet synchroniseren met beeld dat op de oorspronkelijke timing is gemonteerd.
Waarschuwing
Maak de video af binnen OmniArt
Zodra je de vertelstem hebt, kan de rest van de productie in dezelfde werkruimte blijven.
- Beeld — genereer B-rollclips met elk van de videomodellen van OmniArt. Monteer ze op het ritme van de vertelstem: elke zin een nieuw shot, of langer vasthouden bij complexere punten.
- Muziek — voeg een achtergrondscore toe met MiniMax Music 2.6 of Lyria 3 Pro. Een muziekbed op ongeveer −18 dB onder de vertelstem geeft aanwezigheid zonder te concurreren.
- SFX — genereer geluidseffecten voor overgangen en momenten van nadruk. Bekijk de gids voor de AI-geluidseffectgenerator voor de workflow.
Het kernvoordeel van werken over modaliteiten heen op één plek is iteratie: verander de vertelstem, genereer de SFX eromheen opnieuw en pas de muziekcue aan in dezelfde sessie — in plaats van heen en weer te pendelen tussen drie aparte tools en bestandsexports.
Specifiek voor short-form: bekijk AI-video voor TikTok en YouTube Shorts voor de verticale videoworkflow die hierbij past.
Aan de slag op OmniArt
Schrijf een script van 1.500 tekens — één vertelstem op Shorts-lengte. Open de audiowerkruimte van OmniArt, kies MiniMax Speech 2.8 HD, blader door de stemmen en genereer een eerste take. Luister naar het ritme en de klemtoon, pas het script aan met leestekens en draai een tweede ronde. De meeste vertelstemmen zijn in twee of drie takes klaar. Genereer daarna het passende beeld, voeg een muziekbed toe, en je hebt een complete video die op één plek is gemaakt.
Klaar om te maken?
Ga aan de slag en genereer content met AI