Eleven v3-audiotags: expressieve AI-stemmen regisseren
Leer hoe je de audiotags van ElevenLabs v3 gebruikt — emotie, voordracht, accent en personage tussen vierkante haken — om expressieve AI-stemvoordracht op OmniArt te regisseren.

De meeste tekst-naar-spraaktools lezen een script elke keer op dezelfde manier voor: vlak, afgemeten en licht robotachtig. Eleven v3 is anders. Het model begrijpt de emotionele textuur van je script, en met audiotags kun je het expliciet regisseren — net zoals een stemregisseur een acteur voor een take zou aansturen.
Audiotags zijn korte woorden of zinsdelen tussen vierkante haken, rechtstreeks in je script gezet. Ze vertellen het model hoe het de volgende regel moet brengen: fluisterend, schreeuwend, gekleurd met een Brits accent, of halverwege onderbroken door een zucht. Deze gids behandelt het volledige tagvocabulaire dat op OmniArt beschikbaar is, hoe je scripts met meerdere personages schrijft die er gebruik van maken, en hoe je bepaalt wanneer Eleven v3 het juiste model voor de klus is.
Wat zijn audiotags?
Audiotags zijn regie-instructies die je tussen vierkante haken in de tekst plaatst — [whispers], [excited], [British accent] — precies daar in het script waar de voordracht moet veranderen. Eleven v3 leest ze als instructies in plaats van als uit te spreken woorden, en past toon, tempo en gevoel erop aan.
Het cruciale verschil met oudere tekst-naar-spraak is dat v3 context meeweegt. Het legt niet zomaar een filter over alles heen: het weegt de tag tegen de omringende zin, dus [sighs] vóór "I suppose you're right" levert iets anders op dan [sighs] vóór "Fine, let's go." Die gevoeligheid voor context zorgt ervoor dat getagde scripts geregisseerd aanvoelen in plaats van verwerkt.
Tip
Het vocabulaire van audiotags
De tabel hieronder ordent elke grote tagcategorie met voorbeelden. Dit zijn de instructies waar Eleven v3 op OmniArt betrouwbaar op reageert.
Emotietags
| Tag | Effect |
|---|---|
[excited] | Meer energie, hoger tempo, helderdere toon |
[sad] | Trager, lager, ingehoudener |
[angry] | Kortaf, krachtig, hoger volume |
[nervous] | Licht ongelijkmatig tempo, over de hele linie zachter |
[happy] | Warm, opgewekt, open resonantie |
[tired] | Trager, vlakker, minder inspanning |
[afraid] | Gespannen, ingehouden, minder adem |
[disgusted] | Vlak gevoel met een lichte minachting |
[surprised] | Hogere inzet, kortere frasering |
Voordrachttags
| Tag | Effect |
|---|---|
[whispers] | Ademend, zacht, intiem |
[shouting] | Hoog volume, geprojecteerd, brede resonantie |
[pause] | Natuurlijke beat of onderbreking op deze plek |
[slowly] | Opgerekt tempo zonder verandering van toonhoogte |
[fast] | Samengeperst tempo, meer energie |
[sighs] | Hoorbare uitademing verweven met het begin van de zin |
[laughs] | Voegt een korte natuurlijke lach toe voor of tijdens de regel |
[crying] | Gebroken, betraande kwaliteit in de voordracht |
Personage- en roltags
| Tag | Effect |
|---|---|
[pirate voice] | Theatraal, grommend, overdreven cadans |
[robot voice] | Kortaf, monotoon, synthetisch |
[narrator] | Gezaghebbend, afgemeten, documentaireregister |
[announcer] | Geprojecteerd, formeel, omroepkwaliteit |
[childlike] | Hogere toonhoogte, kortere frasering, speels |
Accenttags
| Tag | Effect |
|---|---|
[British accent] | Klank van Received Pronunciation |
[Southern US accent] | Warme, gerekte klinkers |
[Australian accent] | Intonatie die aan het eind omhoog gaat |
[Irish accent] | Melodisch, kenmerkende ronding van klinkers |
[New York accent] | Kortaffe medeklinkers, nasaal middengebied |
Let op
Spiekbriefje voor tags
| Doel | Voorbeeldtags |
|---|---|
| Emotie — positief | [excited], [happy], [surprised] |
| Emotie — negatief | [sad], [angry], [tired], [afraid], [nervous] |
| Volume en projectie | [whispers], [shouting] |
| Tempo | [slowly], [fast] |
| Natuurlijke geluiden | [sighs], [laughs], [crying], [pause] |
| Personageregister | [pirate voice], [robot voice], [narrator], [announcer], [childlike] |
| Accent | [British accent], [Southern US accent], [Australian accent], [Irish accent], [New York accent] |
Een getagd script schrijven: twee voorbeelden
Voorbeeld 1 — emotionele vertelstem
Dit is een korte opening voor een hoofdstuk uit een luisterboek. De tags verschuiven de stemming naarmate de scène verandert.
[narrator] The city had been quiet for three days.
[slowly] Not the quiet of peace — [pause] the quiet of waiting.
[tired] Maya poured her fourth cup of coffee and stared at the map pinned to the wall.
[whispers] They had to be out there somewhere.
[sighs] She just needed one more lead.
De tag voor de verteller zet vanaf het begin een afgemeten register neer. [slowly] met een [pause] creëert dramatische ruimte. [tired] laat de voordracht doorzakken voordat [whispers] haar laag en intiem trekt. [sighs] voegt een fysieke ademhaling toe die de slotregel verdiend laat aanvoelen.
Voorbeeld 2 — dialoog met twee personages
Eleven v3 kan vanuit één prompt met meerdere sprekers werken. Gebruik personagelabels en voordrachttags om elke stem te onderscheiden.
CAPTAIN (VOICE A): [excited] We found it. [pause] The actual coordinates — right where the old chart said they'd be.
FIRST MATE (VOICE B): [nervous] Sir, that chart is four hundred years old. Half of it is sea monsters drawn by someone who'd never left port.
CAPTAIN (VOICE A): [laughs] Exactly! [fast] Which means no one else thought it was worth following. Get the crew up.
FIRST MATE (VOICE B): [sighs] [slowly] Aye, captain.
Tip
Audiotags gebruiken op OmniArt
- Ga naar de audiomodus en kies het tabblad Spraak.
- Kies Eleven v3 in het modelmenu. Het is beschikbaar vanaf het Starter-plan.
- Kies een stemvoorinstelling. OmniArt biedt 353 samengestelde stemmen over de spraakmodellen heen. Blader op gender en stijl — diepere, gezaghebbende stemmen werken goed voor vertelstem; helderdere stemmen in het middengebied reageren goed op sterke emotietags.
- Plak je getagde script in het promptveld. Eleven v3 accepteert maximaal 5.000 tekens per generatie.
- Stel de taal in die bij je script hoort.
- Genereer en luister. Wordt een tag te sterk of te zwak toegepast, verplaats hem dan, voeg een tweede tag toe die de voordracht terugzet, of probeer een andere stemvoorinstelling.
Je betaalt 1 credit per begonnen blok van 50 tekens. Een script van 500 tekens kost 10 credits; een script van 5.000 tekens kost 100 credits. Onvolledige blokken van 50 tekens worden naar boven afgerond.
Waarschuwing
Wanneer kies je Eleven v3 en wanneer een ander spraakmodel?
Op OmniArt zijn drie modellen van ElevenLabs beschikbaar. Zo bepaal je welk model je pakt.
| Situatie | Beste model | Reden |
|---|---|---|
| Emotioneel gevarieerde voordracht — een personage dat lacht, huilt, schreeuwt | Eleven v3 | Audiotags en gevoel voor context geven het grootste expressieve bereik |
| Stabiele meertalige vertelstem (50+ talen) | Eleven Multilingual v2 | Consistente, gelijkmatige voordracht over talen heen; 10.000 tekens per generatie |
| Lange scripts met een snelle doorlooptijd | Eleven Turbo v2.5 | Lage latentie; 40.000 tekens per generatie tegen 1 credit per 100 tekens |
| Zuinig genereren of genereren op het Free-plan | MiniMax Speech 2.8 HD / Turbo | Beschikbaar op het Free-plan; HD voor afgewerkte kwaliteit, Turbo voor schetsen |
Een bruikbaar denkmodel: gebruik v3 wanneer het script om een voordracht vraagt en de manier van brengen zelf betekenis draagt. Gebruik Multilingual v2 wanneer het doel heldere vertelstem is die in veel talen makkelijk te volgen blijft. Gebruik Turbo v2.5 wanneer je een lang, tamelijk neutraal script hebt en snel resultaat nodig hebt.
De volledige specificaties staan op de modelpagina’s: Eleven v3, Eleven Multilingual v2, Eleven Turbo v2.5.
Veelgemaakte fouten bij het taggen
Te veel tags: een tag bij elke zin vlakt de variatie juist af. Emotietags komen harder binnen wanneer ze arriveren na een stuk ongemarkeerde, natuurlijke voordracht. Gebruik ze voor pieken en overgangen, niet als constante laag.
Tegenstrijdige tags: [shouting] direct gevolgd door [whispers] zonder zin ertussen kan het model in de war brengen. Laat een zin neutrale voordracht tussen sterke contrasten staan.
Accenttags zonder test: hoe een accent klinkt, hangt af van de gekozen stemvoorinstelling. Draai een testregel van 50 tekens voordat je een accenttag over een lang script toepast.
Tags midden in een woord: tags horen tussen hele woorden of leestekens te staan, niet binnen een woord. Incre[excited]dible wordt niet correct gelezen — schrijf in plaats daarvan [excited] Incredible.
Toepassingen die er het meest van profiteren
Luisterboeken met meerdere personages: de combinatie van stemvoorinstellingen en voordrachttags laat je verteller en personage onderscheiden en elk personage een consistente emotionele signatuur geven. Hoe je een complete audioproductie opbouwt, lees je in de gids voor voice-over met MiniMax Speech, die een vergelijkbare workflow beschrijft.
Gamedialoog en interactieve fictie: korte, pittige regels met sterke tags — [afraid] Stay back!, [laughs] You call that a plan? — leveren geloofwaardige NPC’s op zonder eigen stemacteurs.
YouTube-vertelstem met emotioneel bereik: een documentaire of uitlegvideo die schuift tussen dramatische onthullingen, humoristische terzijdes en stille bespiegeling profiteert van wisselingen in voordracht. Tag de overgangen en het ritme schrijft zichzelf.
Media en trailers die op dialoog draaien: twee of drie personages uit één generatie, elk onderscheiden door stemvoorinstelling en tags, persen een dialoogscène samen tot één stap in de workflow.
Aan de slag op OmniArt
De snelste manier om gevoel te krijgen voor wat v3 kan, is een script pakken dat je goed kent — een monoloog, de opening van een kort verhaal, een paar regels gamedialoog — en het twee keer taggen: één keer licht, één keer met stevige wisselingen in voordracht. Genereer beide en vergelijk. Het verschil tussen een licht en een volledig geregisseerd script is meestal al in de eerste zin duidelijk.
Open Eleven v3 op OmniArt en plak je eerste getagde script. Begin met het voorbeeld van de emotionele vertelstem hierboven, wissel de stemvoorinstelling en kijk wat er verandert. Zodra het tagvocabulaire vanzelf gaat, wordt het model net zo reactief als een echte opnamesessie — zonder studio.
Een breder overzicht van alle audiomodellen op OmniArt, inclusief muziek en geluidseffecten, staat in de complete gids voor de audiowerkruimte.
Klaar om te maken?
Ga aan de slag en genereer content met AI