Tagi audio Eleven v3: reżyserowanie ekspresyjnych głosów AI
Dowiedz się, jak używać tagów audio ElevenLabs v3 — wskazówek emocji, sposobu mówienia, akcentu i persony w nawiasach kwadratowych — aby reżyserować ekspresyjne występy głosowe AI w OmniArt.

Większość narzędzi do syntezy mowy czyta skrypt za każdym razem tak samo: płasko, miarowo i lekko robotycznie. Eleven v3 działa inaczej. Rozumie emocjonalną fakturę skryptu, a dzięki tagom audio możesz dawać mu jasne wskazówki — tak, jak reżyser głosu prowadzi wykonawcę przed ujęciem.
Tagi audio to krótkie słowa lub frazy w nawiasach kwadratowych, osadzone bezpośrednio w skrypcie. Mówią modelowi, jak wypowiedzieć następną kwestię: szeptem, krzykiem, z brytyjskim akcentem albo z westchnieniem w środku zdania. Ten poradnik omawia pełny słownik tagów dostępnych w OmniArt, pokazuje, jak pisać skrypty z wieloma postaciami, które z nich korzystają, i pomaga zdecydować, kiedy Eleven v3 jest właściwym modelem do zadania.
Czym są tagi audio?
Tagi audio to wstawiane w tekst wskazówki reżyserskie w nawiasach kwadratowych — [whispers], [excited], [British accent] — umieszczone w tym miejscu skryptu, w którym ma zmienić się sposób mówienia. Eleven v3 odczytuje je jako instrukcje, a nie słowa do wypowiedzenia, i odpowiednio dostosowuje ton, tempo oraz afekt.
Najważniejsza różnica względem starszych narzędzi do syntezy mowy polega na tym, że v3 interpretuje kontekst. Nie nakłada po prostu jednego filtra na całość: waży tag względem otaczającego zdania, więc [sighs] przed „Chyba masz rację” daje inny rezultat niż [sighs] przed „Dobrze, chodźmy”. Ta wrażliwość na kontekst sprawia, że skrypty z tagami brzmią jak reżyserowane, a nie tylko przetworzone.
Wskazówka
Słownik tagów audio
Poniższa tabela porządkuje każdą główną kategorię tagów i przykłady. To wskazówki, na które Eleven v3 niezawodnie reaguje w OmniArt.
Tagi emocji
| Tag | Efekt |
|---|---|
[excited] | Wyższa energia, szybsze tempo, jaśniejszy ton |
[sad] | Wolniejszy, niższy, bardziej przygaszony sposób mówienia |
[angry] | Krótkie, mocne frazy i większa głośność |
[nervous] | Lekko nierówne tempo i ogólnie cichszy głos |
[happy] | Ciepłe, pogodne, otwarte brzmienie |
[tired] | Wolniej, bardziej płasko, z mniejszym wysiłkiem |
[afraid] | Napięcie, powściągliwość, mniej oddechu |
[disgusted] | Płaski afekt z lekką pogardą |
[surprised] | Wyższy początek wysokości głosu, krótsza fraza |
Tagi sposobu mówienia
| Tag | Efekt |
|---|---|
[whispers] | Oddechowy, cichy, intymny głos |
[shouting] | Wysoka głośność, projekcja, szerokie brzmienie |
[pause] | Naturalne uderzenie rytmu albo przerwa w tym miejscu |
[slowly] | Rozciągnięte tempo bez zmiany wysokości głosu |
[fast] | Skondensowane tempo i większa energia |
[sighs] | Słyszalny wydech wpleciony w początek frazy |
[laughs] | Dodaje krótki naturalny śmiech przed kwestią albo w jej trakcie |
[crying] | Łamliwa, mokra jakość głosu |
Tagi postaci i persony
| Tag | Efekt |
|---|---|
[pirate voice] | Teatralna, chropawa, przerysowana kadencja |
[robot voice] | Krótko cięty, monotonny, syntetyczny charakter |
[narrator] | Autorytatywny, miarowy, dokumentalny rejestr |
[announcer] | Projekcja, formalność, jakość transmisji |
[childlike] | Wyższa wysokość głosu, krótsze frazowanie, zabawowość |
Tagi akcentu
| Tag | Efekt |
|---|---|
[British accent] | Wymowa w standardzie Received Pronunciation |
[Southern US accent] | Ciepłe, przeciągane samogłoski |
[Australian accent] | Wznosząca intonacja na końcach fraz |
[Irish accent] | Melodyjne, charakterystyczne zaokrąglenie samogłosek |
[New York accent] | Krótkie spółgłoski, nosowy środek pasma |
Uwaga
Ściąga z tagów
| Cel | Przykładowe tagi |
|---|---|
| Emocja — pozytywna | [excited], [happy], [surprised] |
| Emocja — negatywna | [sad], [angry], [tired], [afraid], [nervous] |
| Głośność / projekcja | [whispers], [shouting] |
| Tempo | [slowly], [fast] |
| Naturalne dźwięki | [sighs], [laughs], [crying], [pause] |
| Rejestr postaci | [pirate voice], [robot voice], [narrator], [announcer], [childlike] |
| Akcent | [British accent], [Southern US accent], [Australian accent], [Irish accent], [New York accent] |
Pisanie skryptu z tagami: dwa przykłady
Przykład 1 — emocjonalna narracja
To krótkie otwarcie rozdziału audiobooka. Tagi zmieniają nastrój wraz ze zmianą sceny.
[narrator] The city had been quiet for three days.
[slowly] Not the quiet of peace — [pause] the quiet of waiting.
[tired] Maya poured her fourth cup of coffee and stared at the map pinned to the wall.
[whispers] They had to be out there somewhere.
[sighs] She just needed one more lead.
Tag narratora ustawia od początku miarowy rejestr. [slowly] razem z [pause] tworzy dramatyczną przestrzeń. [tired] obniża energię wypowiedzi, zanim [whispers] sprowadzi ją nisko i intymnie. [sighs] dodaje fizyczny oddech, dzięki któremu finałowa linia brzmi na zasłużoną.
Przykład 2 — dialog dwóch postaci
Eleven v3 potrafi obsłużyć czytanie wielu mówców z jednego promptu. Użyj etykiet postaci i tagów sposobu mówienia, aby odróżnić każdy głos.
CAPTAIN (VOICE A): [excited] We found it. [pause] The actual coordinates — right where the old chart said they'd be.
FIRST MATE (VOICE B): [nervous] Sir, that chart is four hundred years old. Half of it is sea monsters drawn by someone who'd never left port.
CAPTAIN (VOICE A): [laughs] Exactly! [fast] Which means no one else thought it was worth following. Get the crew up.
FIRST MATE (VOICE B): [sighs] [slowly] Aye, captain.
Wskazówka
Jak używać tagów audio w OmniArt
- Przejdź do trybu audio i wybierz kartę mowy.
- Wybierz Eleven v3 z menu modeli. Jest dostępny w planie Starter i wyższych.
- Wybierz wariant głosu. OmniArt oferuje 353 starannie dobrane głosy w różnych modelach mowy. Przeglądaj je według płci i stylu — głębsze, bardziej autorytatywne warianty dobrze sprawdzają się w narracji; jaśniejsze warianty ze średniego zakresu dobrze reagują na mocne tagi emocji.
- Wklej skrypt z tagami w polu promptu. Eleven v3 przyjmuje do 5 000 znaków na jedno generowanie.
- Ustaw język zgodny ze skryptem.
- Wygeneruj i odsłuchaj. Jeśli tag działa za mocno albo za słabo, przesuń go, dodaj kolejny tag resetujący sposób mówienia albo spróbuj innego wariantu głosu.
Rozliczenie wynosi 1 kredyt za każdy rozpoczęty blok 50 znaków. Skrypt o długości 500 znaków kosztuje 10 kredytów; skrypt o długości 5 000 znaków kosztuje 100 kredytów. Niepełne bloki 50 znaków są zaokrąglane w górę.
Ostrzeżenie
Kiedy używać Eleven v3, a kiedy innych modeli mowy
W OmniArt dostępne są trzy modele ElevenLabs. Oto sytuacje, w których warto sięgnąć po każdy z nich.
| Scenariusz | Najlepszy model | Powód |
|---|---|---|
| Emocjonalnie zróżnicowane wykonanie — postać, która śmieje się, płacze, krzyczy | Eleven v3 | Tagi audio i świadomość kontekstu dają największy zakres ekspresji |
| Stabilna wielojęzyczna narracja (ponad 50 języków) | Eleven Multilingual v2 | Spójny, równy sposób mówienia w różnych językach; 10 000 znaków na generowanie |
| Długie skrypty z krótkim czasem realizacji | Eleven Turbo v2.5 | Niskie opóźnienie; 40 000 znaków na generowanie przy koszcie 1 kredytu za 100 znaków |
| Generowanie z myślą o budżecie albo w planie Free | MiniMax Speech 2.8 HD / Turbo | Dostępne w planie Free; HD do finalnej jakości, Turbo do szkiców |
Przydatny model myślowy: używaj v3, gdy skrypt potrzebuje wykonania, a sam sposób mówienia niesie znaczenie. Używaj Multilingual v2, gdy celem jest klarowna narracja łatwa do śledzenia w wielu językach. Używaj Turbo v2.5, gdy masz długi, względnie neutralny skrypt i potrzebujesz szybkich wyników.
Pełne specyfikacje znajdziesz na osobnych stronach modeli: Eleven v3, Eleven Multilingual v2, Eleven Turbo v2.5.
Typowe błędy przy tagowaniu, których warto uniknąć
Zbyt wiele tagów: dodanie tagu do każdego zdania spłaszcza zmienność. Tagi emocji działają mocniej, gdy pojawiają się po fragmencie nieoznaczonego, naturalnego sposobu mówienia. Używaj ich do szczytów i przejść, a nie jako stałej warstwy.
Sprzeczne tagi: [shouting] bezpośrednio po którym następuje [whispers], bez zdania między nimi, może zdezorientować model. Zostaw zdanie neutralnego sposobu mówienia między mocnymi kontrastami.
Tagi akcentu bez testu: odwzorowanie akcentu zależy od bazowego wariantu głosu. Uruchom linię testową o długości 50 znaków, zanim zastosujesz tag akcentu w całym długim skrypcie.
Tagi w środku słowa: tagi muszą stać między pełnymi słowami albo znakami interpunkcyjnymi, nie wewnątrz słowa. Incre[excited]dible nie zostanie poprawnie sparsowane — zamiast tego napisz [excited] Incredible.
Zastosowania, które zyskują najwięcej
Audiobooki z wieloma postaciami: połączenie wariantów głosu i tagów sposobu mówienia pozwala odróżnić narratora od postaci i nadać każdej postaci spójną sygnaturę emocjonalną. Zobacz, jak zbudować pełną produkcję audio w poradniku lektorskim MiniMax Speech, który pokazuje porównywalny proces.
Dialogi w grach i fikcja interaktywna: krótkie, mocne kwestie z wyrazistymi tagami — [afraid] Stay back!, [laughs] You call that a plan? — tworzą wiarygodnych NPC bez niestandardowych aktorów głosowych.
Narracja na YouTube z zakresem emocji: dokument albo materiał wyjaśniający, który przechodzi między dramatycznymi odkryciami, żartobliwymi wtrąceniami i cichą refleksją, korzysta na zmianach sposobu mówienia. Otaguj przejścia, a tempo samo zacznie układać się w rytm.
Media i trailery oparte na dialogu: czytanie dwóch lub trzech postaci z jednego generowania, gdzie każdą odróżnia wariant głosu i tagi, zamyka scenę dialogową w jednym kroku procesu.
Jak zacząć w OmniArt
Najszybszy sposób, aby wyczuć możliwości v3, to wziąć dobrze znany skrypt — monolog, otwarcie krótkiego opowiadania, kilka kwestii z gry — i otagować go dwa razy: raz lekko, raz z agresywnymi zmianami sposobu mówienia. Wygeneruj oba warianty i porównaj. Różnica między lekko wyreżyserowanym a w pełni wyreżyserowanym skryptem zwykle jest oczywista już w pierwszym zdaniu.
Otwórz Eleven v3 w OmniArt i wklej swój pierwszy skrypt z tagami. Zacznij od powyższego przykładu emocjonalnej narracji, podmień wariant głosu i zobacz, co się zmienia. Gdy słownik tagów zaczyna brzmieć naturalnie, model zaczyna reagować niemal jak podczas prawdziwej sesji nagraniowej — bez studia.
Szerszy przegląd wszystkich modeli audio dostępnych w OmniArt, w tym muzyki i efektów dźwiękowych, znajdziesz w pełnym przewodniku po przestrzeni audio.
Gotowy, aby tworzyć?
Zacznij generować świetne treści z AI