TutorialPoradniki krok po kroku9 min czytania

Tagi audio Eleven v3: reżyserowanie ekspresyjnych głosów AI

Dowiedz się, jak używać tagów audio ElevenLabs v3 — wskazówek emocji, sposobu mówienia, akcentu i persony w nawiasach kwadratowych — aby reżyserować ekspresyjne występy głosowe AI w OmniArt.

Zespół OmniArt
Tagi audio Eleven v3: reżyserowanie ekspresyjnych głosów AI

Większość narzędzi do syntezy mowy czyta skrypt za każdym razem tak samo: płasko, miarowo i lekko robotycznie. Eleven v3 działa inaczej. Rozumie emocjonalną fakturę skryptu, a dzięki tagom audio możesz dawać mu jasne wskazówki — tak, jak reżyser głosu prowadzi wykonawcę przed ujęciem.

Tagi audio to krótkie słowa lub frazy w nawiasach kwadratowych, osadzone bezpośrednio w skrypcie. Mówią modelowi, jak wypowiedzieć następną kwestię: szeptem, krzykiem, z brytyjskim akcentem albo z westchnieniem w środku zdania. Ten poradnik omawia pełny słownik tagów dostępnych w OmniArt, pokazuje, jak pisać skrypty z wieloma postaciami, które z nich korzystają, i pomaga zdecydować, kiedy Eleven v3 jest właściwym modelem do zadania.

Czym są tagi audio?

Tagi audio to wstawiane w tekst wskazówki reżyserskie w nawiasach kwadratowych — [whispers], [excited], [British accent] — umieszczone w tym miejscu skryptu, w którym ma zmienić się sposób mówienia. Eleven v3 odczytuje je jako instrukcje, a nie słowa do wypowiedzenia, i odpowiednio dostosowuje ton, tempo oraz afekt.

Najważniejsza różnica względem starszych narzędzi do syntezy mowy polega na tym, że v3 interpretuje kontekst. Nie nakłada po prostu jednego filtra na całość: waży tag względem otaczającego zdania, więc [sighs] przed „Chyba masz rację” daje inny rezultat niż [sighs] przed „Dobrze, chodźmy”. Ta wrażliwość na kontekst sprawia, że skrypty z tagami brzmią jak reżyserowane, a nie tylko przetworzone.

Wskazówka

Umieść tag bezpośrednio przed frazą, na którą ma wpłynąć. Tag na początku akapitu prowadzi sposób mówienia aż do następnego tagu albo naturalnego resetu tonu.

Słownik tagów audio

Poniższa tabela porządkuje każdą główną kategorię tagów i przykłady. To wskazówki, na które Eleven v3 niezawodnie reaguje w OmniArt.

Tagi emocji

TagEfekt
[excited]Wyższa energia, szybsze tempo, jaśniejszy ton
[sad]Wolniejszy, niższy, bardziej przygaszony sposób mówienia
[angry]Krótkie, mocne frazy i większa głośność
[nervous]Lekko nierówne tempo i ogólnie cichszy głos
[happy]Ciepłe, pogodne, otwarte brzmienie
[tired]Wolniej, bardziej płasko, z mniejszym wysiłkiem
[afraid]Napięcie, powściągliwość, mniej oddechu
[disgusted]Płaski afekt z lekką pogardą
[surprised]Wyższy początek wysokości głosu, krótsza fraza

Tagi sposobu mówienia

TagEfekt
[whispers]Oddechowy, cichy, intymny głos
[shouting]Wysoka głośność, projekcja, szerokie brzmienie
[pause]Naturalne uderzenie rytmu albo przerwa w tym miejscu
[slowly]Rozciągnięte tempo bez zmiany wysokości głosu
[fast]Skondensowane tempo i większa energia
[sighs]Słyszalny wydech wpleciony w początek frazy
[laughs]Dodaje krótki naturalny śmiech przed kwestią albo w jej trakcie
[crying]Łamliwa, mokra jakość głosu

Tagi postaci i persony

TagEfekt
[pirate voice]Teatralna, chropawa, przerysowana kadencja
[robot voice]Krótko cięty, monotonny, syntetyczny charakter
[narrator]Autorytatywny, miarowy, dokumentalny rejestr
[announcer]Projekcja, formalność, jakość transmisji
[childlike]Wyższa wysokość głosu, krótsze frazowanie, zabawowość

Tagi akcentu

TagEfekt
[British accent]Wymowa w standardzie Received Pronunciation
[Southern US accent]Ciepłe, przeciągane samogłoski
[Australian accent]Wznosząca intonacja na końcach fraz
[Irish accent]Melodyjne, charakterystyczne zaokrąglenie samogłosek
[New York accent]Krótkie spółgłoski, nosowy środek pasma

Uwaga

Tagi akcentu nakładają się na bazowy wariant głosu. Wyniki różnią się zależnie od wariantu — niektóre głosy reagują mocniej niż inne. Wygeneruj krótką linię testową, zanim przejdziesz do pełnego skryptu.

Ściąga z tagów

CelPrzykładowe tagi
Emocja — pozytywna[excited], [happy], [surprised]
Emocja — negatywna[sad], [angry], [tired], [afraid], [nervous]
Głośność / projekcja[whispers], [shouting]
Tempo[slowly], [fast]
Naturalne dźwięki[sighs], [laughs], [crying], [pause]
Rejestr postaci[pirate voice], [robot voice], [narrator], [announcer], [childlike]
Akcent[British accent], [Southern US accent], [Australian accent], [Irish accent], [New York accent]

Pisanie skryptu z tagami: dwa przykłady

Przykład 1 — emocjonalna narracja

To krótkie otwarcie rozdziału audiobooka. Tagi zmieniają nastrój wraz ze zmianą sceny.

[narrator] The city had been quiet for three days.

[slowly] Not the quiet of peace — [pause] the quiet of waiting.

[tired] Maya poured her fourth cup of coffee and stared at the map pinned to the wall.

[whispers] They had to be out there somewhere.

[sighs] She just needed one more lead.

Tag narratora ustawia od początku miarowy rejestr. [slowly] razem z [pause] tworzy dramatyczną przestrzeń. [tired] obniża energię wypowiedzi, zanim [whispers] sprowadzi ją nisko i intymnie. [sighs] dodaje fizyczny oddech, dzięki któremu finałowa linia brzmi na zasłużoną.

Przykład 2 — dialog dwóch postaci

Eleven v3 potrafi obsłużyć czytanie wielu mówców z jednego promptu. Użyj etykiet postaci i tagów sposobu mówienia, aby odróżnić każdy głos.

CAPTAIN (VOICE A): [excited] We found it. [pause] The actual coordinates — right where the old chart said they'd be.

FIRST MATE (VOICE B): [nervous] Sir, that chart is four hundred years old. Half of it is sea monsters drawn by someone who'd never left port.

CAPTAIN (VOICE A): [laughs] Exactly! [fast] Which means no one else thought it was worth following. Get the crew up.

FIRST MATE (VOICE B): [sighs] [slowly] Aye, captain.

Wskazówka

W skryptach z wieloma postaciami wybierz dwa warianty głosu o wyraźnie różnych bazowych rejestrach — jeden głębszy, drugi jaśniejszy — aby różnica między postaciami była słyszalna nawet bez widocznych etykiet mówców w wyjściowym audio.

Jak używać tagów audio w OmniArt

  1. Przejdź do trybu audio i wybierz kartę mowy.
  2. Wybierz Eleven v3 z menu modeli. Jest dostępny w planie Starter i wyższych.
  3. Wybierz wariant głosu. OmniArt oferuje 353 starannie dobrane głosy w różnych modelach mowy. Przeglądaj je według płci i stylu — głębsze, bardziej autorytatywne warianty dobrze sprawdzają się w narracji; jaśniejsze warianty ze średniego zakresu dobrze reagują na mocne tagi emocji.
  4. Wklej skrypt z tagami w polu promptu. Eleven v3 przyjmuje do 5 000 znaków na jedno generowanie.
  5. Ustaw język zgodny ze skryptem.
  6. Wygeneruj i odsłuchaj. Jeśli tag działa za mocno albo za słabo, przesuń go, dodaj kolejny tag resetujący sposób mówienia albo spróbuj innego wariantu głosu.

Rozliczenie wynosi 1 kredyt za każdy rozpoczęty blok 50 znaków. Skrypt o długości 500 znaków kosztuje 10 kredytów; skrypt o długości 5 000 znaków kosztuje 100 kredytów. Niepełne bloki 50 znaków są zaokrąglane w górę.

Ostrzeżenie

OmniArt nie oferuje klonowania głosu, suwaków szybkości ani kontroli wysokości głosu dla Eleven v3. Cała zmienność wykonania pochodzi z tekstu skryptu i tagów audio.

Kiedy używać Eleven v3, a kiedy innych modeli mowy

W OmniArt dostępne są trzy modele ElevenLabs. Oto sytuacje, w których warto sięgnąć po każdy z nich.

ScenariuszNajlepszy modelPowód
Emocjonalnie zróżnicowane wykonanie — postać, która śmieje się, płacze, krzyczyEleven v3Tagi audio i świadomość kontekstu dają największy zakres ekspresji
Stabilna wielojęzyczna narracja (ponad 50 języków)Eleven Multilingual v2Spójny, równy sposób mówienia w różnych językach; 10 000 znaków na generowanie
Długie skrypty z krótkim czasem realizacjiEleven Turbo v2.5Niskie opóźnienie; 40 000 znaków na generowanie przy koszcie 1 kredytu za 100 znaków
Generowanie z myślą o budżecie albo w planie FreeMiniMax Speech 2.8 HD / TurboDostępne w planie Free; HD do finalnej jakości, Turbo do szkiców

Przydatny model myślowy: używaj v3, gdy skrypt potrzebuje wykonania, a sam sposób mówienia niesie znaczenie. Używaj Multilingual v2, gdy celem jest klarowna narracja łatwa do śledzenia w wielu językach. Używaj Turbo v2.5, gdy masz długi, względnie neutralny skrypt i potrzebujesz szybkich wyników.

Pełne specyfikacje znajdziesz na osobnych stronach modeli: Eleven v3, Eleven Multilingual v2, Eleven Turbo v2.5.

Typowe błędy przy tagowaniu, których warto uniknąć

Zbyt wiele tagów: dodanie tagu do każdego zdania spłaszcza zmienność. Tagi emocji działają mocniej, gdy pojawiają się po fragmencie nieoznaczonego, naturalnego sposobu mówienia. Używaj ich do szczytów i przejść, a nie jako stałej warstwy.

Sprzeczne tagi: [shouting] bezpośrednio po którym następuje [whispers], bez zdania między nimi, może zdezorientować model. Zostaw zdanie neutralnego sposobu mówienia między mocnymi kontrastami.

Tagi akcentu bez testu: odwzorowanie akcentu zależy od bazowego wariantu głosu. Uruchom linię testową o długości 50 znaków, zanim zastosujesz tag akcentu w całym długim skrypcie.

Tagi w środku słowa: tagi muszą stać między pełnymi słowami albo znakami interpunkcyjnymi, nie wewnątrz słowa. Incre[excited]dible nie zostanie poprawnie sparsowane — zamiast tego napisz [excited] Incredible.

Zastosowania, które zyskują najwięcej

Audiobooki z wieloma postaciami: połączenie wariantów głosu i tagów sposobu mówienia pozwala odróżnić narratora od postaci i nadać każdej postaci spójną sygnaturę emocjonalną. Zobacz, jak zbudować pełną produkcję audio w poradniku lektorskim MiniMax Speech, który pokazuje porównywalny proces.

Dialogi w grach i fikcja interaktywna: krótkie, mocne kwestie z wyrazistymi tagami — [afraid] Stay back!, [laughs] You call that a plan? — tworzą wiarygodnych NPC bez niestandardowych aktorów głosowych.

Narracja na YouTube z zakresem emocji: dokument albo materiał wyjaśniający, który przechodzi między dramatycznymi odkryciami, żartobliwymi wtrąceniami i cichą refleksją, korzysta na zmianach sposobu mówienia. Otaguj przejścia, a tempo samo zacznie układać się w rytm.

Media i trailery oparte na dialogu: czytanie dwóch lub trzech postaci z jednego generowania, gdzie każdą odróżnia wariant głosu i tagi, zamyka scenę dialogową w jednym kroku procesu.

Jak zacząć w OmniArt

Najszybszy sposób, aby wyczuć możliwości v3, to wziąć dobrze znany skrypt — monolog, otwarcie krótkiego opowiadania, kilka kwestii z gry — i otagować go dwa razy: raz lekko, raz z agresywnymi zmianami sposobu mówienia. Wygeneruj oba warianty i porównaj. Różnica między lekko wyreżyserowanym a w pełni wyreżyserowanym skryptem zwykle jest oczywista już w pierwszym zdaniu.

Otwórz Eleven v3 w OmniArt i wklej swój pierwszy skrypt z tagami. Zacznij od powyższego przykładu emocjonalnej narracji, podmień wariant głosu i zobacz, co się zmienia. Gdy słownik tagów zaczyna brzmieć naturalnie, model zaczyna reagować niemal jak podczas prawdziwej sesji nagraniowej — bez studia.

Szerszy przegląd wszystkich modeli audio dostępnych w OmniArt, w tym muzyki i efektów dźwiękowych, znajdziesz w pełnym przewodniku po przestrzeni audio.

Gotowy, aby tworzyć?

Zacznij generować świetne treści z AI

Zacznij za darmo