TutorialУроки та покрокові посібники8 хв читання

Аудіотеги Eleven v3: як режисувати виразні ШІ-голоси

Дізнайтеся, як користуватися аудіотегами ElevenLabs v3 — вказівками щодо емоції, подачі, акценту й персони у квадратних дужках — щоб режисувати виразну гру ШІ-голосу в OmniArt.

Команда OmniArt
Аудіотеги Eleven v3: як режисувати виразні ШІ-голоси

Більшість інструментів синтезу мовлення читають сценарій щоразу однаково: пласко, розмірено й трохи механічно. Eleven v3 інша. Вона розуміє емоційну фактуру вашого сценарію, а за допомогою аудіотегів ви можете дати їй явні вказівки — так само, як режисер озвучення підказує акторові перед дублем.

Аудіотеги — це короткі слова чи фрази у квадратних дужках, вписані просто у ваш сценарій. Вони кажуть моделі, як подати наступний рядок: прошепотіти, вигукнути, забарвити британським акцентом чи розірвати посеред речення зітханням. Цей посібник охоплює повний словник тегів, доступний в OmniArt, показує, як писати сценарії на кілька персонажів із їх використанням, і допомагає вирішити, коли Eleven v3 — правильна модель для завдання.

Що таке аудіотеги?

Аудіотеги — це вбудовані вказівки у квадратних дужках: [whispers], [excited], [British accent] — поставлені в тому місці сценарію, де подача має змінитися. Eleven v3 розбирає їх як інструкції, а не як слова для промовляння, і відповідно коригує тон, темп та афект.

Ключова відмінність від старіших систем синтезу мовлення в тому, що v3 враховує контекст. Вона не просто накидає суцільний фільтр: вона зважує тег проти навколишнього речення, тож [sighs] перед «I suppose you're right» дає інший результат, ніж [sighs] перед «Fine, let's go». Саме ця чутливість до контексту робить розмічені сценарії зрежисованими, а не обробленими.

Порада

Ставте тег безпосередньо перед фразою, на яку він має вплинути. Тег на початку абзацу керує подачею аж до наступного тега або до природного тонального скидання.

Словник аудіотегів

Таблиця нижче впорядковує всі основні категорії тегів із прикладами. Це вказівки, на які Eleven v3 надійно реагує в OmniArt.

Теги емоцій

ТегЕфект
[excited]Піднята енергія, швидший темп, світліший тон
[sad]Повільніша, нижча, стриманіша подача
[angry]Уривчасто, напористо, гучніше
[nervous]Дещо нерівний темп, загалом тихіше
[happy]Тепло, піднесено, відкритий резонанс
[tired]Повільніше, пласкіше, з меншим зусиллям
[afraid]Напружено, стримано, менше дихання
[disgusted]Плаский афект із легкою зневагою
[surprised]Вищий старт висоти, коротша фраза

Теги подачі

ТегЕфект
[whispers]Придихово, тихо, інтимно
[shouting]Гучно, з посилом, широкий резонанс
[pause]Тут вставляється природна пауза чи розрив
[slowly]Розтягнутий темп без зміни висоти
[fast]Стиснутий темп, більше енергії
[sighs]Чутний видих, вплетений у початок фрази
[laughs]Додає короткий природний сміх перед рядком або в ньому
[crying]Надламана, «мокра» якість подачі

Теги персонажів і персон

ТегЕфект
[pirate voice]Театрально, з гарчанням, перебільшена ритміка
[robot voice]Уривчасто, монотонно, синтетично
[narrator]Авторитетно, розмірено, документальний регістр
[announcer]З посилом, формально, ефірна якість
[childlike]Вища висота, коротші фрази, грайливо

Теги акцентів

ТегЕфект
[British accent]Якість Received Pronunciation
[Southern US accent]Теплі, розтягнуті голосні
[Australian accent]Висхідна інтонація наприкінці фрази
[Irish accent]Мелодійність, характерне огублення голосних
[New York accent]Уривчасті приголосні, носовий середній регістр

Примітка

Теги акцентів накладаються поверх базового голосового пресета. Результати різняться залежно від пресета — одні голоси реагують сильніше за інші. Згенеруйте короткий тестовий рядок, перш ніж братися за повний сценарій.

Шпаргалка з тегів

ПризначенняПриклади тегів
Емоція — позитивна[excited], [happy], [surprised]
Емоція — негативна[sad], [angry], [tired], [afraid], [nervous]
Гучність і посил[whispers], [shouting]
Темп[slowly], [fast]
Природні звуки[sighs], [laughs], [crying], [pause]
Регістр персонажа[pirate voice], [robot voice], [narrator], [announcer], [childlike]
Акцент[British accent], [Southern US accent], [Australian accent], [Irish accent], [New York accent]

Як написати розмічений сценарій: два приклади

Приклад 1 — емоційна начитка

Це короткий початок розділу аудіокниги. Теги змінюють настрій разом зі сценою.

[narrator] The city had been quiet for three days.

[slowly] Not the quiet of peace — [pause] the quiet of waiting.

[tired] Maya poured her fourth cup of coffee and stared at the map pinned to the wall.

[whispers] They had to be out there somewhere.

[sighs] She just needed one more lead.

Тег [narrator] задає розмірений регістр від самого початку. [slowly] разом із [pause] створює драматичний простір. [tired] пригнічує подачу, а [whispers] стягує її вниз і робить інтимною. [sighs] додає фізичне дихання, завдяки якому останній рядок звучить заслужено.

Приклад 2 — діалог двох персонажів

Eleven v3 тягне начитку кількома голосами з одного промпту. Використовуйте позначки персонажів і теги подачі, щоб розрізнити голоси.

CAPTAIN (VOICE A): [excited] We found it. [pause] The actual coordinates — right where the old chart said they'd be.

FIRST MATE (VOICE B): [nervous] Sir, that chart is four hundred years old. Half of it is sea monsters drawn by someone who'd never left port.

CAPTAIN (VOICE A): [laughs] Exactly! [fast] Which means no one else thought it was worth following. Get the crew up.

FIRST MATE (VOICE B): [sighs] [slowly] Aye, captain.

Порада

Для сценаріїв на кілька персонажів беріть два голосові пресети з виразно різними базовими регістрами — один нижчий, другий світліший, — щоб персонажі розрізнялися навіть без візуальних позначок мовця в аудіо.

Як користуватися аудіотегами в OmniArt

  1. Перейдіть у режим «Аудіо» й виберіть вкладку «Мовлення».
  2. Виберіть Eleven v3 у меню моделей. Вона доступна на тарифі Starter і вище.
  3. Виберіть голосовий пресет. OmniArt пропонує 353 дібрані голоси в моделях мовлення. Гортайте за статтю та стилем: нижчі, авторитетніші пресети добре працюють для начитки, а світліші, середнього регістру, добре відгукуються на сильні теги емоцій.
  4. Вставте свій розмічений сценарій у поле промпту. Eleven v3 приймає до 5 000 символів на генерацію.
  5. Виберіть мову, яка відповідає вашому сценарію.
  6. Згенеруйте й прослухайте. Якщо тег спрацював надто сильно або надто слабко, змініть його позицію, додайте ще один тег, щоб скинути подачу, або спробуйте інший голосовий пресет.

Списання йде по 1 кредиту за кожні розпочаті 50 символів. Сценарій на 500 символів коштує 10 кредитів; сценарій на 5 000 символів — 100 кредитів. Неповні блоки по 50 символів округлюються вгору.

Попередження

OmniArt не пропонує клонування голосу, повзунків швидкості чи керування висотою для Eleven v3. Уся варіативність подачі йде з тексту сценарію та аудіотегів.

Коли брати Eleven v3, а коли інші моделі мовлення

В OmniArt доступні три моделі ElevenLabs. Ось коли варто братися за кожну.

СценарійНайкраща модельПричина
Емоційно різнопланова гра — персонаж, який сміється, плаче, кричитьEleven v3Аудіотеги й чутливість до контексту дають найширший виразний діапазон
Стабільна багатомовна начитка (50+ мов)Eleven Multilingual v2Рівна, стала подача в різних мовах; 10 000 символів на генерацію
Довгі сценарії зі швидким результатомEleven Turbo v2.5Низька затримка; 40 000 символів на генерацію по 1 кредиту за 100 символів
Ощадливий варіант або генерація на тарифі FreeMiniMax Speech 2.8 HD / TurboДоступні на тарифі Free; HD для чистового результату, Turbo для чернеток

Корисна ментальна модель: беріть v3, коли сценарій вимагає гри і сама подача несе зміст. Беріть Multilingual v2, коли мета — зрозуміла начитка, яку легко слухати багатьма мовами. Беріть Turbo v2.5, коли у вас довгий і відносно нейтральний сценарій, а результат потрібен швидко.

Повні характеристики — на окремих сторінках моделей: Eleven v3, Eleven Multilingual v2, Eleven Turbo v2.5.

Поширені помилки в розмітці, яких варто уникати

Надмір тегів: тег у кожному реченні згладжує варіативність. Теги емоцій б’ють сильніше, коли з’являються після відрізка нерозміченої, природної подачі. Використовуйте їх для піків і переходів, а не як постійний шар.

Суперечливі теги: [shouting] одразу після [whispers] без речення між ними здатне збити модель. Залишайте одне речення нейтральної подачі між сильними контрастами.

Теги акценту без тесту: відтворення акценту залежить від базового голосового пресета. Проженіть тестовий рядок на 50 символів, перш ніж застосовувати тег акценту до довгого сценарію.

Теги всередині слова: теги мають стояти між цілими словами або біля розділових знаків, а не всередині слова. Incre[excited]dible розібрати не вдасться — пишіть натомість [excited] Incredible.

Сценарії, яким це дає найбільше

Аудіокниги з кількома персонажами: поєднання голосових пресетів і тегів подачі дає змогу відрізнити оповідача від персонажа й дати кожному персонажеві сталий емоційний підпис. Як побудувати повноцінне аудіовиробництво, показано в посібнику з озвучення на MiniMax Speech — процес там порівнянний.

Ігрові діалоги та інтерактивна проза: короткі влучні рядки із сильними тегами — [afraid] Stay back!, [laughs] You call that a plan? — створюють переконливих NPC без залучення акторів озвучення.

Начитка для YouTube з емоційним діапазоном: документальний чи пояснювальний матеріал, що рухається між драматичними відкриттями, гумористичними відступами й тихою рефлексією, виграє від змін подачі. Розмітьте переходи — і темп напишеться сам.

Медіа та трейлери, побудовані на діалозі: дві-три персонажні начитки з однієї генерації, кожна відрізнена голосовим пресетом і тегами, стискають діалогову сцену в один крок процесу.

Із чого почати в OmniArt

Найшвидший спосіб виробити слух на можливості v3 — узяти добре знайомий вам сценарій (монолог, початок оповідання, кілька рядків ігрового діалогу) і розмітити його двічі: один раз легко, другий — з агресивними змінами подачі. Згенеруйте обидва й порівняйте. Різниця між ледь зрежисованим і повністю зрежисованим сценарієм зазвичай очевидна вже з першого речення.

Відкрийте Eleven v3 в OmniArt і вставте свій перший розмічений сценарій. Почніть із прикладу емоційної начитки вище, змініть голосовий пресет і подивіться, що зміниться. Щойно словник тегів стане звичним, модель почне відгукуватися, як справжня сесія звукозапису, — тільки без студії.

Ширший огляд усіх аудіомоделей, доступних в OmniArt, разом із музикою та звуковими ефектами — у повному посібнику з аудіопростору.

Готові творити?

Почніть створювати вражаючий контент зі ШІ

Почати безкоштовно