Tutorial教學與操作指南閱讀時間 13 分鐘

Eleven v3 音訊標記:指揮有表情的 AI 語音

學會怎麼用 ElevenLabs v3 的音訊標記——寫在方括號裡的情緒、語氣、口音和角色提示——在 OmniArt 上指揮有表情的 AI 語音演出。

OmniArt 團隊
Eleven v3 音訊標記:指揮有表情的 AI 語音

大多數文字轉語音工具每次唸稿的方式都一樣:平、勻,還帶一點機械感。Eleven v3 不一樣。它讀得懂你腳本裡的情緒質地,而且用音訊標記,你可以給它明確的指示——就像配音導演在錄之前對演員下的提示。

音訊標記是直接嵌在腳本裡、寫在方括號中的短詞或短語。它們告訴模型下一句該怎麼唸:用氣音講、吼出來、加上英國腔,或是在句子中間用一聲嘆息斷開。這篇指南涵蓋 OmniArt 上完整的標記詞彙、怎麼寫用得上它們的多角色腳本,以及怎麼判斷什麼時候 Eleven v3 才是對的模型。

音訊標記是什麼

音訊標記是放在方括號裡的行內指示提示——[whispers][excited][British accent]——擺在腳本裡你想要語氣改變的那個位置。Eleven v3 會把它們解析成指令而不是要唸出來的字,並據此調整語調、節奏和情緒。

它跟舊式 TTS 最關鍵的差別,是 v3 會詮釋上下文。它不只是套一層無差別的濾鏡:它會拿標記去對照周圍的句子權衡,所以 [sighs] 放在 "I suppose you're right" 前面,跟放在 "Fine, let's go." 前面,出來的結果不一樣。正是這種對上下文的敏感度,讓有標記的腳本聽起來像被導過,而不是被處理過。

小技巧

把標記緊接在它要影響的那個片語前面。放在段落開頭的標記,會一直管到下一個標記或一次自然的語氣重置為止。

音訊標記詞彙

下面的表格把每一大類標記連同例子整理出來。這些都是 Eleven v3 在 OmniArt 上會穩定回應的提示。

情緒標記

標記效果
[excited]能量升高、節奏變快、音色變亮
[sad]更慢、更低、更收斂
[angry]短促、有力、音量提高
[nervous]節奏略微不勻,整體變輕
[happy]溫暖、上揚、共鳴開闊
[tired]更慢、更平、用力更少
[afraid]緊繃、克制、氣息變少
[disgusted]情緒平板,帶一點嫌惡
[surprised]起音音高變高,句子變短

語氣標記

標記效果
[whispers]氣音、低音量、貼近
[shouting]高音量、送得出去、共鳴開闊
[pause]在這裡插入自然的停頓或斷點
[slowly]拉長速度,不改變音高
[fast]壓縮速度,能量升高
[sighs]在片語開頭織進一聲聽得見的吐氣
[laughs]在句子前面或句中加一聲自然的短笑
[crying]讓語氣帶著破碎、濕潤的質地

角色與人設標記

標記效果
[pirate voice]戲劇化、帶喉音、誇張的抑揚
[robot voice]短促、單調、合成質地
[narrator]權威、勻速、紀錄片的語域
[announcer]送得出去、正式、播報等級
[childlike]音高較高、斷句較短、俏皮

口音標記

標記效果
[British accent]標準英式發音的質地
[Southern US accent]溫暖、拉長的母音
[Australian accent]句尾上揚的語調
[Irish accent]富旋律感,母音圓化很有辨識度
[New York accent]短促的子音,中頻帶鼻音

說明

口音標記是疊在基礎聲音預設上的。結果依預設而異——有些聲音的反應比其他的強。在整份腳本上路之前,先生成一句短的測試看看。

標記速查表

用途範例標記
情緒——正向[excited][happy][surprised]
情緒——負向[sad][angry][tired][afraid][nervous]
音量/投射[whispers][shouting]
速度[slowly][fast]
自然聲響[sighs][laughs][crying][pause]
角色語域[pirate voice][robot voice][narrator][announcer][childlike]
口音[British accent][Southern US accent][Australian accent][Irish accent][New York accent]

寫一份帶標記的腳本:兩個例子

例子 1——有情緒的敘述

這是一段有聲書章節的短開場。標記會隨著場景推進轉換情緒。

[narrator] The city had been quiet for three days.

[slowly] Not the quiet of peace — [pause] the quiet of waiting.

[tired] Maya poured her fourth cup of coffee and stared at the map pinned to the wall.

[whispers] They had to be out there somewhere.

[sighs] She just needed one more lead.

[narrator] 標記從一開始就定下勻速的語域。[slowly] 配上一個 [pause] 撐出戲劇空間。[tired] 讓語氣垮下來,接著 [whispers] 把它拉得又低又貼近。[sighs] 加進一次生理上的呼吸,讓最後一句聽起來是掙來的。

例子 2——兩個角色的對白

Eleven v3 可以從單一提示詞處理多說話者的朗讀。用角色標籤和語氣標記把每個聲音區分開來。

CAPTAIN (VOICE A): [excited] We found it. [pause] The actual coordinates — right where the old chart said they'd be.

FIRST MATE (VOICE B): [nervous] Sir, that chart is four hundred years old. Half of it is sea monsters drawn by someone who'd never left port.

CAPTAIN (VOICE A): [laughs] Exactly! [fast] Which means no one else thought it was worth following. Get the crew up.

FIRST MATE (VOICE B): [sighs] [slowly] Aye, captain.

小技巧

做多角色腳本時,挑兩個基礎語域明顯不同的聲音預設——一個較低沉,一個較輕亮——這樣就算音訊輸出裡沒有可見的說話者標籤,角色的區別也聽得出來。

怎麼在 OmniArt 上使用音訊標記

  1. 進到音訊模式,選 Speech 分頁。
  2. 在模型選單裡選 Eleven v3。 它在 Starter 級距以上可用。
  3. 挑一個聲音預設。 OmniArt 在各語音模型上共有 353 個精選聲音。按性別和風格瀏覽——較低沉、較有權威感的預設適合敘述;較亮、中音域的預設對強烈的情緒標記反應很好。
  4. 把你帶標記的腳本貼進提示詞欄位。 Eleven v3 每次生成最多接受 5,000 個字元。
  5. 設定語言,對上你的腳本。
  6. 生成並試聽。 如果某個標記套過頭或套得不夠,就調整它的位置、加另一個標記重置語氣,或換一個聲音預設試試。

計費是每起算 50 個字元 1 點數。一份 500 字元的腳本要 10 點數;一份 5,000 字元的腳本要 100 點數。不足 50 字元的區塊無條件進位。

注意

OmniArt 沒有替 Eleven v3 提供聲音複製、速度滑桿或音高控制項。所有語氣變化都來自腳本文字和音訊標記。

什麼時候用 Eleven v3,什麼時候用其他語音模型

OmniArt 上有三個 ElevenLabs 模型。以下是各自該出場的時機。

情境最佳模型原因
情緒起伏大的演出——一個會笑、會哭、會吼的角色Eleven v3音訊標記加上對上下文的理解,給得出最大的表現幅度
穩定的多語言敘述(50 種以上語言)Eleven Multilingual v2跨語言語氣一致且勻稱;每次生成 10,000 字元
長腳本又要快速交件Eleven Turbo v2.5低延遲;每次生成 40,000 字元,每 100 字元 1 點數
預算吃緊,或要用 Free 方案生成MiniMax Speech 2.8 HD/TurboFree 方案可用;HD 收成片畫質,Turbo 打草稿

一個好用的心智模型:當腳本要的是一段演出、語氣本身就在承載意義時,用 v3。當目標是跨多種語言都清楚好跟的敘述時,用 Multilingual v2。當你手上是一份長而相對中性的腳本、又需要快點拿到結果時,用 Turbo v2.5。

完整規格請看各自的模型頁:Eleven v3Eleven Multilingual v2Eleven Turbo v2.5

該避開的常見標記錯誤

**標記過量:**每一句都加標記,反而會把變化壓平。情緒標記在一段沒有標記的自然語氣之後出現,力道才夠。把它們用在高峰和轉折上,不要當成一層恆常的濾鏡。

互相矛盾的標記:[shouting] 後面緊接著 [whispers]、中間沒有隔一句,可能會讓模型混亂。在強烈對比之間留一句中性語氣。

**沒有測試就用口音標記:**口音的呈現取決於基礎聲音預設。在整份長腳本套用口音標記之前,先跑一句 50 字元的測試。

**標記卡在字中間:**標記必須落在完整的字或標點之間,不能塞進一個字裡面。Incre[excited]dible 解析不出來——請改寫成 [excited] Incredible

最受用的使用情境

**多角色有聲書:**聲音預設加語氣標記的組合,讓你把敘述者和角色區分開來,並給每個角色一個一致的情緒簽名。想看一整套音訊製作怎麼搭起來,可以看 MiniMax Speech 配音指南裡的類似流程。

**遊戲對白和互動小說:**短而有力、標記強烈的台詞——[afraid] Stay back![laughs] You call that a plan?——不用找專門的配音員也能做出可信的 NPC。

**有情緒起伏的 YouTube 敘述:**一支在戲劇性揭示、幽默旁白和安靜省思之間來回的紀錄片或解說片,很受用於語氣的切換。把轉折標起來,節奏就自己寫好了。

**對白驅動的內容和預告片:**一次生成裡朗讀兩三個角色,各自靠聲音預設和標記區分,把一場對白戲壓縮成一個流程步驟。

在 OmniArt 上開始

最快培養出對 v3 的耳感的方法,是拿一份你很熟的腳本——一段獨白、一篇短篇小說的開頭、幾句遊戲對白——標記兩次:一次輕度標記,一次做大幅度的語氣切換。兩份都生成出來,然後比。輕度指揮和完整指揮的差別,通常第一句就聽得出來。

打開 OmniArt 上的 Eleven v3,貼上你的第一份帶標記腳本。從上面那個有情緒的敘述例子開始,換掉聲音預設,看看有什麼變化。等標記詞彙用起來變得自然,這個模型就會像一場真正的錄音一樣有反應——只是不用進錄音室。

想更全面了解 OmniArt 上的每一個音訊模型,包括音樂和音效,可以看完整的音訊工作台指南

準備好開始創作了嗎?

用 AI 生成精彩內容

免費開始