Eleven v3 音訊標記:指揮有表情的 AI 語音
學會怎麼用 ElevenLabs v3 的音訊標記——寫在方括號裡的情緒、語氣、口音和角色提示——在 OmniArt 上指揮有表情的 AI 語音演出。

大多數文字轉語音工具每次唸稿的方式都一樣:平、勻,還帶一點機械感。Eleven v3 不一樣。它讀得懂你腳本裡的情緒質地,而且用音訊標記,你可以給它明確的指示——就像配音導演在錄之前對演員下的提示。
音訊標記是直接嵌在腳本裡、寫在方括號中的短詞或短語。它們告訴模型下一句該怎麼唸:用氣音講、吼出來、加上英國腔,或是在句子中間用一聲嘆息斷開。這篇指南涵蓋 OmniArt 上完整的標記詞彙、怎麼寫用得上它們的多角色腳本,以及怎麼判斷什麼時候 Eleven v3 才是對的模型。
音訊標記是什麼
音訊標記是放在方括號裡的行內指示提示——[whispers]、[excited]、[British accent]——擺在腳本裡你想要語氣改變的那個位置。Eleven v3 會把它們解析成指令而不是要唸出來的字,並據此調整語調、節奏和情緒。
它跟舊式 TTS 最關鍵的差別,是 v3 會詮釋上下文。它不只是套一層無差別的濾鏡:它會拿標記去對照周圍的句子權衡,所以 [sighs] 放在 "I suppose you're right" 前面,跟放在 "Fine, let's go." 前面,出來的結果不一樣。正是這種對上下文的敏感度,讓有標記的腳本聽起來像被導過,而不是被處理過。
小技巧
音訊標記詞彙
下面的表格把每一大類標記連同例子整理出來。這些都是 Eleven v3 在 OmniArt 上會穩定回應的提示。
情緒標記
| 標記 | 效果 |
|---|---|
[excited] | 能量升高、節奏變快、音色變亮 |
[sad] | 更慢、更低、更收斂 |
[angry] | 短促、有力、音量提高 |
[nervous] | 節奏略微不勻,整體變輕 |
[happy] | 溫暖、上揚、共鳴開闊 |
[tired] | 更慢、更平、用力更少 |
[afraid] | 緊繃、克制、氣息變少 |
[disgusted] | 情緒平板,帶一點嫌惡 |
[surprised] | 起音音高變高,句子變短 |
語氣標記
| 標記 | 效果 |
|---|---|
[whispers] | 氣音、低音量、貼近 |
[shouting] | 高音量、送得出去、共鳴開闊 |
[pause] | 在這裡插入自然的停頓或斷點 |
[slowly] | 拉長速度,不改變音高 |
[fast] | 壓縮速度,能量升高 |
[sighs] | 在片語開頭織進一聲聽得見的吐氣 |
[laughs] | 在句子前面或句中加一聲自然的短笑 |
[crying] | 讓語氣帶著破碎、濕潤的質地 |
角色與人設標記
| 標記 | 效果 |
|---|---|
[pirate voice] | 戲劇化、帶喉音、誇張的抑揚 |
[robot voice] | 短促、單調、合成質地 |
[narrator] | 權威、勻速、紀錄片的語域 |
[announcer] | 送得出去、正式、播報等級 |
[childlike] | 音高較高、斷句較短、俏皮 |
口音標記
| 標記 | 效果 |
|---|---|
[British accent] | 標準英式發音的質地 |
[Southern US accent] | 溫暖、拉長的母音 |
[Australian accent] | 句尾上揚的語調 |
[Irish accent] | 富旋律感,母音圓化很有辨識度 |
[New York accent] | 短促的子音,中頻帶鼻音 |
說明
標記速查表
| 用途 | 範例標記 |
|---|---|
| 情緒——正向 | [excited]、[happy]、[surprised] |
| 情緒——負向 | [sad]、[angry]、[tired]、[afraid]、[nervous] |
| 音量/投射 | [whispers]、[shouting] |
| 速度 | [slowly]、[fast] |
| 自然聲響 | [sighs]、[laughs]、[crying]、[pause] |
| 角色語域 | [pirate voice]、[robot voice]、[narrator]、[announcer]、[childlike] |
| 口音 | [British accent]、[Southern US accent]、[Australian accent]、[Irish accent]、[New York accent] |
寫一份帶標記的腳本:兩個例子
例子 1——有情緒的敘述
這是一段有聲書章節的短開場。標記會隨著場景推進轉換情緒。
[narrator] The city had been quiet for three days.
[slowly] Not the quiet of peace — [pause] the quiet of waiting.
[tired] Maya poured her fourth cup of coffee and stared at the map pinned to the wall.
[whispers] They had to be out there somewhere.
[sighs] She just needed one more lead.
[narrator] 標記從一開始就定下勻速的語域。[slowly] 配上一個 [pause] 撐出戲劇空間。[tired] 讓語氣垮下來,接著 [whispers] 把它拉得又低又貼近。[sighs] 加進一次生理上的呼吸,讓最後一句聽起來是掙來的。
例子 2——兩個角色的對白
Eleven v3 可以從單一提示詞處理多說話者的朗讀。用角色標籤和語氣標記把每個聲音區分開來。
CAPTAIN (VOICE A): [excited] We found it. [pause] The actual coordinates — right where the old chart said they'd be.
FIRST MATE (VOICE B): [nervous] Sir, that chart is four hundred years old. Half of it is sea monsters drawn by someone who'd never left port.
CAPTAIN (VOICE A): [laughs] Exactly! [fast] Which means no one else thought it was worth following. Get the crew up.
FIRST MATE (VOICE B): [sighs] [slowly] Aye, captain.
小技巧
怎麼在 OmniArt 上使用音訊標記
- 進到音訊模式,選 Speech 分頁。
- 在模型選單裡選 Eleven v3。 它在 Starter 級距以上可用。
- 挑一個聲音預設。 OmniArt 在各語音模型上共有 353 個精選聲音。按性別和風格瀏覽——較低沉、較有權威感的預設適合敘述;較亮、中音域的預設對強烈的情緒標記反應很好。
- 把你帶標記的腳本貼進提示詞欄位。 Eleven v3 每次生成最多接受 5,000 個字元。
- 設定語言,對上你的腳本。
- 生成並試聽。 如果某個標記套過頭或套得不夠,就調整它的位置、加另一個標記重置語氣,或換一個聲音預設試試。
計費是每起算 50 個字元 1 點數。一份 500 字元的腳本要 10 點數;一份 5,000 字元的腳本要 100 點數。不足 50 字元的區塊無條件進位。
注意
什麼時候用 Eleven v3,什麼時候用其他語音模型
OmniArt 上有三個 ElevenLabs 模型。以下是各自該出場的時機。
| 情境 | 最佳模型 | 原因 |
|---|---|---|
| 情緒起伏大的演出——一個會笑、會哭、會吼的角色 | Eleven v3 | 音訊標記加上對上下文的理解,給得出最大的表現幅度 |
| 穩定的多語言敘述(50 種以上語言) | Eleven Multilingual v2 | 跨語言語氣一致且勻稱;每次生成 10,000 字元 |
| 長腳本又要快速交件 | Eleven Turbo v2.5 | 低延遲;每次生成 40,000 字元,每 100 字元 1 點數 |
| 預算吃緊,或要用 Free 方案生成 | MiniMax Speech 2.8 HD/Turbo | Free 方案可用;HD 收成片畫質,Turbo 打草稿 |
一個好用的心智模型:當腳本要的是一段演出、語氣本身就在承載意義時,用 v3。當目標是跨多種語言都清楚好跟的敘述時,用 Multilingual v2。當你手上是一份長而相對中性的腳本、又需要快點拿到結果時,用 Turbo v2.5。
完整規格請看各自的模型頁:Eleven v3、Eleven Multilingual v2、Eleven Turbo v2.5。
該避開的常見標記錯誤
**標記過量:**每一句都加標記,反而會把變化壓平。情緒標記在一段沒有標記的自然語氣之後出現,力道才夠。把它們用在高峰和轉折上,不要當成一層恆常的濾鏡。
互相矛盾的標記:[shouting] 後面緊接著 [whispers]、中間沒有隔一句,可能會讓模型混亂。在強烈對比之間留一句中性語氣。
**沒有測試就用口音標記:**口音的呈現取決於基礎聲音預設。在整份長腳本套用口音標記之前,先跑一句 50 字元的測試。
**標記卡在字中間:**標記必須落在完整的字或標點之間,不能塞進一個字裡面。Incre[excited]dible 解析不出來——請改寫成 [excited] Incredible。
最受用的使用情境
**多角色有聲書:**聲音預設加語氣標記的組合,讓你把敘述者和角色區分開來,並給每個角色一個一致的情緒簽名。想看一整套音訊製作怎麼搭起來,可以看 MiniMax Speech 配音指南裡的類似流程。
**遊戲對白和互動小說:**短而有力、標記強烈的台詞——[afraid] Stay back!、[laughs] You call that a plan?——不用找專門的配音員也能做出可信的 NPC。
**有情緒起伏的 YouTube 敘述:**一支在戲劇性揭示、幽默旁白和安靜省思之間來回的紀錄片或解說片,很受用於語氣的切換。把轉折標起來,節奏就自己寫好了。
**對白驅動的內容和預告片:**一次生成裡朗讀兩三個角色,各自靠聲音預設和標記區分,把一場對白戲壓縮成一個流程步驟。
在 OmniArt 上開始
最快培養出對 v3 的耳感的方法,是拿一份你很熟的腳本——一段獨白、一篇短篇小說的開頭、幾句遊戲對白——標記兩次:一次輕度標記,一次做大幅度的語氣切換。兩份都生成出來,然後比。輕度指揮和完整指揮的差別,通常第一句就聽得出來。
打開 OmniArt 上的 Eleven v3,貼上你的第一份帶標記腳本。從上面那個有情緒的敘述例子開始,換掉聲音預設,看看有什麼變化。等標記詞彙用起來變得自然,這個模型就會像一場真正的錄音一樣有反應——只是不用進錄音室。
想更全面了解 OmniArt 上的每一個音訊模型,包括音樂和音效,可以看完整的音訊工作台指南。
準備好開始創作了嗎?
用 AI 生成精彩內容