YouTube 影片的 AI 配音:一套創作者的工作流程
用 OmniArt 上的 AI 語音模型,把你的腳本變成打磨過的 YouTube 旁白——模型怎麼挑、多語配音怎麼做、節奏怎麼調,還有一個點數成本試算。

以前要拿到一段打磨過的配音,意思是租錄音室、找配音員,或是妥協用 2012 年那種機器人腔的文字轉語音。這幾條路都放不大。OmniArt 上的 AI 語音模型讓你從一段文字就拿到錄音室等級的旁白——挑一個聲音預設、貼上腳本,幾秒鐘就有一個完成的音檔。這份指南會走完整套流程:怎麼寫給耳朵聽的腳本、怎麼挑對模型、怎麼控制語氣,還有怎麼不離開平台就把影片做完。
簡短版:句子寫短、挑一個高保真的語音模型、在 OmniArt 的音訊工作台生成、用標點和行內提示反覆調,然後把音訊鋪到畫面下面。長版在下面。
步驟 1:把腳本寫給耳朵聽
YouTube 腳本不是文章。觀眾沒辦法回頭重看一句話——他們要嘛跟得上,要嘛跟不上。所以:
- **句子寫短。**一句一個想法。能控制在 15 個字以內最好。
- 放路標。「先……然後……最後……」讓聽的人不用目錄也知道自己走到哪。
- 不要塞子句。「這個模型,它是用多語資料訓練的、而且支援行內插入語,語氣處理得很好」在 1.25 倍速下根本聽不懂。拆開它。
- **唸出來。**你會卡的地方,模型也會卡。改到唸起來順為止。
- 寫給你的聽眾,不是寫你的主題。「你會想選 HD 那個模型」比「創作者應該考慮 HD 模型」溫暖多了。
一份 1,500 字元的 Shorts 腳本大約是 90 秒的旁白。這是個好用的校準基準。
步驟 2:挑模型
OmniArt 給你五個各有專長的語音模型。要按任務配模型,不是按你熟不熟。
| 模型 | 方案 | 字元上限 | 費用 | 適合 |
|---|---|---|---|---|
| MiniMax Speech 2.8 HD | Free | 10,000 字元 | 每起算 50 字元 1 點數 | 打磨過的旁白、長篇論述 |
| MiniMax Speech 2.8 Turbo | Free | 10,000 字元 | 每 100 字元 1 點數 | 快速草稿、測試不同句子 |
| Eleven Multilingual v2 | Starter | 10,000 字元 | 每次 50 點數 | 多語配音、在地化頻道 |
| Eleven v3 | Starter | 5,000 字元 | 每次 50 點數 | 用音訊標記做出有表情的演繹 |
| Eleven Turbo v2.5 | Starter | 40,000 字元 | 每次 100 點數 | 一次跑完整支長影片論述 |
MiniMax Speech 2.8 HD 是打磨過的 YouTube 旁白的預設選擇。它在盲聽比較裡名次很前面,長篇內容也處理得很乾淨。成品那幾條用它。
MiniMax Speech 2.8 Turbo 把點數砍一半,快到你可以在一次工作階段裡測二十種開場。用 Turbo 打草稿,用 HD 定稿。
Eleven Multilingual v2 是替國際觀眾配音時該用的模型。它跨語言維持穩定的語氣和節奏——如果你在做同一支影片的在地化版本,這一點很有用。
Eleven v3 解鎖了 [excited]、[whispers] 這類方括號音訊標記,能做出標點做不到的語氣塑形。當腳本需要其他模型碰不到的情緒幅度時,找它。
Eleven Turbo v2.5 一次可以吃到 40,000 字元的腳本——那是一支 45 分鐘紀錄片的旁白量。如果你的影片論述很長,這是唯一不用把腳本切塊就能處理的模型。
小技巧
步驟 3:在音訊工作台生成
- 打開 OmniArt 的音訊工作台。
- 從模型選單裡選一個語音模型。
- 挑一個聲音預設。多試聽幾個;預設是決定成品感覺的最大變因。
- 把腳本貼進提示詞欄位。
- 生成,然後聽。
第一條是基準線,不是成品。你要聽的是節奏、重音,還有不自然的停頓——這些下一步都可以修。
步驟 4:用標點和插入語調整演繹
你沒辦法按一個「讓它聽起來不要那麼平」的按鈕,但你可以改腳本來引導演繹。
**標點決定節奏。**逗號製造短促的節拍。破折號——像這樣——加上半拍停頓,感覺跟逗號不一樣。刪節號……製造遲疑。句號把一個想法完整收掉。這些要刻意用,不是照文法用。
**問號會觸發自然的上揚語調。**如果一句話結尾該往上抬,就算內容是陳述句,也把它寫成問句:用「在想該用哪個模型?」而不是「本節說明模型選擇」。
**大寫代表重音。**在大多數模型裡,「This is IMPORTANT」或「You need to pick the RIGHT voice」會把大寫的那個字強調出來。少用,用多了會像在吼。
MiniMax HD 的行內插入語讓你用括號記法在腳本中間插入情緒提示:(laughs)、(sighs)、(clears throat)。這些會在下一句之前帶出一個自然的聲音。
Eleven v3 的音訊標記用方括號:[excited]、[whispers]、[dramatic pause]。把它們直接放在該受影響的那句話前面。
說明
實例試算:一份 Shorts 腳本要花多少點數
一份典型的 YouTube Shorts 旁白大約 1,500 字元。用 MiniMax Speech 2.8 HD 來算,它是每起算 50 個字元收 1 點數:
- 1,500 字元 ÷ 每塊 50 字元 = 30 塊
- 30 塊 × 1 點數 = 整段 Shorts 旁白 30 點數
如果你用 Turbo 打草稿(每 100 字元 1 點數),同一份腳本每跑一輪是 15 點數。跑十輪草稿、挑出最好的,再用 HD 定稿花 30 點數。總計:大約 180 點數就能找到並完成一段打磨過的旁白。
給國際觀眾的多語配音
把 YouTube 頻道推到單一語言之外是一個複利式的賭注:同一支影片配成西班牙文、葡萄牙文或日文,就能觸及不同的觀眾,而除了旁白之外沒有額外的製作成本。
流程是一樣的:
- 翻譯你的腳本(用翻譯工具、找雙語的夥伴,或用模型跑一輪再請母語者審過)。
- 回到 OmniArt 音訊,選 Eleven Multilingual v2。
- 挑一個適合目標語言的聲音預設——有幾個預設有標語言或地區。
- 貼上翻譯好的腳本,生成。
Eleven Multilingual v2 會跨語言維持一致的節奏和演繹,當配音必須對上按原本時間點剪好的畫面時,這一點很關鍵。
注意
在 OmniArt 裡把影片做完
旁白拿到之後,剩下的製作可以留在同一個工作台裡。
- 畫面——用 OmniArt 任何一個影片模型生成 B-roll 片段。照旁白的節奏剪:一句換一顆鏡頭,比較複雜的段落就讓鏡頭久一點。
- 音樂——用 MiniMax Music 2.6 或 Lyria 3 Pro 加上背景配樂。音樂床壓在旁白下方約 −18 dB,能加上存在感又不會打架。
- 音效——替轉場和需要強調的時刻生成音效。流程可以看 AI 音效生成器指南。
在同一個地方跨模態工作,核心的好處是迭代:改旁白、重生成夾在它前後的音效、順手調整音樂點,全部在同一次工作階段裡完成——而不是在三個工具和一堆檔案輸出之間來回跑。
專門講短影音的部分,可以看 TikTok 和 YouTube Shorts 的 AI 影片,那份直式優先的影片流程跟這一份是一對的。
在 OmniArt 開始
寫一份 1,500 字元的腳本——一段 Shorts 長度的旁白。打開 OmniArt 的音訊工作台,選 MiniMax Speech 2.8 HD,逛一逛聲音預設,生成第一條。聽節奏和重音,用標點改腳本,再跑第二輪。大多數旁白兩三條就完成了。接下來生成對得上的畫面、加一層音樂床,一支完整的影片就在同一個地方做好了。
準備好開始創作了嗎?
用 AI 生成精彩內容