Tutorial教學與操作指南閱讀時間 12 分鐘

YouTube 影片的 AI 配音:一套創作者的工作流程

用 OmniArt 上的 AI 語音模型,把你的腳本變成打磨過的 YouTube 旁白——模型怎麼挑、多語配音怎麼做、節奏怎麼調,還有一個點數成本試算。

OmniArt 團隊
YouTube 影片的 AI 配音:一套創作者的工作流程

以前要拿到一段打磨過的配音,意思是租錄音室、找配音員,或是妥協用 2012 年那種機器人腔的文字轉語音。這幾條路都放不大。OmniArt 上的 AI 語音模型讓你從一段文字就拿到錄音室等級的旁白——挑一個聲音預設、貼上腳本,幾秒鐘就有一個完成的音檔。這份指南會走完整套流程:怎麼寫給耳朵聽的腳本、怎麼挑對模型、怎麼控制語氣,還有怎麼不離開平台就把影片做完。

簡短版:句子寫短、挑一個高保真的語音模型、在 OmniArt 的音訊工作台生成、用標點和行內提示反覆調,然後把音訊鋪到畫面下面。長版在下面。

步驟 1:把腳本寫給耳朵聽

YouTube 腳本不是文章。觀眾沒辦法回頭重看一句話——他們要嘛跟得上,要嘛跟不上。所以:

  • **句子寫短。**一句一個想法。能控制在 15 個字以內最好。
  • 放路標。「先……然後……最後……」讓聽的人不用目錄也知道自己走到哪。
  • 不要塞子句。「這個模型,它是用多語資料訓練的、而且支援行內插入語,語氣處理得很好」在 1.25 倍速下根本聽不懂。拆開它。
  • **唸出來。**你會卡的地方,模型也會卡。改到唸起來順為止。
  • 寫給你的聽眾,不是寫你的主題。「你會想選 HD 那個模型」比「創作者應該考慮 HD 模型」溫暖多了。

一份 1,500 字元的 Shorts 腳本大約是 90 秒的旁白。這是個好用的校準基準。

步驟 2:挑模型

OmniArt 給你五個各有專長的語音模型。要按任務配模型,不是按你熟不熟。

模型方案字元上限費用適合
MiniMax Speech 2.8 HDFree10,000 字元每起算 50 字元 1 點數打磨過的旁白、長篇論述
MiniMax Speech 2.8 TurboFree10,000 字元每 100 字元 1 點數快速草稿、測試不同句子
Eleven Multilingual v2Starter10,000 字元每次 50 點數多語配音、在地化頻道
Eleven v3Starter5,000 字元每次 50 點數用音訊標記做出有表情的演繹
Eleven Turbo v2.5Starter40,000 字元每次 100 點數一次跑完整支長影片論述

MiniMax Speech 2.8 HD 是打磨過的 YouTube 旁白的預設選擇。它在盲聽比較裡名次很前面,長篇內容也處理得很乾淨。成品那幾條用它。

MiniMax Speech 2.8 Turbo 把點數砍一半,快到你可以在一次工作階段裡測二十種開場。用 Turbo 打草稿,用 HD 定稿。

Eleven Multilingual v2 是替國際觀眾配音時該用的模型。它跨語言維持穩定的語氣和節奏——如果你在做同一支影片的在地化版本,這一點很有用。

Eleven v3 解鎖了 [excited][whispers] 這類方括號音訊標記,能做出標點做不到的語氣塑形。當腳本需要其他模型碰不到的情緒幅度時,找它。

Eleven Turbo v2.5 一次可以吃到 40,000 字元的腳本——那是一支 45 分鐘紀錄片的旁白量。如果你的影片論述很長,這是唯一不用把腳本切塊就能處理的模型。

小技巧

OmniArt 在這幾個語音模型上共有 353 個精選聲音預設。在鎖定一個聲音之前先逛一逛——挑對預設對演繹的影響,比任何提示詞微調都大。

步驟 3:在音訊工作台生成

  1. 打開 OmniArt 的音訊工作台
  2. 從模型選單裡選一個語音模型。
  3. 挑一個聲音預設。多試聽幾個;預設是決定成品感覺的最大變因。
  4. 把腳本貼進提示詞欄位。
  5. 生成,然後聽。

第一條是基準線,不是成品。你要聽的是節奏、重音,還有不自然的停頓——這些下一步都可以修。

步驟 4:用標點和插入語調整演繹

你沒辦法按一個「讓它聽起來不要那麼平」的按鈕,但你可以改腳本來引導演繹。

**標點決定節奏。**逗號製造短促的節拍。破折號——像這樣——加上半拍停頓,感覺跟逗號不一樣。刪節號……製造遲疑。句號把一個想法完整收掉。這些要刻意用,不是照文法用。

**問號會觸發自然的上揚語調。**如果一句話結尾該往上抬,就算內容是陳述句,也把它寫成問句:用「在想該用哪個模型?」而不是「本節說明模型選擇」。

**大寫代表重音。**在大多數模型裡,「This is IMPORTANT」或「You need to pick the RIGHT voice」會把大寫的那個字強調出來。少用,用多了會像在吼。

MiniMax HD 的行內插入語讓你用括號記法在腳本中間插入情緒提示:(laughs)(sighs)(clears throat)。這些會在下一句之前帶出一個自然的聲音。

Eleven v3 的音訊標記用方括號:[excited][whispers][dramatic pause]。把它們直接放在該受影響的那句話前面。

說明

插入語和音訊標記都不是通用的——它們跟模型綁定。插入語在 MiniMax Speech 2.8 HD 裡有效;方括號標記在 Eleven v3 裡有效。在錯的模型用錯的記法,輸出會變成一團亂。完整語法可以看 Eleven v3 音訊標記指南MiniMax Speech 2.8 配音指南

實例試算:一份 Shorts 腳本要花多少點數

一份典型的 YouTube Shorts 旁白大約 1,500 字元。用 MiniMax Speech 2.8 HD 來算,它是每起算 50 個字元收 1 點數:

  • 1,500 字元 ÷ 每塊 50 字元 = 30 塊
  • 30 塊 × 1 點數 = 整段 Shorts 旁白 30 點數

如果你用 Turbo 打草稿(每 100 字元 1 點數),同一份腳本每跑一輪是 15 點數。跑十輪草稿、挑出最好的,再用 HD 定稿花 30 點數。總計:大約 180 點數就能找到並完成一段打磨過的旁白。

給國際觀眾的多語配音

把 YouTube 頻道推到單一語言之外是一個複利式的賭注:同一支影片配成西班牙文、葡萄牙文或日文,就能觸及不同的觀眾,而除了旁白之外沒有額外的製作成本。

流程是一樣的:

  1. 翻譯你的腳本(用翻譯工具、找雙語的夥伴,或用模型跑一輪再請母語者審過)。
  2. 回到 OmniArt 音訊,選 Eleven Multilingual v2
  3. 挑一個適合目標語言的聲音預設——有幾個預設有標語言或地區。
  4. 貼上翻譯好的腳本,生成。

Eleven Multilingual v2 會跨語言維持一致的節奏和演繹,當配音必須對上按原本時間點剪好的畫面時,這一點很關鍵。

注意

YouTube 的營利政策要求內容必須包含有意義的創作者投入——光是 AI 生成的配音,並不會讓一支影片豁免於平台的合成內容揭露規定。使用 AI 生成語音時,務必確認 YouTube 當下的準則,並在影片說明欄加上揭露。

在 OmniArt 裡把影片做完

旁白拿到之後,剩下的製作可以留在同一個工作台裡。

  • 畫面——用 OmniArt 任何一個影片模型生成 B-roll 片段。照旁白的節奏剪:一句換一顆鏡頭,比較複雜的段落就讓鏡頭久一點。
  • 音樂——用 MiniMax Music 2.6 或 Lyria 3 Pro 加上背景配樂。音樂床壓在旁白下方約 −18 dB,能加上存在感又不會打架。
  • 音效——替轉場和需要強調的時刻生成音效。流程可以看 AI 音效生成器指南

在同一個地方跨模態工作,核心的好處是迭代:改旁白、重生成夾在它前後的音效、順手調整音樂點,全部在同一次工作階段裡完成——而不是在三個工具和一堆檔案輸出之間來回跑。

專門講短影音的部分,可以看 TikTok 和 YouTube Shorts 的 AI 影片,那份直式優先的影片流程跟這一份是一對的。

在 OmniArt 開始

寫一份 1,500 字元的腳本——一段 Shorts 長度的旁白。打開 OmniArt 的音訊工作台,選 MiniMax Speech 2.8 HD,逛一逛聲音預設,生成第一條。聽節奏和重音,用標點改腳本,再跑第二輪。大多數旁白兩三條就完成了。接下來生成對得上的畫面、加一層音樂床,一支完整的影片就在同一個地方做好了。

準備好開始創作了嗎?

用 AI 生成精彩內容

免費開始