Guide功能閱讀時間 6 分鐘
AI 音訊生成器:在 OmniArt 做出旁白和配樂
在 OmniArt 上用 MiniMax、ElevenLabs 和 Lyria 模型生成旁白和音樂,再到剪輯軟體裡跟影片、音效組合成成片。
OmniArt 團隊

聲音是大多數創作者放著碰運氣的那一半。當旁白、音樂和畫面共用同一份需求,一顆好鏡頭的力道才真的打得出來。OmniArt 的音訊工作台目前生成語音和音樂,並沒有獨立的文字轉音效、環境音或擬音模型。這篇會講清楚這個工作台能做什麼、該挑哪個模型,以及流程裡哪一段還是得交給另一套剪輯軟體。
把生成出來的素材放在一起,還是能少掉很多交接。你可以在同一個專案裡先做旁白、再做一層音樂床,順手生成搭配的圖片或影片素材,最後才到別的地方組時間軸。
你可以生成什麼
OmniArt 的音訊模型涵蓋兩種製作工作:
- 旁白 — 從文字生成敘述、角色台詞和多語言對白,可調的控制項依語音模型而定。
- 音樂 — 用曲風、情緒、配器和段落結構指揮出完整曲目或音樂雛形。
說明
有些影片模型會在影片結果裡直接生成原生音訊。那跟獨立的音效生成器是兩回事:請用你選的那個影片模型自己顯示的控制項,也別預設每個模型都開放音訊。
OmniArt 上的音訊模型
不同模型擅長的工作不一樣。OmniArt 把它們收進同一個工作台,讓你按任務挑模型,而不是按平台挑。
| 模型 | 最適合 | 說明 |
|---|---|---|
| MiniMax Speech 2.8 HD | 高保真旁白和敘述 | 錄音室等級的清晰度,成片旁白的預設選擇 |
| MiniMax Speech 2.8 Turbo | 快速草稿和大量對白 | 試台詞的時候可以快速迭代 |
| Eleven Multilingual v2 | 多語言旁白,語氣穩定 | 跨多種語言都可靠 |
| Eleven v3 | 情緒豐富、表演張力大 | 需要演出幅度的時候找它 |
| Eleven Turbo v2.5 | 低延遲語音 | 適合長腳本和快速試多版 |
| MiniMax Music 2.6 | 依曲風和情緒生成完整曲目 | 背景配樂和品牌音效標 |
| ElevenLabs Music | 有結構的歌曲和循環段 | 懂段落的音樂生成 |
| Google Lyria 3 Pro | 高品質器樂和電影感配樂 | 預告片和敘事影片配樂 |
挑哪一個取決於需求本身:成片敘述用 HD 語音,試不同台詞用 Turbo,底下墊的那層則交給音樂模型。換模型不必動到專案裡的其他東西。
一步一步生成音訊
- 在音訊工作台選語音或音樂。
- 挑一個對得上工作的模型。 要人聲演出就用語音模型,要配樂或歌曲就用音樂模型。
- 寫一份製作需求。 語音要附上完整腳本和你想要的語氣;音樂則描述曲風、情緒、配器、速度和段落結構。
- 生成後檢查。 聽發音、節奏、音樂轉折,還有結果有沒有替對白留出空間。
- 一次只改一個變數。 有意識地調整語氣或結構,別每聽完一版就把整份需求重寫一次。
- 匯出選定的素材,再到你慣用的影片或音訊剪輯軟體裡,跟畫面、環境音和音效組在一起。
讓音訊跟圖片、影片對上
有用的交接從一份共用的需求開始。做不露臉的解說影片,先生成旁白,再做出節奏對得上的畫面。做產品短片,先做一層留得下訊息空間的音樂床,音效和環境音則在剪輯階段用授權素材或實錄補上。
小技巧
先把結構搭在旁白的時間點上,再去打磨畫面。把生成出來的片段剪到一段穩定的旁白上,通常比把做好的旁白硬塞進一份已經鎖定的剪輯容易得多。
在 OmniArt 上開始
從一段短腳本開始。用兩種不同的語氣生成兩版語音,再做一層撐得起同樣情緒的音樂床。把兩個素材都匯出,在剪輯軟體裡補上音效或環境音,最後對著畫面混音成片。打開音訊工作台做旁白或音樂那一層;如果需求裡還要生成畫面,就看所有 AI 影片模型都在同一個工作台。
準備好開始創作了嗎?
用 AI 生成精彩內容