MiniMax H3 原生音訊指南:對白、音樂與同步
學會怎麼替 MiniMax H3 的原生立體聲寫提示詞——對白、環境音、音樂、聲音參考素材和同步,附一套今天就能跑的可重複製作測試計畫。

MiniMax H3 的原生音訊,把聲音變成生成需求的一部分,而不是畫面做完之後自動補上去的一個檔案。MiniMax 說 H3 能一起理解文字、圖片、影片和音訊,然後生成帶原生立體聲的影片。它的訓練範圍也把人聲、音效和音樂當成同一個音訊領域,而不是分開的工具。
那是一個有意義的工作流程改變,但它不是在保證每一句台詞都會唸得完美、每一個腳步聲都會落在對的影格上,或是每一份立體聲混音都能直接發佈。這份指南把 MiniMax 官方記載的 H3 能力和創作者該自己跑的製作測試分開。它給你一套實用的聲音企劃結構、一條音訊參考素材的流程、五份提示詞範本,還有一張可重複的評分表,而不會把官方示範當成獨立的驗證結果。
MiniMax 官方對 H3 音訊記載了什麼
MiniMax 把 H3 描述成一個通用的多模態影片模型,不是一個外掛獨立音訊流程的無聲影片生成器。官方的上線資料說這個模型會生成原生立體聲,並且把人聲、音效和音樂一起建模。MiniMax 也示範了一句提示詞,同時把運鏡取自一段影片、角色取自一張圖片,人聲則對上一份音訊參考素材。
官方 H3 影片生成指南定義了目前的 API 邊界:
| 記載的能力 | 對創作者代表什麼 |
|---|---|
| 原生立體聲 | H3 可以隨生成的影片回傳一條雙聲道音軌 |
| 音訊當成多模態脈絡 | 一段音訊可以引導人聲、動作、剪輯節奏,或提示詞裡描述的其他對應關係 |
| 最多三份音訊參考素材 | 每段 2–15 秒,所有音訊參考素材加起來最多 15 秒 |
| 混合參考素材 | 音訊可以在同一個參考素材轉影片的請求裡跟圖片和影片混用 |
| WAV 和 MP3 輸入 | 參考音訊必須使用記載的其中一種輸入格式 |
| 4–15 秒輸出 | H3 是為短片段設計的,不是一次生成就給你一整條長篇配樂 |
有三個重要的限制。音訊參考素材不能單獨送出;MiniMax 要求旁邊至少要有一張圖片或一段影片。音訊檔每個上限 15 MB,整個混合參考素材請求上限 12 份素材。參考素材模式也不能跟首格或末格模式放在同一個請求裡,所以要先決定這顆鏡頭比較在意的是準確的邊界影格,還是更廣的多模態條件控制。
說明
立體聲不等於空間音訊。MiniMax 記載的是原生立體聲輸出,但它目前的公開資料並沒有承諾環繞、Ambisonic、物件導向音訊,或某種程度的定位準確度。用耳機確認過左右定位,再把結果形容成空間音訊。
寫提示詞之前先做聲音企劃
最有用的 H3 提示詞不是一長串聲音清單。它是一份精簡的聲音計畫,告訴模型什麼該領頭、什麼該當支撐,還有什麼必須在一個看得見的時刻發生。這份計畫分五輪寫。
1. 先鎖住畫面動作和時間點
音訊同步靠的是看得見的事件。先定鏡頭、主體動作、運鏡和節拍順序。“A spoon hits the saucer as the camera settles” 給了模型一個影音共享的事件。“Add a cup sound” 沒有說這件事什麼時候發生,也沒說是什麼造成的。
一段 10 秒的片段,簡單的節拍表可能是:
- 0–3 秒:建立空間和主體
- 3–7 秒:對白或主要動作
- 7–10 秒:產品揭曉和最後的聲音提示
把那些時間點當成指示,不是精確到影格的剪輯標記。製作測試要量的就是輸出跟它們貼得多近。
2. 只指定一個主要音訊層
挑一個觀眾必須先注意到的聲音:對白、一個產品互動、一段音樂鉤子,或某個環境聲響。給它最清楚的措辭,並在它周圍留出空間。
如果主角是對白,就把準確的台詞用引號寫出來,並指定一句演繹方向。如果主角是產品聲,就描述產生它的那個物理動作。如果主角是音樂,就講出速度、配器、情緒,還有編制該在哪裡變化。
3. 把環境音當成一個聲學空間來加
環境音應該解釋這顆鏡頭住在哪裡。不要寫「咖啡廳的聲音」,改成描述說話者身後一道安靜的濃縮咖啡機蒸氣聲、低低的室內談話,還有遠處的一聲門鈴。要做乾淨的產品廣告時,除非安靜本身是刻意的創作選擇,否則該要的是受控的錄音室空間聲響,而不是完全無聲。
用一些畫面和聲音都適用的距離詞和材質詞:
- 近、乾、親密,還有帶一點殘響
- 遠、隔著玻璃悶掉,或是在鏡頭外的左邊
- 磁磚上的腳步聲、布料摩擦、雨打在金屬上,或是一只玻璃杯放到木頭上
4. 決定音樂是配樂還是場景內的聲源
配樂坐在場景外面;場景內音樂來自場景裡的某個物件或地點。講清楚你指的是哪一種。“A restrained electronic score under the dialogue” 要的是一個背景層,而 “music playing quietly from the café radio, slightly muffled” 則給了它一個畫面內的聲學來源。
不需要音樂的時候,就寫 no music。這會讓對白或擬音測試比較好判斷。需要的時候,要替人聲留餘裕,而不是要求每一層都又大聲又戲劇化。
5. 把排除項寫出來
否定式的音訊指示在保護需求的時候很有用。例如 no narration、no crowd cheering、no added melody 和 no exaggerated whooshes。排除清單要短;限制太多會跟你真正想要的動作互相打架。
怎麼用音訊參考素材而不搞混它們的職責
H3 的參考素材系統在每一份素材只有一個職責時最有用。一段參考音訊可能提供的是嗓音音色和語速、音樂能量、某種聲音質地,或是剪輯節奏。不要假設模型知道要借哪一個性質。
在寫最終提示詞之前,先畫一張素材職責表:
| 素材 | 指派的職責 | 不該被帶過去的東西 |
|---|---|---|
| 角色圖片 | 識別、服裝和產品位置 | 背景和光線 |
| 動作影片 | 手勢和運鏡的時間點 | 角色識別和對白 |
| 人聲音訊 | 嗓音性格、語速和情緒能量 | 原本的字句和背景噪音 |
| 音樂音訊 | 速度、編制密度和剪輯節奏 | 認得出來的旋律或歌詞 |
然後用自然語言描述這些關係。MiniMax 自己的 H3 範例用一句話把運鏡指派給影片參考素材、把表演者指派給圖片參考素材,把人聲指派給音訊參考素材。編號的素材標籤會因介面而異,而 API 用的是型別化的內容和參考素材角色,所以請把下面範本裡的標籤換成你的流程裡實際顯示的寫法。
注意
只有在你拿到授權時,才可以把一個人的聲音或表演拿來當參考素材。一份聲音參考素材並不能證明你擁有這位說話者的識別、這份錄音、這段音樂,或發佈一個生成模仿的權利。
乾淨的參考素材帶來更乾淨的實驗。修掉靜音、拿掉不相關的背景音樂、避免爆音,並讓相關的人聲或樂句容易聽清楚。用一小段能展示你要的那個性質的片段,不要預設就上傳到最長。
五份 MiniMax H3 原生音訊提示詞範本
這些是起手的需求,不是宣稱過的測試結果。每一句提示詞都跑不只一次,並用下一節的流程替輸出打分。
1. 單人對白加空間聲響
Close-up of a chef at the pass in a quiet restaurant kitchen after service. The camera makes a slow push-in as she looks toward a colleague off-camera and says, “We try it again tomorrow.” Delivery: tired but quietly optimistic, natural pace, one short breath before “tomorrow.” Her voice is the primary audio layer, close and dry. Low ventilation hum and occasional metal cooling sounds remain distant. No music, no narration, no other voices.
用這份範本評估說話的準確度、情緒演繹、嘴部動作,還有環境音有沒有乖乖待在台詞後面。
2. 有層次的環境音加同步擬音
Wide shot inside a nearly empty laundromat at night, fluorescent light reflecting on the tiled floor. A person moves a wet jacket from a washer to a rolling basket; the metal door clicks shut exactly when their hand closes it, then the basket wheels rattle softly across tile. Foreground: fabric movement and the door click. Mid-ground: steady washer rotation. Background: rain against the front window and one distant car passing outside. Native stereo mix, no dialogue, no music.
這份需求把環境音、材質真實度、左右分離和接觸點同步單獨拉出來測。
3. 以音樂為主的產品揭曉
Ten-second vertical product film for a translucent coral sports bottle on a lilac studio surface. Start with a macro shot of condensation, then orbit as the bottle rises into the hero position. Original minimal electronic score at 100 BPM: soft pulse for the opening, a clean percussive accent when the logo faces camera, then a short resolved final note. Add subtle droplets and one controlled placement sound. Music supports the product sounds rather than masking them. No voice and no stock-style cinematic boom.
聲音之外的產品畫面規劃,可以用照片轉產品影片流程。
4. 有授權的人聲參考素材配新對白
Use voice reference 1 only for the narrator's vocal timbre, speaking pace, and warm conversational energy. Do not reuse its words or background noise. The person from image reference 1 stands beside the window and says, “The first draft is only the beginning.” Keep the spoken line intelligible and synchronized to the visible speaker. Add a quiet residential room tone and soft rain outside. No music. The voice recording is authorized for this use.
測試你要的那些嗓音特質有沒有帶過去,同時有沒有不小心把來源錄音的噪音、斷句或內容一起抄過來。把想要的特質用文字描述出來,這樣就算參考素材的服從度有起伏,這句指令還是有用。
5. 社群剪輯用的節奏參考素材
Create a 12-second montage of a ceramic artist shaping, glazing, and placing a finished cup on a shelf. Use audio reference 1 only for tempo, rhythmic energy, and edit pacing. Compose an original percussive track with different melody and sound design. Cut the visual action on the major rhythmic changes: clay lands on the wheel, brush touches glaze, cup reaches the shelf. Preserve natural wheel rotation, brush texture, and the final ceramic tap beneath the music. No dialogue.
這把「節奏條件控制」和「抄音樂」分開,也給了你三個看得見的同步點可以檢查。
一套可重複的 H3 音訊評估計畫
一支打磨過的官方示範,回答不了「這個模型合不合你的製作流程」。用同一份需求至少跑三次生成,長度和參考素材固定不變,然後替每一個輸出打分,而不是只挑最強的那一個。
先把各層分開測
從四句受控的提示詞開始:
- 只有對白和安靜的空間聲響
- 環境音加三個看得見的擬音事件,沒有人聲也沒有音樂
- 演奏樂加兩個規劃好的畫面重音
- 一份有授權的音訊參考素材,搭配一張簡單的圖片或影片參考素材
這四項過了之後,才把對白、環境音、擬音和音樂放進同一個擁擠的場景。這會讓失敗可診斷:你分得出問題是出在發音、時間點、參考素材的轉移,還是混音密度。
用評分表,不要用印象
| 面向 | 要回答的問題 | 簡單的量法 |
|---|---|---|
| 對白準確度 | 要求的字句有沒有唸對? | 唸對的字數除以要求的字數 |
| 對嘴 | 看得見的閉嘴和音節重音對得上嗎? | 打 1–5 分,並記下第一次看得出來飄掉的地方 |
| 事件同步 | 接觸聲有沒有跟畫面裡的動作一起落下? | 在三個規劃好的提示點記早了或晚了幾格 |
| 人聲一致性 | 說話者從頭到尾聽起來還是同一個人嗎? | 開頭、中段、結尾分開打分 |
| 參考素材控制 | 要的那個性質有沒有帶過來,又沒有夾帶不想要的東西? | 列出有意和無意的轉移 |
| 立體聲影像 | 左右定位有用而且穩定嗎? | 耳機檢查加上聲道波形檢查 |
| 混音層次 | 主要那一層清楚聽得懂嗎? | 在正常播放音量下打 1–5 分 |
| 可重複性 | 不用修音就能用的片段有多常出現? | 可用的輸出除以總跑數 |
在剪輯軟體或音訊工作站裡檢查輸出檔。確認真的有兩個聲道、在單聲道下聽有沒有相位問題,並比對規劃好的接觸事件附近的波形。不要從社群平台的預覽去推斷音訊品質,那可能會重新壓縮或重新對應音軌。
小技巧
失敗的生成留著。一次提示詞修改要算改進,前提是它在重複跑的時候拉高了可用輸出的比例,而不是產出了一條好運的片子。
要事先規劃的限制
MiniMax 自己的上線貼文說 H3 仍有進步空間,並點名視覺細節是未來要處理的方向之一。就音訊製作而言,目前的公開文件也留了好幾個問題沒答。它沒有公布字錯率、對嘴準確度、響度、取樣率、立體聲以外的聲道配置、語言涵蓋範圍、人聲參考素材的相似度,或時間碼層級的提示點控制的保證。
照這些實際的邊界規劃:
- **輸出很短:**4–15 秒適合鏡頭、廣告和社群片段,但長篇的連貫性需要跨多次生成再剪接。
- **參考素材脈絡很短:**最多三段音訊,但它們加起來的長度不能超過 15 秒。
- **不能只用音訊當參考素材:**一段參考音訊必須至少搭配一張圖片或一段影片。
- **自然語言的時間點不是鎖死的時間軸:**在重複測試證明你要的精度之前,把節拍時間點當成意圖。
- **立體聲需要驗證:**兩個聲道不會自動產生可信的方向、深度或單聲道相容性。
- **密的混音會藏住錯誤:**對白、音效、環境音和音樂可能全部一起建模,但比較簡單的需求比較好控制、也比較好修。
- **參考素材的權利照樣適用:**模型有能力,不代表你有權模仿一個聲音或重用受保護的音樂。
MiniMax H3 現在對 OmniArt Creator 以上方案的使用者開放,有影片、轉場和參考素材三種模式,輸出 5–15 秒、1440p。參考素材模式吃得下最多九張圖片、三段影片和三段音訊,總計不超過 12 份素材;參考音訊必須至少搭配一張圖片或一段影片。OmniArt 每輸出秒收 9 點數,另外每一秒(無條件進位)的參考影片再收 9 點數。前五張參考圖免費,之後每張 2 點數,參考音訊不另外收費。原生音訊是 H3 輸出的一部分,目前 OmniArt 的介面上沒有獨立的音訊開關。要替 OmniArt 之外的官方 API 抓預算,可以看官方隨用隨付定價頁和 H3 定價與規格指南;不要拿第三方代管商的費率去替代 MiniMax 自己的價格。
在 OmniArt 把剩下的聲音做完
原生音訊可以減少交接,但它不會抹掉獨立音訊工具的價值。如果一條 H3 的畫面對了、旁白很弱,就留住畫面,另外做一條可控的人聲軌。如果對白可以用、但空間缺質地,就加一層環境音或擬音,不要整顆鏡頭重生成。
OmniArt 把影片、語音、聲音和音樂的流程放進同一個創作工作台。用 AI 音效生成器指南設計替換用的擬音和環境音,或是拿 Veo 3.1 空間音訊指南比較提示詞的寫法。目標不是把每一個聲音都硬塞進一次生成。而是原生音軌好用的時候就留著,只換掉不好用的那一層。
準備好開始創作了嗎?
用 AI 生成精彩內容