Guide教學與操作指南閱讀時間 18 分鐘

Veo 3.1 空間音訊:讓聲音貼合鏡頭的最佳做法

Veo 3.1 把對白、環境音和音效跟影片一起生成,而且帶著真正的方向感和距離感。在 OmniArt 上,怎麼一層一層刻意寫提示詞,讓聲音真的貼合鏡頭。

OmniArt 團隊
Veo 3.1 空間音訊:讓聲音貼合鏡頭的最佳做法

多數 AI 影片的聲音聽起來是「擺上去的」,而不是「在現場的」。一段熱鬧市集的片子配上人聲雜音;一段森林的片子配上鳥叫。兩者技術上都對,卻都不令人信服,因為那些聲音不知道畫面裡的東西在哪裡。Veo 3.1 用原生空間音訊改變了這件事:模型和影片一起生成聲音,知道什麼近、什麼遠、什麼被悶住、什麼穿得過來。一扇在主體背後關上的門,聽起來和一扇在前景關上的門不一樣。樓下三層的車流,比街道高度的車流更小聲、也更擴散。這份指南要說明 Veo 的聯合聲音生成怎麼運作、怎麼把三層聲音分開來想,以及怎麼寫出第一次跑就有空間縱深的提示詞——附三個你可以馬上套用的實作場景。

Veo 3.1 的原生聲音怎麼運作

Veo 3.1 在同一次聯合運算裡生成聲音和影像。這跟兩段式的流程不同——後者是先匯出一支無聲影片,再讓一個音訊模型去對上它——Veo 是在構築畫面的同時構築整個聲景。模型知道它正在生成的那個場景的空間佈局:哪些元素靠近鏡頭、哪些在背景、環境有多密實、表面會吸音還是反射。

實際的效果是方向感。近場的元素(主體的腳步聲、一隻手碰到表面、呼吸)和背景元素(街道噪音、環境的低鳴、人群交談)坐在不同的表觀距離上。模型能把它們以適當的相對音量疊起來,是因為它在建構那個空間場景,而不是事後推論它。

說明

OmniArt 上的三個 Veo 3.1 變體都有原生聲音:veo-3.1-standard、veo-3.1-fast 和 veo-3.1-lite。空間一致性在各變體之間是一致的;變體之間的主要差別是生成速度和解析度上限,不是聲音品質。

Veo 3.1 也提供原生 4K 輸出,這件事對聲音的提示詞寫作有一個具體的影響:視覺還原度愈高,畫面裡的環境細節就愈多——而聲音模型能回應的細節也就愈多。一條被雨淋濕的石板街,在 4K 下給模型的線索,比同一個場景一段軟綿綿的 720p 生成多得多。

要分開來想的三層聲音

想從 Veo 3.1 的聲音生成拿到好結果,最可靠的方法是在寫下第一個字之前,先在腦子裡把聲音指令分成三層。每一層的特性不同,回應的提示詞模式也不同。

對白

對白是最能精準控制的一層。模型需要明確的資訊:講了什麼、誰在講、怎麼講。跟環境音不同——環境音模型可以從視覺情境推論出很多——對白沒有任何視覺對應物可以讓模型讀。一個角色邊走邊說話,不管他是在背購物清單還是在講一段獨白,看起來都一樣。

把台詞逐字寫出來,後面再跟一句表演註記。一個精簡的表演形容詞,通常比兩三個更有效。可靠有效的表演註記:warm and unhurriedflat and exhaustedurgent, just above a whispersoft but careful。容易做出平均值結果的註記:把相反的東西疊在一起,例如 relaxed but tensequiet but intense

空間情境對對白也很重要。Voice close-mic'd, room barely audible 做出來的結果,和 voice slightly distant, reverberant room 不一樣。你描述多少環境空間,模型就會把聲學環境配到那個程度。

環境音與空間

環境音是 Veo 3.1 處理得最有辨識度的一層。因為模型知道自己正在生成的空間佈局,你可以用層次和距離去描述一個環境,而模型真的能照著那份描述動作。

一個好用的心智模型:把它想成三個同心區域——最前景(鏡頭伸手可及的範圍)、中景(場景實際發生的空間),以及背景(會從窗戶外或畫面邊緣傳進來的聲音)。把每個區域裡的元素指名出來,並標示它們的相對音量,就等於給了模型一個空間混音的目標。

區域範例元素提示詞寫法
前景布料摩擦、呼吸、手放在表面上"close fabric rustle"、"subject's quiet breathing"
中景腳步聲、交談、工具、烹飪的聲音"footsteps on concrete nearby"、"clink of cups on the counter"
背景街上的車流、人群低語、環境的低鳴"traffic muffled behind glass"、"distant crowd, barely audible"

你不需要把三個區域都填滿。一個極簡的室內場景,可能只需要一個中景元素加上一點淡淡的空間環境音。把不該有聲音的區域也寫滿,只會把混音弄亂。

音效(SFX)

音效是綁在特定視覺時刻上的離散聲音事件:一扇門打開、一個物件被放下、一聲通知音、一輛車經過。因為 Veo 是把聲音和影像一起生成的,對應到畫面上看得見的動作的音效,通常會自然對上——模型在一隻手碰到杯子之前,就知道那隻手正伸過去。

需要精準落點的音效,請把它描述成視覺事件,而不是聲音事件。"She sets the phone face-down on the desk" 同時提示了視覺動作和它產生的聲音;"a clunk as the phone hits the desk" 只是抽象地描述聲音,模型比較難對上。

當你需要一個沒有連著畫面動作的音效——一個畫面外傳來的聲音、一個環境上的標點——就把它當成對白提示來處理:明確指名它,並給它空間情境。"A car alarm starts briefly in the distance, off-frame right" 比 "random street noise includes a car alarm" 精準得多。

三個實作場景

以下三個例子把完整的提示詞模式套在三種不同的聲音情境上。每一個示範的都是不同的主要聲音挑戰。

場景 1:街上的遠近空間分層

簡報: 一位主體沿著商店街走向一家店的入口。聲音要呈現出近處元素(主體的腳步聲、環境裡的呼吸)和周圍環境(車流、一扇店門)之間的空間差異。

提示詞:

"Medium shot following a person walking along a busy city street toward a café entrance, overcast daylight. Audio: subject's footsteps on wet pavement close and clear; street traffic — buses, cars — sitting further back, diffuse and slightly muffled; as the subject reaches for the café door, the door's hinge and the muffled interior sound briefly audible, then the street noise dropping away as they step inside. No music."

該期待什麼: 腳步聲應該坐在近場,跟背景車流清楚分開。門口那個轉換——從室外到被悶住的室內——就是這段提示詞在導向的那個空間事件,而 Veo 的聯合生成代表模型知道那一刻的視覺走位。

調整的把手: 如果車流相對於腳步聲太大聲,加上 traffic well back, not competing with footsteps。如果門口的轉換太突兀,加上 gradual acoustic shift as the door opens


場景 2:沒有對白、完全靠環境音撐起來的情緒鏡頭

簡報: 黃昏時的一顆室內大遠景——沒有對白,也沒有明顯的動作。聲音要完全靠環境層次撐起這個場景的情緒基調。

提示詞:

"Wide shot of an empty apartment living room at dusk, warm orange light through venetian blinds making stripe patterns across the floor. No person present. Audio: distant traffic hum from outside (well back, through glass), occasional creak of the building settling, a single car passing slowly on the street below — its engine present then gone — faint hiss of an old radiator in the foreground right. No music. The overall room feel should be quiet enough to hear the silence between sounds."

該期待什麼: 一層一層的環境混音,事件之間的停頓跟事件本身一樣聽得見。模型應該把 quiet enough to hear the silence between sounds 當成一條混音層級的指令——讓所有元素都低到能感覺得到空間環境音。

調整的把手: quiet enough to hear the silence 這句話可以加上 each element appearing only briefly, not constant 來加強。加上 a phone buzzing once on a surface, off-frame,可以在不破壞氛圍的前提下放進一個敘事上的標點。

小技巧

沒有對白的環境音場景,是 Veo 3.1 的空間音訊贏過平面聲音模型贏得最明顯的地方。如果結果聽起來像一條單一的循環背景音軌,而不是一個有層次的環境,通常代表提示詞寫得不夠——再加第二或第三個具名元素,並明確指定它們的空間位置。

場景 3:對白的句子層級語調

簡報: 一個角色對著鏡頭講出一個問句。表演需要自然的句子層級語調——具體來說,是問句結尾那個聽得出來的上揚——而不是節拍器式的平讀。

提示詞:

"Close-up of a man in his 40s at a wooden desk, warm desk lamp, bookshelves behind him. He looks directly at camera, slight pause, then says 'Did you really think I wouldn't find out?' — delivery quiet, genuinely confused rather than angry, voice rising slightly on 'find out'. Room: light ambient hum from an unseen HVAC, no reverb, no music."

該期待什麼: rising slightly on 'find out'genuinely confused rather than angry 這兩句表演註記,應該同時形塑聲音的波形和表演的音高曲線。空間環境音的指令(no reverb)建立了聲學環境,讓對白不會聽起來像在另一個空間錄的。

調整的把手: 如果表演太平,把 quiet 換成 controlled but emotionally present。如果句子語調沒有出來,就把表演註記和情緒註記分開:先講情緒,再講那條具體的語調指令。


重跑之前:怎麼讀一個平板或機械的結果

不是每一次生成都需要改提示詞。有些結果只是需要更長的時長或換一個 Seed。但有幾種特定的樣態,代表問題出在提示詞本身:

平板的結果(沒有空間縱深): 所有聲音元素都坐在同一個表觀距離上,沒有前景/背景的區分。修法:至少幫兩個元素加上明確的空間語言——一個標成近的,一個標成遠的或被悶住的。模型需要一個對比才能動作。

機械的對白: 表演節奏平均、沒有停頓、沒有音高變化、尾音沒有語調。修法:在提示詞裡寫一條具體的語調指令(問句結尾上揚、在情緒節拍上放慢、陳述句收尾下沉)。像 naturalrealistic 這種抽象的表演註記,太模糊了,改變不了結果。

塞爆的混音: 太多聲音元素在搶存在感,沒有一個站得出來。修法:減到最重要的兩三個元素,並明確描述它們的相對音量。三個擺對位置的聲音,勝過七個互相打架的聲音。

錯的聲學環境: 空間聽起來對這個畫面來說殘響太多或太乾。修法:直接指名聲學特性——dry, close-mic'd roommedium reverb, concrete wallsoutdoor, open air, no reflections

症狀可能原因修法
沒有空間縱深缺少遠近的描述語幫兩個以上的元素加上明確的距離限定
機械的對白表演註記太模糊加一條具體的語調指令
混音太雜聲源太多減到 2 到 3 個元素,並寫出相對音量
空間聲學錯了沒有給聲學情境明確指名空間的聲學特性

最佳做法總結

該做什麼為什麼
動筆前先在腦中把對白、環境音和音效分開每一層回應的提示詞模式都不同
依區域指名環境元素——前景、中景、背景給模型一個空間混音目標,而不是一段平面描述
逐字寫出台詞,後面跟一句表演註記模型需要確切的文字,加上一個語氣方向
把音效描述成視覺事件,不要描述成聲音事件對上畫面動作,比對上抽象的時間點容易建模
只要音效不要音樂時,用 no music避免自動配樂加上一條背景音軌
具名元素的數量保持少三個擺對位置的聲音勝過七個互相打架的
指名聲學環境空間特性會影響其他所有元素怎麼坐

在 OmniArt 上開始

三個 Veo 3.1 變體——veo-3.1-standard、veo-3.1-fast 和 veo-3.1-lite——在 OmniArt 影片工作台裡都有,共用同一份點數餘額和同一套提示詞介面,不需要另外的 Google 帳號或 API 金鑰。要把聲音的提示詞手感校準起來,最快的方法是先在一個簡單場景裡做一組遠近對比,看看模型做出什麼,再一次加一層,直到混音到你要的位置。

想更全面地看 Veo 3.1 的攝影和提示詞結構,請看 Veo 3.1 提示詞與電影感指南。如果你在用另一條產線上、同樣一次聯合生成聲音的模型,Grok Imagine 原生聲音指南裡的模式,涵蓋了 xAI 原生聲音系統類似的提示詞邏輯。

到 OmniArt 開始生成

準備好開始創作了嗎?

用 AI 生成精彩內容

免費開始