Guide模型與觀察閱讀時間 14 分鐘

一次生成就有聲音:Grok Imagine 1.5 的對白、對嘴和環境音

Grok Imagine 1.5 在同一次推論裡一起生成音訊和影片 token——對白、對嘴、音效和環境音樂一起出來。這裡談怎麼在提示詞裡指導聲音設計,附三個在 OmniArt 上做完的場景。

OmniArt 團隊
一次生成就有聲音:Grok Imagine 1.5 的對白、對嘴和環境音

大多數 AI 影片模型生成的是無聲片段。你把影片輸出、拉進 DAW 或另一個音訊工具,從不同的服務商找對白、環境音和音樂,把每一層對齊,然後祈禱它們不會跑掉。Grok Imagine 1.5 把這條產線拿掉了:音訊——對白、對嘴、音效和環境層——是跟影片影格在同一次推論裡生成的。結果是一段拿到手就已經像它自己在響的片子。這份指南說明原生音訊的機制怎麼運作、1.5 相對 1.0 進步在哪,還有怎麼把聲音寫進提示詞,讓模型真的照著做。

原生音訊生成怎麼運作

傳統的 AI 影片模型把聲音當成後處理步驟。先生成影片 token;再讓一個音訊模型跑過結果,試著去對上已經算好的畫面。因為這兩趟是各自獨立的,時間對不上是家常便飯——一扇早了一格關上的門、在錯的拍點換氣的對白、不會跟著場景變化的環境層。

Grok Imagine 1.5 在單一次推論裡把影片和音訊 token 一起生成。模型在決定要發出什麼聲音、什麼時候發出來的時候,看得到完整的場景脈絡——構圖、角色動作、光線情緒。嘴唇的動作是跟音訊波形一起塑形的,而不是事後套上去的。環境層回應的是模型正在建的那個視覺環境,不是一格必須回溯去解讀的輸出畫面。

說明

單次生成不代表音訊擬真度無上限——片段上限還是 720p、24fps、1–15 秒,跟任何一次 Grok Imagine 生成一樣。改變的是你看到的東西和你聽到的東西之間的連貫性。

從 1.0 到 1.5 改了什麼

Grok Imagine 1.0 也有原生音訊,但結果有兩個一貫的問題。對白的時間點很機械:角色用節拍器般的速度講話,沒有自然的停頓、沒有語尾上揚,也沒有句子層級的抑揚。環境層很平:熱鬧街頭的場景不管視覺密度、天氣或時段是什麼,都得到一樣的罐頭人群噪音。

Grok Imagine 1.5 兩個都處理了。對白的演繹現在會尊重句子的節奏——短的想法很快落地、情緒時刻稍微慢下來、問句結尾聽得出上揚。環境層變得會回應場景:一個下著大雨的夜市,聽起來跟一個乾燥的正午市場不一樣,因為模型讀得到它自己正在生成的視覺線索,並據此調整音訊的混音。

能力Grok Imagine 1.0Grok Imagine 1.5
對白時間點機械、速度均勻自然的停頓、句子的抑揚
對嘴認得出來但很僵跟生成的音訊波形同步
環境層平、不管場景會回應場景、有層次
音效有,但混得太小聲跟畫面事件整合在一起
背景音樂偶爾有,很罐頭依情緒自動配樂(選用)

競技場排名反映了這個進步:Grok Imagine 1.5 相對 1.0 拿到 +52 Elo,在圖生影片競技場排到第 1 名,在盲測裡領先 Seedance 2.0、HappyHorse 1.0 和 Google Veo。Aurora 引擎是依序處理影格的,而這正是讓動態連貫到「音訊那一趟能產出有用的同步」的原因。

怎麼把聲音寫進提示詞

在自然語言提示詞裡指導聲音,有幾個一貫的寫法。模型把音訊線索當成場景描述的一部分,而不是一個獨立的指令區塊——所以你要把聲音嵌在攝影指示旁邊,不是放在它後面。

把對白台詞和演繹方式寫出來

不要假設模型會自己編出對的台詞。把台詞明確寫出來,後面接一句演繹說明。

沒有音訊指示有音訊指示
"A barista talking to a customer""A barista says 'Your order will be about five minutes' with a warm, unhurried delivery; ambient café noise underneath"

好用的演繹說明:warmurgentflat and tiredslightly breathlessquiet but firm。通常一個形容詞就夠了。兩個以上就開始互相打架。

把環境層明確指出來

當你不指定環境音,模型會挑一個很罐頭的。把每一層點名——包括相對音量——就給了它一個可以瞄準的目標。

"Close-up of a chef plating a dish: the sizzle of the pan in the background, quiet kitchen ventilation, the clink of a spoon on porcelain, no music."

當你希望這個場景只靠音效和空間聲響撐起來時,no music 這句話很有用。少了它,模型可能會自己加一段輕音樂。

描述節奏和停頓

停頓也是音訊事件。如果一個角色在回答之前遲疑了一下,或是你需要在一個音效落下之前留兩拍安靜,就要講出來。

"She looks at the letter, two seconds of silence, then exhales sharply."

決定要讓它自動配樂還是限制它

如果你完全沒提音樂,Grok Imagine 1.5 可能會替片段自動配上一段情緒相符的樂句——情感場景配輕柔的弦樂、動作場景配有推進感的節奏。這對快速的社群草稿很好用。要做精準的東西時——你想要安靜、想要特定曲風,或想要一個落在剪點上的拍點——就明確限制它:把曲風、速度感講出來,或是寫 no background music 把它關掉。

小技巧

一段片子只給一種連貫的聲音情緒。不要要求 "energetic upbeat music but also quiet and contemplative"。模型會挑一個,而那不會是你想像的那個。

三個完整場景

這些範例示範完整的提示詞寫法怎麼實際運作。每一個都包含視覺設定、音訊指示,還有原生音訊那一趟會產出什麼。

場景 1:帶對嘴的對白特寫

**需求:**一個角色對著鏡頭講一句台詞。這顆鏡頭需要乾淨的對嘴和自然的演繹,而不是另外找來的旁白音軌。

提示詞:

"Medium close-up of a woman in her late 30s at a kitchen table, morning light from a window to her left. She looks directly at camera and says 'I didn't think it would take this long' with a tired, honest delivery — slight pause after 'think', voice dropping at the end. Background: low refrigerator hum, no music."

**會發生什麼:**模型在同一趟裡生成對白音訊和嘴部動作。句中的那個停頓同時塑形了音訊波形和看得見的嘴唇動作。冰箱的低頻嗡聲以低音量墊在對白底下,不會跟它搶。

**可以調的槓桿:**如果演繹太平,在演繹說明裡加 emotional weight。如果嗡聲太搶,在它前面加 barely audible


場景 2:有層次的環境音

**需求:**一個下著大雨的夜市——沒有對白,純氛圍。音訊要有層次、要有實體存在感,而不是像單一個循環音檔。

提示詞:

"Slow dolly through a busy night market in heavy rain. Neon signs reflecting in puddles, steam rising from food stalls. Audio layers: heavy rain on canvas awnings (top layer), sizzling woks from nearby stalls, muffled crowd chatter in the distance, no music. Quiet enough to feel intimate, not overwhelming."

**會發生什麼:**因為模型正在建這個視覺場景——雨棚、攤位、人群密度——它可以在音訊那一趟回應這些元素。畫面裡看得到的攤位炒鍋聲,通常會比空間上被放在更後面的環境人聲大。

**可以調的槓桿:**加 close-mic'd rain drops 讓質地更豐富。指定 a distant vendor calling out,就能在沒有正式對白的情況下加進一個敘事性的音訊元素。

注意

片段長度是 1–15 秒。層次很多的環境場景在 8–12 秒最好——那個長度夠讓模型在片子結束前把各層建立起來。非常短的片段(2–4 秒)可能只會做出最主要的那一層。

場景 3:以音樂為主的節拍

**需求:**一位舞者的動作必須跟上一種特定的節奏感——不是順便對上,而是作為整段片子的核心設計。

提示詞:

"Slow-motion close-up of a dancer's feet hitting a wooden floor in a dark studio, single overhead spotlight. Each footfall lands on a beat. Audio: driving minimal techno at roughly 120 BPM, the impact of each footfall mixed into the beat so the physical sound and the music feel like the same event. No ambient room noise — tight, dry acoustics."

**會發生什麼:**模型會生成音樂,並把腳步撞擊當成音樂裡的節奏事件來處理。因為動態和音訊是一起生成的,每一次落地的視覺時間點對上拍子的機會,比兩趟式流程高得多。

**可以調的槓桿:**指定另一種曲風——minimal houseorchestral percussionhip-hop at 90 BPM——來換掉那個感覺。如果乾的聲學聽起來太像實驗室,加 slight room reverb


最佳做法整理

該做什麼為什麼重要
對白台詞一字不差地寫出來模型需要準確的文字才能生成對得上的嘴型
把環境層明確點名籠統的描述會產出籠統的聲音
想要安靜或只要音效時用 no music避免自動配樂蓋過你的意圖
維持一種連貫的聲音情緒互相衝突的音訊指示會產出平均掉、沒有焦點的結果
把停頓當成音訊事件描述停頓同時塑形波形和嘴唇動作——它們是同步的一部分
用曲風和速度限制音樂沒有指示的 "Music" 預設就是很罐頭的東西

在 OmniArt 要花多少點數

原生音訊每秒不加價——點數費率跟任何一次 Grok Imagine 生成一樣。

解析度每秒點數
480p每秒 10 點數
720p每秒 15 點數

一段 10 秒、720p 的對白場景要 150 點數。一段 12 秒、480p 的環境場景要 120 點數。如果你正在專門迭代音訊指示——調演繹說明或環境層描述——從 480p 開始,它便宜三分之一,只把你要留的那一條升上去。

在 OmniArt 開始

Grok Imagine 1.5 就在 OmniArt 影片工作台裡,跟素材庫裡其他每一個模型擺在一起——同一份點數餘額、同一個提示詞介面,不需要另外訂閱 xAI。學會原生音訊能做什麼最快的方法,是把一句對白寫進一個文生影片的提示詞,看看模型怎麼處理,再從那裡往下迭代。

想看 Grok Imagine 的生成模式、定價,以及什麼時候該用它而不是別的模型的完整圖像,可以看 Grok Imagine 創作者指南。如果你要在影片生成之外另外找音效、環境音或音樂,AI 音效生成器指南介紹了 OmniArt 專門的音訊模型。

準備好開始創作了嗎?

用 AI 生成精彩內容

免費開始