Guide教學與操作指南閱讀時間 11 分鐘

Gemini Omni Flash 的 10 秒影片提示詞怎麼寫

Gemini Omni Flash 的提示詞介面很特別:沒有負面提示詞參數、只有兩種畫面比例、只支援英文,還有兩種截然不同的提示模式。這篇教你兩種都寫好。

OmniArt 團隊
Gemini Omni Flash 的 10 秒影片提示詞怎麼寫

大多數 AI 影片提示詞指南只教你寫一種東西:一段豐富、細節齊全、交給模型一次的段落。Gemini Omni Flash 打破了這個前提。它的開發者 API(6 月 30 日起上線)是圍繞兩種不同的提示行為建構的——第一次生成,然後是一連串持續的編輯對話,每一輪都在重塑同一段片子。只寫其中一種、忽略另一種,你就把這個模型的大半留在桌上沒動。

Omni Flash 的提示詞介面在「拿掉了什麼」上也很不尋常。沒有負面提示詞欄位、沒有 temperature 旋鈕、沒有系統指令,畫面比例只有兩種。這些不是要盲目繞過的缺口——每一項都改變了你該怎麼措辭。這篇指南涵蓋兩種模式,以及塑造它們的那些限制。

說明

在這篇指南發佈之後,Gemini Omni Flash 已經加入 OmniArt 的影片工作台,支援標準的文字與圖片引導生成。下面幾節仍然直接描述 Google 的對話式流程,因為 OmniArt 目前沒有開放那套會保留工作階段的 Interactions API 控制項。

兩種提示模式,不是一種

每一次 Omni Flash 的工作階段都有兩種提示詞,而它們獎勵的寫法不一樣。

第一次生成的提示詞是一份寫給單一個 10 秒節拍的完整需求:主體、動態、攝影、光線、聲音、風格。它的行為跟任何一句好的文生影片或圖生影片提示詞一樣——細節往前放、講具體、一次把整顆鏡頭描述完。

對話式編輯的指令則相反。它很短,只點名一個改動,而且假設模型腦子裡還握著前一段片子。"Make the lighting golden hour."、"Swap the sedan for a pickup."。模型會套用那個改動,同時保住你沒有提到的一切——靠的是 previous_interaction_id,它透過 Interactions API 把工作階段狀態帶過最多三次連續編輯。把三個改動塞進同一句編輯指令,你就失去了讓這個模式值得用的那份精準。

心智模型是:**第一句用來組合,後續幾句用來指揮。**先拿到一段扎實的基底片子,然後像在拍攝現場給導演下註記那樣打磨它——一次一個註記。

塑造你措辭的那些 API 限制

Omni Flash 的參數清單短得很刻意。每一項缺席都有它在提示詞上的後果:

限制它對提示詞的意義
沒有負面提示詞欄位把排除項寫進提示詞本身——寫 "an empty street, no pedestrians, no traffic",而不是另開一份負面清單
沒有 temperature/top_p/系統指令你沒辦法調整變異度,也沒辦法設定一條持久的風格規則——每次都把語氣和風格烘進提示詞文字裡
畫面比例只有 9:16 或 16:9一開始就決定方向;沒有方形或電影超寬選項,所以從第一個字就要為直式或橫式構圖
音訊只能描述,永遠不能上傳你沒辦法丟一段音軌給它去對——你用文字描述你要的聲音(見下)
完整支援英文,其他語言未經測試用英文寫提示詞,結果才可預測
10 秒硬上限每次生成一個清楚的動作——不是一張鏡頭表

注意

Omni Flash 沒有音訊參考上傳。你沒辦法給它一層音樂床或一段人聲樣本去對時。它預設會生成一條音軌,而你唯一的控制權就是提示詞裡的文字——所以聲音設計必須用寫的,不能用附加的。

第一次生成的範本

因為 10 秒只裝得下一個節拍,最強的第一句提示詞會描述一個連續的瞬間,而且每一層都指定清楚。六個欄位幾乎涵蓋得了任何一顆鏡頭:

  1. 主體 — 畫面上是誰或是什麼,具體地描述
  2. 動態 — 在整段片子裡演完的那一個動作
  3. 攝影 — 一個移動,不是一串("slow push in"、"locked-off wide")
  4. 光線 — 方向、質感、時間
  5. 聲音設計 — 你要生成的音訊,用文字寫
  6. 風格 — 色調、年代、電影參照、質地

一個實作範例:

"A ceramic pour-over coffee dripper on a pale oak counter, steam rising as dark coffee streams into the glass carafe below. Slow push in on the drip. Soft morning light from a window camera-left, warm and diffused. Sound: gentle water trickle, distant kitchen ambience, no music. Muted editorial palette, shallow depth of field, shot on a fast prime lens."

注意排除項就住在句子裡面("no music")、攝影只有一個移動,而且聲音是拼寫出來的。整套紀律就這麼多。

對話式編輯:真的有效的詞彙

一旦你有了基底片子,編輯就是 Omni Flash 拉開跟「生成完就丟」流程差距的地方。每一句指令只放一個意圖,並且靠一套模型讀得乾淨的一致動詞詞彙:

  • 重新打光 — "make it golden hour"、"add a cool rim light from behind"
  • 替換 — "swap the coffee dripper for a French press"
  • 換風格 — "make it feel like 1970s film stock"
  • 換顏色 — "change the mug to matte black"
  • 改節奏 — "slow the pour down"、"let the steam linger longer"

有兩條規則能讓這串對話保持連貫。一輪一個改動——模型會保住你沒提到的東西,所以單一註記的編輯既比較可預測,也比較容易靠重下提示詞退回去。還有接著前一輪的用語往下寫——重複用你已經立好的名詞("the mug"、"the pour"),模型才會錨定在同樣的元素上,而不是重新推斷整個場景。

小技巧

那三次編輯是一份預算,不是一個建議。把基底提示詞規劃到需要最少後續輪次——一次強力的第一次生成,會把你的編輯輪次留給真正的創意改動,而不是拿去補第一句提示詞本來就能指定的東西。

繞開目前的限制

有幾個限制不是提示詞解得了的,與其硬碰,不如寫提示詞時就把它們放在心上:

  • 10 秒上限。 API 裡沒有場景延長,所以別寫暗示更長弧線的提示詞。設計一個站得住的獨立節拍。
  • 跨場景的角色一致性是官方承認的弱點。如果肖像一致很重要,就把編輯保持在同一個場景裡,不要要求模型把角色搬到新環境。
  • 超過 3 秒的影片參考不會被完整處理。 任何參考片段都保持短而扼要。
  • 不支援多影片參考,也不支援人聲編輯——這兩項都沒有,所以把那些步驟安排到另一套工具裡,而不是塞進提示詞。

這些對一個快速、短片形式的迭代工具來說都不算致命。它們只是意味著 Omni Flash 獎勵那種把範圍收在它擅長之處的提示詞:一個緊湊的節拍,然後用對話打磨。

OmniArt 上今天行得通的部分

Gemini Omni Flash 現在在 OmniArt 上可用,上面幾乎每一個提示詞習慣都直接適用:一個清楚的節拍、具體勝過關鍵字大雜燴,以及把聲音寫進提示詞裡。主要的例外是多輪、保留工作階段的編輯,那仍然是上游 API 的流程,不是 OmniArt 的介面控制項。

  • 參考素材驅動的生成直接對應到 OmniArt 上線的 Seedance 2.0,它最多吃九張圖片、三段影片和三個音訊檔,用 @image1 / @video1 語法綁定角色——就是「用素材組合」的想法,而且輸入比 Omni Flash 給的更多。
  • 電影感的攝影語言對應到 Veo 3.1,它對 "drift"、"glide"、"dolly in" 這類動態動詞的詮釋帶著克制。
  • 六欄位範本(主體、動態、攝影、光線、聲音、風格)是同一副骨架,在工作台裡每一個影片模型上都做得出乾淨的結果。

打開影片工作台裡的 Gemini Omni Flash,把第一句提示詞寫成一個完整的節拍。如果你需要 Google 的多輪編輯循環,那一段就繼續在 Interactions API 上做;至於標準生成和參考圖流程,OmniArt 的模型入口現在就準備好了。

準備好開始創作了嗎?

用 AI 生成精彩內容

免費開始