Industry模型與觀察閱讀時間 9 分鐘

Gemini Omni Flash 的任意模態輸入實際做得到什麼

Omni-modal 是 Gemini Omni Flash 的招牌賣點,但實際上線的 API 比行銷說法窄。任意模態輸入真正改變的,是一份需求的寫法。

OmniArt 團隊
Gemini Omni Flash 的任意模態輸入實際做得到什麼

Gemini Omni Flash 發表時扛最重的那個字是「Omni」——它承諾的是一個模型,讓你在同一句提示詞裡一次餵進文字、圖片、音訊和影片。這跟在它之前那些單一輸入的影片模型,確實是完全不同的訴求,也是這個名字站得住腳的原因。但實際在開發者 API 上線的版本,比發表會上的框架窄,而如果你正打算圍繞它安排真實工作,那個落差就很重要。

這篇文章把「任意模態輸入今天實際給你什麼」和「什麼還停在願景階段」分開,然後談更有用的那件事:多模態輸入怎麼從根本改變你寫需求的方式。

「any-to-any」實際上是什麼意思

大多數影片模型只吃一種操控方式。你寫文字,或給一張參考圖,模型就從那裡出發。任意模態輸入的意思是,同一套提示詞語法可以同時接受好幾種模態,並回傳一個尊重全部輸入的連貫結果:一張參考影格決定樣貌、一段短片決定動態、一段文字說明其餘的一切——是合起來,不是二選一。

這個轉變,是從用文字描述一顆鏡頭,變成用素材組合出一顆鏡頭。那才是真正的能力,也是「omni-modal」不算純行銷的原因。問題在於,其中有多少真的上線了。

宣傳說法與實際上線的 API

以下是目前預覽版的老實對照表,直接來自 API 自己的文件:

輸入狀態說明
文字提示詞支援每一次生成的骨幹
圖片參考支援文生影片、圖生影片和主體參考
影片參考支援,但有但書超過 3 秒的參考素材不會被完整處理
音訊參考不支援你無法上傳一段聲音或人聲讓模型去對
多個影片參考不支援每次生成只能一段參考片段
非英文提示詞未經測試英文是唯一完整支援的語言

注意

音訊這個缺口最可能把一份計畫絆倒。Omni Flash 預設會生成音軌,但「any-to-any」不包括把一層音樂床、一段旁白或一份環境錄音交給它去對時。音訊是你用文字操控的輸出,不是你提供的輸入。

所以準確的讀法是:今天的任意模態輸入等於文字+圖片+影片進,影片(含生成音訊)出。omni-modal 承諾裡「音訊進」的那一半是刻意保留的——這跟 Google 在發表時基於安全考量按下的畫面內語音編輯和虛擬人像功能一致。相對於單一輸入的模型,這是一次真正的能力改變;只是還不到這個名字暗示的那種完整的 any-to-any-to-any 圖景。

多模態輸入改變了需求的什麼

當你開始用素材組合、而不是用散文描述,需求本身的形狀就變了。三種輸入各司其職,功夫在於把每一種指派給它最擅長的事:

  • 圖片參考承載樣貌——主體、色調,以及你已經喜歡的那個構圖。
  • 影片參考承載動態——你想要被呼應的某個運鏡或某個動作。
  • 文字承載意圖,以及素材沒有呈現出來的一切——氛圍、變化,還有兩份參考素材裡都沒有的那個東西。

實務上的效果是,你不用再費力把一張畫面翻譯成形容詞。與其寫「一顆溫暖的、淺景深的特寫,帶緩慢推進」,不如直接提供那張本來就長那樣的影格、和那段本來就那樣動的片段,然後把字數花在新的東西上。對任何曾經為了用文字描述某種特定美學而掙扎過的人來說,這就是流程上的解鎖。

四種任務模式,以及它們怎麼串

這個 API 開放四種 task 類型,而它們乾淨地對應到「用素材組合」這個想法:

  1. text_to_video — 純描述,沒有素材。從零開始時的退路。
  2. image_to_video — 讓一張定格動起來。最常見的入口:一張強力的圖片變成動態的第一影格。
  3. reference_to_video — 把某個主體或風格從參考素材帶進一次新的生成。
  4. edit — 對話式、帶狀態的模式,修改前一段片子,同時保住你沒有動到的部分。

它設想的流程是把這幾種串起來:先用前三種其中之一生成或動畫化一個基底,再進到 edit 用對話的方式打磨。這跟 Google 自己的 Nano Banana 2 Lite 接 Omni Flash 的搭配是同一個形狀——先改一張定格,再讓它動起來——只是延伸到了多輪對話。

音訊那個細節,講明白

因為音訊沒辦法提供,聲音設計就變成一件寫作的工作。模型會根據你的提示詞描述產出對白、音效和環境音——像是 "gentle rain on a window, no music" 或 "a single soft click, then room tone."。你確實有有意義的控制權,但那是描述性的控制權,而這對規劃來說意味著兩件事:

  • 如果你的專案需要生成出來的影片對上一段既有的音軌——一首授權歌曲、一段品牌音效標、一段錄好的旁白——那個對時要在另一個音訊步驟裡處理,不在 Omni Flash 裡面。
  • 如果你只是需要一段合適的原創聲音,在提示詞裡把它描述好,不用上傳也到得了。

OmniArt 今天落在哪裡

「用素材組合」這套流程,你不必等 Omni Flash 才能試——OmniArt 影片工作台裡上線的模型早就跑得動,而且在某一點上走得更遠。

現在就能在 OmniArt 上用的 Seedance 2.0,正是圍繞這個想法造出來的:它在同一句提示詞裡最多吃九張圖片、三段影片,而且——值得注意——三個音訊檔,每一個都用 @image1 / @video1 / @audio1 語法綁定一個角色。那包含了 Omni Flash 保留起來的音訊參考輸入。如果你的需求就是要餵一段特定的聲音給模型用,這條路今天就存在。

而整個領域的走向也很清楚:六月發表的 Seedance 2.5 把同一套參考架構推到一次最多 50 個多模態輸入。任意模態輸入不是單一模型的故事——那是有導演意識的 AI 影片正在去的方向。Omni Flash 替這個想法命了名;而工作台已經讓你可以動手練了。

打開 OmniArt 上的影片工作台,把你的參考素材組合起來,讓素材承載樣貌和動態,讓你的文字承載意圖。這就是任意模態的需求寫法,現在就能用。

準備好開始創作了嗎?

用 AI 生成精彩內容

免費開始