Gemini Omni Flash:真正上線的部分,以及 Google 留了什麼沒放
Google 在 I/O 2026 推出 Gemini Omni Flash——這裡拆解第一個 Omni 模型做得到什麼、哪些能力被刻意保留,還有創作者在 OmniArt 上該怎麼動。

Google I/O 2026 在 5 月 19 日落地,等主題演講結束時,Gemini Omni Flash 已經上線了。不是「即將推出」,也不是「限量預覽」——是上線,就在同一天。兩週前我們發過我們對 I/O 前流出消息的解讀,把已證實的訊號和純猜測分開。現在我們拿到真的模型了。以下是實際上線的部分、Google 刻意沒放的部分,以及這對這週就有活要交的創作者代表什麼。
Omni Flash 是 Google 新的「Omni」框架下第一個公開模型。它不是 Veo 4,也不是 Veo 3.1 換個名字——它是獨立的產品線,而 Google DeepMind 已經確認會有一個更高階的 Omni Pro 接在後面。Omni Pro 沒有日期。Flash 是第一階段。
哪些證實了,哪些被保留
那篇流出消息的文章把這個模型形容為「有全模態企圖的 Gemini 原生影片」。這句話站得很穩。等主題演講的塵埃落定,完整的圖像是這樣。
| 功能 | 狀態 | 對創作者代表什麼 |
|---|---|---|
| 一句提示詞產出 10 秒影片,帶同步音訊 | 已上線 | 這個片長最自然的用途是短影音、預告和台呼 |
| 任意對任意輸入:文字、圖片、音訊和影片放在同一句提示詞 | 已上線 | 你可以同時給它一張參考圖、一段語音備忘和一份需求——三者共用一套提示詞語法 |
| 對話式/聊天式編輯(「把光線改一下」、「把狗換成貓」) | 已上線 | 這就是流出消息那篇點名為真正頭條的工作流程轉變——下面細講 |
| 每一份輸出都有 SynthID 浮水印 | 已上線——不可關閉,API 沒有開關 | 預設就當作輸出帶浮水印來規劃;商業投放前先確認使用情境條款 |
| 在生成影片裡編輯語音或音訊 | 因安全考量保留 | 貼近深偽的風險;Google 已確認這是刻意保留,不是能力不足 |
| 虛擬人模式 | 保留 | 跟音訊編輯同一類顧慮——沒有給時程 |
| 開發者 API | 上線時說「未來幾週」;2026 年 6 月 30 日開放 | 標準生成現在可以透過 API 和 OmniArt 使用 |
注意
Google 也公開承認了三項目前的限制:編輯過程中的視覺一致性、複雜的動作序列,還有畫面內可讀文字的生成。這些跟整個 AI 影片類別共有的弱點是同一批;Omni Flash 沒有解決它們。
流出消息對照現實
I/O 之前我們列出了 Omni 可能是什麼的三種情境:Veo 的消費端改名、Gemini 原生的影片模型,或是一套真正全模態的統一系統。我們判斷「情境 2 和 3 的混合」可能性最高。
那是準的。Omni Flash 明顯是 Gemini 原生的——它跑在 Gemini App 和 Google Flow 裡,不是一個獨立的 Veo 介面——而且它的輸入確實是任意對任意。Google 給它的「全模態」定位不是行銷誇大;把文字、圖片、音訊和影片合進同一句提示詞,相對於 Veo 3.1 的輸入模型是一個真實的能力改變。
猜測錯的地方:流出消息裡「remix」那個定位低估了對話式編輯功能的深度。它不只是從頭重混一次。它會在多輪編輯之間維持一致性,而那是本質不同的一件事。
對話式編輯才是真正的頭條
今天每一個主要的 AI 影片模型,在工作流程層級上運作方式都一樣:你寫一句提示詞、等、下載片段,錯了就重下提示詞。Omni Flash 打破了這個循環。對話式編輯功能讓你打 "change the lighting to golden hour" 或 "swap the dog for a cat",然後拿回一段跟先前輸出保持一致的修訂版,而不是從頭重生成。
這件事之所以重要,是因為影片迭代的成本一直都在那個重生成的循環上——時間和點數都是。能維持一致性的多輪編輯,把初稿到成片之間的距離壓縮了。它同時也意味著模型會保留關於你這個專案的狀態,而生成完就丟的流程做不到這件事。
目前承認的限制是真的:複雜的動作序列在多次編輯之間會失去連貫,模型在細緻的視覺細節上也還是會飄。但工作流程的原則是成立的,而且隨著底層模型改進,這個功能最有可能經得起時間考驗。
Omni Flash 在整個陣容裡的位置
Omni Flash 的強項是消費端的易用性、對話式迭代,還有多模態輸入的彈性。它的限制——10 秒片段、不能編輯語音、承認的動態和文字生成缺口——把它的車道劃得很清楚。
| 這顆鏡頭需要 | 可以找 |
|---|---|
| 對話式迭代、聊天式微調 | Omni Flash(在 Google 自家的介面上) |
| 原生 4K、空間音訊、廣播級收尾 | Veo 3.1 |
| 長的單一鏡次 | Sora 2 |
| 多鏡頭分鏡的連貫性 | Kling、V6 + BACH |
| 快速、風格化、高能量的片段 | PixVerse 系列模型 |
| 量大時的划算度 | Kling,以成片秒數計算最有價格優勢 |
想更深入看 Omni Flash 和 Veo 3.1 逐顆鏡頭的比較,可以看 Gemini Omni Flash 對 Veo 3.1:你的流程該選哪一個。
實際上在哪裡用得到
5 月 19 日上線當下,Omni Flash 在 YouTube Shorts、YouTube Create、Gemini App 和 Google Flow 上可用,開發者 API 則還停在「未來幾週」。那個 API 在 2026 年 6 月 30 日開放;標準的 Gemini Omni 影片生成現在也可以透過 OmniArt 的模型頁使用。
想了解更廣的 Veo 產品線脈絡,Veo 4 釋出狀態與 Veo 在 OmniArt 上的位置談了 Veo 3.1 現在做得到什麼,以及它在一個多模型工作台裡怎麼定位。
Omni Pro 確認了——但沒有時程
Google DeepMind 已經確認會有更高階的 Omni Pro,形容它是「相對於 Flash 的一次階段性躍升」。沒有釋出日期、沒有功能清單,也沒有預覽權限。照已經上線的東西規劃,不要照被承諾的東西規劃。
如果你的產線第三季有交付,今天就照 Omni Flash 已確認的規格去建。等 Omni Pro 落地,你是在一條已經在產出的流程裡多加一個選項——你不會等它,也不會為它整個換平台。
說明
這週該做什麼
想用 Google 完整的、保留工作階段的對話式編輯迴圈,就用 Gemini App、Google Flow 或 Interactions API。想做標準的文字和圖片引導生成,Gemini Omni Flash 現在在 OmniArt 上就有,跟其他影片陣容擺在一起。
在 OmniArt 上,你可以把 Gemini Omni Flash 拿來跟 Veo 3.1 和其他陣容比較——PixVerse 系列模型、Sora 2、Kling、Happy Horse、Seedance 2 等等——圖片、影片、音訊和音樂全在同一個工作台裡。一份餘額、一套提示詞語法、一個可以把輸出並排比較的地方。
在你評估 Omni Flash 的同時,想把 Veo 3.1 用到極致的實際步驟,Veo 3.1 提示詞與電影感指南涵蓋了從需求到成片的完整流程。
實際的動作:把你手上的需求丟給那些已經上線而且穩定的模型跑,包括 Gemini Omni Flash,只有在 Omni Pro 帶著一個你現有產線覆蓋不了的任務上線時,才把它加進來。
常見問題
Gemini Omni Flash 現在就能用嗎?
可以。它在 2026 年 5 月 19 日的 Google I/O 上線、6 月 30 日開放開發者 API,現在可以透過 OmniArt 的 Gemini Omni 模型頁做標準生成。Google 那套保留工作階段的對話式控制,仍然只在它自己的產品和 API 介面上。
Omni Flash 和 Veo 3.1 差在哪?
Omni Flash 是 Gemini 原生的,吃任意對任意的輸入(文字、圖片、音訊、影片放在同一句提示詞),而且有對話式的多輪編輯。Veo 3.1 是專門的影片模型,有確認的原生 4K 輸出和空間音訊。兩者的標準生成現在都在 OmniArt 裡;Google 完整的對話式控制介面仍然是分開的。
Google 從 Omni Flash 保留了哪些功能?
兩項能力被刻意保留:影片內的語音和音訊編輯,以及虛擬人模式。Google 已確認這是基於安全考量,不是因為技術限制。兩者都沒有釋出日期。
Gemini Omni Pro 會取代 Flash 嗎?
Google DeepMind 已確認 Omni Pro 是未來更高階的模型,形容為「相對於 Flash 的一次階段性躍升」,但功能、定價和釋出日期都沒有公布。照 Flash 已確認的能力規劃;把 Omni Pro 當成未來的加項。
Omni Flash 有 SynthID 浮水印嗎?
有。每一份 Omni Flash 輸出都帶 SynthID 浮水印。它不可關閉,API 也沒有開關。在商業情境使用輸出之前,先確認該平台的服務條款。
準備好開始創作了嗎?
用 AI 生成精彩內容