Industry模型與觀察閱讀時間 13 分鐘

Gemini Omni Flash:真正上線的部分,以及 Google 留了什麼沒放

Google 在 I/O 2026 推出 Gemini Omni Flash——這裡拆解第一個 Omni 模型做得到什麼、哪些能力被刻意保留,還有創作者在 OmniArt 上該怎麼動。

OmniArt 團隊
Gemini Omni Flash:真正上線的部分,以及 Google 留了什麼沒放

Google I/O 2026 在 5 月 19 日落地,等主題演講結束時,Gemini Omni Flash 已經上線了。不是「即將推出」,也不是「限量預覽」——是上線,就在同一天。兩週前我們發過我們對 I/O 前流出消息的解讀,把已證實的訊號和純猜測分開。現在我們拿到真的模型了。以下是實際上線的部分、Google 刻意沒放的部分,以及這對這週就有活要交的創作者代表什麼。

Omni Flash 是 Google 新的「Omni」框架下第一個公開模型。它不是 Veo 4,也不是 Veo 3.1 換個名字——它是獨立的產品線,而 Google DeepMind 已經確認會有一個更高階的 Omni Pro 接在後面。Omni Pro 沒有日期。Flash 是第一階段。

哪些證實了,哪些被保留

那篇流出消息的文章把這個模型形容為「有全模態企圖的 Gemini 原生影片」。這句話站得很穩。等主題演講的塵埃落定,完整的圖像是這樣。

功能狀態對創作者代表什麼
一句提示詞產出 10 秒影片,帶同步音訊已上線這個片長最自然的用途是短影音、預告和台呼
任意對任意輸入:文字、圖片、音訊和影片放在同一句提示詞已上線你可以同時給它一張參考圖、一段語音備忘和一份需求——三者共用一套提示詞語法
對話式/聊天式編輯(「把光線改一下」、「把狗換成貓」)已上線這就是流出消息那篇點名為真正頭條的工作流程轉變——下面細講
每一份輸出都有 SynthID 浮水印已上線——不可關閉,API 沒有開關預設就當作輸出帶浮水印來規劃;商業投放前先確認使用情境條款
在生成影片裡編輯語音或音訊因安全考量保留貼近深偽的風險;Google 已確認這是刻意保留,不是能力不足
虛擬人模式保留跟音訊編輯同一類顧慮——沒有給時程
開發者 API上線時說「未來幾週」;2026 年 6 月 30 日開放標準生成現在可以透過 API 和 OmniArt 使用

注意

兩項重要能力——影片內音訊編輯和虛擬人模式——在上線時被刻意保留,理由不是技術,而是安全。Google 已經確認這一點。如果你的產線靠其中任何一項,沒有繞道方法,也沒有釋出日期。

Google 也公開承認了三項目前的限制:編輯過程中的視覺一致性、複雜的動作序列,還有畫面內可讀文字的生成。這些跟整個 AI 影片類別共有的弱點是同一批;Omni Flash 沒有解決它們。

流出消息對照現實

I/O 之前我們列出了 Omni 可能是什麼的三種情境:Veo 的消費端改名、Gemini 原生的影片模型,或是一套真正全模態的統一系統。我們判斷「情境 2 和 3 的混合」可能性最高。

那是準的。Omni Flash 明顯是 Gemini 原生的——它跑在 Gemini App 和 Google Flow 裡,不是一個獨立的 Veo 介面——而且它的輸入確實是任意對任意。Google 給它的「全模態」定位不是行銷誇大;把文字、圖片、音訊和影片合進同一句提示詞,相對於 Veo 3.1 的輸入模型是一個真實的能力改變。

猜測錯的地方:流出消息裡「remix」那個定位低估了對話式編輯功能的深度。它不只是從頭重混一次。它會在多輪編輯之間維持一致性,而那是本質不同的一件事。

對話式編輯才是真正的頭條

今天每一個主要的 AI 影片模型,在工作流程層級上運作方式都一樣:你寫一句提示詞、等、下載片段,錯了就重下提示詞。Omni Flash 打破了這個循環。對話式編輯功能讓你打 "change the lighting to golden hour" 或 "swap the dog for a cat",然後拿回一段跟先前輸出保持一致的修訂版,而不是從頭重生成。

這件事之所以重要,是因為影片迭代的成本一直都在那個重生成的循環上——時間和點數都是。能維持一致性的多輪編輯,把初稿到成片之間的距離壓縮了。它同時也意味著模型會保留關於你這個專案的狀態,而生成完就丟的流程做不到這件事。

目前承認的限制是真的:複雜的動作序列在多次編輯之間會失去連貫,模型在細緻的視覺細節上也還是會飄。但工作流程的原則是成立的,而且隨著底層模型改進,這個功能最有可能經得起時間考驗。

Omni Flash 在整個陣容裡的位置

Omni Flash 的強項是消費端的易用性、對話式迭代,還有多模態輸入的彈性。它的限制——10 秒片段、不能編輯語音、承認的動態和文字生成缺口——把它的車道劃得很清楚。

這顆鏡頭需要可以找
對話式迭代、聊天式微調Omni Flash(在 Google 自家的介面上)
原生 4K、空間音訊、廣播級收尾Veo 3.1
長的單一鏡次Sora 2
多鏡頭分鏡的連貫性Kling、V6 + BACH
快速、風格化、高能量的片段PixVerse 系列模型
量大時的划算度Kling,以成片秒數計算最有價格優勢

想更深入看 Omni Flash 和 Veo 3.1 逐顆鏡頭的比較,可以看 Gemini Omni Flash 對 Veo 3.1:你的流程該選哪一個

實際上在哪裡用得到

5 月 19 日上線當下,Omni Flash 在 YouTube Shorts、YouTube Create、Gemini App 和 Google Flow 上可用,開發者 API 則還停在「未來幾週」。那個 API 在 2026 年 6 月 30 日開放;標準的 Gemini Omni 影片生成現在也可以透過 OmniArt 的模型頁使用。

想了解更廣的 Veo 產品線脈絡,Veo 4 釋出狀態與 Veo 在 OmniArt 上的位置談了 Veo 3.1 現在做得到什麼,以及它在一個多模型工作台裡怎麼定位。

Omni Pro 確認了——但沒有時程

Google DeepMind 已經確認會有更高階的 Omni Pro,形容它是「相對於 Flash 的一次階段性躍升」。沒有釋出日期、沒有功能清單,也沒有預覽權限。照已經上線的東西規劃,不要照被承諾的東西規劃。

如果你的產線第三季有交付,今天就照 Omni Flash 已確認的規格去建。等 Omni Pro 落地,你是在一條已經在產出的流程裡多加一個選項——你不會等它,也不會為它整個換平台。

說明

這就是多模型工作台在實務上的意義:新的釋出是加法,不是干擾。你拿它來跟你已經在交付的東西比,而不是跟你一直在等的東西比。

這週該做什麼

想用 Google 完整的、保留工作階段的對話式編輯迴圈,就用 Gemini App、Google Flow 或 Interactions API。想做標準的文字和圖片引導生成,Gemini Omni Flash 現在在 OmniArt 上就有,跟其他影片陣容擺在一起。

在 OmniArt 上,你可以把 Gemini Omni Flash 拿來跟 Veo 3.1 和其他陣容比較——PixVerse 系列模型、Sora 2、Kling、Happy Horse、Seedance 2 等等——圖片、影片、音訊和音樂全在同一個工作台裡。一份餘額、一套提示詞語法、一個可以把輸出並排比較的地方。

在你評估 Omni Flash 的同時,想把 Veo 3.1 用到極致的實際步驟,Veo 3.1 提示詞與電影感指南涵蓋了從需求到成片的完整流程。

實際的動作:把你手上的需求丟給那些已經上線而且穩定的模型跑,包括 Gemini Omni Flash,只有在 Omni Pro 帶著一個你現有產線覆蓋不了的任務上線時,才把它加進來。

常見問題

Gemini Omni Flash 現在就能用嗎?

可以。它在 2026 年 5 月 19 日的 Google I/O 上線、6 月 30 日開放開發者 API,現在可以透過 OmniArt 的 Gemini Omni 模型頁做標準生成。Google 那套保留工作階段的對話式控制,仍然只在它自己的產品和 API 介面上。

Omni Flash 和 Veo 3.1 差在哪?

Omni Flash 是 Gemini 原生的,吃任意對任意的輸入(文字、圖片、音訊、影片放在同一句提示詞),而且有對話式的多輪編輯。Veo 3.1 是專門的影片模型,有確認的原生 4K 輸出和空間音訊。兩者的標準生成現在都在 OmniArt 裡;Google 完整的對話式控制介面仍然是分開的。

Google 從 Omni Flash 保留了哪些功能?

兩項能力被刻意保留:影片內的語音和音訊編輯,以及虛擬人模式。Google 已確認這是基於安全考量,不是因為技術限制。兩者都沒有釋出日期。

Gemini Omni Pro 會取代 Flash 嗎?

Google DeepMind 已確認 Omni Pro 是未來更高階的模型,形容為「相對於 Flash 的一次階段性躍升」,但功能、定價和釋出日期都沒有公布。照 Flash 已確認的能力規劃;把 Omni Pro 當成未來的加項。

Omni Flash 有 SynthID 浮水印嗎?

有。每一份 Omni Flash 輸出都帶 SynthID 浮水印。它不可關閉,API 也沒有開關。在商業情境使用輸出之前,先確認該平台的服務條款。

準備好開始創作了嗎?

用 AI 生成精彩內容

免費開始