Industry模型與觀察閱讀時間 16 分鐘

Gemini Omni 外流:Google 這個影片模型可能意味著什麼

Google I/O 2026 前夕,外流訊息指向一個 Gemini Omni 影片模型。什麼已經確認、什麼還是傳聞,以及 OmniArt 創作者這週該做什麼。

OmniArt 團隊
Gemini Omni 外流:Google 這個影片模型可能意味著什麼

Google I/O 2026 落在 5 月 19 到 20 日,而網路上 AI 影片這一角已經先把發表會過了一遍。起因是有人在 Gemini 的影片分頁裡看到一行介面文字:"Start with an idea or try a template. Powered by Omni."。從這一行出發,三波外流訊息拼出了一個尚未發表的 Google 影片模型的輪廓——暫時被叫做 Gemini Omni——它可能取代 Veo 3.1、可能跟它並存,也可能悄悄把 Google 整套生成技術升級一輪。

這篇文章是寫給 OmniArt 創作者的判讀:在星期二之前,你到底該不該為它做什麼。我們把確認過的訊號和推測分開,走過 Omni 的三種可能身分,最後給出這週就得交片的創作者該採取的務實動作。

我們實際知道什麼(以及不知道什麼)

訊號狀態意義
Gemini 影片分頁裡的介面文字 "Powered by Omni"截圖已確認一個叫 Omni 的產品已經備好,等在功能旗標後面
模型 ID bard_eac_video_generation_omni透過應用程式檢視回報一個內部識別碼已經串進 Gemini 的影片流程
10 秒片段上限早期測試者回報暗示是早期階段或消費者級距的限制,不是 API 級距
"Remix your videos, edit directly in chat, try a template"回報的功能文案是編輯與混剪流程,不是只能生成
文字連貫性很強(例如數學算式)演示報導中提及對畫面內字體排印來說是值得注意的技術進展
原生音訊未確認Veo 3.1 有原生音訊;Omni 的狀態不明
API 存取未確認開發者不該依照未經確認的開放程度做規劃
取代、補充,還是把 Veo 3.1 換皮未解問題對製作團隊來說最重要的問題

老實的總結:一個叫 Omni 的 Google 影片產品,真實到已經有介面文案出貨了;但關於它的每一項架構宣稱,都還只是從應用程式字串和測試者回報推論出來的。

三種可能的身分

大部分的不確定性可以收攏成三種情境,各自對創作者依賴的那排 AI 影片工具有不同的意涵。

情境 1——Veo 的消費端換皮

最簡單的讀法:Omni 是 Gemini 內部取代「Veo」這個品牌的消費端門面,就像 Google 把圖片生成整併到「Nano Banana」底下那樣。Veo 仍然是底層引擎,Omni 是大多數使用者看到的表層。

如果是這樣,預期會看到:相對 Veo 3.1 的能力變化不大、消費者級距一樣是 8 到 10 秒的上限,而 Veo 繼續走企業/API 那條線。

情境 2——Gemini 原生的影片模型

第二種讀法:Omni 是專門為影片微調過的 Gemini 架構版本,與 Veo 那條線平行運作。Veo 留在 API 和企業端當專用影片模型,Omni 則是消費端模型,並受惠於 Gemini 的文字與推理能力。

如果是這樣,預期會看到:更強的提示詞貼合度、更好的畫面內字體排印(數學算式那些回報支持這一點),以及跟 Gemini 對話式編輯更緊密的整合。

情境 3——真正的全模態模型

最有野心的讀法:Omni 是一套統一的系統,用單一模型原生生成文字、圖片、影片和音訊。「Omni」這個名字本身就暗示,這是 Google 正在朝向的那個情境,即使發表當下離完整對齊還有距離。

如果是這樣,預期會看到:流程明顯往對話式編輯移動、在對話裡完成跨模態的交接,以及對業界其他人那套「一種模態一個模型」的堆疊構成長期挑戰。

I/O 上最可能的結果,是情境 2 和 3 的某種混合——一個帶著全模態企圖、但發表時仍受消費者級距限制的 Gemini 原生影片模型。

為什麼那些回報的功能重要

有三項回報的功能,值得比「模型身分」這個問題更多的關注,因為不論誰先出貨,它們都指出了 AI 影片這個類別要往哪去。

對話式編輯成為預設

"Remix your videos, edit directly in chat" 是這波外流裡真正改變流程話題的那一塊。今天大多數 AI 影片工具還停在「生成然後下載」——你下提示詞、你等、你存檔、你為了改動再下一次提示詞。以對話為基礎的編輯,把模型重新定義成一個持續在場的協作者:「把第二顆鏡頭調暖一點」、「換掉背景」、「再延長三秒」。如果 Omni 把這件事做得夠好,它會逼每一個其他模型跟上。

範本作為入口坡道

範本降低了新使用者的提示詞工程門檻——這是真實的好處。但當所有人都從同一句共用提示詞出發,它們也會把輸出的多樣性壓平。有意思的問題不是範本會不會出貨,而是它們有沒有真的贏過一句從零寫好的需求。

影片裡的文字

有報導指出數學算式能在生成影片裡乾淨地算出來,這在技術上很值得注意。畫面內字體排印一直是每個主要模型看得見的弱點。如果 Omni 能可靠地處理複雜的字體排印,那就打開了解說影片、教育和動態圖像這幾條原本需要另外合成一輪的流程。

Omni 會怎麼卡進這排陣容

對已經跨多個 AI 影片模型工作的創作者來說,相關的問題是 Omni 落在哪,而不是它贏不贏。依照回報的功能,答案的形狀大致是:

能力Gemini Omni(回報)Veo 3.1(已確認)V6 / R1Sora 2
時長10 秒(回報)最長 8 秒1–15 秒最長 20 秒
解析度未知最高 1080p最高 1080p1080p,有 4K
原生音訊未確認已確認內含內含
編輯/混剪回報:混剪、對話、範本有限Modify、Extend、多片段有限
API 存取未確認可用可用可用
最強的地方對話式編輯(回報)原生 4K、空間音訊電影感控制、即時長單鏡

如果外流的功能組合成立,Omni 的車道就是「對話式的消費端影片」——快速社群工作和對話驅動迭代的甜蜜點。電影感、播出等級和多鏡頭那幾條車道,在有證據之前仍屬於它們現在的領先者。

這對創作者這週意味著什麼

面對一次發表前的外流,人的直覺是等。對任何未來十天內有交付物的人,我們會反對這個直覺。

注意

把媒體上的每一項 Omni 功能都當成發表前訊號,不是已確認的能力。建立在回報規格上的計畫,大約有一半熬得過發表會。

務實的做法取決於你要交什麼。

如果你這週就要交影片

用已經上線且驗證過的東西。電影感鏡頭用 V6,原生 4K 的播出剪輯用 Veo 3.1,多語言社群變體用 Kling 3.0,快速迭代用 HappyHorse 1.0。在 OmniArt 裡這些都只差一次點擊,所以你不必在發表會之前押上任何單一工具。

如果你在規劃第三季的製作

把需求建立在能力上,不是品牌上。把你真正需要的東西寫下來——時長、解析度、音訊、編輯模式、角色鎖定——然後讓 I/O 之後的陣容在兩週後重新競標這份工作。如果 Omni 出貨而且表現得住,這份需求就能插進去,流程的其餘部分不用重寫。

如果你在研究和學習

看發表會。存下測試,不是意見。發表之後你能擁有最有價值的東西,是一次同基準的比較——同一份需求、同一批參考素材、同一套評分準則——跑過不管出貨的是什麼、跑過 Veo 3.1,也跑過既有的陣容。

Omni 訊號背後更大的轉變

不管 Omni 最後是什麼,這些外流訊息講的,其實是關於這個類別的故事,而不只是關於 Google。

競爭的戰場正在移動。 第一輪輸出的視覺品質在領先者之間正在收斂。真正的差異化正往可控性、多鏡頭一致性、聲畫同步、對話式編輯,以及一個模型跟真實流程貼合得有多好的方向移動——而不是哪個模型贏了某個基準測試。

成本仍然是真的。 Omni 介面裡反覆被回報的用量限制和消耗量分頁,證實了高保真影片生成在規模化之後依然吃算力。範本和短片段上限,一部分是使用體驗,一部分是經濟考量。

權利和混剪會更難處理。 在生成影片之上再做混剪,會帶出文生影片流程沒有完全浮現出來的智慧財產權、同意和商用問題。任何要把混剪產出投進付費媒體的團隊,最好在功能出貨之前就把權利檢查清單準備好。

OmniArt 後來怎麼因應這次發表

這篇文章記錄的是 2026 年 5 月 13 日當下的 I/O 前外流狀態。Google 後來發表了 Gemini Omni Flash、開放了開發者存取,而這個模型也已經加入 OmniArt 的影片工作台,支援標準的文字與圖片引導生成。

它現在跟 Veo 3.1、Sora 2、V6、Kling 3.0、Happy Horse 1.0、Seedance 2.0、Runway Gen-4.5、Hailuo 和 Grok Imagine 並排——一套提示詞語法、一份餘額、一個把它跟其他模型放在一起比較的地方。Google 那套帶狀態的對話式編輯控制項,目前沒有在 OmniArt 上開放。

想了解目前的影片陣容,可以看 OmniArt 影片模型導覽。想知道怎麼寫出能乾淨地在各模型之間搬動的需求,可以看提示詞寫作指南

常見問題

Gemini Omni 正式發表了嗎?

發表了。這篇文章寫於發表之前;Google 隨後在 I/O 2026 上推出 Gemini Omni Flash,並於 6 月 30 日開放開發者存取。Gemini Omni Flash 現在在 OmniArt 上可用,支援標準生成。

Gemini Omni 會取代 Veo 3.1 嗎?

還不清楚。三種可能的情境是:Omni 是 Veo 在消費端的換皮、Omni 作為 Gemini 原生的消費端模型與 Veo 並存,或 Omni 是一套真正的全模態統一系統。發表當下最可能的是第二種和第三種的混合。

Gemini Omni 有哪些被回報的功能?

被回報的功能包括在 Gemini 對話裡直接編輯、一套混剪流程、提示詞範本、影片內很強的文字連貫性(數學算式能乾淨地算出來),以及 10 秒的片段上限。這些都還沒有官方確認。

這週要做影片,我該等 Omni 嗎?

不用。用今天已經上線而且穩定的模型。現有陣容已經涵蓋電影感鏡頭、原生 4K 播出、多語言社群、快速迭代、多鏡頭連戲和影格級特效,而 Gemini Omni Flash 現在也是這些可用選項之一。

Omni 跟 Veo 3.1 比起來如何?

Omni 的優勢在對話式編輯和靈活的輸入;Veo 3.1 的強項是原生音訊和 4K 輸出。兩者現在都能在 OmniArt 上做標準生成,所以你可以拿同一份需求比較它們;當測試明確需要帶狀態的對話式編輯時,就用 Google 自己的 API 介面。

準備好開始創作了嗎?

用 AI 生成精彩內容

免費開始