Industry模型與觀察閱讀時間 19 分鐘

為創作者拆解即時 AI 影片與世界模型

即時 AI 影片和世界模型真正的意思是什麼,互動式影片生成跟批次的文生影片差在哪裡,以及這對創作者到底改變了什麼。

OmniArt 團隊
為創作者拆解即時 AI 影片與世界模型

即時 AI 影片是現在生成式媒體裡最多人討論的前沿,同時也是定義最模糊的一塊。看是誰在講,它可能指一個生成速度比播放還快的模型、一個你可以在它跑的時候用鍵盤操控的模型,或是一個腦子裡裝著一整個模擬環境的模型。這是三個不同的技術問題,有三條不同的時間軸,而把它們壓成同一個標題,正是創作者最後圍著還不存在的能力做規劃的原因。

這篇文章要把這些詞分開。「即時生成」實際上在描述什麼、「世界模型」是什麼又不是什麼、誰在這個領域裡動工、真正的硬限制在哪,以及——對這個月手上有交付物的人來說最重要的部分——這對今天要出貨的工作改變了什麼、又沒有改變什麼。短版本是:正式的影片產出還是跑在批次模型上,而且還會這樣一陣子。

在 AI 影片裡,「即時」到底是什麼意思

多數創作者在用的模型是批次模型。你寫一份簡報、送出,模型把整支片當成一個單位規劃並生成出來,幾秒或幾分鐘之後你拿到一個完成的檔案。輸出的內容沒有任何一部分是在你看著的時候決定的。這次生成就是一個任務。

即時生成把這個循環反過來。模型不是產出一支完成的片,而是連續產出畫面,快到這道串流可以邊做邊看——而且關鍵是,快到中途送進來的輸入可以影響接下來的畫面。人們講「即時」的時候,通常指的是最後這個性質,而它更精確的說法是互動式影片生成

同一個標籤底下其實藏了三種不同的宣稱:

宣稱意思是什麼為什麼難
生成比播放快生成一支片的時間,比看完它還短主要是效率和基礎設施問題
串流式生成畫面逐步送達,而不是一次到齊需要因果式、逐格的架構
互動式生成你中途的輸入會改變接下來發生的事需要模型持有並更新狀態

第一種是最佳化。第三種是另一個類別的系統。

世界模型是什麼(又不是什麼)

世界模型不只是一個跑得比較久的影片模型。差別在於狀態。一個文生影片模型把提示詞映射成一串畫面;提示詞就是全部的指令,那串畫面就是全部的答案。世界模型則維持一個場景的內部表徵——裡面有什麼、東西在哪、它們怎麼運作——並把畫面當成那個表徵的一個_視角_生成出來,再依照動作去更新它。

這也是為什麼世界模型常常跟遊戲引擎一起被討論,而不是跟影片工具一起。這個比喻不完美,但很有用:

性質批次文生影片世界模型
輸出單位一支完成的片一個持續生成的視角
指令一段提示詞,一開始就給完一段提示詞加上持續進來的動作
內部狀態隱式,生成完就丟掉顯式,而且在一次工作階段裡持續存在
成功條件這支片符合簡報你在裡面移動時,環境保持一致
失敗樣態鏡頭錯了、片子內部跑掉物件消失、幾何自相矛盾、物理壞掉

有趣的研究問題是持續性:如果你別過頭去再轉回來,那個物件還在嗎?還在同一個位置嗎?長得還一樣嗎?批次模型從來不必回答這個。世界模型的成敗就押在這上面。

值得注意的參賽者

有三群人在推這件事,而他們要的東西不一樣。

Google 的 Genie 系列世界模型

Google DeepMind 的 Genie 產品線是多數人引用的參考點。它的訴求是從一段提示詞或一張圖,做出可被動作驅動的可漫遊環境——你描述一個地方,然後在裡面移動,模型會生成接下來的每一個視角,而不是重播一段預先做好的畫面。公開示範強調的是在感覺得到反應的畫面率下互動,以及在一段連續探索裡撐得住的一致性;而它的定位明確地偏研究,動機裡被提到的代理人訓練和具身 AI,至少和內容創作一樣多。

PixVerse R1

PixVerse 把 R1 定位成一個即時世界模型,而不是又一次文生影片發布,並且瞄準創作者和遊戲週邊的受眾,把它行銷成 Genie 系列系統的替代方案。這個定位值得注意,因為它出自一家影片生成公司,而不是研究實驗室,這代表這個類別正在被當成一個產品面來認真對待,不只是一篇論文。在獨立的實測比較出現之前,請把具體規格當成服務商的定位說法看待——在這個領域,發表時的品質和實際出貨的品質分家過不只一次。

遊戲週邊的中間地帶

第三群最不上頭條,卻可能最有實質影響:把生成模型放進傳統引擎裡面或旁邊的工作。在引擎輸出之上再跑一層神經網路成像、生成的素材和環境餵進一條正常的產線、生成式的 NPC 行為、逐格套用的風格轉換。這些都不是完整的世界模型。但它們全都會更早出貨,因為它們繼承了引擎的確定性和控制力,只在生成真的比較好的地方才用生成。

說明

看發表稿時要留意的措辭:沒有講清楚互動循環的「即時」,通常是指生成很快,不是可操控的生成。把「世界模型」貼在一個固定長度的短片生成器上,通常代表行銷團隊跑得比架構還快。

決定時間軸的那些限制

在示範和可靠的創作工具之間,橫著四個問題。沒有一個接近解決,而且在其中一個上前進,往往要拿另一個來換。

延遲對上還原度。 互動性帶來一個硬性的每格運算預算:模型在下一格畫面到期之前能產出多少,你就只有多少。批次模型愛在一格上花多久就花多久。互動系統裡每一分品質,都得在那個預算內付掉,這也是為什麼互動式的輸出看起來比批次輸出落後一個世代——而且就算兩邊都在進步,它還是會一直落後。

解析度和細節。 同一個預算,換算到像素上。批次流程負擔得起精修和升頻階段;一個隨需生成畫面的系統通常負擔不起,至少不可能不加回它本來就想避開的那份延遲。

時間上的連貫性。 這是最深的一題。長時距的一致性需要記住已經生成過的東西,而記憶要花運算,那份運算又跟畫面預算互搶。物件慢慢飄移、幾何悄悄自相矛盾、同一個地點兩次造訪之間光線變了,都是同一個限制的症狀。這裡的進展是真的,但屬於漸進式;誠實的講法是:工作階段會一致一陣子,然後就不一致了。

控制的精準度。 只有當模型照你的意思回應輸入時,互動才有用。方向性的移動相對好處理。精準、可重現、逐格準確的執導——一位導演或遊戲設計師真正需要的那種——難得多,而且在「會即興發揮的系統」和「完全照指令做的系統」之間,還有一個沒解決的張力。

還有一個比較少被提到的經濟限制。一次批次生成是一個有邊界、可計費的任務。一次互動工作階段則是一道沒有終點的運算串流,而它的每一秒都有人要付錢。這件事早在研究做完之前,就已經在形塑這個類別的產品能長成什麼樣子。

這對創作者改變了什麼——又沒改變什麼

目前還沒改變的部分

如果你是在為客戶、檔期或觀眾出影片,即時世界模型現在不在你的產線上,假裝它在會讓你賠掉一個死線。成品畫質、解析度、聲音、鏡頭控制和參考圖的還原度,全都還住在批次模型裡——今天在 OmniArt 上就有的 Seedance、Veo、Kling、Sora、PixVerse 和 Grok Imagine 這幾代。它們每一個都是為互動系統選擇放棄的那件事而最佳化的:花上真實的運算,把一支片做到它能有的最好。

這也不是一條取代路線。互動式生成和批次生成,是同一組取捨的兩個相反端點。世界模型很出色的未來,不代表批次模型就過時了,就像即時遊戲引擎沒有讓離線的電影級成像變得過時一樣。

真的改變了的部分

現在有三件事值得調整。

  • 前期視覺化會最先變便宜。 可操控生成最早真正有用的應用,是在投入一次完整生成之前,先探索一個空間或一個走位想法。當你還在決定的時候,粗糙、可互動、隨時能改,勝過精緻但很慢。
  • 提示詞不再是唯一的介面。 當模型能接收持續進來的輸入,簡報就會愈來愈不像一段文章,愈來愈像執導——一個起始狀態,加上一連串意圖。已經習慣用鏡頭和節拍思考、而不是用句子思考的創作者,會適應得更快。
  • 遊戲週邊的工作會比電影週邊的工作先開放。 互動媒體願意用較低的還原度換反應速度,因為觀眾是在參與,不是在觀看。那會是這項技術第一個真正有競爭力的地方。

可以帶著走的能力

你在今天的模型上學到的東西,沒有一樣是浪費的。精準地描述一個場景、指定鏡頭和光線、讓一個角色或一種質感貫穿多顆鏡頭,以及養成一套可重複的評估習慣——同一份簡報、同一批參考素材、同一張評分表,拿去跑任何新東西——這些全都能直接移植。介面會變;把自己想要什麼講清楚的這門手藝不會。

注意

對這個類別的基準測試宣稱要小心。互動系統很難公平比較,而一個為了穿過環境裡某條又短又漂亮的路徑而最佳化的示範,幾乎不能告訴你它在更長的一段工作階段裡表現如何。等實測出來再改產線。

你今天在 OmniArt 上可以做什麼

OmniArt 沒有提供即時的世界模型生成,我們寧可直說,也不想把這條線抹糊。影片工作台真正提供的,是把現在這批批次模型放在同一個地方——Seedance 2.0、Veo 3.1、Kling、Sora 2、PixVerse V6 和 C1、Google Gemini Omni、Happy Horse,還有 Grok Imagine——共用一份餘額,共用一套提示詞語法。

這件事對互動式的未來,比聽起來更有用。準備好的方法,是把會帶著走的部分練快:

  1. 在便宜的級距上迭代。 先用 fast 或 mini 變體把一顆鏡頭做成草稿,把構圖和動態定下來,再用同一份簡報跑更高的級距。這是互動循環的批次版本,也是你搞懂一份簡報真正在要什麼的方式。
  2. 用「續接」的方式工作,不要每次都一次到位。 OmniArt 有專門的 Grok Imagine Extend 和 Modify 模型,直接作用在一支已完成的片上——延長它或改動它,而不是從頭重生成——而且 Extend 可以吃影片工作台裡任何模型產出的畫面。你也可以手動串接:用轉場模式,或把一支片的最後一格餵回去當成下一支的起始圖。無論哪一種,用續接思考,練的正是互動式生成將來會要求的那種循序、有狀態意識的習慣。
  3. 用同一份簡報比較模型。 一段提示詞、好幾個模型,並排看。這是這個領域裡唯一誠實的評估方式,也是讓你能用一個下午、而不是一整季,去判斷一項真正的新能力的習慣。

想完整逛一遍工作台裡的模型,請看所有 AI 影片模型集中在一個工作台。想現在就開一顆鏡頭,就到創作頁面

常見問題

創作者今天可以用到即時 AI 影片嗎?

快速生成可以。真正可互動、可操控的生成還是一項正在冒出頭的能力,目前是示範和早期產品,不是可靠的量產工具。要交付的影片工作,跑在批次模型上。

世界模型和文生影片模型差在哪裡?

文生影片模型把一段提示詞變成一支完成的片。世界模型維持一個場景的持續內部狀態,並依照持續進來的動作生成它的視角,所以「你再回到同一個地方時的一致性」比單支片的畫質更重要。

世界模型會取代批次影片模型嗎?

不太可能,至少不會整個類別取代。兩者最佳化的是同一組「延遲對還原度」取捨的相反端點,所以把它們理解成互補的工具,比理解成前後代更貼近事實。

我現在該學什麼才算準備好?

精準的場景描述、鏡頭和光線的執導、跨鏡頭的一致性,以及一套可重複的比較習慣。不管介面最後長成什麼樣,這些全都能帶著走。

準備好開始創作了嗎?

用 AI 生成精彩內容

免費開始