Grok Imagine 1.5 對比 1.0:那 +52 Elo 到底改變了什麼
xAI 的 Grok Imagine 1.5 比 1.0 高出 52 Elo,登上 Image-to-Video Arena 第一。我們把這段落差拆成創作者立刻感覺得到的四項改動——原生聲音、15 秒片段、臉部一致性和 Extend from Frame——並在 OmniArt 裡實測前後差異。

Grok Imagine 1.5 以 Preview 更新的形式推出,而且真的動了指針:比 1.0 高出 52 Elo,在盲測中越過 Seedance 2.0、HappyHorse 1.0 和 Google Veo,跳上 Image-to-Video Arena 榜首。在一個已經成熟的排行榜上跳 52 分是很有意義的訊號——換算起來,1.5 在對上 1.0 的一對一盲測裡,勝率大約 57%。
數字是標題。對正式製作真正重要的,是哪些具體改動撐起了它。我們一直在 OmniArt 的影片工作台裡把 1.5 和 1.0 並排跑,這段進步乾淨地追溯到四件創作者立刻感覺得到的事。沒有一件是細微的。
如果你剛接觸 Grok Imagine,先從基礎指南開始——那裡詳細講了六種生成模式、提示詞寫法和點數怎麼算。這篇假設你已經用 1.0 做出過幾支片子,想知道哪些值得重跑。
規格速覽:1.0 對比 1.5
| 規格 | Grok Imagine 1.0 | Grok Imagine 1.5 |
|---|---|---|
| 最高解析度 | 720p | 720p |
| 最長長度 | 10 秒 | 15 秒 |
| 畫面比例 | 16:9、4:3、1:1、9:16、3:4、3:2、2:3 | 16:9、4:3、1:1、9:16、3:4、3:2、2:3 |
| 聲音 | 原生,聯合生成 | 原生,聯合生成——有改進 |
| 臉部一致性 | 基準線 | 明顯改進 |
| Extend from Frame | 可從尾格接續 | 可明確選格,連續性更好 |
| 圖片生成底座 | FLUX.1(Black Forest Labs) | FLUX.1(Black Forest Labs) |
| 費用(480p) | 每秒 10 點數 | 每秒 10 點數 |
| 費用(720p) | 每秒 15 點數 | 每秒 15 點數 |
| Arena 排名 | 落在第一名之後好幾位 | Image-to-Video Arena 第 1 名 |
解析度上限和點數定價都沒變。進步發生在這些限制之內,模型做了什麼。
改動 1:原生聲音現在聽起來像一次做完的
從 1.0 開始,Grok Imagine 就會生成聲音——對白、對嘴、音效和環境音樂,全部由影片 token 在單次推論中一起建出來,後面不再接一個獨立的音訊模型。實務上,1.0 的聲音有兩個固定的失敗模式:對白節奏機械(字詞以均勻間隔到達,停在文法邊界而不是自然的換氣點),以及環境音扁平(一個咖啡店場景只有一層沒有層次的背景人聲,沒有空間變化)。
1.5 把兩件事都處理了。同樣的單次推論架構,現在會做出句級語調——比較短、比較有力的句子以下降語調收尾,比較長的說明性語句在收束前聽得出句中的上揚。環境音有層次了:一個街道場景會生成遠處的車流、近處的腳步聲,還有主體背後一扇悶悶的店門。這些不是後製加上去的,而是用 Aurora 引擎處理運動時那套逐格接續的邏輯生成的——每一格影響下一格,聲學環境跟著視覺軌跡走。
1.0 prompt: "A barista explains the brewing process to a customer across the counter, coffee shop background, warm lighting."
- 1.0 的結果:對白以節拍器般的爆發式節奏到達,背景的義式咖啡機從頭到尾維持在同一個音量。
- 1.5 的結果:咖啡師的說明有自然的句中停頓,另一張單子開始時咖啡機的聲音會堆疊上來,顧客低聲的回應比較小聲,而且在空間上被擺在離主要收音軸更遠的地方。
對白多的片段差距最明顯。如果你先前一直把 Grok 1.0 的影片送去另一個音訊模型做人聲,1.5 已經在原生的層面上把大部分落差補起來了。
改動 2:10 秒變成 15 秒
Grok Imagine 1.0 的片段上限是 10 秒,1.5 拉到 15 秒,而且 1~15 之間任何整數秒數都支援。多出來的五秒聽起來不算什麼。實際上,它就是「一支社群片子還要再跑一次 Extend」和「第一次生成就能上」之間的差別。
常見用途的點數帳變化很明顯:
| 用途 | 1.0(10 秒上限 + Extend 補到 15 秒) | 1.5(原生 15 秒) |
|---|---|---|
| 15 秒 TikTok,480p | 100(10 秒)+ 75(延長 5 秒)= 175 | 150 |
| 15 秒 TikTok,720p | 150(10 秒)+ 112.5(延長 5 秒)= 262.5 | 225 |
| 10 秒產品鏡頭,720p | 150 | 150(不變) |
在最常見的社群格式——15 秒片段——上,和 1.0「先生成再延長」的做法比,1.5 在 480p 大約便宜 14%,在 720p 也便宜 14%,而且你不用面對延長接點偶爾出現的接縫瑕疵。
Extend 模式本身在 1.5 裡還在,用來推超過 15 秒,但你只在真的需要更長時間的素材上付延長成本,而不是因為基礎生成硬把片子切斷。
改動 3:臉部準確度和角色一致性
這是最難量化、卻在社群回饋裡被提得最一致的一項改動。Grok Imagine 1.0 可以在開場那一格生出一張很有說服力的臉,然後把它弄丟——五官在影格之間變形,尤其是轉頭、光線轉換或快速運動的時候。透過 Reference Mode 帶進來的角色,在比較長的片段裡臉部比例會漂移。
1.5 從架構層面處理這件事。Aurora 引擎那套逐格生成——每一格都受前一格影響——現在能在旋轉和光線變化中更穩定地保住臉部特徵點。社群回饋的模式很一致:以前會產生詭異變形的轉頭,現在在正常播放速度下能乾淨地完成。
Before/after on a single Reference Mode prompt: "[@Image1] walks toward the camera through a fog-filled alley, face clearly visible, turns slightly right at 8 seconds, warm streetlight from above."
- 1.0:主體在走路過程中維持一致的識別,但向右轉時,在轉到一半那一格出現明顯的下顎寬度位移,轉完又彈回來。
- 1.5:同樣的轉頭完成時沒有那個修正瑕疵。下顎和顴骨的比例在整個旋轉過程中守住了。
這對任何以角色臉部為主體的用途最重要——講話畫面、角色驅動的敘事、有代言人的產品示範,以及任何用 Reference Mode 讓同一個識別貫穿多顆鏡頭的片段。
小技巧
角色一致性在 Extend Mode 上會累積。在 1.5 裡,延長出來的片段會保留原始生成中建立起來的臉部特徵點穩定性。延長接上去的那道接縫比 1.0 更難察覺,因為現在兩段共用同一套臉部幾何基準。
改動 4:Extend from Frame——把片段串成短片長度
1.0 的 Extend Mode 是在片段尾端接上影格,但控制項很有限:你把片段交給模型,請它接下去。1.5 的 Extend from Frame 加上了明確的選格——你挑出想要接續的那一格,模型就從那個確切的視覺狀態接下去:一樣的主體位置、一樣的光線方向、一樣的鏡頭軌跡、一樣的大氣條件。
當一次生成的開頭和中段都對,最後幾格卻偏離你的意圖時,這個差別就有份量了。在 1.0 裡,不完美的尾格意味著你要嘛接受它當延長的起點,要嘛整段重跑。在 1.5 裡,你可以挑生成中比較早的一格——那個構圖乾淨、你真正想接下去的瞬間——從那裡延長。
比較長的製作,實務流程是這樣:
- 生成 15 秒的開場段落。看過一遍,找出最好的收尾影格。
- 用 Extend from Frame 選中那一格,生成下一段 15 秒。
- 重複,直到達到你需要的長度。
三段各 15 秒串起來,就是 45 秒的素材,而且角色、光線和鏡頭狀態在接點之間都保住了。這足夠做一支產品示範、一支短廣告,或一段敘事開場——而這個模型是按秒計費、每秒 10~15 點數。
說明
OmniArt 裡的 Extend 模式是跨模型的,不只給 Grok Imagine 用。你可以用另一個模型生成開場,再用 Grok Imagine 1.5 的 Extend from Frame 接下去,把角色一致性的改進帶到別處出生的素材上。
那 +52 Elo 實際上對應到什麼
競技場上的落差可以拆成這四項改動,並依照它們在日常製作裡出現的頻率加權:
| 改動 | 對 Elo 的影響 | 你在哪裡感覺得到 |
|---|---|---|
| 聲音自然度 | 高 | 任何有對白或有層次環境音的片段 |
| 原生 15 秒長度 | 中等 | 15 秒社群格式;依賴 Extend 的流程 |
| 臉部一致性 | 高 | 講話畫面、Reference Mode 角色工作、轉頭 |
| Extend from Frame | 中等 | 多段落製作、串接的片段 |
這個競技場測的正是圖片生成影片——一張輸入的靜態圖被動起來。在那個情境下,臉部一致性和聲音自然度是盲測投票者最會注意的兩個特質,這也解釋了 Elo 的漲幅主要來自哪裡。長度和 Extend from Frame,對做多鏡頭專案的資深使用者比對只看五秒片段的盲測投票者更重要。
你該把 1.0 的專案重跑一遍嗎?
短版答案:臉是主體的專案,該重跑;用「先生成再延長」湊到 15 秒的東西,也該重跑。其他的就看專案而定。
現在就重跑,如果:
- 你在 1.0 做過講話畫面或以角色為主的片段,而且注意到片中臉會漂移。同樣的 Reference Mode 輸入,在 1.5 應該會明顯乾淨許多。
- 你的 15 秒片段是 10 秒 + 延長 5 秒做出來的,而且撞到接縫瑕疵。1.5 的原生 15 秒生成消掉了那個接點。
- 某支片子其他都差不多了,只卡在聲音。1.5 自然的語調和有層次的環境音,不必重寫視覺端的提示詞就能解掉最常見的抱怨。
不值得重跑,如果:
- 這支片段只有運動,沒有角色也沒有對白——720p 的畫質天花板沒變,而單段輸出的 Extend 行為改進很有限。
- 你大量使用 Modify Mode——Modify 仍然會把任何超過 854×480 的輸入自動降到 480p 再處理,這個行為在 1.5 沒變。
- 原本是一支 8 秒以內、沒有角色的氛圍空景。環境音的改進是真的,但以目前的點數價格來說,大概不值得重新生成一次。
注意
Modify Mode 的 480p 降轉限制在 1.5 沒有改變。如果你需要在不損失解析度的情況下編輯一支 720p 片段,就把 Modify 這一趟放在最終 720p 生成之前,而不是之後。
在 OmniArt 上開始
Grok Imagine 1.5 已經在 OmniArt 的影片工作台上線,旁邊就是 V6、BACH、Sora 2、Veo 3、Kling 3.0、HappyHorse 1.0 和 Seedance 2.0。不需要另外訂閱 xAI——同一份 OmniArt 點數餘額涵蓋所有模型。
要摸清 1.5 最快的方法,是拿一條你在 1.0 上已經很熟的提示詞來跑。同樣的輸入,輸出並排比較,臉部和聲音的改進會直接對著你的基準線顯現出來。從那裡開始,再決定哪些 1.0 專案真的值得重跑。
想看六種模式的完整拆解、點數怎麼算,以及 Reference Mode 的提示詞寫法,請看 Grok Imagine 指南。想看 Grok Imagine 的圖片生成影片排名放進 2026 年更大的版圖裡是什麼位置,圖片生成影片模型精選清單有目前的排名。
準備好開始創作了嗎?
用 AI 生成精彩內容