Guide模型與觀察閱讀時間 10 分鐘

Grok Imagine:2026 年 xAI 影片模型的創作者指南

一份實用的 Grok Imagine 指南——六種生成模式、提示詞寫法、真實的成本計算,以及 2026 年什麼時候該選它而不是 V6 或 Sora 2。

OmniArt 團隊
Grok Imagine:2026 年 xAI 影片模型的創作者指南

Grok Imagine 是 xAI 的影片與音訊生成模型,2026 年 1 月推出,在 OmniArt 上不用另外訂閱 xAI 就能用。它和 Grok 聊天機器人是兩個不同的產品——除了名字之外沒有任何關係。這份指南談 Grok Imagine 是為什麼設計的、哪六種生成模式真的重要、怎麼寫出尊重每一種模式的提示詞,還有真實專案到底要花多少點數。

Grok Imagine 是什麼

Grok Imagine 生成最高 720p 的影片,帶原生音訊,長度 1–15 秒。它的賣點不是解析度——720p 這個規格擺明就不打算在畫質上硬碰 Sora 2 或 V6。它的賣點是模型周圍那一圈工作流介面:六種共用同一組權重的生成模式,讓你可以生成、延長、換風格和修改,全程不用離開這個模型。

規格數值
最高解析度720p(要 1080p 以上就用 V6)
最長時長每次生成 15 秒
畫面比例16:9、4:3、1:1、9:16、3:4、3:2、2:3
音訊原生,和影片一起生成
成本(480p)每秒 10 點數
成本(720p)每秒 15 點數

值得認識的六種模式

每一種模式,都是在告訴模型它手上拿到的是哪一類輸入。挑對模式,提示詞工程就已經做完一大半。

文生影片(Text-to-Video)

預設模式。寫一段提示詞,拿一支片。最適合概念探索、情緒板,以及手邊還沒有參考圖的社群草稿。成本依解析度是每秒 10–15 點數。

圖生影片(Image-to-Video)

讓一張靜態圖動起來,同時保留輸入的構圖。第一格會被鎖在你的圖上。用來讓插畫、商品攝影和設計示意稿動起來——也就是那些起始畫面不能妥協的情況。

參考模式(Reference Mode)——真正的差異點

參考模式接受 1–7 張圖當成視覺錨點,但不鎖第一格。你用 @Image1@Image2@Image3 標記圖片,然後在提示詞裡引用它們。這是多數其他影片模型沒有的東西——大部分模型不是鎖住第一格(圖生影片),就是完全不吃參考圖(文生影片)。參考模式坐在中間,而它是跨多顆鏡頭維持角色一致最乾淨的一條路。

成本在 480p 是每秒 15 點數,720p 是 22.5 點數。

延長模式(Extend Mode)

在既有的片子後面接上 2–10 秒。輸入是一支 2 到 15 秒的 MP4。輸出是一支連續的片子;計費只算接上去的那一段。跨模型的小技巧是:延長模式吃得下 OmniArt 影片工作台裡任何模型生成的影片,不限於 Grok。

修改模式(Modify Mode)

不重新生成就編輯既有的片子——換背景、改光線、改特定物件的顏色、加天氣效果。輸入上限是 8 秒,而且會自動縮放到 854×480,這表示高解析度的來源在這一趟來回裡會掉細節。修改模式請用在你本來就是 480p 生出來的片子上。

編輯工具組——換風格、物件操作、線稿動起來

一組生成後的雜項操作。換風格(Restyle)套用藝術風格(賽博龐克、動漫、復古、摺紙、水彩、馬賽克)。物件操作(Object Manipulation)可以新增、移除或替換元素。線稿動起來(Sketches to Life)讓線條畫動起來。加入演出(Add Performance)把角色動畫嫁接到靜態人物上。想從一支來源片衍生出多個版本時很好用。

尊重這個模型的提示詞

四個習慣,比把提示詞寫更長更快拉高品質。

用電影語言

Grok Imagine 內建六種運鏡預設:推近(Zoom In)、拉遠(Zoom Out)、後退推軌(Dolly Out)、上仰(Tilt Up)、右搖(Pan Right)、縮時(Timelapse)。提示詞用上攝影術語時,它們啟動得更精準。

比較弱比較強
"A city street at night with neon signs and people walking""Dolly forward through a rain-slicked Tokyo alley, neon signs reflecting in puddles, shallow depth of field, a figure with an umbrella enters frame right, cinematic 2.39:1 framing"

把參考圖的角色標清楚

提示詞一含糊,參考模式的表現就掉下來。把每一張參考圖綁定一個角色。

"@Image1 (the red sports car) drifts around a mountain corner with @Image3 (the sunset sky) in the background while @Image2 (the driver character) grips the steering wheel."

把動作放到前面

生成是沿著時長順序跑的。如果高潮擺在一支 5 秒片的最後,模型可能來不及把它做完。把動作往前挪。

比較弱比較強
"A quiet forest scene with birds, then suddenly a deer leaps across a stream""A deer leaps across a forest stream in golden hour light, camera tracking its arc, birds scatter from nearby branches"

10–15 秒的片子要排時間軸

比較長的片子,把時間點直接寫進提示詞。

"Slow zoom into abandoned library (0–5s), dust particles catch light beams (5–10s), book falls from shelf (10–12s), pages flutter (12–15s)."

實際要花多少

三個真實的鏡頭情境,用 OmniArt 點數計價。

一支 15 秒的 TikTok 商品影片

步驟模式解析度成本
初次生成文生影片480p,10 秒100
延長延長模式480p,5 秒75
合計(含一次修改)175–275

一份三顆鏡頭的品牌分鏡

步驟模式解析度成本
鏡頭 1,配 2 張參考圖參考模式,8 秒720p180
鏡頭 2,同一組參考圖參考模式,8 秒720p180
鏡頭 3,同一組參考圖參考模式,6 秒720p135
修鏡頭 2 的光線修改模式,8 秒720p180
合計675

一次換風格

步驟模式解析度成本
換成動漫風換風格,8 秒480p120

什麼時候該換別的模型

Grok Imagine 適合短影音、線稿變影片,以及 480p–720p、靠參考圖撐起來的多鏡頭故事。它不適合的時候是:

你需要更好的選擇
1080p 以上V6、BACH、Veo 3
進階鏡頭控制(焦段、景深、像差)V6
一次生成 16–20 秒Sora 2
可上線等級的對白和音樂專用音訊模型再加剪接
編輯時要保住高解析度來源別用修改模式

真的能交件的工作流

Grok Imagine 在 OmniArt 上回本的方式,不是當一個獨立的生成器,而是當那一層負責反覆打磨的工具。有兩種做法最划算。

做法 1——別的地方生成,這裡打磨。 用 V6 或 Sora 2 以更高解析度算出主片,再用延長、換風格和修改模式,在 Grok 上以更低成本衍生變體和加長。

做法 2——用參考模式鎖住角色。 品牌廣告需要同一個角色出現在五顆鏡頭裡時,用一張錨點圖放進 @Image1 鎖住識別,然後在參考模式裡帶著同一組參考圖生成每一顆鏡頭。比每一顆鏡頭都重跑一次 Sora 2 便宜。

注意

修改模式會把任何超過 854×480 的輸入自動縮到 480p 才處理。如果你要編輯一支 1080p 的片子又不想掉解析度,就到別的地方去做這個編輯,或是在放大那一步之前先編輯完。

在 OmniArt 上開始

Grok Imagine 就在 OmniArt 的影片工作台裡,和 V6、BACH、Sora 2、Veo 3、Kling 3.0、HappyHorse 1.0 與 Seedance 2.0 放在一起。同一份點數餘額、同一套參考圖上傳、同一套提示詞文法。先從文生影片開始熟悉運鏡預設,等你手上有角色或商品要鎖住,再進階到參考模式。

想做更高畫質的敘事作品,把這份指南配上 BACH 攝影指導拆解一起看;如果你正在替某一顆特定鏡頭挑模型,可以看最佳圖生影片模型精選

準備好開始創作了嗎?

用 AI 生成精彩內容

免費開始