從產品靜態圖到會動的廣告:Grok Imagine 1.5 圖片生成影片實戰
Grok Imagine 1.5 最強的模式,是把一張乾淨的產品靜態圖變成會動的廣告。這裡有原圖規則、五段式提示詞公式、480p 到 720p 的流程,以及四個在 OmniArt 裡跑完的實例。

Grok Imagine 1.5 的圖片生成影片模式,有一件事做得特別好:拿一張乾淨的產品靜態圖,把它變成一支會動的廣告片段,而不需要從文字描述把產品重新造一次。Aurora 引擎會從你的原圖鎖住主體位置、光線和鏡頭軌跡,所以那雙球鞋還是那個白,錶盤上的字還是讀得出來——這是文字生成影片對你真的在賣的產品給不了的保證。
這份指南談三根決定「一支 Grok Imagine 1.5 圖片生成影片片段第一次就能用嗎」的支柱:原圖品質、提示詞結構,以及 480p 到 720p 的解析度流程。四個完整實例——球鞋、手錶、手提包和美妝產品——會把每一根支柱從頭到尾示範一次。
想看涵蓋模型選擇、平台格式和聲音的完整電商廣告流程,請看用 OmniArt 把產品照變成影片廣告。這一篇只窄窄地聚焦在怎麼把 Grok Imagine 1.5 用到最好。
Grok Imagine 1.5 在圖片生成影片上帶來什麼
| 規格 | 內容 |
|---|---|
| 解析度 | 最高 720p |
| 影格率 | 24 fps |
| 長度 | 1~15 秒 |
| 原生聲音 | 有——在同一次推論中生成 |
| 圖片底座 | FLUX.1(Black Forest Labs) |
| Arena 排名 | Image-to-Video Arena 第 1 名(比 1.0 高 52 Elo) |
FLUX.1 這個底座,正是自然語言提示詞在這裡管用的原因。你用交代攝影師的方式描述這顆鏡頭,而不是在 OpenCLIP 的詞彙表裡堆關鍵詞。接著 Aurora 引擎把原圖當成主要的空間參考——在鏡頭和光線繞著它移動時,穩住主體的輪廓、顏色和相對位置。
OmniArt 把 Grok Imagine 和其他所有模型一起放在影片工作台裡,所以不需要另外訂閱 xAI。點數費率是 480p 每秒 10 點數、720p 每秒 15 點數——也就是一支 5 秒的 480p 草稿要 50 點數,同樣 5 秒的 720p 成品要 75 點數。
支柱 1:原圖品質
Aurora 引擎從原圖那一格鎖住構圖。輸入好,運動就有錨;輸入弱就會漂移——模型會把讀不清楚的地方重新內插,準確度就掉了。
原圖檢查清單
| 要這樣做 | 不要這樣做 |
|---|---|
| 用乾淨不雜亂的背景(白、淺灰,或留有餘裕的生活情境) | 用雜到產品直接消失在裡面的背景 |
| 拍攝或裁切成產品佔畫面 50~70% | 用裁得太兇或邊緣被切掉的產品照 |
| 讓主體和背景之間對比夠強 | 用顏色和背景撞在一起的產品照 |
| 讓文字、標誌和標籤保持清晰可讀 | 用 JPEG 壓縮瑕疵很重的圖 |
| 從你手上解析度最高的原檔開始(至少 1024 × 1024) | 用縮圖等級或被縮小過的網頁圖 |
| 每一格只放一個主角 | 用一張擺了五個產品的平拍合照 |
| 確認產品的關鍵細節(鞋底、錶盤、扣環、瓶蓋)清楚可見 | 用一個把產品關鍵特徵藏起來的角度 |
注意
為什麼這件事對 Grok 比對文字生成影片更重要
用文字生成影片時,你描述一個產品,模型就發明一個符合你描述的出來。用圖片生成影片時,模型承諾要尊重你真正的產品——但也只到它能從原圖那一格讀懂的程度。一張低解析度或視覺上曖昧的照片,是 Grok Imagine 1.5 圖片生成影片讓人失望的第一大原因。
支柱 2:五段式提示詞公式
Grok Imagine 1.5 用 FLUX.1 當圖片底座,這種底座偏好自然語言描述,而不是關鍵詞串。下面五個段落,對應的是 Aurora 的運動引擎可以直接執行的東西。
公式
[Action] — [Lighting] — [Pace] — [Background] — [Mood/reference]
每個段落細講:
-
動作——鏡頭或主體的運動。要具體:"slow dolly-in from waist height"、"orbital pan around the left side"、"gentle vertical float, 3 cm up and back down"。像「有動感」這種模糊詞給模型太多空間,結果就不穩定。
-
光線——描述光的方向、質地和來源。"Rim-lit from behind with a warm tungsten key at camera-left"勝過"dramatic lighting"。具體的色溫("3200K"、"5600K daylight")或有名字的光質("softbox fill"、"hard shadow at 45 degrees")會把整個調性錨住。
-
節奏——運動的速度和律動。"2-second slow push, no acceleration"、"0.5× playback feel"、"unhurried, editorial"。沒有明確節奏,模型會預設中等程度的運動,而那對主角級的產品鏡頭來說太快了。
-
背景——它該保持不動、輕微變化,還是參與整個場景。"White cyclorama, no background motion"、"Blurred bokeh marble surface, subtle light shift"、"Studio void, no environment detail"。這一段省略掉,常常就會出現不想要的背景漂移。
-
氛圍與鏡頭參考——一個短語,用來校準整體的調性。器材參考比形容詞可靠:"shot on Fujifilm XT4"勝過"cinematic";"luxury print ad feel"勝過"high-end";一個具體的月份加時段("January morning, 9 AM studio")勝過*"golden hour"*。
小技巧
要省略什麼
不要放品牌名稱、真人臉孔或真實地點的指涉。不要堆同義詞當關鍵詞("luxury high-end premium")——FLUX.1 的自然語言提示詞從這種堆疊裡得不到任何東西,只會多出雜訊。每一段一個清楚的句子,勝過三個支離破碎的形容詞。
支柱 3:480p 到 720p 的解析度流程
480p 和 720p 的點數差是每秒 5 點數——單支片子看起來不多,但在你還在調提示詞和運動、還沒定案的時候,差距就有意義了。
建議流程
| 步驟 | 解析度 | 目的 | 費用(5 秒片段) |
|---|---|---|---|
| 1. 提示詞發想 | 480p | 測鏡頭運動和主體穩定度 | 50 點數 |
| 2. 運動微調 | 480p | 把節奏、背景和光線提示詞調準 | 每次迭代 50 點數 |
| 3. 最終輸出 | 720p | 乾淨的社群或提案母帶 | 75 點數 |
三次 480p 迭代加一次 720p 成品,總共 225 點數——和三次 720p 生成一樣。關鍵的紀律是:在 480p 草稿還沒做出你要的運動和構圖之前,不要升到 720p。Aurora 引擎放大的是同一支片段,所以 480p 過關的結果,到 720p 也會穩定過關。
說明
四個完整實例
實例 1:球鞋主角推鏡
產品: 白色低筒球鞋,四分之三側角,拍在白色檯面上,反射乾淨。
原圖設定: 從略高處以 45 度角拍攝,鞋底看得見,鞋帶結清晰,鞋舌標籤讀得出來。以 2048 × 2048 輸出,無壓縮。
提示詞:
"Slow dolly-in from mid-distance to close-up on the toe box, stopping when the sole fills one-third of frame. Hard shadow from overhead natural light raking left to right. Unhurried, 0.3× pace feel. White infinity backdrop, no movement. Shot on Leica SL2, luxury footwear editorial register."
運動加了什麼: 逐步推近會依序揭露鞋頭的材質紋理和鞋底邊緣——這是一張平面靜態圖傳達不了的資訊。自然光的陰影掃過側牆,不需要旁白就說明了表面質感。
聲音: Grok 會生成淡淡的環境房間音,以及鞋底進入畫面時一點細微的材質聲——依需要移除,或壓在音樂底下。
實例 2:手錶環繞揭曉
產品: 不鏽鋼正裝錶,平放在灰色紋理紙上,錶面朝上,錶帶未扣。
原圖設定: 錶面佔畫面 60%,時標讀得出來,右側看得見錶冠細節。以 2000 × 2000 拍攝,均勻的散射光。
提示詞:
"Slow orbital pan starting at the 9 o'clock position, travelling clockwise around the watch face, completing 180 degrees over 8 seconds. Softbox fill from above, hard specular rim from camera-right at 4500K. No pace acceleration. Pale grey linen surface, stationary background. Studio watchmaker editorial style."
運動加了什麼: 這一趟環繞在一次通過裡,就從多個角度抓到錶殼邊緣和指針的金屬反光——通常要四張獨立靜態圖才講得清楚的產品細節。180 度的弧線讓錶盤全程保持可讀。
聲音: Aurora 引擎會生成淡淡的機械環境音——細、精準,很符合製錶的情境。當旁白底下的襯底很好用。
實例 3:手提包浮起再落下
產品: 棕褐色結構型皮革手提包,立在溫暖的奶油色背景前,五金看得見。
原圖設定: 正面置中,上方提把圈看得見,拉鍊頭清晰。以 1800 × 1800 拍攝。
提示詞:
"Bag floats 6 cm upward from the surface, holds for 2 seconds at peak, then settles softly back down. Light barely moves. Warm 3200K ambient fill from above-left, subtle leather highlight from below-right. Deliberate, considered pace. Cream infinity backdrop, no environment motion. Luxury fashion catalogue register, shot on Hasselblad medium format."
運動加了什麼: 浮起再落下營造出重量感和材質實體感——包看起來像一個真的物體,而不是一張去背圖。在最高點停住的那兩秒,給觀眾時間讀五金和車線的細節。
聲音: 房間音很淡;落回檯面時會出現一點細微的接觸聲,強化了實體感。
實例 4:美妝產品旋轉並帶水氣
產品: 霧面精華液瓶,直立,銀色滴管蓋,白色標籤。
原圖設定: 瓶身佔畫面 55%,標籤文字清晰,瓶蓋細節看得見,乾淨的白色背景。以 1920 × 1920 拍攝。
提示詞:
"Slow counter-clockwise rotation, full 360 degrees over 10 seconds. Fine moisture condensation forms on the glass surface as the rotation begins and disperses by the halfway point. Soft cool daylight from above at 6000K, rim light from behind. Steady, unhurried pace. White studio background, no drift. Skincare campaign aesthetic, shot on Phase One IQ4."
運動加了什麼: 水氣凝結傳達了功效和新鮮感——這兩個概念在靜態圖裡代價很高。完整旋轉一圈則把背標文案和滴管結構從每個角度都秀了一遍。
注意
常見的失敗模式和修法
| 問題 | 可能原因 | 修法 |
|---|---|---|
| 標籤文字在運動中糊掉或扭曲 | 原圖被壓縮過,或標籤在畫面裡太小 | 從解析度更高的原檔開始;裁得更緊,讓標籤佔更大面積 |
| 主體從起始位置漂走 | 背景在視覺上和產品太像 | 換高對比的背景重拍,或在提示詞裡明確描述背景顏色 |
| 鏡頭運動太快 | 沒有指定節奏 | 加上明確的節奏描述:「從容」、「0.3 倍速的感覺」,或一個秒數 |
| 背景生出不想要的運動 | 沒有寫背景描述 | 明確加上「stationary background, no background motion」 |
| 片中顏色跑掉 | 原圖白平衡不一致 | 上傳前先把原圖的白平衡修正 |
| 原生聲音聽起來不搭 | 氛圍參考太模糊 | 如果你不想要生成的聲音場景,就加上更具體的調性(「安靜的攝影棚」、「極簡房間音」) |
什麼時候該選 Grok Imagine 1.5,什麼時候該選別的
當你手上有一張乾淨的原始靜態圖,又想在點數效率好的前提下拿到穩定的主體錨定時,Grok Imagine 1.5 就是對的工具。它不是每一份影片 brief 的正解。
| 需求 | 更適合的選擇 |
|---|---|
| 跨多顆鏡頭的角色一致性 | Seedance 2.0 |
| 影格層級的鏡頭參數化 | V6 |
| 可播出的 4K 輸出 | Veo 3 |
| 強烈的運動能量、生活感 UGC 質地 | PixVerse 系列 |
| 最長的片段長度(最長 60 秒) | Sora 2 |
想看整個圖片生成影片版圖上通用的模型選擇框架,產品照做成影片廣告這份指南照目標和預算列出了選擇。
在 OmniArt 上開始
打開 OmniArt 的影片工作台,把模型選成 Grok Imagine,上傳一張通得過上面那份原圖檢查清單的產品靜態圖。寫一條五段式提示詞——動作、光線、節奏、背景、氛圍——生成一支 5 秒、480p 的草稿。如果運動和主體錨定都守得住,再升到 720p 做成品。
整個迴圈——打樣、微調、出母帶——都在同一個工作台裡跑,用的是你在其他每個 OmniArt 模型上用的同一份點數餘額。不用另外開 xAI 帳號,不用把檔案匯出到別的工具,也不用在你明明已經有想要的產品照時,還從文字重新開始。
準備好開始創作了嗎?
用 AI 生成精彩內容