Guide教學與操作指南閱讀時間 12 分鐘

Veo 3.1 提示詞與電影感指南

怎麼寫 Veo 3.1 的提示詞,做出廣播等級的成果:原生 4K、空間音訊,以及很強的圖片忠實度——附一套可重複使用的五段公式和 OmniArt 內的前後對照。

OmniArt 團隊
Veo 3.1 提示詞與電影感指南

Veo 3.1 是 OmniArt 上的廣播等級影片模型——當成品必須撐得住大螢幕時,你會找的就是它。它提供原生 4K、跟影片畫面一起生成的空間音訊,以及在你給參考圖時異常強的首格忠實度。但提示詞如果含糊,這些都沒有意義。這份指南給你一套可重複使用的公式,用 Veo 3.1 想被指導的方式去指導它,另外還有前後對照、一份電影感詞彙表,以及怎麼替不同案子挑對層級(standard、fast 或 lite)。

Veo 3.1 提示詞的五段公式

Veo 3.1 對「照順序回答五個問題」的結構化提示詞反應很好。少寫一段,模型就會自己補上——而且通常補得非常籠統。

  1. 主體與動作——誰或什麼、在做什麼、在哪裡。"A filmmaker reviewing footage alone in a dark edit suite."
  2. 攝影機(運動、鏡頭、取景)——景別、焦段、運動方式和速度。"Slow push-in, 50mm, medium close-up, camera locked then drifting forward."
  3. 光線與氛圍——光源、方向、質感、色調。"Single monitor glow as key light, deep shadows, cool blue, high contrast."
  4. 音訊與環境音——這個空間聽起來如何、有哪些特定聲音、音樂方向,或 no music"Quiet electrical hum, occasional keyboard click, no music."
  5. 技術輸出——解析度(要不要 4K)、時長意圖、任何風格參考。"4K, 8 seconds, photorealistic."

一個完整範例

提示詞:

"A filmmaker reviewing footage alone in a dark edit suite. Slow push-in, 50mm, medium close-up, camera locked then drifting forward. Single monitor glow as key light, deep shadows, cool blue, high contrast. Quiet electrical hum, occasional keyboard click, no music. 4K, 8 seconds, photorealistic."

這條提示詞寫起來不到三十秒。它用攝影指導對燈光師說話的方式描述這顆鏡頭,Veo 3.1 幾乎沒有猜錯的空間。

小技巧

每一條提示詞都寫上音訊指示,不要只在聲音重要的時候寫。Veo 3.1 會跟影片畫面一起生成空間音訊——不指定音訊不會讓輸出變安靜,只是把控制權交給模型。如果你想要一段乾淨、之後自己配樂的室內底噪,就寫 no music

電影感詞彙速查表

這些說法可以直接對應到 Veo 3.1 生成出來的畫面。需要哪一句,就複製到你的提示詞裡。

運鏡

運動提示詞寫法
慢慢靠近"slow dolly-in", "gentle push-in"
後退"slow pull-back", "dolly-out to reveal"
平行跟拍"smooth tracking shot from the left", "lateral dolly"
上升揭露"slow crane up to reveal the skyline"
手持的緊張感"subtle handheld shake, reactive framing"
鎖定、穩定"tripod-locked", "static wide"
繞著主體弧形移動"slow arc around the subject"

景別與角度

意圖提示詞寫法
規模與環境"wide 18mm, deep focus, full environment"
主體在空間裡"medium shot, eye level"
親密感"medium close-up, 50mm"
張力"tight close-up, 85mm, shallow focus"
力量與壓迫感"low angle looking up"
脆弱感"high angle looking down"

光線

質感提示詞寫法
自然的暖調"golden-hour side light, warm highlights, cool shadows"
情緒化的反差"chiaroscuro, single hard source from camera right"
都市氛圍"neon spill, magenta and cyan, reflections in wet pavement"
乾淨的訪談"soft diffused key, slightly warm, low contrast"
夜晚的存在感"practical light only — a single lamp, deep background falloff"

前後對照

A:運鏡指示——單一影響最大的槓桿

你能對 Veo 3.1 提示詞做的最有效改動,就是加上一個運鏡和焦段。比較看看:

沒寫的版本: "A street musician playing violin in the rain."

寫了的版本: "Medium close-up of a street musician playing violin in the rain. Slow dolly-in, 85mm, shallow depth of field — background traffic dissolving into blur. Practical street-lamp from above, rim-lighting the bow. Light rain sound, distant traffic, no music."

第二個版本一次都沒用到「cinematic」這個字。它直接指定了讓這顆鏡頭有電影感的東西——模型於是生出你的意圖,而不是從十種籠統的詮釋裡隨便挑一個。

B:圖片生成影片的首格忠實度

當你提供一張參考圖當首格時,Veo 3.1 的圖片忠實度特別強。模型會守住第一個影格的構圖、調色和關鍵角色細節,並在整段生成裡把它們當成約束條件。

實務用法:拿一張商業攝影的定格、一張產品的 3D 成品圖或一張角色概念圖,在 OmniArt 的圖片生成影片流程裡當作首格提供,再寫一條從那個起點描述運動的提示詞。

提供產品照當首格之後的提示詞:

"The perfume bottle sits on a white marble surface. Slow arc from left to right, the bottle staying centred. Late-afternoon light from a high window sweeps across the glass, catching the facets. 4K, 6 seconds, no music."

模型會從你的參考素材繼承完全相同的光線、產品擺位和表面質感,再把描述的運動套上去——而不是把整個場景從零重新生成一次。

說明

當首格圖片的畫面比例和解析度接近你要生成的規格時,圖片忠實度最強。把一張正方形圖片丟進 16:9 的生成,會被裁切或加上左右黑邊,這會讓模型繼承到的構圖跑掉。

C:一行提示詞就做出空間音訊

Veo 3.1 的空間音訊不需要另外跑一輪——提示詞裡一行描述性的音訊句子,就足以做出有層次、有方位感的聲音場景。

提示詞片段:

"...Audio: close-mic'd rain on corrugated iron overhead, a distant market crowd, occasional motorbike passing right to left, no music."

模型生出來的東西是:雨聲存在而且有方向——你聽得出它在場景上方的空間位置。市場人聲落在中距離。機車照描述掃過立體聲場。這種方向性來自 Veo 3.1 原生的音訊架構,不是後製加上去的。把各層聲音和它們的空間關係點名出來——closedistantpassing left to right——模型才有足夠資訊去做出方位感。

standard、fast 和 lite 怎麼選

Veo 3.1 在 OmniArt 上有三個層級。選哪一個要看案子,而不是看習慣。

層級什麼時候用點數成本
veo-3.1-standard最終成品、廣播交付、客戶審片,以及任何要用 4K 的情境每秒最貴
veo-3.1-fast在合理畫質下做迭代和提示詞打磨中等
veo-3.1-lite快速概念測試、縮圖確認、分鏡動態試跑每秒最便宜

**什麼時候 4K 值得多花點數:**大螢幕交付、產品主視覺鏡頭、任何會用完整解析度輸出的東西,或是背景和材質細節對需求很關鍵的案子。4K 只有 veo-3.1-standard 有。

**什麼時候 4K 是浪費:**1080p 或更小的社群裁切版、反正還會重新生成的動態草稿,還有任何你只是在探索、不是要交付的東西。這類工作用 veo-3.1-lite——便宜地迭代,最後一輪再切到 standard。

注意

拿還要重生成好幾次的探索型提示詞去跑 4K,點數會被乘上去得很快。先在 fast 或 lite 上把提示詞定下來,再把最終版本交給 standard 跑 4K。

常見的提示詞錯誤

主體那一句塞太滿。 "A middle-aged woman with curly red hair wearing a vintage coat standing by a canal in Amsterdam holding a bouquet of tulips looking wistful" 在最前面塞了太多細節,模型只好自己挑要真的生出哪幾項。把角色描述縮到這顆鏡頭真正必要的部分,其他放掉。

運鏡指示互相打架。 "Slow push-in with a wide pull-back" 在物理上不可能——模型會挑一個、忽略另一個。每條提示詞只寫一個有動機的運動。如果你要的是一顆從廣角開始、然後收進去的鏡頭,那就是推進,沒有別的。

完全忘了音訊。 不管你有沒有指示,Veo 3.1 都會生成音訊。沒有指示的音訊不是安靜,而是模型的最佳猜測,而那可能跟你的意圖不一樣。永遠用一行音訊句子結束提示詞,就算只是 no music, ambient room tone only 也好。

把「cinematic」當成風格詞來寫。 「cinematic」這個字等於要模型替你做一個本來該由你做的決定。把它換成你真正要的具體視覺屬性:鏡頭、光線、運動、色調。

在 OmniArt 上開始

Veo 3.1 的 standard、fast 和 lite 三個層級,都和模型庫裡其他所有模型一起放在 OmniArt 影片工作台裡。要最快上手,就拿一個現成的想法,照上面的五段公式寫一次,先用 veo-3.1-fast 生成把提示詞磨好,再交給 standard。

想了解更廣的電影感詞彙,以及同一套提示詞模式怎麼套用在 OmniArt 全部影片模型上,請看電影感 AI 影片提示詞指南。想更深入研究 Veo 3.1 的音訊生成,Veo 3.1 空間音訊最佳實務這份指南詳細談了分層聲音場景、方位音訊提示和音樂指示。想看 Veo 3.1 和其他頂級模型正面對決,請看 Veo 3.1 對上 Sora 2

準備好開始創作了嗎?

用 AI 生成精彩內容

免費開始