Veo 3.1 提示詞與電影感指南
怎麼寫 Veo 3.1 的提示詞,做出廣播等級的成果:原生 4K、空間音訊,以及很強的圖片忠實度——附一套可重複使用的五段公式和 OmniArt 內的前後對照。

Veo 3.1 是 OmniArt 上的廣播等級影片模型——當成品必須撐得住大螢幕時,你會找的就是它。它提供原生 4K、跟影片畫面一起生成的空間音訊,以及在你給參考圖時異常強的首格忠實度。但提示詞如果含糊,這些都沒有意義。這份指南給你一套可重複使用的公式,用 Veo 3.1 想被指導的方式去指導它,另外還有前後對照、一份電影感詞彙表,以及怎麼替不同案子挑對層級(standard、fast 或 lite)。
Veo 3.1 提示詞的五段公式
Veo 3.1 對「照順序回答五個問題」的結構化提示詞反應很好。少寫一段,模型就會自己補上——而且通常補得非常籠統。
- 主體與動作——誰或什麼、在做什麼、在哪裡。"A filmmaker reviewing footage alone in a dark edit suite."
- 攝影機(運動、鏡頭、取景)——景別、焦段、運動方式和速度。"Slow push-in, 50mm, medium close-up, camera locked then drifting forward."
- 光線與氛圍——光源、方向、質感、色調。"Single monitor glow as key light, deep shadows, cool blue, high contrast."
- 音訊與環境音——這個空間聽起來如何、有哪些特定聲音、音樂方向,或
no music。"Quiet electrical hum, occasional keyboard click, no music." - 技術輸出——解析度(要不要 4K)、時長意圖、任何風格參考。"4K, 8 seconds, photorealistic."
一個完整範例
提示詞:
"A filmmaker reviewing footage alone in a dark edit suite. Slow push-in, 50mm, medium close-up, camera locked then drifting forward. Single monitor glow as key light, deep shadows, cool blue, high contrast. Quiet electrical hum, occasional keyboard click, no music. 4K, 8 seconds, photorealistic."
這條提示詞寫起來不到三十秒。它用攝影指導對燈光師說話的方式描述這顆鏡頭,Veo 3.1 幾乎沒有猜錯的空間。
小技巧
no music。電影感詞彙速查表
這些說法可以直接對應到 Veo 3.1 生成出來的畫面。需要哪一句,就複製到你的提示詞裡。
運鏡
| 運動 | 提示詞寫法 |
|---|---|
| 慢慢靠近 | "slow dolly-in", "gentle push-in" |
| 後退 | "slow pull-back", "dolly-out to reveal" |
| 平行跟拍 | "smooth tracking shot from the left", "lateral dolly" |
| 上升揭露 | "slow crane up to reveal the skyline" |
| 手持的緊張感 | "subtle handheld shake, reactive framing" |
| 鎖定、穩定 | "tripod-locked", "static wide" |
| 繞著主體弧形移動 | "slow arc around the subject" |
景別與角度
| 意圖 | 提示詞寫法 |
|---|---|
| 規模與環境 | "wide 18mm, deep focus, full environment" |
| 主體在空間裡 | "medium shot, eye level" |
| 親密感 | "medium close-up, 50mm" |
| 張力 | "tight close-up, 85mm, shallow focus" |
| 力量與壓迫感 | "low angle looking up" |
| 脆弱感 | "high angle looking down" |
光線
| 質感 | 提示詞寫法 |
|---|---|
| 自然的暖調 | "golden-hour side light, warm highlights, cool shadows" |
| 情緒化的反差 | "chiaroscuro, single hard source from camera right" |
| 都市氛圍 | "neon spill, magenta and cyan, reflections in wet pavement" |
| 乾淨的訪談 | "soft diffused key, slightly warm, low contrast" |
| 夜晚的存在感 | "practical light only — a single lamp, deep background falloff" |
前後對照
A:運鏡指示——單一影響最大的槓桿
你能對 Veo 3.1 提示詞做的最有效改動,就是加上一個運鏡和焦段。比較看看:
沒寫的版本: "A street musician playing violin in the rain."
寫了的版本: "Medium close-up of a street musician playing violin in the rain. Slow dolly-in, 85mm, shallow depth of field — background traffic dissolving into blur. Practical street-lamp from above, rim-lighting the bow. Light rain sound, distant traffic, no music."
第二個版本一次都沒用到「cinematic」這個字。它直接指定了讓這顆鏡頭有電影感的東西——模型於是生出你的意圖,而不是從十種籠統的詮釋裡隨便挑一個。
B:圖片生成影片的首格忠實度
當你提供一張參考圖當首格時,Veo 3.1 的圖片忠實度特別強。模型會守住第一個影格的構圖、調色和關鍵角色細節,並在整段生成裡把它們當成約束條件。
實務用法:拿一張商業攝影的定格、一張產品的 3D 成品圖或一張角色概念圖,在 OmniArt 的圖片生成影片流程裡當作首格提供,再寫一條從那個起點描述運動的提示詞。
提供產品照當首格之後的提示詞:
"The perfume bottle sits on a white marble surface. Slow arc from left to right, the bottle staying centred. Late-afternoon light from a high window sweeps across the glass, catching the facets. 4K, 6 seconds, no music."
模型會從你的參考素材繼承完全相同的光線、產品擺位和表面質感,再把描述的運動套上去——而不是把整個場景從零重新生成一次。
說明
C:一行提示詞就做出空間音訊
Veo 3.1 的空間音訊不需要另外跑一輪——提示詞裡一行描述性的音訊句子,就足以做出有層次、有方位感的聲音場景。
提示詞片段:
"...Audio: close-mic'd rain on corrugated iron overhead, a distant market crowd, occasional motorbike passing right to left, no music."
模型生出來的東西是:雨聲存在而且有方向——你聽得出它在場景上方的空間位置。市場人聲落在中距離。機車照描述掃過立體聲場。這種方向性來自 Veo 3.1 原生的音訊架構,不是後製加上去的。把各層聲音和它們的空間關係點名出來——close、distant、passing left to right——模型才有足夠資訊去做出方位感。
standard、fast 和 lite 怎麼選
Veo 3.1 在 OmniArt 上有三個層級。選哪一個要看案子,而不是看習慣。
| 層級 | 什麼時候用 | 點數成本 |
|---|---|---|
veo-3.1-standard | 最終成品、廣播交付、客戶審片,以及任何要用 4K 的情境 | 每秒最貴 |
veo-3.1-fast | 在合理畫質下做迭代和提示詞打磨 | 中等 |
veo-3.1-lite | 快速概念測試、縮圖確認、分鏡動態試跑 | 每秒最便宜 |
**什麼時候 4K 值得多花點數:**大螢幕交付、產品主視覺鏡頭、任何會用完整解析度輸出的東西,或是背景和材質細節對需求很關鍵的案子。4K 只有 veo-3.1-standard 有。
**什麼時候 4K 是浪費:**1080p 或更小的社群裁切版、反正還會重新生成的動態草稿,還有任何你只是在探索、不是要交付的東西。這類工作用 veo-3.1-lite——便宜地迭代,最後一輪再切到 standard。
注意
常見的提示詞錯誤
主體那一句塞太滿。 "A middle-aged woman with curly red hair wearing a vintage coat standing by a canal in Amsterdam holding a bouquet of tulips looking wistful" 在最前面塞了太多細節,模型只好自己挑要真的生出哪幾項。把角色描述縮到這顆鏡頭真正必要的部分,其他放掉。
運鏡指示互相打架。 "Slow push-in with a wide pull-back" 在物理上不可能——模型會挑一個、忽略另一個。每條提示詞只寫一個有動機的運動。如果你要的是一顆從廣角開始、然後收進去的鏡頭,那就是推進,沒有別的。
完全忘了音訊。 不管你有沒有指示,Veo 3.1 都會生成音訊。沒有指示的音訊不是安靜,而是模型的最佳猜測,而那可能跟你的意圖不一樣。永遠用一行音訊句子結束提示詞,就算只是 no music, ambient room tone only 也好。
把「cinematic」當成風格詞來寫。 「cinematic」這個字等於要模型替你做一個本來該由你做的決定。把它換成你真正要的具體視覺屬性:鏡頭、光線、運動、色調。
在 OmniArt 上開始
Veo 3.1 的 standard、fast 和 lite 三個層級,都和模型庫裡其他所有模型一起放在 OmniArt 影片工作台裡。要最快上手,就拿一個現成的想法,照上面的五段公式寫一次,先用 veo-3.1-fast 生成把提示詞磨好,再交給 standard。
想了解更廣的電影感詞彙,以及同一套提示詞模式怎麼套用在 OmniArt 全部影片模型上,請看電影感 AI 影片提示詞指南。想更深入研究 Veo 3.1 的音訊生成,Veo 3.1 空間音訊最佳實務這份指南詳細談了分層聲音場景、方位音訊提示和音樂指示。想看 Veo 3.1 和其他頂級模型正面對決,請看 Veo 3.1 對上 Sora 2。
準備好開始創作了嗎?
用 AI 生成精彩內容