AI 影片生成壞掉時的 7 種提示詞修法
按症狀分類的 AI 影片除錯指南,七種提示詞修法對付五官變形、動作被忽略、畫面漂移、文字亂碼、動態抖動和對嘴不同步。

大多數失敗的 AI 影片片段都不是模型的問題。它們是一句帶著某個特定缺陷的提示詞,而那個缺陷會留下指紋:融化的手、站著不動的主體、從頭到尾沒動過的鏡頭、播到一半換了顏色的外套。只要你讀得懂指紋,下面這幾種修法每一種都只要改一個地方。
這篇文章按症狀編排,而不是按原則。如果你要的是地基——主體、風格、光線、構圖——先去看怎麼把提示詞寫得更好,等某一次生成出狀況再回到這裡。下面的內容假設你已經寫得出像樣的提示詞,只是想知道片子壞掉時該改哪個字。
例子用的是 OmniArt 影片工作台裡有的模型——Seedance、Veo 3.1、Kling、Grok Imagine、PixVerse V6 和 C1——因為除錯有一部分,就是認出某個症狀該換模型解決,而不是再多寫幾行提示詞。
一次只除錯一個變數
在進到個別修法之前,先養成那個讓所有修法都變快的習慣:每次生成只改一件事。生出一版爛的就把整句提示詞重寫,你什麼都學不到,因為你分不出是哪一次修改有效。
時長、解析度、畫面比例和參考圖對結果的影響不會比措辭小,所以把設定跟提示詞一起記下來。刻意的兩三次嘗試,通常勝過十次重寫。
小技巧
修法 1:臉、手和四肢在片子中途變形
**你看到的:**第一影格很乾淨,然後手指黏在一起、一張臉從頭骨上滑開,或是轉身的時候多長出一隻手臂。
**為什麼會這樣:**模型正在把身體內插到你的提示詞從沒描述過的姿勢上。四肢動得快、鏡頭貼近拍手、遮擋(手從臉前面經過)和長時長,都會讓模型必須憑空編出來的影格數翻倍。
**修法:**減少必須憑空編的部分。景別往後退一級,把身體的動作機制明講出來,讓手要嘛不動、要嘛走一條簡單的路徑。從一張乾淨的圖片而不是文字出發也能把人體結構定住,因為模型繼承到的是一副正確的身體,而不是自己猜一副。
修改前:"Close-up of a chef's hands quickly chopping vegetables and tossing them into a pan."
修改後:"Medium shot of a chef at a wooden counter. One steady chopping motion with the right hand, left hand resting flat on the board. Hands stay inside frame, no cuts. 50mm, soft window light from camera left."
以人為主的鏡頭,Veo 3.1 和 Kling 通常能在一整段裡把身體結構撐住;而當失敗點出在人體結構上,任何模型的圖生影片都比文生影片穩。如果那顆特寫非留不可,就把片子縮短,並且接受一個動作而不是兩個。
修法 2:主體無視你要求的動作
**你看到的:**構圖、光線和風格都對得上你的提示詞,但主體就站在那裡呼吸,或是做著某種通用的待機動作,而不是你指定的那個動作。
**為什麼會這樣:**動作被埋掉了。如果動詞坐在一長串描述句的尾巴,或是跟另外三個動詞在搶位置,模型就會把它當成靜態場景的又一個屬性。而模糊的動詞("interacting"、"enjoying"、"exploring")根本沒有視覺形狀,所以什麼也不會發生。
**修法:**把主體和動作放最前面,用一個具體的物理動詞、現在式,並且描述這個動作的終點。所有造型相關的東西——鏡頭、色調、氛圍——都移到動作後面,讓它們讀起來像裝飾,而不是主句。
修改前:"A dramatic, moody, rain-soaked alley at night with neon reflections and steam, where a courier is exploring the area and interacting with her surroundings."
修改後:"A courier crouches and picks up a dropped envelope, then stands and looks left. Rain-soaked alley at night, neon reflections on wet asphalt, steam from a vent. Handheld medium shot."
Seedance 對這種分鏡表式的寫法反應很好;而當需求就是一個受控的動作節拍——一個轉身、一次伸手、一次產品揭示——PixVerse C1 是個合理的選擇。
修法 3:運鏡沒有發生,或是跟主體打架
**你看到的:**你要了一個推軌前進,拿到的是鎖死的畫面。或者鏡頭是動了,但主體相對背景滑得很怪,整顆鏡頭像一張被扭曲的照片,而不是穿過空間的移動。
**為什麼會這樣:**兩種成因,長得很像。要嘛這個運鏡被寫成一個沒有動機的效果("zoom in"、"cinematic camera movement"),要嘛你把互相矛盾的指令疊在一起——主體朝鏡頭走的同時鏡頭推進,或是在一個四秒片段裡塞進橫搖加俯仰加升降。
**修法:**一個片段一個運鏡,用電影語言命名,並且綁在畫面裡正在發生的某件事上。然後檢查有沒有衝突:如果主體朝鏡頭移動,鏡頭應該定住或後退,不該推進。
修改前:"Epic cinematic camera movement, zoom in and pan around the hero as he runs at the camera, dynamic angles."
修改後:"The hero runs toward camera down a corridor. The camera retreats ahead of him at a steady pace, holding him at medium framing. Low angle, wide lens, no other camera movement."
Kling 和 Seedance 都很吃得下明確的運鏡指示;如果比起精準構圖你更在意感覺,那種鬆一點、有勁道的運鏡值得拿 Grok Imagine 試一輪。要是某個運鏡就是不肯生效,改成描述觀眾看到的變化——"the skyline enters frame from the bottom"——而不是去點名器材。
修法 4:場景漂移,或主體的長相在片中改變
**你看到的:**主體一開始是某個人,結束時變成那個人的堂表親。紅外套變成酒紅色,背景的店面自己重排了一次,房間長出第二扇窗。
**為什麼會這樣:**這次生成裡沒有任何東西在釘住外觀。文字提示詞描述的是一個類別,不是一個個體,所以每一影格都可以把"young woman in a red jacket"稍微重新詮釋一次。時長愈長、背景愈雜,漂移就愈快。
**修法:**用一張圖片定錨,然後只描述會變的東西。當你上傳了參考圖或起始影格,在提示詞裡把外觀完整重述一遍反而有害——文字會跟圖片搶。背景保持簡單,長的想法拆成幾顆短鏡頭,不要做成一顆長鏡頭。
修改前:"A young woman in a red jacket with brown hair walks through a busy market, 10 seconds, lots of detail, many people and stalls."
修改後:"Keep the referenced subject's face, hair, and red jacket unchanged. She walks forward past two stalls and stops to look right. Shallow depth of field so the market behind her stays soft. 5 seconds, single continuous shot."
說明
修法 5:文字和標誌生成出來是亂的
**你看到的:**一塊寫著 "SHOPP" 的招牌、一張溶解成偽字母的產品標籤、一個每幾影格就變異一次的標誌。
**為什麼會這樣:**影片模型是把文字當紋理生成的,不是當字形,而任何動態都會讓那塊紋理逐格重新算一次。小字級、彎曲或移動表面上的字,以及落在透視平面上的字,是最糟的情況。
**修法:**別再叫影片模型去產出文字。先用圖片模型生成那一影格——在那裡調字體成本很低——再讓那張影格動起來。在影片提示詞裡引用完整的字串,讓它短,並且讓帶字的表面盡量平、盡量穩。
修改前:"A cafe storefront with a big detailed sign, menu boards, and lots of signage as the camera swoops past."
修改後:"Animate the provided frame. The sign reading 'DAYLIGHT' stays flat to camera and unchanged. Slow lateral drift to the right, sign fully in frame the whole time, no other text visible."
在 OmniArt 上,第一步你可以用 GPT Image 2 或 Seedream 5.0 Pro 這類圖片模型跑,再把定稿的影格送進同一個工作台裡的影片模型。凡是要交給客戶的東西,預設就把「文字要看得清楚」當成一件圖片優先的工作。
修法 6:動態太快、抖動或一格一格跳
**你看到的:**片子播起來像開了 1.5 倍速,或者主體在微微震動,又或者動態是以看得見的階梯往前跳,而不是順順地走。
**為什麼會這樣:**強度形容詞會被讀成速度。"Dynamic"、"explosive"、"energetic"、"action-packed" 都在推著模型把更多變化塞進同樣數量的影格裡。另一個常見成因是在太短的時間裡要求太多事件——四秒鐘三個節拍,等於每個節拍都分不到影格。
**修法:**刪掉強度用詞,改成指定節奏。一個片段給一個節拍,明講這顆鏡頭是連續的;如果動作真的需要更多時間,那就要求更長的時長,而不是更快的表演。
修改前:"Explosive dynamic action shot, skateboarder doing tricks, fast energetic motion, rapid cuts."
修改後:"A skateboarder rolls up a ramp and lifts into one slow ollie at the top. Steady, even pace, single continuous shot, no cuts. Camera tracks alongside at the same speed."
如果抖動是細碎的、不是結構性的,試試同一個模型家族裡更高的級距——用標準級距取代 fast 或 mini 級距——因為較低的級距是拿時間穩定性去換速度和成本的。
修法 7:音訊和對嘴對不上
**你看到的:**嘴形比話早或比話晚,嘴閉著對白還在繼續,或是人聲被模型自己加上去的音樂蓋掉。
**為什麼會這樣:**對嘴需要嘴看得見,而且台詞短到塞得進這個片段。五秒鏡頭裡塞長對白,模型只能選擇讓嘴趕拍或乾脆放棄同步。像 "with an epic soundtrack" 這種環境描述,等於在邀請一層跟人聲搶的音樂床。
**修法:**一個說話的人、一句用引號框起來的短台詞、嘴清楚入鏡且沒有遮擋,以及沒有互相競爭的音訊指令。什麼該安靜,要講得跟什麼該被聽見一樣明確。
修改前:"Two people talking about the product launch with an epic soundtrack and city ambience, close-up."
修改後:"Medium close-up of one woman facing camera, mouth fully visible. She says: 'We ship on Friday.' Then she pauses and smiles. Quiet room tone only, no music."
Veo 3.1 會生成含對白的原生音訊,PixVerse V6 在 OmniArt 的 Free 方案上也支援音訊。當你想用的模型沒有原生聲音時,可靠的路線是先生成無聲片段,另外用 MiniMax Speech 2.8 或 ElevenLabs 這類語音模型做人聲,再把兩者剪在一起。這樣做還有一個好處:重錄旁白不必重生畫面。
症狀對修法速查表
片子生壞的時候拿這張表來做分診。先改第一欄的那一項,其他都先別動。
| 症狀 | 先改這個 | 模型備註 |
|---|---|---|
| 臉或手變形 | 景別拉寬、片子縮短、用圖片當起始影格 | 人物動態用 Veo 3.1、Kling |
| 動作被忽略 | 把動詞移到最前面,只留一個具體動作 | Seedance、PixVerse C1 |
| 運鏡沒出現 | 一個命名過、有動機的運鏡;移除衝突 | Kling、Seedance、Grok Imagine |
| 場景或長相漂移 | 用參考圖,只描述會變的部分 | PixVerse C1 參考素材、V6 多鏡頭 |
| 文字亂碼 | 先用圖片模型生成那一影格 | GPT Image 2、Seedream 5.0 Pro,再接任何影片模型 |
| 動態太快或抖動 | 刪掉強度用詞、指定節奏、拉長時長 | 標準級距優先於 fast 或 mini |
| 對嘴不準 | 一句引號短台詞、嘴要入鏡、不要音樂 | Veo 3.1、PixVerse V6,或另外配語音 |
在 OmniArt 上開始
挑你最近一次失敗的片子,對著上面七個症狀診斷一遍。只套用一種修法,重新生成,然後比對——兩輪通常就能告訴你問題出在提示詞還是模型選擇。因為 OmniArt 把圖片、影片和音訊模型放在同一個工作台裡,一顆難搞的鏡頭可以在不同做法之間搬動,而不用重建你的設定:用圖片模型把它定錨、換第二個影片模型重試,或是把人聲另外配上去。
打開創作工作台,貼上改好的提示詞,把撐得住的那幾版留下來。
準備好開始創作了嗎?
用 AI 生成精彩內容