AI 视频生成翻车了?7 个按症状对症的提示词修正法
按症状排查 AI 视频问题:人脸手部变形、动作被忽略、场景漂移、文字乱码、运动抖动、口型不同步,七个提示词修正方法,每个只改一处。

大多数失败的 AI 视频片段并不是模型的问题。它们是一条带着某个具体缺陷的提示词,而这个缺陷会留下自己的指纹:手融成一团、主体站着不动、镜头从来不动、外套颜色到一半变了。一旦你能读出这枚指纹,下面这些 AI 视频提示词修正法每一个都只需要改一处。
这篇文章按症状而不是按原理来组织。如果你想要的是基本功——主体、风格、光线、构图——请先从怎么写出更好的提示词开始,等某一次具体的生成出问题时再回到这里。下面所有内容都假设你已经会写像样的提示词,只是想知道片子翻车时该改哪个词。
例子用的都是 OmniArt 视频工作台里能用到的模型——Seedance、Veo 3.1、Kling、Grok Imagine、PixVerse V6 和 C1——因为调试的一部分,就是认出某个症状换个模型解决比堆更多提示词文字更有效。
一次只调一个变量
在讲具体的修正法之前,先养成让它们全部变快的那个习惯:每次生成只改一件事。一条烂片子之后把整条提示词重写一遍,什么也学不到,因为你分不清是哪一处修改起了作用。
时长、分辨率、画面比例和参考图对结果的影响和措辞一样大,所以要把参数和提示词文字一起记下来。两三轮有意识的尝试,通常胜过十次重写。
提示
修正 1:人脸、手和四肢在片子中途变形
你看到的: 第一帧看起来干净,然后手指黏在一起、一张脸从头骨上滑下去,或者在转身过程中长出一条多余的手臂。
为什么会这样: 模型正在把一个身体插值穿过你的提示词从未描述过的姿态。快速的肢体运动、贴近手部的取景、遮挡关系(一只手从脸前经过)以及较长的时长,都会成倍增加模型必须凭空造出来的帧数。
怎么修: 减少必须被凭空造出来的东西。取景往后退一档,明确说出身体的力学动作,并让手要么保持静止、要么走一条简单的路径。从一张干净的图片而不是从文字起步,同样能把人体结构钉住,因为模型继承到的是一具正确的身体,而不是猜出来的。
改之前: “Close-up of a chef's hands quickly chopping vegetables and tossing them into a pan.”
改之后: “Medium shot of a chef at a wooden counter. One steady chopping motion with the right hand, left hand resting flat on the board. Hands stay inside frame, no cuts. 50mm, soft window light from camera left.”
对以人为主的镜头,Veo 3.1 和 Kling 在整条片子里保持身体结构的表现通常不错;而当失败点是人体结构时,任何模型的图生视频都强过文生视频。如果你必须保住这个特写,那就把片子缩短,并接受一个动作而不是两个。
修正 2:主体无视你要求的动作
你看到的: 取景、光线、风格全都和提示词一致,但主体就站在那里呼吸,或者做某种通用的待机动作,而不是你指定的那个动作。
为什么会这样: 动作被埋掉了。如果动词落在一长句描述的末尾,或者要和另外三个动词竞争,模型就会把它当成一个静态场景的又一条属性。含糊的动词(“互动”“享受”“探索”)根本没有视觉形态,所以什么都不会发生。
怎么修: 把主体和动作放到最前面,用一个具体的、现在时的物理动词,并描述这个动作的终点。把所有造型信息——镜头、色调、氛围——都挪到动作之后,让它读起来像装饰而不是主句。
改之前: “A dramatic, moody, rain-soaked alley at night with neon reflections and steam, where a courier is exploring the area and interacting with her surroundings.”
改之后: “A courier crouches and picks up a dropped envelope, then stands and looks left. Rain-soaked alley at night, neon reflections on wet asphalt, steam from a vent. Handheld medium shot.”
Seedance 对这种分镜表式的措辞反应很好;而当需求是一个受控的动作节拍——一次转身、一次伸手,或者一次产品露出——PixVerse C1 是个合理的选择。
修正 3:运镜没有发生,或者在跟主体打架
你看到的: 你要的是推镜,拿回来的是锁定画面。或者镜头动了,但主体相对背景滑得很怪,整个镜头像一张被扭曲的照片,而不是一次穿过空间的运动。
为什么会这样: 两种原因,长得很像。要么运镜只被写成一个没有动机的效果(“放大”“电影感运镜”),要么你堆了互相矛盾的指令——主体走向镜头的同时还要推进,或者在一段四秒的片子里同时要横摇加俯仰加摇臂。
怎么修: 一段片子一次运镜,用影视术语命名,并绑定到画面里正在发生的某件事上。然后检查冲突:如果主体走向镜头,镜头就应该保持不动或后退,而不是推进。
改之前: “Epic cinematic camera movement, zoom in and pan around the hero as he runs at the camera, dynamic angles.”
改之后: “The hero runs toward camera down a corridor. The camera retreats ahead of him at a steady pace, holding him at medium framing. Low angle, wide lens, no other camera movement.”
Kling 和 Seedance 都很吃明确的运镜指令,而 Grok Imagine 值得试一试那种更松、更有劲的运动——精确构图在那里不如感觉重要。如果一个运镜怎么都不生效,就去描述观众看到的画面变化——“天际线从画面底部进入”——而不是去点名机械设备。
修正 4:场景漂移,或者身份在片子中途变了
你看到的: 主体开头是一个人,结尾变成了这个人的表亲。一件红外套变成了酒红色,背景的店面自己重排了一遍,房间长出了第二扇窗。
为什么会这样: 这次生成里没有任何东西在钉住外观。文字提示词描述的是一个类别,不是一个个体,所以每一帧都可以把“穿红外套的年轻女性”重新解释得略有不同。更长的时长和更繁杂的背景会加速这种漂移。
怎么修: 用图片锚定,然后只描述会变的部分。当你上传了参考图或首帧时,在提示词里重复完整外观反而有害——文字会跟图片竞争。把背景保持简单,并把长的想法拆成几个短镜头,而不是一个长镜头。
改之前: “A young woman in a red jacket with brown hair walks through a busy market, 10 seconds, lots of detail, many people and stalls.”
改之后: “Keep the referenced subject's face, hair, and red jacket unchanged. She walks forward past two stalls and stops to look right. Shallow depth of field so the market behind her stays soft. 5 seconds, single continuous shot.”
说明
修正 5:文字和标识出来是乱码
你看到的: 一块招牌写着“SHOPP”、一个产品标签溶解成伪字母、一个标识每隔几帧就变异一次。
为什么会这样: 视频模型把文字当成纹理生成,而不是当成字形,而任何运动都会逐帧重新渲染这层纹理。小号字、位于弯曲或运动表面上的文字,以及处在透视平面里的文字,是最糟的情况。
怎么修: 别再让视频模型去写这些文字。先用图片模型生成这一帧——在那里迭代排版很便宜——然后再让这一帧动起来。在视频提示词里把那串字符原样引用出来、保持简短,并让带字的表面尽可能平整稳定。
改之前: “A cafe storefront with a big detailed sign, menu boards, and lots of signage as the camera swoops past.”
改之后: “Animate the provided frame. The sign reading 'DAYLIGHT' stays flat to camera and unchanged. Slow lateral drift to the right, sign fully in frame the whole time, no other text visible.”
在 OmniArt 上,第一步可以用 GPT Image 2 或 Seedream 5.0 Pro 这样的图片模型完成,然后把通过的那一帧送进同一个工作台里的视频模型。凡是要交给客户的东西,默认都把可读文字当成一件先出图的活。
修正 6:运动太快、抖动或者一顿一顿
你看到的: 片子播起来像开了 1.5 倍速,或者主体在轻微震颤,或者运动是以可见的台阶推进而不是顺滑推进。
为什么会这样: 强度形容词会被读成速度。“动感”“爆炸性”“充满能量”“动作满满”都会推着模型在同样的帧数里塞进更多变化。另一个常见原因是在太短的时间里要求太多事件——四秒里三个节拍,等于哪个节拍都没有帧可用。
怎么修: 删掉强度词,改成指定节奏。一段片子一个节拍,明确说这是连续镜头,如果这个动作确实需要更多时间,那就要求更长的时长,而不是要求更快的表演。
改之前: “Explosive dynamic action shot, skateboarder doing tricks, fast energetic motion, rapid cuts.”
改之后: “A skateboarder rolls up a ramp and lifts into one slow ollie at the top. Steady, even pace, single continuous shot, no cuts. Camera tracks alongside at the same speed.”
如果抖动是细颗粒的而不是结构性的,试试同一模型系列里更高的档位——用标准档而不是快速档或迷你档——因为低档位是用时间稳定性换速度和成本的。
修正 7:音频和口型对不上
你看到的: 嘴的动作比词早或晚、嘴闭着对白还在继续,或者人声被模型自作主张加的音乐盖住了。
为什么会这样: 口型同步需要嘴可见,并且台词短到能装进这段片子。五秒镜头里塞一段长对白,会逼模型要么把嘴赶得飞快,要么放弃同步。而“配上史诗级配乐”这类环境描述,等于邀请一层和人声抢戏的音乐床。
怎么修: 一个说话人、一句用引号括起来的短台词、嘴部构图清晰无遮挡,并且没有互相竞争的音频指令。什么该安静,说得要和什么该被听见一样明确。
改之前: “Two people talking about the product launch with an epic soundtrack and city ambience, close-up.”
改之后: “Medium close-up of one woman facing camera, mouth fully visible. She says: 'We ship on Friday.' Then she pauses and smiles. Quiet room tone only, no music.”
Veo 3.1 能生成包含对白的原生音频,PixVerse V6 在 OmniArt 的免费档位上就支持音频。当你想用的模型没有原生声音时,靠得住的路径是先生成无声片子,再用语音模型单独做人声——比如 MiniMax Speech 2.8 或 ElevenLabs——然后把两者剪在一起。这样你还能在不重新生成画面的前提下重录旁白。
症状到修正法的速查表
片子拿回来不对时,把这张表当分诊单用。先改第一列指向的东西,其他都别动。
| 症状 | 先改这个 | 模型备注 |
|---|---|---|
| 人脸或手变形 | 取景放宽、片子缩短、用图片做首帧 | 人物运动用 Veo 3.1、Kling |
| 动作被无视 | 把动词挪到最前面,只留一个具体动作 | Seedance、PixVerse C1 |
| 运镜缺失 | 一个有命名、有动机的运镜;去掉冲突 | Kling、Seedance、Grok Imagine |
| 场景或身份漂移 | 用参考图,只描述会变的部分 | PixVerse C1 的参考功能、V6 的多镜头 |
| 文字乱码 | 先在图片模型里生成这一帧 | GPT Image 2、Seedream 5.0 Pro,之后接任意视频模型 |
| 运动太快或抖动 | 删掉强度词,指定节奏,延长时长 | 优先用标准档,而不是快速档或迷你档 |
| 口型不同步 | 一句引号内的短台词、嘴在画面里、无音乐 | Veo 3.1、PixVerse V6,或者单独加人声 |
在 OmniArt 上开始
挑出你最近一次失败的片子,对着上面七种症状做诊断。只应用一个修正,重新生成,然后对比——两轮通常就能告诉你问题出在提示词还是模型选择上。因为 OmniArt 把图片、视频和音频模型放在同一个工作台里,一个难搞的镜头可以在不同思路之间移动,而不用重搭环境:用图片模型把它锚住、换第二个视频模型再试,或者把人声单独加上去。
打开创作工作台,把改好的提示词粘进去,留下那些立得住的片子。
准备好创作了吗?
开始用 AI 生成精彩内容