AI 视频生成翻车了?7 个按症状对症的提示词修正法
按症状排查 AI 视频问题:人脸手部变形、动作被忽略、场景漂移、文字乱码、运动抖动、口型不同步,七个提示词修正方法,每个只改一处。

大多数失败的 AI 视频片段并不是模型的问题。它们是一条带着某个具体缺陷的提示词,而这个缺陷会留下自己的指纹:手融成一团、主体站着不动、镜头从来不动、外套颜色到一半变了。一旦你能读出这枚指纹,下面这些 AI 视频提示词修正法每一个都只需要改一处。
这篇文章按症状而不是按原理来组织。如果你想要的是基本功——主体、风格、光线、构图——请先从怎么写出更好的提示词开始,等某一次具体的生成出问题时再回到这里。下面所有内容都假设你已经会写像样的提示词,只是想知道片子翻车时该改哪个词。
例子用的都是 OmniArt 视频工作区里能用到的模型——Seedance、Veo 3.1、Kling、Grok Imagine、PixVerse V6 和 C1——因为调试的一部分,就是认出某个症状换个模型解决比堆更多提示词文字更有效。
一次只调一个变量
在讲具体的修正法之前,先养成让它们全部变快的那个习惯:每次生成只改一件事。一条烂片子之后把整条提示词重写一遍,什么也学不到,因为你分不清是哪一处修改起了作用。
时长、分辨率、宽高比和参考图对结果的影响和措辞一样大,所以要把参数和提示词文字一起记下来。两三轮有意识的尝试,通常胜过十次重写。
提示
修正 1:人脸、手和四肢在片子中途变形
你看到的: 第一帧看起来干净,然后手指黏在一起、一张脸从头骨上滑下去,或者在转身过程中长出一条多余的手臂。
为什么会这样: 模型正在把一个身体插值穿过你的提示词从未描述过的姿态。快速的肢体运动、贴近手部的取景、遮挡关系(一只手从脸前经过)以及较长的时长,都会成倍增加模型必须凭空造出来的帧数。
怎么修: 减少必须被凭空造出来的东西。取景往后退一档,明确说出身体的力学动作,并让手要么保持静止、要么走一条简单的路径。从一张干净的图片而不是从文字起步,同样能把人体结构钉住,因为模型继承到的是一具正确的身体,而不是猜出来的。
改之前: “厨师双手的特写,快速切菜并把菜扔进锅里。”
改之后: “中景,一位厨师站在木质料理台前。右手做一个平稳的切菜动作,左手平放在案板上。双手全程留在画面内,不切镜。50mm,来自机位左侧的柔和窗光。”
对以人为主的镜头,Veo 3.1 和 Kling 在整条片子里保持身体结构的表现通常不错;而当失败点是人体结构时,任何模型的图生视频都强过文生视频。如果你必须保住这个特写,那就把片子缩短,并接受一个动作而不是两个。
修正 2:主体无视你要求的动作
你看到的: 取景、光线、风格全都和提示词一致,但主体就站在那里呼吸,或者做某种通用的待机动作,而不是你指定的那个动作。
为什么会这样: 动作被埋掉了。如果动词落在一长句描述的末尾,或者要和另外三个动词竞争,模型就会把它当成一个静态场景的又一条属性。含糊的动词(“互动”“享受”“探索”)根本没有视觉形态,所以什么都不会发生。
怎么修: 把主体和动作放到最前面,用一个具体的、现在时的物理动词,并描述这个动作的终点。把所有造型信息——镜头、色调、氛围——都挪到动作之后,让它读起来像装饰而不是主句。
改之前: “一条戏剧化、氛围阴郁、被雨淋透的夜间小巷,有霓虹反光和蒸汽,一名快递员正在探索这片区域并与周围环境互动。”
改之后: “一名快递员蹲下捡起一个掉落的信封,然后站起来向左看。被雨淋透的夜间小巷,湿沥青上的霓虹反光,通风口冒出蒸汽。手持中景。”
Seedance 对这种分镜表式的措辞反应很好;而当需求是一个受控的动作节拍——一次转身、一次伸手,或者一次产品露出——PixVerse C1 是个合理的选择。
修正 3:运镜没有发生,或者在跟主体打架
你看到的: 你要的是推镜,拿回来的是锁定画面。或者镜头动了,但主体相对背景滑得很怪,整个镜头像一张被扭曲的照片,而不是一次穿过空间的运动。
为什么会这样: 两种原因,长得很像。要么运镜只被写成一个没有动机的效果(“放大”“电影感运镜”),要么你堆了互相矛盾的指令——主体走向镜头的同时还要推进,或者在一段四秒的片子里同时要横摇加俯仰加摇臂。
怎么修: 一段片子一次运镜,用影视术语命名,并绑定到画面里正在发生的某件事上。然后检查冲突:如果主体走向镜头,镜头就应该保持不动或后退,而不是推进。
改之前: “史诗级电影感运镜,主角冲向镜头时放大并环绕摇摄,动感角度。”
改之后: “主角沿走廊冲向镜头。镜头以稳定速度在他前方后退,把他保持在中景构图里。低角度,广角镜头,没有其他运镜。”
Kling 和 Seedance 都很吃明确的运镜指令,而 Grok Imagine 值得试一试那种更松、更有劲的运动——精确构图在那里不如感觉重要。如果一个运镜怎么都不生效,就去描述观众看到的画面变化——“天际线从画面底部进入”——而不是去点名机械设备。
修正 4:场景漂移,或者身份在片子中途变了
你看到的: 主体开头是一个人,结尾变成了这个人的表亲。一件红外套变成了酒红色,背景的店面自己重排了一遍,房间长出了第二扇窗。
为什么会这样: 这次生成里没有任何东西在钉住外观。文字提示词描述的是一个类别,不是一个个体,所以每一帧都可以把“穿红外套的年轻女性”重新解释得略有不同。更长的时长和更繁杂的背景会加速这种漂移。
怎么修: 用图片锚定,然后只描述会变的部分。当你上传了参考图或首帧时,在提示词里重复完整外观反而有害——文字会跟图片竞争。把背景保持简单,并把长的想法拆成几个短镜头,而不是一个长镜头。
改之前: “一位穿红外套、棕色头发的年轻女性穿过热闹的集市,10 秒,细节丰富,很多人和摊位。”
改之后: “保持参考主体的脸、头发和红外套不变。她向前走过两个摊位,停下来往右看。浅景深,让她身后的集市保持虚化。5 秒,单一连续镜头。”
说明
修正 5:文字和标识出来是乱码
你看到的: 一块招牌写着“SHOPP”、一个产品标签溶解成伪字母、一个标识每隔几帧就变异一次。
为什么会这样: 视频模型把文字当成纹理生成,而不是当成字形,而任何运动都会逐帧重新渲染这层纹理。小号字、位于弯曲或运动表面上的文字,以及处在透视平面里的文字,是最糟的情况。
怎么修: 别再让视频模型去写这些文字。先用图片模型生成这一帧——在那里迭代排版很便宜——然后再让这一帧动起来。在视频提示词里把那串字符原样引用出来、保持简短,并让带字的表面尽可能平整稳定。
改之前: “一家咖啡馆店面,有一块又大又精细的招牌、菜单板和大量标识,镜头掠过。”
改之后: “让提供的这一帧动起来。写着 ‘DAYLIGHT’ 的招牌正对镜头并保持不变。缓慢向右横移,招牌全程完整在画面内,不出现其他文字。”
在 OmniArt 上,第一步可以用 GPT Image 2 或 Seedream 5.0 Pro 这样的图片模型完成,然后把通过的那一帧送进同一个工作区里的视频模型。凡是要交给客户的东西,默认都把可读文字当成一件先出图的活。
修正 6:运动太快、抖动或者一顿一顿
你看到的: 片子播起来像开了 1.5 倍速,或者主体在轻微震颤,或者运动是以可见的台阶推进而不是顺滑推进。
为什么会这样: 强度形容词会被读成速度。“动感”“爆炸性”“充满能量”“动作满满”都会推着模型在同样的帧数里塞进更多变化。另一个常见原因是在太短的时间里要求太多事件——四秒里三个节拍,等于哪个节拍都没有帧可用。
怎么修: 删掉强度词,改成指定节奏。一段片子一个节拍,明确说这是连续镜头,如果这个动作确实需要更多时间,那就要求更长的时长,而不是要求更快的表演。
改之前: “爆炸性动感动作镜头,滑板手做花式动作,快速有能量的运动,快速剪切。”
改之后: “一名滑板手滑上斜坡,在顶端抬起做一个缓慢的豚跳。节奏平稳均匀,单一连续镜头,不切镜。镜头以相同速度侧向跟拍。”
如果抖动是细颗粒的而不是结构性的,试试同一模型系列里更高的档位——用标准档而不是快速档或迷你档——因为低档位是用时间稳定性换速度和成本的。
修正 7:音频和口型对不上
你看到的: 嘴的动作比词早或晚、嘴闭着对白还在继续,或者人声被模型自作主张加的音乐盖住了。
为什么会这样: 口型同步需要嘴可见,并且台词短到能装进这段片子。五秒镜头里塞一段长对白,会逼模型要么把嘴赶得飞快,要么放弃同步。而“配上史诗级配乐”这类环境描述,等于邀请一层和人声抢戏的音乐床。
怎么修: 一个说话人、一句用引号括起来的短台词、嘴部构图清晰无遮挡,并且没有互相竞争的音频指令。什么该安静,说得要和什么该被听见一样明确。
改之前: “两个人在谈产品发布,配史诗级配乐和城市环境音,特写。”
改之后: “中近景,一位女性正对镜头,嘴部完全可见。她说:‘我们周五发布。’然后她停顿并微笑。只有安静的房间底噪,没有音乐。”
Veo 3.1 能生成包含对白的原生音频,PixVerse V6 在 OmniArt 的免费档位上就支持音频。当你想用的模型没有原生声音时,靠得住的路径是先生成无声片子,再用语音模型单独做人声——比如 MiniMax Speech 2.8 或 ElevenLabs——然后把两者剪在一起。这样你还能在不重新生成画面的前提下重录旁白。
症状到修正法的速查表
片子拿回来不对时,把这张表当分诊单用。先改第一列指向的东西,其他都别动。
| 症状 | 先改这个 | 模型备注 |
|---|---|---|
| 人脸或手变形 | 取景放宽、片子缩短、用图片做首帧 | 人物运动用 Veo 3.1、Kling |
| 动作被无视 | 把动词挪到最前面,只留一个具体动作 | Seedance、PixVerse C1 |
| 运镜缺失 | 一个有命名、有动机的运镜;去掉冲突 | Kling、Seedance、Grok Imagine |
| 场景或身份漂移 | 用参考图,只描述会变的部分 | PixVerse C1 的参考功能、V6 的多镜头 |
| 文字乱码 | 先在图片模型里生成这一帧 | GPT Image 2、Seedream 5.0 Pro,之后接任意视频模型 |
| 运动太快或抖动 | 删掉强度词,指定节奏,延长时长 | 优先用标准档,而不是快速档或迷你档 |
| 口型不同步 | 一句引号内的短台词、嘴在画面里、无音乐 | Veo 3.1、PixVerse V6,或者单独加人声 |
在 OmniArt 上开始
挑出你最近一次失败的片子,对着上面七种症状做诊断。只应用一个修正,重新生成,然后对比——两轮通常就能告诉你问题出在提示词还是模型选择上。因为 OmniArt 把图片、视频和音频模型放在同一个工作区里,一个难搞的镜头可以在不同思路之间移动,而不用重搭环境:用图片模型把它锚住、换第二个视频模型再试,或者把人声单独加上去。
打开创作工作区,把改好的提示词粘进去,留下那些立得住的片子。
准备好创作了吗?
开始用 AI 生成精彩内容