AI動画が思いどおりに出ないときのプロンプト修正7選
AI動画の不具合を症状別に切り分け、崩れる顔や無視されるアクション、シーンのぶれ、文字化け、揺れ、リップシンクのずれを直すプロンプト修正7選を解説します。

失敗したAI動画のほとんどは、モデルの問題ではありません。プロンプトに具体的な欠陥が1つあり、その欠陥は指紋を残します。溶けていく手、じっと立っているだけの被写体、まったく動かないカメラ、途中で色が変わる上着。その指紋を読めるようになれば、以下のプロンプト修正はどれも1か所直すだけで済みます。
この記事は原則ではなく症状で整理してあります。被写体、様式、ライティング、構図といった土台から知りたい場合は、より良いプロンプトの書き方から始めて、特定の生成がおかしくなったときにここへ戻ってきてください。以下はすべて、すでにまともなプロンプトを書けている人が、クリップが失敗したときにどの語を変えればいいかを知りたい、という前提で書いています。
例に使うのはOmniArtの動画ワークスペースで使えるモデル、Seedance、Veo 3.1、Kling、Grok Imagine、PixVerse V6とC1です。デバッグの一部は、その症状がプロンプトを増やすよりも別のモデルで解決したほうが早い、と気づくことだからです。
変数は1つずつ切り分ける
個別の修正に入る前に、そのすべてを速くする習慣を身につけてください。1回の生成で変えるのは1か所だけです。失敗したテイクのあとにプロンプト全体を書き直しても、何も学べません。どの変更が効いたのか分からなくなるからです。
尺、解像度、アスペクト比、参照画像は、文言と同じくらい結果に影響します。プロンプト本文と一緒に設定も記録してください。意図をもった2〜3回の試行が、10回の書き直しに勝ることがほとんどです。
ヒント
修正1:顔、手、手足がクリップの途中で崩れる
見えている症状: 1フレーム目はきれいなのに、そのあと指が融合し、顔が頭蓋からずれ落ち、振り向く途中で腕が1本増える。
なぜ起きるのか: プロンプトが説明していない姿勢を通して、モデルが身体を補間しているからです。速い手足の動き、手に寄った画面、遮蔽(顔の前を手が通る)、長い尺は、どれもモデルが作り出さなければならないフレーム数を増やします。
直し方: 作り出さなければならないものを減らします。画面サイズを1段引き、身体の動き方を明示的に名指しし、手は静止させるか単純な軌道に乗せます。テキストではなくきれいな画像から始めるのも人体構造を固定します。モデルが推測するのではなく、正しい身体を引き継ぐからです。
修正前: 「Close-up of a chef's hands quickly chopping vegetables and tossing them into a pan.」
修正後: 「Medium shot of a chef at a wooden counter. One steady chopping motion with the right hand, left hand resting flat on the board. Hands stay inside frame, no cuts. 50mm, soft window light from camera left.」
人物中心のカットでは、Veo 3.1とKlingがテイク全体を通して身体構造を保ちやすい傾向があります。人体構造が破綻の原因になっている場合は、どのモデルでも画像から動画がテキストから動画に勝ります。どうしてもクローズアップを維持したいなら、クリップを短くして、2つではなく1つの動きで妥協してください。
修正2:頼んだアクションを被写体が無視する
見えている症状: 画面構成もライティングも様式もプロンプトどおりなのに、被写体はただ立って呼吸しているだけ、あるいは指定したアクションの代わりに当たり障りのない待機動作をしている。
なぜ起きるのか: アクションが埋もれているからです。動詞が長い描写文の末尾にあったり、ほかの3つの動詞と競合していると、モデルはそれを静止したシーンの属性がもう1つ増えただけだと扱います。「関わっている」「楽しんでいる」「探索している」のような曖昧な動詞は視覚的な形をまったく持たないので、何も起きません。
直し方: 被写体とアクションを先頭に置き、具体的な物理的動詞を現在形で1つだけ使い、アクションの終着点を書きます。レンズ、色調、雰囲気といった様式の指定はすべてアクションのあとへ移し、主節ではなく装飾として読ませます。
修正前: 「A dramatic, moody, rain-soaked alley at night with neon reflections and steam, where a courier is exploring the area and interacting with her surroundings.」
修正後: 「A courier crouches and picks up a dropped envelope, then stands and looks left. Rain-soaked alley at night, neon reflections on wet asphalt, steam from a vent. Handheld medium shot.」
Seedanceはこの種の撮影指示に近い書き方によく応えます。PixVerse C1は、振り向き、手を伸ばす、商品を見せるといった制御された動きが1つだけの依頼のときに妥当な選択肢です。
修正3:カメラの動きが起きない、または被写体とぶつかる
見えている症状: ドリーインを頼んだのに固定画面が返ってきた。あるいはカメラは動くけれど被写体が背景に対して不自然に滑り、空間を移動する動きではなく歪んだ写真のように見える。
なぜ起きるのか: 原因は2つあり、見た目が似ています。動きに動機がなく効果としてしか書かれていない場合(「ズームイン」「シネマティックなカメラワーク」)か、矛盾する指示を積み重ねた場合です。被写体がカメラへ歩いてくるのに寄る、4秒のクリップにパンとティルトとクレーンを詰め込む、といった具合です。
直し方: 1クリップにカメラの動きは1つだけ。映像用語で名指しして、画面内で起きている何かに結びつけます。そのうえで矛盾を確認します。被写体がレンズへ向かうなら、カメラは寄るのではなく止まるか引くべきです。
修正前: 「Epic cinematic camera movement, zoom in and pan around the hero as he runs at the camera, dynamic angles.」
修正後: 「The hero runs toward camera down a corridor. The camera retreats ahead of him at a steady pace, holding him at medium framing. Low angle, wide lens, no other camera movement.」
KlingとSeedanceはどちらも明示的なカメラ指示をよく受け取ります。Grok Imagineは、正確な画面よりも感覚が大事な、緩くて勢いのある動きで試す価値があります。それでも動きが反映されないなら、機材名を挙げるのではなく、見る人の目に何が変化して映るのかを書いてください。「スカイラインが画面下から入ってくる」のように。
修正4:シーンがぶれる、途中で同一性が変わる
見えている症状: 被写体が最初は1人の人物で、最後にはその親戚のような別人になっている。赤い上着がワインレッドに変わり、背景の店構えが組み替わり、部屋に2つ目の窓が生える。
なぜ起きるのか: 生成の中に見た目を固定するものが何もないからです。テキストのプロンプトは個体ではなくカテゴリーを説明しているので、どのフレームも「赤い上着を着た若い女性」を少しずつ違う解釈で描き直す自由があります。長い尺と情報量の多い背景は、そのぶれを加速させます。
直し方: 画像で固定し、変わるものだけを説明します。参照画像や開始フレームをアップロードしたなら、プロンプトで見た目をもう一度全部説明するのは逆効果です。テキストが画像と競合します。背景は単純に保ち、長いアイデアは1つの長回しではなく短いカットに分けてください。
修正前: 「A young woman in a red jacket with brown hair walks through a busy market, 10 seconds, lots of detail, many people and stalls.」
修正後: 「Keep the referenced subject's face, hair, and red jacket unchanged. She walks forward past two stalls and stops to look right. Shallow depth of field so the market behind her stays soft. 5 seconds, single continuous shot.」
メモ
修正5:文字やロゴが崩れる
見えている症状: 「SHOPP」と読める看板、擬似的な文字に溶けていく商品ラベル、数フレームごとに変異するロゴ。
なぜ起きるのか: 動画モデルは文字を字形ではなく質感として生成し、動きがあればその質感がフレームごとに描き直されます。小さな文字、曲面や動く面の上の文字、遠近のついた面の文字が最悪の条件です。
直し方: 文字を書かせる仕事を動画モデルから外します。書体を安く詰められる画像モデルでフレームを作り、そのフレームを動かします。動画側のプロンプトでは、文字列を正確に引用し、短く保ち、文字が乗る面をできるだけ平らで安定させておきます。
修正前: 「A cafe storefront with a big detailed sign, menu boards, and lots of signage as the camera swoops past.」
修正後: 「Animate the provided frame. The sign reading 'DAYLIGHT' stays flat to camera and unchanged. Slow lateral drift to the right, sign fully in frame the whole time, no other text visible.」
OmniArtでは、その最初の工程をGPT Image 2やSeedream 5.0 Proといった画像モデルで進め、採用したフレームを同じワークスペース内の動画モデルへ送れます。クライアント向けのものなら、読める文字は既定で画像優先の仕事として扱ってください。
修正6:動きが速すぎる、揺れる、飛ぶ
見えている症状: 1.5倍速で再生されているようなクリップ、被写体がわずかに振動する、動きが滑らかにではなく目に見える段階で進む。
なぜ起きるのか: 強度を表す形容詞が速度として読まれるからです。「ダイナミック」「爆発的」「エネルギッシュ」「アクション満載」は、同じフレーム数の中により多くの変化を詰め込む方向にモデルを押します。もう1つのよくある原因は、短い時間に出来事を詰め込みすぎることです。4秒に3つの節目を入れると、どれにもフレームが残りません。
直し方: 強度を表す語を消して、代わりにテンポを指定します。1クリップに節目は1つ、カットのない連続した画面であることを明記し、アクションに本当に時間が必要なら、演技を速めるのではなく長い尺を指定してください。
修正前: 「Explosive dynamic action shot, skateboarder doing tricks, fast energetic motion, rapid cuts.」
修正後: 「A skateboarder rolls up a ramp and lifts into one slow ollie at the top. Steady, even pace, single continuous shot, no cuts. Camera tracks alongside at the same speed.」
揺れが構造的なものではなく細かい粒のようなものなら、同じモデル系列の上位の段を試してください。FastやMiniではなくStandardの段です。下位の段は速度とコストのために時間方向の安定性を犠牲にしています。
修正7:音声とリップシンクが合わない
見えている症状: 言葉より先に、あるいは遅れて口が動く、口が閉じているのにセリフが続く、モデルが勝手に足した音楽の下に話し声が埋もれる。
なぜ起きるのか: リップシンクには口が見えていることと、セリフがクリップに収まる短さであることが必要です。5秒のカットに長いセリフを入れると、モデルは口を早口にするか同期を捨てるかしかありません。「壮大なサウンドトラックとともに」のような環境の描写は、声と競合する音楽を招き入れます。
直し方: 話し手は1人、短いセリフを1つ引用符で囲み、口をはっきり画面に入れて遮らない、そして競合する音声の指示を書かない。聞かせたいものと同じくらい明確に、静かであるべきものを書いてください。
修正前: 「Two people talking about the product launch with an epic soundtrack and city ambience, close-up.」
修正後: 「Medium close-up of one woman facing camera, mouth fully visible. She says: 'We ship on Friday.' Then she pauses and smiles. Quiet room tone only, no music.」
Veo 3.1はセリフを含むネイティブ音声を生成し、PixVerse V6はOmniArtの無料プランで音声に対応します。使いたいモデルにネイティブの音がない場合は、クリップを無音で生成し、MiniMax Speech 2.8やElevenLabsのような音声モデルで声を別に作り、あとで編集で合わせるのが確実な道筋です。この方法なら、映像を作り直さずに読みだけを撮り直せます。
症状から修正への早見表
クリップがおかしな状態で返ってきたときの振り分け表として使ってください。ほかに手を付ける前に、1列目の項目を変えます。
| 症状 | まずここを変える | モデルの補足 |
|---|---|---|
| 顔や手が崩れる | 画面を引く、クリップを短くする、開始画像を使う | 人物の動きにはVeo 3.1、Kling |
| アクションが無視される | 動詞を先頭へ、具体的なアクションを1つ | Seedance、PixVerse C1 |
| カメラの動きが出ない | 名指しして動機のある動きを1つ、矛盾を消す | Kling、Seedance、Grok Imagine |
| シーンや同一性がぶれる | 参照画像を使い、変わるものだけ書く | PixVerse C1の参照、V6のマルチショット |
| 文字が崩れる | まず画像モデルでフレームを作る | GPT Image 2、Seedream 5.0 Pro、そのあと任意の動画モデル |
| 動きが速すぎる・揺れる | 強度の語を消す、テンポを書く、尺を長くする | FastやMiniよりStandardの段を優先 |
| リップシンクがずれる | 短い引用のセリフ1つ、口を画面に、音楽なし | Veo 3.1、PixVerse V6、または音声を別に足す |
OmniArtで始める
直近で失敗したクリップを1本選び、上の7つの症状に照らして診断してください。修正はちょうど1つだけ当てて、生成し直して見比べます。2回試せば、問題がプロンプトだったのかモデル選びだったのかは、たいてい分かります。OmniArtは画像・動画・音声のモデルを1つのワークスペースに置いているので、手強いカットは環境を組み直さずに手法を移動できます。画像モデルで固定する、2つ目の動画モデルで試し直す、あるいは声を別に足す、といった具合です。
作成ワークスペースを開き、直したプロンプトを貼り付けて、通用したテイクを残していってください。
制作を始めますか?
AIで魅力的なコンテンツを生成しましょう