tipsArticles et conseils13 min de lecture

Vidéo IA ratée : 7 correctifs de prompt à appliquer

Dépannage de vidéo IA par symptôme : sept correctifs de prompt pour les visages déformés, l'action ignorée, la dérive de scène, le texte illisible et le lip-sync raté.

Équipe OmniArt
Vidéo IA ratée : 7 correctifs de prompt à appliquer

La plupart des clips vidéo IA ratés ne relèvent pas d'un problème de modèle. Ce sont des prompts porteurs d'un défaut bien précis, et ce défaut laisse une empreinte : des mains qui fondent, un sujet qui ne bouge pas, une caméra qui reste figée, un blouson qui change de couleur en cours de route. Dès que vous savez lire l'empreinte, les correctifs de prompt vidéo IA ci-dessous ne demandent qu'une seule modification chacun.

Cet article est organisé par symptôme plutôt que par principe. Si vous cherchez les fondamentaux — sujet, style, lumière, composition — commencez par comment écrire de meilleurs prompts et revenez ici quand une génération précise se comporte mal. Tout ce qui suit suppose que vous écrivez déjà des prompts corrects et que vous voulez savoir quel mot changer quand un clip échoue.

Les exemples s'appuient sur des modèles disponibles dans l'espace de travail vidéo d'OmniArt — Seedance, Veo 3.1, Kling, Grok Imagine, PixVerse V6 et C1 — parce qu'une partie du débogage consiste à reconnaître le moment où un symptôme se règle mieux en changeant de modèle qu'en ajoutant du texte au prompt.

Déboguez une variable à la fois

Avant les correctifs individuels, adoptez l'habitude qui les rend tous plus rapides : ne changez qu'une seule chose par génération. Réécrire tout le prompt après une mauvaise prise ne vous apprend rien, puisque vous ne pouvez pas dire quelle modification a aidé.

La durée, la résolution, le format et les images de référence pèsent autant sur le résultat que la formulation : notez donc les réglages à côté du texte du prompt. Deux ou trois passes réfléchies valent généralement mieux que dix réécritures.

Astuce

Raccourcissez d'abord le clip. Une grande part des échecs de mouvement et d'anatomie disparaît quand vous demandez quatre secondes d'une seule action au lieu de huit secondes de trois actions.

Correctif 1 : les visages, les mains et les membres se déforment en cours de clip

Ce que vous voyez : la première image est nette, puis les doigts fusionnent, un visage glisse hors de son crâne, ou un bras supplémentaire apparaît pendant une rotation.

Pourquoi cela arrive : le modèle interpole un corps à travers des positions que votre prompt n'a jamais décrites. Un mouvement de membre rapide, un cadrage serré sur les mains, l'occlusion (une main qui passe devant un visage) et les longues durées multiplient tous le nombre d'images que le modèle doit inventer.

Le correctif : réduisez ce qui doit être inventé. Reculez le cadrage d'un cran, nommez explicitement la mécanique du corps, et gardez les mains immobiles ou sur une trajectoire simple. Partir d'une image propre plutôt que d'un texte ancre aussi l'anatomie, car le modèle hérite d'un corps correct au lieu de le deviner.

Avant : « Gros plan sur les mains d'un chef qui découpe rapidement des légumes et les jette dans une poêle. »

Après : « Plan moyen d'un chef à un comptoir en bois. Un seul geste de découpe régulier avec la main droite, la main gauche posée à plat sur la planche. Les mains restent dans le cadre, aucune coupe. 50 mm, lumière douce de fenêtre venant de la gauche caméra. »

Pour les plans centrés sur l'humain, Veo 3.1 et Kling tiennent plutôt bien la structure du corps sur une prise entière, et l'image vers vidéo, sur n'importe quel modèle, bat le texte vers vidéo quand l'anatomie est le point de rupture. Si vous devez conserver le gros plan, raccourcissez le clip et acceptez un seul mouvement au lieu de deux.

Correctif 2 : le sujet ignore l'action que vous avez demandée

Ce que vous voyez : le cadrage, la lumière et le style correspondent tous à votre prompt, mais le sujet reste planté là à respirer, ou exécute un mouvement d'attente générique au lieu de l'action que vous avez précisée.

Pourquoi cela arrive : l'action est enfouie. Si le verbe se trouve à la fin d'une longue phrase descriptive, ou s'il entre en concurrence avec trois autres verbes, le modèle le traite comme un attribut de plus d'une scène immobile. Les verbes vagues (« interagir », « profiter », « explorer ») n'ont aucune forme visuelle : il ne se passe donc rien.

Le correctif : placez le sujet et l'action en tête, employez un seul verbe physique concret au présent, et décrivez le point d'arrivée de l'action. Repoussez tout l'habillage — objectif, palette, ambiance — après l'action, pour qu'il se lise comme une décoration et non comme la proposition principale.

Avant : « Une ruelle dramatique et mélancolique détrempée par la pluie, la nuit, avec des reflets de néon et de la vapeur, où une coursière explore les lieux et interagit avec son environnement. »

Après : « Une coursière s'accroupit et ramasse une enveloppe tombée, puis se relève et regarde à gauche. Ruelle détrempée par la pluie la nuit, reflets de néon sur l'asphalte mouillé, vapeur sortant d'une grille d'aération. Plan moyen caméra à l'épaule. »

Seedance réagit bien à ce genre de formulation en liste de plans, et PixVerse C1 est un choix raisonnable quand le brief tient en un seul temps de mouvement contrôlé : une rotation, un geste vers un objet, ou la révélation d'un produit.

Correctif 3 : le mouvement de caméra n'a pas lieu, ou lutte contre le sujet

Ce que vous voyez : vous avez demandé un travelling avant et vous obtenez un cadre verrouillé. Ou la caméra bouge, mais le sujet glisse bizarrement sur le fond, et le plan ressemble à une photo déformée plutôt qu'à un déplacement dans l'espace.

Pourquoi cela arrive : deux causes, qui se ressemblent. Soit le mouvement est énoncé comme un effet sans motivation (« zoom avant », « mouvement de caméra cinématographique »), soit vous avez empilé des instructions contradictoires — un travelling avant pendant que le sujet marche vers la caméra, un panoramique plus une inclinaison plus une grue dans un même clip de quatre secondes.

Le correctif : un seul mouvement de caméra par clip, nommé dans le vocabulaire du cinéma, rattaché à quelque chose qui se produit dans le cadre. Vérifiez ensuite les conflits : si le sujet avance vers l'objectif, la caméra doit rester fixe ou reculer, pas avancer.

Avant : « Mouvement de caméra cinématographique épique, zoom avant et panoramique autour du héros qui court vers la caméra, angles dynamiques. »

Après : « Le héros court vers la caméra dans un couloir. La caméra recule devant lui à un rythme constant et le maintient en plan moyen. Contre-plongée, objectif grand angle, aucun autre mouvement de caméra. »

Kling et Seedance acceptent tous deux bien une direction de caméra explicite, et Grok Imagine mérite un essai pour les mouvements plus libres et énergiques, où le cadrage exact compte moins que la sensation. Si un mouvement refuse toujours de s'inscrire, décrivez le changement dans ce que voit le spectateur — « la ligne d'horizon entre dans le cadre par le bas » — plutôt que de nommer le matériel.

Correctif 4 : la scène dérive ou l'identité change en cours de clip

Ce que vous voyez : le sujet commence en une personne et finit en cousin de cette personne. Un blouson rouge devient bordeaux, une vitrine en arrière-plan se réorganise, la pièce se dote d'une deuxième fenêtre.

Pourquoi cela arrive : rien dans la génération ne fixe l'apparence. Les prompts textuels décrivent une catégorie, pas un individu : chaque image est donc libre de réinterpréter légèrement « jeune femme en blouson rouge ». Les durées plus longues et les arrière-plans chargés accélèrent la dérive.

Le correctif : ancrez avec une image, puis ne décrivez que ce qui change. Quand vous téléversez une référence ou une image de départ, répéter toute l'apparence dans le prompt nuit activement — le texte entre en concurrence avec l'image. Gardez l'arrière-plan simple, et découpez les idées longues en plusieurs plans courts plutôt qu'en une seule longue prise.

Avant : « Une jeune femme en blouson rouge aux cheveux bruns traverse un marché animé, 10 secondes, beaucoup de détails, de nombreuses personnes et de nombreux étals. »

Après : « Conserve le visage, les cheveux et le blouson rouge du sujet de référence sans changement. Elle avance devant deux étals et s'arrête pour regarder à droite. Faible profondeur de champ pour que le marché derrière elle reste flou. 5 secondes, un seul plan continu. »

Note

Les flux de références diffèrent d'un modèle à l'autre. PixVerse C1 prend en charge le mouvement guidé par référence et les transitions du début à la fin quand les deux compositions comptent, et PixVerse V6 gère les séquences multi-plans. Vérifiez dans le compositeur ce que le modèle sélectionné expose avant d'écrire un prompt qui en dépend.

Correctif 5 : le texte et les logos sortent illisibles

Ce que vous voyez : une enseigne où on lit « SHOPP », une étiquette produit qui se dissout en pseudo-lettres, un logo qui mute toutes les quelques images.

Pourquoi cela arrive : les modèles vidéo génèrent le texte comme une texture et non comme des glyphes, et tout mouvement recalcule cette texture image par image. Les petits corps de texte, le texte sur des surfaces courbes ou mobiles et le texte inscrit dans un plan en perspective sont les pires cas.

Le correctif : arrêtez de demander au modèle vidéo d'écrire le texte. Générez l'image avec un modèle d'image, où vous pouvez itérer à faible coût sur la typographie, puis animez cette image. Dans le prompt vidéo, citez la chaîne exacte, gardez-la courte, et maintenez la surface portant les lettres aussi plane et stable que possible.

Avant : « Une devanture de café avec une grande enseigne détaillée, des ardoises de menu et beaucoup de signalétique, tandis que la caméra passe en glissant. »

Après : « Anime l'image fournie. L'enseigne portant la mention "DAYLIGHT" reste plane face à la caméra et inchangée. Léger glissement latéral vers la droite, l'enseigne entièrement dans le cadre en permanence, aucun autre texte visible. »

Sur OmniArt, vous pouvez réaliser cette première étape avec un modèle d'image comme GPT Image 2 ou Seedream 5.0 Pro, puis envoyer l'image validée vers un modèle vidéo dans le même espace de travail. Pour tout ce qui est destiné à un client, traitez par défaut le texte lisible comme un travail qui commence par l'image.

Correctif 6 : le mouvement est trop rapide, saccadé ou heurté

Ce que vous voyez : le clip semble jouer en vitesse 1,5x, ou le sujet vibre légèrement, ou le mouvement avance par paliers visibles au lieu d'être fluide.

Pourquoi cela arrive : les adjectifs d'intensité sont lus comme de la vitesse. « Dynamique », « explosif », « énergique » et « bourré d'action » poussent le modèle à entasser plus de changement dans le même nombre d'images. L'autre cause fréquente consiste à demander trop d'événements en trop peu de temps : trois temps en quatre secondes ne laissent d'images à aucun d'entre eux.

Le correctif : supprimez les mots d'intensité et précisez plutôt le rythme. Donnez un seul temps par clip, indiquez que le plan est continu, et si l'action a réellement besoin de plus de temps, demandez une durée plus longue plutôt qu'une exécution plus rapide.

Avant : « Plan d'action explosif et dynamique, skateur qui enchaîne des figures, mouvement rapide et énergique, coupes rapides. »

Après : « Un skateur monte une rampe et se soulève en un seul ollie lent au sommet. Rythme régulier et constant, un seul plan continu, aucune coupe. La caméra l'accompagne latéralement à la même vitesse. »

Si la saccade est fine plutôt que structurelle, essayez un niveau supérieur de la même famille de modèles — un niveau standard au lieu d'un niveau fast ou mini — puisque les niveaux inférieurs échangent de la stabilité temporelle contre de la vitesse et du coût.

Correctif 7 : l'audio et le lip-sync ne collent pas

Ce que vous voyez : la bouche bouge avant ou après les mots, le dialogue continue alors que les lèvres sont fermées, ou la parole est noyée sous une musique que le modèle a ajoutée de lui-même.

Pourquoi cela arrive : le lip-sync exige que la bouche soit visible et que la réplique soit assez courte pour tenir dans le clip. Un long dialogue dans un plan de cinq secondes force le modèle soit à précipiter la bouche, soit à abandonner la synchronisation. Les descriptions d'ambiance du type « avec une bande-son épique » invitent un lit musical qui concurrence la voix.

Le correctif : un seul locuteur, une réplique courte entre guillemets, une bouche clairement cadrée et dégagée, et aucune instruction audio concurrente. Dites ce qui doit rester silencieux aussi explicitement que ce qui doit s'entendre.

Avant : « Deux personnes qui parlent du lancement du produit avec une bande-son épique et une ambiance urbaine, gros plan. »

Après : « Plan serré d'une femme face à la caméra, bouche entièrement visible. Elle dit : "On livre vendredi." Puis elle marque une pause et sourit. Uniquement le silence de la pièce, aucune musique. »

Veo 3.1 génère de l'audio natif, dialogues compris, et PixVerse V6 gère l'audio avec l'offre gratuite d'OmniArt. Quand le modèle que vous visez n'a pas de son natif, la voie fiable consiste à générer le clip muet et à produire la voix séparément avec un modèle de synthèse vocale comme MiniMax Speech 2.8 ou ElevenLabs, puis à monter les deux ensemble. Cela vous laisse aussi refaire la lecture sans régénérer l'image.

Table de correspondance symptôme / correctif

Servez-vous-en comme d'un tableau de triage quand un clip revient raté. Changez l'élément de la première colonne avant de toucher à quoi que ce soit d'autre.

SymptômeÀ changer en premierNote sur les modèles
Visages ou mains déformésCadrage plus large, clip plus court, image de départVeo 3.1, Kling pour le mouvement humain
Action ignoréeMettre le verbe en tête, une seule action concrèteSeedance, PixVerse C1
Mouvement de caméra absentUn seul mouvement nommé et motivé ; supprimer les conflitsKling, Seedance, Grok Imagine
Dérive de la scène ou de l'identitéImage de référence, ne décrire que ce qui changeRéférence PixVerse C1, multi-plans V6
Texte illisibleGénérer d'abord l'image dans un modèle d'imageGPT Image 2, Seedream 5.0 Pro, puis n'importe quel modèle vidéo
Mouvement trop rapide ou saccadéSupprimer les mots d'intensité, préciser le rythme, allonger la duréePréférer les niveaux standard aux niveaux fast ou mini
Lip-sync décaléUne réplique courte citée, bouche dans le cadre, pas de musiqueVeo 3.1, PixVerse V6, ou ajouter la voix séparément

Premiers pas sur OmniArt

Prenez votre clip raté le plus récent et diagnostiquez-le à l'aide des sept symptômes ci-dessus. Appliquez exactement un correctif, régénérez et comparez — deux passes suffisent généralement à savoir si le problème venait du prompt ou du choix de modèle. Comme OmniArt réunit les modèles image, vidéo et audio dans un seul espace de travail, un plan récalcitrant peut passer d'une approche à l'autre sans reconstruire votre installation : ancrez-le avec un modèle d'image, réessayez-le sur un deuxième modèle vidéo, ou ajoutez la piste voix séparément.

Ouvrez l'espace de travail de création, collez le prompt corrigé et gardez les prises qui tiennent.

Prêt à créer ?

Commencez à générer du contenu incroyable avec l’IA

Commencer gratuitement