7 promptcorrecties voor AI-video als je clip misgaat
AI-video oplossen per symptoom, met zeven promptcorrecties voor vervormde gezichten, genegeerde acties, wegdrijvende scènes, onleesbare tekst, trillingen en missende lipsync.

De meeste mislukte AI-videoclips zijn geen modelprobleem. Het is een prompt met één specifiek gebrek, en dat gebrek laat een vingerafdruk achter: handen die smelten, een onderwerp dat stilstaat, een camera die nooit beweegt, een jas die halverwege van kleur verandert. Zodra je die vingerafdruk kunt lezen, kost elk van de correcties hieronder één aanpassing.
Dit artikel is geordend op symptoom in plaats van op principe. Wil je de basis — onderwerp, stijl, licht, compositie — begin dan bij betere prompts schrijven en kom hier terug wanneer een specifieke generatie zich misdraagt. Alles hieronder gaat ervan uit dat je al redelijke prompts schrijft en wilt weten welk woord je verandert als een clip faalt.
De voorbeelden gebruiken modellen uit de videowerkruimte van OmniArt — Seedance, Veo 3.1, Kling, Grok Imagine, PixVerse V6 en C1 — omdat een deel van debuggen bestaat uit herkennen wanneer een symptoom beter met een ander model dan met meer prompttekst is opgelost.
Debug één variabele per keer
Neem vóór de losse correcties de gewoonte aan die ze allemaal sneller maakt: verander één ding per generatie. Van het herschrijven van de hele prompt na een slechte take leer je niets, want je kunt niet zien welke aanpassing hielp.
Duur, resolutie, beeldverhouding en referentieafbeeldingen bepalen het resultaat net zo goed als de formulering, dus noteer je instellingen naast de prompttekst. Twee of drie bewuste rondes verslaan meestal tien herschrijvingen.
Tip
Correctie 1: gezichten, handen en ledematen vervormen halverwege
Wat je ziet: het eerste frame ziet er schoon uit, daarna versmelten vingers, glijdt een gezicht van de schedel of verschijnt er een extra arm tijdens een draai.
Waarom het gebeurt: het model interpoleert een lichaam door houdingen die je prompt nooit heeft beschreven. Snelle bewegingen van ledematen, een strak kader op handen, occlusie (een hand die voor een gezicht langs gaat) en een lange duur vermenigvuldigen allemaal het aantal frames dat het model moet verzinnen.
De correctie: verklein wat er verzonnen moet worden. Trek het kader één maat ruimer, benoem de lichaamsmechaniek expliciet en houd handen stil of op een eenvoudig pad. Beginnen vanaf een schone afbeelding in plaats van vanaf tekst verankert de anatomie ook, omdat het model een correct lichaam erft in plaats van er een te gokken.
Vóór: "Close-up of a chef's hands quickly chopping vegetables and tossing them into a pan."
Na: "Medium shot of a chef at a wooden counter. One steady chopping motion with the right hand, left hand resting flat on the board. Hands stay inside frame, no cuts. 50mm, soft window light from camera left."
Bij shots met mensen houden Veo 3.1 en Kling de lichaamsstructuur meestal goed vast over een hele take, en beeld-naar-video verslaat op elk model tekst-naar-video wanneer anatomie het zwakke punt is. Moet die close-up echt blijven, maak de clip dan korter en accepteer één beweging in plaats van twee.
Correctie 2: het onderwerp negeert de actie waar je om vroeg
Wat je ziet: kader, licht en stijl kloppen allemaal met je prompt, maar het onderwerp staat er ademend bij of doet een generieke stilstaande beweging in plaats van de actie die je opgaf.
Waarom het gebeurt: de actie ligt begraven. Staat het werkwoord aan het eind van een lange beschrijvende zin, of concurreert het met drie andere werkwoorden, dan behandelt het model het als nog een eigenschap van een stilstaande scène. Vage werkwoorden ("interacting", "enjoying", "exploring") hebben helemaal geen visuele vorm, dus gebeurt er niets.
De correctie: zet onderwerp en actie vooraan, gebruik één concreet fysiek werkwoord in de tegenwoordige tijd en beschrijf het eindpunt van de actie. Verplaats alle styling — lens, palet, sfeer — naar achter de actie, zodat het als versiering leest en niet als hoofdzin.
Vóór: "A dramatic, moody, rain-soaked alley at night with neon reflections and steam, where a courier is exploring the area and interacting with her surroundings."
Na: "A courier crouches and picks up a dropped envelope, then stands and looks left. Rain-soaked alley at night, neon reflections on wet asphalt, steam from a vent. Handheld medium shot."
Seedance reageert goed op dit soort shotlijst-achtige formulering, en PixVerse C1 is een redelijke keuze wanneer de briefing één gecontroleerde bewegingsbeat is, zoals een draai, een reikende arm of een productonthulling.
Correctie 3: de camerabeweging gebeurt niet, of vecht met het onderwerp
Wat je ziet: je vroeg om een dolly-in en kreeg een vast kader. Of de camera beweegt wel, maar het onderwerp schuift vreemd tegen de achtergrond, en het shot voelt als een vervormde foto in plaats van een beweging door de ruimte.
Waarom het gebeurt: twee oorzaken, en ze lijken op elkaar. Of de beweging staat er als effect zonder motivatie ("zoom in", "cinematic camera movement"), of je hebt tegenstrijdige instructies gestapeld — een push-in terwijl het onderwerp naar de camera loopt, een pan plus een tilt plus een crane in één clip van vier seconden.
De correctie: één camerabeweging per clip, benoemd in filmtaal en verbonden met iets dat in beeld gebeurt. Controleer daarna op conflict: beweegt het onderwerp naar de lens toe, dan houdt de camera stil of wijkt hij terug, en duwt hij niet mee.
Vóór: "Epic cinematic camera movement, zoom in and pan around the hero as he runs at the camera, dynamic angles."
Na: "The hero runs toward camera down a corridor. The camera retreats ahead of him at a steady pace, holding him at medium framing. Low angle, wide lens, no other camera movement."
Kling en Seedance nemen expliciete cameraregie allebei goed aan, en Grok Imagine is een ronde waard voor lossere, energieke bewegingen waarbij het exacte kader minder telt dan het gevoel. Weigert een beweging nog steeds door te komen, beschrijf dan de verandering in wat de kijker ziet — "the skyline enters frame from the bottom" — in plaats van de apparatuur te benoemen.
Correctie 4: de scène drijft weg of de identiteit verandert halverwege
Wat je ziet: het onderwerp begint als één persoon en eindigt als een neef van die persoon. Een rode jas wordt bordeaux, een winkelpui op de achtergrond herschikt zichzelf, de kamer krijgt er een tweede raam bij.
Waarom het gebeurt: niets in de generatie zet het uiterlijk vast. Tekstprompts beschrijven een categorie, geen individu, dus elk frame mag "young woman in a red jacket" net iets anders opvatten. Een langere duur en drukke achtergronden versnellen het wegdrijven.
De correctie: veranker met een afbeelding en beschrijf daarna alleen wat verandert. Wanneer je een referentie of startframe uploadt, werkt het herhalen van het volledige uiterlijk in de prompt averechts — de tekst concurreert met de afbeelding. Houd de achtergrond eenvoudig en knip lange ideeën op in meerdere korte shots in plaats van één lange take.
Vóór: "A young woman in a red jacket with brown hair walks through a busy market, 10 seconds, lots of detail, many people and stalls."
Na: "Keep the referenced subject's face, hair, and red jacket unchanged. She walks forward past two stalls and stops to look right. Shallow depth of field so the market behind her stays soft. 5 seconds, single continuous shot."
Let op
Correctie 5: tekst en logo’s komen onleesbaar terug
Wat je ziet: een bord waarop "SHOPP" staat, een productlabel dat oplost in pseudoletters, een logo dat om de paar frames muteert.
Waarom het gebeurt: videomodellen genereren tekst als textuur, niet als letters, en elke beweging rendert die textuur frame voor frame opnieuw. Kleine letters, tekst op gebogen of bewegende oppervlakken en tekst in een perspectiefvlak zijn de ergste gevallen.
De correctie: vraag het videomodel niet langer om de tekst te schrijven. Genereer het frame met een beeldmodel, waar je goedkoop op de typografie kunt itereren, en animeer dat frame daarna. Citeer in de videoprompt de exacte tekst, houd hem kort en houd het bedrukte oppervlak zo vlak en stabiel mogelijk.
Vóór: "A cafe storefront with a big detailed sign, menu boards, and lots of signage as the camera swoops past."
Na: "Animate the provided frame. The sign reading 'DAYLIGHT' stays flat to camera and unchanged. Slow lateral drift to the right, sign fully in frame the whole time, no other text visible."
Op OmniArt draai je die eerste stap met een beeldmodel als GPT Image 2 of Seedream 5.0 Pro, en stuur je het goedgekeurde frame daarna in dezelfde werkruimte naar een videomodel. Behandel leesbare tekst voor alles wat naar een klant gaat standaard als een klus die met beeld begint.
Correctie 6: de beweging is te snel, trillerig of schokkerig
Wat je ziet: de clip speelt alsof hij op 1,5× staat, of het onderwerp trilt licht, of de beweging schuift in zichtbare stapjes vooruit in plaats van vloeiend.
Waarom het gebeurt: bijvoeglijke naamwoorden over intensiteit worden als snelheid gelezen. "Dynamic", "explosive", "energetic" en "action-packed" duwen het model om meer verandering in hetzelfde aantal frames te proppen. De andere veelvoorkomende oorzaak is te veel gebeurtenis in te weinig tijd vragen — drie beats in vier seconden laat voor geen enkele beat frames over.
De correctie: schrap intensiteitswoorden en geef in plaats daarvan het tempo op. Eén beat per clip, vermeld dat het shot doorloopt, en heeft de actie echt meer tijd nodig, vraag dan om een langere duur in plaats van om een snellere uitvoering.
Vóór: "Explosive dynamic action shot, skateboarder doing tricks, fast energetic motion, rapid cuts."
Na: "A skateboarder rolls up a ramp and lifts into one slow ollie at the top. Steady, even pace, single continuous shot, no cuts. Camera tracks alongside at the same speed."
Is het trillen fijnkorrelig in plaats van structureel, probeer dan een zwaardere variant binnen dezelfde modelfamilie — een standaardvariant in plaats van een fast- of mini-variant — want de lichtere varianten ruilen stabiliteit in de tijd in voor snelheid en kosten.
Correctie 7: audio en lipsync lopen niet gelijk
Wat je ziet: de mond beweegt voor of na de woorden, de dialoog loopt door terwijl de lippen dicht zijn, of de spraak verdrinkt onder muziek die het model er zelf bij heeft gezet.
Waarom het gebeurt: lipsync vraagt een zichtbare mond en een zin die kort genoeg is voor de clip. Lange dialoog in een shot van vijf seconden dwingt het model om de mond te haasten of de sync los te laten. Sfeerbeschrijvingen als "with an epic soundtrack" nodigen een muziekbed uit dat met de stem concurreert.
De correctie: één spreker, één korte zin tussen aanhalingstekens, een mond die duidelijk en onbelemmerd in beeld staat, en geen concurrerende audio-instructies. Zeg net zo expliciet wat stil moet blijven als wat hoorbaar moet zijn.
Vóór: "Two people talking about the product launch with an epic soundtrack and city ambience, close-up."
Na: "Medium close-up of one woman facing camera, mouth fully visible. She says: 'We ship on Friday.' Then she pauses and smiles. Quiet room tone only, no music."
Veo 3.1 genereert native audio inclusief dialoog, en PixVerse V6 ondersteunt audio op het Free-plan van OmniArt. Heeft het model dat je wilt geen eigen geluid, dan is de betrouwbare route: genereer de clip stil, maak de stem apart met een spraakmodel als MiniMax Speech 2.8 of ElevenLabs, en monteer ze daarna samen. Zo kun je de inspreekbeurt ook overdoen zonder het beeld opnieuw te genereren.
Snelle verwijzing van symptoom naar correctie
Gebruik dit als triagetabel wanneer een clip verkeerd terugkomt. Verander wat in de eerste kolom staat voordat je aan iets anders komt.
| Symptoom | Verander dit eerst | Opmerking over modellen |
|---|---|---|
| Vervormde gezichten of handen | Ruimer kader, kortere clip, startframe uit een afbeelding | Veo 3.1, Kling voor menselijke beweging |
| Actie genegeerd | Zet het werkwoord vooraan, één concrete actie | Seedance, PixVerse C1 |
| Camerabeweging ontbreekt | Eén benoemde, gemotiveerde beweging; conflicten weghalen | Kling, Seedance, Grok Imagine |
| Scène of identiteit drijft weg | Referentieafbeelding, beschrijf alleen wat verandert | PixVerse C1 met referentie, V6 met multi-shot |
| Onleesbare tekst | Genereer het frame eerst in een beeldmodel | GPT Image 2, Seedream 5.0 Pro, daarna elk videomodel |
| Beweging te snel of trillerig | Schrap intensiteitswoorden, geef tempo op, langere duur | Kies standaardvarianten boven fast of mini |
| Lipsync klopt niet | Eén korte geciteerde zin, mond in beeld, geen muziek | Veo 3.1, PixVerse V6, of de spraak apart toevoegen |
Aan de slag op OmniArt
Pak je meest recente mislukte clip en diagnosticeer hem tegen de zeven symptomen hierboven. Pas precies één correctie toe, genereer opnieuw en vergelijk — twee rondes vertellen je meestal of het probleem de prompt was of de modelkeuze. Omdat OmniArt beeld-, video- en audiomodellen in één werkruimte houdt, kan een hardnekkig shot van aanpak wisselen zonder dat je je opzet opnieuw opbouwt: veranker het met een beeldmodel, probeer het op een tweede videomodel of voeg de stem apart toe.
Open de creatiewerkruimte, plak de gecorrigeerde prompt en houd de takes over die standhouden.
Klaar om te maken?
Ga aan de slag en genereer content met AI