7 correzioni al prompt quando il tuo video AI viene male
Diagnostica dei video AI sintomo per sintomo: sette correzioni al prompt per volti deformati, azioni ignorate, deriva di scena, testo illeggibile e labiale fuori sincrono.

La maggior parte delle clip AI venute male non è un problema del modello. È un prompt con un difetto specifico, e quel difetto lascia un'impronta: mani che si fondono, un soggetto che resta immobile, una camera che non si muove mai, una giacca che cambia colore a metà strada. Una volta che sai leggere l'impronta, ognuna delle correzioni qui sotto richiede una sola modifica.
Questo articolo è organizzato per sintomo e non per principio. Se vuoi le basi — soggetto, stile, luce, composizione — parti da come scrivere prompt migliori e torna qui quando una generazione specifica si comporta male. Tutto quello che segue presuppone che tu scriva già prompt ragionevoli e voglia sapere quale parola cambiare quando una clip fallisce.
Gli esempi usano i modelli disponibili nello spazio di lavoro video di OmniArt — Seedance, Veo 3.1, Kling, Grok Imagine, PixVerse V6 e C1 — perché parte del lavoro di diagnosi consiste nel riconoscere quando un sintomo si risolve meglio con un modello diverso che con più testo nel prompt.
Cambia una variabile alla volta
Prima delle singole correzioni, adotta l'abitudine che le rende tutte più rapide: cambia una cosa per generazione. Riscrivere tutto il prompt dopo una ripresa venuta male non ti insegna niente, perché non puoi sapere quale modifica ha aiutato.
Durata, risoluzione, formato e immagini di riferimento influenzano il risultato tanto quanto le parole, quindi annota le impostazioni insieme al testo del prompt. Due o tre passate ragionate battono quasi sempre dieci riscritture.
Suggerimento
Correzione 1: volti, mani e arti si deformano a metà clip
Cosa vedi: il primo fotogramma è pulito, poi le dita si fondono, un volto slitta via dal cranio o compare un braccio in più durante una rotazione.
Perché succede: il modello sta interpolando un corpo attraverso posizioni che il tuo prompt non ha mai descritto. Movimenti rapidi degli arti, inquadrature ravvicinate sulle mani, occlusioni (una mano che passa davanti a un volto) e durate lunghe moltiplicano tutti il numero di fotogrammi che il modello deve inventare.
La correzione: riduci ciò che va inventato. Allarga l'inquadratura di una misura, nomina in modo esplicito la meccanica del corpo e tieni le mani ferme oppure su una traiettoria semplice. Anche partire da un'immagine pulita invece che dal testo ancora l'anatomia, perché il modello eredita un corpo corretto invece di tirarlo a indovinare.
Prima: «Close-up of a chef's hands quickly chopping vegetables and tossing them into a pan.»
Dopo: «Medium shot of a chef at a wooden counter. One steady chopping motion with the right hand, left hand resting flat on the board. Hands stay inside frame, no cuts. 50mm, soft window light from camera left.»
Per le riprese incentrate sulle persone, Veo 3.1 e Kling tendono a tenere bene la struttura del corpo per tutta la durata, e la generazione da immagine a video su qualunque modello batte quella da testo a video quando è l'anatomia il punto di rottura. Se devi tenere il primo piano, accorcia la clip e accetta un movimento solo invece di due.
Correzione 2: il soggetto ignora l'azione che hai chiesto
Cosa vedi: inquadratura, luce e stile corrispondono al tuo prompt, ma il soggetto se ne sta lì a respirare, oppure esegue un movimento generico da fermo invece dell'azione che avevi specificato.
Perché succede: l'azione è sepolta. Se il verbo sta alla fine di una lunga frase descrittiva, o si contende lo spazio con altri tre verbi, il modello lo tratta come un attributo in più di una scena immobile. I verbi vaghi («interagire», «godersi», «esplorare») non hanno alcuna forma visiva, quindi non succede niente.
La correzione: metti soggetto e azione all'inizio, usa un solo verbo fisico e concreto al presente e descrivi il punto d'arrivo dell'azione. Sposta tutta la parte di stile — obiettivo, palette, atmosfera — dopo l'azione, così si legge come decorazione e non come proposizione principale.
Prima: «A dramatic, moody, rain-soaked alley at night with neon reflections and steam, where a courier is exploring the area and interacting with her surroundings.»
Dopo: «A courier crouches and picks up a dropped envelope, then stands and looks left. Rain-soaked alley at night, neon reflections on wet asphalt, steam from a vent. Handheld medium shot.»
Seedance risponde bene a questo modo di scrivere in stile lista di riprese, e PixVerse C1 è una scelta ragionevole quando il brief è un singolo movimento controllato: una rotazione, un braccio che si allunga, la presentazione di un prodotto.
Correzione 3: il movimento di camera non avviene, o combatte con il soggetto
Cosa vedi: hai chiesto una carrellata in avanti e hai ottenuto un'inquadratura bloccata. Oppure la camera si muove, ma il soggetto slitta in modo strano sullo sfondo e la ripresa sembra una foto deformata invece di uno spostamento nello spazio.
Perché succede: due cause, e si somigliano. O il movimento è dichiarato come un effetto senza motivazione («zoom in», «movimento di camera cinematografico»), oppure hai impilato istruzioni contraddittorie: una carrellata in avanti mentre il soggetto cammina verso la camera, una panoramica più un'inclinazione più una gru in una clip di quattro secondi.
La correzione: un solo movimento di camera per clip, nominato in linguaggio cinematografico, legato a qualcosa che accade nell'inquadratura. Poi controlla i conflitti: se il soggetto si muove verso l'obiettivo, la camera deve restare ferma o ritirarsi, non avanzare.
Prima: «Epic cinematic camera movement, zoom in and pan around the hero as he runs at the camera, dynamic angles.»
Dopo: «The hero runs toward camera down a corridor. The camera retreats ahead of him at a steady pace, holding him at medium framing. Low angle, wide lens, no other camera movement.»
Kling e Seedance accettano bene entrambi le indicazioni di camera esplicite, e Grok Imagine merita una prova per i movimenti più liberi ed energici, dove l'inquadratura esatta conta meno della sensazione. Se un movimento continua a non registrarsi, descrivi il cambiamento in ciò che vede lo spettatore — «lo skyline entra nell'inquadratura dal basso» — invece di nominare l'attrezzatura.
Correzione 4: la scena deriva o l'identità cambia a metà clip
Cosa vedi: il soggetto inizia come una persona e finisce come un suo cugino. Una giacca rossa diventa bordeaux, la vetrina di un negozio sullo sfondo si riorganizza, la stanza si fa crescere una seconda finestra.
Perché succede: nella generazione non c'è nulla che fissi l'aspetto. I prompt testuali descrivono una categoria, non un individuo, quindi ogni fotogramma è libero di reinterpretare «giovane donna con giacca rossa» in modo un po' diverso. Durate più lunghe e sfondi affollati accelerano la deriva.
La correzione: ancora con un'immagine, poi descrivi solo ciò che cambia. Quando carichi un riferimento o un fotogramma iniziale, ripetere l'aspetto completo nel prompt fa attivamente danno: il testo si mette in concorrenza con l'immagine. Tieni lo sfondo semplice e spezza le idee lunghe in diverse riprese brevi invece di un unico piano lungo.
Prima: «A young woman in a red jacket with brown hair walks through a busy market, 10 seconds, lots of detail, many people and stalls.»
Dopo: «Keep the referenced subject's face, hair, and red jacket unchanged. She walks forward past two stalls and stops to look right. Shallow depth of field so the market behind her stays soft. 5 seconds, single continuous shot.»
Nota
Correzione 5: testo e loghi vengono illeggibili
Cosa vedi: un'insegna che recita «SHOPP», l'etichetta di un prodotto che si dissolve in pseudo-lettere, un logo che muta ogni pochi fotogrammi.
Perché succede: i modelli video generano il testo come texture e non come glifi, e qualunque movimento ridisegna quella texture fotogramma per fotogramma. Caratteri piccoli, testo su superfici curve o in movimento e testo su un piano in prospettiva sono i casi peggiori.
La correzione: smetti di chiedere al modello video di comporre il testo. Genera il fotogramma con un modello di immagini, dove puoi iterare sulla tipografia a basso costo, poi anima quel fotogramma. Nel prompt video, cita la stringa esatta, tienila breve e mantieni la superficie con le lettere il più piatta e stabile possibile.
Prima: «A cafe storefront with a big detailed sign, menu boards, and lots of signage as the camera swoops past.»
Dopo: «Animate the provided frame. The sign reading 'DAYLIGHT' stays flat to camera and unchanged. Slow lateral drift to the right, sign fully in frame the whole time, no other text visible.»
Su OmniArt puoi fare quel primo passaggio con un modello di immagini come GPT Image 2 o Seedream 5.0 Pro, poi mandare il fotogramma approvato in un modello video dentro lo stesso spazio di lavoro. Per qualunque cosa destinata a un cliente, tratta il testo leggibile come un lavoro che parte dall'immagine, per impostazione predefinita.
Correzione 6: il movimento è troppo rapido, tremolante o a scatti
Cosa vedi: la clip va come se fosse a velocità 1,5x, oppure il soggetto vibra leggermente, oppure il movimento avanza a scatti visibili invece che in modo fluido.
Perché succede: gli aggettivi di intensità vengono letti come velocità. «Dinamico», «esplosivo», «energico» e «pieno d'azione» spingono il modello a stipare più cambiamento nello stesso numero di fotogrammi. L'altra causa comune è chiedere troppi eventi in troppo poco tempo: tre battute in quattro secondi non lasciano fotogrammi a nessuna di loro.
La correzione: cancella le parole di intensità e specifica invece il ritmo. Dai una battuta per clip, dichiara che la ripresa è continua e, se l'azione ha davvero bisogno di più tempo, chiedi una durata maggiore invece di un'esecuzione più veloce.
Prima: «Explosive dynamic action shot, skateboarder doing tricks, fast energetic motion, rapid cuts.»
Dopo: «A skateboarder rolls up a ramp and lifts into one slow ollie at the top. Steady, even pace, single continuous shot, no cuts. Camera tracks alongside at the same speed.»
Se il tremolio è fine e non strutturale, prova un livello superiore della stessa famiglia di modelli — un livello standard invece di uno fast o mini — perché i livelli più bassi scambiano stabilità temporale con velocità e costo.
Correzione 7: audio e sincronizzazione labiale non tornano
Cosa vedi: la bocca si muove prima o dopo le parole, il dialogo continua con le labbra chiuse, oppure il parlato finisce sepolto sotto una musica che il modello ha aggiunto da sé.
Perché succede: la sincronizzazione labiale richiede che la bocca sia visibile e che la battuta sia abbastanza corta per stare nella clip. Un dialogo lungo in una ripresa di cinque secondi costringe il modello o ad accelerare la bocca o a rinunciare al sincrono. Descrizioni d'ambiente come «con una colonna sonora epica» invitano un tappeto musicale che si mette in concorrenza con la voce.
La correzione: un solo parlante, una sola battuta breve tra virgolette, bocca inquadrata bene e senza ostacoli, e nessuna istruzione audio in concorrenza. Di' cosa deve stare in silenzio con la stessa precisione con cui dici cosa deve sentirsi.
Prima: «Two people talking about the product launch with an epic soundtrack and city ambience, close-up.»
Dopo: «Medium close-up of one woman facing camera, mouth fully visible. She says: 'We ship on Friday.' Then she pauses and smiles. Quiet room tone only, no music.»
Veo 3.1 genera audio nativo, dialogo compreso, e PixVerse V6 supporta l'audio sul piano gratuito di OmniArt. Quando il modello che ti serve non ha suono nativo, la strada affidabile è generare la clip muta e produrre la voce a parte con un modello di sintesi vocale come MiniMax Speech 2.8 o ElevenLabs, poi montarle insieme. Così ti restano anche i secondi ciak sulla lettura senza rigenerare l'immagine.
Riferimento rapido da sintomo a correzione
Usalo come tabella di triage quando una clip torna sbagliata. Cambia la voce della prima colonna prima di toccare qualunque altra cosa.
| Sintomo | Cambia prima questo | Nota sui modelli |
|---|---|---|
| Volti o mani deformati | Inquadratura più larga, clip più corta, fotogramma iniziale da immagine | Veo 3.1, Kling per il movimento umano |
| Azione ignorata | Sposta il verbo all'inizio, una sola azione concreta | Seedance, PixVerse C1 |
| Movimento di camera assente | Un solo movimento nominato e motivato; togli i conflitti | Kling, Seedance, Grok Imagine |
| Deriva di scena o di identità | Immagine di riferimento, descrivi solo ciò che cambia | Riferimento su PixVerse C1, più riprese su V6 |
| Testo illeggibile | Genera prima il fotogramma in un modello di immagini | GPT Image 2, Seedream 5.0 Pro, poi qualunque modello video |
| Movimento troppo rapido o tremolante | Cancella le parole di intensità, dichiara il ritmo, durata più lunga | Preferisci i livelli standard a quelli fast o mini |
| Labiale fuori sincrono | Una sola battuta breve tra virgolette, bocca in inquadratura, nessuna musica | Veo 3.1, PixVerse V6, oppure aggiungi la voce a parte |
Come iniziare su OmniArt
Prendi la tua ultima clip venuta male e diagnosticala rispetto ai sette sintomi qui sopra. Applica esattamente una correzione, rigenera e confronta: due passate ti dicono di solito se il problema era il prompt o la scelta del modello. Poiché OmniArt tiene i modelli di immagini, video e audio in un unico spazio di lavoro, una ripresa testarda può passare da un approccio all'altro senza rimettere in piedi la tua configurazione: ancorala con un modello di immagini, riprovala su un secondo modello video oppure aggiungi la traccia vocale a parte.
Apri lo spazio di lavoro di creazione, incolla il prompt corretto e tieni le riprese che reggono.
Pronto a creare?
Inizia a generare contenuti straordinari con l’AI