7 correções de prompt quando seu vídeo com IA sai errado
Diagnóstico de vídeo com IA por sintoma: sete correções de prompt para rostos deformados, ação ignorada, deriva de cena, texto embaralhado, tremor e lip sync.

A maioria dos vídeos com IA que dão errado não é problema de modelo. É um prompt com um defeito específico, e o defeito deixa uma impressão digital: mãos que derretem, um sujeito que fica parado, uma câmera que nunca se move, uma jaqueta que muda de cor no meio do caminho. Uma vez que você aprende a ler a impressão digital, cada uma das correções de prompt abaixo custa uma única edição.
Este artigo está organizado por sintoma, não por princípio. Se você quer os fundamentos — sujeito, estilo, iluminação, composição —, comece por como escrever prompts melhores e volte para cá quando uma geração específica sair da linha. Tudo abaixo parte do princípio de que você já escreve prompts razoáveis e quer saber qual palavra mudar quando um clipe falha.
Os exemplos usam modelos disponíveis no espaço de trabalho de vídeo da OmniArt — Seedance, Veo 3.1, Kling, Grok Imagine, PixVerse V6 e C1 — porque parte da depuração é reconhecer quando um sintoma se resolve melhor com outro modelo do que com mais texto no prompt.
Depure uma variável por vez
Antes das correções individuais, adote o hábito que torna todas elas mais rápidas: mude uma coisa por geração. Reescrever o prompt inteiro depois de um resultado ruim não ensina nada, porque você não consegue saber qual edição ajudou.
Duração, resolução, proporção e imagens de referência afetam o resultado tanto quanto a redação, então registre as configurações junto com o texto do prompt. Duas ou três passadas deliberadas normalmente ganham de dez reescritas.
Dica
Correção 1: rostos, mãos e membros se deformam no meio do clipe
O que você vê: o primeiro quadro parece limpo, depois os dedos se fundem, um rosto escorrega do crânio ou um braço extra aparece durante uma virada.
Por que acontece: o modelo está interpolando um corpo por posições que seu prompt nunca descreveu. Movimento rápido de membros, enquadramento fechado nas mãos, oclusão (uma mão passando na frente de um rosto) e durações longas — tudo isso multiplica o número de quadros que o modelo precisa inventar.
A correção: reduza o que precisa ser inventado. Abra o enquadramento em um tamanho, nomeie a mecânica corporal de forma explícita e mantenha as mãos paradas ou num trajeto simples. Partir de uma imagem limpa em vez de texto também ancora a anatomia, porque o modelo herda um corpo correto em vez de adivinhar um.
Antes: "Close-up of a chef's hands quickly chopping vegetables and tossing them into a pan."
Depois: "Medium shot of a chef at a wooden counter. One steady chopping motion with the right hand, left hand resting flat on the board. Hands stay inside frame, no cuts. 50mm, soft window light from camera left."
Para cenas centradas em pessoas, o Veo 3.1 e o Kling tendem a sustentar bem a estrutura corporal ao longo de uma tomada inteira, e imagem para vídeo em qualquer modelo ganha de texto para vídeo quando a anatomia é o ponto de falha. Se você precisa manter o close, encurte o clipe e aceite um movimento em vez de dois.
Correção 2: o sujeito ignora a ação que você pediu
O que você vê: enquadramento, iluminação e estilo combinam com o prompt, mas o sujeito fica parado ali respirando, ou executa algum movimento genérico de espera em vez da ação que você especificou.
Por que acontece: a ação está soterrada. Se o verbo fica no fim de uma frase descritiva longa, ou disputa espaço com outros três verbos, o modelo o trata como mais um atributo de uma cena imóvel. Verbos vagos ("interagindo", "aproveitando", "explorando") não têm forma visual nenhuma, então nada acontece.
A correção: coloque sujeito e ação primeiro, use um verbo físico concreto no presente e descreva o ponto final da ação. Mova toda a estilização — lente, paleta, clima — para depois da ação, para que ela seja lida como decoração, e não como oração principal.
Antes: "A dramatic, moody, rain-soaked alley at night with neon reflections and steam, where a courier is exploring the area and interacting with her surroundings."
Depois: "A courier crouches and picks up a dropped envelope, then stands and looks left. Rain-soaked alley at night, neon reflections on wet asphalt, steam from a vent. Handheld medium shot."
O Seedance responde bem a esse tipo de redação em formato de decupagem, e o PixVerse C1 é uma escolha razoável quando o briefing é um único movimento controlado, como uma virada, um alcançar ou a revelação de um produto.
Correção 3: o movimento de câmera não acontece, ou briga com o sujeito
O que você vê: você pediu um avanço em travelling e recebeu um quadro travado. Ou a câmera se move, mas o sujeito desliza de forma estranha contra o fundo, e a cena parece uma foto distorcida em vez de um deslocamento pelo espaço.
Por que acontece: duas causas, e elas se parecem. Ou o movimento foi declarado como efeito sem nenhuma motivação ("dar zoom", "movimento de câmera cinematográfico"), ou você empilhou instruções contraditórias — um avanço enquanto o sujeito caminha em direção à câmera, uma panorâmica mais uma inclinação mais uma grua num clipe de quatro segundos.
A correção: um movimento de câmera por clipe, nomeado em linguagem de cinema e amarrado a algo que acontece no quadro. Depois procure conflito: se o sujeito se move em direção à lente, a câmera deve se manter ou recuar, não avançar.
Antes: "Epic cinematic camera movement, zoom in and pan around the hero as he runs at the camera, dynamic angles."
Depois: "The hero runs toward camera down a corridor. The camera retreats ahead of him at a steady pace, holding him at medium framing. Low angle, wide lens, no other camera movement."
O Kling e o Seedance aceitam bem direção explícita de câmera, e o Grok Imagine vale uma passada para movimentos mais soltos e energéticos, em que o enquadramento exato importa menos que a sensação. Se um movimento ainda se recusar a aparecer, descreva a mudança no que o espectador vê — "a linha do horizonte entra no quadro por baixo" — em vez de nomear o equipamento.
Correção 4: a cena deriva ou a identidade muda no meio do clipe
O que você vê: o sujeito começa como uma pessoa e termina como uma prima dessa pessoa. Uma jaqueta vermelha vira bordô, uma vitrine de fundo se reorganiza, a sala ganha uma segunda janela.
Por que acontece: nada na geração está fixando a aparência. Prompts de texto descrevem uma categoria, não um indivíduo, então cada quadro fica livre para reinterpretar "jovem de jaqueta vermelha" de um jeito ligeiramente diferente. Durações mais longas e fundos movimentados aceleram a deriva.
A correção: ancore com uma imagem e descreva apenas o que muda. Quando você envia uma referência ou um quadro inicial, repetir a aparência completa no prompt atrapalha de verdade — o texto compete com a imagem. Mantenha o fundo simples e divida ideias longas em várias cenas curtas em vez de uma tomada única e longa.
Antes: "A young woman in a red jacket with brown hair walks through a busy market, 10 seconds, lots of detail, many people and stalls."
Depois: "Keep the referenced subject's face, hair, and red jacket unchanged. She walks forward past two stalls and stops to look right. Shallow depth of field so the market behind her stays soft. 5 seconds, single continuous shot."
Nota
Correção 5: texto e logotipos saem embaralhados
O que você vê: uma placa que diz "SHOPP", um rótulo de produto que se dissolve em pseudoletras, um logotipo que muda de forma a cada poucos quadros.
Por que acontece: modelos de vídeo geram texto como textura, não como caracteres, e qualquer movimento renderiza essa textura de novo, quadro por quadro. Tipografia pequena, texto em superfícies curvas ou em movimento e texto num plano em perspectiva são os piores casos.
A correção: pare de pedir que o modelo de vídeo escreva o texto. Gere o quadro com um modelo de imagem, onde a iteração de tipografia é barata, e depois anime esse quadro. No prompt de vídeo, cite a cadeia de caracteres exata, mantenha-a curta e deixe a superfície com as letras o mais plana e estável possível.
Antes: "A cafe storefront with a big detailed sign, menu boards, and lots of signage as the camera swoops past."
Depois: "Animate the provided frame. The sign reading 'DAYLIGHT' stays flat to camera and unchanged. Slow lateral drift to the right, sign fully in frame the whole time, no other text visible."
Na OmniArt você pode rodar esse primeiro passo com um modelo de imagem como o GPT Image 2 ou o Seedream 5.0 Pro e depois enviar o quadro aprovado para um modelo de vídeo no mesmo espaço de trabalho. Para qualquer coisa que vá para o cliente, trate texto legível como um trabalho de imagem primeiro, por padrão.
Correção 6: o movimento está rápido demais, trêmulo ou aos saltos
O que você vê: o clipe roda como se estivesse em 1,5x, ou o sujeito vibra levemente, ou o movimento avança em passos visíveis em vez de fluir.
Por que acontece: adjetivos de intensidade são lidos como velocidade. "Dinâmico", "explosivo", "energético" e "cheio de ação" empurram o modelo a comprimir mais mudança no mesmo número de quadros. A outra causa comum é pedir evento demais em tempo de menos — três acontecimentos em quatro segundos não deixam quadros para nenhum deles.
A correção: apague as palavras de intensidade e especifique o ritmo em vez disso. Dê um acontecimento por clipe, declare que a tomada é contínua e, se a ação realmente precisar de mais tempo, peça uma duração maior em vez de uma execução mais rápida.
Antes: "Explosive dynamic action shot, skateboarder doing tricks, fast energetic motion, rapid cuts."
Depois: "A skateboarder rolls up a ramp and lifts into one slow ollie at the top. Steady, even pace, single continuous shot, no cuts. Camera tracks alongside at the same speed."
Se o tremor for fino em vez de estrutural, teste um nível mais alto da mesma família de modelos — um nível padrão em vez de um nível rápido ou mini —, já que os níveis mais baixos trocam estabilidade temporal por velocidade e custo.
Correção 7: áudio e lip sync não se encaixam
O que você vê: a boca se move antes ou depois das palavras, o diálogo continua com os lábios fechados, ou a fala fica soterrada sob uma música que o modelo acrescentou por conta própria.
Por que acontece: lip sync exige a boca visível e uma fala curta o suficiente para caber no clipe. Um diálogo longo numa cena de cinco segundos força o modelo a acelerar a boca ou a abandonar a sincronia. Descrições de ambientação como "com uma trilha épica" convidam uma cama musical que disputa espaço com a voz.
A correção: um único locutor, uma fala curta entre aspas, boca claramente enquadrada e desobstruída, e nenhuma instrução de áudio concorrente. Diga o que deve ficar em silêncio com a mesma clareza com que diz o que deve ser ouvido.
Antes: "Two people talking about the product launch with an epic soundtrack and city ambience, close-up."
Depois: "Medium close-up of one woman facing camera, mouth fully visible. She says: 'We ship on Friday.' Then she pauses and smiles. Quiet room tone only, no music."
O Veo 3.1 gera áudio nativo, incluindo diálogo, e o PixVerse V6 dá suporte a áudio no plano gratuito da OmniArt. Quando o modelo que você quer não tem som nativo, o caminho confiável é gerar o clipe em silêncio e produzir a voz separadamente com um modelo de fala como o MiniMax Speech 2.8 ou o ElevenLabs, e depois juntar os dois na edição. Isso também dá a você novas tomadas de locução sem regenerar a imagem.
Referência rápida de sintoma e correção
Use isto como tabela de triagem quando um clipe voltar errado. Mude o item da primeira coluna antes de tocar em qualquer outra coisa.
| Sintoma | Mude isto primeiro | Nota sobre modelos |
|---|---|---|
| Rostos ou mãos deformados | Enquadramento mais aberto, clipe mais curto, imagem como quadro inicial | Veo 3.1, Kling para movimento humano |
| Ação ignorada | Leve o verbo para o início, uma ação concreta | Seedance, PixVerse C1 |
| Movimento de câmera ausente | Um movimento nomeado e motivado; remova conflitos | Kling, Seedance, Grok Imagine |
| Deriva de cena ou de identidade | Imagem de referência, descreva só o que muda | Referência no PixVerse C1, várias cenas no V6 |
| Texto embaralhado | Gere o quadro primeiro num modelo de imagem | GPT Image 2, Seedream 5.0 Pro, depois qualquer modelo de vídeo |
| Movimento rápido demais ou trêmulo | Apague palavras de intensidade, declare o ritmo, duração maior | Prefira níveis padrão a níveis rápidos ou mini |
| Lip sync fora de sincronia | Uma fala curta entre aspas, boca no quadro, sem música | Veo 3.1, PixVerse V6, ou acrescente a fala separadamente |
Como começar na OmniArt
Pegue seu clipe malsucedido mais recente e diagnostique-o contra os sete sintomas acima. Aplique exatamente uma correção, gere de novo e compare — duas passadas normalmente já revelam se o problema era o prompt ou a escolha do modelo. Como a OmniArt mantém modelos de imagem, vídeo e áudio num só espaço de trabalho, uma cena difícil pode transitar entre abordagens sem que você reconstrua sua configuração: ancore-a com um modelo de imagem, tente de novo num segundo modelo de vídeo ou acrescente a faixa de voz separadamente.
Abra o espaço de trabalho de criação, cole o prompt corrigido e guarde as tomadas que se sustentam.
Pronto para criar?
Comece a gerar conteúdo incrível com IA