7 correções de prompt quando seu vídeo com IA sai errado
Diagnóstico de vídeo com IA por sintoma: sete correções de prompt para rostos deformados, ação ignorada, deriva de cena, texto embaralhado, tremor e lip sync.

A maioria dos vídeos com IA que dão errado não é problema de modelo. É um prompt com um defeito específico, e o defeito deixa uma impressão digital: mãos que derretem, um sujeito que fica parado, uma câmera que nunca se move, uma jaqueta que muda de cor no meio do caminho. Uma vez que você aprende a ler a impressão digital, cada uma das correções de prompt abaixo custa uma única edição.
Este artigo está organizado por sintoma, não por princípio. Se você quer os fundamentos — sujeito, estilo, iluminação, composição —, comece por como escrever prompts melhores e volte para cá quando uma geração específica sair da linha. Tudo abaixo parte do princípio de que você já escreve prompts razoáveis e quer saber qual palavra mudar quando um clipe falha.
Os exemplos usam modelos disponíveis no espaço de trabalho de vídeo da OmniArt — Seedance, Veo 3.1, Kling, Grok Imagine, PixVerse V6 e C1 — porque parte da depuração é reconhecer quando um sintoma se resolve melhor com outro modelo do que com mais texto no prompt.
Depure uma variável por vez
Antes das correções individuais, adote o hábito que torna todas elas mais rápidas: mude uma coisa por geração. Reescrever o prompt inteiro depois de um resultado ruim não ensina nada, porque você não consegue saber qual edição ajudou.
Duração, resolução, proporção e imagens de referência afetam o resultado tanto quanto a redação, então registre as configurações junto com o texto do prompt. Duas ou três passadas deliberadas normalmente ganham de dez reescritas.
Dica
Correção 1: rostos, mãos e membros se deformam no meio do clipe
O que você vê: o primeiro quadro parece limpo, depois os dedos se fundem, um rosto escorrega do crânio ou um braço extra aparece durante uma virada.
Por que acontece: o modelo está interpolando um corpo por posições que seu prompt nunca descreveu. Movimento rápido de membros, enquadramento fechado nas mãos, oclusão (uma mão passando na frente de um rosto) e durações longas — tudo isso multiplica o número de quadros que o modelo precisa inventar.
A correção: reduza o que precisa ser inventado. Abra o enquadramento em um tamanho, nomeie a mecânica corporal de forma explícita e mantenha as mãos paradas ou num trajeto simples. Partir de uma imagem limpa em vez de texto também ancora a anatomia, porque o modelo herda um corpo correto em vez de adivinhar um.
Antes: "Close das mãos de um chef picando legumes rapidamente e jogando tudo numa panela."
Depois: "Plano médio de um chef numa bancada de madeira. Um movimento firme de corte com a mão direita, mão esquerda apoiada plana sobre a tábua. As mãos permanecem dentro do quadro, sem cortes. 50 mm, luz difusa de janela à esquerda da câmera."
Para cenas centradas em pessoas, o Veo 3.1 e o Kling tendem a sustentar bem a estrutura corporal ao longo de uma tomada inteira, e imagem para vídeo em qualquer modelo ganha de texto para vídeo quando a anatomia é o ponto de falha. Se você precisa manter o close, encurte o clipe e aceite um movimento em vez de dois.
Correção 2: o sujeito ignora a ação que você pediu
O que você vê: enquadramento, iluminação e estilo combinam com o prompt, mas o sujeito fica parado ali respirando, ou executa algum movimento genérico de espera em vez da ação que você especificou.
Por que acontece: a ação está soterrada. Se o verbo fica no fim de uma frase descritiva longa, ou disputa espaço com outros três verbos, o modelo o trata como mais um atributo de uma cena imóvel. Verbos vagos ("interagindo", "aproveitando", "explorando") não têm forma visual nenhuma, então nada acontece.
A correção: coloque sujeito e ação primeiro, use um verbo físico concreto no presente e descreva o ponto final da ação. Mova toda a estilização — lente, paleta, clima — para depois da ação, para que ela seja lida como decoração, e não como oração principal.
Antes: "Um beco dramático, sombrio e encharcado de chuva à noite, com reflexos de neon e vapor, onde uma entregadora está explorando o local e interagindo com o ambiente."
Depois: "Uma entregadora se agacha e pega um envelope caído, depois se levanta e olha para a esquerda. Beco encharcado de chuva à noite, reflexos de neon no asfalto molhado, vapor saindo de uma grade. Plano médio com câmera na mão."
O Seedance responde bem a esse tipo de redação em formato de decupagem, e o PixVerse C1 é uma escolha razoável quando o briefing é um único movimento controlado, como uma virada, um alcançar ou a revelação de um produto.
Correção 3: o movimento de câmera não acontece, ou briga com o sujeito
O que você vê: você pediu um avanço em travelling e recebeu um quadro travado. Ou a câmera se move, mas o sujeito desliza de forma estranha contra o fundo, e a cena parece uma foto distorcida em vez de um deslocamento pelo espaço.
Por que acontece: duas causas, e elas se parecem. Ou o movimento foi declarado como efeito sem nenhuma motivação ("dar zoom", "movimento de câmera cinematográfico"), ou você empilhou instruções contraditórias — um avanço enquanto o sujeito caminha em direção à câmera, uma panorâmica mais uma inclinação mais uma grua num clipe de quatro segundos.
A correção: um movimento de câmera por clipe, nomeado em linguagem de cinema e amarrado a algo que acontece no quadro. Depois procure conflito: se o sujeito se move em direção à lente, a câmera deve se manter ou recuar, não avançar.
Antes: "Movimento de câmera épico e cinematográfico, dar zoom e girar em volta do herói enquanto ele corre na direção da câmera, ângulos dinâmicos."
Depois: "O herói corre em direção à câmera por um corredor. A câmera recua à frente dele em ritmo constante, mantendo-o em plano médio. Ângulo baixo, lente grande angular, nenhum outro movimento de câmera."
O Kling e o Seedance aceitam bem direção explícita de câmera, e o Grok Imagine vale uma passada para movimentos mais soltos e energéticos, em que o enquadramento exato importa menos que a sensação. Se um movimento ainda se recusar a aparecer, descreva a mudança no que o espectador vê — "a linha do horizonte entra no quadro por baixo" — em vez de nomear o equipamento.
Correção 4: a cena deriva ou a identidade muda no meio do clipe
O que você vê: o sujeito começa como uma pessoa e termina como uma prima dessa pessoa. Uma jaqueta vermelha vira bordô, uma vitrine de fundo se reorganiza, a sala ganha uma segunda janela.
Por que acontece: nada na geração está fixando a aparência. Prompts de texto descrevem uma categoria, não um indivíduo, então cada quadro fica livre para reinterpretar "jovem de jaqueta vermelha" de um jeito ligeiramente diferente. Durações mais longas e fundos movimentados aceleram a deriva.
A correção: ancore com uma imagem e descreva apenas o que muda. Quando você envia uma referência ou um quadro inicial, repetir a aparência completa no prompt atrapalha de verdade — o texto compete com a imagem. Mantenha o fundo simples e divida ideias longas em várias cenas curtas em vez de uma tomada única e longa.
Antes: "Uma jovem de jaqueta vermelha e cabelo castanho atravessa uma feira movimentada, 10 segundos, muitos detalhes, muitas pessoas e barracas."
Depois: "Mantenha o rosto, o cabelo e a jaqueta vermelha do sujeito de referência inalterados. Ela caminha para frente passando por duas barracas, depois para e olha para a direita. Profundidade de campo rasa, para que a feira atrás dela fique suave. 5 segundos, uma única tomada contínua."
Nota
Correção 5: texto e logotipos saem embaralhados
O que você vê: uma placa que diz "SHOPP", um rótulo de produto que se dissolve em pseudoletras, um logotipo que muda de forma a cada poucos quadros.
Por que acontece: modelos de vídeo geram texto como textura, não como caracteres, e qualquer movimento renderiza essa textura de novo, quadro por quadro. Tipografia pequena, texto em superfícies curvas ou em movimento e texto num plano em perspectiva são os piores casos.
A correção: pare de pedir que o modelo de vídeo escreva o texto. Gere o quadro com um modelo de imagem, onde a iteração de tipografia é barata, e depois anime esse quadro. No prompt de vídeo, cite a cadeia de caracteres exata, mantenha-a curta e deixe a superfície com as letras o mais plana e estável possível.
Antes: "Fachada de um café com uma placa grande e detalhada, quadros de menu e muita sinalização enquanto a câmera passa voando."
Depois: "Anime o quadro fornecido. A placa que diz 'DAYLIGHT' permanece plana em relação à câmera e inalterada. Deriva lateral lenta para a direita, placa totalmente dentro do quadro o tempo todo, nenhum outro texto visível."
Na OmniArt você pode rodar esse primeiro passo com um modelo de imagem como o GPT Image 2 ou o Seedream 5.0 Pro e depois enviar o quadro aprovado para um modelo de vídeo no mesmo espaço de trabalho. Para qualquer coisa que vá para o cliente, trate texto legível como um trabalho de imagem primeiro, por padrão.
Correção 6: o movimento está rápido demais, trêmulo ou aos saltos
O que você vê: o clipe roda como se estivesse em 1,5x, ou o sujeito vibra levemente, ou o movimento avança em passos visíveis em vez de fluir.
Por que acontece: adjetivos de intensidade são lidos como velocidade. "Dinâmico", "explosivo", "energético" e "cheio de ação" empurram o modelo a comprimir mais mudança no mesmo número de quadros. A outra causa comum é pedir evento demais em tempo de menos — três acontecimentos em quatro segundos não deixam quadros para nenhum deles.
A correção: apague as palavras de intensidade e especifique o ritmo em vez disso. Dê um acontecimento por clipe, declare que a tomada é contínua e, se a ação realmente precisar de mais tempo, peça uma duração maior em vez de uma execução mais rápida.
Antes: "Cena de ação explosiva e dinâmica, skatista fazendo manobras, movimento rápido e energético, cortes velozes."
Depois: "Um skatista sobe uma rampa e sai do chão num único ollie lento no topo. Ritmo firme e regular, uma única tomada contínua, sem cortes. A câmera acompanha ao lado na mesma velocidade."
Se o tremor for fino em vez de estrutural, teste um nível mais alto da mesma família de modelos — um nível padrão em vez de um nível rápido ou mini —, já que os níveis mais baixos trocam estabilidade temporal por velocidade e custo.
Correção 7: áudio e lip sync não se encaixam
O que você vê: a boca se move antes ou depois das palavras, o diálogo continua com os lábios fechados, ou a fala fica soterrada sob uma música que o modelo acrescentou por conta própria.
Por que acontece: lip sync exige a boca visível e uma fala curta o suficiente para caber no clipe. Um diálogo longo numa cena de cinco segundos força o modelo a acelerar a boca ou a abandonar a sincronia. Descrições de ambientação como "com uma trilha épica" convidam uma cama musical que disputa espaço com a voz.
A correção: um único locutor, uma fala curta entre aspas, boca claramente enquadrada e desobstruída, e nenhuma instrução de áudio concorrente. Diga o que deve ficar em silêncio com a mesma clareza com que diz o que deve ser ouvido.
Antes: "Duas pessoas conversando sobre o lançamento do produto com uma trilha épica e som ambiente de cidade, close."
Depois: "Close médio de uma mulher de frente para a câmera, boca totalmente visível. Ela diz: 'A gente lança na sexta.' Depois faz uma pausa e sorri. Apenas o som natural da sala, sem música."
O Veo 3.1 gera áudio nativo, incluindo diálogo, e o PixVerse V6 dá suporte a áudio no plano gratuito da OmniArt. Quando o modelo que você quer não tem som nativo, o caminho confiável é gerar o clipe em silêncio e produzir a voz separadamente com um modelo de fala como o MiniMax Speech 2.8 ou o ElevenLabs, e depois juntar os dois na edição. Isso também dá a você novas tomadas de locução sem regenerar a imagem.
Referência rápida de sintoma e correção
Use isto como tabela de triagem quando um clipe voltar errado. Mude o item da primeira coluna antes de tocar em qualquer outra coisa.
| Sintoma | Mude isto primeiro | Nota sobre modelos |
|---|---|---|
| Rostos ou mãos deformados | Enquadramento mais aberto, clipe mais curto, imagem como quadro inicial | Veo 3.1, Kling para movimento humano |
| Ação ignorada | Leve o verbo para o início, uma ação concreta | Seedance, PixVerse C1 |
| Movimento de câmera ausente | Um movimento nomeado e motivado; remova conflitos | Kling, Seedance, Grok Imagine |
| Deriva de cena ou de identidade | Imagem de referência, descreva só o que muda | Referência no PixVerse C1, várias cenas no V6 |
| Texto embaralhado | Gere o quadro primeiro num modelo de imagem | GPT Image 2, Seedream 5.0 Pro, depois qualquer modelo de vídeo |
| Movimento rápido demais ou trêmulo | Apague palavras de intensidade, declare o ritmo, duração maior | Prefira níveis padrão a níveis rápidos ou mini |
| Lip sync fora de sincronia | Uma fala curta entre aspas, boca no quadro, sem música | Veo 3.1, PixVerse V6, ou acrescente a fala separadamente |
Como começar na OmniArt
Pegue seu clipe malsucedido mais recente e diagnostique-o contra os sete sintomas acima. Aplique exatamente uma correção, gere de novo e compare — duas passadas normalmente já revelam se o problema era o prompt ou a escolha do modelo. Como a OmniArt mantém modelos de imagem, vídeo e áudio num só espaço de trabalho, uma cena difícil pode transitar entre abordagens sem que você reconstrua sua configuração: ancore-a com um modelo de imagem, tente de novo num segundo modelo de vídeo ou acrescente a faixa de voz separadamente.
Abra o espaço de trabalho de criação, cole o prompt corrigido e guarde as tomadas que se sustentam.
Pronto para criar?
Comece a gerar conteúdo incrível com IA