7 arreglos de prompt para vídeo con IA cuando el clip sale mal
Diagnóstico de vídeo con IA por síntoma: siete arreglos de prompt para caras deformadas, acciones ignoradas, deriva de escena, texto ilegible y labios desincronizados.

Casi ningún clip de vídeo con IA fallido es un problema del modelo. Es un prompt con un defecto concreto, y el defecto deja huella: manos que se derriten, un sujeto que se queda quieto, una cámara que no se mueve nunca, una chaqueta que cambia de color a mitad de plano. Una vez que sabes leer la huella, los arreglos de prompt para vídeo con IA de abajo se resuelven con una sola edición cada uno.
Este artículo está organizado por síntoma y no por principio. Si buscas los fundamentos —sujeto, estilo, iluminación, composición—, empieza por cómo escribir mejores prompts y vuelve aquí cuando una generación concreta se porte mal. Todo lo de abajo da por supuesto que ya escribes prompts razonables y que lo que quieres saber es qué palabra cambiar cuando un clip falla.
Los ejemplos usan modelos disponibles en el espacio de trabajo de vídeo de OmniArt —Seedance, Veo 3.1, Kling, Grok Imagine, PixVerse V6 y C1— porque parte de depurar consiste en reconocer cuándo un síntoma se resuelve mejor con otro modelo que con más texto en el prompt.
Depura una variable a la vez
Antes de los arreglos concretos, adopta el hábito que hace que todos vayan más rápido: cambia una sola cosa por generación. Reescribir el prompt entero después de una mala toma no te enseña nada, porque no puedes saber qué edición ayudó.
La duración, la resolución, la relación de aspecto y las imágenes de referencia afectan al resultado tanto como la redacción, así que anota los ajustes junto al texto del prompt. Dos o tres pasadas deliberadas suelen ganar a diez reescrituras.
Consejo
Arreglo 1: caras, manos y extremidades se deforman a mitad de clip
Qué ves: el primer fotograma se ve limpio y después los dedos se fusionan, una cara se desliza fuera del cráneo o aparece un brazo de más durante un giro.
Por qué pasa: el modelo está interpolando un cuerpo a través de posiciones que tu prompt nunca describió. El movimiento rápido de extremidades, el encuadre cerrado sobre las manos, la oclusión (una mano que pasa por delante de una cara) y las duraciones largas multiplican todos el número de fotogramas que el modelo tiene que inventar.
El arreglo: reduce lo que hay que inventar. Abre el encuadre un tamaño, nombra la mecánica corporal de forma explícita y mantén las manos quietas o en una trayectoria simple. Partir de una imagen limpia en lugar de texto también ancla la anatomía, porque el modelo hereda un cuerpo correcto en vez de adivinarlo.
Antes: «Close-up of a chef's hands quickly chopping vegetables and tossing them into a pan.»
Después: «Medium shot of a chef at a wooden counter. One steady chopping motion with the right hand, left hand resting flat on the board. Hands stay inside frame, no cuts. 50mm, soft window light from camera left.»
En planos centrados en personas, Veo 3.1 y Kling tienden a mantener bien la estructura corporal durante una toma completa, y la imagen a vídeo en cualquier modelo gana al texto a vídeo cuando el punto de fallo es la anatomía. Si tienes que conservar el primer plano, acorta el clip y acepta un movimiento en lugar de dos.
Arreglo 2: el sujeto ignora la acción que pediste
Qué ves: el encuadre, la iluminación y el estilo cuadran con tu prompt, pero el sujeto se queda ahí respirando o hace algún movimiento genérico de reposo en lugar de la acción que especificaste.
Por qué pasa: la acción está enterrada. Si el verbo va al final de una frase descriptiva larga, o compite con otros tres verbos, el modelo lo trata como un atributo más de una escena estática. Los verbos vagos («interactuar», «disfrutar», «explorar») no tienen ninguna forma visual, así que no pasa nada.
El arreglo: pon sujeto y acción al principio, usa un verbo físico concreto en presente y describe el punto final de la acción. Mueve todo el estilismo —óptica, paleta, atmósfera— detrás de la acción, para que se lea como decoración y no como la oración principal.
Antes: «A dramatic, moody, rain-soaked alley at night with neon reflections and steam, where a courier is exploring the area and interacting with her surroundings.»
Después: «A courier crouches and picks up a dropped envelope, then stands and looks left. Rain-soaked alley at night, neon reflections on wet asphalt, steam from a vent. Handheld medium shot.»
Seedance responde bien a este tipo de redacción de guion técnico, y PixVerse C1 es una opción razonable cuando el brief es un único movimiento controlado, como un giro, un alcance o la revelación de un producto.
Arreglo 3: el movimiento de cámara no ocurre, o pelea con el sujeto
Qué ves: pediste un travelling de aproximación y te salió un encuadre fijo. O la cámara se mueve, pero el sujeto se desliza de forma extraña contra el fondo y el plano parece una foto deformada en lugar de un desplazamiento por el espacio.
Por qué pasa: hay dos causas, y se parecen. O el movimiento está enunciado como un efecto sin motivación («zoom in», «movimiento de cámara cinematográfico»), o has apilado instrucciones contradictorias: un avance mientras el sujeto camina hacia cámara, o una panorámica más una inclinación más una grúa en un clip de cuatro segundos.
El arreglo: un movimiento de cámara por clip, nombrado en lenguaje de cine y ligado a algo que pasa en el encuadre. Después busca conflictos: si el sujeto se mueve hacia el objetivo, la cámara debería mantenerse o retroceder, no avanzar.
Antes: «Epic cinematic camera movement, zoom in and pan around the hero as he runs at the camera, dynamic angles.»
Después: «The hero runs toward camera down a corridor. The camera retreats ahead of him at a steady pace, holding him at medium framing. Low angle, wide lens, no other camera movement.»
Kling y Seedance aceptan bien las indicaciones explícitas de cámara, y a Grok Imagine merece la pena darle una pasada para movimientos más sueltos y energéticos, en los que el encuadre exacto importa menos que la sensación. Si un movimiento sigue negándose a registrarse, describe el cambio en lo que ve el espectador —«el horizonte urbano entra en el encuadre por abajo»— en lugar de nombrar el equipo.
Arreglo 4: la escena deriva o la identidad cambia a mitad de clip
Qué ves: el sujeto empieza siendo una persona y acaba siendo un primo suyo. Una chaqueta roja se vuelve burdeos, un escaparate del fondo se reorganiza, a la habitación le sale una segunda ventana.
Por qué pasa: no hay nada en la generación que fije la apariencia. Los prompts de texto describen una categoría, no un individuo, así que cada fotograma es libre de reinterpretar «mujer joven con chaqueta roja» de forma algo distinta. Las duraciones largas y los fondos cargados aceleran la deriva.
El arreglo: ancla con una imagen y describe solo lo que cambia. Cuando subes una referencia o un fotograma inicial, repetir la apariencia completa en el prompt es contraproducente: el texto compite con la imagen. Mantén el fondo sencillo y reparte las ideas largas en varios planos cortos en lugar de una sola toma larga.
Antes: «A young woman in a red jacket with brown hair walks through a busy market, 10 seconds, lots of detail, many people and stalls.»
Después: «Keep the referenced subject's face, hair, and red jacket unchanged. She walks forward past two stalls and stops to look right. Shallow depth of field so the market behind her stays soft. 5 seconds, single continuous shot.»
Nota
Arreglo 5: el texto y los logotipos salen ilegibles
Qué ves: un cartel que dice «SHOPP», una etiqueta de producto que se disuelve en pseudoletras, un logotipo que muta cada pocos fotogramas.
Por qué pasa: los modelos de vídeo generan el texto como textura, no como glifos, y cualquier movimiento vuelve a renderizar esa textura fotograma a fotograma. Los cuerpos pequeños, el texto sobre superficies curvas o en movimiento y el texto en un plano en perspectiva son los peores casos.
El arreglo: deja de pedirle al modelo de vídeo que escriba el texto. Genera el fotograma con un modelo de imagen, donde puedes iterar sobre la tipografía por poco dinero, y anima después ese fotograma. En el prompt de vídeo, cita la cadena exacta, mantenla corta y deja la superficie con letras lo más plana y estable posible.
Antes: «A cafe storefront with a big detailed sign, menu boards, and lots of signage as the camera swoops past.»
Después: «Animate the provided frame. The sign reading 'DAYLIGHT' stays flat to camera and unchanged. Slow lateral drift to the right, sign fully in frame the whole time, no other text visible.»
En OmniArt puedes hacer ese primer paso con un modelo de imagen como GPT Image 2 o Seedream 5.0 Pro y enviar después el fotograma aprobado a un modelo de vídeo en el mismo espacio de trabajo. Para cualquier cosa que vaya a ver un cliente, trata el texto legible como un trabajo que empieza por la imagen.
Arreglo 6: el movimiento va demasiado rápido, tiembla o va a saltos
Qué ves: el clip se reproduce como si fuera a 1,5x, o el sujeto vibra ligeramente, o el movimiento avanza en pasos visibles en lugar de con suavidad.
Por qué pasa: los adjetivos de intensidad se leen como velocidad. «Dinámico», «explosivo», «enérgico» y «lleno de acción» empujan al modelo a meter más cambio en el mismo número de fotogramas. La otra causa habitual es pedir demasiados sucesos en muy poco tiempo: tres tiempos en cuatro segundos no deja fotogramas para ninguno.
El arreglo: borra las palabras de intensidad y especifica el ritmo en su lugar. Un solo tiempo por clip, indica que el plano es continuo y, si la acción necesita de verdad más tiempo, pide una duración mayor en lugar de una interpretación más rápida.
Antes: «Explosive dynamic action shot, skateboarder doing tricks, fast energetic motion, rapid cuts.»
Después: «A skateboarder rolls up a ramp and lifts into one slow ollie at the top. Steady, even pace, single continuous shot, no cuts. Camera tracks alongside at the same speed.»
Si el tembleque es de grano fino y no estructural, prueba un nivel superior de la misma familia de modelos —un nivel estándar en lugar de uno rápido o mini—, porque los niveles inferiores cambian estabilidad temporal por velocidad y precio.
Arreglo 7: el audio y la sincronización labial no cuadran
Qué ves: la boca se mueve antes o después de las palabras, el diálogo continúa con los labios cerrados o la voz queda enterrada bajo una música que el modelo añadió por su cuenta.
Por qué pasa: la sincronización labial necesita la boca visible y una frase lo bastante corta para caber en el clip. Un diálogo largo en un plano de cinco segundos obliga al modelo a acelerar la boca o a perder la sincronía. Las descripciones ambientales del tipo «con una banda sonora épica» invitan a una cama musical que compite con la voz.
El arreglo: un solo hablante, una frase corta entre comillas, la boca claramente encuadrada y sin obstrucciones, y ninguna instrucción de audio que compita. Di qué debe estar en silencio con la misma claridad con la que dices qué debe oírse.
Antes: «Two people talking about the product launch with an epic soundtrack and city ambience, close-up.»
Después: «Medium close-up of one woman facing camera, mouth fully visible. She says: 'We ship on Friday.' Then she pauses and smiles. Quiet room tone only, no music.»
Veo 3.1 genera audio nativo, diálogo incluido, y PixVerse V6 admite audio en el plan Free de OmniArt. Cuando el modelo que quieres no tiene sonido nativo, la vía fiable es generar el clip en silencio y producir la voz por separado con un modelo de habla como MiniMax Speech 2.8 o ElevenLabs, y montarlos después. Eso además te da tomas nuevas de la locución sin regenerar la imagen.
Referencia rápida de síntoma a arreglo
Usa esto como tabla de triaje cuando un clip vuelva mal. Cambia lo de la primera columna antes de tocar cualquier otra cosa.
| Síntoma | Cambia esto primero | Nota de modelo |
|---|---|---|
| Caras o manos deformadas | Encuadre más abierto, clip más corto, fotograma inicial de imagen | Veo 3.1, Kling para movimiento humano |
| Acción ignorada | Mueve el verbo al principio, una sola acción concreta | Seedance, PixVerse C1 |
| Falta el movimiento de cámara | Un movimiento nombrado y motivado; elimina conflictos | Kling, Seedance, Grok Imagine |
| Deriva de escena o de identidad | Imagen de referencia, describe solo lo que cambia | Referencia de PixVerse C1, varios planos con V6 |
| Texto ilegible | Genera antes el fotograma en un modelo de imagen | GPT Image 2, Seedream 5.0 Pro, y después cualquier modelo de vídeo |
| Movimiento demasiado rápido o con tembleque | Borra las palabras de intensidad, indica el ritmo, más duración | Prefiere los niveles estándar a los rápidos o mini |
| Sincronía labial descuadrada | Una frase corta entre comillas, boca en el encuadre, sin música | Veo 3.1, PixVerse V6, o añade la voz por separado |
Empezar en OmniArt
Coge tu clip fallido más reciente y diagnostícalo contra los siete síntomas de arriba. Aplica exactamente un arreglo, regenera y compara: dos pasadas suelen bastar para saber si el problema era el prompt o la elección de modelo. Como OmniArt mantiene los modelos de imagen, vídeo y audio en un mismo espacio de trabajo, un plano que se resiste puede moverse entre enfoques sin rehacer tu montaje: áncralo con un modelo de imagen, reinténtalo en un segundo modelo de vídeo o añade la pista de voz por separado.
Abre el espacio de creación, pega el prompt corregido y quédate con las tomas que aguanten.
¿Listo para crear?
Empieza a generar contenido increíble con IA