7 arreglos de prompt para vídeo con IA cuando el clip sale mal
Diagnóstico de vídeo con IA por síntoma: siete arreglos de prompt para caras deformadas, acciones ignoradas, deriva de escena, texto ilegible y labios desincronizados.

Casi ningún clip de vídeo con IA fallido es un problema del modelo. Es un prompt con un defecto concreto, y el defecto deja huella: manos que se derriten, un sujeto que se queda quieto, una cámara que no se mueve nunca, una chaqueta que cambia de color a mitad de plano. Una vez que sabes leer la huella, los arreglos de prompt para vídeo con IA de abajo se resuelven con una sola edición cada uno.
Este artículo está organizado por síntoma y no por principio. Si buscas los fundamentos —sujeto, estilo, iluminación, composición—, empieza por cómo escribir mejores prompts y vuelve aquí cuando una generación concreta se porte mal. Todo lo de abajo da por supuesto que ya escribes prompts razonables y que lo que quieres saber es qué palabra cambiar cuando un clip falla.
Los ejemplos usan modelos disponibles en el espacio de trabajo de vídeo de OmniArt —Seedance, Veo 3.1, Kling, Grok Imagine, PixVerse V6 y C1— porque parte de depurar consiste en reconocer cuándo un síntoma se resuelve mejor con otro modelo que con más texto en el prompt.
Depura una variable a la vez
Antes de los arreglos concretos, adopta el hábito que hace que todos vayan más rápido: cambia una sola cosa por generación. Reescribir el prompt entero después de una mala toma no te enseña nada, porque no puedes saber qué edición ayudó.
La duración, la resolución, la relación de aspecto y las imágenes de referencia afectan al resultado tanto como la redacción, así que anota los ajustes junto al texto del prompt. Dos o tres pasadas deliberadas suelen ganar a diez reescrituras.
Consejo
Arreglo 1: caras, manos y extremidades se deforman a mitad de clip
Qué ves: el primer fotograma se ve limpio y después los dedos se fusionan, una cara se desliza fuera del cráneo o aparece un brazo de más durante un giro.
Por qué pasa: el modelo está interpolando un cuerpo a través de posiciones que tu prompt nunca describió. El movimiento rápido de extremidades, el encuadre cerrado sobre las manos, la oclusión (una mano que pasa por delante de una cara) y las duraciones largas multiplican todos el número de fotogramas que el modelo tiene que inventar.
El arreglo: reduce lo que hay que inventar. Abre el encuadre un tamaño, nombra la mecánica corporal de forma explícita y mantén las manos quietas o en una trayectoria simple. Partir de una imagen limpia en lugar de texto también ancla la anatomía, porque el modelo hereda un cuerpo correcto en vez de adivinarlo.
Antes: «Primer plano de las manos de un chef cortando verduras rápidamente y echándolas a una sartén.»
Después: «Plano medio de un chef en una encimera de madera. Un único movimiento firme de corte con la mano derecha, la mano izquierda apoyada en plano sobre la tabla. Las manos se mantienen dentro del encuadre, sin cortes. 50 mm, luz suave de ventana desde la izquierda de cámara.»
En planos centrados en personas, Veo 3.1 y Kling tienden a mantener bien la estructura corporal durante una toma completa, y la imagen a vídeo en cualquier modelo gana al texto a vídeo cuando el punto de fallo es la anatomía. Si tienes que conservar el primer plano, acorta el clip y acepta un movimiento en lugar de dos.
Arreglo 2: el sujeto ignora la acción que pediste
Qué ves: el encuadre, la iluminación y el estilo cuadran con tu prompt, pero el sujeto se queda ahí respirando o hace algún movimiento genérico de reposo en lugar de la acción que especificaste.
Por qué pasa: la acción está enterrada. Si el verbo va al final de una frase descriptiva larga, o compite con otros tres verbos, el modelo lo trata como un atributo más de una escena estática. Los verbos vagos («interactuar», «disfrutar», «explorar») no tienen ninguna forma visual, así que no pasa nada.
El arreglo: pon sujeto y acción al principio, usa un verbo físico concreto en presente y describe el punto final de la acción. Mueve todo el estilismo —óptica, paleta, atmósfera— detrás de la acción, para que se lea como decoración y no como la oración principal.
Antes: «Un callejón dramático, atmosférico y empapado de lluvia por la noche, con reflejos de neón y vapor, donde una mensajera está explorando la zona e interactuando con su entorno.»
Después: «Una mensajera se agacha y recoge un sobre caído, después se incorpora y mira a la izquierda. Callejón empapado de lluvia por la noche, reflejos de neón sobre el asfalto mojado, vapor saliendo de una rejilla. Plano medio a cámara en mano.»
Seedance responde bien a este tipo de redacción de guion técnico, y PixVerse C1 es una opción razonable cuando el brief es un único movimiento controlado, como un giro, un alcance o la revelación de un producto.
Arreglo 3: el movimiento de cámara no ocurre, o pelea con el sujeto
Qué ves: pediste un travelling de aproximación y te salió un encuadre fijo. O la cámara se mueve, pero el sujeto se desliza de forma extraña contra el fondo y el plano parece una foto deformada en lugar de un desplazamiento por el espacio.
Por qué pasa: hay dos causas, y se parecen. O el movimiento está enunciado como un efecto sin motivación («zoom in», «movimiento de cámara cinematográfico»), o has apilado instrucciones contradictorias: un avance mientras el sujeto camina hacia cámara, o una panorámica más una inclinación más una grúa en un clip de cuatro segundos.
El arreglo: un movimiento de cámara por clip, nombrado en lenguaje de cine y ligado a algo que pasa en el encuadre. Después busca conflictos: si el sujeto se mueve hacia el objetivo, la cámara debería mantenerse o retroceder, no avanzar.
Antes: «Movimiento de cámara épico y cinematográfico, zoom in y panorámica alrededor del héroe mientras corre hacia la cámara, ángulos dinámicos.»
Después: «El héroe corre hacia la cámara por un pasillo. La cámara retrocede delante de él a un ritmo constante, manteniéndolo en plano medio. Ángulo bajo, objetivo angular, ningún otro movimiento de cámara.»
Kling y Seedance aceptan bien las indicaciones explícitas de cámara, y a Grok Imagine merece la pena darle una pasada para movimientos más sueltos y energéticos, en los que el encuadre exacto importa menos que la sensación. Si un movimiento sigue negándose a registrarse, describe el cambio en lo que ve el espectador —«el horizonte urbano entra en el encuadre por abajo»— en lugar de nombrar el equipo.
Arreglo 4: la escena deriva o la identidad cambia a mitad de clip
Qué ves: el sujeto empieza siendo una persona y acaba siendo un primo suyo. Una chaqueta roja se vuelve burdeos, un escaparate del fondo se reorganiza, a la habitación le sale una segunda ventana.
Por qué pasa: no hay nada en la generación que fije la apariencia. Los prompts de texto describen una categoría, no un individuo, así que cada fotograma es libre de reinterpretar «mujer joven con chaqueta roja» de forma algo distinta. Las duraciones largas y los fondos cargados aceleran la deriva.
El arreglo: ancla con una imagen y describe solo lo que cambia. Cuando subes una referencia o un fotograma inicial, repetir la apariencia completa en el prompt es contraproducente: el texto compite con la imagen. Mantén el fondo sencillo y reparte las ideas largas en varios planos cortos en lugar de una sola toma larga.
Antes: «Una mujer joven con chaqueta roja y pelo castaño camina por un mercado concurrido, 10 segundos, mucho detalle, muchas personas y puestos.»
Después: «Mantén sin cambios la cara, el pelo y la chaqueta roja del sujeto de la referencia. Ella camina hacia delante pasando dos puestos y se detiene a mirar a la derecha. Profundidad de campo reducida para que el mercado detrás de ella quede suave. 5 segundos, un solo plano continuo.»
Nota
Arreglo 5: el texto y los logotipos salen ilegibles
Qué ves: un cartel que dice «SHOPP», una etiqueta de producto que se disuelve en pseudoletras, un logotipo que muta cada pocos fotogramas.
Por qué pasa: los modelos de vídeo generan el texto como textura, no como glifos, y cualquier movimiento vuelve a renderizar esa textura fotograma a fotograma. Los cuerpos pequeños, el texto sobre superficies curvas o en movimiento y el texto en un plano en perspectiva son los peores casos.
El arreglo: deja de pedirle al modelo de vídeo que escriba el texto. Genera el fotograma con un modelo de imagen, donde puedes iterar sobre la tipografía por poco dinero, y anima después ese fotograma. En el prompt de vídeo, cita la cadena exacta, mantenla corta y deja la superficie con letras lo más plana y estable posible.
Antes: «Un escaparate de cafetería con un cartel grande y detallado, pizarras de menú y mucha rotulación mientras la cámara pasa volando.»
Después: «Anima el fotograma proporcionado. El cartel que dice "DAYLIGHT" se mantiene plano a cámara y sin cambios. Deriva lateral lenta hacia la derecha, el cartel totalmente dentro del encuadre en todo momento, ningún otro texto visible.»
En OmniArt puedes hacer ese primer paso con un modelo de imagen como GPT Image 2 o Seedream 5.0 Pro y enviar después el fotograma aprobado a un modelo de vídeo en el mismo espacio de trabajo. Para cualquier cosa que vaya a ver un cliente, trata el texto legible como un trabajo que empieza por la imagen.
Arreglo 6: el movimiento va demasiado rápido, tiembla o va a saltos
Qué ves: el clip se reproduce como si fuera a 1,5x, o el sujeto vibra ligeramente, o el movimiento avanza en pasos visibles en lugar de con suavidad.
Por qué pasa: los adjetivos de intensidad se leen como velocidad. «Dinámico», «explosivo», «enérgico» y «lleno de acción» empujan al modelo a meter más cambio en el mismo número de fotogramas. La otra causa habitual es pedir demasiados sucesos en muy poco tiempo: tres tiempos en cuatro segundos no deja fotogramas para ninguno.
El arreglo: borra las palabras de intensidad y especifica el ritmo en su lugar. Un solo tiempo por clip, indica que el plano es continuo y, si la acción necesita de verdad más tiempo, pide una duración mayor en lugar de una interpretación más rápida.
Antes: «Plano de acción explosivo y dinámico, un skater haciendo trucos, movimiento rápido y enérgico, cortes veloces.»
Después: «Un skater sube por una rampa y se eleva en un único ollie lento en la parte alta. Ritmo constante y regular, un solo plano continuo, sin cortes. La cámara le acompaña en paralelo a la misma velocidad.»
Si el tembleque es de grano fino y no estructural, prueba un nivel superior de la misma familia de modelos —un nivel estándar en lugar de uno rápido o mini—, porque los niveles inferiores cambian estabilidad temporal por velocidad y precio.
Arreglo 7: el audio y la sincronización labial no cuadran
Qué ves: la boca se mueve antes o después de las palabras, el diálogo continúa con los labios cerrados o la voz queda enterrada bajo una música que el modelo añadió por su cuenta.
Por qué pasa: la sincronización labial necesita la boca visible y una frase lo bastante corta para caber en el clip. Un diálogo largo en un plano de cinco segundos obliga al modelo a acelerar la boca o a perder la sincronía. Las descripciones ambientales del tipo «con una banda sonora épica» invitan a una cama musical que compite con la voz.
El arreglo: un solo hablante, una frase corta entre comillas, la boca claramente encuadrada y sin obstrucciones, y ninguna instrucción de audio que compita. Di qué debe estar en silencio con la misma claridad con la que dices qué debe oírse.
Antes: «Dos personas hablando del lanzamiento del producto con una banda sonora épica y ambiente de ciudad, primer plano.»
Después: «Primer plano medio de una mujer de frente a cámara, boca totalmente visible. Dice: "Salimos el viernes". Después hace una pausa y sonríe. Solo el sonido ambiente de la sala, sin música.»
Veo 3.1 genera audio nativo, diálogo incluido, y PixVerse V6 admite audio en el plan Free de OmniArt. Cuando el modelo que quieres no tiene sonido nativo, la vía fiable es generar el clip en silencio y producir la voz por separado con un modelo de habla como MiniMax Speech 2.8 o ElevenLabs, y montarlos después. Eso además te da tomas nuevas de la locución sin regenerar la imagen.
Referencia rápida de síntoma a arreglo
Usa esto como tabla de triaje cuando un clip vuelva mal. Cambia lo de la primera columna antes de tocar cualquier otra cosa.
| Síntoma | Cambia esto primero | Nota de modelo |
|---|---|---|
| Caras o manos deformadas | Encuadre más abierto, clip más corto, fotograma inicial de imagen | Veo 3.1, Kling para movimiento humano |
| Acción ignorada | Mueve el verbo al principio, una sola acción concreta | Seedance, PixVerse C1 |
| Falta el movimiento de cámara | Un movimiento nombrado y motivado; elimina conflictos | Kling, Seedance, Grok Imagine |
| Deriva de escena o de identidad | Imagen de referencia, describe solo lo que cambia | Referencia de PixVerse C1, varios planos con V6 |
| Texto ilegible | Genera antes el fotograma en un modelo de imagen | GPT Image 2, Seedream 5.0 Pro, y después cualquier modelo de vídeo |
| Movimiento demasiado rápido o con tembleque | Borra las palabras de intensidad, indica el ritmo, más duración | Prefiere los niveles estándar a los rápidos o mini |
| Sincronía labial descuadrada | Una frase corta entre comillas, boca en el encuadre, sin música | Veo 3.1, PixVerse V6, o añade la voz por separado |
Empezar en OmniArt
Coge tu clip fallido más reciente y diagnostícalo contra los siete síntomas de arriba. Aplica exactamente un arreglo, regenera y compara: dos pasadas suelen bastar para saber si el problema era el prompt o la elección de modelo. Como OmniArt mantiene los modelos de imagen, vídeo y audio en un mismo espacio de trabajo, un plano que se resiste puede moverse entre enfoques sin rehacer tu montaje: áncralo con un modelo de imagen, reinténtalo en un segundo modelo de vídeo o añade la pista de voz por separado.
Abre el espacio de creación, pega el prompt corregido y quédate con las tomas que aguanten.
¿Listo para crear?
Empieza a generar contenido increíble con IA