TipsArtículos y consejos12 min de lectura

7 arreglos de prompt para video con IA cuando el clip sale mal

Diagnóstico de video con IA por síntoma, con siete arreglos de prompt para caras deformadas, acciones ignoradas, deriva de escena, texto ilegible, temblor y labios fuera de sincronía.

Equipo OmniArt
7 arreglos de prompt para video con IA cuando el clip sale mal

La mayoría de los clips de video con IA que fallan no tienen un problema de modelo. Son un prompt con un defecto muy concreto, y ese defecto deja una huella: manos que se derriten, un sujeto que se queda quieto, una cámara que nunca se mueve, una chaqueta que cambia de color a mitad de camino. Una vez que sabes leer la huella, cada uno de los arreglos de prompt de abajo toma una sola edición.

Este artículo está organizado por síntoma y no por principio. Si quieres los fundamentos —sujeto, estilo, iluminación, composición— empieza por cómo escribir mejores prompts y vuelve aquí cuando una generación específica se porte mal. Todo lo que sigue asume que ya escribes prompts razonables y quieres saber qué palabra cambiar cuando un clip falla.

Los ejemplos usan modelos disponibles en el espacio de video de OmniArt —Seedance, Veo 3.1, Kling, Grok Imagine, PixVerse V6 y C1— porque parte de depurar es reconocer cuándo un síntoma se resuelve mejor con otro modelo que con más texto en el prompt.

Depura una variable a la vez

Antes de los arreglos individuales, adopta el hábito que los hace todos más rápidos: cambia una sola cosa por generación. Reescribir el prompt entero después de una mala toma no te enseña nada, porque no puedes saber qué edición ayudó.

La duración, la resolución, la relación de aspecto y las imágenes de referencia afectan el resultado tanto como la redacción, así que registra los ajustes junto con el texto del prompt. Dos o tres pasadas deliberadas casi siempre le ganan a diez reescrituras.

Consejo

Acorta el clip primero. Buena parte de las fallas de movimiento y anatomía desaparecen cuando pides cuatro segundos de una acción en lugar de ocho segundos de tres acciones.

Arreglo 1: caras, manos y extremidades se deforman a mitad del clip

Lo que ves: el primer fotograma se ve limpio y luego los dedos se fusionan, una cara se desliza fuera del cráneo o aparece un brazo extra durante un giro.

Por qué pasa: el modelo está interpolando un cuerpo a través de posiciones que tu prompt nunca describió. El movimiento rápido de extremidades, el encuadre cerrado sobre las manos, la oclusión (una mano que pasa frente a una cara) y las duraciones largas multiplican la cantidad de fotogramas que el modelo tiene que inventar.

El arreglo: reduce lo que hay que inventar. Abre el encuadre un tamaño, nombra la mecánica corporal de forma explícita y mantén las manos quietas o en una trayectoria simple. Partir de una imagen limpia en lugar de texto también ancla la anatomía, porque el modelo hereda un cuerpo correcto en vez de adivinarlo.

Antes: "Close-up of a chef's hands quickly chopping vegetables and tossing them into a pan."

Después: "Medium shot of a chef at a wooden counter. One steady chopping motion with the right hand, left hand resting flat on the board. Hands stay inside frame, no cuts. 50mm, soft window light from camera left."

Para planos centrados en personas, Veo 3.1 y Kling suelen sostener bien la estructura corporal durante una toma completa, y la imagen a video en cualquier modelo le gana al texto a video cuando la anatomía es el punto de falla. Si tienes que conservar el primer plano, acorta el clip y acepta un movimiento en lugar de dos.

Arreglo 2: el sujeto ignora la acción que pediste

Lo que ves: el encuadre, la iluminación y el estilo coinciden con tu prompt, pero el sujeto se queda ahí parado respirando, o hace algún movimiento genérico de espera en lugar de la acción que especificaste.

Por qué pasa: la acción está enterrada. Si el verbo queda al final de una oración descriptiva larga, o compite con otros tres verbos, el modelo lo trata como un atributo más de una escena estática. Los verbos vagos ("interactuar", "disfrutar", "explorar") no tienen ninguna forma visual, así que no pasa nada.

El arreglo: pon el sujeto y la acción al principio, usa un verbo físico concreto en presente y describe el punto final de la acción. Mueve todo el estilo —lente, paleta, atmósfera— después de la acción, para que se lea como decoración y no como la oración principal.

Antes: "A dramatic, moody, rain-soaked alley at night with neon reflections and steam, where a courier is exploring the area and interacting with her surroundings."

Después: "A courier crouches and picks up a dropped envelope, then stands and looks left. Rain-soaked alley at night, neon reflections on wet asphalt, steam from a vent. Handheld medium shot."

Seedance responde bien a este tipo de redacción de lista de planos, y PixVerse C1 es una opción razonable cuando el brief es un solo beat de movimiento controlado, como un giro, un alcance o la revelación de un producto.

Arreglo 3: el movimiento de cámara no ocurre, o pelea con el sujeto

Lo que ves: pediste un dolly de acercamiento y obtuviste un cuadro fijo. O la cámara se mueve, pero el sujeto se desliza de forma rara contra el fondo, y el plano se siente como una foto deformada más que como un desplazamiento por el espacio.

Por qué pasa: hay dos causas y se parecen. O bien el movimiento está enunciado como un efecto sin motivación ("acercar", "movimiento de cámara cinematográfico"), o apilaste instrucciones contradictorias: un acercamiento mientras el sujeto camina hacia la cámara, un paneo más una inclinación más una grúa en un solo clip de cuatro segundos.

El arreglo: un movimiento de cámara por clip, nombrado en lenguaje de cine y atado a algo que pasa en cuadro. Después revisa si hay conflicto: si el sujeto avanza hacia el lente, la cámara debe sostenerse o retroceder, no empujar.

Antes: "Epic cinematic camera movement, zoom in and pan around the hero as he runs at the camera, dynamic angles."

Después: "The hero runs toward camera down a corridor. The camera retreats ahead of him at a steady pace, holding him at medium framing. Low angle, wide lens, no other camera movement."

Kling y Seedance aceptan bien la dirección de cámara explícita, y a Grok Imagine vale la pena darle una pasada para movimientos más sueltos y enérgicos, donde el encuadre exacto importa menos que la sensación. Si un movimiento sigue sin registrarse, describe el cambio en lo que ve el espectador —"la línea del horizonte entra en cuadro desde abajo"— en lugar de nombrar el equipo.

Arreglo 4: la escena se desvía o la identidad cambia a mitad del clip

Lo que ves: el sujeto empieza siendo una persona y termina siendo un primo de esa persona. Una chaqueta roja se vuelve borgoña, una tienda del fondo se reacomoda sola, la habitación gana una segunda ventana.

Por qué pasa: nada en la generación está fijando la apariencia. Los prompts de texto describen una categoría, no un individuo, así que cada fotograma es libre de reinterpretar "mujer joven con chaqueta roja" de forma un poco distinta. Las duraciones largas y los fondos cargados aceleran la deriva.

El arreglo: ancla con una imagen y luego describe solo lo que cambia. Cuando subes una referencia o un fotograma inicial, repetir la apariencia completa en el prompt te perjudica: el texto compite con la imagen. Mantén el fondo simple y divide las ideas largas en varios planos cortos en lugar de una sola toma larga.

Antes: "A young woman in a red jacket with brown hair walks through a busy market, 10 seconds, lots of detail, many people and stalls."

Después: "Keep the referenced subject's face, hair, and red jacket unchanged. She walks forward past two stalls and stops to look right. Shallow depth of field so the market behind her stays soft. 5 seconds, single continuous shot."

Nota

Los flujos de referencia varían según el modelo. PixVerse C1 admite movimiento guiado por referencia y transiciones de inicio a fin cuando ambas composiciones importan, y PixVerse V6 admite secuencias multi-shot. Revisa el compositor para ver qué expone el modelo seleccionado antes de escribir un prompt que dependa de ello.

Arreglo 5: el texto y los logos salen ilegibles

Lo que ves: un letrero que dice "SHOPP", una etiqueta de producto que se disuelve en pseudoletras, un logo que muta cada pocos fotogramas.

Por qué pasa: los modelos de video generan el texto como textura, no como glifos, y cualquier movimiento vuelve a renderizar esa textura fotograma por fotograma. La tipografía pequeña, el texto sobre superficies curvas o en movimiento y el texto en un plano en perspectiva son los peores casos.

El arreglo: deja de pedirle al modelo de video que redacte el texto. Genera el fotograma con un modelo de imagen, donde puedes iterar barato sobre la tipografía, y después anima ese fotograma. En el prompt de video, cita la cadena exacta, mantenla corta y deja la superficie con letras lo más plana y estable posible.

Antes: "A cafe storefront with a big detailed sign, menu boards, and lots of signage as the camera swoops past."

Después: "Animate the provided frame. The sign reading 'DAYLIGHT' stays flat to camera and unchanged. Slow lateral drift to the right, sign fully in frame the whole time, no other text visible."

En OmniArt puedes hacer ese primer paso con un modelo de imagen como GPT Image 2 o Seedream 5.0 Pro, y luego enviar el fotograma aprobado a un modelo de video en el mismo espacio. Para cualquier cosa que vea un cliente, trata el texto legible como un trabajo de imagen primero, por defecto.

Arreglo 6: el movimiento va muy rápido, tiembla o se entrecorta

Lo que ves: el clip se reproduce como si fuera a 1.5x, o el sujeto vibra un poco, o el movimiento avanza en pasos visibles en vez de fluir.

Por qué pasa: los adjetivos de intensidad se leen como velocidad. "Dinámico", "explosivo", "enérgico" y "lleno de acción" empujan al modelo a meter más cambio en la misma cantidad de fotogramas. La otra causa común es pedir demasiado evento en muy poco tiempo: tres beats en cuatro segundos no dejan fotogramas para ninguno.

El arreglo: borra las palabras de intensidad y especifica el ritmo. Da un beat por clip, indica que el plano es continuo y, si la acción de verdad necesita más tiempo, pide una duración mayor en lugar de una interpretación más rápida.

Antes: "Explosive dynamic action shot, skateboarder doing tricks, fast energetic motion, rapid cuts."

Después: "A skateboarder rolls up a ramp and lifts into one slow ollie at the top. Steady, even pace, single continuous shot, no cuts. Camera tracks alongside at the same speed."

Si el temblor es fino y no estructural, prueba un nivel más alto de la misma familia de modelos —un nivel estándar en vez de uno fast o mini— ya que los niveles bajos cambian estabilidad temporal por velocidad y costo.

Arreglo 7: el audio y la sincronización labial no coinciden

Lo que ves: la boca se mueve antes o después de las palabras, el diálogo sigue con los labios cerrados, o la voz queda enterrada bajo música que el modelo agregó por su cuenta.

Por qué pasa: la sincronización labial necesita la boca visible y una línea lo bastante corta para caber en el clip. Un diálogo largo en un plano de cinco segundos obliga al modelo a apurar la boca o a perder la sincronía. Las descripciones ambientales como "con una banda sonora épica" invitan a una cama musical que compite con la voz.

El arreglo: un solo hablante, una línea corta entre comillas, la boca bien encuadrada y sin obstrucciones, y ninguna instrucción de audio que compita. Di qué debe quedar en silencio con la misma claridad con la que dices qué debe oírse.

Antes: "Two people talking about the product launch with an epic soundtrack and city ambience, close-up."

Después: "Medium close-up of one woman facing camera, mouth fully visible. She says: 'We ship on Friday.' Then she pauses and smiles. Quiet room tone only, no music."

Veo 3.1 genera audio nativo, incluido el diálogo, y PixVerse V6 admite audio en el plan Free de OmniArt. Cuando el modelo que quieres no tiene sonido nativo, el camino confiable es generar el clip mudo y producir la voz aparte con un modelo de habla como MiniMax Speech 2.8 o ElevenLabs, y después montarlos juntos. Eso además te da repeticiones de la locución sin regenerar la imagen.

Referencia rápida de síntoma a arreglo

Usa esto como tabla de triaje cuando un clip vuelva mal. Cambia lo de la primera columna antes de tocar cualquier otra cosa.

SíntomaCambia esto primeroNota de modelo
Caras o manos deformadasEncuadre más abierto, clip más corto, fotograma inicial de imagenVeo 3.1, Kling para movimiento humano
Acción ignoradaMueve el verbo al frente, una acción concretaSeedance, PixVerse C1
Falta el movimiento de cámaraUn movimiento nombrado y motivado; quita los conflictosKling, Seedance, Grok Imagine
Deriva de escena o de identidadImagen de referencia, describe solo lo que cambiaReferencia de PixVerse C1, multi-shot de V6
Texto ilegibleGenera el fotograma primero en un modelo de imagenGPT Image 2, Seedream 5.0 Pro y luego cualquier modelo de video
Movimiento muy rápido o temblorosoBorra las palabras de intensidad, indica el ritmo, más duraciónPrefiere niveles estándar sobre fast o mini
Sincronización labial desfasadaUna línea corta entre comillas, boca en cuadro, sin músicaVeo 3.1, PixVerse V6, o agrega la voz aparte

Cómo empezar en OmniArt

Toma tu clip fallido más reciente y diagnostícalo contra los siete síntomas de arriba. Aplica exactamente un arreglo, vuelve a generar y compara: dos pasadas suelen decirte si el problema era el prompt o la elección de modelo. Como OmniArt mantiene los modelos de imagen, video y audio en un solo espacio, un plano terco puede moverse entre enfoques sin rehacer tu configuración: ánclalo con un modelo de imagen, reinténtalo en un segundo modelo de video o agrega la pista de voz por separado.

Abre el espacio de creación, pega el prompt corregido y quédate con las tomas que aguanten.

¿Todo listo para crear?

Empieza a generar contenido increíble con IA

Empezar gratis