GuideTutoriales y guías18 min de lectura

Guía de prompts de MiniMax H3: controla cada referencia

Aprende a escribir prompts para MiniMax H3 con referencias de imagen, video, audio y texto. Asigna un rol a cada archivo, evita conflictos y dirige un plano con tiempos.

Equipo OmniArt
Guía de prompts de MiniMax H3: controla cada referencia

La idea útil detrás de un prompt para MiniMax H3 no es “escribe más detalle”. Es “dale a cada entrada un solo trabajo”. H3 puede tomar texto, imágenes, video y audio como un conjunto unificado de referencias, así que un creador puede sacar la identidad del producto de una foto fija, el movimiento de un clip, el ritmo del audio y la dirección del plano del prompt. Esa flexibilidad solo ayuda cuando el modelo puede distinguir qué fuente controla qué parte del resultado.

Esta guía de prompts para MiniMax H3 convierte ese principio en un formato repetible. Vas a aprender a atar cada archivo a un rol, evitar que las referencias se contradigan, escribir reglas de preservación y dividir una generación de 4–15 segundos en tiempos marcados. Las seis plantillas del final cubren video de producto, movimiento de personaje, diálogo, edición de video, movimiento de interfaz y transiciones de primer a último cuadro.

Nota

Esta es una guía de prompts basada en documentación, no un informe de generaciones de H3 comparadas de forma independiente por OmniArt. Se apoya en la guía de generación de H3 y en la referencia oficial de la API de MiniMax. MiniMax H3 ya está disponible para usuarios Creator+ de OmniArt, pero las capacidades documentadas del proveedor no equivalen a benchmarks independientes.

¿MiniMax H3, Hailuo 3.0 o Hailuo 03?

La documentación vigente de MiniMax llama al modelo MiniMax H3 y da como identificador oficial de la API el valor MiniMax-H3. También te vas a cruzar con Hailuo 3.0, Hailuo 03 o Hailuo-3.0 en la cobertura del lanzamiento y en catálogos de terceros, porque Hailuo es la marca de producto de video de MiniMax.

Usa la etiqueta que exija la superficie que tienes enfrente. Para la API oficial V2 de MiniMax documentada al momento de publicar, eso significa MiniMax-H3; no supongas que un alias de un marketplace también es un identificador válido de la API oficial. Esta guía usa MiniMax H3 para el modelo y generación por referencia para el modo que combina entradas de imagen, video y audio. “Omni reference” es una buena descripción de ese flujo de medios mixtos, pero la API oficial lo llama referencia a video.

Conoce los tres modos de generación de H3

Elegir el modo correcto viene antes de escribir el prompt.

ModoEntradasÚsalo cuando
Texto a videoPrompt de texto obligatorioLa escena se puede crear solo a partir de una descripción
Imagen a video con primer o último cuadroPrompt obligatorio más un primer cuadro, un último cuadro o ambosImporta una composición exacta de apertura o de cierre
Generación por referenciaPrompt obligatorio más imágenes, videos o audios de referenciaNecesitas identidad, diseño, movimiento, cámara, voz, ritmo o estilo de archivos subidos

La especificación oficial vigente lista salida en 2K y duraciones enteras de 4 a 15 segundos. Toda solicitud requiere un prompt de texto no vacío, con un límite de 7,000 caracteres. Una solicitud por referencia puede incluir hasta nueve imágenes, tres videos y tres clips de audio, sin superar 12 archivos en total. Los videos de referencia suman como máximo 15 segundos en conjunto, igual que los audios de referencia. Un audio de referencia no se puede enviar solo: tiene que acompañar al menos a una imagen o a un video.

Texto a video exige una relación de aspecto concreta. La generación por referencia puede usar una relación concreta o dejar que H3 elija de forma adaptativa, mientras que la generación con primer o último cuadro sigue la imagen subida. Las relaciones documentadas son 21:9, 16:9, 4:3, 1:1, 3:4 y 9:16.

Hay un límite duro de flujo: el modo de primer o último cuadro y la generación por referencia no se pueden mezclar en la misma solicitud a la API. Si importan los cuadros exactos de los extremos, usa el modo de primer o último cuadro. Si importa más la transferencia de identidad, movimiento, estilo o audio, usa la generación por referencia y describe la composición inicial en texto.

Arma un prompt de H3 como un mapa de roles

La API de H3 recibe los medios como elementos tipados, con roles como reference_image, reference_video y reference_audio. Esos roles técnicos identifican el tipo de medio; tu prompt debería ir un nivel más allá y declarar la responsabilidad creativa de cada archivo.

Usa este orden:

DELIVERABLE
What the final clip is for, its duration, and its format.

ROLE MAP
Reference image 1 = subject identity and immutable appearance.
Reference image 2 = environment or visual style only.
Reference video 1 = body motion and timing only.
Reference audio 1 = rhythm and edit timing only.

SHOT
Subject, action, environment, lighting, and camera direction.

TIMELINE
Time-coded beats that add up to the selected duration.

PRESERVE
Features that must remain unchanged from named references.

EXCLUDE
A short list of the most damaging unwanted changes.

Las etiquetas numeradas de arriba son rótulos semánticos para tu brief, no la promesa de que toda interfaz de H3 exponga controles literales llamados Reference image 1. En la API oficial, los archivos son elementos separados dentro del arreglo content. En una interfaz visual, usa los nombres de adjunto o la sintaxis de mención que ofrezca esa superficie y mantén la misma lógica de un archivo, un trabajo.

Dale a cada archivo un trabajo principal

Una referencia contiene más información de la que normalmente quieres transferir. Un clip de baile contiene un intérprete, ropa, locación, cámara, iluminación, movimiento y quizá música. Si le pides a H3 que “siga el video”, todas esas características compiten con tu imagen de personaje.

Ata cada cosa de forma estrecha:

  • Referencia de imagen: identidad, rostro, vestuario, geometría del producto, logo, paleta o diseño del entorno.
  • Referencia de video: movimiento del cuerpo, recorrido de cámara, tiempos de la acción, interacción física o ritmo de montaje.
  • Referencia de audio: carácter de la voz, cadencia, ritmo musical, ambiente o una señal de evento.
  • Prompt de texto: la escena final, las reglas de transferencia, la línea de tiempo, las prioridades y las instrucciones de preservación.

Cuando un archivo tiene que hacer dos trabajos, nombra los dos y deja explícito el límite: “El video de referencia 1 controla el recorrido de cámara y los tiempos de la acción; ignora su intérprete, vestuario, locación, corrección de color y audio”.

Evita que las referencias se peleen entre sí

El conflicto entre referencias suele ser un problema de instrucciones antes que un problema del modelo. Dos imágenes pueden mostrar chaquetas distintas, un clip de movimiento puede tener otro tipo de cuerpo, o un pulso de audio puede sugerir cortes que chocan con un movimiento de cámara continuo que pediste.

Usa un orden de prioridad escrito cada vez que las entradas se superpongan:

Priority order:
1. Reference image 1 controls character identity and wardrobe.
2. Reference video 1 controls movement and timing only.
3. Reference image 2 controls lighting palette and set design only.
4. The text prompt controls camera framing and final composition.

Después resuelve las contradicciones en vez de esperar que H3 deduzca tu preferencia. Si la imagen de identidad tiene el pelo suelto pero el video de movimiento tiene un sombrero, declara si el personaje final conserva el pelo o usa el sombrero. Si una referencia de producto muestra una etiqueta legible pero la imagen de estilo es pictórica, aclara que la estilización aplica al entorno mientras el packaging se mantiene fotorrealista.

Tres hábitos reducen el conflicto:

  1. Usa el conjunto de referencias más chico que sirva. Más entradas crean más desacuerdos posibles. Suma un archivo solo cuando aporte información que el prompt no pueda expresar de forma confiable.
  2. Separa contenido de estilo. Declara qué referencia es dueña del sujeto y cuál es dueña del tratamiento.
  3. Elige una sola autoridad de cámara. O transfieres la cámara desde un video o la diriges en texto. Si necesitas las dos cosas, declara que el video aporta los tiempos y el texto manda sobre el encuadre.

Para un flujo más amplio, síntoma por síntoma, ten a mano 7 arreglos para prompts de video con IA mientras iteras.

Escribe instrucciones de preservación que se puedan verificar

“Manténlo consistente” es demasiado vago. Un bloque de preservación debería nombrar propiedades visibles que puedas inspeccionar en cualquier cuadro.

Para un personaje:

Preserve from reference image 1 throughout every frame: facial structure,
eye color, hairstyle and length, jacket cut, jacket color, and body proportions.
Do not replace the performer with the person from reference video 1.

Para un producto:

Preserve from reference image 1: bottle silhouette, cap shape, label placement,
navy wordmark, coral seal, material finish, and relative proportions.
No duplicate product, redesigned packaging, extra text, or changing logo.

Las anclas positivas van primero; las exclusiones son una baranda, no todo el prompt. Mantén la lista negativa corta y específica. Diez prohibiciones vagas pueden diluir los cuatro invariantes que de verdad deciden si una toma sirve.

Si el mismo personaje va a aparecer en varios clips generados por separado, mantén el bloque de identidad y vestuario idéntico en cada prompt. El flujo de personajes consistentes explica cómo armar ese paquete de referencias reutilizable a lo largo de una secuencia más larga.

Dirige el tiempo, no solo el contenido

H3 permite clips de 4 a 15 segundos, pero un párrafo largo no le dice al modelo cuándo ocurre cada evento. Una línea de tiempo convierte el prompt en un plan de plano compacto.

Para un clip de 10 segundos:

0–2 seconds: locked medium-wide establishing shot; subject holds still.
2–6 seconds: subject performs the referenced action at the source tempo.
6–9 seconds: camera makes one slow 20-degree arc to the right.
9–10 seconds: subject settles; hold a clean final composition for the edit.

Mantén cada tiempo alcanzable. Una acción principal más un movimiento de cámara suele ser más claro que una cadena de transformaciones sin relación. Deja que los rangos de tiempo sumen la duración elegida, ubica los detalles importantes de producto o de rostro en un tiempo más lento, y reserva el último medio segundo o segundo para un punto de montaje estable.

El audio puede compartir el mismo reloj:

At 2.0 seconds, the first downbeat starts the hand movement.
At 6.0 seconds, the bass hit motivates the camera arc.
From 9.0 seconds, let the music tail continue under the held final frame.

Para más vocabulario de lentes, luz y cámara, mira la guía de prompts para video cinematográfico con IA.

Seis plantillas de prompt para MiniMax H3

Reemplaza los detalles entre corchetes, adjunta solo los archivos listados y adapta las etiquetas a la interfaz que uses. Estas plantillas son puntos de partida estructurados según los modos de entrada documentados de H3; no son ganadoras de benchmark ni resultados garantizados.

Plantilla 1: revelación de producto con referencias de movimiento y música

  • Modo: generación por referencia
  • Archivos: una imagen limpia de producto, un video con movimiento de cámara y, si quieres, una referencia musical
Create a 10-second 9:16 product reveal for a paid social placement.

Role map:
- Reference image 1 controls the product's exact design, proportions, packaging,
  colors, materials, label placement, and wordmark.
- Reference video 1 controls camera path and acceleration only. Ignore its subject,
  location, lighting, color grade, and audio.
- Reference audio 1 controls beat and edit timing only.

Scene: The product stands centered on a warm-violet studio plinth. Soft lilac key
light from camera left, restrained coral rim light, subtle atmospheric haze.

Timeline:
- 0–2 seconds: static wide reveal on the first soft beat.
- 2–7 seconds: transfer the smooth push-and-arc movement from reference video 1.
- 7–9 seconds: one narrow highlight travels across the product surface.
- 9–10 seconds: camera settles; hold the label front-facing and readable.

Preserve reference image 1 exactly: silhouette, cap, material finish, label layout,
brand colors, and wordmark. Keep one product only. No redesigned packaging,
duplicate objects, extra text, warped label, or abrupt camera shake.

Para la preparación de la imagen fija que va antes de este prompt, usa el flujo de foto a video de producto.

Plantilla 2: transferencia de movimiento de personaje sin desvío de identidad

  • Modo: generación por referencia
  • Archivos: una imagen de personaje, un video de movimiento y, si quieres, una imagen de entorno
Create an 8-second 16:9 cinematic character performance.

Priority order:
1. Reference image 1 controls face, hair, body proportions, and wardrobe.
2. Reference video 1 controls body choreography and action timing only.
3. Reference image 2 controls the environment palette and architecture only.
4. This prompt controls framing and lighting.

The character from reference image 1 performs the complete movement from reference
video 1 in a moonlit station based on reference image 2. Medium full shot, camera
locked at chest height, soft directional light, realistic weight and foot contact.

Timeline:
- 0–1 seconds: character holds the starting pose.
- 1–7 seconds: perform the reference choreography once at its original tempo.
- 7–8 seconds: settle naturally and look toward camera left.

Preserve facial structure, hairstyle, coat shape, coat color, boots, and body
proportions from reference image 1 in every frame. Do not inherit the motion video's
performer, face, clothing, background, camera movement, or audio. No extra limbs,
sliding feet, costume changes, or cuts.

Plantilla 3: interpretación de diálogo con una referencia de voz

  • Modo: generación por referencia
  • Archivos: una imagen de personaje y un clip de voz o diálogo con autorización

Advertencia

Sube únicamente una voz que te pertenezca o que tengas permiso explícito para usar. Que un modelo acepte audio de referencia no te da derechos para imitar la voz de otra persona.

Create a 9-second 16:9 single-character dialogue shot.

Role map:
- Reference image 1 controls the speaker's appearance, wardrobe, and room design.
- Reference audio 1 controls spoken timing, cadence, emotional progression, and pauses.

Shot: Medium close-up, eye-level, 50 mm cinematic framing. The speaker begins calm,
briefly smiles after the central pause, then finishes with quiet confidence. Natural
blinks and restrained hand movement. Camera remains static; soft room tone underneath.

Timeline:
- 0–1 seconds: silent eye contact and a small inhale.
- 1–8 seconds: performance follows reference audio 1 exactly in timing and pauses.
- 8–9 seconds: mouth closes, expression settles, hold for the edit.

Preserve face, hairstyle, skin tone, jacket, background layout, and lighting direction
from reference image 1. Keep one speaker. No camera move, cutaway, background speech,
new words, exaggerated gestures, or wardrobe changes.

Plantilla 4: reemplazar el entorno de un video de origen

  • Modo: generación por referencia
  • Archivos: un video de origen, una imagen de entorno y, si quieres, una imagen del sujeto
Create a 12-second 16:9 environmental replacement based on the source clip.

Role map:
- Reference video 1 controls shot length, subject action, physical timing, camera path,
  framing progression, and interaction with the ground.
- Reference image 1 controls the replacement environment, architecture, palette,
  weather, and lighting mood.
- Reference image 2 controls the subject's face and wardrobe, if supplied.

Replace the source video's location with the environment from reference image 1.
Preserve the original action and camera movement continuously. Match subject lighting,
contact shadows, reflections, and atmospheric perspective to the new environment.

Timeline follows reference video 1. Maintain one continuous shot with the original
action beats and no added event.

Preserve the source subject's position, scale, motion, and ground contact. Preserve
identity and wardrobe from reference image 2 when present. Do not copy the original
background, signage, bystanders, color grade, or source audio. No cuts, teleporting,
floating feet, or changing architecture.

Plantilla 5: movimiento de interfaz de marca sincronizado con un pulso

  • Modo: generación por referencia
  • Archivos: una imagen del diseño de interfaz, un video con estilo de movimiento y, si quieres, una referencia de audio
Create a 7-second 1:1 UI motion-design clip for a product announcement.

Priority order:
1. Reference image 1 controls exact layout, hierarchy, component positions, text,
   logo, colors, corner shapes, and typography appearance.
2. Reference video 1 controls transition character and easing only.
3. Reference audio 1 controls the timing of three motion beats only.

Animate the interface from reference image 1 without redesigning it. Begin with the
main panel at rest. Use the restrained slide-and-scale transition quality from
reference video 1. Keep the camera orthographic and the background static.

Timeline:
- 0–1 seconds: complete layout at rest.
- 1–3 seconds: cards enter in sequence on beat one.
- 3–5 seconds: primary control changes state on beat two.
- 5–6 seconds: one subtle emphasis pulse on beat three.
- 6–7 seconds: complete interface holds sharp and readable.

Preserve every word, logo shape, component proportion, spacing relationship, and brand
color from reference image 1. No invented labels, misspelled text, extra panels,
perspective tilt, camera movement, glow overload, or elastic distortion.

Plantilla 6: transformación exacta de primer a último cuadro

  • Modo: imagen a video con primer y último cuadro
  • Archivos: una imagen de primer cuadro y una de último cuadro; sin medios de referencia
Create a 10-second transformation from the supplied first frame to the supplied last
frame. Preserve the subject's identity and the camera's fixed position throughout.

Timeline:
- 0–2 seconds: hold the first-frame composition; only subtle ambient movement.
- 2–7 seconds: the scene transforms progressively from the center outward. Materials
  change continuously with believable physical contact and no hard cut.
- 7–9 seconds: remaining details resolve into the last-frame design.
- 9–10 seconds: arrive exactly at the supplied last frame and hold it cleanly.

One continuous locked shot. Preserve subject scale, face, silhouette, horizon, lens,
and framing during the transition. No reference-style transfer, new characters,
camera movement, jump cut, flicker, or overshoot beyond the final composition.

No adjuntes a esta solicitud las imágenes, videos o audios de referencia de las otras plantillas. La API oficial trata la generación con primer o último cuadro y la generación por referencia como modos mutuamente excluyentes.

Un orden práctico para iterar

No cambies a la vez las instrucciones de identidad, movimiento, cámara, estilo y audio después de un render decepcionante. Así es imposible aprender qué instrucción ayudó.

Itera en tres pasadas:

  1. Fija roles e invariantes. Usa el conjunto de referencias más chico y verifica que el sujeto o el producto siga siendo reconocible.
  2. Fija acción y línea de tiempo. Suma la fuente de movimiento o los tiempos marcados, manteniendo el estilo simple.
  3. Suma tratamiento. Introduce entorno, iluminación, corrección de color, señales de audio y detalles de terminación recién cuando las dos primeras capas estén estables.

Cuando un resultado se desvía, simplifica antes de agregar más lenguaje negativo. Saca la referencia menos importante, acorta la línea de tiempo o dale a una fuente un trabajo más acotado. Compara varias variantes contra la misma lista: identidad, geometría, movimiento, cámara, sincronía del audio y estabilidad del cuadro final.

Cómo empezar desde OmniArt

MiniMax H3 está disponible para usuarios Creator+ en OmniArt. Abre el creador de video con MiniMax H3, elige H3 y selecciona el modo que coincida con el brief: Video para una generación estándar, Transition para un plano de primer a último cuadro, o Reference para condicionamiento mixto con imagen, video y audio. La superficie actual del producto admite salidas de 5–15 segundos en 1440p.

En el modo Reference, adjunta hasta nueve imágenes, tres videos y tres clips de audio, sin superar 12 archivos en total. El audio de referencia tiene que ir acompañado de al menos una imagen o un video. Asigna un rol a cada adjunto, pega en el prompt el mapa de roles y las reglas de preservación correspondientes, elige una duración de 5–15 segundos y genera. El audio nativo es parte de la salida de H3; hoy OmniArt no expone un control de audio separado.

OmniArt cobra 9 créditos por segundo de salida. El video de referencia cuesta 9 créditos adicionales por cada segundo de origen redondeado hacia arriba; las primeras cinco imágenes de referencia son gratis y cada imagen adicional cuesta 2 créditos; el audio de referencia no tiene cargo extra. Para las tarifas oficiales de la API y ejemplos de costo fuera de OmniArt, usa la guía de precios y especificaciones de MiniMax H3.

¿Todo listo para crear?

Empieza a generar contenido increíble con IA

Empezar gratis