Guía de prompts de MiniMax H3: controla cada entrada de referencia
Aprende a escribir prompts para MiniMax H3 con referencias de imagen, vídeo, audio y texto. Asigna un rol a cada recurso, evita conflictos y dirige un plano de vídeo con IA temporizado.

La idea útil detrás de un prompt de MiniMax H3 no es «escribir más detalle». Es «darle a cada entrada un solo trabajo». H3 puede recibir texto, imágenes, vídeo y audio como un conjunto unificado de referencias, de modo que un creador puede tomar la identidad del producto de una foto fija, el movimiento de un clip, el ritmo del audio y la dirección del plano del prompt. Esa flexibilidad solo ayuda cuando el modelo puede distinguir qué fuente controla qué parte del resultado.
Esta guía de prompts de MiniMax H3 convierte ese principio en un formato repetible. Aprenderás a vincular cada recurso a un rol, impedir que las referencias se contradigan entre sí, escribir reglas de preservación y dividir una generación de 4–15 segundos en tiempos codificados. Seis plantillas al final cubren vídeo de producto, movimiento de personaje, diálogo, edición de vídeo, motion de UI y transiciones de primer a último fotograma.
Nota
Esta es una guía de prompts basada en documentación, no un informe de generaciones de H3 probadas por OmniArt. Se apoya en la guía de generación H3 actual de MiniMax y en la referencia oficial de la API. H3 no está confirmado actualmente en el catálogo de modelos de referencia de OmniArt a fecha de 31 de julio de 2026. Las etiquetas de interfaz y la sintaxis de referencia también pueden diferir entre las superficies propias de MiniMax y los hosts posteriores.
¿MiniMax H3, Hailuo 3.0 o Hailuo 03?
La documentación actual de MiniMax llama al modelo MiniMax H3 y da el identificador oficial del modelo de API como MiniMax-H3. También puedes encontrar Hailuo 3.0, Hailuo 03 o Hailuo-3.0 en coberturas de lanzamiento y catálogos de terceros porque Hailuo es la marca de producto de vídeo de MiniMax.
Usa la etiqueta que exija la superficie que tengas delante. Para la API V2 oficial de MiniMax documentada en el momento de publicación, eso significa MiniMax-H3; no asumas que un alias de marketplace sea también un identificador oficial válido de la API. Esta guía usa MiniMax H3 para el modelo y generación por referencia para el modo que combina entradas de imagen, vídeo y audio. «Referencia omni» es una descripción útil de ese flujo de trabajo de medios mixtos, pero la API oficial lo llama reference-to-video.
Conoce los tres modos de generación de H3
Elegir el modo correcto va antes de escribir el prompt.
| Modo | Entradas | Úsalo cuando |
|---|---|---|
| Texto a vídeo | Prompt de texto obligatorio | La escena puede crearse solo a partir de la descripción |
| Imagen a vídeo de primer/último fotograma | Prompt obligatorio más un primer fotograma, un último fotograma, o ambos | Importa una composición exacta de apertura o de cierre |
| Generación por referencia | Prompt obligatorio más imágenes, vídeos o audio de referencia | Necesitas identidad, diseño, movimiento, cámara, voz, ritmo o estilo a partir de recursos subidos |
La especificación oficial actual lista salida 2K y duraciones enteras de 4 a 15 segundos. Toda solicitud exige un prompt de texto no vacío, con un límite de 7,000 caracteres. Una solicitud de referencia puede incluir hasta nueve imágenes, tres vídeos y tres clips de audio, con no más de 12 recursos en total. Los vídeos de referencia están limitados a 15 segundos en conjunto, igual que los clips de audio de referencia. Una referencia de audio no puede enviarse sola; debe acompañar al menos a una imagen o un vídeo.
El texto a vídeo exige una relación de aspecto concreta. La generación por referencia puede usar una relación concreta o dejar que H3 elija de forma adaptativa, mientras que la generación de primer/último fotograma sigue la imagen subida. Las relaciones documentadas son 21:9, 16:9, 4:3, 1:1, 3:4 y 9:16.
Hay un límite duro de flujo de trabajo: el modo de primer/último fotograma y la generación por referencia no pueden mezclarse en la misma solicitud de API. Si importan los fotogramas de borde exactos, usa el modo de primer/último fotograma. Si importan más la identidad, el movimiento, el estilo o la transferencia de audio, usa la generación por referencia y describe la composición de apertura en texto.
Construye un prompt de H3 como un mapa de roles
La API de H3 recibe los medios como elementos tipados con roles como reference_image, reference_video y reference_audio. Esos roles técnicos identifican el tipo de medio; tu prompt debe ir un nivel más allá y enunciar la responsabilidad creativa de cada recurso.
Usa este orden:
DELIVERABLE
What the final clip is for, its duration, and its format.
ROLE MAP
Reference image 1 = subject identity and immutable appearance.
Reference image 2 = environment or visual style only.
Reference video 1 = body motion and timing only.
Reference audio 1 = rhythm and edit timing only.
SHOT
Subject, action, environment, lighting, and camera direction.
TIMELINE
Time-coded beats that add up to the selected duration.
PRESERVE
Features that must remain unchanged from named references.
EXCLUDE
A short list of the most damaging unwanted changes.
Las etiquetas numeradas de arriba son etiquetas semánticas para tu brief, no una promesa de que cada interfaz de H3 exponga asas literales de Reference image 1. En la API oficial, los archivos son elementos separados en el array content. En una interfaz visual, usa los nombres de adjunto o la sintaxis de mención que ofrezca esa superficie, y mantén la misma lógica de un recurso, un trabajo.
Dale a cada recurso un trabajo principal
Una referencia contiene más información de la que sueles querer transferir. Un clip de baile contiene un intérprete, ropa, localización, cámara, iluminación, movimiento y quizá música. Si pides a H3 que «siga el vídeo», todas esas características compiten con tu imagen de personaje.
Vincula de forma estrecha en su lugar:
- Referencia de imagen: identidad, cara, vestuario, geometría del producto, logo, paleta o diseño del entorno.
- Referencia de vídeo: movimiento corporal, trayectoria de cámara, timing de la acción, interacción física o ritmo de edición.
- Referencia de audio: carácter de la voz, cadencia, ritmo musical, ambiente o una señal de evento.
- Prompt de texto: la escena final, las reglas de transferencia, la línea de tiempo, las prioridades y las instrucciones de preservación.
Cuando un recurso deba hacer dos trabajos, nómbralos ambos y deja el límite explícito: «Reference video 1 controla la trayectoria de cámara y el timing de la acción; ignora su intérprete, vestuario, localización, grade de color y audio.»
Evita que las referencias peleen entre sí
El conflicto de referencias suele ser un problema de instrucciones antes que un problema del modelo. Dos imágenes pueden mostrar chaquetas distintas, un clip de movimiento puede usar un tipo de cuerpo diferente, o un beat de audio puede implicar cortes que chocan con un movimiento de cámara ininterrumpido solicitado.
Usa un orden de prioridad escrito siempre que las entradas se solapen:
Priority order:
1. Reference image 1 controls character identity and wardrobe.
2. Reference video 1 controls movement and timing only.
3. Reference image 2 controls lighting palette and set design only.
4. The text prompt controls camera framing and final composition.
Después resuelve las contradicciones en lugar de esperar que H3 infiera tu preferencia. Si la imagen de identidad tiene el pelo suelto pero el vídeo de movimiento lleva sombrero, indica si el personaje final conserva el pelo o lleva el sombrero. Si una referencia de producto muestra una etiqueta legible pero la imagen de estilo es pictórica, di que la estilización se aplica al entorno mientras el packaging permanece fotorrealista.
Tres hábitos reducen el conflicto:
- Usa el conjunto de referencias más pequeño que sea útil. Más entradas crean más desacuerdos posibles. Añade un archivo solo cuando aporte información que el prompt no pueda expresar de forma fiable.
- Separa el contenido del estilo. Nombra qué referencia posee el sujeto y cuál posee el tratamiento.
- Elige una sola autoridad de cámara. O bien transfieres la cámara desde un vídeo o la diriges en texto. Si necesitas ambas, indica que el vídeo aporta el timing mientras el texto anula el encuadre.
Para un flujo de trabajo más amplio síntoma a síntoma, ten a mano 7 arreglos de prompt para vídeo con IA junto a esta guía mientras iteras.
Escribe instrucciones de preservación que se puedan comprobar
«Manténlo consistente» es demasiado vago. Un bloque de preservación debe nombrar propiedades visibles que puedas inspeccionar en cualquier fotograma.
Para un personaje:
Preserve from reference image 1 throughout every frame: facial structure,
eye color, hairstyle and length, jacket cut, jacket color, and body proportions.
Do not replace the performer with the person from reference video 1.
Para un producto:
Preserve from reference image 1: bottle silhouette, cap shape, label placement,
navy wordmark, coral seal, material finish, and relative proportions.
No duplicate product, redesigned packaging, extra text, or changing logo.
Los anclajes positivos deben ir primero; las exclusiones son un guardarraíl, no el prompt entero. Mantén la lista negativa corta y específica. Diez prohibiciones vagas pueden diluir los cuatro invariantes que de verdad deciden si una toma es usable.
Si el mismo personaje aparecerá en varios clips generados por separado, mantén el bloque de identidad y vestuario idéntico en cada prompt. El flujo de trabajo de personaje consistente explica cómo construir ese paquete de referencia reutilizable a lo largo de una secuencia más larga.
Dirige el tiempo, no solo el contenido
H3 permite clips de 4 a 15 segundos, pero un párrafo largo no le dice al modelo cuándo ocurre cada evento. Una línea de tiempo convierte el prompt en un plan de plano compacto.
Para un clip de 10 segundos:
0–2 seconds: locked medium-wide establishing shot; subject holds still.
2–6 seconds: subject performs the referenced action at the source tempo.
6–9 seconds: camera makes one slow 20-degree arc to the right.
9–10 seconds: subject settles; hold a clean final composition for the edit.
Mantén cada beat alcanzable. Una acción principal más un movimiento de cámara suele ser más claro que una cadena de transformaciones sin relación. Deja que los rangos de tiempo sumen la duración seleccionada, coloca los detalles importantes del producto o del rostro en un beat más lento y reserva el último medio segundo o segundo para un punto de edición estable.
El audio puede compartir el mismo reloj:
At 2.0 seconds, the first downbeat starts the hand movement.
At 6.0 seconds, the bass hit motivates the camera arc.
From 9.0 seconds, let the music tail continue under the held final frame.
Para más vocabulario de lente, luz y cámara, consulta la guía de prompts de vídeo cinematográfico con IA.
Seis plantillas de prompt de MiniMax H3
Sustituye los detalles entre corchetes, adjunta solo los recursos listados y adapta las etiquetas a la interfaz que uses. Estas plantillas son puntos de partida estructurados basados en los modos de entrada documentados de H3; no se presentan como ganadoras de benchmarks ni como salidas garantizadas.
Plantilla 1: presentación de producto con referencias de movimiento y música
- Modo: Generación por referencia
- Recursos: Una imagen limpia del producto, un vídeo de movimiento de cámara, referencia de música opcional
Create a 10-second 9:16 product reveal for a paid social placement.
Role map:
- Reference image 1 controls the product's exact design, proportions, packaging,
colors, materials, label placement, and wordmark.
- Reference video 1 controls camera path and acceleration only. Ignore its subject,
location, lighting, color grade, and audio.
- Reference audio 1 controls beat and edit timing only.
Scene: The product stands centered on a warm-violet studio plinth. Soft lilac key
light from camera left, restrained coral rim light, subtle atmospheric haze.
Timeline:
- 0–2 seconds: static wide reveal on the first soft beat.
- 2–7 seconds: transfer the smooth push-and-arc movement from reference video 1.
- 7–9 seconds: one narrow highlight travels across the product surface.
- 9–10 seconds: camera settles; hold the label front-facing and readable.
Preserve reference image 1 exactly: silhouette, cap, material finish, label layout,
brand colors, and wordmark. Keep one product only. No redesigned packaging,
duplicate objects, extra text, warped label, or abrupt camera shake.
Para la preparación de la imagen fija que precede a este prompt, usa el flujo de trabajo de foto a vídeo de producto.
Plantilla 2: transferencia de movimiento de personaje sin deriva de identidad
- Modo: Generación por referencia
- Recursos: Una imagen de personaje, un vídeo de movimiento, imagen de entorno opcional
Create an 8-second 16:9 cinematic character performance.
Priority order:
1. Reference image 1 controls face, hair, body proportions, and wardrobe.
2. Reference video 1 controls body choreography and action timing only.
3. Reference image 2 controls the environment palette and architecture only.
4. This prompt controls framing and lighting.
The character from reference image 1 performs the complete movement from reference
video 1 in a moonlit station based on reference image 2. Medium full shot, camera
locked at chest height, soft directional light, realistic weight and foot contact.
Timeline:
- 0–1 seconds: character holds the starting pose.
- 1–7 seconds: perform the reference choreography once at its original tempo.
- 7–8 seconds: settle naturally and look toward camera left.
Preserve facial structure, hairstyle, coat shape, coat color, boots, and body
proportions from reference image 1 in every frame. Do not inherit the motion video's
performer, face, clothing, background, camera movement, or audio. No extra limbs,
sliding feet, costume changes, or cuts.
Plantilla 3: interpretación de diálogo con una referencia de voz
- Modo: Generación por referencia
- Recursos: Una imagen de personaje, un clip de audio de voz o diálogo autorizado
Advertencia
Solo sube una voz que poseas o para la que tengas permiso explícito de uso. Que un modelo acepte audio de referencia no te da derechos para imitar la voz de otra persona.
Create a 9-second 16:9 single-character dialogue shot.
Role map:
- Reference image 1 controls the speaker's appearance, wardrobe, and room design.
- Reference audio 1 controls spoken timing, cadence, emotional progression, and pauses.
Shot: Medium close-up, eye-level, 50 mm cinematic framing. The speaker begins calm,
briefly smiles after the central pause, then finishes with quiet confidence. Natural
blinks and restrained hand movement. Camera remains static; soft room tone underneath.
Timeline:
- 0–1 seconds: silent eye contact and a small inhale.
- 1–8 seconds: performance follows reference audio 1 exactly in timing and pauses.
- 8–9 seconds: mouth closes, expression settles, hold for the edit.
Preserve face, hairstyle, skin tone, jacket, background layout, and lighting direction
from reference image 1. Keep one speaker. No camera move, cutaway, background speech,
new words, exaggerated gestures, or wardrobe changes.
Plantilla 4: sustituir el entorno de un vídeo fuente
- Modo: Generación por referencia
- Recursos: Un vídeo fuente, una imagen de entorno, imagen de sujeto opcional
Create a 12-second 16:9 environmental replacement based on the source clip.
Role map:
- Reference video 1 controls shot length, subject action, physical timing, camera path,
framing progression, and interaction with the ground.
- Reference image 1 controls the replacement environment, architecture, palette,
weather, and lighting mood.
- Reference image 2 controls the subject's face and wardrobe, if supplied.
Replace the source video's location with the environment from reference image 1.
Preserve the original action and camera movement continuously. Match subject lighting,
contact shadows, reflections, and atmospheric perspective to the new environment.
Timeline follows reference video 1. Maintain one continuous shot with the original
action beats and no added event.
Preserve the source subject's position, scale, motion, and ground contact. Preserve
identity and wardrobe from reference image 2 when present. Do not copy the original
background, signage, bystanders, color grade, or source audio. No cuts, teleporting,
floating feet, or changing architecture.
Plantilla 5: motion de UI de marca sincronizado a un beat
- Modo: Generación por referencia
- Recursos: Una imagen de layout de UI, un vídeo de estilo de motion, referencia de audio opcional
Create a 7-second 1:1 UI motion-design clip for a product announcement.
Priority order:
1. Reference image 1 controls exact layout, hierarchy, component positions, text,
logo, colors, corner shapes, and typography appearance.
2. Reference video 1 controls transition character and easing only.
3. Reference audio 1 controls the timing of three motion beats only.
Animate the interface from reference image 1 without redesigning it. Begin with the
main panel at rest. Use the restrained slide-and-scale transition quality from
reference video 1. Keep the camera orthographic and the background static.
Timeline:
- 0–1 seconds: complete layout at rest.
- 1–3 seconds: cards enter in sequence on beat one.
- 3–5 seconds: primary control changes state on beat two.
- 5–6 seconds: one subtle emphasis pulse on beat three.
- 6–7 seconds: complete interface holds sharp and readable.
Preserve every word, logo shape, component proportion, spacing relationship, and brand
color from reference image 1. No invented labels, misspelled text, extra panels,
perspective tilt, camera movement, glow overload, or elastic distortion.
Plantilla 6: transformación exacta de primer a último fotograma
- Modo: Imagen a vídeo de primer/último fotograma
- Recursos: Una imagen de primer fotograma y una imagen de último fotograma; sin medios de referencia
Create a 10-second transformation from the supplied first frame to the supplied last
frame. Preserve the subject's identity and the camera's fixed position throughout.
Timeline:
- 0–2 seconds: hold the first-frame composition; only subtle ambient movement.
- 2–7 seconds: the scene transforms progressively from the center outward. Materials
change continuously with believable physical contact and no hard cut.
- 7–9 seconds: remaining details resolve into the last-frame design.
- 9–10 seconds: arrive exactly at the supplied last frame and hold it cleanly.
One continuous locked shot. Preserve subject scale, face, silhouette, horizon, lens,
and framing during the transition. No reference-style transfer, new characters,
camera movement, jump cut, flicker, or overshoot beyond the final composition.
No adjuntes las imágenes, vídeos o audio de referencia de las otras plantillas a esta solicitud. La API oficial trata la generación de primer/último fotograma y la generación por referencia como modos mutuamente excluyentes.
Un orden práctico de iteración
No cambies las instrucciones de identidad, movimiento, cámara, estilo y audio después de un solo render decepcionante. Eso hace imposible saber qué instrucción ayudó.
Itera en tres pases:
- Fija roles e invariantes. Usa el conjunto de referencias más pequeño y verifica que el sujeto o el producto siga siendo reconocible.
- Fija la acción y la línea de tiempo. Añade la fuente de movimiento o los beats temporizados, manteniendo el estilo simple.
- Añade el tratamiento. Introduce entorno, iluminación, grade, señales de audio y detalles de acabado después de que las dos primeras capas estén estables.
Cuando un resultado se desvíe, simplifica antes de añadir más lenguaje negativo. Elimina la referencia menos importante, acorta la línea de tiempo o dale a una fuente un trabajo más estrecho. Compara varias variantes con la misma lista de comprobación: identidad, geometría, movimiento, cámara, timing de audio y estabilidad del fotograma final.
Cómo empezar desde OmniArt
MiniMax H3 no está confirmado actualmente como seleccionable dentro de OmniArt, así que este artículo no enlaza a una ruta de creación de H3 ni reclama un flujo de trabajo de H3 en OmniArt. Consulta el lineup actual de modelos de vídeo de OmniArt para ver los modelos disponibles hoy.
El método del mapa de roles sigue transfiriéndose bien a los modelos de vídeo por referencia admitidos: prepara una imagen de identidad, una fuente de movimiento y un bloque corto de preservación antes de abrir el espacio de trabajo. Mantén el prompt neutro respecto al modelo hasta que el brief creativo esté estable; después adapta las etiquetas de adjunto y la sintaxis específica de cada función al modelo que selecciones de verdad. Eso te da una hoja de dirección reutilizable ahora y un prompt limpio de H3 si el modelo se une a OmniArt más adelante.
Para tarifas oficiales de la API, facturación de vídeo de referencia y ejemplos de coste trabajados, usa la guía de precios y especificaciones de MiniMax H3. Usa la propia página de precios de MiniMax en lugar de una tarifa de revendedor.
¿Listo para crear?
Empieza a generar contenido increíble con IA