Guide de prompts MiniMax H3 : contrôler chaque entrée de référence
Apprenez à prompter MiniMax H3 avec des références d'image, vidéo, audio et texte. Attribuez un rôle à chaque asset, évitez les conflits et dirigez un plan vidéo IA chronométré.

L'idée utile derrière un prompt MiniMax H3 n'est pas « écrivez davantage de détails ». C'est « donnez une fonction à chaque entrée ». H3 peut recevoir texte, images, vidéo et audio comme un ensemble de références unifié : un créateur peut donc tirer l'identité d'un produit d'une image fixe, le mouvement d'un extrait, le rythme de l'audio et la direction du plan du prompt. Cette souplesse n'aide que lorsque le modèle sait quelle source contrôle quelle partie du résultat.
Ce guide de prompts MiniMax H3 transforme ce principe en format reproductible. Vous apprendrez à associer chaque asset à un rôle, empêcher les références de se contredire, rédiger des règles de préservation et découper une génération de 4–15 secondes en temps chronométrés. Les six modèles de fin couvrent la vidéo produit, le mouvement de personnage, le dialogue, le montage vidéo, le mouvement d'UI et les transitions de première à dernière frame.
Note
Ce guide de prompts est fondé sur la documentation, non sur un rapport de générations H3 testées par OmniArt. Il s'appuie sur le guide de génération H3 actuel de MiniMax et sa référence API officielle. H3 n'est pas actuellement confirmé dans le catalogue de modèles source de vérité d'OmniArt au 31 juillet 2026. Les libellés d'interface et la syntaxe des références peuvent aussi différer entre les propres surfaces de MiniMax et les hôtes en aval.
MiniMax H3, Hailuo 3.0 ou Hailuo 03 ?
La documentation actuelle de MiniMax appelle le modèle MiniMax H3 et donne MiniMax-H3 comme identifiant officiel du modèle API. Vous pourrez aussi rencontrer Hailuo 3.0, Hailuo 03 ou Hailuo-3.0 dans la couverture du lancement et les catalogues tiers, car Hailuo est la marque de produit vidéo de MiniMax.
Utilisez le libellé imposé par la surface devant vous. Pour l'API V2 officielle de MiniMax documentée à la publication, cela signifie MiniMax-H3 ; ne supposez pas qu'un alias de marketplace soit aussi un identifiant API officiel valide. Ce guide emploie MiniMax H3 pour le modèle et génération par référence pour le mode combinant entrées image, vidéo et audio. « Omni reference » décrit utilement ce workflow de médias mixtes, mais l'API officielle l'appelle reference-to-video.
Connaître les trois modes de génération H3
Choisir le bon mode précède l'écriture du prompt.
| Mode | Entrées | À utiliser lorsque |
|---|---|---|
| Text-to-video | Prompt texte obligatoire | La scène peut être créée à partir de la seule description |
| First/last-frame image-to-video | Prompt obligatoire plus une première frame, une dernière frame ou les deux | Une composition d'ouverture ou de fin exacte importe |
| Reference generation | Prompt obligatoire plus images, vidéos ou audio de référence | Vous avez besoin d'identité, design, mouvement, caméra, voix, rythme ou style venant d'assets téléversés |
La spécification officielle actuelle indique une sortie 2K et des durées entières de 4 à 15 secondes. Chaque demande exige un prompt texte non vide, limité à 7,000 caractères. Une demande de référence peut inclure jusqu'à neuf images, trois vidéos et trois extraits audio, pour 12 assets au total au plus. Les vidéos de référence sont limitées à 15 secondes cumulées, tout comme les extraits audio. Une référence audio ne peut pas être envoyée seule : elle doit accompagner au moins une image ou vidéo.
Text-to-video exige un ratio d'aspect concret. La génération par référence peut employer un ratio concret ou laisser H3 le choisir de façon adaptative, tandis que la génération de première/dernière frame suit l'image téléversée. Les ratios documentés sont 21:9, 16:9, 4:3, 1:1, 3:4 et 9:16.
Il existe une limite ferme de workflow : le mode première/dernière frame et la génération par référence ne peuvent pas être mélangés dans la même demande API. Si des frames limites exactes sont essentielles, utilisez le mode première/dernière frame. Si l'identité, le mouvement, le style ou le transfert audio comptent davantage, utilisez la génération par référence et décrivez la composition d'ouverture dans le texte.
Construire un prompt H3 comme une carte de rôles
L'API H3 reçoit les médias comme éléments typés dotés de rôles tels que reference_image, reference_video et reference_audio. Ces rôles techniques identifient le type de média ; votre prompt doit aller plus loin et énoncer la responsabilité créative de chaque asset.
Utilisez cet ordre :
DELIVERABLE
What the final clip is for, its duration, and its format.
ROLE MAP
Reference image 1 = subject identity and immutable appearance.
Reference image 2 = environment or visual style only.
Reference video 1 = body motion and timing only.
Reference audio 1 = rhythm and edit timing only.
SHOT
Subject, action, environment, lighting, and camera direction.
TIMELINE
Time-coded beats that add up to the selected duration.
PRESERVE
Features that must remain unchanged from named references.
EXCLUDE
A short list of the most damaging unwanted changes.
Les étiquettes numérotées ci-dessus sont des étiquettes sémantiques pour votre brief, non la promesse que chaque interface H3 présente littéralement des poignées Reference image 1. Dans l'API officielle, les fichiers sont des éléments séparés du tableau content. Dans une interface visuelle, employez les noms de pièces jointes ou la syntaxe de mention proposés, en conservant la logique un asset, une fonction.
Donner à chaque asset une fonction principale
Une référence contient davantage d'informations que vous ne souhaitez généralement transférer. Un extrait de danse contient un interprète, des vêtements, un lieu, une caméra, un éclairage, un mouvement et peut-être de la musique. Si vous demandez à H3 de « suivre la vidéo », toutes ces caractéristiques rivalisent avec votre image de personnage.
Associez-les plus étroitement :
- Référence image : identité, visage, tenue, géométrie produit, logo, palette ou design d'environnement.
- Référence vidéo : mouvement du corps, trajectoire de caméra, timing d'action, interaction physique ou rythme de montage.
- Référence audio : caractère vocal, cadence, rythme musical, ambiance ou signal d'événement.
- Prompt texte : scène finale, règles de transfert, timeline, priorités et instructions de préservation.
Lorsqu'un asset doit exercer deux fonctions, nommez-les et explicitez la frontière : « Reference video 1 controls camera path and action timing; ignore its performer, wardrobe, location, color grade, and audio. »
Empêcher les références de se combattre
Le conflit entre références est généralement un problème d'instruction avant d'être un problème de modèle. Deux images peuvent montrer des vestes différentes, un extrait de mouvement peut utiliser un type de corps différent, ou un rythme audio peut impliquer des coupes incompatibles avec un mouvement de caméra ininterrompu demandé.
Utilisez un ordre de priorité écrit lorsque les entrées se recoupent :
Priority order:
1. Reference image 1 controls character identity and wardrobe.
2. Reference video 1 controls movement and timing only.
3. Reference image 2 controls lighting palette and set design only.
4. The text prompt controls camera framing and final composition.
Résolvez ensuite les contradictions plutôt que d'espérer que H3 devine votre préférence. Si l'image d'identité montre des cheveux lâchés mais que la vidéo de mouvement comporte un chapeau, indiquez si le personnage final conserve les cheveux ou porte le chapeau. Si une référence produit montre une étiquette lisible mais que l'image de style est picturale, précisez que la stylisation s'applique à l'environnement tandis que l'emballage reste photoréaliste.
Trois habitudes réduisent les conflits :
- Utilisez le plus petit ensemble de références utile. Davantage d'entrées créent davantage de désaccords possibles. N'ajoutez un fichier que s'il apporte une information que le prompt ne peut exprimer fiablement.
- Séparez contenu et style. Nommez la référence qui possède le sujet et celle qui possède le traitement.
- Choisissez une seule autorité de caméra. Transférez la caméra d'une vidéo ou dirigez-la dans le texte. Si vous avez besoin des deux, indiquez que la vidéo fournit le timing tandis que le texte remplace le cadrage.
Pour un workflow plus large symptôme par symptôme, gardez 7 correctifs de prompts vidéo IA à côté de ce guide pendant vos itérations.
Écrire des instructions de préservation vérifiables
« Gardez la cohérence » est trop vague. Un bloc de préservation doit nommer des propriétés visibles que vous pouvez inspecter dans n'importe quelle frame.
Pour un personnage :
Preserve from reference image 1 throughout every frame: facial structure,
eye color, hairstyle and length, jacket cut, jacket color, and body proportions.
Do not replace the performer with the person from reference video 1.
Pour un produit :
Preserve from reference image 1: bottle silhouette, cap shape, label placement,
navy wordmark, coral seal, material finish, and relative proportions.
No duplicate product, redesigned packaging, extra text, or changing logo.
Les ancrages positifs doivent venir d'abord ; les exclusions sont un garde-fou, non le prompt entier. Gardez la liste négative courte et précise. Dix interdictions vagues peuvent diluer les quatre invariants qui déterminent réellement si une prise est exploitable.
Si le même personnage doit apparaître dans plusieurs extraits générés séparément, gardez le bloc identité et tenue identique dans chaque prompt. Le workflow de personnages cohérents explique comment construire ce paquet de références réutilisable sur une séquence plus longue.
Diriger le temps, pas seulement le contenu
H3 accepte des extraits de 4 à 15 secondes, mais un long paragraphe ne dit pas au modèle quand chaque événement survient. Une timeline transforme le prompt en plan de tournage compact.
Pour un extrait de 10 secondes :
0–2 seconds: locked medium-wide establishing shot; subject holds still.
2–6 seconds: subject performs the referenced action at the source tempo.
6–9 seconds: camera makes one slow 20-degree arc to the right.
9–10 seconds: subject settles; hold a clean final composition for the edit.
Gardez chaque temps réalisable. Une action principale et un mouvement de caméra sont généralement plus clairs qu'une chaîne de transformations sans rapport. Faites correspondre les plages de temps à la durée choisie, placez les détails importants du produit ou du visage dans un temps plus lent et réservez la dernière demi-seconde ou seconde à un point de montage stable.
L'audio peut partager la même horloge :
At 2.0 seconds, the first downbeat starts the hand movement.
At 6.0 seconds, the bass hit motivates the camera arc.
From 9.0 seconds, let the music tail continue under the held final frame.
Pour davantage de vocabulaire de lentille, lumière et caméra, consultez le guide de prompts vidéo IA cinématographiques.
Six modèles de prompts MiniMax H3
Remplacez les détails entre crochets, joignez uniquement les assets listés et adaptez les étiquettes à votre interface. Ces modèles sont des points de départ structurés basés sur les modes d'entrée H3 documentés ; ils ne prétendent pas être des vainqueurs de benchmark ni garantir des sorties.
Modèle 1 : révélation produit avec références de mouvement et de musique
- Mode : Génération par référence
- Assets : Une image produit propre, une vidéo de mouvement de caméra, référence musicale facultative
Create a 10-second 9:16 product reveal for a paid social placement.
Role map:
- Reference image 1 controls the product's exact design, proportions, packaging,
colors, materials, label placement, and wordmark.
- Reference video 1 controls camera path and acceleration only. Ignore its subject,
location, lighting, color grade, and audio.
- Reference audio 1 controls beat and edit timing only.
Scene: The product stands centered on a warm-violet studio plinth. Soft lilac key
light from camera left, restrained coral rim light, subtle atmospheric haze.
Timeline:
- 0–2 seconds: static wide reveal on the first soft beat.
- 2–7 seconds: transfer the smooth push-and-arc movement from reference video 1.
- 7–9 seconds: one narrow highlight travels across the product surface.
- 9–10 seconds: camera settles; hold the label front-facing and readable.
Preserve reference image 1 exactly: silhouette, cap, material finish, label layout,
brand colors, and wordmark. Keep one product only. No redesigned packaging,
duplicate objects, extra text, warped label, or abrupt camera shake.
Pour la préparation d'image fixe qui précède ce prompt, utilisez le workflow photo-vers-vidéo de produit.
Modèle 2 : transfert de mouvement de personnage sans dérive d'identité
- Mode : Génération par référence
- Assets : Une image de personnage, une vidéo de mouvement, image d'environnement facultative
Create an 8-second 16:9 cinematic character performance.
Priority order:
1. Reference image 1 controls face, hair, body proportions, and wardrobe.
2. Reference video 1 controls body choreography and action timing only.
3. Reference image 2 controls the environment palette and architecture only.
4. This prompt controls framing and lighting.
The character from reference image 1 performs the complete movement from reference
video 1 in a moonlit station based on reference image 2. Medium full shot, camera
locked at chest height, soft directional light, realistic weight and foot contact.
Timeline:
- 0–1 seconds: character holds the starting pose.
- 1–7 seconds: perform the reference choreography once at its original tempo.
- 7–8 seconds: settle naturally and look toward camera left.
Preserve facial structure, hairstyle, coat shape, coat color, boots, and body
proportions from reference image 1 in every frame. Do not inherit the motion video's
performer, face, clothing, background, camera movement, or audio. No extra limbs,
sliding feet, costume changes, or cuts.
Modèle 3 : interprétation de dialogue avec référence vocale
- Mode : Génération par référence
- Assets : Une image de personnage, un extrait audio de voix ou de dialogue autorisé
Avertissement
Ne téléversez qu'une voix qui vous appartient ou que vous avez l'autorisation explicite d'utiliser. Le fait qu'un modèle accepte l'audio de référence ne vous donne pas le droit d'imiter la voix d'une autre personne.
Create a 9-second 16:9 single-character dialogue shot.
Role map:
- Reference image 1 controls the speaker's appearance, wardrobe, and room design.
- Reference audio 1 controls spoken timing, cadence, emotional progression, and pauses.
Shot: Medium close-up, eye-level, 50 mm cinematic framing. The speaker begins calm,
briefly smiles after the central pause, then finishes with quiet confidence. Natural
blinks and restrained hand movement. Camera remains static; soft room tone underneath.
Timeline:
- 0–1 seconds: silent eye contact and a small inhale.
- 1–8 seconds: performance follows reference audio 1 exactly in timing and pauses.
- 8–9 seconds: mouth closes, expression settles, hold for the edit.
Preserve face, hairstyle, skin tone, jacket, background layout, and lighting direction
from reference image 1. Keep one speaker. No camera move, cutaway, background speech,
new words, exaggerated gestures, or wardrobe changes.
Modèle 4 : remplacer l'environnement d'une vidéo source
- Mode : Génération par référence
- Assets : Une vidéo source, une image d'environnement, image du sujet facultative
Create a 12-second 16:9 environmental replacement based on the source clip.
Role map:
- Reference video 1 controls shot length, subject action, physical timing, camera path,
framing progression, and interaction with the ground.
- Reference image 1 controls the replacement environment, architecture, palette,
weather, and lighting mood.
- Reference image 2 controls the subject's face and wardrobe, if supplied.
Replace the source video's location with the environment from reference image 1.
Preserve the original action and camera movement continuously. Match subject lighting,
contact shadows, reflections, and atmospheric perspective to the new environment.
Timeline follows reference video 1. Maintain one continuous shot with the original
action beats and no added event.
Preserve the source subject's position, scale, motion, and ground contact. Preserve
identity and wardrobe from reference image 2 when present. Do not copy the original
background, signage, bystanders, color grade, or source audio. No cuts, teleporting,
floating feet, or changing architecture.
Modèle 5 : mouvement d'UI de marque synchronisé à un temps fort
- Mode : Génération par référence
- Assets : Une image de mise en page UI, une vidéo de style de mouvement, référence audio facultative
Create a 7-second 1:1 UI motion-design clip for a product announcement.
Priority order:
1. Reference image 1 controls exact layout, hierarchy, component positions, text,
logo, colors, corner shapes, and typography appearance.
2. Reference video 1 controls transition character and easing only.
3. Reference audio 1 controls the timing of three motion beats only.
Animate the interface from reference image 1 without redesigning it. Begin with the
main panel at rest. Use the restrained slide-and-scale transition quality from
reference video 1. Keep the camera orthographic and the background static.
Timeline:
- 0–1 seconds: complete layout at rest.
- 1–3 seconds: cards enter in sequence on beat one.
- 3–5 seconds: primary control changes state on beat two.
- 5–6 seconds: one subtle emphasis pulse on beat three.
- 6–7 seconds: complete interface holds sharp and readable.
Preserve every word, logo shape, component proportion, spacing relationship, and brand
color from reference image 1. No invented labels, misspelled text, extra panels,
perspective tilt, camera movement, glow overload, or elastic distortion.
Modèle 6 : transformation exacte de première à dernière frame
- Mode : Image-vers-vidéo de première/dernière frame
- Assets : Une image de première frame et une image de dernière frame ; aucun média de référence
Create a 10-second transformation from the supplied first frame to the supplied last
frame. Preserve the subject's identity and the camera's fixed position throughout.
Timeline:
- 0–2 seconds: hold the first-frame composition; only subtle ambient movement.
- 2–7 seconds: the scene transforms progressively from the center outward. Materials
change continuously with believable physical contact and no hard cut.
- 7–9 seconds: remaining details resolve into the last-frame design.
- 9–10 seconds: arrive exactly at the supplied last frame and hold it cleanly.
One continuous locked shot. Preserve subject scale, face, silhouette, horizon, lens,
and framing during the transition. No reference-style transfer, new characters,
camera movement, jump cut, flicker, or overshoot beyond the final composition.
Ne joignez pas à cette demande les images, vidéos ou audio de référence des autres modèles. L'API officielle traite la génération de première/dernière frame et la génération par référence comme des modes mutuellement exclusifs.
Un ordre d'itération pratique
Ne modifiez pas identité, mouvement, caméra, style et instructions audio après un seul rendu décevant. Il devient alors impossible de savoir quelle instruction a aidé.
Itérez en trois passes :
- Verrouillez les rôles et invariants. Utilisez le plus petit ensemble de références et vérifiez que le sujet ou produit reste reconnaissable.
- Verrouillez l'action et la timeline. Ajoutez la source de mouvement ou les temps chronométrés en gardant le style simple.
- Ajoutez le traitement. Introduisez environnement, éclairage, grade, indices audio et détails de finition après stabilisation des deux premières couches.
Quand un résultat dérive, simplifiez avant d'ajouter davantage de langage négatif. Retirez la référence la moins importante, raccourcissez la timeline ou donnez à une source une fonction plus étroite. Comparez plusieurs variantes avec la même liste de contrôle : identité, géométrie, mouvement, caméra, timing audio et stabilité de la frame finale.
Démarrer depuis OmniArt
MiniMax H3 n'est pas actuellement confirmé comme sélectionnable dans OmniArt ; cet article ne lie donc pas une route de création H3 et ne revendique pas de workflow OmniArt H3. Consultez la gamme actuelle de modèles vidéo OmniArt pour les modèles disponibles aujourd'hui.
La méthode de carte de rôles se transpose néanmoins aux modèles vidéo pilotés par références pris en charge : préparez une image d'identité, une source de mouvement et un court bloc de préservation avant d'ouvrir l'espace de travail. Gardez le prompt neutre vis-à-vis du modèle jusqu'à stabilisation du brief créatif, puis adaptez les étiquettes de pièces jointes et la syntaxe propre à la fonctionnalité du modèle réellement choisi. Vous obtenez ainsi une feuille de direction réutilisable aujourd'hui et un prompt H3 propre si le modèle rejoint OmniArt plus tard.
Pour les tarifs API officiels, la facturation des vidéos de référence et des exemples de coûts détaillés, consultez le guide des tarifs et spécifications MiniMax H3. Il s'appuie sur la page de tarifs de MiniMax plutôt que sur un tarif de revendeur.
Prêt à créer ?
Commencez à générer du contenu incroyable avec l’IA