guideTutoriels et guides pratiques16 min de lecture

Guide de l'audio natif MiniMax H3 : dialogue, musique et synchronisation

Apprenez à prompter l'audio stéréo natif de MiniMax H3 pour le dialogue, l'ambiance, la musique, les références vocales et la synchronisation, avec un plan de test reproductible.

Équipe OmniArt
Guide de l'audio natif MiniMax H3 : dialogue, musique et synchronisation

L'audio natif de MiniMax H3 fait de la bande-son une partie du brief de génération, au lieu d'un fichier ajouté automatiquement une fois l'image terminée. MiniMax indique que H3 comprend conjointement le texte, les images, la vidéo et l'audio, puis génère des vidéos avec un son stéréo natif. Son périmètre d'entraînement traite également voix, effets sonores et musique comme un même domaine audio plutôt que comme des outils séparés.

Il s'agit d'un changement de workflow important, mais pas de la promesse que chaque réplique sera parfaite, que chaque pas tombera sur la bonne frame ou que chaque mix stéréo sera prêt à publier. Ce guide distingue les capacités H3 documentées par MiniMax des tests de production que les créateurs doivent effectuer. Il propose une structure pratique de brief sonore, un workflow de référence audio, cinq modèles de prompts et une grille d'évaluation reproductible, sans présenter les démos officielles comme des résultats indépendants.

Ce que MiniMax documente officiellement sur l'audio H3

MiniMax décrit H3 comme un modèle vidéo multimodal généraliste, et non comme un générateur de vidéo muette doté d'une passe son distincte. Les supports de lancement de l'entreprise indiquent que le modèle génère de l'audio stéréo natif et modélise conjointement voix, effets sonores et musique. MiniMax montre aussi un prompt combinant le mouvement de caméra d'une vidéo, un personnage d'une image et des voix assorties à une référence audio.

Le guide officiel de génération vidéo H3 définit les limites API actuelles :

Capacité documentéeCe que cela signifie pour un créateur
Audio stéréo natifH3 peut retourner une bande-son à deux canaux avec la vidéo générée
Audio comme contexte multimodalUn extrait audio peut guider la voix, le mouvement, le rythme de montage ou une autre relation décrite dans le prompt
Jusqu'à trois références audioChaque extrait peut durer 2–15 secondes, avec 15 secondes maximum pour toutes les références audio
Références mixtesL'audio peut être combiné avec des images et vidéos dans une demande reference-to-video
Entrée WAV et MP3L'audio de référence doit utiliser l'un des formats d'entrée documentés
Sortie de 4–15 secondesH3 est conçu pour de courts extraits, pas pour une bande-son longue complète en une génération

Trois contraintes sont importantes. Une référence audio ne peut pas être envoyée seule ; MiniMax exige au moins une image ou une vidéo à ses côtés. Les fichiers audio sont limités à 15 MB chacun et la demande complète de références mixtes est limitée à 12 assets. Le mode référence ne peut pas non plus être combiné au mode première ou dernière frame dans une même demande : choisissez donc si des frames limites exactes ou un conditionnement multimodal plus large comptent le plus pour le plan.

Note

La stéréo n'est pas la même chose que l'audio spatial. MiniMax documente une sortie stéréo native, mais ses documents publics actuels ne promettent ni surround, ni ambisonie, ni audio orienté objet, ni un niveau particulier de précision positionnelle. Évaluez le placement gauche-droite au casque avant de qualifier un résultat de spatial.

Construire le brief sonore avant d'écrire le prompt

Le prompt H3 le plus utile n'est pas une longue liste de sons. C'est un plan sonore compact qui indique au modèle ce qui doit dominer, ce qui doit soutenir et ce qui doit arriver à un moment visible. Écrivez le plan en cinq passes.

1. Verrouiller l'action visuelle et le timing

La synchronisation audio dépend des événements visibles. Commencez par le plan, l'action du sujet, le mouvement de caméra et la séquence des temps forts. « Une cuillère touche la soucoupe lorsque la caméra s'immobilise » donne au modèle un événement audiovisuel partagé. « Ajoutez un son de tasse » ne dit ni quand l'événement doit survenir ni ce qui doit le provoquer.

Pour un extrait de 10 secondes, une carte simple des temps peut être :

  • 0–3 secondes : installation de la pièce et du sujet
  • 3–7 secondes : dialogue ou action principale
  • 7–10 secondes : révélation du produit et indice sonore final

Considérez ces timings comme une direction, non comme des marqueurs de montage précis à la frame. Un test de production devrait mesurer avec quelle précision la sortie les suit.

2. Nommer une couche audio principale

Choisissez le son que le public doit remarquer en premier : dialogue, interaction avec un produit, motif musical ou son d'environnement. Formulez-le le plus clairement possible et protégez de l'espace autour de lui.

Si le dialogue est principal, écrivez la réplique exacte entre guillemets et indiquez une direction de jeu. Si le son du produit est principal, décrivez l'action physique qui le crée. Si la musique est principale, indiquez le tempo, l'instrumentation, l'ambiance et le moment où l'arrangement doit changer.

3. Ajouter l'ambiance comme un lieu acoustique

L'ambiance doit expliquer où se déroule le plan. Au lieu de « sons de café », décrivez le sifflement discret d'une machine à espresso derrière le locuteur, de faibles conversations et une clochette de porte au loin. Pour un spot produit propre, demandez une tonalité de studio contrôlée plutôt que le silence, sauf si le silence est un choix créatif délibéré.

Employez des mots de distance et de matière applicables à l'image comme au son :

  • proche, sec, intime et légèrement réverbérant
  • lointain, étouffé à travers une vitre ou hors champ à gauche
  • pas sur du carrelage, froissement de tissu, pluie sur du métal ou verre posé sur du bois

4. Décider si la musique est une partition ou une source

La partition se situe hors de la scène ; la musique source provient d'un objet ou d'un lieu de la scène. Précisez ce que vous voulez. « Une partition électronique retenue sous le dialogue » demande une couche d'arrière-plan, tandis que « de la musique jouée doucement par la radio du café, légèrement étouffée » lui donne une source acoustique à l'écran.

Lorsque la musique n'est pas nécessaire, indiquez no music. Cela rend un test de dialogue ou de Foley plus facile à évaluer. Lorsqu'elle est nécessaire, laissez de la marge à la voix au lieu de demander à chaque couche d'être forte et dramatique.

5. Énoncer les exclusions

Une direction audio négative est utile lorsqu'elle protège le brief. Exemples : no narration, no crowd cheering, no added melody et no exaggerated whooshes. Gardez la liste courte ; trop de contraintes peuvent concurrencer l'action recherchée.

Utiliser les références audio sans confondre leur rôle

Le système de références de H3 est particulièrement utile lorsque chaque asset n'a qu'une fonction. Un extrait audio de référence peut fournir le timbre et la cadence vocale, l'énergie musicale, une texture sonore ou le rythme de montage. Ne supposez pas que le modèle sait quelle propriété emprunter.

Écrivez une carte des assets avant le prompt final :

AssetRôle attribuéCe qui ne doit pas être transféré
Image de personnageIdentité, tenue et placement du produitArrière-plan et éclairage
Vidéo de mouvementGeste et timing de caméraIdentité du personnage et dialogue
Audio de voixCaractère vocal, cadence et énergie émotionnelleMots d'origine et bruit de fond
Audio de musiqueTempo, densité de l'arrangement et rythme de montageMélodie ou paroles reconnaissables

Décrivez ensuite ces relations en langage naturel. L'exemple H3 de MiniMax attribue le mouvement de caméra à une référence vidéo, l'interprète à une image et les voix à une référence audio. Les libellés d'assets numérotés varient selon l'interface, tandis que l'API emploie du contenu typé et des rôles de référence : remplacez donc les étiquettes des modèles ci-dessous par la notation exacte de votre workflow.

Avertissement

N'utilisez la voix ou la performance d'une personne comme référence qu'avec son autorisation. Une référence vocale ne prouve pas que vous détenez l'identité du locuteur, l'enregistrement, la musique ou le droit de publier une imitation générée.

Des références propres produisent des expériences plus propres. Coupez les silences, retirez les musiques de fond sans rapport, évitez l'écrêtage et rendez le passage vocal ou musical pertinent facile à entendre. Utilisez un court segment qui démontre la propriété recherchée plutôt que de téléverser la durée maximale par défaut.

Cinq modèles de prompts audio natif MiniMax H3

Ce sont des briefs de départ, pas des résultats de test revendiqués. Exécutez chaque prompt plus d'une fois et notez les sorties avec le protocole de la section suivante.

1. Dialogue à un locuteur avec tonalité de pièce

Gros plan d'une cheffe au passe dans une cuisine de restaurant calme après le service. La caméra avance lentement lorsqu'elle regarde un collègue hors champ et dit : « On réessaie demain. » Interprétation : fatiguée mais discrètement optimiste, rythme naturel, une courte inspiration avant « demain ». Sa voix est la couche audio principale, proche et sèche. Un faible bourdonnement de ventilation et quelques sons lointains de métal qui refroidit restent distants. Pas de musique, pas de narration, aucune autre voix.

Utilisez ce modèle pour évaluer l'exactitude de la parole, l'interprétation émotionnelle, le mouvement de bouche et la capacité de l'ambiance à rester derrière la réplique.

2. Ambiance en couches avec Foley synchronisé

Plan large dans une laverie presque vide la nuit, lumière fluorescente reflétée sur le sol carrelé. Une personne déplace une veste mouillée du lave-linge vers un panier roulant ; la porte métallique se ferme avec un clic exactement lorsque sa main la ferme, puis les roues du panier vibrent doucement sur le carrelage. Premier plan : mouvement du tissu et clic de la porte. Plan moyen : rotation régulière du lave-linge. Arrière-plan : pluie contre la vitrine et une voiture lointaine qui passe dehors. Mix stéréo natif, sans dialogue ni musique.

Ce brief isole l'ambiance, le réalisme des matériaux, la séparation gauche-droite et la synchronisation au contact.

3. Révélation produit menée par la musique

Film produit vertical de dix secondes pour une gourde de sport corail translucide sur une surface de studio lilas. Commencez par une macro de condensation, puis orbitez pendant que la gourde s'élève à la position héro. Partition électronique minimaliste originale à 100 BPM : pulsation douce au début, accent percussif net lorsque le logo fait face à la caméra, puis courte note finale résolue. Ajoutez de subtiles gouttelettes et un son de pose contrôlé. La musique soutient les sons du produit au lieu de les masquer. Pas de voix ni boom cinématographique de stock.

Pour une planification visuelle propre au produit au-delà de la bande-son, utilisez le workflow photo-vers-vidéo de produit.

4. Référence vocale autorisée avec nouveau dialogue

Utilisez la référence vocale 1 uniquement pour le timbre vocal du narrateur, son débit et son énergie chaleureuse de conversation. Ne réutilisez ni ses mots ni son bruit de fond. La personne de l'image de référence 1 se tient près de la fenêtre et dit : « Le premier brouillon n'est que le début. » Gardez la réplique intelligible et synchronisée au locuteur visible. Ajoutez une tonalité résidentielle calme et une pluie douce à l'extérieur. Pas de musique. L'enregistrement vocal est autorisé pour cet usage.

Testez si les qualités vocales recherchées se transfèrent sans copier involontairement le bruit, le phrasé ou le contenu de l'enregistrement source. Décrivez les qualités voulues avec des mots afin que l'instruction reste utile même si l'adhérence à la référence varie.

5. Référence rythmique pour un montage social

Créez un montage de 12 secondes d'une céramiste qui façonne, émaille puis pose une tasse terminée sur une étagère. Utilisez la référence audio 1 uniquement pour le tempo, l'énergie rythmique et le rythme de montage. Composez une piste percussive originale avec une mélodie et un design sonore différents. Coupez l'action visuelle sur les changements rythmiques majeurs : l'argile tombe sur le tour, le pinceau touche l'émail, la tasse atteint l'étagère. Préservez la rotation naturelle du tour, la texture du pinceau et le dernier tintement de céramique sous la musique. Pas de dialogue.

Cela sépare le conditionnement rythmique de la copie musicale et fournit trois points de synchronisation visibles à inspecter.

Un plan d'évaluation audio H3 reproductible

Une démo officielle soignée ne peut pas répondre à la question de savoir si un modèle convient à votre workflow de production. Utilisez le même brief pour au moins trois générations, gardez durée et références fixes, et notez chaque sortie plutôt que de ne sélectionner que la plus forte.

Tester d'abord les couches séparément

Commencez par quatre prompts contrôlés :

  1. Dialogue et faible tonalité de pièce uniquement
  2. Ambiance et trois événements Foley visibles, sans parole ni musique
  3. Musique instrumentale avec deux accents visuels planifiés
  4. Une référence audio autorisée associée à une simple référence d'image ou de vidéo

Ce n'est qu'après leur réussite que vous devriez combiner dialogue, ambiance, Foley et musique dans une scène dense. Ainsi, les échecs sont diagnostiquables : vous pouvez déterminer si le problème vient de la prononciation, du timing, du transfert de référence ou de la densité du mix.

Utiliser une grille, pas une impression

DimensionQuestionMesure simple
Exactitude du dialogueLes mots demandés ont-ils été prononcés correctement ?Mots corrects divisés par mots demandés
Synchronisation labialeFermetures de bouche et accents syllabiques visibles sont-ils alignés ?Note de 1–5 et première dérive visible
Synchronisation des événementsLes sons de contact tombent-ils avec l'action à l'image ?Frames d'avance ou de retard sur trois indices planifiés
Cohérence vocaleLe locuteur reste-t-il reconnaissable pendant la réplique ?Noter séparément début, milieu et fin
Contrôle de référenceLa propriété demandée s'est-elle transférée sans bagage indésirable ?Lister transferts voulus et non voulus
Image stéréoLes placements gauche-droite sont-ils utiles et stables ?Vérification au casque et de la forme d'onde des canaux
Hiérarchie du mixLa couche principale reste-t-elle nettement intelligible ?Note de 1–5 au niveau de lecture normal
ReproductibilitéÀ quelle fréquence l'extrait est-il exploitable sans réparation audio ?Sorties exploitables divisées par nombre total d'essais

Inspectez le fichier exporté dans un éditeur vidéo ou une station audio. Confirmez que deux canaux existent, écoutez les problèmes de phase en mono et comparez les formes d'onde autour des événements de contact planifiés. Ne déduisez pas la qualité audio d'un aperçu sur une plateforme sociale, qui peut recompresser ou remapper la bande-son.

Astuce

Conservez les générations ratées. Une révision de prompt n'est une amélioration que si elle augmente le taux de sorties exploitables sur des essais répétés, pas si elle produit un seul extrait chanceux.

Limites à anticiper

Le billet de lancement de MiniMax indique lui-même que H3 peut encore progresser et cite le détail visuel comme un axe de travail futur. Pour la production audio, la documentation publique actuelle laisse aussi plusieurs questions ouvertes. Elle ne publie aucune garantie sur le taux d'erreur des mots, la précision de la synchronisation labiale, le loudness, la fréquence d'échantillonnage, la disposition des canaux au-delà de la stéréo, la couverture linguistique, la similarité de référence vocale ou le contrôle des indices au niveau du timecode.

Planifiez autour de ces limites pratiques :

  • Sortie courte : 4–15 secondes convient aux plans, publicités et extraits sociaux, mais la continuité long format exige un montage entre générations.
  • Contexte de référence court : Jusqu'à trois extraits audio sont autorisés, mais leur durée cumulée ne peut dépasser 15 secondes.
  • Pas de demande de référence audio seule : Une référence audio doit être associée à au moins une image ou vidéo.
  • Le timing en langage naturel n'est pas une timeline verrouillée : Considérez les temps comme une intention jusqu'à ce que des tests répétés prouvent la précision nécessaire.
  • La stéréo doit être vérifiée : Deux canaux ne créent pas automatiquement une direction, une profondeur ou une compatibilité mono crédibles.
  • Les mix denses peuvent masquer les erreurs : Dialogue, effets, ambiance et musique peuvent être modélisés ensemble, mais un brief simple est plus facile à contrôler et réparer.
  • Les droits sur les références s'appliquent toujours : La capacité du modèle n'accorde pas la permission d'imiter une voix ou réutiliser une musique protégée.

La disponibilité, les contrôles d'interface et la facturation peuvent aussi évoluer. Les tarifs officiels actuels de MiniMax affichent le matériel de référence audio sans frais d'entrée distincts, alors que la sortie vidéo et certains autres matériaux de référence suivent leurs propres règles. Consultez la page officielle des tarifs de paiement à l'usage avant de budgéter une production API ; ne remplacez pas le tarif MiniMax par celui d'un hôte tiers. Le guide des tarifs et spécifications H3 détaille les tarifs officiels MiniMax et les coûts de matériel de référence. Le catalogue actuel de modèles OmniArt ne confirme pas la disponibilité de H3 ; ce guide n'affirme donc pas que H3 peut déjà être généré dans OmniArt.

Construire le reste de la bande-son dans OmniArt

L'audio natif peut réduire les transferts, mais n'élimine pas la valeur d'outils sonores séparés. Si une prise H3 a la bonne image mais une narration faible, conservez l'image et créez une piste vocale contrôlée. Si le dialogue fonctionne mais que la pièce manque de texture, ajoutez une couche d'ambiance ou de Foley plutôt que de régénérer le plan entier.

OmniArt réunit les workflows vidéo, parole, son et musique dans un même espace créatif. Utilisez le guide du générateur d'effets sonores IA pour concevoir un Foley et une ambiance de remplacement, ou comparez l'approche de prompting avec le guide de l'audio spatial Veo 3.1. L'objectif n'est pas de forcer chaque son dans une génération : conservez la piste native lorsqu'elle fonctionne et remplacez uniquement la couche défaillante.

Découvrez les workflows de création vidéo sur OmniArt

Prêt à créer ?

Commencez à générer du contenu incroyable avec l’IA

Commencer gratuitement