tutorialTutoriels et guides pratiques11 min de lecture

Installer la skill de prompts MiniMax H3 pour agents

Installez la skill de prompts MiniMax H3, choisissez le bon mode vidéo et convertissez vos briefs en structures base ou Ref2VA exactes pour les agents.

Équipe OmniArt
Installer la skill de prompts MiniMax H3 pour agents

La skill de rédaction de prompts MiniMax H3 donne à un agent d’IA une méthode définie pour transformer une demande créative en prompt audiovisuel prêt pour H3. Au lieu de laisser l’agent improviser un format, vous installez une skill, identifiez le mode de génération et obtenez les champs et libellés de référence attendus par ce mode.

Ce tutoriel porte sur l’installation et l’utilisation de la skill, pas sur l’ensemble des techniques de prompting H3. Il suit les fichiers du dépôt officiel MiniMax-H3, notamment la skill h3-prompt-writing, son guide des modes de base et son guide de référence complète. Pour approfondir les rôles des références, les règles de conservation et les prompts de production, consultez séparément le guide des prompts MiniMax H3.

Installer la skill de rédaction de prompts MiniMax H3

Dans le projet où vous utilisez votre agent de programmation ou de création par IA, exécutez la commande d’installation d’une seule skill publiée dans le dépôt MiniMax :

npx skills add https://github.com/MiniMax-AI/MiniMax-H3 --skill h3-prompt-writing

Cette commande installe uniquement h3-prompt-writing. Le dépôt regroupe aussi huit skills de génération vidéo propres à des styles précis ; la sélection par nom garde cette installation centrée sur la rédaction de prompts.

La skill installée contient deux guides de référence :

  • references/base-en.txt couvre T2VA, I2VA, FL2VA et L2VA.
  • references/ref-en.txt couvre le mode Ref2VA à référence complète.

Cette séparation compte davantage que le sujet du clip. L’agent choisit le guide selon la relation entre les fichiers d’entrée, puis conserve ses noms de champs, l’ordre des sections, les libellés et la notation temporelle.

Choisir le mode de tâche H3 avant la réécriture

Indiquez explicitement le mode à l’agent lorsque vous le connaissez. Sinon, décrivez les images limites et les fichiers de référence disponibles afin qu’il classe la demande.

ModeEntrées et relationRésultat que la skill doit produire
T2VATexte uniquementUne chronologie audiovisuelle complète issue du brief
I2VAPremière image fournieUn parcours partant exactement de cette image
FL2VAPremière et dernière images fourniesUn parcours continu reliant les deux images limites
L2VADernière image fournieUn début plausible convergeant vers l’image finale
Ref2VAImages ou vidéos de référence, avec audio facultatifUne analyse et une description en six sections

T2VA, I2VA, FL2VA et L2VA sont les modes de base de la skill. Ils partagent un corps à trois champs. I2VA, FL2VA et L2VA ajoutent une instruction d’alignement exacte au-dessus ; T2VA commence directement par le premier champ.

Ref2VA n’est pas le même template avec davantage de pièces jointes. Il possède un contrat distinct en six sections pour définir les références, classer leurs rôles, analyser leur conservation et préciser quand chacune intervient.

Ne choisissez pas Ref2VA simplement parce qu’une demande est détaillée. Utilisez-le lorsque le contenu référencé doit être défini et suivi dans toute la sortie.

Connaître la structure exacte des modes de base

Pour chaque mode de base, le corps utilise ces trois noms de champs dans cet ordre :

integrated_multimodal_description: [Shot 1] ...

overall_soundscape: ...

non_diegetic_music: ...

integrated_multimodal_description contient le style visuel, la composition, les sujets, l’environnement, les actions, la caméra, les dialogues, le chant et les sons diégétiques synchronisés dans la chronologie. overall_soundscape résume l’ambiance, les sons physiques et les sons humains non verbaux du clip. non_diegetic_music décrit la musique entendue par le public, mais pas par les personnages ; utilisez N/A lorsqu’il n’y en a pas.

La ligne d’alignement change avec le mode d’image clé. Le guide officiel impose les formes suivantes :

I2VA
For the target video, at 0.00 seconds into the target video, <Picture 1> (from [Shot 1]) is fully referenced.

FL2VA
How the reference pictures align with the target video — Picture 1 (from Shot 1) aligns with the 0.00-second mark of the target video; Picture 2 (from Shot N) aligns with the S.SS-second mark of the target video.

L2VA
How the reference pictures align with the target video — <Picture 1> (from [Shot N]) aligns with the S.SS-second mark of the target video.

Dans la réécriture finale, N devient le numéro réel du dernier plan et S.SS, la durée effective avec exactement deux décimales. Cette ligne vient en premier, suivie d’une ligne vide puis du corps à trois champs. T2VA n’a pas de ligne d’alignement.

Le minutage des plans suit aussi une convention : [Shot 1] n’a pas d’horodatage, tandis que les plans suivants commencent par un temps de coupe strictement croissant dans la durée, comme [Shot 2] At 00:03.500, .... Le mode, l’alignement, le dernier plan et la durée doivent correspondre.

Connaître la structure exacte de Ref2VA

Le mode de référence complète doit renvoyer six sections dans cet ordre :

subject_definitions:
...

summary:
[reference generation] ...

retention_analysis:
<Subject 1> (appears in [Shot 1]): fully_preserved - ...

detailed_description:
...

overall_soundscape:
...

non_diegetic_music:
...

Chaque libellé a un rôle distinct :

  • <Subject N> désigne un contenu visible réutilisable : personne, objet, scène, style, action, interface ou effet.
  • <Picture N> désigne une image utilisée comme image cible, image clé, ancre de composition ou référence de storyboard.
  • <Video N> désigne une vidéo source utilisée pour le montage, la continuation ou la structure temporelle globale.
  • <Audio N> désigne un signal audio autonome ou une piste synchronisée activée, copiée ou utilisée comme référence.

Ces catégories sont numérotées séparément. Un sujet visible extrait d’une vidéo utilise toujours <Subject N> ; <Video N> représente le fichier ou sa relation avec la vidéo entière. La présence de son dans une vidéo ne crée pas automatiquement d’entrée <Audio N>.

summary commence par un ou plusieurs types de tâches officiels entre crochets : keyframe completion, reference generation, video editing, video continuation, audio reuse ou audio reference. Plusieurs types applicables sont reliés par +.

retention_analysis attribue ensuite une relation explicite à chaque libellé. Le contenu visuel utilise fully_preserved, partially_preserved, attribute_transfer ou weak_reference ; l’audio utilise fully_copy, partially_copy, reference ou weak_reference. Le marqueur décrit la relation souhaitée, pas une note de qualité générale.

Enfin, Ref2VA remplace integrated_multimodal_description par detailed_description. Pour les tâches de génération, le guide MiniMax demande normalement 350 à 500 mots anglais détaillant la composition, les sujets, l’environnement, l’éclairage, les actions, les changements d’état, la caméra, le son et les références de chaque plan. Un contenu riche en dialogues privilégie la chronologie parlée complète plutôt que le respect mécanique de cette plage.

Demander un prompt de mode de base à l’agent

Après l’installation, appelez la skill par son nom et fournissez un brief compact. Sa configuration d’agent incluse utilise $h3-prompt-writing dans la demande par défaut.

Voici une demande FL2VA à copier :

Use $h3-prompt-writing to rewrite this request as a MiniMax H3 FL2VA prompt.

Duration: 8.00 seconds.
Picture 1: the supplied first frame, a closed field notebook on a rain-darkened café table.
Picture 2: the supplied last frame, the same notebook open to a pressed violet flower.
Action: one hand enters, opens the notebook, and stops on the flower page.
Camera: one continuous shot with a slow, small push in.
Sound: quiet café room tone, rain against glass, paper and cover movement.
Dialogue: none.
Non-diegetic music: none.

Preserve the table position, notebook identity, hand continuity, lighting direction, and final composition. Return only the final rewrite in the official base-mode structure.

Les éléments utiles sont le mode explicite, la durée exacte, le rôle clair de chaque image, une transition réalisable, les choix sonores et la contrainte de sortie. L’agent doit renvoyer d’abord la ligne FL2VA, utiliser les trois champs et atteindre Picture 2 à 8.00 secondes.

Pour I2VA, remplacez la seconde image par les actions qui se développent depuis la première. Pour L2VA, décrivez l’événement précédant l’image finale fournie. Pour T2VA, retirez les références visuelles et donnez assez d’informations pour construire la composition initiale et la séquence audiovisuelle.

Demander un prompt de référence complète à l’agent

Les demandes Ref2VA fonctionnent mieux quand chaque fichier possède un rôle déclaré. Cette demande sépare l’identité, le mouvement et les indications audio :

Use $h3-prompt-writing to rewrite this request as a MiniMax H3 full-reference Ref2VA prompt.

Target: a 10-second, three-shot product demonstration.
Picture 1: preserve the reusable bottle identity, silhouette, cap, label placement, and material finish.
Video 1: reference only the demonstrator's hand action and the three-shot cut rhythm; do not reuse its product, set, or wardrobe.
Audio 1: reference the percussion tempo for edit timing without copying the source signal.

Shot flow:
1. Establish the bottle centered on a stone counter.
2. A hand presses the pump once and the lotion lands on the back of the other hand.
3. End on the bottle and a small lotion smear beside it.

No dialogue or visible text beyond the preserved label. Use new room ambience and restrained audience-only percussion. Return only the six official Ref2VA sections in their required order, with consistent labels and explicit retention markers.

La demande n’essaie pas d’écrire subject_definitions à la place de l’agent. Elle apporte assez de provenance et d’intention de réutilisation pour que la skill crée les définitions, classe le résumé en génération par référence et référence audio, puis explique la conservation ou le transfert de chaque libellé. Si un fichier ne doit influencer qu’une propriété, dites-le : une vidéo de mouvement peut guider la main sans contrôler l’interprète, la tenue, le décor, le produit, la caméra ou l’audio.

Utiliser un processus d’agent en deux étapes

Traitez la sortie comme un brouillon structuré suivi d’une vérification déterministe.

  1. Rédigez l’inventaire des sources. Listez les instructions, images, vidéos et audios, puis indiquez ce que chaque fichier doit ou ne doit pas contrôler.
  2. Verrouillez le mode. Choisissez T2VA, I2VA, FL2VA, L2VA ou Ref2VA avant la réécriture.
  3. Donnez les contraintes de livraison. Incluez la durée, le nombre de plans, le minutage des images limites, les dialogues, le texte visible et la musique.
  4. Demandez uniquement la structure officielle. Les champs absents, sections désordonnées et commentaires supplémentaires deviennent faciles à repérer.
  5. Vérifiez sans modifier le brief. Contrôlez d’abord la structure, les références, le temps, le texte parlé et le placement audio.
  6. Révisez une couche à la fois. Demandez de corriger un écart précis en conservant les sections validées.

Pour la seconde étape, utilisez cette instruction :

Review the rewrite against the h3-prompt-writing guide. Keep the creative brief unchanged. Correct only field order, unresolved reference labels, shot timestamps, duration alignment, dialogue preservation, and diegetic versus non-diegetic audio placement. Return the corrected prompt only.

Ce prompt de contrôle réduit le risque qu’une correction de format devienne silencieusement une réécriture créative.

Vérifier la sortie avant la génération

Utilisez cette liste après chaque réécriture :

  • Mode : la sortie utilise le guide correspondant à la relation réelle des entrées.
  • Structure de base : T2VA commence par integrated_multimodal_description ; I2VA, FL2VA et L2VA placent la bonne instruction au-dessus.
  • Structure Ref2VA : les six champs apparaissent une fois et dans l’ordre requis ; detailed_description remplace integrated_multimodal_description.
  • Libellés : chaque <Subject N>, <Picture N>, <Video N> et <Audio N> garde le même sens, sans libellé non défini plus loin.
  • Rôles : sujets, images concrètes, relations vidéo globales et signaux audio utilisent le bon type.
  • Conservation : chaque référence suivie possède un marqueur autorisé cohérent avec la demande.
  • Plans : [Shot 1] n’a pas d’horodatage ; les coupes suivantes augmentent et restent dans la durée.
  • Images limites : I2VA part de la première, FL2VA atteint la dernière et L2VA converge vers l’image finale fournie.
  • Paroles et texte : dialogues, paroles de chanson et texte visible gardent leur langue et leurs mots ; la description réécrite reste en anglais.
  • Audio : paroles et sons diégétiques synchronisés restent dans la description ; l’ambiance générale va dans overall_soundscape et la musique réservée au public dans non_diegetic_music.
  • Faisabilité : les actions tiennent dans la durée et la fin se résout sans coupure involontaire.
  • Propreté : l’agent n’ajoute ni résumé narratif, ni fichier incompatible, ni rôle contradictoire, ni commentaire supplémentaire.

Passer du brouillon de l’agent à OmniArt

La skill sert surtout de couche de préparation : elle transforme un inventaire et un brief en prompt vérifiable avant la génération. Conservez la sortie validée avec ses fichiers sources, car les libellés restent utiles uniquement si leur ordre et leur sens sont stables.

Apportez ensuite le prompt vérifié et les fichiers correspondants dans le studio de création vidéo OmniArt. Pour améliorer le brief plutôt que la structure H3, revenez au guide des prompts MiniMax H3. Le partage est simple : utilisez le guide pour définir votre objectif, h3-prompt-writing pour l’exprimer dans le contrat H3 choisi et la liste de contrôle pour bloquer les erreurs structurelles avant la génération.

Prêt à créer ?

Commencez à générer du contenu incroyable avec l’IA

Commencer gratuitement