TutorialTutorials en handleidingen11 min lezen

De prompt-writing skill van MiniMax H3 installeren voor agents

Installeer de prompt-writing skill van MiniMax H3, kies de juiste videotaakmodus en zet creatieve briefings om in de exacte uitvoerstructuur van base of Ref2VA voor agents.

OmniArt-team
De prompt-writing skill van MiniMax H3 installeren voor agents

De prompt-writing skill van MiniMax H3 geeft een AI-agent een vaste manier om een creatief verzoek om te zetten in een audiovisuele prompt die klaar is voor H3. In plaats van de agent zelf een formaat te laten improviseren, installeer je één skill, bepaal je de generatiemodus en krijg je de velden en referentielabels terug die bij die modus horen.

Deze tutorial gaat over het opzetten en bedienen van de skill, niet over het verzamelen van elke denkbare prompttechniek voor H3. Hij volgt de bestanden in de officiële MiniMax-H3-repository, waaronder de skill h3-prompt-writing, de bijbehorende gids voor de base-modus en de gids voor volledige referenties. Voor breder advies over referentierollen, beschermregels en productieprompts houd je de bestaande promptgids voor MiniMax H3 er los naast open.

De prompt-writing skill van MiniMax H3 installeren

Draai het installatiecommando voor één skill dat in de repository van MiniMax staat, vanuit het project waarin je je AI-agent voor code of creatief werk gebruikt:

npx skills add https://github.com/MiniMax-AI/MiniMax-H3 --skill h3-prompt-writing

Dit commando installeert alleen h3-prompt-writing. De repository bundelt die prompt-writing skill op dit moment samen met acht videogeneratieskills voor specifieke stijlen, dus de skill op naam kiezen houdt deze opzet gericht.

De geïnstalleerde skill heeft twee referentiegidsen:

  • references/base-en.txt behandelt T2VA, I2VA, FL2VA en L2VA.
  • references/ref-en.txt behandelt Ref2VA met volledige referenties.

Die splitsing telt zwaarder dan het onderwerp van de clip. De agent hoort een gids te kiezen op basis van de invoerverhouding in het verzoek en daarna de veldnamen, sectievolgorde, labels en tijdnotatie van die gids aan te houden.

Kies de taakmodus van H3 vóór je om een herschrijving vraagt

Geef de agent de modus expliciet mee zodra je hem kent. Weet je hem niet, beschrijf dan welke grensframes en referentiebestanden je hebt, zodat de agent het verzoek kan indelen.

ModusInvoer en verhoudingWat de skill hoort te bouwen
T2VAAlleen tekstEen complete audiovisuele tijdlijn opgebouwd uit de geschreven briefing
I2VAEen meegeleverd eerste frameEen verloop dat vanaf precies dat frame begint en vooruit ontwikkelt
FL2VAMeegeleverd eerste en laatste frameEen doorlopend verloop dat de twee grensframes verbindt
L2VAEen meegeleverd laatste frameEen geloofwaardige opening die geleidelijk naar het slotframe toe werkt
Ref2VAReferentieafbeeldingen of -video’s, eventueel met audiorollenEen analyse met volledige referenties in zes secties plus shotbeschrijving

T2VA, I2VA, FL2VA en L2VA zijn de base-modi van de skill. Ze delen één body van drie velden. I2VA, FL2VA en L2VA zetten daarboven een exacte uitlijningsinstructie; T2VA begint meteen met het eerste veld.

Ref2VA is niet gewoon hetzelfde sjabloon met meer bijlagen. Het heeft een apart contract van zes secties om referenties te definiëren, hun rol in te delen, het behoud te analyseren en te beschrijven wanneer elke referentie in werking treedt.

Kies Ref2VA niet alleen omdat een verzoek gedetailleerd is. Kies het wanneer verwezen materiaal in de hele uitvoer gedefinieerd en gevolgd moet worden.

Ken de exacte uitvoerstructuur van de base-modus

In elke base-modus gebruikt de body deze drie veldnamen in deze volgorde:

integrated_multimodal_description: [Shot 1] ...

overall_soundscape: ...

non_diegetic_music: ...

integrated_multimodal_description draagt de beeldstijl, compositie, onderwerpen, omgeving, handelingen, camera, dialoog, zang en gesynchroniseerd diegetisch geluid langs de tijdlijn. overall_soundscape vat de omgevingsklank, handelingsgeluiden en niet-verbale menselijke geluiden over de hele clip samen. non_diegetic_music beschrijft muziek die het publiek hoort maar de personages niet; is die er niet, dan staat er N/A.

De uitlijningsregel verschilt per keyframemodus. De officiële gids geeft deze vormen:

I2VA
For the target video, at 0.00 seconds into the target video, <Picture 1> (from [Shot 1]) is fully referenced.

FL2VA
How the reference pictures align with the target video — Picture 1 (from Shot 1) aligns with the 0.00-second mark of the target video; Picture 2 (from Shot N) aligns with the S.SS-second mark of the target video.

L2VA
How the reference pictures align with the target video — <Picture 1> (from [Shot N]) aligns with the S.SS-second mark of the target video.

In de afgeronde herschrijving wordt N het werkelijke nummer van het laatste shot en S.SS de effectieve duur met precies twee decimalen. De regel komt eerst, gevolgd door één lege regel en de body met drie velden. T2VA heeft geen uitlijningsregel.

De timing van shots heeft een eigen afspraak: [Shot 1] krijgt geen tijdstempel, terwijl latere shots beginnen met een strikt oplopende snijtijd, zoals [Shot 2] At 00:03.500, .... Uitvoer in een base-modus is pas klaar als de gekozen modus, de uitlijningsregel, het laatste shot en de duur met elkaar kloppen.

Ken de exacte uitvoerstructuur van Ref2VA

De modus met volledige referenties moet zes secties teruggeven in deze volgorde:

subject_definitions:
...

summary:
[reference generation] ...

retention_analysis:
<Subject 1> (appears in [Shot 1]): fully_preserved - ...

detailed_description:
...

overall_soundscape:
...

non_diegetic_music:
...

Elk label heeft een eigen taak:

  • <Subject N> benoemt herbruikbare zichtbare inhoud, zoals een persoon, object, scène, stijl, handeling, interface of effect.
  • <Picture N> benoemt een afbeelding die als concreet doelframe, keyframe, compositieanker of storyboardreferentie dient.
  • <Video N> benoemt een bronvideo die wordt gebruikt voor montage, voortzetting of de tijdstructuur van de hele video.
  • <Audio N> benoemt een losstaand audiosignaal of een ingeschakeld gesynchroniseerd audiospoor dat wordt gekopieerd of gebruikt als referentie.

Deze categorieën worden onafhankelijk genummerd. Een visueel onderwerp dat uit een referentievideo is gehaald, gebruikt nog steeds <Subject N>; <Video N> staat voor het bestand of de verhouding tot de hele video. Net zo goed levert een videobestand met geluid niet automatisch een <Audio N>-regel op.

De summary begint met een of meer officiële taaktypen tussen vierkante haken: keyframe completion, reference generation, video editing, video continuation, audio reuse of audio reference. Meerdere geldige typen koppel je met +.

retention_analysis geeft daarna elk label een expliciete verhouding. Zichtbare inhoud gebruikt fully_preserved, partially_preserved, attribute_transfer of weak_reference. Geluid gebruikt fully_copy, partially_copy, reference of weak_reference. De markering hoort de bedoelde verhouding te beschrijven en niet als algemeen kwaliteitscijfer te dienen.

Tot slot vervangt Ref2VA het basisveld integrated_multimodal_description door detailed_description. Voor generatietaken vraagt de gids van MiniMax hier normaal om 350–500 Engelse woorden, met genoeg detail om per shot de compositie, onderwerpen, omgeving, licht, handelingen, toestandsveranderingen, camerabeweging, geluid en het gebruik van referenties vast te leggen. Werk met veel dialoog geeft voorrang aan de volledige gesproken tijdlijn in plaats van dat bereik mechanisch te halen.

Vraag de agent om een prompt in een base-modus

Roep de skill na de installatie bij naam aan en geef een compacte productiebriefing mee. De meegeleverde agentconfiguratie van de skill gebruikt $h3-prompt-writing in het standaardverzoek.

Hier is een FL2VA-verzoek dat je kunt plakken:

Use $h3-prompt-writing to rewrite this request as a MiniMax H3 FL2VA prompt.

Duration: 8.00 seconds.
Picture 1: the supplied first frame, a closed field notebook on a rain-darkened café table.
Picture 2: the supplied last frame, the same notebook open to a pressed violet flower.
Action: one hand enters, opens the notebook, and stops on the flower page.
Camera: one continuous shot with a slow, small push in.
Sound: quiet café room tone, rain against glass, paper and cover movement.
Dialogue: none.
Non-diegetic music: none.

Preserve the table position, notebook identity, hand continuity, lighting direction, and final composition. Return only the final rewrite in the official base-mode structure.

De bruikbare onderdelen zijn de expliciete modus, de exacte duur, de heldere rol per afbeelding, het haalbare overgangsverloop, de keuzes over geluid en de beperking op de uitvoer. De agent hoort eerst de uitlijningsregel voor FL2VA terug te geven, de drie gedeelde velden te gebruiken en Picture 2 op 8.00 seconden te laten landen.

Voor I2VA vervang je de tweede afbeelding door de handelingen die zich vanaf het eerste frame ontwikkelen. Voor L2VA beschrijf je de bedoelde gebeurtenis vóór het meegeleverde slotframe. Voor T2VA haal je de verwijzingen naar afbeeldingen weg en geef je de agent genoeg informatie om de openingscompositie en de audiovisuele reeks uit tekst op te bouwen.

Vraag de agent om een prompt met volledige referenties

Verzoeken voor Ref2VA werken beter wanneer elk bestand een uitgesproken rol heeft. Hier is een agentverzoek dat je kunt plakken en dat identiteit, beweging en geluidssturing uit elkaar houdt:

Use $h3-prompt-writing to rewrite this request as a MiniMax H3 full-reference Ref2VA prompt.

Target: a 10-second, three-shot product demonstration.
Picture 1: preserve the reusable bottle identity, silhouette, cap, label placement, and material finish.
Video 1: reference only the demonstrator's hand action and the three-shot cut rhythm; do not reuse its product, set, or wardrobe.
Audio 1: reference the percussion tempo for edit timing without copying the source signal.

Shot flow:
1. Establish the bottle centered on a stone counter.
2. A hand presses the pump once and the lotion lands on the back of the other hand.
3. End on the bottle and a small lotion smear beside it.

No dialogue or visible text beyond the preserved label. Use new room ambience and restrained audience-only percussion. Return only the six official Ref2VA sections in their required order, with consistent labels and explicit retention markers.

Het verzoek probeert niet zelf subject_definitions voor de agent te schrijven. Het geeft genoeg herkomst en hergebruikintentie mee zodat de skill die definities kan opbouwen, de samenvatting kan indelen als reference generation plus audio reference, en per label het verwachte behoud of de verwachte overdracht kan uitleggen. Mag een bestand maar één eigenschap beïnvloeden, zeg dat dan: een bewegingsclip kan de handbeweging sturen zonder ook de acteur, de kleding, de set, het product, de camera of het geluid te bepalen.

Werk met een agentworkflow in twee rondes

Behandel de uitvoer van de skill als een gestructureerd concept met een vaste controleronde.

  1. Schrijf het bronoverzicht. Zet elke tekstinstructie en elk frame-, afbeeldings-, video- en audiobestand op een rij. Benoem wat elk bestand wel en niet mag bepalen.
  2. Zet de taakmodus vast. Kies T2VA, I2VA, FL2VA, L2VA of Ref2VA vóór de herschrijving.
  3. Geef de agent opleveringseisen. Vermeld duur, aantal shots, timing van de grensframes, dialoog, zichtbare tekst en of er muziek is.
  4. Vraag alleen om de officiële structuur. Zo vallen ontbrekende velden, verwisselde secties en commentaar buiten de prompt meteen op.
  5. Controleer zonder de briefing te wijzigen. Kijk eerst naar structuur, referenties, timing, gesproken tekst en plaatsing van geluid.
  6. Herzie één laag tegelijk. Laat de agent één specifieke afwijking corrigeren en de goedgekeurde secties intact laten.

Gebruik voor de tweede ronde een gerichte instructie:

Review the rewrite against the h3-prompt-writing guide. Keep the creative brief unchanged. Correct only field order, unresolved reference labels, shot timestamps, duration alignment, dialogue preservation, and diegetic versus non-diegetic audio placement. Return the corrected prompt only.

Deze controleprompt verkleint de kans dat een correctie op het formaat stilletjes een creatieve herschrijving wordt.

Controleer de uitvoer vóór het genereren

Gebruik deze checklist na elke herschrijving door de agent:

  • Modus: De uitvoer gebruikt de gids die bij de werkelijke invoerverhouding hoort.
  • Basisstructuur: T2VA begint met integrated_multimodal_description; I2VA, FL2VA en L2VA zetten de juiste uitlijningsinstructie erboven.
  • Ref2VA-structuur: Alle zes velden komen één keer voor en in de vereiste volgorde; detailed_description wordt gebruikt in plaats van integrated_multimodal_description.
  • Labels: Elke <Subject N>, <Picture N>, <Video N> en <Audio N> houdt in alle secties dezelfde betekenis. Er duikt later geen ongedefinieerd label op.
  • Referentierollen: Onderwerpen, concrete frames, verhoudingen tot een hele video en audiosignalen gebruiken het juiste labeltype.
  • Behoud: Elke gevolgde referentie heeft een toegestane verhoudingsmarkering die bij het verzoek past.
  • Shots: [Shot 1] heeft geen tijdstempel. Latere snijtijden lopen strikt op en blijven binnen de gevraagde duur.
  • Grensframes: I2VA begint bij het eerste frame, FL2VA bereikt het laatste frame en L2VA komt uit op het meegeleverde slotframe.
  • Spraak en tekst: Dialoog, songtekst en zichtbare tekst in de scène houden hun oorspronkelijke taal en formulering. Het proza van de herschrijving blijft Engels.
  • Geluid: Dialoog en gesynchroniseerde diegetische gebeurtenissen blijven in de hoofdbeschrijving; omgevingsklank over de hele clip hoort in overall_soundscape; muziek die alleen het publiek hoort, hoort in non_diegetic_music.
  • Haalbaarheid: De beschreven handelingen passen binnen de duur, en het slotmoment is afgerond in plaats van onbedoeld afgekapt.
  • Nette uitvoer: De agent heeft geen samenvatting, geen niet-ondersteund bestand, geen tegenstrijdige rol en geen commentaar buiten de gevraagde prompt toegevoegd.

Van het agentconcept naar OmniArt

De skill is het nuttigst als voorbereidingslaag: hij zet een overzicht van je bestanden en een creatieve briefing om in een prompt die je vóór het genereren kunt nalopen. Bewaar de goedgekeurde uitvoer bij de bronbestanden, want de labels blijven alleen bruikbaar zolang de volgorde en de betekenis van die bestanden stabiel blijven.

Breng de gecontroleerde prompt en de bijbehorende bestanden daarna naar de videowerkruimte van OmniArt. Wil je de creatieve briefing zelf verbeteren in plaats van de veldstructuur voor H3, ga dan terug naar de promptgids voor MiniMax H3. De scheiding is simpel: gebruik de gids om te bepalen wat je wilt, gebruik h3-prompt-writing om dat in het gekozen H3-contract uit te drukken, en gebruik de checklist om structurele fouten tegen te houden voordat ze bij een generatie belanden.

Klaar om te maken?

Ga aan de slag en genereer content met AI

Gratis aan de slag