GuideTutorials en handleidingen15 min lezen

Gids voor native audio in MiniMax H3: dialoog, muziek en sync

Leer hoe je de native stereo-audio van MiniMax H3 promptt voor dialoog, sfeergeluid, muziek, stemreferenties en sync, met een herhaalbaar testplan voor je productie.

OmniArt-team
Gids voor native audio in MiniMax H3: dialoog, muziek en sync

De native audio van MiniMax H3 maakt van de soundtrack een deel van de generatiebriefing, in plaats van een bestand dat je automatisch toevoegt zodra het beeld af is. MiniMax zegt dat H3 tekst, afbeeldingen, video en audio samen begrijpt en daarna video’s met native stereogeluid genereert. De training behandelt stem, geluidseffecten en muziek bovendien als één audiodomein en niet als losse gereedschappen.

Dat is een betekenisvolle verandering in de workflow, maar het is geen belofte dat elke regel perfect wordt uitgesproken, elke voetstap op het juiste frame landt of elke stereomix klaar is om te publiceren. Deze gids scheidt de gedocumenteerde mogelijkheden van H3 volgens MiniMax van de productietests die makers zelf horen te draaien. Je krijgt een praktische opzet voor een geluidsbriefing, een workflow voor audioreferenties, vijf kant-en-klare prompts en een herhaalbare scorekaart, zonder dat officiële demo’s als onafhankelijke resultaten worden gepresenteerd.

Wat MiniMax officieel documenteert over de audio van H3

MiniMax beschrijft H3 als een multimodaal videomodel voor algemeen gebruik, en niet als een stille videogenerator met een aparte geluidsdoorloop. In het lanceringsmateriaal staat dat het model native stereo-audio genereert en stem, geluidseffecten en muziek samen modelleert. MiniMax laat ook een prompt zien die camerabeweging uit een video, een personage uit een afbeelding en zang die op een audioreferentie is afgestemd, combineert.

De officiële gids voor videogeneratie met H3 legt de huidige grenzen van de API vast:

Gedocumenteerde mogelijkheidWat het betekent voor een maker
Native stereo-audioH3 kan een soundtrack met twee kanalen bij de gegenereerde video teruggeven
Audio als multimodale contextEen audioclip kan stem, beweging, montageritme of een andere relatie sturen die je in de prompt beschrijft
Tot drie audioreferentiesElke clip mag 2–15 seconden duren, met maximaal 15 seconden over alle audioreferenties samen
Gemengde referentiesAudio is te combineren met afbeeldingen en video’s in één aanvraag van referentie naar video
Invoer in WAV en MP3Referentieaudio moet een van de gedocumenteerde invoerformaten gebruiken
Uitvoer van 4–15 secondenH3 is ontworpen voor korte clips, niet voor een complete lange soundtrack in één generatie

Er zijn drie belangrijke beperkingen. Een audioreferentie kun je niet alleen indienen; MiniMax vraagt er minstens één afbeelding of video bij. Audiobestanden mogen elk maximaal 15 MB zijn, en de volledige aanvraag met gemengde referenties is beperkt tot 12 bestanden. De referentiemodus is bovendien niet te combineren met de modus voor het eerste of laatste frame in dezelfde aanvraag, dus bepaal of exacte begin- en eindframes of bredere multimodale sturing zwaarder weegt voor het shot.

Let op

Stereo is niet hetzelfde als ruimtelijke audio. MiniMax documenteert native stereo-uitvoer, maar het huidige openbare materiaal belooft geen surround, ambisonics, objectgebaseerde audio of een bepaald niveau van positionele nauwkeurigheid. Beoordeel de links-rechtsplaatsing met een koptelefoon voordat je een resultaat ruimtelijk noemt.

Bouw de geluidsbriefing voordat je de prompt schrijft

De nuttigste H3-prompt is geen lange lijst geluiden. Het is een compact geluidsplan dat het model vertelt wat de leiding neemt, wat dat ondersteunt en wat er op een zichtbaar moment moet gebeuren. Schrijf dat plan in vijf rondes.

1. Leg de visuele actie en de timing vast

Audiosynchronisatie hangt af van zichtbare gebeurtenissen. Begin met het shot, de actie van het onderwerp, de camerabeweging en de volgorde van de beats. “A spoon hits the saucer as the camera settles” geeft het model één gedeelde audiovisuele gebeurtenis. “Add a cup sound” zegt niet wanneer die gebeurtenis plaatsvindt of waardoor die wordt veroorzaakt.

Voor een clip van 10 seconden kan een eenvoudige beatkaart er zo uitzien:

  • 0–3 seconden: de ruimte en het onderwerp neerzetten
  • 3–7 seconden: dialoog of hoofdactie
  • 7–10 seconden: productonthulling en de laatste geluidscue

Behandel die tijden als regie, niet als framenauwkeurige montagemarkeringen. Een productietest moet meten hoe dicht het resultaat erbij blijft.

2. Benoem één primaire audiolaag

Kies het geluid dat het publiek als eerste moet opmerken: dialoog, een interactie met het product, een muzikale hook of een stuk omgevingsgeluid. Geef dat de helderste formulering en houd er ruimte omheen vrij.

Is dialoog primair, schrijf dan de exacte regel tussen aanhalingstekens en geef één notitie over de voordracht. Is een productgeluid primair, beschrijf dan de fysieke actie die het veroorzaakt. Is muziek primair, noem dan het tempo, de instrumentatie, de sfeer en waar het arrangement moet veranderen.

3. Voeg sfeergeluid toe als akoestische plek

Sfeergeluid moet uitleggen waar het shot leeft. Beschrijf in plaats van “café sounds” het zachte sissen van een espressomachine achter de spreker, gedempt gesprek in de ruimte en een deurbel in de verte. Vraag voor een schone productspot om een gecontroleerde ruimtetoon uit de studio in plaats van stilte, tenzij stilte een bewuste creatieve keuze is.

Gebruik woorden voor afstand en materiaal die zowel op beeld als op geluid kunnen slaan:

  • dichtbij, droog, intiem en licht galmend
  • ver weg, gedempt door glas, of buiten beeld aan de linkerkant
  • voetstappen op tegels, bewegende stof, regen op metaal, of een glas dat op hout wordt gezet

4. Bepaal of muziek score of bron is

Een score staat buiten de scène; bronmuziek komt uit een object of een plek binnen de scène. Zeg welke van de twee je bedoelt. “A restrained electronic score under the dialogue” vraagt om een achtergrondlaag, terwijl “music playing quietly from the café radio, slightly muffled” er een akoestische bron in beeld bij geeft.

Is muziek niet nodig, zeg dan no music. Dat houdt een test met dialoog of Foley makkelijker te beoordelen. Is muziek wel nodig, laat dan ruimte over voor de stem in plaats van elke laag luid en dramatisch te vragen.

5. Benoem de uitsluitingen

Negatieve geluidsregie is nuttig zolang die de briefing beschermt. Voorbeelden zijn no narration, no crowd cheering, no added melody en no exaggerated whooshes. Houd de uitsluitingslijst kort; te veel beperkingen kunnen concurreren met de actie die je juist wilt.

Audioreferenties gebruiken zonder hun rol te vertroebelen

Het referentiesysteem van H3 is het nuttigst als elk bestand één taak heeft. Een referentieaudioclip kan stemtimbre en cadans leveren, muzikale energie, een klanktextuur of een montageritme. Ga er niet van uit dat het model weet welke eigenschap het moet lenen.

Schrijf een overzicht van je bestanden voordat je de definitieve prompt maakt:

BestandToegewezen taakWat niet mee mag komen
Afbeelding van het personageIdentiteit, kleding en plaatsing van het productAchtergrond en belichting
BewegingsvideoGebaren en de timing van de cameraDe identiteit van het personage en de dialoog
StemaudioStemkarakter, cadans en emotionele energieDe oorspronkelijke woorden en achtergrondgeluid
MuziekaudioTempo, dichtheid van het arrangement en montageritmeHerkenbare melodie of songtekst

Beschrijf die verhoudingen daarna in natuurlijke taal. Het eigen H3-voorbeeld van MiniMax gebruikt één zin die camerabeweging aan een videoreferentie toewijst, de performer aan een referentieafbeelding en de zang aan een audioreferentie. Genummerde labels voor bestanden verschillen per interface, terwijl de API met getypeerde inhoud en referentierollen werkt, dus vervang de labels in de sjablonen hieronder door de exacte notatie die jouw workflow toont.

Waarschuwing

Gebruik de stem of de voordracht van een persoon alleen als referentie wanneer je toestemming hebt. Een stemreferentie is geen bewijs dat je de identiteit van de spreker, de opname, de muziek of het recht om een gegenereerde imitatie te publiceren bezit.

Schone referenties leveren schonere experimenten op. Snij stiltes weg, haal ongerelateerde achtergrondmuziek eruit, voorkom vervorming en houd de relevante zang- of muziekpassage goed hoorbaar. Gebruik een kort fragment dat de eigenschap toont die je wilt, in plaats van standaard de maximale duur te uploaden.

Vijf kant-en-klare prompts voor native audio in MiniMax H3

Dit zijn startbriefings, geen geclaimde testresultaten. Draai elke prompt meer dan één keer en beoordeel de resultaten met het protocol in het volgende deel.

1. Dialoog met één spreker en ruimtetoon

Close-up of a chef at the pass in a quiet restaurant kitchen after service. The camera makes a slow push-in as she looks toward a colleague off-camera and says, “We try it again tomorrow.” Delivery: tired but quietly optimistic, natural pace, one short breath before “tomorrow.” Her voice is the primary audio layer, close and dry. Low ventilation hum and occasional metal cooling sounds remain distant. No music, no narration, no other voices.

Gebruik dit sjabloon om de nauwkeurigheid van de spraak, de emotionele voordracht, de mondbeweging en de vraag of het sfeergeluid achter de regel blijft te beoordelen.

2. Gelaagd sfeergeluid met gesynchroniseerde Foley

Wide shot inside a nearly empty laundromat at night, fluorescent light reflecting on the tiled floor. A person moves a wet jacket from a washer to a rolling basket; the metal door clicks shut exactly when their hand closes it, then the basket wheels rattle softly across tile. Foreground: fabric movement and the door click. Mid-ground: steady washer rotation. Background: rain against the front window and one distant car passing outside. Native stereo mix, no dialogue, no music.

Deze briefing isoleert sfeergeluid, materiaalrealisme, links-rechtsscheiding en de synchronisatie van contactgeluiden.

3. Productonthulling geleid door muziek

Ten-second vertical product film for a translucent coral sports bottle on a lilac studio surface. Start with a macro shot of condensation, then orbit as the bottle rises into the hero position. Original minimal electronic score at 100 BPM: soft pulse for the opening, a clean percussive accent when the logo faces camera, then a short resolved final note. Add subtle droplets and one controlled placement sound. Music supports the product sounds rather than masking them. No voice and no stock-style cinematic boom.

Voor visuele planning die specifiek op het product is gericht en verder gaat dan de soundtrack, gebruik je de workflow van foto naar productvideo.

4. Toegestane stemreferentie met nieuwe dialoog

Use voice reference 1 only for the narrator's vocal timbre, speaking pace, and warm conversational energy. Do not reuse its words or background noise. The person from image reference 1 stands beside the window and says, “The first draft is only the beginning.” Keep the spoken line intelligible and synchronized to the visible speaker. Add a quiet residential room tone and soft rain outside. No music. The voice recording is authorized for this use.

Test of de bedoelde stemkwaliteiten meekomen zonder dat er onbedoeld ruis, frasering of inhoud uit de bronopname wordt gekopieerd. Beschrijf de gewenste kwaliteiten in woorden, zodat de instructie bruikbaar blijft als de trouw aan de referentie varieert.

5. Ritmereferentie voor een socialmontage

Create a 12-second montage of a ceramic artist shaping, glazing, and placing a finished cup on a shelf. Use audio reference 1 only for tempo, rhythmic energy, and edit pacing. Compose an original percussive track with different melody and sound design. Cut the visual action on the major rhythmic changes: clay lands on the wheel, brush touches glaze, cup reaches the shelf. Preserve natural wheel rotation, brush texture, and the final ceramic tap beneath the music. No dialogue.

Dit scheidt ritmische sturing van het kopiëren van muziek en geeft je drie zichtbare syncpunten om te controleren.

Een herhaalbaar evaluatieplan voor H3-audio

Eén gepolijste officiële demo kan niet beantwoorden of een model bij jouw productieworkflow past. Gebruik dezelfde briefing voor minstens drie generaties, houd de duur en de referenties vast, en beoordeel elk resultaat in plaats van alleen het sterkste eruit te pikken.

Test de lagen eerst apart

Begin met vier gecontroleerde prompts:

  1. Alleen dialoog en een rustige ruimtetoon
  2. Sfeergeluid en drie zichtbare Foley-gebeurtenissen, zonder spraak of muziek
  3. Instrumentale muziek met twee geplande visuele accenten
  4. Eén toegestane audioreferentie, gekoppeld aan een eenvoudige referentieafbeelding of referentievideo

Combineer dialoog, sfeergeluid, Foley en muziek pas in één drukke scène nadat die vier zijn geslaagd. Zo blijven fouten te diagnosticeren: je kunt zien of een probleem uit de uitspraak, de timing, de overdracht van de referentie of de dichtheid van de mix komt.

Gebruik een scorekaart, geen indruk

DimensieVraag die je beantwoordtEenvoudige maatstaf
Nauwkeurigheid van de dialoogZijn de gevraagde woorden correct uitgesproken?Correcte woorden gedeeld door gevraagde woorden
LipsyncVallen zichtbare mondsluitingen en lettergreepklemtonen samen?Cijfer 1–5 en noteer de eerste zichtbare afwijking
Sync van gebeurtenissenLanden contactgeluiden samen met de actie in beeld?Frames te vroeg of te laat bij drie geplande cues
Consistentie van de stemBlijft de spreker de hele regel herkenbaar?Beoordeel begin, midden en eind apart
Controle over de referentieKwam de gevraagde eigenschap over zonder ongewenste bagage?Noteer bedoelde en onbedoelde overdrachten
StereobeeldZijn de links-rechtsplaatsingen bruikbaar en stabiel?Controle met koptelefoon plus controle van de golfvorm per kanaal
Hiërarchie in de mixIs de primaire laag duidelijk verstaanbaar?Cijfer 1–5 op normaal afspeelvolume
HerhaalbaarheidHoe vaak is de clip bruikbaar zonder audioreparatie?Bruikbare resultaten gedeeld door het totaal aantal runs

Bekijk het geëxporteerde bestand in een video-editor of een audioworkstation. Controleer of er twee kanalen zijn, luister in mono naar faseproblemen en vergelijk de golfvormen rond de geplande contactgebeurtenissen. Leid de audiokwaliteit niet af uit een preview op een socialplatform, dat de soundtrack opnieuw kan comprimeren of hermappen.

Tip

Bewaar de mislukte generaties. Een herziening van je prompt is pas een verbetering als die het percentage bruikbare resultaten over herhaalde runs verhoogt, niet als die één gelukstreffer oplevert.

Beperkingen om rekening mee te houden

In de eigen lanceringspost van MiniMax staat dat H3 nog ruimte heeft om te verbeteren, met visueel detail als een van de aandachtspunten voor de toekomst. Voor audioproductie laat de huidige openbare documentatie ook meerdere vragen open. Er zijn geen gepubliceerde garanties voor de woordfoutmarge, de nauwkeurigheid van de lipsync, de luidheid, de samplefrequentie, een kanaalindeling voorbij stereo, taaldekking, de gelijkenis met een stemreferentie of cuecontrole op timecodeniveau.

Houd rekening met deze praktische grenzen:

  • Korte uitvoer: 4–15 seconden is geschikt voor shots, advertenties en socialclips, maar continuïteit over langere lengte vraagt montage over meerdere generaties heen.
  • Korte referentiecontext: er zijn tot drie audioclips toegestaan, maar hun gezamenlijke duur mag niet boven de 15 seconden komen.
  • Geen aanvraag met alleen audio als referentie: een referentieaudioclip moet aan minstens één afbeelding of video worden gekoppeld.
  • Timing in natuurlijke taal is geen vaste timeline: behandel beattijden als bedoeling totdat herhaalde tests de precisie aantonen die jij nodig hebt.
  • Stereo vraagt verificatie: twee kanalen leveren niet automatisch geloofwaardige richting, diepte of monocompatibiliteit op.
  • Dichte mixen kunnen fouten verbergen: dialoog, effecten, sfeergeluid en muziek worden misschien samen gemodelleerd, maar een eenvoudiger briefing is makkelijker te sturen en te repareren.
  • Rechten op referenties blijven gelden: wat een model kan, geeft nog geen toestemming om een stem te imiteren of beschermde muziek te hergebruiken.

MiniMax H3 is nu beschikbaar voor OmniArt-gebruikers vanaf Creator, in de modi Video, Transition en Reference, met uitvoer van 5–15 seconden op 1440p. De referentiemodus accepteert tot negen afbeeldingen, drie video’s en drie audioclips, met maximaal 12 bestanden in totaal; referentieaudio moet aan minstens één afbeelding of video worden gekoppeld. OmniArt rekent 9 credits per uitvoerseconde, plus 9 credits per naar boven afgeronde seconde referentievideo. De eerste vijf referentieafbeeldingen zijn gratis, elke extra afbeelding kost 2 credits, en referentieaudio kost niets extra. Native audio hoort bij de uitvoer van H3, en het huidige OmniArt-oppervlak heeft geen aparte audioschakelaar. Voor budgettering via de officiële API buiten OmniArt bekijk je de officiële pagina met pay-as-you-go-tarieven en de gids met prijzen en specificaties van H3; vervang de prijs van MiniMax zelf niet door die van een externe host.

Bouw de rest van de soundtrack in OmniArt

Native audio kan het aantal overdrachten verminderen, maar het haalt de waarde van aparte geluidstools niet weg. Heeft een H3-take het juiste beeld maar een zwakke vertelstem, houd dan het beeld en bouw er een gecontroleerde stemtrack bij. Werkt de dialoog wel maar mist de ruimte textuur, voeg dan een laag sfeergeluid of Foley toe in plaats van het hele shot opnieuw te genereren.

OmniArt brengt workflows voor video, spraak, geluid en muziek samen in één creatieve werkruimte. Gebruik de gids voor de AI-geluidseffectgenerator om vervangende Foley en sfeergeluid te ontwerpen, of vergelijk de promptaanpak met de gids voor ruimtelijke audio in Veo 3.1. Het doel is niet om elk geluid in één generatie te persen. Het doel is om de native track te houden waar die werkt en alleen de laag te vervangen die dat niet doet.

Maak met MiniMax H3 op OmniArt

Klaar om te maken?

Ga aan de slag en genereer content met AI

Gratis aan de slag