Natywny dźwięk MiniMax H3: dialog, muzyka i synchronizacja
Naucz się pisać prompty pod natywny dźwięk stereo w MiniMax H3 — dialog, tło, muzyka, referencje głosowe i synchronizacja — z powtarzalnym planem testów produkcyjnych.

Natywny dźwięk MiniMax H3 zamienia ścieżkę dźwiękową w część briefu generowania zamiast w plik, który odruchowo dokładasz po zamknięciu obrazu. MiniMax twierdzi, że H3 rozumie wspólnie tekst, obrazy, wideo i dźwięk, a potem generuje wideo z natywnym dźwiękiem stereo. Zakres treningu traktuje też głos, efekty dźwiękowe i muzykę jako jedną dziedzinę audio, a nie osobne narzędzia.
To istotna zmiana w przebiegu pracy, ale nie obietnica, że każda kwestia zostanie idealnie wypowiedziana, każdy krok wyląduje na właściwej klatce, a każdy miks stereo będzie gotowy do publikacji. Ten przewodnik oddziela udokumentowane możliwości H3 według MiniMax od testów produkcyjnych, które twórcy powinni przeprowadzić sami. Daje praktyczną strukturę briefu dźwiękowego, przebieg pracy z referencjami audio, pięć szablonów promptów i powtarzalną kartę oceny, bez podawania oficjalnych materiałów demonstracyjnych jako niezależnych wyników.
Co MiniMax oficjalnie dokumentuje na temat dźwięku w H3
MiniMax opisuje H3 jako uniwersalny multimodalny model wideo, a nie generator niemego wideo z osobnym przebiegiem dźwiękowym. Materiały premierowe firmy mówią, że model generuje natywny dźwięk stereo i modeluje wspólnie głos, efekty dźwiękowe i muzykę. MiniMax pokazuje też prompt łączący ruch kamery z wideo, postać z obrazu i wokal dopasowany do referencji audio.
Oficjalny przewodnik po generowaniu wideo H3 definiuje obecne granice API:
| Udokumentowana możliwość | Co to znaczy dla twórcy |
|---|---|
| Natywny dźwięk stereo | H3 może zwrócić dwukanałową ścieżkę dźwiękową razem z wygenerowanym wideo |
| Dźwięk jako kontekst multimodalny | Klip audio może sterować głosem, ruchem, rytmem montażu albo inną relacją opisaną w prompcie |
| Do trzech referencji audio | Każdy klip może mieć 2–15 sekund, przy maksymalnie 15 sekundach łącznie dla wszystkich referencji audio |
| Mieszane referencje | Dźwięk można łączyć z obrazami i wideo w jednym żądaniu referencja na wideo |
| Wejście WAV i MP3 | Referencyjny dźwięk musi używać jednego z udokumentowanych formatów wejściowych |
| Wynik 4–15 sekund | H3 zaprojektowano do krótkich klipów, a nie do pełnej długiej ścieżki dźwiękowej w jednym generowaniu |
Są trzy ważne ograniczenia. Referencji audio nie da się wysłać samodzielnie; MiniMax wymaga przynajmniej jednego obrazu albo wideo obok niej. Pliki audio są ograniczone do 15 MB każdy, a całe żądanie z mieszanymi referencjami do 12 plików. Trybu referencji nie da się też połączyć z trybem pierwszej albo ostatniej klatki w tym samym żądaniu, więc zdecyduj, czy przy tym ujęciu ważniejsze są dokładne klatki brzegowe, czy szersze sterowanie multimodalne.
Uwaga
Stereo to nie to samo co dźwięk przestrzenny. MiniMax dokumentuje natywny wynik stereo, ale jego obecne publiczne materiały nie obiecują dźwięku dookólnego, ambisonicznego, obiektowego ani określonego poziomu dokładności pozycjonowania. Oceń rozmieszczenie lewo-prawo na słuchawkach, zanim nazwiesz wynik przestrzennym.
Zbuduj brief dźwiękowy, zanim napiszesz prompt
Najbardziej użyteczny prompt do H3 to nie długa lista dźwięków. To zwięzły plan dźwiękowy, który mówi modelowi, co ma prowadzić, co ma to wspierać, a co musi wydarzyć się w widocznym momencie. Napisz ten plan w pięciu przejściach.
1. Ustal akcję wizualną i rytm
Synchronizacja dźwięku zależy od widocznych zdarzeń. Zacznij od ujęcia, akcji tematu, ruchu kamery i sekwencji taktów. „A spoon hits the saucer as the camera settles” daje modelowi wspólne zdarzenie audiowizualne. „Add a cup sound” nie mówi, kiedy zdarzenie następuje ani co powinno je wywołać.
Dla dziesięciosekundowego klipu prosta mapa taktów może wyglądać tak:
- 0–3 sekundy: ustanowienie pomieszczenia i tematu
- 3–7 sekund: dialog albo główna akcja
- 7–10 sekund: odsłonięcie produktu i finalna wskazówka dźwiękowa
Traktuj te czasy jako kierunek, a nie znaczniki montażowe co do klatki. Test produkcyjny powinien zmierzyć, jak blisko wynik trzyma się tego planu.
2. Nazwij jedną główną warstwę dźwiękową
Wybierz dźwięk, który widownia musi zauważyć pierwszy: dialog, interakcję z produktem, hak muzyczny albo element dźwięku otoczenia. Daj mu najbardziej klarowne sformułowanie i chroń wokół niego miejsce.
Jeśli główny jest dialog, napisz dokładną kwestię w cudzysłowie i podaj jedną wskazówkę wykonawczą. Jeśli główny jest dźwięk produktu, opisz fizyczną akcję, która go wytwarza. Jeśli główna jest muzyka, podaj tempo, instrumentację, nastrój i miejsce, w którym aranżacja ma się zmienić.
3. Dodaj tło jako miejsce akustyczne
Tło ma wyjaśniać, gdzie żyje ujęcie. Zamiast „café sounds” opisz cichy syk ekspresu za osobą mówiącą, niską rozmowę w sali i dzwonek drzwi w oddali. Przy czystym spocie produktowym poproś o kontrolowany ton studia, a nie o ciszę — chyba że cisza jest świadomym wyborem twórczym.
Używaj słów o odległości i materiale, które da się zastosować i do obrazu, i do dźwięku:
- blisko, sucho, kameralnie i z lekkim pogłosem
- daleko, przytłumione przez szybę albo poza kadrem po lewej
- kroki po płytkach, ruch tkaniny, deszcz na metalu albo szklanka stawiana na drewnie
4. Zdecyduj, czy muzyka to ilustracja, czy źródło
Ilustracja siedzi poza sceną; muzyka źródłowa pochodzi z przedmiotu albo miejsca wewnątrz niej. Powiedz, którą masz na myśli. „A restrained electronic score under the dialogue” prosi o warstwę tła, a „music playing quietly from the café radio, slightly muffled” daje jej źródło akustyczne w kadrze.
Kiedy muzyka nie jest potrzebna, napisz no music. To ułatwia ocenę testu dialogu albo efektów. Kiedy jest potrzebna, zostaw zapas dla głosu, zamiast prosić, by każda warstwa była głośna i dramatyczna.
5. Podaj wykluczenia
Negatywne sterowanie dźwiękiem jest użyteczne, kiedy chroni brief. Przykłady to no narration, no crowd cheering, no added melody i no exaggerated whooshes. Trzymaj listę wykluczeń krótko; zbyt wiele ograniczeń może rywalizować z akcją, o którą naprawdę ci chodzi.
Jak używać referencji audio bez mieszania ich ról
System referencji H3 jest najbardziej użyteczny, kiedy każdy plik ma jedno zadanie. Referencyjny klip audio może dostarczyć barwy i kadencji głosu, energii muzycznej, faktury dźwiękowej albo rytmu montażu. Nie zakładaj, że model wie, którą właściwość ma zapożyczyć.
Napisz mapę plików przed finalnym promptem:
| Plik | Przypisane zadanie | Co nie powinno się przenieść |
|---|---|---|
| Obraz postaci | Tożsamość, ubiór i umiejscowienie produktu | Tło i światło |
| Wideo ruchu | Gest i rytm kamery | Tożsamość postaci i dialog |
| Audio głosu | Charakter głosu, kadencja i energia emocjonalna | Oryginalne słowa i szum tła |
| Audio muzyki | Tempo, gęstość aranżacji i rytm montażu | Rozpoznawalna melodia albo tekst |
Potem opisz te relacje w języku naturalnym. Własny przykład H3 od MiniMax używa zdania, które przypisuje ruch kamery referencji wideo, wykonawcę referencji obrazowej, a wokal referencji audio. Numerowane etykiety plików różnią się w zależności od interfejsu, a API używa typowanej zawartości i ról referencji, więc zastąp etykiety w poniższych szablonach dokładną notacją widoczną w twoim przebiegu pracy.
Ostrzeżenie
Używaj cudzego głosu albo wykonania jako referencji tylko wtedy, gdy masz zgodę. Referencja głosowa nie jest dowodem, że masz prawa do tożsamości osoby mówiącej, do nagrania, do muzyki ani do publikacji wygenerowanej imitacji.
Czyste referencje dają czystsze eksperymenty. Przytnij ciszę, usuń niepowiązaną muzykę tła, unikaj przesterowania i zadbaj, żeby istotny fragment wokalny albo muzyczny był dobrze słyszalny. Użyj krótkiego wycinka pokazującego właściwość, o którą ci chodzi, zamiast domyślnie wgrywać maksymalną długość.
Pięć szablonów promptów pod natywny dźwięk MiniMax H3
To briefy wyjściowe, a nie deklarowane wyniki testów. Uruchom każdy prompt więcej niż raz i oceń wyniki protokołem z następnej sekcji.
1. Dialog jednej osoby z tonem pomieszczenia
Close-up of a chef at the pass in a quiet restaurant kitchen after service. The camera makes a slow push-in as she looks toward a colleague off-camera and says, “We try it again tomorrow.” Delivery: tired but quietly optimistic, natural pace, one short breath before “tomorrow.” Her voice is the primary audio layer, close and dry. Low ventilation hum and occasional metal cooling sounds remain distant. No music, no narration, no other voices.
Użyj tego szablonu do oceny poprawności mowy, podania emocjonalnego, ruchu ust i tego, czy tło zostaje za kwestią.
2. Warstwowe tło ze zsynchronizowanym Foley
Wide shot inside a nearly empty laundromat at night, fluorescent light reflecting on the tiled floor. A person moves a wet jacket from a washer to a rolling basket; the metal door clicks shut exactly when their hand closes it, then the basket wheels rattle softly across tile. Foreground: fabric movement and the door click. Mid-ground: steady washer rotation. Background: rain against the front window and one distant car passing outside. Native stereo mix, no dialogue, no music.
Ten brief izoluje tło, realizm materiałów, separację lewo-prawo i synchronizację kontaktu.
3. Odsłonięcie produktu prowadzone muzyką
Ten-second vertical product film for a translucent coral sports bottle on a lilac studio surface. Start with a macro shot of condensation, then orbit as the bottle rises into the hero position. Original minimal electronic score at 100 BPM: soft pulse for the opening, a clean percussive accent when the logo faces camera, then a short resolved final note. Add subtle droplets and one controlled placement sound. Music supports the product sounds rather than masking them. No voice and no stock-style cinematic boom.
Planowanie wizualne pod konkretny produkt, poza samą ścieżką dźwiękową, opisuje przebieg pracy od zdjęcia do wideo produktowego.
4. Dozwolona referencja głosowa z nowym dialogiem
Use voice reference 1 only for the narrator's vocal timbre, speaking pace, and warm conversational energy. Do not reuse its words or background noise. The person from image reference 1 stands beside the window and says, “The first draft is only the beginning.” Keep the spoken line intelligible and synchronized to the visible speaker. Add a quiet residential room tone and soft rain outside. No music. The voice recording is authorized for this use.
Sprawdź, czy zamierzone właściwości głosu przenoszą się bez niezamierzonego skopiowania szumu, frazowania albo treści z nagrania źródłowego. Opisz pożądane cechy słowami, żeby instrukcja pozostała użyteczna nawet wtedy, gdy wierność wobec referencji się waha.
5. Referencja rytmu do montażu na social media
Create a 12-second montage of a ceramic artist shaping, glazing, and placing a finished cup on a shelf. Use audio reference 1 only for tempo, rhythmic energy, and edit pacing. Compose an original percussive track with different melody and sound design. Cut the visual action on the major rhythmic changes: clay lands on the wheel, brush touches glaze, cup reaches the shelf. Preserve natural wheel rotation, brush texture, and the final ceramic tap beneath the music. No dialogue.
To oddziela sterowanie rytmem od kopiowania muzyki i daje trzy widoczne punkty synchronizacji do sprawdzenia.
Powtarzalny plan oceny dźwięku w H3
Jedno dopracowane oficjalne demo nie odpowie na pytanie, czy model pasuje do twojego przebiegu pracy. Użyj tego samego briefu w co najmniej trzech generowaniach, trzymaj czas trwania i referencje bez zmian i oceniaj każdy wynik, zamiast wybierać tylko najmocniejszy.
Najpierw przetestuj warstwy osobno
Zacznij od czterech kontrolowanych promptów:
- Sam dialog i cichy ton pomieszczenia
- Tło i trzy widoczne zdarzenia Foley, bez mowy i muzyki
- Muzyka instrumentalna z dwoma zaplanowanymi akcentami wizualnymi
- Jedna dozwolona referencja audio w parze z prostą referencją obrazową albo wideo
Dopiero gdy te przejdą pomyślnie, łącz dialog, tło, Foley i muzykę w jednej zatłoczonej scenie. Dzięki temu porażki dają się diagnozować: rozpoznasz, czy problem wynika z wymowy, rytmu, przeniesienia referencji, czy gęstości miksu.
Używaj karty oceny, a nie wrażenia
| Wymiar | Pytanie, na które odpowiadasz | Prosta miara |
|---|---|---|
| Poprawność dialogu | Czy żądane słowa zostały wypowiedziane poprawnie? | Poprawne słowa podzielone przez żądane |
| Synchronizacja ust | Czy widoczne zamknięcia ust i akcenty sylab się zgadzają? | Ocena 1–5 i pierwszy widoczny rozjazd |
| Synchronizacja zdarzeń | Czy dźwięki kontaktu lądują z pokazaną akcją? | Klatki przed lub po przy trzech planowanych punktach |
| Spójność głosu | Czy osoba mówiąca pozostaje rozpoznawalna przez całą kwestię? | Oceń początek, środek i koniec osobno |
| Kontrola referencji | Czy żądana właściwość przeniosła się bez zbędnego bagażu? | Wypisz przeniesienia zamierzone i niezamierzone |
| Obraz stereo | Czy rozmieszczenie lewo-prawo jest użyteczne i stabilne? | Odsłuch na słuchawkach plus kontrola przebiegu kanałów |
| Hierarchia miksu | Czy główna warstwa jest wyraźnie zrozumiała? | Ocena 1–5 przy normalnym poziomie odtwarzania |
| Powtarzalność | Jak często klip nadaje się do użytku bez naprawy dźwięku? | Użyteczne wyniki podzielone przez wszystkie przebiegi |
Obejrzyj wyeksportowany plik w edytorze wideo albo stacji audio. Potwierdź, że są dwa kanały, posłuchaj problemów fazowych w mono i porównaj przebiegi wokół planowanych zdarzeń kontaktu. Nie wnioskuj o jakości dźwięku z podglądu na platformie społecznościowej, która może rekompresować albo przemapować ścieżkę.
Wskazówka
Zachowaj nieudane generowania. Poprawka promptu jest ulepszeniem tylko wtedy, gdy podnosi odsetek użytecznych wyników w powtarzanych przebiegach, a nie gdy daje jeden szczęśliwy klip.
Ograniczenia, które trzeba wziąć pod uwagę
Własny post premierowy MiniMax mówi, że H3 wciąż ma pole do poprawy, i wskazuje detal wizualny jako jeden z obszarów przyszłej pracy. Jeśli chodzi o produkcję dźwięku, obecna publiczna dokumentacja zostawia też kilka pytań otwartych. Nie publikuje gwarancji dotyczących współczynnika błędu słów, dokładności synchronizacji ust, głośności, częstotliwości próbkowania, układu kanałów poza stereo, pokrycia językowego, podobieństwa do referencji głosowej ani sterowania wskazówkami co do kodu czasowego.
Planuj wokół tych praktycznych granic:
- Krótki wynik: 4–15 sekund pasuje do ujęć, reklam i klipów na social media, ale ciągłość w długiej formie wymaga montażu z wielu generowań.
- Krótki kontekst referencyjny: dozwolone są maksymalnie trzy klipy audio, ale ich łączny czas nie może przekroczyć 15 sekund.
- Brak żądania z samą referencją audio: referencyjny klip audio musi mieć w parze przynajmniej jeden obraz albo wideo.
- Rytm w języku naturalnym to nie zablokowana oś czasu: traktuj czasy taktów jako intencję, dopóki powtarzane testy nie udowodnią potrzebnej ci precyzji.
- Stereo wymaga weryfikacji: dwa kanały nie tworzą automatycznie wiarygodnego kierunku, głębi ani zgodności z mono.
- Gęste miksy potrafią ukryć błędy: dialog, efekty, tło i muzyka mogą być modelowane razem, ale prostszy brief łatwiej kontrolować i naprawiać.
- Prawa do referencji wciąż obowiązują: możliwości modelu nie dają zgody na imitowanie głosu ani na wykorzystanie chronionej muzyki.
MiniMax H3 jest już dostępny dla użytkowników OmniArt z planem Creator i wyżej w trybach Video, Transition i Reference, z wynikiem 5–15 sekund w 1440p. Tryb Reference przyjmuje do dziewięciu obrazów, trzech wideo i trzech klipów audio, przy maksymalnie 12 plikach łącznie; referencyjny dźwięk musi mieć w parze przynajmniej jeden obraz albo wideo. OmniArt nalicza 9 kredytów za sekundę wyniku plus 9 kredytów za każdą zaokrągloną w górę sekundę referencyjnego wideo. Pierwsze pięć obrazów referencyjnych jest bezpłatnych, każdy kolejny obraz kosztuje 2 kredyty, a referencyjny dźwięk nie kosztuje dodatkowo. Natywny dźwięk jest częścią wyniku H3, a obecna powierzchnia OmniArt nie wystawia osobnego przełącznika dźwięku. Do planowania budżetu w oficjalnym API poza OmniArt sprawdź oficjalną stronę cennika pay-as-you-go oraz przewodnik po cenniku i specyfikacji H3; nie podstawiaj stawki hosta zewnętrznego zamiast ceny samego MiniMax.
Zbuduj resztę ścieżki dźwiękowej w OmniArt
Natywny dźwięk może ograniczyć przekazywanie plików między narzędziami, ale nie odbiera wartości osobnym narzędziom dźwiękowym. Jeśli podejście H3 ma dobry obraz i słabą narrację, zachowaj obraz i zbuduj kontrolowaną ścieżkę głosową. Jeśli dialog działa, ale pomieszczeniu brakuje faktury, dołóż warstwę tła albo Foley zamiast generować całe ujęcie od nowa.
OmniArt łączy przebiegi pracy nad wideo, mową, dźwiękiem i muzyką w jednej twórczej przestrzeni. Użyj przewodnika po generatorze efektów dźwiękowych AI, żeby zaprojektować zastępczy Foley i tło, albo porównaj podejście do promptów z przewodnikiem po dźwięku przestrzennym w Veo 3.1. Celem nie jest wciśnięcie każdego dźwięku w jedno generowanie. Chodzi o to, żeby zachować natywną ścieżkę tam, gdzie działa, i wymienić tylko tę warstwę, która nie działa.
Gotowy, aby tworzyć?
Zacznij generować świetne treści z AI