MiniMax H3 — przewodnik po promptach i kontroli referencji
Naucz się promptować MiniMax H3 z referencjami obrazu, wideo, audio i tekstu. Przypisz każdemu plikowi jedną rolę, unikaj konfliktów i wyreżyseruj ujęcie w czasie.

Użyteczna myśl stojąca za promptem do MiniMax H3 nie brzmi „pisz więcej szczegółów”. Brzmi „daj każdemu wejściu jedno zadanie”. H3 przyjmuje tekst, obrazy, wideo i audio jako jeden zestaw referencji, więc twórca może wziąć tożsamość produktu z kadru, ruch z klipu, tempo z dźwięku, a reżyserię ujęcia z promptu. Ta elastyczność pomaga tylko wtedy, gdy model wie, które źródło steruje którą częścią wyniku.
Ten przewodnik po promptach do MiniMax H3 zamienia tę zasadę w powtarzalny format. Dowiesz się, jak przypisać każdemu plikowi rolę, nie dopuścić do sprzeczności między referencjami, napisać reguły zachowania i podzielić generowanie trwające 4–15 sekund na odmierzone takty. Sześć szablonów na końcu obejmuje wideo produktowe, ruch postaci, dialog, podmianę otoczenia, animację interfejsu i przejście od pierwszej do ostatniej klatki.
Uwaga
To przewodnik oparty na dokumentacji, a nie raport z generowań H3 niezależnie przetestowanych przez OmniArt. Powstał na podstawie aktualnego przewodnika H3 po generowaniu oraz oficjalnej dokumentacji API MiniMax. MiniMax H3 jest już dostępny dla użytkowników planów Creator+ w OmniArt, ale udokumentowanych możliwości dostawcy wciąż nie należy czytać jako wyników niezależnych testów.
MiniMax H3, Hailuo 3.0 czy Hailuo 03?
Aktualna dokumentacja MiniMax nazywa ten model MiniMax H3 i podaje oficjalny identyfikator modelu w API jako MiniMax-H3. W relacjach premierowych i katalogach zewnętrznych spotkasz też Hailuo 3.0, Hailuo 03 albo Hailuo-3.0, bo Hailuo to marka produktów wideo MiniMax.
Używaj nazwy wymaganej przez powierzchnię, przed którą siedzisz. W oficjalnym API MiniMax V2 udokumentowanym w chwili publikacji oznacza to MiniMax-H3; nie zakładaj, że alias z marketplace'u jest też poprawnym identyfikatorem w oficjalnym API. Ten przewodnik używa nazwy MiniMax H3 dla modelu i generowanie z referencji dla trybu łączącego wejścia obrazu, wideo i audio. „Omni reference” dobrze opisuje ten proces z mieszanymi mediami, ale oficjalne API nazywa go reference-to-video.
Poznaj trzy tryby generowania H3
Wybór właściwego trybu poprzedza pisanie promptu.
| Tryb | Wejścia | Użyj, gdy |
|---|---|---|
| Tekst na wideo | Wymagany prompt tekstowy | Scenę da się stworzyć z samego opisu |
| Obraz na wideo z pierwszą/ostatnią klatką | Wymagany prompt plus pierwsza klatka, ostatnia albo obie | Liczy się dokładna kompozycja otwierająca lub kończąca |
| Generowanie z referencji | Wymagany prompt plus referencje obrazu, wideo lub audio | Potrzebujesz tożsamości, wzornictwa, ruchu, kamery, głosu, rytmu albo stylu z wgranych plików |
Aktualna specyfikacja oficjalna wymienia wynik w 2K i długości całkowite od 4 do 15 sekund. Każde zapytanie wymaga niepustego promptu tekstowego, z limitem 7000 znaków. Zapytanie z referencjami może zawierać do dziewięciu obrazów, trzech wideo i trzech plików audio, łącznie nie więcej niż 12 plików. Referencje wideo mieszczą się w łącznym limicie 15 sekund, tak samo jak referencje audio. Referencji audio nie da się wysłać samodzielnie; musi jej towarzyszyć co najmniej jeden obraz albo wideo.
Tryb tekst na wideo wymaga konkretnych proporcji obrazu. Generowanie z referencji może użyć konkretnych proporcji albo pozwolić H3 dobrać je adaptacyjnie, a tryb z pierwszą i ostatnią klatką idzie za wgranym obrazem. Udokumentowane proporcje do wyboru to 21:9, 16:9, 4:3, 1:1, 3:4 i 9:16.
Jest jedna twarda granica procesu: trybu z pierwszą/ostatnią klatką i generowania z referencji nie da się połączyć w jednym zapytaniu do API. Jeśli liczą się dokładne klatki brzegowe, użyj trybu z pierwszą i ostatnią klatką. Jeśli ważniejsze jest przeniesienie tożsamości, ruchu, stylu albo dźwięku, użyj generowania z referencji i opisz kompozycję otwierającą tekstem.
Zbuduj prompt H3 jako mapę ról
API H3 przyjmuje media jako typowane elementy z rolami takimi jak reference_image, reference_video i reference_audio. Te role techniczne wskazują typ mediów; twój prompt powinien pójść o poziom dalej i określić kreatywną odpowiedzialność każdego pliku.
Trzymaj się tej kolejności:
DELIVERABLE
What the final clip is for, its duration, and its format.
ROLE MAP
Reference image 1 = subject identity and immutable appearance.
Reference image 2 = environment or visual style only.
Reference video 1 = body motion and timing only.
Reference audio 1 = rhythm and edit timing only.
SHOT
Subject, action, environment, lighting, and camera direction.
TIMELINE
Time-coded beats that add up to the selected duration.
PRESERVE
Features that must remain unchanged from named references.
EXCLUDE
A short list of the most damaging unwanted changes.
Numerowane etykiety powyżej to etykiety semantyczne na potrzeby twojego briefu, a nie obietnica, że każdy interfejs H3 wystawia dosłowne uchwyty Reference image 1. W oficjalnym API pliki są osobnymi elementami tablicy content. W interfejsie graficznym używaj nazw załączników albo składni wzmianek, które daje ta powierzchnia, i utrzymaj tę samą logikę: jeden plik, jedno zadanie.
Daj każdemu plikowi jedno główne zadanie
Referencja zawiera więcej informacji, niż zwykle chcesz przenieść. Klip taneczny zawiera wykonawcę, ubranie, lokację, kamerę, światło, ruch, a czasem muzykę. Jeśli poprosisz H3, żeby „poszedł za wideo”, wszystkie te cechy zaczną konkurować z twoim obrazem postaci.
Wiąż wąsko:
- Referencja obrazu: tożsamość, twarz, kostium, geometria produktu, logo, paleta albo projekt otoczenia.
- Referencja wideo: ruch ciała, tor kamery, czas akcji, interakcja fizyczna albo rytm montażu.
- Referencja audio: charakter głosu, tempo mowy, rytm muzyki, tło dźwiękowe albo sygnał zdarzenia.
- Prompt tekstowy: finalna scena, reguły przenoszenia, oś czasu, priorytety i instrukcje zachowania.
Kiedy jeden plik musi wykonać dwa zadania, nazwij oba i wyraźnie postaw granicę: „Reference video 1 controls camera path and action timing; ignore its performer, wardrobe, location, color grade, and audio.”
Nie pozwól referencjom walczyć ze sobą
Konflikt referencji jest zwykle problemem instrukcji, zanim stanie się problemem modelu. Dwa obrazy mogą pokazywać różne kurtki, klip z ruchem może mieć inną budowę ciała, a rytm dźwięku może sugerować cięcia kłócące się z zamówionym nieprzerwanym ruchem kamery.
Gdy wejścia się nakładają, użyj spisanej kolejności priorytetów:
Priority order:
1. Reference image 1 controls character identity and wardrobe.
2. Reference video 1 controls movement and timing only.
3. Reference image 2 controls lighting palette and set design only.
4. The text prompt controls camera framing and final composition.
A potem rozstrzygnij sprzeczności, zamiast liczyć, że H3 domyśli się twoich preferencji. Jeśli obraz tożsamości ma rozpuszczone włosy, a wideo z ruchem czapkę, powiedz, czy finalna postać zostaje przy włosach, czy zakłada czapkę. Jeśli referencja produktu ma czytelną etykietę, a obraz stylu jest malarski, napisz, że stylizacja dotyczy otoczenia, a opakowanie pozostaje fotorealistyczne.
Trzy nawyki ograniczają konflikty:
- Używaj najmniejszego użytecznego zestawu referencji. Więcej wejść to więcej możliwych niezgodności. Dokładaj plik tylko wtedy, gdy wnosi informację, której prompt nie wyrazi niezawodnie.
- Oddziel treść od stylu. Nazwij, która referencja odpowiada za bohatera, a która za sposób pokazania.
- Wybierz jedną instancję odpowiedzialną za kamerę. Albo przenieś kamerę z wideo, albo wyreżyseruj ją tekstem. Jeśli potrzebujesz obu, napisz, że wideo daje czas, a tekst nadpisuje kadr.
Szerszy proces rozpisany objaw po objawie znajdziesz w tekście 7 poprawek do promptów wideo AI — trzymaj go obok tego przewodnika przy iterowaniu.
Pisz instrukcje zachowania, które da się sprawdzić
„Utrzymaj spójność” to za mało. Blok zachowania powinien nazywać widoczne cechy, które da się sprawdzić w dowolnej klatce.
Dla postaci:
Preserve from reference image 1 throughout every frame: facial structure,
eye color, hairstyle and length, jacket cut, jacket color, and body proportions.
Do not replace the performer with the person from reference video 1.
Dla produktu:
Preserve from reference image 1: bottle silhouette, cap shape, label placement,
navy wordmark, coral seal, material finish, and relative proportions.
No duplicate product, redesigned packaging, extra text, or changing logo.
Najpierw powinny iść pozytywne kotwice; wykluczenia są barierką, a nie całym promptem. Trzymaj listę zakazów krótką i konkretną. Dziesięć mglistych zakazów potrafi rozmyć cztery cechy stałe, które naprawdę decydują o użyteczności ujęcia.
Jeśli ta sama postać pojawi się w kilku osobno generowanych klipach, trzymaj blok tożsamości i kostiumu identyczny w każdym prompcie. Proces spójnej postaci wyjaśnia, jak zbudować taki wielokrotnego użytku pakiet referencji na dłuższą sekwencję.
Reżyseruj czas, a nie tylko treść
H3 pozwala na klipy od 4 do 15 sekund, ale długi akapit nie mówi modelowi, kiedy dzieje się każde zdarzenie. Oś czasu zamienia prompt w zwięzły plan ujęcia.
Dla klipu 10-sekundowego:
0–2 seconds: locked medium-wide establishing shot; subject holds still.
2–6 seconds: subject performs the referenced action at the source tempo.
6–9 seconds: camera makes one slow 20-degree arc to the right.
9–10 seconds: subject settles; hold a clean final composition for the edit.
Trzymaj każdy takt w zasięgu możliwości. Jedna główna akcja plus jeden ruch kamery są zwykle czytelniejsze niż łańcuch niepowiązanych przemian. Zadbaj, żeby zakresy czasu sumowały się do wybranej długości, ważne detale produktu albo twarzy umieść w wolniejszym takcie, a ostatnie pół sekundy lub sekundę zarezerwuj na stabilny punkt montażowy.
Dźwięk może korzystać z tego samego zegara:
At 2.0 seconds, the first downbeat starts the hand movement.
At 6.0 seconds, the bass hit motivates the camera arc.
From 9.0 seconds, let the music tail continue under the held final frame.
Więcej słownictwa o obiektywach, świetle i kamerze znajdziesz w przewodniku po filmowych promptach do wideo AI.
Sześć szablonów promptów do MiniMax H3
Podmień szczegóły w nawiasach, dołącz wyłącznie wymienione pliki i dostosuj etykiety do interfejsu, którego używasz. Te szablony są uporządkowanymi punktami wyjścia opartymi na udokumentowanych trybach wejścia H3; nie są deklarowanymi zwycięzcami testów ani gwarancją wyniku.
Szablon 1: odsłonięcie produktu z referencją ruchu i muzyki
- Tryb: generowanie z referencji
- Pliki: jeden czysty obraz produktu, jedno wideo z ruchem kamery, opcjonalnie referencja muzyczna
Create a 10-second 9:16 product reveal for a paid social placement.
Role map:
- Reference image 1 controls the product's exact design, proportions, packaging,
colors, materials, label placement, and wordmark.
- Reference video 1 controls camera path and acceleration only. Ignore its subject,
location, lighting, color grade, and audio.
- Reference audio 1 controls beat and edit timing only.
Scene: The product stands centered on a warm-violet studio plinth. Soft lilac key
light from camera left, restrained coral rim light, subtle atmospheric haze.
Timeline:
- 0–2 seconds: static wide reveal on the first soft beat.
- 2–7 seconds: transfer the smooth push-and-arc movement from reference video 1.
- 7–9 seconds: one narrow highlight travels across the product surface.
- 9–10 seconds: camera settles; hold the label front-facing and readable.
Preserve reference image 1 exactly: silhouette, cap, material finish, label layout,
brand colors, and wordmark. Keep one product only. No redesigned packaging,
duplicate objects, extra text, warped label, or abrupt camera shake.
Przygotowanie kadru nieruchomego, które poprzedza ten prompt, opisuje proces zdjęcie na wideo produktowe.
Szablon 2: przeniesienie ruchu postaci bez dryfu tożsamości
- Tryb: generowanie z referencji
- Pliki: jeden obraz postaci, jedno wideo z ruchem, opcjonalnie obraz otoczenia
Create an 8-second 16:9 cinematic character performance.
Priority order:
1. Reference image 1 controls face, hair, body proportions, and wardrobe.
2. Reference video 1 controls body choreography and action timing only.
3. Reference image 2 controls the environment palette and architecture only.
4. This prompt controls framing and lighting.
The character from reference image 1 performs the complete movement from reference
video 1 in a moonlit station based on reference image 2. Medium full shot, camera
locked at chest height, soft directional light, realistic weight and foot contact.
Timeline:
- 0–1 seconds: character holds the starting pose.
- 1–7 seconds: perform the reference choreography once at its original tempo.
- 7–8 seconds: settle naturally and look toward camera left.
Preserve facial structure, hairstyle, coat shape, coat color, boots, and body
proportions from reference image 1 in every frame. Do not inherit the motion video's
performer, face, clothing, background, camera movement, or audio. No extra limbs,
sliding feet, costume changes, or cuts.
Szablon 3: scena dialogowa z referencją głosu
- Tryb: generowanie z referencji
- Pliki: jeden obraz postaci, jeden autoryzowany klip audio z głosem albo dialogiem
Ostrzeżenie
Wgrywaj wyłącznie głos, do którego masz prawa albo wyraźną zgodę. To, że model przyjmuje referencję audio, nie daje ci prawa do naśladowania cudzego głosu.
Create a 9-second 16:9 single-character dialogue shot.
Role map:
- Reference image 1 controls the speaker's appearance, wardrobe, and room design.
- Reference audio 1 controls spoken timing, cadence, emotional progression, and pauses.
Shot: Medium close-up, eye-level, 50 mm cinematic framing. The speaker begins calm,
briefly smiles after the central pause, then finishes with quiet confidence. Natural
blinks and restrained hand movement. Camera remains static; soft room tone underneath.
Timeline:
- 0–1 seconds: silent eye contact and a small inhale.
- 1–8 seconds: performance follows reference audio 1 exactly in timing and pauses.
- 8–9 seconds: mouth closes, expression settles, hold for the edit.
Preserve face, hairstyle, skin tone, jacket, background layout, and lighting direction
from reference image 1. Keep one speaker. No camera move, cutaway, background speech,
new words, exaggerated gestures, or wardrobe changes.
Szablon 4: podmiana otoczenia z wideo źródłowego
- Tryb: generowanie z referencji
- Pliki: jedno wideo źródłowe, jeden obraz otoczenia, opcjonalnie obraz bohatera
Create a 12-second 16:9 environmental replacement based on the source clip.
Role map:
- Reference video 1 controls shot length, subject action, physical timing, camera path,
framing progression, and interaction with the ground.
- Reference image 1 controls the replacement environment, architecture, palette,
weather, and lighting mood.
- Reference image 2 controls the subject's face and wardrobe, if supplied.
Replace the source video's location with the environment from reference image 1.
Preserve the original action and camera movement continuously. Match subject lighting,
contact shadows, reflections, and atmospheric perspective to the new environment.
Timeline follows reference video 1. Maintain one continuous shot with the original
action beats and no added event.
Preserve the source subject's position, scale, motion, and ground contact. Preserve
identity and wardrobe from reference image 2 when present. Do not copy the original
background, signage, bystanders, color grade, or source audio. No cuts, teleporting,
floating feet, or changing architecture.
Szablon 5: animacja interfejsu marki zsynchronizowana z rytmem
- Tryb: generowanie z referencji
- Pliki: jeden obraz układu interfejsu, jedno wideo ze stylem ruchu, opcjonalnie referencja audio
Create a 7-second 1:1 UI motion-design clip for a product announcement.
Priority order:
1. Reference image 1 controls exact layout, hierarchy, component positions, text,
logo, colors, corner shapes, and typography appearance.
2. Reference video 1 controls transition character and easing only.
3. Reference audio 1 controls the timing of three motion beats only.
Animate the interface from reference image 1 without redesigning it. Begin with the
main panel at rest. Use the restrained slide-and-scale transition quality from
reference video 1. Keep the camera orthographic and the background static.
Timeline:
- 0–1 seconds: complete layout at rest.
- 1–3 seconds: cards enter in sequence on beat one.
- 3–5 seconds: primary control changes state on beat two.
- 5–6 seconds: one subtle emphasis pulse on beat three.
- 6–7 seconds: complete interface holds sharp and readable.
Preserve every word, logo shape, component proportion, spacing relationship, and brand
color from reference image 1. No invented labels, misspelled text, extra panels,
perspective tilt, camera movement, glow overload, or elastic distortion.
Szablon 6: dokładna przemiana od pierwszej do ostatniej klatki
- Tryb: obraz na wideo z pierwszą i ostatnią klatką
- Pliki: jeden obraz pierwszej klatki i jeden obraz ostatniej klatki; bez mediów referencyjnych
Create a 10-second transformation from the supplied first frame to the supplied last
frame. Preserve the subject's identity and the camera's fixed position throughout.
Timeline:
- 0–2 seconds: hold the first-frame composition; only subtle ambient movement.
- 2–7 seconds: the scene transforms progressively from the center outward. Materials
change continuously with believable physical contact and no hard cut.
- 7–9 seconds: remaining details resolve into the last-frame design.
- 9–10 seconds: arrive exactly at the supplied last frame and hold it cleanly.
One continuous locked shot. Preserve subject scale, face, silhouette, horizon, lens,
and framing during the transition. No reference-style transfer, new characters,
camera movement, jump cut, flicker, or overshoot beyond the final composition.
Nie dołączaj do tego zapytania obrazów, wideo ani audio referencyjnych z pozostałych szablonów. Oficjalne API traktuje generowanie z pierwszą i ostatnią klatką oraz generowanie z referencji jako tryby wzajemnie się wykluczające.
Praktyczna kolejność iterowania
Nie zmieniaj instrukcji tożsamości, ruchu, kamery, stylu i dźwięku naraz po jednym rozczarowującym renderowaniu. Wtedy nie da się nauczyć, która instrukcja pomogła.
Iteruj w trzech przebiegach:
- Zablokuj role i cechy stałe. Użyj najmniejszego zestawu referencji i sprawdź, czy bohater albo produkt pozostaje rozpoznawalny.
- Zablokuj akcję i oś czasu. Dodaj źródło ruchu albo odmierzone takty, trzymając styl w ryzach.
- Dołóż warstwę wykończeniową. Wprowadź otoczenie, światło, korekcję barwną, sygnały dźwiękowe i detale wykończenia dopiero wtedy, gdy dwie pierwsze warstwy są stabilne.
Kiedy wynik odpływa, upraszczaj, zanim dołożysz kolejne zakazy. Usuń najmniej istotną referencję, skróć oś czasu albo zawęź zadanie jednego źródła. Porównuj kilka wariantów według tej samej listy: tożsamość, geometria, ruch, kamera, zgranie dźwięku i stabilność ostatniej klatki.
Pierwsze kroki z poziomu OmniArt
MiniMax H3 jest dostępny dla użytkowników planów Creator+ w OmniArt. Otwórz kreator wideo MiniMax H3, wybierz H3 i tryb pasujący do briefu: Video do standardowego generowania, Transition do ujęcia od pierwszej do ostatniej klatki albo Reference do mieszanego prowadzenia obrazem, wideo i dźwiękiem. Obecna powierzchnia produktu obsługuje wynik 5–15 sekund w 1440p.
W trybie Reference dołącz do dziewięciu obrazów, trzech wideo i trzech plików audio, łącznie nie więcej niż 12 plików. Referencja audio musi iść w parze z co najmniej jednym obrazem albo wideo. Przypisz każdemu załącznikowi jedną rolę, wklej do promptu odpowiednią mapę ról i reguły zachowania, wybierz długość 5–15 sekund i generuj. Natywny dźwięk jest częścią wyniku H3; OmniArt nie wystawia obecnie osobnego przełącznika dźwięku.
OmniArt nalicza 9 kredytów za sekundę wyniku. Referencja wideo kosztuje dodatkowe 9 kredytów za każdą zaokrągloną w górę sekundę źródła; pierwsze pięć obrazów referencyjnych jest bezpłatne, a każdy kolejny obraz kosztuje 2 kredyty; referencja audio nie wiąże się z dodatkową opłatą. Oficjalne stawki API i rozpisane przykłady kosztów poza OmniArt znajdziesz w przewodniku po cenach i specyfikacji MiniMax H3.
Gotowy, aby tworzyć?
Zacznij generować świetne treści z AI