Guia de prompts do MiniMax H3: controle cada entrada de referência
Aprenda a fazer prompts no MiniMax H3 com referências de imagem, vídeo, áudio e texto. Atribua um papel a cada asset, evite conflitos e dirija um plano de vídeo com IA no tempo.

A ideia útil por trás de um prompt do MiniMax H3 não é “escrever mais detalhes”. É “dar a cada entrada um único trabalho”. O H3 pode receber texto, imagens, vídeo e áudio como um conjunto unificado de referências, então um criador pode extrair a identidade do produto de uma still, o movimento de um clipe, o ritmo do áudio e a direção do plano a partir do prompt. Essa flexibilidade só ajuda quando o modelo consegue distinguir qual fonte controla qual parte do resultado.
Este guia de prompts do MiniMax H3 transforma esse princípio em um formato repetível. Você vai aprender a vincular cada asset a um papel, impedir que as referências se contradigam, escrever regras de preservação e dividir uma geração de 4–15 segundos em batidas cronometradas. Seis templates no final cobrem vídeo de produto, movimento de personagem, diálogo, edição de vídeo, motion de UI e transições do primeiro ao último quadro.
Nota
Este é um guia de prompts orientado pela documentação, não um relatório de gerações H3 testadas pelo OmniArt. Ele se baseia no guia de geração H3 atual da MiniMax e na referência oficial da API. O H3 ainda não está confirmado no catálogo de modelos fonte de verdade do OmniArt em 31 de julho de 2026. Os rótulos de interface e a sintaxe de referência também podem diferir entre as superfícies da MiniMax e hosts downstream.
MiniMax H3, Hailuo 3.0 ou Hailuo 03?
A documentação atual da MiniMax chama o modelo de MiniMax H3 e define o identificador oficial do modelo na API como MiniMax-H3. Você também pode encontrar Hailuo 3.0, Hailuo 03 ou Hailuo-3.0 em coberturas de lançamento e catálogos de terceiros, porque Hailuo é a marca de produto de vídeo da MiniMax.
Use o rótulo exigido pela superfície à sua frente. Para a API V2 oficial da MiniMax documentada na data de publicação, isso significa MiniMax-H3; não presuma que um alias de marketplace também seja um identificador oficial válido da API. Este guia usa MiniMax H3 para o modelo e geração por referência para o modo que combina entradas de imagem, vídeo e áudio. “Omni reference” é uma descrição útil desse fluxo de mídia mista, mas a API oficial o chama de reference-to-video.
Conheça os três modos de geração do H3
Escolher o modo certo vem antes de escrever o prompt.
| Modo | Entradas | Use quando |
|---|---|---|
| Texto para vídeo | Prompt de texto obrigatório | A cena pode ser criada apenas a partir da descrição |
| Imagem para vídeo de primeiro/último quadro | Prompt obrigatório com um primeiro quadro, um último quadro ou ambos | Uma composição inicial ou final exata é importante |
| Geração por referência | Prompt obrigatório com imagens, vídeos ou áudio de referência | Você precisa de identidade, design, movimento, câmera, voz, ritmo ou estilo dos assets enviados |
A especificação oficial atual lista saída em 2K e durações inteiras de 4 a 15 segundos. Toda solicitação exige um prompt de texto não vazio, com limite de 7,000 caracteres. Uma solicitação de referência pode incluir até nove imagens, três vídeos e três clipes de áudio, com no máximo 12 assets no total. Os vídeos de referência são limitados a 15 segundos no agregado, assim como os clipes de áudio de referência. Uma referência de áudio não pode ser enviada sozinha; ela deve acompanhar pelo menos uma imagem ou um vídeo.
Texto para vídeo exige uma proporção concreta. A geração por referência pode usar uma proporção concreta ou deixar o H3 escolher de forma adaptativa, enquanto a geração de primeiro/último quadro segue a imagem enviada. As opções de proporção documentadas são 21:9, 16:9, 4:3, 1:1, 3:4 e 9:16.
Há um limite rígido de fluxo de trabalho: o modo primeiro/último quadro e a geração por referência não podem ser misturados na mesma solicitação da API. Se os quadros de limite exatos importam, use o modo primeiro/último quadro. Se a transferência de identidade, movimento, estilo ou áudio importa mais, use a geração por referência e descreva a composição de abertura no texto.
Construa um prompt H3 como um mapa de papéis
A API do H3 recebe mídia como itens tipados com papéis como reference_image, reference_video e reference_audio. Esses papéis técnicos identificam o tipo de mídia; seu prompt deve ir um nível além e declarar a responsabilidade criativa de cada asset.
Use esta ordem:
DELIVERABLE
What the final clip is for, its duration, and its format.
ROLE MAP
Reference image 1 = subject identity and immutable appearance.
Reference image 2 = environment or visual style only.
Reference video 1 = body motion and timing only.
Reference audio 1 = rhythm and edit timing only.
SHOT
Subject, action, environment, lighting, and camera direction.
TIMELINE
Time-coded beats that add up to the selected duration.
PRESERVE
Features that must remain unchanged from named references.
EXCLUDE
A short list of the most damaging unwanted changes.
Os rótulos numerados acima são rótulos semânticos para o seu briefing, não uma promessa de que toda interface do H3 exponha handles literais Reference image 1. Na API oficial, os arquivos são itens separados no array content. Em uma interface visual, use os nomes de anexos ou a sintaxe de menção que a superfície fornecer e mantenha a mesma lógica de um-asset-um-trabalho.
Dê a cada asset um trabalho principal
Uma referência contém mais informação do que você normalmente quer transferir. Um clipe de dança contém um performer, roupas, local, câmera, iluminação, movimento e talvez música. Se você pedir ao H3 para “seguir o vídeo”, todas essas características competem com a imagem do seu personagem.
Vincule de forma restrita:
- Referência de imagem: identidade, rosto, guarda-roupa, geometria do produto, logo, paleta ou design de ambiente.
- Referência de vídeo: movimento corporal, trajeto de câmera, timing da ação, interação física ou ritmo de edição.
- Referência de áudio: caráter da voz, cadência, ritmo musical, ambiência ou uma dica de evento.
- Prompt de texto: a cena final, regras de transferência, timeline, prioridades e instruções de preservação.
Quando um asset precisar fazer dois trabalhos, nomeie os dois e deixe o limite explícito: “O vídeo de referência 1 controla apenas o trajeto da câmera e o timing da ação; ignore o performer, o guarda-roupa, o local, a correção de cor e o áudio dele.”
Impeça as referências de brigarem entre si
Conflito de referências costuma ser um problema de instrução antes de ser um problema do modelo. Duas imagens podem mostrar jaquetas diferentes, um clipe de movimento pode usar um tipo de corpo diferente, ou uma batida de áudio pode implicar cortes que colidem com um movimento de câmera contínuo solicitado.
Use uma ordem de prioridade escrita sempre que as entradas se sobrepuserem:
Priority order:
1. Reference image 1 controls character identity and wardrobe.
2. Reference video 1 controls movement and timing only.
3. Reference image 2 controls lighting palette and set design only.
4. The text prompt controls camera framing and final composition.
Em seguida, resolva as contradições em vez de esperar que o H3 infira sua preferência. Se a imagem de identidade tem cabelo solto, mas o vídeo de movimento tem um chapéu, declare se o personagem final mantém o cabelo ou usa o chapéu. Se uma referência de produto mostra um rótulo legível, mas a imagem de estilo é pictórica, diga que a estilização se aplica ao ambiente enquanto a embalagem permanece fotorrealista.
Três hábitos reduzem o conflito:
- Use o menor conjunto útil de referências. Mais entradas criam mais possíveis desacordos. Adicione um arquivo só quando ele contribuir com informação que o prompt não consegue expressar de forma confiável.
- Separe conteúdo de estilo. Nomeie qual referência é dona do sujeito e qual é dona do tratamento.
- Escolha uma única autoridade de câmera. Ou transfira a câmera de um vídeo, ou dirija-a no texto. Se precisar dos dois, declare que o vídeo fornece o timing enquanto o texto sobrescreve o enquadramento.
Para um fluxo de trabalho mais amplo, sintoma por sintoma, mantenha 7 correções de prompt de vídeo com IA ao lado deste guia enquanto itera.
Escreva instruções de preservação que possam ser verificadas
“Mantenha a consistência” é vago demais. Um bloco de preservação deve nomear propriedades visíveis que você possa inspecionar em qualquer quadro.
Para um personagem:
Preserve from reference image 1 throughout every frame: facial structure,
eye color, hairstyle and length, jacket cut, jacket color, and body proportions.
Do not replace the performer with the person from reference video 1.
Para um produto:
Preserve from reference image 1: bottle silhouette, cap shape, label placement,
navy wordmark, coral seal, material finish, and relative proportions.
No duplicate product, redesigned packaging, extra text, or changing logo.
Âncoras positivas devem vir primeiro; exclusões são um guarda-corpo, não o prompt inteiro. Mantenha a lista negativa curta e específica. Dez proibições vagas podem diluir os quatro invariantes que de fato decidem se uma take é utilizável.
Se o mesmo personagem for aparecer em vários clipes gerados separadamente, mantenha o bloco de identidade e guarda-roupa idêntico em todos os prompts. O fluxo de trabalho de personagem consistente explica como montar esse pacote de referência reutilizável em uma sequência mais longa.
Dirija o tempo, não só o conteúdo
O H3 permite clipes de 4 a 15 segundos, mas um parágrafo longo não diz ao modelo quando cada evento acontece. Uma timeline transforma o prompt em um plano de shot compacto.
Para um clipe de 10 segundos:
0–2 seconds: locked medium-wide establishing shot; subject holds still.
2–6 seconds: subject performs the referenced action at the source tempo.
6–9 seconds: camera makes one slow 20-degree arc to the right.
9–10 seconds: subject settles; hold a clean final composition for the edit.
Mantenha cada batida realizável. Uma ação principal mais um movimento de câmera costuma ser mais claro do que uma cadeia de transformações sem relação. Deixe os intervalos de tempo somarem a duração selecionada, coloque detalhes importantes do produto ou do rosto em uma batida mais lenta e reserve o meio segundo ou o segundo final para um ponto de edição estável.
O áudio pode compartilhar o mesmo relógio:
At 2.0 seconds, the first downbeat starts the hand movement.
At 6.0 seconds, the bass hit motivates the camera arc.
From 9.0 seconds, let the music tail continue under the held final frame.
Para mais vocabulário de lente, luz e câmera, veja o guia de prompts de vídeo cinematográfico com IA.
Seis templates de prompt do MiniMax H3
Substitua os detalhes entre colchetes, anexe apenas os assets listados e adapte os rótulos à interface que você usa. Esses templates são pontos de partida estruturados com base nos modos de entrada documentados do H3; não são vencedores de benchmark declarados nem saídas garantidas.
Template 1: Revelação de produto com referências de movimento e música
- Modo: Geração por referência
- Recursos: Uma imagem limpa do produto, um vídeo de movimento de câmera e uma referência musical opcional
Create a 10-second 9:16 product reveal for a paid social placement.
Role map:
- Reference image 1 controls the product's exact design, proportions, packaging,
colors, materials, label placement, and wordmark.
- Reference video 1 controls camera path and acceleration only. Ignore its subject,
location, lighting, color grade, and audio.
- Reference audio 1 controls beat and edit timing only.
Scene: The product stands centered on a warm-violet studio plinth. Soft lilac key
light from camera left, restrained coral rim light, subtle atmospheric haze.
Timeline:
- 0–2 seconds: static wide reveal on the first soft beat.
- 2–7 seconds: transfer the smooth push-and-arc movement from reference video 1.
- 7–9 seconds: one narrow highlight travels across the product surface.
- 9–10 seconds: camera settles; hold the label front-facing and readable.
Preserve reference image 1 exactly: silhouette, cap, material finish, label layout,
brand colors, and wordmark. Keep one product only. No redesigned packaging,
duplicate objects, extra text, warped label, or abrupt camera shake.
Para a preparação da still que vem antes deste prompt, use o fluxo de trabalho de foto para vídeo de produto.
Template 2: Transferência de movimento de personagem sem desvio de identidade
- Modo: Geração por referência
- Recursos: Uma imagem de personagem, um vídeo de movimento e uma imagem de ambiente opcional
Create an 8-second 16:9 cinematic character performance.
Priority order:
1. Reference image 1 controls face, hair, body proportions, and wardrobe.
2. Reference video 1 controls body choreography and action timing only.
3. Reference image 2 controls the environment palette and architecture only.
4. This prompt controls framing and lighting.
The character from reference image 1 performs the complete movement from reference
video 1 in a moonlit station based on reference image 2. Medium full shot, camera
locked at chest height, soft directional light, realistic weight and foot contact.
Timeline:
- 0–1 seconds: character holds the starting pose.
- 1–7 seconds: perform the reference choreography once at its original tempo.
- 7–8 seconds: settle naturally and look toward camera left.
Preserve facial structure, hairstyle, coat shape, coat color, boots, and body
proportions from reference image 1 in every frame. Do not inherit the motion video's
performer, face, clothing, background, camera movement, or audio. No extra limbs,
sliding feet, costume changes, or cuts.
Template 3: Performance de diálogo com uma referência de voz
- Modo: Geração por referência
- Recursos: Uma imagem de personagem e um clipe de áudio autorizado de voz ou diálogo
Aviso
Faça upload apenas de uma voz que você possui ou tem permissão explícita para usar. Um modelo aceitar áudio de referência não lhe dá direitos de imitar a voz de outra pessoa.
Create a 9-second 16:9 single-character dialogue shot.
Role map:
- Reference image 1 controls the speaker's appearance, wardrobe, and room design.
- Reference audio 1 controls spoken timing, cadence, emotional progression, and pauses.
Shot: Medium close-up, eye-level, 50 mm cinematic framing. The speaker begins calm,
briefly smiles after the central pause, then finishes with quiet confidence. Natural
blinks and restrained hand movement. Camera remains static; soft room tone underneath.
Timeline:
- 0–1 seconds: silent eye contact and a small inhale.
- 1–8 seconds: performance follows reference audio 1 exactly in timing and pauses.
- 8–9 seconds: mouth closes, expression settles, hold for the edit.
Preserve face, hairstyle, skin tone, jacket, background layout, and lighting direction
from reference image 1. Keep one speaker. No camera move, cutaway, background speech,
new words, exaggerated gestures, or wardrobe changes.
Template 4: Substituir o ambiente de um vídeo-fonte
- Modo: Geração por referência
- Recursos: Um vídeo de origem, uma imagem de ambiente e uma imagem opcional do sujeito
Create a 12-second 16:9 environmental replacement based on the source clip.
Role map:
- Reference video 1 controls shot length, subject action, physical timing, camera path,
framing progression, and interaction with the ground.
- Reference image 1 controls the replacement environment, architecture, palette,
weather, and lighting mood.
- Reference image 2 controls the subject's face and wardrobe, if supplied.
Replace the source video's location with the environment from reference image 1.
Preserve the original action and camera movement continuously. Match subject lighting,
contact shadows, reflections, and atmospheric perspective to the new environment.
Timeline follows reference video 1. Maintain one continuous shot with the original
action beats and no added event.
Preserve the source subject's position, scale, motion, and ground contact. Preserve
identity and wardrobe from reference image 2 when present. Do not copy the original
background, signage, bystanders, color grade, or source audio. No cuts, teleporting,
floating feet, or changing architecture.
Template 5: Motion de UI da marca sincronizado a uma batida
- Modo: Geração por referência
- Recursos: Uma imagem de layout de UI, um vídeo de estilo de movimento e uma referência de áudio opcional
Create a 7-second 1:1 UI motion-design clip for a product announcement.
Priority order:
1. Reference image 1 controls exact layout, hierarchy, component positions, text,
logo, colors, corner shapes, and typography appearance.
2. Reference video 1 controls transition character and easing only.
3. Reference audio 1 controls the timing of three motion beats only.
Animate the interface from reference image 1 without redesigning it. Begin with the
main panel at rest. Use the restrained slide-and-scale transition quality from
reference video 1. Keep the camera orthographic and the background static.
Timeline:
- 0–1 seconds: complete layout at rest.
- 1–3 seconds: cards enter in sequence on beat one.
- 3–5 seconds: primary control changes state on beat two.
- 5–6 seconds: one subtle emphasis pulse on beat three.
- 6–7 seconds: complete interface holds sharp and readable.
Preserve every word, logo shape, component proportion, spacing relationship, and brand
color from reference image 1. No invented labels, misspelled text, extra panels,
perspective tilt, camera movement, glow overload, or elastic distortion.
Template 6: Transformação exata do primeiro ao último quadro
- Modo: Imagem para vídeo de primeiro/último quadro
- Recursos: Uma imagem do primeiro quadro e uma imagem do último quadro; sem mídia de referência
Create a 10-second transformation from the supplied first frame to the supplied last
frame. Preserve the subject's identity and the camera's fixed position throughout.
Timeline:
- 0–2 seconds: hold the first-frame composition; only subtle ambient movement.
- 2–7 seconds: the scene transforms progressively from the center outward. Materials
change continuously with believable physical contact and no hard cut.
- 7–9 seconds: remaining details resolve into the last-frame design.
- 9–10 seconds: arrive exactly at the supplied last frame and hold it cleanly.
One continuous locked shot. Preserve subject scale, face, silhouette, horizon, lens,
and framing during the transition. No reference-style transfer, new characters,
camera movement, jump cut, flicker, or overshoot beyond the final composition.
Não anexe as imagens, vídeos ou áudios de referência dos outros templates a esta solicitação. A API oficial trata a geração de primeiro/último quadro e a geração por referência como modos mutuamente exclusivos.
Uma ordem prática de iteração
Não mude instruções de identidade, movimento, câmera, estilo e áudio depois de um único render decepcionante. Isso torna impossível aprender qual instrução ajudou.
Itere em três passagens:
- Trave papéis e invariantes. Use o menor conjunto de referências e verifique se o sujeito ou produto permanece reconhecível.
- Trave ação e timeline. Adicione a fonte de movimento ou as batidas cronometradas, mantendo o estilo simples.
- Adicione o tratamento. Introduza ambiente, iluminação, grade, dicas de áudio e detalhes de acabamento depois que as duas primeiras camadas estiverem estáveis.
Quando um resultado desviar, simplifique antes de acrescentar mais linguagem negativa. Remova a referência menos importante, encurte a timeline ou dê a uma fonte um trabalho mais estreito. Compare várias variantes com a mesma checklist: identidade, geometria, movimento, câmera, timing de áudio e estabilidade do quadro final.
Como começar a partir do OmniArt
O MiniMax H3 ainda não está confirmado como selecionável dentro do OmniArt, então este artigo não linka a uma rota de criação H3 nem afirma um fluxo H3 no OmniArt. Confira o lineup atual de modelos de vídeo do OmniArt para os modelos disponíveis hoje.
O método do mapa de papéis ainda se transfere bem para modelos de vídeo baseados em referência já suportados: prepare uma imagem de identidade, uma fonte de movimento e um bloco curto de preservação antes de abrir o workspace. Mantenha o prompt neutro em relação ao modelo até o briefing criativo estar estável; depois adapte os rótulos de anexo e a sintaxe específica de recursos ao modelo que você de fato selecionar. Isso lhe dá uma ficha de direção reutilizável agora e um prompt H3 limpo se o modelo entrar no OmniArt depois.
Para taxas oficiais da API, cobrança de vídeo de referência e exemplos de custo trabalhados, use o guia de preços e especificações do MiniMax H3. Ele usa a página de preços da própria MiniMax, e não a taxa de um revendedor.
Pronto para criar?
Comece a gerar conteúdo incrível com IA