Guia de áudio nativo do MiniMax H3: diálogo, música e sincronização
Aprenda a fazer prompts de áudio estéreo nativo no MiniMax H3 para diálogo, ambiente, música, referências de voz e sincronização, com um plano de teste de produção repetível.

O áudio nativo do MiniMax H3 transforma a trilha sonora em parte do briefing de geração, em vez de um arquivo que você adiciona automaticamente depois que a imagem está pronta. A MiniMax diz que o H3 entende de forma conjunta texto, imagens, vídeo e áudio, e gera vídeos com som estéreo nativo. O escopo de treinamento também trata voz, efeitos sonoros e música como um único domínio de áudio, e não como ferramentas separadas.
Essa é uma mudança significativa de fluxo de trabalho, mas não é uma promessa de que cada fala sairá perfeitamente pronunciada, de que cada passo cairá no frame certo ou de que cada mix estéreo estará pronto para publicar. Este guia separa as capacidades do H3 documentadas pela MiniMax dos testes de produção que criadores devem rodar. Ele oferece uma estrutura prática de briefing de som, um fluxo com referências de áudio, cinco templates de prompt e um scorecard de avaliação repetível, sem apresentar demos oficiais como resultados independentes.
O que a MiniMax documenta oficialmente sobre o áudio do H3
A MiniMax descreve o H3 como um modelo multimodal de vídeo de uso geral, e não como um gerador de vídeo mudo com uma passagem de som separada. Os materiais de lançamento da empresa dizem que o modelo gera áudio estéreo nativo e modela de forma conjunta voz, efeitos sonoros e música. A MiniMax também demonstra um prompt que combina movimento de câmera a partir de um vídeo, um personagem a partir de uma imagem e vocais alinhados a uma referência de áudio.
O guia oficial de geração de vídeo H3 define os limites atuais da API:
| Capacidade documentada | O que isso significa para um criador |
|---|---|
| Áudio estéreo nativo | O H3 pode devolver uma trilha sonora de dois canais junto com o vídeo gerado |
| Áudio como contexto multimodal | Um clipe de áudio pode orientar voz, movimento, ritmo de edição ou outra relação descrita no prompt |
| Até três referências de áudio | Cada clipe pode ter 2–15 segundos, com no máximo 15 segundos no total de todas as referências de áudio |
| Referências mistas | O áudio pode ser combinado com imagens e vídeos em uma única solicitação de referência para vídeo |
| Entrada em WAV e MP3 | O áudio de referência deve usar um dos formatos de entrada documentados |
| Saída de 4–15 segundos | O H3 foi feito para clipes curtos, não para uma trilha sonora longa completa em uma única geração |
Há três restrições importantes. Uma referência de áudio não pode ser enviada sozinha; a MiniMax exige pelo menos uma imagem ou um vídeo junto com ela. Os arquivos de áudio estão limitados a 15 MB cada, e a solicitação completa de referências mistas está limitada a 12 ativos. O modo de referência também não pode ser combinado com o modo de primeiro ou último quadro na mesma solicitação, então decida se frames de contorno exatos ou um condicionamento multimodal mais amplo importa mais para o plano.
Nota
Estéreo não é a mesma coisa que áudio espacial. A MiniMax documenta saída estéreo nativa, mas seus materiais públicos atuais não prometem surround, ambisonics, áudio baseado em objetos nem um nível particular de precisão posicional. Avalie o posicionamento esquerda-direita com fones de ouvido antes de descrever um resultado como espacial.
Monte o briefing de som antes de escrever o prompt
O prompt de H3 mais útil não é uma lista longa de sons. É um plano de som compacto que diz ao modelo o que deve liderar, o que deve apoiar e o que precisa acontecer em um momento visível. Escreva o plano em cinco passagens.
1. Trave a ação visual e o timing
A sincronização de áudio depende de eventos visíveis. Comece pelo plano, pela ação do sujeito, pelo movimento de câmera e pela sequência de batidas. “Uma colher bate no pires quando a câmera se acomoda” dá ao modelo um evento audiovisual compartilhado. “Adicione o som de uma xícara” não diz quando o evento acontece nem o que deve causá-lo.
Para um clipe de 10 segundos, um mapa simples de batidas pode ser:
- 0–3 segundos: estabelecer o ambiente e o sujeito
- 3–7 segundos: diálogo ou ação principal
- 7–10 segundos: revelação do produto e cue sonoro final
Trate esses timings como direção, não como marcadores de edição com precisão de frame. Um teste de produção deve medir o quão de perto a saída os segue.
2. Nomeie uma camada de áudio primária
Escolha o som que o público precisa notar primeiro: diálogo, uma interação com o produto, um gancho musical ou um pedaço de som ambiental. Dê a ele a redação mais clara e proteja o espaço ao redor.
Se o diálogo for primário, escreva a fala exata entre aspas e especifique uma direção de interpretação. Se o som de um produto for primário, descreva a ação física que o cria. Se a música for primária, indique o andamento, a instrumentação, o clima e onde o arranjo deve mudar.
3. Adicione ambiência como um lugar acústico
A ambiência deve explicar onde o plano vive. Em vez de “sons de café”, descreva um chiado baixo da máquina de espresso atrás de quem fala, conversa baixa no ambiente e o sino da porta ao longe. Para um spot de produto limpo, peça tom de sala de estúdio controlado em vez de silêncio, a menos que o silêncio seja uma escolha criativa deliberada.
Use palavras de distância e material que possam se aplicar tanto à imagem quanto ao som:
- próximo, seco, íntimo e levemente reverberante
- distante, abafado através do vidro ou fora de câmera à esquerda
- passos em azulejo, movimento de tecido, chuva no metal ou um copo pousado na madeira
4. Decida se a música é trilha ou fonte
A trilha (score) fica fora da cena; a música de fonte vem de um objeto ou local dentro dela. Declare qual você quer. “Uma trilha eletrônica contida sob o diálogo” pede uma camada de fundo, enquanto “música tocando baixinho no rádio do café, um pouco abafada” dá a ela uma fonte acústica em cena.
Quando a música não for necessária, diga no music. Isso mantém um teste de diálogo ou Foley mais fácil de julgar. Quando for necessária, deixe headroom para a voz em vez de pedir que cada camada seja alta e dramática.
5. Declare as exclusões
Direções negativas de áudio são úteis quando protegem o briefing. Exemplos incluem no narration, no crowd cheering, no added melody e no exaggerated whooshes. Mantenha a lista de exclusões curta; restrições demais podem competir com a ação que você realmente quer.
Como usar referências de áudio sem confundir o papel delas
O sistema de referências do H3 é mais útil quando cada ativo tem um único trabalho. Um clipe de áudio de referência pode fornecer timbre e cadência vocal, energia musical, uma textura sonora ou ritmo de edição. Não assuma que o modelo sabe qual propriedade tomar emprestada.
Escreva um mapa de ativos antes do prompt final:
| Ativo | Trabalho atribuído | O que não deve transferir |
|---|---|---|
| Imagem do personagem | Identidade, figurino e posicionamento do produto | Fundo e iluminação |
| Vídeo de movimento | Gesto e timing de câmera | Identidade do personagem e diálogo |
| Áudio de voz | Caráter vocal, cadência e energia emocional | Palavras originais e ruído de fundo |
| Áudio de música | Andamento, densidade do arranjo e ritmo de edição | Melodia ou letra reconhecíveis |
Em seguida, descreva essas relações em linguagem natural. O próprio exemplo de H3 da MiniMax usa uma frase que atribui o movimento de câmera a uma referência de vídeo, o performer a uma referência de imagem e os vocais a uma referência de áudio. Os rótulos numerados de ativos variam conforme a interface, enquanto a API usa conteúdo tipado e papéis de referência, então substitua os rótulos dos templates abaixo pela notação exata mostrada no seu fluxo.
Aviso
Use a voz ou a performance de uma pessoa como referência somente quando você tiver permissão. Uma referência de voz não é prova de que você possui a identidade do falante, a gravação, a música ou o direito de publicar uma imitação gerada.
Referências limpas geram experimentos mais limpos. Corte silêncios, remova música de fundo não relacionada, evite clipping e mantenha o trecho vocal ou musical relevante fácil de ouvir. Use um segmento curto que demonstre a propriedade que você quer, em vez de enviar por padrão a duração máxima.
Cinco templates de prompt de áudio nativo do MiniMax H3
Estes são briefings iniciais, não resultados de teste alegados. Rode cada prompt mais de uma vez e pontue as saídas usando o protocolo da próxima seção.
1. Diálogo de um falante com tom de sala
Close de uma chef no passe de uma cozinha de restaurante silenciosa após o serviço. A câmera se aproxima lentamente enquanto ela olha para uma colega fora de quadro e diz: “Tentamos de novo amanhã.” Interpretação: cansada, mas discretamente otimista, ritmo natural e uma respiração curta antes de “amanhã”. A voz dela é a camada de áudio primária, próxima e seca. Um zumbido baixo de ventilação e sons ocasionais de metal esfriando permanecem distantes. Sem música, narração ou outras vozes.
Use este template para avaliar precisão da fala, entrega emocional, movimento da boca e se a ambiência permanece atrás da linha.
2. Ambiência em camadas com Foley sincronizado
Plano aberto dentro de uma lavanderia quase vazia à noite, com luz fluorescente refletindo no piso de azulejos. Uma pessoa move uma jaqueta molhada de uma máquina de lavar para um cesto com rodas; a porta de metal fecha com um clique exatamente quando sua mão a fecha, depois as rodas do cesto chocalham suavemente sobre o azulejo. Primeiro plano: movimento de tecido e o clique da porta. Plano médio: rotação constante da máquina. Fundo: chuva na vitrine da frente e um carro distante passando do lado de fora. Mix estéreo nativo, sem diálogo e sem música.
Este briefing isola ambiência, realismo de materiais, separação esquerda-direita e sincronização de contato.
3. Revelação de produto guiada por música
Filme vertical de produto de dez segundos para uma garrafa esportiva translúcida coral sobre uma superfície de estúdio lilás. Comece com um macro de condensação, depois faça uma órbita enquanto a garrafa sobe para a posição de destaque. Trilha eletrônica minimalista original a 100 BPM: pulso suave na abertura, um acento percussivo limpo quando o logo fica de frente para a câmera, depois uma nota final curta e resolvida. Adicione gotículas sutis e um som controlado de posicionamento. A música apoia os sons do produto em vez de mascará-los. Sem voz nem impacto cinematográfico de banco de efeitos.
Para o planejamento visual específico de produto além da trilha sonora, use o fluxo de foto para vídeo de produto.
4. Referência de voz autorizada com diálogo novo
Use a referência de voz 1 apenas para o timbre vocal do narrador, o ritmo de fala e a energia conversacional calorosa. Não reutilize as palavras nem o ruído de fundo. A pessoa da referência de imagem 1 fica ao lado da janela e diz: “O primeiro rascunho é apenas o começo.” Mantenha a fala inteligível e sincronizada com o falante visível. Adicione um tom ambiente residencial tranquilo e chuva suave do lado de fora. Sem música. A gravação de voz está autorizada para este uso.
Teste se as qualidades vocais pretendidas se transferem sem copiar involuntariamente ruído, fraseado ou conteúdo da gravação de origem. Descreva as qualidades desejadas em palavras para que a instrução continue útil mesmo se a aderência à referência variar.
5. Referência rítmica para um edit social
Crie uma montagem de 12 segundos de um ceramista modelando, esmaltando e colocando uma xícara pronta em uma prateleira. Use a referência de áudio 1 apenas para andamento, energia rítmica e ritmo de edição. Componha uma trilha percussiva original com melodia e design sonoro diferentes. Corte a ação visual nas mudanças rítmicas principais: o barro pousa no torno, o pincel toca o esmalte, a xícara chega à prateleira. Preserve a rotação natural do torno, a textura do pincel e o toque final da cerâmica sob a música. Sem diálogo.
Isso separa o condicionamento rítmico da cópia de música e dá a você três pontos de sincronização visíveis para inspecionar.
Um plano de avaliação de áudio do H3 repetível
Uma demo oficial polida não responde se um modelo se encaixa no seu fluxo de produção. Use o mesmo briefing para pelo menos três gerações, mantenha duração e referências fixas e pontue cada saída em vez de selecionar apenas o resultado mais forte.
Teste as camadas separadamente primeiro
Comece com quatro prompts controlados:
- Diálogo e tom de sala quieto apenas
- Ambiência e três eventos Foley visíveis, sem fala nem música
- Música instrumental com dois acentos visuais planejados
- Uma referência de áudio autorizada pareada com uma referência simples de imagem ou vídeo
Só depois que esses passarem você deve combinar diálogo, ambiência, Foley e música em uma cena densa. Isso torna as falhas diagnosticáveis: você consegue dizer se o problema vem da pronúncia, do timing, da transferência da referência ou da densidade do mix.
Use um scorecard, não uma impressão
| Dimensão | Pergunta a responder | Medida simples |
|---|---|---|
| Precisão do diálogo | As palavras pedidas foram faladas corretamente? | Palavras corretas divididas pelas pedidas |
| Lip-sync | Os fechamentos visíveis da boca e as sílabas fortes se alinham? | Pontue 1–5 e anote o primeiro desvio visível |
| Sincronização de eventos | Os sons de contato caem com a ação mostrada? | Frames adiantados ou atrasados em três cues planejados |
| Consistência de voz | O falante permanece reconhecível ao longo da fala? | Pontue início, meio e fim separadamente |
| Controle da referência | A propriedade pedida transferiu sem bagagem indesejada? | Liste transferências intencionais e não intencionais |
| Imagem estéreo | Os posicionamentos esquerda-direita são úteis e estáveis? | Checagem em fones mais checagem de forma de onda dos canais |
| Hierarquia do mix | A camada primária está claramente inteligível? | Pontue 1–5 no nível normal de reprodução |
| Repetibilidade | Com que frequência o clipe é usável sem reparo de áudio? | Saídas usáveis divididas pelo total de execuções |
Inspecione o arquivo exportado em um editor de vídeo ou estação de áudio. Confirme que existem dois canais, ouça problemas de fase em mono e compare as formas de onda em torno dos eventos de contato planejados. Não infira qualidade de áudio a partir de um preview de rede social, que pode recomprimir ou remapear a trilha sonora.
Dica
Guarde as gerações que falharam. Uma revisão de prompt só é uma melhoria se ela eleva a taxa de saídas usáveis em execuções repetidas, não se produz um único clipe sortudo.
Limitações com as quais planejar
O próprio post de lançamento da MiniMax diz que o H3 ainda tem espaço para melhorar e identifica o detalhe visual como uma área de trabalho futuro. Para produção de áudio, a documentação pública atual também deixa várias perguntas em aberto. Ela não publica garantias de taxa de erro de palavras, precisão de lip-sync, loudness, taxa de amostragem, layout de canais além de estéreo, cobertura de idiomas, similaridade de referência de voz ou controle de cues em nível de timecode.
Planeje em torno destes limites práticos:
- Saída curta: 4–15 segundos serve para planos, anúncios e clipes sociais, mas a continuidade de forma longa exige edição entre gerações.
- Contexto de referência curto: Até três clipes de áudio são permitidos, mas a duração combinada não pode ultrapassar 15 segundos.
- Sem solicitação só com referência de áudio: Um clipe de áudio de referência precisa ser pareado com pelo menos uma imagem ou um vídeo.
- Timing em linguagem natural não é uma timeline travada: Trate os timings de batida como intenção até testes repetidos provarem a precisão de que você precisa.
- Estéreo precisa de verificação: Dois canais não criam automaticamente direção crível, profundidade ou compatibilidade mono.
- Mixes densos podem esconder erros: Diálogo, efeitos, ambiência e música podem ser modelados juntos, mas um briefing mais simples é mais fácil de controlar e reparar.
- Direitos de referência ainda se aplicam: A capacidade do modelo não concede permissão para imitar uma voz ou reutilizar música protegida.
Disponibilidade, controles de interface e faturamento também podem mudar. A precificação oficial atual da MiniMax lista material de referência de áudio sem cobrança de entrada separada, enquanto a saída de vídeo e alguns outros materiais de referência são cobrados sob regras próprias. Consulte a página oficial de preços pay-as-you-go antes de orçar uma produção via API; não substitua a tarifa de um host de terceiros pelo preço da própria MiniMax. O guia de preços e especificações do H3 detalha as tarifas oficiais da MiniMax e os custos de material de referência. O catálogo atual de modelos do OmniArt não estabelece disponibilidade do H3, então este guia não afirma que o H3 já possa ser gerado dentro do OmniArt.
Construa o restante da trilha sonora no OmniArt
O áudio nativo pode reduzir handoffs, mas não elimina o valor de ferramentas de som separadas. Se uma tomada do H3 tem a imagem certa e a narração fraca, mantenha a imagem e construa uma trilha de voz controlada. Se o diálogo funciona, mas o ambiente falta textura, adicione uma camada de ambiência ou Foley em vez de regenerar o plano completo.
O OmniArt reúne fluxos de vídeo, fala, som e música em um único workspace criativo. Use o guia do gerador de efeitos sonoros com IA para desenhar Foley e ambiência de substituição, ou compare a abordagem de prompting com o guia de áudio espacial do Veo 3.1. O objetivo não é forçar cada som em uma única geração. É manter a trilha nativa quando ela funciona e substituir apenas a camada que não funciona.
Pronto para criar?
Comece a gerar conteúdo incrível com IA