Guia de áudio nativo do MiniMax H3: diálogo, música e sincronização
Aprenda a fazer prompts de áudio estéreo nativo no MiniMax H3 para diálogo, ambiente, música, referências de voz e sincronização, com um plano de teste de produção repetível.

O áudio nativo do MiniMax H3 transforma a trilha sonora em parte do briefing de geração, em vez de um arquivo que você adiciona automaticamente depois que a imagem está pronta. A MiniMax diz que o H3 entende de forma conjunta texto, imagens, vídeo e áudio, e gera vídeos com som estéreo nativo. O escopo de treinamento também trata voz, efeitos sonoros e música como um único domínio de áudio, e não como ferramentas separadas.
Essa é uma mudança significativa de fluxo de trabalho, mas não é uma promessa de que cada fala sairá perfeitamente pronunciada, de que cada passo cairá no frame certo ou de que cada mix estéreo estará pronto para publicar. Este guia separa as capacidades do H3 documentadas pela MiniMax dos testes de produção que criadores devem rodar. Ele oferece uma estrutura prática de briefing de som, um fluxo com referências de áudio, cinco templates de prompt e um scorecard de avaliação repetível, sem apresentar demos oficiais como resultados independentes.
O que a MiniMax documenta oficialmente sobre o áudio do H3
A MiniMax descreve o H3 como um modelo multimodal de vídeo de uso geral, e não como um gerador de vídeo mudo com uma passagem de som separada. Os materiais de lançamento da empresa dizem que o modelo gera áudio estéreo nativo e modela de forma conjunta voz, efeitos sonoros e música. A MiniMax também demonstra um prompt que combina movimento de câmera a partir de um vídeo, um personagem a partir de uma imagem e vocais alinhados a uma referência de áudio.
O guia oficial de geração de vídeo H3 define os limites atuais da API:
| Capacidade documentada | O que isso significa para um criador |
|---|---|
| Áudio estéreo nativo | O H3 pode devolver uma trilha sonora de dois canais junto com o vídeo gerado |
| Áudio como contexto multimodal | Um clipe de áudio pode orientar voz, movimento, ritmo de edição ou outra relação descrita no prompt |
| Até três referências de áudio | Cada clipe pode ter 2–15 segundos, com no máximo 15 segundos no total de todas as referências de áudio |
| Referências mistas | O áudio pode ser combinado com imagens e vídeos em uma única solicitação de referência para vídeo |
| Entrada em WAV e MP3 | O áudio de referência deve usar um dos formatos de entrada documentados |
| Saída de 4–15 segundos | O H3 foi feito para clipes curtos, não para uma trilha sonora longa completa em uma única geração |
Há três restrições importantes. Uma referência de áudio não pode ser enviada sozinha; a MiniMax exige pelo menos uma imagem ou um vídeo junto com ela. Os arquivos de áudio estão limitados a 15 MB cada, e a solicitação completa de referências mistas está limitada a 12 ativos. O modo de referência também não pode ser combinado com o modo de primeiro ou último quadro na mesma solicitação, então decida se frames de contorno exatos ou um condicionamento multimodal mais amplo importa mais para o plano.
Nota
Estéreo não é a mesma coisa que áudio espacial. A MiniMax documenta saída estéreo nativa, mas seus materiais públicos atuais não prometem surround, ambisonics, áudio baseado em objetos nem um nível particular de precisão posicional. Avalie o posicionamento esquerda-direita com fones de ouvido antes de descrever um resultado como espacial.
Monte o briefing de som antes de escrever o prompt
O prompt de H3 mais útil não é uma lista longa de sons. É um plano de som compacto que diz ao modelo o que deve liderar, o que deve apoiar e o que precisa acontecer em um momento visível. Escreva o plano em cinco passagens.
1. Trave a ação visual e o timing
A sincronização de áudio depende de eventos visíveis. Comece pelo plano, pela ação do sujeito, pelo movimento de câmera e pela sequência de batidas. “Uma colher bate no pires quando a câmera se acomoda” dá ao modelo um evento audiovisual compartilhado. “Adicione o som de uma xícara” não diz quando o evento acontece nem o que deve causá-lo.
Para um clipe de 10 segundos, um mapa simples de batidas pode ser:
- 0–3 segundos: estabelecer o ambiente e o sujeito
- 3–7 segundos: diálogo ou ação principal
- 7–10 segundos: revelação do produto e cue sonoro final
Trate esses timings como direção, não como marcadores de edição com precisão de frame. Um teste de produção deve medir o quão de perto a saída os segue.
2. Nomeie uma camada de áudio primária
Escolha o som que o público precisa notar primeiro: diálogo, uma interação com o produto, um gancho musical ou um pedaço de som ambiental. Dê a ele a redação mais clara e proteja o espaço ao redor.
Se o diálogo for primário, escreva a fala exata entre aspas e especifique uma direção de interpretação. Se o som de um produto for primário, descreva a ação física que o cria. Se a música for primária, indique o andamento, a instrumentação, o clima e onde o arranjo deve mudar.
3. Adicione ambiência como um lugar acústico
A ambiência deve explicar onde o plano vive. Em vez de “sons de café”, descreva um chiado baixo da máquina de espresso atrás de quem fala, conversa baixa no ambiente e o sino da porta ao longe. Para um spot de produto limpo, peça tom de sala de estúdio controlado em vez de silêncio, a menos que o silêncio seja uma escolha criativa deliberada.
Use palavras de distância e material que possam se aplicar tanto à imagem quanto ao som:
- próximo, seco, íntimo e levemente reverberante
- distante, abafado através do vidro ou fora de câmera à esquerda
- passos em azulejo, movimento de tecido, chuva no metal ou um copo pousado na madeira
4. Decida se a música é trilha ou fonte
A trilha (score) fica fora da cena; a música de fonte vem de um objeto ou local dentro dela. Declare qual você quer. “Uma trilha eletrônica contida sob o diálogo” pede uma camada de fundo, enquanto “música tocando baixinho no rádio do café, um pouco abafada” dá a ela uma fonte acústica em cena.
Quando a música não for necessária, diga no music. Isso mantém um teste de diálogo ou Foley mais fácil de julgar. Quando for necessária, deixe headroom para a voz em vez de pedir que cada camada seja alta e dramática.
5. Declare as exclusões
Direções negativas de áudio são úteis quando protegem o briefing. Exemplos incluem no narration, no crowd cheering, no added melody e no exaggerated whooshes. Mantenha a lista de exclusões curta; restrições demais podem competir com a ação que você realmente quer.
Como usar referências de áudio sem confundir o papel delas
O sistema de referências do H3 é mais útil quando cada ativo tem um único trabalho. Um clipe de áudio de referência pode fornecer timbre e cadência vocal, energia musical, uma textura sonora ou ritmo de edição. Não assuma que o modelo sabe qual propriedade tomar emprestada.
Escreva um mapa de ativos antes do prompt final:
| Ativo | Trabalho atribuído | O que não deve transferir |
|---|---|---|
| Imagem do personagem | Identidade, figurino e posicionamento do produto | Fundo e iluminação |
| Vídeo de movimento | Gesto e timing de câmera | Identidade do personagem e diálogo |
| Áudio de voz | Caráter vocal, cadência e energia emocional | Palavras originais e ruído de fundo |
| Áudio de música | Andamento, densidade do arranjo e ritmo de edição | Melodia ou letra reconhecíveis |
Em seguida, descreva essas relações em linguagem natural. O próprio exemplo de H3 da MiniMax usa uma frase que atribui o movimento de câmera a uma referência de vídeo, o performer a uma referência de imagem e os vocais a uma referência de áudio. Os rótulos numerados de ativos variam conforme a interface, enquanto a API usa conteúdo tipado e papéis de referência, então substitua os rótulos dos templates abaixo pela notação exata mostrada no seu fluxo.
Aviso
Use a voz ou a performance de uma pessoa como referência somente quando você tiver permissão. Uma referência de voz não é prova de que você possui a identidade do falante, a gravação, a música ou o direito de publicar uma imitação gerada.
Referências limpas geram experimentos mais limpos. Corte silêncios, remova música de fundo não relacionada, evite clipping e mantenha o trecho vocal ou musical relevante fácil de ouvir. Use um segmento curto que demonstre a propriedade que você quer, em vez de enviar por padrão a duração máxima.
Cinco templates de prompt de áudio nativo do MiniMax H3
Estes são briefings iniciais, não resultados de teste alegados. Rode cada prompt mais de uma vez e pontue as saídas usando o protocolo da próxima seção.
1. Diálogo de um falante com tom de sala
Close-up of a chef at the pass in a quiet restaurant kitchen after service. The camera makes a slow push-in as she looks toward a colleague off-camera and says, “We try it again tomorrow.” Delivery: tired but quietly optimistic, natural pace, one short breath before “tomorrow.” Her voice is the primary audio layer, close and dry. Low ventilation hum and occasional metal cooling sounds remain distant. No music, no narration, no other voices.
Use este template para avaliar precisão da fala, entrega emocional, movimento da boca e se a ambiência permanece atrás da linha.
2. Ambiência em camadas com Foley sincronizado
Wide shot inside a nearly empty laundromat at night, fluorescent light reflecting on the tiled floor. A person moves a wet jacket from a washer to a rolling basket; the metal door clicks shut exactly when their hand closes it, then the basket wheels rattle softly across tile. Foreground: fabric movement and the door click. Mid-ground: steady washer rotation. Background: rain against the front window and one distant car passing outside. Native stereo mix, no dialogue, no music.
Este briefing isola ambiência, realismo de materiais, separação esquerda-direita e sincronização de contato.
3. Revelação de produto guiada por música
Ten-second vertical product film for a translucent coral sports bottle on a lilac studio surface. Start with a macro shot of condensation, then orbit as the bottle rises into the hero position. Original minimal electronic score at 100 BPM: soft pulse for the opening, a clean percussive accent when the logo faces camera, then a short resolved final note. Add subtle droplets and one controlled placement sound. Music supports the product sounds rather than masking them. No voice and no stock-style cinematic boom.
Para o planejamento visual específico de produto além da trilha sonora, use o fluxo de foto para vídeo de produto.
4. Referência de voz autorizada com diálogo novo
Use voice reference 1 only for the narrator's vocal timbre, speaking pace, and warm conversational energy. Do not reuse its words or background noise. The person from image reference 1 stands beside the window and says, “The first draft is only the beginning.” Keep the spoken line intelligible and synchronized to the visible speaker. Add a quiet residential room tone and soft rain outside. No music. The voice recording is authorized for this use.
Teste se as qualidades vocais pretendidas se transferem sem copiar involuntariamente ruído, fraseado ou conteúdo da gravação de origem. Descreva as qualidades desejadas em palavras para que a instrução continue útil mesmo se a aderência à referência variar.
5. Referência rítmica para um edit social
Create a 12-second montage of a ceramic artist shaping, glazing, and placing a finished cup on a shelf. Use audio reference 1 only for tempo, rhythmic energy, and edit pacing. Compose an original percussive track with different melody and sound design. Cut the visual action on the major rhythmic changes: clay lands on the wheel, brush touches glaze, cup reaches the shelf. Preserve natural wheel rotation, brush texture, and the final ceramic tap beneath the music. No dialogue.
Isso separa o condicionamento rítmico da cópia de música e dá a você três pontos de sincronização visíveis para inspecionar.
Um plano de avaliação de áudio do H3 repetível
Uma demo oficial polida não responde se um modelo se encaixa no seu fluxo de produção. Use o mesmo briefing para pelo menos três gerações, mantenha duração e referências fixas e pontue cada saída em vez de selecionar apenas o resultado mais forte.
Teste as camadas separadamente primeiro
Comece com quatro prompts controlados:
- Diálogo e tom de sala quieto apenas
- Ambiência e três eventos Foley visíveis, sem fala nem música
- Música instrumental com dois acentos visuais planejados
- Uma referência de áudio autorizada pareada com uma referência simples de imagem ou vídeo
Só depois que esses passarem você deve combinar diálogo, ambiência, Foley e música em uma cena densa. Isso torna as falhas diagnosticáveis: você consegue dizer se o problema vem da pronúncia, do timing, da transferência da referência ou da densidade do mix.
Use um scorecard, não uma impressão
| Dimensão | Pergunta a responder | Medida simples |
|---|---|---|
| Precisão do diálogo | As palavras pedidas foram faladas corretamente? | Palavras corretas divididas pelas pedidas |
| Lip-sync | Os fechamentos visíveis da boca e as sílabas fortes se alinham? | Pontue 1–5 e anote o primeiro desvio visível |
| Sincronização de eventos | Os sons de contato caem com a ação mostrada? | Frames adiantados ou atrasados em três cues planejados |
| Consistência de voz | O falante permanece reconhecível ao longo da fala? | Pontue início, meio e fim separadamente |
| Controle da referência | A propriedade pedida transferiu sem bagagem indesejada? | Liste transferências intencionais e não intencionais |
| Imagem estéreo | Os posicionamentos esquerda-direita são úteis e estáveis? | Checagem em fones mais checagem de forma de onda dos canais |
| Hierarquia do mix | A camada primária está claramente inteligível? | Pontue 1–5 no nível normal de reprodução |
| Repetibilidade | Com que frequência o clipe é usável sem reparo de áudio? | Saídas usáveis divididas pelo total de execuções |
Inspecione o arquivo exportado em um editor de vídeo ou estação de áudio. Confirme que existem dois canais, ouça problemas de fase em mono e compare as formas de onda em torno dos eventos de contato planejados. Não infira qualidade de áudio a partir de um preview de rede social, que pode recomprimir ou remapear a trilha sonora.
Dica
Guarde as gerações que falharam. Uma revisão de prompt só é uma melhoria se ela eleva a taxa de saídas usáveis em execuções repetidas, não se produz um único clipe sortudo.
Limitações com as quais planejar
O próprio post de lançamento da MiniMax diz que o H3 ainda tem espaço para melhorar e identifica o detalhe visual como uma área de trabalho futuro. Para produção de áudio, a documentação pública atual também deixa várias perguntas em aberto. Ela não publica garantias de taxa de erro de palavras, precisão de lip-sync, loudness, taxa de amostragem, layout de canais além de estéreo, cobertura de idiomas, similaridade de referência de voz ou controle de cues em nível de timecode.
Planeje em torno destes limites práticos:
- Saída curta: 4–15 segundos serve para planos, anúncios e clipes sociais, mas a continuidade de forma longa exige edição entre gerações.
- Contexto de referência curto: Até três clipes de áudio são permitidos, mas a duração combinada não pode ultrapassar 15 segundos.
- Sem solicitação só com referência de áudio: Um clipe de áudio de referência precisa ser pareado com pelo menos uma imagem ou um vídeo.
- Timing em linguagem natural não é uma timeline travada: Trate os timings de batida como intenção até testes repetidos provarem a precisão de que você precisa.
- Estéreo precisa de verificação: Dois canais não criam automaticamente direção crível, profundidade ou compatibilidade mono.
- Mixes densos podem esconder erros: Diálogo, efeitos, ambiência e música podem ser modelados juntos, mas um briefing mais simples é mais fácil de controlar e reparar.
- Direitos de referência ainda se aplicam: A capacidade do modelo não concede permissão para imitar uma voz ou reutilizar música protegida.
O MiniMax H3 está disponível via PixVerse na OmniArt a partir do plano Creator. Os modos Vídeo, Transição e Referência geram de 5 a 15 segundos em 768p ou 1440p (2K). O modo Referência aceita até 9 imagens, 3 vídeos e 3 arquivos de áudio. As referências de áudio exigem pelo menos uma imagem ou um vídeo. A OmniArt não expõe atualmente um controle de áudio separado para o H3. O áudio de referência orienta a geração, mas não garante uma trilha pronta em todo resultado; confira o arquivo entregue. São 8 (768p) / 12 (2K) créditos por segundo de saída. No modo Reference, o vídeo de referência custa mais 8 (768p) / 12 (2K) créditos por segundo arredondado para cima; cinco imagens estão incluídas, cada imagem adicional custa 4 créditos e o áudio de referência não acrescenta créditos. página oficial de preços pay-as-you-go guia de preços e especificações do H3
Construa o restante da trilha sonora no OmniArt
O áudio nativo pode reduzir handoffs, mas não elimina o valor de ferramentas de som separadas. Se uma tomada do H3 tem a imagem certa e a narração fraca, mantenha a imagem e construa uma trilha de voz controlada. Se o diálogo funciona, mas o ambiente falta textura, adicione uma camada de ambiência ou Foley em vez de regenerar o plano completo.
O OmniArt reúne fluxos de vídeo, fala, som e música em um único espaço de trabalho criativo. Use o guia do gerador de efeitos sonoros com IA para desenhar Foley e ambiência de substituição, ou compare a abordagem de prompting com o guia de áudio espacial do Veo 3.1. O objetivo não é forçar cada som em uma única geração. É manter a trilha nativa quando ela funciona e substituir apenas a camada que não funciona.
Pronto para criar?
Comece a gerar conteúdo incrível com IA