GuideTutoriais e guias práticos16 min de leitura

Guia de áudio nativo do MiniMax H3: diálogo, música e sincronização

Aprenda a fazer prompts de áudio estéreo nativo no MiniMax H3 para diálogo, ambiente, música, referências de voz e sincronização, com um plano de teste de produção repetível.

Equipe OmniArt
Guia de áudio nativo do MiniMax H3: diálogo, música e sincronização

O áudio nativo do MiniMax H3 transforma a trilha sonora em parte do briefing de geração, em vez de um arquivo que você adiciona automaticamente depois que a imagem está pronta. A MiniMax diz que o H3 entende de forma conjunta texto, imagens, vídeo e áudio, e gera vídeos com som estéreo nativo. O escopo de treinamento também trata voz, efeitos sonoros e música como um único domínio de áudio, e não como ferramentas separadas.

Essa é uma mudança significativa de fluxo de trabalho, mas não é uma promessa de que cada fala sairá perfeitamente pronunciada, de que cada passo cairá no frame certo ou de que cada mix estéreo estará pronto para publicar. Este guia separa as capacidades do H3 documentadas pela MiniMax dos testes de produção que criadores devem rodar. Ele oferece uma estrutura prática de briefing de som, um fluxo com referências de áudio, cinco templates de prompt e um scorecard de avaliação repetível, sem apresentar demos oficiais como resultados independentes.

O que a MiniMax documenta oficialmente sobre o áudio do H3

A MiniMax descreve o H3 como um modelo multimodal de vídeo de uso geral, e não como um gerador de vídeo mudo com uma passagem de som separada. Os materiais de lançamento da empresa dizem que o modelo gera áudio estéreo nativo e modela de forma conjunta voz, efeitos sonoros e música. A MiniMax também demonstra um prompt que combina movimento de câmera a partir de um vídeo, um personagem a partir de uma imagem e vocais alinhados a uma referência de áudio.

O guia oficial de geração de vídeo H3 define os limites atuais da API:

Capacidade documentadaO que isso significa para um criador
Áudio estéreo nativoO H3 pode devolver uma trilha sonora de dois canais junto com o vídeo gerado
Áudio como contexto multimodalUm clipe de áudio pode orientar voz, movimento, ritmo de edição ou outra relação descrita no prompt
Até três referências de áudioCada clipe pode ter 2–15 segundos, com no máximo 15 segundos no total de todas as referências de áudio
Referências mistasO áudio pode ser combinado com imagens e vídeos em uma única solicitação de referência para vídeo
Entrada em WAV e MP3O áudio de referência deve usar um dos formatos de entrada documentados
Saída de 4–15 segundosO H3 foi feito para clipes curtos, não para uma trilha sonora longa completa em uma única geração

Há três restrições importantes. Uma referência de áudio não pode ser enviada sozinha; a MiniMax exige pelo menos uma imagem ou um vídeo junto com ela. Os arquivos de áudio estão limitados a 15 MB cada, e a solicitação completa de referências mistas está limitada a 12 ativos. O modo de referência também não pode ser combinado com o modo de primeiro ou último quadro na mesma solicitação, então decida se frames de contorno exatos ou um condicionamento multimodal mais amplo importa mais para o plano.

Nota

Estéreo não é a mesma coisa que áudio espacial. A MiniMax documenta saída estéreo nativa, mas seus materiais públicos atuais não prometem surround, ambisonics, áudio baseado em objetos nem um nível particular de precisão posicional. Avalie o posicionamento esquerda-direita com fones de ouvido antes de descrever um resultado como espacial.

Monte o briefing de som antes de escrever o prompt

O prompt de H3 mais útil não é uma lista longa de sons. É um plano de som compacto que diz ao modelo o que deve liderar, o que deve apoiar e o que precisa acontecer em um momento visível. Escreva o plano em cinco passagens.

1. Trave a ação visual e o timing

A sincronização de áudio depende de eventos visíveis. Comece pelo plano, pela ação do sujeito, pelo movimento de câmera e pela sequência de batidas. “Uma colher bate no pires quando a câmera se acomoda” dá ao modelo um evento audiovisual compartilhado. “Adicione o som de uma xícara” não diz quando o evento acontece nem o que deve causá-lo.

Para um clipe de 10 segundos, um mapa simples de batidas pode ser:

  • 0–3 segundos: estabelecer o ambiente e o sujeito
  • 3–7 segundos: diálogo ou ação principal
  • 7–10 segundos: revelação do produto e cue sonoro final

Trate esses timings como direção, não como marcadores de edição com precisão de frame. Um teste de produção deve medir o quão de perto a saída os segue.

2. Nomeie uma camada de áudio primária

Escolha o som que o público precisa notar primeiro: diálogo, uma interação com o produto, um gancho musical ou um pedaço de som ambiental. Dê a ele a redação mais clara e proteja o espaço ao redor.

Se o diálogo for primário, escreva a fala exata entre aspas e especifique uma direção de interpretação. Se o som de um produto for primário, descreva a ação física que o cria. Se a música for primária, indique o andamento, a instrumentação, o clima e onde o arranjo deve mudar.

3. Adicione ambiência como um lugar acústico

A ambiência deve explicar onde o plano vive. Em vez de “sons de café”, descreva um chiado baixo da máquina de espresso atrás de quem fala, conversa baixa no ambiente e o sino da porta ao longe. Para um spot de produto limpo, peça tom de sala de estúdio controlado em vez de silêncio, a menos que o silêncio seja uma escolha criativa deliberada.

Use palavras de distância e material que possam se aplicar tanto à imagem quanto ao som:

  • próximo, seco, íntimo e levemente reverberante
  • distante, abafado através do vidro ou fora de câmera à esquerda
  • passos em azulejo, movimento de tecido, chuva no metal ou um copo pousado na madeira

4. Decida se a música é trilha ou fonte

A trilha (score) fica fora da cena; a música de fonte vem de um objeto ou local dentro dela. Declare qual você quer. “Uma trilha eletrônica contida sob o diálogo” pede uma camada de fundo, enquanto “música tocando baixinho no rádio do café, um pouco abafada” dá a ela uma fonte acústica em cena.

Quando a música não for necessária, diga no music. Isso mantém um teste de diálogo ou Foley mais fácil de julgar. Quando for necessária, deixe headroom para a voz em vez de pedir que cada camada seja alta e dramática.

5. Declare as exclusões

Direções negativas de áudio são úteis quando protegem o briefing. Exemplos incluem no narration, no crowd cheering, no added melody e no exaggerated whooshes. Mantenha a lista de exclusões curta; restrições demais podem competir com a ação que você realmente quer.

Como usar referências de áudio sem confundir o papel delas

O sistema de referências do H3 é mais útil quando cada ativo tem um único trabalho. Um clipe de áudio de referência pode fornecer timbre e cadência vocal, energia musical, uma textura sonora ou ritmo de edição. Não assuma que o modelo sabe qual propriedade tomar emprestada.

Escreva um mapa de ativos antes do prompt final:

AtivoTrabalho atribuídoO que não deve transferir
Imagem do personagemIdentidade, figurino e posicionamento do produtoFundo e iluminação
Vídeo de movimentoGesto e timing de câmeraIdentidade do personagem e diálogo
Áudio de vozCaráter vocal, cadência e energia emocionalPalavras originais e ruído de fundo
Áudio de músicaAndamento, densidade do arranjo e ritmo de ediçãoMelodia ou letra reconhecíveis

Em seguida, descreva essas relações em linguagem natural. O próprio exemplo de H3 da MiniMax usa uma frase que atribui o movimento de câmera a uma referência de vídeo, o performer a uma referência de imagem e os vocais a uma referência de áudio. Os rótulos numerados de ativos variam conforme a interface, enquanto a API usa conteúdo tipado e papéis de referência, então substitua os rótulos dos templates abaixo pela notação exata mostrada no seu fluxo.

Aviso

Use a voz ou a performance de uma pessoa como referência somente quando você tiver permissão. Uma referência de voz não é prova de que você possui a identidade do falante, a gravação, a música ou o direito de publicar uma imitação gerada.

Referências limpas geram experimentos mais limpos. Corte silêncios, remova música de fundo não relacionada, evite clipping e mantenha o trecho vocal ou musical relevante fácil de ouvir. Use um segmento curto que demonstre a propriedade que você quer, em vez de enviar por padrão a duração máxima.

Cinco templates de prompt de áudio nativo do MiniMax H3

Estes são briefings iniciais, não resultados de teste alegados. Rode cada prompt mais de uma vez e pontue as saídas usando o protocolo da próxima seção.

1. Diálogo de um falante com tom de sala

Close-up of a chef at the pass in a quiet restaurant kitchen after service. The camera makes a slow push-in as she looks toward a colleague off-camera and says, “We try it again tomorrow.” Delivery: tired but quietly optimistic, natural pace, one short breath before “tomorrow.” Her voice is the primary audio layer, close and dry. Low ventilation hum and occasional metal cooling sounds remain distant. No music, no narration, no other voices.

Use este template para avaliar precisão da fala, entrega emocional, movimento da boca e se a ambiência permanece atrás da linha.

2. Ambiência em camadas com Foley sincronizado

Wide shot inside a nearly empty laundromat at night, fluorescent light reflecting on the tiled floor. A person moves a wet jacket from a washer to a rolling basket; the metal door clicks shut exactly when their hand closes it, then the basket wheels rattle softly across tile. Foreground: fabric movement and the door click. Mid-ground: steady washer rotation. Background: rain against the front window and one distant car passing outside. Native stereo mix, no dialogue, no music.

Este briefing isola ambiência, realismo de materiais, separação esquerda-direita e sincronização de contato.

3. Revelação de produto guiada por música

Ten-second vertical product film for a translucent coral sports bottle on a lilac studio surface. Start with a macro shot of condensation, then orbit as the bottle rises into the hero position. Original minimal electronic score at 100 BPM: soft pulse for the opening, a clean percussive accent when the logo faces camera, then a short resolved final note. Add subtle droplets and one controlled placement sound. Music supports the product sounds rather than masking them. No voice and no stock-style cinematic boom.

Para o planejamento visual específico de produto além da trilha sonora, use o fluxo de foto para vídeo de produto.

4. Referência de voz autorizada com diálogo novo

Use voice reference 1 only for the narrator's vocal timbre, speaking pace, and warm conversational energy. Do not reuse its words or background noise. The person from image reference 1 stands beside the window and says, “The first draft is only the beginning.” Keep the spoken line intelligible and synchronized to the visible speaker. Add a quiet residential room tone and soft rain outside. No music. The voice recording is authorized for this use.

Teste se as qualidades vocais pretendidas se transferem sem copiar involuntariamente ruído, fraseado ou conteúdo da gravação de origem. Descreva as qualidades desejadas em palavras para que a instrução continue útil mesmo se a aderência à referência variar.

5. Referência rítmica para um edit social

Create a 12-second montage of a ceramic artist shaping, glazing, and placing a finished cup on a shelf. Use audio reference 1 only for tempo, rhythmic energy, and edit pacing. Compose an original percussive track with different melody and sound design. Cut the visual action on the major rhythmic changes: clay lands on the wheel, brush touches glaze, cup reaches the shelf. Preserve natural wheel rotation, brush texture, and the final ceramic tap beneath the music. No dialogue.

Isso separa o condicionamento rítmico da cópia de música e dá a você três pontos de sincronização visíveis para inspecionar.

Um plano de avaliação de áudio do H3 repetível

Uma demo oficial polida não responde se um modelo se encaixa no seu fluxo de produção. Use o mesmo briefing para pelo menos três gerações, mantenha duração e referências fixas e pontue cada saída em vez de selecionar apenas o resultado mais forte.

Teste as camadas separadamente primeiro

Comece com quatro prompts controlados:

  1. Diálogo e tom de sala quieto apenas
  2. Ambiência e três eventos Foley visíveis, sem fala nem música
  3. Música instrumental com dois acentos visuais planejados
  4. Uma referência de áudio autorizada pareada com uma referência simples de imagem ou vídeo

Só depois que esses passarem você deve combinar diálogo, ambiência, Foley e música em uma cena densa. Isso torna as falhas diagnosticáveis: você consegue dizer se o problema vem da pronúncia, do timing, da transferência da referência ou da densidade do mix.

Use um scorecard, não uma impressão

DimensãoPergunta a responderMedida simples
Precisão do diálogoAs palavras pedidas foram faladas corretamente?Palavras corretas divididas pelas pedidas
Lip-syncOs fechamentos visíveis da boca e as sílabas fortes se alinham?Pontue 1–5 e anote o primeiro desvio visível
Sincronização de eventosOs sons de contato caem com a ação mostrada?Frames adiantados ou atrasados em três cues planejados
Consistência de vozO falante permanece reconhecível ao longo da fala?Pontue início, meio e fim separadamente
Controle da referênciaA propriedade pedida transferiu sem bagagem indesejada?Liste transferências intencionais e não intencionais
Imagem estéreoOs posicionamentos esquerda-direita são úteis e estáveis?Checagem em fones mais checagem de forma de onda dos canais
Hierarquia do mixA camada primária está claramente inteligível?Pontue 1–5 no nível normal de reprodução
RepetibilidadeCom que frequência o clipe é usável sem reparo de áudio?Saídas usáveis divididas pelo total de execuções

Inspecione o arquivo exportado em um editor de vídeo ou estação de áudio. Confirme que existem dois canais, ouça problemas de fase em mono e compare as formas de onda em torno dos eventos de contato planejados. Não infira qualidade de áudio a partir de um preview de rede social, que pode recomprimir ou remapear a trilha sonora.

Dica

Guarde as gerações que falharam. Uma revisão de prompt só é uma melhoria se ela eleva a taxa de saídas usáveis em execuções repetidas, não se produz um único clipe sortudo.

Limitações com as quais planejar

O próprio post de lançamento da MiniMax diz que o H3 ainda tem espaço para melhorar e identifica o detalhe visual como uma área de trabalho futuro. Para produção de áudio, a documentação pública atual também deixa várias perguntas em aberto. Ela não publica garantias de taxa de erro de palavras, precisão de lip-sync, loudness, taxa de amostragem, layout de canais além de estéreo, cobertura de idiomas, similaridade de referência de voz ou controle de cues em nível de timecode.

Planeje em torno destes limites práticos:

  • Saída curta: 4–15 segundos serve para planos, anúncios e clipes sociais, mas a continuidade de forma longa exige edição entre gerações.
  • Contexto de referência curto: Até três clipes de áudio são permitidos, mas a duração combinada não pode ultrapassar 15 segundos.
  • Sem solicitação só com referência de áudio: Um clipe de áudio de referência precisa ser pareado com pelo menos uma imagem ou um vídeo.
  • Timing em linguagem natural não é uma timeline travada: Trate os timings de batida como intenção até testes repetidos provarem a precisão de que você precisa.
  • Estéreo precisa de verificação: Dois canais não criam automaticamente direção crível, profundidade ou compatibilidade mono.
  • Mixes densos podem esconder erros: Diálogo, efeitos, ambiência e música podem ser modelados juntos, mas um briefing mais simples é mais fácil de controlar e reparar.
  • Direitos de referência ainda se aplicam: A capacidade do modelo não concede permissão para imitar uma voz ou reutilizar música protegida.

O MiniMax H3 está disponível via PixVerse na OmniArt a partir do plano Creator. Os modos Vídeo, Transição e Referência geram de 5 a 15 segundos em 768p ou 1440p (2K). O modo Referência aceita até 9 imagens, 3 vídeos e 3 arquivos de áudio. As referências de áudio exigem pelo menos uma imagem ou um vídeo. A OmniArt não expõe atualmente um controle de áudio separado para o H3. O áudio de referência orienta a geração, mas não garante uma trilha pronta em todo resultado; confira o arquivo entregue. São 8 (768p) / 12 (2K) créditos por segundo de saída. No modo Reference, o vídeo de referência custa mais 8 (768p) / 12 (2K) créditos por segundo arredondado para cima; cinco imagens estão incluídas, cada imagem adicional custa 4 créditos e o áudio de referência não acrescenta créditos. página oficial de preços pay-as-you-go guia de preços e especificações do H3

Construa o restante da trilha sonora no OmniArt

O áudio nativo pode reduzir handoffs, mas não elimina o valor de ferramentas de som separadas. Se uma tomada do H3 tem a imagem certa e a narração fraca, mantenha a imagem e construa uma trilha de voz controlada. Se o diálogo funciona, mas o ambiente falta textura, adicione uma camada de ambiência ou Foley em vez de regenerar o plano completo.

O OmniArt reúne fluxos de vídeo, fala, som e música em um único espaço de trabalho criativo. Use o guia do gerador de efeitos sonoros com IA para desenhar Foley e ambiência de substituição, ou compare a abordagem de prompting com o guia de áudio espacial do Veo 3.1. O objetivo não é forçar cada som em uma única geração. É manter a trilha nativa quando ela funciona e substituir apenas a camada que não funciona.

Crie com o MiniMax H3 no OmniArt

Pronto para criar?

Comece a gerar conteúdo incrível com IA

Começar grátis