GuideTutoriales y guías16 min de lectura

Guía del audio nativo de MiniMax H3: diálogo, música y sincronía

Aprende a escribir prompts para el audio estéreo nativo de MiniMax H3 en diálogo, ambiente, música, referencias de voz y sincronía, con un plan de pruebas de producción repetible.

Equipo OmniArt
Guía del audio nativo de MiniMax H3: diálogo, música y sincronía

El audio nativo de MiniMax H3 convierte la banda sonora en parte del brief de generación, en lugar de un archivo que agregas automáticamente cuando la imagen ya está terminada. MiniMax dice que H3 entiende de forma conjunta texto, imágenes, video y audio, y que después genera videos con sonido estéreo nativo. Su alcance de entrenamiento también trata la voz, los efectos de sonido y la música como un mismo dominio de audio y no como herramientas separadas.

Ese es un cambio de flujo significativo, pero no es la promesa de que cada línea se pronuncie perfecto, de que cada pisada caiga en el cuadro correcto o de que cada mezcla estéreo esté lista para publicar. Esta guía separa las capacidades de audio de H3 documentadas por MiniMax de las pruebas de producción que conviene correr. Te da una estructura práctica de brief sonoro, un flujo para referencias de audio, cinco plantillas de prompt y una tabla de evaluación repetible, sin presentar los demos oficiales como resultados independientes.

Qué documenta oficialmente MiniMax sobre el audio de H3

MiniMax describe a H3 como un modelo de video multimodal de propósito general, no como un generador de video mudo con una pasada de sonido aparte. Los materiales de lanzamiento de la empresa dicen que el modelo genera audio estéreo nativo y que modela de forma conjunta voz, efectos de sonido y música. MiniMax también muestra un prompt que combina el movimiento de cámara de un video, un personaje de una imagen y una voz ajustada a una referencia de audio.

La guía oficial de generación de video de H3 define los límites actuales de la API:

Capacidad documentadaQué significa para un creador
Audio estéreo nativoH3 puede devolver una banda sonora de dos canales junto con el video generado
Audio como contexto multimodalUn clip de audio puede guiar la voz, el movimiento, el ritmo de edición u otra relación descrita en el prompt
Hasta tres referencias de audioCada clip puede durar de 2 a 15 segundos, con 15 segundos como máximo entre todas las referencias
Referencias mixtasEl audio se puede combinar con imágenes y videos en una misma solicitud de referencia a video
Entrada en WAV y MP3El audio de referencia debe usar uno de los formatos de entrada documentados
Salida de 4 a 15 segundosH3 está pensado para clips cortos, no para una banda sonora completa de formato largo en una generación

Hay tres restricciones importantes. Una referencia de audio no se puede enviar sola; MiniMax exige al menos una imagen o un video junto a ella. Los archivos de audio están limitados a 15 MB cada uno, y la solicitud completa con referencias mixtas está limitada a 12 recursos. El modo de referencia tampoco se puede combinar con el modo de primer o último cuadro en la misma solicitud, así que decide qué importa más para el plano: cuadros de frontera exactos o un condicionamiento multimodal más amplio.

Nota

Estéreo no es lo mismo que audio espacial. MiniMax documenta salida estéreo nativa, pero sus materiales públicos actuales no prometen surround, ambisónico, audio basado en objetos ni un nivel determinado de precisión posicional. Evalúa la ubicación izquierda-derecha con audífonos antes de describir un resultado como espacial.

Arma el brief sonoro antes de escribir el prompt

El prompt de H3 más útil no es una lista larga de sonidos. Es un plan sonoro compacto que le dice al modelo qué debe llevar la voz cantante, qué lo acompaña y qué tiene que ocurrir en un momento visible. Escribe el plan en cinco pasadas.

1. Fija la acción visual y los tiempos

La sincronización de audio depende de eventos visibles. Empieza por el plano, la acción del sujeto, el movimiento de cámara y la secuencia de beats. “A spoon hits the saucer as the camera settles” le da al modelo un evento audiovisual compartido. “Add a cup sound” no dice cuándo ocurre el evento ni qué debería causarlo.

Para un clip de 10 segundos, un mapa de beats simple podría ser:

  • 0–3 segundos: establecer la habitación y el sujeto
  • 3–7 segundos: diálogo o acción principal
  • 7–10 segundos: revelación del producto y señal sonora final

Trata esos tiempos como dirección, no como marcas de edición exactas al cuadro. Una prueba de producción debería medir qué tan de cerca los sigue el resultado.

2. Nombra una sola capa de audio principal

Elige el sonido que el público debe notar primero: el diálogo, una interacción con el producto, un gancho musical o un elemento del entorno. Dale la redacción más clara y protege el espacio a su alrededor.

Si lo principal es el diálogo, escribe la línea exacta entre comillas y especifica una sola indicación de interpretación. Si lo principal es un sonido de producto, describe la acción física que lo produce. Si lo principal es la música, indica el tempo, la instrumentación, el ánimo y dónde debe cambiar el arreglo.

3. Agrega el ambiente como un lugar acústico

El ambiente debería explicar dónde vive el plano. En lugar de “café sounds”, describe el siseo discreto de una máquina de espresso detrás de quien habla, conversación baja de sala y una campanilla de puerta a lo lejos. Para un spot de producto limpio, pide un tono de sala de estudio controlado en vez de silencio, salvo que el silencio sea una decisión creativa deliberada.

Usa palabras de distancia y de material que sirvan tanto para la imagen como para el sonido:

  • cercano, seco, íntimo y con poca reverberación
  • lejano, apagado a través del vidrio o fuera de cuadro por la izquierda
  • pasos sobre azulejo, movimiento de tela, lluvia sobre metal o un vaso apoyado en madera

4. Decide si la música es score o fuente

El score vive fuera de la escena; la música de fuente sale de un objeto o de un lugar dentro de ella. Di cuál de las dos quieres. “A restrained electronic score under the dialogue” pide una capa de fondo, mientras que “music playing quietly from the café radio, slightly muffled” le da una fuente acústica dentro del cuadro.

Cuando no hace falta música, escribe no music. Eso hace más fácil juzgar una prueba de diálogo o de Foley. Cuando sí hace falta, deja margen para la voz en lugar de pedir que todas las capas suenen fuertes y dramáticas.

5. Declara las exclusiones

La dirección de audio en negativo es útil cuando protege el brief. Algunos ejemplos son no narration, no crowd cheering, no added melody y no exaggerated whooshes. Mantén corta la lista de exclusiones; demasiadas restricciones pueden competir con la acción que sí quieres.

Cómo usar las referencias de audio sin confundir su rol

El sistema de referencias de H3 es más útil cuando cada recurso tiene un solo trabajo. Un clip de audio de referencia puede aportar timbre y cadencia vocal, energía musical, una textura sonora o un ritmo de edición. No des por hecho que el modelo sabe qué propiedad debe tomar prestada.

Escribe un mapa de recursos antes del prompt final:

RecursoTrabajo asignadoQué no debe transferirse
Imagen de personajeIdentidad, vestuario y colocación del productoFondo e iluminación
Video de movimientoGesto y tiempos de cámaraIdentidad del personaje y diálogo
Audio de vozCarácter vocal, cadencia y energía emocionalPalabras originales y ruido de fondo
Audio de músicaTempo, densidad del arreglo y ritmo de ediciónMelodía o letra reconocibles

Después describe esas relaciones en lenguaje natural. El propio ejemplo de H3 de MiniMax usa una oración que le asigna el movimiento de cámara a una referencia de video, la intérprete a una referencia de imagen y la voz a una referencia de audio. Las etiquetas numeradas de los recursos varían según la interfaz, mientras que la API usa contenido tipado y roles de referencia, así que reemplaza las etiquetas de las plantillas de abajo por la notación exacta que muestre tu flujo.

Advertencia

Usa la voz o la interpretación de una persona como referencia solo cuando tengas permiso. Una referencia de voz no es prueba de que seas dueño de la identidad de esa persona, de la grabación, de la música ni del derecho a publicar una imitación generada.

Las referencias limpias hacen experimentos más limpios. Recorta el silencio, quita la música de fondo que no venga al caso, evita la saturación y deja que el pasaje vocal o musical relevante se escuche con claridad. Usa un segmento corto que demuestre la propiedad que buscas en vez de subir por defecto la duración máxima.

Cinco plantillas de prompt para el audio nativo de MiniMax H3

Son briefs de partida, no resultados de prueba comprobados. Corre cada prompt más de una vez y califica los resultados con el protocolo de la sección siguiente.

1. Diálogo de un solo hablante con tono de sala

Close-up of a chef at the pass in a quiet restaurant kitchen after service. The camera makes a slow push-in as she looks toward a colleague off-camera and says, “We try it again tomorrow.” Delivery: tired but quietly optimistic, natural pace, one short breath before “tomorrow.” Her voice is the primary audio layer, close and dry. Low ventilation hum and occasional metal cooling sounds remain distant. No music, no narration, no other voices.

Usa esta plantilla para evaluar la exactitud del habla, la entrega emocional, el movimiento de la boca y si el ambiente se mantiene detrás de la línea.

2. Ambiente por capas con Foley sincronizado

Wide shot inside a nearly empty laundromat at night, fluorescent light reflecting on the tiled floor. A person moves a wet jacket from a washer to a rolling basket; the metal door clicks shut exactly when their hand closes it, then the basket wheels rattle softly across tile. Foreground: fabric movement and the door click. Mid-ground: steady washer rotation. Background: rain against the front window and one distant car passing outside. Native stereo mix, no dialogue, no music.

Este brief aísla el ambiente, el realismo de los materiales, la separación izquierda-derecha y la sincronía de los contactos.

3. Revelación de producto guiada por la música

Ten-second vertical product film for a translucent coral sports bottle on a lilac studio surface. Start with a macro shot of condensation, then orbit as the bottle rises into the hero position. Original minimal electronic score at 100 BPM: soft pulse for the opening, a clean percussive accent when the logo faces camera, then a short resolved final note. Add subtle droplets and one controlled placement sound. Music supports the product sounds rather than masking them. No voice and no stock-style cinematic boom.

Para la planeación visual específica de producto más allá de la banda sonora, usa el flujo de foto a video de producto.

4. Referencia de voz autorizada con diálogo nuevo

Use voice reference 1 only for the narrator's vocal timbre, speaking pace, and warm conversational energy. Do not reuse its words or background noise. The person from image reference 1 stands beside the window and says, “The first draft is only the beginning.” Keep the spoken line intelligible and synchronized to the visible speaker. Add a quiet residential room tone and soft rain outside. No music. The voice recording is authorized for this use.

Prueba si las cualidades vocales buscadas se trasladan sin copiar sin querer ruido, fraseo o contenido de la grabación de origen. Describe las cualidades deseadas con palabras para que la instrucción siga siendo útil aunque la adherencia a la referencia varíe.

5. Referencia de ritmo para una edición de redes

Create a 12-second montage of a ceramic artist shaping, glazing, and placing a finished cup on a shelf. Use audio reference 1 only for tempo, rhythmic energy, and edit pacing. Compose an original percussive track with different melody and sound design. Cut the visual action on the major rhythmic changes: clay lands on the wheel, brush touches glaze, cup reaches the shelf. Preserve natural wheel rotation, brush texture, and the final ceramic tap beneath the music. No dialogue.

Esto separa el condicionamiento rítmico de la copia musical y te da tres puntos de sincronía visibles para inspeccionar.

Un plan repetible de evaluación del audio de H3

Un demo oficial pulido no puede responder si un modelo encaja en tu flujo de producción. Usa el mismo brief para al menos tres generaciones, mantén fijas la duración y las referencias, y califica cada resultado en lugar de quedarte solo con el mejor.

Prueba primero las capas por separado

Empieza con cuatro prompts controlados:

  1. Solo diálogo y tono de sala tranquilo
  2. Ambiente y tres eventos de Foley visibles, sin habla ni música
  3. Música instrumental con dos acentos visuales planeados
  4. Una referencia de audio autorizada junto con una referencia simple de imagen o video

Solo cuando esas pasen deberías combinar diálogo, ambiente, Foley y música en una misma escena cargada. Así las fallas se vuelven diagnosticables: puedes distinguir si el problema viene de la pronunciación, de los tiempos, de la transferencia de referencia o de la densidad de la mezcla.

Usa una tabla de puntaje, no una impresión

DimensiónPregunta por responderMedida simple
Exactitud del diálogo¿Se dijeron correctamente las palabras pedidas?Palabras correctas divididas entre las pedidas
Sincronía labial¿Coinciden los cierres de boca y los acentos silábicos visibles?Puntaje de 1 a 5 y el primer desfase visible
Sincronía de eventos¿Los sonidos de contacto caen con la acción en imagen?Cuadros de adelanto o retraso en tres señales
Consistencia de voz¿El hablante sigue siendo reconocible durante toda la línea?Califica inicio, medio y final por separado
Control de referencia¿La propiedad pedida se transfirió sin equipaje indeseado?Enumera transferencias buscadas e indeseadas
Imagen estéreo¿Las ubicaciones izquierda-derecha son útiles y estables?Revisión con audífonos más revisión de la onda
Jerarquía de mezcla¿La capa principal se entiende con claridad?Puntaje de 1 a 5 a volumen normal de reproducción
Repetibilidad¿Con qué frecuencia el clip es usable sin reparar el audio?Resultados usables divididos entre corridas totales

Inspecciona el archivo exportado en un editor de video o en una estación de audio. Confirma que existan dos canales, escucha si hay problemas de fase al pasar a mono y compara las formas de onda alrededor de los eventos de contacto planeados. No deduzcas la calidad del audio a partir de la vista previa de una red social, que puede recomprimir o remapear la banda sonora.

Consejo

Guarda las generaciones fallidas. Una revisión del prompt solo es una mejora si sube la tasa de resultados usables en corridas repetidas, no si produce un clip con suerte.

Limitaciones que conviene prever

El propio anuncio de lanzamiento de MiniMax dice que H3 todavía tiene margen de mejora e identifica el detalle visual como un área de trabajo futuro. Para producción de audio, la documentación pública actual también deja varias preguntas abiertas. No publica garantías de tasa de error de palabras, precisión de sincronía labial, sonoridad, frecuencia de muestreo, configuración de canales más allá del estéreo, cobertura de idiomas, similitud con la referencia de voz ni control de señales a nivel de código de tiempo.

Prevé estos límites prácticos:

  • Salida corta: de 4 a 15 segundos sirve para planos, anuncios y clips de redes, pero la continuidad de formato largo exige editar entre varias generaciones.
  • Contexto de referencia corto: se permiten hasta tres clips de audio, pero su duración combinada no puede pasar de 15 segundos.
  • No hay solicitud con referencia solo de audio: un clip de audio de referencia debe ir acompañado de al menos una imagen o un video.
  • Los tiempos en lenguaje natural no son una línea de tiempo fija: trata los tiempos de los beats como intención hasta que pruebas repetidas demuestren la precisión que necesitas.
  • El estéreo necesita verificación: dos canales no crean automáticamente dirección, profundidad ni compatibilidad con mono creíbles.
  • Las mezclas densas esconden errores: el diálogo, los efectos, el ambiente y la música se pueden modelar juntos, pero un brief más simple es más fácil de controlar y de reparar.
  • Los derechos de la referencia siguen aplicando: que el modelo pueda hacerlo no otorga permiso para imitar una voz ni para reutilizar música protegida.

MiniMax H3 ya está disponible para los usuarios de OmniArt Creator+ en los modos Video, Transición y Referencia, con salida de 5 a 15 segundos en 1440p. El modo de referencia acepta hasta nueve imágenes, tres videos y tres clips de audio, con un máximo de 12 recursos en total; el audio de referencia debe ir acompañado de al menos una imagen o un video. OmniArt cobra 9 créditos por segundo de salida, más 9 créditos por cada segundo redondeado hacia arriba de video de referencia. Las primeras cinco imágenes de referencia son gratis, cada imagen adicional cuesta 2 créditos y el audio de referencia no tiene cargo extra. El audio nativo es parte de la salida de H3, y la superficie actual de OmniArt no expone un interruptor de audio aparte. Para presupuestar la API oficial fuera de OmniArt, revisa la página oficial de precios de pago por uso y la guía de precios y especificaciones de H3; no sustituyas el precio propio de MiniMax por la tarifa de un proveedor de terceros.

Arma el resto de la banda sonora en OmniArt

El audio nativo puede reducir traspasos, pero no elimina el valor de las herramientas de sonido separadas. Si una toma de H3 tiene la imagen correcta y una narración floja, quédate con la imagen y arma una pista de voz controlada. Si el diálogo funciona pero la sala carece de textura, agrega una capa de ambiente o de Foley en vez de regenerar el plano completo.

OmniArt reúne los flujos de video, voz, sonido y música en un mismo espacio creativo. Usa la guía del generador de efectos de sonido con IA para diseñar Foley y ambiente de reemplazo, o compara el enfoque de prompts con la guía de audio espacial de Veo 3.1. La meta no es meter todos los sonidos en una sola generación. Es conservar la pista nativa cuando funciona y reemplazar solo la capa que no.

Crea con MiniMax H3 en OmniArt

¿Todo listo para crear?

Empieza a generar contenido increíble con IA

Empezar gratis