Guía de audio nativo de MiniMax H3: diálogo, música y sincronización
Aprende a redactar prompts para el audio estéreo nativo de MiniMax H3: diálogo, ambiente, música, referencias de voz y sincronización, con un plan de pruebas repetible.

El audio nativo de MiniMax H3 convierte la banda sonora en parte del encargo de generación, en lugar de en un archivo que añades automáticamente después de terminar la imagen. MiniMax afirma que H3 comprende conjuntamente texto, imágenes, vídeo y audio, y después genera vídeos con sonido estéreo nativo. Su ámbito de entrenamiento también trata la voz, los efectos sonoros y la música como un único dominio de audio en vez de como herramientas separadas.
Es un cambio relevante de flujo de trabajo, pero no promete que cada frase se pronuncie perfectamente, que cada paso caiga en el fotograma correcto o que cada mezcla estéreo esté lista para publicar. Esta guía separa las capacidades documentadas de H3 por MiniMax de las pruebas de producción que deben ejecutar los creadores. Ofrece una estructura práctica para el encargo sonoro, un flujo de trabajo con referencias de audio, cinco plantillas de prompts y una tarjeta de evaluación repetible sin presentar las demos oficiales como resultados independientes.
Qué documenta oficialmente MiniMax sobre el audio de H3
MiniMax describe H3 como un modelo de vídeo multimodal de uso general, no como un generador de vídeo silencioso con una pasada de sonido separada. Los materiales de lanzamiento de la empresa indican que el modelo genera audio estéreo nativo y modela conjuntamente voz, efectos sonoros y música. MiniMax también muestra un prompt que combina movimiento de cámara de un vídeo, un personaje de una imagen y voces ajustadas a una referencia de audio.
La guía oficial de generación de vídeo H3 define los límites actuales de la API:
| Capacidad documentada | Qué significa para un creador |
|---|---|
| Audio estéreo nativo | H3 puede devolver una banda sonora de dos canales con el vídeo generado |
| Audio como contexto multimodal | Un clip de audio puede guiar voz, movimiento, ritmo de edición u otra relación descrita en el prompt |
| Hasta tres referencias de audio | Cada clip puede durar 2–15 segundos, con un máximo de 15 segundos entre todas las referencias de audio |
| Referencias mixtas | El audio se puede combinar con imágenes y vídeos en una solicitud de referencia a vídeo |
| Entrada WAV y MP3 | El audio de referencia debe usar uno de los formatos de entrada documentados |
| Salida de 4–15 segundos | H3 está diseñado para clips cortos, no para una banda sonora completa de formato largo en una generación |
Hay tres restricciones importantes. Una referencia de audio no puede enviarse sola; MiniMax requiere al menos una imagen o vídeo junto a ella. Los archivos de audio están limitados a 15 MB cada uno y la solicitud completa de referencias mixtas está limitada a 12 recursos. El modo de referencia tampoco puede combinarse con el modo de primer o último fotograma en la misma solicitud, así que decide si importan más para el plano los fotogramas límite exactos o un condicionamiento multimodal más amplio.
Nota
El estéreo no es lo mismo que el audio espacial. MiniMax documenta salida estéreo nativa, pero sus materiales públicos actuales no prometen sonido envolvente, ambisónico, basado en objetos ni un nivel particular de precisión posicional. Evalúa la colocación izquierda-derecha con auriculares antes de describir un resultado como espacial.
Construye el encargo sonoro antes de escribir el prompt
El prompt de H3 más útil no es una lista larga de sonidos. Es un plan sonoro compacto que indica al modelo qué debe liderar, qué debe respaldarlo y qué debe ocurrir en un momento visible. Escribe el plan en cinco pasadas.
1. Fija la acción visual y la sincronización
La sincronización de audio depende de eventos visibles. Empieza por el plano, la acción del sujeto, el movimiento de cámara y la secuencia de tiempos. «Una cuchara golpea el platillo cuando la cámara se asienta» da al modelo un evento audiovisual compartido. «Añade un sonido de taza» no dice cuándo sucede el evento ni qué debe causarlo.
Para un clip de 10 segundos, un mapa de tiempos sencillo podría ser:
- 0–3 segundos: presentar la habitación y al sujeto
- 3–7 segundos: diálogo o acción principal
- 7–10 segundos: revelado del producto y señal sonora final
Trata esos tiempos como dirección, no como marcadores de edición exactos por fotograma. Una prueba de producción debe medir cuánto se aproxima la salida a ellos.
2. Nombra una capa de audio principal
Elige el sonido que el público debe advertir primero: diálogo, interacción con un producto, un gancho musical o sonido ambiental. Dale la formulación más clara y protege espacio a su alrededor.
Si el diálogo es principal, escribe la frase exacta entre comillas y especifica una dirección de interpretación. Si lo principal es el sonido de un producto, describe la acción física que lo crea. Si lo principal es la música, indica el tempo, la instrumentación, el ánimo y dónde debe cambiar el arreglo.
3. Añade ambiente como lugar acústico
El ambiente debe explicar dónde transcurre el plano. En vez de «sonidos de cafetería», describe un suave siseo de máquina de espresso detrás del hablante, conversación baja de sala y una campanilla de puerta a lo lejos. Para un anuncio limpio de producto, pide un tono de sala de estudio controlado en vez de silencio, salvo que el silencio sea una decisión creativa deliberada.
Usa palabras de distancia y material aplicables tanto a imagen como a sonido:
- cercano, seco, íntimo y ligeramente reverberante
- distante, amortiguado tras un cristal o fuera de cámara a la izquierda
- pasos sobre baldosa, movimiento de tela, lluvia sobre metal o un vaso apoyado en madera
4. Decide si la música es banda sonora o fuente
La banda sonora está fuera de la escena; la música de fuente procede de un objeto o lugar dentro de ella. Indica cuál quieres. «Una base electrónica contenida bajo el diálogo» pide una capa de fondo, mientras que «música sonando suavemente desde la radio de la cafetería, algo amortiguada» le da una fuente acústica en pantalla.
Cuando no se necesite música, di no music. Así es más fácil juzgar una prueba de diálogo o Foley. Cuando sí se necesite, deja margen para la voz en vez de pedir que todas las capas sean fuertes y dramáticas.
5. Indica las exclusiones
La dirección de audio negativa es útil cuando protege el encargo. Algunos ejemplos son no narration, no crowd cheering, no added melody y no exaggerated whooshes. Mantén corta la lista de exclusiones; demasiadas restricciones pueden competir con la acción que realmente quieres.
Cómo usar referencias de audio sin confundir su papel
El sistema de referencias de H3 resulta más útil cuando cada recurso tiene una tarea. Un clip de audio de referencia puede aportar timbre y cadencia vocal, energía musical, textura sonora o ritmo de edición. No supongas que el modelo sabe qué propiedad debe tomar.
Escribe un mapa de recursos antes del prompt final:
| Recurso | Tarea asignada | Lo que no debe transferirse |
|---|---|---|
| Imagen de personaje | Identidad, vestuario y colocación del producto | Fondo e iluminación |
| Vídeo de movimiento | Gesto y sincronización de cámara | Identidad del personaje y diálogo |
| Audio de voz | Carácter vocal, cadencia y energía emocional | Palabras originales y ruido de fondo |
| Audio de música | Tempo, densidad del arreglo y ritmo de edición | Melodía o letra reconocible |
Después describe esas relaciones en lenguaje natural. El propio ejemplo de H3 de MiniMax usa una frase que asigna el movimiento de cámara a una referencia de vídeo, el intérprete a una referencia de imagen y las voces a una referencia de audio. Las etiquetas numeradas de recursos varían según la interfaz, mientras que la API usa contenido tipado y roles de referencia; por ello, sustituye las etiquetas de las plantillas siguientes por la notación exacta que muestre tu flujo de trabajo.
Advertencia
Usa la voz o interpretación de una persona como referencia solo si tienes permiso. Una referencia de voz no demuestra que poseas la identidad del hablante, la grabación, la música ni el derecho a publicar una imitación generada.
Las referencias limpias generan experimentos más limpios. Recorta los silencios, elimina música de fondo no relacionada, evita la saturación y mantén el pasaje vocal o musical relevante fácil de oír. Usa un segmento corto que demuestre la propiedad que buscas en lugar de subir por defecto la duración máxima.
Cinco plantillas de prompts de audio nativo de MiniMax H3
Estos son encargos iniciales, no resultados de pruebas afirmados. Ejecuta cada prompt más de una vez y puntúa las salidas con el protocolo de la siguiente sección.
1. Diálogo de un único hablante con tono de sala
Primer plano de una chef en el pase de una cocina de restaurante tranquila después del servicio. La cámara hace un lento acercamiento mientras mira hacia una compañera fuera de cámara y dice: «Mañana lo intentamos otra vez». Interpretación: cansada pero discretamente optimista, ritmo natural, una respiración corta antes de «mañana». Su voz es la capa de audio principal, cercana y seca. Un zumbido bajo de ventilación y sonidos ocasionales de metal enfriándose permanecen lejanos. Sin música, sin narración, sin otras voces.
Usa esta plantilla para evaluar precisión del habla, interpretación emocional, movimiento de boca y si el ambiente se mantiene detrás de la frase.
2. Ambiente por capas con Foley sincronizado
Plano general dentro de una lavandería casi vacía por la noche, con luz fluorescente reflejada en el suelo de baldosas. Una persona pasa una chaqueta mojada de una lavadora a un cesto con ruedas; la puerta metálica hace clic al cerrarse justo cuando su mano la cierra y luego las ruedas del cesto traquetean suavemente sobre la baldosa. Primer plano sonoro: movimiento de tela y clic de puerta. Plano medio: rotación constante de la lavadora. Fondo: lluvia contra la ventana delantera y un coche lejano que pasa fuera. Mezcla estéreo nativa, sin diálogo, sin música.
Este encargo aísla ambiente, realismo de materiales, separación izquierda-derecha y sincronización de contacto.
3. Presentación de producto guiada por música
Película vertical de producto de diez segundos para una botella deportiva coral translúcida sobre una superficie de estudio lila. Empieza con un plano macro de condensación y después orbita mientras la botella se eleva a la posición principal. Banda electrónica minimalista original a 100 BPM: pulso suave para la apertura, acento percusivo limpio cuando el logotipo mira a cámara y después una nota final corta resuelta. Añade gotas sutiles y un sonido controlado de colocación. La música respalda los sonidos del producto en vez de enmascararlos. Sin voz ni golpe cinematográfico de archivo.
Para planificación visual específica de producto más allá de la banda sonora, consulta el flujo de trabajo de foto a vídeo de producto.
4. Referencia de voz permitida con diálogo nuevo
Usa la referencia de voz 1 solo para el timbre vocal de la narradora, el ritmo al hablar y una energía conversacional cálida. No reutilices sus palabras ni su ruido de fondo. La persona de la referencia de imagen 1 está junto a la ventana y dice: «El primer borrador es solo el principio». Mantén la frase inteligible y sincronizada con la hablante visible. Añade un tono de sala residencial tranquilo y lluvia suave fuera. Sin música. La grabación de voz está autorizada para este uso.
Prueba si las cualidades vocales previstas se transfieren sin copiar involuntariamente ruido, fraseo o contenido de la grabación de origen. Describe las cualidades deseadas con palabras para que la instrucción siga siendo útil aunque varíe la adherencia a la referencia.
5. Referencia rítmica para una edición social
Crea un montaje de 12 segundos de una artesana ceramista dando forma, esmaltando y colocando una taza terminada en una estantería. Usa la referencia de audio 1 solo para el tempo, la energía rítmica y el ritmo de edición. Compón una pista percusiva original con melodía y diseño sonoro diferentes. Corta la acción visual en los principales cambios rítmicos: el barro cae en el torno, el pincel toca el esmalte, la taza llega a la estantería. Conserva la rotación natural del torno, la textura del pincel y el toque cerámico final bajo la música. Sin diálogo.
Esto separa el condicionamiento rítmico de la copia musical y te da tres puntos de sincronización visibles que inspeccionar.
Un plan de evaluación de audio H3 repetible
Una demo oficial pulida no puede responder si un modelo encaja en tu flujo de producción. Usa el mismo encargo para al menos tres generaciones, mantén fijas la duración y las referencias, y puntúa cada salida en lugar de seleccionar solo el resultado más fuerte.
Prueba primero las capas por separado
Empieza con cuatro prompts controlados:
- Solo diálogo y tono de sala tranquilo
- Ambiente y tres eventos Foley visibles, sin habla ni música
- Música instrumental con dos acentos visuales previstos
- Una referencia de audio autorizada emparejada con una referencia simple de imagen o vídeo
Solo después de que esos funcionen debes combinar diálogo, ambiente, Foley y música en una escena cargada. Así los fallos se pueden diagnosticar: podrás saber si el problema procede de la pronunciación, la sincronización, la transferencia de referencias o la densidad de mezcla.
Usa una tarjeta de puntuación, no una impresión
| Dimensión | Pregunta que responder | Medida sencilla |
|---|---|---|
| Precisión del diálogo | ¿Se pronunciaron correctamente las palabras solicitadas? | Palabras correctas divididas por palabras solicitadas |
| Sincronización labial | ¿Se alinean los cierres de boca visibles y los acentos silábicos? | Puntuación 1–5 y anota la primera desviación visible |
| Sincronización de eventos | ¿Los sonidos de contacto caen con la acción mostrada? | Fotogramas antes o después en tres señales previstas |
| Consistencia de voz | ¿El hablante se mantiene reconocible durante la frase? | Puntúa principio, medio y final por separado |
| Control de referencia | ¿La propiedad solicitada se transfirió sin efectos no deseados? | Lista transferencias previstas e imprevistas |
| Imagen estéreo | ¿Las posiciones izquierda-derecha son útiles y estables? | Revisión con auriculares más comprobación de forma de onda por canal |
| Jerarquía de mezcla | ¿La capa principal es claramente inteligible? | Puntuación 1–5 al nivel normal de reproducción |
| Repetibilidad | ¿Con qué frecuencia el clip es utilizable sin reparación de audio? | Salidas utilizables divididas por ejecuciones totales |
Inspecciona el archivo exportado en un editor de vídeo o estación de trabajo de audio. Confirma que existan dos canales, escucha problemas de fase en mono y compara las formas de onda alrededor de eventos de contacto previstos. No deduzcas la calidad de audio de una vista previa de red social, que puede recomprimir o reasignar la banda sonora.
Consejo
Conserva las generaciones fallidas. Una revisión del prompt solo es una mejora si eleva la tasa de salidas utilizables en ejecuciones repetidas, no si produce un clip afortunado.
Limitaciones que debes prever
La propia publicación de lanzamiento de MiniMax dice que H3 aún tiene margen de mejora e identifica el detalle visual como una de las áreas para trabajo futuro. Para la producción de audio, la documentación pública actual también deja abiertas varias preguntas. No publica garantías sobre tasa de error de palabras, precisión de sincronización labial, sonoridad, frecuencia de muestreo, disposición de canales más allá del estéreo, cobertura de idiomas, similitud de referencias de voz ni control de señales a nivel de código de tiempo.
Planifica teniendo en cuenta estos límites prácticos:
- Salida corta: 4–15 segundos es adecuado para planos, anuncios y clips sociales, pero la continuidad de formato largo necesita edición entre generaciones.
- Contexto de referencia corto: se permiten hasta tres clips de audio, pero su duración combinada no puede superar 15 segundos.
- Sin solicitud de referencia de solo audio: un clip de audio de referencia debe emparejarse con al menos una imagen o vídeo.
- La sincronización en lenguaje natural no es una línea de tiempo bloqueada: trata los tiempos como intención hasta que pruebas repetidas demuestren la precisión que necesitas.
- El estéreo necesita verificación: dos canales no crean automáticamente dirección, profundidad o compatibilidad mono creíbles.
- Las mezclas densas pueden ocultar errores: diálogo, efectos, ambiente y música pueden modelarse juntos, pero un encargo más simple es más fácil de controlar y reparar.
- Los derechos de referencia siguen siendo aplicables: la capacidad del modelo no concede permiso para imitar una voz ni reutilizar música protegida.
La disponibilidad, los controles de interfaz y la facturación también pueden cambiar. El precio oficial actual de MiniMax lista el material de referencia de audio sin un cargo de entrada separado, mientras que la salida de vídeo y algunos otros materiales de referencia se facturan según sus propias reglas. Consulta la página oficial de precios de pago por uso antes de presupuestar una producción de API; no sustituyas la tarifa de MiniMax por la de un host de terceros. La guía de precios y especificaciones de H3 desarrolla las tarifas oficiales de MiniMax y los costes de material de referencia. El catálogo actual de modelos de OmniArt no establece disponibilidad de H3, por lo que esta guía no afirma que H3 ya se pueda generar dentro de OmniArt.
Construye el resto de la banda sonora en OmniArt
El audio nativo puede reducir traspasos, pero no elimina el valor de herramientas de sonido separadas. Si una toma de H3 tiene la imagen correcta y una narración débil, conserva la imagen y crea una pista de voz controlada. Si el diálogo funciona pero a la sala le falta textura, añade una capa de ambiente o Foley en lugar de regenerar el plano completo.
OmniArt reúne flujos de trabajo de vídeo, voz, sonido y música en un espacio creativo. Usa la guía del generador de efectos de sonido con IA para diseñar Foley y ambiente de sustitución, o compara el enfoque de prompting con la guía de audio espacial de Veo 3.1. El objetivo no es forzar cada sonido en una generación. Es conservar la pista nativa cuando funciona y sustituir solo la capa que no funciona.
¿Listo para crear?
Empieza a generar contenido increíble con IA