guideTutoriales y guías16 min de lectura

Guía de audio nativo de MiniMax H3: diálogo, música y sincronización

Aprende a redactar prompts para el audio estéreo nativo de MiniMax H3: diálogo, ambiente, música, referencias de voz y sincronización, con un plan de pruebas repetible.

Equipo OmniArt
Guía de audio nativo de MiniMax H3: diálogo, música y sincronización

El audio nativo de MiniMax H3 convierte la banda sonora en parte del encargo de generación, en lugar de en un archivo que añades automáticamente después de terminar la imagen. MiniMax afirma que H3 comprende conjuntamente texto, imágenes, vídeo y audio, y después genera vídeos con sonido estéreo nativo. Su ámbito de entrenamiento también trata la voz, los efectos sonoros y la música como un único dominio de audio en vez de como herramientas separadas.

Es un cambio relevante de flujo de trabajo, pero no promete que cada frase se pronuncie perfectamente, que cada paso caiga en el fotograma correcto o que cada mezcla estéreo esté lista para publicar. Esta guía separa las capacidades documentadas de H3 por MiniMax de las pruebas de producción que deben ejecutar los creadores. Ofrece una estructura práctica para el encargo sonoro, un flujo de trabajo con referencias de audio, cinco plantillas de prompts y una tarjeta de evaluación repetible sin presentar las demos oficiales como resultados independientes.

Qué documenta oficialmente MiniMax sobre el audio de H3

MiniMax describe H3 como un modelo de vídeo multimodal de uso general, no como un generador de vídeo silencioso con una pasada de sonido separada. Los materiales de lanzamiento de la empresa indican que el modelo genera audio estéreo nativo y modela conjuntamente voz, efectos sonoros y música. MiniMax también muestra un prompt que combina movimiento de cámara de un vídeo, un personaje de una imagen y voces ajustadas a una referencia de audio.

La guía oficial de generación de vídeo H3 define los límites actuales de la API:

Capacidad documentadaQué significa para un creador
Audio estéreo nativoH3 puede devolver una banda sonora de dos canales con el vídeo generado
Audio como contexto multimodalUn clip de audio puede guiar voz, movimiento, ritmo de edición u otra relación descrita en el prompt
Hasta tres referencias de audioCada clip puede durar 2–15 segundos, con un máximo de 15 segundos entre todas las referencias de audio
Referencias mixtasEl audio se puede combinar con imágenes y vídeos en una solicitud de referencia a vídeo
Entrada WAV y MP3El audio de referencia debe usar uno de los formatos de entrada documentados
Salida de 4–15 segundosH3 está diseñado para clips cortos, no para una banda sonora completa de formato largo en una generación

Hay tres restricciones importantes. Una referencia de audio no puede enviarse sola; MiniMax requiere al menos una imagen o vídeo junto a ella. Los archivos de audio están limitados a 15 MB cada uno y la solicitud completa de referencias mixtas está limitada a 12 recursos. El modo de referencia tampoco puede combinarse con el modo de primer o último fotograma en la misma solicitud, así que decide si importan más para el plano los fotogramas límite exactos o un condicionamiento multimodal más amplio.

Nota

El estéreo no es lo mismo que el audio espacial. MiniMax documenta salida estéreo nativa, pero sus materiales públicos actuales no prometen sonido envolvente, ambisónico, basado en objetos ni un nivel particular de precisión posicional. Evalúa la colocación izquierda-derecha con auriculares antes de describir un resultado como espacial.

Construye el encargo sonoro antes de escribir el prompt

El prompt de H3 más útil no es una lista larga de sonidos. Es un plan sonoro compacto que indica al modelo qué debe liderar, qué debe respaldarlo y qué debe ocurrir en un momento visible. Escribe el plan en cinco pasadas.

1. Fija la acción visual y la sincronización

La sincronización de audio depende de eventos visibles. Empieza por el plano, la acción del sujeto, el movimiento de cámara y la secuencia de tiempos. «Una cuchara golpea el platillo cuando la cámara se asienta» da al modelo un evento audiovisual compartido. «Añade un sonido de taza» no dice cuándo sucede el evento ni qué debe causarlo.

Para un clip de 10 segundos, un mapa de tiempos sencillo podría ser:

  • 0–3 segundos: presentar la habitación y al sujeto
  • 3–7 segundos: diálogo o acción principal
  • 7–10 segundos: revelado del producto y señal sonora final

Trata esos tiempos como dirección, no como marcadores de edición exactos por fotograma. Una prueba de producción debe medir cuánto se aproxima la salida a ellos.

2. Nombra una capa de audio principal

Elige el sonido que el público debe advertir primero: diálogo, interacción con un producto, un gancho musical o sonido ambiental. Dale la formulación más clara y protege espacio a su alrededor.

Si el diálogo es principal, escribe la frase exacta entre comillas y especifica una dirección de interpretación. Si lo principal es el sonido de un producto, describe la acción física que lo crea. Si lo principal es la música, indica el tempo, la instrumentación, el ánimo y dónde debe cambiar el arreglo.

3. Añade ambiente como lugar acústico

El ambiente debe explicar dónde transcurre el plano. En vez de «sonidos de cafetería», describe un suave siseo de máquina de espresso detrás del hablante, conversación baja de sala y una campanilla de puerta a lo lejos. Para un anuncio limpio de producto, pide un tono de sala de estudio controlado en vez de silencio, salvo que el silencio sea una decisión creativa deliberada.

Usa palabras de distancia y material aplicables tanto a imagen como a sonido:

  • cercano, seco, íntimo y ligeramente reverberante
  • distante, amortiguado tras un cristal o fuera de cámara a la izquierda
  • pasos sobre baldosa, movimiento de tela, lluvia sobre metal o un vaso apoyado en madera

4. Decide si la música es banda sonora o fuente

La banda sonora está fuera de la escena; la música de fuente procede de un objeto o lugar dentro de ella. Indica cuál quieres. «Una base electrónica contenida bajo el diálogo» pide una capa de fondo, mientras que «música sonando suavemente desde la radio de la cafetería, algo amortiguada» le da una fuente acústica en pantalla.

Cuando no se necesite música, di no music. Así es más fácil juzgar una prueba de diálogo o Foley. Cuando sí se necesite, deja margen para la voz en vez de pedir que todas las capas sean fuertes y dramáticas.

5. Indica las exclusiones

La dirección de audio negativa es útil cuando protege el encargo. Algunos ejemplos son no narration, no crowd cheering, no added melody y no exaggerated whooshes. Mantén corta la lista de exclusiones; demasiadas restricciones pueden competir con la acción que realmente quieres.

Cómo usar referencias de audio sin confundir su papel

El sistema de referencias de H3 resulta más útil cuando cada recurso tiene una tarea. Un clip de audio de referencia puede aportar timbre y cadencia vocal, energía musical, textura sonora o ritmo de edición. No supongas que el modelo sabe qué propiedad debe tomar.

Escribe un mapa de recursos antes del prompt final:

RecursoTarea asignadaLo que no debe transferirse
Imagen de personajeIdentidad, vestuario y colocación del productoFondo e iluminación
Vídeo de movimientoGesto y sincronización de cámaraIdentidad del personaje y diálogo
Audio de vozCarácter vocal, cadencia y energía emocionalPalabras originales y ruido de fondo
Audio de músicaTempo, densidad del arreglo y ritmo de ediciónMelodía o letra reconocible

Después describe esas relaciones en lenguaje natural. El propio ejemplo de H3 de MiniMax usa una frase que asigna el movimiento de cámara a una referencia de vídeo, el intérprete a una referencia de imagen y las voces a una referencia de audio. Las etiquetas numeradas de recursos varían según la interfaz, mientras que la API usa contenido tipado y roles de referencia; por ello, sustituye las etiquetas de las plantillas siguientes por la notación exacta que muestre tu flujo de trabajo.

Advertencia

Usa la voz o interpretación de una persona como referencia solo si tienes permiso. Una referencia de voz no demuestra que poseas la identidad del hablante, la grabación, la música ni el derecho a publicar una imitación generada.

Las referencias limpias generan experimentos más limpios. Recorta los silencios, elimina música de fondo no relacionada, evita la saturación y mantén el pasaje vocal o musical relevante fácil de oír. Usa un segmento corto que demuestre la propiedad que buscas en lugar de subir por defecto la duración máxima.

Cinco plantillas de prompts de audio nativo de MiniMax H3

Estos son encargos iniciales, no resultados de pruebas afirmados. Ejecuta cada prompt más de una vez y puntúa las salidas con el protocolo de la siguiente sección.

1. Diálogo de un único hablante con tono de sala

Primer plano de una chef en el pase de una cocina de restaurante tranquila después del servicio. La cámara hace un lento acercamiento mientras mira hacia una compañera fuera de cámara y dice: «Mañana lo intentamos otra vez». Interpretación: cansada pero discretamente optimista, ritmo natural, una respiración corta antes de «mañana». Su voz es la capa de audio principal, cercana y seca. Un zumbido bajo de ventilación y sonidos ocasionales de metal enfriándose permanecen lejanos. Sin música, sin narración, sin otras voces.

Usa esta plantilla para evaluar precisión del habla, interpretación emocional, movimiento de boca y si el ambiente se mantiene detrás de la frase.

2. Ambiente por capas con Foley sincronizado

Plano general dentro de una lavandería casi vacía por la noche, con luz fluorescente reflejada en el suelo de baldosas. Una persona pasa una chaqueta mojada de una lavadora a un cesto con ruedas; la puerta metálica hace clic al cerrarse justo cuando su mano la cierra y luego las ruedas del cesto traquetean suavemente sobre la baldosa. Primer plano sonoro: movimiento de tela y clic de puerta. Plano medio: rotación constante de la lavadora. Fondo: lluvia contra la ventana delantera y un coche lejano que pasa fuera. Mezcla estéreo nativa, sin diálogo, sin música.

Este encargo aísla ambiente, realismo de materiales, separación izquierda-derecha y sincronización de contacto.

3. Presentación de producto guiada por música

Película vertical de producto de diez segundos para una botella deportiva coral translúcida sobre una superficie de estudio lila. Empieza con un plano macro de condensación y después orbita mientras la botella se eleva a la posición principal. Banda electrónica minimalista original a 100 BPM: pulso suave para la apertura, acento percusivo limpio cuando el logotipo mira a cámara y después una nota final corta resuelta. Añade gotas sutiles y un sonido controlado de colocación. La música respalda los sonidos del producto en vez de enmascararlos. Sin voz ni golpe cinematográfico de archivo.

Para planificación visual específica de producto más allá de la banda sonora, consulta el flujo de trabajo de foto a vídeo de producto.

4. Referencia de voz permitida con diálogo nuevo

Usa la referencia de voz 1 solo para el timbre vocal de la narradora, el ritmo al hablar y una energía conversacional cálida. No reutilices sus palabras ni su ruido de fondo. La persona de la referencia de imagen 1 está junto a la ventana y dice: «El primer borrador es solo el principio». Mantén la frase inteligible y sincronizada con la hablante visible. Añade un tono de sala residencial tranquilo y lluvia suave fuera. Sin música. La grabación de voz está autorizada para este uso.

Prueba si las cualidades vocales previstas se transfieren sin copiar involuntariamente ruido, fraseo o contenido de la grabación de origen. Describe las cualidades deseadas con palabras para que la instrucción siga siendo útil aunque varíe la adherencia a la referencia.

5. Referencia rítmica para una edición social

Crea un montaje de 12 segundos de una artesana ceramista dando forma, esmaltando y colocando una taza terminada en una estantería. Usa la referencia de audio 1 solo para el tempo, la energía rítmica y el ritmo de edición. Compón una pista percusiva original con melodía y diseño sonoro diferentes. Corta la acción visual en los principales cambios rítmicos: el barro cae en el torno, el pincel toca el esmalte, la taza llega a la estantería. Conserva la rotación natural del torno, la textura del pincel y el toque cerámico final bajo la música. Sin diálogo.

Esto separa el condicionamiento rítmico de la copia musical y te da tres puntos de sincronización visibles que inspeccionar.

Un plan de evaluación de audio H3 repetible

Una demo oficial pulida no puede responder si un modelo encaja en tu flujo de producción. Usa el mismo encargo para al menos tres generaciones, mantén fijas la duración y las referencias, y puntúa cada salida en lugar de seleccionar solo el resultado más fuerte.

Prueba primero las capas por separado

Empieza con cuatro prompts controlados:

  1. Solo diálogo y tono de sala tranquilo
  2. Ambiente y tres eventos Foley visibles, sin habla ni música
  3. Música instrumental con dos acentos visuales previstos
  4. Una referencia de audio autorizada emparejada con una referencia simple de imagen o vídeo

Solo después de que esos funcionen debes combinar diálogo, ambiente, Foley y música en una escena cargada. Así los fallos se pueden diagnosticar: podrás saber si el problema procede de la pronunciación, la sincronización, la transferencia de referencias o la densidad de mezcla.

Usa una tarjeta de puntuación, no una impresión

DimensiónPregunta que responderMedida sencilla
Precisión del diálogo¿Se pronunciaron correctamente las palabras solicitadas?Palabras correctas divididas por palabras solicitadas
Sincronización labial¿Se alinean los cierres de boca visibles y los acentos silábicos?Puntuación 1–5 y anota la primera desviación visible
Sincronización de eventos¿Los sonidos de contacto caen con la acción mostrada?Fotogramas antes o después en tres señales previstas
Consistencia de voz¿El hablante se mantiene reconocible durante la frase?Puntúa principio, medio y final por separado
Control de referencia¿La propiedad solicitada se transfirió sin efectos no deseados?Lista transferencias previstas e imprevistas
Imagen estéreo¿Las posiciones izquierda-derecha son útiles y estables?Revisión con auriculares más comprobación de forma de onda por canal
Jerarquía de mezcla¿La capa principal es claramente inteligible?Puntuación 1–5 al nivel normal de reproducción
Repetibilidad¿Con qué frecuencia el clip es utilizable sin reparación de audio?Salidas utilizables divididas por ejecuciones totales

Inspecciona el archivo exportado en un editor de vídeo o estación de trabajo de audio. Confirma que existan dos canales, escucha problemas de fase en mono y compara las formas de onda alrededor de eventos de contacto previstos. No deduzcas la calidad de audio de una vista previa de red social, que puede recomprimir o reasignar la banda sonora.

Consejo

Conserva las generaciones fallidas. Una revisión del prompt solo es una mejora si eleva la tasa de salidas utilizables en ejecuciones repetidas, no si produce un clip afortunado.

Limitaciones que debes prever

La propia publicación de lanzamiento de MiniMax dice que H3 aún tiene margen de mejora e identifica el detalle visual como una de las áreas para trabajo futuro. Para la producción de audio, la documentación pública actual también deja abiertas varias preguntas. No publica garantías sobre tasa de error de palabras, precisión de sincronización labial, sonoridad, frecuencia de muestreo, disposición de canales más allá del estéreo, cobertura de idiomas, similitud de referencias de voz ni control de señales a nivel de código de tiempo.

Planifica teniendo en cuenta estos límites prácticos:

  • Salida corta: 4–15 segundos es adecuado para planos, anuncios y clips sociales, pero la continuidad de formato largo necesita edición entre generaciones.
  • Contexto de referencia corto: se permiten hasta tres clips de audio, pero su duración combinada no puede superar 15 segundos.
  • Sin solicitud de referencia de solo audio: un clip de audio de referencia debe emparejarse con al menos una imagen o vídeo.
  • La sincronización en lenguaje natural no es una línea de tiempo bloqueada: trata los tiempos como intención hasta que pruebas repetidas demuestren la precisión que necesitas.
  • El estéreo necesita verificación: dos canales no crean automáticamente dirección, profundidad o compatibilidad mono creíbles.
  • Las mezclas densas pueden ocultar errores: diálogo, efectos, ambiente y música pueden modelarse juntos, pero un encargo más simple es más fácil de controlar y reparar.
  • Los derechos de referencia siguen siendo aplicables: la capacidad del modelo no concede permiso para imitar una voz ni reutilizar música protegida.

La disponibilidad, los controles de interfaz y la facturación también pueden cambiar. El precio oficial actual de MiniMax lista el material de referencia de audio sin un cargo de entrada separado, mientras que la salida de vídeo y algunos otros materiales de referencia se facturan según sus propias reglas. Consulta la página oficial de precios de pago por uso antes de presupuestar una producción de API; no sustituyas la tarifa de MiniMax por la de un host de terceros. La guía de precios y especificaciones de H3 desarrolla las tarifas oficiales de MiniMax y los costes de material de referencia. El catálogo actual de modelos de OmniArt no establece disponibilidad de H3, por lo que esta guía no afirma que H3 ya se pueda generar dentro de OmniArt.

Construye el resto de la banda sonora en OmniArt

El audio nativo puede reducir traspasos, pero no elimina el valor de herramientas de sonido separadas. Si una toma de H3 tiene la imagen correcta y una narración débil, conserva la imagen y crea una pista de voz controlada. Si el diálogo funciona pero a la sala le falta textura, añade una capa de ambiente o Foley en lugar de regenerar el plano completo.

OmniArt reúne flujos de trabajo de vídeo, voz, sonido y música en un espacio creativo. Usa la guía del generador de efectos de sonido con IA para diseñar Foley y ambiente de sustitución, o compara el enfoque de prompting con la guía de audio espacial de Veo 3.1. El objetivo no es forzar cada sonido en una generación. Es conservar la pista nativa cuando funciona y sustituir solo la capa que no funciona.

Explora flujos de trabajo de creación de vídeo en OmniArt

¿Listo para crear?

Empieza a generar contenido increíble con IA

Empezar gratis