Guía de audio nativo de MiniMax H3: diálogo, música y sincronización
Aprende a redactar prompts para el audio estéreo nativo de MiniMax H3: diálogo, ambiente, música, referencias de voz y sincronización, con un plan de pruebas repetible.

El audio nativo de MiniMax H3 convierte la banda sonora en parte del encargo de generación, en lugar de en un archivo que añades automáticamente después de terminar la imagen. MiniMax afirma que H3 comprende conjuntamente texto, imágenes, vídeo y audio, y después genera vídeos con sonido estéreo nativo. Su ámbito de entrenamiento también trata la voz, los efectos sonoros y la música como un único dominio de audio en vez de como herramientas separadas.
Es un cambio relevante de flujo de trabajo, pero no promete que cada frase se pronuncie perfectamente, que cada paso caiga en el fotograma correcto o que cada mezcla estéreo esté lista para publicar. Esta guía separa las capacidades documentadas de H3 por MiniMax de las pruebas de producción que deben ejecutar los creadores. Ofrece una estructura práctica para el encargo sonoro, un flujo de trabajo con referencias de audio, cinco plantillas de prompts y una tarjeta de evaluación repetible sin presentar las demos oficiales como resultados independientes.
Qué documenta oficialmente MiniMax sobre el audio de H3
MiniMax describe H3 como un modelo de vídeo multimodal de uso general, no como un generador de vídeo silencioso con una pasada de sonido separada. Los materiales de lanzamiento de la empresa indican que el modelo genera audio estéreo nativo y modela conjuntamente voz, efectos sonoros y música. MiniMax también muestra un prompt que combina movimiento de cámara de un vídeo, un personaje de una imagen y voces ajustadas a una referencia de audio.
La guía oficial de generación de vídeo H3 define los límites actuales de la API:
| Capacidad documentada | Qué significa para un creador |
|---|---|
| Audio estéreo nativo | H3 puede devolver una banda sonora de dos canales con el vídeo generado |
| Audio como contexto multimodal | Un clip de audio puede guiar voz, movimiento, ritmo de edición u otra relación descrita en el prompt |
| Hasta tres referencias de audio | Cada clip puede durar 2–15 segundos, con un máximo de 15 segundos entre todas las referencias de audio |
| Referencias mixtas | El audio se puede combinar con imágenes y vídeos en una solicitud de referencia a vídeo |
| Entrada WAV y MP3 | El audio de referencia debe usar uno de los formatos de entrada documentados |
| Salida de 4–15 segundos | H3 está diseñado para clips cortos, no para una banda sonora completa de formato largo en una generación |
Hay tres restricciones importantes. Una referencia de audio no puede enviarse sola; MiniMax requiere al menos una imagen o vídeo junto a ella. Los archivos de audio están limitados a 15 MB cada uno y la solicitud completa de referencias mixtas está limitada a 12 recursos. El modo de referencia tampoco puede combinarse con el modo de primer o último fotograma en la misma solicitud, así que decide si importan más para el plano los fotogramas límite exactos o un condicionamiento multimodal más amplio.
Nota
El estéreo no es lo mismo que el audio espacial. MiniMax documenta salida estéreo nativa, pero sus materiales públicos actuales no prometen sonido envolvente, ambisónico, basado en objetos ni un nivel particular de precisión posicional. Evalúa la colocación izquierda-derecha con auriculares antes de describir un resultado como espacial.
Construye el encargo sonoro antes de escribir el prompt
El prompt de H3 más útil no es una lista larga de sonidos. Es un plan sonoro compacto que indica al modelo qué debe liderar, qué debe respaldarlo y qué debe ocurrir en un momento visible. Escribe el plan en cinco pasadas.
1. Fija la acción visual y la sincronización
La sincronización de audio depende de eventos visibles. Empieza por el plano, la acción del sujeto, el movimiento de cámara y la secuencia de tiempos. «Una cuchara golpea el platillo cuando la cámara se asienta» da al modelo un evento audiovisual compartido. «Añade un sonido de taza» no dice cuándo sucede el evento ni qué debe causarlo.
Para un clip de 10 segundos, un mapa de tiempos sencillo podría ser:
- 0–3 segundos: presentar la habitación y al sujeto
- 3–7 segundos: diálogo o acción principal
- 7–10 segundos: revelado del producto y señal sonora final
Trata esos tiempos como dirección, no como marcadores de edición exactos por fotograma. Una prueba de producción debe medir cuánto se aproxima la salida a ellos.
2. Nombra una capa de audio principal
Elige el sonido que el público debe advertir primero: diálogo, interacción con un producto, un gancho musical o sonido ambiental. Dale la formulación más clara y protege espacio a su alrededor.
Si el diálogo es principal, escribe la frase exacta entre comillas y especifica una dirección de interpretación. Si lo principal es el sonido de un producto, describe la acción física que lo crea. Si lo principal es la música, indica el tempo, la instrumentación, el ánimo y dónde debe cambiar el arreglo.
3. Añade ambiente como lugar acústico
El ambiente debe explicar dónde transcurre el plano. En vez de «sonidos de cafetería», describe un suave siseo de máquina de espresso detrás del hablante, conversación baja de sala y una campanilla de puerta a lo lejos. Para un anuncio limpio de producto, pide un tono de sala de estudio controlado en vez de silencio, salvo que el silencio sea una decisión creativa deliberada.
Usa palabras de distancia y material aplicables tanto a imagen como a sonido:
- cercano, seco, íntimo y ligeramente reverberante
- distante, amortiguado tras un cristal o fuera de cámara a la izquierda
- pasos sobre baldosa, movimiento de tela, lluvia sobre metal o un vaso apoyado en madera
4. Decide si la música es banda sonora o fuente
La banda sonora está fuera de la escena; la música de fuente procede de un objeto o lugar dentro de ella. Indica cuál quieres. «Una base electrónica contenida bajo el diálogo» pide una capa de fondo, mientras que «música sonando suavemente desde la radio de la cafetería, algo amortiguada» le da una fuente acústica en pantalla.
Cuando no se necesite música, di no music. Así es más fácil juzgar una prueba de diálogo o Foley. Cuando sí se necesite, deja margen para la voz en vez de pedir que todas las capas sean fuertes y dramáticas.
5. Indica las exclusiones
La dirección de audio negativa es útil cuando protege el encargo. Algunos ejemplos son no narration, no crowd cheering, no added melody y no exaggerated whooshes. Mantén corta la lista de exclusiones; demasiadas restricciones pueden competir con la acción que realmente quieres.
Cómo usar referencias de audio sin confundir su papel
El sistema de referencias de H3 resulta más útil cuando cada recurso tiene una tarea. Un clip de audio de referencia puede aportar timbre y cadencia vocal, energía musical, textura sonora o ritmo de edición. No supongas que el modelo sabe qué propiedad debe tomar.
Escribe un mapa de recursos antes del prompt final:
| Recurso | Tarea asignada | Lo que no debe transferirse |
|---|---|---|
| Imagen de personaje | Identidad, vestuario y colocación del producto | Fondo e iluminación |
| Vídeo de movimiento | Gesto y sincronización de cámara | Identidad del personaje y diálogo |
| Audio de voz | Carácter vocal, cadencia y energía emocional | Palabras originales y ruido de fondo |
| Audio de música | Tempo, densidad del arreglo y ritmo de edición | Melodía o letra reconocible |
Después describe esas relaciones en lenguaje natural. El propio ejemplo de H3 de MiniMax usa una frase que asigna el movimiento de cámara a una referencia de vídeo, el intérprete a una referencia de imagen y las voces a una referencia de audio. Las etiquetas numeradas de recursos varían según la interfaz, mientras que la API usa contenido tipado y roles de referencia; por ello, sustituye las etiquetas de las plantillas siguientes por la notación exacta que muestre tu flujo de trabajo.
Advertencia
Usa la voz o interpretación de una persona como referencia solo si tienes permiso. Una referencia de voz no demuestra que poseas la identidad del hablante, la grabación, la música ni el derecho a publicar una imitación generada.
Las referencias limpias generan experimentos más limpios. Recorta los silencios, elimina música de fondo no relacionada, evita la saturación y mantén el pasaje vocal o musical relevante fácil de oír. Usa un segmento corto que demuestre la propiedad que buscas en lugar de subir por defecto la duración máxima.
Cinco plantillas de prompts de audio nativo de MiniMax H3
Estos son encargos iniciales, no resultados de pruebas afirmados. Ejecuta cada prompt más de una vez y puntúa las salidas con el protocolo de la siguiente sección.
1. Diálogo de un único hablante con tono de sala
Close-up of a chef at the pass in a quiet restaurant kitchen after service. The camera makes a slow push-in as she looks toward a colleague off-camera and says, “We try it again tomorrow.” Delivery: tired but quietly optimistic, natural pace, one short breath before “tomorrow.” Her voice is the primary audio layer, close and dry. Low ventilation hum and occasional metal cooling sounds remain distant. No music, no narration, no other voices.
Usa esta plantilla para evaluar precisión del habla, interpretación emocional, movimiento de boca y si el ambiente se mantiene detrás de la frase.
2. Ambiente por capas con Foley sincronizado
Wide shot inside a nearly empty laundromat at night, fluorescent light reflecting on the tiled floor. A person moves a wet jacket from a washer to a rolling basket; the metal door clicks shut exactly when their hand closes it, then the basket wheels rattle softly across tile. Foreground: fabric movement and the door click. Mid-ground: steady washer rotation. Background: rain against the front window and one distant car passing outside. Native stereo mix, no dialogue, no music.
Este encargo aísla ambiente, realismo de materiales, separación izquierda-derecha y sincronización de contacto.
3. Presentación de producto guiada por música
Ten-second vertical product film for a translucent coral sports bottle on a lilac studio surface. Start with a macro shot of condensation, then orbit as the bottle rises into the hero position. Original minimal electronic score at 100 BPM: soft pulse for the opening, a clean percussive accent when the logo faces camera, then a short resolved final note. Add subtle droplets and one controlled placement sound. Music supports the product sounds rather than masking them. No voice and no stock-style cinematic boom.
Para planificación visual específica de producto más allá de la banda sonora, consulta el flujo de trabajo de foto a vídeo de producto.
4. Referencia de voz permitida con diálogo nuevo
Use voice reference 1 only for the narrator's vocal timbre, speaking pace, and warm conversational energy. Do not reuse its words or background noise. The person from image reference 1 stands beside the window and says, “The first draft is only the beginning.” Keep the spoken line intelligible and synchronized to the visible speaker. Add a quiet residential room tone and soft rain outside. No music. The voice recording is authorized for this use.
Prueba si las cualidades vocales previstas se transfieren sin copiar involuntariamente ruido, fraseo o contenido de la grabación de origen. Describe las cualidades deseadas con palabras para que la instrucción siga siendo útil aunque varíe la adherencia a la referencia.
5. Referencia rítmica para una edición social
Create a 12-second montage of a ceramic artist shaping, glazing, and placing a finished cup on a shelf. Use audio reference 1 only for tempo, rhythmic energy, and edit pacing. Compose an original percussive track with different melody and sound design. Cut the visual action on the major rhythmic changes: clay lands on the wheel, brush touches glaze, cup reaches the shelf. Preserve natural wheel rotation, brush texture, and the final ceramic tap beneath the music. No dialogue.
Esto separa el condicionamiento rítmico de la copia musical y te da tres puntos de sincronización visibles que inspeccionar.
Un plan de evaluación de audio H3 repetible
Una demo oficial pulida no puede responder si un modelo encaja en tu flujo de producción. Usa el mismo encargo para al menos tres generaciones, mantén fijas la duración y las referencias, y puntúa cada salida en lugar de seleccionar solo el resultado más fuerte.
Prueba primero las capas por separado
Empieza con cuatro prompts controlados:
- Solo diálogo y tono de sala tranquilo
- Ambiente y tres eventos Foley visibles, sin habla ni música
- Música instrumental con dos acentos visuales previstos
- Una referencia de audio autorizada emparejada con una referencia simple de imagen o vídeo
Solo después de que esos funcionen debes combinar diálogo, ambiente, Foley y música en una escena cargada. Así los fallos se pueden diagnosticar: podrás saber si el problema procede de la pronunciación, la sincronización, la transferencia de referencias o la densidad de mezcla.
Usa una tarjeta de puntuación, no una impresión
| Dimensión | Pregunta que responder | Medida sencilla |
|---|---|---|
| Precisión del diálogo | ¿Se pronunciaron correctamente las palabras solicitadas? | Palabras correctas divididas por palabras solicitadas |
| Sincronización labial | ¿Se alinean los cierres de boca visibles y los acentos silábicos? | Puntuación 1–5 y anota la primera desviación visible |
| Sincronización de eventos | ¿Los sonidos de contacto caen con la acción mostrada? | Fotogramas antes o después en tres señales previstas |
| Consistencia de voz | ¿El hablante se mantiene reconocible durante la frase? | Puntúa principio, medio y final por separado |
| Control de referencia | ¿La propiedad solicitada se transfirió sin efectos no deseados? | Lista transferencias previstas e imprevistas |
| Imagen estéreo | ¿Las posiciones izquierda-derecha son útiles y estables? | Revisión con auriculares más comprobación de forma de onda por canal |
| Jerarquía de mezcla | ¿La capa principal es claramente inteligible? | Puntuación 1–5 al nivel normal de reproducción |
| Repetibilidad | ¿Con qué frecuencia el clip es utilizable sin reparación de audio? | Salidas utilizables divididas por ejecuciones totales |
Inspecciona el archivo exportado en un editor de vídeo o estación de trabajo de audio. Confirma que existan dos canales, escucha problemas de fase en mono y compara las formas de onda alrededor de eventos de contacto previstos. No deduzcas la calidad de audio de una vista previa de red social, que puede recomprimir o reasignar la banda sonora.
Consejo
Conserva las generaciones fallidas. Una revisión del prompt solo es una mejora si eleva la tasa de salidas utilizables en ejecuciones repetidas, no si produce un clip afortunado.
Limitaciones que debes prever
La propia publicación de lanzamiento de MiniMax dice que H3 aún tiene margen de mejora e identifica el detalle visual como una de las áreas para trabajo futuro. Para la producción de audio, la documentación pública actual también deja abiertas varias preguntas. No publica garantías sobre tasa de error de palabras, precisión de sincronización labial, sonoridad, frecuencia de muestreo, disposición de canales más allá del estéreo, cobertura de idiomas, similitud de referencias de voz ni control de señales a nivel de código de tiempo.
Planifica teniendo en cuenta estos límites prácticos:
- Salida corta: 4–15 segundos es adecuado para planos, anuncios y clips sociales, pero la continuidad de formato largo necesita edición entre generaciones.
- Contexto de referencia corto: se permiten hasta tres clips de audio, pero su duración combinada no puede superar 15 segundos.
- Sin solicitud de referencia de solo audio: un clip de audio de referencia debe emparejarse con al menos una imagen o vídeo.
- La sincronización en lenguaje natural no es una línea de tiempo bloqueada: trata los tiempos como intención hasta que pruebas repetidas demuestren la precisión que necesitas.
- El estéreo necesita verificación: dos canales no crean automáticamente dirección, profundidad o compatibilidad mono creíbles.
- Las mezclas densas pueden ocultar errores: diálogo, efectos, ambiente y música pueden modelarse juntos, pero un encargo más simple es más fácil de controlar y reparar.
- Los derechos de referencia siguen siendo aplicables: la capacidad del modelo no concede permiso para imitar una voz ni reutilizar música protegida.
MiniMax H3 está disponible a través de PixVerse en OmniArt desde la suscripción Creator. Los modos Vídeo, Transición y Referencia generan entre 5 y 15 segundos en 768p o 1440p (2K). El modo Referencia admite hasta 9 imágenes, 3 vídeos y 3 archivos de audio. Las referencias de audio requieren al menos una imagen o un vídeo. OmniArt no muestra actualmente un control de audio independiente para H3. El audio de referencia sirve de guía, pero no garantiza una banda sonora lista en cada resultado; revisa el archivo entregado. Cuesta 8 (768p) / 12 (2K) créditos por segundo de salida. En Reference, el vídeo de referencia añade 8 (768p) / 12 (2K) créditos por cada segundo redondeado hacia arriba; se incluyen cinco imágenes, cada imagen posterior cuesta 4 créditos y el audio de referencia no añade créditos. página oficial de precios de pago por uso guía de precios y especificaciones de H3
Construye el resto de la banda sonora en OmniArt
El audio nativo puede reducir traspasos, pero no elimina el valor de herramientas de sonido separadas. Si una toma de H3 tiene la imagen correcta y una narración débil, conserva la imagen y crea una pista de voz controlada. Si el diálogo funciona pero a la sala le falta textura, añade una capa de ambiente o Foley en lugar de regenerar el plano completo.
OmniArt reúne flujos de trabajo de vídeo, voz, sonido y música en un espacio creativo. Usa la guía del generador de efectos de sonido con IA para diseñar Foley y ambiente de sustitución, o compara el enfoque de prompting con la guía de audio espacial de Veo 3.1. El objetivo no es forzar cada sonido en una generación. Es conservar la pista nativa cuando funciona y sustituir solo la capa que no funciona.
¿Listo para crear?
Empieza a generar contenido increíble con IA