Cómo instalar la skill de prompts de MiniMax H3
Instala la skill de prompts de MiniMax H3, elige el modo de vídeo adecuado y convierte briefs creativos en estructuras base o Ref2VA exactas para agentes.

La skill de escritura de prompts de MiniMax H3 ofrece a un agente de IA un método definido para convertir una petición creativa en un prompt audiovisual preparado para H3. En lugar de dejar que improvise un formato, instalas una skill, identificas el modo de generación y recibes los campos y las etiquetas de referencia que exige ese modo.
Este tutorial explica cómo configurar y usar la skill, no recopila todas las técnicas posibles de prompting para H3. Sigue los archivos del repositorio oficial MiniMax-H3, incluida la skill h3-prompt-writing, su guía de modos base y la de referencia completa. Para profundizar en papeles de las referencias, reglas de conservación y prompts de producción, abre por separado la guía de prompts de MiniMax H3.
Instala la skill de escritura de prompts de MiniMax H3
Ejecuta el comando de instalación de una sola skill publicado en el repositorio de MiniMax desde el proyecto donde uses tu agente de programación o creación con IA:
npx skills add https://github.com/MiniMax-AI/MiniMax-H3 --skill h3-prompt-writing
El comando instala solo h3-prompt-writing. El repositorio incluye además ocho skills de generación de vídeo para estilos concretos, por lo que elegirla por su nombre mantiene la configuración centrada en la escritura de prompts.
La skill instalada contiene dos guías de referencia:
references/base-en.txtabarca T2VA, I2VA, FL2VA y L2VA.references/ref-en.txtabarca Ref2VA de referencia completa.
Esta división importa más que el tema del clip. El agente debe elegir la guía según la relación entre las entradas y conservar sus nombres de campo, orden de secciones, etiquetas y notación temporal.
Elige el modo de tarea H3 antes de pedir la reescritura
Indica el modo al agente siempre que lo conozcas. Si no, describe los fotogramas límite y los materiales de referencia disponibles para que clasifique la petición.
| Modo | Entradas y relación | Lo que debe crear la skill |
|---|---|---|
| T2VA | Solo texto | Una cronología audiovisual completa a partir del brief |
| I2VA | Primer fotograma proporcionado | Un recorrido que parte de ese fotograma y avanza |
| FL2VA | Primer y último fotogramas proporcionados | Un recorrido continuo que conecta ambos límites |
| L2VA | Último fotograma proporcionado | Un inicio plausible que converge en el fotograma final |
| Ref2VA | Imágenes o vídeos de referencia, con audio opcional | Un análisis y una descripción de referencia en seis secciones |
T2VA, I2VA, FL2VA y L2VA son los modos base de la skill. Comparten un cuerpo de tres campos. I2VA, FL2VA y L2VA añaden encima una instrucción exacta de alineación; T2VA comienza directamente con el primer campo.
Ref2VA no es la misma plantilla con más archivos. Tiene un contrato aparte de seis secciones para definir referencias, clasificar sus papeles, analizar su conservación e indicar cuándo interviene cada una.
No elijas Ref2VA solo porque una petición sea detallada. Úsalo cuando el contenido de referencia deba definirse y seguirse en toda la salida.
Conoce la estructura exacta de los modos base
En todos los modos base, el cuerpo usa estos tres nombres de campo y este orden:
integrated_multimodal_description: [Shot 1] ...
overall_soundscape: ...
non_diegetic_music: ...
integrated_multimodal_description contiene estilo visual, composición, sujetos, entorno, acciones, cámara, diálogo, canto y sonido diegético sincronizado a lo largo de la cronología. overall_soundscape resume ambiente, sonidos físicos y sonidos humanos no verbales del clip. non_diegetic_music describe la música que oye el público, pero no los personajes; usa N/A cuando no exista.
La línea de alineación cambia con el modo de fotograma clave. La guía oficial especifica estas formas:
I2VA
For the target video, at 0.00 seconds into the target video, <Picture 1> (from [Shot 1]) is fully referenced.
FL2VA
How the reference pictures align with the target video — Picture 1 (from Shot 1) aligns with the 0.00-second mark of the target video; Picture 2 (from Shot N) aligns with the S.SS-second mark of the target video.
L2VA
How the reference pictures align with the target video — <Picture 1> (from [Shot N]) aligns with the S.SS-second mark of the target video.
En la reescritura final, N se convierte en el número real del último plano y S.SS, en la duración efectiva con exactamente dos decimales. La línea va primero, seguida de una línea en blanco y el cuerpo de tres campos. T2VA no tiene línea de alineación.
Los tiempos de plano también siguen una convención: [Shot 1] no lleva marca temporal, mientras que los posteriores empiezan con un tiempo de corte estrictamente creciente dentro de la duración, como [Shot 2] At 00:03.500, .... Modo, alineación, último plano y duración deben coincidir.
Conoce la estructura exacta de Ref2VA
El modo de referencia completa debe devolver seis secciones en este orden:
subject_definitions:
...
summary:
[reference generation] ...
retention_analysis:
<Subject 1> (appears in [Shot 1]): fully_preserved - ...
detailed_description:
...
overall_soundscape:
...
non_diegetic_music:
...
Cada etiqueta tiene una función distinta:
<Subject N>identifica contenido visible reutilizable, como personas, objetos, escenas, estilos, acciones, interfaces o efectos.<Picture N>identifica una imagen usada como fotograma objetivo, fotograma clave, ancla de composición o referencia de storyboard.<Video N>identifica un vídeo fuente para edición, continuación o estructura temporal del vídeo completo.<Audio N>identifica una señal de audio independiente o una pista sincronizada habilitada que se copia o se toma como referencia.
Las categorías se numeran por separado. Un sujeto visual extraído de un vídeo sigue usando <Subject N>; <Video N> representa el archivo o su relación con todo el vídeo. Que un vídeo contenga sonido tampoco crea automáticamente una entrada <Audio N>.
summary empieza con uno o varios tipos oficiales entre corchetes: keyframe completion, reference generation, video editing, video continuation, audio reuse o audio reference. Los tipos aplicables se unen con +.
retention_analysis asigna una relación explícita a cada etiqueta. El contenido visual usa fully_preserved, partially_preserved, attribute_transfer o weak_reference; el audio usa fully_copy, partially_copy, reference o weak_reference. El marcador describe la relación prevista, no una puntuación genérica de calidad.
Por último, Ref2VA sustituye integrated_multimodal_description por detailed_description. Para tareas de generación, la guía de MiniMax suele pedir 350–500 palabras en inglés, con detalles sobre composición, sujetos, entorno, iluminación, acciones, cambios de estado, cámara, sonido y referencias de cada plano. Si hay mucho diálogo, prima encajar toda la cronología hablada, no alcanzar la cifra de forma mecánica.
Pide al agente un prompt de modo base
Tras la instalación, llama a la skill por su nombre y aporta un brief compacto. La configuración incluida usa $h3-prompt-writing en la petición predeterminada.
Puedes copiar esta petición FL2VA:
Use $h3-prompt-writing to rewrite this request as a MiniMax H3 FL2VA prompt.
Duration: 8.00 seconds.
Picture 1: the supplied first frame, a closed field notebook on a rain-darkened café table.
Picture 2: the supplied last frame, the same notebook open to a pressed violet flower.
Action: one hand enters, opens the notebook, and stops on the flower page.
Camera: one continuous shot with a slow, small push in.
Sound: quiet café room tone, rain against glass, paper and cover movement.
Dialogue: none.
Non-diegetic music: none.
Preserve the table position, notebook identity, hand continuity, lighting direction, and final composition. Return only the final rewrite in the official base-mode structure.
Lo útil es el modo explícito, la duración exacta, el papel claro de cada imagen, una transición viable, las decisiones de sonido y el límite de salida. El agente debe devolver primero la línea FL2VA, usar los tres campos y llegar a Picture 2 en 8.00 segundos.
Para I2VA, sustituye la segunda imagen por acciones que avancen desde el primer fotograma. Para L2VA, describe el acontecimiento anterior al fotograma final. Para T2VA, elimina las imágenes y da información suficiente para construir la composición inicial y la secuencia audiovisual.
Pide al agente un prompt de referencia completa
Las peticiones Ref2VA funcionan mejor si cada material tiene un papel declarado. Esta petición separa identidad, movimiento y orientación de audio:
Use $h3-prompt-writing to rewrite this request as a MiniMax H3 full-reference Ref2VA prompt.
Target: a 10-second, three-shot product demonstration.
Picture 1: preserve the reusable bottle identity, silhouette, cap, label placement, and material finish.
Video 1: reference only the demonstrator's hand action and the three-shot cut rhythm; do not reuse its product, set, or wardrobe.
Audio 1: reference the percussion tempo for edit timing without copying the source signal.
Shot flow:
1. Establish the bottle centered on a stone counter.
2. A hand presses the pump once and the lotion lands on the back of the other hand.
3. End on the bottle and a small lotion smear beside it.
No dialogue or visible text beyond the preserved label. Use new room ambience and restrained audience-only percussion. Return only the six official Ref2VA sections in their required order, with consistent labels and explicit retention markers.
La petición no intenta escribir subject_definitions por el agente. Aporta procedencia e intención de reutilización suficientes para que la skill construya las definiciones, clasifique el resumen como generación por referencia más referencia de audio y explique la conservación o transferencia de cada etiqueta.
Si un material solo debe afectar a una propiedad, indícalo: un vídeo de movimiento puede guiar la mano sin controlar intérprete, vestuario, decorado, producto, cámara o audio.
Usa un flujo de agente en dos pasos
Trata la salida como un borrador estructurado seguido de una revisión determinista.
- Escribe el inventario de fuentes. Enumera instrucciones, fotogramas, imágenes, vídeos y audios e indica qué debe y no debe controlar cada material.
- Fija el modo. Elige T2VA, I2VA, FL2VA, L2VA o Ref2VA antes de reescribir.
- Da las restricciones de entrega. Incluye duración, número de planos, tiempos límite, diálogo, texto visible y música.
- Pide solo la estructura oficial. Así detectas campos ausentes, secciones desordenadas y comentarios extra.
- Revisa sin cambiar el brief. Comprueba primero estructura, referencias, tiempo, texto hablado y ubicación del audio.
- Corrige una capa cada vez. Pide arreglar una diferencia concreta conservando las secciones aceptadas.
En el segundo paso, usa esta instrucción:
Review the rewrite against the h3-prompt-writing guide. Keep the creative brief unchanged. Correct only field order, unresolved reference labels, shot timestamps, duration alignment, dialogue preservation, and diegetic versus non-diegetic audio placement. Return the corrected prompt only.
Este prompt de revisión reduce el riesgo de que una corrección de formato se convierta en una reescritura creativa silenciosa.
Revisa la salida antes de generar
Usa esta lista tras cada reescritura:
- Modo: la salida emplea la guía correspondiente a la relación real de entradas.
- Estructura base: T2VA empieza con
integrated_multimodal_description; I2VA, FL2VA y L2VA ponen la instrucción correcta encima. - Estructura Ref2VA: los seis campos aparecen una vez y en orden; se usa
detailed_description, nointegrated_multimodal_description. - Etiquetas: cada
<Subject N>,<Picture N>,<Video N>y<Audio N>conserva un significado y no aparece después ninguna etiqueta sin definir. - Papeles: sujetos, fotogramas concretos, relaciones de vídeo completo y señales de audio usan el tipo correcto.
- Conservación: toda referencia seguida tiene un marcador permitido y coherente.
- Planos:
[Shot 1]no tiene marca temporal; los cortes posteriores aumentan y quedan dentro de la duración. - Fotogramas límite: I2VA parte del primero, FL2VA alcanza el último y L2VA converge en el final aportado.
- Habla y texto: diálogo, letras y texto visible conservan idioma y palabras; la descripción reescrita queda en inglés.
- Audio: habla y sonidos diegéticos sincronizados quedan en la descripción; el ambiente general va en
overall_soundscape; la música solo para el público, ennon_diegetic_music. - Viabilidad: las acciones caben en la duración y el final se resuelve sin un corte involuntario.
- Limpieza: el agente no añade resumen argumental, material incompatible, papeles contradictorios ni comentarios extra.
Lleva el borrador del agente a OmniArt
La skill resulta más útil como preparación: convierte un inventario y un brief en un prompt revisable antes de generar. Guarda la salida aceptada con sus archivos fuente, porque las etiquetas solo funcionan si el orden y el significado de los materiales permanecen estables.
Después, lleva el prompt revisado y los materiales correspondientes al estudio de creación de vídeo de OmniArt. Si necesitas mejorar el brief y no la estructura H3, vuelve a la guía de prompts de MiniMax H3. Usa la guía para decidir qué quieres, h3-prompt-writing para expresarlo en el contrato H3 elegido y la lista para detener errores estructurales antes de generar.
¿Listo para crear?
Empieza a generar contenido increíble con IA