Cómo instalar la skill de escritura de prompts de MiniMax H3 para agentes
Instala la skill de escritura de prompts de MiniMax H3, elige el modo de tarea de video correcto y convierte briefs creativos en estructuras de salida base o Ref2VA exactas para agentes.

La skill de escritura de prompts de MiniMax H3 le da a un agente de IA una manera definida de convertir un pedido creativo en un prompt audiovisual listo para H3. En vez de pedirle al agente que improvise un formato, instalas una sola skill, identificas el modo de generación y recibes los campos y las etiquetas de referencia que ese modo espera.
Este tutorial trata de configurar y operar la skill, no de reunir todas las técnicas posibles de prompting para H3. Sigue los archivos del repositorio oficial MiniMax-H3, incluida la skill h3-prompt-writing, su guía de modo base y su guía de referencia completa. Para consejos más amplios sobre roles de referencia, reglas de preservación y prompts de producción, mantén abierta aparte la guía de prompts de MiniMax H3.
Instala la skill de escritura de prompts de MiniMax H3
Ejecuta el comando de instalación de una sola skill publicado en el repositorio de MiniMax desde el proyecto donde usas tu agente de código o creativo:
npx skills add https://github.com/MiniMax-AI/MiniMax-H3 --skill h3-prompt-writing
El primer comando instala únicamente h3-prompt-writing. Hoy el repositorio agrupa esa skill de escritura de prompts junto a ocho skills de generación de video específicas por estilo, así que seleccionarla por nombre mantiene enfocada esta configuración.
La skill instalada trae dos guías de referencia:
references/base-en.txtcubre T2VA, I2VA, FL2VA y L2VA.references/ref-en.txtcubre Ref2VA de referencia completa.
Esa división importa más que el tema del clip. El agente debería elegir una guía a partir de la relación entre las entradas del pedido y después preservar los nombres de campo, el orden de secciones, las etiquetas y la notación de tiempo de esa guía.
Elige el modo de tarea de H3 antes de pedir una reescritura
Dale el modo al agente de forma explícita siempre que lo sepas. Si no lo sabes, describe qué fotogramas de frontera y qué recursos de referencia tienes para que pueda clasificar el pedido.
| Modo | Entradas y relación | Qué debería construir la skill |
|---|---|---|
| T2VA | Solo texto | Una línea de tiempo audiovisual completa creada desde el brief escrito |
| I2VA | Un primer fotograma provisto | Un recorrido que arranca en ese fotograma exacto y avanza |
| FL2VA | Primer y último fotograma provistos | Un recorrido continuo que conecta los dos fotogramas de frontera |
| L2VA | Un último fotograma provisto | Una apertura plausible que converge progresivamente en el fotograma final |
| Ref2VA | Imágenes o videos referenciados, opcionalmente con roles de audio | Un análisis de referencia completa en seis secciones y la descripción de planos |
T2VA, I2VA, FL2VA y L2VA son los modos base de la skill. Comparten un mismo cuerpo de tres campos. I2VA, FL2VA y L2VA agregan una instrucción de alineación exacta encima de ese cuerpo; T2VA empieza directamente por el primer campo.
Ref2VA no es la misma plantilla con más adjuntos. Tiene un contrato aparte de seis secciones para definir referencias, clasificar su rol, analizar la retención y describir cuándo entra en efecto cada referencia.
No elijas Ref2VA solo porque un pedido sea detallado. Elígelo cuando haya contenido referenciado que deba definirse y rastrearse a lo largo de la salida.
Conoce la estructura exacta de salida en modo base
Para todos los modos base, el cuerpo usa estos tres nombres de campo en este orden:
integrated_multimodal_description: [Shot 1] ...
overall_soundscape: ...
non_diegetic_music: ...
integrated_multimodal_description lleva el estilo visual, la composición, los sujetos, el entorno, las acciones, la cámara, el diálogo, el canto y el sonido diegético sincronizado a lo largo de la línea de tiempo. overall_soundscape resume el ambiente, los sonidos de acción y los sonidos humanos no verbales de todo el clip. non_diegetic_music describe la música que escucha el público pero no los personajes; es N/A cuando no hay ninguna.
La línea de alineación cambia según el modo de fotograma clave. La guía oficial especifica estas formas:
I2VA
For the target video, at 0.00 seconds into the target video, <Picture 1> (from [Shot 1]) is fully referenced.
FL2VA
How the reference pictures align with the target video — Picture 1 (from Shot 1) aligns with the 0.00-second mark of the target video; Picture 2 (from Shot N) aligns with the S.SS-second mark of the target video.
L2VA
How the reference pictures align with the target video — <Picture 1> (from [Shot N]) aligns with the S.SS-second mark of the target video.
En la reescritura final, N pasa a ser el número real del último plano y S.SS pasa a ser la duración efectiva con exactamente dos decimales. La línea va primero, seguida de una línea en blanco y del cuerpo de tres campos. T2VA no lleva línea de alineación.
El tiempo de los planos tiene su propia convención: [Shot 1] no lleva marca de tiempo, mientras que los planos siguientes empiezan con un tiempo de corte estrictamente creciente, como [Shot 2] At 00:03.500, .... Una salida en modo base está lista solo cuando el modo elegido, la línea de alineación, el último plano y la duración concuerdan.
Conoce la estructura exacta de salida de Ref2VA
El modo de referencia completa debe devolver seis secciones en este orden:
subject_definitions:
...
summary:
[reference generation] ...
retention_analysis:
<Subject 1> (appears in [Shot 1]): fully_preserved - ...
detailed_description:
...
overall_soundscape:
...
non_diegetic_music:
...
Cada etiqueta tiene un trabajo distinto:
<Subject N>nombra contenido visible reutilizable, como una persona, un objeto, una escena, un estilo, una acción, una interfaz o un efecto.<Picture N>nombra una imagen usada como fotograma objetivo concreto, fotograma clave, ancla de composición o referencia de storyboard.<Video N>nombra un video de origen usado para edición, continuación o estructura temporal de video completo.<Audio N>nombra una señal de audio independiente o una pista de audio sincronizada habilitada que se copia o se referencia.
Estas categorías se numeran de forma independiente. Un sujeto visual extraído de un video de referencia igual usa <Subject N>; <Video N> representa el recurso o su relación de video completo. Del mismo modo, un archivo de video que contiene sonido no crea automáticamente una entrada <Audio N>.
El summary empieza con uno o más tipos de tarea oficiales entre corchetes: keyframe completion, reference generation, video editing, video continuation, audio reuse o audio reference. Cuando aplican varios, se unen con +.
Después, retention_analysis le da a cada etiqueta una relación explícita. El contenido visible usa fully_preserved, partially_preserved, attribute_transfer o weak_reference. El audio usa fully_copy, partially_copy, reference o weak_reference. El marcador debería describir la relación buscada y no funcionar como un puntaje general de calidad.
Por último, Ref2VA reemplaza el campo base integrated_multimodal_description por detailed_description. Para tareas de generación, la guía de MiniMax normalmente pide de 350 a 500 palabras en inglés acá, con detalle suficiente para establecer la composición, los sujetos, el entorno, la iluminación, las acciones, los cambios de estado, el movimiento de cámara, el sonido y el uso de referencias de cada plano. El trabajo denso en diálogo prioriza que entre la línea de tiempo hablada completa en lugar de alcanzar ese rango de forma mecánica.
Pídele al agente un prompt en modo base
Después de instalar, llama a la skill por su nombre y entrega un brief de producción compacto. La configuración de agente que trae la skill usa $h3-prompt-writing en su pedido por defecto.
Este es un pedido FL2VA listo para pegar:
Use $h3-prompt-writing to rewrite this request as a MiniMax H3 FL2VA prompt.
Duration: 8.00 seconds.
Picture 1: the supplied first frame, a closed field notebook on a rain-darkened café table.
Picture 2: the supplied last frame, the same notebook open to a pressed violet flower.
Action: one hand enters, opens the notebook, and stops on the flower page.
Camera: one continuous shot with a slow, small push in.
Sound: quiet café room tone, rain against glass, paper and cover movement.
Dialogue: none.
Non-diegetic music: none.
Preserve the table position, notebook identity, hand continuity, lighting direction, and final composition. Return only the final rewrite in the official base-mode structure.
Las partes útiles son el modo explícito, la duración exacta, el rol claro de cada imagen, un recorrido de transición alcanzable, las decisiones de sonido y la restricción de salida. El agente debería devolver primero la línea de alineación de FL2VA, usar los tres campos compartidos y hacer aterrizar la Picture 2 en el segundo 8.00.
Para I2VA, reemplaza la segunda imagen por las acciones que se desarrollan a partir del primer fotograma. Para L2VA, describe el evento previsto antes del fotograma final provisto. Para T2VA, quita las referencias de imagen y dale al agente información suficiente para construir desde texto la composición de apertura y la secuencia audiovisual.
Pídele al agente un prompt de referencia completa
Los pedidos de Ref2VA funcionan mejor cuando cada recurso tiene un rol declarado. Este es un pedido de agente listo para pegar que separa identidad, movimiento y guía de audio:
Use $h3-prompt-writing to rewrite this request as a MiniMax H3 full-reference Ref2VA prompt.
Target: a 10-second, three-shot product demonstration.
Picture 1: preserve the reusable bottle identity, silhouette, cap, label placement, and material finish.
Video 1: reference only the demonstrator's hand action and the three-shot cut rhythm; do not reuse its product, set, or wardrobe.
Audio 1: reference the percussion tempo for edit timing without copying the source signal.
Shot flow:
1. Establish the bottle centered on a stone counter.
2. A hand presses the pump once and the lotion lands on the back of the other hand.
3. End on the bottle and a small lotion smear beside it.
No dialogue or visible text beyond the preserved label. Use new room ambience and restrained audience-only percussion. Return only the six official Ref2VA sections in their required order, with consistent labels and explicit retention markers.
El pedido no intenta escribirle al agente el subject_definitions. Le da suficiente procedencia e intención de reutilización para que la skill construya esas definiciones, clasifique el resumen como reference generation más audio reference y explique la preservación o transferencia esperada para cada etiqueta.
Si un recurso debe afectar una sola propiedad, dilo: un clip de movimiento puede guiar la acción de las manos sin controlar además al intérprete, el vestuario, el set, el producto, la cámara o el audio.
Usa un flujo de agente en dos pasadas
Trata la salida de la skill como un borrador estructurado con una pasada de revisión determinista.
- Escribe el manifiesto de origen. Enumera cada instrucción de texto, fotograma, imagen, video y recurso de audio. Declara qué debe y qué no debe controlar cada recurso.
- Fija el modo de tarea. Elige T2VA, I2VA, FL2VA, L2VA o Ref2VA antes de la reescritura.
- Dale al agente las restricciones de entrega. Incluye duración, cantidad de planos, tiempos de los fotogramas de frontera, diálogo, texto visible y si hay música.
- Pide únicamente la estructura oficial. Así es fácil detectar campos faltantes, secciones reordenadas y comentarios fuera del prompt.
- Revisa sin cambiar el brief. Verifica primero estructura, referencias, tiempos, texto hablado y ubicación del audio.
- Corrige una capa a la vez. Pídele al agente que arregle un desajuste específico mientras preserva las secciones aceptadas.
Para la segunda pasada, usa una instrucción acotada:
Review the rewrite against the h3-prompt-writing guide. Keep the creative brief unchanged. Correct only field order, unresolved reference labels, shot timestamps, duration alignment, dialogue preservation, and diegetic versus non-diegetic audio placement. Return the corrected prompt only.
Este prompt de revisión limita la posibilidad de que una corrección de formato se convierta en silencio en una reescritura creativa.
Revisa la salida antes de generar
Usa esta lista de verificación después de cada reescritura del agente:
- Modo: la salida usa la guía correspondiente a la relación real entre las entradas.
- Estructura base: T2VA empieza con
integrated_multimodal_description; I2VA, FL2VA y L2VA colocan encima la instrucción de alineación correcta. - Estructura Ref2VA: los seis campos aparecen una sola vez y en el orden requerido; se usa
detailed_descriptionen lugar deintegrated_multimodal_description. - Etiquetas: cada
<Subject N>,<Picture N>,<Video N>y<Audio N>conserva un único significado en todas las secciones. Ninguna etiqueta sin definir aparece más adelante. - Roles de referencia: los sujetos, los fotogramas concretos, las relaciones de video completo y las señales de audio usan el tipo de etiqueta correcto.
- Retención: cada referencia rastreada tiene un marcador de relación permitido y coherente con el pedido.
- Planos:
[Shot 1]no lleva marca de tiempo. Los tiempos de corte siguientes crecen estrictamente y quedan dentro de la duración pedida. - Fotogramas de frontera: I2VA arranca en el primer fotograma, FL2VA llega al último y L2VA converge en el fotograma final provisto.
- Habla y texto: el diálogo, la letra y el texto visible de la escena conservan su idioma y su redacción originales. La prosa de la reescritura se mantiene en inglés.
- Audio: el diálogo y los eventos diegéticos sincronizados quedan en la descripción principal; el ambiente de todo el clip va en
overall_soundscape; la música que solo escucha el público va ennon_diegetic_music. - Viabilidad: las acciones descritas entran en la duración y el momento final queda resuelto en lugar de cortado sin querer.
- Higiene de salida: el agente no agregó un resumen de trama, un recurso no soportado, un rol contradictorio ni comentarios fuera del prompt pedido.
Del borrador del agente a OmniArt
La skill es más útil como capa de preparación: convierte un manifiesto de recursos y un brief creativo en un prompt que puedes inspeccionar antes de generar. Guarda la salida aceptada junto a sus archivos de origen, porque sus etiquetas solo siguen sirviendo mientras el orden y el significado de los recursos se mantengan estables.
Después lleva el prompt revisado y los recursos correspondientes al espacio de creación de video de OmniArt. Si lo que necesitas es mejorar el brief creativo en sí y no su estructura de campos de H3, vuelve a la guía de prompts de MiniMax H3. La división limpia es simple: usa la guía para decidir qué quieres, usa h3-prompt-writing para expresarlo en el contrato de H3 elegido y usa la lista de verificación para frenar los errores estructurales antes de que lleguen a una corrida de generación.
¿Todo listo para crear?
Empieza a generar contenido increíble con IA