Como instalar a skill de prompts MiniMax H3 em agentes
Instale a skill de prompts do MiniMax H3, escolha o modo de vídeo certo e transforme briefings em estruturas base ou Ref2VA exatas e reutilizáveis para agentes.

A skill de escrita de prompts do MiniMax H3 oferece a um agente de IA uma forma definida de transformar um pedido criativo em um prompt audiovisual pronto para o H3. Em vez de deixar o agente improvisar o formato, você instala uma skill, identifica o modo de geração e recebe os campos e rótulos de referência exigidos por ele.
Este tutorial ensina a configurar e usar a skill, não reúne todas as técnicas de prompt do H3. Ele segue os arquivos do repositório oficial MiniMax-H3, incluindo a skill h3-prompt-writing, o guia dos modos base e o guia de referência completa. Para orientações mais amplas sobre papéis das referências, regras de preservação e prompts de produção, consulte separadamente o guia de prompts do MiniMax H3.
Instale a skill de escrita de prompts do MiniMax H3
No projeto em que você usa seu agente de programação ou criação com IA, execute o comando para uma única skill publicado pelo repositório da MiniMax:
npx skills add https://github.com/MiniMax-AI/MiniMax-H3 --skill h3-prompt-writing
O comando instala apenas h3-prompt-writing. O repositório também reúne oito skills de geração de vídeo para estilos específicos; escolher pelo nome mantém esta configuração focada na escrita de prompts.
A skill instalada contém dois guias de referência:
references/base-en.txtcobre T2VA, I2VA, FL2VA e L2VA.references/ref-en.txtcobre o Ref2VA de referência completa.
Essa divisão importa mais do que o tema do clipe. O agente deve escolher o guia pela relação entre as entradas do pedido e preservar nomes de campos, ordem das seções, rótulos e notação de tempo.
Escolha o modo de tarefa H3 antes da reescrita
Informe o modo ao agente quando já souber qual é. Caso contrário, descreva os quadros de limite e os materiais de referência disponíveis para que ele classifique o pedido.
| Modo | Entradas e relação | O que a skill deve criar |
|---|---|---|
| T2VA | Somente texto | Uma linha do tempo audiovisual completa a partir do briefing |
| I2VA | Primeiro quadro fornecido | Um percurso que começa nesse quadro e avança |
| FL2VA | Primeiro e último quadros fornecidos | Um percurso contínuo entre os dois limites |
| L2VA | Último quadro fornecido | Uma abertura plausível que converge para o quadro final |
| Ref2VA | Imagens ou vídeos de referência, com áudio opcional | Análise e descrição em seis seções de referência completa |
T2VA, I2VA, FL2VA e L2VA são os modos base da skill. Eles compartilham um corpo de três campos. I2VA, FL2VA e L2VA acrescentam uma instrução exata de alinhamento acima dele; T2VA começa diretamente no primeiro campo.
Ref2VA não é o mesmo template com mais anexos. Ele tem um contrato separado de seis seções para definir referências, classificar seus papéis, analisar a retenção e indicar quando cada uma entra em ação.
Não escolha Ref2VA apenas porque o pedido é detalhado. Use-o quando o conteúdo referenciado precisa ser definido e acompanhado ao longo da saída.
Entenda a estrutura exata dos modos base
Em todos os modos base, o corpo usa estes três nomes de campo, nesta ordem:
integrated_multimodal_description: [Shot 1] ...
overall_soundscape: ...
non_diegetic_music: ...
integrated_multimodal_description leva estilo visual, composição, sujeitos, ambiente, ações, câmera, diálogo, canto e som diegético sincronizado pela linha do tempo. overall_soundscape resume ambiente, sons físicos e sons humanos não verbais do clipe inteiro. non_diegetic_music descreve a música ouvida pelo público, mas não pelos personagens; use N/A quando não houver.
A linha de alinhamento muda conforme o modo de quadro-chave. O guia oficial determina estas formas:
I2VA
For the target video, at 0.00 seconds into the target video, <Picture 1> (from [Shot 1]) is fully referenced.
FL2VA
How the reference pictures align with the target video — Picture 1 (from Shot 1) aligns with the 0.00-second mark of the target video; Picture 2 (from Shot N) aligns with the S.SS-second mark of the target video.
L2VA
How the reference pictures align with the target video — <Picture 1> (from [Shot N]) aligns with the S.SS-second mark of the target video.
Na reescrita final, N vira o número real do último plano e S.SS, a duração efetiva com exatamente duas casas decimais. A linha vem primeiro, seguida por uma linha em branco e o corpo de três campos. T2VA não tem linha de alinhamento.
O tempo dos planos também segue uma convenção: [Shot 1] não tem marca temporal; os seguintes começam com um tempo de corte crescente dentro da duração, como [Shot 2] At 00:03.500, .... Modo, alinhamento, último plano e duração devem concordar.
Entenda a estrutura exata do Ref2VA
O modo de referência completa deve retornar seis seções nesta ordem:
subject_definitions:
...
summary:
[reference generation] ...
retention_analysis:
<Subject 1> (appears in [Shot 1]): fully_preserved - ...
detailed_description:
...
overall_soundscape:
...
non_diegetic_music:
...
Cada rótulo tem uma função diferente:
<Subject N>identifica conteúdo visual reutilizável, como pessoa, objeto, cena, estilo, ação, interface ou efeito.<Picture N>identifica uma imagem usada como quadro-alvo, quadro-chave, âncora de composição ou referência de storyboard.<Video N>identifica um vídeo-fonte usado para edição, continuação ou estrutura temporal do vídeo inteiro.<Audio N>identifica um sinal de áudio independente ou uma faixa sincronizada habilitada, copiada ou referenciada.
As categorias são numeradas separadamente. Um sujeito visual extraído de um vídeo ainda usa <Subject N>; <Video N> representa o arquivo ou sua relação com o vídeo inteiro. Um vídeo conter som também não cria automaticamente uma entrada <Audio N>.
summary começa com um ou mais tipos oficiais entre colchetes: keyframe completion, reference generation, video editing, video continuation, audio reuse ou audio reference. Tipos simultâneos são ligados por +.
retention_analysis atribui uma relação explícita a cada rótulo. O visual usa fully_preserved, partially_preserved, attribute_transfer ou weak_reference; o áudio usa fully_copy, partially_copy, reference ou weak_reference. O marcador descreve a relação desejada, não uma nota genérica de qualidade.
Por fim, Ref2VA troca integrated_multimodal_description por detailed_description. Para tarefas de geração, o guia da MiniMax normalmente pede 350–500 palavras em inglês, detalhando composição, sujeitos, ambiente, luz, ações, mudanças de estado, câmera, som e referências em cada plano. Conteúdo com muito diálogo prioriza a fala completa em vez de atingir mecanicamente essa faixa.
Peça um prompt de modo base ao agente
Depois da instalação, chame a skill pelo nome e forneça um briefing curto. A configuração incluída usa $h3-prompt-writing no pedido padrão.
Este pedido FL2VA pode ser copiado:
Use $h3-prompt-writing to rewrite this request as a MiniMax H3 FL2VA prompt.
Duration: 8.00 seconds.
Picture 1: the supplied first frame, a closed field notebook on a rain-darkened café table.
Picture 2: the supplied last frame, the same notebook open to a pressed violet flower.
Action: one hand enters, opens the notebook, and stops on the flower page.
Camera: one continuous shot with a slow, small push in.
Sound: quiet café room tone, rain against glass, paper and cover movement.
Dialogue: none.
Non-diegetic music: none.
Preserve the table position, notebook identity, hand continuity, lighting direction, and final composition. Return only the final rewrite in the official base-mode structure.
Os elementos úteis são modo explícito, duração exata, papel claro de cada imagem, transição viável, decisões de som e limite da saída. O agente deve devolver primeiro a linha FL2VA, usar os três campos e chegar a Picture 2 em 8.00 segundos.
Para I2VA, substitua a segunda imagem pelas ações que avançam a partir do primeiro quadro. Para L2VA, descreva o evento anterior ao quadro final. Para T2VA, retire as imagens e dê informações suficientes para o agente criar a composição inicial e a sequência audiovisual.
Peça um prompt de referência completa ao agente
Pedidos Ref2VA funcionam melhor quando cada material tem uma função. Este pedido copiável separa identidade, movimento e orientação de áudio:
Use $h3-prompt-writing to rewrite this request as a MiniMax H3 full-reference Ref2VA prompt.
Target: a 10-second, three-shot product demonstration.
Picture 1: preserve the reusable bottle identity, silhouette, cap, label placement, and material finish.
Video 1: reference only the demonstrator's hand action and the three-shot cut rhythm; do not reuse its product, set, or wardrobe.
Audio 1: reference the percussion tempo for edit timing without copying the source signal.
Shot flow:
1. Establish the bottle centered on a stone counter.
2. A hand presses the pump once and the lotion lands on the back of the other hand.
3. End on the bottle and a small lotion smear beside it.
No dialogue or visible text beyond the preserved label. Use new room ambience and restrained audience-only percussion. Return only the six official Ref2VA sections in their required order, with consistent labels and explicit retention markers.
O pedido não tenta escrever subject_definitions pelo agente. Ele fornece origem e intenção de reutilização suficientes para a skill criar as definições, classificar o resumo como geração por referência mais referência de áudio e explicar a preservação ou transferência de cada rótulo.
Se um material deve afetar só uma propriedade, diga isso: um vídeo de movimento pode orientar a mão sem controlar pessoa, roupa, cenário, produto, câmera ou áudio.
Use um fluxo de agente em duas etapas
Trate a saída como um rascunho estruturado seguido por uma revisão objetiva.
- Escreva o inventário das fontes. Liste instruções, quadros, imagens, vídeos e áudios e diga o que cada material deve ou não controlar.
- Fixe o modo. Escolha T2VA, I2VA, FL2VA, L2VA ou Ref2VA antes da reescrita.
- Informe as restrições. Inclua duração, número de planos, tempo dos quadros de limite, diálogo, texto visível e música.
- Peça somente a estrutura oficial. Assim, campos ausentes, seções fora de ordem e comentários extras ficam visíveis.
- Revise sem mudar o briefing. Verifique primeiro estrutura, referências, tempo, fala e posição do áudio.
- Revise uma camada por vez. Peça a correção de uma diferença específica preservando as seções aprovadas.
Na segunda etapa, use esta instrução:
Review the rewrite against the h3-prompt-writing guide. Keep the creative brief unchanged. Correct only field order, unresolved reference labels, shot timestamps, duration alignment, dialogue preservation, and diegetic versus non-diegetic audio placement. Return the corrected prompt only.
Esse prompt de revisão reduz o risco de uma correção de formato virar uma mudança criativa silenciosa.
Revise a saída antes da geração
Use esta lista depois de cada reescrita:
- Modo: a saída usa o guia correspondente à relação real das entradas.
- Estrutura base: T2VA começa com
integrated_multimodal_description; I2VA, FL2VA e L2VA colocam a instrução certa acima. - Estrutura Ref2VA: os seis campos aparecem uma vez e na ordem exigida; usa
detailed_description, nãointegrated_multimodal_description. - Rótulos: cada
<Subject N>,<Picture N>,<Video N>e<Audio N>mantém um significado, sem rótulos indefinidos depois. - Papéis: sujeitos, quadros concretos, relações de vídeo inteiro e sinais de áudio usam o tipo correto.
- Retenção: toda referência acompanhada tem um marcador permitido e coerente.
- Planos:
[Shot 1]não tem marca temporal; os cortes posteriores aumentam e ficam dentro da duração. - Quadros de limite: I2VA parte do primeiro, FL2VA alcança o último e L2VA converge para o final fornecido.
- Fala e texto: diálogos, letras e texto visível preservam idioma e palavras; a descrição reescrita fica em inglês.
- Áudio: fala e sons diegéticos sincronizados ficam na descrição; ambiente geral em
overall_soundscape; trilha só para o público emnon_diegetic_music. - Viabilidade: as ações cabem na duração e o fim se resolve sem corte involuntário.
- Higiene: o agente não adicionou resumo de enredo, material incompatível, papel conflitante nem comentário extra.
Leve o rascunho do agente para o OmniArt
A skill funciona melhor como preparação: converte inventário e briefing em um prompt que você pode revisar antes de gerar. Guarde a saída aprovada com os arquivos-fonte, pois os rótulos só continuam úteis se a ordem e o significado dos materiais permanecerem estáveis.
Depois, leve o prompt revisado e os materiais correspondentes ao estúdio de criação de vídeo do OmniArt. Para melhorar o briefing, e não a estrutura H3, volte ao guia de prompts do MiniMax H3. Use o guia para decidir o que deseja, h3-prompt-writing para expressar isso no contrato H3 escolhido e a lista para impedir erros estruturais antes da geração.
Pronto para criar?
Comece a gerar conteúdo incrível com IA