Как установить навык промптов MiniMax H3 для агента
Установите навык промптов MiniMax H3, выберите режим видео и преобразуйте творческий бриф в точную структуру базового режима или Ref2VA для агентов.

Навык написания промптов MiniMax H3 даёт ИИ-агенту чёткий способ превратить творческий запрос в готовый для H3 аудиовизуальный промпт. Вместо импровизации с форматом вы устанавливаете навык, определяете режим генерации и получаете поля и метки референсов, предусмотренные этим режимом.
Это руководство посвящено настройке и использованию навыка, а не всем возможным приёмам работы с промптами H3. Оно основано на файлах из официального репозитория MiniMax-H3, включая навык h3-prompt-writing, руководство для базовых режимов и руководство для полных референсов. Более общие рекомендации по ролям референсов, правилам сохранения и производственным промптам собраны отдельно в руководстве по промптам MiniMax H3.
Установить навык написания промптов MiniMax H3
В проекте, где используется ИИ-агент для программирования или творчества, выполните опубликованную MiniMax команду установки одного навыка:
npx skills add https://github.com/MiniMax-AI/MiniMax-H3 --skill h3-prompt-writing
Команда устанавливает только h3-prompt-writing. В репозитории также есть восемь навыков генерации видео для отдельных стилей, поэтому выбор по имени сохраняет фокус на написании промптов.
Установленный навык содержит два справочных руководства:
references/base-en.txtописывает T2VA, I2VA, FL2VA и L2VA.references/ref-en.txtописывает Ref2VA с полными референсами.
Это разделение важнее темы ролика. Агент выбирает руководство по взаимосвязи входных данных, а затем сохраняет названия полей, порядок разделов, метки и формат времени.
Выбрать режим H3 до запроса на переписывание
Если режим известен, укажите его агенту прямо. В противном случае опишите доступные граничные кадры и референсы, чтобы агент классифицировал запрос.
| Режим | Входные данные и взаимосвязь | Что должен построить навык |
|---|---|---|
| T2VA | Только текст | Полную аудиовизуальную хронологию из брифа |
| I2VA | Предоставлен первый кадр | Путь, который начинается с этого кадра и развивается |
| FL2VA | Предоставлены первый и последний кадры | Непрерывный путь между двумя граничными кадрами |
| L2VA | Предоставлен последний кадр | Правдоподобное начало со схождением к финальному кадру |
| Ref2VA | Референсные изображения или видео, аудио опционально | Анализ и описание полных референсов в шести разделах |
T2VA, I2VA, FL2VA и L2VA — базовые режимы навыка. У них общий основной блок из трёх полей. I2VA, FL2VA и L2VA добавляют над ним точную инструкцию выравнивания, а T2VA начинается сразу с первого поля.
Ref2VA — не та же схема с большим числом вложений. Для него действует отдельный контракт из шести разделов: определение референсов, классификация ролей, анализ сохранения и описание момента применения каждого референса.
Не выбирайте Ref2VA только из-за подробности запроса. Он нужен, когда референсный контент требуется определить и отслеживать во всей выдаче.
Разобрать точную структуру базовых режимов
Основной блок каждого базового режима использует следующие три поля в таком порядке:
integrated_multimodal_description: [Shot 1] ...
overall_soundscape: ...
non_diegetic_music: ...
integrated_multimodal_description описывает по хронологии визуальный стиль, композицию, героев, окружение, действия, камеру, диалог, пение и синхронный диегетический звук. overall_soundscape подводит итог атмосфере, физическим звукам и невербальным человеческим звукам всего ролика. non_diegetic_music описывает музыку, слышимую зрителям, но не героям; при её отсутствии указывается N/A.
Строка выравнивания зависит от режима ключевых кадров. Официальное руководство задаёт следующие формы:
I2VA
For the target video, at 0.00 seconds into the target video, <Picture 1> (from [Shot 1]) is fully referenced.
FL2VA
How the reference pictures align with the target video — Picture 1 (from Shot 1) aligns with the 0.00-second mark of the target video; Picture 2 (from Shot N) aligns with the S.SS-second mark of the target video.
L2VA
How the reference pictures align with the target video — <Picture 1> (from [Shot N]) aligns with the S.SS-second mark of the target video.
В готовой версии N заменяется фактическим номером последнего плана, а S.SS — эффективной длительностью с двумя знаками после запятой. Строка идёт первой, затем пустая строка и блок из трёх полей. В T2VA строки выравнивания нет.
Для времени планов тоже действует правило: у [Shot 1] нет временной метки, а последующие планы начинаются со строго возрастающего времени склейки внутри длительности, например [Shot 2] At 00:03.500, .... Режим, выравнивание, последний план и длительность должны совпадать.
Разобрать точную структуру Ref2VA
Режим полных референсов должен вернуть шесть разделов в следующем порядке:
subject_definitions:
...
summary:
[reference generation] ...
retention_analysis:
<Subject 1> (appears in [Shot 1]): fully_preserved - ...
detailed_description:
...
overall_soundscape:
...
non_diegetic_music:
...
У каждой метки своя функция:
<Subject N>обозначает повторно используемый видимый контент: человека, предмет, сцену, стиль, действие, интерфейс или эффект.<Picture N>обозначает изображение как конкретный целевой или ключевой кадр, опорную композицию либо референс раскадровки.<Video N>обозначает исходное видео для редактирования, продолжения или общей временной структуры.<Audio N>обозначает отдельный аудиосигнал или включённую синхронную дорожку, которую копируют или используют как референс.
Категории нумеруются независимо. Видимый герой, извлечённый из референсного видео, всё равно получает <Subject N>; <Video N> представляет файл или его связь со всем видео. Наличие звука в видео не создаёт автоматически запись <Audio N>.
summary начинается с одного или нескольких официальных типов задач в квадратных скобках: keyframe completion, reference generation, video editing, video continuation, audio reuse или audio reference. Несколько типов соединяются через +.
retention_analysis задаёт каждой метке явную связь. Для видимого контента используются fully_preserved, partially_preserved, attribute_transfer или weak_reference; для аудио — fully_copy, partially_copy, reference или weak_reference. Маркер описывает нужную связь, а не общую оценку качества.
Наконец, Ref2VA заменяет integrated_multimodal_description на detailed_description. Для задач генерации руководство MiniMax обычно требует 350–500 английских слов с подробностями о композиции, героях, окружении, освещении, действиях, изменениях состояния, камере, звуке и референсах каждого плана. При большом числе реплик важнее уместить всю речевую хронологию, чем механически достичь объёма.
Запросить у агента промпт базового режима
После установки вызовите навык по имени и передайте компактный производственный бриф. Встроенная конфигурация агента использует $h3-prompt-writing в стандартном запросе.
Этот запрос FL2VA можно скопировать:
Use $h3-prompt-writing to rewrite this request as a MiniMax H3 FL2VA prompt.
Duration: 8.00 seconds.
Picture 1: the supplied first frame, a closed field notebook on a rain-darkened café table.
Picture 2: the supplied last frame, the same notebook open to a pressed violet flower.
Action: one hand enters, opens the notebook, and stops on the flower page.
Camera: one continuous shot with a slow, small push in.
Sound: quiet café room tone, rain against glass, paper and cover movement.
Dialogue: none.
Non-diegetic music: none.
Preserve the table position, notebook identity, hand continuity, lighting direction, and final composition. Return only the final rewrite in the official base-mode structure.
Полезные элементы — явный режим, точная длительность, понятная роль каждого изображения, выполнимый переход, выбор звука и ограничение выдачи. Агент должен сначала вернуть строку FL2VA, использовать три поля и прийти к Picture 2 на отметке 8.00 секунды.
Для I2VA замените второе изображение действиями, развивающимися из первого кадра. Для L2VA опишите событие перед заданным финальным кадром. Для T2VA удалите изображения и дайте достаточно информации для начальной композиции и аудиовизуальной последовательности.
Запросить у агента промпт с полными референсами
Запросы Ref2VA работают лучше, когда у каждого материала есть заявленная роль. Этот запрос разделяет идентичность, движение и звуковые указания:
Use $h3-prompt-writing to rewrite this request as a MiniMax H3 full-reference Ref2VA prompt.
Target: a 10-second, three-shot product demonstration.
Picture 1: preserve the reusable bottle identity, silhouette, cap, label placement, and material finish.
Video 1: reference only the demonstrator's hand action and the three-shot cut rhythm; do not reuse its product, set, or wardrobe.
Audio 1: reference the percussion tempo for edit timing without copying the source signal.
Shot flow:
1. Establish the bottle centered on a stone counter.
2. A hand presses the pump once and the lotion lands on the back of the other hand.
3. End on the bottle and a small lotion smear beside it.
No dialogue or visible text beyond the preserved label. Use new room ambience and restrained audience-only percussion. Return only the six official Ref2VA sections in their required order, with consistent labels and explicit retention markers.
Запрос не пытается написать subject_definitions за агента. В нём достаточно происхождения и намерения повторного использования, чтобы навык создал определения, классифицировал итог как референсную генерацию плюс аудиореференс и объяснил сохранение или перенос каждой метки.
Если материал должен влиять только на одно свойство, укажите это: видео движения может направлять руку, не управляя исполнителем, одеждой, декорацией, продуктом, камерой или звуком.
Использовать двухэтапный процесс агента
Считайте выдачу навыка структурированным черновиком с последующей детерминированной проверкой.
- Составьте перечень источников. Перечислите инструкции, кадры, изображения, видео и аудио и укажите, чем каждый материал должен управлять, а чем нет.
- Зафиксируйте режим. Выберите T2VA, I2VA, FL2VA, L2VA или Ref2VA до переписывания.
- Задайте условия результата. Укажите длительность, число планов, время граничных кадров, диалог, видимый текст и наличие музыки.
- Запросите только официальную структуру. Так легче заметить пропавшие поля, неверный порядок и лишние комментарии.
- Проверьте без изменения брифа. Сначала изучите структуру, референсы, время, реплики и распределение аудио.
- Исправляйте по одному слою. Попросите устранить конкретное расхождение, сохранив принятые разделы.
Для второго этапа используйте инструкцию:
Review the rewrite against the h3-prompt-writing guide. Keep the creative brief unchanged. Correct only field order, unresolved reference labels, shot timestamps, duration alignment, dialogue preservation, and diegetic versus non-diegetic audio placement. Return the corrected prompt only.
Такой проверочный промпт снижает вероятность того, что исправление формата незаметно превратится в творческую переработку.
Проверить выдачу до генерации
После каждого переписывания используйте список:
- Режим: выбранное руководство соответствует фактической связи входных данных.
- Базовая структура: T2VA начинается с
integrated_multimodal_description; I2VA, FL2VA и L2VA ставят над ним нужную инструкцию. - Структура Ref2VA: шесть полей встречаются по одному разу и в правильном порядке; используется
detailed_description, а неintegrated_multimodal_description. - Метки: каждый
<Subject N>,<Picture N>,<Video N>и<Audio N>сохраняет одно значение; неопределённых меток далее нет. - Роли: герои, конкретные кадры, связи с целым видео и аудиосигналы используют правильный тип.
- Сохранение: у каждого отслеживаемого референса есть разрешённый и подходящий маркер.
- Планы: у
[Shot 1]нет времени; последующие склейки возрастают и остаются внутри длительности. - Граничные кадры: I2VA начинается с первого, FL2VA достигает последнего, L2VA сходится к предоставленному финалу.
- Речь и текст: диалоги, песни и видимый текст сохраняют язык и формулировки; описание остаётся на английском.
- Аудио: речь и синхронный диегетический звук остаются в описании, общая атмосфера — в
overall_soundscape, музыка только для зрителя — вnon_diegetic_music. - Выполнимость: действия помещаются в длительность, а финал разрешается без случайного обрыва.
- Чистота: агент не добавляет пересказ, неподдерживаемый материал, конфликтующие роли или лишние пояснения.
Перейти от черновика агента к OmniArt
Навык полезнее всего как подготовительный слой: он превращает перечень материалов и бриф в промпт, который можно проверить до генерации. Храните принятую выдачу рядом с исходниками, поскольку метки работают только при стабильном порядке и значении материалов.
Затем перенесите проверенный промпт и соответствующие материалы в студию создания видео OmniArt. Если требуется улучшить сам бриф, а не структуру H3, вернитесь к руководству по промптам MiniMax H3. Руководство помогает решить, чего вы хотите, h3-prompt-writing выражает это в выбранном контракте H3, а список останавливает структурные ошибки до генерации.
Готовы создавать?
Начните генерировать впечатляющий контент с ИИ