tutorialРуководства и инструкции9 мин чтения

Как установить навык промптов MiniMax H3 для агента

Установите навык промптов MiniMax H3, выберите режим видео и преобразуйте творческий бриф в точную структуру базового режима или Ref2VA для агентов.

Команда OmniArt
Как установить навык промптов MiniMax H3 для агента

Навык написания промптов MiniMax H3 даёт ИИ-агенту чёткий способ превратить творческий запрос в готовый для H3 аудиовизуальный промпт. Вместо импровизации с форматом вы устанавливаете навык, определяете режим генерации и получаете поля и метки референсов, предусмотренные этим режимом.

Это руководство посвящено настройке и использованию навыка, а не всем возможным приёмам работы с промптами H3. Оно основано на файлах из официального репозитория MiniMax-H3, включая навык h3-prompt-writing, руководство для базовых режимов и руководство для полных референсов. Более общие рекомендации по ролям референсов, правилам сохранения и производственным промптам собраны отдельно в руководстве по промптам MiniMax H3.

Установить навык написания промптов MiniMax H3

В проекте, где используется ИИ-агент для программирования или творчества, выполните опубликованную MiniMax команду установки одного навыка:

npx skills add https://github.com/MiniMax-AI/MiniMax-H3 --skill h3-prompt-writing

Команда устанавливает только h3-prompt-writing. В репозитории также есть восемь навыков генерации видео для отдельных стилей, поэтому выбор по имени сохраняет фокус на написании промптов.

Установленный навык содержит два справочных руководства:

  • references/base-en.txt описывает T2VA, I2VA, FL2VA и L2VA.
  • references/ref-en.txt описывает Ref2VA с полными референсами.

Это разделение важнее темы ролика. Агент выбирает руководство по взаимосвязи входных данных, а затем сохраняет названия полей, порядок разделов, метки и формат времени.

Выбрать режим H3 до запроса на переписывание

Если режим известен, укажите его агенту прямо. В противном случае опишите доступные граничные кадры и референсы, чтобы агент классифицировал запрос.

РежимВходные данные и взаимосвязьЧто должен построить навык
T2VAТолько текстПолную аудиовизуальную хронологию из брифа
I2VAПредоставлен первый кадрПуть, который начинается с этого кадра и развивается
FL2VAПредоставлены первый и последний кадрыНепрерывный путь между двумя граничными кадрами
L2VAПредоставлен последний кадрПравдоподобное начало со схождением к финальному кадру
Ref2VAРеференсные изображения или видео, аудио опциональноАнализ и описание полных референсов в шести разделах

T2VA, I2VA, FL2VA и L2VA — базовые режимы навыка. У них общий основной блок из трёх полей. I2VA, FL2VA и L2VA добавляют над ним точную инструкцию выравнивания, а T2VA начинается сразу с первого поля.

Ref2VA — не та же схема с большим числом вложений. Для него действует отдельный контракт из шести разделов: определение референсов, классификация ролей, анализ сохранения и описание момента применения каждого референса.

Не выбирайте Ref2VA только из-за подробности запроса. Он нужен, когда референсный контент требуется определить и отслеживать во всей выдаче.

Разобрать точную структуру базовых режимов

Основной блок каждого базового режима использует следующие три поля в таком порядке:

integrated_multimodal_description: [Shot 1] ...

overall_soundscape: ...

non_diegetic_music: ...

integrated_multimodal_description описывает по хронологии визуальный стиль, композицию, героев, окружение, действия, камеру, диалог, пение и синхронный диегетический звук. overall_soundscape подводит итог атмосфере, физическим звукам и невербальным человеческим звукам всего ролика. non_diegetic_music описывает музыку, слышимую зрителям, но не героям; при её отсутствии указывается N/A.

Строка выравнивания зависит от режима ключевых кадров. Официальное руководство задаёт следующие формы:

I2VA
For the target video, at 0.00 seconds into the target video, <Picture 1> (from [Shot 1]) is fully referenced.

FL2VA
How the reference pictures align with the target video — Picture 1 (from Shot 1) aligns with the 0.00-second mark of the target video; Picture 2 (from Shot N) aligns with the S.SS-second mark of the target video.

L2VA
How the reference pictures align with the target video — <Picture 1> (from [Shot N]) aligns with the S.SS-second mark of the target video.

В готовой версии N заменяется фактическим номером последнего плана, а S.SS — эффективной длительностью с двумя знаками после запятой. Строка идёт первой, затем пустая строка и блок из трёх полей. В T2VA строки выравнивания нет.

Для времени планов тоже действует правило: у [Shot 1] нет временной метки, а последующие планы начинаются со строго возрастающего времени склейки внутри длительности, например [Shot 2] At 00:03.500, .... Режим, выравнивание, последний план и длительность должны совпадать.

Разобрать точную структуру Ref2VA

Режим полных референсов должен вернуть шесть разделов в следующем порядке:

subject_definitions:
...

summary:
[reference generation] ...

retention_analysis:
<Subject 1> (appears in [Shot 1]): fully_preserved - ...

detailed_description:
...

overall_soundscape:
...

non_diegetic_music:
...

У каждой метки своя функция:

  • <Subject N> обозначает повторно используемый видимый контент: человека, предмет, сцену, стиль, действие, интерфейс или эффект.
  • <Picture N> обозначает изображение как конкретный целевой или ключевой кадр, опорную композицию либо референс раскадровки.
  • <Video N> обозначает исходное видео для редактирования, продолжения или общей временной структуры.
  • <Audio N> обозначает отдельный аудиосигнал или включённую синхронную дорожку, которую копируют или используют как референс.

Категории нумеруются независимо. Видимый герой, извлечённый из референсного видео, всё равно получает <Subject N>; <Video N> представляет файл или его связь со всем видео. Наличие звука в видео не создаёт автоматически запись <Audio N>.

summary начинается с одного или нескольких официальных типов задач в квадратных скобках: keyframe completion, reference generation, video editing, video continuation, audio reuse или audio reference. Несколько типов соединяются через +.

retention_analysis задаёт каждой метке явную связь. Для видимого контента используются fully_preserved, partially_preserved, attribute_transfer или weak_reference; для аудио — fully_copy, partially_copy, reference или weak_reference. Маркер описывает нужную связь, а не общую оценку качества.

Наконец, Ref2VA заменяет integrated_multimodal_description на detailed_description. Для задач генерации руководство MiniMax обычно требует 350–500 английских слов с подробностями о композиции, героях, окружении, освещении, действиях, изменениях состояния, камере, звуке и референсах каждого плана. При большом числе реплик важнее уместить всю речевую хронологию, чем механически достичь объёма.

Запросить у агента промпт базового режима

После установки вызовите навык по имени и передайте компактный производственный бриф. Встроенная конфигурация агента использует $h3-prompt-writing в стандартном запросе.

Этот запрос FL2VA можно скопировать:

Use $h3-prompt-writing to rewrite this request as a MiniMax H3 FL2VA prompt.

Duration: 8.00 seconds.
Picture 1: the supplied first frame, a closed field notebook on a rain-darkened café table.
Picture 2: the supplied last frame, the same notebook open to a pressed violet flower.
Action: one hand enters, opens the notebook, and stops on the flower page.
Camera: one continuous shot with a slow, small push in.
Sound: quiet café room tone, rain against glass, paper and cover movement.
Dialogue: none.
Non-diegetic music: none.

Preserve the table position, notebook identity, hand continuity, lighting direction, and final composition. Return only the final rewrite in the official base-mode structure.

Полезные элементы — явный режим, точная длительность, понятная роль каждого изображения, выполнимый переход, выбор звука и ограничение выдачи. Агент должен сначала вернуть строку FL2VA, использовать три поля и прийти к Picture 2 на отметке 8.00 секунды.

Для I2VA замените второе изображение действиями, развивающимися из первого кадра. Для L2VA опишите событие перед заданным финальным кадром. Для T2VA удалите изображения и дайте достаточно информации для начальной композиции и аудиовизуальной последовательности.

Запросить у агента промпт с полными референсами

Запросы Ref2VA работают лучше, когда у каждого материала есть заявленная роль. Этот запрос разделяет идентичность, движение и звуковые указания:

Use $h3-prompt-writing to rewrite this request as a MiniMax H3 full-reference Ref2VA prompt.

Target: a 10-second, three-shot product demonstration.
Picture 1: preserve the reusable bottle identity, silhouette, cap, label placement, and material finish.
Video 1: reference only the demonstrator's hand action and the three-shot cut rhythm; do not reuse its product, set, or wardrobe.
Audio 1: reference the percussion tempo for edit timing without copying the source signal.

Shot flow:
1. Establish the bottle centered on a stone counter.
2. A hand presses the pump once and the lotion lands on the back of the other hand.
3. End on the bottle and a small lotion smear beside it.

No dialogue or visible text beyond the preserved label. Use new room ambience and restrained audience-only percussion. Return only the six official Ref2VA sections in their required order, with consistent labels and explicit retention markers.

Запрос не пытается написать subject_definitions за агента. В нём достаточно происхождения и намерения повторного использования, чтобы навык создал определения, классифицировал итог как референсную генерацию плюс аудиореференс и объяснил сохранение или перенос каждой метки. Если материал должен влиять только на одно свойство, укажите это: видео движения может направлять руку, не управляя исполнителем, одеждой, декорацией, продуктом, камерой или звуком.

Использовать двухэтапный процесс агента

Считайте выдачу навыка структурированным черновиком с последующей детерминированной проверкой.

  1. Составьте перечень источников. Перечислите инструкции, кадры, изображения, видео и аудио и укажите, чем каждый материал должен управлять, а чем нет.
  2. Зафиксируйте режим. Выберите T2VA, I2VA, FL2VA, L2VA или Ref2VA до переписывания.
  3. Задайте условия результата. Укажите длительность, число планов, время граничных кадров, диалог, видимый текст и наличие музыки.
  4. Запросите только официальную структуру. Так легче заметить пропавшие поля, неверный порядок и лишние комментарии.
  5. Проверьте без изменения брифа. Сначала изучите структуру, референсы, время, реплики и распределение аудио.
  6. Исправляйте по одному слою. Попросите устранить конкретное расхождение, сохранив принятые разделы.

Для второго этапа используйте инструкцию:

Review the rewrite against the h3-prompt-writing guide. Keep the creative brief unchanged. Correct only field order, unresolved reference labels, shot timestamps, duration alignment, dialogue preservation, and diegetic versus non-diegetic audio placement. Return the corrected prompt only.

Такой проверочный промпт снижает вероятность того, что исправление формата незаметно превратится в творческую переработку.

Проверить выдачу до генерации

После каждого переписывания используйте список:

  • Режим: выбранное руководство соответствует фактической связи входных данных.
  • Базовая структура: T2VA начинается с integrated_multimodal_description; I2VA, FL2VA и L2VA ставят над ним нужную инструкцию.
  • Структура Ref2VA: шесть полей встречаются по одному разу и в правильном порядке; используется detailed_description, а не integrated_multimodal_description.
  • Метки: каждый <Subject N>, <Picture N>, <Video N> и <Audio N> сохраняет одно значение; неопределённых меток далее нет.
  • Роли: герои, конкретные кадры, связи с целым видео и аудиосигналы используют правильный тип.
  • Сохранение: у каждого отслеживаемого референса есть разрешённый и подходящий маркер.
  • Планы: у [Shot 1] нет времени; последующие склейки возрастают и остаются внутри длительности.
  • Граничные кадры: I2VA начинается с первого, FL2VA достигает последнего, L2VA сходится к предоставленному финалу.
  • Речь и текст: диалоги, песни и видимый текст сохраняют язык и формулировки; описание остаётся на английском.
  • Аудио: речь и синхронный диегетический звук остаются в описании, общая атмосфера — в overall_soundscape, музыка только для зрителя — в non_diegetic_music.
  • Выполнимость: действия помещаются в длительность, а финал разрешается без случайного обрыва.
  • Чистота: агент не добавляет пересказ, неподдерживаемый материал, конфликтующие роли или лишние пояснения.

Перейти от черновика агента к OmniArt

Навык полезнее всего как подготовительный слой: он превращает перечень материалов и бриф в промпт, который можно проверить до генерации. Храните принятую выдачу рядом с исходниками, поскольку метки работают только при стабильном порядке и значении материалов.

Затем перенесите проверенный промпт и соответствующие материалы в студию создания видео OmniArt. Если требуется улучшить сам бриф, а не структуру H3, вернитесь к руководству по промптам MiniMax H3. Руководство помогает решить, чего вы хотите, h3-prompt-writing выражает это в выбранном контракте H3, а список останавливает структурные ошибки до генерации.

Готовы создавать?

Начните генерировать впечатляющий контент с ИИ

Начать бесплатно