Установіть навичку написання промптів MiniMax H3 для агентів
Установіть навичку написання промптів MiniMax H3, оберіть правильний режим відеозавдання й перетворюйте творчі брифи на точні структури виводу base або Ref2VA для агентів.

Навичка написання промптів MiniMax H3 дає агентові зі ШІ визначений спосіб перетворювати творчий запит на аудіовізуальний промпт, готовий для H3. Замість того щоб просити агента імпровізувати з форматом, ви встановлюєте одну навичку, визначаєте режим генерації й отримуєте поля та мітки референсів, яких цей режим очікує.
Цей туторіал про налаштування та роботу з навичкою, а не про збирання всіх можливих технік промптингу для H3. Він спирається на файли з офіційного репозиторію MiniMax-H3, зокрема на навичку h3-prompt-writing, її посібник для базового режиму та посібник для повних референсів. Ширші поради щодо ролей референсів, правил збереження й виробничих промптів тримайте відкритими окремо — у наявному посібнику з промптів MiniMax H3.
Установіть навичку написання промптів MiniMax H3
Виконайте команду встановлення однієї навички, опубліковану в репозиторії MiniMax, із того проєкту, де ви користуєтеся своїм агентом для коду чи творчих задач:
npx skills add https://github.com/MiniMax-AI/MiniMax-H3 --skill h3-prompt-writing
Перша команда встановлює лише h3-prompt-writing. Наразі репозиторій пакує цю навичку написання промптів разом із вісьмома навичками генерації відео під конкретні стилі, тож вибір навички за назвою тримає це налаштування зосередженим.
Установлена навичка має два довідкові посібники:
references/base-en.txtпокриває T2VA, I2VA, FL2VA та L2VA.references/ref-en.txtпокриває повнореференсний Ref2VA.
Цей поділ важить більше за тему кліпу. Агент має обирати посібник за співвідношенням входів у запиті, а потім зберігати назви полів, порядок секцій, мітки й нотацію тайм-кодів із цього посібника.
Оберіть режим завдання H3, перш ніж просити переписати
Задавайте агентові режим явно щоразу, коли ви його знаєте. Якщо ні — опишіть, які граничні кадри й референсні матеріали у вас є, щоб він міг класифікувати запит.
| Режим | Входи та їхнє співвідношення | Що навичка має побудувати |
|---|---|---|
| T2VA | Лише текст | Повний аудіовізуальний таймлайн, створений із написаного брифу |
| I2VA | Наданий перший кадр | Шлях, що починається рівно з цього кадру й розвивається вперед |
| FL2VA | Надані перший і останній кадри | Безперервний шлях, що з’єднує два граничні кадри |
| L2VA | Наданий останній кадр | Правдоподібний початок, що поступово сходиться до фінального кадру |
| Ref2VA | Референсні зображення чи відео, за потреби з аудіоролями | Повнореференсний аналіз із шести секцій і опис кадрів |
T2VA, I2VA, FL2VA та L2VA — це базові режими навички. Вони поділяють одне тіло з трьох полів. I2VA, FL2VA та L2VA додають над цим тілом точну інструкцію вирівнювання; T2VA починається одразу з першого поля.
Ref2VA — це не той самий шаблон із більшою кількістю вкладень. У нього окремий контракт із шести секцій для визначення референсів, класифікації їхньої ролі, аналізу збереження й опису того, коли кожен референс набуває чинності.
Не обирайте Ref2VA лише тому, що запит докладний. Обирайте його тоді, коли референсний вміст треба визначити й відстежувати наскрізь у виводі.
Знайте точну структуру виводу базового режиму
Для кожного базового режиму тіло використовує ці три назви полів у такому порядку:
integrated_multimodal_description: [Shot 1] ...
overall_soundscape: ...
non_diegetic_music: ...
integrated_multimodal_description несе візуальний стиль, композицію, суб’єктів, середовище, дії, камеру, діалог, спів і синхронізований діегетичний звук уздовж таймлайна. overall_soundscape підсумовує атмосферу, звуки дій і невербальні людські звуки на всьому кліпі. non_diegetic_music описує музику, яку чує глядач, але не чують персонажі; якщо її немає, там N/A.
Рядок вирівнювання змінюється залежно від режиму ключових кадрів. Офіційний посібник задає такі форми:
I2VA
For the target video, at 0.00 seconds into the target video, <Picture 1> (from [Shot 1]) is fully referenced.
FL2VA
How the reference pictures align with the target video — Picture 1 (from Shot 1) aligns with the 0.00-second mark of the target video; Picture 2 (from Shot N) aligns with the S.SS-second mark of the target video.
L2VA
How the reference pictures align with the target video — <Picture 1> (from [Shot N]) aligns with the S.SS-second mark of the target video.
У готовому переписаному промпті N стає фактичним номером останнього кадру, а S.SS — фактичною тривалістю рівно з двома знаками після коми. Цей рядок іде першим, за ним один порожній рядок і тіло з трьох полів. У T2VA рядка вирівнювання немає.
Тайминг кадрів має власну домовленість: [Shot 1] не має тайм-коду, а наступні кадри починаються зі строго зростаючого часу склейки, як-от [Shot 2] At 00:03.500, .... Вивід базового режиму готовий лише тоді, коли обраний режим, рядок вирівнювання, останній кадр і тривалість узгоджені між собою.
Знайте точну структуру виводу Ref2VA
Повнореференсний режим має повертати шість секцій у такому порядку:
subject_definitions:
...
summary:
[reference generation] ...
retention_analysis:
<Subject 1> (appears in [Shot 1]): fully_preserved - ...
detailed_description:
...
overall_soundscape:
...
non_diegetic_music:
...
У кожної мітки своя робота:
<Subject N>називає повторно використовуваний видимий вміст: людину, предмет, сцену, стиль, дію, інтерфейс чи ефект.<Picture N>називає зображення, що править за конкретний цільовий кадр, ключовий кадр, композиційний якір або розкадровку.<Video N>називає вихідне відео, використане для монтажу, продовження чи часової структури всього відео.<Audio N>називає окремий аудіосигнал або увімкнену синхронізовану звукову доріжку, яку копіюють чи беруть за референс.
Ці категорії нумеруються незалежно одна від одної. Візуальний суб’єкт, витягнутий із референсного відео, усе одно позначається <Subject N>; <Video N> представляє сам матеріал або співвідношення з відео цілком. Так само відеофайл зі звуком не створює автоматично запис <Audio N>.
summary починається з одного чи кількох офіційних типів завдання у квадратних дужках: keyframe completion, reference generation, video editing, video continuation, audio reuse або audio reference. Кілька придатних типів з’єднуються знаком +.
Далі retention_analysis дає кожній мітці явне співвідношення. Видимий вміст використовує fully_preserved, partially_preserved, attribute_transfer або weak_reference. Аудіо використовує fully_copy, partially_copy, reference або weak_reference. Маркер має описувати задумане співвідношення, а не правити за загальну оцінку якості.
Нарешті, Ref2VA замінює базове поле integrated_multimodal_description на detailed_description. Для завдань генерації посібник MiniMax зазвичай вимагає тут 350–500 англійських слів — достатньо докладно, щоб задати композицію кожного кадру, суб’єктів, середовище, світло, дії, зміни стану, рух камери, звук і використання референсів. Робота, насичена діалогами, натомість пріоритезує вміщення повного таймлайна реплік, а не механічне досягання цього діапазону.
Попросіть агента про промпт у базовому режимі
Після встановлення викликайте навичку за назвою й давайте компактний виробничий бриф. Вбудована конфігурація агента в цій навичці використовує $h3-prompt-writing у своєму типовому запиті.
Ось готовий до вставляння запит для FL2VA:
Use $h3-prompt-writing to rewrite this request as a MiniMax H3 FL2VA prompt.
Duration: 8.00 seconds.
Picture 1: the supplied first frame, a closed field notebook on a rain-darkened café table.
Picture 2: the supplied last frame, the same notebook open to a pressed violet flower.
Action: one hand enters, opens the notebook, and stops on the flower page.
Camera: one continuous shot with a slow, small push in.
Sound: quiet café room tone, rain against glass, paper and cover movement.
Dialogue: none.
Non-diegetic music: none.
Preserve the table position, notebook identity, hand continuity, lighting direction, and final composition. Return only the final rewrite in the official base-mode structure.
Корисні тут частини — це явний режим, точна тривалість, чітка роль кожного зображення, досяжний шлях переходу, рішення щодо звуку й обмеження на вивід. Агент має повернути спершу рядок вирівнювання FL2VA, використати три спільні поля й посадити Picture 2 на 8.00 секунди.
Для I2VA замініть друге зображення на дії, що розвиваються з першого кадру. Для L2VA опишіть подію, задуману перед наданим фінальним кадром. Для T2VA приберіть посилання на зображення й дайте агентові достатньо інформації, щоб він побудував початкову композицію та аудіовізуальну послідовність із тексту.
Попросіть агента про промпт із повними референсами
Запити Ref2VA працюють краще, коли в кожного матеріалу є заявлена роль. Ось готовий до вставляння запит до агента, що розділяє ідентичність, рух і вказівки щодо звуку:
Use $h3-prompt-writing to rewrite this request as a MiniMax H3 full-reference Ref2VA prompt.
Target: a 10-second, three-shot product demonstration.
Picture 1: preserve the reusable bottle identity, silhouette, cap, label placement, and material finish.
Video 1: reference only the demonstrator's hand action and the three-shot cut rhythm; do not reuse its product, set, or wardrobe.
Audio 1: reference the percussion tempo for edit timing without copying the source signal.
Shot flow:
1. Establish the bottle centered on a stone counter.
2. A hand presses the pump once and the lotion lands on the back of the other hand.
3. End on the bottle and a small lotion smear beside it.
No dialogue or visible text beyond the preserved label. Use new room ambience and restrained audience-only percussion. Return only the six official Ref2VA sections in their required order, with consistent labels and explicit retention markers.
Запит не намагається написати subject_definitions за агента. Він дає достатньо походження й наміру щодо повторного використання, щоб навичка сама побудувала ці визначення, класифікувала summary як reference generation плюс audio reference і пояснила очікуване збереження чи перенесення для кожної мітки.
Якщо матеріал має впливати лише на одну властивість, скажіть це: кліп із рухом може задавати дію рук, не керуючи водночас виконавцем, костюмом, декораціями, продуктом, камерою чи звуком.
Працюйте з агентом у два проходи
Ставтеся до виводу навички як до структурованої чернетки з детермінованим проходом перевірки.
- Складіть маніфест джерел. Перелічіть кожну текстову інструкцію, кадр, зображення, відео й аудіоматеріал. Зазначте, чим кожен матеріал має керувати, а чим ні.
- Зафіксуйте режим завдання. Оберіть T2VA, I2VA, FL2VA, L2VA або Ref2VA до переписування.
- Дайте агентові обмеження здачі. Вкажіть тривалість, кількість кадрів, тайминг граничних кадрів, діалог, видимий текст і чи є музика.
- Просіть лише офіційну структуру. Так легко помітити пропущені поля, переставлені секції й коментарі поза промптом.
- Перевіряйте, не змінюючи брифу. Спершу звірте структуру, референси, тайминг, репліки й розміщення звуку.
- Правте по одному шару за раз. Просіть агента виправити конкретну невідповідність, зберігши прийняті секції.
Для другого проходу використайте цільову інструкцію:
Review the rewrite against the h3-prompt-writing guide. Keep the creative brief unchanged. Correct only field order, unresolved reference labels, shot timestamps, duration alignment, dialogue preservation, and diegetic versus non-diegetic audio placement. Return the corrected prompt only.
Цей перевірковий промпт зменшує ймовірність того, що виправлення формату тихо перетвориться на творче переписування.
Перевірте вивід перед генерацією
Користуйтеся цим контрольним списком після кожного переписування агентом:
- Режим: вивід використовує посібник для фактичного співвідношення входів.
- Базова структура: T2VA починається з
integrated_multimodal_description; I2VA, FL2VA та L2VA ставлять над ним правильну інструкцію вирівнювання. - Структура Ref2VA: усі шість полів з’являються один раз і в потрібному порядку; замість
integrated_multimodal_descriptionвикористаноdetailed_description. - Мітки: кожна
<Subject N>,<Picture N>,<Video N>і<Audio N>зберігає одне значення в усіх секціях. Жодна невизначена мітка не з’являється далі. - Ролі референсів: суб’єкти, конкретні кадри, співвідношення з відео цілком і аудіосигнали позначені правильним типом мітки.
- Збереження: кожен відстежуваний референс має дозволений маркер співвідношення, узгоджений із запитом.
- Кадри:
[Shot 1]не має тайм-коду. Наступні часи склейок строго зростають і лишаються в межах запитаної тривалості. - Граничні кадри: I2VA починається з першого кадру, FL2VA доходить до останнього, а L2VA сходиться на наданому фінальному кадрі.
- Мовлення й текст: діалог, слова пісень і видимий текст у сцені зберігають початкову мову та формулювання. Проза самого переписаного промпта лишається англійською.
- Звук: діалог і синхронізовані діегетичні події лишаються в головному описі; атмосфера на весь кліп належить до
overall_soundscape; музика лише для глядача — доnon_diegetic_music. - Здійсненність: описані дії вміщуються в тривалість, а фінальний момент завершений, а не обрізаний ненавмисно.
- Гігієна виводу: агент не додав переказу сюжету, непідтвердженого матеріалу, суперечливої ролі чи коментарів поза запитаним промптом.
Від чернетки агента до OmniArt
Навичка найкорисніша як шар підготовки: вона перетворює маніфест матеріалів і творчий бриф на промпт, який можна оглянути до генерації. Зберігайте прийнятий вивід разом із вихідними файлами, бо його мітки лишаються корисними лише доти, доки порядок і значення матеріалів незмінні.
Далі несіть перевірений промпт і відповідні матеріали в простір створення відео в OmniArt. Якщо треба покращити сам творчий бриф, а не його структуру полів H3, поверніться до посібника з промптів MiniMax H3. Чистий поділ простий: посібником вирішуйте, чого ви хочете, навичкою h3-prompt-writing виражайте це в обраному контракті H3, а контрольним списком зупиняйте структурні помилки, доки вони не дійшли до запуску генерації.
Готові творити?
Почніть створювати вражаючий контент зі ШІ