에이전트용 MiniMax H3 프롬프트 작성 스킬 설치법
MiniMax H3 프롬프트 작성 스킬을 설치하고 영상 작업 모드를 선택해 창작 브리프를 정확한 기본 또는 Ref2VA 출력 구조로 바꾸는 방법을 알아봅니다.

MiniMax H3 프롬프트 작성 스킬은 AI 에이전트가 창작 요청을 H3용 시청각 프롬프트로 바꾸는 정해진 방식을 제공합니다. 에이전트가 형식을 즉석에서 정하게 두는 대신 스킬을 설치하고 생성 모드를 식별하면 해당 모드에 필요한 필드와 참조 라벨을 받을 수 있습니다.
이 튜토리얼은 H3 프롬프트 기법 전반이 아니라 스킬 설정과 사용에 집중합니다. MiniMax 공식 MiniMax-H3 저장소의 파일을 기준으로 하며, h3-prompt-writing 스킬, 기본 모드 가이드, 전체 참조 가이드를 다룹니다. 참조 역할, 보존 규칙, 제작 프롬프트에 관한 폭넓은 내용은 기존 MiniMax H3 프롬프트 가이드를 함께 확인하세요.
MiniMax H3 프롬프트 작성 스킬 설치하기
AI 코딩 또는 창작 에이전트를 사용하는 프로젝트에서 MiniMax 저장소가 공개한 단일 스킬 설치 명령을 실행합니다.
npx skills add https://github.com/MiniMax-AI/MiniMax-H3 --skill h3-prompt-writing
이 명령은 h3-prompt-writing만 설치합니다. 저장소에는 이 스킬과 함께 특정 스타일용 영상 생성 스킬 8개가 있으므로 이름으로 선택하면 설정 범위를 프롬프트 작성에 한정할 수 있습니다.
설치된 스킬에는 두 개의 참조 가이드가 있습니다.
references/base-en.txt는 T2VA, I2VA, FL2VA, L2VA를 다룹니다.references/ref-en.txt는 전체 참조 Ref2VA를 다룹니다.
이 구분은 영상 주제보다 중요합니다. 에이전트는 요청의 입력 관계에 따라 가이드를 고른 뒤 해당 가이드의 필드명, 섹션 순서, 라벨, 시간 표기를 그대로 지켜야 합니다.
재작성 전에 H3 작업 모드 선택하기
모드를 알고 있다면 에이전트에게 명시하세요. 모른다면 어떤 경계 프레임과 참조 자료가 있는지 설명해 요청을 분류할 수 있게 합니다.
| 모드 | 입력과 관계 | 스킬이 구성해야 할 결과 |
|---|---|---|
| T2VA | 텍스트만 | 브리프로 만든 전체 시청각 타임라인 |
| I2VA | 첫 프레임 제공 | 해당 프레임에서 시작해 전개되는 경로 |
| FL2VA | 첫 프레임과 마지막 프레임 제공 | 두 경계 프레임을 잇는 연속 경로 |
| L2VA | 마지막 프레임 제공 | 자연스러운 시작에서 마지막 프레임으로 수렴하는 경로 |
| Ref2VA | 참조 이미지나 영상, 선택적인 오디오 역할 | 6개 섹션의 전체 참조 분석과 샷 설명 |
T2VA, I2VA, FL2VA, L2VA는 스킬의 기본 모드입니다. 세 필드로 된 본문을 공유하며 I2VA, FL2VA, L2VA는 그 위에 정확한 정렬 지시문을 추가합니다. T2VA는 첫 번째 필드에서 바로 시작합니다.
Ref2VA는 첨부 파일만 늘어난 같은 템플릿이 아닙니다. 참조를 정의하고 역할과 보존 관계를 분류하며 각 참조가 적용되는 시점을 설명하는 별도의 6개 섹션 규약을 사용합니다.
요청이 자세하다는 이유만으로 Ref2VA를 선택하지 마세요. 출력에서 참조 콘텐츠를 정의하고 계속 추적해야 할 때 선택합니다.
정확한 기본 모드 출력 구조 알아보기
모든 기본 모드 본문은 다음 세 필드명을 이 순서대로 사용합니다.
integrated_multimodal_description: [Shot 1] ...
overall_soundscape: ...
non_diegetic_music: ...
integrated_multimodal_description에는 타임라인을 따라 시각 스타일, 구도, 피사체, 환경, 동작, 카메라, 대사, 노래, 동기화된 극중 음향을 적습니다. overall_soundscape는 영상 전체의 주변음, 동작음, 비언어적 사람 소리를 요약합니다. non_diegetic_music은 인물에게는 들리지 않고 관객에게만 들리는 음악이며, 없으면 N/A입니다.
키프레임 모드에 따라 정렬 행이 달라집니다. 공식 가이드는 다음 형식을 지정합니다.
I2VA
For the target video, at 0.00 seconds into the target video, <Picture 1> (from [Shot 1]) is fully referenced.
FL2VA
How the reference pictures align with the target video — Picture 1 (from Shot 1) aligns with the 0.00-second mark of the target video; Picture 2 (from Shot N) aligns with the S.SS-second mark of the target video.
L2VA
How the reference pictures align with the target video — <Picture 1> (from [Shot N]) aligns with the S.SS-second mark of the target video.
완성된 재작성에서는 N을 실제 마지막 샷 번호로, S.SS를 소수점 둘째 자리까지 표시한 유효 영상 길이로 바꿉니다. 이 행을 맨 앞에 두고 빈 줄 하나 뒤에 세 필드 본문을 씁니다. T2VA에는 정렬 행이 없습니다.
샷 시간에도 규칙이 있습니다. [Shot 1]에는 타임스탬프가 없고 이후 샷은 [Shot 2] At 00:03.500, ...처럼 영상 길이 안에서 엄격히 증가하는 컷 시간으로 시작합니다. 선택한 모드, 정렬 행, 마지막 샷, 영상 길이가 일치해야 기본 모드 출력을 사용할 수 있습니다.
정확한 Ref2VA 출력 구조 알아보기
전체 참조 모드는 다음 순서로 6개 섹션을 반환해야 합니다.
subject_definitions:
...
summary:
[reference generation] ...
retention_analysis:
<Subject 1> (appears in [Shot 1]): fully_preserved - ...
detailed_description:
...
overall_soundscape:
...
non_diegetic_music:
...
라벨마다 역할이 다릅니다.
<Subject N>은 사람, 사물, 장면, 스타일, 동작, 인터페이스, 효과처럼 재사용 가능한 시각 콘텐츠를 뜻합니다.<Picture N>은 구체적인 목표 프레임, 키프레임, 구도 기준 또는 스토리보드 참조로 쓰이는 이미지입니다.<Video N>은 편집, 이어 만들기 또는 영상 전체 시간 구조에 쓰이는 원본 영상입니다.<Audio N>은 복사하거나 참조하는 독립 오디오 신호 또는 활성화된 동기화 음원입니다.
각 범주는 별도로 번호를 매깁니다. 참조 영상에서 가져온 시각 피사체도 <Subject N>을 쓰며 <Video N>은 파일이나 영상 전체와의 관계를 나타냅니다. 영상 파일에 소리가 있다고 해서 자동으로 <Audio N> 항목이 생기지는 않습니다.
summary는 대괄호 안의 공식 작업 유형으로 시작합니다. 유형은 keyframe completion, reference generation, video editing, video continuation, audio reuse, audio reference이며 여러 유형이 적용되면 +로 연결합니다.
retention_analysis는 각 라벨에 명확한 관계를 부여합니다. 시각 콘텐츠는 fully_preserved, partially_preserved, attribute_transfer, weak_reference를 사용하고 오디오는 fully_copy, partially_copy, reference, weak_reference를 사용합니다. 이 표시는 일반적인 품질 점수가 아니라 의도한 관계를 설명합니다.
Ref2VA는 기본 필드 integrated_multimodal_description을 detailed_description으로 바꿉니다. MiniMax 가이드는 생성 작업에서 보통 350~500개의 영어 단어로 각 샷의 구도, 피사체, 환경, 조명, 동작, 상태 변화, 카메라 움직임, 음향, 참조 사용을 구체적으로 설명하도록 합니다. 대사가 많은 콘텐츠는 단어 수를 억지로 맞추기보다 전체 발화 타임라인을 담는 것이 우선입니다.
에이전트에게 기본 모드 프롬프트 요청하기
설치 후 스킬 이름을 불러 간결한 제작 브리프를 제공합니다. 번들 에이전트 설정의 기본 요청에는 $h3-prompt-writing이 사용됩니다.
다음 FL2VA 요청을 그대로 붙여 넣을 수 있습니다.
Use $h3-prompt-writing to rewrite this request as a MiniMax H3 FL2VA prompt.
Duration: 8.00 seconds.
Picture 1: the supplied first frame, a closed field notebook on a rain-darkened café table.
Picture 2: the supplied last frame, the same notebook open to a pressed violet flower.
Action: one hand enters, opens the notebook, and stops on the flower page.
Camera: one continuous shot with a slow, small push in.
Sound: quiet café room tone, rain against glass, paper and cover movement.
Dialogue: none.
Non-diegetic music: none.
Preserve the table position, notebook identity, hand continuity, lighting direction, and final composition. Return only the final rewrite in the official base-mode structure.
명시적인 모드와 정확한 영상 길이, 각 이미지의 역할, 실행 가능한 전환 경로, 음향 결정, 출력 제한이 핵심입니다. 에이전트는 FL2VA 정렬 행을 먼저 반환하고 세 공통 필드를 사용해 8.00초에 Picture 2에 도달해야 합니다.
I2VA에서는 두 번째 이미지를 첫 프레임에서 이어지는 동작으로 바꿉니다. L2VA에서는 주어진 마지막 프레임 이전에 일어날 사건을 설명합니다. T2VA에서는 이미지 참조를 빼고 에이전트가 텍스트로 시작 구도와 시청각 시퀀스를 만들 만큼 충분한 정보를 제공합니다.
에이전트에게 전체 참조 프롬프트 요청하기
각 자료에 역할을 정해 주면 Ref2VA 요청이 더 명확해집니다. 다음 요청은 정체성, 움직임, 오디오 지침을 분리합니다.
Use $h3-prompt-writing to rewrite this request as a MiniMax H3 full-reference Ref2VA prompt.
Target: a 10-second, three-shot product demonstration.
Picture 1: preserve the reusable bottle identity, silhouette, cap, label placement, and material finish.
Video 1: reference only the demonstrator's hand action and the three-shot cut rhythm; do not reuse its product, set, or wardrobe.
Audio 1: reference the percussion tempo for edit timing without copying the source signal.
Shot flow:
1. Establish the bottle centered on a stone counter.
2. A hand presses the pump once and the lotion lands on the back of the other hand.
3. End on the bottle and a small lotion smear beside it.
No dialogue or visible text beyond the preserved label. Use new room ambience and restrained audience-only percussion. Return only the six official Ref2VA sections in their required order, with consistent labels and explicit retention markers.
이 요청은 에이전트 대신 subject_definitions를 작성하지 않습니다. 스킬이 정의를 구성하고 요약을 참조 생성과 오디오 참조로 분류하며 각 라벨의 보존 또는 전이 관계를 설명할 만큼 출처와 재사용 의도를 제공합니다.
자료가 한 속성에만 영향을 줘야 한다면 그렇게 명시하세요. 움직임 영상은 출연자, 의상, 세트, 제품, 카메라, 오디오를 제어하지 않고 손동작만 안내할 수 있습니다.
2단계 에이전트 워크플로 사용하기
스킬 출력을 구조화된 초안으로 보고 정해진 검토 단계를 거칩니다.
- 원본 목록 작성. 모든 텍스트 지시문, 프레임, 이미지, 영상, 오디오 자료를 나열하고 각각이 제어해야 할 것과 제어하지 말아야 할 것을 적습니다.
- 작업 모드 고정. 재작성 전에 T2VA, I2VA, FL2VA, L2VA, Ref2VA 중 하나를 선택합니다.
- 납품 제약 전달. 영상 길이, 샷 수, 경계 프레임 시간, 대사, 화면 텍스트, 음악 유무를 포함합니다.
- 공식 구조만 요청. 누락된 필드, 바뀐 섹션 순서, 프롬프트 밖의 설명을 쉽게 찾을 수 있습니다.
- 브리프를 바꾸지 않고 검토. 구조, 참조, 시간, 발화 텍스트, 오디오 배치를 먼저 확인합니다.
- 한 번에 한 계층만 수정. 승인된 섹션은 유지하면서 특정 불일치만 고치도록 요청합니다.
두 번째 단계에는 다음 지시문을 사용합니다.
Review the rewrite against the h3-prompt-writing guide. Keep the creative brief unchanged. Correct only field order, unresolved reference labels, shot timestamps, duration alignment, dialogue preservation, and diegetic versus non-diegetic audio placement. Return the corrected prompt only.
이 검토 프롬프트는 형식 수정이 몰래 창작 내용 변경으로 이어질 가능성을 줄입니다.
생성 전에 출력 검토하기
에이전트가 재작성할 때마다 다음 항목을 확인합니다.
- 모드: 실제 입력 관계에 맞는 가이드를 사용합니다.
- 기본 구조: T2VA는
integrated_multimodal_description으로 시작하고 I2VA, FL2VA, L2VA는 그 위에 올바른 정렬 지시문을 둡니다. - Ref2VA 구조: 6개 필드가 한 번씩 올바른 순서로 나타나며
integrated_multimodal_description대신detailed_description을 사용합니다. - 라벨: 모든
<Subject N>,<Picture N>,<Video N>,<Audio N>은 전체 섹션에서 같은 의미를 유지하며 정의되지 않은 라벨이 뒤에 나오지 않습니다. - 참조 역할: 피사체, 구체적 프레임, 영상 전체 관계, 오디오 신호에 올바른 라벨 유형을 사용합니다.
- 보존: 추적하는 모든 참조에 요청과 일치하는 허용 관계 표시가 있습니다.
- 샷:
[Shot 1]에는 타임스탬프가 없고 이후 컷 시간은 영상 길이 안에서 엄격히 증가합니다. - 경계 프레임: I2VA는 첫 프레임에서 시작하고 FL2VA는 마지막 프레임에 도달하며 L2VA는 주어진 마지막 프레임으로 수렴합니다.
- 발화와 텍스트: 대사, 가사, 화면 텍스트는 원래 언어와 문구를 유지하고 재작성 설명은 영어로 씁니다.
- 오디오: 대사와 동기화된 극중 음향은 주 설명에, 전체 주변음은
overall_soundscape에, 관객 전용 음악은non_diegetic_music에 둡니다. - 실행 가능성: 설명한 동작이 영상 길이 안에 맞고 마지막 순간이 의도치 않게 끊기지 않습니다.
- 출력 정리: 에이전트가 줄거리 요약, 지원되지 않는 자료, 충돌하는 역할 또는 프롬프트 밖 설명을 추가하지 않습니다.
에이전트 초안에서 OmniArt로 이동하기
이 스킬은 자료 목록과 창작 브리프를 생성 전에 검토할 수 있는 프롬프트로 바꾸는 준비 계층으로 가장 유용합니다. 자료 순서와 의미가 유지돼야 라벨도 계속 유효하므로 승인된 출력과 원본 파일을 함께 보관하세요.
검토한 프롬프트와 해당 자료를 OmniArt 영상 제작 스튜디오로 가져갑니다. H3 필드 구조가 아니라 창작 브리프 자체를 개선하려면 MiniMax H3 프롬프트 가이드로 돌아가세요. 가이드로 원하는 결과를 정하고 h3-prompt-writing으로 선택한 H3 규약에 맞게 표현한 뒤 체크리스트로 생성 전에 구조 오류를 막으면 됩니다.
제작할 준비가 되셨나요?
AI로 멋진 콘텐츠를 생성하세요