为智能体安装 MiniMax H3 提示词编写技能
安装 MiniMax H3 提示词编写技能,选对视频任务模式,让智能体把创意简报整理成准确的基础模式或 Ref2VA 输出结构。

MiniMax H3 提示词编写技能为 AI 智能体提供了一套明确方法,可以把创意需求转换成适用于 H3 的视听提示词。你不必让智能体临时猜测格式,只需安装一个技能、确定生成模式,就能获得该模式要求的字段和参考标签。
这篇教程讲的是技能的设置与使用,不会罗列所有 H3 提示词技巧。内容依据 MiniMax 官方 MiniMax-H3 仓库中的文件,包括 h3-prompt-writing 技能、基础模式指南和全参考模式指南。如需了解参考内容的职责划分、保留规则和制作提示词,请另行打开现有的 MiniMax H3 提示词指南。
安装 MiniMax H3 提示词编写技能
在使用 AI 编程或创意智能体的项目中,运行 MiniMax 仓库公布的单技能安装命令:
npx skills add https://github.com/MiniMax-AI/MiniMax-H3 --skill h3-prompt-writing
这条命令只会安装 h3-prompt-writing。该仓库目前还提供八个特定风格的视频生成技能,按名称选择技能可以让这次设置只聚焦于提示词编写。
安装后的技能包含两份参考指南:
references/base-en.txt涵盖 T2VA、I2VA、FL2VA 和 L2VA。references/ref-en.txt涵盖全参考 Ref2VA。
这一区分比视频主题更重要。智能体应根据请求中输入内容的关系选择指南,然后严格保留该指南的字段名、章节顺序、标签和时间标记法。
让智能体改写前先选择 H3 任务模式
如果已经知道模式,就在请求中明确告诉智能体。如果还不确定,应说明你有哪些边界帧和参考素材,让智能体据此分类。
| 模式 | 输入及其关系 | 技能应构建的内容 |
|---|---|---|
| T2VA | 仅文本 | 根据文字简报构建完整视听时间线 |
| I2VA | 提供首帧 | 从该帧准确起步并向后发展的路径 |
| FL2VA | 提供首帧和尾帧 | 连接两张边界帧的连续路径 |
| L2VA | 提供尾帧 | 从合理开场逐步收束到尾帧的路径 |
| Ref2VA | 参考图或参考视频,可选择加入音频的职责 | 六部分全参考分析和镜头描述 |
T2VA、I2VA、FL2VA 和 L2VA 是该技能的基础模式,共用一套三字段正文。I2VA、FL2VA 和 L2VA 会在正文上方增加精确的对齐指令;T2VA 则直接从第一个字段开始。
Ref2VA 并非只是附件更多的同一模板。它有单独的六部分约定,用于定义参考内容、判断其职责、分析保留关系,并说明每项参考内容何时生效。
不要仅仅因为请求很详细就选择 Ref2VA。只有当输出必须定义并持续追踪参考内容时,才应选择它。
掌握基础模式的准确输出结构
所有基础模式的正文都按以下顺序使用三个字段名:
integrated_multimodal_description: [Shot 1] ...
overall_soundscape: ...
non_diegetic_music: ...
integrated_multimodal_description 按时间线承载视觉风格、构图、主体、环境、动作、摄像机、对白、歌唱和同步的画内声音。overall_soundscape 概括整段视频的环境声、动作声和非语言人声。non_diegetic_music 描述观众能听见、角色听不见的音乐;没有这类音乐时填写 N/A。
关键帧模式不同,对齐行也会变化。官方指南规定使用以下格式:
I2VA
For the target video, at 0.00 seconds into the target video, <Picture 1> (from [Shot 1]) is fully referenced.
FL2VA
How the reference pictures align with the target video — Picture 1 (from Shot 1) aligns with the 0.00-second mark of the target video; Picture 2 (from Shot N) aligns with the S.SS-second mark of the target video.
L2VA
How the reference pictures align with the target video — <Picture 1> (from [Shot N]) aligns with the S.SS-second mark of the target video.
在最终改写结果中,N 要替换为真实的最后镜头编号,S.SS 要替换为保留两位小数的实际时长。对齐行放在最前面,随后留一个空行,再写三字段正文。T2VA 没有对齐行。
镜头时间也有专门的规则:[Shot 1] 不写时间戳,后续镜头则以严格递增的剪切时间开头,例如 [Shot 2] At 00:03.500, ...。只有所选模式、对齐行、最后镜头和时长彼此一致,基础模式输出才算可以使用。
掌握 Ref2VA 的准确输出结构
全参考模式必须按以下顺序返回六个部分:
subject_definitions:
...
summary:
[reference generation] ...
retention_analysis:
<Subject 1> (appears in [Shot 1]): fully_preserved - ...
detailed_description:
...
overall_soundscape:
...
non_diegetic_music:
...
每种标签都有不同职责:
<Subject N>表示可重复使用的可见内容,例如人物、物体、场景、风格、动作、界面或特效。<Picture N>表示用作具体目标帧、关键帧、构图锚点或故事板参考的图像。<Video N>表示用于编辑、续写或提供整段视频时间结构的源视频。<Audio N>表示被复制或参考的独立音频信号,或已启用的同步音轨。
这些类别分别独立编号。从参考视频中提取的可见主体仍使用 <Subject N>;<Video N> 代表该文件本身或它与整段视频的关系。同样,视频文件带有声音,并不意味着一定要创建 <Audio N> 条目。
summary 以方括号中的一种或多种官方任务类型开头:keyframe completion、reference generation、video editing、video continuation、audio reuse 或 audio reference。同时适用多种类型时,用 + 连接。
接下来,retention_analysis 会为每个标签给出明确关系。可见内容使用 fully_preserved、partially_preserved、attribute_transfer 或 weak_reference;音频使用 fully_copy、partially_copy、reference 或 weak_reference。这些标记描述的是预期关系,不是笼统的质量评分。
最后,Ref2VA 用 detailed_description 取代基础模式中的 integrated_multimodal_description。对于生成任务,MiniMax 指南通常要求这里使用 350–500 个英文单词,并提供足够细节来说明每个镜头的构图、主体、环境、光线、动作、状态变化、摄像机运动、声音和参考内容用法。对白密集的内容应优先完整容纳口播时间线,不必机械凑满字数范围。
让智能体编写基础模式提示词
安装后,按名称调用技能,并提供简明的制作简报。该技能附带的智能体配置会在默认请求中使用 $h3-prompt-writing。
下面是一段可直接粘贴的 FL2VA 请求:
Use $h3-prompt-writing to rewrite this request as a MiniMax H3 FL2VA prompt.
Duration: 8.00 seconds.
Picture 1: the supplied first frame, a closed field notebook on a rain-darkened café table.
Picture 2: the supplied last frame, the same notebook open to a pressed violet flower.
Action: one hand enters, opens the notebook, and stops on the flower page.
Camera: one continuous shot with a slow, small push in.
Sound: quiet café room tone, rain against glass, paper and cover movement.
Dialogue: none.
Non-diegetic music: none.
Preserve the table position, notebook identity, hand continuity, lighting direction, and final composition. Return only the final rewrite in the official base-mode structure.
这段请求的有效信息包括明确的模式、准确的时长、两张图各自清晰的职责、可实现的过渡路径、声音选择和输出限制。智能体应先返回 FL2VA 对齐行,再使用三个共享字段,并在 8.00 秒时落到 Picture 2。
使用 I2VA 时,把第二张图改为从首帧继续发展的动作。使用 L2VA 时,描述抵达所提供尾帧前应该发生的事件。使用 T2VA 时,移除图片参考,并提供足够信息,让智能体从文本构建开场构图和视听序列。
让智能体编写全参考提示词
如果每项素材都有明确职责,Ref2VA 请求会更有效。下面这段可直接粘贴的智能体请求把身份、动作和音频指引分开:
Use $h3-prompt-writing to rewrite this request as a MiniMax H3 full-reference Ref2VA prompt.
Target: a 10-second, three-shot product demonstration.
Picture 1: preserve the reusable bottle identity, silhouette, cap, label placement, and material finish.
Video 1: reference only the demonstrator's hand action and the three-shot cut rhythm; do not reuse its product, set, or wardrobe.
Audio 1: reference the percussion tempo for edit timing without copying the source signal.
Shot flow:
1. Establish the bottle centered on a stone counter.
2. A hand presses the pump once and the lotion lands on the back of the other hand.
3. End on the bottle and a small lotion smear beside it.
No dialogue or visible text beyond the preserved label. Use new room ambience and restrained audience-only percussion. Return only the six official Ref2VA sections in their required order, with consistent labels and explicit retention markers.
这段请求不会替智能体预写 subject_definitions,而是提供足够的来源信息和复用意图,让技能自行构建定义,把摘要分类为参考生成加音频参考,并说明每个标签预期的保留或迁移关系。
如果某项素材只应影响一个属性,就明确写出来:动作视频可以指导手部动作,而无需同时控制表演者、服装、布景、产品、摄像机或音频。
使用两轮智能体工作流
把技能输出视为结构化初稿,再进行一轮确定性的检查。
- 编写来源清单。 列出每条文字指令、每一帧、每张图、每段视频和每段音频。说明每项素材应该和不应该控制什么。
- 锁定任务模式。 改写前选择 T2VA、I2VA、FL2VA、L2VA 或 Ref2VA。
- 告诉智能体交付限制。 包括时长、镜头数量、边界帧时间、对白、画面文字,以及是否包含音乐。
- 只要求官方结构。 这样更容易发现缺失字段、章节错序和提示词以外的说明。
- 不改变简报地检查。 先检查结构、参考关系、时间、口播文字和音频归类。
- 每次只修改一层。 要求智能体修正一个明确问题,同时保留已经确认的章节。
第二轮可使用这段定向指令:
Review the rewrite against the h3-prompt-writing guide. Keep the creative brief unchanged. Correct only field order, unresolved reference labels, shot timestamps, duration alignment, dialogue preservation, and diegetic versus non-diegetic audio placement. Return the corrected prompt only.
这段检查提示词可以降低格式修正悄悄变成创意改写的概率。
生成前检查输出
每次让智能体改写后,都使用以下清单:
- 模式: 输出使用的指南与实际输入关系一致。
- 基础结构: T2VA 从
integrated_multimodal_description开始;I2VA、FL2VA 和 L2VA 在其上方放置正确的对齐指令。 - Ref2VA 结构: 六个字段各出现一次且顺序正确;使用
detailed_description,而不是integrated_multimodal_description。 - 标签: 每个
<Subject N>、<Picture N>、<Video N>和<Audio N>在所有章节中保持同一含义,后文没有未定义的标签。 - 参考职责: 主体、具体帧、整段视频关系和音频信号使用正确的标签类型。
- 保留关系: 每项被追踪的参考内容都有符合请求的允许关系标记。
- 镜头:
[Shot 1]没有时间戳;后续剪切时间严格递增,并处于请求时长以内。 - 边界帧: I2VA 从首帧开始,FL2VA 抵达尾帧,L2VA 收束到所提供的最终帧。
- 口播和文字: 对白、歌词和画面可见文字保留原语言和原措辞;改写说明使用英文。
- 音频: 对白和同步的画内声音保留在主描述中;全片环境声放入
overall_soundscape;仅观众能听到的配乐放入non_diegetic_music。 - 可行性: 所述动作能在时长内完成,结尾得到解决,而不是在非预期位置中断。
- 输出整洁度: 智能体没有添加剧情梗概、不受支持的素材、相互冲突的职责,也没有在提示词以外添加说明。
从智能体初稿转到 OmniArt
这个技能最适合作为准备层:它把素材清单和创意简报转换成可在生成前检查的提示词。请把确认后的输出与源文件放在一起,因为只有素材顺序和含义保持稳定,标签才会一直有用。
接着,把检查后的提示词和对应素材带入 OmniArt 的视频创作工作台。如果要改进的是创意简报本身,而不是 H3 字段结构,请回到 MiniMax H3 提示词指南。分工很简单:用指南决定你想要什么,用 h3-prompt-writing 按所选 H3 约定表达需求,再用检查清单拦住进入生成环节前的结构错误。
准备好创作了吗?
开始用 AI 生成精彩内容