tutorial教程与操作指南16 分钟阅读

为智能体安装 MiniMax H3 提示词编写技能

安装 MiniMax H3 提示词编写技能,选对视频任务模式,让智能体把创意简报整理成准确的基础模式或 Ref2VA 输出结构。

OmniArt 团队
为智能体安装 MiniMax H3 提示词编写技能

MiniMax H3 提示词编写技能为 AI 智能体提供了一套明确方法,可以把创意需求转换成适用于 H3 的视听提示词。你不必让智能体临时猜测格式,只需安装一个技能、确定生成模式,就能获得该模式要求的字段和参考标签。

这篇教程讲的是技能的设置与使用,不会罗列所有 H3 提示词技巧。内容依据 MiniMax 官方 MiniMax-H3 仓库中的文件,包括 h3-prompt-writing 技能、基础模式指南和全参考模式指南。如需了解参考内容的职责划分、保留规则和制作提示词,请另行打开现有的 MiniMax H3 提示词指南

安装 MiniMax H3 提示词编写技能

在使用 AI 编程或创意智能体的项目中,运行 MiniMax 仓库公布的单技能安装命令:

npx skills add https://github.com/MiniMax-AI/MiniMax-H3 --skill h3-prompt-writing

这条命令只会安装 h3-prompt-writing。该仓库目前还提供八个特定风格的视频生成技能,按名称选择技能可以让这次设置只聚焦于提示词编写。

安装后的技能包含两份参考指南:

  • references/base-en.txt 涵盖 T2VA、I2VA、FL2VA 和 L2VA。
  • references/ref-en.txt 涵盖全参考 Ref2VA。

这一区分比视频主题更重要。智能体应根据请求中输入内容的关系选择指南,然后严格保留该指南的字段名、章节顺序、标签和时间标记法。

让智能体改写前先选择 H3 任务模式

如果已经知道模式,就在请求中明确告诉智能体。如果还不确定,应说明你有哪些边界帧和参考素材,让智能体据此分类。

模式输入及其关系技能应构建的内容
T2VA仅文本根据文字简报构建完整视听时间线
I2VA提供首帧从该帧准确起步并向后发展的路径
FL2VA提供首帧和尾帧连接两张边界帧的连续路径
L2VA提供尾帧从合理开场逐步收束到尾帧的路径
Ref2VA参考图或参考视频,可选择加入音频的职责六部分全参考分析和镜头描述

T2VA、I2VA、FL2VA 和 L2VA 是该技能的基础模式,共用一套三字段正文。I2VA、FL2VA 和 L2VA 会在正文上方增加精确的对齐指令;T2VA 则直接从第一个字段开始。

Ref2VA 并非只是附件更多的同一模板。它有单独的六部分约定,用于定义参考内容、判断其职责、分析保留关系,并说明每项参考内容何时生效。

不要仅仅因为请求很详细就选择 Ref2VA。只有当输出必须定义并持续追踪参考内容时,才应选择它。

掌握基础模式的准确输出结构

所有基础模式的正文都按以下顺序使用三个字段名:

integrated_multimodal_description: [Shot 1] ...

overall_soundscape: ...

non_diegetic_music: ...

integrated_multimodal_description 按时间线承载视觉风格、构图、主体、环境、动作、摄像机、对白、歌唱和同步的画内声音。overall_soundscape 概括整段视频的环境声、动作声和非语言人声。non_diegetic_music 描述观众能听见、角色听不见的音乐;没有这类音乐时填写 N/A

关键帧模式不同,对齐行也会变化。官方指南规定使用以下格式:

I2VA
For the target video, at 0.00 seconds into the target video, <Picture 1> (from [Shot 1]) is fully referenced.

FL2VA
How the reference pictures align with the target video — Picture 1 (from Shot 1) aligns with the 0.00-second mark of the target video; Picture 2 (from Shot N) aligns with the S.SS-second mark of the target video.

L2VA
How the reference pictures align with the target video — <Picture 1> (from [Shot N]) aligns with the S.SS-second mark of the target video.

在最终改写结果中,N 要替换为真实的最后镜头编号,S.SS 要替换为保留两位小数的实际时长。对齐行放在最前面,随后留一个空行,再写三字段正文。T2VA 没有对齐行。

镜头时间也有专门的规则:[Shot 1] 不写时间戳,后续镜头则以严格递增的剪切时间开头,例如 [Shot 2] At 00:03.500, ...。只有所选模式、对齐行、最后镜头和时长彼此一致,基础模式输出才算可以使用。

掌握 Ref2VA 的准确输出结构

全参考模式必须按以下顺序返回六个部分:

subject_definitions:
...

summary:
[reference generation] ...

retention_analysis:
<Subject 1> (appears in [Shot 1]): fully_preserved - ...

detailed_description:
...

overall_soundscape:
...

non_diegetic_music:
...

每种标签都有不同职责:

  • <Subject N> 表示可重复使用的可见内容,例如人物、物体、场景、风格、动作、界面或特效。
  • <Picture N> 表示用作具体目标帧、关键帧、构图锚点或故事板参考的图像。
  • <Video N> 表示用于编辑、续写或提供整段视频时间结构的源视频。
  • <Audio N> 表示被复制或参考的独立音频信号,或已启用的同步音轨。

这些类别分别独立编号。从参考视频中提取的可见主体仍使用 <Subject N><Video N> 代表该文件本身或它与整段视频的关系。同样,视频文件带有声音,并不意味着一定要创建 <Audio N> 条目。

summary 以方括号中的一种或多种官方任务类型开头:keyframe completionreference generationvideo editingvideo continuationaudio reuseaudio reference。同时适用多种类型时,用 + 连接。

接下来,retention_analysis 会为每个标签给出明确关系。可见内容使用 fully_preservedpartially_preservedattribute_transferweak_reference;音频使用 fully_copypartially_copyreferenceweak_reference。这些标记描述的是预期关系,不是笼统的质量评分。

最后,Ref2VA 用 detailed_description 取代基础模式中的 integrated_multimodal_description。对于生成任务,MiniMax 指南通常要求这里使用 350–500 个英文单词,并提供足够细节来说明每个镜头的构图、主体、环境、光线、动作、状态变化、摄像机运动、声音和参考内容用法。对白密集的内容应优先完整容纳口播时间线,不必机械凑满字数范围。

让智能体编写基础模式提示词

安装后,按名称调用技能,并提供简明的制作简报。该技能附带的智能体配置会在默认请求中使用 $h3-prompt-writing

下面是一段可直接粘贴的 FL2VA 请求:

Use $h3-prompt-writing to rewrite this request as a MiniMax H3 FL2VA prompt.

Duration: 8.00 seconds.
Picture 1: the supplied first frame, a closed field notebook on a rain-darkened café table.
Picture 2: the supplied last frame, the same notebook open to a pressed violet flower.
Action: one hand enters, opens the notebook, and stops on the flower page.
Camera: one continuous shot with a slow, small push in.
Sound: quiet café room tone, rain against glass, paper and cover movement.
Dialogue: none.
Non-diegetic music: none.

Preserve the table position, notebook identity, hand continuity, lighting direction, and final composition. Return only the final rewrite in the official base-mode structure.

这段请求的有效信息包括明确的模式、准确的时长、两张图各自清晰的职责、可实现的过渡路径、声音选择和输出限制。智能体应先返回 FL2VA 对齐行,再使用三个共享字段,并在 8.00 秒时落到 Picture 2。

使用 I2VA 时,把第二张图改为从首帧继续发展的动作。使用 L2VA 时,描述抵达所提供尾帧前应该发生的事件。使用 T2VA 时,移除图片参考,并提供足够信息,让智能体从文本构建开场构图和视听序列。

让智能体编写全参考提示词

如果每项素材都有明确职责,Ref2VA 请求会更有效。下面这段可直接粘贴的智能体请求把身份、动作和音频指引分开:

Use $h3-prompt-writing to rewrite this request as a MiniMax H3 full-reference Ref2VA prompt.

Target: a 10-second, three-shot product demonstration.
Picture 1: preserve the reusable bottle identity, silhouette, cap, label placement, and material finish.
Video 1: reference only the demonstrator's hand action and the three-shot cut rhythm; do not reuse its product, set, or wardrobe.
Audio 1: reference the percussion tempo for edit timing without copying the source signal.

Shot flow:
1. Establish the bottle centered on a stone counter.
2. A hand presses the pump once and the lotion lands on the back of the other hand.
3. End on the bottle and a small lotion smear beside it.

No dialogue or visible text beyond the preserved label. Use new room ambience and restrained audience-only percussion. Return only the six official Ref2VA sections in their required order, with consistent labels and explicit retention markers.

这段请求不会替智能体预写 subject_definitions,而是提供足够的来源信息和复用意图,让技能自行构建定义,把摘要分类为参考生成加音频参考,并说明每个标签预期的保留或迁移关系。 如果某项素材只应影响一个属性,就明确写出来:动作视频可以指导手部动作,而无需同时控制表演者、服装、布景、产品、摄像机或音频。

使用两轮智能体工作流

把技能输出视为结构化初稿,再进行一轮确定性的检查。

  1. 编写来源清单。 列出每条文字指令、每一帧、每张图、每段视频和每段音频。说明每项素材应该和不应该控制什么。
  2. 锁定任务模式。 改写前选择 T2VA、I2VA、FL2VA、L2VA 或 Ref2VA。
  3. 告诉智能体交付限制。 包括时长、镜头数量、边界帧时间、对白、画面文字,以及是否包含音乐。
  4. 只要求官方结构。 这样更容易发现缺失字段、章节错序和提示词以外的说明。
  5. 不改变简报地检查。 先检查结构、参考关系、时间、口播文字和音频归类。
  6. 每次只修改一层。 要求智能体修正一个明确问题,同时保留已经确认的章节。

第二轮可使用这段定向指令:

Review the rewrite against the h3-prompt-writing guide. Keep the creative brief unchanged. Correct only field order, unresolved reference labels, shot timestamps, duration alignment, dialogue preservation, and diegetic versus non-diegetic audio placement. Return the corrected prompt only.

这段检查提示词可以降低格式修正悄悄变成创意改写的概率。

生成前检查输出

每次让智能体改写后,都使用以下清单:

  • 模式: 输出使用的指南与实际输入关系一致。
  • 基础结构: T2VA 从 integrated_multimodal_description 开始;I2VA、FL2VA 和 L2VA 在其上方放置正确的对齐指令。
  • Ref2VA 结构: 六个字段各出现一次且顺序正确;使用 detailed_description,而不是 integrated_multimodal_description
  • 标签: 每个 <Subject N><Picture N><Video N><Audio N> 在所有章节中保持同一含义,后文没有未定义的标签。
  • 参考职责: 主体、具体帧、整段视频关系和音频信号使用正确的标签类型。
  • 保留关系: 每项被追踪的参考内容都有符合请求的允许关系标记。
  • 镜头: [Shot 1] 没有时间戳;后续剪切时间严格递增,并处于请求时长以内。
  • 边界帧: I2VA 从首帧开始,FL2VA 抵达尾帧,L2VA 收束到所提供的最终帧。
  • 口播和文字: 对白、歌词和画面可见文字保留原语言和原措辞;改写说明使用英文。
  • 音频: 对白和同步的画内声音保留在主描述中;全片环境声放入 overall_soundscape;仅观众能听到的配乐放入 non_diegetic_music
  • 可行性: 所述动作能在时长内完成,结尾得到解决,而不是在非预期位置中断。
  • 输出整洁度: 智能体没有添加剧情梗概、不受支持的素材、相互冲突的职责,也没有在提示词以外添加说明。

从智能体初稿转到 OmniArt

这个技能最适合作为准备层:它把素材清单和创意简报转换成可在生成前检查的提示词。请把确认后的输出与源文件放在一起,因为只有素材顺序和含义保持稳定,标签才会一直有用。

接着,把检查后的提示词和对应素材带入 OmniArt 的视频创作工作台。如果要改进的是创意简报本身,而不是 H3 字段结构,请回到 MiniMax H3 提示词指南。分工很简单:用指南决定你想要什么,用 h3-prompt-writing 按所选 H3 约定表达需求,再用检查清单拦住进入生成环节前的结构错误。

准备好创作了吗?

开始用 AI 生成精彩内容

免费开始