MiniMax H3 原生音频指南:对白、音乐与同步
学习如何为 MiniMax H3 原生立体声音频写提示词,覆盖对白、环境声、音乐、人声参考与同步,并附可复用的制作测试方案。

MiniMax H3 原生音频把声轨变成生成简报的一部分,而不是画面完成后你再自动贴上的文件。MiniMax 表示,H3 能联合理解文本、图片、视频与音频,并生成带原生立体声的视频。其训练范围也把人声、音效与音乐当作同一个音频域,而不是彼此割裂的工具。
这是一次有实质意义的工作流变化,但并不等于承诺每一句台词都会完美说出来、每一步脚步都落在正确帧上,或每一次立体声混音都可直接发布。本指南把 MiniMax 文档中的 H3 能力 与创作者应跑的制作测试分开说明。它会给你一套实用的声音简报结构、音频参考工作流、五个提示词模板,以及可复用的评估记分卡,同时不会把官方演示当作独立实测结果来呈现。
MiniMax 官方文档如何描述 H3 音频
MiniMax 把 H3 描述为通用多模态视频模型,而不是「先出静音视频,再单独加声轨」的生成器。公司发布材料写明,该模型可生成原生立体声音频,并联合建模人声、音效与音乐。MiniMax 还演示过一种提示词:从视频取镜头运动、从图片取角色,再从音频参考匹配人声。
官方 H3 视频生成指南 定义了当前 API 边界:
| 文档记载的能力 | 对创作者意味着什么 |
|---|---|
| 原生立体声音频 | H3 可随生成视频一并返回双声道声轨 |
| 音频作为多模态上下文 | 一段音频可引导人声、运动、剪辑节奏,或提示词中描述的其他关系 |
| 最多三个音频参考 | 每段可为 2–15 秒,全部音频参考合计最长 15 秒 |
| 混合参考 | 音频可与图片、视频一起放在同一次参考生视频请求中 |
| WAV 与 MP3 输入 | 参考音频必须使用文档列出的输入格式之一 |
| 4–15 秒输出 | H3 面向短片段设计,不是一次生成完整长片声轨 |
还有三条重要约束。音频参考不能单独提交;MiniMax 要求它至少伴随一张图片或一个视频。音频文件每个上限 15 MB,完整的混合参考请求上限为 12 个素材。参考模式也不能与首帧或尾帧模式在同一请求中混用,所以要先判断:对这个镜头来说,精确的边界帧更重要,还是更宽的多模态条件更重要。
说明
立体声不等于空间音频。MiniMax 文档记载的是原生立体声输出,但当前公开材料并未承诺环绕声、Ambisonic、基于对象的音频,或特定水平的定位精度。在把结果描述为「空间感」之前,请用耳机先检查左右声像。
写提示词之前,先做好声音简报
最有用的 H3 提示词不是一长串声音清单,而是一份紧凑的声音计划:告诉模型什么该主导、什么该衬托,以及在可见时刻必须发生什么。按五步来写这份计划。
1. 锁定画面动作与时间
音频同步依赖可见事件。先写清镜头、主体动作、运镜与节拍顺序。「镜头落稳时,勺子敲上茶托」给模型一个共享的视听事件。「加点杯子声」既不说明事件何时发生,也不说明应由什么触发。
对一段 10 秒片段,简单节拍图可以是:
- 0–3 秒:建立房间与主体
- 3–7 秒:对白或主动作
- 7–10 秒:产品揭示与最终声音线索
把这些时间点当作方向,而不是帧级精确的剪辑标记。制作测试应衡量输出与它们的贴近程度。
2. 点名一层主音频
选定观众必须先注意到的声音:对白、产品互动、音乐钩子,或一段环境声。给它最清晰的措辞,并保护它周围的空间。
若对白是主层,用引号写出确切台词,并指定一种表演方向。若产品声是主层,描述产生它的物理动作。若音乐是主层,说明速度、乐器编配、情绪,以及编曲应在何处变化。
3. 把环境声写成声学场所
环境声应解释镜头「住在」哪里。不要只写「咖啡馆声音」,而要描述说话人身后安静的意式咖啡机嘶嘶声、低声的室内交谈,以及远处的门铃声。对干净的产品短片,除非静音是刻意创意选择,否则请要求受控的录音棚房间底噪,而不是空白静音。
使用可同时作用于画面与声音的距离与材质词:
- 近、干、亲密,以及轻微混响
- 远、隔着玻璃发闷,或画外偏左
- 瓷砖上的脚步、布料摩擦、金属上的雨声,或木桌上放下玻璃杯
4. 决定音乐是配乐还是现场声源
配乐在场景之外;现场声源音乐来自场景内的物体或场所。写清你指的是哪一种。「对白下方克制的电子配乐」要求的是背景层,而「咖啡馆收音机里安静播放、略带闷感的音乐」则给它一个画面内的声源。
不需要音乐时,写 no music。这样对白或拟音测试更容易判断。需要音乐时,为人声留出动态余量,而不是要求每一层都又响又戏剧化。
5. 写明排除项
负面音频方向在保护简报时很有用。例如 no narration、no crowd cheering、no added melody 与 no exaggerated whooshes。排除列表保持简短;约束太多会与你真正想要的动作互相争夺注意力。
如何使用音频参考,而不混淆它们的职责
当每个素材只承担一件工作时,H3 的参考系统最有用。一段参考音频可能提供声线音色与节奏、音乐能量、声音纹理,或剪辑节奏。不要假设模型知道该借用哪一种属性。
在写最终提示词之前,先写一张素材职责表:
| 素材 | 分配职责 | 不应迁移的内容 |
|---|---|---|
| 角色图片 | 身份、服装与产品位置 | 背景与光线 |
| 运动视频 | 手势与镜头时机 | 角色身份与对白 |
| 人声音频 | 声线性格、语速与情绪能量 | 原词与背景噪声 |
| 音乐音频 | 速度、编曲密度与剪辑节奏 | 可辨认的旋律或歌词 |
然后用自然语言描述这些关系。MiniMax 自己的 H3 示例用一句话把镜头运动分给视频参考、表演者分给图片参考、人声分给音频参考。带编号的素材标签因界面而异,而 API 使用带类型的内容与参考角色,所以请把下方模板中的标签替换成你工作流里显示的确切写法。
警告
只有在你已获得授权时,才把某人的声音或表演当作参考。人声参考并不能证明你拥有说话人身份、录音、音乐,或发布生成仿制的权利。
干净的参考会带来更干净的实验。裁掉静音、去掉无关背景音乐、避免削波,并让相关人声或音乐段落易于听清。用能展示你想要属性的短片段,而不是默认上传最长时长。
五个 MiniMax H3 原生音频提示词模板
这些是起始简报,不是已宣称的测试结果。每个提示词都多跑几次,并用下一节的协议给输出打分。
1. 单人说话人 + 房间底噪
Close-up of a chef at the pass in a quiet restaurant kitchen after service. The camera makes a slow push-in as she looks toward a colleague off-camera and says, “We try it again tomorrow.” Delivery: tired but quietly optimistic, natural pace, one short breath before “tomorrow.” Her voice is the primary audio layer, close and dry. Low ventilation hum and occasional metal cooling sounds remain distant. No music, no narration, no other voices.
用这个模板评估语音准确度、情绪表演、口型,以及环境声是否始终压在台词后方。
2. 分层环境声与同步拟音
Wide shot inside a nearly empty laundromat at night, fluorescent light reflecting on the tiled floor. A person moves a wet jacket from a washer to a rolling basket; the metal door clicks shut exactly when their hand closes it, then the basket wheels rattle softly across tile. Foreground: fabric movement and the door click. Mid-ground: steady washer rotation. Background: rain against the front window and one distant car passing outside. Native stereo mix, no dialogue, no music.
这份简报隔离了环境声、材质真实感、左右分离,以及接触同步。
3. 以音乐主导的产品揭示
Ten-second vertical product film for a translucent coral sports bottle on a lilac studio surface. Start with a macro shot of condensation, then orbit as the bottle rises into the hero position. Original minimal electronic score at 100 BPM: soft pulse for the opening, a clean percussive accent when the logo faces camera, then a short resolved final note. Add subtle droplets and one controlled placement sound. Music supports the product sounds rather than masking them. No voice and no stock-style cinematic boom.
若需要超出声轨之外的产品视觉规划,可使用图生产品视频工作流。
4. 经授权的人声参考 + 新对白
Use voice reference 1 only for the narrator's vocal timbre, speaking pace, and warm conversational energy. Do not reuse its words or background noise. The person from image reference 1 stands beside the window and says, “The first draft is only the beginning.” Keep the spoken line intelligible and synchronized to the visible speaker. Add a quiet residential room tone and soft rain outside. No music. The voice recording is authorized for this use.
测试目标人声特质是否能迁移,同时不无意复制源录音中的噪声、措辞或内容。用文字描述期望特质,这样即使参考贴合度有波动,指令仍然有用。
5. 社交剪辑的节奏参考
Create a 12-second montage of a ceramic artist shaping, glazing, and placing a finished cup on a shelf. Use audio reference 1 only for tempo, rhythmic energy, and edit pacing. Compose an original percussive track with different melody and sound design. Cut the visual action on the major rhythmic changes: clay lands on the wheel, brush touches glaze, cup reaches the shelf. Preserve natural wheel rotation, brush texture, and the final ceramic tap beneath the music. No dialogue.
这把节奏条件与音乐复制分开,并给你三个可见同步点可检查。
可复用的 H3 音频评估方案
一份打磨过的官方演示,回答不了模型是否适合你的制作工作流。对同一简报至少生成三次,固定时长与参考,给每一次输出打分,而不是只挑最强结果。
先分开测试各层
从四个受控提示词开始:
- 仅对白与安静房间底噪
- 环境声与三个可见拟音事件,无语音、无音乐
- 器乐音乐,带两个计划中的视觉重音
- 一个经授权的音频参考,配对简单的图片或视频参考
只有这些过关后,才在同一拥挤场景中组合对白、环境声、拟音与音乐。这样失败才可诊断:你能分清问题来自发音、时机、参考迁移,还是混音密度。
用记分卡,而不是印象
| 维度 | 要回答的问题 | 简单度量 |
|---|---|---|
| 对白准确度 | 要求的词是否正确说出? | 正确词数 / 要求词数 |
| 口型同步 | 可见的闭嘴与音节重音是否对齐? | 1–5 分,并记下首次可见漂移 |
| 事件同步 | 接触声是否与画面动作落地? | 三个计划线索处早/晚多少帧 |
| 声线一致性 | 说话人是否在整句中保持可辨? | 分别给开头、中间、结尾打分 |
| 参考控制 | 要求的属性是否迁移,且无多余包袱? | 列出有意与无意迁移 |
| 立体声声像 | 左右位置是否有用且稳定? | 耳机检查 + 声道波形检查 |
| 混音层次 | 主层是否清晰可懂? | 正常回放电平下 1–5 分 |
| 可重复性 | 无需音频修复即可用的比例多高? | 可用输出 / 总次数 |
在视频编辑器或音频工作站中检查导出文件。确认存在两个声道,在单声道下听相位问题,并在计划接触事件附近比较波形。不要从社交平台预览推断音频质量,因为平台可能重压缩或重映射声轨。
提示
保留失败的生成结果。提示词修订只有在提高多次运行中的可用输出率时才算改进,而不是只产出一次幸运片段。
需要提前规划的限制
MiniMax 自己的发布帖也写明,H3 仍有提升空间,并把视觉细节列为未来工作方向之一。就音频制作而言,当前公开文档也留下若干开放问题。它并未公布词错误率、口型同步精度、响度、采样率、立体声以外的声道布局、语言覆盖、人声参考相似度,或时间码级线索控制的保证。
围绕这些实用边界做规划:
- 输出偏短: 4–15 秒适合镜头、广告与社交片段,但长片连贯性需要跨多次生成做剪辑。
- 参考上下文偏短: 最多允许三段音频,但合计时长不能超过 15 秒。
- 不能只提交音频参考: 参考音频必须至少配对一张图片或一个视频。
- 自然语言时机不是锁定时间线: 在重复测试证明你需要的精度之前,把节拍时间当作意图。
- 立体声需要核验: 双声道不会自动带来可信的方向感、纵深或单声道兼容性。
- 密集混音可能掩盖错误: 对白、效果、环境声与音乐可能被一起建模,但更简单的简报更易控制与修复。
- 参考权利仍然适用: 模型能力并不授予你模仿人声或复用受保护音乐的许可。
MiniMax H3 通过 PixVerse 向 OmniArt Creator 及以上套餐开放,提供视频、转场和参考模式,支持 5–15 秒、768p 或 1440p(2K)输出。 参考模式最多支持 9 张图片、3 段视频和 3 个音频文件。参考音频必须至少搭配一张图片或一段视频。 OmniArt 当前不提供独立的 H3 音频控制。参考音频是引导输入,不代表每个输出都会带有可直接用于制作的声音;请检查实际交付文件。 H3 每输出 1 秒消耗 8 (768p) / 12 (2K) 积分。参考模式中,参考视频每个向上取整秒另收 8 (768p) / 12 (2K) 积分;前 5 张参考图片免费,之后每张 4 积分,参考音频不额外收费。 官方按量付费定价页 H3 定价与规格指南
在 OmniArt 中补完其余声轨
原生音频可以减少交接,但并不会取消独立声音工具的价值。如果一次 H3 成片画面正确而旁白偏弱,保留画面,再搭一条受控人声轨。如果对白可用但房间缺质感,就加环境声或拟音层,而不是整段重生成。
OmniArt 把视频、语音、音效与音乐工作流收进同一个创意工作台。使用 AI 音效生成器指南 设计替代拟音与环境声,或对照 Veo 3.1 空间音频指南 比较提示词思路。目标不是把每一种声音都硬塞进一次生成,而是在原生声轨可用时保留它,只替换不好用的那一层。
准备好创作了吗?
开始用 AI 生成精彩内容