MiniMax H3 原生音频指南:对白、音乐与同步
学习如何为 MiniMax H3 原生立体声音频写提示词,覆盖对白、环境声、音乐、人声参考与同步,并附可复用的制作测试方案。

MiniMax H3 原生音频把声轨变成生成简报的一部分,而不是画面完成后你再自动贴上的文件。MiniMax 表示,H3 能联合理解文本、图片、视频与音频,并生成带原生立体声的视频。其训练范围也把人声、音效与音乐当作同一个音频域,而不是彼此割裂的工具。
这是一次有实质意义的工作流变化,但并不等于承诺每一句台词都会完美说出来、每一步脚步都落在正确帧上,或每一次立体声混音都可直接发布。本指南把 MiniMax 文档中的 H3 能力 与创作者应跑的制作测试分开说明。它会给你一套实用的声音简报结构、音频参考工作流、五个提示词模板,以及可复用的评估记分卡,同时不会把官方演示当作独立实测结果来呈现。
MiniMax 官方文档如何描述 H3 音频
MiniMax 把 H3 描述为通用多模态视频模型,而不是「先出静音视频,再单独加声轨」的生成器。公司发布材料写明,该模型可生成原生立体声音频,并联合建模人声、音效与音乐。MiniMax 还演示过一种提示词:从视频取镜头运动、从图片取角色,再从音频参考匹配人声。
官方 H3 视频生成指南 定义了当前 API 边界:
| 文档记载的能力 | 对创作者意味着什么 |
|---|---|
| 原生立体声音频 | H3 可随生成视频一并返回双声道声轨 |
| 音频作为多模态上下文 | 一段音频可引导人声、运动、剪辑节奏,或提示词中描述的其他关系 |
| 最多三个音频参考 | 每段可为 2–15 秒,全部音频参考合计最长 15 秒 |
| 混合参考 | 音频可与图片、视频一起放在同一次参考生视频请求中 |
| WAV 与 MP3 输入 | 参考音频必须使用文档列出的输入格式之一 |
| 4–15 秒输出 | H3 面向短片段设计,不是一次生成完整长片声轨 |
还有三条重要约束。音频参考不能单独提交;MiniMax 要求它至少伴随一张图片或一个视频。音频文件每个上限 15 MB,完整的混合参考请求上限为 12 个素材。参考模式也不能与首帧或尾帧模式在同一请求中混用,所以要先判断:对这个镜头来说,精确的边界帧更重要,还是更宽的多模态条件更重要。
说明
立体声不等于空间音频。MiniMax 文档记载的是原生立体声输出,但当前公开材料并未承诺环绕声、Ambisonic、基于对象的音频,或特定水平的定位精度。在把结果描述为「空间感」之前,请用耳机先检查左右声像。
写提示词之前,先做好声音简报
最有用的 H3 提示词不是一长串声音清单,而是一份紧凑的声音计划:告诉模型什么该主导、什么该衬托,以及在可见时刻必须发生什么。按五步来写这份计划。
1. 锁定画面动作与时间
音频同步依赖可见事件。先写清镜头、主体动作、运镜与节拍顺序。「镜头落稳时,勺子敲上茶托」给模型一个共享的视听事件。「加点杯子声」既不说明事件何时发生,也不说明应由什么触发。
对一段 10 秒片段,简单节拍图可以是:
- 0–3 秒:建立房间与主体
- 3–7 秒:对白或主动作
- 7–10 秒:产品揭示与最终声音线索
把这些时间点当作方向,而不是帧级精确的剪辑标记。制作测试应衡量输出与它们的贴近程度。
2. 点名一层主音频
选定观众必须先注意到的声音:对白、产品互动、音乐钩子,或一段环境声。给它最清晰的措辞,并保护它周围的空间。
若对白是主层,用引号写出确切台词,并指定一种表演方向。若产品声是主层,描述产生它的物理动作。若音乐是主层,说明速度、乐器编配、情绪,以及编曲应在何处变化。
3. 把环境声写成声学场所
环境声应解释镜头「住在」哪里。不要只写「咖啡馆声音」,而要描述说话人身后安静的意式咖啡机嘶嘶声、低声的室内交谈,以及远处的门铃声。对干净的产品短片,除非静音是刻意创意选择,否则请要求受控的录音棚房间底噪,而不是空白静音。
使用可同时作用于画面与声音的距离与材质词:
- 近、干、亲密,以及轻微混响
- 远、隔着玻璃发闷,或画外偏左
- 瓷砖上的脚步、布料摩擦、金属上的雨声,或木桌上放下玻璃杯
4. 决定音乐是配乐还是现场声源
配乐在场景之外;现场声源音乐来自场景内的物体或场所。写清你指的是哪一种。「对白下方克制的电子配乐」要求的是背景层,而「咖啡馆收音机里安静播放、略带闷感的音乐」则给它一个画面内的声源。
不需要音乐时,写 no music。这样对白或拟音测试更容易判断。需要音乐时,为人声留出动态余量,而不是要求每一层都又响又戏剧化。
5. 写明排除项
负面音频方向在保护简报时很有用。例如 no narration、no crowd cheering、no added melody 与 no exaggerated whooshes。排除列表保持简短;约束太多会与你真正想要的动作互相争夺注意力。
如何使用音频参考,而不混淆它们的职责
当每个素材只承担一件工作时,H3 的参考系统最有用。一段参考音频可能提供声线音色与节奏、音乐能量、声音纹理,或剪辑节奏。不要假设模型知道该借用哪一种属性。
在写最终提示词之前,先写一张素材职责表:
| 素材 | 分配职责 | 不应迁移的内容 |
|---|---|---|
| 角色图片 | 身份、服装与产品位置 | 背景与光线 |
| 运动视频 | 手势与镜头时机 | 角色身份与对白 |
| 人声音频 | 声线性格、语速与情绪能量 | 原词与背景噪声 |
| 音乐音频 | 速度、编曲密度与剪辑节奏 | 可辨认的旋律或歌词 |
然后用自然语言描述这些关系。MiniMax 自己的 H3 示例用一句话把镜头运动分给视频参考、表演者分给图片参考、人声分给音频参考。带编号的素材标签因界面而异,而 API 使用带类型的内容与参考角色,所以请把下方模板中的标签替换成你工作流里显示的确切写法。
警告
只有在你已获得授权时,才把某人的声音或表演当作参考。人声参考并不能证明你拥有说话人身份、录音、音乐,或发布生成仿制的权利。
干净的参考会带来更干净的实验。裁掉静音、去掉无关背景音乐、避免削波,并让相关人声或音乐段落易于听清。用能展示你想要属性的短片段,而不是默认上传最长时长。
五个 MiniMax H3 原生音频提示词模板
这些是起始简报,不是已宣称的测试结果。每个提示词都多跑几次,并用下一节的协议给输出打分。
1. 单人说话人 + 房间底噪
收工后安静餐厅厨房里,厨师在出餐台的特写。镜头缓慢推进,她看向画外的同事说:“我们明天再试一次。”表演:疲惫却安静乐观,语速自然,在“明天”前有一次短促换气。她的声音是主音频层,近且干。低通风嗡鸣与偶尔的金属冷却声保持在远处。无音乐、无旁白、无其他人声。
用这个模板评估语音准确度、情绪表演、口型,以及环境声是否始终压在台词后方。
2. 分层环境声与同步拟音
夜间近乎空无一人的自助洗衣店全景,荧光灯映在瓷砖地面上。一个人把湿夹克从洗衣机移到带轮篮子里;金属门在手合上的瞬间咔嗒关上,随后篮轮在瓷砖上轻轻滚动。前景:布料摩擦与门的咔嗒声。中景:洗衣机稳定旋转。背景:雨打在前窗上,以及外面远处一辆车驶过。原生立体声混音,无对白,无音乐。
这份简报隔离了环境声、材质真实感、左右分离,以及接触同步。
3. 以音乐主导的产品揭示
十秒竖屏产品片:半透明珊瑚红运动水瓶,放在淡紫工作室台面上。从冷凝水珠的微距开场,再环绕拍摄,让瓶子升入英雄位。原创极简电子配乐 100 BPM:开场是柔和脉冲,Logo 正对镜头时来一次干净的打击重音,然后是短促收束的终音。加入细微水珠声与一次受控的放置声。音乐衬托产品声,而不是盖住它们。无人声,也没有库存感电影大轰鸣。
若需要超出声轨之外的产品视觉规划,可使用图生产品视频工作流。
4. 经授权的人声参考 + 新对白
仅使用人声参考 1 获取旁白的声线音色、语速与温暖的交谈能量。不要复用其原词或背景噪声。图像参考 1 中的人站在窗边说:“初稿只是开始。”保持台词可懂,并与可见说话人同步。加入安静的住宅房间底噪与窗外细雨。无音乐。该人声录音已获本用途授权。
测试目标人声特质是否能迁移,同时不无意复制源录音中的噪声、措辞或内容。用文字描述期望特质,这样即使参考贴合度有波动,指令仍然有用。
5. 社交剪辑的节奏参考
制作一段 12 秒蒙太奇:陶瓷艺术家塑形、上釉,并把成品杯子放到架子上。仅使用 audio reference 1 获取速度、节奏能量与剪辑节奏。创作一段旋律与声音设计都不同的原创打击乐。在主要节奏变化处切换画面动作:陶土落到转盘上、刷子触及釉面、杯子落到架子上。在音乐之下保留自然的转盘旋转、刷子质感,以及最终陶瓷轻敲声。无对白。
这把节奏条件与音乐复制分开,并给你三个可见同步点可检查。
可复用的 H3 音频评估方案
一份打磨过的官方演示,回答不了模型是否适合你的制作工作流。对同一简报至少生成三次,固定时长与参考,给每一次输出打分,而不是只挑最强结果。
先分开测试各层
从四个受控提示词开始:
- 仅对白与安静房间底噪
- 环境声与三个可见拟音事件,无语音、无音乐
- 器乐音乐,带两个计划中的视觉重音
- 一个经授权的音频参考,配对简单的图片或视频参考
只有这些过关后,才在同一拥挤场景中组合对白、环境声、拟音与音乐。这样失败才可诊断:你能分清问题来自发音、时机、参考迁移,还是混音密度。
用记分卡,而不是印象
| 维度 | 要回答的问题 | 简单度量 |
|---|---|---|
| 对白准确度 | 要求的词是否正确说出? | 正确词数 / 要求词数 |
| 口型同步 | 可见的闭嘴与音节重音是否对齐? | 1–5 分,并记下首次可见漂移 |
| 事件同步 | 接触声是否与画面动作落地? | 三个计划线索处早/晚多少帧 |
| 声线一致性 | 说话人是否在整句中保持可辨? | 分别给开头、中间、结尾打分 |
| 参考控制 | 要求的属性是否迁移,且无多余包袱? | 列出有意与无意迁移 |
| 立体声声像 | 左右位置是否有用且稳定? | 耳机检查 + 声道波形检查 |
| 混音层次 | 主层是否清晰可懂? | 正常回放电平下 1–5 分 |
| 可重复性 | 无需音频修复即可用的比例多高? | 可用输出 / 总次数 |
在视频编辑器或音频工作站中检查导出文件。确认存在两个声道,在单声道下听相位问题,并在计划接触事件附近比较波形。不要从社交平台预览推断音频质量,因为平台可能重压缩或重映射声轨。
提示
保留失败的生成结果。提示词修订只有在提高多次运行中的可用输出率时才算改进,而不是只产出一次幸运片段。
需要提前规划的限制
MiniMax 自己的发布帖也写明,H3 仍有提升空间,并把视觉细节列为未来工作方向之一。就音频制作而言,当前公开文档也留下若干开放问题。它并未公布词错误率、口型同步精度、响度、采样率、立体声以外的声道布局、语言覆盖、人声参考相似度,或时间码级线索控制的保证。
围绕这些实用边界做规划:
- 输出偏短: 4–15 秒适合镜头、广告与社交片段,但长片连贯性需要跨多次生成做剪辑。
- 参考上下文偏短: 最多允许三段音频,但合计时长不能超过 15 秒。
- 不能只提交音频参考: 参考音频必须至少配对一张图片或一个视频。
- 自然语言时机不是锁定时间线: 在重复测试证明你需要的精度之前,把节拍时间当作意图。
- 立体声需要核验: 双声道不会自动带来可信的方向感、纵深或单声道兼容性。
- 密集混音可能掩盖错误: 对白、效果、环境声与音乐可能被一起建模,但更简单的简报更易控制与修复。
- 参考权利仍然适用: 模型能力并不授予你模仿人声或复用受保护音乐的许可。
可用性、界面控件与计费也可能变化。MiniMax 当前官方定价将音频参考材料列为不另收输入费,而视频输出与部分其他参考材料按各自规则计费。在为 API 制作做预算前,请查看官方按量付费定价页;不要用第三方托管方的费率替代 MiniMax 自己的价格。H3 定价与规格指南 会梳理 MiniMax 官方费率与参考材料成本。当前 OmniArt 模型目录尚未确立 H3 可用性,因此本指南不声称 H3 已可在 OmniArt 内生成。
在 OmniArt 中补完其余声轨
原生音频可以减少交接,但并不会取消独立声音工具的价值。如果一次 H3 成片画面正确而旁白偏弱,保留画面,再搭一条受控人声轨。如果对白可用但房间缺质感,就加环境声或拟音层,而不是整段重生成。
OmniArt 把视频、语音、音效与音乐工作流收进同一个创意工作区。使用 AI 音效生成器指南 设计替代拟音与环境声,或对照 Veo 3.1 空间音频指南 比较提示词思路。目标不是把每一种声音都硬塞进一次生成,而是在原生声轨可用时保留它,只替换不好用的那一层。
准备好创作了吗?
开始用 AI 生成精彩内容