guideチュートリアルと使い方ガイド26分で読めます

MiniMax H3ネイティブ音声ガイド:台詞、音楽、同期

MiniMax H3のネイティブステレオ音声を、台詞、環境音、音楽、声の参照、同期に活用するプロンプトと、再現可能な制作テスト計画を解説します。

OmniArt チーム
MiniMax H3ネイティブ音声ガイド:台詞、音楽、同期

MiniMax H3のネイティブ音声は、映像完成後に自動的に追加するファイルではなく、サウンドトラックを生成ブリーフの一部にします。MiniMaxによれば、H3はテキスト、画像、動画、音声を共同で理解し、ネイティブステレオ音声を持つ動画を生成します。学習の対象範囲でも、声、効果音、音楽を別々のツールではなく1つの音声領域として扱っています。

これは意味のあるワークフローの変化ですが、すべての台詞が完璧に話されること、すべての足音が正しいフレームに着地すること、すべてのステレオミックスが公開可能になることを約束するものではありません。このガイドでは、MiniMaxが文書化したH3の能力と、クリエイターが行うべき制作テストを分けます。公式デモを独立した結果として示すことなく、実用的なサウンドブリーフの構造、音声参照のワークフロー、5つのプロンプトテンプレート、再現可能な評価スコアカードを提供します。

MiniMaxがH3音声について公式に文書化していること

MiniMaxはH3を、別の音声処理を伴う無音動画ジェネレーターではなく、汎用マルチモーダル動画モデルとして説明しています。同社のローンチ資料では、モデルがネイティブステレオ音声を生成し、声、効果音、音楽を共同でモデル化するとされています。MiniMaxは、動画からのカメラ移動、画像からのキャラクター、音声参照に一致するボーカルを組み合わせるプロンプトも実演しています。

公式H3動画生成ガイドは、現在のAPI境界を定義しています。

文書化された能力クリエイターにとっての意味
ネイティブステレオ音声H3は生成動画とともに2チャンネルのサウンドトラックを返せる
マルチモーダルコンテキストとしての音声音声クリップは、声、動き、編集リズム、またはプロンプトで説明した別の関係を導ける
最大3つの音声参照各クリップは2~15秒、全音声参照の合計は最大15秒
混合参照音声は、1回の参照動画生成リクエストで画像や動画と組み合わせられる
WAVおよびMP3入力参照音声は文書化された入力形式のいずれかを使う必要がある
4~15秒の出力H3は短いクリップ向けであり、1回の生成で完結する長尺サウンドトラック向けではない

重要な制約が3つあります。音声参照は単独では送信できず、MiniMaxは少なくとも1つの画像または動画を一緒に必要とします。音声ファイルはそれぞれ15 MBまでで、混合参照リクエスト全体は12アセットまでです。また、同じリクエストで参照モードと最初のフレームまたは最後のフレームモードを組み合わせることはできません。ショットでは、正確な境界フレームと、より幅広いマルチモーダル条件付けのどちらが重要かを決めてください。

メモ

ステレオは空間音声と同じではありません。MiniMaxはネイティブステレオ出力を文書化 していますが、現在の公開資料ではサラウンド、アンビソニック、オブジェクトベース音声、 または特定水準の位置精度を約束していません。結果を空間的と説明する前に、ヘッドホンで 左右の配置を評価してください。

プロンプトを書く前にサウンドブリーフを作る

最も有用なH3プロンプトは、長い音のリストではありません。何を主役にし、何がそれを支え、見える瞬間に何を起こすべきかをモデルに伝える、簡潔なサウンドプランです。計画は5段階で書きます。

1. 視覚アクションとタイミングを固定する

音声の同期は可視イベントに依存します。ショット、被写体の動き、カメラ移動、ビートの並びから始めましょう。「カメラが止まるとき、スプーンが受け皿に当たる」なら、モデルに共通の視聴覚イベントを与えられます。「カップの音を追加する」では、いつ起こるのか、何がそのイベントを生むのかが分かりません。

10秒のクリップでは、シンプルなビートマップは次のようになります。

  • 0~3秒:部屋と被写体を確立する
  • 3~7秒:台詞または主なアクション
  • 7~10秒:商品公開と最後の音のきっかけ

これらのタイミングは、フレーム単位で正確な編集マーカーではなく、演出として扱ってください。制作テストでは、出力がどの程度それに従うかを測定すべきです。

2. 主となる音声レイヤーを1つ決める

観客に最初に気付いてほしい音を選びます。台詞、商品との相互作用、音楽のフック、環境音の一部などです。最も明確な表現を与え、その周囲の空間を守ります。

台詞が主役なら、正確な文を引用符で書き、演技指示を1つ指定します。商品音が主役なら、その音を生む物理的アクションを説明します。音楽が主役なら、テンポ、編成、ムード、アレンジを変える場所を示します。

3. 環境音を音響的な場所として加える

環境音は、ショットがどこに存在するかを説明するべきです。「カフェの音」ではなく、話者の後ろにある静かなエスプレッソマシンの蒸気音、低い店内の会話、遠くのドアチャイムを説明します。クリーンな商品スポットでは、無音が意図的な創作選択でない限り、無音ではなく制御されたスタジオのルームトーンを求めてください。

映像と音声の両方に当てはまる、距離と素材の言葉を使います。

  • 近く、ドライ、親密で、軽い残響がある
  • 遠く、ガラス越しにこもっている、または画面外の左側
  • タイル上の足音、布の動き、金属に当たる雨、木に置かれるグラス

4. 音楽が劇伴か作中音かを決める

劇伴はシーンの外側にあり、作中音楽はシーン内の物や場所から流れます。どちらを意味するかを示してください。「台詞の下に控えめなエレクトロニックの劇伴」は背景レイヤーを求めますが、「カフェラジオから静かに流れる、少しこもった音楽」なら、画面内の音響源を与えます。

音楽が不要なときはno musicと書いてください。これにより、台詞やフォーリーのテストを判断しやすくなります。音楽が必要なときは、すべてのレイヤーを大きく劇的にするのではなく、声のための余裕を残します。

5. 除外事項を記す

ネガティブな音声指示は、ブリーフを守るときに役立ちます。例にはno narrationno crowd cheeringno added melodyno exaggerated whooshesがあります。除外リストは短くしてください。制約が多すぎると、実際に望むアクションと競合することがあります。

役割を混同せずに音声参照を使う方法

H3の参照システムは、各アセットに1つの役割があるときに最も有用です。参照音声クリップは、声質と抑揚、音楽的エネルギー、音の質感、編集リズムを与えられます。モデルがどの特性を借りるべきかを知っていると考えないでください。

最終プロンプトの前にアセットマップを書きます。

アセット割り当てる役割移してはならないもの
キャラクター画像同一性、衣装、商品配置背景と照明
モーション動画ジェスチャーとカメラタイミングキャラクターの同一性と台詞
声の音声声の性格、抑揚、感情的エネルギー元の言葉と背景ノイズ
音楽音声テンポ、編曲密度、編集リズム認識可能なメロディーや歌詞

次に、その関係を自然な言葉で説明します。MiniMax自身のH3例では、動画参照にカメラ移動を、画像参照に演者を、音声参照にボーカルを割り当てる文を使っています。番号付きアセットラベルはインターフェースごとに異なりますが、APIは型付きコンテンツと参照役割を使うため、以下のテンプレート内のラベルはワークフローに表示される正確な表記へ置き換えてください。

警告

人の声や演技を参照として使うのは、許可を得ている場合だけにしてください。声の参照は、 話者の同一性、録音、音楽、または生成した模倣を公開する権利を所有している証拠にはなりません。

クリーンな参照ほど、実験もクリーンになります。無音部分をトリミングし、関係のない背景音楽を取り除き、クリッピングを避け、必要な声や音楽の箇所を聞き取りやすく保ってください。既定で最大時間をアップロードするのではなく、望む特性を示す短い区間を使います。

MiniMax H3ネイティブ音声のプロンプトテンプレート5選

これらは出発点となるブリーフであり、テスト済みの結果ではありません。各プロンプトを複数回実行し、次のセクションのプロトコルで出力を採点してください。

1. ルームトーン付きの1人話者の台詞

営業終了後の静かなレストラン厨房で、調理台に立つシェフのクローズアップ。彼女は画面外の同僚の方を見ながらカメラがゆっくり寄り、「明日、もう一度やってみよう」と言う。話し方:疲れているが静かに楽観的。自然なペースで、「明日」の前に短く1度息を吸う。彼女の声を主音声レイヤーとし、近くてドライにする。低い換気扇のうなりと、ときどき聞こえる金属の冷える音は遠くに保つ。音楽、ナレーション、ほかの声はなし。

このテンプレートで、発話の正確さ、感情表現、口の動き、環境音が台詞の後ろに留まるかを評価します。

2. 同期したフォーリーを伴う重層的な環境音

夜の、ほとんど人のいないコインランドリーのワイドショット。蛍光灯がタイル床に反射している。人物が濡れたジャケットを洗濯機からキャスター付きのかごへ移す。手で閉める瞬間に金属扉が正確にカチッと閉まり、その後かごの車輪がタイルの上を柔らかくがたつく。前景:布の動きと扉のクリック音。中景:安定した洗濯機の回転音。背景:正面窓に当たる雨と、外を通る遠くの車1台。ネイティブステレオミックス、台詞なし、音楽なし。

このブリーフは、環境音、素材のリアリズム、左右の分離、接触の同期を切り分けます。

3. 音楽主導の商品公開

ライラックのスタジオ面に置かれた半透明コーラルのスポーツボトルの、10秒縦型商品映像。結露のマクロショットから始め、ボトルが主役位置へ上がるにつれて周回する。100 BPMのオリジナルでミニマルなエレクトロニック劇伴:冒頭は柔らかなパルス、ロゴがカメラを向く瞬間に明瞭なパーカッシブアクセント、次に短く解決する終止音。控えめな水滴と、制御された1つの設置音を加える。音楽は商品音を覆い隠すのではなく支える。声なし、ストック映像風のシネマティックなブーム音なし。

サウンドトラック以外の商品固有の視覚計画については、写真から商品動画を作るワークフローを参照してください。

4. 許可済みの声の参照と新しい台詞

声の参照1は、ナレーターの声質、話す速さ、温かく会話的なエネルギーにのみ使う。その言葉や背景ノイズは再利用しない。画像参照1の人物は窓のそばに立ち、「最初の下書きは、始まりにすぎない」と言う。発話を聞き取りやすくし、見えている話者と同期させる。静かな住宅のルームトーンと、外の柔らかな雨を加える。音楽なし。この声の録音はこの利用のために許可されている。

元の録音からノイズ、言い回し、内容を意図せずコピーせずに、意図した声の特性が移るかをテストします。参照への追従が変わっても指示が役立つよう、望む特性を言葉で説明してください。

5. ソーシャル編集用のリズム参照

陶芸家が成形、施釉、完成したカップを棚に置く12秒のモンタージュを作る。音声参照1は、テンポ、リズムのエネルギー、編集ペースにのみ使う。異なるメロディーとサウンドデザインによるオリジナルのパーカッシブトラックを作曲する。大きなリズム変化で視覚アクションをカットする:粘土がろくろに置かれる、筆が釉薬に触れる、カップが棚に届く。自然なろくろの回転、筆の質感、音楽の下にある最後の陶器の軽い音を維持する。台詞なし。

これにより、リズムの条件付けと音楽のコピーを分け、確認できる3つの同期点が得られます。

再現可能なH3音声評価計画

洗練された公式デモ1本では、モデルが制作ワークフローに適するかに答えられません。同じブリーフで少なくとも3回生成し、時間と参照を固定し、最も強い結果だけを選ぶのではなく、すべての出力を採点してください。

最初にレイヤーを個別にテストする

まず、4つの制御されたプロンプトから始めます。

  1. 台詞と静かなルームトーンのみ
  2. 発話も音楽もない、環境音と見える3つのフォーリーイベント
  3. 計画した2つの視覚アクセントを持つインストゥルメンタル音楽
  4. シンプルな画像または動画参照と組み合わせた、1つの許可済み音声参照

これらが通ってから、台詞、環境音、フォーリー、音楽を1つの混み合ったシーンに組み合わせます。こうすれば失敗を診断できます。問題が発音、タイミング、参照転送、ミックス密度のどれから来るかを判別できます。

印象ではなくスコアカードを使う

評価軸答えるべき質問シンプルな測定
台詞の正確さ要求した言葉が正しく話されたか正しい語数を要求語数で割る
リップシンク見える口の閉じ方と音節の強勢は合っているか1~5で採点し、最初に見えるずれを記録
イベント同期接触音は映っているアクションに着地するか計画した3つの合図で何フレーム早いか遅いか
声の一貫性話者は台詞を通じて識別できるか冒頭、中盤、終盤を別々に採点
参照制御望む特性が不要な付随要素なしに移ったか意図した転送と意図しない転送を列挙
ステレオイメージ左右の配置は有用で安定しているかヘッドホン確認とチャンネル波形確認
ミックスの階層主レイヤーは明瞭に聞き取れるか通常の再生音量で1~5を採点
再現性音声修正なしでクリップを使える頻度はどの程度か使用可能な出力数を実行総数で割る

書き出したファイルは、動画編集ソフトまたはオーディオワークステーションで確認してください。2チャンネルが存在することを確かめ、モノラル時の位相問題を聞き、計画した接触イベントの周辺で波形を比較します。再圧縮やサウンドトラックの再マッピングを行うことがあるため、ソーシャルプラットフォームのプレビューから音質を推測しないでください。

ヒント

失敗した生成も残してください。プロンプトの改訂が改善と言えるのは、偶然うまくいった クリップを1本生むことではなく、反復実行全体で使用可能な出力率を高める場合だけです。

計画に織り込むべき制約

MiniMax自身のローンチ投稿では、H3にはまだ改善の余地があり、視覚的な細部を今後の改善領域の1つとして挙げています。音声制作についても、現在の公開ドキュメントはいくつかの問いを未解決のままにしています。単語誤り率、リップシンク精度、ラウドネス、サンプルレート、ステレオ以外のチャンネルレイアウト、言語対応、声の参照類似度、タイムコード水準の合図制御について、保証は公開されていません。

次の実用的な境界を前提に計画してください。

  • **短い出力:**4~15秒はショット、広告、ソーシャルクリップに適しますが、長尺での連続性には複数生成をまたぐ編集が必要です。
  • **短い参照コンテキスト:**最大3つの音声クリップが許可されますが、合計時間は15秒を超えられません。
  • **音声のみの参照リクエストは不可:**参照音声クリップには、少なくとも1つの画像または動画を組み合わせる必要があります。
  • **自然言語によるタイミングは固定タイムラインではない:**反復テストで必要な精度が証明されるまで、ビートのタイミングは意図として扱ってください。
  • **ステレオには検証が必要:**2チャンネルであっても、説得力のある方向感、奥行き、モノラル互換性が自動的に生まれるわけではありません。
  • **密なミックスはエラーを隠し得る:**台詞、効果、環境音、音楽をすべて一緒にモデル化できますが、よりシンプルなブリーフの方が制御・修正しやすくなります。
  • **参照の権利は引き続き適用される:**モデルの能力は、声を模倣したり保護された音楽を再利用したりする許可を与えません。

利用可能性、インターフェースコントロール、課金も変わる可能性があります。MiniMaxの現在の公式料金では、音声参照素材に別個の入力料金はありませんが、動画出力と一部の参照素材にはそれぞれのルールで課金されます。API制作の予算を立てる前に、公式従量課金料金ページを確認してください。第三者ホストの料金をMiniMax自身の価格の代わりに使ってはいけません。H3料金と仕様ガイドでは、MiniMaxの公式料金と参照素材の費用を確認できます。現在のOmniArtモデルカタログはH3の利用可能性を確立していないため、このガイドはH3がすでにOmniArt内で生成できるとは主張しません。

OmniArtでサウンドトラックの残りを作る

ネイティブ音声は引き継ぎを減らせますが、別個のサウンドツールの価値をなくすものではありません。H3のテイクに適切な映像がありナレーションが弱いなら、映像は残して制御された音声トラックを作ります。台詞は機能していても部屋に質感が欠けるなら、ショット全体を再生成する代わりに環境音またはフォーリーレイヤーを追加します。

OmniArtは動画、音声、サウンド、音楽のワークフローを1つのクリエイティブワークスペースにまとめます。AI効果音ジェネレーターガイドで置き換え用のフォーリーと環境音を設計するか、Veo 3.1空間音声ガイドとプロンプト手法を比較してください。目標は、すべての音を1回の生成に押し込むことではありません。うまく機能するネイティブトラックは保持し、機能しないレイヤーだけを置き換えることです。

OmniArtで動画制作ワークフローを見る

制作を始めますか?

AIで魅力的なコンテンツを生成しましょう

無料で始める