MiniMax H3 네이티브 오디오 가이드: 대사, 음악 및 싱크
MiniMax H3 네이티브 스테레오 오디오의 대사, 분위기음, 음악, 음성 참조와 싱크를 프롬프트로 지시하고 반복 가능한 제작 테스트 계획을 알아보세요.

MiniMax H3의 네이티브 오디오는 화면이 완성된 뒤 자동으로 더하는 파일이 아니라 사운드트랙을 생성 브리프의 일부로 만듭니다. MiniMax는 H3가 텍스트, 이미지, 영상, 오디오를 함께 이해한 뒤 네이티브 스테레오 사운드가 포함된 영상을 생성한다고 말합니다. 학습 범위 역시 음성, 음향 효과, 음악을 별도 도구가 아닌 하나의 오디오 영역으로 다룹니다.
이는 의미 있는 워크플로 변화이지만, 모든 문장이 완벽하게 발화되거나 모든 발걸음이 정확한 프레임에 맞거나 모든 스테레오 믹스가 바로 게시 가능한 상태라는 약속은 아닙니다. 이 가이드는 MiniMax가 문서화한 H3 기능과 크리에이터가 수행해야 할 제작 테스트를 구분합니다. 공식 데모를 독립적인 결과처럼 제시하지 않고, 실용적인 사운드 브리프 구조, 오디오 참조 워크플로, 5개 프롬프트 템플릿 및 반복 가능한 평가 점수표를 제공합니다.
MiniMax가 H3 오디오에 관해 공식적으로 문서화한 내용
MiniMax는 H3를 별도 사운드 패스가 붙은 무음 영상 생성기가 아니라 범용 멀티모달 영상 모델로 설명합니다. 회사의 출시 자료는 모델이 네이티브 스테레오 오디오를 생성하고 음성, 음향 효과, 음악을 함께 모델링한다고 말합니다. MiniMax는 또한 영상의 카메라 움직임, 이미지의 캐릭터, 오디오 참조에 맞춘 보컬을 결합한 프롬프트를 시연합니다.
공식 H3 영상 생성 가이드는 현재 API 경계를 다음과 같이 정의합니다.
| 문서화된 기능 | 크리에이터에게 의미하는 바 |
|---|---|
| 네이티브 스테레오 오디오 | H3는 생성 영상과 함께 2채널 사운드트랙을 반환할 수 있음 |
| 멀티모달 컨텍스트의 오디오 | 오디오 클립은 프롬프트에 설명한 음성, 움직임, 편집 리듬 또는 관계를 안내할 수 있음 |
| 최대 3개 오디오 참조 | 각 클립은 2–15초이며 모든 오디오 참조의 합계는 최대 15초 |
| 혼합 참조 | 오디오는 하나의 참조-영상 요청에서 이미지 및 영상과 결합 가능 |
| WAV 및 MP3 입력 | 참조 오디오는 문서화된 입력 형식 중 하나여야 함 |
| 4–15초 출력 | H3는 한 번의 생성으로 완성하는 장편 사운드트랙이 아니라 짧은 클립용으로 설계됨 |
중요한 제약은 세 가지입니다. 오디오 참조는 단독으로 제출할 수 없으며 MiniMax는 최소 하나의 이미지나 영상을 함께 요구합니다. 오디오 파일은 각각 15 MB로 제한되고, 전체 혼합 참조 요청은 12개 에셋으로 제한됩니다. 참조 모드는 동일한 요청에서 첫 프레임 또는 마지막 프레임 모드와 결합할 수도 없으므로, 정확한 경계 프레임과 더 폭넓은 멀티모달 조건화 중 촬영에 더 중요한 것을 결정하세요.
참고
스테레오는 공간 오디오와 다릅니다. MiniMax는 네이티브 스테레오 출력을 문서화하지만, 현재 공개 자료는 서라운드, 앰비소닉, 객체 기반 오디오 또는 특정 수준의 위치 정확도를 약속하지 않습니다. 결과를 공간적이라고 설명하기 전에 헤드폰으로 좌우 배치를 평가하세요.
프롬프트를 쓰기 전에 사운드 브리프 만들기
가장 유용한 H3 프롬프트는 긴 소리 목록이 아닙니다. 무엇이 주도해야 하는지, 무엇이 이를 뒷받침하는지, 무엇이 보이는 순간에 발생해야 하는지를 모델에 알려 주는 간결한 사운드 계획입니다. 다섯 단계로 계획을 작성하세요.
1. 시각 동작과 타이밍 고정하기
오디오 동기화는 보이는 사건에 의존합니다. 촬영, 피사체 동작, 카메라 움직임 및 비트 순서부터 시작하세요. “카메라가 멈춰 설 때 숟가락이 받침접시에 닿는다”는 모델에 공유된 시청각 사건을 제공합니다. “컵 소리를 추가한다”는 사건이 언제 일어나고 무엇이 그 원인인지 말해 주지 않습니다.
10초 클립의 단순한 비트 맵은 다음과 같을 수 있습니다.
- 0–3초: 공간과 피사체 설정
- 3–7초: 대사 또는 주요 동작
- 7–10초: 제품 공개와 마지막 사운드 큐
이 타이밍은 프레임 정확한 편집 마커가 아니라 연출로 다루세요. 제작 테스트는 출력이 이를 얼마나 가깝게 따르는지 측정해야 합니다.
2. 주요 오디오 레이어 하나 지정하기
관객이 먼저 알아차려야 할 소리를 고르세요. 대사, 제품 상호작용, 음악 훅 또는 환경음이 될 수 있습니다. 가장 명확한 표현을 사용하고 그 주변의 공간을 보호하세요.
대사가 주요 요소라면 정확한 문장을 따옴표로 쓰고 하나의 연기 지시를 지정하세요. 제품 소리가 주요 요소라면 이를 만드는 물리적 동작을 설명하세요. 음악이 주요 요소라면 템포, 악기 구성, 분위기 및 편곡이 바뀌어야 하는 지점을 명시하세요.
3. 분위기음을 음향적 장소로 더하기
분위기음은 촬영이 놓인 장소를 설명해야 합니다. “카페 소리” 대신 화자 뒤의 조용한 에스프레소 머신 쉭 소리, 낮은 실내 대화, 멀리서 들리는 문종을 설명하세요. 깨끗한 제품 광고라면 침묵이 의도적인 창작 선택이 아닌 한 침묵보다 제어된 스튜디오 룸 톤을 요청하세요.
화면과 소리에 모두 적용할 수 있는 거리 및 소재 표현을 사용하세요.
- 가까운, 건조한, 친밀한, 약한 잔향
- 멀리 있는, 유리 너머로 먹먹한, 화면 왼쪽 밖의
- 타일 위 발걸음, 천의 움직임, 금속 위 빗소리 또는 나무 위에 놓이는 유리
4. 음악이 스코어인지 현장 음악인지 결정하기
스코어는 장면 바깥에 있고 현장 음악은 장면 안의 물체나 장소에서 나옵니다. 어느 쪽을 의미하는지 명시하세요. “대사 아래 절제된 일렉트로닉 스코어”는 배경 레이어를 요청하지만, “카페 라디오에서 조용히 흘러나오는 약간 먹먹한 음악”은 화면 안의 음향 출처를 제공합니다.
음악이 필요하지 않을 때는 no music이라고 쓰세요. 그러면 대사나 폴리 테스트를 더 쉽게 판단할 수 있습니다. 음악이 필요하다면 모든 레이어가 크고 극적이어야 한다고 요청하는 대신 음성을 위한 헤드룸을 남기세요.
5. 제외 항목 명시하기
부정적 오디오 지시는 브리프를 보호할 때 유용합니다. 예를 들어 no narration, no crowd cheering, no added melody, no exaggerated whooshes가 있습니다. 제외 목록은 짧게 유지하세요. 제약이 너무 많으면 실제로 원하는 동작과 경쟁할 수 있습니다.
역할을 혼동하지 않고 오디오 참조 사용하기
H3의 참조 시스템은 모든 에셋에 하나의 역할이 있을 때 가장 유용합니다. 참조 오디오 클립은 보컬 음색과 억양, 음악적 에너지, 소리 질감 또는 편집 리듬을 제공할 수 있습니다. 모델이 어떤 속성을 가져와야 하는지 안다고 가정하지 마세요.
최종 프롬프트 전에 에셋 맵을 작성하세요.
| 에셋 | 할당된 역할 | 전송되면 안 되는 요소 |
|---|---|---|
| 캐릭터 이미지 | 정체성, 의상, 제품 배치 | 배경과 조명 |
| 모션 영상 | 제스처와 카메라 타이밍 | 캐릭터 정체성과 대사 |
| 음성 오디오 | 음성 특성, 억양, 감정 에너지 | 원래 말과 배경 소음 |
| 음악 오디오 | 템포, 편곡 밀도, 편집 리듬 | 알아볼 수 있는 멜로디나 가사 |
그다음 이러한 관계를 자연어로 설명하세요. MiniMax의 H3 예시는 영상 참조에 카메라 움직임을, 이미지 참조에 연기자를, 오디오 참조에 보컬을 할당하는 문장을 사용합니다. 번호가 붙은 에셋 레이블은 인터페이스마다 다르지만 API는 유형이 지정된 콘텐츠와 참조 역할을 사용하므로, 아래 템플릿의 레이블은 사용하는 워크플로에 표시된 정확한 표기로 바꾸세요.
경고
타인의 음성이나 퍼포먼스를 참조로 사용할 때는 반드시 허가를 받으세요. 음성 참조는 화자의 정체성, 녹음물, 음악 또는 생성된 모방을 게시할 권리를 소유한다는 증거가 아닙니다.
깨끗한 참조는 더 깨끗한 실험을 만듭니다. 무음을 잘라 내고, 관계없는 배경 음악을 제거하며, 클리핑을 피하고, 필요한 보컬이나 음악 구간이 잘 들리게 하세요. 기본값으로 최대 길이를 업로드하는 대신 원하는 특성을 보여 주는 짧은 구간을 사용하세요.
5개의 MiniMax H3 네이티브 오디오 프롬프트 템플릿
다음은 검증된 테스트 결과가 아니라 시작용 브리프입니다. 각 프롬프트를 한 번 이상 실행하고 다음 섹션의 프로토콜로 출력을 평가하세요.
1. 룸 톤이 있는 1인 대사
영업 종료 후 조용한 레스토랑 주방의 패스 앞에 선 셰프 클로즈업. 카메라는 화면 밖 동료를 바라보는 그녀에게 천천히 다가가고, 그녀는 “내일 다시 해봐요.”라고 말한다. 연기: 지쳤지만 조용히 낙관적이며 자연스러운 속도, “내일” 앞에 짧은 숨. 그녀의 목소리가 주요 오디오 레이어이고 가까우며 건조하다. 낮은 환기 소리와 가끔 들리는 금속 냉각음은 멀리 둔다. 음악, 내레이션, 다른 목소리는 없다.
이 템플릿으로 말의 정확성, 감정 전달, 입 움직임 및 분위기음이 대사 뒤에 남는지를 평가하세요.
2. 동기화된 폴리가 있는 레이어드 분위기음
밤의 거의 비어 있는 세탁소 와이드 샷. 형광등이 타일 바닥에 반사된다. 한 사람이 세탁기에서 젖은 재킷을 꺼내 바퀴 달린 바구니로 옮긴다. 손이 문을 닫는 정확한 순간 금속문이 찰칵 닫히고, 이어 바구니 바퀴가 타일 위에서 부드럽게 덜컹거린다. 전경: 천의 움직임과 문 닫히는 소리. 중경: 일정한 세탁기 회전. 배경: 앞 유리창에 내리는 비와 바깥을 지나가는 먼 차량 한 대. 네이티브 스테레오 믹스, 대사와 음악은 없다.
이 브리프는 분위기음, 소재의 사실감, 좌우 분리 및 접촉 동기화를 분리해 평가합니다.
3. 음악 중심 제품 공개
라일락 스튜디오 표면 위 반투명 코랄 스포츠 보틀을 위한 10초 세로형 제품 필름. 결로의 매크로 샷으로 시작하고 보틀이 주인공 위치로 떠오를 때 궤도를 돈다. 100 BPM의 독창적 미니멀 일렉트로닉 스코어: 시작에는 부드러운 펄스, 로고가 카메라를 향할 때 깔끔한 타악 악센트, 그 뒤 짧고 해소되는 마지막 음. 미세한 물방울과 하나의 제어된 배치음을 더한다. 음악은 제품 소리를 가리지 않고 뒷받침한다. 음성과 스톡 영상식 시네마틱 붐은 없다.
사운드트랙 외 제품별 시각 계획은 사진을 제품 영상으로 만드는 워크플로를 참고하세요.
4. 허가받은 음성 참조로 새 대사 만들기
음성 참조 1은 내레이터의 음색, 말하는 속도, 따뜻하고 대화하듯 하는 에너지에만 사용한다. 그 말이나 배경 소음을 재사용하지 않는다. 이미지 참조 1의 인물은 창가에 서서 “The first draft is only the beginning.”이라고 말한다. 말이 또렷하고 보이는 화자와 동기화되게 유지한다. 조용한 주거 공간의 룸 톤과 밖의 부드러운 빗소리를 더한다. 음악은 없다. 이 음성 녹음은 이 용도로 허가되었다.
참조 준수가 달라지더라도 지시가 유용하도록, 원하는 특성을 단어로 설명하면서 원본 녹음의 소음, 억양 또는 내용을 의도치 않게 복사하지 않고 목표 음성 특성이 전달되는지 테스트하세요.
5. 소셜 편집을 위한 리듬 참조
도예가가 도자기를 빚고, 유약을 바르고, 완성된 컵을 선반에 놓는 12초 몽타주를 만든다. 오디오 참조 1은 템포, 리드미컬한 에너지, 편집 페이싱에만 사용한다. 다른 멜로디와 사운드 디자인으로 독창적인 타악 트랙을 작곡한다. 주요 리듬 변화에 맞춰 시각 동작을 자른다. 흙이 물레에 놓이고, 붓이 유약에 닿고, 컵이 선반에 도달한다. 음악 아래에서도 자연스러운 물레 회전, 붓의 질감, 마지막 도자기 탭을 유지한다. 대사는 없다.
이는 리듬 조건화를 음악 복사와 분리하고 검사할 수 있는 세 개의 가시적 싱크 지점을 제공합니다.
반복 가능한 H3 오디오 평가 계획
완성도 높은 공식 데모 하나로는 모델이 제작 워크플로에 맞는지 알 수 없습니다. 같은 브리프를 최소 세 번 생성하고, 길이와 참조를 고정하며, 가장 강한 결과만 고르지 말고 모든 출력을 평가하세요.
먼저 레이어를 따로 테스트하기
다음 4개의 제어된 프롬프트로 시작하세요.
- 대사와 조용한 룸 톤만
- 말이나 음악 없이 분위기음과 눈에 보이는 폴리 사건 3개
- 계획된 시각 악센트 2개가 있는 기악 음악
- 간단한 이미지 또는 영상 참조와 짝지은 허가된 오디오 참조 1개
이 항목들이 통과한 뒤에야 대사, 분위기음, 폴리, 음악을 하나의 복잡한 장면에 결합하세요. 이렇게 하면 발음, 타이밍, 참조 전송, 믹스 밀도 중 어디에서 문제가 생겼는지 진단할 수 있습니다.
인상이 아닌 점수표 사용하기
| 차원 | 답할 질문 | 간단한 측정 방법 |
|---|---|---|
| 대사 정확성 | 요청한 말이 올바르게 발화되었는가? | 올바른 단어 수를 요청한 단어 수로 나눔 |
| 립싱크 | 보이는 입 다물림과 음절 강세가 정렬되는가? | 1–5점으로 평가하고 처음 보이는 드리프트 기록 |
| 이벤트 싱크 | 접촉 소리가 화면의 동작과 일치하는가? | 계획한 큐 3개에서 빠르거나 늦은 프레임 수 |
| 음성 일관성 | 화자가 대사 전체에서 알아볼 수 있는가? | 시작, 중간, 끝을 따로 평가 |
| 참조 제어 | 원하지 않는 요소 없이 요청한 속성이 전송되었는가? | 의도한 전송과 의도치 않은 전송 목록화 |
| 스테레오 이미지 | 좌우 배치가 유용하고 안정적인가? | 헤드폰 확인과 채널 파형 확인 |
| 믹스 위계 | 주요 레이어가 명확하게 알아들을 수 있는가? | 일반 재생 레벨에서 1–5점 평가 |
| 반복 가능성 | 오디오 보정 없이 사용할 수 있는 클립의 빈도는 얼마인가? | 사용할 수 있는 출력 수를 전체 실행 수로 나눔 |
내보낸 파일을 영상 편집기나 오디오 워크스테이션에서 검사하세요. 두 채널이 있는지 확인하고, 모노에서 위상 문제를 들으며, 계획된 접촉 사건 주변의 파형을 비교하세요. 사운드트랙을 재압축하거나 다시 매핑할 수 있는 소셜 플랫폼 미리보기만으로 오디오 품질을 추론하지 마세요.
팁
실패한 생성도 보관하세요. 프롬프트 수정은 운 좋게 한 클립을 얻었기 때문이 아니라, 반복 실행 전반에서 사용할 수 있는 출력 비율을 높일 때만 개선입니다.
계획해야 할 제한 사항
MiniMax의 자체 출시 글은 H3에 여전히 개선의 여지가 있으며 시각적 디테일을 향후 개선 영역으로 언급합니다. 오디오 제작의 경우 현재 공개 문서에도 몇 가지 질문이 남아 있습니다. 단어 오류율, 립싱크 정확도, 라우드니스, 샘플 레이트, 스테레오 외 채널 레이아웃, 언어 지원, 음성 참조 유사성 또는 타임코드 수준 큐 제어에 대한 보장을 공개하지 않습니다.
다음과 같은 실용적 경계를 고려해 계획하세요.
- 짧은 출력: 4–15초는 샷, 광고, 소셜 클립에 적합하지만 장편 연속성에는 여러 생성에 걸친 편집이 필요합니다.
- 짧은 참조 컨텍스트: 최대 3개의 오디오 클립이 허용되지만 합산 길이는 15초를 넘을 수 없습니다.
- 오디오만으로 참조 요청 불가: 참조 오디오 클립은 최소 하나의 이미지 또는 영상과 짝지어야 합니다.
- 자연어 타이밍은 고정된 타임라인이 아님: 반복 테스트가 필요한 정밀도를 입증할 때까지 비트 타이밍은 의도로 다루세요.
- 스테레오는 검증이 필요함: 두 채널이 있다고 해서 믿을 만한 방향성, 깊이 또는 모노 호환성이 자동으로 생기지는 않습니다.
- 복잡한 믹스는 오류를 가릴 수 있음: 대사, 효과음, 분위기음, 음악은 모두 함께 모델링될 수 있지만 단순한 브리프가 제어하고 보정하기 쉽습니다.
- 참조 권리는 여전히 적용됨: 모델 기능이 음성을 모방하거나 보호된 음악을 재사용할 허가를 부여하지는 않습니다.
가용성, 인터페이스 제어, 과금도 바뀔 수 있습니다. MiniMax의 현재 공식 가격은 오디오 참조 자료에 별도 입력 요금을 부과하지 않지만, 영상 출력과 일부 다른 참조 자료에는 각각의 규칙에 따라 과금됩니다. API 제작 예산을 세우기 전에 공식 종량제 가격 페이지를 확인하고, 제3자 호스트의 요금을 MiniMax의 자체 가격으로 대체하지 마세요. H3 가격 및 사양 가이드는 MiniMax의 공식 요금과 참조 자료 비용을 살펴봅니다. 현재 OmniArt 모델 카탈로그는 H3의 제공 여부를 확정하지 않으므로, 이 가이드는 H3가 이미 OmniArt에서 생성 가능하다고 주장하지 않습니다.
OmniArt에서 나머지 사운드트랙 만들기
네이티브 오디오는 전달 단계를 줄일 수 있지만 별도 사운드 도구의 가치를 없애지는 않습니다. H3 결과에 화면은 맞지만 내레이션이 약하다면 화면은 유지하고 제어된 음성 트랙을 만드세요. 대사는 잘되지만 공간의 질감이 부족하다면 전체 샷을 다시 생성하는 대신 분위기음이나 폴리 레이어를 추가하세요.
OmniArt는 영상, 음성, 사운드, 음악 워크플로를 하나의 창작 작업 공간에 모읍니다. AI 음향 효과 생성기 가이드를 사용해 대체 폴리와 분위기음을 설계하거나, Veo 3.1 공간 오디오 가이드와 프롬프트 접근 방식을 비교하세요. 목표는 모든 소리를 하나의 생성에 억지로 넣는 것이 아닙니다. 잘 작동하는 네이티브 트랙은 유지하고 그렇지 않은 레이어만 교체하는 것입니다.
제작할 준비가 되셨나요?
AI로 멋진 콘텐츠를 생성하세요