guideTutorials und Anleitungen15 Min. Lesezeit

MiniMax H3-Eingabeaufforderung: Steuern Sie jeden Referenzeingang

Lernen Sie die MiniMax H3-Eingabeaufforderung für Bild-, Video-, Audio- und Textreferenzen. Binden Sie jedes Asset an eine Rolle, verhindern Sie Konflikte und steuern Sie eine zeitgesteuerte KI-Videoaufnahme.

OmniArt-Team
MiniMax H3-Eingabeaufforderung: Steuern Sie jeden Referenzeingang

Die nützliche Idee hinter einer MiniMax H3-Eingabeaufforderung besteht nicht darin, „mehr Details zu schreiben“. Es heißt: „Geben Sie jeder Eingabe einen Job.“ H3 kann Text, Bilder, Video und Audio als einheitlichen Referenzsatz verwenden, sodass ein Ersteller die Produktidentität aus einem Standbild, die Bewegung aus einem Clip, das Tempo aus dem Audio und die Aufnahmerichtung aus der Eingabeaufforderung ableiten kann. Diese Flexibilität hilft nur, wenn das Modell erkennen kann, welche Quelle welchen Teil des Ergebnisses steuert.

Diese MiniMax H3-Eingabeaufforderungsanleitung setzt dieses Prinzip in ein wiederholbares Format um. Sie erfahren, wie Sie jedes Asset an eine Rolle binden, verhindern, dass Referenzen einander widersprechen, Aufbewahrungsregeln schreiben und eine Generation von 4 bis 15 Sekunden in zeitgesteuerte Beats unterteilen. Sechs Vorlagen am Ende umfassen Produktvideo, Charakterbewegung, Dialog, Videobearbeitung, UI-Bewegung und Übergänge vom ersten zum letzten Bild.

Hinweis

Dies ist ein dokumentationsbasierter Leitfaden, kein Bericht über H3-Generationen getestet von OmniArt. Es basiert auf der aktuellen H3-Generation von MiniMax Leitfaden und offiziell API Referenz. H3 ist derzeit im Source-of-Truth-Modellkatalog von OmniArt nicht bestätigt 31. Juli 2026. Schnittstellenbezeichnungen und Referenzsyntax können ebenfalls unterschiedlich sein Die eigenen Oberflächen und Downstream-Hosts von MiniMax.

MiniMax H3, Hailuo 3.0 oder Hailuo 03?

Die aktuelle Dokumentation von MiniMax nennt das Modell MiniMax H3 und gibt die offizielle API-Modellkennung als MiniMax-H3 an. Möglicherweise stoßen Sie auch auf Hailuo 3.0, Hailuo 03 oder Hailuo-3.0 in der Einführungsberichterstattung und in Katalogen von Drittanbietern, da Hailuo die Videoproduktmarke von MiniMax ist.

Verwenden Sie das Etikett, das für die Oberfläche vor Ihnen erforderlich ist. Für die zum Zeitpunkt der Veröffentlichung dokumentierte offizielle MiniMax V2-API bedeutet dies MiniMax-H3; Gehen Sie nicht davon aus, dass ein Marktplatz-Alias ​​auch eine gültige offizielle API-Kennung ist. In dieser Anleitung wird MiniMax H3 für das Modell und Referenzgeneration für den Modus verwendet, der Bild-, Video- und Audioeingänge kombiniert. „Omni-Referenz“ ist eine nützliche Beschreibung dieses Mixed-Media-Workflows, die offizielle API nennt ihn jedoch „Referenz-auf-Video“.

Kennen Sie die drei H3-Generierungsmodi

Die Auswahl des richtigen Modus erfolgt vor dem Schreiben der Eingabeaufforderung.

ModusEingabenVerwenden Sie es, wenn
Text-zu-VideoErforderliche TextaufforderungDie Szene kann allein aus der Beschreibung erstellt werden
Erstes/letztes Bild-zu-VideoErforderliche Eingabeaufforderung plus ein erster Frame, ein letzter Frame oder beidesAuf eine genaue Eröffnungs- oder Schlusskomposition kommt es an
ReferenzgenerierungErforderliche Eingabeaufforderung plus Referenzbilder, Videos oder AudioSie benötigen Identität, Design, Bewegung, Kamera, Stimme, Rhythmus oder Stil von hochgeladenen Assets

Die aktuelle offizielle Spezifikation listet 2K-Ausgaben und Ganzzahldauern von 4 bis 15 Sekunden auf. Jede Anfrage erfordert eine nicht leere Textaufforderung mit einer Begrenzung von 7.000 Zeichen. Eine Referenzanfrage kann bis zu neun Bilder, drei Videos und drei Audioclips mit insgesamt nicht mehr als 12 Assets umfassen. Referenzvideos sind insgesamt auf 15 Sekunden begrenzt, ebenso Referenz-Audioclips. Eine Audioreferenz kann nicht alleine eingereicht werden; es muss mindestens ein Bild oder Video begleiten.

Text-zu-Video erfordert ein konkretes Seitenverhältnis. Die Referenzgenerierung kann ein konkretes Verhältnis verwenden oder H3 eine adaptive Auswahl überlassen, während die Generierung des ersten/letzten Frames dem hochgeladenen Bild folgt. Die dokumentierten Verhältnisoptionen sind 21:9, 16:9, 4:3, 1:1, 3:4 und 9:16.

Es gibt eine harte Workflow-Grenze: Der Modus für den ersten/letzten Frame und die Referenzgenerierung können nicht in derselben API-Anfrage gemischt werden. Wenn genaue Grenzbilder wichtig sind, verwenden Sie den Modus „Erstes/letztes Bild“. Wenn Identität, Bewegung, Stil oder Audioübertragung wichtiger sind, verwenden Sie die Referenzgenerierung und beschreiben Sie die Eröffnungskomposition im Text.

Erstellen Sie eine H3-Eingabeaufforderung als Rollenzuordnung

Die API von H3 empfängt Medien als typisierte Elemente mit Rollen wie reference_image, reference_video und reference_audio. Diese technischen Rollen identifizieren den Medientyp; Ihre Eingabeaufforderung sollte noch einen Schritt weiter gehen und die kreative Verantwortung jedes Assets angeben.

Verwenden Sie diese Reihenfolge:

DELIVERABLE
What the final clip is for, its duration, and its format.

ROLE MAP
Reference image 1 = subject identity and immutable appearance.
Reference image 2 = environment or visual style only.
Reference video 1 = body motion and timing only.
Reference audio 1 = rhythm and edit timing only.

SHOT
Subject, action, environment, lighting, and camera direction.

TIMELINE
Time-coded beats that add up to the selected duration.

PRESERVE
Features that must remain unchanged from named references.

EXCLUDE
A short list of the most damaging unwanted changes.

Die oben nummerierten Bezeichnungen sind semantische Bezeichnungen für Ihre Kurzbeschreibung und kein Versprechen, dass jede H3-Schnittstelle wörtliche Reference image 1-Handles bereitstellt. In der offiziellen API sind die Dateien separate Elemente im content-Array. Verwenden Sie in einer visuellen Benutzeroberfläche die von der Oberfläche bereitgestellten Anhangsnamen oder Erwähnungssyntax und behalten Sie dann die gleiche Ein-Asset-ein-Job-Logik bei.

Geben Sie jedem Asset eine Hauptaufgabe

Eine Referenz enthält mehr Informationen, als Sie normalerweise übertragen möchten. Ein Tanzclip enthält einen Darsteller, Kleidung, Ort, Kamera, Beleuchtung, Bewegung und möglicherweise Musik. Wenn Sie H3 bitten, „dem Video zu folgen“, konkurrieren alle diese Funktionen mit Ihrem Charakterbild.

Stattdessen eng binden:

  • Bildreferenz: Identität, Gesicht, Garderobe, Produktgeometrie, Logo, Palette oder Umgebungsdesign.
  • Videoreferenz: Körperbewegung, Kameraweg, Aktionszeitpunkt, körperliche Interaktion oder Bearbeitungsrhythmus.
  • Audioreferenz: Stimmcharakter, Kadenz, Musikrhythmus, Atmosphäre oder ein Ereignishinweis.
  • Textaufforderung: die letzte Szene, Übertragungsregeln, Zeitleiste, Prioritäten und Aufbewahrungsanweisungen.

Wenn ein Asset zwei Aufgaben erledigen muss, benennen Sie beide und machen Sie die Grenze deutlich: „Referenzvideo 1 steuert Kamerapfad und Aktionszeitpunkt; ignorieren Sie seinen Darsteller, seine Garderobe, seinen Standort, seine Farbqualität und seinen Ton.“

Verhindern Sie, dass Referenzen miteinander kämpfen

Ein Referenzkonflikt ist normalerweise ein Anweisungsproblem, bevor es sich um ein Modellproblem handelt. Zwei Bilder können unterschiedliche Jacken zeigen, ein Bewegungsclip kann einen anderen Körpertyp verwenden oder ein Audio-Beat kann Schnitte andeuten, die mit einer gewünschten ununterbrochenen Kamerabewegung kollidieren.

Verwenden Sie eine schriftliche Prioritätsreihenfolge, wenn sich Eingaben überschneiden:

Priority order:
1. Reference image 1 controls character identity and wardrobe.
2. Reference video 1 controls movement and timing only.
3. Reference image 2 controls lighting palette and set design only.
4. The text prompt controls camera framing and final composition.

Lösen Sie dann Widersprüche auf, anstatt zu hoffen, dass H3 auf Ihre Präferenz schließen lässt. Wenn das Identitätsbild offene Haare aufweist, das bewegte Video jedoch einen Hut, geben Sie an, ob die letzte Figur die Haare behält oder den Hut trägt. Wenn eine Produktreferenz ein lesbares Etikett aufweist, das Stilbild jedoch malerisch ist, dann gilt die Stilisierung beispielsweise für die Umgebung, während die Verpackung fotorealistisch bleibt.

Drei Gewohnheiten reduzieren Konflikte:

  1. Verwenden Sie den kleinsten nützlichen Referenzsatz. Mehr Eingaben führen zu mehr möglichen Meinungsverschiedenheiten. Fügen Sie eine Datei nur hinzu, wenn sie Informationen liefert, die die Eingabeaufforderung nicht zuverlässig wiedergeben kann.
  2. Trennen Sie Inhalt und Stil. Geben Sie an, welcher Referenz das Thema und welcher die Behandlung gehört.
  3. Wählen Sie eine Kameraberechtigung aus. Übertragen Sie die Kamera entweder aus einem Video oder steuern Sie sie in Textform. Wenn Sie beides benötigen, geben Sie an, dass das Video das Timing liefert, während der Text das Framing überschreibt.

Für einen umfassenderen, Symptom-für-Symptom-Workflow halten Sie 7 Korrekturen für KI-Video-Eingabeaufforderungen neben diesem Leitfaden bereit, während Sie iterieren.

Schreiben Sie überprüfbare Erhaltungsanweisungen

„Konsistent bleiben“ ist zu vage. Ein Erhaltungsblock sollte sichtbare Eigenschaften benennen, die Sie in jedem Frame überprüfen können.

Für einen Charakter:

Preserve from reference image 1 throughout every frame: facial structure,
eye color, hairstyle and length, jacket cut, jacket color, and body proportions.
Do not replace the performer with the person from reference video 1.

Für ein Produkt:

Preserve from reference image 1: bottle silhouette, cap shape, label placement,
navy wordmark, coral seal, material finish, and relative proportions.
No duplicate product, redesigned packaging, extra text, or changing logo.

Positive Anker sollten an erster Stelle stehen; Ausschlüsse sind eine Leitplanke, nicht die ganze Aufforderung. Halten Sie die Negativliste kurz und spezifisch. Zehn vage Verbote können die vier Invarianten verwässern, die tatsächlich über die Brauchbarkeit eines Takes entscheiden.

Wenn derselbe Charakter in mehreren separat erstellten Clips erscheint, achten Sie darauf, dass der Identitäts- und Garderobenblock in jeder Eingabeaufforderung identisch ist. Der Consistent-Character-Workflow erklärt, wie man dieses wiederverwendbare Referenzpaket über eine längere Sequenz hinweg erstellt.

Steuern Sie die Zeit, nicht nur den Inhalt

H3 erlaubt Clips von 4 bis 15 Sekunden, aber ein langer Absatz sagt dem Modell nicht, wann jedes Ereignis eintritt. Eine Zeitleiste verwandelt die Eingabeaufforderung in einen kompakten Aufnahmeplan.

Für einen 10-Sekunden-Clip:

0–2 seconds: locked medium-wide establishing shot; subject holds still.
2–6 seconds: subject performs the referenced action at the source tempo.
6–9 seconds: camera makes one slow 20-degree arc to the right.
9–10 seconds: subject settles; hold a clean final composition for the edit.

Halten Sie jeden Beat umsetzbar. Eine Hauptaktion plus eine Kamerabewegung ist normalerweise klarer als eine Kette unabhängiger Transformationen. Achten Sie darauf, dass die Zeitbereiche zusammen die ausgewählte Dauer ergeben, platzieren Sie wichtige Produkt- oder Gesichtsdetails in einem langsameren Takt und reservieren Sie die letzte halbe Sekunde oder Sekunde für einen stabilen Schnittpunkt.

Audio kann denselben Takt verwenden:

At 2.0 seconds, the first downbeat starts the hand movement.
At 6.0 seconds, the bass hit motivates the camera arc.
From 9.0 seconds, let the music tail continue under the held final frame.

Weitere Informationen zu Objektiven, Licht und Kamera finden Sie im Cinematic AI Video Prompt Guide.

Sechs MiniMax H3-Eingabeaufforderungsvorlagen

Ersetzen Sie die in Klammern gesetzten Angaben, hängen Sie nur die aufgelisteten Assets an und passen Sie die Beschriftungen an die von Ihnen verwendete Schnittstelle an. Bei diesen Vorlagen handelt es sich um strukturierte Ausgangspunkte, die auf dokumentierten H3-Eingabemodi basieren. Es handelt sich nicht um behauptete Benchmark-Gewinner oder garantierte Ergebnisse.

Vorlage 1: Produktpräsentation mit Bewegungs- und Musikreferenzen

  • Modus: Referenzgenerierung
  • Assets: Ein sauberes Produktbild, ein Kamera-Bewegungsvideo, optionale Musikreferenz
Create a 10-second 9:16 product reveal for a paid social placement.

Role map:
- Reference image 1 controls the product's exact design, proportions, packaging,
  colors, materials, label placement, and wordmark.
- Reference video 1 controls camera path and acceleration only. Ignore its subject,
  location, lighting, color grade, and audio.
- Reference audio 1 controls beat and edit timing only.

Scene: The product stands centered on a warm-violet studio plinth. Soft lilac key
light from camera left, restrained coral rim light, subtle atmospheric haze.

Timeline:
- 0–2 seconds: static wide reveal on the first soft beat.
- 2–7 seconds: transfer the smooth push-and-arc movement from reference video 1.
- 7–9 seconds: one narrow highlight travels across the product surface.
- 9–10 seconds: camera settles; hold the label front-facing and readable.

Preserve reference image 1 exactly: silhouette, cap, material finish, label layout,
brand colors, and wordmark. Keep one product only. No redesigned packaging,
duplicate objects, extra text, warped label, or abrupt camera shake.

Für die Standbildvorbereitung, die vor dieser Eingabeaufforderung erfolgt, verwenden Sie den Foto-zu-Produkt-Video-Workflow.

Vorlage 2: Charakterbewegungsübertragung ohne Identitätsdrift

  • Modus: Referenzgenerierung
  • Assets: Ein Charakterbild, ein Bewegungsvideo, optionales Umgebungsbild
Create an 8-second 16:9 cinematic character performance.

Priority order:
1. Reference image 1 controls face, hair, body proportions, and wardrobe.
2. Reference video 1 controls body choreography and action timing only.
3. Reference image 2 controls the environment palette and architecture only.
4. This prompt controls framing and lighting.

The character from reference image 1 performs the complete movement from reference
video 1 in a moonlit station based on reference image 2. Medium full shot, camera
locked at chest height, soft directional light, realistic weight and foot contact.

Timeline:
- 0–1 seconds: character holds the starting pose.
- 1–7 seconds: perform the reference choreography once at its original tempo.
- 7–8 seconds: settle naturally and look toward camera left.

Preserve facial structure, hairstyle, coat shape, coat color, boots, and body
proportions from reference image 1 in every frame. Do not inherit the motion video's
performer, face, clothing, background, camera movement, or audio. No extra limbs,
sliding feet, costume changes, or cuts.

Vorlage 3: Dialogdarbietung mit Sprachbezug

  • Modus: Referenzgenerierung
  • Assets: Ein Charakterbild, eine autorisierte Stimme oder ein Dialog-Audioclip

Warnung

Laden Sie nur eine Stimme hoch, die Ihnen gehört oder für deren Verwendung Sie ausdrücklich die Erlaubnis haben. Ein Modell Wenn Sie Referenzaudio akzeptieren, erhalten Sie nicht das Recht, das Audiomaterial einer anderen Person nachzuahmen Stimme.

Create a 9-second 16:9 single-character dialogue shot.

Role map:
- Reference image 1 controls the speaker's appearance, wardrobe, and room design.
- Reference audio 1 controls spoken timing, cadence, emotional progression, and pauses.

Shot: Medium close-up, eye-level, 50 mm cinematic framing. The speaker begins calm,
briefly smiles after the central pause, then finishes with quiet confidence. Natural
blinks and restrained hand movement. Camera remains static; soft room tone underneath.

Timeline:
- 0–1 seconds: silent eye contact and a small inhale.
- 1–8 seconds: performance follows reference audio 1 exactly in timing and pauses.
- 8–9 seconds: mouth closes, expression settles, hold for the edit.

Preserve face, hairstyle, skin tone, jacket, background layout, and lighting direction
from reference image 1. Keep one speaker. No camera move, cutaway, background speech,
new words, exaggerated gestures, or wardrobe changes.

Vorlage 4: Ersetzen Sie eine Quellvideoumgebung

  • Modus: Referenzgenerierung
  • Assets: Ein Quellvideo, ein Umgebungsbild, optionales Motivbild
Create a 12-second 16:9 environmental replacement based on the source clip.

Role map:
- Reference video 1 controls shot length, subject action, physical timing, camera path,
  framing progression, and interaction with the ground.
- Reference image 1 controls the replacement environment, architecture, palette,
  weather, and lighting mood.
- Reference image 2 controls the subject's face and wardrobe, if supplied.

Replace the source video's location with the environment from reference image 1.
Preserve the original action and camera movement continuously. Match subject lighting,
contact shadows, reflections, and atmospheric perspective to the new environment.

Timeline follows reference video 1. Maintain one continuous shot with the original
action beats and no added event.

Preserve the source subject's position, scale, motion, and ground contact. Preserve
identity and wardrobe from reference image 2 when present. Do not copy the original
background, signage, bystanders, color grade, or source audio. No cuts, teleporting,
floating feet, or changing architecture.

Vorlage 5: Gebrandete UI-Bewegung synchronisiert mit einem Takt

  • Modus: Referenzgenerierung
  • Assets: Ein UI-Layoutbild, ein Video im Bewegungsstil, optionale Audioreferenz
Create a 7-second 1:1 UI motion-design clip for a product announcement.

Priority order:
1. Reference image 1 controls exact layout, hierarchy, component positions, text,
   logo, colors, corner shapes, and typography appearance.
2. Reference video 1 controls transition character and easing only.
3. Reference audio 1 controls the timing of three motion beats only.

Animate the interface from reference image 1 without redesigning it. Begin with the
main panel at rest. Use the restrained slide-and-scale transition quality from
reference video 1. Keep the camera orthographic and the background static.

Timeline:
- 0–1 seconds: complete layout at rest.
- 1–3 seconds: cards enter in sequence on beat one.
- 3–5 seconds: primary control changes state on beat two.
- 5–6 seconds: one subtle emphasis pulse on beat three.
- 6–7 seconds: complete interface holds sharp and readable.

Preserve every word, logo shape, component proportion, spacing relationship, and brand
color from reference image 1. No invented labels, misspelled text, extra panels,
perspective tilt, camera movement, glow overload, or elastic distortion.

Vorlage 6: Exakte Transformation vom ersten zum letzten Frame

  • Modus: Erstes/letztes Bild-zu-Video
  • Assets: Ein Bild des ersten Frames und ein Bild des letzten Frames; keine Referenzmedien
Create a 10-second transformation from the supplied first frame to the supplied last
frame. Preserve the subject's identity and the camera's fixed position throughout.

Timeline:
- 0–2 seconds: hold the first-frame composition; only subtle ambient movement.
- 2–7 seconds: the scene transforms progressively from the center outward. Materials
  change continuously with believable physical contact and no hard cut.
- 7–9 seconds: remaining details resolve into the last-frame design.
- 9–10 seconds: arrive exactly at the supplied last frame and hold it cleanly.

One continuous locked shot. Preserve subject scale, face, silhouette, horizon, lens,
and framing during the transition. No reference-style transfer, new characters,
camera movement, jump cut, flicker, or overshoot beyond the final composition.

Fügen Sie dieser Anfrage keine Referenzbilder, Videos oder Audiodateien der anderen Vorlagen bei. Die offizielle API behandelt die Generierung des ersten/letzten Frames und die Referenzgenerierung als sich gegenseitig ausschließende Modi.

Eine praktische Iterationsreihenfolge

Ändern Sie Identität, Bewegung, Kamera, Stil und Audioanweisungen nicht nach einem enttäuschenden Rendering. Dadurch ist es unmöglich herauszufinden, welche Anleitung geholfen hat.

Iterieren Sie in drei Durchgängen:

  1. Rollen und Invarianten sperren. Verwenden Sie den kleinsten Referenzsatz und stellen Sie sicher, dass das Thema oder Produkt erkennbar bleibt.
  2. Aktion und Zeitleiste sperren. Fügen Sie die Bewegungsquelle oder zeitgesteuerte Beats hinzu und halten Sie dabei den Stil einfach.
  3. Behandlung hinzufügen. Geben Sie Umgebung, Beleuchtung, Neigung, Audiohinweise und Enddetails ein, nachdem die ersten beiden Schichten stabil sind.

Wenn ein Ergebnis abweicht, vereinfachen Sie es, bevor Sie weitere negative Formulierungen hinzufügen. Entfernen Sie die unwichtigste Referenz, verkürzen Sie den Zeitrahmen oder geben Sie einer Quelle eine engere Aufgabe. Vergleichen Sie mehrere Varianten mit derselben Checkliste: Identität, Geometrie, Bewegung, Kamera, Audio-Timing und Stabilität des endgültigen Bildes.

Erste Schritte mit OmniArt

Es ist derzeit nicht bestätigt, dass MiniMax H3 in OmniArt auswählbar ist. Daher enthält dieser Artikel keinen Link zu einer H3-Erstellungsroute oder beansprucht einen OmniArt H3-Workflow. Sehen Sie sich die aktuelle OmniArt-Videomodellpalette für die heute verfügbaren Modelle an.

Die Rollenzuordnungsmethode lässt sich immer noch gut auf unterstützte referenzgesteuerte Videomodelle übertragen: Bereiten Sie ein Identitätsbild, eine Bewegungsquelle und einen kurzen Aufbewahrungsblock vor, bevor Sie den Arbeitsbereich öffnen. Halten Sie die Eingabeaufforderung modellneutral, bis das kreative Briefing stabil ist, und passen Sie dann die Anhangsbezeichnungen und die funktionsspezifische Syntax an das tatsächlich ausgewählte Modell an. Dadurch erhalten Sie jetzt ein wiederverwendbares Richtungsblatt und eine saubere H3-Eingabeaufforderung, wenn das Modell später OmniArt beitritt.

Offizielle API-Tarife, Referenzvideo-Abrechnungen und Beispiele für Arbeitskosten finden Sie im MiniMax H3-Preis- und Spezifikationsleitfaden. Es verwendet die eigene Preisseite von MiniMax anstelle eines Wiederverkäufertarifs.

Bereit zum Erstellen?

Starte mit KI die Erstellung beeindruckender Inhalte

Kostenlos starten