Grok Imagine: der Creator-Leitfaden zum Videomodell von xAI 2026
Praxis-Leitfaden zu Grok Imagine — sechs Generierungsmodi, Prompt-Muster, echte Kostenrechnung und wann du es 2026 V6 oder Sora 2 vorziehst.

Grok Imagine ist das Video- und Audio-Generierungsmodell von xAI, im Januar 2026 gestartet und über OmniArt zugänglich, ohne dass du ein eigenes xAI-Abonnement brauchst. Es ist ein anderes Produkt als der Grok-Chatbot — die beiden teilen sich einen Namen und sonst nichts. Dieser Leitfaden behandelt, wofür Grok Imagine gebaut ist, welche sechs Generierungsmodi zählen, welche Prompt-Muster jedem Modus gerecht werden, und was echte Projekte tatsächlich an Credits kosten.
Was Grok Imagine ist
Grok Imagine erzeugt Video bis 720p mit nativem Audio in Clips von 1 bis 15 Sekunden. Der eigentliche Trick ist nicht die Auflösung — mit 720p tritt es bewusst nicht gegen Sora 2 oder V6 um die reine Bildtreue an. Der eigentliche Trick ist die Workflow-Oberfläche rund um das Modell: sechs Generierungsmodi, die sich ein Weight-Set teilen und dich generieren, verlängern, umstylen und bearbeiten lassen, ohne das Modell zu verlassen.
| Spezifikation | Wert |
|---|---|
| Maximale Auflösung | 720p (für 1080p und mehr nimm V6) |
| Maximale Dauer | 15 Sekunden pro Generierung |
| Seitenverhältnisse | 16:9, 4:3, 1:1, 9:16, 3:4, 3:2, 2:3 |
| Audio | nativ, gemeinsam mit dem Video erzeugt |
| Kosten (480p) | 10 Credits pro Sekunde |
| Kosten (720p) | 15 Credits pro Sekunde |
Die sechs Modi, die du kennen solltest
Jeder Modus ist eine andere Art, dem Modell mitzuteilen, mit welcher Sorte Eingabe es arbeitet. Den richtigen Modus zu wählen, ist der größte Teil der Prompt-Arbeit.
Text-zu-Video
Der Standard. Prompt schreiben, Clip bekommen. Am besten für die Erkundung von Konzepten, Moodboards und Social-Entwürfe, für die du noch kein Referenzbild hast. Die Kosten liegen je nach Auflösung bei 10 bis 15 Credits pro Sekunde.
Bild-zu-Video
Animiert ein Standbild und bewahrt dabei die Komposition der Eingabe. Das erste Bild wird auf dein Bild festgesperrt. Nimm es für Illustrationen, Produktfotografie und Design-Mockups, bei denen das Ausgangsbild nicht verhandelbar ist.
Referenzmodus — das Unterscheidungsmerkmal
Der Referenzmodus nimmt 1 bis 7 Bilder als visuelle Anker an, ohne das erste Bild festzusperren. Du markierst Bilder mit @Image1, @Image2, @Image3 und beziehst dich im Prompt darauf. Genau das haben die meisten anderen Videomodelle nicht — die meisten sperren entweder das erste Bild fest (Bild-zu-Video) oder nehmen gar keine Referenz an (Text-zu-Video). Der Referenzmodus sitzt dazwischen und ist der sauberste Weg zu Figurenkonsistenz über mehrere Einstellungen hinweg.
Die Kosten liegen bei 15 Credits pro Sekunde bei 480p und 22,5 bei 720p.
Extend-Modus
Hängt 2 bis 10 Sekunden an einen bestehenden Clip an. Die Eingabe ist eine MP4-Datei zwischen 2 und 15 Sekunden Länge. Die Ausgabe ist ein einziger durchgehender Clip; abgerechnet wird nur der angehängte Teil. Der modellübergreifende Trick: Der Extend-Modus funktioniert mit Videos, die von jedem Modell im OmniArt-Video-Workspace erzeugt wurden, nicht nur von Grok.
Modify-Modus
Bearbeitet einen bestehenden Clip, ohne ihn neu zu generieren — Hintergrundwechsel, Lichtänderungen, Farbverschiebungen an einzelnen Objekten, Wettereffekte. Die Eingabe ist auf 8 Sekunden begrenzt und wird automatisch auf 854×480 skaliert, was bedeutet, dass hochauflösende Quellen auf dem Hin- und Rückweg Details verlieren. Nutze Modify auf Clips, die du ohnehin in 480p generiert hast.
Editing Suite — Restyle, Objektbearbeitung, Sketches to Life
Eine Wundertüte an Operationen nach der Generierung. Restyle legt künstlerische Stile an (Cyberpunk, Anime, Retro, Origami, Aquarell, Mosaik). Die Objektbearbeitung fügt Elemente hinzu, entfernt sie oder tauscht sie aus. Sketches to Life animiert Strichzeichnungen. Add Performance pfropft Figurenanimation auf statische Gestalten. Nützlich, um aus einem einzigen Quellclip mehrere Varianten zu bauen.
Prompts, die dem Modell gerecht werden
Vier Gewohnheiten heben die Qualität schneller an als längere Prompts.
Filmische Sprache verwenden
Grok Imagine bringt sechs eingebaute Kamera-Presets mit: Zoom In, Zoom Out, Dolly Out, Tilt Up, Pan Right, Timelapse. Diese greifen präziser, wenn Prompts filmische Fachbegriffe verwenden.
| Schwächer | Stärker |
|---|---|
| "A city street at night with neon signs and people walking" | "Dolly forward through a rain-slicked Tokyo alley, neon signs reflecting in puddles, shallow depth of field, a figure with an umbrella enters frame right, cinematic 2.39:1 framing" |
Referenzen ausdrücklich markieren
Der Referenzmodus wird schwächer, wenn der Prompt allgemein bleibt. Binde jede Referenz an eine Rolle.
"@Image1 (the red sports car) drifts around a mountain corner with @Image3 (the sunset sky) in the background while @Image2 (the driver character) grips the steering wheel."
Die Aktion nach vorne stellen
Die Generierung läuft sequenziell durch die Dauer. Wenn der Höhepunkt am Ende eines fünfsekündigen Clips liegt, bringt das Modell ihn womöglich nicht zu Ende. Zieh die Aktion nach vorne.
| Schwächer | Stärker |
|---|---|
| "A quiet forest scene with birds, then suddenly a deer leaps across a stream" | "A deer leaps across a forest stream in golden hour light, camera tracking its arc, birds scatter from nearby branches" |
Clips von 10 bis 15 Sekunden auf einer Zeitachse takten
Bei längeren Clips schreibst du das Timing direkt in den Prompt.
"Slow zoom into abandoned library (0–5s), dust particles catch light beams (5–10s), book falls from shelf (10–12s), pages flutter (12–15s)."
Was es tatsächlich kostet
Drei realistische Szenarien, gerechnet in OmniArt-Credits.
Ein 15-Sekunden-Produktvideo für TikTok
| Schritt | Modus | Auflösung | Kosten |
|---|---|---|---|
| Erstgenerierung | Text-zu-Video | 480p, 10 s | 100 |
| Verlängern | Extend | 480p, 5 s | 75 |
| Gesamt (eine Überarbeitung) | 175–275 |
Ein Marken-Storyboard aus drei Einstellungen
| Schritt | Modus | Auflösung | Kosten |
|---|---|---|---|
| Einstellung 1 mit 2 Referenzen | Referenz, 8 s | 720p | 180 |
| Einstellung 2, gleiche Referenzen | Referenz, 8 s | 720p | 180 |
| Einstellung 3, gleiche Referenzen | Referenz, 6 s | 720p | 135 |
| Lichtkorrektur an Einstellung 2 | Modify, 8 s | 720p | 180 |
| Gesamt | 675 |
Ein Restyle-Durchgang
| Schritt | Modus | Auflösung | Kosten |
|---|---|---|---|
| Restyle zu Anime | Restyle, 8 s | 480p | 120 |
Wann du ein anderes Modell wählen solltest
Grok Imagine ist das richtige Werkzeug für Social-Kurzformat, Skizze-zum-Leben-Arbeit und referenzgetriebene Geschichten über mehrere Einstellungen bei 480p bis 720p. Das falsche Werkzeug ist es, wenn:
| Bedarf | Bessere Wahl |
|---|---|
| 1080p oder mehr | V6, BACH, Veo 3 |
| Fortgeschrittene Objektivkontrolle (Brennweite, Schärfentiefe, Abbildungsfehler) | V6 |
| Clips von 16 bis 20 Sekunden in einem Durchlauf | Sora 2 |
| Dialog und Musik in Produktionsqualität | eigenes Audiomodell + Schnitt |
| Erhalt hochauflösender Quellen beim Bearbeiten | Modify-Modus meiden |
Workflow-Muster, die sich bewähren
Grok Imagine zahlt sich auf OmniArt nicht als eigenständiger Generator aus — sondern als Iterationsschicht. Zwei Muster bringen am meisten.
Muster 1 — anderswo generieren, hier verfeinern. Rendere den Master-Clip mit V6 oder Sora 2 in höherer Auflösung und nutze dann Extend, Restyle und Modify, um in Grok günstiger Varianten und Ergänzungen zu drehen.
Muster 2 — Referenzmodus für Figurenbindung. Wenn eine Markenkampagne dieselbe Figur über fünf Einstellungen braucht, halte die Identität mit einem Ankerbild in @Image1 fest und generiere dann jede Einstellung mit derselben Referenz im Referenzmodus. Günstiger, als für jede Einstellung Sora 2 neu zu würfeln.
Warnung
Der Modify-Modus skaliert jede Eingabe oberhalb von 854×480 vor der Verarbeitung automatisch auf 480p herunter. Wenn du einen 1080p-Clip bearbeiten willst, ohne Auflösung zu verlieren, rendere die Bearbeitung anderswo oder erledige sie vor dem Hochskalieren.
Loslegen auf OmniArt
Grok Imagine ist im OmniArt-Video-Workspace verfügbar, neben V6, BACH, Sora 2, Veo 3, Kling 3.0, HappyHorse 1.0 und Seedance 2.0. Gleiches Credits-Guthaben, gleicher Referenz-Upload, gleiche Prompt-Grammatik. Fang mit Text-zu-Video an, um die Kamera-Presets kennenzulernen, und steig auf den Referenzmodus um, sobald du eine Figur oder ein Produkt festhalten willst.
Kombiniere diesen Leitfaden mit der BACH-Kameramann-Analyse für hochwertigere narrative Arbeit oder mit der Shortlist der besten Bild-zu-Video-Modelle, wenn du für eine bestimmte Einstellung zwischen Modellen wählst.
Bereit zum Erstellen?
Starte mit KI die Erstellung beeindruckender Inhalte