Grok Imagine: przewodnik twórcy po modelu wideo xAI w 2026 roku
Praktyczny przewodnik po Grok Imagine — sześć trybów generowania, wzorce promptów, realne wyliczenia kosztów i moment, w którym warto wybrać go zamiast V6 czy Sora 2.

Grok Imagine to model generowania wideo i dźwięku od xAI, wypuszczony w styczniu 2026 roku i dostępny przez OmniArt bez osobnej subskrypcji xAI. To inny produkt niż chatbot Grok — łączy je nazwa i nic poza tym. Ten przewodnik omawia, do czego Grok Imagine jest zbudowany, sześć trybów generowania, które mają znaczenie, wzorce promptów szanujące każdy z nich oraz wyliczenia tego, ile prawdziwe projekty naprawdę kosztują w kredytach.
Czym jest Grok Imagine
Grok Imagine generuje wideo do 720p z natywnym dźwiękiem w klipach od 1 do 15 sekund. Sztuczką numer jeden nie jest rozdzielczość — przy 720p model świadomie nie walczy z Sora 2 ani V6 o surową wierność. Sztuczką numer jeden jest powierzchnia pracy wokół modelu: sześć trybów generowania, które dzielą jeden zestaw wag i pozwalają generować, przedłużać, przestylizowywać i modyfikować bez wychodzenia z modelu.
| Parametr | Wartość |
|---|---|
| Maksymalna rozdzielczość | 720p (po 1080p i wyżej sięgnij do V6) |
| Maksymalny czas trwania | 15 sekund na generowanie |
| Proporcje obrazu | 16:9, 4:3, 1:1, 9:16, 3:4, 3:2, 2:3 |
| Dźwięk | Natywny, generowany razem z wideo |
| Koszt (480p) | 10 kredytów na sekundę |
| Koszt (720p) | 15 kredytów na sekundę |
Sześć trybów, które warto znać
Każdy tryb to inny sposób powiedzenia modelowi, z jakim rodzajem wejścia pracuje. Wybór właściwego trybu to większość pracy nad promptem.
Tekst na wideo
Ustawienie domyślne. Piszesz prompt, dostajesz klip. Najlepszy do eksploracji konceptów, tablic nastroju i szkiców na social media, kiedy nie masz jeszcze obrazu referencyjnego. Koszt to 10–15 kredytów na sekundę, zależnie od rozdzielczości.
Obraz na wideo
Ożywia kadr, zachowując kompozycję wejścia. Pierwsza klatka jest zablokowana na twoim obrazie. Używaj do ożywiania ilustracji, fotografii produktowej i makiet projektowych, w których kadr źródłowy jest nienegocjowalny.
Tryb Reference — wyróżnik
Tryb Reference przyjmuje od 1 do 7 obrazów jako kotwice wizualne bez blokowania pierwszej klatki. Oznaczasz obrazy jako @Image1, @Image2, @Image3 i odwołujesz się do nich w prompcie. Tego właśnie nie mają inne modele wideo — większość albo blokuje pierwszą klatkę (obraz na wideo), albo nie przyjmuje żadnej referencji (tekst na wideo). Tryb Reference siedzi pośrodku i jest najczystszą drogą do spójności postaci w wielu ujęciach.
Koszt to 15 kredytów na sekundę przy 480p i 22,5 przy 720p.
Tryb Extend
Dokleja od 2 do 10 sekund do istniejącego klipu. Wejściem jest MP4 o długości od 2 do 15 sekund. Wyjściem jest jeden ciągły klip, a rozliczana jest wyłącznie doklejona część. Sztuczka międzymodelowa: tryb Extend działa na wideo wygenerowanych dowolnym modelem w przestrzeni wideo OmniArt, nie tylko Grokiem.
Tryb Modify
Edytuje istniejący klip bez generowania go od nowa — podmiana tła, zmiany światła, przesunięcia koloru na konkretnych obiektach, efekty pogodowe. Wejście jest ograniczone do 8 sekund i automatycznie skalowane do 854×480, co oznacza, że źródła o wysokiej rozdzielczości tracą szczegół w tej podróży. Używaj trybu Modify na klipach, które i tak wygenerowano w 480p.
Editing Suite — Restyle, Object Manipulation, Sketches to Life
Zbieranina operacji po generowaniu. Restyle nakłada style artystyczne (Cyberpunk, Anime, Retro, Origami, Watercolor, Mosaic). Object Manipulation dodaje, usuwa albo podmienia elementy. Sketches to Life ożywia rysunki kreskowe. Add Performance przeszczepia animację postaci na statyczne sylwetki. Przydatne do tworzenia wielu wariantów z jednego klipu źródłowego.
Prompty, które szanują model
Cztery nawyki podnoszą jakość szybciej niż dłuższe prompty.
Używaj języka filmowego
Grok Imagine ma sześć wbudowanych ustawień kamery: Zoom In, Zoom Out, Dolly Out, Tilt Up, Pan Right, Timelapse. Aktywują się precyzyjniej, kiedy prompt używa terminów operatorskich.
| Słabiej | Mocniej |
|---|---|
| "A city street at night with neon signs and people walking" | "Dolly forward through a rain-slicked Tokyo alley, neon signs reflecting in puddles, shallow depth of field, a figure with an umbrella enters frame right, cinematic 2.39:1 framing" |
Oznaczaj referencje wprost
Tryb Reference psuje się, kiedy prompt jest ogólnikowy. Przypisz każdej referencji rolę.
"@Image1 (the red sports car) drifts around a mountain corner with @Image3 (the sunset sky) in the background while @Image2 (the driver character) grips the steering wheel."
Wysuń akcję na przód
Generowanie biegnie sekwencyjnie przez cały czas trwania. Jeśli kulminacja siedzi na końcu pięciosekundowego klipu, model może jej nie dokończyć. Przesuń akcję do przodu.
| Słabiej | Mocniej |
|---|---|
| "A quiet forest scene with birds, then suddenly a deer leaps across a stream" | "A deer leaps across a forest stream in golden hour light, camera tracking its arc, birds scatter from nearby branches" |
Rozpisz klipy 10–15-sekundowe na osi czasu
Przy dłuższych klipach wpisz taktowanie prosto w prompt.
"Slow zoom into abandoned library (0–5s), dust particles catch light beams (5–10s), book falls from shelf (10–12s), pages flutter (12–15s)."
Ile to naprawdę kosztuje
Trzy realne scenariusze ujęć, wycenione w kredytach OmniArt.
Piętnastosekundowe wideo produktowe na TikToka
| Krok | Tryb | Rozdzielczość | Koszt |
|---|---|---|---|
| Generowanie początkowe | Tekst na wideo | 480p, 10 s | 100 |
| Przedłużenie | Extend | 480p, 5 s | 75 |
| Łącznie (jedna poprawka) | 175–275 |
Storyboard marki z trzech ujęć
| Krok | Tryb | Rozdzielczość | Koszt |
|---|---|---|---|
| Ujęcie 1 z 2 referencjami | Reference, 8 s | 720p | 180 |
| Ujęcie 2, te same referencje | Reference, 8 s | 720p | 180 |
| Ujęcie 3, te same referencje | Reference, 6 s | 720p | 135 |
| Poprawka światła w ujęciu 2 | Modify, 8 s | 720p | 180 |
| Łącznie | 675 |
Jeden przebieg Restyle
| Krok | Tryb | Rozdzielczość | Koszt |
|---|---|---|---|
| Restyle na Anime | Restyle, 8 s | 480p | 120 |
Kiedy wybrać inny model
Grok Imagine jest właściwym narzędziem do krótkiej formy social, prac typu szkic na wideo i wielojęciowych historii prowadzonych referencją w 480p–720p. Jest narzędziem niewłaściwym, kiedy:
| Potrzeba | Lepszy wybór |
|---|---|
| 1080p albo wyżej | V6, BACH, Veo 3 |
| Zaawansowana kontrola obiektywu (ogniskowa, głębia ostrości, aberracja) | V6 |
| Klipy 16–20-sekundowe w jednym przebiegu | Sora 2 |
| Dialog i muzyka na poziomie produkcyjnym | Dedykowany model audio plus montaż |
| Zachowanie wysokiej rozdzielczości źródła przy edycji | Unikaj trybu Modify |
Wzorce pracy, które się sprawdzają
Grok Imagine zwraca się w OmniArt nie jako samodzielny generator — tylko jako warstwa iteracji. Najwięcej dają dwa wzorce.
Wzorzec 1 — generuj gdzie indziej, dopracowuj tutaj. Wyrenderuj klip nadrzędny w V6 albo Sora 2 w wyższej rozdzielczości, a potem użyj trybów Extend, Restyle i Modify, żeby taniej wykręcić w Groku warianty i dokładki.
Wzorzec 2 — tryb Reference do blokowania postaci. Kiedy kampania marki potrzebuje tej samej postaci w pięciu ujęciach, zablokuj tożsamość jednym obrazem kotwiczącym w @Image1, a potem generuj każde ujęcie z tą samą referencją w trybie Reference. Taniej niż przetaczanie Sora 2 przy każdym ujęciu.
Ostrzeżenie
Tryb Modify automatycznie skaluje każde wejście powyżej 854×480 w dół do 480p, zanim je przetworzy. Jeśli musisz zmontować klip w 1080p bez utraty rozdzielczości, zrób edycję gdzie indziej albo wykonaj ją przed krokiem powiększania.
Pierwsze kroki w OmniArt
Grok Imagine jest dostępny w przestrzeni wideo OmniArt obok V6, BACH, Sora 2, Veo 3, Kling 3.0, HappyHorse 1.0 i Seedance 2.0. To samo saldo kredytów, to samo wgrywanie referencji, ta sama gramatyka promptu. Zacznij od trybu tekst na wideo, żeby poznać ustawienia kamery, a kiedy będziesz mieć postać albo produkt do zablokowania, przejdź do trybu Reference.
Zestaw ten przewodnik z rozbiorem BACH okiem operatora przy pracy narracyjnej o wyższej wierności albo z krótką listą najlepszych modeli obraz na wideo, jeśli wybierasz model pod konkretne ujęcie.
Gotowy, aby tworzyć?
Zacznij generować świetne treści z AI