8 promptów do Grok Imagine, które naprawdę działają
Osiem gotowych do wklejenia promptów do Grok Imagine 1.5 — obraz i wideo — opartych na naturalnym języku FLUX.1 i strukturze temat + akcja + kamera + styl + dźwięk. Co robi każdy prompt i dlaczego trafia, w OmniArt.

Grok Imagine 1.5 przesiadł się w warstwie obrazu na FLUX.1 od Black Forest Labs, a ta zmiana ma konkretny skutek dla sposobu pisania promptów: model reaguje na opis w języku naturalnym tak, jak fotograf czyta brief, a nie tak, jak starsze modele rozbierały listy słów kluczowych. Osiem poniższych promptów jest gotowych do wklejenia — wrzuć je do przestrzeni Grok Imagine w OmniArt, dostosuj szczegóły i generuj. Każda karta zawiera dokładny tekst promptu, to, co on daje, i jedną uwagę warsztatową o tym, dlaczego ta struktura trafia.
Ogólną teorię promptów dla wszystkich modeli w OmniArt znajdziesz w tekście jak pisać lepsze prompty. Głębsze omówienie sześciu trybów generowania Grok Imagine i matematyki kosztów daje przewodnik twórcy po Grok Imagine. Ten artykuł dotyczy konkretnie Grok Imagine 1.5 — wydania na FLUX.1 — i warsztatu promptu, który ono nagradza.
Co Grok Imagine 1.5 zmienił w promptowaniu
Model bazowy FLUX.1 jest trenowany inaczej niż wcześniejsze architektury text-to-image. Dobrze rozbiera spójną prozę i zwykle słabo reaguje na czyste stosy słów kluczowych. Pięć nawyków podnosi jakość najpewniej:
- Język naturalny zamiast stosów słów kluczowych. Pełne zdania biją przymiotniki rozdzielone przecinkami. "A street at blue hour, lit by the hum of a convenience store sign" bije "street, night, neon, cinematic, 4K."
- Konkretne odniesienia zamiast mglistych przymiotników. "Shot on a Fujifilm XT4, 23mm f/2" mówi modelowi więcej niż "high quality photo." Nazwany sprzęt i konkretne filmy niosą realną wagę w przestrzeni latentnej.
- Dokładne nazwy kolorów zamiast "colorful". "Electric blue and hot pink" daje świadomą paletę. "Colorful" daje uśredniony szum.
- Dokładny czas zamiast "golden hour". "Late October, 5:45 pm, sun 6° above the horizon" mówi modelowi o dokładnym kącie i cieple światła. "Golden hour" jest niejednoznaczne w różnych porach roku i na różnych szerokościach geograficznych.
- Struktura wideo: temat + akcja + kamera + styl + dźwięk. Umieść rdzeń tematu i akcji w pierwszych 20–30 słowach. Jedno skupienie stylistyczne bije mieszankę. Iteruj stopniowo — zmieniaj jedną rzecz na generowanie, aż wynik się ustabilizuje, a potem idź dalej.
Pełne omówienie słownika filmowego, który przenosi się na wideo, znajdziesz w przewodniku po filmowych promptach do wideo AI — omawia dobór obiektywu, umotywowane ruchy kamery i język światła w głąb.
Osiem promptów
1. Filmowe ujęcie produktowe (obraz)
35mm product photography, shot on Fujifilm XT4. A matte black mechanical wristwatch resting on a slab of raw concrete,
late October afternoon light coming in low from camera left at roughly 20°, casting a long shadow across the concrete
face. Shallow depth of field, background falling completely soft. Color palette: warm amber highlights, cool blue-grey
shadow fill. No props, no reflections except the concrete surface itself.
Co daje: czystą, wyreżyserowaną plastycznie stopklatkę, która czyta się jak profesjonalna fotografia produktowa, a nie jak wynik AI.
Dlaczego trafia: odniesienie do Fujifilm XT4 osadza naukę o kolorze i rysunek matrycy w konkretnym, istniejącym wyglądzie. Kąt światła jest podany liczbowo, co powstrzymuje model przed domyślnym rozproszonym światłem z góry. Trzymanie palety przy dwóch kolorach — ciepłe bursztynowe światła, chłodne niebiesko-szare wypełnienie cienia — nie pozwala modelowi wprowadzić trzeciej, konkurującej barwy.
2. Zbliżenie postaci z dźwiękiem (wideo)
Medium close-up of a young woman with short silver hair and a worn leather jacket, inside a neon-lit record shop at
3 am. She looks directly into camera and says: "Every city has one song. I'm still looking for mine." Natural lip
sync. Camera holds completely still. Light source: one pink neon tube overhead, one cyan neon sign spilling from
camera right. Atmosphere: quiet, a little melancholic, not cinematic drama. Ambient audio: low vinyl static underneath
the dialogue. 8 seconds.
Co daje: moment z postacią z natywnym dźwiękiem Grok Imagine 1.5 — model generuje dialog, synchronizację ust i tło akustyczne w jednym przebiegu.
Dlaczego trafia: kwestia dialogowa jest na tyle krótka, że mieści się w czystej synchronizacji ust w 8 sekundach. Dwa osobne, nazwane źródła neonu (różowy z góry, cyjanowy z prawej) dają modelowi czytelną mapę światła i zapobiegają uśrednionemu „neonowemu miastu”. „Not cinematic drama” to ograniczenie negatywne, które prowadzi nastrój precyzyjniej niż zrobiłby to przymiotnik pozytywny.
Wskazówka
Trzymaj wypowiadany dialog przy jednym albo dwóch krótkich zdaniach w klipach poniżej 10 sekund. Dłuższe kwestie tłoczą się w dostępnym czasie, a model może przyspieszyć wypowiedź albo urwać dźwięk wcześniej.
3. Nastrojowe otoczenie — klip z tłem akustycznym (wideo)
Wide establishing shot of a fog-filled pine forest in southern Norway, early November, 7 am. No people, no animals.
Soft diffused dawn light filtering through the canopy, pale grey-white, casting almost no shadow. Slow imperceptible
push forward, as if the camera is drifting on breath. Audio: deep forest ambience — distant water, occasional bird,
near-silence underneath. No music. 12 seconds.
Co daje: budujący nastrój klip tła, idealny jako materiał podkładowy, przejście albo scena otwierająca.
Dlaczego trafia: „early November, 7 am” jest dokładniejsze niż „mglisty poranek”. Najazd opisano jako „imperceptible” i „drifting on breath”, co przekazuje tempo precyzyjniej niż „powolny najazd”. Prośba o brak muzyki nie pozwala dźwiękowi zsunąć się w podkład — model generuje zamiast tego prawdziwe tło w stylu nagrania terenowego.
4. Szybki pion do social mediów — odsłonięcie produktu (wideo)
9:16 vertical. A pair of electric blue running shoes drops into frame from the top, landing on a wet reflective black
studio floor. High-speed impact, tiny water spray, shoes bounce once and settle. Immediate cut to product floating
at centre frame, slow rotation 360°. Fast rhythm: first motion 0–2s, rotation 2–8s. Hard direct light from above,
electric blue accent light from below floor (subtle). No dialogue. Audio: sharp impact sound on drop, then a clean
single synthesizer tone during rotation. 8 seconds.
Co daje: energiczny klip 9:16 zbudowany pod TikToka, Reels albo Shorts — szybko cięte odsłonięcie produktu z natywnym dźwiękiem.
Dlaczego trafia: podanie 9:16 na początku ustawia proporcje obrazu przed wszystkim innym w prompcie. Oś czasu jest wypisana wprost („0–2s / 2–8s”), co pomaga modelowi poprawnie rozłożyć dwa takty, zamiast zlewać je w jeden ruch. Nazwanie konkretnych zdarzeń dźwiękowych (uderzenie, ton syntezatora) daje bardziej świadomy projekt dźwięku niż „dodaj efekty dźwiękowe”.
Ostrzeżenie
Klipy z Grok Imagine 1.5 trwają do 15 sekund. Przy treściach społecznościowych trzymaj klipy przy maksymalnie 8–10 sekundach — ruch modelu jest najczystszy w tym zakresie, a okna uwagi na platformach społecznościowych są krótkie. W 720p ośmiosekundowy klip kosztuje w OmniArt 120 kredytów.
5. Stylizowana ilustracja (obraz)
Risograph print illustration of a small coastal Japanese fishing village at dusk, mid-December. Two ink colors only:
deep indigo and warm persimmon orange. Flat graphic shapes, no gradients. Fishing boats pulled up on shore, a single
wooden dock, lantern light in two window rectangles. Composition: low horizon line, large sky area, boats and dock in
lower third. The print has slight ink misregistration — indigo shifted 2px left from the orange layer. Texture:
visible paper grain throughout.
Co daje: graficzną ilustrację o ograniczonej palecie, która czyta się jak prawdziwy proces drukarski, a nie jak ogólna grafika cyfrowa.
Dlaczego trafia: nazwanie techniki druku (risograf) i jej konkretnych ograniczeń (dwa kolory farby, płaskie kształty, brak gradientów, przesunięcie pasowania) daje modelowi kompletny brief techniczny. „Ink misregistration” to ten rodzaj detalu z procesu fizycznego, który zakotwicza wynik w rzeczywistej estetyce — to odpowiednik nazwania konkretnego filmu w świecie FLUX.1. Bez tego model chętnie dokłada gradienty albo miesza kolory.
6. Dynamiczny ruch kamery — odjazd dronem (wideo)
Aerial drone footage. Extreme close-up on the face of a compass resting on a weathered wooden ship's deck, late
afternoon November light, warm golden horizontal rays from camera left. Slow pull-back revealing the full deck,
then the ship's hull, then open grey Atlantic ocean horizon. Pull-back runs the full 15 seconds — begin on compass,
end with ocean filling 80% of the frame. Camera elevation stays constant, no tilt. Real drone color science: flat
LOG-style color, slight lens vignette. Audio: wind increasing in volume as ocean fills frame.
Co daje: utrzymane przez 15 sekund ujęcie odsłaniające — maksymalną długość klipu w tym modelu — zbudowane wokół jednego umotywowanego ruchu kamery.
Dlaczego trafia: ten prompt wykorzystuje pełne 15 sekund na jeden ciągły ruch, co jest najpewniejszą drogą do czystego wyniku przy takiej długości. Odjazd jest ograniczony do stałej wysokości (bez pochylenia), co powstrzymuje model przed improwizowaniem drugiej osi kamery i tworzeniem szarpanego ruchu. „LOG-style color, slight lens vignette” koduje wygląd prawdziwej kamery, nie wymagając nazw konkretnego sprzętu.
7. Stylizowana moda — portret na konkretnym filmie (obraz)
Expired Kodak Portra 400 film scan. Portrait of a woman in her mid-thirties, strong afternoon window light from
camera right, half of her face in deep shadow. She is wearing a deep forest green linen blazer, no visible jewellery.
Expression is neutral, looking slightly off-camera left. Grain heavy and warm, slight halation around the window
highlight, greens shifted slightly toward yellow-olive. Tight crop: from collarbone to just above top of head.
Aspect ratio 4:5.
Co daje: portret fotografii analogowej z wiernym oddaniem koloru vintage — autentyczną ziarnistością, halacją i przesunięciami barw przeterminowanego filmu.
Dlaczego trafia: „expired Kodak Portra 400” to jedno z najmocniejszych jednofrazowych odniesień stylistycznych w przestrzeni latentnej obrazu — niesie kompletny zestaw oczekiwań tonalnych. Podanie przesunięcia koloru („greens shifted slightly toward yellow-olive”) zapobiega ogólnej ziarnistości retro i prowadzi do dokładnie tego zepsucia palety, które kojarzy się z przeterminowanym filmem. Ciasny kadr i konkretne proporcje obrazu (4:5) dają portret, który czyta się jak prawdziwa odbitka.
8. Immersyjne otoczenie — ulewa (wideo)
Ground-level POV inside a glass bus shelter, heavy urban rain, Tokyo residential street, late June 22:00. Camera
holds completely still. Rain streaks down the glass panels in foreground, streetlights smear into vertical bokeh
streaks behind the wet glass. A cyclist passes in the distance — silhouette only, visible for about 2 seconds in
mid-clip. No camera movement. Audio: heavy rain on glass, distant car tyre hiss, one distant motorbike engine
fading right-to-left. No music. 10 seconds.
Co daje: immersyjny klip otoczenia z jednego punktu widzenia — mocny jako ujęcie otwierające albo samodzielny kawałek nastrojowy.
Dlaczego trafia: „late June 22:00” określa dokładną porę roku, odczucie temperatury (wilgotny letni deszcz) i poziom ciemności. Przejeżdżający rowerzysta jest zasadzony jako konkretne zdarzenie w konkretnym momencie („about 2 seconds in mid-clip”), co daje modelowi kotwicę narracyjną bez proszenia o złożone działanie postaci. Dźwięk jest podany w trzech osobnych warstwach (deszcz na szkle, syk opon, motocykl), co zwykle daje bardziej przemyślany projekt dźwięku niż jedna instrukcja „ambient city rain”.
Jak puścić to w OmniArt
Wszystkie osiem promptów działa na Grok Imagine 1.5 w przestrzeni tworzenia OmniArt — bez osobnej subskrypcji xAI. Prompty obrazowe (1, 5, 7) idą do przestrzeni obrazu; prompty wideo (2, 3, 4, 6, 8) idą do przestrzeni wideo pod Grok Imagine.
Kilka praktycznych uwag do uruchomień w OmniArt:
- Zacznij od 480p na iterację. W 480p wideo kosztuje 10 kredytów za sekundę. Gdy struktura jest już właściwa, przeskocz na 720p (15 kredytów za sekundę) na finalne podejście.
- Do wydłużania używaj trybu Extend. Klip nastrojowy (prompt 3) i odjazd dronem (prompt 6) można przedłużyć o kolejne 15 sekund trybem Extend w Grok Imagine — ten sam model, rozliczany tylko za dołożoną część.
- Do celowanych poprawek używaj trybu Modify. Jeśli światło w wyniku jest prawie dobre, ale jeden element się nie zgadza, tryb Modify pozwala opisać zmianę tekstem bez generowania całego klipu od nowa. Trzymaj klipy źródłowe w 480p przed przekazaniem do Modify — ten tryb przyjmuje wejście najwyżej 854×480.
- Spójność postaci między ujęciami: jeśli generujesz kilka ujęć tej samej postaci (w stylu promptu 2), użyj trybu Reference z portretem jako
@Image1i powtórz opis postaci w każdym nowym prompcie. Tryb Reference w Grok Imagine 1.5 to najprostsza droga do spójności bez opierania się na dostrojonym modelu.
Pełne omówienie wszystkich sześciu trybów generowania Grok Imagine, scenariuszy kosztowych i tego, kiedy przejść na inny model, znajdziesz w kompletnym przewodniku po Grok Imagine. A szerszy słownik zdjęciowy, który przenosi się na każdy prompt wideo, opisuje przewodnik po filmowych promptach do wideo AI — warto go trzymać w zakładkach obok tego tekstu.
Gotowy, aby tworzyć?
Zacznij generować świetne treści z AI