Grok Imagine 1.5 kontra 1.0: co naprawdę zmienia +52 Elo
Grok Imagine 1.5 od xAI zyskał +52 Elo względem 1.0 i objął pierwsze miejsce w Image-to-Video Arena. Rozbijamy ten skok na cztery zmiany, które twórcy czują od razu — natywny dźwięk, 15-sekundowe klipy, spójność twarzy i Extend from Frame — z odczytami przed i po w OmniArt.

Grok Imagine 1.5 wyszedł jako aktualizacja w wersji Preview i naprawdę ruszył wskazówką: +52 Elo względem 1.0 i skok na szczyt Image-to-Video Arena, przed Seedance 2.0, HappyHorse 1.0 i Google Veo w ślepych testach użytkowników. Skok o 52 punkty w dojrzałym rankingu to istotny sygnał — odpowiada mniej więcej 57 % zwycięstw 1.5 w ślepych pojedynkach z 1.0.
Liczba jest nagłówkiem. Dla pracy produkcyjnej liczy się to, które konkretne zmiany ją napędziły. Uruchamialiśmy 1.5 obok 1.0 w przestrzeni wideo OmniArt i zysk czysto rozkłada się na cztery rzeczy, które twórcy czują od razu. Żadna z nich nie jest subtelna.
Jeśli dopiero zaczynasz z Grok Imagine, sięgnij najpierw po przewodnik podstawowy — omawia szczegółowo sześć trybów generowania, wzorce promptów i matematykę kredytów. Ten tekst zakłada, że masz już za sobą kilka klipów zrobionych w 1.0 i chcesz wiedzieć, co warto wygenerować od nowa.
Szybkie porównanie parametrów: 1.0 kontra 1.5
| Parametr | Grok Imagine 1.0 | Grok Imagine 1.5 |
|---|---|---|
| Maksymalna rozdzielczość | 720p | 720p |
| Maksymalny czas trwania | 10 sekund | 15 sekund |
| Proporcje obrazu | 16:9, 4:3, 1:1, 9:16, 3:4, 3:2, 2:3 | 16:9, 4:3, 1:1, 9:16, 3:4, 3:2, 2:3 |
| Dźwięk | natywny, generowany wspólnie | natywny, generowany wspólnie — ulepszony |
| Spójność twarzy | poziom bazowy | zauważalnie lepsza |
| Extend from Frame | kontynuacja od klatki końcowej | jawny wybór klatki, lepsza ciągłość |
| Baza generowania obrazu | FLUX.1 (Black Forest Labs) | FLUX.1 (Black Forest Labs) |
| Koszt (480p) | 10 kredytów/s | 10 kredytów/s |
| Koszt (720p) | 15 kredytów/s | 15 kredytów/s |
| Pozycja w arenie | kilka miejsc poniżej szczytu | 1. miejsce w Image-to-Video Arena |
Limit rozdzielczości i ceny w kredytach są bez zmian. Zysk siedzi w tym, co model robi w tych ramach.
Zmiana 1: natywny dźwięk brzmi teraz jak jeden przebieg
Grok Imagine generuje dźwięk od wersji 1.0 — dialog, lip-sync, efekty dźwiękowe i muzykę tła, wszystko budowane z tokenów wideo w jednym przebiegu inferencji, bez doszywanego z tyłu osobnego modelu audio. W praktyce dźwięk w 1.0 zawodził w dwóch powtarzalnych miejscach: mechaniczne tempo dialogu (słowa padały w równych odstępach, z pauzami na granicach gramatycznych zamiast w naturalnych momentach oddechu) oraz płaskie tło (scena w kawiarni z jednym niezróżnicowanym pomrukiem, bez zmienności przestrzennej).
1.5 zajmuje się obiema sprawami. Ta sama jednoprzebiegowa architektura daje teraz intonację na poziomie zdania — krótsze, dobitniejsze frazy lądują z opadającą intonacją, a dłuższa mowa wyjaśniająca ma słyszalny wzrost w środku zdania przed rozwiązaniem. Tło brzmi warstwowo: scena uliczna generuje ruch samochodowy w oddali, kroki blisko, przytłumione drzwi sklepu za tematem. To nie jest obrabiane po fakcie; powstaje w tej samej sekwencyjnej logice klatka po klatce, której silnik Aurora używa do ruchu, gdzie każda klatka informuje kolejną, a otoczenie akustyczne podąża za trajektorią wizualną.
Prompt w 1.0: "A barista explains the brewing process to a customer across the counter, coffee shop background, warm lighting."
- Wynik w 1.0: dialog padał metronomicznymi zrywami, a ekspres w tle chodził przez cały czas na jednym poziomie.
- Wynik w 1.5: wyjaśnienie baristy ma naturalne pauzy w środku zdania, ekspres narasta, gdy zaczyna się kolejne zamówienie, a mruknięta odpowiedź klienta jest cichsza i umieszczona przestrzennie dalej od dominującej osi mikrofonu.
Różnica jest najwyraźniejsza w klipach mocno dialogowych. Jeśli wideo z Grok 1.0 trafia u ciebie do osobnego modelu audio dla samego głosu, 1.5 zasypuje większość tej luki natywnie.
Zmiana 2: z 10 sekund robi się 15
Grok Imagine 1.0 ograniczał klipy do 10 sekund. 1.5 podnosi limit do 15 sekund, z dowolnym całkowitym czasem trwania od 1 do 15. Dodatkowe pięć sekund brzmi drobno. W praktyce to różnica między klipem na social media, który potrzebuje jednego przebiegu Extend, a takim, który wychodzi gotowy z pierwszego generowania.
Przy standardowych zastosowaniach matematyka kredytów zmienia się zauważalnie:
| Zastosowanie | 1.0 (maks. 10 s + Extend do 15 s) | 1.5 (natywne 15 s) |
|---|---|---|
| 15-sekundowy TikTok, 480p | 100 (10 s) + 75 (5 s przedłużenia) = 175 | 150 |
| 15-sekundowy TikTok, 720p | 150 (10 s) + 112,5 (5 s przedłużenia) = 262,5 | 225 |
| 10-sekundowe ujęcie produktowe, 720p | 150 | 150 (bez zmian) |
W najczęstszym formacie na social media — klipie 15-sekundowym — 1.5 kosztuje o około 14 % mniej w 480p i o 14 % mniej w 720p niż podejście „wygeneruj, potem przedłuż” z 1.0, a przy okazji omijasz artefakt szwu, który czasem pojawia się w miejscu doklejenia.
Sam tryb Extend jest w 1.5 nadal dostępny, gdy chcesz wyjść poza 15 sekund, ale za przedłużenie płacisz tylko przy materiale, który naprawdę potrzebuje dłuższego czasu, a nie dlatego, że bazowe generowanie wymusiło cięcie.
Zmiana 3: wierność twarzy i spójność postaci
To zmiana najtrudniejsza do zmierzenia i najczęściej wymieniana w opiniach społeczności. Grok Imagine 1.0 potrafił wygenerować przekonującą twarz w pierwszej klatce i ją zgubić — rysy przechodziły jedne w drugie między klatkami, zwłaszcza przy obrotach głowy, zmianach światła albo szybkim ruchu. Postacie wprowadzone przez tryb Reference dryfowały w proporcjach twarzy w dłuższych klipach.
1.5 rozwiązuje to na poziomie architektury. Sekwencyjne generowanie klatek w silniku Aurora — gdzie każdą klatkę informuje poprzednia — utrzymuje teraz punkty charakterystyczne twarzy stabilniej przy obrotach i zmianach oświetlenia. Wzorzec opinii społeczności jest spójny: obroty twarzy, które wcześniej dawały niepokojące przenikanie rysów, teraz kończą się czysto przy normalnej prędkości odtwarzania.
Przed i po na jednym prompcie w trybie Reference: "[@Image1] walks toward the camera through a fog-filled alley, face clearly visible, turns slightly right at 8 seconds, warm streetlight from above."
- 1.0: temat utrzymywał spójną tożsamość przez całe przejście, a potem obrót w prawo dawał wyraźną zmianę szerokości żuchwy w klatce w połowie obrotu, która wracała na miejsce po jego zakończeniu.
- 1.5: ten sam obrót kończy się bez artefaktu korekty. Proporcje żuchwy i kości policzkowych trzymają się przez cały obrót.
Najbardziej liczy się to wszędzie tam, gdzie głównym tematem jest twarz postaci — materiały typu gadająca głowa, narracje prowadzone przez postać, demonstracje produktu z rzecznikiem i każdy klip, w którym tryb Reference kotwiczy spójną tożsamość w wielu ujęciach.
Wskazówka
Spójność postaci kumuluje się w trybie Extend. W 1.5 przedłużony klip zachowuje stabilność punktów charakterystycznych twarzy ustaloną w pierwotnym generowaniu. Szew w miejscu doklejenia jest mniej wykrywalny niż w 1.0, bo oba odcinki mają teraz tę samą bazę geometrii twarzy.
Zmiana 4: Extend from Frame — łańcuch klipów o długości krótkiego metrażu
Tryb Extend w 1.0 doklejał klatki na końcu klipu, ale zestaw sterowania był skromny: podajesz modelowi klip i prosisz, żeby go kontynuował. W 1.5 Extend from Frame dokłada jawny wybór klatki — wskazujesz konkretną klatkę końcową, od której chcesz kontynuować, a model wznawia dokładnie od tego stanu wizualnego: ta sama pozycja tematu, ten sam kierunek światła, ta sama trajektoria kamery, te same warunki atmosferyczne.
Różnica ma znaczenie, gdy generowanie daje dobre otwarcie i środek, ale ostatnie klatki odchodzą od zamiaru. W 1.0 niedoskonała klatka końcowa oznaczała, że albo przyjmujesz ją jako punkt wyjścia do przedłużenia, albo generujesz cały klip od nowa. W 1.5 możesz wybrać klatkę z wcześniejszej części generowania — ten czystszy moment kompozycji, od którego naprawdę chcesz kontynuować — i przedłużyć od niego.
Praktyczny przebieg pracy przy dłuższych produkcjach:
- Wygeneruj 15-sekundowy odcinek otwierający. Przejrzyj go i wskaż najlepszą klatkę zamykającą.
- Użyj Extend from Frame, wybierz tę klatkę i wygeneruj kolejne 15 sekund.
- Powtarzaj, aż osiągniesz potrzebny czas trwania.
Łańcuch trzech odcinków po 15 sekund daje 45 sekund materiału z zachowaną postacią, światłem i stanem kamery na złączach. To wystarczy na demonstrację produktu, krótką reklamę albo sekwencję otwierającą narrację — w modelu, który liczy 10–15 kredytów za sekundę.
Uwaga
Tryb Extend w OmniArt działa w różnych modelach, nie tylko w Grok Imagine. Możesz wygenerować otwarcie innym modelem, a potem kontynuować je przez Extend from Frame w Grok Imagine 1.5, przenosząc poprawę spójności postaci na materiał, który powstał gdzie indziej.
Na co naprawdę przekłada się +52 Elo
Różnica w arenie rozkłada się na te cztery zmiany, ważone tym, jak często każda pojawia się w codziennej produkcji:
| Zmiana | Wpływ na Elo | Gdzie to czujesz |
|---|---|---|
| Naturalność dźwięku | wysoki | każdy klip z dialogiem albo warstwowym tłem |
| Natywne 15 sekund | umiarkowany | 15-sekundowe formaty na social media; przebiegi oparte na Extend |
| Spójność twarzy | wysoki | gadające głowy, praca z postacią w trybie Reference, obroty głowy |
| Extend from Frame | umiarkowany | produkcje wieloodcinkowe, łańcuchy klipów |
Arena testuje konkretnie tryb obraz na wideo — nieruchome wejście zostaje ożywione. W tym kontekście spójność twarzy i naturalność dźwięku to dwie cechy, które ślepo głosujący zauważają najbardziej, i to wyjaśnia, skąd wziął się gros zysku Elo. Czas trwania i Extend from Frame liczą się bardziej dla doświadczonych użytkowników budujących projekty wieloujęciowe niż dla głosującego, który w ślepym teście ogląda pięciosekundowy klip.
Czy warto wygenerować projekty z 1.0 od nowa?
Krótka wersja: tak przy każdym projekcie, w którym głównym tematem była twarz, i tak przy wszystkim, co powstało wzorcem „wygeneruj, potem przedłuż”, żeby dobić do 15 sekund. W pozostałych przypadkach decyzja zależy od projektu.
Generuj od nowa, jeśli:
- Masz z 1.0 klipy typu gadająca głowa albo skupione na postaci, w których twarz dryfuje w połowie. Te same wejścia w trybie Reference powinny dać w 1.5 zauważalnie czystszy wynik.
- Twoje 15-sekundowe klipy powstawały jako 10 s + 5 s przedłużenia i mają artefakty szwu. Natywne 15-sekundowe generowanie w 1.5 znosi miejsce doklejenia.
- Ostatnim problemem klipu, poza tym gotowego, był dźwięk. Naturalna intonacja i warstwowe tło w 1.5 rozwiązują najczęstsze zastrzeżenia bez pisania promptu wizualnego od nowa.
Nie warto generować od nowa, jeśli:
- Klip był czysto ruchowy, bez postaci i bez dialogu — sufit jakości wizualnej w 720p się nie zmienił, a poprawa zachowania Extend jest przy wyniku jednoodcinkowym marginalna.
- Intensywnie korzystasz z trybu Modify — Modify nadal automatycznie skaluje każde wejście powyżej 854×480 w dół do 480p przed przetwarzaniem, a to zachowanie w 1.5 się nie zmieniło.
- Oryginał był krótkim (poniżej 8 s) nastrojowym ujęciem uzupełniającym, bez postaci. Poprawa dźwięku otoczenia jest realna, ale przy obecnych cenach w kredytach raczej nie uzasadnia ponownego generowania.
Ostrzeżenie
Limit skalowania w dół do 480p w trybie Modify nie zmienił się w 1.5. Jeśli chcesz edytować klip 720p bez utraty rozdzielczości, zrób przebieg Modify przed finalnym generowaniem w 720p, a nie po nim.
Pierwsze kroki w OmniArt
Grok Imagine 1.5 jest dostępny w przestrzeni wideo OmniArt obok V6, BACH, Sora 2, Veo 3, Kling 3.0, HappyHorse 1.0 i Seedance 2.0. Nie potrzebujesz osobnej subskrypcji xAI — to samo saldo kredytów w OmniArt pokrywa wszystkie modele.
Najszybszy sposób na skalibrowanie 1.5 to uruchomienie promptu, który znasz już z 1.0. To samo wejście, wyniki obok siebie, a poprawa twarzy i dźwięku widoczna od razu na tle twojego punktu odniesienia. Zacznij od tego, a potem zdecyduj, które projekty z 1.0 naprawdę zyskują dość, żeby je powtórzyć.
Pełny rozkład sześciu trybów, matematykę kredytów i wzorce promptów w trybie Reference opisuje przewodnik po Grok Imagine. Porównanie wielu modeli, w którym pozycja Grok Imagine w rankingu obraz na wideo wpisuje się w szerszy krajobraz 2026, znajdziesz w krótkiej liście najlepszych modeli obraz na wideo z aktualnymi rankingami.
Gotowy, aby tworzyć?
Zacznij generować świetne treści z AI