Grok Imagine 1.5 проти 1.0: що насправді змінюють +52 Elo
Grok Imagine 1.5 від xAI додав +52 Elo до 1.0 і вийшов на перше місце в Image-to-Video Arena. Розкладаємо цей приріст на чотири зміни, які креатори відчувають одразу, — власний звук, кліпи на 15 секунд, стабільність облич і Extend from Frame — із порівняннями «до/після» в OmniArt.

Grok Imagine 1.5 вийшов як оновлення в статусі Preview — і зрушив справу з місця: +52 Elo до 1.0 і перше місце в Image-to-Video Arena, попереду Seedance 2.0, HappyHorse 1.0 та Google Veo у сліпому тестуванні користувачами. Стрибок на 52 пункти у зрілому рейтингу — це серйозний сигнал: приблизно 57 % перемог 1.5 у сліпих очних порівняннях проти 1.0.
Цифра — це заголовок. Для продакшену важить інше: які саме зміни її дали. Ми ганяли 1.5 поруч із 1.0 у відеопросторі OmniArt, і приріст чітко зводиться до чотирьох речей, які креатори відчувають одразу. Жодна з них не є ледь помітною.
Якщо ви тільки знайомитеся з Grok Imagine, почніть із базового посібника — там докладно розібрані шість режимів генерації, схеми промптів і арифметика кредитів. Ця стаття виходить із того, що ви вже випустили кілька кліпів на 1.0 і хочете знати, що варто перегенерувати.
Швидке порівняння характеристик: 1.0 і 1.5
| Характеристика | Grok Imagine 1.0 | Grok Imagine 1.5 |
|---|---|---|
| Максимальна роздільна здатність | 720p | 720p |
| Максимальна тривалість | 10 секунд | 15 секунд |
| Співвідношення сторін | 16:9, 4:3, 1:1, 9:16, 3:4, 3:2, 2:3 | 16:9, 4:3, 1:1, 9:16, 3:4, 3:2, 2:3 |
| Звук | Власний, спільна генерація | Власний, спільна генерація — покращена |
| Стабільність облич | Базова | Помітно краща |
| Extend from Frame | Продовження з останнього кадру | Явний вибір кадру, краща безперервність |
| Основа для зображень | FLUX.1 (Black Forest Labs) | FLUX.1 (Black Forest Labs) |
| Вартість (480p) | 10 кредитів/с | 10 кредитів/с |
| Вартість (720p) | 15 кредитів/с | 15 кредитів/с |
| Місце в арені | Кілька позицій нижче першої | 1-ше місце в Image-to-Video Arena |
Стеля роздільної здатності й ціна в кредитах не змінилися. Приріст — у тому, що модель робить у цих самих межах.
Зміна 1: власний звук нарешті звучить як один прохід
Grok Imagine генерує звук ще від 1.0 — діалоги, ліпсинк, звукові ефекти та фонову музику, і все це будується з відеотокенів за один прохід інференсу, без окремої аудіомоделі, пришитої згори. На практиці у звуку 1.0 було два стабільні провали: механічний таймінг діалогів (слова йшли рівними інтервалами, з паузами на граматичних межах, а не в природних місцях для вдиху) і плаский фон (сцена в кав’ярні з одним нерозрізненним гулом без просторової варіації).
1.5 знімає обидва. Та сама однопрохідна архітектура тепер дає інтонацію на рівні речення: коротші, енергійніші фрази лягають зі спадною інтонацією, а довша пояснювальна мова має чутне підвищення всередині речення перед розв’язанням. Фон відчувається шаруватим: вулична сцена генерує трафік удалині, кроки поруч, приглушені двері крамниці за героєм. Це не постобробка — усе генерується тією самою покадровою послідовною логікою, якою рушій Aurora веде рух: кожен кадр підказує наступний, а акустичне середовище йде за візуальною траєкторією.
Промпт для 1.0: "A barista explains the brewing process to a customer across the counter, coffee shop background, warm lighting."
- Результат 1.0: діалог ішов метрономними чергами, фонова кавомашина весь час звучала на одному рівні.
- Результат 1.5: у поясненні бариста є природні паузи всередині речень, кавомашина наростає, коли починається нове замовлення, а бурмотіння клієнта тихіше й просторово розташоване далі від головної осі мікрофона.
Найпомітніший розрив — у кліпах із великою кількістю діалогів. Якщо ви проганяли відео Grok 1.0 через окрему аудіомодель заради голосу, 1.5 закриває більшу частину цього розриву власними силами.
Зміна 2: 10 секунд стають 15
Grok Imagine 1.0 обмежував кліпи 10 секундами. 1.5 піднімає стелю до 15 секунд, підтримуючи будь-яку цілу тривалість від 1 до 15. Зайві п’ять секунд звучать дрібницею. На практиці це різниця між соціальним кліпом, якому потрібен один прохід Extend, і кліпом, який виходить з першої генерації.
Арифметика кредитів для стандартних сценаріїв змінюється відчутно:
| Сценарій | 1.0 (максимум 10 с + Extend до 15 с) | 1.5 (15 с одразу) |
|---|---|---|
| 15 с для TikTok, 480p | 100 (10 с) + 75 (продовження 5 с) = 175 | 150 |
| 15 с для TikTok, 720p | 150 (10 с) + 112,5 (продовження 5 с) = 262,5 | 225 |
| 10 с товарного кадру, 720p | 150 | 150 (без змін) |
Для найпоширенішого соціального формату — кліпу на 15 секунд — 1.5 обходиться приблизно на 14 % дешевше у 480p і на 14 % дешевше у 720p, ніж підхід «згенерувати й продовжити» на 1.0, і ви оминаєте артефакт шва, який іноді з’являється в точці стикування.
Сам режим Extend у 1.5 нікуди не подівся й потрібен для виходу за межі 15 секунд, але тепер ви платите за продовження лише тоді, коли матеріалу справді потрібен довший хронометраж, а не тому, що базова генерація змусила різати.
Зміна 3: точність облич і стабільність персонажа
Це найважче вимірювана зміна — і найчастіше згадувана у відгуках спільноти. Grok Imagine 1.0 умів згенерувати переконливе обличчя в першому кадрі й загубити його: риси перетікали між кадрами, особливо на поворотах голови, змінах освітлення чи швидкому русі. Персонажі, задані через режим референсів, дрейфували в пропорціях обличчя на довших кліпах.
1.5 розв’язує це на рівні архітектури. Послідовна генерація кадрів у рушії Aurora, де кожен кадр спирається на попередній, тепер стабільніше утримує лицьові орієнтири крізь повороти та зміни світла. Відгуки спільноти сходяться в одному: повороти голови, які раніше давали моторошне перетікання, тепер завершуються чисто на нормальній швидкості відтворення.
Порівняння «до/після» на одному промпті в режимі референсів: "[@Image1] walks toward the camera through a fog-filled alley, face clearly visible, turns slightly right at 8 seconds, warm streetlight from above."
- 1.0: герой тримав ідентичність протягом ходьби, а потім на повороті праворуч у середньому кадрі стався помітний стрибок ширини щелепи, який повертався назад під кінець руху.
- 1.5: той самий поворот завершується без артефакту корекції. Пропорції щелепи та вилиць тримаються крізь усе обертання.
Це найважливіше для будь-якого сценарію, де обличчя персонажа — головний герой кадру: контент із людиною, що говорить, наративи навколо персонажа, демонстрації товару з ведучим і будь-який кліп, де режим референсів утримує ту саму ідентичність у кількох кадрах.
Порада
Стабільність персонажа накопичується в режимі Extend. У 1.5 продовжений кліп зберігає стабільність лицьових орієнтирів, закладену в первинній генерації. Шов, де приєднується продовження, помітити важче, ніж у 1.0, бо обидва сегменти тепер спираються на ту саму базову геометрію обличчя.
Зміна 4: Extend from Frame — ланцюжок кліпів до довжини короткого фільму
Режим Extend у 1.0 дописував кадри в кінець кліпу, але керування було обмежене: ви давали моделі кліп і просили продовжити. У 1.5 функція Extend from Frame додає явний вибір кадру — ви обираєте конкретний кінцевий кадр, від якого хочете продовжити, і модель стартує рівно з цього візуального стану: те саме положення героя, той самий напрямок світла, та сама траєкторія камери, ті самі атмосферні умови.
Різниця важить тоді, коли генерація дала правильні початок і середину, а фінальні кадри відійшли від задуму. У 1.0 недосконалий останній кадр означав або прийняти його як основу для продовження, або перегенеровувати весь кліп. У 1.5 ви можете обрати кадр із раніших моментів генерації — той чистіший момент композиції, від якого насправді хотіли продовжити, — і подовжити звідти.
Практичний робочий процес для довших постановок:
- Згенеруйте перший сегмент на 15 секунд. Передивіться, знайдіть найкращий кінцевий кадр.
- Скористайтеся Extend from Frame, виберіть цей кадр, згенеруйте наступні 15 секунд.
- Повторюйте, доки не досягнете потрібного хронометражу.
Ланцюжок із трьох сегментів по 15 секунд дає 45 секунд матеріалу зі збереженням персонажа, освітлення та стану камери на стиках. Цього вистачає на демонстрацію товару, коротку рекламу чи наративний вступ — від моделі, яка тарифікується посекундно по 10–15 кредитів.
Примітка
Режим Extend в OmniArt працює між моделями, а не лише з Grok Imagine. Ви можете згенерувати початок іншою моделлю й продовжити його через Extend from Frame у Grok Imagine 1.5, принісши покращену стабільність персонажа в матеріал, який виник деінде.
До чого насправді зводяться +52 Elo
Розрив в арені розкладається на ці чотири зміни, зважені за тим, як часто кожна трапляється в щоденному продакшені:
| Зміна | Вплив на Elo | Де ви це відчуваєте |
|---|---|---|
| Природність звуку | Високий | Будь-який кліп із діалогом чи шаруватим фоном |
| Власні 15 секунд | Помірний | Соціальні формати на 15 секунд; процеси, залежні від Extend |
| Стабільність облич | Високий | Люди, що говорять, персонажі в режимі референсів, повороти голови |
| Extend from Frame | Помірний | Багатосегментні постановки, ланцюжки кліпів |
Арена тестує саме «зображення у відео»: подане статичне зображення оживлюють. У такому контексті стабільність облич і природність звуку — дві якості, які сліпі голосувальники помічають найбільше, і це пояснює, звідки взялася основна частина приросту Elo. Тривалість і Extend from Frame важать більше для досвідчених користувачів, які будують multi-shot проєкти, ніж для голосувальника, що дивиться п’ятисекундний кліп.
Чи варто перегенеровувати проєкти з 1.0?
Коротко: так для будь-якого проєкту, де обличчя було головним героєм, і так для всього, що ви збирали за схемою «згенерувати й продовжити», аби дотягнути до 15 секунд. Для решти рішення залежить від проєкту.
Перегенеруйте зараз, якщо:
- Ви робили в 1.0 кліпи з людиною, що говорить, або з фокусом на персонажі й помічали дрейф обличчя посеред кліпу. Ті самі вхідні дані для режиму референсів мають дати помітно чистіший результат у 1.5.
- Ви збирали 15-секундні кліпи як 10 с + продовження на 5 с і натрапляли на артефакти шва. Власна генерація на 15 секунд у 1.5 прибирає точку стикування.
- Звук був останньою перепоною для кліпу, який в іншому був майже готовий. Природна інтонація й шаруватий фон у 1.5 знімають найтиповіші претензії без переписування візуальної частини промпту.
Не варто перегенеровувати, якщо:
- Кліп був суто про рух, без персонажів і діалогу: стеля візуальної якості у 720p не змінилася, а покращення в поведінці Extend для односегментного результату мінімальні.
- Ви активно користуєтеся режимом Modify: він і далі автоматично зменшує будь-який вхід понад 854×480 до 480p перед обробкою, і в 1.5 ця поведінка не змінилася.
- Оригіналом був короткий (до 8 с) атмосферний перебивочний кадр без персонажів. Покращення фонового звуку реальне, але навряд чи виправдає перегенерацію за поточних цін у кредитах.
Попередження
Ліміт зменшення до 480p у режимі Modify в 1.5 не змінився. Якщо треба відредагувати кліп у 720p без втрати роздільної здатності, робіть прохід Modify до фінальної генерації у 720p, а не після неї.
Як почати в OmniArt
Grok Imagine 1.5 доступний у відеопросторі OmniArt поряд із V6, BACH, Sora 2, Veo 3, Kling 3.0, HappyHorse 1.0 і Seedance 2.0. Окрема підписка xAI не потрібна — той самий баланс кредитів OmniArt покриває всі моделі.
Найшвидший спосіб відкалібрувати 1.5 — прогнати промпт, який ви вже знаєте з 1.0. Той самий вхід, результати поруч, а покращення в обличчях і звуку одразу видно на тлі вашої базової лінії. Почніть із цього, а потім вирішуйте, які проєкти на 1.0 справді варто перегенерувати.
Повний розбір шести режимів, арифметику кредитів і схеми промптів для режиму референсів дає посібник із Grok Imagine. Щоб побачити, як позиція Grok Imagine у «зображення у відео» вписується в ширшу картину 2026 року, зазирніть у короткий список найкращих моделей «зображення у відео» з актуальним рейтингом.
Готові творити?
Почніть створювати вражаючий контент зі ШІ