IndustryМоделі та аналітика10 хв читання

Grok Imagine 1.5 проти 1.0: що насправді змінюють +52 Elo

Grok Imagine 1.5 від xAI додав +52 Elo до 1.0 і вийшов на перше місце в Image-to-Video Arena. Розкладаємо цей приріст на чотири зміни, які креатори відчувають одразу, — власний звук, кліпи на 15 секунд, стабільність облич і Extend from Frame — із порівняннями «до/після» в OmniArt.

Команда OmniArt
Grok Imagine 1.5 проти 1.0: що насправді змінюють +52 Elo

Grok Imagine 1.5 вийшов як оновлення в статусі Preview — і зрушив справу з місця: +52 Elo до 1.0 і перше місце в Image-to-Video Arena, попереду Seedance 2.0, HappyHorse 1.0 та Google Veo у сліпому тестуванні користувачами. Стрибок на 52 пункти у зрілому рейтингу — це серйозний сигнал: приблизно 57 % перемог 1.5 у сліпих очних порівняннях проти 1.0.

Цифра — це заголовок. Для продакшену важить інше: які саме зміни її дали. Ми ганяли 1.5 поруч із 1.0 у відеопросторі OmniArt, і приріст чітко зводиться до чотирьох речей, які креатори відчувають одразу. Жодна з них не є ледь помітною.

Якщо ви тільки знайомитеся з Grok Imagine, почніть із базового посібника — там докладно розібрані шість режимів генерації, схеми промптів і арифметика кредитів. Ця стаття виходить із того, що ви вже випустили кілька кліпів на 1.0 і хочете знати, що варто перегенерувати.

Швидке порівняння характеристик: 1.0 і 1.5

ХарактеристикаGrok Imagine 1.0Grok Imagine 1.5
Максимальна роздільна здатність720p720p
Максимальна тривалість10 секунд15 секунд
Співвідношення сторін16:9, 4:3, 1:1, 9:16, 3:4, 3:2, 2:316:9, 4:3, 1:1, 9:16, 3:4, 3:2, 2:3
ЗвукВласний, спільна генераціяВласний, спільна генерація — покращена
Стабільність обличБазоваПомітно краща
Extend from FrameПродовження з останнього кадруЯвний вибір кадру, краща безперервність
Основа для зображеньFLUX.1 (Black Forest Labs)FLUX.1 (Black Forest Labs)
Вартість (480p)10 кредитів/с10 кредитів/с
Вартість (720p)15 кредитів/с15 кредитів/с
Місце в ареніКілька позицій нижче першої1-ше місце в Image-to-Video Arena

Стеля роздільної здатності й ціна в кредитах не змінилися. Приріст — у тому, що модель робить у цих самих межах.

Зміна 1: власний звук нарешті звучить як один прохід

Grok Imagine генерує звук ще від 1.0 — діалоги, ліпсинк, звукові ефекти та фонову музику, і все це будується з відеотокенів за один прохід інференсу, без окремої аудіомоделі, пришитої згори. На практиці у звуку 1.0 було два стабільні провали: механічний таймінг діалогів (слова йшли рівними інтервалами, з паузами на граматичних межах, а не в природних місцях для вдиху) і плаский фон (сцена в кав’ярні з одним нерозрізненним гулом без просторової варіації).

1.5 знімає обидва. Та сама однопрохідна архітектура тепер дає інтонацію на рівні речення: коротші, енергійніші фрази лягають зі спадною інтонацією, а довша пояснювальна мова має чутне підвищення всередині речення перед розв’язанням. Фон відчувається шаруватим: вулична сцена генерує трафік удалині, кроки поруч, приглушені двері крамниці за героєм. Це не постобробка — усе генерується тією самою покадровою послідовною логікою, якою рушій Aurora веде рух: кожен кадр підказує наступний, а акустичне середовище йде за візуальною траєкторією.

Промпт для 1.0: "A barista explains the brewing process to a customer across the counter, coffee shop background, warm lighting."

  • Результат 1.0: діалог ішов метрономними чергами, фонова кавомашина весь час звучала на одному рівні.
  • Результат 1.5: у поясненні бариста є природні паузи всередині речень, кавомашина наростає, коли починається нове замовлення, а бурмотіння клієнта тихіше й просторово розташоване далі від головної осі мікрофона.

Найпомітніший розрив — у кліпах із великою кількістю діалогів. Якщо ви проганяли відео Grok 1.0 через окрему аудіомодель заради голосу, 1.5 закриває більшу частину цього розриву власними силами.

Зміна 2: 10 секунд стають 15

Grok Imagine 1.0 обмежував кліпи 10 секундами. 1.5 піднімає стелю до 15 секунд, підтримуючи будь-яку цілу тривалість від 1 до 15. Зайві п’ять секунд звучать дрібницею. На практиці це різниця між соціальним кліпом, якому потрібен один прохід Extend, і кліпом, який виходить з першої генерації.

Арифметика кредитів для стандартних сценаріїв змінюється відчутно:

Сценарій1.0 (максимум 10 с + Extend до 15 с)1.5 (15 с одразу)
15 с для TikTok, 480p100 (10 с) + 75 (продовження 5 с) = 175150
15 с для TikTok, 720p150 (10 с) + 112,5 (продовження 5 с) = 262,5225
10 с товарного кадру, 720p150150 (без змін)

Для найпоширенішого соціального формату — кліпу на 15 секунд — 1.5 обходиться приблизно на 14 % дешевше у 480p і на 14 % дешевше у 720p, ніж підхід «згенерувати й продовжити» на 1.0, і ви оминаєте артефакт шва, який іноді з’являється в точці стикування.

Сам режим Extend у 1.5 нікуди не подівся й потрібен для виходу за межі 15 секунд, але тепер ви платите за продовження лише тоді, коли матеріалу справді потрібен довший хронометраж, а не тому, що базова генерація змусила різати.

Зміна 3: точність облич і стабільність персонажа

Це найважче вимірювана зміна — і найчастіше згадувана у відгуках спільноти. Grok Imagine 1.0 умів згенерувати переконливе обличчя в першому кадрі й загубити його: риси перетікали між кадрами, особливо на поворотах голови, змінах освітлення чи швидкому русі. Персонажі, задані через режим референсів, дрейфували в пропорціях обличчя на довших кліпах.

1.5 розв’язує це на рівні архітектури. Послідовна генерація кадрів у рушії Aurora, де кожен кадр спирається на попередній, тепер стабільніше утримує лицьові орієнтири крізь повороти та зміни світла. Відгуки спільноти сходяться в одному: повороти голови, які раніше давали моторошне перетікання, тепер завершуються чисто на нормальній швидкості відтворення.

Порівняння «до/після» на одному промпті в режимі референсів: "[@Image1] walks toward the camera through a fog-filled alley, face clearly visible, turns slightly right at 8 seconds, warm streetlight from above."

  • 1.0: герой тримав ідентичність протягом ходьби, а потім на повороті праворуч у середньому кадрі стався помітний стрибок ширини щелепи, який повертався назад під кінець руху.
  • 1.5: той самий поворот завершується без артефакту корекції. Пропорції щелепи та вилиць тримаються крізь усе обертання.

Це найважливіше для будь-якого сценарію, де обличчя персонажа — головний герой кадру: контент із людиною, що говорить, наративи навколо персонажа, демонстрації товару з ведучим і будь-який кліп, де режим референсів утримує ту саму ідентичність у кількох кадрах.

Порада

Стабільність персонажа накопичується в режимі Extend. У 1.5 продовжений кліп зберігає стабільність лицьових орієнтирів, закладену в первинній генерації. Шов, де приєднується продовження, помітити важче, ніж у 1.0, бо обидва сегменти тепер спираються на ту саму базову геометрію обличчя.

Зміна 4: Extend from Frame — ланцюжок кліпів до довжини короткого фільму

Режим Extend у 1.0 дописував кадри в кінець кліпу, але керування було обмежене: ви давали моделі кліп і просили продовжити. У 1.5 функція Extend from Frame додає явний вибір кадру — ви обираєте конкретний кінцевий кадр, від якого хочете продовжити, і модель стартує рівно з цього візуального стану: те саме положення героя, той самий напрямок світла, та сама траєкторія камери, ті самі атмосферні умови.

Різниця важить тоді, коли генерація дала правильні початок і середину, а фінальні кадри відійшли від задуму. У 1.0 недосконалий останній кадр означав або прийняти його як основу для продовження, або перегенеровувати весь кліп. У 1.5 ви можете обрати кадр із раніших моментів генерації — той чистіший момент композиції, від якого насправді хотіли продовжити, — і подовжити звідти.

Практичний робочий процес для довших постановок:

  1. Згенеруйте перший сегмент на 15 секунд. Передивіться, знайдіть найкращий кінцевий кадр.
  2. Скористайтеся Extend from Frame, виберіть цей кадр, згенеруйте наступні 15 секунд.
  3. Повторюйте, доки не досягнете потрібного хронометражу.

Ланцюжок із трьох сегментів по 15 секунд дає 45 секунд матеріалу зі збереженням персонажа, освітлення та стану камери на стиках. Цього вистачає на демонстрацію товару, коротку рекламу чи наративний вступ — від моделі, яка тарифікується посекундно по 10–15 кредитів.

Примітка

Режим Extend в OmniArt працює між моделями, а не лише з Grok Imagine. Ви можете згенерувати початок іншою моделлю й продовжити його через Extend from Frame у Grok Imagine 1.5, принісши покращену стабільність персонажа в матеріал, який виник деінде.

До чого насправді зводяться +52 Elo

Розрив в арені розкладається на ці чотири зміни, зважені за тим, як часто кожна трапляється в щоденному продакшені:

ЗмінаВплив на EloДе ви це відчуваєте
Природність звукуВисокийБудь-який кліп із діалогом чи шаруватим фоном
Власні 15 секундПомірнийСоціальні формати на 15 секунд; процеси, залежні від Extend
Стабільність обличВисокийЛюди, що говорять, персонажі в режимі референсів, повороти голови
Extend from FrameПомірнийБагатосегментні постановки, ланцюжки кліпів

Арена тестує саме «зображення у відео»: подане статичне зображення оживлюють. У такому контексті стабільність облич і природність звуку — дві якості, які сліпі голосувальники помічають найбільше, і це пояснює, звідки взялася основна частина приросту Elo. Тривалість і Extend from Frame важать більше для досвідчених користувачів, які будують multi-shot проєкти, ніж для голосувальника, що дивиться п’ятисекундний кліп.

Чи варто перегенеровувати проєкти з 1.0?

Коротко: так для будь-якого проєкту, де обличчя було головним героєм, і так для всього, що ви збирали за схемою «згенерувати й продовжити», аби дотягнути до 15 секунд. Для решти рішення залежить від проєкту.

Перегенеруйте зараз, якщо:

  • Ви робили в 1.0 кліпи з людиною, що говорить, або з фокусом на персонажі й помічали дрейф обличчя посеред кліпу. Ті самі вхідні дані для режиму референсів мають дати помітно чистіший результат у 1.5.
  • Ви збирали 15-секундні кліпи як 10 с + продовження на 5 с і натрапляли на артефакти шва. Власна генерація на 15 секунд у 1.5 прибирає точку стикування.
  • Звук був останньою перепоною для кліпу, який в іншому був майже готовий. Природна інтонація й шаруватий фон у 1.5 знімають найтиповіші претензії без переписування візуальної частини промпту.

Не варто перегенеровувати, якщо:

  • Кліп був суто про рух, без персонажів і діалогу: стеля візуальної якості у 720p не змінилася, а покращення в поведінці Extend для односегментного результату мінімальні.
  • Ви активно користуєтеся режимом Modify: він і далі автоматично зменшує будь-який вхід понад 854×480 до 480p перед обробкою, і в 1.5 ця поведінка не змінилася.
  • Оригіналом був короткий (до 8 с) атмосферний перебивочний кадр без персонажів. Покращення фонового звуку реальне, але навряд чи виправдає перегенерацію за поточних цін у кредитах.

Попередження

Ліміт зменшення до 480p у режимі Modify в 1.5 не змінився. Якщо треба відредагувати кліп у 720p без втрати роздільної здатності, робіть прохід Modify до фінальної генерації у 720p, а не після неї.

Як почати в OmniArt

Grok Imagine 1.5 доступний у відеопросторі OmniArt поряд із V6, BACH, Sora 2, Veo 3, Kling 3.0, HappyHorse 1.0 і Seedance 2.0. Окрема підписка xAI не потрібна — той самий баланс кредитів OmniArt покриває всі моделі.

Найшвидший спосіб відкалібрувати 1.5 — прогнати промпт, який ви вже знаєте з 1.0. Той самий вхід, результати поруч, а покращення в обличчях і звуку одразу видно на тлі вашої базової лінії. Почніть із цього, а потім вирішуйте, які проєкти на 1.0 справді варто перегенерувати.

Повний розбір шести режимів, арифметику кредитів і схеми промптів для режиму референсів дає посібник із Grok Imagine. Щоб побачити, як позиція Grok Imagine у «зображення у відео» вписується в ширшу картину 2026 року, зазирніть у короткий список найкращих моделей «зображення у відео» з актуальним рейтингом.

Готові творити?

Почніть створювати вражаючий контент зі ШІ

Почати безкоштовно