Grok Imagine: гайд креатора по видеомодели xAI в 2026
Практический гайд по Grok Imagine: шесть режимов генерации, паттерны промптов, реальная математика кредитов и когда выбрать его вместо V6 или Sora 2 в 2026 году.

Grok Imagine — модель генерации видео и звука от xAI, запущенная в январе 2026 года и доступная через OmniArt без отдельной подписки xAI. Это другой продукт, а не чат-бот Grok: у них общее имя и больше ничего. В этом гайде разбираем, подо что модель сделана, какие шесть режимов генерации действительно важны, какие паттерны промптов подходят каждому режиму и во сколько кредитов обходятся реальные проекты.
Что такое Grok Imagine
Grok Imagine генерирует видео до 720p с нативным звуком клипами по 1–15 секунд. Главный её приём — не разрешение: на 720p она осознанно не соревнуется с Sora 2 или V6 в чистой достоверности картинки. Главный приём — рабочая поверхность вокруг модели: шесть режимов генерации, которые делят один набор весов и позволяют генерировать, продлевать, перестилизовывать и править, не выходя из модели.
| Параметр | Значение |
|---|---|
| Максимальное разрешение | 720p (для 1080p и выше берите V6) |
| Максимальная длительность | 15 с на генерацию |
| Соотношения сторон | 16:9, 4:3, 1:1, 9:16, 3:4, 3:2, 2:3 |
| Звук | Нативный, генерируется вместе с видео |
| Стоимость (480p) | 10 кредитов в секунду |
| Стоимость (720p) | 15 кредитов в секунду |
Шесть режимов, о которых стоит знать
Каждый режим — свой способ объяснить модели, с каким типом входных данных она работает. Правильный выбор режима — это большая часть всей работы над промптом.
Text-to-Video
Режим по умолчанию. Пишете промпт — получаете клип. Лучше всего подходит для проверки концепций, мудбордов и черновиков под соцсети, когда референса ещё нет. Стоимость — 10–15 кредитов в секунду в зависимости от разрешения.
Image-to-Video
Оживляет статичный кадр, сохраняя композицию исходника. Первый кадр жёстко привязан к вашему изображению. Берите его для анимации иллюстраций, предметной съёмки и дизайн-макетов, где исходный кадр менять нельзя.
Reference Mode — то, что выделяет модель
Reference Mode принимает от 1 до 7 изображений как визуальные якоря, не фиксируя при этом первый кадр. Изображения помечаются тегами @Image1, @Image2, @Image3, и вы ссылаетесь на них в промпте. Именно этого нет у большинства других видеомоделей: они либо жёстко фиксируют первый кадр (image-to-video), либо вообще не принимают референсов (text-to-video). Reference Mode стоит между ними и даёт самый чистый путь к одинаковому персонажу в серии кадров.
Стоимость — 15 кредитов в секунду на 480p и 22,5 кредита в секунду на 720p.
Extend Mode
Дописывает к существующему клипу от 2 до 10 секунд. На вход подаётся MP4 длиной от 2 до 15 с. На выходе — один непрерывный клип, а списываются кредиты только за дописанную часть. Кроссмодельный приём: Extend Mode работает с видео, сгенерированным любой моделью в видеопространстве OmniArt, а не только Grok.
Modify Mode
Правит существующий клип без полной перегенерации: замена фона, изменение света, сдвиг цвета на конкретных объектах, погодные эффекты. Вход ограничен 8 с и автоматически масштабируется до 854×480, то есть исходники высокого разрешения теряют детали на этом круге. Применяйте Modify к клипам, которые вы и так сняли в 480p.
Editing Suite — Restyle, Object Manipulation, Sketches to Life
Набор операций после генерации. Restyle накладывает художественные стили (Cyberpunk, Anime, Retro, Origami, Watercolor, Mosaic). Object Manipulation добавляет, удаляет или заменяет элементы. Sketches to Life оживляет линейные рисунки. Add Performance переносит анимацию персонажа на статичную фигуру. Удобно, когда из одного исходного клипа нужно сделать несколько вариантов.
Промпты, которые уважают модель
Четыре привычки поднимают качество быстрее, чем удлинение промпта.
Говорите на языке кино
В Grok Imagine встроены шесть пресетов камеры: Zoom In, Zoom Out, Dolly Out, Tilt Up, Pan Right, Timelapse. Они срабатывают точнее, когда в промпте есть операторская терминология.
| Слабее | Сильнее |
|---|---|
| «A city street at night with neon signs and people walking» | «Dolly forward through a rain-slicked Tokyo alley, neon signs reflecting in puddles, shallow depth of field, a figure with an umbrella enters frame right, cinematic 2.39:1 framing» |
Помечайте референсы явно
Reference Mode деградирует, когда промпт общий. Привяжите каждый референс к своей роли.
«@Image1 (the red sports car) drifts around a mountain corner with @Image3 (the sunset sky) in the background while @Image2 (the driver character) grips the steering wheel.»
Выносите действие в начало
Генерация идёт последовательно по всей длительности. Если кульминация стоит в конце пятисекундного клипа, модель может её не доиграть. Передвиньте действие вперёд.
| Слабее | Сильнее |
|---|---|
| «A quiet forest scene with birds, then suddenly a deer leaps across a stream» | «A deer leaps across a forest stream in golden hour light, camera tracking its arc, birds scatter from nearby branches» |
Раскладывайте клипы на 10–15 с по таймлайну
Для длинных клипов впишите тайминг прямо в промпт.
«Slow zoom into abandoned library (0–5s), dust particles catch light beams (5–10s), book falls from shelf (10–12s), pages flutter (12–15s).»
Сколько это стоит на самом деле
Три реальных сценария съёмки, посчитанных в кредитах OmniArt.
Пятнадцатисекундный ролик о товаре для TikTok
| Шаг | Режим | Разрешение | Кредиты |
|---|---|---|---|
| Первая генерация | Text-to-Video | 480p, 10 с | 100 |
| Продление | Extend | 480p, 5 с | 75 |
| Итого (с одной правкой) | 175–275 |
Раскадровка бренда из трёх кадров
| Шаг | Режим | Разрешение | Кредиты |
|---|---|---|---|
| Кадр 1 с двумя референсами | Reference, 8 с | 720p | 180 |
| Кадр 2, те же референсы | Reference, 8 с | 720p | 180 |
| Кадр 3, те же референсы | Reference, 6 с | 720p | 135 |
| Правка света в кадре 2 | Modify, 8 с | 720p | 180 |
| Итого | 675 |
Проход перестилизации
| Шаг | Режим | Разрешение | Кредиты |
|---|---|---|---|
| Перестилизация в Anime | Restyle, 8 с | 480p | 120 |
Когда выбрать другую модель
Grok Imagine — правильный инструмент для короткого формата в соцсетях, оживления набросков и историй из нескольких кадров на референсах в 480p–720p. Неправильный инструмент он тогда, когда нужно:
| Потребность | Что лучше |
|---|---|
| 1080p и выше | V6, BACH, Veo 3 |
| Точный контроль оптики (фокусное расстояние, глубина резкости, аберрации) | V6 |
| Клипы на 16–20 с за один проход | Sora 2 |
| Диалоги и музыка продакшен-качества | Отдельная звуковая модель плюс монтаж |
| Сохранить высокое разрешение исходника при правках | Не берите Modify Mode |
Рабочие схемы, которые доходят до сдачи
Grok Imagine окупается в OmniArt не как самостоятельный генератор, а как слой итераций. Больше всего дают две схемы.
Схема 1 — генерируем в другом месте, дорабатываем здесь. Отрисуйте мастер-клип в V6 или Sora 2 в более высоком разрешении, а затем с помощью Extend, Restyle и Modify накрутите варианты и дополнения в Grok — дешевле.
Схема 2 — Reference Mode для фиксации персонажа. Когда кампании бренда нужен один и тот же персонаж в пяти кадрах, зафиксируйте внешность одним якорным изображением в @Image1, а затем сгенерируйте каждый кадр с тем же референсом в Reference Mode. Дешевле, чем перезапускать Sora 2 на каждый кадр.
Предупреждение
Modify Mode автоматически уменьшает любой вход больше 854×480 до 480p перед обработкой. Если нужно отредактировать клип в 1080p без потери разрешения, сделайте правку в другом инструменте или выполните её до шага увеличения.
С чего начать в OmniArt
Grok Imagine доступен в видеопространстве OmniArt рядом с V6, BACH, Sora 2, Veo 3, Kling 3.0, HappyHorse 1.0 и Seedance 2.0. Тот же баланс кредитов, та же загрузка референсов, та же грамматика промптов. Начните с Text-to-Video, чтобы освоить пресеты камеры, и переходите к Reference Mode, когда появится персонаж или товар, который нужно зафиксировать.
Дополните этот гайд разбором операторских возможностей BACH для повествовательной работы с более высокой точностью картинки или подборкой лучших моделей «изображение в видео», если выбираете модель под конкретный кадр.
Готовы создавать?
Начните генерировать впечатляющий контент с ИИ