Вхід «будь-що в будь-що» в Gemini Omni Flash: що він дає насправді
Омнімодальність — головна обіцянка Gemini Omni Flash, але API, яке вийшло, вужче за маркетинг. Ось що вхід «будь-що в будь-що» справді змінює в брифі.

Найбільше навантаження в анонсі Gemini Omni Flash несло слово «Omni» — обіцянка однієї моделі, якій можна одночасно згодувати текст, зображення, звук і відео в межах одного промпту. Це справді інша обіцянка, ніж у попередніх відеомоделей з одним типом входу, і саме через неї модель виправдовує свою назву. Але версія, що вийшла в API для розробників, вужча за формулювання з презентації, і цей розрив важливий, якщо ви плануєте будувати навколо неї реальну роботу.
Цей матеріал відділяє те, що вхід «будь-що в будь-що» дає сьогодні, від того, що досі лишається мрією, — а далі переходить до кориснішої тези: як мультимодальний вхід узагалі змінює спосіб, у який ви пишете бриф.
Що насправді означає «будь-що в будь-що»
Більшість відеомоделей приймають один тип керування. Ви пишете текст або даєте одне референсне зображення, і модель працює з цим. Вхід «будь-що в будь-що» означає, що одна граматика промпту приймає кілька модальностей разом і повертає зв’язний результат, який поважає їх усі: референсний кадр для вигляду, короткий кліп для руху й письмову вказівку для всього іншого — разом, а не замість одне одного.
Зсув відбувається від опису кадру словами до збирання його з матеріалів. Ось у чому справжня можливість, і саме тому «омнімодальність» — не чистий маркетинг. Питання лише в тому, наскільки вона вже жива.
Обіцянка проти випущеного API
Ось чесна матриця для поточної preview-версії — прямо з документації самого API:
| Вхід | Статус | Примітки |
|---|---|---|
| Текстовий промпт | Підтримується | Основа кожної генерації |
| Референсне зображення | Підтримується | Текст у відео, зображення у відео та референс героя |
| Референсне відео | Підтримується, із застереженням | Референси довші за 3 секунди обробляються не повністю |
| Референсне аудіо | Не підтримується | Ви не можете вивантажити звук чи голос, під який модель мала б підлаштуватися |
| Кілька відеореференсів | Не підтримується | Один референсний кліп на генерацію |
| Промпти не англійською | Не перевірено | Повністю підтримується лише англійська |
Попередження
Саме прогалина зі звуком найімовірніше зламає ваш план. Omni Flash за замовчуванням генерує звукову доріжку, але «будь-що в будь-що» не передбачає, що ви передасте їй музичну підкладку, закадровий голос чи запис навколишнього середовища для синхронізації. Звук тут — це вивід, яким ви керуєте словами, а не вхід, який ви надаєте.
Тож точне прочитання таке: сьогодні «будь-що в будь-що» — це текст + зображення + відео на вході, відео (зі згенерованим звуком) на виході. Половину омнімодальної обіцянки, що стосується звуку на вході, свідомо притримали — так само, як функції редагування мовлення у відео та аватарів, які Google не випустила на старті з міркувань безпеки. Це справжня зміна можливостей порівняно з моделями з одним входом; просто це ще не та повна картина «будь-що в будь-що в будь-що», яку обіцяє назва.
Що мультимодальний вхід змінює в брифі
Щойно ви починаєте збирати кадр із матеріалів замість описувати його прозою, сам бриф змінює форму. Три входи виконують різні ролі, а майстерність полягає в тому, щоб призначити кожному те, у чому він найсильніший:
- Референсне зображення несе вигляд — героя, палітру, кадрування, яке вам уже подобається.
- Референсне відео несе рух — рух камери або дію, яку ви хочете відтворити.
- Текст несе намір і все те, чого матеріали не показують, — настрій, зміни, те, чого немає в жодному з референсів.
Практичний ефект у тому, що ви перестаєте перекладати картинку в прикметники. Замість писати «теплий крупний план із малою глибиною різкості та повільним наїздом», ви даєте кадр, який уже так виглядає, і кліп, який уже так рухається, а слова витрачаєте на те, що нове. Для всіх, хто колись бився над описом конкретної естетики текстом, це і є розблокування процесу.
Чотири режими завдань і як вони поєднуються
API відкриває чотири типи task, і вони чисто лягають на ідею збирання з матеріалів:
text_to_video— чистий опис, без матеріалів. Запасний варіант, коли ви починаєте з нуля.image_to_video— оживити кадр. Найпоширеніша точка входу: сильне зображення стає першим кадром руху.reference_to_video— перенести героя або стиль із референсу в нову генерацію.edit— розмовний режим зі збереженням стану, який переробляє попередній кліп, зберігаючи те, чого ви не змінювали.
Задуманий потік зчіплює їх: згенеруйте або оживіть основу одним із перших трьох режимів, а потім переходьте в edit і доопрацьовуйте в розмові. Це та сама форма, що й у власній зв’язці Google Nano Banana 2 Lite → Omni Flash — відредагувати кадр, потім оживити його, — тільки розтягнута на кілька реплік.
Нюанс зі звуком, розкладений по поличках
Оскільки звук подати не можна, саунд-дизайн стає завданням для письма. Модель створює репліки, ефекти й атмосферу на основі того, що описує ваш промпт: «gentle rain on a window, no music» або «a single soft click, then room tone». Ви отримуєте змістовний контроль, але це контроль описовий, і для планування це означає дві речі:
- Якщо вашому проєкту потрібно, щоб згенероване відео збігалося з наявною доріжкою — ліцензованою піснею, брендовим джинглом, записаним закадровим голосом, — така синхронізація відбувається на окремому аудіокроці, а не всередині Omni Flash.
- Якщо ж вам просто потрібен доречний оригінальний звук, гарного опису в промпті цілком достатньо, без жодного вивантаження.
Де сьогодні перебуває OmniArt
Щоб спробувати процес «збирання з матеріалів», не обов’язково чекати на Omni Flash — він уже працює на моделях, живих у просторі OmniArt для відео, і в одному аспекті вони йдуть далі.
Seedance 2.0, доступна в OmniArt уже зараз, будувалася саме навколо цієї ідеї: вона приймає до дев’яти зображень, трьох відеокліпів і — що показово — трьох аудіофайлів в одному промпті, і кожен прив’язується до ролі синтаксисом @image1 / @video1 / @audio1. Сюди входить і той аудіореференс, який Omni Flash притримує. Якщо ваш бриф залежить від можливості дати моделі конкретний звук, цей шлях існує вже сьогодні.
І напрям руху по всьому полю зрозумілий: Seedance 2.5, анонсована в червні, розганяє ту саму архітектуру референсів аж до 50 мультимодальних входів одночасно. Вхід «будь-що в будь-що» — це історія не однієї моделі, а того, куди прямує кероване ШІ-відео. Omni Flash дала ідеї ім’я; простір уже дозволяє її практикувати.
Відкрийте простір OmniArt для відео, зберіть свій набір референсів і дайте матеріалам нести вигляд і рух, поки ваші слова несуть намір. Ось він, бриф «будь-що в будь-що», доступний уже зараз.
Готові творити?
Почніть створювати вражаючий контент зі ШІ