IndustryМоделі та аналітика6 хв читання

Вхід «будь-що в будь-що» в Gemini Omni Flash: що він дає насправді

Омнімодальність — головна обіцянка Gemini Omni Flash, але API, яке вийшло, вужче за маркетинг. Ось що вхід «будь-що в будь-що» справді змінює в брифі.

Команда OmniArt
Вхід «будь-що в будь-що» в Gemini Omni Flash: що він дає насправді

Найбільше навантаження в анонсі Gemini Omni Flash несло слово «Omni» — обіцянка однієї моделі, якій можна одночасно згодувати текст, зображення, звук і відео в межах одного промпту. Це справді інша обіцянка, ніж у попередніх відеомоделей з одним типом входу, і саме через неї модель виправдовує свою назву. Але версія, що вийшла в API для розробників, вужча за формулювання з презентації, і цей розрив важливий, якщо ви плануєте будувати навколо неї реальну роботу.

Цей матеріал відділяє те, що вхід «будь-що в будь-що» дає сьогодні, від того, що досі лишається мрією, — а далі переходить до кориснішої тези: як мультимодальний вхід узагалі змінює спосіб, у який ви пишете бриф.

Що насправді означає «будь-що в будь-що»

Більшість відеомоделей приймають один тип керування. Ви пишете текст або даєте одне референсне зображення, і модель працює з цим. Вхід «будь-що в будь-що» означає, що одна граматика промпту приймає кілька модальностей разом і повертає зв’язний результат, який поважає їх усі: референсний кадр для вигляду, короткий кліп для руху й письмову вказівку для всього іншого — разом, а не замість одне одного.

Зсув відбувається від опису кадру словами до збирання його з матеріалів. Ось у чому справжня можливість, і саме тому «омнімодальність» — не чистий маркетинг. Питання лише в тому, наскільки вона вже жива.

Обіцянка проти випущеного API

Ось чесна матриця для поточної preview-версії — прямо з документації самого API:

ВхідСтатусПримітки
Текстовий промптПідтримуєтьсяОснова кожної генерації
Референсне зображенняПідтримуєтьсяТекст у відео, зображення у відео та референс героя
Референсне відеоПідтримується, із застереженнямРеференси довші за 3 секунди обробляються не повністю
Референсне аудіоНе підтримуєтьсяВи не можете вивантажити звук чи голос, під який модель мала б підлаштуватися
Кілька відеореференсівНе підтримуєтьсяОдин референсний кліп на генерацію
Промпти не англійськоюНе перевіреноПовністю підтримується лише англійська

Попередження

Саме прогалина зі звуком найімовірніше зламає ваш план. Omni Flash за замовчуванням генерує звукову доріжку, але «будь-що в будь-що» не передбачає, що ви передасте їй музичну підкладку, закадровий голос чи запис навколишнього середовища для синхронізації. Звук тут — це вивід, яким ви керуєте словами, а не вхід, який ви надаєте.

Тож точне прочитання таке: сьогодні «будь-що в будь-що» — це текст + зображення + відео на вході, відео (зі згенерованим звуком) на виході. Половину омнімодальної обіцянки, що стосується звуку на вході, свідомо притримали — так само, як функції редагування мовлення у відео та аватарів, які Google не випустила на старті з міркувань безпеки. Це справжня зміна можливостей порівняно з моделями з одним входом; просто це ще не та повна картина «будь-що в будь-що в будь-що», яку обіцяє назва.

Що мультимодальний вхід змінює в брифі

Щойно ви починаєте збирати кадр із матеріалів замість описувати його прозою, сам бриф змінює форму. Три входи виконують різні ролі, а майстерність полягає в тому, щоб призначити кожному те, у чому він найсильніший:

  • Референсне зображення несе вигляд — героя, палітру, кадрування, яке вам уже подобається.
  • Референсне відео несе рух — рух камери або дію, яку ви хочете відтворити.
  • Текст несе намір і все те, чого матеріали не показують, — настрій, зміни, те, чого немає в жодному з референсів.

Практичний ефект у тому, що ви перестаєте перекладати картинку в прикметники. Замість писати «теплий крупний план із малою глибиною різкості та повільним наїздом», ви даєте кадр, який уже так виглядає, і кліп, який уже так рухається, а слова витрачаєте на те, що нове. Для всіх, хто колись бився над описом конкретної естетики текстом, це і є розблокування процесу.

Чотири режими завдань і як вони поєднуються

API відкриває чотири типи task, і вони чисто лягають на ідею збирання з матеріалів:

  1. text_to_video — чистий опис, без матеріалів. Запасний варіант, коли ви починаєте з нуля.
  2. image_to_video — оживити кадр. Найпоширеніша точка входу: сильне зображення стає першим кадром руху.
  3. reference_to_video — перенести героя або стиль із референсу в нову генерацію.
  4. edit — розмовний режим зі збереженням стану, який переробляє попередній кліп, зберігаючи те, чого ви не змінювали.

Задуманий потік зчіплює їх: згенеруйте або оживіть основу одним із перших трьох режимів, а потім переходьте в edit і доопрацьовуйте в розмові. Це та сама форма, що й у власній зв’язці Google Nano Banana 2 Lite → Omni Flash — відредагувати кадр, потім оживити його, — тільки розтягнута на кілька реплік.

Нюанс зі звуком, розкладений по поличках

Оскільки звук подати не можна, саунд-дизайн стає завданням для письма. Модель створює репліки, ефекти й атмосферу на основі того, що описує ваш промпт: «gentle rain on a window, no music» або «a single soft click, then room tone». Ви отримуєте змістовний контроль, але це контроль описовий, і для планування це означає дві речі:

  • Якщо вашому проєкту потрібно, щоб згенероване відео збігалося з наявною доріжкою — ліцензованою піснею, брендовим джинглом, записаним закадровим голосом, — така синхронізація відбувається на окремому аудіокроці, а не всередині Omni Flash.
  • Якщо ж вам просто потрібен доречний оригінальний звук, гарного опису в промпті цілком достатньо, без жодного вивантаження.

Де сьогодні перебуває OmniArt

Щоб спробувати процес «збирання з матеріалів», не обов’язково чекати на Omni Flash — він уже працює на моделях, живих у просторі OmniArt для відео, і в одному аспекті вони йдуть далі.

Seedance 2.0, доступна в OmniArt уже зараз, будувалася саме навколо цієї ідеї: вона приймає до дев’яти зображень, трьох відеокліпів і — що показово — трьох аудіофайлів в одному промпті, і кожен прив’язується до ролі синтаксисом @image1 / @video1 / @audio1. Сюди входить і той аудіореференс, який Omni Flash притримує. Якщо ваш бриф залежить від можливості дати моделі конкретний звук, цей шлях існує вже сьогодні.

І напрям руху по всьому полю зрозумілий: Seedance 2.5, анонсована в червні, розганяє ту саму архітектуру референсів аж до 50 мультимодальних входів одночасно. Вхід «будь-що в будь-що» — це історія не однієї моделі, а того, куди прямує кероване ШІ-відео. Omni Flash дала ідеї ім’я; простір уже дозволяє її практикувати.

Відкрийте простір OmniArt для відео, зберіть свій набір референсів і дайте матеріалам нести вигляд і рух, поки ваші слова несуть намір. Ось він, бриф «будь-що в будь-що», доступний уже зараз.

Готові творити?

Почніть створювати вражаючий контент зі ШІ

Почати безкоштовно