IndustryModele i analizy8 min czytania

Gemini Omni Flash: co trafiło na rynek, a co Google zatrzymał

Google pokazał Gemini Omni Flash na I/O 2026 — oto co robi pierwszy model Omni, co celowo wstrzymano i jaki praktyczny ruch mają dziś twórcy w OmniArt.

Zespół OmniArt
Gemini Omni Flash: co trafiło na rynek, a co Google zatrzymał

Google I/O 2026 wypadło 19 maja i zanim keynote się skończył, Gemini Omni Flash był już dostępny. Nie „wkrótce”, nie „ograniczona wersja zapoznawcza” — dostępny, tego samego dnia. Dwa tygodnie wcześniej opublikowaliśmy naszą lekturę przecieków sprzed I/O, oddzielając potwierdzone sygnały od spekulacji. Teraz mamy prawdziwy model. Oto co trafiło na rynek, czego Google celowo nie wypuścił i co to znaczy dla twórców, którzy mają coś oddać w tym tygodniu.

Omni Flash to pierwszy publiczny model w nowej strukturze Google o nazwie „Omni”. To nie jest Veo 4 ani zmiana nazwy Veo 3.1 — to osobna linia produktowa, a Google DeepMind potwierdził już wyższy poziom Omni Pro jako kontynuację. Bez daty dla Omni Pro. Flash jest fazą pierwszą.

Co potwierdzone, a co wstrzymane

Tekst o przeciekach nazywał model „natywnym dla Gemini wideo z ambicjami omnimodalnymi”. To się dobrze obroniło. Oto pełny obraz, gdy kurz po keynote już opadł.

FunkcjaStatusCo to znaczy dla twórców
Dziesięciosekundowe klipy wideo ze zsynchronizowanym dźwiękiem z jednego promptuDostarczoneKrótkie formy do social mediów, zwiastuny i identy to naturalne dopasowanie przy tej długości klipu
Wejście dowolne na dowolne: tekst, obraz, dźwięk i wideo w jednym prompcieDostarczoneMożesz podać obraz referencyjny, notatkę głosową i brief — jedna gramatyka promptu dla wszystkich trzech
Edycja konwersacyjna w czacie („change the lighting”, „swap the dog for a cat”)DostarczoneZmiana w przebiegu pracy, którą tekst o przeciekach wskazał jako prawdziwą sensację — więcej o tym niżej
Znak wodny SynthID w każdym wynikuDostarczone — nieopcjonalne, bez przełącznika w APIZakładaj domyślnie wynik ze znakiem wodnym; sprawdź warunki użycia przed komercyjną publikacją
Edycja mowy albo dźwięku wewnątrz wygenerowanego wideoWstrzymane ze względów bezpieczeństwaRyzyko bliskie deepfake'om; Google potwierdził, że to celowe wstrzymanie, a nie brak możliwości
Tryb awataraWstrzymaneTa sama kategoria obaw co edycja dźwięku — bez podanego terminu
API dla deweloperówNa premierze „w najbliższych tygodniach”; otwarte 30 czerwca 2026Standardowe generowanie jest już dostępne przez API i w OmniArt

Ostrzeżenie

Dwie istotne możliwości — edycja dźwięku wewnątrz wideo i tryb awatara — zostały celowo wstrzymane na premierze, nie z powodów technicznych, tylko ze względów bezpieczeństwa. Google to potwierdził. Jeśli twój proces zależy od którejkolwiek z nich, nie ma obejścia ani daty udostępnienia.

Google publicznie przyznał się też do trzech obecnych ograniczeń: spójności wizualnej podczas edycji, złożonych sekwencji ruchu i renderowania czytelnego tekstu w kadrze. To te same słabe punkty, które dzieli cała kategoria wideo AI; Omni Flash ich nie rozwiązał.

Przeciek kontra rzeczywistość

Przed I/O nakreśliliśmy trzy scenariusze tego, czym może być Omni: konsumencka zmiana nazwy Veo, natywny dla Gemini model wideo albo prawdziwy zunifikowany system omnimodalny. Za najbardziej prawdopodobne uznaliśmy „połączenie scenariuszy 2 i 3”.

To było trafne. Omni Flash jest bezsprzecznie natywny dla Gemini — działa wewnątrz aplikacji Gemini i Google Flow, a nie jako samodzielna powierzchnia Veo — i naprawdę przyjmuje dowolne wejście. Rama „omnimodalna”, którą nadał mu Google, nie jest marketingową przesadą; łączenie tekstu, obrazu, dźwięku i wideo w jednym prompcie to realna zmiana możliwości względem modelu wejścia Veo 3.1.

Czego spekulacja nie doceniła: przeciekowa rama „remiksu” zaniżyła głębię funkcji edycji konwersacyjnej. To nie jest tylko remiks od zera. Ta funkcja zachowuje spójność przez wiele tur edycji, a to zupełnie inna sprawa.

Prawdziwą sensacją jest edycja konwersacyjna

Każdy większy dzisiejszy model wideo AI działa na poziomie przebiegu pracy tak samo: piszesz prompt, czekasz, pobierasz klip i piszesz prompt od nowa, jeśli wyszedł źle. Omni Flash to łamie. Funkcja edycji konwersacyjnej pozwala napisać „change the lighting to golden hour” albo „swap the dog for a cat” i dostać poprawiony klip, który zachowuje spójność z wcześniejszymi wynikami zamiast generować od zera.

To ma znaczenie, bo kosztem iteracji w wideo zawsze był cykl regenerowania — i w czasie, i w kredytach. Wielotorowa edycja zachowująca spójność skraca dystans między pierwszym szkicem a gotowym klipem. Oznacza też, że model trzyma stan twojego projektu w sposób, którego przebiegi typu wygeneruj i wyrzuć nie mają.

Obecnie przyznane ograniczenia są realne: złożone sekwencje ruchu tracą spójność między edycjami, a model wciąż potrafi dryfować na drobnych detalach wizualnych. Ale zasada przebiegu pracy jest słuszna i to właśnie ta funkcja ma największą szansę zestarzeć się dobrze, w miarę jak model pod spodem będzie się poprawiał.

Gdzie Omni Flash mieści się w składzie

Mocne strony Omni Flash to konsumencka dostępność, iterowanie w rozmowie i elastyczne wejście multimodalne. Jego ograniczenia — dziesięciosekundowe klipy, brak edycji mowy, przyznane luki w ruchu i renderowaniu tekstu — wyraźnie wyznaczają mu pas.

Czego potrzebuje ujęcieSięgnij po
Iterowanie w rozmowie, dopracowywanie w czacieOmni Flash (na powierzchniach Google)
Natywne 4K, dźwięk przestrzenny, wykończenie emisyjneVeo 3.1
Długie pojedyncze ujęciaSora 2
Ciągłość storyboardu na wielu ujęciachKling, V6 + BACH
Szybkie, stylizowane, energetyczne klipyModele PixVerse
Stosunek jakości do ceny przy dużej objętościKling za ekonomiczne gotowe sekundy

Głębsze spojrzenie na to, jak Omni Flash i Veo 3.1 wypadają ujęcie po ujęciu, znajdziesz w tekście Gemini Omni Flash kontra Veo 3.1: który do twojego przebiegu pracy.

Gdzie faktycznie go użyć

W chwili premiery 19 maja Omni Flash działał w YouTube Shorts, YouTube Create, aplikacji Gemini i Google Flow, a API dla deweloperów wciąż obiecywano „w najbliższych tygodniach”. To API otwarto 30 czerwca 2026; standardowe generowanie wideo Gemini Omni jest teraz dostępne także przez stronę modelu w OmniArt.

Kontekst szerszej linii Veo opisuje tekst Status premiery Veo 4 i miejsce Veo w OmniArt, który omawia, co Veo 3.1 już potrafi i jak wpisuje się w przestrzeń z wieloma modelami.

Omni Pro jest potwierdzony — ale bez terminu

Google DeepMind potwierdził, że nadchodzi wyższy poziom Omni Pro, opisany jako „skok jakościowy ponad Flash”. Nie ma daty premiery, listy funkcji ani dostępu zapoznawczego. Planuj wokół tego, co wychodzi, a nie tego, co obiecane.

Jeśli twój proces ma coś do oddania w trzecim kwartale, zbuduj to dziś na potwierdzonej specyfikacji Omni Flash. Kiedy Omni Pro się pojawi, dołożysz go jako opcję do przebiegu pracy, który już produkuje — nie czekasz na niego i nie przebudowujesz pod niego platformy.

Uwaga

To właśnie praktyczny argument za przestrzenią z wieloma modelami: nowe premiery są dodatkami, a nie zakłóceniami. Porównujesz je z tym, co już wydajesz, a nie z tym, na co się czekało.

Co zrobić w tym tygodniu

Pełną pętlę edycji konwersacyjnej Google z zachowaniem sesji obsłużysz w aplikacji Gemini, Google Flow albo w Interactions API. Do standardowego generowania z tekstu i obrazu Gemini Omni Flash jest teraz dostępny w OmniArt obok reszty składu wideo.

W OmniArt porównasz Gemini Omni Flash z Veo 3.1 i resztą składu — modelami PixVerse, Sorą 2, Klingiem, Happy Horse, Seedance 2 i innymi — w obrazie, wideo, dźwięku i muzyce w jednej przestrzeni. Jedno saldo, jedna gramatyka promptu, jedno miejsce do porównywania wyników obok siebie.

Praktyczne kroki, żeby wycisnąć najwięcej z Veo 3.1 w czasie oceniania Omni Flash, opisuje przewodnik po promptach i języku kinowym Veo 3.1, który obejmuje cały przebieg pracy od briefu do gotowego klipu.

Praktyczny ruch: przepuść bieżący brief przez modele, które są dostępne i stabilne, w tym Gemini Omni Flash, a Omni Pro dołóż tylko wtedy, gdy pojawi się z zadaniem, którego twój obecny proces jeszcze nie obsługuje.

FAQ

Czy Gemini Omni Flash jest już dostępny?

Tak. Zadebiutował na Google I/O 2026 dnia 19 maja, 30 czerwca otworzył API dla deweloperów i jest teraz dostępny do standardowego generowania przez stronę modelu Gemini Omni w OmniArt. Sterowanie konwersacyjne Google z zachowaniem sesji pozostaje specyficzne dla jego własnych powierzchni produktowych i API.

Czym Omni Flash różni się od Veo 3.1?

Omni Flash jest natywny dla Gemini, przyjmuje wejście dowolne na dowolne (tekst, obraz, dźwięk, wideo w jednym prompcie) i ma wielotorową edycję konwersacyjną. Veo 3.1 to dedykowany model wideo z potwierdzonym natywnym wynikiem 4K i dźwiękiem przestrzennym. Standardowe generowanie dla obu mieszka teraz w OmniArt; pełna powierzchnia sterowania konwersacyjnego Google pozostaje osobna.

Jakie funkcje Google zatrzymał w Omni Flash?

Celowo wstrzymano dwie możliwości: edycję mowy i dźwięku wewnątrz wideo oraz tryb awatara. Google potwierdził, że wstrzymano je ze względów bezpieczeństwa, a nie z powodu ograniczeń technicznych. Dla żadnej z nich nie ma daty udostępnienia.

Czy Gemini Omni Pro zastąpi Flash?

Google DeepMind potwierdził Omni Pro jako przyszły model wyższego poziomu, opisany jako „skok jakościowy ponad Flash”, ale nie ujawnił funkcji, cen ani daty premiery. Planuj wokół potwierdzonych możliwości Flash; Omni Pro traktuj jako przyszły dodatek.

Czy Omni Flash ma znak wodny SynthID?

Tak. Każdy wynik Omni Flash zawiera znak wodny SynthID. Jest nieopcjonalny i nie ma przełącznika w API. Sprawdź regulamin platformy, zanim użyjesz wyników w kontekście komercyjnym.

Gotowy, aby tworzyć?

Zacznij generować świetne treści z AI

Zacznij za darmo