Gemini Omni 1.1 Flash: co trafiło do sterowania wideo
Gemini Omni 1.1 Flash od Google to aktualizacja wideo pod produkcję: przedłużaj sceny, ustaw pierwszą i ostatnią klatkę, szkicuj w 360p i generuj wynik w 1080p albo 4K.

27 sierpnia 2026 Google wydał Gemini Omni 1.1 Flash — pierwszą aktualizację modelu wideo Omni Flash z I/O nastawioną na produkcję. Oficjalna zapowiedź i wątek Google na X ustawiają ją jako wydanie o sterowaniu, a nie zmianę nazwy: przedłuż scenę, zablokuj klatkę początkową i końcową, dołącz krótkie referencje wideo, tanio naszkicuj w 360p, a potem wygeneruj 1080p albo 4K dla ujęć, które zostawiasz.
To inne zadanie niż konsumencki debiut z 19 maja, o którym pisaliśmy w tekście Gemini Omni Flash: co trafiło na rynek, a co Google zatrzymał. Pierwotna obietnica Flash to edycja konwersacyjna i wejście any-to-any, twardy klip 10-sekundowy i brak przedłużania sceny w API dla deweloperów z 30 czerwca. 1.1 to przebieg, który próbuje zrobić te klipy wystarczająco długimi, ostrymi i reżyserowanymi pod proces produkcyjny.
Ten artykuł to przegląd możliwości: co 1.1 naprawdę dodał, które limity wciąż obowiązują i które z tych zadań da się już dziś uruchomić w OmniArt.
Co Gemini Omni 1.1 Flash naprawdę wypuścił
Identyfikator API Google to gemini-omni-1.1-flash (preview na Gemini Enterprise Agent Platform jako gemini-omni-1.1-flash-preview). Domyślny wynik nadal to 720p w orientacji poziomej; 16:9 i 9:16 pozostają dwoma proporcjami obrazu. Znak wodny SynthID nadal jest obowiązkowy.
| Możliwość | Oryginalny Omni Flash | Omni 1.1 Flash |
|---|---|---|
| Długość klipu | 10 sekund na generowanie | Generowania 10-sekundowe, przedłużane krokami po 10 sekund do łącznie 40 sekund |
| Przedłużanie sceny | Nie było w API z 30 czerwca | Analizuje do 10 sekund wcześniejszego materiału (nie tylko ostatnią sekundę) |
| Pierwsza i ostatnia klatka | Nie był to osobny tryb API | Interpoluje ciągły ruch między dwiema klatkami kluczowymi |
| Referencje wideo | Jeden klip; klipy dłuższe niż 3 sekundy nie były przetwarzane w całości | Do trzech klipów po 3 sekundy każdy |
| Rozdzielczość szkicu | 720p domyślnie, bez tańszego podglądu | Szkice 360p, Google podaje do 60 % szybsze i około jednej trzeciej kosztu 720p |
| Rozdzielczość wykończenia | Nieujawniona na I/O; OmniArt serwuje 720p | Wynik 1080p albo 4K, w dokumentacji jako wyjście o wyższej szczegółowości z generowania 720p |
| Powierzchnie | Aplikacja Gemini, Flow, YouTube, potem API z 30 czerwca | Google AI Studio, Gemini API, Gemini Enterprise Agent Platform, Google Flow; przedłużanie sceny także w aplikacji Gemini dla subskrybentów Google AI Plus, Pro i Ultra |
Lista wstrzymanych funkcji z I/O się nie przesunęła. Aktualna dokumentacja Google nadal mówi, że edycja mowy nie jest obsługiwana, wgrywanie referencji audio nie jest obsługiwane, a tryb awatara nigdy nie wszedł do tego wydania. 1.1 dokłada reżyserię i długość. Funkcji wstrzymanych ze względów bezpieczeństwa nie dodaje.
Przedłużanie sceny: 10 sekund kontekstu, do 40 sekund
Przedłużanie sceny to nagłówek wydania. Kontynuujesz od ogona istniejącego klipu, zamiast liczyć, że nowe 10-sekundowe generowanie do niego pasuje.
Własne liczby Google: model czyta teraz do 10 sekund wcześniejszego materiału — „skok względem poprzednich modeli, które brały tylko ostatnią sekundę” — i dopisuje kolejne 3–10 sekund. Powtarzaj to w krokach co 10 sekund, aż skumulowany klip osiągnie 40 sekund. Część ostatnich klatek źródła jest przepisywana, żeby złączenie nie było twardym cięciem. Nie da się dodać materiału na początek i nie da się przedłużyć środka klipu.
Prompt do przedłużenia może być krótki jak "Continue the scene." albo konkretny — z nowym ruchem kamery. Dokumentacja Google mówi wprost, że 0 sekund w prompcie przedłużenia ze znacznikami czasu to początek nowego segmentu, a nie początek oryginalnego klipu. Opisz dźwięk, jeśli ścieżka ma się zmienić; w przeciwnym razie model stara się utrzymać ją spójną.
Dwa ograniczenia warto znać, zanim oprzesz na tym 40-sekundowy materiał:
- Wgrane klipy źródłowe do przedłużenia muszą mieć 10 sekund albo mniej, chyba że przedłużasz klip, który model już wygenerował w tej samej sesji wieloturowiej.
- Przedłużanie wgranego klipu nie jest dostępne w EOG, Szwajcarii i Wielkiej Brytanii. Przedłużanie klipu wygenerowanego przez model jest dostępne we wszystkich regionach, w których działa samo API.
W OmniArt Seedance 2.5 już obsługuje pokrewne zadanie: przedłużaj dowolny wynik trwający 30 sekund lub mniej, wielokrotnie, do 60 sekund, albo generuj 30–180 sekund w jednym przebiegu Long Video. To obecna ścieżka w przestrzeni do długiego reżyserowanego wideo. 40-sekundowy natywny dla Omni łańcuch 1.1 to wersja tego samego pomysłu na powierzchniach Google.
Pierwsza i ostatnia klatka
Ustaw obraz początkowy i obraz końcowy; Omni 1.1 wygeneruje ciągły ruch między nimi. Google ustawia to pod orbity kamery, przejścia zoomem i zapętlone klipy — to ostatnie wychodzi, gdy ten sam obraz jest zarówno pierwszą, jak i ostatnią klatką.
Tagi w prompcie przypisują role. Google dokumentuje proste tagi FIRST_FRAME i LAST_FRAME wewnątrz promptu; w bardziej złożonych promptach źródła można zadeklarować wprost:
[# Sources <FIRST_FRAME>@Image1 <LAST_FRAME>@Image2]
Tagi zostają w prompcie w tej postaci. Otaczająca instrukcja to miejsce, w którym opisujesz ruch: jedno ciągłe ujęcie, bez skoków cięcia, co robi kamera między dwoma kadrami nieruchomymi.
W OmniArt PixVerse V6 już udostępnia przebieg przejścia między zatwierdzoną klatką początkową i końcową. Jeśli brief brzmi „przejdź z tej klatki do tamtej”, nie musisz czekać na osobny identyfikator modelu Omni 1.1. Jeśli brief brzmi „zrób to w wątku rozmowy Omni Flash”, to nadal mieszka w Interactions API Google.
Referencje wideo, do trzech sekund każda
1.1 pozwala wrzucić krótkie wideo referencyjne do tego samego multimodalnego promptu co tekst i obrazy. Publiczne demo Google nakłada trzy klipy tancerzy na trzy stopklatki postaci i prosi o jedno ciągłe ujęcie.
Udokumentowany sufit jest twardszy niż marketingowa linijka. Referencje wideo najlepiej działają przy podobieństwie postaci; dźwięk wewnątrz klipu referencyjnego jest ignorowany; maksimum to trzy klipy, do 3 sekund każdy. Google pisze też, że odnoszenie się do wielu filmów naraz albo wnioskowanie na ich podstawie jako porównanie narracyjne nie jest obsługiwane — traktuj każdy klip jako referencję tematu albo ruchu, a nie jako drugie źródło do montażu.
To realne rozszerzenie względem preview z 30 czerwca, które przyjmowało jedną referencję wideo i nie przetwarzało w całości klipów dłuższych niż 3 sekundy. Nadal nie jest to audio-wejściowa połowa obietnicy any-to-any. Dźwięk nadal opisujesz w prompcie.
Obecna karta Gemini Omni w OmniArt przyjmuje jedno wideo referencyjne (MP4 albo MOV, 1–10 sekund) zmieszane z maksymalnie pięcioma obrazami referencyjnymi, a rozliczenie liczy się od czasu trwania klipu źródłowego. Na pojedynczą referencję ruchu to wystarczy już dziś. Przy większych zestawach materiałów referencyjnych Seedance 2.5 nadal jest modelem przestrzeni zbudowanym wokół tego zadania.
Szkice 360p i wynik 1080p / 4K
Drabina rozdzielczości to druga zmiana produkcyjna. Domyślne generowanie to 720p. Teraz możesz poprosić o:
- 360p — tani poziom szkicu Google. Deklarowane do 60 % szybsze przetwarzanie i około jednej trzeciej kosztu 720p. Flow pozwala szkicować w 360p, a potem pobrać zatrzymane ujęcie w 720p.
- 1080p albo 4K — w dokumentacji to wynik o wyższej szczegółowości z generowania 720p, celowany w social, cyfrowe wykończenie albo emisję.
Przydatny przebieg jest oczywisty: badaj kamerę, grę i punkty cięcia w 360p, a generowanie 1080p albo 4K wydaj na ujęcie, które naprawdę oddasz. To ta sama dyscyplina co szkic na szybkim modelu w OmniArt przed wykończeniem na droższym — tylko teraz to przełącznik rozdzielczości na jednym modelu Omni.
Uwaga
Google opublikował tabelę cen API według rozdzielczości razem z zapowiedzią 1.1. Linijkę „360p to jedna trzecia 720p” traktuj jako porównanie samego Google, a nie jako przelicznik kredytów OmniArt. Karta Gemini Omni w OmniArt obecnie rozlicza powierzchnię 720p o długości 3–10 sekund.
Natywne generowanie 4K w tym składzie nadal jest zadaniem Veo 3.1. Ścieżka 1.1 do 4K to krok wykończenia na klipie Omni, a nie twierdzenie, że Omni zastąpił Veo przy dostawie na duży ekran.
Gdzie to już działa i co OmniArt odsłania dziś
Google wdraża 1.1 w swoim stosie 27 sierpnia:
- Google AI Studio i Gemini API (
gemini-omni-1.1-flash) - Gemini Enterprise Agent Platform (
gemini-omni-1.1-flash-preview) - Google Flow, w tym klatki start/koniec, szkice 360p oraz eksport 1080p / 4K
- Przedłużanie sceny w aplikacji Gemini, dla subskrybentów Google AI Plus, Pro i Ultra
Standardowe generowanie Gemini Omni jest już w OmniArt: 720p, 3–10 sekund, natywne audio, do pięciu obrazów referencyjnych i jedno wideo referencyjne, plan Starter i wyższe. OmniArt nie odsłania obecnie osobnego identyfikatora modelu gemini-omni-1.1-flash, 40-sekundowego łańcucha przedłużeń, zadania pierwszej i ostatniej klatki ani drabiny rozdzielczości 360p / 1080p / 4K. Edycja konwersacyjna z zachowaniem sesji nadal wymaga Interactions API Google, tak jak wtedy, gdy opisywaliśmy API dla deweloperów z 30 czerwca.
Ostrzeżenie
Nie planuj 40-sekundowej dostawy Omni 1.1 na obecnym selektorze Gemini Omni w OmniArt. Model w przestrzeni to powierzchnia Omni Flash w 720p i 10 sekund. Do sterowania specyficznego dla 1.1 użyj API albo Flow Google, aż pojawi się tu osobna karta modelu.
Jak wybierać obok Veo 3.1 i Seedance 2.5
1.1 nie wycofuje reszty linii Google i nie czyni Omni jedyną opcją reżyserowanego wideo w OmniArt. Wybieraj pod ujęcie:
| Ujęcie wymaga | Sięgnij po |
|---|---|
| Poprawek prowadzonych czatem w jednym wątku Omni | Gemini Omni 1.1 w API / Flow Google |
| Natywnego 4K, dźwięku przestrzennego, wykończenia emisyjnego | Veo 3.1 w OmniArt |
| 30-sekundowych pojedynczych ujęć, przedłużeń do 60 sekund albo długiego wideo na 180 sekund | Seedance 2.5 w OmniArt |
| Interpolacji od pierwszej do ostatniej klatki w przestrzeni już dziś | Przejście PixVerse V6 albo First and Last Frames w Seedance 2.5 |
| Szybkiego generowania Omni w 720p z jedną referencją wideo | Gemini Omni w OmniArt |
| Dużych multimodalnych zestawów materiałów referencyjnych | Seedance 2.5 |
Schemat jest ten sam co na I/O: nowe wydania Omni są dodatkami. Zostawiasz modele, które już pokrywają brief, i dokładasz 1.1, gdy zadanie to właśnie konwersacyjne sterowanie Omni plus dłuższe, ostrzejsze wykończenie.
Nawyki pisania promptów, które nadal dotyczą pierwszego 10-sekundowego taktu — jedna jasna akcja, dźwięk wpisany w prompt, bez pola promptu negatywnego — znajdziesz w przewodniku po promptach Omni Flash. Język przedłużania na modelu przestrzeni, który już to robi, jest w przewodniku po montażu i przedłużaniu Seedance 2.5.
Co zrobić w tym tygodniu w OmniArt
Jeśli chcesz spróbować samego Omni, otwórz Gemini Omni w przestrzeni wideo i uruchom obecną powierzchnię 10-sekundową w 720p: tekst, obrazy referencyjne albo jedną krótką referencję wideo. Porównaj ją obok Veo 3.1, Seedance 2.5, PixVerse V6, Klinga i reszty składu — jedno saldo, jedna gramatyka promptu.
Jeśli brief dotyczy właśnie nowych sterowań 1.1 — 40-sekundowego natywnego dla Omni przedłużenia, interpolacji pierwszej i ostatniej klatki wewnątrz Omni albo pętli „360p, potem 4K” — w tym tygodniu użyj Google AI Studio, Flow albo Gemini API, a OmniArt traktuj jako miejsce, w którym już generujesz resztę projektu.
Ten podział jest tymczasowy tak samo, jak była luka oryginalnego API Flash. Gdy sterowanie 1.1 wyląduje jako wybieralny model OmniArt, stanie się kolejną opcją w przestrzeni, która już produkuje, a nie powodem, żeby czekać.
FAQ
Czym jest Gemini Omni 1.1 Flash?
Gemini Omni 1.1 Flash to aktualizacja Omni Flash od Google z 27 sierpnia 2026, multimodalny model generowania i edycji wideo. Dokłada przedłużanie sceny, interpolację pierwszej i ostatniej klatki, krótkie referencje wideo, szkice 360p oraz wynik 1080p / 4K na wierzchu oryginalnej edycji konwersacyjnej i wejścia tekstem, obrazem i wideo.
Czy Gemini Omni 1.1 Flash jest dostępny w OmniArt?
Nie jako osobny identyfikator modelu. OmniArt obecnie serwuje standardowe generowanie Gemini Omni w 720p i 3–10 sekund. Sterowanie specyficzne dla 1.1 — przedłużenie do 40 sekund, pierwsza i ostatnia klatka, szkice 360p oraz wynik 1080p / 4K — wdrażane jest w Google AI Studio, Flow, Gemini API i Gemini Enterprise Agent Platform.
Jak długie mogą być klipy Omni 1.1 Flash?
Pojedyncze generowanie nadal daje 10-sekundowy klip. Przedłużanie sceny dopisuje po 3–10 sekund naraz, korzystając z do 10 sekund wcześniejszego materiału jako kontekstu, do skumulowanego maksimum 40 sekund. Wgrane źródła do przedłużenia muszą mieć 10 sekund albo mniej.
Czy Omni 1.1 Flash generuje natywne 4K?
Google dokumentuje 1080p i 4K jako wynik o wyższej szczegółowości z domyślnego generowania 720p, a nie jako natywną ścieżkę zapisu 4K. Do natywnego wideo 4K w OmniArt Veo 3.1 pozostaje modelem z linii Google zbudowanym pod takie wykończenie.
Czy 1.1 dodał wgrywanie referencji audio albo edycję mowy?
Nie. Aktualna dokumentacja Omni od Google nadal wymienia wgrywanie referencji audio i edycję mowy jako nieobsługiwane. Dźwięk referencji wideo jest ignorowany. Dźwiękiem nadal sterujesz w prompcie, co zgadza się z tym, co zapisaliśmy w artykule o wejściu any-to-any.
Gotowy, aby tworzyć?
Zacznij generować świetne treści z AI