GuidePoradniki krok po kroku7 min czytania

Jak pisać prompty do 10-sekundowego wideo w Gemini Omni Flash

Gemini Omni Flash ma nietypowy sposób pracy z promptami: brak parametru negatywnego, dwie proporcje obrazu, tylko angielski i dwa odrębne tryby promptowania. Zobacz, jak dobrze pisać oba.

Zespół OmniArt
Jak pisać prompty do 10-sekundowego wideo w Gemini Omni Flash

Większość poradników o promptach do wideo AI uczy pisać jedną rzecz: bogaty, szczegółowy akapit, który raz przekazujesz modelowi. Gemini Omni Flash przełamuje to założenie. Jego API dla deweloperów (działa od 30 czerwca) opiera się na dwóch różnych działaniach z promptem — pierwszym generowaniu, a potem bieżącej rozmowie o edycjach, z których każda przekształca ten sam klip. Gdy piszesz tylko pod jedno i pomijasz drugie, zostawiasz większość możliwości modelu niewykorzystaną.

Sposób pracy z promptem w Omni Flash jest nietypowy także przez to, co usuwa. Nie ma pola promptu negatywnego, parametru temperature, instrukcji systemowej, a proporcje obrazu są tylko dwie. To nie są luki, które trzeba ślepo obchodzić — każda zmienia sposób formułowania promptu. Ten przewodnik omawia oba tryby i ograniczenia, które je kształtują.

Uwaga

Od publikacji tego przewodnika Gemini Omni Flash dołączył do przestrzeni wideo OmniArt dla standardowego generowania z tekstu i obrazu referencyjnego. Poniższe sekcje nadal opisują bezpośrednio konwersacyjny proces Google, ponieważ OmniArt obecnie nie udostępnia kontrolek Interactions API, które zachowują sesję.

Dwa tryby promptu, nie jeden

Każda sesja Omni Flash ma dwa rodzaje promptu i każdy premiuje inny sposób pisania.

Prompt pierwszego generowania to kompletny brief dla jednego 10-sekundowego momentu: temat, ruch, kamera, światło, dźwięk, styl. Działa jak każdy mocny prompt typu text-to-video lub image-to-video — umieść szczegóły na początku, pisz konkretnie i opisz całe ujęcie naraz.

Instrukcja edycji konwersacyjnej jest odwrotna. Jest krótka, wskazuje dokładnie jedną zmianę i zakłada, że model ma już poprzedni klip w kontekście. "Make the lighting golden hour." "Swap the sedan for a pickup." Model wprowadza zmianę, zachowując wszystko, czego nie wymieniasz — przez previous_interaction_id, który przenosi stan sesji przez maksymalnie trzy kolejne edycje w Interactions API. Upchnij trzy zmiany w jednej instrukcji edycji, a stracisz precyzję, dla której ten tryb jest wart użycia.

Model mentalny: komponuj w pierwszym prompcie, reżyseruj w kolejnych. Zbuduj solidny klip bazowy, a potem dopracowuj go tak, jak przekazuje się reżyserowi uwagi w trakcie zdjęć — po jednej naraz.

Ograniczenia API, które kształtują brzmienie promptu

Lista parametrów Omni Flash jest z założenia krótka. Każde pominięcie ma konsekwencję dla promptowania:

OgraniczenieCo oznacza dla promptu
Brak pola promptu negatywnegoWpisuj wykluczenia w sam prompt — "an empty street, no pedestrians, no traffic" zamiast osobnej listy negatywnej
Brak parametrów temperature / top_p i brak instrukcji systemowejNie możesz regulować zmienności ani ustawić trwałej reguły stylu — za każdym razem wpisuj ton i styl w tekst promptu
Proporcje obrazu: tylko 9:16 albo 16:9Wybierz orientację z góry; nie ma opcji kwadratu ani szerokiego kadru kinowego, więc kadruj pionowo albo poziomo od pierwszego słowa
Audio opisywane, nigdy wgrywaneNie możesz podać ścieżki do dopasowania — opisujesz słowami dźwięk, którego chcesz (zobacz niżej)
Angielski w pełni obsługiwany; inne języki nieprzetestowanePisz prompty po angielsku, aby uzyskać przewidywalne wyniki
Twardy limit 10 sJedna wyraźna akcja na generowanie — nie lista ujęć

Ostrzeżenie

Omni Flash nie obsługuje wgrywania referencji audio. Nie możesz dać mu podkładu muzycznego ani próbki głosu do synchronizacji. Model domyślnie generuje ścieżkę audio, a jedyną kontrolą są słowa w prompcie — więc projekt dźwięku trzeba opisać, nie załączyć.

Szablon dla pierwszego generowania

Ponieważ 10 s mieści jeden moment, najmocniejsze pierwsze prompty opisują jedną ciągłą scenę z doprecyzowaną każdą warstwą. Sześć pól obejmuje niemal każde ujęcie:

  1. Temat — kto albo co jest na ekranie, opisane konkretnie
  2. Ruch — jedna akcja, która rozgrywa się w klipie
  3. Kamera — jeden ruch, nie sekwencja ("slow push in", "locked-off wide")
  4. Światło — kierunek, charakter, pora dnia
  5. Projekt dźwięku — audio, które ma zostać wygenerowane, opisane słowami
  6. Styl — paleta, epoka, odniesienie filmowe, faktura

Przykład roboczy:

"A ceramic pour-over coffee dripper on a pale oak counter, steam rising as dark coffee streams into the glass carafe below. Slow push in on the drip. Soft morning light from a window camera-left, warm and diffused. Sound: gentle water trickle, distant kitchen ambience, no music. Muted editorial palette, shallow depth of field, shot on a fast prime lens."

Zauważ, że wykluczenia są wpisane w zdanie ("no music"), kamera ma jeden ruch, a dźwięk jest opisany wprost. Na tym polega cała dyscyplina.

Edycja konwersacyjna: słownictwo, które trafia

Gdy masz już klip bazowy, edycje są miejscem, w którym Omni Flash wyprzedza procesy typu wygeneruj i wyrzuć. Trzymaj każdą instrukcję przy jednej intencji i korzystaj ze spójnego słownika czasowników, który model odczytuje jednoznacznie:

  • Relight — "make it golden hour", "add a cool rim light from behind"
  • Replace — "swap the coffee dripper for a French press"
  • Restyle — "make it feel like 1970s film stock"
  • Recolor — "change the mug to matte black"
  • Re-time — "slow the pour down", "let the steam linger longer"

Dwie zasady utrzymują spójność wątku. Jedna zmiana na turę — model zachowuje to, czego nie wymieniasz, więc pojedyncza uwaga jest bardziej przewidywalna i łatwiejsza do cofnięcia przez ponowny prompt. I buduj na języku poprzedniej tury — używaj ponownie rzeczowników, które już zostały ustalone ("the mug", "the pour"), aby model zakotwiczył się w tych samych elementach zamiast od nowa wnioskować scenę.

Wskazówka

Łańcuch trzech edycji to budżet, nie sugestia. Zaplanuj prompt bazowy tak, aby wymagał jak najmniej kolejnych kroków — mocne pierwsze generowanie zostawia tury edycji na prawdziwe zmiany kreatywne, a nie na naprawianie rzeczy, które pierwszy prompt mógł określić.

Jak pracować z obecnymi ograniczeniami

Kilku ograniczeń nie da się rozwiązać promptem, więc warto promptować z myślą o nich, zamiast z nimi walczyć:

  • Limit 10 s. API nie ma przedłużania sceny, więc nie pisz promptów sugerujących dłuższy łuk. Zaprojektuj jeden samodzielny moment.
  • Spójność postaci między zmianami sceny jest uznaną słabością. Jeśli podobieństwo ma znaczenie, trzymaj edycje w tej samej scenie, zamiast prosić model o przeniesienie postaci do nowego miejsca.
  • Referencje wideo powyżej 3 s nie są w pełni przetwarzane. Każdy klip referencyjny powinien być krótki i konkretny.
  • Brak referencji z wielu plików wideo i brak edycji głosu — oba elementy nie są obsługiwane, więc zaplanuj te kroki w osobnym narzędziu, a nie w prompcie.

Żadne z nich nie dyskwalifikuje Omni Flash jako szybkiego narzędzia do krótkich iteracji. Oznaczają tylko, że Omni Flash nagradza prompty dopasowane do tego, co robi dobrze: jeden ciasny moment, dopracowywany konwersacyjnie.

Co działa dziś w OmniArt

Gemini Omni Flash jest już dostępny w OmniArt i niemal każdy powyższy nawyk promptowania przekłada się bezpośrednio: jeden jasny moment, konkret zamiast gąszczu słów kluczowych i dźwięk wpisany w prompt. Głównym wyjątkiem jest wieloturowa edycja z zachowaniem sesji, która pozostaje procesem po stronie API dostawcy, a nie kontrolką interfejsu OmniArt.

  • Generowanie oparte na materiałach referencyjnych przekłada się bezpośrednio na Seedance 2.0, dostępny w OmniArt, który przyjmuje do dziewięciu obrazów, trzech wideo i trzech plików audio przypisanych do ról składnią @image1 / @video1 — idea „komponowania z plików”, z większą liczbą wejść niż oferuje Omni Flash.
  • Kinowy język kamery dobrze pasuje do Veo 3.1, który z umiarem interpretuje czasowniki ruchu, takie jak "drift", "glide" i "dolly in".
  • Sześciopolowy szablon (temat, ruch, kamera, światło, dźwięk, styl) to ten sam szkielet, który daje czyste wyniki w każdym modelu wideo w przestrzeni.

Otwórz Gemini Omni Flash w przestrzeni wideo i napisz pierwszy prompt jako jeden kompletny moment. Jeśli potrzebujesz wieloturowej pętli edycji Google, kontynuuj tę część w Interactions API; dla standardowego generowania i procesów z obrazem referencyjnym wpis modelu OmniArt jest gotowy już teraz.

Gotowy, aby tworzyć?

Zacznij generować świetne treści z AI

Zacznij za darmo