UpdateModele i analizy11 min czytania

FLUX 3: co naprawdę udostępniono, a czego nie

FLUX 3 pojawił się 23 lipca 2026 z 20-sekundowym wideo i natywnym audio — ale bez modelu obrazu. Co udostępniono, co naprawdę mówią benchmarki i czego używać dziś.

Zespół OmniArt
FLUX 3: co naprawdę udostępniono, a czego nie

Black Forest Labs ogłosiło FLUX 3 23 lipca 2026 i nazwało go jednym z najbardziej zaawansowanych multimodalnych modeli do inteligencji wizualnej. Dwa dni później nagłówek, który ma znaczenie dla większości twórców, nie brzmi jednak, co FLUX 3 potrafi — tylko co możesz faktycznie uruchomić. FLUX 3 Video jest dostępny po zgłoszeniu. FLUX 3 Action wymaga umowy partnerskiej. A FLUX 3 Image, czyli część, na której wyrosła nazwa FLUX, nie został udostępniony wcale.

Ta luka jest właściwą historią. Firma, która sprawiła, że generowanie obrazów z otwartymi wagami stało się poważną opcją, pokazała flagową premierę z brakującą połową obrazową, a resztę ogłoszenia skierowała ku wideo, audio i robotyce. To prawdziwy zwrot i mówi sporo o tym, gdzie dziś jest presja na tym rynku.

Ten tekst oddziela ogłoszenie od produktu: co jest dostępne dziś, czego benchmarki BFL dowodzą, a czego nie, czym naprawdę jest deklaracja architektoniczna i po co sięgnąć, dopóki FLUX 3 Image pozostaje za listą oczekujących.

Co Black Forest Labs naprawdę ogłosiło

FLUX 3 jest przedstawiany jako jedna rodzina modeli trenowana wspólnie na obrazach, wideo, audio i akcjach, a nie jako cztery osobne systemy. Ogłoszenie obejmuje FLUX 3 Video, FLUX 3 Image, FLUX 3 Action (z wariantem robotycznym o nazwie FLUX-mimic) oraz przyszły FLUX 3 Dev z otwartymi wagami.

Dostępność to zupełnie inna tabela.

Status udostępnienia każdego komponentu FLUX 3 dwa dni po ogłoszeniu: wideo i akcja we wczesnym dostępie, podczas gdy model obrazu, otwarte wagi i ceny pozostają nieudostępnione
Status udostępnienia każdego komponentu FLUX 3 dwa dni po ogłoszeniu: wideo i akcja we wczesnym dostępie, podczas gdy model obrazu, otwarte wagi i ceny pozostają nieudostępnione

Ostrzeżenie

Nie ma publicznych cen FLUX 3, opublikowanej liczby parametrów, raportu technicznego dla rodziny modeli ani warunków licencji dla obiecanej wersji z otwartymi wagami. Każda specyfikacja, która podaje rozdzielczość FLUX 3 Image, limity obrazów referencyjnych albo koszt jednego obrazu, jest ekstrapolacją, nie dokumentacją.

Model obrazu jest brakującym elementem

Własne sformułowanie BFL mówi, że FLUX 3 Image otrzyma „fazę wczesnego dostępu w kolejnych tygodniach”. To całe publiczne zobowiązanie. Bez daty, bez specyfikacji, bez benchmarku.

Ma to większe znaczenie niż zwykłe etapowe wdrożenie, bo generowanie obrazów jest tym, co oznacza marka FLUX. FLUX.1 i jego linia edycji Kontext stały się domyślnym wyborem w procesach z otwartymi wagami. Ogłoszenie flagowego generowania bez dostępności tego komponentu — w czasie, gdy konkurenci wypuszczają modele obrazu co tydzień — zostawia twórców z deklaracjami, których nie da się sprawdzić.

Praktyczny skutek: dziś nie możesz ocenić FLUX 3 do pracy z obrazem i nikt inny też nie może. Krążące twierdzenia o renderowaniu tekstu, spójności postaci albo trzymaniu się promptu nie mają za sobą niezależnej oceny. Traktuj je jak marketing, dopóki model nie będzie testowalny.

FLUX 3 Video: 20 sekund z natywnym audio

Komponent, który faktycznie udostępniono — zatwierdzonym kandydatom we wczesnym dostępie — jest naprawdę interesujący. FLUX 3 Video generuje klipy o długości do 20 sekund z natywnie zsynchronizowanym audio, zamiast generować nieme wideo i oceniać je później. Obejmuje też image-to-video, keyframe-to-video i łączenie multi-shot.

Dwadzieścia sekund z natywnym dźwiękiem to znacząca długość. Większość flagowych modeli wideo nadal jest strojona pod klipy 5–10 s, a sklejanie ich w coś spójnego pochłania dużą część czasu produkcji. Jeśli FLUX 3 utrzyma ciągłość postaci i audio w odcinku 20 s, będzie to realna zmiana procesu.

Mówi to też, gdzie BFL widzi rynek wzrostu. Firma znana z obrazów statycznych, która buduje image-to-video i łączenie ujęć, próbuje przejąć cały proces, nie tylko pierwszą klatkę.

Jak uczciwie czytać tabelę benchmarków BFL

BFL opublikowało wskaźniki preferencji dla FLUX 3 Video wobec ośmiu konkurentów. Zanim je odczytasz, zwróć uwagę na cztery zastrzeżenia, które dopisuje samo BFL: liczby są raportowane przez firmę, wstępne, zmierzone w trakcie treningu, na 10-sekundowych klipach 720p. Nie ma niezależnej weryfikacji.

Wykres słupkowy wskaźników preferencji FLUX 3 Video wobec ośmiu konkurencyjnych modeli, z pięcioma modelami dostępnymi w OmniArt wyróżnionymi
Wykres słupkowy wskaźników preferencji FLUX 3 Video wobec ośmiu konkurencyjnych modeli, z pięcioma modelami dostępnymi w OmniArt wyróżnionymi

Wyróżniają się dwie rzeczy.

Wygrane są przeciwko modelom najdalej od czołówki. Wynik 93 % dotyczy Luma Ray 3.2, a 77 % — Runway Gen-4.5. To największe przewagi na wykresie i jednocześnie dwa porównania, w których poprzeczka jest najniżej.

Wobec obecnej czołówki jest remis. FLUX 3 był preferowany w 52 % porównań z Seedance 2.0 i w 52 % z Gemini Omni Flash. W teście preferencji 52 % to rzut monetą. BFL należy się uznanie, że publikuje to uczciwie, zamiast po cichu usuwać wiersze — ale rzut monetą wobec modeli, z którymi już dziś możesz generować, nie jest powodem, by czekać na listę oczekujących.

Pięć z ośmiu modeli z tego wykresu jest teraz w selektorze wideo OmniArt: Grok Imagine, Kling, Happy Horse, Seedance 2.0 i Gemini Omni Flash. Możesz jeszcze dziś uruchomić brief, który benchmarkowało BFL, i samodzielnie ocenić punkt odniesienia.

Uwaga

Klipy poniżej to wynik Seedance wygenerowany w OmniArt — modelu, wobec którego FLUX 3 uzyskał 52 % preferencji. Są tu po to, by pokazać obecny punkt odniesienia, który możesz faktycznie stworzyć dziś, a nie po to, by reprezentować wynik FLUX 3. Nie istnieją publiczne próbki FLUX 3, które możemy niezależnie zweryfikować.

Seedance w OmniArt: skala wykonuje pracę emocjonalną — mała postać wobec ogromnego sygnału. To poziom, wobec którego FLUX 3 Video raportuje 52 % preferencji.
Relacja bez dialogu, niesiona przez światło ognia, parę i śpiące dziecko — atmosfera i gest zamiast ekspozycji.

Self-Flow: deklaracja architektoniczna, którą warto śledzić

Idea techniczna za FLUX 3 nazywa się Self-Flow — samonadzorowane dopasowanie przepływów z warunkowaniem kroku czasowego dla każdego tokenu, opublikowane jako badanie równolegle z premierą. Deklaracja mówi o szybszej zbieżności niż we wcześniejszych podejściach do dopasowania reprezentacji oraz o jednej bazowej architekturze, w której trening obrazu, wideo, audio i akcji wzajemnie się ograniczają.

Jeśli to się utrzyma, ciekawym skutkiem nie będzie po prostu lepszy model obrazu. Będzie nim to, że ulepszenia w jednej modalności powinny podnosić pozostałe, bo współdzielą reprezentację, zamiast działać w osobnych modułach. To ten sam zakład, który Google postawiło z linią Gemini omni, tylko od przeciwnej strony — Google przyszło z języka, BFL idzie od pikseli.

To zakład wart śledzenia. Nie jest to jeszcze wynik, którego możesz użyć.

Zderzenie z rzeczywistością FLUX.2

Ponieważ FLUX 3 Image nie istnieje publicznie, najnowszym używalnym modelem obrazu FLUX pozostaje FLUX.2, który pojawił się w listopadzie 2025 i został rozszerzony o wariant max w grudniu oraz kompaktową linię klein w styczniu 2026.

WariantDostępnośćCena katalogowaUwagi
FLUX.2 [max]API0,07 USD / MPNajwyższy wariant; dodaje ugruntowane generowanie z wyszukiwaniem w sieci na żywo
FLUX.2 [pro]API0,03 USD / MPOpłacalny domyślny wybór do generowania i edycji
FLUX.2 [flex]API0,06 USD / MPUdostępnia kroki i parametr guidance; strojony pod typografię
FLUX.2 [dev] 32BOtwarte wagiWłasny hostingLicencja niekomercyjna; użycie komercyjne jest płatnym wariantem
FLUX.2 [klein] 4BOtwarte wagiWłasny hostingApache 2.0 — jedyny wariant z licencją permisywną

Gdzie FLUX.2 nadal wygrywa

  • Spójność wielu referencji. Osiem obrazów referencyjnych przez API, dziesięć w panelu testowym. Zablokuj twarz, produkt, ustawienie światła i wygeneruj spójną serię. To pozostaje jego najjaśniejszą przewagą strukturalną.
  • Kolor zgodny z marką. Wartości szesnastkowe przypisane do nazwanego obiektu są udokumentowaną funkcją pierwszej klasy. Przypisz wartość do rzeczy — "the car is #FF0000" — zamiast pozwalać jej dryfować w prompcie.
  • Fotorealizm materiałów. Rozpraszanie podpowierzchniowe w skórze, zachowanie odbić na szkle i metalu, sposób, w jaki tkanina pochłania światło albo je odbija.
  • Ugruntowane generowanie w [max]. Wyszukiwanie w sieci na żywo podczas generowania, dla aktualnych produktów i ostatnich wydarzeń. Nic innego w tej klasie tego nie robi.

Gdzie został z tyłu

Obraz z testów ślepej preferencji jest mniej pochlebny. W arenie text-to-image Artificial Analysis FLUX.2 [max] jest obecnie około 16. miejsca, za GPT Image 2, rodziną Nano Banana 2 i Seedream 5.0 Pro. FLUX.2 [dev] — otwarty flagowiec 32B — jest niżej niż Qwen Image 2.0 Pro, model 7B na licencji Apache-2.0.

Inne tarcia, które warto znać, zanim oprzesz na nim proces:

  • Brak negatywnych promptów. Przepisuj wszystko pozytywnie. "Sharp focus throughout" zamiast "no blur."
  • Ograniczenia licencji. Wagi 32B [dev] są niekomercyjne. Tylko wariant 4B klein jest na Apache 2.0.
  • Koszt sprzętu. Pełna precyzja [dev] razem z 24B enkoderem tekstu Mistral daleko przekracza konsumencki VRAM; społeczność uruchamia skwantyzowane wersje z utratą jakości.
  • Skargi na anatomię. Dłonie i interakcje wielu osób to powracające tryby porażki w wątkach społeczności, szczególnie w destylowanych wariantach klein przy domyślnie niskiej liczbie kroków.

Wzorce promptów, które przechodzą dalej

Opublikowane przez BFL wskazówki do promptowania FLUX.2 są dobrym rzemiosłem i przenoszą się na większość współczesnych modeli obrazu, w tym te w OmniArt.

Układaj strukturę jako Subject + Action + Style + Context. Kolejność słów niesie wagę; zacznij od tego, co najważniejsze. Udokumentowany optymalny zakres to od 30 do 80 słów.

Cytuj dosłowny tekst. The text 'OPEN' appears in red neon letters — potem określ położenie, grubość i kolor.

Opisuj fonty, nie podawaj ich nazw. "Bold geometric sans-serif with slightly extended kerning" trafia znacznie bardziej niezawodnie niż nazwa kroju.

Przypisz rolę każdemu obrazowi referencyjnemu. Powiedz, który materiał dostarcza temat, który styl, a który tło.

Używaj JSON, gdy chcesz wersjonować brief. Zamroź strukturę, zmieniaj dokładnie jeden klucz na wariant, a dostaniesz kontrolowane porównanie zamiast ponownego losowania:

{
  "scene": "Studio product photography on polished concrete",
  "subjects": [{ "description": "Matte black ceramic mug, steam rising", "position": "center foreground" }],
  "style": "Ultra-realistic commercial product photography",
  "color_palette": ["matte black", "concrete gray", "soft white highlights"],
  "lighting": "Three-point softbox, soft diffused highlights, no harsh shadows",
  "camera": { "angle": "high", "lens-mm": 85, "f-number": "f/5.6" }
}

Wskazówka

Najbardziej wartościowy nawyk z przewodnika BFL to pozytywne przepisywanie. Zamiast "headlights not on the subject," napisz "headlights pointing down the road, illuminating the wet asphalt ahead, leaving the figure in soft silhouette." Działa w każdym modelu, nie tylko we FLUX.

Co zrobić w tym tygodniu

Jeśli FLUX 3 miał być punktem startu projektu, uczciwa rada brzmi: nie czekaj. Model obrazu nie ma daty, a model wideo wymaga zgłoszenia i nie ma publicznych cen.

Jeśli FLUX 3 miał służyć do…Zrób to dziś
Fotorealistycznych kadrów i pracy produktowejGPT Image 2 albo Seedream 5.0 Pro w selektorze obrazów OmniArt
Wieloreferencyjnej spójności postaciSeedream 5.0 Pro, który przyjmuje do 10 obrazów referencyjnych
Layoutów i plakatów z dużą ilością tekstuGPT Image 2 — obecny lider tekstu w obrazie
Długich klipów ze zsynchronizowanym dźwiękiemSeedance 2.0 albo Gemini Omni Flash, oba działają już teraz
Kadru, który już lubisz, zamienionego w ruchDowolny model image-to-video w OmniArt

Ostatni wiersz jest tym, który większość osób zbyt nisko wycenia. Proces, który BFL próbuje przejąć — wygenerować kadr, a potem go animować — już działa od początku do końca w jednej przestrzeni. Nasz przewodnik po modelach image-to-video opisuje, który model wybrać do danego rodzaju ruchu, a przewodnik po promptach Seedance pokazuje, jak reżyserować ujęcie, zamiast tylko je opisywać.

Opisane

Wyreżyserowane

Ten sam koncept, dwa prompty. Wyreżyserowanie ujęcia — nastrój, zamiar kamery i to, o czym jest scena — bije wyliczanie jego zawartości. Ta umiejętność przenosi się na dowolny model, który akurat wygrywa.

Co obserwować dalej

Trzy sygnały pokażą, czy warto wrócić do FLUX 3.

  1. Otwarcie wczesnego dostępu do FLUX 3 Image, ze specyfikacją. Liczba obrazów referencyjnych, natywna rozdzielczość i ceny to liczby, które zdecydują, czy model konkuruje.
  2. Niezależne benchmarki FLUX 3 Video. Testy preferencji dostawcy, mierzone w trakcie treningu, są punktem startowym, nie wynikiem. Pozycja w arenie wobec Seedance i linii Gemini omni jest prawdziwym testem.
  3. Licencja otwartych wag. FLUX.2 [dev] był niekomercyjny i ta jedna decyzja kosztowała BFL dużą część pozycji w świecie otwartego oprogramowania. To, czy FLUX 3 Dev ją powtórzy, zdecyduje, czy lokalny ekosystem wróci.

Pierwsze kroki w OmniArt

Nie musisz wybierać strony w premierze FLUX 3, żeby stworzyć coś w tym tygodniu. OmniArt trzyma generowanie obrazów, wideo, audio i muzyki w jednej przestrzeni, z aktualnymi flagowymi modelami — GPT Image 2, Nano Banana, Seedream, Seedance, Kling, Veo, Grok Imagine i Gemini Omni Flash — za jednym selektorem i jednym saldem kredytów.

To praktyczna odpowiedź na premierę za bramką: oceniasz modele na własnym briefie zamiast na wykresie dostawcy i zmieniasz je wtedy, gdy pojawi się coś naprawdę lepszego. Kiedy FLUX 3 Image stanie się testowalny, uruchomimy go na tych samych briefach i opublikujemy porównanie. Do tego czasu zobacz każdy model wideo w jednej przestrzeni, żeby sprawdzić, co jest dostępne dziś.

Gotowy, aby tworzyć?

Zacznij generować świetne treści z AI

Zacznij za darmo