updateModelle und Einblicke11 Min. Lesezeit

FLUX 3 erklärt: Was wirklich erschienen ist — und was nicht

FLUX 3 kam am 23. Juli 2026 mit 20-Sekunden-Video und nativem Audio — aber ohne Bildmodell. Was erschienen ist, was die Benchmarks wirklich sagen und was Sie heute nutzen.

OmniArt-Team
FLUX 3 erklärt: Was wirklich erschienen ist — und was nicht

Black Forest Labs hat FLUX 3 am 23. Juli 2026 angekündigt und es als multimodales Frontier-Modell für visuelle Intelligenz bezeichnet. Zwei Tage später lautet die Schlagzeile, die für die meisten Kreativen zählt, nicht, was FLUX 3 kann — sondern was Sie tatsächlich ausführen können. FLUX 3 Video steckt hinter einem Bewerbungsformular. FLUX 3 Action steckt hinter einer Partnervereinbarung. Und FLUX 3 Image, genau der Teil, auf dem der Name FLUX aufgebaut wurde, ist überhaupt nicht erschienen.

Diese Lücke ist die eigentliche Geschichte. Das Unternehmen, das offene Gewichte in der Bildgenerierung zu einer ernsthaften Option gemacht hat, liefert ein Flaggschiff, bei dem die Bildhälfte das fehlende Stück ist, und richtet den Rest der Ankündigung auf Video, Audio und Robotik aus. Das ist ein echter Kurswechsel, und er sagt etwas darüber aus, wo in diesem Markt der Druck liegt.

Dieser Artikel trennt die Ankündigung vom Produkt: was es heute gibt, was die Benchmark-Zahlen von BFL belegen und was nicht, worin die Architekturbehauptung tatsächlich besteht und worauf Sie zurückgreifen sollten, solange FLUX 3 Image hinter der Warteliste bleibt.

Was Black Forest Labs tatsächlich angekündigt hat

FLUX 3 wird als eine einzige Modellfamilie präsentiert, die gemeinsam über Bild, Video, Audio und Aktion trainiert wurde, statt als vier getrennte Systeme. Die Ankündigung umfasst FLUX 3 Video, FLUX 3 Image, FLUX 3 Action (mit einer Robotik-Variante namens FLUX-mimic) und ein künftiges FLUX 3 Dev mit offenen Gewichten.

Die Verfügbarkeit erzählt eine ganz andere Geschichte.

Release-Status jeder FLUX-3-Komponente zwei Tage nach der Ankündigung: Video und Action im Early Access, während Bildmodell, offene Gewichte und Preise weiterhin unveröffentlicht sind
Release-Status jeder FLUX-3-Komponente zwei Tage nach der Ankündigung: Video und Action im Early Access, während Bildmodell, offene Gewichte und Preise weiterhin unveröffentlicht sind

Warnung

Es gibt keine öffentlichen FLUX-3-Preise, keine veröffentlichte Parameterzahl, keinen technischen Bericht zur Modellfamilie und keine Lizenzbedingungen für das versprochene Release mit offenen Gewichten. Jedes Datenblatt, das Ihnen Auflösung, Referenzbild-Limits oder Kosten pro Bild für FLUX 3 Image nennt, ist Extrapolation, keine Dokumentation.

Das Bildmodell ist das fehlende Stück

BFL formuliert es selbst so, dass FLUX 3 Image „in den kommenden Wochen eine Early-Access-Phase“ erhalten wird. Das ist die gesamte öffentliche Zusage. Kein Datum, keine Spezifikationen, kein Benchmark.

Das wiegt schwerer als ein normaler gestaffelter Rollout, denn Bildgenerierung ist das, wofür die Marke FLUX steht. FLUX.1 und seine Kontext-Editing-Linie wurden zum Standard in Pipelines mit offenen Gewichten. Ein Flaggschiff anzukündigen, ohne diese Komponente verfügbar zu machen — während Wettbewerber im Wochentakt Bildmodelle veröffentlichen —, lässt Kreative mit Behauptungen zurück, die sie nicht überprüfen können.

Die praktische Konsequenz: Sie können FLUX 3 heute nicht für Bildarbeit bewerten, und niemand sonst kann es. Kursierende Aussagen über Textdarstellung, Charakterkonsistenz oder Prompt-Treue haben keine unabhängige Evaluierung hinter sich. Behandeln Sie sie als Marketing, bis das Modell testbar ist.

FLUX 3 Video: 20 Sekunden mit nativem Audio

Die Komponente, die tatsächlich erschienen ist — für zugelassene Early-Access-Bewerber —, ist die wirklich interessante. FLUX 3 Video erzeugt Clips von bis zu 20 Sekunden Länge mit nativ synchronisiertem Audio, statt stummes Video zu generieren und es nachträglich zu vertonen. Es deckt außerdem Bild-zu-Video, Keyframe-zu-Video und die Verkettung mehrerer Einstellungen ab.

Zwanzig Sekunden mit nativem Ton sind eine relevante Länge. Die meisten Flaggschiff-Videomodelle sind weiterhin auf Clips von 5 bis 10 Sekunden ausgelegt, und genau beim Zusammensetzen dieser Clips zu etwas Kohärentem geht viel Produktionszeit verloren. Wenn FLUX 3 Charakter- und Audiokontinuität über 20 Sekunden hält, ist das eine echte Workflow-Veränderung.

Es verrät auch, worin BFL den Wachstumsmarkt sieht. Ein Haus für Standbilder, das Bild-zu-Video und Shot-Verkettung baut, ist ein Unternehmen, das die gesamte Pipeline besetzen will, nicht nur das erste Bild.

Die Benchmark-Tabelle von BFL ehrlich lesen

BFL hat Präferenzraten für FLUX 3 Video gegenüber acht Wettbewerbern veröffentlicht. Bevor Sie sie lesen, beachten Sie die vier Einschränkungen, die BFL selbst dazu nennt: Die Zahlen sind selbst berichtet, vorläufig, gemessen während des Midtrainings, an 10-sekündigen 720p-Clips. Es gibt keine unabhängige Überprüfung.

Balkendiagramm der Präferenzraten von FLUX 3 Video gegenüber acht konkurrierenden Modellen, wobei die fünf auf OmniArt verfügbaren Modelle hervorgehoben sind
Balkendiagramm der Präferenzraten von FLUX 3 Video gegenüber acht konkurrierenden Modellen, wobei die fünf auf OmniArt verfügbaren Modelle hervorgehoben sind

Zwei Dinge fallen auf.

Die Siege gelingen gegen die Modelle, die am weitesten von der Spitze entfernt sind. Die 93 % beziehen sich auf Luma Ray 3.2, die 77 % auf Runway Gen-4.5. Das sind die größten Abstände im Diagramm — und zugleich die beiden Vergleiche, bei denen die Messlatte am niedrigsten liegt.

Gegen die aktuelle Spitze steht es unentschieden. FLUX 3 wurde in 52 % der Vergleiche gegenüber Seedance 2.0 und in 52 % gegenüber Gemini Omni Flash bevorzugt. In einem Präferenztest sind 52 % ein Münzwurf. Anerkennung dafür, dass BFL das ehrlich publiziert, statt die Zeilen stillschweigend zu streichen — aber ein Münzwurf gegen Modelle, mit denen Sie heute schon generieren können, ist kein Grund, auf eine Warteliste zu warten.

Fünf der acht Modelle in diesem Diagramm stehen bereits jetzt in der Videoauswahl von OmniArt: Grok Imagine, Kling, Happy Horse, Seedance 2.0 und Gemini Omni Flash. Sie können das Briefing, gegen das BFL gemessen hat, noch heute Nachmittag ausführen und die Ausgangslage selbst beurteilen.

Hinweis

Die folgenden Clips sind Seedance-Ergebnisse, erzeugt auf OmniArt — also mit dem Modell, gegen das FLUX 3 auf 52 % kam. Sie stehen hier, um die Ausgangslage zu zeigen, die Sie heute tatsächlich produzieren können, nicht um FLUX-3-Ergebnisse darzustellen. Es existieren keine öffentlichen FLUX-3-Beispiele, die wir unabhängig verifizieren könnten.

Seedance auf OmniArt: Die Größenordnung übernimmt die emotionale Arbeit — eine kleine Figur vor einem gewaltigen Signal. Das ist das Niveau, gegen das FLUX 3 Video eine Präferenzrate von 52 % meldet.
Eine Beziehung ohne Dialog, getragen von Feuerschein, Dampf und einem schlafenden Kind — Atmosphäre und Geste statt Erklärung.

Self-Flow: die Architekturbehauptung, die man verfolgen sollte

Die technische Idee hinter FLUX 3 heißt Self-Flow — selbstüberwachtes Flow Matching mit Zeitschritt-Konditionierung pro Token, zum Launch als Forschungsarbeit veröffentlicht. Behauptet wird eine schnellere Konvergenz als bei bisherigen Ansätzen zur Repräsentationsausrichtung sowie eine einzige zugrunde liegende Architektur, in der sich Bild-, Video-, Audio- und Aktionstraining gegenseitig einschränken.

Wenn das trägt, ist die interessante Folge nicht ein besseres Bildmodell. Sie besteht darin, dass Verbesserungen in einer Modalität die anderen mitziehen sollten, weil sie sich die Repräsentation teilen, statt in getrennten Türmen zu sitzen. Das ist dieselbe Wette, die Google mit der Gemini-Omni-Linie eingegangen ist, nur aus der entgegengesetzten Richtung — Google kam von der Sprache, BFL kommt von den Pixeln.

Eine Wette, die man verfolgen sollte. Ein nutzbares Ergebnis ist sie noch nicht.

Der Realitätscheck bei FLUX.2

Da FLUX 3 Image öffentlich nicht existiert, ist das neueste nutzbare FLUX-Bildmodell weiterhin FLUX.2, erschienen im November 2025 und erweitert um eine max-Stufe im Dezember sowie eine kompakte klein-Linie im Januar 2026.

VarianteVerfügbarkeitListenpreisAnmerkungen
FLUX.2 [max]API0,07 $ / MPOberste Stufe; ergänzt fundierte Generierung mit Live-Websuche
FLUX.2 [pro]API0,03 $ / MPDer kosteneffiziente Standard für Generierung und Bearbeitung
FLUX.2 [flex]API0,06 $ / MPLegt Schritte und Guidance offen; auf Typografie abgestimmt
FLUX.2 [dev] 32BOffene GewichteSelf-HostingNicht-kommerzielle Lizenz; kommerzielle Nutzung ist eine kostenpflichtige Stufe
FLUX.2 [klein] 4BOffene GewichteSelf-HostingApache 2.0 — die einzige permissiv lizenzierte Variante

Wo FLUX.2 weiterhin gewinnt

  • Konsistenz über mehrere Referenzen. Acht Referenzbilder über die API, zehn im Playground. Fixieren Sie ein Gesicht, ein Produkt, ein Lichtsetup und generieren Sie eine stimmige Serie. Das bleibt der klarste strukturelle Vorteil.
  • Markengenaue Farbe. Hex-Werte, die an ein benanntes Objekt gebunden sind, sind ein dokumentiertes First-Class-Feature. Binden Sie den Wert an das Objekt — „das Auto ist #FF0000“ — statt ihn frei im Prompt schweben zu lassen.
  • Materialfotorealismus. Subsurface Scattering in der Haut, Glanzverhalten auf Glas und Metall, wie Stoff Licht aufnimmt statt es zu reflektieren.
  • Fundierte Generierung auf [max]. Live-Websuche während der Generierung, für aktuelle Produkte und jüngste Ereignisse. Nichts sonst in dieser Stufe kann das.

Wo es zurückgefallen ist

Das Bild der Blindpräferenz fällt weniger schmeichelhaft aus. In der Text-zu-Bild-Arena von Artificial Analysis liegt FLUX.2 [max] derzeit etwa auf Platz 16, hinter GPT Image 2, der Nano-Banana-2-Familie und Seedream 5.0 Pro. FLUX.2 [dev] — das offene 32B-Flaggschiff — landet hinter Qwen Image 2.0 Pro, einem 7B-Modell unter Apache 2.0.

Weitere Reibungspunkte, die Sie kennen sollten, bevor Sie eine Pipeline darauf festlegen:

  • Keine negativen Prompts. Formulieren Sie alles positiv. „Durchgehend scharfer Fokus“ statt „keine Unschärfe“.
  • Lizenzgrenzen. Die 32B-[dev]-Gewichte sind nicht-kommerziell. Nur die 4B-klein-Variante steht unter Apache 2.0.
  • Hardwarekosten. Das [dev] in voller Präzision plus sein 24B-Mistral-Textencoder liegt weit jenseits von Consumer-VRAM; die Community nutzt quantisierte Builds mit Qualitätsverlust.
  • Beschwerden zur Anatomie. Hände und Interaktionen zwischen mehreren Personen sind in Community-Threads wiederkehrende Schwachstellen, besonders bei den destillierten klein-Varianten mit ihrer niedrigen Standard-Schrittzahl.

Prompt-Muster, die sich übertragen lassen

Die von BFL veröffentlichten Prompting-Hinweise für FLUX.2 sind solides Handwerk und übertragen sich auf die meisten modernen Bildmodelle, auch auf die auf OmniArt.

Strukturieren Sie als Subjekt + Aktion + Stil + Kontext. Die Wortreihenfolge hat Gewicht; beginnen Sie mit dem Wichtigsten. Dreißig bis achtzig Wörter sind der dokumentierte Idealbereich.

Setzen Sie wörtlichen Text in Anführungszeichen. The text 'OPEN' appears in red neon letters — und legen Sie danach Platzierung, Strichstärke und Farbe fest.

Beschreiben Sie Schriften, statt sie zu benennen. „Fette geometrische Sans-Serif mit leicht erweiterter Laufweite“ trifft deutlich zuverlässiger als der Name einer Schriftart.

Weisen Sie jedem Referenzbild eine Rolle zu. Sagen Sie, welche Eingabe das Subjekt liefert, welche den Stil und welche den Hintergrund.

Nutzen Sie JSON, wenn Sie ein Briefing versionieren müssen. Frieren Sie die Struktur ein, ändern Sie pro Variante genau einen Schlüssel, und Sie erhalten einen kontrollierten Vergleich statt eines neuen Zufallswurfs:

{
  "scene": "Studio product photography on polished concrete",
  "subjects": [{ "description": "Matte black ceramic mug, steam rising", "position": "center foreground" }],
  "style": "Ultra-realistic commercial product photography",
  "color_palette": ["matte black", "concrete gray", "soft white highlights"],
  "lighting": "Three-point softbox, soft diffused highlights, no harsh shadows",
  "camera": { "angle": "high", "lens-mm": 85, "f-number": "f/5.6" }
}

Tipp

Die wertvollste Gewohnheit aus BFLs Leitfaden ist das positive Umformulieren. Schreiben Sie statt „Scheinwerfer nicht auf das Motiv“ lieber „Scheinwerfer die Straße hinunter gerichtet, die den nassen Asphalt voraus ausleuchten und die Figur in weicher Silhouette lassen“. Das funktioniert bei jedem Modell, nicht nur bei FLUX.

Was Sie diese Woche tun sollten

Wenn Sie auf FLUX 3 gewartet haben, um ein Projekt zu starten, lautet der ehrliche Rat: nicht warten. Das Bildmodell hat kein Datum, und das Videomodell steckt hinter einer Bewerbung ohne veröffentlichte Preise.

Wenn Sie FLUX 3 wollten für …Tun Sie das heute
Fotorealistische Stills und ProduktaufnahmenGPT Image 2 oder Seedream 5.0 Pro in der Bildauswahl von OmniArt
Charakterkonsistenz über mehrere ReferenzenSeedream 5.0 Pro, das bis zu 10 Referenzbilder annimmt
Textlastige Layouts und PosterGPT Image 2 — aktuell führend bei Text im Bild
Lange Clips mit synchronisiertem TonSeedance 2.0 oder Gemini Omni Flash, beide sofort verfügbar
Ein Standbild, das Ihnen gefällt, in Bewegung gebrachtJedes Bild-zu-Video-Modell auf OmniArt

Die letzte Zeile wird am meisten unterschätzt. Die Pipeline, die BFL besetzen will — ein Standbild erzeugen und es dann animieren —, funktioniert bereits durchgängig in einem einzigen Workspace. Unser Leitfaden zu Bild-zu-Video-Modellen zeigt, welches Modell zu welcher Art von Bewegung passt, und der Seedance-Prompt-Leitfaden erklärt, wie Sie eine Einstellung inszenieren, statt sie nur zu beschreiben.

Beschrieben

Inszeniert

Dasselbe Konzept, zwei Prompts. Eine Einstellung zu inszenieren — Stimmung, Kameraabsicht und worum es in der Szene geht — schlägt das bloße Auflisten ihres Inhalts. Diese Fähigkeit überträgt sich auf jedes Modell, das am Ende gewinnt.

Worauf Sie als Nächstes achten sollten

Drei Signale zeigen Ihnen, ob sich ein erneuter Blick auf FLUX 3 lohnt.

  1. Die Öffnung des Early Access für FLUX 3 Image, samt Spezifikationen. Anzahl der Referenzbilder, native Auflösung und Preis sind die Zahlen, die über die Wettbewerbsfähigkeit entscheiden.
  2. Unabhängige Benchmarks für FLUX 3 Video. Präferenztests des Anbieters, gemessen während des Midtrainings, sind ein Ausgangspunkt, kein Ergebnis. Die Arena-Platzierung gegen Seedance und die Gemini-Omni-Linie ist der eigentliche Test.
  3. Die Lizenz für die offenen Gewichte. FLUX.2 [dev] war nicht-kommerziell, und diese eine Entscheidung hat BFL einen Großteil seiner Open-Source-Position gekostet. Ob FLUX 3 Dev das wiederholt, entscheidet darüber, ob das lokale Ökosystem zurückkommt.

Einstieg auf OmniArt

Sie müssen sich im FLUX-3-Rollout auf keine Seite schlagen, um diese Woche etwas zu produzieren. OmniArt hält Bild-, Video-, Audio- und Musikgenerierung in einem einzigen Workspace zusammen, mit den aktuellen Flaggschiff-Modellen — GPT Image 2, Nano Banana, Seedream, Seedance, Kling, Veo, Grok Imagine und Gemini Omni Flash — hinter einer einzigen Auswahl und einem einzigen Guthaben.

Das ist die praktische Antwort auf einen gesperrten Launch: Sie bewerten Modelle an Ihrem eigenen Briefing statt am Diagramm eines Anbieters, und Sie wechseln, sobald etwas wirklich Besseres erscheint. Sobald FLUX 3 Image testbar wird, lassen wir es gegen dieselben Briefings antreten und veröffentlichen den Vergleich. Bis dahin zeigt alle Videomodelle in einem Workspace, was heute verfügbar ist.

Bereit zum Erstellen?

Starte mit KI die Erstellung beeindruckender Inhalte

Kostenlos starten