FLUX 3を徹底解説:実際にリリースされたもの、されなかったもの
FLUX 3が2026年7月23日に登場。20秒の動画とネイティブ音声に対応する一方、画像モデルは未公開のままです。何がリリースされ、ベンチマークの数字が実際に何を示すのか、そして今日使うべきモデルを整理します。

Black Forest Labsは2026年7月23日にFLUX 3を発表し、これを視覚知能のためのマルチモーダルな最先端モデルと位置づけました。それから2日が経った今、多くのクリエイターにとって本当に重要なのは、FLUX 3が何をできるかではなく、実際に何が使えるのかという点です。FLUX 3 Videoは申請フォームの先にあり、FLUX 3 Actionはパートナー契約の先にあります。そしてFLUXという名前を支えてきた画像モデル、FLUX 3 Imageは、まだ一切公開されていません。
この落差こそが今回の要点です。オープンウェイトの画像生成を現実的な選択肢に押し上げた企業が、肝心の画像部分を欠いたままフラッグシップを打ち出し、発表の残りを動画・音声・ロボティクスに向けたのです。これは本物の路線転換であり、この市場でどこに圧力がかかっているのかを物語っています。
この記事では、発表内容と実際の製品を切り分けます。今日時点で存在するものは何か、BFLのベンチマーク数値が示せるものと示せないものは何か、アーキテクチャに関する主張の中身は何か、そしてFLUX 3 Imageがウェイトリストの向こう側にある間、代わりに何を使えばよいのかを見ていきます。
Black Forest Labsが実際に発表した内容
FLUX 3は、4つの別々のシステムではなく、画像・動画・音声・行動を横断して一体で学習された1つのモデルファミリーとして提示されています。発表の対象は、FLUX 3 Video、FLUX 3 Image、FLUX 3 Action(FLUX-mimicと呼ばれるロボティクス向けの派生を含む)、そして将来オープンウェイトで公開予定のFLUX 3 Devです。
一方、提供状況はまったく別の話になります。

警告
FLUX 3には公開価格がなく、パラメーター数も公表されておらず、このモデルファミリーの技術レポートも存在しません。約束されたオープンウェイト公開のライセンス条項もまだありません。FLUX 3 Imageの解像度、参照画像の上限枚数、1枚あたりの費用を記した仕様表を見かけたとしても、それは推測であって公式資料ではありません。
欠けているのは画像モデル
BFL自身の表現によれば、FLUX 3 Imageは「今後数週間のうちに早期アクセス段階へ入る」とのことです。公開されている約束はこれがすべてで、日付も仕様もベンチマークもありません。
これは通常の段階的な提供開始よりも重い意味を持ちます。画像生成こそがFLUXというブランドの中身だからです。FLUX.1とその編集系列であるKontextは、オープンウェイトのワークフローにおける定番になっていました。競合が毎週のように画像モデルを出している最中に、その要素を欠いたままフラッグシップを発表すれば、クリエイターの手元には検証できない主張だけが残ります。
実務上の帰結はこうです。今日の時点であなたはFLUX 3を画像用途で評価できませんし、それは他の誰にとっても同じです。 テキスト描画、キャラクターの一貫性、プロンプト追従性について流れている評判には、独立した検証が一切ありません。モデルを実際に試せるようになるまでは、宣伝文句として受け止めておくのが妥当です。
FLUX 3 Video:ネイティブ音声付きの20秒
実際にリリースされたコンポーネント、つまり審査を通過した早期アクセス申請者に向けて公開された部分は、確かに興味深いものです。FLUX 3 Videoは最長20秒のクリップを生成でき、音声は無音の映像を作ってから後付けするのではなく、はじめから同期した状態で生成されます。画像から動画、キーフレームから動画、複数ショットの連結にも対応しています。
ネイティブ音声付きの20秒というのは意味のある長さです。主要な動画モデルの多くは今も5秒から10秒のクリップを前提に調整されており、それらをつなぎ合わせて一貫した映像に仕上げる工程に制作時間の多くが費やされています。FLUX 3が20秒の尺を通してキャラクターと音声の連続性を保てるのであれば、それは実際にワークフローを変える変化です。
同時に、BFLが成長市場をどこに見ているかも伝わってきます。静止画を出自とする企業が画像から動画への変換とショット連結を手がけるということは、最初の1枚だけでなく制作の流れ全体を押さえようとしている、ということです。
BFLのベンチマーク表を正直に読む
BFLは、8つの競合モデルに対するFLUX 3 Videoの選好率(どちらが好まれたかの割合)を公開しました。数字を読む前に、BFL自身が添えている4つの但し書きを押さえておいてください。これらの数値は自社測定であり、暫定的であり、学習の途中段階で測られたもので、対象は10秒・720pのクリップです。独立した検証はありません。

目を引く点が2つあります。
大きく勝っている相手は、最先端から最も遠いモデルです。 93%という数字はLuma Ray 3.2に対するもので、77%はRunway Gen-4.5に対するものです。グラフ上で差が最も大きい2つであり、同時に最も基準の低い比較でもあります。
現在の最先端モデルが相手だと、結果は互角です。 FLUX 3はSeedance 2.0との比較で52%、Gemini Omni Flashとの比較でも52%という選好率でした。選好テストにおける52%は、実質的にコイン投げと変わりません。この行をこっそり落とすのではなく正直に公開した点はBFLを評価すべきですが、今日すでに生成に使えるモデルと互角だという事実は、ウェイトリストに並んで待つ理由にはなりません。
グラフに載っている8モデルのうち5つは、今この瞬間にOmniArtの動画モデル選択画面にあります。Grok Imagine、Kling、Happy Horse、Seedance 2.0、そしてGemini Omni Flashです。BFLがベンチマークに使ったのと同じ狙いの映像を今日の午後に自分で生成し、基準となる品質を自分の目で確かめられます。
メモ
以下のクリップは、OmniArt上でSeedanceを使って生成したものです。FLUX 3が52%の選好率を記録した相手のモデルにあたります。ここに掲載しているのは、今日実際に作れる水準を示すためであり、FLUX 3の出力を表すものではありません。私たちが独立して検証できるFLUX 3の公開サンプルは、現時点で存在しません。
Self-Flow:追いかける価値のあるアーキテクチャの主張
FLUX 3の背後にある技術的な発想はSelf-Flowと呼ばれ、トークンごとのタイムステップ条件付けを伴う自己教師ありのフローマッチングとして、ローンチと同時に研究成果が公開されました。主張の中身は、従来の表現アライメント手法より収束が速いこと、そして画像・動画・音声・行動の学習が互いを制約し合う単一の基盤アーキテクチャを持つことです。
これが成り立つ場合、興味深い帰結は「画像モデルが良くなる」ことではありません。それぞれが独立した塔に分かれるのではなく表現を共有しているため、ひとつのモダリティでの改善が他のモダリティを押し上げるはずだ、という点です。これはGoogleがGemini omni系列で張ったのと同じ賭けを、逆方向から仕掛けたものです。Googleは言語から出発し、BFLはピクセルから出発しています。
追いかける価値のある賭けではあります。ただし、今すぐ使える成果ではありません。
FLUX.2という現実
FLUX 3 Imageが公開されていない以上、実際に使えるFLUXの画像モデルとして最新なのは今もFLUX.2です。2025年11月にリリースされ、12月にmaxティアが加わり、2026年1月には軽量なklein系列へと広がりました。
| 種類 | 提供形態 | 定価 | 備考 |
|---|---|---|---|
| FLUX.2 [max] | API | $0.07 / メガピクセル | 最上位ティア。ウェブ検索と連携した生成に対応 |
| FLUX.2 [pro] | API | $0.03 / メガピクセル | 生成と編集における費用対効果の高い標準的な選択肢 |
| FLUX.2 [flex] | API | $0.06 / メガピクセル | ステップ数とガイダンスを調整可能。文字組み向けに調整済み |
| FLUX.2 [dev] 32B | オープンウェイト | 自前運用 | 非商用ライセンス。商用利用は有料プラン |
| FLUX.2 [klein] 4B | オープンウェイト | 自前運用 | Apache 2.0――唯一、寛容なライセンスの種類 |
FLUX.2が今も強い領域
- 複数参照画像での一貫性。 APIでは8枚、プレイグラウンドでは10枚の参照画像を扱えます。顔、商品、照明設計を固定したまま、一貫したシリーズを生成できます。これは今も最も明確な構造的優位です。
- ブランドカラーの正確な再現。 特定の物体に16進数のカラーコードを結び付けることが、文書化された標準機能として用意されています。「車は#FF0000」のように値を対象へ結び付けてください。プロンプトの中に色だけを浮かせて書くのは避けます。
- 素材レベルの写実性。 肌のサブサーフェススキャタリング、ガラスや金属の反射の挙動、布地が光を吸収するのか反射するのかといった違いです。
- [max]でのウェブ検索を伴う生成。 生成中にウェブから最新情報を取得できるため、現行の製品や最近の出来事にも対応できます。同じ価格帯でこれができるモデルは他にありません。
見劣りしてきた領域
ブラインド選好の状況はあまり芳しくありません。Artificial Analysisのテキストから画像を生成するアリーナで、FLUX.2 [max]は現在16位前後に位置し、GPT Image 2、Nano Banana 2系列、Seedream 5.0 Proの後塵を拝しています。32Bのオープンな旗艦であるFLUX.2 [dev]に至っては、7BのApache 2.0モデルであるQwen Image 2.0 Proよりも下です。
制作パイプラインを本格的に預ける前に、知っておきたい引っかかりが他にもあります。
- ネガティブプロンプトが使えません。 すべて肯定形で書き直す必要があります。「ぼかしなし」ではなく「画面全体にわたってシャープなピント」と書きます。
- ライセンスの制約。 32Bの[dev]の重みは非商用です。Apache 2.0なのは4Bのkleinのみです。
- ハードウェア費用。 フル精度の[dev]と24BのMistralテキストエンコーダーの組み合わせは、一般向けGPUのメモリー容量をはるかに超えます。コミュニティでは品質を犠牲にして量子化版を動かしています。
- 人体表現への不満。 手の描写と複数人の絡みは、コミュニティの議論で繰り返し挙がる失敗例です。特に蒸留版のkleinを既定の少ないステップ数で使った場合に目立ちます。
他のモデルにも通じるプロンプトの型
BFLがFLUX.2向けに公開したプロンプト指南は、腕の立つ書き方の教科書として優れており、OmniArt上のものを含め現代の画像モデル全般に応用が利きます。
被写体 + 動作 + スタイル + 文脈の順で構成します。 語順には重みがあるため、最も大事な要素を先頭に置いてください。30語から80語が、公式資料で示されている最適な分量です。
画面に出す文字は引用符で囲みます。 The text 'OPEN' appears in red neon lettersのように書き、そのうえで配置・太さ・色を指定します。
書体は名前ではなく特徴で説明します。 書体名を挙げるよりも、「わずかに字間を広げた太めの幾何学的サンセリフ」と描写したほうがはるかに安定して反映されます。
参照画像それぞれに役割を割り当てます。 どの入力が被写体を担い、どれがスタイルを担い、どれが背景を担うのかを明示してください。
指示内容を版管理したいときはJSONを使います。 構造を固定し、派生ごとに変えるキーを1つだけにすれば、引き直しではなく条件を揃えた比較になります。
{
"scene": "Studio product photography on polished concrete",
"subjects": [{ "description": "Matte black ceramic mug, steam rising", "position": "center foreground" }],
"style": "Ultra-realistic commercial product photography",
"color_palette": ["matte black", "concrete gray", "soft white highlights"],
"lighting": "Three-point softbox, soft diffused highlights, no harsh shadows",
"camera": { "angle": "high", "lens-mm": 85, "f-number": "f/5.6" }
}
ヒント
BFLの指南書で最も価値の高い習慣は、肯定形への書き換えです。「ヘッドライトを被写体に当てない」と書く代わりに、「ヘッドライトは道の先を照らし、濡れたアスファルトを浮かび上がらせ、人物は柔らかなシルエットとして残る」と書きます。これはFLUXに限らず、あらゆるモデルで効きます。
今週やるべきこと
FLUX 3を待ってから企画を始めようと考えていたのであれば、正直な助言は「待たないこと」です。画像モデルには日付がなく、動画モデルは価格未公表のまま申請制の向こう側にあります。
| FLUX 3に期待していた用途 | 今日できること |
|---|---|
| 写実的な静止画と商品撮影 | OmniArtの画像モデル選択画面でGPT Image 2かSeedream 5.0 Pro |
| 複数参照画像でのキャラクターの一貫性 | 参照画像を最大10枚まで扱えるSeedream 5.0 Pro |
| 文字量の多いレイアウトやポスター | GPT Image 2――画像内の文字描画で現在の首位 |
| 音声が同期した長めのクリップ | Seedance 2.0またはGemini Omni Flash。どちらも提供中 |
| 気に入っている静止画を動かす | OmniArt上の任意の画像から動画へのモデル |
最後の行こそ、多くの人が過小評価している選択肢です。BFLが押さえようとしている流れ、つまり静止画を生成してからそれを動かすという工程は、すでに1つの作業環境の中で最初から最後まで完結します。画像から動画へのモデル選びガイドではどんな動きにどのモデルが向くかを扱い、Seedanceプロンプトガイドでは、内容を列挙するのではなくショットを演出する方法を扱っています。
描写しただけ
演出した
次に注目すべきこと
FLUX 3を改めて検討する価値があるかどうかは、3つの兆候で判断できます。
- 仕様を伴うFLUX 3 Imageの早期アクセス開始。 参照画像の枚数、ネイティブ解像度、価格の3つが、競争力の有無を決める数字です。
- FLUX 3 Videoの独立したベンチマーク。 学習途中に測られたベンダー自身の選好テストは出発点であって結論ではありません。SeedanceやGemini omni系列を相手にしたアリーナでの順位こそが本当の試金石です。
- オープンウェイトのライセンス。 FLUX.2 [dev]は非商用でした。この決定ひとつでBFLはオープンソースにおける立ち位置の多くを失っています。FLUX 3 Devが同じ道をたどるかどうかが、ローカル環境の生態系が戻ってくるかを左右します。
OmniArtで始める
FLUX 3の提供状況をめぐってどちらかの立場を選ばなくても、今週から何かを作ることはできます。OmniArtは画像・動画・音声・音楽の生成を1つの作業環境にまとめており、GPT Image 2、Nano Banana、Seedream、Seedance、Kling、Veo、Grok Imagine、Gemini Omni Flashといった現行の主要モデルを、単一の選択画面と単一のクレジット残高で使えます。
これが、提供を絞ったローンチに対する現実的な答えです。ベンダーのグラフではなく自分の狙いに照らしてモデルを評価し、本当に優れたものが出てきた時点で乗り換えればよいのです。FLUX 3 Imageが実際に試せるようになったら、同じ狙いの映像で検証して比較を公開します。それまでは、すべての動画モデルを1つの作業環境でを読んで、今日使えるものを確かめてみてください。
制作を始めますか?
AIで魅力的なコンテンツを生成しましょう