FLUX 3 解讀:什麼真的出貨了,什麼沒有
FLUX 3 在 2026 年 7 月 23 日登場,帶來 20 秒影片和原生音訊——卻沒有圖片模型。什麼真的出貨了、基準數字實際在說什麼,以及今天該用什麼。

Black Forest Labs 在 2026 年 7 月 23 日發表 FLUX 3,稱它是視覺智慧的多模態前沿模型。兩天後,對大多數創作者真正重要的標題不是 FLUX 3 做得到什麼,而是你實際跑得動什麼。FLUX 3 Video 擋在一張申請表後面。FLUX 3 Action 擋在一份合作協議後面。而 FLUX 這個名字賴以建立的那一塊——FLUX 3 Image——根本還沒發佈。
那個缺口才是重點。這家讓開放權重圖片生成成為認真選項的公司,交出了一個旗艦,而它的圖片那一半正是缺席的那塊,發表的其餘篇幅則指向影片、音訊和機器人。這是一次真正的轉向,也透露了這個市場的壓力現在壓在哪裡。
這篇文章把發表和產品分開來看:今天存在的是什麼、BFL 的基準數字證明了什麼又沒證明什麼、那個架構主張到底是什麼,以及在 FLUX 3 Image 還關在候補名單後面的期間,該伸手拿什麼。
Black Forest Labs 到底發表了什麼
FLUX 3 被呈現為一個橫跨圖片、影片、音訊和動作聯合訓練的模型家族,而不是四套各自獨立的系統。這次發表涵蓋 FLUX 3 Video、FLUX 3 Image、FLUX 3 Action(含一個叫 FLUX-mimic 的機器人版本),以及未來要開放權重的 FLUX 3 Dev。
至於能不能用,那完全是另一張表。

注意
目前沒有公開的 FLUX 3 價格、沒有公佈的參數量、這個模型家族沒有技術報告,承諾要開放的權重也沒有授權條款。任何你找得到、標著 FLUX 3 Image 解析度、參考圖上限或每張圖成本的規格表,都是推測,不是文件。
圖片模型才是缺席的那塊
BFL 自己的說法是,FLUX 3 Image 會「在接下來幾週進入早期存取階段」。這就是全部的公開承諾。沒有日期、沒有規格、沒有基準。
這件事比一般的分階段推出更要緊,因為圖片生成就是 FLUX 這個品牌的意思。FLUX.1 和它的 Kontext 編輯系列已經成為開放權重流程裡的預設。在競爭對手每週都在推圖片模型的時候,發表一代旗艦卻沒有那塊元件可用,留給創作者的就只有一堆無法驗證的宣稱。
實務上的後果是:**你今天沒辦法評估 FLUX 3 的圖片能力,別人也不行。**那些關於它的文字算繪、角色一致性或提示詞貼合度的流傳說法,背後沒有任何獨立評測。在模型可測之前,都當行銷話術看待。
FLUX 3 Video:20 秒加原生音訊
真正出貨的那個元件——給通過審核的早期存取申請者——才是真正有意思的。FLUX 3 Video 生成最長 20 秒的片段,音訊是原生同步的,而不是先生成無聲影片再事後配樂。它同時涵蓋圖生影片、關鍵影格生影片和多鏡頭串接。
20 秒加原生聲音是有意義的長度。大多數旗艦影片模型仍然是圍繞 5 到 10 秒的片段調校的,而把那些片段接成連貫的東西,正是製作時間的大宗去處。如果 FLUX 3 能在 20 秒的跨度上撐住角色和音訊的連戲,那就是真正的流程改變。
它同時也告訴你 BFL 認為成長市場在哪。一家做靜態圖片起家的公司去做圖生影片和鏡頭串接,是一家想吃下整條流程的公司,不只是第一影格。
老實地讀 BFL 的基準表
BFL 公佈了 FLUX 3 Video 對上八個競爭者的偏好率。在讀之前,先注意 BFL 自己加上的四個限定詞:這些數字是自行回報的、初步的、在訓練中期測的,用的是 10 秒 720p 片段。沒有任何獨立驗證。

有兩件事很醒目。
**贏的都是離前沿最遠的那幾個。**93% 那一項對上的是 Luma Ray 3.2,77% 對上的是 Runway Gen-4.5。這是整張圖上差距最大的兩欄,也剛好是門檻最低的兩組比較。
**對上當前前沿,是平手。**FLUX 3 在對上 Seedance 2.0 的比較中被偏好的比例是 52%,對上 Gemini Omni Flash 也是 52%。在偏好測試裡,52% 就是擲硬幣。BFL 老實公佈這一項、而不是悄悄把那幾列拿掉,這點值得肯定——但對上你今天就能拿來生成的模型只打成平手,並不構成排隊等候補名單的理由。
那張圖上的八個模型裡,有五個現在就在 OmniArt 的影片選單裡:Grok Imagine、Kling、Happy Horse、Seedance 2.0 和 Gemini Omni Flash。你今天下午就能跑 BFL 拿來對比的那份需求,自己判斷基準線在哪。
說明
下面的片段是在 OmniArt 上用 Seedance 生成的——也就是 FLUX 3 拿到 52% 的那個對手。放在這裡是為了呈現你今天實際做得出來的基準線,不是要代表 FLUX 3 的輸出。目前不存在任何我們能獨立驗證的公開 FLUX 3 樣本。
Self-Flow:值得追蹤的架構主張
FLUX 3 背後的技術想法叫 Self-Flow——帶逐 token 時步條件的自監督 flow matching,隨發表一起以研究形式公開。它主張比先前的表徵對齊做法收斂更快,而且圖片、影片、音訊和動作的訓練共用一個底層架構、彼此互相約束。
如果這個主張成立,有意思的後果不是「一個更好的圖片模型」,而是某一種模態上的進步應該會把其他模態一起抬起來,因為它們共用同一份表徵,而不是各自坐在分開的塔裡。這跟 Google 在 Gemini omni 系列上押的是同一注,只是從相反方向過來——Google 從語言出發,BFL 從像素出發。
這一注值得追蹤。但它還不是一個你用得上的結果。
FLUX.2 的現實檢查
因為 FLUX 3 Image 公開上並不存在,目前最新的可用 FLUX 圖片模型還是 FLUX.2——它在 2025 年 11 月出貨,12 月延伸出 max 級距,2026 年 1 月又加上輕巧的 klein 系列。
| 版本 | 取得方式 | 官方刊例價 | 說明 |
|---|---|---|---|
| FLUX.2 [max] | API | $0.07 / MP | 最高級距;加上帶即時網路檢索的接地生成 |
| FLUX.2 [pro] | API | $0.03 / MP | 生成和編輯的高性價比預設 |
| FLUX.2 [flex] | API | $0.06 / MP | 開放步數和引導強度;為字體排印調校 |
| FLUX.2 [dev] 32B | 開放權重 | 自行架設 | 非商用授權;商用要另外付費 |
| FLUX.2 [klein] 4B | 開放權重 | 自行架設 | Apache 2.0——唯一寬鬆授權的版本 |
FLUX.2 現在還贏在哪
- 多參考素材的一致性。 API 吃八張參考圖,playground 吃十張。鎖住一張臉、一件商品、一套打光,然後生成一整組連貫的作品。這仍然是它最清楚的結構性優勢。
- 精準的品牌色。 把十六進位色碼綁定到具名物件上,是有文件記載的一級功能。把數值綁在那個東西上——"the car is #FF0000"——而不是讓它在提示詞裡漂著。
- 材質的寫實感。 皮膚的次表面散射、玻璃和金屬的高光行為、布料是吸光還是反光。
- [max] 上的接地生成。 生成過程中即時檢索網路,用在當期商品和近期事件上。同級距裡沒有別的做得到。
它在哪裡落後了
盲測偏好的圖像就沒那麼好看了。在 Artificial Analysis 的文生圖競技場上,FLUX.2 [max] 目前大約排在第 16 名,落後 GPT Image 2、Nano Banana 2 家族和 Seedream 5.0 Pro。FLUX.2 [dev]——那個 32B 的開放旗艦——排在 Qwen Image 2.0 Pro 之下,而後者是一個 7B 的 Apache-2.0 模型。
在你把整條流程押上去之前,還有幾個值得知道的摩擦點:
- 沒有負面提示詞。 所有東西都要正面改寫。用 "Sharp focus throughout" 取代 "no blur."。
- 授權限制。 32B 的 [dev] 權重是非商用的。只有 4B 的 klein 版本是 Apache 2.0。
- 硬體成本。 全精度的 [dev] 加上它那顆 24B 的 Mistral 文字編碼器,遠遠超出消費級顯示卡的 VRAM;社群跑的是有畫質損失的量化版本。
- 人體結構的抱怨。 手和多人互動在社群討論串裡是反覆出現的失敗模式,尤其是蒸餾過的 klein 版本在預設的低步數下。
可以沿用的提示詞寫法
BFL 為 FLUX.2 公佈的提示詞建議,是很好的手藝建議,而且可以沿用到大多數現代圖片模型上,包括 OmniArt 上的那些。
結構用 Subject + Action + Style + Context。 詞序有重量;最重要的放最前面。三十到八十個字是文件記載的甜蜜點。
把字面文字用引號框起來。 The text 'OPEN' appears in red neon letters——然後指定位置、字重和顏色。
描述字體,不要點名字體。 "Bold geometric sans-serif with slightly extended kerning" 比點名一款字體可靠得多。
替每一張參考圖指派一個角色。 講清楚哪一份輸入提供主體、哪一份提供風格、哪一份提供背景。
需要替一份需求做版本控制時,用 JSON。 把結構凍住,每個變體只改一個鍵,你拿到的就是一次受控比較,而不是一次重抽:
{
"scene": "Studio product photography on polished concrete",
"subjects": [{ "description": "Matte black ceramic mug, steam rising", "position": "center foreground" }],
"style": "Ultra-realistic commercial product photography",
"color_palette": ["matte black", "concrete gray", "soft white highlights"],
"lighting": "Three-point softbox, soft diffused highlights, no harsh shadows",
"camera": { "angle": "high", "lens-mm": 85, "f-number": "f/5.6" }
}
小技巧
BFL 那份指南裡價值最高的一個習慣,是正面改寫。與其寫 "headlights not on the subject",不如寫 "headlights pointing down the road, illuminating the wet asphalt ahead, leaving the figure in soft silhouette."。這招在每個模型上都有用,不只是 FLUX。
這週該做什麼
如果你本來在等 FLUX 3 才要開專案,老實的建議是別等。圖片模型沒有日期,影片模型擋在一份申請後面,而且沒有公佈價格。
| 如果你想用 FLUX 3 來做…… | 今天就這樣做 |
|---|---|
| 寫實靜態圖和商品作品 | 在 OmniArt 圖片選單裡用 GPT Image 2 或 Seedream 5.0 Pro |
| 多參考素材的角色一致性 | Seedream 5.0 Pro,最多吃 10 張參考圖 |
| 文字量大的版面和海報 | GPT Image 2——目前畫面內文字的領先者 |
| 長片段加同步聲音 | Seedance 2.0 或 Gemini Omni Flash,兩個現在都上線了 |
| 把一張你已經喜歡的定格變成動態 | OmniArt 上任何一個圖生影片模型 |
最後一列是大多數人低估的那一項。BFL 想吃下的那條流程——先生成一張定格,再讓它動起來——在同一個工作台裡早就從頭到尾跑得通了。我們的圖生影片模型指南講的是哪一種動態該挑哪個模型,Seedance 提示詞指南講的則是怎麼把一顆鏡頭導出來,而不只是把它描述出來。
描述
執導
接下來看什麼
三個訊號會告訴你 FLUX 3 值不值得回頭再看。
- FLUX 3 Image 早期存取開放,並附規格。 參考圖張數、原生解析度和價格,是決定它有沒有競爭力的那幾個數字。
- FLUX 3 Video 的獨立基準測試。 服務商在訓練中期做的偏好測試是起點,不是結果。在競技場上對上 Seedance 和 Gemini omni 系列的名次,才是真正的考驗。
- 開放權重的授權。 FLUX.2 [dev] 是非商用的,光是這一個決定就讓 BFL 賠掉了大半開源地位。FLUX 3 Dev 會不會重蹈覆轍,將決定本地生態系會不會回來。
在 OmniArt 上開始
你不必在 FLUX 3 的推出節奏裡選邊站,也能在這週做出東西。OmniArt 把圖片、影片、音訊和音樂生成放在同一個工作台裡,當期的旗艦模型——GPT Image 2、Nano Banana、Seedream、Seedance、Kling、Veo、Grok Imagine 和 Gemini Omni Flash——都在同一個選單和同一份點數餘額後面。
這就是面對一次限量發表的務實答案:你拿自己的需求去評估模型,而不是拿服務商的圖表;等真正更好的東西出貨了再換。等 FLUX 3 Image 可以測了,我們會拿同樣的需求跑一遍,然後把比較結果發出來。在那之前,看看所有影片模型都在同一個工作台裡今天有什麼。
準備好開始創作了嗎?
用 AI 生成精彩內容