Industry模型與觀察閱讀時間 13 分鐘

FLUX.2 技術預測:Black Forest Labs 這次會端出什麼

FLUX.2 技術預測——架構、2K 以上解析度、角色一致性、情境內編輯,以及 Pro/Dev/Schnell 分層發布對創作者的意義。

OmniArt 團隊
FLUX.2 技術預測:Black Forest Labs 這次會端出什麼

FLUX.2 是 Black Forest Labs 的下一個圖片模型,也是 2026 年除了旗艦影片模型之外最受矚目的一次發布。FLUX.1 在提示詞遵從度、透過 Kontext 保留身分特徵的編輯,以及對開發者友善的權重釋出上,都立下了標竿。目前圍繞 FLUX.2 的訊號——alpha 和 beta 都已完成、內部預覽進行中、Pro 版本先上,Dev 和 Schnell 排在後面——都指向一次會把解析度、一致性和流程整合往前推的發布。這篇文章會逐項走過對創作者真正重要的技術預測、這些預測若成真會改變什麼,以及要怎麼在 OmniArt 上為這次發布做準備。

FLUX.2 預期會是什麼

FLUX.2 的定位是 FLUX 家族的下一次跳躍,而不是一次小版本推進。綜合公開討論裡比較可信的讀法:一套超越純 diffusion-Transformer 的混合架構、更大的潛在空間、多階段精修,以及一個能一次處理完複雜構圖需求的內部推理步驟。除了畫質提升之外,推論效率也是明講出來的目標——潛在向量重複利用得更好,大量生成流程的周轉也更快。

面向FLUX.1FLUX.2(預測)
原生解析度有高解析度模式原生 2K 以上,2048×2048 起跳
材質模擬基礎扎實次表面散射、鏡面/漫射分離
角色一致性同一系列裡表現不穩用身分嵌入維持多張圖片之間的一致性
編輯Kontext(潛在空間編輯)擴充的情境內編輯、可變強度的局部重繪
場景理解語意解析更強,幻覺更少
推論速度基準線效率提升,並分成多個版本層級
發布版本有限Pro、Dev、Schnell

值得認真看待的架構預測

有幾個細節反覆出現在各家獨立評論裡;對一個還沒上線的模型來說,這已經是最接近可信訊號的東西了。

超越 diffusion-Transformer 的混合架構。 FLUX.1 本來就已經走出純潛在擴散。FLUX.2 預期會再疊上一層更接近多階段精修迴圈的東西,加上一個內部推理步驟,把「圖片生成器」和「會規劃、也會生成圖片的模型」之間的距離拉近。

更大的潛在空間。 潛在空間變大,模型就有更多餘裕在複雜場景裡撐住構圖結構——像是那種要同時容納五個指名物件、三個打光方向和一項字體排版限制的需求。

潛在向量重複利用得更好。 這是推論端的預測。如果 FLUX.2 能更有效率地跨迭代保留並重用潛在向量,變化型工作的成本結構就會改變——就是那種要圍繞一個概念生出 30 張靜態圖的專案。

可變強度的局部重繪與情境內編輯。 Kontext 最大的弱點是撐不住多次編輯之間的上下文;FLUX.2 的預測是一套在長迭代串裡仍然尊重身分特徵和場景結構的編輯介面。

解析度與材質擬真度

FLUX.2 在視覺這一側的預測清單。

  • 原生 2K 以上解析度。 以 2048×2048 為底,另有更高的模式,用於海報、電影感靜態圖和印刷。
  • 更好的次表面散射。 皮膚更好、蠟質更好,半透明材質整體都更好。
  • 更乾淨的鏡面/漫射過渡。 金屬、玻璃和拋光表面應該會少掉一些今天一眼就看得出是生成畫面的破綻。
  • 深度線索。 風景和建築題材會有更有說服力的空氣透視和大氣層次。

角色一致性才是重頭戲

FLUX 社群喊了最久的能力,就是跨多張圖片的身分一致性,而且不要那種生到第三、第四張就開始跑掉的漂移。預測是這樣:一套身分嵌入系統,撐得住劇烈的場景變化、打光變化和服裝變化——同一個角色能撐完一整檔品牌行銷,而不只是撐過兩次生成。

如果真的做到了,實際效果就是終結「生五十張、挑五張」這種目前主導大量角色插畫工作的流程。

提示詞解讀與場景理解

上線時值得盯的三個行為:

  • 更好的語意解析。 版面、鏡位、打光和情緒基調,都應該能從自然語言解析出來,不用再靠關鍵字堆疊撐著。
  • 幻覺變少。 手、四肢和物件擺放是經典的失敗模式。更乾淨的空間推理可以補掉其中大部分。
  • 電影感構圖指示。 「變形寬銀幕 2.39:1,主體落在右三分之一,柔和主光從左上打下來,左側深陰影」這種指示應該第一次就要到位。

編輯與流程整合

Kontext 這條血脈,就是 FLUX 在商業上有意思的地方。對 FLUX.2 的期待:

  • 擴充的局部重繪與外擴延伸,並在多輪之間保住角色和場景。
  • 可變強度編輯。 一次操作就能對圖片不同區域套用不同的編輯強度。
  • 多輪精修,迴圈更快,適合設計迭代。
  • 可直接接 API 的整合,對應設計工具、素材流程、遊戲引擎和企業系統。

Pro/Dev/Schnell 的分層發布

Black Forest Labs 已經預告了分層發布:FLUX.2 Pro 先上,接著是開發者版本(「Dev」),再來是快速版本(「Schnell」)。這個節奏不是隨便排的——它讓模型從高階先出貨,同時由量化或蒸餾過的版本去接業餘玩家和大量生成的情境。

版本可能的對象可能的取捨
Pro工作室、代理商、高階產品案畫質最高、成本最高、推論最久
Dev獨立創作者、專業級玩家畫質好、成本合理、拿得到權重
Schnell迭代迴圈、草稿、自動化周轉最快、擬真度較低、推論最便宜

預期會有的限制

寫一篇預測文章卻不老實列出可能的摩擦點,這樣不太健康。

  • 濫用風險會隨擬真度一起放大。 寫實度愈高,深偽和未經授權的肖像使用就愈容易。可以預期 Black Forest Labs 和 OmniArt 都會在模型選擇器那一層加上內容規則。
  • 身分一致性在劇烈場景變化下可能會晃。 要在一次操作裡同時換裝、翻轉打光、再轉 30 度視角還保住長相,是真的很難。
  • 運算成本。 原生 2K 以上解析度和多階段精修都不是免費的。Schnell 這一層存在的理由就是這個。
  • 前幾週的風格偏移。 每一個新旗艦都有一種「預設長相」,要靠大家集體用提示詞模式把它學掉。可以預期會有大約六週的期間,每一張 FLUX.2 圖片看起來都有點像,直到社群整理出破除這個偏誤的提示詞文法。

這對 OmniArt 的模型選擇器意味著什麼

如果這些預測成立,FLUX.2 會在寫實度上正面對上 Nano Banana Pro、在懂版面的需求上對上 GPT Image 2、在美術指導型工作上對上 Midjourney V8。這些模型都不會因此丟掉自己的位置——它們留在原位,而 FLUX.2 替自己刻出一個明確的新位置。

工作現在的選擇FLUX.2 上線之後
寫實人像Nano Banana Pro拿 Nano Banana Pro 和 FLUX.2 Pro 對比
字體排版吃重的海報GPT Image 2GPT Image 2 仍然領先
多角色品牌行銷混合流程用帶身分嵌入的 FLUX.2
大量草稿迭代Seedream 5.0 Lite等 FLUX.2 Schnell 開放後改用它
指名電影參考的風格化插畫Midjourney V8Midjourney V8 仍然領先

說明

這是一篇預測文章,不是評測。文中列出的能力是從公開討論和 FLUX.1 的血脈推斷出來的;FLUX.2 上線那天,我們會拿真實跑分回頭修正。只要它一進到 OmniArt 的圖片工作台,我們就會發一篇並排實測。

上線當天要盯什麼

有三個訊號會告訴你這些預測站不站得住。

  1. 身分一致性測試。 把同一個角色放進五個天差地遠的場景生成。如果不用重新綁定參考素材,長相就撐得住,那重頭戲就成立了。
  2. 情境內編輯能撐多長。 連續編輯幾次之後場景結構才會垮?FLUX.1 Kontext 很早就垮了;FLUX.2 應該要撐得更久。
  3. Schnell 版本的推論時間。 如果 Schnell 真的夠快——1024px 輸出五秒內完成——那所有人的迭代算術都會改變。

在 OmniArt 上先做好準備

FLUX.2 上線時的計畫,就是 Nano Banana Pro 和 GPT Image 2 上線時行得通的那一套:權重釋出當天,它就會帶著點數價格出現在 OmniArt 的圖片模型選擇器裡,同一週我們會發一篇正面對決的比較。

在那之前,Seedream 5.0 Lite 提示詞指南GPT Image 2 提示詞指南講的是目前 OmniArt 上最常被使用的兩個旗艦級圖片模型。等 FLUX.2 上線,這兩份指南裡的模式只要小幅調整就能搬過去。

準備好開始創作了嗎?

用 AI 生成精彩內容

免費開始