update模型与洞察19 分钟阅读

FLUX 3 深度解读:真正发布的是什么,没发布的又是什么

FLUX 3 于 2026 年 7 月 23 日发布,带来 20 秒视频和原生音频,但图片模型缺席。本文梳理实际发布了什么、基准数字到底说明什么,以及今天该用哪些模型。

OmniArt 团队
FLUX 3 深度解读:真正发布的是什么,没发布的又是什么

Black Forest Labs 在 2026 年 7 月 23 日发布了 FLUX 3,并称其为面向视觉智能的多模态前沿模型。两天过去,对大多数创作者真正重要的问题不是 FLUX 3 能做什么,而是你现在到底能用上什么。FLUX 3 Video 卡在一张申请表后面,FLUX 3 Action 卡在合作协议后面,而 FLUX 这个名字赖以立足的那一半——FLUX 3 Image——根本还没有发布。

这个落差才是重点。这家把开放权重图片生成变成严肃选项的公司,交出了一款旗舰产品,其中图片部分恰恰是缺失的那块拼图,发布内容的其余篇幅则指向了视频、音频和机器人。这是一次真实的转向,也说明了这个市场的压力究竟在哪里。

这篇文章把发布会和产品分开来看:今天真正存在的是什么、BFL 的基准数字能证明和不能证明什么、所谓架构创新的具体主张是什么,以及在 FLUX 3 Image 还停留在候补名单期间,你可以拿什么来替代。

Black Forest Labs 到底宣布了什么

FLUX 3 被呈现为一个在图片、视频、音频和动作上联合训练的统一模型家族,而不是四套彼此独立的系统。发布内容涵盖 FLUX 3 Video、FLUX 3 Image、FLUX 3 Action(含一个名为 FLUX-mimic 的机器人变体),以及未来会开放权重的 FLUX 3 Dev。

可用性则完全是另外一张表。

发布两天后 FLUX 3 各组件的上线状态:视频和动作进入早期体验,图片模型、开放权重和定价仍未发布
发布两天后 FLUX 3 各组件的上线状态:视频和动作进入早期体验,图片模型、开放权重和定价仍未发布

警告

FLUX 3 目前没有公开定价,没有公布参数量,整个模型家族没有技术报告,承诺开放权重的许可条款也不存在。你在网上看到的任何标着 FLUX 3 Image 分辨率、参考图数量上限或单张成本的规格表,都是推测,不是文档。

缺失的那块拼图是图片模型

BFL 自己的原话是,FLUX 3 Image 会在"接下来几周内"进入早期体验阶段。这就是全部的公开承诺——没有日期,没有规格,没有基准测试。

这件事比一次普通的分阶段发布更值得注意,因为图片生成正是 FLUX 这个品牌的含义所在。FLUX.1 和它的 Kontext 编辑系列已经成为开放权重工作流里的默认选择。在竞争对手每周都在发布图片模型的时候,推出一款缺少这个组件的旗舰,留给创作者的只有无法验证的说法。

实际后果是:今天你没法评估 FLUX 3 的图片能力,别人也一样。 目前流传的那些关于它文字渲染、角色一致性或提示词遵循能力的说法,背后没有任何独立评测。在模型可以实测之前,把它们当成市场宣传就好。

FLUX 3 Video:20 秒,带原生音频

真正发布出来的组件——面向通过审核的早期体验申请者——确实是有意思的那一个。FLUX 3 Video 能生成最长 20 秒的片段,音频是原生同步生成的,而不是先生成无声画面再后期配上去。它同时支持图生视频、关键帧生视频和多镜头串联。

20 秒加上原生声音是一个有意义的长度。大多数旗舰视频模型仍然围绕 5 到 10 秒的片段调优,而把这些片段拼接成连贯内容,恰恰是制作时间的大头。如果 FLUX 3 能在 20 秒的跨度里守住角色和音频的连续性,那确实会改变工作流。

这也透露出 BFL 认为增长市场在哪里。一家做静态图片起家的公司去做图生视频和镜头串联,说明它想拿下整条链路,而不只是第一帧。

怎样诚实地读 BFL 的基准表

BFL 公布了 FLUX 3 Video 对阵八个竞品的偏好胜率。在读这些数字之前,先注意 BFL 自己附上的四个限定条件:这些数字是自测的初步的、在训练中期测得的,用的是 10 秒 720p 片段。没有任何独立验证。

FLUX 3 Video 对阵八个竞争模型的偏好胜率柱状图,其中五个在 OmniArt 上可用的模型被高亮标出
FLUX 3 Video 对阵八个竞争模型的偏好胜率柱状图,其中五个在 OmniArt 上可用的模型被高亮标出

有两点格外显眼。

赢得最多的,是离前沿最远的那几个对手。 93% 是对阵 Luma Ray 3.2,77% 是对阵 Runway Gen-4.5。这是图表上差距最大的两条,也恰好是门槛最低的两次比较。

面对当前的前沿模型,结果是平手。 FLUX 3 对阵 Seedance 2.0 的偏好率是 52%,对阵 Gemini Omni Flash 也是 52%。在偏好测试里,52% 就是抛硬币。BFL 愿意如实公布,而不是悄悄把这两行删掉,这点值得肯定——但对着今天就能直接生成的模型打成平手,并不构成你去排候补名单的理由。

图表上的八个模型里,有五个此刻就在 OmniArt 的视频模型选择器里:Grok Imagine、Kling、Happy Horse、Seedance 2.0 和 Gemini Omni Flash。BFL 用来跑基准的那些创意,你今天下午就能自己跑一遍,亲自判断基线在哪。

说明

下面的片段是在 OmniArt 上用 Seedance 生成的——也就是 FLUX 3 拿到 52% 偏好率的那个对手。放在这里是为了展示你今天真正做得出来的基线水准,而不是代表 FLUX 3 的输出。目前不存在任何我们能够独立验证的 FLUX 3 公开样片。

OmniArt 上的 Seedance:用尺度承载情绪——一个渺小的身影,面对一座庞大的信号装置。这就是 FLUX 3 Video 声称拿到 52% 偏好率的那个水准。
一段没有台词的关系戏,全靠火光、蒸汽和一个熟睡的孩子撑起来——用氛围和动作代替解释。

Self-Flow:值得跟踪的架构主张

FLUX 3 背后的技术思路叫 Self-Flow——自监督的流匹配,配合逐 token 的时间步条件控制,作为研究成果与这次发布同期公开。它的主张是:比此前的表征对齐方法收敛更快,并且图片、视频、音频和动作训练共享同一套底层架构、彼此约束。

如果这个主张成立,真正有意思的结果并不是"图片模型更强了",而是任何一个模态上的进步都会带动其他模态,因为它们共享同一套表征,而不是各自独立成塔。这和 Google 在 Gemini omni 系列上下的是同一个赌注,只是方向相反——Google 从语言出发,BFL 从像素出发。

这个赌注值得跟踪,但它现在还不是一个你能拿来用的结果。

FLUX.2 的现实检查

因为 FLUX 3 Image 还没有公开版本,目前可用的最新 FLUX 图片模型仍然是 FLUX.2。它在 2025 年 11 月发布,12 月扩展出 max 档位,2026 年 1 月又补上了轻量的 klein 系列。

版本可用形式官方定价说明
FLUX.2 [max]API$0.07 / 百万像素顶配档位;支持联网实时检索的生成
FLUX.2 [pro]API$0.03 / 百万像素生成和编辑场景下性价比最高的默认选项
FLUX.2 [flex]API$0.06 / 百万像素开放步数和引导强度;针对排版调优
FLUX.2 [dev] 32B开放权重自行部署非商用许可;商用需另行付费授权
FLUX.2 [klein] 4B开放权重自行部署Apache 2.0——唯一采用宽松许可的版本

FLUX.2 仍然领先的地方

  • 多参考图一致性。 API 支持八张参考图,playground 里支持十张。锁定一张脸、一件产品、一套布光,就能生成连贯的系列图。这仍然是它最明确的结构性优势。
  • 品牌色精确还原。 把十六进制色值绑定到指定物体上,是有文档支持的一级功能。要把色值绑在具体的东西上——"这辆车是 #FF0000"——而不是让它在提示词里孤零零地飘着。
  • 材质级真实感。 皮肤的次表面散射、玻璃和金属的高光行为、织物是吸光还是反光。
  • [max] 上的联网生成。 生成过程中实时检索网络内容,用来处理当下的产品和近期事件。同价位段里没有第二家能做到。

它落后的地方

盲测偏好的结果就没那么好看了。在 Artificial Analysis 的文生图竞技场上,FLUX.2 [max] 目前大约排在第 16 位,落后于 GPT Image 2、Nano Banana 2 系列和 Seedream 5.0 Pro。而 FLUX.2 [dev]——那个 32B 的开放权重旗舰——排名甚至低于 Qwen Image 2.0 Pro 这样一个 7B 的 Apache-2.0 模型。

在把生产流程押在它身上之前,还有这些摩擦值得先知道:

  • 不支持负向提示词。 所有内容都要正面重写。写"全画面锐利对焦",而不是"不要模糊"。
  • 许可限制。 32B 的 [dev] 权重是非商用的,只有 4B 的 klein 变体是 Apache 2.0。
  • 硬件成本。 全精度 [dev] 加上它 24B 的 Mistral 文本编码器,远远超出消费级显存;社区跑的是量化版本,代价是画质损失。
  • 人体结构问题。 手部和多人互动是社区讨论里反复出现的失败点,尤其是蒸馏后的 klein 变体在默认低步数下。

可以迁移的提示词写法

BFL 为 FLUX.2 公布的提示词指南是很扎实的手艺经验,而且能迁移到大多数现代图片模型上,包括 OmniArt 上的这些。

主体 + 动作 + 风格 + 场景来组织。 词序是有权重的,把最重要的放在最前面。三十到八十个词是文档给出的最佳区间。

字面文字要加引号。 The text 'OPEN' appears in red neon letters——然后再指定位置、字重和颜色。

描述字体,而不是点名字体。 "带轻微扩展字距的粗体几何无衬线体",比直接报一个字体名要靠谱得多。

给每一张参考图分配角色。 说清楚哪张输入提供主体、哪张提供风格、哪张提供背景。

需要给创意做版本管理时,就改用 JSON。 固定结构,每个变体只改一个键,你得到的就是一次受控对比,而不是重新抽一次卡:

{
  "scene": "Studio product photography on polished concrete",
  "subjects": [{ "description": "Matte black ceramic mug, steam rising", "position": "center foreground" }],
  "style": "Ultra-realistic commercial product photography",
  "color_palette": ["matte black", "concrete gray", "soft white highlights"],
  "lighting": "Three-point softbox, soft diffused highlights, no harsh shadows",
  "camera": { "angle": "high", "lens-mm": 85, "f-number": "f/5.6" }
}

提示

BFL 指南里价值最高的一个习惯,就是正面重写。与其写"车灯不要打在主体上",不如写"车灯朝向路面前方,照亮前方湿滑的沥青,让人物留在柔和的剪影里"。这一招在每个模型上都有效,不只是 FLUX。

这周该做什么

如果你一直在等 FLUX 3 来启动某个项目,实话是别等了。图片模型没有日期,视频模型卡在申请制后面,定价也没公布。

你原本想用 FLUX 3 做……今天可以这样做
写实静态图和产品图在 OmniArt 图片模型选择器里用 GPT Image 2 或 Seedream 5.0 Pro
多参考图的角色一致性Seedream 5.0 Pro,最多支持 10 张参考图
文字密集的版式和海报GPT Image 2——目前图内文字的领先者
带同步声音的长片段Seedance 2.0 或 Gemini Omni Flash,现在都能用
把一张已经满意的静图变成动态OmniArt 上任意一个图生视频模型

最后一行是大多数人低估的。BFL 想要拿下的那条链路——先生成静态图,再让它动起来——已经能在一个工作台里完整跑通。我们的图生视频模型指南讲了什么样的运动该选什么模型,Seedance 提示词指南讲的则是如何导演一个镜头,而不只是描述它的内容。

描述式

导演式

同一个概念,两种提示词。导演这个镜头——氛围、镜头意图、这场戏到底在讲什么——胜过罗列画面里有什么。这项能力可以迁移到最终胜出的任何模型上。

接下来看什么

有三个信号会告诉你 FLUX 3 值不值得再回头看一眼。

  1. FLUX 3 Image 开放早期体验,并公布规格。 参考图数量、原生分辨率和定价,这三个数字决定它有没有竞争力。
  2. FLUX 3 Video 的独立基准测试。 厂商在训练中期做的偏好测试是起点,不是结论。在竞技场上对阵 Seedance 和 Gemini omni 系列,才是真正的考验。
  3. 开放权重的许可条款。 FLUX.2 [dev] 是非商用的,仅这一个决定就让 BFL 丢掉了大半开源阵地。FLUX 3 Dev 会不会重蹈覆辙,将决定本地生态会不会回来。

在 OmniArt 上开始

你不需要在 FLUX 3 的发布节奏里选边站,也能在这周做出点东西。OmniArt 把图片、视频、音频和音乐生成放在同一个工作台里,当前的旗舰模型——GPT Image 2、Nano Banana、Seedream、Seedance、Kling、Veo、Grok Imagine 和 Gemini Omni Flash——都在同一个选择器和同一份积分余额之下。

面对一场受限发布,这就是最实际的答案:你用自己的创意去评估模型,而不是看厂商的图表,等真正更好的东西发布了再切换。等到 FLUX 3 Image 可以实测,我们会用同一批创意跑一遍并发布对比。在那之前,先看看一个工作台里的全部视频模型,了解今天有什么可用。

准备好创作了吗?

开始用 AI 生成精彩内容

免费开始