updateMô hình và insight16 phút đọc

Giải mã FLUX 3: những gì đã thực sự ra mắt, và những gì chưa

FLUX 3 ra mắt ngày 23/7/2026 với video 20 giây và âm thanh gốc — nhưng không có model ảnh. Đâu là thứ đã ra mắt, benchmark thực sự nói gì, và nên dùng gì hôm nay.

Đội ngũ OmniArt
Giải mã FLUX 3: những gì đã thực sự ra mắt, và những gì chưa

Black Forest Labs công bố FLUX 3 vào ngày 23 tháng 7 năm 2026 và gọi nó là một model tiên phong đa phương thức cho trí tuệ thị giác. Hai ngày sau, điều quan trọng nhất với phần lớn nhà sáng tạo không phải là FLUX 3 làm được gì — mà là bạn thực sự chạy được cái gì. FLUX 3 Video nằm sau một biểu mẫu đăng ký. FLUX 3 Action nằm sau một thỏa thuận đối tác. Còn FLUX 3 Image, chính phần đã làm nên tên tuổi FLUX, thì hoàn toàn chưa được phát hành.

Khoảng trống đó mới là câu chuyện. Công ty đã biến việc tạo ảnh bằng model mở trọng số thành một lựa chọn nghiêm túc lại tung ra một sản phẩm chủ lực mà nửa phần ảnh bị thiếu, rồi hướng phần còn lại của thông báo sang video, âm thanh và robot. Đây là một cú chuyển hướng thật sự, và nó nói lên điều gì đó về nơi áp lực đang dồn vào thị trường này.

Bài viết này tách thông báo ra khỏi sản phẩm: hôm nay có gì thật sự tồn tại, các con số benchmark của BFL chứng minh và không chứng minh được điều gì, tuyên bố về kiến trúc thực chất là gì, và nên dùng gì trong lúc FLUX 3 Image vẫn nằm sau danh sách chờ.

Black Forest Labs thực sự đã công bố những gì

FLUX 3 được giới thiệu như một họ model duy nhất, huấn luyện chung trên ảnh, video, âm thanh và hành động, thay vì bốn hệ thống riêng biệt. Thông báo bao gồm FLUX 3 Video, FLUX 3 Image, FLUX 3 Action (kèm một biến thể cho robot tên là FLUX-mimic), và một bản FLUX 3 Dev mở trọng số trong tương lai.

Còn khả năng tiếp cận lại là một bảng hoàn toàn khác.

Trạng thái phát hành của từng thành phần FLUX 3 hai ngày sau thông báo, cho thấy phần video và hành động đang ở giai đoạn truy cập sớm, trong khi model ảnh, trọng số mở và giá vẫn chưa được công bố
Trạng thái phát hành của từng thành phần FLUX 3 hai ngày sau thông báo, cho thấy phần video và hành động đang ở giai đoạn truy cập sớm, trong khi model ảnh, trọng số mở và giá vẫn chưa được công bố

Cảnh báo

Chưa có giá công khai cho FLUX 3, chưa công bố số lượng tham số, chưa có báo cáo kỹ thuật cho họ model này, và chưa có điều khoản giấy phép cho bản mở trọng số đã hứa. Bất kỳ bảng thông số nào bạn tìm thấy có nêu độ phân giải của FLUX 3 Image, giới hạn ảnh tham chiếu hay chi phí mỗi ảnh đều là suy đoán, không phải tài liệu chính thức.

Model ảnh chính là mảnh ghép còn thiếu

Nguyên văn của BFL là FLUX 3 Image sẽ có "một giai đoạn truy cập sớm trong vài tuần tới". Đó là toàn bộ cam kết công khai. Không ngày tháng, không thông số, không benchmark.

Điều này đáng chú ý hơn một đợt phát hành theo giai đoạn thông thường, bởi tạo ảnh chính là ý nghĩa của thương hiệu FLUX. FLUX.1 và dòng chỉnh sửa Kontext đã trở thành lựa chọn mặc định trong các quy trình mở trọng số. Công bố một sản phẩm chủ lực mà thiếu đúng thành phần đó — trong khi đối thủ ra model ảnh mới hằng tuần — chỉ để lại cho nhà sáng tạo những tuyên bố họ không thể kiểm chứng.

Hệ quả thực tế: hôm nay bạn không thể đánh giá FLUX 3 cho công việc ảnh, và cũng không ai làm được. Những tuyên bố đang lan truyền về khả năng hiển thị chữ, độ nhất quán nhân vật hay mức độ bám prompt của nó đều không có đánh giá độc lập nào đứng sau. Hãy xem đó là tiếp thị cho đến khi model có thể kiểm chứng được.

FLUX 3 Video: 20 giây kèm âm thanh gốc

Thành phần thực sự đã ra mắt — cho những người đăng ký truy cập sớm được duyệt — lại là phần thú vị thật sự. FLUX 3 Video tạo được clip dài đến 20 giây với âm thanh đồng bộ ngay từ gốc, thay vì tạo video câm rồi ghép tiếng sau. Nó cũng hỗ trợ ảnh sang video, khung hình chính sang video, và nối nhiều cảnh quay liên tiếp.

Hai mươi giây kèm âm thanh gốc là một độ dài có ý nghĩa. Phần lớn model video chủ lực vẫn được tinh chỉnh quanh những clip 5 đến 10 giây, và việc khâu chúng lại thành một mạch liền lạc là nơi ngốn rất nhiều thời gian sản xuất. Nếu FLUX 3 giữ được nhân vật và âm thanh liền mạch suốt 20 giây, đó là một thay đổi quy trình thực sự.

Nó cũng cho bạn biết BFL nghĩ thị trường tăng trưởng nằm ở đâu. Một hãng chuyên ảnh tĩnh nay xây dựng ảnh sang video và nối cảnh là một công ty đang muốn sở hữu toàn bộ quy trình, chứ không chỉ khung hình đầu tiên.

Đọc bảng benchmark của BFL một cách trung thực

BFL công bố tỷ lệ được ưa thích của FLUX 3 Video trước tám đối thủ. Trước khi đọc chúng, hãy lưu ý bốn điều kiện mà chính BFL đính kèm: các con số này là tự báo cáo, mang tính sơ bộ, đo trong giai đoạn huấn luyện giữa chừng, trên clip 720p dài 10 giây. Không có kiểm chứng độc lập nào.

Biểu đồ cột về tỷ lệ được ưa thích của FLUX 3 Video so với tám model đối thủ, làm nổi bật năm model đang có trên OmniArt
Biểu đồ cột về tỷ lệ được ưa thích của FLUX 3 Video so với tám model đối thủ, làm nổi bật năm model đang có trên OmniArt

Có hai điểm nổi bật.

Các chiến thắng đều đến trước những model xa nhóm dẫn đầu nhất. Con số 93% là so với Luma Ray 3.2 và 77% là so với Runway Gen-4.5. Đó là hai khoảng cách rộng nhất trên biểu đồ, và cũng là hai phép so sánh có mặt bằng thấp nhất.

Trước nhóm dẫn đầu hiện tại, kết quả là hòa. FLUX 3 được ưa thích trong 52% số lần so sánh với Seedance 2.0 và 52% với Gemini Omni Flash. Trong một bài kiểm tra mức độ ưa thích, 52% chỉ ngang với tung đồng xu. Phải ghi nhận BFL đã công bố thẳng thắn thay vì lặng lẽ bỏ những hàng đó đi — nhưng một kết quả hòa trước các model bạn đã tạo được nội dung ngay hôm nay không phải là lý do để chờ một danh sách chờ.

Năm trong tám model trên biểu đồ đó đang có sẵn trong bộ chọn video của OmniArt ngay lúc này: Grok Imagine, Kling, Happy Horse, Seedance 2.0 và Gemini Omni Flash. Bạn có thể chạy chính đề bài mà BFL đã dùng để benchmark ngay chiều nay, và tự mình đánh giá mặt bằng chung.

Ghi chú

Các clip bên dưới là kết quả từ Seedance được tạo trên OmniArt — chính model mà FLUX 3 đạt 52% khi so sánh. Chúng có mặt ở đây để cho thấy mặt bằng hiện tại mà bạn thực sự tạo ra được hôm nay, không phải để đại diện cho đầu ra của FLUX 3. Hiện chưa có mẫu FLUX 3 công khai nào mà chúng tôi có thể kiểm chứng độc lập.

Seedance trên OmniArt: tỷ lệ làm nên công việc cảm xúc — một hình nhỏ bé trước tín hiệu khổng lồ. Đây chính là hạng mà FLUX 3 Video báo cáo chỉ đạt tỷ lệ ưa thích 52% khi so sánh.
Một mối quan hệ không lời thoại, được nâng đỡ bởi ánh lửa, hơi nước và một đứa trẻ đang ngủ — bầu không khí và cử chỉ thay cho lời giải thích.

Self-Flow: tuyên bố kiến trúc đáng theo dõi

Ý tưởng kỹ thuật đằng sau FLUX 3 được gọi là Self-Flow — flow matching tự giám sát với điều kiện hóa bước thời gian theo từng token, được công bố dưới dạng nghiên cứu song song với đợt ra mắt. Tuyên bố là nó hội tụ nhanh hơn các phương pháp căn chỉnh biểu diễn trước đây, và có một kiến trúc nền duy nhất, nơi việc huấn luyện ảnh, video, âm thanh và hành động ràng buộc lẫn nhau.

Nếu điều đó đúng, hệ quả thú vị không phải là một model ảnh tốt hơn. Mà là cải tiến ở một phương thức sẽ nâng các phương thức còn lại lên theo, vì tất cả cùng chia sẻ một biểu diễn thay vì đứng riêng trong những tháp tách biệt. Đó cũng chính là canh bạc Google đã đặt với dòng Gemini omni, chỉ khác là đi từ hướng ngược lại — Google xuất phát từ ngôn ngữ, còn BFL xuất phát từ pixel.

Đó là một canh bạc đáng theo dõi. Nhưng nó chưa phải là kết quả bạn dùng được.

Nhìn lại thực tế của FLUX.2

Vì FLUX 3 Image chưa tồn tại công khai, model ảnh FLUX mới nhất mà bạn dùng được vẫn là FLUX.2, ra mắt tháng 11 năm 2025 rồi mở rộng bằng bậc max vào tháng 12 và dòng gọn nhẹ klein vào tháng 1 năm 2026.

Biến thểKhả năng tiếp cậnGiá niêm yếtGhi chú
FLUX.2 [max]API$0.07 / MPBậc cao nhất; bổ sung khả năng tạo ảnh có đối chiếu dữ liệu web trực tiếp
FLUX.2 [pro]API$0.03 / MPLựa chọn mặc định tiết kiệm cho tạo và chỉnh sửa ảnh
FLUX.2 [flex]API$0.06 / MPMở quyền chỉnh số bước và mức dẫn hướng; tinh chỉnh cho chữ nghĩa
FLUX.2 [dev] 32BMở trọng sốTự vận hànhGiấy phép phi thương mại; dùng thương mại phải trả phí
FLUX.2 [klein] 4BMở trọng sốTự vận hànhApache 2.0 — biến thể duy nhất có giấy phép thoáng

Những chỗ FLUX.2 vẫn thắng

  • Độ nhất quán đa ảnh tham chiếu. Tám ảnh tham chiếu qua API, mười ảnh trong playground. Khóa một gương mặt, một sản phẩm, một bố cục ánh sáng, rồi tạo cả một loạt ảnh liền mạch. Đây vẫn là lợi thế cấu trúc rõ ràng nhất của nó.
  • Màu đúng chuẩn thương hiệu. Gán mã hex cho một vật thể có tên là tính năng chính thức, có tài liệu hẳn hoi. Hãy buộc giá trị màu vào đúng vật thể — "chiếc xe màu #FF0000" — thay vì để nó trôi nổi trong prompt.
  • Độ chân thực của chất liệu. Tán xạ dưới bề mặt trên da, cách kính và kim loại phản chiếu, cách vải hấp thụ so với phản xạ ánh sáng.
  • Tạo ảnh có đối chiếu dữ liệu trên [max]. Truy xuất web trực tiếp trong lúc tạo ảnh, dành cho sản phẩm hiện hành và sự kiện mới. Không model nào cùng hạng làm được điều này.

Những chỗ nó đã tụt lại

Bức tranh từ các bài đánh giá ưa thích ẩn danh thì kém long lanh hơn. Trên đấu trường văn bản sang ảnh của Artificial Analysis, FLUX.2 [max] hiện đứng khoảng hạng 16, sau GPT Image 2, họ Nano Banana 2 và Seedream 5.0 Pro. FLUX.2 [dev] — bản mở chủ lực 32B — thậm chí xếp dưới Qwen Image 2.0 Pro, một model 7B dùng giấy phép Apache 2.0.

Vài trở ngại khác đáng biết trước khi bạn gắn cả quy trình vào nó:

  • Không có negative prompt. Phải viết lại mọi thứ theo hướng khẳng định. "Nét căng đều toàn khung" thay vì "không bị nhòe".
  • Giới hạn giấy phép. Trọng số [dev] 32B là phi thương mại. Chỉ biến thể klein 4B mới theo Apache 2.0.
  • Chi phí phần cứng. Bản [dev] đầy đủ độ chính xác cộng với bộ mã hóa văn bản Mistral 24B vượt xa dung lượng VRAM phổ thông; cộng đồng phải chạy bản lượng tử hóa và chấp nhận mất chất lượng.
  • Phàn nàn về giải phẫu. Bàn tay và tương tác nhiều người là lỗi lặp lại trong các thảo luận cộng đồng, đặc biệt trên các biến thể klein đã chưng cất với số bước mặc định thấp.

Những công thức prompt vẫn dùng được

Hướng dẫn viết prompt mà BFL công bố cho FLUX.2 là lời khuyên nghề nghiệp tốt và chuyển được sang hầu hết model ảnh hiện đại, kể cả các model trên OmniArt.

Xây cấu trúc theo Subject + Action + Style + Context. Thứ tự từ có trọng lượng; hãy mở đầu bằng thứ quan trọng nhất. Ba mươi đến tám mươi từ là khoảng lý tưởng đã được ghi trong tài liệu.

Đặt chữ cần hiển thị trong dấu nháy. The text 'OPEN' appears in red neon letters — rồi mới nêu vị trí, độ đậm và màu sắc.

Mô tả kiểu chữ, đừng gọi tên phông. "Sans-serif hình học đậm với khoảng cách chữ hơi giãn" cho kết quả ổn định hơn nhiều so với việc nêu tên một bộ phông.

Gán vai trò cho từng ảnh tham chiếu. Nói rõ ảnh nào cung cấp chủ thể, ảnh nào cung cấp phong cách, và ảnh nào cung cấp hậu cảnh.

Dùng JSON khi bạn cần đánh phiên bản cho một đề bài. Giữ nguyên cấu trúc, mỗi biến thể chỉ đổi đúng một khóa, và bạn có được một phép so sánh có kiểm soát thay vì một lần quay lại từ đầu:

{
  "scene": "Studio product photography on polished concrete",
  "subjects": [{ "description": "Matte black ceramic mug, steam rising", "position": "center foreground" }],
  "style": "Ultra-realistic commercial product photography",
  "color_palette": ["matte black", "concrete gray", "soft white highlights"],
  "lighting": "Three-point softbox, soft diffused highlights, no harsh shadows",
  "camera": { "angle": "high", "lens-mm": 85, "f-number": "f/5.6" }
}

Mẹo

Thói quen giá trị nhất trong hướng dẫn của BFL là viết lại theo hướng khẳng định. Thay vì "đèn pha không chiếu vào chủ thể", hãy viết "đèn pha rọi dọc con đường, làm sáng mặt nhựa ướt phía trước, để lại bóng dáng nhân vật in nhẹ trong bóng tối". Cách này hiệu quả với mọi model, không riêng gì FLUX.

Nên làm gì trong tuần này

Nếu bạn đang chờ FLUX 3 để bắt đầu một dự án, lời khuyên thật lòng là đừng chờ. Model ảnh chưa có ngày ra mắt, còn model video thì bị chặn sau một biểu mẫu đăng ký không công bố giá.

Nếu bạn muốn dùng FLUX 3 để…Hôm nay hãy làm thế này
Ảnh tĩnh chân thực và ảnh sản phẩmGPT Image 2 hoặc Seedream 5.0 Pro trong bộ chọn ảnh của OmniArt
Nhất quán nhân vật từ nhiều ảnh tham chiếuSeedream 5.0 Pro, nhận tối đa 10 ảnh tham chiếu
Bố cục và poster nhiều chữGPT Image 2 — đang dẫn đầu về chữ trong ảnh
Clip dài kèm âm thanh đồng bộSeedance 2.0 hoặc Gemini Omni Flash, cả hai đều đã dùng được
Một ảnh tĩnh bạn đã ưng, biến thành chuyển độngBất kỳ model ảnh sang video nào trên OmniArt

Hàng cuối cùng là hàng nhiều người đánh giá thấp nhất. Chính quy trình mà BFL đang muốn sở hữu — tạo một ảnh tĩnh rồi làm nó chuyển động — đã chạy trọn vẹn trong một không gian làm việc duy nhất. Hướng dẫn chọn model ảnh sang video của chúng tôi nói rõ nên chọn model nào cho kiểu chuyển động nào, còn hướng dẫn viết prompt Seedance chỉ cách đạo diễn một cảnh quay thay vì chỉ mô tả nó.

Chỉ mô tả

Có đạo diễn

Cùng một ý tưởng, hai prompt. Đạo diễn một cảnh quay — cảm xúc, ý đồ máy quay, và cảnh đó nói về điều gì — luôn thắng việc liệt kê những thứ có trong khung hình. Kỹ năng đó chuyển được sang bất kỳ model nào rồi sẽ thắng cuộc.

Những gì cần theo dõi tiếp

Ba tín hiệu sẽ cho bạn biết FLUX 3 có đáng để quay lại xem hay không.

  1. FLUX 3 Image mở truy cập sớm, kèm thông số. Số lượng ảnh tham chiếu, độ phân giải gốc và giá là những con số quyết định nó có cạnh tranh được hay không.
  2. Benchmark độc lập cho FLUX 3 Video. Bài kiểm tra ưa thích do nhà cung cấp thực hiện trong giai đoạn huấn luyện giữa chừng chỉ là điểm khởi đầu, không phải kết quả. Thứ hạng trên đấu trường trước Seedance và dòng Gemini omni mới là phép thử thật sự.
  3. Giấy phép cho bản mở trọng số. FLUX.2 [dev] là phi thương mại, và chỉ một quyết định đó đã lấy đi phần lớn vị thế mã nguồn mở của BFL. Việc FLUX 3 Dev có lặp lại điều đó hay không sẽ quyết định hệ sinh thái tự vận hành có quay lại hay không.

Bắt đầu trên OmniArt

Bạn không cần chọn phe trong màn ra mắt nhỏ giọt của FLUX 3 để làm ra một thứ gì đó trong tuần này. OmniArt gom việc tạo ảnh, video, âm thanh và nhạc vào cùng một không gian làm việc, với các model chủ lực hiện tại — GPT Image 2, Nano Banana, Seedream, Seedance, Kling, Veo, Grok Imagine và Gemini Omni Flash — nằm sau một bộ chọn duy nhất và một số dư tín dụng duy nhất.

Đó là câu trả lời thiết thực cho một đợt ra mắt bị giới hạn quyền truy cập: bạn đánh giá model bằng chính đề bài của mình thay vì bằng biểu đồ của nhà cung cấp, và bạn chuyển sang thứ khác ngay khi có gì đó thực sự tốt hơn. Khi FLUX 3 Image có thể kiểm chứng, chúng tôi sẽ chạy nó với cùng bộ đề bài và công bố bảng so sánh. Trong lúc chờ, hãy xem mọi model video trong một không gian làm việc để biết hôm nay có sẵn những gì.

Sẵn sàng sáng tạo?

Bắt đầu tạo nội dung tuyệt vời bằng AI

Bắt đầu miễn phí