update모델 및 인사이트25분 읽기

FLUX 3 정리: 실제로 출시된 것과 끝내 나오지 않은 것

FLUX 3가 2026년 7월 23일 공개돼 20초 영상과 네이티브 오디오를 지원하지만 이미지 모델은 빠졌습니다. 무엇이 출시됐는지, 벤치마크 수치가 실제로 무엇을 말하는지, 지금은 무엇을 쓰면 좋은지 정리했습니다.

OmniArt 팀
FLUX 3 정리: 실제로 출시된 것과 끝내 나오지 않은 것

Black Forest Labs는 2026년 7월 23일 FLUX 3를 발표하며 이를 시각 지능을 위한 멀티모달 프런티어 모델이라고 소개했습니다. 이틀이 지난 지금, 대다수 창작자에게 중요한 것은 FLUX 3가 무엇을 할 수 있느냐가 아니라 실제로 무엇을 쓸 수 있느냐입니다. FLUX 3 Video는 신청서를 통과해야 하고, FLUX 3 Action은 파트너 계약이 있어야 합니다. 그리고 FLUX라는 이름을 지금까지 지탱해온 이미지 모델, FLUX 3 Image는 아직 전혀 공개되지 않았습니다.

바로 이 격차가 이번 발표의 핵심입니다. 오픈 웨이트 이미지 생성을 진지한 선택지로 만들어낸 회사가 정작 이미지 부분이 비어 있는 플래그십을 내놓았고, 발표의 나머지를 영상과 오디오, 로보틱스로 채웠습니다. 이것은 실질적인 방향 전환이며, 이 시장의 압력이 어디에서 오는지를 보여줍니다.

이 글에서는 발표와 제품을 분리해서 봅니다. 오늘 실제로 존재하는 것은 무엇인지, BFL의 벤치마크 수치가 증명하는 것과 증명하지 못하는 것은 무엇인지, 아키텍처 관련 주장의 실체는 무엇인지, 그리고 FLUX 3 Image가 대기 명단 뒤에 머무는 동안 무엇을 대신 쓰면 되는지 살펴봅니다.

Black Forest Labs가 실제로 발표한 내용

FLUX 3는 네 개의 개별 시스템이 아니라 이미지, 영상, 오디오, 행동을 아울러 함께 학습한 하나의 모델 제품군으로 제시됐습니다. 발표 범위는 FLUX 3 Video, FLUX 3 Image, FLUX 3 Action(FLUX-mimic이라는 로보틱스 계열 포함), 그리고 앞으로 오픈 웨이트로 공개될 FLUX 3 Dev입니다.

하지만 실제 이용 가능 여부는 완전히 다른 이야기입니다.

발표 이틀 뒤 FLUX 3 각 구성 요소의 출시 상태. 영상과 행동은 얼리 액세스 단계이고 이미지 모델, 오픈 웨이트, 가격은 아직 미공개
발표 이틀 뒤 FLUX 3 각 구성 요소의 출시 상태. 영상과 행동은 얼리 액세스 단계이고 이미지 모델, 오픈 웨이트, 가격은 아직 미공개

경고

FLUX 3는 공개된 가격이 없고, 파라미터 수도 공표되지 않았으며, 이 모델 제품군에 대한 기술 보고서도 없습니다. 약속된 오픈 웨이트 공개의 라이선스 조건 역시 존재하지 않습니다. FLUX 3 Image의 해상도, 참조 이미지 개수 제한, 장당 비용을 적어놓은 사양표를 어디선가 봤다면 그것은 추정이지 공식 문서가 아닙니다.

비어 있는 조각은 이미지 모델입니다

BFL이 직접 쓴 표현은 FLUX 3 Image가 "앞으로 몇 주 안에 얼리 액세스 단계에 들어간다"는 것입니다. 공개된 약속은 이게 전부입니다. 날짜도, 사양도, 벤치마크도 없습니다.

이는 평범한 단계적 출시보다 훨씬 무겁게 다가옵니다. 이미지 생성이야말로 FLUX라는 브랜드의 정체성이기 때문입니다. FLUX.1과 그 편집 계열인 Kontext는 오픈 웨이트 작업 흐름의 기본 선택지로 자리 잡았습니다. 경쟁사들이 매주 이미지 모델을 내놓는 시점에 정작 그 구성 요소가 빠진 플래그십을 발표하면, 창작자에게는 검증할 수 없는 주장만 남습니다.

현실적인 결론은 이렇습니다. 오늘 당신은 FLUX 3를 이미지 작업 기준으로 평가할 수 없고, 이는 다른 누구에게도 마찬가지입니다. 텍스트 렌더링, 캐릭터 일관성, 프롬프트 준수 능력에 대해 돌고 있는 이야기들 뒤에는 독립적인 평가가 전혀 없습니다. 모델을 직접 시험해볼 수 있게 되기 전까지는 마케팅 문구로 받아들이는 편이 안전합니다.

FLUX 3 Video: 네이티브 오디오가 붙은 20초

실제로 출시된 구성 요소, 즉 승인된 얼리 액세스 신청자에게 열린 부분은 확실히 흥미롭습니다. FLUX 3 Video는 최대 20초 길이의 클립을 생성하며, 무음 영상을 만든 뒤 나중에 소리를 입히는 방식이 아니라 처음부터 동기화된 오디오를 함께 생성합니다. 이미지-영상 변환, 키프레임 기반 생성, 여러 숏 이어붙이기도 지원합니다.

네이티브 사운드가 붙은 20초는 의미 있는 길이입니다. 주요 영상 모델 대부분은 여전히 5초에서 10초 클립에 맞춰 조정되어 있고, 그 조각들을 이어 붙여 하나의 흐름으로 만드는 작업에 제작 시간의 상당 부분이 들어갑니다. FLUX 3가 20초 구간 내내 캐릭터와 오디오의 연속성을 지켜준다면, 그건 실제로 작업 흐름을 바꾸는 변화입니다.

여기서 BFL이 성장 시장을 어디로 보는지도 드러납니다. 정지 이미지로 출발한 회사가 이미지-영상 변환과 숏 연결을 만든다는 것은, 첫 프레임만이 아니라 제작 흐름 전체를 가져가려 한다는 뜻입니다.

BFL의 벤치마크 표를 정직하게 읽는 법

BFL은 여덟 개 경쟁 모델을 상대로 한 FLUX 3 Video의 선호도 수치를 공개했습니다. 숫자를 읽기 전에 BFL이 직접 달아놓은 네 가지 단서를 먼저 봐야 합니다. 이 수치는 자체 측정이고, 잠정적이며, 학습 중간 단계에서 측정됐고, 대상은 10초 720p 클립입니다. 독립적인 검증은 없습니다.

여덟 개 경쟁 모델을 상대로 한 FLUX 3 Video 선호도 막대 그래프. OmniArt에서 쓸 수 있는 다섯 개 모델이 강조 표시되어 있음
여덟 개 경쟁 모델을 상대로 한 FLUX 3 Video 선호도 막대 그래프. OmniArt에서 쓸 수 있는 다섯 개 모델이 강조 표시되어 있음

두 가지가 눈에 띕니다.

크게 이긴 상대는 최전선에서 가장 멀리 있는 모델들입니다. 93%는 Luma Ray 3.2를 상대로, 77%는 Runway Gen-4.5를 상대로 나온 수치입니다. 그래프에서 격차가 가장 큰 두 항목이자, 동시에 기준이 가장 낮은 두 비교이기도 합니다.

현재 최전선 모델을 상대로는 무승부입니다. FLUX 3는 Seedance 2.0과의 비교에서 52%, Gemini Omni Flash와의 비교에서도 52%의 선호도를 기록했습니다. 선호도 테스트에서 52%는 동전 던지기와 같습니다. 이 항목을 슬쩍 빼지 않고 정직하게 공개한 점은 BFL에 점수를 줄 만합니다. 다만 오늘 바로 쓸 수 있는 모델과 비겼다는 사실은, 대기 명단에 이름을 올리고 기다릴 이유가 되지 못합니다.

그래프에 있는 여덟 개 모델 중 다섯 개는 지금 이 순간 OmniArt의 영상 모델 선택기에 들어 있습니다. Grok Imagine, Kling, Happy Horse, Seedance 2.0, Gemini Omni Flash입니다. BFL이 벤치마크에 사용한 것과 같은 기획을 오늘 오후에 직접 돌려보고 기준선을 스스로 판단할 수 있습니다.

참고

아래 클립은 OmniArt에서 Seedance로 생성한 결과물입니다. FLUX 3가 52%의 선호도를 기록한 바로 그 상대 모델입니다. 오늘 실제로 만들어낼 수 있는 기준선을 보여주기 위한 것이지 FLUX 3의 출력을 대신하는 것이 아닙니다. 우리가 독립적으로 검증할 수 있는 FLUX 3의 공개 샘플은 현재 존재하지 않습니다.

OmniArt의 Seedance: 스케일이 감정을 떠받치는 장면 — 거대한 신호 설비 앞에 선 작은 인물 하나. FLUX 3 Video가 52% 선호도를 보고한 상대가 바로 이 수준입니다.
대사 한 줄 없이 불빛과 수증기, 잠든 아이만으로 지탱되는 관계의 한 장면 — 설명 대신 공기와 몸짓으로 말합니다.

Self-Flow: 지켜볼 가치가 있는 아키텍처 주장

FLUX 3의 기술적 뼈대는 Self-Flow라고 불립니다. 토큰별 타임스텝 조건화를 적용한 자기지도 플로 매칭이며, 출시와 함께 연구 결과로 공개됐습니다. 핵심 주장은 기존의 표현 정렬 방식보다 수렴이 빠르다는 것, 그리고 이미지·영상·오디오·행동 학습이 서로를 제약하는 하나의 기반 아키텍처를 공유한다는 것입니다.

이 주장이 성립한다면 흥미로운 결과는 "더 좋은 이미지 모델"이 아닙니다. 각각이 별도의 탑으로 나뉘어 있지 않고 표현을 공유하기 때문에, 한 양식에서의 개선이 나머지 양식까지 끌어올린다는 점입니다. 이는 Google이 Gemini omni 계열에서 건 것과 같은 베팅을 반대 방향에서 시도하는 셈입니다. Google은 언어에서 출발했고, BFL은 픽셀에서 출발하고 있습니다.

지켜볼 가치가 있는 베팅입니다. 다만 아직은 지금 당장 쓸 수 있는 결과가 아닙니다.

FLUX.2로 돌아보는 현실

FLUX 3 Image가 공개되지 않은 이상, 실제로 쓸 수 있는 가장 최신 FLUX 이미지 모델은 여전히 FLUX.2입니다. 2025년 11월에 출시됐고, 12월에 max 등급이 더해졌으며, 2026년 1월에는 경량 계열인 klein으로 확장됐습니다.

종류제공 형태정가비고
FLUX.2 [max]API$0.07 / 메가픽셀최상위 등급. 실시간 웹 검색을 결합한 생성 지원
FLUX.2 [pro]API$0.03 / 메가픽셀생성과 편집에서 비용 효율이 좋은 기본 선택지
FLUX.2 [flex]API$0.06 / 메가픽셀스텝 수와 가이던스 조절 가능. 타이포그래피에 맞춰 조정됨
FLUX.2 [dev] 32B오픈 웨이트직접 운영비상업용 라이선스. 상업적 이용은 유료 등급
FLUX.2 [klein] 4B오픈 웨이트직접 운영Apache 2.0 — 유일하게 관대한 라이선스를 적용한 종류

FLUX.2가 여전히 앞서는 부분

  • 다중 참조 이미지 일관성. API로는 참조 이미지 8장, 플레이그라운드에서는 10장까지 쓸 수 있습니다. 얼굴 하나, 제품 하나, 조명 세팅 하나를 고정한 채 일관된 시리즈를 만들어낼 수 있습니다. 이것이 지금도 가장 분명한 구조적 강점입니다.
  • 브랜드 색상의 정확한 재현. 특정 사물에 헥스 값을 묶는 기능이 문서화된 기본 기능으로 제공됩니다. "이 자동차는 #FF0000"처럼 값을 대상에 붙여주세요. 프롬프트 안에 색만 덩그러니 띄워두면 안 됩니다.
  • 재질 수준의 사실감. 피부의 표면하 산란, 유리와 금속의 반사 거동, 직물이 빛을 흡수하는지 반사하는지의 차이까지 다룹니다.
  • [max]의 웹 검색 결합 생성. 생성 도중 실시간으로 웹 정보를 가져오기 때문에 최신 제품이나 최근 사건도 다룰 수 있습니다. 같은 가격대에서 이걸 하는 모델은 없습니다.

뒤처진 부분

블라인드 선호도 결과는 그리 좋지 않습니다. Artificial Analysis의 텍스트-이미지 변환 아레나에서 FLUX.2 [max]는 현재 16위 안팎에 머물러 GPT Image 2, Nano Banana 2 계열, Seedream 5.0 Pro에 밀립니다. 32B 오픈 플래그십인 FLUX.2 [dev]는 7B Apache 2.0 모델인 Qwen Image 2.0 Pro보다도 아래에 있습니다.

작업 파이프라인 전체를 맡기기 전에 알아둘 만한 걸림돌도 있습니다.

  • 네거티브 프롬프트를 지원하지 않습니다. 모든 내용을 긍정형으로 다시 써야 합니다. "흐림 없음"이 아니라 "화면 전체에 또렷한 초점"이라고 씁니다.
  • 라이선스 제약. 32B [dev] 가중치는 비상업용입니다. Apache 2.0인 것은 4B klein 계열뿐입니다.
  • 하드웨어 비용. 완전 정밀도 [dev]에 24B 규모의 Mistral 텍스트 인코더까지 더하면 일반 소비자용 그래픽 메모리를 한참 넘어섭니다. 커뮤니티에서는 품질 손실을 감수하고 양자화 버전을 돌립니다.
  • 인체 표현 불만. 손과 여러 인물의 상호작용은 커뮤니티 게시글에서 반복적으로 지적되는 실패 지점입니다. 특히 증류된 klein 계열을 기본값의 낮은 스텝 수로 돌릴 때 두드러집니다.

다른 모델에도 그대로 통하는 프롬프트 패턴

BFL이 FLUX.2용으로 공개한 프롬프트 지침은 좋은 작법 조언이며, OmniArt에 있는 모델들을 포함해 최신 이미지 모델 대부분에 그대로 적용됩니다.

주제 + 동작 + 스타일 + 맥락 순서로 구성하세요. 어순에는 무게가 실리므로 가장 중요한 요소를 앞에 두세요. 문서가 제시하는 최적 분량은 30~80단어입니다.

화면에 넣을 문구는 따옴표로 감싸세요. The text 'OPEN' appears in red neon letters처럼 쓴 다음 위치, 굵기, 색을 지정합니다.

서체는 이름 대신 특징으로 설명하세요. 서체 이름을 부르는 것보다 "자간을 살짝 넓힌 굵은 기하학적 산세리프"라고 묘사하는 편이 훨씬 안정적으로 반영됩니다.

참조 이미지마다 역할을 지정하세요. 어떤 입력이 주제를 제공하고, 어떤 입력이 스타일을, 어떤 입력이 배경을 담당하는지 명시하세요.

기획안을 버전 관리해야 한다면 JSON을 쓰세요. 구조를 고정하고 변형마다 정확히 키 하나만 바꾸면, 다시 뽑기가 아니라 조건을 통제한 비교가 됩니다.

{
  "scene": "Studio product photography on polished concrete",
  "subjects": [{ "description": "Matte black ceramic mug, steam rising", "position": "center foreground" }],
  "style": "Ultra-realistic commercial product photography",
  "color_palette": ["matte black", "concrete gray", "soft white highlights"],
  "lighting": "Three-point softbox, soft diffused highlights, no harsh shadows",
  "camera": { "angle": "high", "lens-mm": 85, "f-number": "f/5.6" }
}

BFL 가이드에서 가장 값어치 있는 습관은 긍정형으로 다시 쓰는 것입니다. "헤드라이트를 인물에 비추지 말 것" 대신 "헤드라이트는 도로 앞쪽을 향해 젖은 아스팔트를 비추고, 인물은 부드러운 실루엣으로 남는다"라고 쓰세요. FLUX뿐 아니라 모든 모델에서 통합니다.

이번 주에 할 일

FLUX 3를 기다리며 프로젝트 시작을 미루고 있었다면, 솔직한 조언은 기다리지 말라는 것입니다. 이미지 모델에는 날짜가 없고, 영상 모델은 가격도 공개되지 않은 채 신청 절차 뒤에 있습니다.

FLUX 3로 하려던 일오늘 이렇게 하세요
사실적인 정지 이미지와 제품 컷OmniArt 이미지 모델 선택기의 GPT Image 2 또는 Seedream 5.0 Pro
다중 참조 이미지 기반 캐릭터 일관성참조 이미지를 최대 10장까지 받는 Seedream 5.0 Pro
텍스트가 많은 레이아웃과 포스터GPT Image 2 — 이미지 내 텍스트에서 현재 선두
소리가 동기화된 긴 클립Seedance 2.0 또는 Gemini Omni Flash, 둘 다 지금 사용 가능
이미 마음에 드는 정지 이미지를 움직이게 만들기OmniArt의 모든 이미지-영상 변환 모델

마지막 줄이야말로 대부분이 과소평가하는 선택지입니다. BFL이 가져가려는 흐름, 즉 정지 이미지를 만들고 그것을 움직이게 하는 과정은 이미 하나의 작업 공간 안에서 처음부터 끝까지 작동합니다. 이미지-영상 변환 모델 가이드에서는 어떤 움직임에 어떤 모델이 맞는지 다루고, Seedance 프롬프트 가이드에서는 장면을 나열하는 대신 숏을 연출하는 방법을 다룹니다.

묘사한 프롬프트

연출한 프롬프트

같은 콘셉트, 두 개의 프롬프트. 분위기와 카메라의 의도, 그리고 이 장면이 무엇에 관한 것인지까지 담아 숏을 연출하는 편이 화면 속 요소를 나열하는 것보다 낫습니다. 이 능력은 결국 어떤 모델이 살아남든 그대로 통합니다.

다음에 지켜볼 것

FLUX 3를 다시 들여다볼 가치가 있는지는 세 가지 신호로 판단할 수 있습니다.

  1. 사양이 함께 공개되는 FLUX 3 Image 얼리 액세스. 참조 이미지 개수, 네이티브 해상도, 가격이 경쟁력을 가르는 숫자입니다.
  2. FLUX 3 Video에 대한 독립 벤치마크. 학습 중간 단계에서 측정한 공급사 자체 선호도 테스트는 출발점이지 결론이 아닙니다. Seedance와 Gemini omni 계열을 상대로 한 아레나 순위가 진짜 시험대입니다.
  3. 오픈 웨이트 라이선스. FLUX.2 [dev]는 비상업용이었고, 그 결정 하나로 BFL은 오픈소스 진영에서의 입지를 상당 부분 잃었습니다. FLUX 3 Dev가 같은 길을 반복하는지가 로컬 생태계의 복귀 여부를 결정합니다.

OmniArt에서 시작하기

FLUX 3 출시 상황을 두고 어느 편에 설지 정하지 않아도 이번 주에 무언가를 만들 수 있습니다. OmniArt는 이미지, 영상, 오디오, 음악 생성을 하나의 작업 공간에 모아두고 GPT Image 2, Nano Banana, Seedream, Seedance, Kling, Veo, Grok Imagine, Gemini Omni Flash 같은 현행 주력 모델을 단일 선택기와 단일 크레딧 잔액으로 제공합니다.

이것이 제한적으로 열린 출시에 대한 현실적인 답입니다. 공급사의 그래프가 아니라 자신의 기획을 기준으로 모델을 평가하고, 정말 더 나은 것이 나오면 그때 갈아타면 됩니다. FLUX 3 Image를 실제로 시험해볼 수 있게 되면 같은 기획으로 돌려보고 비교 결과를 공개하겠습니다. 그때까지는 하나의 작업 공간에 모인 모든 영상 모델에서 오늘 쓸 수 있는 것들을 확인해 보세요.

제작할 준비가 되셨나요?

AI로 멋진 콘텐츠를 생성하세요

무료로 시작하기