FLUX 3 explicado: qué se lanzó de verdad y qué no
FLUX 3 llegó el 23 de julio de 2026 con video de 20 segundos y audio nativo, pero sin modelo de imagen. Qué se lanzó, qué dicen de verdad los benchmarks y qué usar hoy.

Black Forest Labs anunció FLUX 3 el 23 de julio de 2026 y lo llamó un modelo multimodal de frontera para la inteligencia visual. Dos días después, el titular que importa para la mayoría de quienes crean no es qué hace FLUX 3, sino qué puedes correr realmente. FLUX 3 Video está detrás de un formulario de solicitud. FLUX 3 Action está detrás de un acuerdo de socios. Y FLUX 3 Image, la parte sobre la que se construyó el nombre FLUX, no se ha lanzado en absoluto.
Esa brecha es la noticia. La empresa que volvió una opción seria a la generación de imágenes con pesos abiertos lanzó un buque insignia donde la mitad de imagen es la pieza faltante, y apuntó el resto del anuncio a video, audio y robótica. Es un giro real, y dice algo sobre dónde está la presión en este mercado.
Este artículo separa el anuncio del producto: qué existe hoy, qué prueban y qué no prueban las cifras de benchmark de BFL, cuál es en realidad la afirmación sobre la arquitectura y a qué recurrir mientras FLUX 3 Image siga detrás de la lista de espera.
Qué anunció realmente Black Forest Labs
FLUX 3 se presenta como una sola familia de modelos entrenada de forma conjunta en imagen, video, audio y acción, en lugar de cuatro sistemas separados. El anuncio cubre FLUX 3 Video, FLUX 3 Image, FLUX 3 Action (con una variante de robótica llamada FLUX-mimic) y un futuro FLUX 3 Dev con pesos abiertos.
La disponibilidad es una tabla completamente distinta.

Advertencia
No hay precios públicos de FLUX 3, ni conteo de parámetros publicado, ni informe técnico de la familia de modelos, ni términos de licencia para el lanzamiento prometido de pesos abiertos. Cualquier ficha técnica que encuentres citando la resolución de FLUX 3 Image, sus límites de imágenes de referencia o su costo por imagen es una extrapolación, no documentación.
El modelo de imagen es la pieza faltante
La redacción de la propia BFL es que FLUX 3 Image tendrá “una fase de acceso anticipado en las próximas semanas”. Ese es todo el compromiso público. Sin fecha, sin especificaciones, sin benchmark.
Esto importa más que un despliegue escalonado normal, porque la generación de imágenes es lo que significa la marca FLUX. FLUX.1 y su línea de edición Kontext se volvieron un estándar en los flujos de pesos abiertos. Anunciar una generación insignia sin ese componente disponible —mientras la competencia lanza modelos de imagen cada semana— deja a quienes crean con afirmaciones que no pueden probar.
La consecuencia práctica: hoy no puedes evaluar FLUX 3 para trabajo de imagen, y nadie más puede. Las afirmaciones que circulan sobre su renderizado de texto, su consistencia de personaje o su adherencia al prompt no tienen ninguna evaluación independiente detrás. Trátalas como marketing hasta que el modelo se pueda probar.
FLUX 3 Video: 20 segundos con audio nativo
El componente que sí se lanzó —a quienes fueron aprobados para el acceso anticipado— es el genuinamente interesante. FLUX 3 Video genera clips de hasta 20 segundos con audio sincronizado de forma nativa, en lugar de generar video mudo y musicalizarlo después. También cubre imagen a video, fotograma clave a video y encadenado multi-shot.
Veinte segundos con sonido nativo es una duración significativa. La mayoría de los modelos de video insignia siguen afinados alrededor de clips de 5 a 10 segundos, y unir esos clips en algo coherente es donde se va mucho tiempo de producción. Si FLUX 3 sostiene la continuidad de personaje y de audio a lo largo de 20 segundos, eso sí cambia el flujo de trabajo.
También te dice cuál cree BFL que es el mercado en crecimiento. Una casa de imagen fija que construye imagen a video y encadenado de planos es una empresa que quiere quedarse con todo el proceso, no solo con el primer fotograma.
Cómo leer con honestidad la tabla de benchmarks de BFL
BFL publicó tasas de preferencia de FLUX 3 Video frente a ocho competidores. Antes de leerlas, fíjate en los cuatro matices que la propia BFL les pone: las cifras son autorreportadas, preliminares, medidas durante el entrenamiento intermedio, sobre clips de 10 segundos en 720p. No hay verificación independiente.

Dos cosas resaltan.
Las victorias son contra los modelos más lejanos de la frontera. La cifra de 93 % es frente a Luma Ray 3.2 y la de 77 % frente a Runway Gen-4.5. Esos son los márgenes más amplios del gráfico, y también las dos comparaciones donde la vara está más baja.
Contra la frontera actual, es un empate. FLUX 3 fue preferido en el 52 % de las comparaciones contra Seedance 2.0 y en el 52 % contra Gemini Omni Flash. En una prueba de preferencia, 52 % es lanzar una moneda. Hay que reconocerle a BFL que lo publicara con honestidad en vez de borrar las filas en silencio, pero un volado contra modelos con los que ya puedes generar hoy no es motivo para esperar una lista de espera.
Cinco de los ocho modelos de ese gráfico están ahora mismo en el selector de video de OmniArt: Grok Imagine, Kling, Happy Horse, Seedance 2.0 y Gemini Omni Flash. Puedes correr esta misma tarde el brief con el que BFL hizo su benchmark y juzgar tú mismo la referencia.
Nota
Los clips de abajo son salida de Seedance generada en OmniArt, el modelo contra el que FLUX 3 marcó 52 %. Están aquí para mostrar la referencia actual que sí puedes producir hoy, no para representar la salida de FLUX 3. No existen muestras públicas de FLUX 3 que podamos verificar de forma independiente.
Self-Flow: la afirmación de arquitectura que vale la pena seguir
La idea técnica detrás de FLUX 3 se llama Self-Flow: flow matching autosupervisado con condicionamiento de paso temporal por token, publicada como investigación junto con el lanzamiento. La afirmación es una convergencia más rápida que los enfoques previos de alineación de representaciones, y una sola arquitectura subyacente en la que el entrenamiento de imagen, video, audio y acción se restringe mutuamente.
Si eso se sostiene, la consecuencia interesante no es un mejor modelo de imagen. Es que las mejoras en una modalidad deberían levantar a las demás, porque comparten la representación en lugar de vivir en torres separadas. Es la misma apuesta que hizo Google con la línea omni de Gemini, llegando desde la dirección opuesta: Google venía del lenguaje, BFL viene de los píxeles.
Es una apuesta que vale la pena seguir. Todavía no es un resultado que puedas usar.
El baño de realidad de FLUX.2
Como FLUX 3 Image no existe públicamente, el modelo de imagen FLUX más nuevo que se puede usar sigue siendo FLUX.2, que salió en noviembre de 2025 y se extendió con un nivel max en diciembre y una línea compacta klein en enero de 2026.
| Variante | Disponibilidad | Precio de lista | Notas |
|---|---|---|---|
| FLUX.2 [max] | API | USD 0.07 / MP | Nivel más alto; agrega generación fundamentada con búsqueda web en vivo |
| FLUX.2 [pro] | API | USD 0.03 / MP | La opción por defecto eficiente en costo para generar y editar |
| FLUX.2 [flex] | API | USD 0.06 / MP | Expone pasos y guía; afinado para tipografía |
| FLUX.2 [dev] 32B | Pesos abiertos | Autoalojado | Licencia no comercial; el uso comercial es un nivel de pago |
| FLUX.2 [klein] 4B | Pesos abiertos | Autoalojado | Apache 2.0, la única variante con licencia permisiva |
En qué sigue ganando FLUX.2
- Consistencia con varias referencias. Ocho imágenes de referencia por la API, diez en el playground. Fija una cara, un producto, un esquema de iluminación y genera una serie coherente. Sigue siendo su ventaja estructural más clara.
- Color exacto de marca. Los valores hexadecimales atados a un objeto nombrado son una función documentada y de primera clase. Ata el valor a la cosa —"the car is #FF0000"— en lugar de dejarlo flotando en el prompt.
- Fotorrealismo de materiales. Dispersión subsuperficial en la piel, comportamiento especular en vidrio y metal, cómo la tela absorbe frente a cómo refleja.
- Generación fundamentada en [max]. Búsqueda web en vivo durante la generación, para productos actuales y eventos recientes. Nada más en su nivel hace esto.
En qué se quedó atrás
El panorama de preferencia ciega es menos halagador. En la arena de texto a imagen de Artificial Analysis, FLUX.2 [max] está hoy alrededor del puesto 16, detrás de GPT Image 2, la familia Nano Banana 2 y Seedream 5.0 Pro. FLUX.2 [dev] —el insignia abierto de 32B— queda por debajo de Qwen Image 2.0 Pro, un modelo de 7B con licencia Apache 2.0.
Otras fricciones que conviene conocer antes de comprometer un proceso con él:
- Sin prompts negativos. Reescribe todo en positivo. "Sharp focus throughout" en lugar de "no blur".
- Límites de licencia. Los pesos de [dev] de 32B son no comerciales. Solo la variante klein de 4B es Apache 2.0.
- Costo de hardware. El [dev] en precisión completa más su codificador de texto Mistral de 24B queda muy por encima de la VRAM de consumo; la comunidad corre compilaciones cuantizadas con pérdida de calidad.
- Quejas de anatomía. Las manos y la interacción entre varias personas son modos de falla recurrentes en los hilos de la comunidad, sobre todo en las variantes klein destiladas con su conteo bajo de pasos por defecto.
Patrones de prompt que se trasladan
La guía de prompts que BFL publicó para FLUX.2 es buen consejo de oficio y se traslada a la mayoría de los modelos de imagen modernos, incluidos los de OmniArt.
Estructura como Subject + Action + Style + Context. El orden de las palabras pesa; empieza por lo que más importa. De treinta a ochenta palabras es el punto dulce documentado.
Cita el texto literal. The text 'OPEN' appears in red neon letters, y después especifica la ubicación, el grosor y el color.
Describe las tipografías, no las nombres. "Bold geometric sans-serif with slightly extended kerning" aterriza mucho más confiablemente que nombrar una fuente.
Asigna un rol a cada imagen de referencia. Di qué entrada aporta el sujeto, cuál aporta el estilo y cuál aporta el fondo.
Usa JSON cuando necesites versionar un brief. Congela la estructura, cambia exactamente una clave por variante y obtienes una comparación controlada en lugar de una tirada al azar:
{
"scene": "Studio product photography on polished concrete",
"subjects": [{ "description": "Matte black ceramic mug, steam rising", "position": "center foreground" }],
"style": "Ultra-realistic commercial product photography",
"color_palette": ["matte black", "concrete gray", "soft white highlights"],
"lighting": "Three-point softbox, soft diffused highlights, no harsh shadows",
"camera": { "angle": "high", "lens-mm": 85, "f-number": "f/5.6" }
}
Consejo
El hábito de más valor de toda la guía de BFL es reescribir en positivo. En lugar de "headlights not on the subject", escribe "headlights pointing down the road, illuminating the wet asphalt ahead, leaving the figure in soft silhouette." Funciona en todos los modelos, no solo en FLUX.
Qué hacer esta semana
Si estabas esperando a FLUX 3 para empezar un proyecto, el consejo honesto es que no esperes. El modelo de imagen no tiene fecha, y el de video está restringido detrás de una solicitud sin precios publicados.
| Si querías FLUX 3 para… | Haz esto hoy |
|---|---|
| Fotos fijas fotorrealistas y trabajo de producto | GPT Image 2 o Seedream 5.0 Pro en el selector de imagen de OmniArt |
| Consistencia de personaje con varias referencias | Seedream 5.0 Pro, que acepta hasta 10 imágenes de referencia |
| Composiciones y carteles con mucho texto | GPT Image 2, el líder actual en texto dentro de la imagen |
| Clips largos con sonido sincronizado | Seedance 2.0 o Gemini Omni Flash, ambos disponibles ya |
| Una imagen que ya te gusta, convertida en movimiento | Cualquier modelo de imagen a video en OmniArt |
La última fila es la que más se subestima. El proceso que BFL quiere controlar —generar una imagen fija y después animarla— ya funciona de punta a punta en un solo espacio. Nuestra guía de modelos de imagen a video cubre qué modelo elegir para cada tipo de movimiento, y la guía de prompts de Seedance cubre cómo dirigir un plano en lugar de solo describirlo.
Descrito
Dirigido
Qué observar a continuación
Tres señales te van a decir si vale la pena volver a mirar FLUX 3.
- La apertura del acceso anticipado de FLUX 3 Image, con especificaciones. El número de imágenes de referencia, la resolución nativa y el precio son las cifras que determinan si compite.
- Benchmarks independientes de FLUX 3 Video. Las pruebas de preferencia del proveedor medidas durante el entrenamiento intermedio son un punto de partida, no un resultado. La posición en Arena frente a Seedance y la línea omni de Gemini es la prueba real.
- La licencia de pesos abiertos. FLUX.2 [dev] fue no comercial, y esa sola decisión le costó a BFL buena parte de su posición en el mundo abierto. Que FLUX 3 Dev lo repita o no va a decidir si el ecosistema local regresa.
Cómo empezar en OmniArt
No necesitas tomar partido en el despliegue de FLUX 3 para hacer algo esta semana. OmniArt mantiene la generación de imagen, video, audio y música en un solo espacio, con los modelos insignia actuales —GPT Image 2, Nano Banana, Seedream, Seedance, Kling, Veo, Grok Imagine y Gemini Omni Flash— detrás de un solo selector y un solo saldo de créditos.
Esa es la respuesta práctica a un lanzamiento restringido: evalúas los modelos contra tu propio brief en lugar del gráfico de un proveedor, y cambias cuando sale algo genuinamente mejor. Cuando FLUX 3 Image se pueda probar, lo vamos a correr contra los mismos briefs y publicar la comparación. Mientras tanto, mira todos los modelos de video en un solo espacio para saber qué hay disponible hoy.
¿Todo listo para crear?
Empieza a generar contenido increíble con IA