FLUX.2: análisis del generador de imágenes IA para diseñadores (2026)

Descubre qué ofrece FLUX.2 como generador de imágenes IA: variantes, precios, licencias, control creativo y límites reales para diseñadores en 2026.

Friday, September 4, 2026Omid Saffari
FLUX.2: análisis del generador de imágenes IA para diseñadores (2026)

FLUX.2 es el generador de imágenes IA al que se recurre cuando hace falta controlar el resultado, no dejarse sorprender por él: colores de marca fijados mediante códigos hexadecimales, el mismo personaje a lo largo de 10 escenas, texto que casi siempre se conserva y pesos que pueden ejecutarse en una GPU propia. No ofrece por sí solo la atmósfera de Midjourney; ofrece un caballo de batalla.

Veredicto: un generador de imágenes IA controlable, no un oráculo estético

Si el trabajo exige imágenes de producción repetibles y coherentes con la marca, FLUX.2 es la alternativa con pesos abiertos más sólida disponible hoy. Black Forest Labs, el equipo de Friburgo detrás de Stable Diffusion, lanzó la familia el 25 de noviembre de 2025 y añadió los modelos pequeños [klein] el 15 de enero de 2026. Lo que lo convierte en una herramienta de diseño, y no en un juguete, es su nivel de control: permite fijar colores de marca exactos con códigos hexadecimales, mantener un personaje o producto consistente entre varias generaciones mediante hasta 10 imágenes de referencia y ajustar el modelo al estilo visual propio con entrenamiento LoRA. Un LoRA es un pequeño archivo adicional que enseña una apariencia concreta al modelo base sin tener que volver a entrenarlo por completo.

Lo que no es: un oráculo estético. Midjourney sigue produciendo desde el primer intento una imagen más acabada y con mayor intención de diseño, mientras que Nano Banana de Google edita fotografías con más limpieza. FLUX.2 cambia esa capacidad de sorprender por previsibilidad, y para el trabajo de diseño suele ser un mejor trato: una imagen algo más sobria que puede reproducirse con exactitud vale más que una espectacular imposible de recuperar.

La recomendación rápida: [klein] 4B para generar gratis con fines comerciales en hardware propio, [pro] para producción alojada, [flex] cuando la imagen sea principalmente texto y [max] solo para piezas principales en las que la calidad pese más que el costo.

Playground de FLUX.2 de Black Forest Labs
El Playground de FLUX.2, donde se puede probar cada variante antes de integrar la API

Qué es realmente FLUX.2

La gran mejora de FLUX.2 es un cambio de cerebro. Mientras la mayoría de los modelos de imagen usan un codificador de texto pequeño y limitado para interpretar el prompt, FLUX.2 lo lee con Mistral Small 3.1, un modelo de visión y lenguaje de 24 mil millones de parámetros, y luego transmite esa comprensión a un transformer de flujo rectificado. (Un transformer de flujo es el motor que convierte ruido en una imagen; que sea «rectificado» solo significa que sigue una ruta más directa y rápida para lograrlo). El modelo [dev] completo ronda los 32 mil millones de parámetros y se distribuye como un único checkpoint capaz tanto de generar imágenes nuevas como de editar las existentes, sin necesidad de una herramienta aparte.

La ventaja práctica de ese cerebro lingüístico más grande es que sí comprende un prompt denso. Al pedir «un vaso de agua sobre una mesa de madera con luz de la tarde», acierta con mayor frecuencia en la refracción, la sombra cálida y direccional y la veta de la madera, porque el modelo Mistral aporta conocimiento del mundo real en lugar de limitarse a inferir a partir de estadísticas. También acepta prompts estructurados en campos con etiquetas —sujeto, entorno, iluminación, paleta de color y estilo—, un formato más cercano a un brief creativo que a una oración.

Hay dos cifras importantes para producción. La salida nativa alcanza 4 megapíxeles, suficiente para web y la mayoría de las redes sociales sin reescalado, y cada generación puede condicionarse con hasta 10 imágenes de referencia a la vez. Ese es el mecanismo que mantiene consistentes a personajes y productos.

Las cinco variantes de un vistazo

Aquí es donde se equivocan las páginas que se limitan a volcar especificaciones: las cinco variantes no forman una escalera de calidad, sino que resuelven trabajos distintos. Los precios son las tarifas oficiales por megapíxel de la API de Black Forest Labs; un megapíxel (MP) equivale aproximadamente a una imagen de 1000x1000, así que una generación estándar de 1 MP cuesta cerca del precio indicado.

VarianteIdeal paraPrecio de APILicenciaSu principal ventaja
[klein] 4BProducción en una GPU propiadesde $0.014/MPApache 2.0Uso comercial gratuito
[klein] 9BEjecución local con más calidaddesde $0.015/MPNo comercialCalidad en un equipo compacto
[pro]Producción alojadadesde $0.03/MPPropietariaRelación precio-calidad
[flex]Tipografía, UI e infografíasdesde $0.05/MPPropietariaControl del muestreo
[max]Piezas principales e impresióndesde $0.07/MPPropietariaMáxima calidad + conexión con la web
[dev]Investigación local y ajuste finogratis (hardware propio)No comercialPesos abiertos de 32B

[klein] 4B es la variante por la que debería comenzar la mayoría de los diseñadores. Es la única con licencia Apache 2.0, lo que permite ejecutarla en una máquina propia y vender el resultado sin condiciones adicionales. Reduce el gran modelo de 32B a 4 mil millones de parámetros, funciona en una GPU de consumo con unos 8GB de VRAM (una RTX 3090 o 4070) y renderiza en menos de medio segundo. En la API de BFL parte de $0.014/MP; en fal también se puede alquilar una versión «Base» sin destilar por $0.009/MP, que sacrifica velocidad a cambio de poder ajustar la calidad y entrenar LoRAs.

[pro] es la opción predeterminada para producción. Con un precio de $0.03/MP por generación, se sitúa en lo más alto de la clasificación de imágenes de LM Arena, con cerca de 1265 ELO en la actualización v1.1, a la par de GPT Image. Admite hasta 8 imágenes de referencia mediante la API y tarda entre cuatro y ocho segundos en renderizar. Para generar variantes publicitarias o fotografías de producto mediante un flujo alojado, esta es la variante que conviene presupuestar.

Modelos FLUX.2 alojados en fal
fal aloja todas las variantes de FLUX.2, incluida la versión klein Base sin destilar y más económica

[flex] existe para trabajar con texto. La mayoría de los modelos de imagen todavía deforman las letras, y [flex] es la respuesta de Black Forest Labs: da acceso a los pasos de muestreo y a la escala de guía para exigir más legibilidad al modelo, y está optimizado para tipografía en varios niveles, infografías con números reales, mockups de UI y composiciones con mucho texto. Por $0.05/MP, es la opción indicada cuando la imagen es un cartel, un gráfico o una pantalla, no una escena. También acepta pesos LoRA, de modo que una marca puede incorporar su propio sistema tipográfico.

[max] es la variante para impresión y piezas principales. Utiliza la misma arquitectura de 32B a máxima calidad y sin atajos, desde $0.07/MP, con una función que las demás no tienen: conexión con la web en tiempo real. Puede buscar en internet durante la generación para reproducir correctamente el empaque de un producto recién lanzado o un acontecimiento actual, en vez de inventarlo a partir de datos de entrenamiento congelados. Conviene reservarla para esa única imagen que se verá en grande.

[dev] es el laboratorio abierto. Sus pesos de 32 mil millones de parámetros pueden descargarse gratis desde Hugging Face bajo una licencia no comercial; en el momento del lanzamiento era el modelo de imagen con pesos abiertos más capaz por número de parámetros. BFL no ofrece un endpoint alojado: hay que ejecutarlo en infraestructura propia. A precisión completa necesita 80GB de memoria de GPU, pero una versión cuantizada a 4 bits cabe en unos 20GB en una RTX 4090. La cuantización reduce el modelo al almacenar sus números con menor precisión, a cambio de un poco de calidad y de un tamaño mucho menor. Esta es la variante para quienes ajustan modelos y para investigadores, no para quien solo quiere una imagen.

En qué falla ante un encargo real

Estos son los inconvenientes sin rodeos, porque todas las variantes los tienen. En lo estético, cumple, pero no cautiva. Al procesar el mismo brief con Midjourney y FLUX.2, la imagen de Midjourney suele sentirse mejor dirigida: mejor luz, una atmósfera más marcada y la sensación de que alguien cuidó la composición. FLUX.2 entrega un resultado correcto y controlable que a menudo necesita una segunda pasada para parecer intencional. En una exploración divergente de moodboards, esa diferencia importa.

Fuera de [flex], el texto todavía falla. Las variantes base representan razonablemente bien textos breves y limpios, pero al pedirles un párrafo, una composición de logotipo o letras en perspectiva, el resultado será texto sin sentido con aspecto verosímil. [flex] reduce el problema, pero no lo elimina. El texto generado debe tratarse como un marcador provisional que luego habrá que reconstruir en Figma o Illustrator, no como arte final.

Premia los prompts detallados y castiga la pereza. El cerebro Mistral está diseñado para instrucciones extensas y estructuradas. Un prompt de tres palabras produce un resultado genérico; el modelo mejora de verdad cuando el sujeto, la iluminación, la paleta y la composición se especifican en campos separados. Exige más trabajo que limitarse a describir una atmósfera en Midjourney.

[dev] exige una inversión en hardware. «Pesos abiertos» suena a gratis hasta que se calcula el precio de la GPU. En una 4090 con cuantización de 4 bits, el tiempo ronda los 15 segundos por megapíxel; si se fuerza a correr en una tarjeta de 8GB mediante offloading, una sola imagen puede tardar un minuto o más. Para la mayoría de los equipos, los endpoints alojados de klein o pro cuestan menos que la electricidad y la espera.

Lo bueno
Lo que hace bien
10 points

  • Control mediante colores hexadecimales y múltiples referencias que la mayoría de sus rivales no ofrece
  • klein 4B permite un uso comercial realmente gratuito
  • Un solo modelo para generar y editar
  • Ajuste fino con LoRA para fijar el estilo de una marca
  • Comprensión de prompts de primer nivel gracias al cerebro lingüístico Mistral
  • Menor dirección artística que Midjourney desde el primer resultado
  • Representación de texto todavía poco fiable fuera de [flex]
  • Necesita prompts extensos y estructurados para destacar
  • [dev] requiere una GPU potente
  • Cinco variantes y tres licencias forman una oferta confusa

Qué variante conviene para cada tipo de trabajo

La elección correcta depende menos del presupuesto que del entorno donde se realiza el trabajo y de quién debe controlarlo.

SituaciónElecciónMotivo
Fundador o creador independiente[klein] 4B (local o alojado)Uso comercial gratuito, funciona en una GPU para videojuegos y tiene velocidad suficiente para iterar
Marca de comercio electrónico[pro] mediante API alojadaFotografías de producto y variantes a escala, consistencia, $0.03/MP
Agencia / estudio[flex] + [max][flex] para tipografía y UI, [max] para la única pieza principal
Equipo interno de producto[dev] con ajuste finoEntrenar un LoRA con la marca, desplegar en privado, sin costo por llamada

La regla para decidir: si el resultado se va a vender y debe generarse en infraestructura propia, hay que empezar con [klein] 4B por su licencia Apache 2.0 y subir de variante solo cuando lo exija una tarea concreta —tipografía, calidad de imagen principal o precisión con datos actuales de la web—. No conviene elegir [max] por defecto solo porque sea la mejor: cuesta cinco veces la tarifa de klein por una calidad que la mayoría de los trabajos de producción no necesita.

Para entender la posición de FLUX.2 frente a las alternativas cerradas, la comparación más útil es con el editor de Google: qué es Nano Banana muestra en qué casos un modelo centrado en fotografía lo supera con ediciones limpias.

¿FLUX.2 es gratis?

En parte. [dev] y [klein] se distribuyen como pesos abiertos que pueden descargarse y ejecutarse gratis, y la licencia Apache 2.0 de [klein] 4B incluso permite vender lo que se genere. Las variantes alojadas ([pro], [flex], [max]) se pagan por megapíxel mediante la API de Black Forest Labs, desde $0.03 hasta $0.07/MP.

¿FLUX.2 es de código abierto?

Los pesos de [dev] y [klein] son abiertos; el código y los pesos de [pro]/[max] no lo son. Solo [klein] 4B utiliza una licencia realmente permisiva (Apache 2.0). [dev] y [klein] 9B tienen una licencia no comercial que restringe los pesos, pero permite usar comercialmente el resultado.

¿Cuánto cuesta FLUX.2?

En la API de BFL, los precios parten de $0.014/MP para [klein] y llegan a $0.07/MP para [max], con [pro] a $0.03/MP como punto óptimo para producción. Al ejecutar [dev] o [klein] en una GPU propia, la generación es gratis salvo por el hardware y la electricidad.

¿Para qué sirve FLUX.2?

Para producir imágenes controlables y coherentes con una marca: variantes publicitarias, fotografía de producto, mockups de UI y cualquier trabajo que necesite colores fijos o repetir un personaje o producto en muchas escenas. Es menos eficaz en la exploración atmosférica y dirigida artísticamente, donde Midjourney conserva la ventaja.

¿Quiere recibir el análisis del próximo modelo la misma semana de su lanzamiento, con los precios reales y un criterio de calidad profesional, sin publicidad exagerada? Suscríbase al boletín y reciba cada edición en su correo.

Última actualización

4 sept 2026

CategoríaDesign

Prefiera este sitio en Google

Añadir omidsaffari.com como fuente preferida en la Búsqueda de Google

Marque omidsaffari.com como fuente preferida y Google lo destacará para usted en Top Stories, AI Overviews y AI Mode.

Newsletter

Una carta, cada domingo. Sistemas que funcionan, no opiniones calientes.

Build logs, sistemas en producción y notas de campo de un portafolio de ventures de IA.

Semanal. Sin spam. Cancele cuando quiera.