Qué GPU necesitas para ejecutar Flux 2: requisitos de VRAM explicados

Ejecutar Flux 2 en local exige un hardware de GPU concreto, y la VRAM es el mayor cuello de botella. Este artículo desglosa los requisitos exactos de VRAM de cada versión de Flux 2, compara GPU de consumo y profesionales en distintos niveles, explica qué efecto tiene la cuantización en la calidad y muestra cómo sacar el mejor partido al hardware que ya tienes.

Qué GPU necesitas para ejecutar Flux 2: requisitos de VRAM explicados
Cristian Da Conceicao
Fundador de Picasso IA

Ejecutar Flux 2 en local no depende solo de tener una CPU rápida o suficiente RAM. El factor que más decide si tu experiencia sale bien o mal es la VRAM, y si tu GPU no alcanza el umbral, o los tiempos de generación serán muy lentos o directamente obtendrás errores.

Fotografía macro de primer plano de una GPU RTX 4090 con los chips de VRAM visibles

Black Forest Labs diseñó Flux 2 como una familia de modelos, que va desde variantes compactas de 4.000 millones de parámetros hasta potentes versiones completas de 9.000 millones. Esa gama se traduce en requisitos de hardware muy distintos. Tanto si ejecutas flux-2-dev en una tarjeta de gama media como si llevas flux-2-max al límite en una RTX 4090, conocer tus cifras de VRAM antes de empezar te ahorra horas de frustración.

Requisitos de VRAM de Flux 2 de un vistazo

La respuesta corta: necesitas al menos 8 GB de VRAM para ejecutar las variantes más pequeñas de Flux 2, y 16 GB o más para ejecutar los modelos completos a velocidades razonables sin optimizaciones de memoria agresivas.

Esta es la tabla de referencia rápida:

Variante del modeloParámetrosVRAM mínimaVRAM recomendada
flux-2-klein-4b4B8 GB12 GB
flux-2-dev9B12 GB16 GB
flux-2-flex9B12 GB16 GB
flux-2-pro9B16 GB24 GB
flux-2-max9B16 GB24 GB+
flux-2-klein-9b-base9B12 GB20 GB

💡 Consejo: "VRAM mínima" significa que el modelo se carga y genera, pero lentamente. "VRAM recomendada" significa una velocidad de inferencia cómoda y real, sin grandes concesiones.

La diferencia entre los modelos de 4B y 9B

El flux-2-klein-4b está diseñado específicamente como variante ligera. Con 4.000 millones de parámetros, cabe en 8 GB de VRAM con precisión float16 estándar. Es la opción adecuada si tienes una RTX 3070, una RTX 3060 Ti o una AMD RX 6700 XT.

Las variantes de 9B, entre ellas flux-2-dev, flux-2-pro y flux-2-max, tienen aproximadamente el doble de parámetros. En float16, un modelo de 9B ocupa unos 18 GB de VRAM antes de cualquier sobrecarga de inferencia. Por eso una tarjeta de 16 GB como la RTX 4080 se queda justa para un uso cómodo, y una RTX 4090 de 24 GB se convierte en la recomendación habitual para un uso local serio.

VRAM mínima y recomendada

Así funcionan las cuentas de los requisitos de VRAM para los grandes modelos de difusión:

  • Precisión float16: 2 bytes por parámetro, así que 9B de parámetros = ~18 GB de memoria base para los pesos
  • Precisión BF16: mismo tamaño que float16, pero con mejor estabilidad numérica
  • Cuantización de 8 bits: ~9 GB para un modelo de 9B (un ahorro importante)
  • Cuantización de 4 bits: ~5 GB para un modelo de 9B (compresión fuerte, con cierta pérdida de calidad)
  • Sobrecarga de inferencia: añade entre 2 y 4 GB sobre los pesos del modelo para las activaciones y la caché KV

Esto significa que, incluso con cuantización de 8 bits, un modelo de 9B de Flux 2 necesita entre 11 y 13 GB en total, lo que deja a las tarjetas de 12 GB justo en el límite.

Varias tarjetas GPU tendidas sobre una superficie de mármol que muestran distintos tamaños y diseños de disipador

Las mejores GPU por nivel de VRAM

Tarjetas de 8 GB: posibles, pero incómodas

Con 8 GB de VRAM, estás limitado al flux-2-klein-4b o a versiones muy cuantizadas de modelos más grandes.

Tarjetas en este rango:

  • NVIDIA RTX 3070 (8 GB GDDR6)
  • NVIDIA RTX 3060 Ti (8 GB GDDR6)
  • NVIDIA RTX 4060 (8 GB GDDR6)
  • AMD RX 6700 XT (12 GB, una ventaja aquí)

💡 Nota: La RX 6700 XT tiene técnicamente 12 GB, lo que la hace más capaz que las tarjetas de 8 GB de NVIDIA en el mismo rango de precio.

Con 8 GB, espera:

  • De 30 a 90 segundos por imagen de 1024x1024 con flux-2-klein-4b
  • Posibles errores de falta de memoria si no tienes activada la descarga secuencial
  • Ningún camino práctico para ejecutar modelos de 9B sin cuantización de 4 bits

Tarjetas de 12 GB: el punto de entrada real

Aquí es donde Flux 2 se vuelve realmente útil para la generación de imágenes con IA en el día a día.

Tarjetas en este rango:

  • NVIDIA RTX 3080 12 GB
  • NVIDIA RTX 4070 (12 GB GDDR6X)
  • NVIDIA RTX 3060 (12 GB GDDR6)
  • AMD RX 7700 XT (12 GB GDDR6)

Con 12 GB de VRAM, puedes ejecutar flux-2-dev con cuantización de 8 bits sin problemas, y flux-2-flex a velocidades razonables. Espera tiempos de generación de 15 a 40 segundos por imagen de 1024x1024 con los ajustes adecuados.

GPUVRAMFlux 2 Dev (8 bits)Flux 2 Klein 4B
RTX 407012 GB~25 s/imagen~10 s/imagen
RTX 3080 12 GB12 GB~35 s/imagen~14 s/imagen
RTX 306012 GB~55 s/imagen~22 s/imagen

16 GB o más: donde todo mejora

Interior de una caja de PC con dos GPU instaladas en montaje vertical, con iluminación LED visible

Con 16 GB o más, la experiencia de Flux 2 cambia por completo. Puedes ejecutar inferencia float16 completa en modelos de 9B sin cuantización, lo que significa la máxima calidad de salida.

Tarjetas en este rango:

  • NVIDIA RTX 4080 (16 GB GDDR6X)
  • NVIDIA RTX 4080 Super (16 GB GDDR6X)
  • AMD RX 7900 GRE (16 GB GDDR6)
  • AMD RX 7900 XT (20 GB GDDR6)
  • NVIDIA RTX 4090 (24 GB GDDR6X)
  • NVIDIA RTX 6000 Ada (48 GB GDDR6)

La RTX 4080 de 16 GB se queda justo en el umbral para flux-2-pro en float16. Las velocidades de generación alcanzan entre 8 y 15 segundos por imagen, algo práctico para el trabajo iterativo. La RTX 4090, con sus 24 GB de GDDR6X, es el benchmark indiscutible en el ámbito de consumo: float16 completa en cualquier variante de Flux 2, incluida flux-2-max, a velocidades de 5 a 10 segundos por imagen de 1024x1024.

💡 Consejo avanzado: La memoria GDDR6X de la RTX 4090 ofrece un ancho de banda de ~1008 GB/s, lo que importa mucho en modelos de difusión basados en transformers como Flux 2. El ancho de banda de memoria, no solo la capacidad, afecta de forma notable a la velocidad de generación.

Flux 2 Dev frente a Pro frente a Max

Estas tres variantes representan un espectro entre calidad y velocidad, y cada una tiene exigencias de hardware muy distintas.

Qué variante necesita más VRAM

flux-2-dev es el modelo de desarrollo de pesos abiertos. Está optimizado para la inferencia en local, admite ajuste fino y LoRA, y es el que menos exige de hardware de los modelos de 9B. Con 12 GB y cuantización de 8 bits, es la opción adecuada para los aficionados con hardware de gama media.

flux-2-flex introduce un condicionamiento estructural para un mayor control sobre la composición de la imagen. Las necesidades de memoria son similares a las de Dev, pero la inferencia es algo más pesada por las vías de condicionamiento adicionales.

flux-2-pro y flux-2-max son modelos de gama alta accesibles por API. Max usa en concreto pipelines de inferencia de precisión completa diseñados para una calidad de resultado profesional. Ejecutarlos en local a calidad completa requiere entre 20 y 24 GB de VRAM.

Pantalla de equipo mostrando gráficas de benchmark de GPU y estadísticas de uso de VRAM

Velocidad frente a calidad: contrapartidas

Esto es lo que realmente obtienes en cada nivel de VRAM con los modelos de 9B de Flux 2:

PrecisiónUso de VRAMImpacto en la calidadVelocidad (RTX 4090)
Float16 (completa)~18 GBNinguno5-8 s/imagen
BF16~18 GBMínimo5-8 s/imagen
8 bits (NF8)~10 GBMuy bajo10-15 s/imagen
4 bits (NF4)~6 GBModerado18-25 s/imagen

La diferencia de calidad entre float16 y 8 bits rara vez se aprecia a simple vista en resoluciones estándar de 1024x1024. Se hace evidente en resoluciones muy altas o con detalles extremadamente finos en rostros y texturas. La cuantización de 4 bits sí introduce falta de nitidez en los detalles finos, pero da resultados viables en hardware limitado.

Cómo usar Flux 2 en PicassoIA

Como flux-2-dev, flux-2-pro, flux-2-max, flux-2-flex y flux-2-klein-4b están disponibles en PicassoIA, puedes generar imágenes con cualquier variante de Flux 2 sin preocuparte en absoluto por los requisitos de VRAM en local.

Creadora de contenido profesional sentada en su escritorio revisando imágenes generadas por IA en dos monitores

Paso a paso con Flux 2 Pro

  1. Abre flux-2-pro en PicassoIA
  2. Escribe tu prompt en el campo de texto. Sé específico: describe el sujeto, la iluminación, el entorno y el ambiente.
  3. Define la resolución que quieras. 1024x1024 funciona bien para retratos; 1792x1024 va bien para escenas de paisaje.
  4. Ajusta el guidance scale. Un valor de 3,5 a 4,0 da una adherencia al prompt equilibrada sin sobresaturar.
  5. Pulsa generar. La inferencia en la nube se ejecuta en hardware de nivel profesional, así que obtienes calidad float16 completa sea cual sea tu GPU local.

Cómo elegir tu variante de Flux 2

Usa este árbol de decisión para elegir el modelo adecuado:

💡 Consejo: Si comparas resultados entre variantes, usa siempre la misma semilla y el mismo prompt para que las diferencias reflejen la capacidad del modelo y no el azar.

Optimizar la VRAM sin actualizar el hardware

No todo el mundo puede gastarse más de 1.500 $ en una RTX 4090. Estas técnicas te permiten exprimir más tu hardware actual.

Manos de un técnico instalando una GPU RTX en una ranura PCIe de la placa base

Cuantización y descarga de modelo

La cuantización GGUF con herramientas como llama.cpp y diffusers ya admite los modelos de Flux 2. Cargar una versión cuantizada Q5_K_M de flux-2-dev reduce el uso de VRAM por debajo de 10 GB con una pérdida mínima de calidad.

La descarga a CPU con el método enable_sequential_cpu_offload() de Hugging Face Diffusers mueve capas a la RAM del sistema cuando no se están procesando activamente. Esto hace técnicamente posible ejecutar Flux 2 en tarjetas de 6 GB o incluso de 4 GB, pero los tiempos de generación pueden alargarse hasta 5-15 minutos por imagen.

La atención por segmentos y la decodificación VAE por teselas también ayudan. Estas opciones dividen las operaciones que más memoria consumen en fragmentos más pequeños, lo que reduce el pico de uso de VRAM a costa de tiempos de procesamiento algo más largos.

Los límites prácticos inferiores con todas las optimizaciones combinadas:

  • 6 GB de VRAM: flux-2-klein-4b con cuantización de 4 bits y descarga a CPU (muy lento)
  • 8 GB de VRAM: flux-2-dev con cuantización GGUF Q4 (usable, pero no recomendado para producción)

AMD frente a NVIDIA para Flux 2

Primer plano extremo de chips de memoria GDDR6X soldados en una placa de circuito de GPU

Las GPU de AMD suelen pasarse por alto en cargas de trabajo de IA, pero la situación ha mejorado mucho con el soporte de ROCm. La RX 7900 XTX, con sus 24 GB de memoria GDDR6, es una competidora legítima de la RTX 4090 para la inferencia de Flux 2.

GPUVRAMAncho de banda de memoriaSoporte de Flux 2
RTX 409024 GB GDDR6X1008 GB/sExcelente (CUDA)
RTX 4080 Super16 GB GDDR6X736 GB/sBueno (CUDA)
RX 7900 XTX24 GB GDDR6960 GB/sBueno (ROCm)
RX 7900 XT20 GB GDDR6800 GB/sBueno (ROCm)
RTX 4070 Ti Super16 GB GDDR6X672 GB/sBueno (CUDA)

ROCm ha madurado hasta el punto de que HuggingFace Diffusers ejecuta Flux 2 en GPU AMD compatibles sin grandes problemas. Dicho esto, las optimizaciones de CUDA en PyTorch siguen dando a NVIDIA ventaja en velocidad, sobre todo con Flash Attention 2.

Nube frente a local: comparativa de costos sin rodeos

Ejecutar Flux 2 en local no tiene costo por imagen una vez hecha la inversión en hardware. Pero el desembolso inicial es considerable:

  • RTX 4090: ~1.600-2.000 $
  • RTX 4080: ~900-1.100 $
  • RTX 4070: ~550-650 $

La inferencia en la nube, a unos 0,04-0,08 $ por imagen, significa que necesitarías entre 20.000 y 50.000 imágenes para amortizar la compra de una tarjeta de gama media. Para la mayoría de usuarios ocasionales, las plataformas en la nube son la opción más inteligente desde el punto de vista económico. Para el trabajo de producción de alto volumen (más de 1.000 imágenes al mes), el hardware local se amortiza en menos de un año.

Qué significa todo esto para la creación de imágenes con IA

Estación de trabajo de investigación en IA con varios monitores mostrando imágenes generadas y una torre con GPU

Flux 2 representa el techo actual de la generación de imágenes con IA de código abierto en calidad. Los requisitos de VRAM son un reflejo directo de la sofisticación del modelo. El backbone de transformer de 9.000 millones de parámetros necesita un ancho de banda de memoria considerable para ofrecer su inconfundible salida fotorrealista, y no hay atajos que no conlleven contrapartidas.

La buena noticia: si tu GPU no alcanza el punto óptimo, no tienes por qué quedarte fuera. Plataformas como PicassoIA te dan acceso a flux-2-pro, flux-2-max y flux-2-dev ejecutándose en hardware en la nube de nivel profesional, con calidad float16 completa y sin limitaciones de VRAM locales.

💡 Conclusión: Apunta a un mínimo de 16 GB de VRAM para un uso local cómodo de Flux 2. Para flux-2-max y flux-2-pro a calidad completa, el objetivo real son 24 GB.

Crea imágenes impresionantes ahora mismo

No necesitas invertir en hardware nuevo para ver de lo que es capaz Flux 2. En PicassoIA, cada variante de Flux 2 se ejecuta en infraestructura en la nube de nivel profesional, lo que significa que tus resultados son idénticos a los que obtendrías en una RTX 4090 instalada en local con 24 GB de VRAM.

Mujer hermosa con vestido de flores de pie en un patio mediterráneo bañado por el sol al atardecer dorado

Empieza con flux-2-dev por su flexibilidad de pesos abiertos y su compatibilidad con LoRA, o ve directamente a flux-2-max si quieres la máxima calidad de salida posible. Prueba distintos ajustes de resolución, ajusta el guidance scale y compara los resultados de las variantes de 4B y 9B de primera mano. La plataforma ejecuta todas ellas con la misma facilidad, y notarás de inmediato la diferencia que marca tener un margen de VRAM adecuado, incluso cuando el hardware lo gestiona la nube.

Compartir este artículo

Elige tu idioma