Ejecutar Flux 2 en local no depende solo de tener una CPU rápida o suficiente RAM. El factor que más decide si tu experiencia sale bien o mal es la VRAM, y si tu GPU no alcanza el umbral, o los tiempos de generación serán muy lentos o directamente obtendrás errores.

Black Forest Labs diseñó Flux 2 como una familia de modelos, que va desde variantes compactas de 4.000 millones de parámetros hasta potentes versiones completas de 9.000 millones. Esa gama se traduce en requisitos de hardware muy distintos. Tanto si ejecutas flux-2-dev en una tarjeta de gama media como si llevas flux-2-max al límite en una RTX 4090, conocer tus cifras de VRAM antes de empezar te ahorra horas de frustración.
Requisitos de VRAM de Flux 2 de un vistazo
La respuesta corta: necesitas al menos 8 GB de VRAM para ejecutar las variantes más pequeñas de Flux 2, y 16 GB o más para ejecutar los modelos completos a velocidades razonables sin optimizaciones de memoria agresivas.
Esta es la tabla de referencia rápida:
💡 Consejo: "VRAM mínima" significa que el modelo se carga y genera, pero lentamente. "VRAM recomendada" significa una velocidad de inferencia cómoda y real, sin grandes concesiones.
La diferencia entre los modelos de 4B y 9B
El flux-2-klein-4b está diseñado específicamente como variante ligera. Con 4.000 millones de parámetros, cabe en 8 GB de VRAM con precisión float16 estándar. Es la opción adecuada si tienes una RTX 3070, una RTX 3060 Ti o una AMD RX 6700 XT.
Las variantes de 9B, entre ellas flux-2-dev, flux-2-pro y flux-2-max, tienen aproximadamente el doble de parámetros. En float16, un modelo de 9B ocupa unos 18 GB de VRAM antes de cualquier sobrecarga de inferencia. Por eso una tarjeta de 16 GB como la RTX 4080 se queda justa para un uso cómodo, y una RTX 4090 de 24 GB se convierte en la recomendación habitual para un uso local serio.
VRAM mínima y recomendada
Así funcionan las cuentas de los requisitos de VRAM para los grandes modelos de difusión:
- Precisión float16: 2 bytes por parámetro, así que 9B de parámetros = ~18 GB de memoria base para los pesos
- Precisión BF16: mismo tamaño que float16, pero con mejor estabilidad numérica
- Cuantización de 8 bits: ~9 GB para un modelo de 9B (un ahorro importante)
- Cuantización de 4 bits: ~5 GB para un modelo de 9B (compresión fuerte, con cierta pérdida de calidad)
- Sobrecarga de inferencia: añade entre 2 y 4 GB sobre los pesos del modelo para las activaciones y la caché KV
Esto significa que, incluso con cuantización de 8 bits, un modelo de 9B de Flux 2 necesita entre 11 y 13 GB en total, lo que deja a las tarjetas de 12 GB justo en el límite.

Las mejores GPU por nivel de VRAM
Tarjetas de 8 GB: posibles, pero incómodas
Con 8 GB de VRAM, estás limitado al flux-2-klein-4b o a versiones muy cuantizadas de modelos más grandes.
Tarjetas en este rango:
- NVIDIA RTX 3070 (8 GB GDDR6)
- NVIDIA RTX 3060 Ti (8 GB GDDR6)
- NVIDIA RTX 4060 (8 GB GDDR6)
- AMD RX 6700 XT (12 GB, una ventaja aquí)
💡 Nota: La RX 6700 XT tiene técnicamente 12 GB, lo que la hace más capaz que las tarjetas de 8 GB de NVIDIA en el mismo rango de precio.
Con 8 GB, espera:
- De 30 a 90 segundos por imagen de 1024x1024 con flux-2-klein-4b
- Posibles errores de falta de memoria si no tienes activada la descarga secuencial
- Ningún camino práctico para ejecutar modelos de 9B sin cuantización de 4 bits
Tarjetas de 12 GB: el punto de entrada real
Aquí es donde Flux 2 se vuelve realmente útil para la generación de imágenes con IA en el día a día.
Tarjetas en este rango:
- NVIDIA RTX 3080 12 GB
- NVIDIA RTX 4070 (12 GB GDDR6X)
- NVIDIA RTX 3060 (12 GB GDDR6)
- AMD RX 7700 XT (12 GB GDDR6)
Con 12 GB de VRAM, puedes ejecutar flux-2-dev con cuantización de 8 bits sin problemas, y flux-2-flex a velocidades razonables. Espera tiempos de generación de 15 a 40 segundos por imagen de 1024x1024 con los ajustes adecuados.
| GPU | VRAM | Flux 2 Dev (8 bits) | Flux 2 Klein 4B |
|---|
| RTX 4070 | 12 GB | ~25 s/imagen | ~10 s/imagen |
| RTX 3080 12 GB | 12 GB | ~35 s/imagen | ~14 s/imagen |
| RTX 3060 | 12 GB | ~55 s/imagen | ~22 s/imagen |
16 GB o más: donde todo mejora

Con 16 GB o más, la experiencia de Flux 2 cambia por completo. Puedes ejecutar inferencia float16 completa en modelos de 9B sin cuantización, lo que significa la máxima calidad de salida.
Tarjetas en este rango:
- NVIDIA RTX 4080 (16 GB GDDR6X)
- NVIDIA RTX 4080 Super (16 GB GDDR6X)
- AMD RX 7900 GRE (16 GB GDDR6)
- AMD RX 7900 XT (20 GB GDDR6)
- NVIDIA RTX 4090 (24 GB GDDR6X)
- NVIDIA RTX 6000 Ada (48 GB GDDR6)
La RTX 4080 de 16 GB se queda justo en el umbral para flux-2-pro en float16. Las velocidades de generación alcanzan entre 8 y 15 segundos por imagen, algo práctico para el trabajo iterativo. La RTX 4090, con sus 24 GB de GDDR6X, es el benchmark indiscutible en el ámbito de consumo: float16 completa en cualquier variante de Flux 2, incluida flux-2-max, a velocidades de 5 a 10 segundos por imagen de 1024x1024.
💡 Consejo avanzado: La memoria GDDR6X de la RTX 4090 ofrece un ancho de banda de ~1008 GB/s, lo que importa mucho en modelos de difusión basados en transformers como Flux 2. El ancho de banda de memoria, no solo la capacidad, afecta de forma notable a la velocidad de generación.
Flux 2 Dev frente a Pro frente a Max
Estas tres variantes representan un espectro entre calidad y velocidad, y cada una tiene exigencias de hardware muy distintas.
Qué variante necesita más VRAM
flux-2-dev es el modelo de desarrollo de pesos abiertos. Está optimizado para la inferencia en local, admite ajuste fino y LoRA, y es el que menos exige de hardware de los modelos de 9B. Con 12 GB y cuantización de 8 bits, es la opción adecuada para los aficionados con hardware de gama media.
flux-2-flex introduce un condicionamiento estructural para un mayor control sobre la composición de la imagen. Las necesidades de memoria son similares a las de Dev, pero la inferencia es algo más pesada por las vías de condicionamiento adicionales.
flux-2-pro y flux-2-max son modelos de gama alta accesibles por API. Max usa en concreto pipelines de inferencia de precisión completa diseñados para una calidad de resultado profesional. Ejecutarlos en local a calidad completa requiere entre 20 y 24 GB de VRAM.

Velocidad frente a calidad: contrapartidas
Esto es lo que realmente obtienes en cada nivel de VRAM con los modelos de 9B de Flux 2:
| Precisión | Uso de VRAM | Impacto en la calidad | Velocidad (RTX 4090) |
|---|
| Float16 (completa) | ~18 GB | Ninguno | 5-8 s/imagen |
| BF16 | ~18 GB | Mínimo | 5-8 s/imagen |
| 8 bits (NF8) | ~10 GB | Muy bajo | 10-15 s/imagen |
| 4 bits (NF4) | ~6 GB | Moderado | 18-25 s/imagen |
La diferencia de calidad entre float16 y 8 bits rara vez se aprecia a simple vista en resoluciones estándar de 1024x1024. Se hace evidente en resoluciones muy altas o con detalles extremadamente finos en rostros y texturas. La cuantización de 4 bits sí introduce falta de nitidez en los detalles finos, pero da resultados viables en hardware limitado.
Cómo usar Flux 2 en PicassoIA
Como flux-2-dev, flux-2-pro, flux-2-max, flux-2-flex y flux-2-klein-4b están disponibles en PicassoIA, puedes generar imágenes con cualquier variante de Flux 2 sin preocuparte en absoluto por los requisitos de VRAM en local.

Paso a paso con Flux 2 Pro
- Abre flux-2-pro en PicassoIA
- Escribe tu prompt en el campo de texto. Sé específico: describe el sujeto, la iluminación, el entorno y el ambiente.
- Define la resolución que quieras. 1024x1024 funciona bien para retratos; 1792x1024 va bien para escenas de paisaje.
- Ajusta el guidance scale. Un valor de 3,5 a 4,0 da una adherencia al prompt equilibrada sin sobresaturar.
- Pulsa generar. La inferencia en la nube se ejecuta en hardware de nivel profesional, así que obtienes calidad float16 completa sea cual sea tu GPU local.
Cómo elegir tu variante de Flux 2
Usa este árbol de decisión para elegir el modelo adecuado:
💡 Consejo: Si comparas resultados entre variantes, usa siempre la misma semilla y el mismo prompt para que las diferencias reflejen la capacidad del modelo y no el azar.
Optimizar la VRAM sin actualizar el hardware
No todo el mundo puede gastarse más de 1.500 $ en una RTX 4090. Estas técnicas te permiten exprimir más tu hardware actual.

Cuantización y descarga de modelo
La cuantización GGUF con herramientas como llama.cpp y diffusers ya admite los modelos de Flux 2. Cargar una versión cuantizada Q5_K_M de flux-2-dev reduce el uso de VRAM por debajo de 10 GB con una pérdida mínima de calidad.
La descarga a CPU con el método enable_sequential_cpu_offload() de Hugging Face Diffusers mueve capas a la RAM del sistema cuando no se están procesando activamente. Esto hace técnicamente posible ejecutar Flux 2 en tarjetas de 6 GB o incluso de 4 GB, pero los tiempos de generación pueden alargarse hasta 5-15 minutos por imagen.
La atención por segmentos y la decodificación VAE por teselas también ayudan. Estas opciones dividen las operaciones que más memoria consumen en fragmentos más pequeños, lo que reduce el pico de uso de VRAM a costa de tiempos de procesamiento algo más largos.
Los límites prácticos inferiores con todas las optimizaciones combinadas:
- 6 GB de VRAM: flux-2-klein-4b con cuantización de 4 bits y descarga a CPU (muy lento)
- 8 GB de VRAM: flux-2-dev con cuantización GGUF Q4 (usable, pero no recomendado para producción)
AMD frente a NVIDIA para Flux 2

Las GPU de AMD suelen pasarse por alto en cargas de trabajo de IA, pero la situación ha mejorado mucho con el soporte de ROCm. La RX 7900 XTX, con sus 24 GB de memoria GDDR6, es una competidora legítima de la RTX 4090 para la inferencia de Flux 2.
| GPU | VRAM | Ancho de banda de memoria | Soporte de Flux 2 |
|---|
| RTX 4090 | 24 GB GDDR6X | 1008 GB/s | Excelente (CUDA) |
| RTX 4080 Super | 16 GB GDDR6X | 736 GB/s | Bueno (CUDA) |
| RX 7900 XTX | 24 GB GDDR6 | 960 GB/s | Bueno (ROCm) |
| RX 7900 XT | 20 GB GDDR6 | 800 GB/s | Bueno (ROCm) |
| RTX 4070 Ti Super | 16 GB GDDR6X | 672 GB/s | Bueno (CUDA) |
ROCm ha madurado hasta el punto de que HuggingFace Diffusers ejecuta Flux 2 en GPU AMD compatibles sin grandes problemas. Dicho esto, las optimizaciones de CUDA en PyTorch siguen dando a NVIDIA ventaja en velocidad, sobre todo con Flash Attention 2.
Nube frente a local: comparativa de costos sin rodeos
Ejecutar Flux 2 en local no tiene costo por imagen una vez hecha la inversión en hardware. Pero el desembolso inicial es considerable:
- RTX 4090: ~1.600-2.000 $
- RTX 4080: ~900-1.100 $
- RTX 4070: ~550-650 $
La inferencia en la nube, a unos 0,04-0,08 $ por imagen, significa que necesitarías entre 20.000 y 50.000 imágenes para amortizar la compra de una tarjeta de gama media. Para la mayoría de usuarios ocasionales, las plataformas en la nube son la opción más inteligente desde el punto de vista económico. Para el trabajo de producción de alto volumen (más de 1.000 imágenes al mes), el hardware local se amortiza en menos de un año.
Qué significa todo esto para la creación de imágenes con IA

Flux 2 representa el techo actual de la generación de imágenes con IA de código abierto en calidad. Los requisitos de VRAM son un reflejo directo de la sofisticación del modelo. El backbone de transformer de 9.000 millones de parámetros necesita un ancho de banda de memoria considerable para ofrecer su inconfundible salida fotorrealista, y no hay atajos que no conlleven contrapartidas.
La buena noticia: si tu GPU no alcanza el punto óptimo, no tienes por qué quedarte fuera. Plataformas como PicassoIA te dan acceso a flux-2-pro, flux-2-max y flux-2-dev ejecutándose en hardware en la nube de nivel profesional, con calidad float16 completa y sin limitaciones de VRAM locales.
💡 Conclusión: Apunta a un mínimo de 16 GB de VRAM para un uso local cómodo de Flux 2. Para flux-2-max y flux-2-pro a calidad completa, el objetivo real son 24 GB.
Crea imágenes impresionantes ahora mismo
No necesitas invertir en hardware nuevo para ver de lo que es capaz Flux 2. En PicassoIA, cada variante de Flux 2 se ejecuta en infraestructura en la nube de nivel profesional, lo que significa que tus resultados son idénticos a los que obtendrías en una RTX 4090 instalada en local con 24 GB de VRAM.

Empieza con flux-2-dev por su flexibilidad de pesos abiertos y su compatibilidad con LoRA, o ve directamente a flux-2-max si quieres la máxima calidad de salida posible. Prueba distintos ajustes de resolución, ajusta el guidance scale y compara los resultados de las variantes de 4B y 9B de primera mano. La plataforma ejecuta todas ellas con la misma facilidad, y notarás de inmediato la diferencia que marca tener un margen de VRAM adecuado, incluso cuando el hardware lo gestiona la nube.