Cómo instalar Flux 2 en local en tu equipo

Ejecutar Flux 2 en tu propio hardware significa no tener límites de uso ni tarifas, y tener control total sobre cada parámetro. Este artículo recorre dos vías de instalación, ComfyUI para un flujo de trabajo visual sin código y Hugging Face Diffusers para un control mediante scripts, además de la optimización de VRAM para tarjetas de 8 GB y cómo acceder a Flux 2 Pro sin ninguna configuración local.

Cómo instalar Flux 2 en local en tu equipo
Cristian Da Conceicao
Fundador de Picasso IA

Ejecutar un modelo de texto a imagen de última generación directamente en tu equipo cambia por completo la forma de trabajar. Sin límites de uso, sin colas y sin cuotas de suscripción que reduzcan el presupuesto de cada experimento. Flux 2, de Black Forest Labs, es uno de los modelos de generación de imágenes de pesos abiertos más capaces que existen hoy, y instalarlo en local es más accesible de lo que la mayoría espera. Este artículo recorre todo el proceso, desde los requisitos del sistema hasta tu primera imagen generada.

Primer plano de la instalación de una GPU NVIDIA en una ranura PCIe de la placa base para configurar la inferencia de IA en local

Qué es realmente Flux 2

Flux 2 es la segunda generación de la arquitectura Flux, creada por Black Forest Labs, el equipo detrás de algunos de los modelos de pesos abiertos más fotorrealistas disponibles hoy. Parte de la familia original Flux.1 y mejora la adherencia al prompt, la precisión anatómica en sujetos humanos y el detalle nítido en resoluciones estándar. El modelo usa una arquitectura de difusión basada en transformers que se diferencia de forma fundamental de los diseños U-Net de los modelos Stable Diffusion anteriores.

La familia de modelos

La familia Flux 2 incluye varias versiones distintas, cada una orientada a un nivel de hardware y a un caso de uso diferente:

ModeloVRAM necesariaIdeal para
flux-2-dev16–24 GBInvestigación, ajuste fino, trabajo en local
flux-2-proSolo en la nubeProducción comercial
flux-2-maxSolo en la nubeMáximo detalle y resolución
flux-2-flexSolo en la nubeControl flexible de la relación de aspecto
flux-2-klein-4b8–12 GBInferencia rápida en hardware de consumo
flux-2-klein-9b-base16 GBGeneración local de alta fidelidad

Para la instalación en local, flux-2-dev y flux-2-klein-4b son tus principales opciones. Las versiones Pro, Max y Flex funcionan exclusivamente a través de la API y no se distribuyen como pesos descargables.

Por qué ejecutarlo en local

Hay motivos concretos más allá del ahorro. La inferencia en local significa que tus prompts y las imágenes generadas nunca salen de tu equipo, algo que importa en trabajos comerciales con temas sensibles. Controlas directamente cada parámetro de muestreo. Puedes procesar por lotes cientos de imágenes durante la noche sin preocuparte por el precio por generación. Y para el ajuste fino con conjuntos de datos propios o para acoplar adaptadores LoRA, la instalación en local es la única vía viable.

Lo que necesita tu equipo

Antes de descargar nada, comprueba que tu hardware y tu software cumplen estos requisitos. Las dependencias que no encajan causan la mayoría de los fallos habituales de instalación.

Pantalla de monitorización de la GPU que muestra el uso de VRAM en su pico durante la inferencia de Flux 2

Requisitos de GPU y VRAM

Flux 2 es muy exigente desde el punto de vista computacional. Este es el desglose real:

Configuración mínima viable:

  • GPU NVIDIA con al menos 8 GB de VRAM (RTX 3070, RTX 4060 Ti o equivalente)
  • flux-2-klein-4b en cuantización fp8 o GGUF

Configuración recomendada:

  • GPU NVIDIA con 16–24 GB de VRAM (RTX 3090, 4080 Super o 4090)
  • flux-2-dev en bf16 o fp16

Las GPU AMD funcionan con ROCm en Linux, pero el soporte de controladores en Windows es irregular. Espera tener que resolver más problemas en comparación con las configuraciones CUDA.

Apple Silicon (M1/M2/M3/M4) puede ejecutar versiones cuantizadas de Flux 2 mediante el framework MLX. Los tiempos de generación son de 2 a 4 veces más lentos que con una tarjeta NVIDIA comparable, pero la calidad de imagen es equivalente.

💡 Consejo: Si tu GPU tiene exactamente 8 GB de VRAM, usa la cuantización GGUF Q4_K_S. La calidad baja un poco, pero el modelo funciona sin errores de memoria con la mayoría de los prompts.

Python, CUDA y controladores

Tu conjunto de software tiene que estar alineado antes de que funcione correctamente cualquier instalación de paquetes de Python:

  1. Controlador NVIDIA: versión 525 o posterior. Compruébalo con nvidia-smi en una terminal.
  2. CUDA Toolkit: versión 11.8 o 12.x. Haz coincidir la versión con tu compilación de PyTorch.
  3. Python: funcionan mejor las versiones 3.10 y 3.11. Evita la 3.12 hasta que el soporte de las bibliotecas se estabilice.
  4. Git: necesario para clonar repositorios.

En Windows, instala CUDA desde el portal de desarrolladores de NVIDIA. En Ubuntu 22.04 o posterior, el instalador runfile evita conflictos de paquetes con los controladores preinstalados.

Dos vías para la instalación en local

Existen dos métodos bien soportados para ejecutar Flux 2 en local. Ninguno es objetivamente mejor, y la opción correcta depende por completo de cómo trabajes.

ComfyUI (la vía visual)

ComfyUI es una interfaz gráfica basada en nodos para ejecutar modelos de difusión. Conectas nodos en un lienzo visual para construir pipelines de generación. Tras la configuración inicial no hace falta escribir scripts en Python. Para la mayoría de las personas es el camino más rápido desde cero hasta una instalación de Flux 2 funcionando.

Elige ComfyUI cuando:

  • Quieras un flujo de trabajo visual, sin código
  • Vayas a experimentar con distintos samplers y configuraciones de scheduler
  • Quieras compartir o importar flujos de trabajo de la comunidad en archivos JSON

Hugging Face Diffusers (la vía del código)

La biblioteca diffusers es la API estándar de Python para ejecutar modelos de difusión de forma programática. Escribes scripts de inferencia y tienes control total sobre cada parámetro, desde el tipo de precisión dtype hasta los schedulers personalizados.

Elige Diffusers cuando:

  • Estés creando una aplicación o un pipeline de automatización
  • Necesites procesamiento por lotes con lógica de negocio propia
  • Quieras hacer ajuste fino o entrenar adaptadores LoRA con datos propios

Instalar Flux 2 con ComfyUI

Es la vía recomendada para la mayoría de usuarios que quieran resultados rápidos sin escribir código.

Interfaz de flujo de trabajo basado en nodos de ComfyUI para la generación de imágenes con Flux 2 en un monitor doble

Configurar ComfyUI en Windows o Linux

Paso 1: clona el repositorio de ComfyUI y entra en el directorio:

git clone https://github.com/comfyanonymous/ComfyUI
cd ComfyUI

Paso 2: instala PyTorch con soporte para CUDA. Usa el selector de pytorch.org para obtener el comando correcto para tu versión de CUDA. Para CUDA 12.1:

pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu121

Paso 3: instala el resto de dependencias de ComfyUI:

pip install -r requirements.txt

Paso 4: inicia el servidor:

python main.py --gpu-only

Abre http://127.0.0.1:8188 en tu navegador. ComfyUI ya está en marcha.

💡 Consejo: En Windows, la versión portátil independiente de la página oficial de ComfyUI en GitHub incluye Python y PyTorch preinstalados. Se inicia con un doble clic y evita casi por completo los problemas de configuración del entorno.

Descargar los checkpoints de Flux 2

Los pesos de Flux 2 están alojados en Hugging Face. Necesitas una cuenta gratuita y debes aceptar el acuerdo de licencia del modelo en su página antes de que la descarga se complete.

Para flux-2-dev (requiere 16 GB o más de VRAM):

huggingface-cli download black-forest-labs/FLUX.2-dev \
  flux2-dev.safetensors \
  --local-dir ./models/checkpoints/

Para flux-2-klein-4b (funciona en tarjetas de 8 GB):

huggingface-cli download black-forest-labs/FLUX.2-klein-4b \
  --local-dir ./models/checkpoints/

También necesitas los codificadores de texto y el VAE compartidos. Estos componentes se reutilizan en todas las versiones de Flux:

# T5 text encoder in fp8 (saves approximately 8 GB VRAM vs full precision)
huggingface-cli download comfyanonymous/flux_text_encoders \
  t5xxl_fp8_e4m3fn.safetensors \
  --local-dir ./models/clip/

# CLIP text encoder
huggingface-cli download openai/clip-vit-large-patch14 \
  --local-dir ./models/clip/

# VAE (shared from Flux.1)
huggingface-cli download black-forest-labs/FLUX.1-schnell \
  ae.safetensors \
  --local-dir ./models/vae/

Ejecuta tu primer prompt

Carga el JSON oficial del flujo de trabajo de Flux en ComfyUI con el botón Load. Los nodos principales que hay que configurar son:

  • CLIPTextEncode: el texto de tu prompt positivo
  • KSampler: fija los pasos en 28 y el cfg en 1.0 para flux-2-dev
  • EmptyLatentImage: fija la resolución objetivo (1024x1024 es un buen punto de partida)
  • VAEDecode: convierte la salida latente en una imagen visible

Pulsa Queue Prompt y empezará tu primera generación con Flux 2.

Cuaderno abierto con un diagrama de flujo de la instalación escrito a mano con los pasos para configurar Flux 2 en local

Instalar Flux 2 con Diffusers

Para flujos de trabajo con scripts y desarrollo de aplicaciones, la biblioteca diffusers de Hugging Face ofrece el control más amplio sobre cada aspecto de la generación de imágenes.

Editor de código Python en la pantalla de un equipo portátil que muestra un script de inferencia de Flux 2 con resaltado de sintaxis

Crea un entorno virtual de Python

Aísla siempre los proyectos de IA en un entorno virtual para evitar conflictos de paquetes entre proyectos.

python -m venv flux2-env

# Windows activation
flux2-env\Scripts\activate

# Linux and macOS activation
source flux2-env/bin/activate

Instala los paquetes adecuados

pip install --upgrade pip
pip install torch torchvision --index-url https://download.pytorch.org/whl/cu121
pip install diffusers transformers accelerate sentencepiece protobuf
pip install huggingface_hub

Para el soporte de cuantización GGUF en tarjetas con poca VRAM:

pip install gguf

💡 Consejo: Tras una instalación que funcione, ejecuta pip freeze > requirements.txt para fijar tus versiones. La biblioteca diffusers se actualiza con frecuencia y algunos cambios que rompen compatibilidad afectan a la API del pipeline de Flux.

Escribe y ejecuta tu script de inferencia

Un script mínimo que funciona para flux-2-dev:

import torch
from diffusers import FluxPipeline

pipe = FluxPipeline.from_pretrained(
    "black-forest-labs/FLUX.2-dev",
    torch_dtype=torch.bfloat16
)
pipe.enable_model_cpu_offload()

prompt = "A photorealistic portrait of a woman in soft natural light, film grain, 8K"

image = pipe(
    prompt,
    height=1024,
    width=1024,
    guidance_scale=3.5,
    num_inference_steps=28,
    max_sequence_length=512,
    generator=torch.Generator("cpu").manual_seed(42)
).images[0]

image.save("flux2_output.png")

Ejecútalo con:

python generate.py

La primera ejecución descarga unos 24 GB de pesos del modelo. Las siguientes cargan desde la caché en unos 30 segundos en un SSD NVMe moderno.

Ventana de terminal en un monitor con comandos de instalación de pip de Python y barras verdes de progreso de descarga

Ejecutar Flux 2 en hardware con poca VRAM

No todo el mundo tiene una GPU de 24 GB. Estas dos estrategias te permiten ejecutar Flux 2 en tarjetas de 8 a 12 GB sin perder la calidad de imagen que hace que el modelo merezca la pena.

Modelos GGUF cuantizados

GGUF es un formato de cuantización adaptado del ecosistema llama.cpp que hoy también funciona con modelos de difusión de imagen. Reduce la precisión del modelo de números de coma flotante de 16 bits a enteros de 4 u 8 bits, lo que recorta los requisitos de VRAM entre un 50 y un 75 %.

En Hugging Face hay archivos GGUF cuantizados por la comunidad para Flux 2. Esta es la contrapartida práctica en cada nivel de cuantización:

ArchivoUso de VRAMCalidad
flux2-dev-Q8_0.gguf~10 GBCasi sin pérdidas
flux2-dev-Q4_K_S.gguf~6 GBBuena, con una ligera suavización
flux2-dev-Q3_K_M.gguf~5 GBAceptable para pruebas rápidas

En ComfyUI, instala la extensión de nodo personalizado ComfyUI-GGUF y luego carga el archivo de checkpoint .gguf igual que cargarías cualquier checkpoint .safetensors. No hace falta cambiar nada más en el flujo de trabajo.

Descarga a CPU y precisión fp8

Dos estrategias adicionales de reducción de memoria que se combinan bien entre sí:

Carga del transformer en fp8 en Diffusers:

from diffusers import FluxPipeline, FluxTransformer2DModel
import torch

transformer = FluxTransformer2DModel.from_pretrained(
    "black-forest-labs/FLUX.2-dev",
    subfolder="transformer",
    torch_dtype=torch.float8_e4m3fn
)
pipe = FluxPipeline.from_pretrained(
    "black-forest-labs/FLUX.2-dev",
    transformer=transformer,
    torch_dtype=torch.bfloat16
)
pipe.enable_model_cpu_offload()

Descarga secuencial a la CPU (más lenta, pero funciona en tarjetas de 8 GB):

pipe.enable_sequential_cpu_offload()

💡 Consejo: Combina GGUF Q4_K_S con enable_model_cpu_offload() para el mejor equilibrio en tarjetas de 8 GB. Espera tiempos de generación de 3 a 5 minutos por imagen de 1024x1024, algo perfectamente viable para trabajo personal iterativo.

Cómo usar Flux 2 en PicassoIA

Si quieres probar Flux 2 antes de comprometerte con una configuración completa en local, o si necesitas acceder a las versiones Pro y Max, que solo están en la nube, PicassoIA ofrece todos los modelos de Flux 2 directamente en el navegador, sin instalar nada.

Laboratorio de servidores domésticos con varios equipos equipados con GPU, colocados en estanterías de cable con gestión de cables

Ejecutar Flux 2 Pro sin configuración local

flux-2-pro y flux-2-max no están disponibles como pesos descargables. Funcionan exclusivamente a través de una API en la nube. PicassoIA ofrece acceso desde el navegador a ambos, además de flux-2-flex para dimensiones de salida flexibles y flux-2-klein-4b para una generación rápida.

Pasos para generar con Flux 2 en PicassoIA:

  1. Abre la página de flux-2-pro en tu navegador
  2. Escribe tu prompt en el campo de texto
  3. Fija las dimensiones y los pasos de inferencia que prefieras (28 es el punto óptimo para las versiones dev)
  4. Haz clic en Generate
  5. Descarga o comparte el resultado directamente desde la interfaz

Para una calidad equivalente a ejecutar flux-2-dev en local con una GPU de 24 GB, la implementación de PicassoIA produce resultados equivalentes sin tiempo de configuración.

Consejos de prompts que funcionan en todas las versiones

Flux 2 responde bien a prompts en lenguaje natural. No necesitas corchetes con pesos ni apilar tokens. Escribe lo que quieres como una frase clara y concreta.

Lo que funciona bien:

  • Una descripción explícita de la luz: "soft morning light from the left, volumetric"
  • La acción y la posición del sujeto: "a woman standing at a kitchen counter, looking down at her hands"
  • Una referencia de estilo: "fotografía analógica, Kodak Portra 400, objetivo de 35 mm f/2.0"
  • El encuadre: "retrato en primer plano, profundidad de campo reducida, sujeto nítido, fondo desenfocado"

Lo que conviene evitar:

  • Apilar más de tres o cuatro sujetos distintos en un mismo prompt
  • Prompts de más de 300 tokens (el codificador T5 admite hasta 512, pero la calidad se degrada a partir de 300)
  • Descriptores emocionales vagos sin anclaje visual ("melancolía" a secas no le da al modelo nada que renderizar)

💡 Consejo: Para flux-2-klein-4b, mantén el guidance scale entre 2,5 y 4,0. Los valores más altos sobresaturan los colores en el modelo más pequeño.

Empieza a generar ahora mismo

Tanto si seguiste la vía de ComfyUI, si escribiste un script de Diffusers o si abriste flux-2-pro en PicassoIA, ya tienes todo lo necesario para trabajar con Flux 2.

Monitor de alta resolución que muestra un retrato fotorrealista generado por IA, demostrando la calidad de salida de Flux 2 en pantalla

El verdadero valor de tener Flux 2 funcionando en local, o a través de una plataforma como PicassoIA, es la velocidad de iteración. Escribes un prompt, ves un resultado en menos de un minuto, refinas la descripción y vuelves a generar. Ese ciclo de retroalimentación tan ajustado es donde se desarrolla la habilidad real para escribir prompts y ajustar parámetros.

PicassoIA te da acceso inmediato a flux-2-dev, flux-2-pro, flux-2-max, flux-2-flex y al eficiente flux-2-klein-4b, sin configurar CUDA, sin descargar 24 GB de pesos y sin preparar un entorno virtual. Es la forma más rápida de comparar lo que realmente produce cada versión antes de decidir si merece la pena una instalación completa en local para tu flujo de trabajo.

Vista por encima del hombro de una persona revisando imágenes generadas con Flux 2 en el monitor de una estación de trabajo

Empieza con un prompt que te importe. Ejecútalo en flux-2-dev y luego compáralo con flux-2-klein-4b. Fíjate en lo que cambia entre los dos. Esa comparación te dice exactamente qué inversión en hardware se justifica para tu caso de uso concreto, sin ninguna suposición.

Compartir este artículo

Elige tu idioma