Comment installer Flux 2 en local sur votre ordinateur

Faire tourner Flux 2 sur votre propre matériel, c’est l’assurance de n’avoir aucune limite de requêtes, aucun frais et un contrôle total sur chaque paramètre. Cet article présente deux méthodes d’installation, ComfyUI pour un flux de travail visuel sans code et Hugging Face Diffusers pour un contrôle par script, ainsi que l’optimisation de la VRAM pour les cartes de 8 Go, et la façon d’accéder à Flux 2 Pro sans aucune installation locale.

Comment installer Flux 2 en local sur votre ordinateur
Cristian Da Conceicao
Fondateur de Picasso IA

Faire tourner un modèle texte vers image de pointe directement sur votre machine change toute votre façon de travailler. Plus de plafond d’utilisation, plus de files d’attente, plus d’abonnement qui grignote chaque essai. Flux 2, signé Black Forest Labs, est l’un des modèles de génération d’images à poids ouverts les plus performants disponibles aujourd’hui, et son installation locale est plus accessible qu’on ne le pense. Cet article détaille toute la démarche, de la configuration requise à votre première image générée.

Gros plan de l’installation d’une carte graphique NVIDIA dans un emplacement PCIe de carte mère pour une configuration d’inférence IA locale

Ce qu’est vraiment Flux 2

Flux 2 est la deuxième génération de l’architecture Flux, développée par Black Forest Labs, l’équipe derrière certains des modèles à poids ouverts les plus photoréalistes disponibles aujourd’hui. Il s’appuie sur la famille originale Flux.1 avec un meilleur respect des prompts, une précision anatomique accrue sur les sujets humains et un rendu des détails plus net aux résolutions standard. Le modèle repose sur une architecture de diffusion à base de transformeurs, qui se distingue fondamentalement des conceptions U-Net des anciens modèles Stable Diffusion.

La gamme de modèles

La famille Flux 2 se décline en plusieurs versions distinctes, chacune visant un niveau de matériel et un usage différents :

ModèleVRAM requiseIdéal pour
flux-2-dev16–24 GoRecherche, fine-tuning, travail en local
flux-2-proCloud uniquementUsage commercial en production
flux-2-maxCloud uniquementDétail et résolution maximum
flux-2-flexCloud uniquementContrôle souple du format
flux-2-klein-4b8–12 GoInférence rapide sur du matériel grand public
flux-2-klein-9b-base16 GoGénération locale très fidèle

Pour une installation locale, flux-2-dev et flux-2-klein-4b sont vos cibles principales. Les versions Pro, Max et Flex fonctionnent exclusivement via API et ne sont pas distribuées sous forme de poids téléchargeables.

Pourquoi l’exécuter en local

Au-delà de l’économie d’argent, les raisons sont concrètes. L’inférence locale signifie que vos prompts et vos images générées ne quittent jamais votre machine, ce qui compte pour un travail commercial sur des sujets sensibles. Vous contrôlez directement chaque paramètre d’échantillonnage. Vous pouvez traiter par lots des centaines d’images pendant la nuit sans vous soucier d’une facturation à la génération. Et pour le fine-tuning sur des jeux de données personnalisés ou l’ajout d’adaptateurs LoRA, l’installation locale est la seule voie viable.

Ce dont votre machine a besoin

Avant de télécharger quoi que ce soit, vérifiez votre matériel et votre environnement logiciel par rapport à ces exigences. Des dépendances mal alignées sont à l’origine de la plupart des échecs d’installation courants.

Écran de surveillance GPU affichant l’utilisation maximale de la VRAM pendant l’inférence de Flux 2

Exigences en GPU et en VRAM

Flux 2 est très exigeant en calcul. Voici le bilan, sans détour :

Configuration minimale viable :

  • GPU NVIDIA avec au moins 8 Go de VRAM (RTX 3070, RTX 4060 Ti ou équivalent)
  • flux-2-klein-4b en quantification fp8 ou GGUF

Configuration recommandée :

  • GPU NVIDIA avec 16–24 Go de VRAM (RTX 3090, 4080 Super ou 4090)
  • flux-2-dev en bf16 ou fp16

Les GPU AMD fonctionnent via ROCm sous Linux, mais la prise en charge des pilotes sous Windows est inégale. Attendez-vous à davantage de dépannage qu’avec les configurations CUDA.

Les Apple Silicon (M1/M2/M3/M4) peuvent exécuter des versions quantifiées de Flux 2 via le framework MLX. Les temps de génération sont 2 à 4 fois plus longs qu’avec une carte NVIDIA comparable, mais la qualité d’image est équivalente.

💡 Astuce : si votre GPU dispose exactement de 8 Go de VRAM, utilisez la quantification GGUF Q4_K_S. La qualité baisse légèrement, mais le modèle tourne sans erreur de mémoire sur la plupart des prompts.

Python, CUDA et pilotes

Votre environnement logiciel doit être aligné avant que toute installation de paquets Python fonctionne correctement :

  1. Pilote NVIDIA : version 525 ou plus récente. Vérifiez-la avec nvidia-smi dans un terminal.
  2. CUDA Toolkit : version 11.8 ou 12.x. Faites correspondre la version à celle de votre PyTorch installé.
  3. Python : 3.10 ou 3.11 sont les plus adaptés. Évitez la 3.12 tant que la prise en charge par les bibliothèques n’est pas stabilisée.
  4. Git : nécessaire pour cloner les dépôts.

Sous Windows, installez CUDA depuis le portail développeur de NVIDIA. Sous Ubuntu 22.04 ou plus récent, l’installeur runfile évite les conflits de paquets avec les pilotes préinstallés.

Deux voies pour l’installation locale

Deux méthodes bien prises en charge existent pour faire tourner Flux 2 en local. Aucune n’est objectivement meilleure, et le bon choix dépend entièrement de votre façon de travailler.

ComfyUI (la voie visuelle)

ComfyUI est une interface graphique à base de nœuds pour exécuter des modèles de diffusion. Vous reliez des nœuds sur un canevas visuel pour construire vos pipelines de génération. Aucun script Python n’est nécessaire après la configuration initiale. Pour la plupart des utilisateurs, c’est le chemin le plus rapide de zéro à une installation de Flux 2 fonctionnelle.

Choisissez ComfyUI si :

  • vous voulez un flux de travail visuel, sans code
  • vous comptez tester différents samplers et configurations de planification
  • vous voulez partager ou importer des flux de travail de la communauté sous forme de fichiers JSON

Hugging Face Diffusers (la voie du code)

La bibliothèque diffusers est l’API Python de référence pour exécuter des modèles de diffusion par programmation. Vous écrivez des scripts d’inférence et gardez un contrôle total sur chaque paramètre, du type de précision aux schedulers personnalisés.

Choisissez Diffusers si :

  • vous construisez une application ou un pipeline d’automatisation
  • vous avez besoin de traitements par lots avec une logique métier spécifique
  • vous voulez fine-tuner ou entraîner des adaptateurs LoRA sur des données personnalisées

Installer Flux 2 via ComfyUI

C’est la voie recommandée pour la plupart des utilisateurs qui veulent des résultats rapidement, sans écrire de code.

Interface ComfyUI sur double écran, flux de travail à base de nœuds pour la génération d’images avec Flux 2

Configurer ComfyUI sous Windows ou Linux

Étape 1 : clonez le dépôt ComfyUI et entrez dans le dossier :

git clone https://github.com/comfyanonymous/ComfyUI
cd ComfyUI

Étape 2 : installez PyTorch avec la prise en charge de CUDA. Utilisez le sélecteur de pytorch.org pour obtenir la commande correspondant à votre version de CUDA. Pour CUDA 12.1 :

pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu121

Étape 3 : installez les autres dépendances de ComfyUI :

pip install -r requirements.txt

Étape 4 : lancez le serveur :

python main.py --gpu-only

Ouvrez http://127.0.0.1:8188 dans votre navigateur. ComfyUI est maintenant en marche.

💡 Astuce : sous Windows, la version portable autonome publiée sur la page GitHub officielle de ComfyUI inclut Python et PyTorch préinstallés. Elle démarre d’un double-clic et évite entièrement la plupart des problèmes de configuration de l’environnement.

Télécharger les checkpoints de Flux 2

Les poids de Flux 2 sont hébergés sur Hugging Face. Il vous faut un compte gratuit et vous devez accepter l’accord de licence du modèle sur sa page avant que le téléchargement n’aboutisse.

Pour flux-2-dev (nécessite 16 Go de VRAM ou plus) :

huggingface-cli download black-forest-labs/FLUX.2-dev \
  flux2-dev.safetensors \
  --local-dir ./models/checkpoints/

Pour flux-2-klein-4b (fonctionne sur les cartes de 8 Go) :

huggingface-cli download black-forest-labs/FLUX.2-klein-4b \
  --local-dir ./models/checkpoints/

Vous avez aussi besoin des encodeurs de texte et du VAE partagés. Ces composants sont réutilisés par toutes les versions de Flux :

# T5 text encoder in fp8 (saves approximately 8 GB VRAM vs full precision)
huggingface-cli download comfyanonymous/flux_text_encoders \
  t5xxl_fp8_e4m3fn.safetensors \
  --local-dir ./models/clip/

# CLIP text encoder
huggingface-cli download openai/clip-vit-large-patch14 \
  --local-dir ./models/clip/

# VAE (shared from Flux.1)
huggingface-cli download black-forest-labs/FLUX.1-schnell \
  ae.safetensors \
  --local-dir ./models/vae/

Lancer votre premier prompt

Chargez le fichier JSON officiel du flux de travail Flux dans ComfyUI via le bouton Load. Les principaux nœuds à configurer sont :

  • CLIPTextEncode : votre texte de prompt positif
  • KSampler : réglez steps sur 28 et cfg sur 1,0 pour flux-2-dev
  • EmptyLatentImage : réglez la résolution cible (1024x1024 est un bon point de départ)
  • VAEDecode : convertit la sortie latente en image visible

Cliquez sur Queue Prompt et votre première génération Flux 2 démarre.

Carnet ouvert avec un organigramme d’installation manuscrit présentant les étapes de configuration locale de Flux 2

Installer Flux 2 via Diffusers

Pour les flux de travail par script et le développement d’applications, la bibliothèque diffusers de Hugging Face offre le contrôle le plus fin sur chaque aspect de la génération d’images.

Éditeur de code Python sur écran d’ordinateur portable affichant un script d’inférence Flux 2 avec coloration syntaxique

Créer un environnement virtuel Python

Isolez toujours vos projets d’IA dans un environnement virtuel pour éviter les conflits de paquets entre projets.

python -m venv flux2-env

# Windows activation
flux2-env\Scripts\activate

# Linux and macOS activation
source flux2-env/bin/activate

Installer les bons paquets

pip install --upgrade pip
pip install torch torchvision --index-url https://download.pytorch.org/whl/cu121
pip install diffusers transformers accelerate sentencepiece protobuf
pip install huggingface_hub

Pour la prise en charge de la quantification GGUF sur les cartes à faible VRAM :

pip install gguf

💡 Astuce : après une installation fonctionnelle, exécutez pip freeze > requirements.txt pour figer vos versions. La bibliothèque diffusers se met souvent à jour, et des changements incompatibles occasionnels touchent l’API du pipeline Flux.

Écrire et lancer votre script d’inférence

Un script minimal fonctionnel pour flux-2-dev :

import torch
from diffusers import FluxPipeline

pipe = FluxPipeline.from_pretrained(
    "black-forest-labs/FLUX.2-dev",
    torch_dtype=torch.bfloat16
)
pipe.enable_model_cpu_offload()

prompt = "A photorealistic portrait of a woman in soft natural light, film grain, 8K"

image = pipe(
    prompt,
    height=1024,
    width=1024,
    guidance_scale=3.5,
    num_inference_steps=28,
    max_sequence_length=512,
    generator=torch.Generator("cpu").manual_seed(42)
).images[0]

image.save("flux2_output.png")

Lancez-le avec :

python generate.py

La première exécution télécharge environ 24 Go de poids du modèle. Les exécutions suivantes se chargent depuis le cache en 30 secondes environ sur un SSD NVMe récent.

Fenêtre de terminal sur écran affichant les commandes d’installation pip de Python et des barres de progression de téléchargement vertes

Exécuter Flux 2 sur du matériel à faible VRAM

Tout le monde ne dispose pas d’un GPU de 24 Go. Ces deux stratégies vous permettent de faire tourner Flux 2 sur des cartes de 8 à 12 Go sans sacrifier la qualité d’image qui fait l’intérêt du modèle.

Modèles GGUF quantifiés

GGUF est un format de quantification issu de l’écosystème llama.cpp, désormais adapté aux modèles de diffusion d’images. Il réduit la précision du modèle, passant de flottants 16 bits à des entiers 4 ou 8 bits, ce qui diminue les besoins en VRAM de 50 à 75 %.

Des fichiers GGUF quantifiés par la communauté pour Flux 2 sont disponibles sur Hugging Face. Voici le compromis concret à chaque niveau de quantification :

FichierUtilisation de la VRAMQualité
flux2-dev-Q8_0.gguf~10 GoQuasi sans perte
flux2-dev-Q4_K_S.gguf~6 GoBonne, légère perte de netteté
flux2-dev-Q3_K_M.gguf~5 GoAcceptable pour des tests rapides

Dans ComfyUI, installez l’extension personnalisée ComfyUI-GGUF, puis chargez le fichier de checkpoint .gguf comme vous chargeriez n’importe quel checkpoint .safetensors. Aucune autre modification du flux de travail n’est nécessaire.

Déchargement sur le CPU et précision fp8

Deux autres stratégies de réduction de la mémoire qui se combinent bien :

Chargement du transformeur en fp8 dans Diffusers :

from diffusers import FluxPipeline, FluxTransformer2DModel
import torch

transformer = FluxTransformer2DModel.from_pretrained(
    "black-forest-labs/FLUX.2-dev",
    subfolder="transformer",
    torch_dtype=torch.float8_e4m3fn
)
pipe = FluxPipeline.from_pretrained(
    "black-forest-labs/FLUX.2-dev",
    transformer=transformer,
    torch_dtype=torch.bfloat16
)
pipe.enable_model_cpu_offload()

Déchargement séquentiel sur le CPU (plus lent, mais fonctionne sur les cartes de 8 Go) :

pipe.enable_sequential_cpu_offload()

💡 Astuce : combinez GGUF Q4_K_S avec enable_model_cpu_offload() pour le meilleur équilibre sur les cartes de 8 Go. Comptez 3 à 5 minutes par image de 1024x1024, ce qui reste tout à fait viable pour un travail personnel itératif.

Utiliser Flux 2 sur PicassoIA

Si vous voulez essayer Flux 2 avant de vous engager dans une installation locale complète, ou si vous avez besoin des versions Pro et Max, disponibles uniquement dans le cloud, PicassoIA propose tous les modèles Flux 2 directement dans le navigateur, sans aucune installation.

Salle de serveurs domestique avec plusieurs ordinateurs équipés de GPU, disposés sur des étagères en fil métallique avec gestion des câbles

Exécuter Flux 2 Pro sans configuration locale

flux-2-pro et flux-2-max ne sont pas disponibles sous forme de poids téléchargeables. Ils fonctionnent exclusivement via une API cloud. PicassoIA donne accès à ces deux versions dans le navigateur, ainsi qu’à flux-2-flex pour des dimensions de sortie souples et à flux-2-klein-4b pour une génération rapide.

Étapes pour générer avec Flux 2 sur PicassoIA :

  1. Ouvrez la page de flux-2-pro dans votre navigateur
  2. Saisissez votre prompt dans le champ de texte
  3. Réglez les dimensions et le nombre d’étapes d’inférence souhaités (28 est le point idéal pour les versions dev)
  4. Cliquez sur Generate
  5. Téléchargez ou partagez le résultat directement depuis l’interface

Pour une qualité comparable à celle de flux-2-dev exécuté en local sur un GPU de 24 Go, l’implémentation de PicassoIA produit des résultats équivalents, sans aucun temps de configuration.

Astuces de prompt qui fonctionnent avec toutes les versions

Flux 2 répond bien aux prompts en langage naturel. Inutile de recourir à des crochets pondérés ou à un empilement de tokens. Décrivez ce que vous voulez sous la forme d’une phrase claire et précise.

Ce qui fonctionne bien :

  • Une description explicite de la lumière : « lumière douce du matin venant de la gauche, volumétrique »
  • L’action et la position du sujet : « une femme debout devant un plan de travail de cuisine, regardant ses mains »
  • Une référence de style : « photographie argentique, Kodak Portra 400, objectif 35 mm f/2.0 »
  • Le cadrage : « portrait en gros plan, faible profondeur de champ, sujet net, arrière-plan flou »

À éviter :

  • Empiler plus de trois ou quatre sujets distincts dans un même prompt
  • Des prompts dépassant 300 tokens (l’encodeur T5 prend en charge jusqu’à 512, mais la qualité se dégrade au-delà de 300)
  • Des descripteurs émotionnels vagues sans ancrage visuel (« mélancolie » seul ne donne rien au modèle à rendre)

💡 Astuce : pour flux-2-klein-4b, gardez le guidance scale entre 2,5 et 4,0. Des valeurs plus élevées sursaturent les couleurs sur le modèle plus petit.

Commencez à générer dès maintenant

Que vous ayez suivi la voie ComfyUI, écrit un script Diffusers ou ouvert flux-2-pro sur PicassoIA, vous disposez désormais de tout ce qu’il faut pour travailler avec Flux 2.

Écran haute résolution affichant un portrait photoréaliste généré par IA, illustrant la qualité des rendus de Flux 2

La vraie valeur de Flux 2 en local, ou via une plateforme comme PicassoIA, c’est la vitesse d’itération. Rédigez un prompt, obtenez un résultat en moins d’une minute, affinez la description et générez à nouveau. C’est dans cette boucle de retour rapide que se développent les vrais savoir-faire en écriture de prompts et en réglage des paramètres.

PicassoIA vous donne un accès immédiat à flux-2-dev, flux-2-pro, flux-2-max, flux-2-flex et à la version efficace flux-2-klein-4b, sans configuration CUDA, sans téléchargement de 24 Go de poids et sans environnement virtuel à mettre en place. C’est le moyen le plus rapide de faire un benchmark de ce que chaque version produit réellement avant de décider si une installation locale complète vaut l’investissement pour votre flux de travail.

Vue par-dessus l’épaule d’une personne examinant des images générées par Flux 2 sur l’écran d’un poste de travail

Commencez par un prompt qui compte pour vous. Lancez-le sur flux-2-dev, puis comparez le résultat avec flux-2-klein-4b. Notez ce qui change entre les deux. Cette comparaison vous indique précisément quel investissement matériel se justifie pour votre usage, sans rien laisser au hasard.

Partager cet article

Choisissez votre langue