Comment installer Flux 2 en local sur votre ordinateur
Faire tourner Flux 2 sur votre propre matériel, c’est l’assurance de n’avoir aucune limite de requêtes, aucun frais et un contrôle total sur chaque paramètre. Cet article présente deux méthodes d’installation, ComfyUI pour un flux de travail visuel sans code et Hugging Face Diffusers pour un contrôle par script, ainsi que l’optimisation de la VRAM pour les cartes de 8 Go, et la façon d’accéder à Flux 2 Pro sans aucune installation locale.
Faire tourner un modèle texte vers image de pointe directement sur votre machine change toute votre façon de travailler. Plus de plafond d’utilisation, plus de files d’attente, plus d’abonnement qui grignote chaque essai. Flux 2, signé Black Forest Labs, est l’un des modèles de génération d’images à poids ouverts les plus performants disponibles aujourd’hui, et son installation locale est plus accessible qu’on ne le pense. Cet article détaille toute la démarche, de la configuration requise à votre première image générée.
Ce qu’est vraiment Flux 2
Flux 2 est la deuxième génération de l’architecture Flux, développée par Black Forest Labs, l’équipe derrière certains des modèles à poids ouverts les plus photoréalistes disponibles aujourd’hui. Il s’appuie sur la famille originale Flux.1 avec un meilleur respect des prompts, une précision anatomique accrue sur les sujets humains et un rendu des détails plus net aux résolutions standard. Le modèle repose sur une architecture de diffusion à base de transformeurs, qui se distingue fondamentalement des conceptions U-Net des anciens modèles Stable Diffusion.
La gamme de modèles
La famille Flux 2 se décline en plusieurs versions distinctes, chacune visant un niveau de matériel et un usage différents :
Pour une installation locale, flux-2-dev et flux-2-klein-4b sont vos cibles principales. Les versions Pro, Max et Flex fonctionnent exclusivement via API et ne sont pas distribuées sous forme de poids téléchargeables.
Pourquoi l’exécuter en local
Au-delà de l’économie d’argent, les raisons sont concrètes. L’inférence locale signifie que vos prompts et vos images générées ne quittent jamais votre machine, ce qui compte pour un travail commercial sur des sujets sensibles. Vous contrôlez directement chaque paramètre d’échantillonnage. Vous pouvez traiter par lots des centaines d’images pendant la nuit sans vous soucier d’une facturation à la génération. Et pour le fine-tuning sur des jeux de données personnalisés ou l’ajout d’adaptateurs LoRA, l’installation locale est la seule voie viable.
Ce dont votre machine a besoin
Avant de télécharger quoi que ce soit, vérifiez votre matériel et votre environnement logiciel par rapport à ces exigences. Des dépendances mal alignées sont à l’origine de la plupart des échecs d’installation courants.
Exigences en GPU et en VRAM
Flux 2 est très exigeant en calcul. Voici le bilan, sans détour :
Configuration minimale viable :
GPU NVIDIA avec au moins 8 Go de VRAM (RTX 3070, RTX 4060 Ti ou équivalent)
Les GPU AMD fonctionnent via ROCm sous Linux, mais la prise en charge des pilotes sous Windows est inégale. Attendez-vous à davantage de dépannage qu’avec les configurations CUDA.
Les Apple Silicon (M1/M2/M3/M4) peuvent exécuter des versions quantifiées de Flux 2 via le framework MLX. Les temps de génération sont 2 à 4 fois plus longs qu’avec une carte NVIDIA comparable, mais la qualité d’image est équivalente.
💡 Astuce : si votre GPU dispose exactement de 8 Go de VRAM, utilisez la quantification GGUF Q4_K_S. La qualité baisse légèrement, mais le modèle tourne sans erreur de mémoire sur la plupart des prompts.
Python, CUDA et pilotes
Votre environnement logiciel doit être aligné avant que toute installation de paquets Python fonctionne correctement :
Pilote NVIDIA : version 525 ou plus récente. Vérifiez-la avec nvidia-smi dans un terminal.
CUDA Toolkit : version 11.8 ou 12.x. Faites correspondre la version à celle de votre PyTorch installé.
Python : 3.10 ou 3.11 sont les plus adaptés. Évitez la 3.12 tant que la prise en charge par les bibliothèques n’est pas stabilisée.
Git : nécessaire pour cloner les dépôts.
Sous Windows, installez CUDA depuis le portail développeur de NVIDIA. Sous Ubuntu 22.04 ou plus récent, l’installeur runfile évite les conflits de paquets avec les pilotes préinstallés.
Deux voies pour l’installation locale
Deux méthodes bien prises en charge existent pour faire tourner Flux 2 en local. Aucune n’est objectivement meilleure, et le bon choix dépend entièrement de votre façon de travailler.
ComfyUI (la voie visuelle)
ComfyUI est une interface graphique à base de nœuds pour exécuter des modèles de diffusion. Vous reliez des nœuds sur un canevas visuel pour construire vos pipelines de génération. Aucun script Python n’est nécessaire après la configuration initiale. Pour la plupart des utilisateurs, c’est le chemin le plus rapide de zéro à une installation de Flux 2 fonctionnelle.
Choisissez ComfyUI si :
vous voulez un flux de travail visuel, sans code
vous comptez tester différents samplers et configurations de planification
vous voulez partager ou importer des flux de travail de la communauté sous forme de fichiers JSON
Hugging Face Diffusers (la voie du code)
La bibliothèque diffusers est l’API Python de référence pour exécuter des modèles de diffusion par programmation. Vous écrivez des scripts d’inférence et gardez un contrôle total sur chaque paramètre, du type de précision aux schedulers personnalisés.
Choisissez Diffusers si :
vous construisez une application ou un pipeline d’automatisation
vous avez besoin de traitements par lots avec une logique métier spécifique
vous voulez fine-tuner ou entraîner des adaptateurs LoRA sur des données personnalisées
Installer Flux 2 via ComfyUI
C’est la voie recommandée pour la plupart des utilisateurs qui veulent des résultats rapidement, sans écrire de code.
Configurer ComfyUI sous Windows ou Linux
Étape 1 : clonez le dépôt ComfyUI et entrez dans le dossier :
git clone https://github.com/comfyanonymous/ComfyUI
cd ComfyUI
Étape 2 : installez PyTorch avec la prise en charge de CUDA. Utilisez le sélecteur de pytorch.org pour obtenir la commande correspondant à votre version de CUDA. Pour CUDA 12.1 :
Étape 3 : installez les autres dépendances de ComfyUI :
pip install -r requirements.txt
Étape 4 : lancez le serveur :
python main.py --gpu-only
Ouvrez http://127.0.0.1:8188 dans votre navigateur. ComfyUI est maintenant en marche.
💡 Astuce : sous Windows, la version portable autonome publiée sur la page GitHub officielle de ComfyUI inclut Python et PyTorch préinstallés. Elle démarre d’un double-clic et évite entièrement la plupart des problèmes de configuration de l’environnement.
Télécharger les checkpoints de Flux 2
Les poids de Flux 2 sont hébergés sur Hugging Face. Il vous faut un compte gratuit et vous devez accepter l’accord de licence du modèle sur sa page avant que le téléchargement n’aboutisse.
Pour flux-2-dev (nécessite 16 Go de VRAM ou plus) :
Vous avez aussi besoin des encodeurs de texte et du VAE partagés. Ces composants sont réutilisés par toutes les versions de Flux :
# T5 text encoder in fp8 (saves approximately 8 GB VRAM vs full precision)
huggingface-cli download comfyanonymous/flux_text_encoders \
t5xxl_fp8_e4m3fn.safetensors \
--local-dir ./models/clip/
# CLIP text encoder
huggingface-cli download openai/clip-vit-large-patch14 \
--local-dir ./models/clip/
# VAE (shared from Flux.1)
huggingface-cli download black-forest-labs/FLUX.1-schnell \
ae.safetensors \
--local-dir ./models/vae/
Lancer votre premier prompt
Chargez le fichier JSON officiel du flux de travail Flux dans ComfyUI via le bouton Load. Les principaux nœuds à configurer sont :
CLIPTextEncode : votre texte de prompt positif
KSampler : réglez steps sur 28 et cfg sur 1,0 pour flux-2-dev
EmptyLatentImage : réglez la résolution cible (1024x1024 est un bon point de départ)
VAEDecode : convertit la sortie latente en image visible
Cliquez sur Queue Prompt et votre première génération Flux 2 démarre.
Installer Flux 2 via Diffusers
Pour les flux de travail par script et le développement d’applications, la bibliothèque diffusers de Hugging Face offre le contrôle le plus fin sur chaque aspect de la génération d’images.
Créer un environnement virtuel Python
Isolez toujours vos projets d’IA dans un environnement virtuel pour éviter les conflits de paquets entre projets.
python -m venv flux2-env
# Windows activation
flux2-env\Scripts\activate
# Linux and macOS activation
source flux2-env/bin/activate
Pour la prise en charge de la quantification GGUF sur les cartes à faible VRAM :
pip install gguf
💡 Astuce : après une installation fonctionnelle, exécutez pip freeze > requirements.txt pour figer vos versions. La bibliothèque diffusers se met souvent à jour, et des changements incompatibles occasionnels touchent l’API du pipeline Flux.
import torch
from diffusers import FluxPipeline
pipe = FluxPipeline.from_pretrained(
"black-forest-labs/FLUX.2-dev",
torch_dtype=torch.bfloat16
)
pipe.enable_model_cpu_offload()
prompt = "A photorealistic portrait of a woman in soft natural light, film grain, 8K"
image = pipe(
prompt,
height=1024,
width=1024,
guidance_scale=3.5,
num_inference_steps=28,
max_sequence_length=512,
generator=torch.Generator("cpu").manual_seed(42)
).images[0]
image.save("flux2_output.png")
Lancez-le avec :
python generate.py
La première exécution télécharge environ 24 Go de poids du modèle. Les exécutions suivantes se chargent depuis le cache en 30 secondes environ sur un SSD NVMe récent.
Exécuter Flux 2 sur du matériel à faible VRAM
Tout le monde ne dispose pas d’un GPU de 24 Go. Ces deux stratégies vous permettent de faire tourner Flux 2 sur des cartes de 8 à 12 Go sans sacrifier la qualité d’image qui fait l’intérêt du modèle.
Modèles GGUF quantifiés
GGUF est un format de quantification issu de l’écosystème llama.cpp, désormais adapté aux modèles de diffusion d’images. Il réduit la précision du modèle, passant de flottants 16 bits à des entiers 4 ou 8 bits, ce qui diminue les besoins en VRAM de 50 à 75 %.
Des fichiers GGUF quantifiés par la communauté pour Flux 2 sont disponibles sur Hugging Face. Voici le compromis concret à chaque niveau de quantification :
Fichier
Utilisation de la VRAM
Qualité
flux2-dev-Q8_0.gguf
~10 Go
Quasi sans perte
flux2-dev-Q4_K_S.gguf
~6 Go
Bonne, légère perte de netteté
flux2-dev-Q3_K_M.gguf
~5 Go
Acceptable pour des tests rapides
Dans ComfyUI, installez l’extension personnalisée ComfyUI-GGUF, puis chargez le fichier de checkpoint .gguf comme vous chargeriez n’importe quel checkpoint .safetensors. Aucune autre modification du flux de travail n’est nécessaire.
Déchargement sur le CPU et précision fp8
Deux autres stratégies de réduction de la mémoire qui se combinent bien :
Chargement du transformeur en fp8 dans Diffusers :
Déchargement séquentiel sur le CPU (plus lent, mais fonctionne sur les cartes de 8 Go) :
pipe.enable_sequential_cpu_offload()
💡 Astuce : combinez GGUF Q4_K_S avec enable_model_cpu_offload() pour le meilleur équilibre sur les cartes de 8 Go. Comptez 3 à 5 minutes par image de 1024x1024, ce qui reste tout à fait viable pour un travail personnel itératif.
Utiliser Flux 2 sur PicassoIA
Si vous voulez essayer Flux 2 avant de vous engager dans une installation locale complète, ou si vous avez besoin des versions Pro et Max, disponibles uniquement dans le cloud, PicassoIA propose tous les modèles Flux 2 directement dans le navigateur, sans aucune installation.
Exécuter Flux 2 Pro sans configuration locale
flux-2-pro et flux-2-max ne sont pas disponibles sous forme de poids téléchargeables. Ils fonctionnent exclusivement via une API cloud. PicassoIA donne accès à ces deux versions dans le navigateur, ainsi qu’à flux-2-flex pour des dimensions de sortie souples et à flux-2-klein-4b pour une génération rapide.
Réglez les dimensions et le nombre d’étapes d’inférence souhaités (28 est le point idéal pour les versions dev)
Cliquez sur Generate
Téléchargez ou partagez le résultat directement depuis l’interface
Pour une qualité comparable à celle de flux-2-dev exécuté en local sur un GPU de 24 Go, l’implémentation de PicassoIA produit des résultats équivalents, sans aucun temps de configuration.
Astuces de prompt qui fonctionnent avec toutes les versions
Flux 2 répond bien aux prompts en langage naturel. Inutile de recourir à des crochets pondérés ou à un empilement de tokens. Décrivez ce que vous voulez sous la forme d’une phrase claire et précise.
Ce qui fonctionne bien :
Une description explicite de la lumière : « lumière douce du matin venant de la gauche, volumétrique »
L’action et la position du sujet : « une femme debout devant un plan de travail de cuisine, regardant ses mains »
Une référence de style : « photographie argentique, Kodak Portra 400, objectif 35 mm f/2.0 »
Le cadrage : « portrait en gros plan, faible profondeur de champ, sujet net, arrière-plan flou »
À éviter :
Empiler plus de trois ou quatre sujets distincts dans un même prompt
Des prompts dépassant 300 tokens (l’encodeur T5 prend en charge jusqu’à 512, mais la qualité se dégrade au-delà de 300)
Des descripteurs émotionnels vagues sans ancrage visuel (« mélancolie » seul ne donne rien au modèle à rendre)
💡 Astuce : pour flux-2-klein-4b, gardez le guidance scale entre 2,5 et 4,0. Des valeurs plus élevées sursaturent les couleurs sur le modèle plus petit.
Commencez à générer dès maintenant
Que vous ayez suivi la voie ComfyUI, écrit un script Diffusers ou ouvert flux-2-pro sur PicassoIA, vous disposez désormais de tout ce qu’il faut pour travailler avec Flux 2.
La vraie valeur de Flux 2 en local, ou via une plateforme comme PicassoIA, c’est la vitesse d’itération. Rédigez un prompt, obtenez un résultat en moins d’une minute, affinez la description et générez à nouveau. C’est dans cette boucle de retour rapide que se développent les vrais savoir-faire en écriture de prompts et en réglage des paramètres.
PicassoIA vous donne un accès immédiat à flux-2-dev, flux-2-pro, flux-2-max, flux-2-flex et à la version efficace flux-2-klein-4b, sans configuration CUDA, sans téléchargement de 24 Go de poids et sans environnement virtuel à mettre en place. C’est le moyen le plus rapide de faire un benchmark de ce que chaque version produit réellement avant de décider si une installation locale complète vaut l’investissement pour votre flux de travail.
Commencez par un prompt qui compte pour vous. Lancez-le sur flux-2-dev, puis comparez le résultat avec flux-2-klein-4b. Notez ce qui change entre les deux. Cette comparaison vous indique précisément quel investissement matériel se justifie pour votre usage, sans rien laisser au hasard.