La plupart des personnes qui cherchent un agent IA gratuit pour les images veulent la même chose : taper une demande, obtenir une image finie et ne jamais voir de facture. Le problème, c’est que le mot « agent » cache deux tâches distinctes. Une partie réfléchit : elle lit votre demande, rédige un prompt plus précis, vérifie le résultat et recommence si besoin. L’autre partie peint : un modèle de diffusion qui transforme ce prompt en pixels. Vous pouvez faire tourner les deux sur un PC domestique pour zéro dollar par mois, mais seulement si les éléments correspondent à votre carte graphique.
Cet article compare les configurations que les particuliers utilisent réellement chez eux, indique le matériel nécessaire à chacune et désigne un choix clair pour la plupart des lecteurs. Il signale aussi où une configuration locale atteint ses limites, car faire comme si ce n’était jamais le cas vous ferait perdre votre week-end.
Ce qu’est vraiment un agent d’image

Le cerveau et le pinceau
Un générateur d’images classique prend un prompt et renvoie une image. Un agent ajoute une boucle autour. Un modèle de langage lit votre objectif (« une photo de produit d’une tasse en céramique sur une toile de lin, lumière du matin »), le développe en un prompt détaillé, appelle l’outil de génération, examine le résultat et décide de le garder ou de recommencer.
Pour une installation locale, le cerveau est généralement un petit modèle de langage à poids ouverts servi par Ollama ou LM Studio. Parmi les candidats de taille adaptée au local, on trouve IBM Granite 4.1 8B et GPT OSS 20B. Le pinceau est un modèle de diffusion qui tourne dans ComfyUI, InvokeAI, Forge ou une interface similaire.
Pourquoi le gratuit et le local comptent
Faire tourner les outils en local supprime trois désagréments récurrents :
- Aucuns frais par image. Votre coût se limite à l’électricité et à la carte que vous possédez déjà.
- Aucune file d’attente. Le trafic des autres ne ralentit pas vos lots.
- Confidentialité totale. Les photos de référence, les fichiers clients et les produits non annoncés ne quittent jamais votre machine.
💡 Test rapide : si vous générez moins de quelques dizaines d’images par mois, une installation locale peut vous coûter plus de temps de configuration qu’elle n’en fait gagner. Si vous en générez des centaines, elle se rentabilise vite.
Le matériel nécessaire, d’abord

La VRAM décide presque de tout
La mémoire vidéo de votre carte graphique est le premier filtre. La vitesse du processeur et la RAM système comptent beaucoup moins. Le tableau ci-dessous donne des paliers indicatifs et pratiques. Les valeurs exactes varient selon la version du modèle, le niveau de quantification et la résolution demandée.
| Mémoire vidéo | Modèles d’image qui fonctionnent bien | Modèle de langage compatible en parallèle | Ce qu’il faut attendre |
|---|
| 4 Go | Modèles anciens et petits | 3B en 4 bits | Lent, faible résolution |
| 6 à 8 Go | SDXL avec déchargement en mémoire, modèles turbo compacts | 7B à 8B en 4 bits | Images 1024 px utilisables en moins d’une minute |
| 12 Go | SDXL sans difficulté, variantes quantifiées de FLUX | 8B en 4 bits | Travail quotidien fluide |
| 16 à 24 Go | FLUX 2 Dev et Qwen Image 2512 en précision réduite | Classe 20B | La meilleure qualité disponible en local |
Le modèle d’image et le modèle de langage se disputent la même mémoire. La solution pratique est simple : laissez ComfyUI décharger les modèles entre les étapes, et réglez la valeur keep_alive d’Ollama sur une valeur basse pour que le modèle de langage quitte la mémoire une fois le prompt rédigé. Par défaut, Ollama garde un modèle chargé pendant cinq minutes, ce qui est bien trop long sur une carte de 8 Go.
Processeur seul et Apple Silicon
Pas de carte graphique dédiée ? Vous avez encore des options, mais plus lentes. Les Mac Apple Silicon partagent la mémoire entre le processeur et le GPU, si bien qu’une machine de 32 Go peut charger des modèles étonnamment grands. Des applications gratuites comme Draw Things sont conçues autour de ce fonctionnement. Un PC sans GPU ne fait tourner que de très petits modèles, et il faut compter des minutes par image plutôt que des secondes.

Les meilleurs ensembles d’outils locaux, classés
Voici le classement honnête, de la plus puissante à la plus accessible aux débutants. Chaque outil ci-dessous est gratuit à télécharger.
| Ensemble d’outils | Idéale pour | Prête pour un agent | Effort d’installation |
|---|
| ComfyUI plus Ollama ou LM Studio | Utilisateurs avancés, pipelines reproductibles | Oui, serveur d’API intégré | Élevé |
| Open WebUI plus Ollama | Interface d’agent de type chat | Oui, se connecte à ComfyUI | Moyen |
| InvokeAI | Retouche sur canevas, interface soignée | En partie, dispose d’une API | Faible à moyen |
| Forge | Interface WebUI familière, moins de mémoire utilisée | Oui, avec l’option API | Moyen |
| Fooocus | Premiers utilisateurs | Limité | Faible |
ComfyUI plus un modèle de langage local
C’est le meilleur choix global. ComfyUI est un outil à base de nœuds où chaque étape d’une génération est un bloc visible. Cela peut intimider, mais c’est précisément ce qui le rend compatible avec un agent. Tout workflow peut être exporté au format API et déclenché par un appel HTTP sur le port local (8188 par défaut). Votre modèle de langage rédige le prompt, l’insère dans le JSON du workflow, l’envoie et récupère le fichier final.
Pourquoi il l’emporte :
- Il prend en charge la gamme la plus large de modèles d’image, y compris les familles SDXL, FLUX et Qwen Image.
- Les workflows sont enregistrés sous forme de fichiers, donc un bon résultat est reproductible.
- Des serveurs MCP pour ComfyUI, développés par la communauté, existent et permettent à des modèles capables d’appeler des outils de le piloter directement. Vérifiez l’activité récente de chaque projet avant de lui faire confiance.
💡 Astuce : construisez et testez d’abord un workflow à la main. Un agent ne peut répéter qu’un pipeline qui fonctionne déjà.

Open WebUI avec Ollama
Si vous voulez dialoguer avec votre agent au lieu de câbler du JSON, Open WebUI est la voie la plus accessible. Elle offre une interface de chat pour les modèles locaux et peut envoyer les demandes d’image à ComfyUI ou à un backend compatible AUTOMATIC1111. Vous tapez « faites trois variations d’une rue pluvieuse au crépuscule » et la fenêtre de chat s’occupe du reste. Elle est moins souple qu’un script ComfyUI brut, mais vous pouvez être productif dès l’après-midi.
InvokeAI pour la retouche manuelle
InvokeAI est open source et construit autour d’un canevas. Vous peignez, masquez et régénérez des zones directement sur l’image, ce qui convient aux illustrateurs et aux photographes qui retouchent davantage qu’ils ne rédigent de prompts. C’est moins un outil d’agent pur, mais son API et son interface épurée en font une seconde installation solide à côté de ComfyUI.
Forge et Fooocus pour des débuts rapides
Forge est une version allégée de l’interface classique AUTOMATIC1111. Elle gère la mémoire avec plus de précision, ce qui profite davantage aux cartes anciennes. Fooocus cache presque tous les réglages derrière une seule zone de prompt, ce qui en fait le point d’entrée le plus doux. Il est en mode de maintenance limitée : considérez-le comme un outil de démarrage plutôt que comme une solution à long terme.
Quels modèles d’image faire tourner

L’agent ne vaut que par son pinceau. Voici comment se positionnent les modèles courants, et chacun dispose d’une page sur PicassoIA où vous pouvez l’essayer avant de passer une heure à télécharger les poids.
Les choix petits et rapides
Si votre carte dispose de 8 Go ou moins, commencez avec SDXL ou Z-Image Turbo. Les modèles de style turbo n’ont besoin que de quelques étapes, ce qui compte beaucoup lorsqu’un agent peut demander quatre ou cinq essais par requête. Un modèle qui met trois secondes par essai vaut mieux qu’un modèle plus joli qui en met quatre-vingt-dix.
Les choix qualité pour les cartes plus puissantes
Avec 16 Go ou plus, FLUX 2 Dev et Qwen Image 2512 offrent la peau, les tissus et l’éclairage les plus convaincants que vous puissiez obtenir chez vous. Les versions quantifiées sacrifient un peu de détail pour une mémoire nettement moindre, et ce compromis en vaut souvent la peine.
Lisez d’abord la fiche de licence. « Gratuit au téléchargement » et « gratuit pour tout usage » sont deux choses différentes. SDXL est publié sous une licence open source permissive. Stable Diffusion 3.5 est gratuit pour les petites entreprises selon les conditions communautaires de Stability. Les poids ouverts des plus grands modèles FLUX sont souvent soumis à des conditions non commerciales. Vérifiez la fiche du modèle avant de vendre quoi que ce soit créé avec eux.
Adaptez le modèle à votre carte
Voici la version courte, selon votre situation :
- Carte de 8 Go, première fois : Fooocus ou Forge avec SDXL, puis ajoutez Open WebUI une fois à l’aise.
- Carte de 12 Go, vous voulez de l’automatisation : ComfyUI avec un petit modèle capable d’appeler des outils, comme IBM Granite 4.1 8B.
- Carte de 16 à 24 Go, vous voulez la meilleure qualité : ComfyUI avec FLUX 2 Dev ou Qwen Image 2512, et un modèle de langage de classe 20B.
- Utilisateur de Mac : Draw Things pour un travail rapide, ComfyUI si vous voulez un pipeline d’agent.
- Pas de matériel suffisant : évitez l’installation et utilisez les mêmes modèles sur PicassoIA.

Prompt, génération, évaluation, nouvel essai
Tout agent d’image opérationnel répète quatre étapes :
- Prompt. Le modèle de langage réécrit votre courte demande en une version détaillée : sujet, décor, lumière, objectif, ambiance.
- Génération. Il appelle l’outil d’image avec ce prompt et une taille fixe.
- Évaluation. Un modèle capable de voir les images, ou un jeu de règles simple, vérifie le résultat pour repérer les défauts évidents, comme des mains déformées ou des couleurs fausses.
- Nouvel essai. Si la vérification échoue, il ajuste le prompt ou le seed et relance, jusqu’à une limite que vous fixez.
Fixez cette limite. Sans un plafond de trois ou quatre essais, une demande tenace peut occuper votre GPU toute la nuit.
Connecter les outils via MCP
Le Model Context Protocol donne au modèle de langage une manière standard d’appeler des outils externes. LM Studio peut jouer le rôle d’hôte MCP, et les modèles d’Ollama capables d’appeler des outils peuvent piloter des configurations similaires grâce à de petits scripts de pont. En pratique, vous enregistrez un outil unique (« generate_image ») qui transmet le prompt à ComfyUI et renvoie un chemin de fichier. Gardez l’outil simple. Un outil qui n’accepte qu’un prompt, un format et un seed est plus facile à appeler correctement pour un petit modèle qu’un outil doté de vingt options.
💡 Règle de fiabilité : les petits modèles de langage échouent avec les schémas d’outils longs. Moins de paramètres signifient moins d’appels erronés.
Là où le local atteint ses limites

Le vrai coût du gratuit
Le local ne coûte rien en argent, mais il consomme beaucoup d’attention. Attendez-vous à une soirée d’installation, à quelques problèmes de pilotes et à une maintenance continue à chaque mise à jour des outils. L’électricité est un coût plus modeste qu’on ne le craint. Une carte de 300 W fonctionnant une heure à 15 centimes le kilowattheure coûte environ 4,5 centimes. La chaleur et le bruit des ventilateurs sont des désagréments quotidiens plus importants, surtout dans une petite pièce.
Les ordinateurs portables ont leurs propres limites. Un portable doté d’une puce graphique modeste peut faire tourner SDXL, mais il ralentira lorsqu’il chauffe et videra rapidement sa batterie. Si vous travaillez depuis des cafés ou des trains, une configuration locale installée sur votre ordinateur de bureau est difficile d’accès, et les modèles légers sur portable n’égaleront pas ce que produit une carte de bureau.
La solution hébergée de secours
Lorsque la tâche dépasse les capacités de votre carte, ou que vous êtes loin de votre bureau, une solution hébergée prend le relais. PicassoIA propose un vaste catalogue de texte vers image, ce qui vous permet de tester FLUX 2 Dev, Qwen Image 2512, P-Image et Seedream 4.5 sans rien télécharger. Il héberge aussi un modèle compatible avec n’importe quel workflow ComfyUI, utile si vous avez déjà construit un pipeline et souhaitez l’exécuter sur un matériel plus puissant. Beaucoup de lecteurs finissent par adopter une approche hybride : en local pour les brouillons et le travail privé, en hébergé pour les rendus finaux les plus lourds.

C’est la même boucle qu’un agent local, réalisée à la main, et c’est un moyen rapide de voir ce qu’un modèle sait faire avant de consacrer de l’espace disque à son téléchargement.
- Ouvrez la page du modèle. Rendez-vous sur FLUX 2 Dev dans la collection texte vers image.
- Rédigez le prompt par couches. Nommez d’abord le sujet, puis le décor, la lumière et l’objectif. Par exemple : « une tasse en céramique sur une toile de lin, lumière douce de fenêtre venant de la gauche, objectif 50 mm, faible profondeur de champ, grain de film ».
- Choisissez le format selon la destination. Utilisez 16:9 pour les bannières de blog, 1:1 pour les photos de produits et 9:16 pour les stories.
- Conservez le seed. Lorsque la composition est juste mais qu’un détail cloche, gardez le même seed et modifiez une seule formule dans le prompt. Changer cinq éléments à la fois rend impossible de savoir ce qui a fonctionné.
- Générez deux ou trois variations et comparez. Gardez la meilleure, puis corrigez les petits défauts avec un modèle de retouche comme Qwen Image Edit 2511.
- Laissez un modèle de langage rédiger votre prochain prompt. Collez la description de votre résultat dans Kimi K2.6 et demandez trois variantes de prompt plus précises. C’est la moitié « cerveau » de l’agent, qui travaille pour vous.
💡 Astuce : tenez un fichier texte des prompts qui ont fonctionné. Il deviendra plus tard la bibliothèque de départ de votre agent local.
Essayez par vous-même sur PicassoIA
Vous n’avez pas besoin de trancher la question local ou hébergé avant de commencer. Ouvrez PicassoIA, choisissez un modèle de texte vers image et lancez le même prompt sur deux ou trois d’entre eux. En dix minutes, vous verrez quel style convient à votre travail, quel modèle mérite un téléchargement et le niveau de détail que vos prompts doivent contenir. Construisez ensuite votre agent local autour du modèle que vous savez déjà apprécier, et gardez Picasso IA ouvert pour les jours où votre propre carte mérite une pause.
Rédigez un prompt, lancez la génération et voyez à quoi ressemble votre idée.