Ideogram 4.0 : workflow ComfyUI, conseils de prompt et face à Krea 2
Un regard pratique sur Ideogram 4.0 dans ComfyUI : les cinq fichiers du modèle et leur emplacement, le fonctionnement des prompts JSON structurés, les habitudes de prompt qui tiennent la route, une comparaison avec Krea 2 sur le contrôle, le texte et le prix, et les réglages pour utiliser les deux sur PicassoIA.
Beaucoup de gens découvrent Ideogram 4.0 à travers une application en ligne et ne voient jamais ce qui le rend singulier : les poids sont ouverts, et ComfyUI propose un workflow prêt à l’emploi qui les fait tourner sur votre propre machine. Cela change ce que vous téléchargez, la manière d’écrire vos prompts et la façon dont le modèle se situe face à Krea 2, qui fonctionne à l’inverse avec un seul cadran de créativité et une série de références de style. Vous trouverez ci-dessous l’installation de ComfyUI fichier par fichier, le format de prompt JSON, les habitudes de prompt qui portent leurs fruits, une comparaison simple avec Krea 2 et un raccourci pour faire tourner les deux dans le navigateur sur PicassoIA.
Ce qu’est vraiment Ideogram 4.0
Ideogram s’est fait un nom grâce à une chose : un texte lisible à l’intérieur d’une image. La version 4.0 conserve cette force et ajoute une manière structurée de décrire une scène, pour qu’une affiche, une photo de produit ou un portrait soit composé comme une page plutôt que laissé au hasard.
Poids ouverts, pas seulement une API
Le changement notable concerne la mise à disposition du modèle. Le modèle a été publié avec des poids ouverts, et ComfyUI l’a pris en charge dès le premier jour, ce qui signifie que vous pouvez le faire tourner en local au lieu de payer chaque image sur le serveur de quelqu’un d’autre. La documentation de ComfyUI mentionne aussi une voie distincte, un nœud partenaire qui appelle le service hébergé ; vous choisissez donc entre des fichiers locaux et un appel distant selon votre matériel.
Deux formats de prompt
Vous pouvez écrire en langage naturel, ce qui convient aux idées rapides, ou utiliser une légende JSON structurée pour un contrôle précis de la mise en page, des couleurs et du style. La voie JSON est celle autour de laquelle le modèle a été conçu, et la plupart des discussions de la communauté tournent autour d’elle. Sur Ideogram v4 Quality, cette même distinction apparaît sous la forme de deux champs séparés : prompt pour le langage naturel et json_prompt pour la version structurée. Utilisez l’un ou l’autre, jamais les deux.
💡 Règle rapide : si l’image a une mise en page qui compte (une affiche, une étiquette, un produit sur un fond défini), utilisez le JSON. S’il s’agit d’une ambiance ou d’un portrait, le texte simple est plus rapide.
Installation de ComfyUI, fichier par fichier
L’installation en local consiste surtout à télécharger des fichiers. Le workflow officiel attend cinq fichiers dans des dossiers précis, et les mettre au mauvais endroit est la raison la plus fréquente pour laquelle le workflow refuse de se charger.
Les cinq fichiers du modèle
Fichier
Dossier
Taille
ideogram4_fp8_scaled.safetensors
models/diffusion_models/
environ 13,8 Go
ideogram4_unconditional_fp8_scaled.safetensors
models/diffusion_models/
environ 13,8 Go
qwen3vl_8b_fp8_scaled.safetensors
models/text_encoders/
environ 8 Go
gemma4_e4b_it_fp8_scaled.safetensors
models/text_encoders/
environ 2 Go
flux2-vae.safetensors
models/vae/
environ 335 Mo
Cela représente environ 38 Go sur le disque. Les fichiers proviennent du dépôt Comfy-Org/Ideogram-4 sur Hugging Face. Le deuxième fichier de diffusion gère la passe inconditionnelle, ce qui explique pourquoi le modèle n’a pas besoin de prompt négatif : le côté inconditionnel supprime simplement les tokens de texte, il n’y a donc aucune chaîne « à éviter » à remplir.
Charger le workflow
Téléchargez le fichier de workflow depuis la page de documentation de ComfyUI et glissez-le sur le canevas. Le graphe est court : un nœud sous-graphe Ideogram4 qui fait le gros du travail, un ResolutionSelector pour la taille de sortie, et un nœud Save Image. Si ComfyUI affiche des nœuds manquants en rouge, mettez d’abord ComfyUI à jour, car le workflow repose sur des ajouts récents.
Le workflow par défaut contient déjà un prompt JSON structuré. Modifiez cet exemple plutôt que de partir d’une case vide, car il montre exactement les champs attendus par le nœud. Si vous préférez construire vos prompts visuellement, le Ideogram 4 Prompt Builder de KJNodes vous permet de placer des éléments sur un canevas et écrit le JSON à votre place.
Vérification réaliste du matériel
Voici l’écart à connaître : la documentation n’indique ni chiffre de VRAM ni configuration minimale. La taille des fichiers en dit plus que la doc. Deux fichiers de diffusion de 13,8 Go plus un encodeur de texte de 8 Go supposent une carte avec beaucoup de mémoire, un stockage rapide et de la patience au premier chargement. Lancez le workflow par défaut une fois, observez votre utilisation de la mémoire, et ce n’est qu’ensuite que vous construirez un pipeline plus large autour. Si votre GPU est juste, la solution hébergée reste le plan B raisonnable.
Rédiger des prompts JSON qui fonctionnent
La légende structurée repose sur un résumé de scène, un bloc de style, un arrière-plan et, en option, des descriptions par objet avec des boîtes englobantes et des palettes de couleurs hexadécimales. Le workflow ComfyUI par défaut organise cela sous trois noms de niveau supérieur.
Les trois blocs principaux
high_level_description : une ou deux phrases qui nomment la scène entière.
style_description : objectif, éclairage, type de pellicule, ambiance. C’est ici que vivent des formules comme « photographie documentaire, lumière douce de fenêtre, grain fin ».
compositional_deconstruction : la liste des éléments, chacun avec une boîte, une description et une palette.
Boîtes et couleurs
Voici la forme d’un prompt, réduit à un seul élément :
{
"high_level_description": "A white ceramic mug on a walnut desk beside an open notebook, morning window light",
"style_description": "Documentary photograph, 50mm lens, soft shadows, fine film grain, natural colors",
"compositional_deconstruction": [
{
"description": "White ceramic mug with a thin blue rim, steam rising",
"bounding_box": [0.55, 0.40, 0.80, 0.75],
"colors": ["#F4F1EA", "#3C6E9E"]
}
]
}
Considérez cela comme une forme, pas comme un schéma. Les noms de champs exacts à l’intérieur de chaque élément et la manière dont les coordonnées des boîtes sont écrites viennent du workflow par défaut : copiez-les depuis là plutôt que depuis cette esquisse.
Les couleurs valent la peine de ce surcroît de saisie. Une valeur hexadécimale fixe la tasse sur un bleu précis, alors que « bleu » seul dérive d’une génération à l’autre. Les boîtes font le même travail pour la position : au lieu d’espérer que « tasse à droite » tombe où vous le voulez, vous donnez au modèle un rectangle.
Il y a aussi une raison pratique de préférer le JSON, même pour des scènes simples. Les notes de ComfyUI indiquent que les prompts en texte simple subissent davantage de faux positifs du filtre de sécurité, et que les prompts structurés réduisent ces blocages.
Conseils de prompt qui tiennent la route
Le JSON attire l’attention, mais la plupart des images ratées viennent d’une formulation vague, pas d’une structure manquante. Trois habitudes règlent la majorité des cas.
Décrire ce que voit l’objectif
Décrivez la photographie, pas l’idée. Les prompts d’exemple de PicassoIA pour ce modèle se lisent comme une fiche de prise de vue : un portrait en pellicule couleur, faible profondeur de champ, mise au point nette sur l’œil, arrière-plan flou en bokeh, grain de pellicule à ISO élevé, style documentaire pris sur le vif. L’objectif, la direction de la lumière et le type de pellicule donnent au modèle quelque chose de concret à rendre, et évitent le rendu brillant et trop poli.
Garder le texte court
Si l’image a besoin de mots, placez-les entre guillemets et précisez où ils se trouvent. Les prompts d’exemple sur les pages des modèles font exactement cela, avec une courte étiquette entre guillemets et une position comme « centré ». Un à trois mots par élément de texte est le juste milieu. Les longues phrases à l’intérieur d’une image sont l’endroit où tous les modèles, celui-ci compris, commencent à flancher.
Se passer du prompt négatif
L’architecture gère déjà le côté « à éviter », donc écrivez ce que vous voulez et arrêtez-vous là. Sur la version hébergée, passer un prompt en langage naturel active automatiquement Magic Prompt, qui développe une description sommaire avant la génération. Cela aide les débutants et gêne si vous avez rédigé un prompt précis, donc vérifiez le résultat par rapport à votre intention. Si Magic Prompt réécrit trop, placez la même idée dans json_prompt.
Ideogram 4.0 face à Krea 2
Krea 2 existe en deux tailles sur PicassoIA. Krea 2 Large est présenté pour le photoréalisme et une large palette artistique dans un seul modèle, et Krea 2 Medium est positionné pour l’anime et le travail pictural.
Une précision avant le tableau : cette comparaison repose sur les spécifications des modèles, la documentation de ComfyUI et des fiches publiques. Ce n’est pas un duel au niveau du pixel, donc testez le même prompt sur les deux avant de vous engager sur l’un ou l’autre pour un projet.
Contrôle contre goût
Les deux modèles demandent de les guider de manières différentes.
Ideogram 4.0 vous offre la structure. Les boîtes placent les éléments, les valeurs hexadécimales fixent les couleurs, et le texte entre guillemets atterrit là où vous l’avez indiqué. Vous décidez, le modèle exécute.
Krea 2 vous offre un cadran. Le réglage creativity va de raw, qui ne rend que ce que vous décrivez, à low et medium, jusqu’à high, où le modèle prend de réelles libertés avec la lumière, l’atmosphère et la composition. Vous pouvez aussi joindre jusqu’à 10 images de référence de style et régler une intensité de 0 à 1 (la valeur par défaut est 0,5) pour décider à quel point leur aspect façonne le résultat.
Coût et vitesse
Un site public de comparaison indique Krea 2 Medium Turbo à environ 15 $ pour 1 000 images et Ideogram 4.0 à environ 60 $ pour 1 000. Dans les votes de préférence à l’aveugle, les deux sont presque à égalité, à 1 223 et 1 217 Elo, sans leader net. Notez que le chiffre bon marché concerne la variante Medium Turbo, et non Large.
Côté vitesse, les exemples de génération listés sur les pages de modèles de PicassoIA donnent une idée approximative : un échantillon Ideogram v4 Quality a pris environ 67 secondes, un échantillon Ideogram v4 Balanced environ 41 secondes, et deux échantillons Krea 2 Large environ 103 et 143 secondes. Ce sont des essais isolés, pas un benchmark, mais ils suggèrent que Balanced est le modèle d’itération et que Quality sert à la passe de finition.
Ideogram 4.0
Krea 2
Saisie du prompt
Langage naturel ou JSON structuré
Langage naturel plus un réglage de créativité
Contrôle de la mise en page
Boîtes englobantes et palettes de couleurs
Formats prédéfinis et références de style
Texte dans les images
Titres solides, étiquettes lisibles
Possible, mais pas l’argument principal
Transfert de style
Inscrit dans le bloc de style
Jusqu’à 10 images de référence
Prompt négatif
Inutile
Ne fait pas partie des saisies
Chiffre de prix public
Environ 60 $ pour 1 000 images
Environ 15 $ pour 1 000 (Medium Turbo)
Le verdict en bref : choisissez Ideogram quand l’image est une mise en page (affiches, emballages, miniatures avec du texte). Choisissez Krea 2 quand l’image est une ambiance (portraits, scènes éditoriales, tout ce où vous voulez que le modèle apporte du goût).
Utiliser les deux sur PicassoIA
Si 38 Go de téléchargements et une exigence de VRAM inconnue vous semblent une corvée, les deux familles tournent dans le navigateur sur PicassoIA, sans installation, sans filigrane et avec des téléchargements propres.
Collez une description en langage naturel dans prompt, ou un objet JSON dans json_prompt. Ne remplissez qu’un seul des deux.
Choisissez un resolution. Il y a plus de 20 tailles, de 2048x2048 jusqu’à 3328x1248. Laissez-le sur None et le modèle choisit lui-même le format. Pour un en-tête de blog, 2560x1440 donne un format 16:9 propre.
Activez la détection de droits d’auteur si vous prévoyez une publication commerciale. Elle est facultative et désactivée par défaut.
Générez, puis reprenez le même prompt sur Ideogram v4 Balanced lorsque vous voulez des brouillons plus rapides avant le rendu final.
Réglages de Krea 2 Large
Sur Krea 2 Large, quatre champs font l’essentiel du travail :
creativity : utilisez raw pour les photos de produits qui doivent correspondre à vos mots, medium comme réglage quotidien par défaut, high pour le concept art.
aspect_ratio : 16:9 pour les bannières, 2,35:1 pour une bande cinématographique, 9:16 pour les publications verticales. Huit formats sont disponibles.
seed : verrouillez une composition qui vous plaît, puis changez une formule à la fois et comparez.
Références de style : commencez à une intensité de 0,5 et ne montez que si la référence se voit à peine.
Choisir le bon modèle
Une façon rapide de décider :
Le texte et la mise en page passent en premier : Ideogram v4 Quality.
Brouillons rapides de la même idée : Ideogram v4 Balanced.
Ambiance photographique ou style précis à partir de références : Krea 2 Large.
Direction picturale ou anime : Krea 2 Medium.
Si aucun ne convient, FLUX 2 Pro, Seedream 5 Pro et GPT Image 2 méritent un essai avec le même prompt. Et quand une image finie doit voir son texte extrait en éléments modifiables, Layerize sépare les calques de texte.
Créez vos propres images dès aujourd’hui
La façon la plus rapide de trancher la question Ideogram contre Krea est de passer votre propre prompt dans les deux. Ouvrez Picasso IA, chargez Ideogram v4 Quality et Krea 2 Large dans deux onglets, collez la même idée en une phrase dans chacun, puis comparez les résultats côte à côte. Réécrivez ensuite le prompt en JSON pour le premier et ajustez le réglage de créativité sur le second.
Dix minutes de ce test vous en diront plus que n’importe quelle fiche technique. Choisissez une scène de votre propre travail, générez-la deux fois, et gardez le modèle qui s’en rapproche le plus dès le premier essai.