Ideogram 4.0 : workflow ComfyUI, conseils de prompt et face à Krea 2

Un regard pratique sur Ideogram 4.0 dans ComfyUI : les cinq fichiers du modèle et leur emplacement, le fonctionnement des prompts JSON structurés, les habitudes de prompt qui tiennent la route, une comparaison avec Krea 2 sur le contrôle, le texte et le prix, et les réglages pour utiliser les deux sur PicassoIA.

Ideogram 4.0 : workflow ComfyUI, conseils de prompt et face à Krea 2
Cristian Da Conceicao
Fondateur de Picasso IA

Beaucoup de gens découvrent Ideogram 4.0 à travers une application en ligne et ne voient jamais ce qui le rend singulier : les poids sont ouverts, et ComfyUI propose un workflow prêt à l’emploi qui les fait tourner sur votre propre machine. Cela change ce que vous téléchargez, la manière d’écrire vos prompts et la façon dont le modèle se situe face à Krea 2, qui fonctionne à l’inverse avec un seul cadran de créativité et une série de références de style. Vous trouverez ci-dessous l’installation de ComfyUI fichier par fichier, le format de prompt JSON, les habitudes de prompt qui portent leurs fruits, une comparaison simple avec Krea 2 et un raccourci pour faire tourner les deux dans le navigateur sur PicassoIA.

Ce qu’est vraiment Ideogram 4.0

Ideogram s’est fait un nom grâce à une chose : un texte lisible à l’intérieur d’une image. La version 4.0 conserve cette force et ajoute une manière structurée de décrire une scène, pour qu’une affiche, une photo de produit ou un portrait soit composé comme une page plutôt que laissé au hasard.

Mains d’un designer posées sur un bureau devant un écran légèrement flou, dans la lumière chaude du matin

Poids ouverts, pas seulement une API

Le changement notable concerne la mise à disposition du modèle. Le modèle a été publié avec des poids ouverts, et ComfyUI l’a pris en charge dès le premier jour, ce qui signifie que vous pouvez le faire tourner en local au lieu de payer chaque image sur le serveur de quelqu’un d’autre. La documentation de ComfyUI mentionne aussi une voie distincte, un nœud partenaire qui appelle le service hébergé ; vous choisissez donc entre des fichiers locaux et un appel distant selon votre matériel.

Deux formats de prompt

Vous pouvez écrire en langage naturel, ce qui convient aux idées rapides, ou utiliser une légende JSON structurée pour un contrôle précis de la mise en page, des couleurs et du style. La voie JSON est celle autour de laquelle le modèle a été conçu, et la plupart des discussions de la communauté tournent autour d’elle. Sur Ideogram v4 Quality, cette même distinction apparaît sous la forme de deux champs séparés : prompt pour le langage naturel et json_prompt pour la version structurée. Utilisez l’un ou l’autre, jamais les deux.

💡 Règle rapide : si l’image a une mise en page qui compte (une affiche, une étiquette, un produit sur un fond défini), utilisez le JSON. S’il s’agit d’une ambiance ou d’un portrait, le texte simple est plus rapide.

Installation de ComfyUI, fichier par fichier

L’installation en local consiste surtout à télécharger des fichiers. Le workflow officiel attend cinq fichiers dans des dossiers précis, et les mettre au mauvais endroit est la raison la plus fréquente pour laquelle le workflow refuse de se charger.

Les cinq fichiers du modèle

FichierDossierTaille
ideogram4_fp8_scaled.safetensorsmodels/diffusion_models/environ 13,8 Go
ideogram4_unconditional_fp8_scaled.safetensorsmodels/diffusion_models/environ 13,8 Go
qwen3vl_8b_fp8_scaled.safetensorsmodels/text_encoders/environ 8 Go
gemma4_e4b_it_fp8_scaled.safetensorsmodels/text_encoders/environ 2 Go
flux2-vae.safetensorsmodels/vae/environ 335 Mo

Cela représente environ 38 Go sur le disque. Les fichiers proviennent du dépôt Comfy-Org/Ideogram-4 sur Hugging Face. Le deuxième fichier de diffusion gère la passe inconditionnelle, ce qui explique pourquoi le modèle n’a pas besoin de prompt négatif : le côté inconditionnel supprime simplement les tokens de texte, il n’y a donc aucune chaîne « à éviter » à remplir.

Charger le workflow

Téléchargez le fichier de workflow depuis la page de documentation de ComfyUI et glissez-le sur le canevas. Le graphe est court : un nœud sous-graphe Ideogram4 qui fait le gros du travail, un ResolutionSelector pour la taille de sortie, et un nœud Save Image. Si ComfyUI affiche des nœuds manquants en rouge, mettez d’abord ComfyUI à jour, car le workflow repose sur des ajouts récents.

Le workflow par défaut contient déjà un prompt JSON structuré. Modifiez cet exemple plutôt que de partir d’une case vide, car il montre exactement les champs attendus par le nœud. Si vous préférez construire vos prompts visuellement, le Ideogram 4 Prompt Builder de KJNodes vous permet de placer des éléments sur un canevas et écrit le JSON à votre place.

Boîtier d’ordinateur ouvert avec une grande carte graphique et des câbles bien rangés, vu de dessus sur un établi

Vérification réaliste du matériel

Voici l’écart à connaître : la documentation n’indique ni chiffre de VRAM ni configuration minimale. La taille des fichiers en dit plus que la doc. Deux fichiers de diffusion de 13,8 Go plus un encodeur de texte de 8 Go supposent une carte avec beaucoup de mémoire, un stockage rapide et de la patience au premier chargement. Lancez le workflow par défaut une fois, observez votre utilisation de la mémoire, et ce n’est qu’ensuite que vous construirez un pipeline plus large autour. Si votre GPU est juste, la solution hébergée reste le plan B raisonnable.

Rédiger des prompts JSON qui fonctionnent

La légende structurée repose sur un résumé de scène, un bloc de style, un arrière-plan et, en option, des descriptions par objet avec des boîtes englobantes et des palettes de couleurs hexadécimales. Le workflow ComfyUI par défaut organise cela sous trois noms de niveau supérieur.

Les trois blocs principaux

  • high_level_description : une ou deux phrases qui nomment la scène entière.
  • style_description : objectif, éclairage, type de pellicule, ambiance. C’est ici que vivent des formules comme « photographie documentaire, lumière douce de fenêtre, grain fin ».
  • compositional_deconstruction : la liste des éléments, chacun avec une boîte, une description et une palette.

Boîtes et couleurs

Voici la forme d’un prompt, réduit à un seul élément :

{
  "high_level_description": "A white ceramic mug on a walnut desk beside an open notebook, morning window light",
  "style_description": "Documentary photograph, 50mm lens, soft shadows, fine film grain, natural colors",
  "compositional_deconstruction": [
    {
      "description": "White ceramic mug with a thin blue rim, steam rising",
      "bounding_box": [0.55, 0.40, 0.80, 0.75],
      "colors": ["#F4F1EA", "#3C6E9E"]
    }
  ]
}

Considérez cela comme une forme, pas comme un schéma. Les noms de champs exacts à l’intérieur de chaque élément et la manière dont les coordonnées des boîtes sont écrites viennent du workflow par défaut : copiez-les depuis là plutôt que depuis cette esquisse.

Les couleurs valent la peine de ce surcroît de saisie. Une valeur hexadécimale fixe la tasse sur un bleu précis, alors que « bleu » seul dérive d’une génération à l’autre. Les boîtes font le même travail pour la position : au lieu d’espérer que « tasse à droite » tombe où vous le voulez, vous donnez au modèle un rectangle.

Il y a aussi une raison pratique de préférer le JSON, même pour des scènes simples. Les notes de ComfyUI indiquent que les prompts en texte simple subissent davantage de faux positifs du filtre de sécurité, et que les prompts structurés réduisent ces blocages.

Vue macro d’un carnet à quadrillage avec des rectangles tracés au crayon pour planifier une mise en page d’image

Conseils de prompt qui tiennent la route

Le JSON attire l’attention, mais la plupart des images ratées viennent d’une formulation vague, pas d’une structure manquante. Trois habitudes règlent la majorité des cas.

Décrire ce que voit l’objectif

Décrivez la photographie, pas l’idée. Les prompts d’exemple de PicassoIA pour ce modèle se lisent comme une fiche de prise de vue : un portrait en pellicule couleur, faible profondeur de champ, mise au point nette sur l’œil, arrière-plan flou en bokeh, grain de pellicule à ISO élevé, style documentaire pris sur le vif. L’objectif, la direction de la lumière et le type de pellicule donnent au modèle quelque chose de concret à rendre, et évitent le rendu brillant et trop poli.

Garder le texte court

Si l’image a besoin de mots, placez-les entre guillemets et précisez où ils se trouvent. Les prompts d’exemple sur les pages des modèles font exactement cela, avec une courte étiquette entre guillemets et une position comme « centré ». Un à trois mots par élément de texte est le juste milieu. Les longues phrases à l’intérieur d’une image sont l’endroit où tous les modèles, celui-ci compris, commencent à flancher.

Se passer du prompt négatif

L’architecture gère déjà le côté « à éviter », donc écrivez ce que vous voulez et arrêtez-vous là. Sur la version hébergée, passer un prompt en langage naturel active automatiquement Magic Prompt, qui développe une description sommaire avant la génération. Cela aide les débutants et gêne si vous avez rédigé un prompt précis, donc vérifiez le résultat par rapport à votre intention. Si Magic Prompt réécrit trop, placez la même idée dans json_prompt.

Directeur artistique en pull anthracite pointant des planches-contact de photos imprimées étalées sur une table blanche

Ideogram 4.0 face à Krea 2

Krea 2 existe en deux tailles sur PicassoIA. Krea 2 Large est présenté pour le photoréalisme et une large palette artistique dans un seul modèle, et Krea 2 Medium est positionné pour l’anime et le travail pictural.

Une précision avant le tableau : cette comparaison repose sur les spécifications des modèles, la documentation de ComfyUI et des fiches publiques. Ce n’est pas un duel au niveau du pixel, donc testez le même prompt sur les deux avant de vous engager sur l’un ou l’autre pour un projet.

Contrôle contre goût

Les deux modèles demandent de les guider de manières différentes.

Ideogram 4.0 vous offre la structure. Les boîtes placent les éléments, les valeurs hexadécimales fixent les couleurs, et le texte entre guillemets atterrit là où vous l’avez indiqué. Vous décidez, le modèle exécute.

Krea 2 vous offre un cadran. Le réglage creativity va de raw, qui ne rend que ce que vous décrivez, à low et medium, jusqu’à high, où le modèle prend de réelles libertés avec la lumière, l’atmosphère et la composition. Vous pouvez aussi joindre jusqu’à 10 images de référence de style et régler une intensité de 0 à 1 (la valeur par défaut est 0,5) pour décider à quel point leur aspect façonne le résultat.

Photographe dans un loft ensoleillé tenant un grand portrait imprimé, vu en contre-plongée

Coût et vitesse

Un site public de comparaison indique Krea 2 Medium Turbo à environ 15 $ pour 1 000 images et Ideogram 4.0 à environ 60 $ pour 1 000. Dans les votes de préférence à l’aveugle, les deux sont presque à égalité, à 1 223 et 1 217 Elo, sans leader net. Notez que le chiffre bon marché concerne la variante Medium Turbo, et non Large.

Côté vitesse, les exemples de génération listés sur les pages de modèles de PicassoIA donnent une idée approximative : un échantillon Ideogram v4 Quality a pris environ 67 secondes, un échantillon Ideogram v4 Balanced environ 41 secondes, et deux échantillons Krea 2 Large environ 103 et 143 secondes. Ce sont des essais isolés, pas un benchmark, mais ils suggèrent que Balanced est le modèle d’itération et que Quality sert à la passe de finition.

Ideogram 4.0Krea 2
Saisie du promptLangage naturel ou JSON structuréLangage naturel plus un réglage de créativité
Contrôle de la mise en pageBoîtes englobantes et palettes de couleursFormats prédéfinis et références de style
Texte dans les imagesTitres solides, étiquettes lisiblesPossible, mais pas l’argument principal
Transfert de styleInscrit dans le bloc de styleJusqu’à 10 images de référence
Prompt négatifInutileNe fait pas partie des saisies
Chiffre de prix publicEnviron 60 $ pour 1 000 imagesEnviron 15 $ pour 1 000 (Medium Turbo)

Deux tirages de portraits presque identiques sur une table lumineuse, avec une loupe posée sur l’un d’eux

Le verdict en bref : choisissez Ideogram quand l’image est une mise en page (affiches, emballages, miniatures avec du texte). Choisissez Krea 2 quand l’image est une ambiance (portraits, scènes éditoriales, tout ce où vous voulez que le modèle apporte du goût).

Utiliser les deux sur PicassoIA

Si 38 Go de téléchargements et une exigence de VRAM inconnue vous semblent une corvée, les deux familles tournent dans le navigateur sur PicassoIA, sans installation, sans filigrane et avec des téléchargements propres.

Ideogram v4 Quality, étape par étape

  1. Ouvrez la page Ideogram v4 Quality.
  2. Collez une description en langage naturel dans prompt, ou un objet JSON dans json_prompt. Ne remplissez qu’un seul des deux.
  3. Choisissez un resolution. Il y a plus de 20 tailles, de 2048x2048 jusqu’à 3328x1248. Laissez-le sur None et le modèle choisit lui-même le format. Pour un en-tête de blog, 2560x1440 donne un format 16:9 propre.
  4. Activez la détection de droits d’auteur si vous prévoyez une publication commerciale. Elle est facultative et désactivée par défaut.
  5. Générez, puis reprenez le même prompt sur Ideogram v4 Balanced lorsque vous voulez des brouillons plus rapides avant le rendu final.

Réglages de Krea 2 Large

Sur Krea 2 Large, quatre champs font l’essentiel du travail :

  • creativity : utilisez raw pour les photos de produits qui doivent correspondre à vos mots, medium comme réglage quotidien par défaut, high pour le concept art.
  • aspect_ratio : 16:9 pour les bannières, 2,35:1 pour une bande cinématographique, 9:16 pour les publications verticales. Huit formats sont disponibles.
  • seed : verrouillez une composition qui vous plaît, puis changez une formule à la fois et comparez.
  • Références de style : commencez à une intensité de 0,5 et ne montez que si la référence se voit à peine.

Quatre collègues autour d’une table ronde en chêne tenant deux images imprimées face à la fenêtre pour les comparer

Choisir le bon modèle

Une façon rapide de décider :

  • Le texte et la mise en page passent en premier : Ideogram v4 Quality.
  • Brouillons rapides de la même idée : Ideogram v4 Balanced.
  • Ambiance photographique ou style précis à partir de références : Krea 2 Large.
  • Direction picturale ou anime : Krea 2 Medium.

Si aucun ne convient, FLUX 2 Pro, Seedream 5 Pro et GPT Image 2 méritent un essai avec le même prompt. Et quand une image finie doit voir son texte extrait en éléments modifiables, Layerize sépare les calques de texte.

Graphiste en chemise en jean examinant une grande photographie imprimée épinglée sur un panneau de liège

Créez vos propres images dès aujourd’hui

La façon la plus rapide de trancher la question Ideogram contre Krea est de passer votre propre prompt dans les deux. Ouvrez Picasso IA, chargez Ideogram v4 Quality et Krea 2 Large dans deux onglets, collez la même idée en une phrase dans chacun, puis comparez les résultats côte à côte. Réécrivez ensuite le prompt en JSON pour le premier et ajustez le réglage de créativité sur le second.

Dix minutes de ce test vous en diront plus que n’importe quelle fiche technique. Choisissez une scène de votre propre travail, générez-la deux fois, et gardez le modèle qui s’en rapproche le plus dès le premier essai.

Créatrice indépendante travaillant sur un ordinateur portable, assise à la fenêtre d’un café, dans la lumière de l’heure dorée

Partager cet article

Choisissez votre langue