Ideogram 4.0: flujo de trabajo en ComfyUI, consejos para prompts y comparación con Krea 2

Un vistazo práctico a Ideogram 4.0 en ComfyUI: los cinco archivos del modelo y dónde van, cómo funcionan los prompts en JSON estructurado, hábitos de escritura que dan buen resultado y una comparación con Krea 2 en control, texto y precio, además de los ajustes para usar ambos en PicassoIA.

Ideogram 4.0: flujo de trabajo en ComfyUI, consejos para prompts y comparación con Krea 2
Cristian Da Conceicao
Fundador de Picasso IA

La mayoría conoce Ideogram 4.0 a través de una app en la nube y nunca ve la parte que lo hace distinto: los pesos son abiertos, y ComfyUI incluye un flujo de trabajo listo para ejecutarlos en tu propio equipo. Eso cambia qué descargas, cómo escribes los prompts y cómo se compara el modelo con Krea 2, que sigue el enfoque contrario, con un único control de creatividad y un conjunto de referencias de estilo. A continuación tienes la configuración de ComfyUI archivo por archivo, el formato de prompt en JSON, los hábitos de escritura que compensan, una comparación sencilla con Krea 2 y un atajo para ejecutar ambos en el navegador en PicassoIA.

Qué es Ideogram 4.0 realmente

Ideogram se ganó su nombre con una cosa: texto que se lee bien dentro de una imagen. La versión 4.0 conserva esa fortaleza y añade una forma estructurada de describir una escena, de modo que un cartel, una foto de producto o un retrato pueden diseñarse como una página en lugar de dejarse al azar.

Manos de un diseñador apoyadas sobre un escritorio frente a un monitor suavemente desenfocado con luz cálida de la mañana

Pesos abiertos, no solo una API

El cambio importante está en la distribución. El modelo se publicó con pesos abiertos, y ComfyUI añadió compatibilidad desde el primer día, lo que significa que puedes ejecutarlo en local en lugar de pagar por imagen a un servidor ajeno. La documentación de ComfyUI también incluye una ruta aparte con un nodo de socio que llama al servicio alojado, así que eliges entre archivos locales y una llamada remota según tu hardware.

Dos formatos de prompt

Puedes escribir lenguaje natural, que sirve para ideas rápidas, o una descripción estructurada en JSON para un control preciso del diseño, los colores y el estilo. La ruta JSON es aquella para la que se construyó el modelo, y la mayor parte de lo que se comenta en la comunidad gira en torno a ella. En Ideogram v4 Quality la misma división aparece como dos entradas separadas: prompt para lenguaje natural y json_prompt para la versión estructurada. Usa una u otra, nunca las dos.

💡 Regla rápida: si la imagen tiene un diseño que importa (un cartel, una etiqueta, un producto sobre un fondo definido), recurre a JSON. Si es un ambiente o un retrato, el texto plano es más rápido.

Configuración de ComfyUI, archivo por archivo

La configuración local consiste sobre todo en descargar archivos. El flujo oficial espera cinco archivos en carpetas concretas, y colocarlos en el lugar equivocado es la razón más habitual por la que el flujo no se carga.

Los cinco archivos del modelo

ArchivoCarpetaTamaño
ideogram4_fp8_scaled.safetensorsmodels/diffusion_models/unos 13,8 GB
ideogram4_unconditional_fp8_scaled.safetensorsmodels/diffusion_models/unos 13,8 GB
qwen3vl_8b_fp8_scaled.safetensorsmodels/text_encoders/unos 8 GB
gemma4_e4b_it_fp8_scaled.safetensorsmodels/text_encoders/unos 2 GB
flux2-vae.safetensorsmodels/vae/unos 335 MB

En total suman unos 38 GB en disco. Los archivos vienen del repositorio Comfy-Org/Ideogram-4 de Hugging Face. El segundo archivo de difusión se encarga del pase no condicionado, y por eso el modelo no necesita un prompt negativo: el lado no condicionado simplemente elimina los tokens de texto, así que no hay una cadena de "evita esto" que rellenar.

Cargar el flujo de trabajo

Descarga el archivo del flujo desde la página de documentación de ComfyUI y arrástralo al lienzo. El grafo es corto: un nodo de subgrafo Ideogram4 que hace el trabajo pesado, un ResolutionSelector para el tamaño de salida y un nodo Save Image. Si ComfyUI muestra nodos faltantes en rojo, actualiza ComfyUI primero, ya que el flujo depende de incorporaciones recientes.

El flujo por defecto trae ya un prompt JSON estructurado rellenado. Edita ese ejemplo en lugar de empezar con un cuadro en blanco, porque muestra exactamente qué campos espera el nodo. Si prefieres construir los prompts de forma visual, el Ideogram 4 Prompt Builder de KJNodes te permite colocar elementos en un lienzo y genera el JSON por ti.

Caja de PC abierta con una tarjeta gráfica grande y cables ordenados sobre una mesa de trabajo vista desde arriba

Baño de realidad sobre el hardware

Esta es la carencia real: la documentación no indica una cifra de VRAM ni una especificación mínima del sistema. El tamaño de los archivos dice más que la documentación. Dos archivos de difusión de 13,8 GB más un codificador de texto de 8 GB significan una tarjeta con mucha memoria, almacenamiento rápido y paciencia en la primera carga. Ejecuta el flujo por defecto una vez, observa cuánta memoria usa y solo entonces construye a su alrededor un pipeline más grande. Si tu GPU va justa, la ruta alojada es la alternativa sensata.

Escribir prompts JSON que funcionen

La descripción estructurada se compone de un resumen de la escena, un bloque de estilo, un fondo y descripciones opcionales por objeto con cuadros delimitadores y paletas de colores hexadecimales. El flujo por defecto de ComfyUI organiza esto bajo tres nombres de nivel superior.

Los tres bloques superiores

  • high_level_description: una o dos frases que nombran la escena completa.
  • style_description: objetivo, iluminación, tipo de película, ambiente. Aquí es donde vive "fotografía documental, luz suave de ventana, grano fino".
  • compositional_deconstruction: la lista de elementos, cada uno con un cuadro, una descripción y una paleta.

Cuadros y colores

Esta es la forma de un prompt, reducida a un solo elemento:

{
  "high_level_description": "A white ceramic mug on a walnut desk beside an open notebook, morning window light",
  "style_description": "Documentary photograph, 50mm lens, soft shadows, fine film grain, natural colors",
  "compositional_deconstruction": [
    {
      "description": "White ceramic mug with a thin blue rim, steam rising",
      "bounding_box": [0.55, 0.40, 0.80, 0.75],
      "colors": ["#F4F1EA", "#3C6E9E"]
    }
  ]
}

Tómalo como una forma, no como un esquema. Los nombres exactos de los campos dentro de cada elemento y la forma en que se escriben las coordenadas de los cuadros vienen del flujo por defecto, así que cópialos de allí y no de este esbozo.

Los colores merecen el esfuerzo extra de escribirlos. Un valor hexadecimal fija la taza en un azul concreto, mientras que "azul" a secas varía de una ejecución a otra. Los cuadros cumplen la misma función con la posición: en lugar de esperar que "taza a la derecha" caiga donde quieres, le das al modelo un rectángulo.

También hay una razón práctica para preferir JSON incluso en escenas sencillas. Las notas de ComfyUI indican que los prompts de texto plano sufren una mayor tasa de falsos positivos del filtro de seguridad, y que los prompts estructurados reducen ese bloqueo.

Vista macro de un cuaderno de papel cuadriculado con rectángulos dibujados a lápiz que planifican la composición de una imagen

Consejos de prompt que dan buen resultado

El JSON se lleva la atención, pero la mayoría de las imágenes fallidas se deben a una redacción vaga, no a la falta de estructura. Tres hábitos corrigen la mayoría de ellas.

Describe lo que ve la cámara

Describe la fotografía, no la idea. Los prompts de ejemplo de PicassoIA para este modelo se leen como una nota de cámara: un retrato en película de color, profundidad de campo poco profunda, enfoque nítido en el ojo, bokeh de fondo desenfocado, grano de película de ISO alto, estilo documental espontáneo. La lente, la dirección de la luz y el tipo de película le dan al modelo algo concreto que renderizar, y mantienen los resultados lejos del aspecto brillante y sobrepulido.

Mantén el texto corto

Si la imagen necesita palabras, ponlas entre comillas e indica dónde van. Los prompts de ejemplo de las páginas del modelo hacen exactamente eso, con una etiqueta breve entre comillas y una posición como "centrado". De una a tres palabras por elemento de texto es el punto ideal. Las frases largas dentro de una imagen hacen que todos los modelos, este incluido, empiecen a fallar.

Prescinde del prompt negativo

La arquitectura ya se encarga del lado de "evita esto", así que escribe lo que quieres y para ahí. En la versión alojada, pasar un prompt en lenguaje natural activa Magic Prompt automáticamente, que amplía una descripción aproximada antes de generar. Eso ayuda a quien empieza y estorba si escribiste un prompt preciso, así que revisa el resultado frente a tu intención. Si Magic Prompt reescribe demasiado, pasa la misma idea a json_prompt.

Director de arte con un jersey gris carbón señalando hojas de contactos de fotos impresas extendidas sobre una mesa blanca

Ideogram 4.0 frente a Krea 2

Krea 2 llega en dos tamaños en PicassoIA. Krea 2 Large está pensado para fotorrealismo y variedad artística en un solo modelo, y Krea 2 Medium se posiciona para anime y trabajo pictórico.

Una advertencia antes de la tabla: esta comparación se basa en especificaciones del modelo, la documentación de ComfyUI y fichas públicas. No es una prueba al detalle de píxeles, así que ejecuta el mismo prompt en ambos antes de comprometer un proyecto con cualquiera de los dos.

Control frente a gusto

Los dos modelos piden que los dirijas de maneras distintas.

Ideogram 4.0 te da estructura. Los cuadros colocan los elementos, los valores hexadecimales fijan los colores y el texto entre comillas aterriza donde dijiste que debía ir. Tú decides, el modelo ejecuta.

Krea 2 te da un control deslizante. El ajuste de creativity va desde raw, que renderiza solo lo que describes, pasando por low y medium, hasta high, donde el modelo se toma verdadera libertad con la luz, la atmósfera y la composición. También puedes adjuntar hasta 10 imágenes de referencia de estilo y fijar una intensidad de 0 a 1 (el valor por defecto es 0,5) para decidir con cuánta fuerza su aspecto moldea el resultado.

Fotógrafo en un loft iluminado por el sol sosteniendo un gran retrato impreso visto desde un ángulo bajo

Costo y velocidad

Un sitio público de comparación indica que Krea 2 Medium Turbo cuesta unos $15 por cada 1.000 imágenes e Ideogram 4.0 unos $60 por cada 1.000. En las votaciones de preferencia a ciegas, los dos quedan casi empatados, con 1.223 y 1.217 Elo, sin un líder claro. Ten en cuenta que la cifra barata corresponde a la versión Medium Turbo, no a Large.

En cuanto a velocidad, las ejecuciones de ejemplo que aparecen en las páginas de modelos de PicassoIA dan una idea aproximada: una muestra de Ideogram v4 Quality tardó unos 67 segundos, una muestra de Ideogram v4 Balanced unos 41 segundos, y dos muestras de Krea 2 Large unos 103 y 143 segundos. Son ejecuciones únicas, no un benchmark, pero sugieren que Balanced es el modelo para iterar y Quality es el pase de acabado.

Ideogram 4.0Krea 2
Entrada del promptLenguaje natural o JSON estructuradoLenguaje natural más un ajuste de creatividad
Control del diseñoCuadros delimitadores y paletas de coloresPresets de relación de aspecto y referencias de estilo
Texto dentro de las imágenesTitulares sólidos, etiquetas legiblesPosible, pero no es su principal atractivo
Transferencia de estiloEscrita en el bloque de estiloHasta 10 imágenes de referencia
Prompt negativoNo es necesarioNo forma parte de las entradas
Cifra de precio públicaUnos $60 por cada 1.000 imágenesUnos $15 por cada 1.000 (Medium Turbo)

Dos impresiones de retrato casi idénticas sobre una mesa de luz con una lupa apoyada sobre una de ellas

El veredicto corto: elige Ideogram cuando la imagen sea un diseño (carteles, empaques, miniaturas con palabras). Elige Krea 2 cuando la imagen sea un ambiente (retratos, escenas editoriales, cualquier cosa en la que quieras que el modelo aporte gusto).

Ejecuta ambos en PicassoIA

Si 38 GB de descargas y un requisito de VRAM desconocido suenan a mal plan, las dos familias funcionan en el navegador en PicassoIA sin configuración, sin marcas de agua y con descargas limpias.

Ideogram v4 Quality, paso a paso

  1. Abre la página de Ideogram v4 Quality.
  2. Pega una descripción en lenguaje natural en prompt, o un objeto JSON en json_prompt. Rellena solo uno.
  3. Elige un resolution. Hay más de 20 tamaños, desde 2048x2048 hasta 3328x1248. Déjalo en None y el modelo elige la relación de aspecto por sí mismo. Para un encabezado de blog, 2560x1440 es un 16:9 limpio.
  4. Activa la detección de derechos de autor si vas a publicar con fines comerciales. Es opcional y está desactivada por defecto.
  5. Genera y, cuando quieras borradores más rápidos antes del render final, repite el mismo prompt en Ideogram v4 Balanced.

Ajustes de Krea 2 Large

En Krea 2 Large, cuatro entradas hacen casi todo el trabajo:

  • creativity: usa raw para fotos de producto que deban coincidir con tus palabras, medium como opción diaria por defecto, high para arte conceptual.
  • aspect_ratio: 16:9 para banners, 2,35:1 para una franja cinematográfica, 9:16 para publicaciones verticales. Hay ocho relaciones disponibles.
  • seed: fija una composición que te guste y luego cambia una frase cada vez y compara.
  • Referencias de estilo: empieza con una intensidad de 0,5 y súbela solo si la referencia apenas se nota.

Cuatro colegas alrededor de una mesa redonda de roble sosteniendo dos imágenes impresas contra la ventana para compararlas

Cómo elegir el modelo adecuado

Una forma rápida de decidir:

  • Texto y diseño primero: Ideogram v4 Quality.
  • Borradores rápidos de la misma idea: Ideogram v4 Balanced.
  • Ambiente fotográfico o un estilo concreto a partir de referencias: Krea 2 Large.
  • Dirección pictórica o anime: Krea 2 Medium.

Si ninguno encaja, FLUX 2 Pro, Seedream 5 Pro y GPT Image 2 merecen una prueba con el mismo prompt. Y cuando un gráfico terminado necesita que su texto se separe en piezas editables, Layerize separa las capas de texto.

Diseñador gráfico con camisa de mezclilla revisando una gran fotografía impresa clavada en un tablero de corcho

Crea tus propias imágenes hoy

La forma más rápida de resolver la cuestión de Ideogram frente a Krea es ejecutar tu propio prompt en ambos. Abre PicassoIA, carga Ideogram v4 Quality y Krea 2 Large en dos pestañas, pega la misma idea de una frase en cada una y compara los resultados lado a lado. Después reescribe el prompt como JSON para el primero y ajusta el control de creatividad en el segundo.

Diez minutos de eso te dicen más que cualquier ficha técnica. Elige una escena de tu propio trabajo, ejecútala dos veces y quédate con el modelo que se acerque más a la primera.

Creador freelance trabajando en un equipo portátil junto a la ventana de una cafetería con la luz de la hora dorada

Compartir este artículo

Elige tu idioma