Ideogram 4.0: flujo de trabajo en ComfyUI, consejos para prompts y comparación con Krea 2
Un vistazo práctico a Ideogram 4.0 en ComfyUI: los cinco archivos del modelo y dónde van, cómo funcionan los prompts en JSON estructurado, hábitos de escritura que dan buen resultado y una comparación con Krea 2 en control, texto y precio, además de los ajustes para usar ambos en PicassoIA.
La mayoría conoce Ideogram 4.0 a través de una app en la nube y nunca ve la parte que lo hace distinto: los pesos son abiertos, y ComfyUI incluye un flujo de trabajo listo para ejecutarlos en tu propio equipo. Eso cambia qué descargas, cómo escribes los prompts y cómo se compara el modelo con Krea 2, que sigue el enfoque contrario, con un único control de creatividad y un conjunto de referencias de estilo. A continuación tienes la configuración de ComfyUI archivo por archivo, el formato de prompt en JSON, los hábitos de escritura que compensan, una comparación sencilla con Krea 2 y un atajo para ejecutar ambos en el navegador en PicassoIA.
Qué es Ideogram 4.0 realmente
Ideogram se ganó su nombre con una cosa: texto que se lee bien dentro de una imagen. La versión 4.0 conserva esa fortaleza y añade una forma estructurada de describir una escena, de modo que un cartel, una foto de producto o un retrato pueden diseñarse como una página en lugar de dejarse al azar.
Pesos abiertos, no solo una API
El cambio importante está en la distribución. El modelo se publicó con pesos abiertos, y ComfyUI añadió compatibilidad desde el primer día, lo que significa que puedes ejecutarlo en local en lugar de pagar por imagen a un servidor ajeno. La documentación de ComfyUI también incluye una ruta aparte con un nodo de socio que llama al servicio alojado, así que eliges entre archivos locales y una llamada remota según tu hardware.
Dos formatos de prompt
Puedes escribir lenguaje natural, que sirve para ideas rápidas, o una descripción estructurada en JSON para un control preciso del diseño, los colores y el estilo. La ruta JSON es aquella para la que se construyó el modelo, y la mayor parte de lo que se comenta en la comunidad gira en torno a ella. En Ideogram v4 Quality la misma división aparece como dos entradas separadas: prompt para lenguaje natural y json_prompt para la versión estructurada. Usa una u otra, nunca las dos.
💡 Regla rápida: si la imagen tiene un diseño que importa (un cartel, una etiqueta, un producto sobre un fondo definido), recurre a JSON. Si es un ambiente o un retrato, el texto plano es más rápido.
Configuración de ComfyUI, archivo por archivo
La configuración local consiste sobre todo en descargar archivos. El flujo oficial espera cinco archivos en carpetas concretas, y colocarlos en el lugar equivocado es la razón más habitual por la que el flujo no se carga.
Los cinco archivos del modelo
Archivo
Carpeta
Tamaño
ideogram4_fp8_scaled.safetensors
models/diffusion_models/
unos 13,8 GB
ideogram4_unconditional_fp8_scaled.safetensors
models/diffusion_models/
unos 13,8 GB
qwen3vl_8b_fp8_scaled.safetensors
models/text_encoders/
unos 8 GB
gemma4_e4b_it_fp8_scaled.safetensors
models/text_encoders/
unos 2 GB
flux2-vae.safetensors
models/vae/
unos 335 MB
En total suman unos 38 GB en disco. Los archivos vienen del repositorio Comfy-Org/Ideogram-4 de Hugging Face. El segundo archivo de difusión se encarga del pase no condicionado, y por eso el modelo no necesita un prompt negativo: el lado no condicionado simplemente elimina los tokens de texto, así que no hay una cadena de "evita esto" que rellenar.
Cargar el flujo de trabajo
Descarga el archivo del flujo desde la página de documentación de ComfyUI y arrástralo al lienzo. El grafo es corto: un nodo de subgrafo Ideogram4 que hace el trabajo pesado, un ResolutionSelector para el tamaño de salida y un nodo Save Image. Si ComfyUI muestra nodos faltantes en rojo, actualiza ComfyUI primero, ya que el flujo depende de incorporaciones recientes.
El flujo por defecto trae ya un prompt JSON estructurado rellenado. Edita ese ejemplo en lugar de empezar con un cuadro en blanco, porque muestra exactamente qué campos espera el nodo. Si prefieres construir los prompts de forma visual, el Ideogram 4 Prompt Builder de KJNodes te permite colocar elementos en un lienzo y genera el JSON por ti.
Baño de realidad sobre el hardware
Esta es la carencia real: la documentación no indica una cifra de VRAM ni una especificación mínima del sistema. El tamaño de los archivos dice más que la documentación. Dos archivos de difusión de 13,8 GB más un codificador de texto de 8 GB significan una tarjeta con mucha memoria, almacenamiento rápido y paciencia en la primera carga. Ejecuta el flujo por defecto una vez, observa cuánta memoria usa y solo entonces construye a su alrededor un pipeline más grande. Si tu GPU va justa, la ruta alojada es la alternativa sensata.
Escribir prompts JSON que funcionen
La descripción estructurada se compone de un resumen de la escena, un bloque de estilo, un fondo y descripciones opcionales por objeto con cuadros delimitadores y paletas de colores hexadecimales. El flujo por defecto de ComfyUI organiza esto bajo tres nombres de nivel superior.
Los tres bloques superiores
high_level_description: una o dos frases que nombran la escena completa.
style_description: objetivo, iluminación, tipo de película, ambiente. Aquí es donde vive "fotografía documental, luz suave de ventana, grano fino".
compositional_deconstruction: la lista de elementos, cada uno con un cuadro, una descripción y una paleta.
Cuadros y colores
Esta es la forma de un prompt, reducida a un solo elemento:
{
"high_level_description": "A white ceramic mug on a walnut desk beside an open notebook, morning window light",
"style_description": "Documentary photograph, 50mm lens, soft shadows, fine film grain, natural colors",
"compositional_deconstruction": [
{
"description": "White ceramic mug with a thin blue rim, steam rising",
"bounding_box": [0.55, 0.40, 0.80, 0.75],
"colors": ["#F4F1EA", "#3C6E9E"]
}
]
}
Tómalo como una forma, no como un esquema. Los nombres exactos de los campos dentro de cada elemento y la forma en que se escriben las coordenadas de los cuadros vienen del flujo por defecto, así que cópialos de allí y no de este esbozo.
Los colores merecen el esfuerzo extra de escribirlos. Un valor hexadecimal fija la taza en un azul concreto, mientras que "azul" a secas varía de una ejecución a otra. Los cuadros cumplen la misma función con la posición: en lugar de esperar que "taza a la derecha" caiga donde quieres, le das al modelo un rectángulo.
También hay una razón práctica para preferir JSON incluso en escenas sencillas. Las notas de ComfyUI indican que los prompts de texto plano sufren una mayor tasa de falsos positivos del filtro de seguridad, y que los prompts estructurados reducen ese bloqueo.
Consejos de prompt que dan buen resultado
El JSON se lleva la atención, pero la mayoría de las imágenes fallidas se deben a una redacción vaga, no a la falta de estructura. Tres hábitos corrigen la mayoría de ellas.
Describe lo que ve la cámara
Describe la fotografía, no la idea. Los prompts de ejemplo de PicassoIA para este modelo se leen como una nota de cámara: un retrato en película de color, profundidad de campo poco profunda, enfoque nítido en el ojo, bokeh de fondo desenfocado, grano de película de ISO alto, estilo documental espontáneo. La lente, la dirección de la luz y el tipo de película le dan al modelo algo concreto que renderizar, y mantienen los resultados lejos del aspecto brillante y sobrepulido.
Mantén el texto corto
Si la imagen necesita palabras, ponlas entre comillas e indica dónde van. Los prompts de ejemplo de las páginas del modelo hacen exactamente eso, con una etiqueta breve entre comillas y una posición como "centrado". De una a tres palabras por elemento de texto es el punto ideal. Las frases largas dentro de una imagen hacen que todos los modelos, este incluido, empiecen a fallar.
Prescinde del prompt negativo
La arquitectura ya se encarga del lado de "evita esto", así que escribe lo que quieres y para ahí. En la versión alojada, pasar un prompt en lenguaje natural activa Magic Prompt automáticamente, que amplía una descripción aproximada antes de generar. Eso ayuda a quien empieza y estorba si escribiste un prompt preciso, así que revisa el resultado frente a tu intención. Si Magic Prompt reescribe demasiado, pasa la misma idea a json_prompt.
Ideogram 4.0 frente a Krea 2
Krea 2 llega en dos tamaños en PicassoIA. Krea 2 Large está pensado para fotorrealismo y variedad artística en un solo modelo, y Krea 2 Medium se posiciona para anime y trabajo pictórico.
Una advertencia antes de la tabla: esta comparación se basa en especificaciones del modelo, la documentación de ComfyUI y fichas públicas. No es una prueba al detalle de píxeles, así que ejecuta el mismo prompt en ambos antes de comprometer un proyecto con cualquiera de los dos.
Control frente a gusto
Los dos modelos piden que los dirijas de maneras distintas.
Ideogram 4.0 te da estructura. Los cuadros colocan los elementos, los valores hexadecimales fijan los colores y el texto entre comillas aterriza donde dijiste que debía ir. Tú decides, el modelo ejecuta.
Krea 2 te da un control deslizante. El ajuste de creativity va desde raw, que renderiza solo lo que describes, pasando por low y medium, hasta high, donde el modelo se toma verdadera libertad con la luz, la atmósfera y la composición. También puedes adjuntar hasta 10 imágenes de referencia de estilo y fijar una intensidad de 0 a 1 (el valor por defecto es 0,5) para decidir con cuánta fuerza su aspecto moldea el resultado.
Costo y velocidad
Un sitio público de comparación indica que Krea 2 Medium Turbo cuesta unos $15 por cada 1.000 imágenes e Ideogram 4.0 unos $60 por cada 1.000. En las votaciones de preferencia a ciegas, los dos quedan casi empatados, con 1.223 y 1.217 Elo, sin un líder claro. Ten en cuenta que la cifra barata corresponde a la versión Medium Turbo, no a Large.
En cuanto a velocidad, las ejecuciones de ejemplo que aparecen en las páginas de modelos de PicassoIA dan una idea aproximada: una muestra de Ideogram v4 Quality tardó unos 67 segundos, una muestra de Ideogram v4 Balanced unos 41 segundos, y dos muestras de Krea 2 Large unos 103 y 143 segundos. Son ejecuciones únicas, no un benchmark, pero sugieren que Balanced es el modelo para iterar y Quality es el pase de acabado.
Ideogram 4.0
Krea 2
Entrada del prompt
Lenguaje natural o JSON estructurado
Lenguaje natural más un ajuste de creatividad
Control del diseño
Cuadros delimitadores y paletas de colores
Presets de relación de aspecto y referencias de estilo
Texto dentro de las imágenes
Titulares sólidos, etiquetas legibles
Posible, pero no es su principal atractivo
Transferencia de estilo
Escrita en el bloque de estilo
Hasta 10 imágenes de referencia
Prompt negativo
No es necesario
No forma parte de las entradas
Cifra de precio pública
Unos $60 por cada 1.000 imágenes
Unos $15 por cada 1.000 (Medium Turbo)
El veredicto corto: elige Ideogram cuando la imagen sea un diseño (carteles, empaques, miniaturas con palabras). Elige Krea 2 cuando la imagen sea un ambiente (retratos, escenas editoriales, cualquier cosa en la que quieras que el modelo aporte gusto).
Ejecuta ambos en PicassoIA
Si 38 GB de descargas y un requisito de VRAM desconocido suenan a mal plan, las dos familias funcionan en el navegador en PicassoIA sin configuración, sin marcas de agua y con descargas limpias.
Pega una descripción en lenguaje natural en prompt, o un objeto JSON en json_prompt. Rellena solo uno.
Elige un resolution. Hay más de 20 tamaños, desde 2048x2048 hasta 3328x1248. Déjalo en None y el modelo elige la relación de aspecto por sí mismo. Para un encabezado de blog, 2560x1440 es un 16:9 limpio.
Activa la detección de derechos de autor si vas a publicar con fines comerciales. Es opcional y está desactivada por defecto.
Genera y, cuando quieras borradores más rápidos antes del render final, repite el mismo prompt en Ideogram v4 Balanced.
Ajustes de Krea 2 Large
En Krea 2 Large, cuatro entradas hacen casi todo el trabajo:
creativity: usa raw para fotos de producto que deban coincidir con tus palabras, medium como opción diaria por defecto, high para arte conceptual.
aspect_ratio: 16:9 para banners, 2,35:1 para una franja cinematográfica, 9:16 para publicaciones verticales. Hay ocho relaciones disponibles.
seed: fija una composición que te guste y luego cambia una frase cada vez y compara.
Referencias de estilo: empieza con una intensidad de 0,5 y súbela solo si la referencia apenas se nota.
Cómo elegir el modelo adecuado
Una forma rápida de decidir:
Texto y diseño primero: Ideogram v4 Quality.
Borradores rápidos de la misma idea: Ideogram v4 Balanced.
Ambiente fotográfico o un estilo concreto a partir de referencias: Krea 2 Large.
Dirección pictórica o anime: Krea 2 Medium.
Si ninguno encaja, FLUX 2 Pro, Seedream 5 Pro y GPT Image 2 merecen una prueba con el mismo prompt. Y cuando un gráfico terminado necesita que su texto se separe en piezas editables, Layerize separa las capas de texto.
Crea tus propias imágenes hoy
La forma más rápida de resolver la cuestión de Ideogram frente a Krea es ejecutar tu propio prompt en ambos. Abre PicassoIA, carga Ideogram v4 Quality y Krea 2 Large en dos pestañas, pega la misma idea de una frase en cada una y compara los resultados lado a lado. Después reescribe el prompt como JSON para el primero y ajusta el control de creatividad en el segundo.
Diez minutos de eso te dicen más que cualquier ficha técnica. Elige una escena de tu propio trabajo, ejecútala dos veces y quédate con el modelo que se acerque más a la primera.