Ideogram 4.0: workflow no ComfyUI, dicas de prompt e comparação com o Krea 2

Um olhar prático sobre o Ideogram 4.0 no ComfyUI: os cinco arquivos do modelo e onde colocá-los, como funcionam os prompts JSON estruturados, hábitos de prompt que dão resultado, uma comparação lado a lado com o Krea 2 em controle, texto e preço, e as configurações para rodar os dois no PicassoIA.

Ideogram 4.0: workflow no ComfyUI, dicas de prompt e comparação com o Krea 2
Cristian Da Conceicao
Fundador do Picasso IA

A maioria das pessoas conhece o Ideogram 4.0 por um aplicativo hospedado e nunca vê a parte que o torna incomum: os pesos são abertos, e o ComfyUI traz um workflow pronto que os executa na sua própria máquina. Isso muda o que você baixa, como escreve prompts e como o modelo se compara ao Krea 2, que segue o caminho oposto, com um único controle de criatividade e um conjunto de referências de estilo. A seguir, você encontra a configuração do ComfyUI arquivo por arquivo, o formato de prompt JSON, os hábitos de prompt que compensam, uma comparação direta com o Krea 2 e um atalho para rodar os dois no navegador, no PicassoIA.

O que é o Ideogram 4.0, de fato

O Ideogram construiu sua fama em uma coisa: texto que se lê corretamente dentro de uma imagem. A versão 4.0 mantém essa força e acrescenta uma forma estruturada de descrever uma cena, para que um pôster, a foto de um produto ou um retrato possam ser organizados como uma página, e não deixados ao acaso.

Mãos de um designer apoiadas sobre uma mesa diante de um monitor levemente desfocado, sob luz quente da manhã

Pesos abertos, não apenas uma API

A mudança notável está na distribuição. O modelo foi lançado com pesos abertos, e o ComfyUI adicionou suporte já no primeiro dia, o que significa que você pode executá-lo localmente em vez de pagar por imagem a um servidor de terceiros. A documentação do ComfyUI também lista uma rota separada por nó parceiro, que chama o serviço hospedado; assim, você escolhe entre arquivos locais e uma chamada remota, dependendo do seu hardware.

Dois formatos de prompt

Você pode escrever em linguagem natural simples, o que serve bem para ideias rápidas, ou usar uma legenda JSON estruturada para controle preciso de layout, cores e estilo. A rota JSON é aquela para a qual o modelo foi construído, e a maior parte das discussões da comunidade gira em torno dela. No Ideogram v4 Quality, a mesma divisão aparece como duas entradas separadas: prompt para linguagem natural e json_prompt para a versão estruturada. Use uma ou outra, nunca as duas.

💡 Regra rápida: se a imagem tem um layout que importa (um pôster, um rótulo, um produto sobre um fundo definido), use JSON. Se é um clima ou um retrato, o texto simples é mais rápido.

Configuração do ComfyUI, arquivo por arquivo

A configuração local é, sobretudo, um trabalho de download. O workflow oficial espera cinco arquivos em pastas específicas, e colocá-los no lugar errado é o motivo mais comum para o workflow se recusar a carregar.

Os cinco arquivos do modelo

ArquivoPastaTamanho
ideogram4_fp8_scaled.safetensorsmodels/diffusion_models/cerca de 13,8 GB
ideogram4_unconditional_fp8_scaled.safetensorsmodels/diffusion_models/cerca de 13,8 GB
qwen3vl_8b_fp8_scaled.safetensorsmodels/text_encoders/cerca de 8 GB
gemma4_e4b_it_fp8_scaled.safetensorsmodels/text_encoders/cerca de 2 GB
flux2-vae.safetensorsmodels/vae/cerca de 335 MB

Isso soma aproximadamente 38 GB em disco. Os arquivos vêm do repositório Comfy-Org/Ideogram-4 no Hugging Face. O segundo arquivo de difusão cuida da passagem incondicional, e esse é o motivo pelo qual o modelo não precisa de prompt negativo: o lado incondicional simplesmente descarta os tokens de texto, então não há uma string separada de "evite isto" para preencher.

Carregando o workflow

Baixe o arquivo do workflow na página de documentação do ComfyUI e arraste-o para a tela. O grafo é curto: um nó de subgrafo Ideogram4, que faz o trabalho pesado, um ResolutionSelector para o tamanho da saída e um nó Save Image. Se o ComfyUI mostrar nós ausentes em vermelho, atualize o ComfyUI primeiro, já que o workflow depende de adições recentes.

O workflow padrão já vem com um prompt JSON estruturado preenchido. Edite esse exemplo em vez de começar de uma caixa em branco, porque ele mostra exatamente quais campos o nó espera. Se você prefere montar prompts visualmente, o Ideogram 4 Prompt Builder, no KJNodes, permite posicionar elementos em uma tela e gera o JSON para você.

Gabinete de PC aberto com uma placa de vídeo grande e cabos organizados sobre uma bancada, visto de cima

Choque de realidade sobre o hardware

Aqui está a lacuna honesta: a documentação não informa um valor de VRAM nem uma especificação mínima de sistema. O tamanho dos arquivos diz mais do que a documentação. Dois arquivos de difusão de 13,8 GB somados a um codificador de texto de 8 GB significam uma placa com muita memória, armazenamento rápido e paciência no primeiro carregamento. Execute o workflow padrão uma vez, observe o uso de memória e só então monte um pipeline maior em volta dele. Se sua GPU está no limite, a rota hospedada é a alternativa sensata.

Como escrever prompts JSON que funcionam

A legenda estruturada é formada por um resumo da cena, um bloco de estilo, um fundo e descrições opcionais por objeto, com caixas delimitadoras e paletas de cores hexadecimais. O workflow padrão do ComfyUI organiza isso em três nomes de nível superior.

Os três blocos principais

  • high_level_description: uma ou duas frases que nomeiam a cena inteira.
  • style_description: lente, iluminação, tipo de filme, clima. É aqui que mora "fotografia documental, luz suave de janela, granulação fina".
  • compositional_deconstruction: a lista de elementos, cada um com uma caixa, uma descrição e uma paleta.

Caixas e cores

Esta é a forma de um prompt, reduzida a um único elemento:

{
  "high_level_description": "A white ceramic mug on a walnut desk beside an open notebook, morning window light",
  "style_description": "Documentary photograph, 50mm lens, soft shadows, fine film grain, natural colors",
  "compositional_deconstruction": [
    {
      "description": "White ceramic mug with a thin blue rim, steam rising",
      "bounding_box": [0.55, 0.40, 0.80, 0.75],
      "colors": ["#F4F1EA", "#3C6E9E"]
    }
  ]
}

Trate isso como uma forma, não como um esquema. Os nomes exatos dos campos dentro de cada elemento e a maneira como as coordenadas das caixas são escritas vêm do workflow padrão, então copie-os de lá e não deste esboço.

As cores valem o esforço extra de digitação. Um valor hexadecimal fixa a caneca em um azul específico, enquanto "azul" sozinho varia de uma execução para outra. As caixas fazem o mesmo papel para a posição: em vez de torcer para que "caneca à direita" caia onde você quer, você entrega ao modelo um retângulo.

Também há um motivo prático para preferir JSON mesmo em cenas simples. As notas do ComfyUI dizem que prompts em texto simples apresentam uma taxa maior de falsos positivos do filtro de segurança, e que prompts estruturados reduzem esse bloqueio.

Vista macro de um caderno de papel quadriculado com retângulos desenhados a lápis planejando o layout de uma imagem

Dicas de prompt que se sustentam

O JSON recebe a atenção, mas a maioria das imagens malsucedidas remonta a um texto vago, e não a uma estrutura ausente. Três hábitos resolvem a maioria dos casos.

Diga o que a câmera vê

Descreva a fotografia, não a ideia. Os prompts de exemplo do próprio PicassoIA para o modelo leem-se como uma anotação de câmera: um retrato em filme colorido, profundidade de campo rasa, foco nítido no olho, fundo desfocado com bokeh, granulação de filme com ISO alto, estilo documental espontâneo. Lente, direção da luz e tipo de filme dão ao modelo algo concreto para renderizar, e mantêm os resultados longe do aspecto brilhante e excessivamente polido.

Mantenha o texto curto

Se a imagem precisa de palavras, coloque-as entre aspas e diga onde ficam. Os exemplos das páginas do modelo fazem exatamente isso, com um rótulo curto entre aspas e uma posição como "centralizado". De uma a três palavras por elemento de texto é o ponto ideal. Frases longas dentro de uma imagem são onde todos os modelos, este incluído, começam a falhar.

Dispense o prompt negativo

A arquitetura já cuida do lado do "evite isto", então escreva o que você quer e pare por aí. Na versão hospedada, passar um prompt em linguagem natural ativa o Magic Prompt automaticamente, que expande uma descrição aproximada antes de gerar. Isso ajuda iniciantes e atrapalha se você escreveu um prompt preciso, então confira o resultado com a sua intenção. Se o Magic Prompt reescrever demais, mova a mesma ideia para json_prompt.

Diretor de arte de suéter cinza-carvão apontando para folhas de contato de fotos impressas espalhadas sobre uma mesa branca

Ideogram 4.0 ou Krea 2

O Krea 2 vem em dois tamanhos no PicassoIA. O Krea 2 Large é indicado para fotorrealismo e alcance artístico em um só modelo, e o Krea 2 Medium é posicionado para trabalhos de anime e de pintura.

Uma ressalva antes da tabela: esta comparação se baseia em especificações dos modelos, na documentação do ComfyUI e em listagens públicas. Não é um confronto pixel a pixel, então rode o mesmo prompt nos dois antes de comprometer um projeto com qualquer um deles.

Controle versus gosto

Os dois modelos pedem que você conduza de maneiras diferentes.

O Ideogram 4.0 oferece estrutura. Caixas posicionam os elementos, valores hexadecimais fixam as cores, e o texto entre aspas cai onde você indicou. Você decide, o modelo executa.

O Krea 2 oferece um controle deslizante. A configuração de creativity vai de raw, que renderiza apenas o que você descreve, passando por low e medium, até high, onde o modelo toma liberdade real com luz, atmosfera e composição. Você também pode anexar até 10 imagens de referência de estilo e definir uma intensidade de 0 a 1 (o padrão é 0,5) para decidir quanto a aparência delas molda o resultado.

Fotógrafo em um loft iluminado pelo sol segurando um grande retrato impresso, visto de um ângulo baixo

Custo e velocidade

Um site público de comparação lista o Krea 2 Medium Turbo em cerca de US$ 15 por 1.000 imagens e o Ideogram 4.0 em cerca de US$ 60 por 1.000. Em votações cegas de preferência, os dois ficam praticamente empatados, com 1.223 e 1.217 Elo, sem líder claro. Observe que o valor barato pertence à versão Medium Turbo, e não à Large.

Sobre velocidade, as execuções de exemplo listadas nas páginas de modelo do PicassoIA dão uma noção aproximada: uma amostra do Ideogram v4 Quality levou cerca de 67 segundos, uma amostra do Ideogram v4 Balanced cerca de 41 segundos, e duas amostras do Krea 2 Large cerca de 103 e 143 segundos. São execuções isoladas, não um benchmark, mas sugerem que o Balanced é o modelo de iteração e o Quality é a passagem final.

Ideogram 4.0Krea 2
Entrada do promptLinguagem natural ou JSON estruturadoLinguagem natural mais uma configuração de criatividade
Controle de layoutCaixas delimitadoras e paletas de coresPredefinições de proporção e referências de estilo
Texto dentro das imagensForte em títulos, rótulos legíveisPossível, mas não é o principal diferencial
Transferência de estiloEscrita no bloco de estiloAté 10 imagens de referência
Prompt negativoNão é necessárioNão faz parte das entradas
Valor público de preçoCerca de US$ 60 por 1.000 imagensCerca de US$ 15 por 1.000 (Medium Turbo)

Duas impressões de retrato quase idênticas sobre uma mesa de luz, com uma lupa apoiada em uma delas

O veredito curto: escolha o Ideogram quando a imagem for um layout (pôsteres, embalagens, miniaturas com palavras). Escolha o Krea 2 quando a imagem for um clima (retratos, cenas editoriais, qualquer coisa em que você queira que o modelo traga gosto).

Rode os dois no PicassoIA

Se 38 GB de downloads e uma exigência de VRAM desconhecida soam como uma péssima terça-feira, os dois modelos rodam no navegador, no PicassoIA, sem configuração, sem marca d’água e com downloads limpos.

Ideogram v4 Quality, passo a passo

  1. Abra a página do Ideogram v4 Quality.
  2. Cole uma descrição em linguagem natural em prompt, ou um objeto JSON em json_prompt. Preencha apenas um.
  3. Escolha um resolution. Há mais de 20 tamanhos, de 2048x2048 até 3328x1248. Deixe em None e o modelo escolhe a proporção sozinho. Para o cabeçalho de um blog, 2560x1440 é uma proporção 16:9 limpa.
  4. Ative a detecção de direitos autorais se planeja publicar comercialmente. Ela é opcional e vem desligada por padrão.
  5. Gere, depois repita o mesmo prompt no Ideogram v4 Balanced quando quiser rascunhos mais rápidos antes da renderização final.

Configurações do Krea 2 Large

No Krea 2 Large, quatro entradas fazem a maior parte do trabalho:

  • creativity: use raw para fotos de produto que precisam corresponder às suas palavras, medium como padrão do dia a dia, high para concept art.
  • aspect_ratio: 16:9 para banners, 2,35:1 para uma faixa cinematográfica, 9:16 para publicações verticais. Oito proporções estão disponíveis.
  • seed: trave uma composição de que você goste e depois mude uma frase por vez para comparar.
  • Referências de estilo: comece com intensidade 0,5 e suba só se a referência quase não aparecer.

Quatro colegas ao redor de uma mesa redonda de carvalho segurando duas imagens impressas contra a janela para compará-las

Escolhendo o modelo certo

Um jeito rápido de decidir:

  • Texto e layout vêm primeiro: Ideogram v4 Quality.
  • Rascunhos rápidos da mesma ideia: Ideogram v4 Balanced.
  • Clima fotográfico ou um visual específico a partir de referências: Krea 2 Large.
  • Direção pictórica ou de anime: Krea 2 Medium.

Se nenhum deles servir, vale testar o FLUX 2 Pro, o Seedream 5 Pro e o GPT Image 2 com o mesmo prompt. E quando um gráfico finalizado precisa ter o texto separado em peças editáveis, o Layerize separa as camadas de texto.

Designer gráfico de camisa jeans revisando uma grande fotografia impressa presa em um painel de cortiça

Crie suas próprias imagens hoje

A forma mais rápida de resolver a questão Ideogram ou Krea é rodar o seu próprio prompt nos dois. Abra o PicassoIA, carregue o Ideogram v4 Quality e o Krea 2 Large em duas abas, cole a mesma ideia de uma frase em cada um e compare os resultados lado a lado. Depois, reescreva o prompt em JSON para o primeiro e ajuste a configuração de criatividade no segundo.

Dez minutos disso dizem mais do que qualquer ficha técnica. Escolha uma cena do seu próprio trabalho, rode duas vezes e fique com o modelo que chegar mais perto na primeira tentativa.

Criador freelancer trabalhando em um notebook junto à janela de um café, sob luz dourada do fim de tarde

Compartilhe este artigo

Escolha seu idioma