Ideogram 4.0: workflow no ComfyUI, dicas de prompt e comparação com o Krea 2
Um olhar prático sobre o Ideogram 4.0 no ComfyUI: os cinco arquivos do modelo e onde colocá-los, como funcionam os prompts JSON estruturados, hábitos de prompt que dão resultado, uma comparação lado a lado com o Krea 2 em controle, texto e preço, e as configurações para rodar os dois no PicassoIA.
A maioria das pessoas conhece o Ideogram 4.0 por um aplicativo hospedado e nunca vê a parte que o torna incomum: os pesos são abertos, e o ComfyUI traz um workflow pronto que os executa na sua própria máquina. Isso muda o que você baixa, como escreve prompts e como o modelo se compara ao Krea 2, que segue o caminho oposto, com um único controle de criatividade e um conjunto de referências de estilo. A seguir, você encontra a configuração do ComfyUI arquivo por arquivo, o formato de prompt JSON, os hábitos de prompt que compensam, uma comparação direta com o Krea 2 e um atalho para rodar os dois no navegador, no PicassoIA.
O que é o Ideogram 4.0, de fato
O Ideogram construiu sua fama em uma coisa: texto que se lê corretamente dentro de uma imagem. A versão 4.0 mantém essa força e acrescenta uma forma estruturada de descrever uma cena, para que um pôster, a foto de um produto ou um retrato possam ser organizados como uma página, e não deixados ao acaso.
Pesos abertos, não apenas uma API
A mudança notável está na distribuição. O modelo foi lançado com pesos abertos, e o ComfyUI adicionou suporte já no primeiro dia, o que significa que você pode executá-lo localmente em vez de pagar por imagem a um servidor de terceiros. A documentação do ComfyUI também lista uma rota separada por nó parceiro, que chama o serviço hospedado; assim, você escolhe entre arquivos locais e uma chamada remota, dependendo do seu hardware.
Dois formatos de prompt
Você pode escrever em linguagem natural simples, o que serve bem para ideias rápidas, ou usar uma legenda JSON estruturada para controle preciso de layout, cores e estilo. A rota JSON é aquela para a qual o modelo foi construído, e a maior parte das discussões da comunidade gira em torno dela. No Ideogram v4 Quality, a mesma divisão aparece como duas entradas separadas: prompt para linguagem natural e json_prompt para a versão estruturada. Use uma ou outra, nunca as duas.
💡 Regra rápida: se a imagem tem um layout que importa (um pôster, um rótulo, um produto sobre um fundo definido), use JSON. Se é um clima ou um retrato, o texto simples é mais rápido.
Configuração do ComfyUI, arquivo por arquivo
A configuração local é, sobretudo, um trabalho de download. O workflow oficial espera cinco arquivos em pastas específicas, e colocá-los no lugar errado é o motivo mais comum para o workflow se recusar a carregar.
Os cinco arquivos do modelo
Arquivo
Pasta
Tamanho
ideogram4_fp8_scaled.safetensors
models/diffusion_models/
cerca de 13,8 GB
ideogram4_unconditional_fp8_scaled.safetensors
models/diffusion_models/
cerca de 13,8 GB
qwen3vl_8b_fp8_scaled.safetensors
models/text_encoders/
cerca de 8 GB
gemma4_e4b_it_fp8_scaled.safetensors
models/text_encoders/
cerca de 2 GB
flux2-vae.safetensors
models/vae/
cerca de 335 MB
Isso soma aproximadamente 38 GB em disco. Os arquivos vêm do repositório Comfy-Org/Ideogram-4 no Hugging Face. O segundo arquivo de difusão cuida da passagem incondicional, e esse é o motivo pelo qual o modelo não precisa de prompt negativo: o lado incondicional simplesmente descarta os tokens de texto, então não há uma string separada de "evite isto" para preencher.
Carregando o workflow
Baixe o arquivo do workflow na página de documentação do ComfyUI e arraste-o para a tela. O grafo é curto: um nó de subgrafo Ideogram4, que faz o trabalho pesado, um ResolutionSelector para o tamanho da saída e um nó Save Image. Se o ComfyUI mostrar nós ausentes em vermelho, atualize o ComfyUI primeiro, já que o workflow depende de adições recentes.
O workflow padrão já vem com um prompt JSON estruturado preenchido. Edite esse exemplo em vez de começar de uma caixa em branco, porque ele mostra exatamente quais campos o nó espera. Se você prefere montar prompts visualmente, o Ideogram 4 Prompt Builder, no KJNodes, permite posicionar elementos em uma tela e gera o JSON para você.
Choque de realidade sobre o hardware
Aqui está a lacuna honesta: a documentação não informa um valor de VRAM nem uma especificação mínima de sistema. O tamanho dos arquivos diz mais do que a documentação. Dois arquivos de difusão de 13,8 GB somados a um codificador de texto de 8 GB significam uma placa com muita memória, armazenamento rápido e paciência no primeiro carregamento. Execute o workflow padrão uma vez, observe o uso de memória e só então monte um pipeline maior em volta dele. Se sua GPU está no limite, a rota hospedada é a alternativa sensata.
Como escrever prompts JSON que funcionam
A legenda estruturada é formada por um resumo da cena, um bloco de estilo, um fundo e descrições opcionais por objeto, com caixas delimitadoras e paletas de cores hexadecimais. O workflow padrão do ComfyUI organiza isso em três nomes de nível superior.
Os três blocos principais
high_level_description: uma ou duas frases que nomeiam a cena inteira.
style_description: lente, iluminação, tipo de filme, clima. É aqui que mora "fotografia documental, luz suave de janela, granulação fina".
compositional_deconstruction: a lista de elementos, cada um com uma caixa, uma descrição e uma paleta.
Caixas e cores
Esta é a forma de um prompt, reduzida a um único elemento:
{
"high_level_description": "A white ceramic mug on a walnut desk beside an open notebook, morning window light",
"style_description": "Documentary photograph, 50mm lens, soft shadows, fine film grain, natural colors",
"compositional_deconstruction": [
{
"description": "White ceramic mug with a thin blue rim, steam rising",
"bounding_box": [0.55, 0.40, 0.80, 0.75],
"colors": ["#F4F1EA", "#3C6E9E"]
}
]
}
Trate isso como uma forma, não como um esquema. Os nomes exatos dos campos dentro de cada elemento e a maneira como as coordenadas das caixas são escritas vêm do workflow padrão, então copie-os de lá e não deste esboço.
As cores valem o esforço extra de digitação. Um valor hexadecimal fixa a caneca em um azul específico, enquanto "azul" sozinho varia de uma execução para outra. As caixas fazem o mesmo papel para a posição: em vez de torcer para que "caneca à direita" caia onde você quer, você entrega ao modelo um retângulo.
Também há um motivo prático para preferir JSON mesmo em cenas simples. As notas do ComfyUI dizem que prompts em texto simples apresentam uma taxa maior de falsos positivos do filtro de segurança, e que prompts estruturados reduzem esse bloqueio.
Dicas de prompt que se sustentam
O JSON recebe a atenção, mas a maioria das imagens malsucedidas remonta a um texto vago, e não a uma estrutura ausente. Três hábitos resolvem a maioria dos casos.
Diga o que a câmera vê
Descreva a fotografia, não a ideia. Os prompts de exemplo do próprio PicassoIA para o modelo leem-se como uma anotação de câmera: um retrato em filme colorido, profundidade de campo rasa, foco nítido no olho, fundo desfocado com bokeh, granulação de filme com ISO alto, estilo documental espontâneo. Lente, direção da luz e tipo de filme dão ao modelo algo concreto para renderizar, e mantêm os resultados longe do aspecto brilhante e excessivamente polido.
Mantenha o texto curto
Se a imagem precisa de palavras, coloque-as entre aspas e diga onde ficam. Os exemplos das páginas do modelo fazem exatamente isso, com um rótulo curto entre aspas e uma posição como "centralizado". De uma a três palavras por elemento de texto é o ponto ideal. Frases longas dentro de uma imagem são onde todos os modelos, este incluído, começam a falhar.
Dispense o prompt negativo
A arquitetura já cuida do lado do "evite isto", então escreva o que você quer e pare por aí. Na versão hospedada, passar um prompt em linguagem natural ativa o Magic Prompt automaticamente, que expande uma descrição aproximada antes de gerar. Isso ajuda iniciantes e atrapalha se você escreveu um prompt preciso, então confira o resultado com a sua intenção. Se o Magic Prompt reescrever demais, mova a mesma ideia para json_prompt.
Ideogram 4.0 ou Krea 2
O Krea 2 vem em dois tamanhos no PicassoIA. O Krea 2 Large é indicado para fotorrealismo e alcance artístico em um só modelo, e o Krea 2 Medium é posicionado para trabalhos de anime e de pintura.
Uma ressalva antes da tabela: esta comparação se baseia em especificações dos modelos, na documentação do ComfyUI e em listagens públicas. Não é um confronto pixel a pixel, então rode o mesmo prompt nos dois antes de comprometer um projeto com qualquer um deles.
Controle versus gosto
Os dois modelos pedem que você conduza de maneiras diferentes.
O Ideogram 4.0 oferece estrutura. Caixas posicionam os elementos, valores hexadecimais fixam as cores, e o texto entre aspas cai onde você indicou. Você decide, o modelo executa.
O Krea 2 oferece um controle deslizante. A configuração de creativity vai de raw, que renderiza apenas o que você descreve, passando por low e medium, até high, onde o modelo toma liberdade real com luz, atmosfera e composição. Você também pode anexar até 10 imagens de referência de estilo e definir uma intensidade de 0 a 1 (o padrão é 0,5) para decidir quanto a aparência delas molda o resultado.
Custo e velocidade
Um site público de comparação lista o Krea 2 Medium Turbo em cerca de US$ 15 por 1.000 imagens e o Ideogram 4.0 em cerca de US$ 60 por 1.000. Em votações cegas de preferência, os dois ficam praticamente empatados, com 1.223 e 1.217 Elo, sem líder claro. Observe que o valor barato pertence à versão Medium Turbo, e não à Large.
Sobre velocidade, as execuções de exemplo listadas nas páginas de modelo do PicassoIA dão uma noção aproximada: uma amostra do Ideogram v4 Quality levou cerca de 67 segundos, uma amostra do Ideogram v4 Balanced cerca de 41 segundos, e duas amostras do Krea 2 Large cerca de 103 e 143 segundos. São execuções isoladas, não um benchmark, mas sugerem que o Balanced é o modelo de iteração e o Quality é a passagem final.
Ideogram 4.0
Krea 2
Entrada do prompt
Linguagem natural ou JSON estruturado
Linguagem natural mais uma configuração de criatividade
Controle de layout
Caixas delimitadoras e paletas de cores
Predefinições de proporção e referências de estilo
Texto dentro das imagens
Forte em títulos, rótulos legíveis
Possível, mas não é o principal diferencial
Transferência de estilo
Escrita no bloco de estilo
Até 10 imagens de referência
Prompt negativo
Não é necessário
Não faz parte das entradas
Valor público de preço
Cerca de US$ 60 por 1.000 imagens
Cerca de US$ 15 por 1.000 (Medium Turbo)
O veredito curto: escolha o Ideogram quando a imagem for um layout (pôsteres, embalagens, miniaturas com palavras). Escolha o Krea 2 quando a imagem for um clima (retratos, cenas editoriais, qualquer coisa em que você queira que o modelo traga gosto).
Rode os dois no PicassoIA
Se 38 GB de downloads e uma exigência de VRAM desconhecida soam como uma péssima terça-feira, os dois modelos rodam no navegador, no PicassoIA, sem configuração, sem marca d’água e com downloads limpos.
Cole uma descrição em linguagem natural em prompt, ou um objeto JSON em json_prompt. Preencha apenas um.
Escolha um resolution. Há mais de 20 tamanhos, de 2048x2048 até 3328x1248. Deixe em None e o modelo escolhe a proporção sozinho. Para o cabeçalho de um blog, 2560x1440 é uma proporção 16:9 limpa.
Ative a detecção de direitos autorais se planeja publicar comercialmente. Ela é opcional e vem desligada por padrão.
Gere, depois repita o mesmo prompt no Ideogram v4 Balanced quando quiser rascunhos mais rápidos antes da renderização final.
Configurações do Krea 2 Large
No Krea 2 Large, quatro entradas fazem a maior parte do trabalho:
creativity: use raw para fotos de produto que precisam corresponder às suas palavras, medium como padrão do dia a dia, high para concept art.
aspect_ratio: 16:9 para banners, 2,35:1 para uma faixa cinematográfica, 9:16 para publicações verticais. Oito proporções estão disponíveis.
seed: trave uma composição de que você goste e depois mude uma frase por vez para comparar.
Referências de estilo: comece com intensidade 0,5 e suba só se a referência quase não aparecer.
Escolhendo o modelo certo
Um jeito rápido de decidir:
Texto e layout vêm primeiro: Ideogram v4 Quality.
Rascunhos rápidos da mesma ideia: Ideogram v4 Balanced.
Clima fotográfico ou um visual específico a partir de referências: Krea 2 Large.
Direção pictórica ou de anime: Krea 2 Medium.
Se nenhum deles servir, vale testar o FLUX 2 Pro, o Seedream 5 Pro e o GPT Image 2 com o mesmo prompt. E quando um gráfico finalizado precisa ter o texto separado em peças editáveis, o Layerize separa as camadas de texto.
Crie suas próprias imagens hoje
A forma mais rápida de resolver a questão Ideogram ou Krea é rodar o seu próprio prompt nos dois. Abra o PicassoIA, carregue o Ideogram v4 Quality e o Krea 2 Large em duas abas, cole a mesma ideia de uma frase em cada um e compare os resultados lado a lado. Depois, reescreva o prompt em JSON para o primeiro e ajuste a configuração de criatividade no segundo.
Dez minutos disso dizem mais do que qualquer ficha técnica. Escolha uma cena do seu próprio trabalho, rode duas vezes e fique com o modelo que chegar mais perto na primeira tentativa.