Agente de IA no n8n para geração de imagens: exemplo de fluxo de trabalho

Este exemplo de fluxo de trabalho de agente de IA no n8n para geração de imagens acompanha cada nó, do Chat Trigger até a URL final da imagem: a mensagem de sistema, um subfluxo que cria e consulta previsões, memória para edições de acompanhamento e uma tabela de correções para os erros que travam a maioria das montagens.

Agente de IA no n8n para geração de imagens: exemplo de fluxo de trabalho
Cristian Da Conceicao
Fundador do Picasso IA

Digitar uma frase numa caixa de chat e receber de volta uma fotografia pronta parece um truque simples, até você montar o fluxo e ver um agente decidir sozinho o que escrever, qual ferramenta chamar e quando parar. É isso que um fluxo de trabalho de agente de IA no n8n para geração de imagens faz. Um modelo de linguagem fica no meio, lê seu pedido, expande-o num prompt detalhado, chama uma API de imagem como ferramenta, espera a renderização e devolve um link.

Este exemplo de fluxo de trabalho vai do primeiro nó ao último. Você recebe o layout dos nós, a mensagem de sistema que mantém o agente honesto, as requisições HTTP que conversam com um modelo de imagem, o laço de consulta que barra resultados vazios e os erros que consomem uma tarde inteira. Ele funciona em qualquer instância do n8n, na nuvem ou self-hosted, e cada modelo citado aqui tem uma página no PicassoIA.

Vista por cima do ombro de um desenvolvedor sentado diante de uma mesa de carvalho, montando uma automação em nós num notebook sob luz da manhã

O que este fluxo de trabalho faz

O fluxo recebe um pedido simples, como "um mercado de rua chuvoso ao entardecer, fotografado em filme 35mm", e devolve uma URL de imagem hospedada. Entre o pedido e o resultado, um nó AI Agent toma as decisões. Ele nunca chama a API de imagem diretamente. Ele chama uma ferramenta, e a ferramenta faz o trabalho pesado.

A ideia em palavras simples

Cinco peças formam a montagem inteira:

  • Chat Trigger: recebe a mensagem do painel de chat do n8n ou de um link público de chat.
  • AI Agent: lê a mensagem e decide o que fazer em seguida.
  • Modelo de chat: o cérebro por trás do agente, conectado como sub-nó.
  • Memória: guarda as trocas anteriores, para que "faça mais largo" ainda faça sentido.
  • Ferramenta de imagem: um sub-fluxo que inicia a renderização, espera o resultado e devolve a URL.

Isso é um único ciclo de conversa. O usuário fala, o agente pensa, a ferramenta renderiza, o agente responde. Nada mais é necessário para uma primeira versão, e cada melhoria posterior (aprovações, armazenamento, agendamento) se acopla a uma dessas cinco peças.

Por que um agente vence uma cadeia fixa

Uma cadeia fixa (gatilho, modelo de linguagem, requisição HTTP, resposta) funciona até alguém escrever "me dê três variações, e deixe uma delas quadrada". O agente pode chamar a ferramenta três vezes com argumentos diferentes, fazer uma pergunta de esclarecimento ou questionar um pedido vago demais para ser visualizado. Uma cadeia só consegue fazer o que você desenhou na tela.

SituaçãoCadeia fixaAI Agent
Um pedido simplesFuncionaFunciona
Três variaçõesPrecisa de um laço montado à mãoChama a ferramenta três vezes
Pedido vagoRepassa o texto vagoFaz uma pergunta ou acrescenta detalhes
Proporção diferentePrecisa de um novo ramoPassa outro argumento
Edições seguintesEsquece o contextoLê sua memória
DepuraçãoLinear e fácilPrecisa do log de execução

💡 A contrapartida é real. Agentes gastam mais tokens e se comportam de forma menos previsível do que uma cadeia. Se todos os pedidos forem parecidos, uma cadeia é mais barata e mais simples. Escolha o agente quando os pedidos variarem.

Vista de cima de um fluxograma desenhado à mão num caderno, ao lado de notas adesivas e um café com leite sobre uma mesa de carvalho clara

O que você precisa primeiro

Três coisas: uma instância do n8n recente o bastante para incluir o nó AI Agent e seus sub-nós de ferramenta, uma credencial para um modelo de chat e uma credencial para uma API de imagem. Some paciência para uma execução de teste e você está pronto.

Escolha o modelo cérebro

O modelo do agente precisa chamar ferramentas com confiabilidade. Um modelo rápido costuma bastar, porque o agente escreve sobretudo um prompt e escolhe dois argumentos. Estes modelos de linguagem do PicassoIA são bons candidatos:

ModeloPor que combina com este fluxo
Claude Sonnet 5Segue mensagens de sistema longas e chama ferramentas na ordem certa
GPT 5.6 LunaRespostas rápidas, adequadas a sessões conversacionais
Gemini 3.5 FlashRespostas ágeis, e aceita imagens como entrada
Kimi K2.6Feito para trabalho de agentes e código

Defina a temperatura entre 0,2 e 0,4. Pouca aleatoriedade faz com que os argumentos da ferramenta saiam sempre no mesmo formato.

Escolha o modelo de imagem

Qualquer que seja o modelo de imagem por trás da ferramenta, o agente só enxerga um nome, uma descrição e duas entradas. Trocar de modelo depois significa editar uma URL no sub-fluxo. Estes modelos de texto para imagem formam uma lista útil:

ModeloMelhor uso num fluxo de agente
GPT Image 2Seguimento preciso de instruções e textos curtos dentro das imagens
Flux 2 ProRealismo fotográfico com pele e materiais naturais
Nano Banana ProEdições de cena e um assunto consistente entre renderizações
Seedream 4.5Detalhe nítido e composição forte
P-ImageRenderizações rápidas para rascunhos

A API do PicassoIA expõe picassoia/picassoia-image para texto para imagem e picassoia/picassoia-image-editor-pro para edições. Os modelos da tabela rodam no aplicativo web, o que os torna uma bancada de testes prática: teste um prompt ali antes de confiar ao agente o envio dele.

Montando o fluxo de trabalho no n8n

Passo 1: Chat Trigger e agente

Crie um novo fluxo de trabalho. Adicione o nó Chat Trigger (listado como When chat message received), depois um nó AI Agent, e conecte o gatilho ao agente. As versões atuais do n8n executam o agente como um tools agent por padrão. Se a sua versão pedir um tipo de agente, escolha Tools Agent.

Na conexão Chat Model do agente, clique no sinal de mais e adicione o nó de modelo que corresponde à sua credencial. Cole a credencial, defina a temperatura como 0,3 e siga em frente.

Close de mãos de uma mulher digitando num notebook prateado num café iluminado, com um cappuccino ao lado

Passo 2: Escreva a mensagem de sistema

Abra o nó AI Agent, adicione a opção System Message e cole isto:

You are an image generation assistant.
When the user asks for an image, call the generate_image tool.
Before calling it, rewrite the request as one detailed photographic prompt of 60 to 120 words: subject, setting, lighting direction, lens and surface textures.
Avoid neon, cartoon and CGI wording unless the user asks for it.
If the request is too vague to picture, ask one short question first.
After the tool returns, reply with the image URL on its own line, then one sentence describing the result.
Never invent a URL. If the tool returns an error, say so and offer one retry.

Cada linha tem uma função. A regra de reescrita é de onde vem a qualidade da imagem. A regra "nunca invente uma URL" existe porque um agente produz, sem hesitar, um link plausível quando uma ferramenta falha. A regra de nova tentativa interrompe laços sem fim.

💡 Nas opções do agente, defina Max Iterations como 6 ou 8. Um laço travado então termina com erro, em vez de consumir tokens a noite toda.

Passo 3: Monte a ferramenta de imagem

Adicione um sub-nó Call n8n Workflow Tool à conexão Tool do agente. Dê a ele o nome generate_image e escreva a descrição como um chamado de trabalho:

Creates one photographic image from a detailed prompt and returns its public URL.
Inputs: prompt (string, required), aspect_ratio (16:9, 1:1 or 9:16).

Aponte a ferramenta para um segundo fluxo de trabalho e monte esse fluxo nesta ordem:

  1. Execute Workflow Trigger com dois campos de entrada: prompt e aspect_ratio.
  2. HTTP Request chamado Create prediction, que inicia a renderização.
  3. Nó Wait configurado para 5 segundos.
  4. HTTP Request chamado Get prediction, que verifica o status.
  5. Nó IF que testa se o status é igual a succeeded.
  6. Se verdadeiro: um nó Edit Fields que gera um único campo chamado imageUrl.
  7. Se falso: um segundo IF que envia failed para um nó Stop and Error e devolve todos os outros status ao nó Wait.

Por que um sub-fluxo em vez de uma HTTP Request Tool isolada? APIs de imagem são assíncronas. Uma ferramenta isolada iniciaria a renderização e devolveria um id, obrigando o agente a consultar sozinho, o que custa turnos e tokens extras. O sub-fluxo esconde o laço, então o agente vê uma única chamada de ferramenta e uma única URL.

Vista lateral de um quadro de cortiça com fotos impressas e fichas presas por barbante vermelho

Passo 4: Adicione memória

Anexe o sub-nó Simple Memory ao agente e defina a janela de contexto para cerca de oito mensagens. Ele usa o id da sessão de chat por padrão, então cada visitante tem um histórico separado. Com a memória ativa, "agora faça a segunda mais larga" funciona, porque o agente consegue ler o prompt anterior e mudar um detalhe.

O mesmo agente também responde pelo celular. Troque o Chat Trigger por um gatilho de Telegram ou Webhook e o restante do fluxo continua intacto.

Vista macro de uma mão segurando um smartphone com uma conversa de chat e a miniatura de uma foto

Conectando a API de imagem

Os nós HTTP dentro do sub-fluxo se comunicam com a API do PicassoIA: endereço base https://api.picassoia.com/v1, um bearer token que começa com pia_sk_, e endpoints de previsão no estilo Replicate. Os trabalhos são assíncronos: você cria uma previsão, consulta o status dela e depois lê o resultado. Crie seu token na página da API do PicassoIA e salve-o no n8n como uma credencial Header Auth, com o nome Authorization e o valor Bearer seguido do seu token.

Crie a previsão

No nó Create prediction, defina o método como POST, a autenticação como Generic Credential Type com Header Auth, e o tipo de corpo como JSON.

POST /v1/models/picassoia/picassoia-image/predictions

{
  "input": {
    "prompt": "{{ $json.prompt }}",
    "aspect_ratio": "{{ $json.aspect_ratio }}"
  }
}

A resposta inclui uma previsão id. Os nomes dos campos de entrada variam entre modelos, então confirme-os na página da API do modelo que você chama. Os prompts podem ter até 4.000 caracteres, o que deixa bastante espaço para uma descrição fotográfica de 120 palavras.

Consulte até terminar

Em Get prediction, envie uma requisição GET para /v1/predictions/{{ $('Create prediction').item.json.id }}. O status passa para succeeded ou failed, e o nó IF lê {{ $json.status }}. Em seguida, o nó Edit Fields extrai o link da resposta:

imageUrl = {{ Array.isArray($json.output) ? $json.output[0] : $json.output }}

Alguns modelos devolvem uma lista e outros uma string única, daí a verificação. Adicione um contador e envie a execução para Stop and Error após 40 consultas, cerca de três minutos com cinco segundos cada. Sem esse teto, um único trabalho travado pode manter uma execução aberta por horas.

💡 Uma conta pode rodar 5 previsões ao mesmo tempo. Para lotes, coloque um nó Loop Over Items antes do agente com tamanho de lote de 2 ou 3, para que a quinta requisição nunca caia numa fila cheia.

Prompts que o agente escreve melhor

Deixe o agente expandir pedidos curtos

As pessoas digitam cinco palavras. Os modelos de imagem querem cinquenta. A mensagem de sistema preenche essa lacuna, então o agente transforma um pedido curto num briefing fotográfico completo.

Usuário: um mercado de rua chuvoso ao entardecer

Prompt do agente: Ampla feira de rua ao entardecer, depois da chuva, vendedores sob toldos listrados, paralelepípedos molhados refletindo lâmpadas de tungstênio quentes, compradores com guarda-chuvas ao fundo, névoa suave vindo da esquerda, lente de 35mm em f/2, grão fino de filme, paleta de Kodak Portra 400, textura visível do tecido e gotas d'água nas caixas de frutas.

Coloque estas regras na mensagem de sistema e o agente as aplica sempre:

  • Nomeie a direção da luz, como luz suave de janela vinda da esquerda.
  • Nomeie a lente, como 35mm f/2 ou 85mm f/1.8.
  • Descreva texturas de superfície: trama do tecido, veio da madeira, pedra molhada.
  • Mantenha um assunto por prompt.
  • Evite texto dentro das imagens, ou limite-o a uma ou duas palavras.

Escreva-as como regras ("sempre nomeie a lente"), não como desejos ("tente mencionar a lente"). Agentes seguem regras muito mais vezes do que sugestões.

Duas colegas inclinadas na direção de um monitor para revisar uma grade de fotografias de paisagens num escritório iluminado

Como usar o Flux 2 Pro

Antes de fixar uma regra de estilo na mensagem de sistema, teste-a manualmente no PicassoIA:

  1. Abra a página do Flux 2 Pro.
  2. Cole um prompt expandido que o agente escreveu em uma execução anterior.
  3. Escolha 16:9 para cenas amplas, 1:1 para blocos de produtos ou 9:16 para stories.
  4. Execute a geração e compare o resultado com a imagem que você tem em mente.
  5. Altere um detalhe por vez, primeiro a iluminação e depois a lente, e execute de novo.
  6. Quando o resultado corresponder à sua ideia, copie a formulação vencedora de volta para a mensagem de sistema.

💡 Altere uma variável por execução. Se você reescrever o prompt inteiro a cada vez, nunca vai descobrir qual mudança ajudou. Para textos curtos e legíveis dentro de uma cena, execute o mesmo prompt no GPT Image 2 e compare.

Onde o fluxo de trabalho se paga

Fotos de produto sob demanda

Vista na altura da mesa de três canecas de cerâmica feitas à mão sobre linho, num pequeno estúdio de fotografia de produtos

Uma dona de loja digita "caneca de cerâmica sobre linho, luz da manhã" e recebe de volta uma foto de rascunho para o anúncio, dentro de uma única conversa. Adicione um nó Google Sheets depois do agente para acrescentar o nome do produto, o prompt e a URL numa planilha. A equipe passa a ter um registro de cada renderização, e ninguém precisa procurar no histórico do chat pela boa.

Como a memória está ativa, a dona pode dizer "mesma caneca, mesa de madeira mais escura", e o agente reaproveita a redação anterior com uma mudança. Esse hábito de fazer acompanhamentos é o que separa um agente de um formulário.

Lotes para blog e redes sociais

Vista aérea de uma bancada de madeira com um tablet, um notebook e provas de fotos impressas sob luz da tarde

Substitua o Chat Trigger por um Schedule Trigger. Leia uma coluna de temas de uma planilha, envie cada linha pelo Loop Over Items para o agente e escreva a URL devolvida ao lado do tema. Uma semana de imagens de destaque chega enquanto você faz outra coisa.

Adicione uma etapa de aprovação humana antes de qualquer coisa ir ao público. Envie as URLs para o Slack ou por e-mail e espere um joinha. Agentes são rápidos, mas uma pessoa ainda percebe um dedo a mais ou uma estação do ano errada.

Corrigindo falhas comuns

SintomaCausa provávelCorreção
O agente responde sem chamar a ferramentaDescrição vaga da ferramentaComece a descrição com um verbo e nomeie cada entrada
A ferramenta roda, mas a resposta não tem URLNome do campo de saída não confereVerifique se o nó Edit Fields gera imageUrl e teste o sub-fluxo isoladamente
A consulta nunca terminaSem ramo de falha ou sem teto de consultasDirecione failed para Stop and Error e limite o laço a 40 consultas
Resposta 401Cabeçalho errado ou token expiradoRecrie a credencial Header Auth e mantenha o prefixo Bearer
Erros 429 ou de filaMais de 5 trabalhos ao mesmo tempoUse Loop Over Items com tamanho de lote de 2 ou 3
Imagens com aparência de desenho animadoPrompt sem detalhes fotográficosAdicione regras de lente, direção da luz e textura na mensagem de sistema
O agente chama a ferramenta várias vezes seguidasMax Iterations alto demaisDefina como 6 e mantenha a regra de uma única nova tentativa

💡 Quando algo quebrar, rode o sub-fluxo sozinho com dados de entrada fixados. Se funcionar por conta própria, a falha está nas instruções do agente, não nos nós HTTP.

Experimente no PicassoIA hoje

Monte primeiro a versão mais simples: um Chat Trigger, um AI Agent, uma ferramenta de imagem. Dez minutos de conexões dão a você uma caixa de chat que devolve fotografias, e cada melhoria depois disso é um único nó.

Abra o Flux 2 Pro, o GPT Image 2 ou o Nano Banana Pro no seu navegador e escreva seu primeiro prompt à mão. Escolha um dos modelos de linguagem acima, pegue um token da API na página da API do PicassoIA e deixe o agente escrever os próximos cem prompts para você. Gere suas próprias imagens no PicassoIA e depois envie o melhor prompt de volta para o seu fluxo de trabalho.

Jovem criadora segurando uma fotografia impressa diante de uma janela com pôr do sol num pequeno estúdio em casa

Compartilhe este artigo

Escolha seu idioma