Agente de IA no n8n para geração de imagens: exemplo de fluxo de trabalho
Este exemplo de fluxo de trabalho de agente de IA no n8n para geração de imagens acompanha cada nó, do Chat Trigger até a URL final da imagem: a mensagem de sistema, um subfluxo que cria e consulta previsões, memória para edições de acompanhamento e uma tabela de correções para os erros que travam a maioria das montagens.
Digitar uma frase numa caixa de chat e receber de volta uma fotografia pronta parece um truque simples, até você montar o fluxo e ver um agente decidir sozinho o que escrever, qual ferramenta chamar e quando parar. É isso que um fluxo de trabalho de agente de IA no n8n para geração de imagens faz. Um modelo de linguagem fica no meio, lê seu pedido, expande-o num prompt detalhado, chama uma API de imagem como ferramenta, espera a renderização e devolve um link.
Este exemplo de fluxo de trabalho vai do primeiro nó ao último. Você recebe o layout dos nós, a mensagem de sistema que mantém o agente honesto, as requisições HTTP que conversam com um modelo de imagem, o laço de consulta que barra resultados vazios e os erros que consomem uma tarde inteira. Ele funciona em qualquer instância do n8n, na nuvem ou self-hosted, e cada modelo citado aqui tem uma página no PicassoIA.
O que este fluxo de trabalho faz
O fluxo recebe um pedido simples, como "um mercado de rua chuvoso ao entardecer, fotografado em filme 35mm", e devolve uma URL de imagem hospedada. Entre o pedido e o resultado, um nó AI Agent toma as decisões. Ele nunca chama a API de imagem diretamente. Ele chama uma ferramenta, e a ferramenta faz o trabalho pesado.
A ideia em palavras simples
Cinco peças formam a montagem inteira:
Chat Trigger: recebe a mensagem do painel de chat do n8n ou de um link público de chat.
AI Agent: lê a mensagem e decide o que fazer em seguida.
Modelo de chat: o cérebro por trás do agente, conectado como sub-nó.
Memória: guarda as trocas anteriores, para que "faça mais largo" ainda faça sentido.
Ferramenta de imagem: um sub-fluxo que inicia a renderização, espera o resultado e devolve a URL.
Isso é um único ciclo de conversa. O usuário fala, o agente pensa, a ferramenta renderiza, o agente responde. Nada mais é necessário para uma primeira versão, e cada melhoria posterior (aprovações, armazenamento, agendamento) se acopla a uma dessas cinco peças.
Por que um agente vence uma cadeia fixa
Uma cadeia fixa (gatilho, modelo de linguagem, requisição HTTP, resposta) funciona até alguém escrever "me dê três variações, e deixe uma delas quadrada". O agente pode chamar a ferramenta três vezes com argumentos diferentes, fazer uma pergunta de esclarecimento ou questionar um pedido vago demais para ser visualizado. Uma cadeia só consegue fazer o que você desenhou na tela.
Situação
Cadeia fixa
AI Agent
Um pedido simples
Funciona
Funciona
Três variações
Precisa de um laço montado à mão
Chama a ferramenta três vezes
Pedido vago
Repassa o texto vago
Faz uma pergunta ou acrescenta detalhes
Proporção diferente
Precisa de um novo ramo
Passa outro argumento
Edições seguintes
Esquece o contexto
Lê sua memória
Depuração
Linear e fácil
Precisa do log de execução
💡 A contrapartida é real. Agentes gastam mais tokens e se comportam de forma menos previsível do que uma cadeia. Se todos os pedidos forem parecidos, uma cadeia é mais barata e mais simples. Escolha o agente quando os pedidos variarem.
O que você precisa primeiro
Três coisas: uma instância do n8n recente o bastante para incluir o nó AI Agent e seus sub-nós de ferramenta, uma credencial para um modelo de chat e uma credencial para uma API de imagem. Some paciência para uma execução de teste e você está pronto.
Escolha o modelo cérebro
O modelo do agente precisa chamar ferramentas com confiabilidade. Um modelo rápido costuma bastar, porque o agente escreve sobretudo um prompt e escolhe dois argumentos. Estes modelos de linguagem do PicassoIA são bons candidatos:
Defina a temperatura entre 0,2 e 0,4. Pouca aleatoriedade faz com que os argumentos da ferramenta saiam sempre no mesmo formato.
Escolha o modelo de imagem
Qualquer que seja o modelo de imagem por trás da ferramenta, o agente só enxerga um nome, uma descrição e duas entradas. Trocar de modelo depois significa editar uma URL no sub-fluxo. Estes modelos de texto para imagem formam uma lista útil:
A API do PicassoIA expõe picassoia/picassoia-image para texto para imagem e picassoia/picassoia-image-editor-pro para edições. Os modelos da tabela rodam no aplicativo web, o que os torna uma bancada de testes prática: teste um prompt ali antes de confiar ao agente o envio dele.
Montando o fluxo de trabalho no n8n
Passo 1: Chat Trigger e agente
Crie um novo fluxo de trabalho. Adicione o nó Chat Trigger (listado como When chat message received), depois um nó AI Agent, e conecte o gatilho ao agente. As versões atuais do n8n executam o agente como um tools agent por padrão. Se a sua versão pedir um tipo de agente, escolha Tools Agent.
Na conexão Chat Model do agente, clique no sinal de mais e adicione o nó de modelo que corresponde à sua credencial. Cole a credencial, defina a temperatura como 0,3 e siga em frente.
Passo 2: Escreva a mensagem de sistema
Abra o nó AI Agent, adicione a opção System Message e cole isto:
You are an image generation assistant.
When the user asks for an image, call the generate_image tool.
Before calling it, rewrite the request as one detailed photographic prompt of 60 to 120 words: subject, setting, lighting direction, lens and surface textures.
Avoid neon, cartoon and CGI wording unless the user asks for it.
If the request is too vague to picture, ask one short question first.
After the tool returns, reply with the image URL on its own line, then one sentence describing the result.
Never invent a URL. If the tool returns an error, say so and offer one retry.
Cada linha tem uma função. A regra de reescrita é de onde vem a qualidade da imagem. A regra "nunca invente uma URL" existe porque um agente produz, sem hesitar, um link plausível quando uma ferramenta falha. A regra de nova tentativa interrompe laços sem fim.
💡 Nas opções do agente, defina Max Iterations como 6 ou 8. Um laço travado então termina com erro, em vez de consumir tokens a noite toda.
Passo 3: Monte a ferramenta de imagem
Adicione um sub-nó Call n8n Workflow Tool à conexão Tool do agente. Dê a ele o nome generate_image e escreva a descrição como um chamado de trabalho:
Creates one photographic image from a detailed prompt and returns its public URL.
Inputs: prompt (string, required), aspect_ratio (16:9, 1:1 or 9:16).
Aponte a ferramenta para um segundo fluxo de trabalho e monte esse fluxo nesta ordem:
Execute Workflow Trigger com dois campos de entrada: prompt e aspect_ratio.
HTTP Request chamado Create prediction, que inicia a renderização.
Nó Wait configurado para 5 segundos.
HTTP Request chamado Get prediction, que verifica o status.
Nó IF que testa se o status é igual a succeeded.
Se verdadeiro: um nó Edit Fields que gera um único campo chamado imageUrl.
Se falso: um segundo IF que envia failed para um nó Stop and Error e devolve todos os outros status ao nó Wait.
Por que um sub-fluxo em vez de uma HTTP Request Tool isolada? APIs de imagem são assíncronas. Uma ferramenta isolada iniciaria a renderização e devolveria um id, obrigando o agente a consultar sozinho, o que custa turnos e tokens extras. O sub-fluxo esconde o laço, então o agente vê uma única chamada de ferramenta e uma única URL.
Passo 4: Adicione memória
Anexe o sub-nó Simple Memory ao agente e defina a janela de contexto para cerca de oito mensagens. Ele usa o id da sessão de chat por padrão, então cada visitante tem um histórico separado. Com a memória ativa, "agora faça a segunda mais larga" funciona, porque o agente consegue ler o prompt anterior e mudar um detalhe.
O mesmo agente também responde pelo celular. Troque o Chat Trigger por um gatilho de Telegram ou Webhook e o restante do fluxo continua intacto.
Conectando a API de imagem
Os nós HTTP dentro do sub-fluxo se comunicam com a API do PicassoIA: endereço base https://api.picassoia.com/v1, um bearer token que começa com pia_sk_, e endpoints de previsão no estilo Replicate. Os trabalhos são assíncronos: você cria uma previsão, consulta o status dela e depois lê o resultado. Crie seu token na página da API do PicassoIA e salve-o no n8n como uma credencial Header Auth, com o nome Authorization e o valor Bearer seguido do seu token.
Crie a previsão
No nó Create prediction, defina o método como POST, a autenticação como Generic Credential Type com Header Auth, e o tipo de corpo como JSON.
A resposta inclui uma previsão id. Os nomes dos campos de entrada variam entre modelos, então confirme-os na página da API do modelo que você chama. Os prompts podem ter até 4.000 caracteres, o que deixa bastante espaço para uma descrição fotográfica de 120 palavras.
Consulte até terminar
Em Get prediction, envie uma requisição GET para /v1/predictions/{{ $('Create prediction').item.json.id }}. O status passa para succeeded ou failed, e o nó IF lê {{ $json.status }}. Em seguida, o nó Edit Fields extrai o link da resposta:
Alguns modelos devolvem uma lista e outros uma string única, daí a verificação. Adicione um contador e envie a execução para Stop and Error após 40 consultas, cerca de três minutos com cinco segundos cada. Sem esse teto, um único trabalho travado pode manter uma execução aberta por horas.
💡 Uma conta pode rodar 5 previsões ao mesmo tempo. Para lotes, coloque um nó Loop Over Items antes do agente com tamanho de lote de 2 ou 3, para que a quinta requisição nunca caia numa fila cheia.
Prompts que o agente escreve melhor
Deixe o agente expandir pedidos curtos
As pessoas digitam cinco palavras. Os modelos de imagem querem cinquenta. A mensagem de sistema preenche essa lacuna, então o agente transforma um pedido curto num briefing fotográfico completo.
Usuário: um mercado de rua chuvoso ao entardecer
Prompt do agente:Ampla feira de rua ao entardecer, depois da chuva, vendedores sob toldos listrados, paralelepípedos molhados refletindo lâmpadas de tungstênio quentes, compradores com guarda-chuvas ao fundo, névoa suave vindo da esquerda, lente de 35mm em f/2, grão fino de filme, paleta de Kodak Portra 400, textura visível do tecido e gotas d'água nas caixas de frutas.
Coloque estas regras na mensagem de sistema e o agente as aplica sempre:
Nomeie a direção da luz, como luz suave de janela vinda da esquerda.
Nomeie a lente, como 35mm f/2 ou 85mm f/1.8.
Descreva texturas de superfície: trama do tecido, veio da madeira, pedra molhada.
Mantenha um assunto por prompt.
Evite texto dentro das imagens, ou limite-o a uma ou duas palavras.
Escreva-as como regras ("sempre nomeie a lente"), não como desejos ("tente mencionar a lente"). Agentes seguem regras muito mais vezes do que sugestões.
Como usar o Flux 2 Pro
Antes de fixar uma regra de estilo na mensagem de sistema, teste-a manualmente no PicassoIA:
Cole um prompt expandido que o agente escreveu em uma execução anterior.
Escolha 16:9 para cenas amplas, 1:1 para blocos de produtos ou 9:16 para stories.
Execute a geração e compare o resultado com a imagem que você tem em mente.
Altere um detalhe por vez, primeiro a iluminação e depois a lente, e execute de novo.
Quando o resultado corresponder à sua ideia, copie a formulação vencedora de volta para a mensagem de sistema.
💡 Altere uma variável por execução. Se você reescrever o prompt inteiro a cada vez, nunca vai descobrir qual mudança ajudou. Para textos curtos e legíveis dentro de uma cena, execute o mesmo prompt no GPT Image 2 e compare.
Onde o fluxo de trabalho se paga
Fotos de produto sob demanda
Uma dona de loja digita "caneca de cerâmica sobre linho, luz da manhã" e recebe de volta uma foto de rascunho para o anúncio, dentro de uma única conversa. Adicione um nó Google Sheets depois do agente para acrescentar o nome do produto, o prompt e a URL numa planilha. A equipe passa a ter um registro de cada renderização, e ninguém precisa procurar no histórico do chat pela boa.
Como a memória está ativa, a dona pode dizer "mesma caneca, mesa de madeira mais escura", e o agente reaproveita a redação anterior com uma mudança. Esse hábito de fazer acompanhamentos é o que separa um agente de um formulário.
Lotes para blog e redes sociais
Substitua o Chat Trigger por um Schedule Trigger. Leia uma coluna de temas de uma planilha, envie cada linha pelo Loop Over Items para o agente e escreva a URL devolvida ao lado do tema. Uma semana de imagens de destaque chega enquanto você faz outra coisa.
Adicione uma etapa de aprovação humana antes de qualquer coisa ir ao público. Envie as URLs para o Slack ou por e-mail e espere um joinha. Agentes são rápidos, mas uma pessoa ainda percebe um dedo a mais ou uma estação do ano errada.
Corrigindo falhas comuns
Sintoma
Causa provável
Correção
O agente responde sem chamar a ferramenta
Descrição vaga da ferramenta
Comece a descrição com um verbo e nomeie cada entrada
A ferramenta roda, mas a resposta não tem URL
Nome do campo de saída não confere
Verifique se o nó Edit Fields gera imageUrl e teste o sub-fluxo isoladamente
A consulta nunca termina
Sem ramo de falha ou sem teto de consultas
Direcione failed para Stop and Error e limite o laço a 40 consultas
Resposta 401
Cabeçalho errado ou token expirado
Recrie a credencial Header Auth e mantenha o prefixo Bearer
Erros 429 ou de fila
Mais de 5 trabalhos ao mesmo tempo
Use Loop Over Items com tamanho de lote de 2 ou 3
Imagens com aparência de desenho animado
Prompt sem detalhes fotográficos
Adicione regras de lente, direção da luz e textura na mensagem de sistema
O agente chama a ferramenta várias vezes seguidas
Max Iterations alto demais
Defina como 6 e mantenha a regra de uma única nova tentativa
💡 Quando algo quebrar, rode o sub-fluxo sozinho com dados de entrada fixados. Se funcionar por conta própria, a falha está nas instruções do agente, não nos nós HTTP.
Experimente no PicassoIA hoje
Monte primeiro a versão mais simples: um Chat Trigger, um AI Agent, uma ferramenta de imagem. Dez minutos de conexões dão a você uma caixa de chat que devolve fotografias, e cada melhoria depois disso é um único nó.
Abra o Flux 2 Pro, o GPT Image 2 ou o Nano Banana Pro no seu navegador e escreva seu primeiro prompt à mão. Escolha um dos modelos de linguagem acima, pegue um token da API na página da API do PicassoIA e deixe o agente escrever os próximos cem prompts para você. Gere suas próprias imagens no PicassoIA e depois envie o melhor prompt de volta para o seu fluxo de trabalho.