A maioria das pessoas que pesquisam um agente de IA gratuito para imagens quer a mesma coisa: digitar um pedido, receber uma imagem pronta e nunca ver uma cobrança. O problema é que a palavra "agente" esconde dois trabalhos separados. Uma parte pensa: lê seu pedido, escreve um prompt mais preciso, verifica o resultado e tenta de novo. A outra parte pinta: um modelo de difusão que transforma esse prompt em pixels. Dá para rodar as duas coisas em um PC doméstico por zero dólar por mês, mas só quando as peças combinam com a sua placa de vídeo.
Este artigo compara as configurações que as pessoas realmente usam em casa, mostra qual hardware cada uma exige e aponta um vencedor claro para a maioria dos leitores. Também mostra onde uma configuração local chega ao limite, porque fingir que isso nunca acontece desperdiçaria o seu fim de semana.
O que é realmente um agente de imagens

O cérebro e o pincel
Um gerador de imagens comum recebe um prompt e devolve uma imagem. Um agente envolve esse processo em um ciclo. Um modelo de linguagem lê o seu objetivo ("uma foto de produto de uma caneca de cerâmica sobre um pano de linho, luz da manhã"), expande isso em um prompt detalhado, chama a ferramenta de imagem, analisa o resultado e decide se mantém a imagem ou tenta de novo.
Em uma montagem local, o cérebro costuma ser um modelo de linguagem pequeno de pesos abertos servido pelo Ollama ou pelo LM Studio. Bons candidatos de tamanho local incluem o IBM Granite 4.1 8B e o GPT OSS 20B. O pincel é um modelo de difusão rodando dentro do ComfyUI, do InvokeAI, do Forge ou de uma interface semelhante.
Por que gratuito e local importa
Rodar localmente elimina três incômodos recorrentes:
- Sem taxa por imagem. Seu custo é a eletricidade e a placa que você já tem.
- Sem fila. O tráfego de outras pessoas não desacelera o seu lote.
- Privacidade total. Fotos de referência, arquivos de clientes e produtos não lançados nunca saem da sua máquina.
💡 Teste rápido: Se você gera menos de algumas dezenas de imagens por mês, um conjunto de ferramentas locais pode custar mais em tempo de configuração do que economiza. Se você gera centenas, ela se paga rápido.
O hardware que você precisa primeiro

A VRAM decide quase tudo
A memória de vídeo da sua placa gráfica é o primeiro filtro. A velocidade do processador e a RAM do sistema importam bem menos. A tabela abaixo traz faixas aproximadas e práticas. Os números exatos mudam com a versão do modelo, o nível de quantização e a resolução que você pedir.
| Memória de vídeo | Modelos de imagem que rodam bem | Modelo de linguagem que cabe junto | O que esperar |
|---|
| 4 GB | Modelos antigos e pequenos | 3B em 4 bits | Lento, baixa resolução |
| 6 a 8 GB | SDXL com descarregamento de memória, modelos turbo compactos | 7B a 8B em 4 bits | Imagens de 1024 px utilizáveis em menos de um minuto |
| 12 GB | SDXL com folga, variantes quantizadas do FLUX | 8B em 4 bits | Trabalho diário tranquilo |
| 16 a 24 GB | FLUX 2 Dev e Qwen Image 2512 em precisão reduzida | Classe 20B | A melhor qualidade local disponível |
O modelo de imagem e o modelo de linguagem disputam a mesma memória. A solução prática é simples: deixe o ComfyUI descarregar os modelos entre as etapas e defina o valor de keep_alive do Ollama baixo, para que o modelo de linguagem saia da memória assim que escrever o prompt. Por padrão, o Ollama mantém um modelo carregado por cinco minutos, o que é tempo demais em uma placa de 8 GB.
Somente CPU e Apple Silicon
Sem placa de vídeo dedicada? Você ainda tem opções, só que mais lentas. Os Macs com Apple Silicon compartilham memória entre o processador e a GPU, então uma máquina de 32 GB consegue carregar modelos surpreendentemente grandes. Apps gratuitos como o Draw Things são construídos em torno desse design. Um PC só com CPU roda modelos minúsculos, mas espere minutos por imagem em vez de segundos.

Ranking dos melhores conjuntos de ferramentas locais
Aqui está o ranking honesto, do mais capaz ao mais fácil para iniciantes. Todas as ferramentas abaixo são gratuitas para baixar.
| Stack | Melhor para | Pronta para agente | Esforço de configuração |
|---|
| ComfyUI com Ollama ou LM Studio | Usuários avançados, pipelines repetíveis | Sim, servidor de API integrado | Alto |
| Open WebUI com Ollama | Interface de agente em estilo chat | Sim, conecta ao ComfyUI | Médio |
| InvokeAI | Edição em canvas, interface refinada | Em parte, tem API | Baixo a médio |
| Forge | Layout de WebUI familiar, menor uso de memória | Sim, com a flag da API | Médio |
| Fooocus | Usuários de primeira vez | Limitada | Baixo |
ComfyUI mais um modelo de linguagem local
Esta é a melhor escolha geral. O ComfyUI é uma ferramenta baseada em nós, em que cada etapa de uma geração é um bloco visível. Isso parece intimidador, mas é o que o torna amigável para agentes. Qualquer fluxo de trabalho pode ser exportado no formato de API e acionado por uma chamada HTTP na porta local (8188 por padrão). Seu modelo de linguagem escreve o prompt, coloca-o no JSON do fluxo de trabalho, envia e recupera o arquivo final.
Por que ele vence:
- Ele suporta a maior variedade de modelos de imagem, incluindo as famílias SDXL, FLUX e Qwen Image.
- Os fluxos de trabalho são salvos como arquivos, então um bom resultado pode ser repetido.
- Existem servidores MCP para ComfyUI criados pela comunidade, o que permite que modelos com chamada de ferramentas o controlem diretamente. Verifique a atividade recente de cada projeto antes de confiar em um deles.
💡 Dica: Monte e teste um fluxo de trabalho manualmente primeiro. Um agente só consegue repetir um pipeline que já funciona.

Open WebUI com Ollama
Se você quer conversar com seu agente em vez de montar JSON, o Open WebUI é o caminho mais amigável. Ele oferece uma interface de chat para modelos locais e pode enviar pedidos de imagem para o ComfyUI ou para um backend compatível com o AUTOMATIC1111. Você digita "faça três variações de uma rua chuvosa ao entardecer" e a janela de chat cuida do resto. Ele é menos flexível que a programação direta no ComfyUI, mas você pode ser produtivo em uma tarde.
InvokeAI para edição prática
O InvokeAI é de código aberto e construído em torno de um canvas. Você pinta, mascara e regenera regiões no próprio lugar, o que combina com ilustradores e fotógrafos que editam mais do que escrevem prompts. Ele é menos uma ferramenta de agente puro, mas sua API e interface limpa fazem dele uma segunda instalação sólida ao lado do ComfyUI.
Forge e Fooocus para começos rápidos
O Forge é um fork mais enxuto da interface clássica do AUTOMATIC1111. Ele usa a memória com mais cuidado, então placas antigas aproveitam melhor. O Fooocus esconde quase todas as configurações atrás de uma única caixa de prompt, o que o torna a porta de entrada mais suave. Ele está em um modo de manutenção limitada, então trate-o como uma ferramenta inicial, e não como uma solução de longo prazo.
Quais modelos de imagem rodar

O agente é tão bom quanto o seu pincel. Veja como se alinham os modelos mais comuns, e cada um tem uma página no PicassoIA onde você pode testá-lo antes de passar uma hora baixando os pesos.
Opções pequenas e rápidas
Se a sua placa tem 8 GB ou menos, comece com o SDXL ou o Z-Image Turbo. Modelos no estilo turbo precisam de apenas algumas etapas, o que importa muito quando um agente pode pedir de quatro a cinco tentativas por pedido. Um modelo que leva três segundos por tentativa vence um mais bonito que leva noventa.
Opções de qualidade para placas maiores
Com 16 GB ou mais, o FLUX 2 Dev e o Qwen Image 2512 entregam a pele, o tecido e a iluminação mais convincentes que você consegue rodar em casa. As versões quantizadas trocam um pouco de detalhe por um uso de memória bem menor, e essa troca costuma valer a pena.
Leia primeiro a licença. "Gratuito para baixar" e "gratuito para qualquer uso" são coisas diferentes. O SDXL é distribuído sob uma licença aberta permissiva. O Stable Diffusion 3.5 é gratuito para empresas menores segundo os termos da comunidade da Stability. Os pesos abertos dos modelos FLUX maiores costumam ter termos não comerciais. Verifique a ficha do modelo antes de vender qualquer coisa feita com eles.
Combine o modelo com a sua placa
Aqui vai a versão curta, por situação:
- Placa de 8 GB, primeira vez: Fooocus ou Forge com o SDXL, depois adicione o Open WebUI quando estiver à vontade.
- Placa de 12 GB, quer automação: ComfyUI com um modelo pequeno com chamada de ferramentas, como o IBM Granite 4.1 8B.
- Placa de 16 a 24 GB, quer a melhor qualidade: ComfyUI com o FLUX 2 Dev ou o Qwen Image 2512, e um modelo de linguagem da classe 20B.
- Usuário de Mac: Draw Things para trabalhos rápidos, ComfyUI se você quiser um pipeline de agente.
- Sem hardware capaz: Pule a instalação e rode os mesmos modelos no PicassoIA.
Como funciona o ciclo do agente

Prompt, gerar, avaliar, tentar de novo
Todo agente de imagens que funciona repete quatro movimentos:
- Prompt. O modelo de linguagem reescreve seu pedido curto em um detalhado: assunto, cenário, luz, lente, clima.
- Gerar. Ele chama a ferramenta de imagem com esse prompt e um tamanho fixo.
- Avaliar. Um modelo com visão, ou um conjunto simples de regras, verifica o resultado em busca de falhas óbvias, como mãos deformadas ou cores erradas.
- Tentar de novo. Se a verificação falhar, ele ajusta o prompt ou o seed e roda outra vez, até um limite que você define.
Defina esse limite. Sem um teto de três ou quatro tentativas, um pedido teimoso pode manter sua GPU ocupada a noite toda.
Conectando ferramentas via MCP
O Model Context Protocol dá ao modelo de linguagem uma forma padrão de chamar ferramentas externas. O LM Studio pode atuar como host MCP, e modelos com chamada de ferramentas no Ollama podem acionar montagens semelhantes por meio de pequenos scripts de ponte. Na prática, você registra uma ferramenta ("generate_image") que encaminha o prompt para o ComfyUI e devolve um caminho de arquivo. Mantenha a ferramenta enxuta. Uma ferramenta que aceita apenas um prompt, uma proporção e um seed é mais fácil de chamar corretamente para um modelo pequeno do que uma com vinte opções.
💡 Regra de confiabilidade: Modelos de linguagem pequenos falham com esquemas de ferramentas longos. Menos parâmetros significam menos chamadas quebradas.
Onde o local fica aquém

O custo real do gratuito
O local é gratuito em dinheiro e caro em atenção. Espere uma noite de instalações, alguns momentos de drivers com defeito e manutenção contínua conforme as ferramentas são atualizadas. A energia é um custo menor do que muita gente teme. Uma placa de 300 W rodando por uma hora a 15 centavos de dólar por quilowatt-hora custa cerca de 4,5 centavos de dólar. Calor e barulho da ventoinha são o incômodo diário maior, sobretudo em um cômodo pequeno.
Notebooks trazem limites próprios. Um notebook com um chip gráfico modesto consegue rodar o SDXL, mas perde desempenho quando esquenta e descarrega a bateria rapidamente. Se você trabalha em cafés ou trens, uma stack local no desktop de casa fica fora de alcance, e os modelos leves em um notebook não vão igualar o que uma placa de desktop produz.
A alternativa hospedada
Quando o trabalho é maior do que a sua placa, ou quando você está longe da mesa, uma rota hospedada cobre a lacuna. O PicassoIA tem um grande catálogo de texto para imagem, então você pode testar o FLUX 2 Dev, o Qwen Image 2512, o P-Image e o Seedream 4.5 sem baixar nada. Ele também hospeda um modelo de qualquer fluxo de trabalho do ComfyUI, o que é útil se você já montou um pipeline e quer rodá-lo em um hardware mais potente. Muitos leitores acabam com uma configuração híbrida: local para rascunhos e trabalhos privados, hospedado para as renderizações pesadas finais.
Como usar o Flux 2 Dev no PicassoIA

Este é o mesmo ciclo de um agente local, feito à mão, e é uma forma rápida de ver o que um modelo faz antes de comprometer espaço em disco com ele.
- Abra a página do modelo. Vá até o FLUX 2 Dev na coleção de texto para imagem.
- Escreva o prompt em camadas. Diga primeiro o assunto, depois o cenário, a luz e a lente. Por exemplo: "uma caneca de cerâmica sobre um pano de linho, luz suave de janela vinda da esquerda, lente de 50mm, profundidade de campo rasa, granulado de filme".
- Escolha a proporção para o destino. Use 16:9 para banners de blog, 1:1 para fotos de produto e 9:16 para stories.
- Mantenha o seed. Quando a composição está certa, mas um detalhe não, mantenha o mesmo seed e troque uma única frase no prompt. Mudar cinco coisas de uma vez impede que você veja o que funcionou.
- Gere duas ou três variações e compare. Fique com a melhor e corrija pequenas falhas com um modelo de edição, como o Qwen Image Edit 2511.
- Deixe um modelo de linguagem escrever o próximo prompt. Cole a descrição do seu resultado no Kimi K2.6 e peça três variações de prompt mais precisas. Essa é a metade "cérebro" do agente trabalhando para você.
💡 Dica: Mantenha um arquivo de texto com os prompts que funcionaram. Ele vira a biblioteca inicial do seu agente local mais tarde.
Experimente você mesmo no Picasso IA
Você não precisa resolver a questão local versus hospedado antes de começar. Abra o Picasso IA, escolha um modelo de texto para imagem e rode o mesmo prompt em dois ou três deles. Em dez minutos você vai ver qual estilo combina com o seu trabalho, qual modelo merece um download e quanto detalhe os seus prompts precisam. Depois monte seu agente local em torno do modelo que você já sabe que gosta, e mantenha o Picasso IA aberto nos dias em que a sua própria placa precisar descansar.
Escreva um prompt, clique em gerar e veja como fica a sua ideia.