Como configurar a geração de imagens com IA sem censura localmente
Rodar a geração de imagens com IA sem censura localmente coloca você no controle total. Sem filtros de conteúdo, sem limites de assinatura, sem preocupações com a privacidade dos dados. Este artigo mostra os requisitos de hardware, a instalação do software, a escolha do modelo e a remoção do filtro de segurança, para que você gere qualquer coisa que imaginar na sua própria máquina.
Rodar a geração de imagens com IA no seu próprio hardware é uma das mudanças mais significativas na liberdade criativa disponível hoje. Nenhum serviço na nuvem filtrando seus prompts. Nenhum limite mensal de tokens. Nenhum e-mail da política de conteúdo dizendo que sua imagem foi bloqueada. Quando você roda o conjunto de ferramentas localmente, o único limite é sua GPU, sua imaginação e o modelo que você escolher.
Este artigo mostra exatamente o que é preciso para colocar a geração de imagens com IA sem censura funcionando localmente, desde o hardware necessário até a desativação dos filtros de segurança nas interfaces mais populares.
O que "local" realmente significa
Quando você roda um gerador de imagens com IA localmente, todo o processo de inferência acontece na sua máquina. Os pesos do modelo são carregados na VRAM da sua GPU, a CPU cuida do pré-processamento e da coordenação da amostragem, e a imagem final nunca sai da sua rede. Nenhuma chamada de API vai para algum servidor. Nenhuma imagem é escaneada, registrada ou revisada.
Isso é fundamentalmente diferente da geração na nuvem. Em plataformas como Midjourney ou DALL-E, cada prompt é processado nos servidores deles e fica sujeito às suas políticas de moderação de conteúdo. As configurações locais eliminam essa camada por completo.
Os dois frameworks dominantes
Dois frameworks de inferência local dominam o setor:
AUTOMATIC1111 (A1111): O mais usado. Interface no navegador, um enorme ecossistema de extensões e uma configuração mais simples para iniciantes.
ComfyUI: Fluxo de trabalho em grafo de nós. Mais complexo, mas muito mais poderoso para montar pipelines personalizados.
Os dois são compatíveis com os mesmos formatos de modelo. A escolha depende de quanto controle você quer ter sobre o pipeline de geração.
Requisitos de hardware
Antes de instalar qualquer coisa, verifique seu hardware. Rodar modelos localmente em hardware insuficiente é a causa mais comum de frustração para novos usuários.
A VRAM da GPU é tudo
A VRAM é o limite rígido. Os modelos precisam caber inteiramente na memória da GPU durante a inferência. Se não couberem, a geração passa a usar a CPU (extremamente lenta) ou simplesmente trava.
Tipo de modelo
VRAM mínima
VRAM recomendada
Checkpoints SD 1.5
4 GB
6 GB
Checkpoints SDXL
8 GB
12 GB
Flux Dev / Schnell
12 GB
16 GB+
SD 3.5 Large
16 GB
24 GB
💡 Nota: Estes são valores aproximados. O uso real depende da resolução, do tamanho do lote e de você estar usando ControlNet ou LoRAs junto com o modelo base.
Para a maioria dos casos de geração NSFW, uma RTX 3080 (10 GB) ou uma RTX 4070 (12 GB) atende a maior parte dos checkpoints populares. Uma RTX 4090 (24 GB) dá conta de tudo, incluindo Flux e SD 3.5 Large, sem concessões.
GPUs AMD funcionam, mas exigem configuração adicional usando ROCm no Linux. No Windows, o suporte AMD via DirectML é funcional, porém mais lento e menos estável.
CPU e RAM
A CPU não é o gargalo para a inferência acelerada por GPU, mas a RAM importa para o carregamento dos modelos e para o consumo do sistema operacional.
Mínimo: 16 GB de RAM do sistema
Recomendado: 32 GB de RAM do sistema
CPU: Qualquer quad-core moderno (Intel i5 ou Ryzen 5 ou superior)
Se a VRAM da sua GPU for insuficiente, o sistema vai transferir o processamento para a CPU e para a memória do sistema (chamado de modo "CPU offload"). Isso funciona, mas gera de 1 a 5 iterações por segundo, em vez de 20 a 60 ou mais em uma GPU adequada.
Armazenamento
Os arquivos de modelo são grandes. Planeje o armazenamento de acordo:
Checkpoints SD 1.5: 2 a 7 GB cada
Checkpoints SDXL: 6 a 13 GB cada
Modelo Flux Dev: cerca de 23 GB
SD 3.5 Large: cerca de 16 GB
Um SSD dedicado de 500 GB a 1 TB é um ponto de partida prático se você planeja reunir vários modelos. HDs funcionam, mas o carregamento dos modelos fica visivelmente mais lento.
Instalando a interface WebUI do AUTOMATIC1111
O AUTOMATIC1111 requer Python 3.10.x e Git. Usar a versão 3.11 ou 3.12 pode causar conflitos de dependências com algumas extensões. Fique com a 3.10.
Configuração no Windows
Instale o Python 3.10 pelo site oficial do Python. Durante a instalação, marque "Add Python to PATH".
Instale o Git pelo git-scm.com.
Abra um terminal (PowerShell ou CMD) na pasta onde você quer instalar a WebUI.
A primeira execução baixa todas as dependências automaticamente. Isso leva de 10 a 20 minutos, dependendo da sua velocidade de internet. Quando terminar, a WebUI abre em http://127.0.0.1:7860 no seu navegador.
O script cuida da criação do ambiente virtual e da instalação das dependências. A interface no navegador usa o mesmo endereço.
Desativando o verificador de segurança
Por padrão, o A1111 vem com um verificador de segurança que deixa pretas as imagens com certos conteúdos. Desativá-lo exige uma única flag.
Abra webui-user.bat (Windows) ou webui.sh (Linux) em um editor de texto. Encontre a linha que começa com COMMANDLINE_ARGS= e adicione as flags a seguir:
Para desativar totalmente o verificador de segurança NSFW, adicione:
--disable-nan-check
💡 Importante: Em alguns checkpoints, o verificador de segurança está embutido no próprio modelo, e não na interface. Trocar por um checkpoint sem restrições (veja abaixo) contorna o verificador por completo, sem mexer na configuração da WebUI.
ComfyUI como alternativa
O ComfyUI segue outra abordagem. Em vez de um painel de configurações tradicional, ele usa um grafo de nós, em que cada etapa de processamento é um bloco visual conectado ao próximo. Isso parece intimidante, mas se torna uma vantagem assim que você entende como funciona.
Por que algumas pessoas preferem o ComfyUI
Nenhuma etapa de processamento oculta: Cada operação do pipeline aparece como um nó. Nada acontece por trás das cenas.
Mais eficiente: O ComfyUI é mais rápido que o A1111 com o mesmo hardware e modelo, especialmente na geração em lote.
O ControlNet é mais fácil de configurar: Adicionar controle de pose, mapeamento de profundidade ou condicionamento por imagem de referência é arrastar e soltar, e não algo escondido nas configurações.
Sem verificador de segurança por padrão: O ComfyUI vem sem nenhuma camada de filtragem de conteúdo. O que você pede no prompt é o que você recebe.
No Windows, a versão portátil independente (disponível na página de releases do ComfyUI no GitHub) não exige instalação do Python. Baixe, extraia e execute.
Coloque os arquivos de checkpoint do modelo na pasta ComfyUI/models/checkpoints/. Os arquivos de LoRA vão em ComfyUI/models/loras/. O ComfyUI os detecta automaticamente na próxima inicialização.
Escolhendo o modelo certo
O checkpoint que você usa importa mais do que qualquer configuração ou parâmetro. O modelo base define o estilo, a precisão da anatomia e se o verificador de segurança está presente ou não.
Os melhores checkpoints para resultados realistas
Os checkpoints sem restrições treinados pela comunidade foram otimizados especificamente para saídas fotorrealistas e capazes de gerar NSFW. As famílias mais populares em 2025 são:
Flux Dev e Flux Schnell representam o estado da arte na geração de texto para imagem com pesos abertos. Eles exigem mais VRAM (12 a 16 GB), mas produzem imagens bem mais nítidas e anatomicamente precisas do que os modelos SD 1.5 ou SDXL.
O Stable Diffusion 3.5 Large é outra opção forte para trabalhos em alta resolução, com excelente aderência ao prompt.
Onde obtê-los
O Civitai é o principal hub da comunidade para checkpoints ajustados, LoRAs e embeddings. A maioria dos modelos sem restrições está lá, com notas detalhadas dos usuários sobre o que cada um produz melhor.
O HuggingFace hospeda os pesos oficiais de modelos do Flux, do Stable Diffusion e de outras arquiteturas base. O acesso a alguns repositórios restritos exige criar uma conta e aceitar os termos de licença do modelo.
Os arquivos de LoRA (pequenos complementos de ajuste fino) vão em:
A1111: stable-diffusion-webui/models/Lora/
ComfyUI: ComfyUI/models/loras/
Escrevendo prompts que realmente funcionam
A qualidade do prompt faz a diferença entre um resultado genérico e algo genuinamente impressionante. O modelo gera apenas o que você descreve com detalhes suficientes.
Estrutura do prompt positivo
Bons prompts seguem uma hierarquia flexível: sujeito e ação, ambiente, iluminação, câmera, modificadores de qualidade.
Para resultados fotorrealistas:
[subject description], [clothing/pose details], [environment/setting],
[lighting type and direction], [camera and lens], [film stock],
photorealistic, 8k, high detail, sharp focus, RAW photo
Exemplo:
beautiful woman with dark hair, wearing a strappy black dress,
standing on a rooftop at dusk, golden hour backlight creating
rim light on shoulders, shot on Sony A7 85mm f/1.8,
Kodak Portra 400, photorealistic, 8k
Prompts negativos para evitar problemas comuns
Os prompts negativos dizem ao modelo o que evitar. Estes são quase universais para melhorar a qualidade:
cartoon, anime, illustration, painting, drawing, 3d render, cgi,
deformed, bad anatomy, extra limbs, missing fingers, blurry,
low resolution, watermark, text, logo, ugly, distorted
💡 Dica: Para modelos SD 1.5, usar o embedding EasyNegative ou bad_prompt_version2 como token de textual inversion no seu prompt negativo reduz bastante os erros anatômicos, sem nenhuma engenharia manual de prompt.
Escala CFG e configurações de amostragem
Duas configurações que a maioria dos iniciantes deixa no padrão, mas não deveria:
Escala CFG: Controla o quanto o modelo segue rigorosamente o seu prompt. Valores entre 5 e 7 produzem resultados mais naturais e variados. Valores acima de 10 costumam causar supersaturação e distorção.
Passos de amostragem: Mais passos significam uma saída mais refinada, até certo ponto. Para a maioria dos modelos, de 20 a 30 passos é o teto prático. O Flux Schnell e o SDXL Lightning 4step são modelos destilados, feitos para rodar em 4 a 8 passos sem perda de qualidade.
O que a IA local realmente produz
Com o checkpoint, as configurações e a estrutura de prompt certos, a geração local de IA produz imagens fotorrealistas indistinguíveis de uma fotografia profissional. A imagem acima mostra o que é possível com uma configuração adequada: descrição detalhada do sujeito, direção de iluminação explícita e uma referência a um tipo de filme no prompt.
A WebUI torna a iteração rápida. Gere um lote, refine o prompt, ajuste o seed e gere de novo. A maioria dos usuários experientes itera de 5 a 15 vezes antes de chegar a um resultado final.
Erros comuns e soluções
Mesmo com uma instalação limpa, alguns erros aparecem com frequência.
"CUDA out of memory": Sua VRAM acabou. Soluções, em ordem de preferência: reduzir a resolução, ativar as flags --medvram ou --lowvram nos argumentos de inicialização do A1111 ou trocar por um modelo menor.
Imagens pretas ou cinzas: O verificador de segurança foi acionado. Isso acontece ao usar modelos SD base com o verificador ainda ativo. Troque por um checkpoint sem restrições ou desative-o como descrito acima.
"model.safetensors is not a valid file": O download foi corrompido. Apague e baixe o checkpoint novamente. Confira se o tamanho do arquivo corresponde ao que a fonte informa.
Geração extremamente lenta (1 a 2 it/s): Você está rodando na CPU. Verifique se o PyTorch foi instalado com suporte a CUDA. No console do A1111, confirme que aparece Using device: cuda na inicialização.
Palavras-gatilho de LoRA ausentes: Muitos LoRAs exigem uma palavra-gatilho específica no prompt para funcionar. Confira a lista de palavras-gatilho na página do modelo no Civitai.
Quando a configuração local não é prática
A geração local é ideal quando você tem o hardware. Mas nem todo mundo tem uma GPU com muita VRAM disponível, e alguns fluxos de trabalho (celular, viagens, máquinas de baixo consumo) tornam as configurações locais impraticáveis.
Para esses casos, a PicassoIA oferece acesso na nuvem a muitos dos mesmos modelos usados nas configurações locais, incluindo variantes do Flux e do Stable Diffusion, sem exigir instalação nem GPU local.
Modelos disponíveis agora
A coleção de texto para imagem da PicassoIA inclui os modelos que os usuários mais sérios mais usam:
A vantagem de usar a PicassoIA junto com uma configuração local é a velocidade e a variedade de modelos. Em vez de baixar mais de 20 GB de arquivos de modelo e esperar a geração local, você pode testar diferentes modelos rapidamente no navegador para decidir quais valem a pena baixar localmente.
Comece a criar agora
Não importa se você roda uma configuração local completa com uma RTX 4090 ou testa prompts entre sessões locais: o caminho para a geração de imagens genuinamente sem restrições está mais acessível em 2027 do que nunca. Os modelos têm pesos abertos, as ferramentas são gratuitas e a comunidade é enorme.
Se você ainda não fez sua primeira geração local, o caminho mais rápido é: escolher uma GPU que caiba no seu orçamento, instalar o ComfyUI na versão portátil, pegar o Realistic Vision v5.1 ou o RealVisXL no Civitai e jogar o arquivo na pasta de checkpoints. Sua primeira geração deve rodar em até 20 minutos após a configuração.
Quer pular a instalação e começar a gerar agora mesmo? Experimente o Flux Dev, o Flux Schnell ou o Stable Diffusion 3.5 Large diretamente na PicassoIA, sem nenhuma instalação. A mesma estrutura de prompt descrita neste artigo funciona da mesma forma na plataforma em nuvem, então você pode testar e iterar antes de se comprometer com um download local completo.