Como funcionam os modelos de difusão sem censura: a mecânica real por trás da arte de IA sem restrições

Uma análise completa da arquitetura dos modelos de difusão sem censura, da remoção de ruído no espaço latente à codificação de texto com CLIP, passando pela remoção de filtros de segurança e pelo modo como o fine-tuning com NSFW muda o que os geradores de imagens de IA conseguem produzir.

Como funcionam os modelos de difusão sem censura: a mecânica real por trás da arte de IA sem restrições
Cristian Da Conceicao
Fundador do Picasso IA

No instante em que um prompt de texto se torna uma imagem fotorrealista, bilhões de operações matemáticas são executadas em sequência, transformando ruído aleatório puro em informação visual coerente que corresponde exatamente ao que você descreveu. Os modelos de difusão sem censura fazem o mesmo, mas sem as travas que a maioria das plataformas comerciais instala por padrão. O resultado é a geração de imagens por IA que responde à gama completa da intenção criativa humana, do banal ao provocativo. Entender como isso funciona não é apenas curiosidade técnica; revela a arquitetura fundamental da geração de imagens por IA moderna e explica por que alguns modelos produzem resultados que outros simplesmente não conseguem.

O que "sem censura" realmente significa em IA

A maioria das pessoas imagina que remover os filtros de segurança de um modelo de difusão é um interruptor simples, escondido num arquivo de configuração. A realidade é bem mais complicada, e mais interessante.

O verificador de segurança padrão

As versões padrão do Stable Diffusion vêm com um verificador de segurança, um modelo de classificação secundário que inspeciona cada imagem gerada antes de ela chegar até você. Quando detecta conteúdo que classifica como inadequado, substitui o resultado por uma imagem preta. O verificador de segurança não faz parte do modelo de difusão em si; ele funciona como um filtro de pós-processamento aplicado depois que a geração já foi concluída.

Removê-lo é tão simples quanto definir safety_checker=None na configuração do pipeline. Mas isso sozinho não torna um modelo "sem censura". Um modelo treinado exclusivamente com datasets limpos ainda terá dificuldade para gerar conteúdo explícito ou provocativo de forma convincente, porque os dados de treinamento moldam aquilo que o modelo sabe renderizar. O filtro é a parte menos interessante da restrição.

Os dados de treinamento são o verdadeiro filtro

A camada de restrição mais significativa está nos dados de treinamento. Modelos como o Stable Diffusion original foram treinados com o LAION-5B, um dataset enorme coletado da web e filtrado para remover conteúdo explicitamente NSFW antes do início do treinamento. O modelo nunca viu esse material, então tem capacidade limitada para gerá-lo com alguma consistência ou qualidade.

Os modelos verdadeiramente sem censura passam por fine-tuning em datasets que incluem conteúdo adulto, nudez artística e imagens provocativas, junto com suas legendas descritivas. Esse processo ajusta os pesos da arquitetura U-Net para que o modelo construa uma representação interna rica da forma humana, de condições de iluminação íntimas e de composições provocativas, coisas que os modelos filtrados simplesmente não têm. A diferença de qualidade entre um modelo base filtrado, com o verificador de segurança removido, e um modelo sem censura bem ajustado por fine-tuning é enorme.

Um retrato fotorrealista que representa a qualidade das imagens de figuras humanas geradas por IA

O processo de difusão, do ruído à imagem

Para entender por que os dados de treinamento sem censura importam tanto, é preciso ver exatamente como os modelos de difusão geram imagens, passo a passo.

Difusão direta e reversa

Os modelos de difusão são treinados em um processo de duas fases. Na fase direta, o modelo é exposto a milhões de imagens reais e observa o ruído gaussiano sendo adicionado a cada uma delas em pequenos incrementos, até que a imagem original fique completamente encoberta por chiado. O modelo acompanha essa destruição em diferentes níveis e estágios de ruído, construindo um mapa interno do que cada quantidade de ruído faz com diferentes conceitos visuais.

Na fase reversa, o modelo é treinado para prever e subtrair esse ruído, passo a passo, até que uma imagem limpa reapareça. Não se trata de uma tarefa de memorização; o modelo constrói uma compreensão estatística de qual informação visual tem mais chance de existir sob qualquer estado ruidoso dado, condicionada ao prompt de texto fornecido.

Durante a inferência, ou seja, quando você de fato gera uma imagem, o modelo parte de ruído aleatório puro e aplica o processo reverso repetidamente. Cada passo de remoção de ruído aproxima um pouco mais a representação latente de uma imagem coerente que corresponde ao seu prompt de texto. É o chamado loop de remoção de ruído, que roda pelo número de passos de amostragem que você configurar, normalmente entre 20 e 50 para a maioria dos modelos.

O espaço latente

Os modelos de difusão modernos não operam diretamente sobre dados de pixel. Eles trabalham em uma representação comprimida chamada espaço latente, codificada e decodificada por um Autoencoder Variacional (VAE). Uma imagem padrão de 512x512 pixels vira uma representação latente bem menor, de 64x64. Essa compressão torna a geração muito mais rápida e permite que o processo de remoção de ruído capture a estrutura semântica de alto nível, a composição, a iluminação e a identidade do sujeito, em vez de padrões de ruído no nível do pixel.

O decodificador do VAE então traduz o latente final, já sem ruído, de volta para uma imagem em resolução total. A qualidade desse decodificador importa muito para o resultado fotorrealista, e é por isso que modelos com fine-tuning costumam incluir pesos de VAE personalizados junto com a U-Net. Um VAE treinado numa faixa mais ampla de anatomia humana e tons de pele produzirá resultados mais precisos e detalhados do que um genérico, e essa é mais uma razão pela qual o fine-tuning sem censura vai além dos pesos da U-Net.

Infraestrutura de servidores GPU alimentando a geração de imagens por IA em escala

Como o CLIP transforma palavras em imagens

O processo de difusão explica como o ruído vira imagem. Mas como o seu prompt de texto influencia de fato a imagem que é gerada?

O codificador de texto CLIP

O Stable Diffusion e seus derivados usam o CLIP (Contrastive Language-Image Pretraining) como codificador de texto. O CLIP foi treinado com centenas de milhões de pares imagem-texto para criar um espaço de embeddings compartilhado, no qual conceitos semelhantes, expressos como palavras ou como conteúdo visual, ficam agrupados numericamente. O modelo aprendeu que uma fotografia de uma mulher na praia e a frase "mulher na praia" devem ficar próximas nesse espaço matemático.

Quando você digita um prompt, o CLIP o converte em um vetor de números chamado embedding de texto, que codifica o significado semântico da sua descrição. Esse embedding é alimentado nas camadas de cross-attention da U-Net em cada passo de remoção de ruído, orientando o modelo para conceitos visuais que correspondem às suas palavras. Quanto mais rico e específico for o seu texto, com mais precisão o CLIP consegue codificar a sua intenção, e mais exatamente a U-Net consegue gerá-la.

O fine-tuning sem censura costuma incluir atualizações também no codificador de texto, e não apenas na U-Net. Quando um modelo é exposto a imagens explícitas pareadas com vocabulário descritivo específico, o espaço de embeddings interno do CLIP se desloca para colocar esses conceitos em posições mais úteis em relação às representações visuais que a U-Net gera. É esse alinhamento que permite que modelos sem censura respondam de forma confiável a prompts explícitos, em vez de produzir resultados vagos ou anatomicamente inconsistentes.

Guidance sem classificador

Um dos parâmetros mais importantes de qualquer modelo de difusão é a escala CFG, também chamada escala de classifier-free guidance. Valores de CFG mais altos empurram o modelo a seguir o prompt com mais rigor a cada passo de remoção de ruído, ao custo de alguma naturalidade e variedade da imagem. Valores mais baixos permitem um desvio criativo maior em relação ao texto, o que pode produzir resultados mais orgânicos, mas pode deixar de lado detalhes específicos que você pediu.

O classifier-free guidance funciona executando o processo de remoção de ruído duas vezes a cada passo: uma com o seu embedding de texto (geração condicionada) e outra sem nenhum texto (geração não condicionada). Em seguida, o modelo amplifica a diferença entre essas duas saídas pelo fator da escala CFG, empurrando o resultado ainda mais na direção que o seu texto aponta.

Na geração sem censura, a escala CFG importa porque o modelo precisa de orientação suficiente para produzir o conteúdo específico que você descreve, sem ficar tão rigidamente restrito a ponto de recorrer aos padrões visuais "seguros" mais representados nos pesos base. Uma escala CFG entre 5 e 9 costuma oferecer o melhor equilíbrio para conteúdo NSFW, dependendo do modelo específico e do sampler.

Dica de prompt: Os prompts negativos são tão importantes quanto os positivos. Use-os para suprimir desfoque, membros extras e distorções anatômicas, que se tornam mais comuns em modelos empurrados para conteúdo nas bordas da sua distribuição de treinamento.

Pesquisador analisando parâmetros de modelo em uma estação de trabalho

Modelos populares e sua arquitetura

Diferentes arquiteturas de modelo lidam com a geração sem censura de formas diferentes. Veja como se comparam os mais conhecidos.

SDXL e seus derivados

O SDXL introduziu uma arquitetura em duas etapas: um modelo base que gera um latente de baixa resolução, seguido por um modelo refinador que adiciona detalhes de alta frequência em uma segunda passagem. A contagem maior de parâmetros (3,5 bilhões contra os 860 milhões do Stable Diffusion 1.5) dá ao SDXL uma anatomia, uma coerência de iluminação e um controle de composição muito melhores. Essa capacidade maior também torna o fine-tuning do SDXL tão eficaz para conteúdo sem censura; simplesmente há mais espaço no modelo para representações sutis.

O SDXL Lightning é uma versão destilada que alcança qualidade comparável em apenas 4 passos de amostragem, o que o torna prático para iterações rápidas quando você está testando composições e poses. A contrapartida é uma aderência ligeiramente menor a detalhes finos do prompt, mas, para a maioria dos casos de uso, o ganho de velocidade compensa a perda de precisão.

Versões da comunidade como o Dreamshaper XL Turbo acrescentam treinamento adicional sobre a base do SDXL, produzindo modelos rápidos e capazes de gerar figuras humanas fotorrealistas em uma grande variedade de estilos.

ModeloArquiteturaPassos de amostragemMelhor para
SDXLUNet de dois estágios20-30Muitos detalhes, cenas complexas
SDXL LightningSDXL destilado4-8Velocidade, iteração rápida
Dreamshaper XLSDXL com fine-tuning10-20Realismo estilizado
Realistic Vision v5.1Fine-tuning do SD 1.520-30Retratos fotorrealistas

Realistic Vision e Photon

O Realistic Vision v5.1 continua sendo um dos modelos mais consistentemente capazes para fotografia humana fotorrealista. Ele passou por fine-tuning extensivo em datasets de fotografia de alta qualidade e produz textura de pele, detalhe de fios de cabelo e comportamento de iluminação natural que muitos modelos mais novos e maiores ainda têm dificuldade de igualar. Seu tamanho relativamente menor (baseado no SD 1.5) também significa tempos de geração mais rápidos na maioria dos hardwares.

O Luma Photon segue outro caminho, priorizando a aderência ao prompt e a precisão de composição em vez da consistência estilística. Ele se destaca em cenas complexas com vários sujeitos e em ângulos de câmera incomuns, mostrando como as melhorias do CLIP, somadas ao fine-tuning da U-Net, podem mudar drasticamente o que um modelo prioriza durante a geração.

Retrato natural ao ar livre que representa a capacidade de saída fotorrealista da IA

Flux e a arquitetura DiT

O Flux Schnell LoRA e o Flux Pro Finetuned representam uma ruptura fundamental com a arquitetura clássica de difusão baseada em U-Net. O Flux usa um Diffusion Transformer (DiT), substituindo as camadas convolucionais da U-Net por mecanismos de autoatenção e cross-attention em toda a arquitetura. O resultado é uma aderência ao texto significativamente melhor, anatomia mais coerente em poses complexas e melhor tratamento de relações espaciais entre vários sujeitos.

As variantes LoRA são especialmente úteis para aplicações sem censura. O LoRA (Low-Rank Adaptation) permite ajustes de peso direcionados sem treinar o modelo completo, o que significa que a arquitetura base do Flux permanece intacta enquanto pesos LoRA separados e leves injetam novas capacidades de geração. Vários LoRAs podem ser combinados e ponderados no momento da inferência, permitindo perfis de geração altamente personalizados que misturam diferentes estilos e tipos de conteúdo.

Como o fine-tuning cria modelos sem censura

O fine-tuning é o processo que de fato transforma um modelo base censurado em um modelo sem censura. Ele é mais sutil do que simplesmente expor o modelo a imagens explícitas.

O que acontece durante o fine-tuning

Quando um desenvolvedor faz fine-tuning de um modelo existente com conteúdo NSFW, ele executa passagens de treinamento adicionais usando um dataset selecionado de imagens explícitas ou provocativas, cada uma pareada com legendas de texto descritivas. As atualizações de gradiente durante esse processo ajustam os pesos da U-Net, especialmente nas camadas de cross-attention, onde os embeddings de texto interagem com os mapas de características visuais, construindo associações mais fortes entre o vocabulário descritivo e as representações visuais que o modelo deve gerar.

O fine-tuning não apaga as capacidades existentes do modelo. Ele acrescenta novas associações sobre as existentes, e é por isso que um fine-tuning sem censura bem executado mantém a mesma inteligência de composição, a mesma sensibilidade à iluminação e a mesma gama estilística do modelo base. Já um fine-tuning malfeito pode introduzir artefatos, degradar a precisão anatômica ou fazer o modelo ignorar partes do prompt que conflitam com a distribuição restrita dos dados de fine-tuning.

LoRA ou fine-tuning completo

Existem duas abordagens dominantes para criar modelos sem censura, e cada uma envolve contrapartidas distintas:

  • Fine-tuning completo: Todos os pesos do modelo são atualizados em cada passagem de treinamento. Produz os resultados mais profundamente integrados, com a melhor consistência anatômica, mas exige muito processamento de GPU, dias de treinamento e corre o risco de "esquecimento catastrófico" das capacidades do modelo base, caso não seja bem gerenciado.
  • Fine-tuning com LoRA: Pequenas matrizes de decomposição de posto são inseridas em camadas de peso específicas, e apenas essas matrizes são atualizadas durante o treinamento. É muito mais barato de treinar, fácil de compartilhar como arquivos pequenos, compatível com combinação no momento da inferência e tem risco mínimo de degradar a qualidade do modelo base.

A maioria dos modelos sem censura disponíveis publicamente são fine-tunings completos de bases SD 1.5 ou SDXL, ou pesos LoRA feitos para serem aplicados sobre os modelos base do Flux Schnell LoRA ou do SDXL.

Ambiente de pesquisa acadêmica que representa o desenvolvimento de modelos de IA

Métodos de amostragem e por que importam

Nem todos os modelos de difusão usam o mesmo algoritmo de amostragem, e a escolha tem um impacto mensurável na qualidade da saída, principalmente nos detalhes anatômicos finos.

Comparação dos principais samplers

O sampler determina como o modelo vai do latente com ruído até a imagem limpa, a cada passo de remoção de ruído. Samplers diferentes usam abordagens matemáticas diferentes para estimar a trajetória ideal de remoção de ruído.

SamplerVelocidadeQualidadeMelhor uso
Euler AncestralRápidoBoaRascunhos rápidos, saídas estilizadas
DPM++ 2M KarrasMédioExcelenteQualidade de retrato, detalhe de pele
DDIMRápidoModeradaSaídas consistentes e reproduzíveis
UniPCRápidoMuito boaUso geral, resultados equilibrados

O DPM++ 2M Karras produz de forma consistente a textura de pele mais nítida e a renderização de cabelo mais natural para sujeitos humanos fotorrealistas. É o sampler preferido para geração NSFW em modelos como o Stable Diffusion 3.5 Large, em que a maior capacidade do modelo se beneficia de uma trajetória de amostragem mais precisa.

Passos de amostragem e seus efeitos

Mais passos produzem resultados mais refinados, mas com retornos decrescentes após certo limite. Para a maioria dos modelos sem censura, a divisão prática fica assim:

  • 10-15 passos: Qualidade de prévia rápida, adequada para testar composições e poses antes de partir para uma geração completa
  • 20-30 passos: Qualidade padrão para saídas finais, suficiente para a maioria dos casos
  • 40-50 passos: Extração máxima de detalhes, vale o tempo extra para imagens principais ou conteúdo que será ampliado por upscaling (aumento de resolução)

A contagem ideal de passos depende muito do sampler. As variantes Lightning e Turbo usam destilação de consistência durante o treinamento para produzir resultados de alta qualidade em 4-8 passos, uma quantidade que geraria resultados borrados e incoerentes com um sampler padrão num modelo não destilado.

Figura elegante em uma piscina de borda infinita que representa saída visual de IA de alta fidelidade

Como obter resultados de qualidade com modelos sem censura

Conhecer a arquitetura é uma coisa. Usá-la para gerar imagens de alta qualidade de forma consistente exige uma abordagem sistemática para a escrita de prompts.

Estrutura de prompt que funciona

Os prompts mais eficazes para modelos sem censura seguem uma estrutura consistente que espelha a forma como um briefing fotográfico descreveria uma sessão:

  1. Descrição do sujeito com atributos físicos específicos (cor do cabelo, porte, tom de pele)
  2. Pose e ação com clareza direcional ("sentada de pernas cruzadas, virada para a esquerda")
  3. Roupa ou a falta dela com detalhes específicos de tecido e cor
  4. Ambiente e fundo com especificações da fonte de luz
  5. Detalhes de câmera e lente para ancorar a estética fotográfica (85mm f/1.4, altura dos olhos)
  6. Modificadores de qualidade no final (8K fotorrealista, grão de filme Kodak Portra 400)

Especificidade é tudo. "Uma mulher bonita na praia" vai produzir resultados medianos, porque o modelo tem liberdade demais para preencher os detalhes com o que é estatisticamente médio nos dados de treinamento. "Uma mulher de cabelo castanho-avermelhado e sardas claras, de biquíni branco, sentada de pernas cruzadas sobre areia branca na hora dourada, fotografada com lente de 85mm f/1.4, luz lateral quente vinda da direita, textura fina de areia em primeiro plano, grão de filme Kodak Portra 400, 8K fotorrealista" produz um resultado muito mais consistente e detalhado.

Pense no prompt como um conjunto de restrições que estreita progressivamente o espaço de amostragem do modelo. Cada detalhe específico que você acrescenta elimina uma classe de resultados possíveis e empurra a geração para exatamente aquilo que você está descrevendo.

Ambiente de estúdio criativo que representa o fluxo de trabalho iterativo de imagens por IA

Prompts negativos que realmente ajudam

Para conteúdo NSFW fotorrealista, os prompts negativos não são opcionais. Eles são a principal ferramenta para eliminar os artefatos de geração mais comuns:

  • deformed, ugly, bad anatomy, disfigured — evita erros estruturais em figuras humanas
  • blurry, low resolution, jpeg artifacts, pixelated — mantém a nitidez da imagem
  • cartoon, illustration, painting, drawing, sketch — ancora o estilo fotorrealista
  • extra limbs, missing fingers, fused fingers, malformed hands — ataca os modos de falha anatômica mais comuns
  • watermark, logo, text, signature — remove sobreposições indesejadas que aparecem com frequência

Ao usar o Realistic Vision v5.1 ou o Dreamshaper XL Turbo, acrescentar oversaturated, plastic skin, waxy, airbrushed ao prompt negativo melhora ainda mais o realismo da pele, afastando o modelo daquele aspecto excessivamente processado que aparece quando os dados de fine-tuning pendem para fotografias muito editadas.

O seed também merece atenção. Quando você encontrar uma geração de que gosta, anote o valor do seed e reutilize-o com pequenas variações no prompt, para iterar de forma sistemática em vez de gerar tudo do zero a cada vez. Essa é a forma mais rápida de sair de um bom resultado e chegar a um ótimo.

Fotografia de estilo de vida litorâneo que representa os benchmarks de qualidade das saídas de IA

Comece a criar no PicassoIA

Modelos de difusão, censurados ou não, só são tão poderosos quanto a plataforma que os coloca nas suas mãos. O PicassoIA dá acesso direto a todo o espectro de modelos de texto para imagem, desde as saídas fotorrealistas do Realistic Vision v5.1 até a precisão arquitetônica do Flux Pro Finetuned e a gama estilística do Dreamshaper XL Turbo. Você controla diretamente os passos de amostragem, a escala CFG, o seed e os prompts negativos, o que significa que pode replicar resultados bem-sucedidos e iterar de forma sistemática, em vez de torcer por uma geração de sorte.

A plataforma também oferece o Luma Photon para trabalhos de composição complexos e o SDXL Lightning para fluxos de trabalho em que a velocidade vem em primeiro lugar e você quer testar muitas ideias em pouco tempo. Todos os modelos descritos neste artigo estão acessíveis sem configuração, sem necessidade de hardware local e sem as horas de configuração que os pipelines hospedados por conta própria exigem.

Tudo o que foi descrito neste artigo, da compressão no espaço latente aos embeddings de texto do CLIP passando pelo loop de remoção de ruído, acontece toda vez que você clica em gerar. A física do processo de difusão não é teórica; ela roda em tempo real em cada imagem que você cria. Escolha um modelo que combine com o que você quer produzir, escreva um prompt específico e estruturado, defina sua escala CFG entre 6 e 8, acrescente seus prompts negativos e veja o que sai. O primeiro resultado raramente é o final, mas a segunda e a terceira iterações, informadas pelo que o modelo mostra, avançam rapidamente até exatamente o que você tinha em mente.

Galeria de arte exibindo imagens geradas por IA que representam a gama de saídas possíveis

Compartilhe este artigo

Escolha seu idioma