Como funcionam nos bastidores os geradores de IA NSFW

Um olhar por dentro de toda a tecnologia dos geradores de IA NSFW: como os modelos de difusão processam prompts, como funcionam os filtros de segurança, qual hardware está rodando e como modelos ajustados por fine-tuning, como o Flux Dev, produzem pessoas fotorrealistas com detalhes impressionantes.

Como funcionam nos bastidores os geradores de IA NSFW
Cristian Da Conceicao
Fundador do Picasso IA

Se você já digitou um prompt sugestivo em um gerador de IA e viu uma imagem fotorrealista surgir em segundos, presenciou um dos pipelines mais complexos do aprendizado de máquina moderno rodando em velocidade máxima. Há muito mais acontecendo por trás daquele ícone de carregamento do que a maioria das pessoas imagina. O processo envolve compressão, matemática de ruído, modelos de linguagem, aceleração por hardware e um emaranhado de decisões de segurança que variam muito de uma plataforma para outra.

Este artigo detalha cada camada desse pipeline, desde o momento em que seu prompt chega ao servidor até o último pixel exibido na sua tela.

O que de fato gera o resultado

O texto entra, os pixels saem

A tecnologia central por trás de praticamente todo gerador de imagens por IA moderno é o modelo de difusão latente. O termo soa técnico, mas o conceito é simples: em vez de trabalhar diretamente com imagens em pixels em tamanho real (o que exigiria uma memória enorme), o modelo opera em um espaço matemático comprimido chamado espaço latente. As imagens são codificadas em uma representação muito menor, manipuladas e depois decodificadas de volta em pixels visíveis.

Os dois modelos que fazem esse trabalho de codificação e decodificação formam o VAE (Variational Autoencoder). Ele comprime a imagem-alvo em números e depois a reconstrói. Essa compressão é o motivo pelo qual imagens por IA podem ser geradas em segundos, e não em horas.

Um corredor de data center hipermoderno com racks de servidores iluminados, representando a infraestrutura por trás da geração por IA

O espaço latente sobre o qual ninguém fala

O espaço latente não é apenas um truque de armazenamento. Ele é um sistema de coordenadas de alta dimensão em que conceitos semelhantes ficam próximos uns dos outros. O rosto de uma mulher, o rosto de um homem e o rosto de um gato não ficam em pontos aleatórios. Eles se agrupam em regiões matematicamente significativas. É por isso que a IA consegue misturar conceitos sem emendas: pedir "uma mulher com olhos felinos" funciona porque esses dois conceitos são vizinhos no espaço latente.

O conteúdo NSFW também vive nesse espaço. Não existe um "departamento NSFW" separado dentro do modelo. Conteúdo explícito e não explícito existem como vetores no mesmo espaço contínuo, separados apenas pela distância entre coordenadas. Quando o filtro de segurança de uma plataforma é ativado, ele essencialmente redireciona o modelo para longe de determinadas regiões desse espaço.

Como os modelos de difusão realmente funcionam

Ruído entra, imagem sai

O processo de geração começa com ruído aleatório puro, e não com uma tela em branco. O modelo é treinado para remover esse ruído gradualmente, em uma série de etapas, guiado pelo seu prompt de texto. Cada etapa prevê com um pouco mais de clareza como a imagem final deve ser. Depois de 20 a 50 dessas etapas (dependendo do scheduler e do modelo), surge uma imagem coerente.

Conceitualmente, o processo é assim:

Faixa de etapasO que acontece
Etapas 1-5Forma-se a composição geral e os blocos de cor
Etapas 6-15Formas principais, rostos e corpos ganham definição
Etapas 16-30Surgem detalhes finos, textura da pele e fios de cabelo
Etapas 30-50Nitidez de alta frequência e coerência final

O número de etapas é configurável. Mais etapas geralmente produzem resultados mais nítidos e coerentes, mas levam mais tempo. Modelos como o Flux Schnell são especificamente otimizados para entregar excelente qualidade em apenas 4 etapas, o que os torna bem mais rápidos que arquiteturas mais antigas.

Fotografia macro em close de uma placa de circuito de GPU de ponta, com trilhas de cobre e chips de silício, representando o hardware de modelos de difusão por IA

O papel do CLIP nos prompts

Seu prompt de texto não entra diretamente no processo de difusão. Primeiro, ele passa por um codificador de texto, mais comumente um modelo chamado CLIP (Contrastive Language-Image Pretraining) ou uma variante como o T5. Esse codificador converte suas palavras em um embedding numérico, um vetor que captura o significado semântico do seu prompt e o posiciona no mesmo espaço de alta dimensão dos latentes da imagem.

💡 É por isso que a formulação do prompt importa tanto. "Mulher bonita de biquíni na praia" e "modelo de moda praia no oceano" vão gerar embeddings diferentes e, portanto, imagens diferentes, mesmo descrevendo uma cena parecida.

A guidance scale (muitas vezes chamada de CFG scale) controla o quanto o modelo obedece ao seu prompt. Um valor mais alto força o modelo a seguir seu texto de forma mais rígida, muitas vezes ao custo da naturalidade. Um valor mais baixo dá ao modelo mais liberdade criativa, mas pode produzir resultados fora do prompt.

Filtros NSFW e como funcionam

Verificadores de segurança no tempo de treinamento

A filtragem NSFW acontece em duas etapas completamente diferentes: durante o treinamento e durante a inferência. A filtragem no treinamento diz respeito a quais dados o modelo chega a ver. Muitos modelos-base, como as primeiras versões do Stable Diffusion, foram treinados com o LAION-5B, um conjunto de dados coletado da internet pública que incluía conteúdo explícito. Esses modelos mantiveram a capacidade de produzir imagens adultas porque essa informação estava incorporada aos seus pesos.

Modelos posteriores introduziram a filtragem NSFW no nível do conjunto de dados, removendo o conteúdo explícito antes do treinamento. O resultado foi um modelo que realmente não sabia produzir conteúdo explícito, e não um modelo apenas impedido de fazê-lo.

Sistemas de filtragem em tempo de execução

A filtragem em tempo de execução é a segunda linha de defesa. É isso que a maioria dos usuários encontra como uma restrição no nível da plataforma. Existem três abordagens comuns:

  1. Classificadores de prompt: Um modelo separado lê o texto da sua entrada e sinaliza prompts potencialmente inseguros antes mesmo de a geração começar.
  2. Classificadores de saída: Depois que a imagem é gerada, um modelo de segurança (como classificadores NSFW baseados em CLIP) examina o resultado e bloqueia a entrega se detectar conteúdo explícito.
  3. Apagamento de conceitos: Algumas plataformas aplicam técnicas que removem literalmente certos conceitos do espaço latente do modelo, tornando impossível gerá-los, não importa como o prompt seja formulado.

Um jovem desenvolvedor em uma estação de trabalho com dois monitores, em um estúdio pouco iluminado à noite, trabalhando em código de geração de imagens por IA

Como as plataformas diferem na aplicação das regras

Nem todas as plataformas de imagens por IA fazem as mesmas escolhas de filtragem, e essas escolhas moldam toda a experiência do usuário.

Tipo de plataformaAbordagemCapacidade de saída
Plataformas de consumo (gerais)Filtragem agressiva de prompts e saídasApenas SFW
Plataformas para criadoresFiltragem seletiva, verificação de idadeNudez artística
Plataformas de IA para adultosFiltragem mínima, modelos com fine-tuningCapaz de gerar conteúdo explícito
Código aberto (local)Controlado pelo usuárioSem restrições

As plataformas que permitem conteúdo NSFW de bom gosto ou artístico, como fotografia glamour e nudez sugerida, normalmente usam verificação de idade combinada com classificadores de saída ajustados para bloquear apenas o conteúdo mais explícito, enquanto permitem tudo o que fica abaixo desse limite.

O hardware que faz todo o trabalho

Clusters de GPU e custos de computação

Cada pedido de geração de imagem é um problema de multiplicação de matrizes executado em escala massiva. A computação em si acontece em clusters de GPU (Graphics Processing Units), porque as GPUs são feitas sob medida para a matemática paralela que os modelos de difusão exigem. Uma única geração de imagem em alta resolução, de 1024x1024, pode exigir bilhões de operações de ponto flutuante.

O hardware que roda a maioria dos geradores de IA hospedados inclui:

  • GPUs NVIDIA A100 ou H100 para modelos premium e de alta qualidade
  • NVIDIA L40S para cargas de inferência de nível intermediário
  • AMD MI300X para implantação com bom custo-benefício em escala

Rodar um modelo como o Flux 1.1 Pro Ultra em escala custa dinheiro real por imagem, e é por isso que a maioria das plataformas funciona com créditos ou assinatura.

Um laboratório moderno de pesquisa em IA, com pesquisadores analisando diagramas de redes neurais em uma grande mesa com tela sensível ao toque

Por que a velocidade de inferência importa

Velocidade não é apenas uma questão de experiência do usuário. Inferência mais rápida significa computação mais barata por imagem, o que afeta diretamente o que uma plataforma pode oferecer de graça. Duas inovações reduziram drasticamente o tempo de inferência nos últimos anos:

  • Modelos destilados: modelos treinados para imitar modelos maiores em menos etapas. O Flux Schnell e o DreamShaper XL Turbo são exemplos claros. Eles abrem mão de um pouco de qualidade em troca de uma geração 10 vezes mais rápida.
  • Quantização: reduzir a precisão numérica dos pesos do modelo (de float32 para int8 ou menos) diminui a pegada de memória e aumenta a produtividade, sem perda de qualidade visualmente significativa.

Dados de treinamento e seu papel no estilo do resultado

O que os modelos aprenderam

O "estilo" de um gerador de imagens por IA é inteiramente produto do que ele foi treinado para ver. Os modelos-base, como o SDXL, foram treinados com centenas de milhões de imagens pareadas com legendas, e absorveram os padrões estatísticos de tudo, desde fotografia de banco de imagens e revistas de moda até arte digital e cenas de filmes.

É por isso que alguns modelos produzem naturalmente uma estética de banco de imagens, enquanto outros tendem para resultados artísticos ou pictóricos. A composição do conjunto de dados de treinamento é o fator mais determinante do estilo visual padrão de um modelo.

💡 Se você quer iluminação cinematográfica e estéticas de fotografia de filme, modelos treinados intensamente com conjuntos de dados de fotografia de alta qualidade vão produzir resultados melhores do que aqueles treinados com imagens amplas da internet.

Uma mulher bonita, de cabelo loiro platinado, fotografada em três quartos de perfil com a luz dourada do fim da tarde, representando a saída de retratos de IA de alta qualidade

Mudando o estilo com LoRA

A LoRA (Low-Rank Adaptation) é uma técnica de fine-tuning que permite aos criadores treinar um pequeno conjunto de pesos adicionais sobre um modelo-base, direcionando sua saída para um visual ou assunto específico. Arquivos LoRA costumam ter apenas algumas centenas de megabytes, mas podem alterar drasticamente a saída de um modelo.

Para modelos capazes de gerar conteúdo NSFW, o fine-tuning com LoRA é particularmente poderoso:

  • Uma "LoRA de retrato realista" direciona o modelo para texturas de pele fotográficas e iluminação natural
  • Uma "LoRA de fotografia de moda" puxa a saída para estéticas editoriais, de alto contraste
  • Uma LoRA específica de um sujeito pode fazer o modelo gerar consistentemente um determinado rosto ou tipo de corpo

O modelo p-image-lora no PicassoIA expõe essa capacidade de fine-tuning diretamente, permitindo aplicar pesos LoRA às suas gerações para estilos de saída muito específicos.

Modelos criados para imagens realistas

Como os modelos ajustados por fine-tuning diferem

O modelo Stable Diffusion base e seus sucessores foram treinados com conjuntos de dados amplos. Os modelos ajustados por fine-tuning vão um passo além, continuando o treinamento com subconjuntos curados e de alta qualidade de estilos visuais específicos. É daí que vêm os modelos fotorrealistas que se destacam com sujeitos humanos.

O Realistic Vision v5.1 é um excelente exemplo: ele é construído sobre a arquitetura SDXL, mas passou por um fine-tuning extensivo com conjuntos de dados fotográficos para produzir sujeitos humanos com textura de pele real, anatomia precisa e iluminação natural, aspectos com os quais os modelos-base costumam ter dificuldade.

De forma semelhante, o Flux Dev da Black Forest Labs representa uma nova geração de arquitetura que trata a geração de imagens de um jeito diferente dos modelos mais antigos baseados em U-Net. O Flux opera sobre o espaço de pixels inteiro de uma vez, em vez de processá-lo de forma hierárquica, o que resulta em precisão anatômica bem superior e em um resultado fotorrealista consistente.

Uma mulher glamourosa, de cabelo longo e ruivo, em uma praia tropical com oceano turquesa atrás de si, representando a capacidade de saída fotorrealista dos modelos de IA modernos

Os melhores modelos para resultados fotorrealistas

Quando se trata de sujeitos humanos fotorrealistas com pele, cabelo e iluminação naturais, vários modelos superam os demais de forma consistente:

ModeloArquiteturaMelhor para
Flux DevFlux TransformerFotorrealismo, precisão anatômica
Flux ProFlux TransformerQualidade de saída comercial
Flux 1.1 Pro UltraFlux TransformerSaída em resolução ultra alta
Realistic Vision v5.1SDXL com fine-tuningEstilo de retrato fotográfico
Stable Diffusion 3.5 LargeMMDiTEquilíbrio entre qualidade e velocidade

Como usar o Flux Dev no PicassoIA

Passo a passo: sua primeira geração

Como o Flux Dev é um dos modelos de melhor desempenho para sujeitos humanos fotorrealistas, veja exatamente como usá-lo no PicassoIA:

  1. Abra a página do modelo pelo link da coleção do Flux Dev
  2. Escreva seu prompt com detalhes específicos: sujeito, ambiente, iluminação, ângulo da câmera e especificações da lente
  3. Defina a proporção como 16:9 para planos cinematográficos amplos ou 1:1 para retratos
  4. Ajuste a guidance scale entre 3,5 e 4,5 para o Flux Dev (mais baixo do que você usaria com SDXL)
  5. Defina as etapas entre 28 e 35 para a melhor qualidade de saída
  6. Clique em gerar e aguarde de 10 a 15 segundos pela sua imagem

Uma mulher confiante, de cabelo cacheado e escuro, em um terraço no topo de um prédio durante a hora dourada, usando um tablet para criar imagens geradas por IA

Dicas para prompts melhores

A qualidade do seu resultado está diretamente ligada à especificidade do prompt. Prompts vagos produzem resultados genéricos. Prompts específicos produzem resultados notáveis.

Prompt fraco: beautiful woman at the beach

Prompt forte: close-up portrait of a woman with sun-kissed skin and loose dark waves, lying on white sand at a tropical beach, afternoon rim light creating a warm halo on her hair, 85mm f/1.4 lens, natural skin texture, Kodak Portra 400 film grain

Dicas adicionais que melhoram consistentemente o resultado:

  • Inclua a direção da luz: "volumetric morning light from the left" or "late afternoon backlight"
  • Especifique câmera e lente: "85mm f/1.4", "35mm grande angular", "100mm macro"
  • Adicione o tipo de filme: "Kodak Portra 400", "Fuji Superia 400", "Kodak Gold 200"
  • Descreva a textura da pele: "poros naturais visíveis", "pele luminosa e quente", "marcas sutis de bronzeado"
  • Defina a atmosfera: "íntima", "editorial", "fotografia de glamour", "editorial de moda"

💡 O Flux Dev responde muito bem a descrições de câmera e de iluminação. Incluir especificações de lente e referências de tipo de filme no seu prompt produz, de forma consistente, um resultado mais fotográfico e menos artificial.

Uma mulher elegante, de cabelo escuro e pele bronzeada, recostada em uma chaise de linho creme ao lado de janelas altas sob a luz suave da manhã

O pipeline do prompt ao pixel, resumido

Quando você clica em "gerar", eis cada etapa que acontece em milissegundos nos bastidores:

  1. Tokenização: seu texto é dividido em tokens e enviado a um codificador CLIP ou T5
  2. Embedding: o codificador converte os tokens em vetores numéricos que representam o significado semântico
  3. Inicialização do ruído: um tensor de ruído aleatório é criado no espaço latente
  4. Laço de remoção de ruído: de 20 a 50 iterações de remoção de ruído guiada, cada etapa moldada pelos seus embeddings de texto
  5. Decodificação pelo VAE: o tensor latente final é decodificado de volta para o espaço de pixels
  6. Verificação de segurança: um classificador de saída examina o resultado em busca de violações das políticas
  7. Entrega: a imagem em pixels é comprimida e enviada para a sua tela

Todo o pipeline roda em hardware de GPU e pode ser concluído em 3 a 15 segundos, dependendo do modelo e da infraestrutura.

Vista aérea de um smartphone exibindo a interface de geração de imagens por IA, ao lado de um caderno com prompts criativos sobre mármore branco

Crie suas próprias imagens no PicassoIA

Agora que você sabe exatamente o que roda por baixo do capô, está em uma posição muito melhor para usar essas ferramentas com intenção. A diferença entre uma imagem de IA medíocre e uma genuinamente impressionante não é sorte. Está em saber qual modelo lida melhor com o seu sujeito, em escrever um prompt que posicione o espaço latente exatamente onde você quer e em entender como o processo de remoção de ruído responde às suas configurações de guidance.

O PicassoIA oferece acesso a toda essa gama de modelos em um só lugar, do Flux Dev e do Flux Pro ao Realistic Vision v5.1 e ao Stable Diffusion 3.5 Large. Não importa se você cria fotografia de glamour, retratos artísticos ou imagens editoriais de moda: os modelos estão disponíveis e o pipeline roda rápido.

Escolha um modelo, escreva um prompt específico e veja o que o espaço latente produz.

Compartilhe este artigo

Escolha seu idioma