O que é um modelo de difusão, explicado de forma simples

Os modelos de difusão são a base de todos os principais geradores de imagens por IA usados hoje, do Stable Diffusion ao Flux. Este artigo explica como eles realmente funcionam, desde a adição de ruído gaussiano até a remoção de ruído no sentido inverso, a compressão no espaço latente e o condicionamento por texto, sem jargão matemático nem enrolação.

O que é um modelo de difusão, explicado de forma simples
Cristian Da Conceicao
Fundador do Picasso IA

Entre a matemática e a mágica, um modelo de difusão pega uma tela cheia de ruído aleatório puro e, aos poucos, o esculpe até virar um rosto fotorrealista, uma pintura a óleo no estilo renascentista ou uma paisagem urbana na hora dourada. Se você já digitou uma frase em um gerador de imagens por IA e viu algo surgir, você já viu um modelo de difusão em ação. Mas o que está realmente acontecendo dentro desse processo? A resposta é surpreendentemente lógica quando você entende as duas fases em que ele se apoia.

A ideia por trás dos modelos de difusão

Um modelo de difusão é treinado para remover ruído. Esse é todo o conceito central. Durante o treinamento, o modelo é exposto a milhões de imagens com quantidades crescentes de ruído aleatório adicionado a elas. Ele desenvolve, passo a passo, a capacidade de reconstruir como a imagem original era antes de o ruído ser introduzido. Depois de treinado, você executa o processo ao contrário: começa com ruído puro, e o modelo percorre para trás os passos que internalizou, eliminando ruído em cada etapa até que surja uma imagem coerente.

Um tipo estranho de criatividade

Pode parecer estranho chamar isso de "criatividade". O modelo não está pintando algo do zero, como um artista humano faria. Em vez disso, ele traça um caminho por um mapa internalizado do que são imagens reais em diferentes níveis de corrupção, indo do caos em direção à clareza. O destino desse caminho, moldado pelo seu prompt de texto, determina o que você vê no final.

É por isso que os resultados parecem tão diversos e naturais. O modelo não recupera imagens armazenadas nem junta fragmentos. Ele constrói algo novo seguindo os padrões estatísticos do que uma imagem real deveria parecer em cada etapa do processo de remoção de ruído.

Por que o ruído é o ponto de partida

A escolha de começar com ruído é deliberada. O ruído é bem definido matematicamente: especificamente, o ruído gaussiano, em que os valores dos pixels seguem uma distribuição em forma de sino. Essa precisão matemática é o que permite ao modelo treinar com rigor. Ele foi exposto às versões ruidosas de milhões de imagens em todos os níveis de corrupção, então consegue prever o que deve ser removido em qualquer etapa.

Nota: O ruído gaussiano é exatamente como a estática de TV. Cada pixel é um valor aleatório tirado de uma distribuição normal. Nos níveis máximos de ruído, a imagem original não contribui com nenhuma informação para o que você vê.

Televisão analógica vintage exibindo ruído de estática, o brilho fosforescente da tela CRT lançando luz branco-azulada em uma sala escura, luz ambiente incandescente quente contrastando com a tela fria

Difusão direta: da imagem ao ruído

A fase de treinamento começa destruindo imagens de forma sistemática. Isso se chama difusão direta, e funciona adicionando uma quantidade pequena e matematicamente precisa de ruído gaussiano à imagem a cada passo de tempo. Depois de centenas de passos de tempo, a imagem original fica completamente irreconhecível. Só resta a estática pura, indistinguível de ruído gerado aleatoriamente, sem imagem nenhuma.

Adicionando ruído, passo a passo

Pense nisso como colocar folhas de papel manteiga cada vez mais opacas sobre uma fotografia. Depois de uma folha, a foto ainda está quase toda visível. Depois de dez folhas, ela está borrada e desbotada. Depois de mil folhas, você não consegue ver a foto de jeito nenhum. A difusão direta faz exatamente isso com ruído em nível de pixel, em incrementos matematicamente controlados e previsíveis.

Retrato fotografado e impresso sobre uma mesa de madeira coberta por camadas translúcidas de papel manteiga empilhadas, cada camada acrescentando mais ruído visual, luz solar de fim de tarde raspando a textura do papel

A ideia central é que cada versão ruidosa fica pareada com seu rótulo de passo de tempo. O modelo recebe a informação "esta é a aparência da imagem no passo 200 de 1000" e "esta é a aparência dela no passo 800 de 1000". Cada passo, para cada imagem do conjunto de treinamento, vira um exemplo de treino rotulado. Isso gera um conjunto de dados vasto e rico em estrutura a partir de imagens que já existem.

Como é o cronograma de ruído

Passo de tempoNível de ruídoVisibilidade da imagem
0NenhumOriginal perfeito
100BaixoLevemente granulada
400MédioBorrada, contornos visíveis
700AltoApenas formas vagas
1000MáximoRuído gaussiano puro

A taxa específica com que o ruído é adicionado segue o que se chama cronograma de ruído. Diferentes cronogramas, como o linear, o cosseno ou o sigmoide, afetam a qualidade das imagens que o modelo pode produzir com o tempo. A maioria dos modelos modernos usa cronograma cosseno, que adiciona ruído mais devagar nas extremidades e mais rápido no meio, resultando em saídas finais de aparência melhor.

Difusão reversa: do ruído à imagem

Depois que o modelo internalizou todos os níveis de ruído de milhões de imagens, você inverte o processo. Você entrega a ele ruído puro e pede que preveja que ruído deve ser removido para se aproximar de uma imagem real. Ele remove um pouco. Você pede de novo. Ele remove um pouco mais. Depois de 20 a 1000 desses passos de remoção de ruído, dependendo do amostrador escolhido, surge uma imagem com aparência real.

A rede neural de remoção de ruído

A rede neural dentro de um modelo de difusão não gera a imagem diretamente. Ela prevê o próprio ruído, especificamente qual ruído precisa ser subtraído em cada passo. A peça principal costuma ser uma arquitetura U-Net: uma rede neural com formato de letra U, com um caminho de codificação que comprime a imagem ruidosa em representações abstratas e um caminho de decodificação que reconstrói a previsão limpa. A imagem surge do que sobra depois que o ruído previsto é subtraído.

Foto aérea de cima da mesa de um engenheiro de software, mãos digitando em um teclado mecânico, monitor widescreen exibindo código Python e visualizações de matrizes, luminária de mesa de luz tungstênio quente, equações manuscritas em um caderno

Quantos passos são necessários?

O artigo original do DDPM (Denoising Diffusion Probabilistic Model) exigia 1000 passos de remoção de ruído, o que tornava a geração dolorosamente lenta. Amostradores modernos como DDIM (Denoising Diffusion Implicit Models), DPM++ e Euler conseguem produzir imagens de alta qualidade em apenas 20 a 50 passos, dando passos maiores e mais inteligentes pelo processo de remoção de ruído. É por isso que as ferramentas de imagem por IA atuais parecem quase instantâneas em comparação com as primeiras implementações.

Nota: O amostrador é um algoritmo separado que fica por cima do modelo treinado. Trocar o amostrador não muda o que o modelo internalizou. Ele só muda como as previsões do modelo são usadas para ir do ruído até a imagem. Amostradores diferentes atendem a necessidades diferentes: o DDIM é rápido e coerente, o DPM++ entrega mais qualidade com mais passos, e o Euler equilibra bem velocidade e fidelidade.

Dentro do espaço latente

Rodar a difusão diretamente sobre valores brutos de pixel em alta resolução seria extremamente lento e caro em termos computacionais. Uma imagem de 512x512 tem mais de 786.000 valores individuais de pixel para processar em cada passo de remoção de ruído. Os modelos de difusão modernos resolvem isso com um truque de eficiência essencial: fazem a remoção de ruído em uma representação comprimida, chamada espaço latente, em vez de no espaço de pixels.

O codificador e o decodificador

Antes de a difusão começar, uma rede neural separada, chamada codificador, comprime a imagem em uma grade muito menor de valores. Uma imagem de 512x512 pixels normalmente vira uma representação latente de 64x64, um fator de compressão de 64. Toda a remoção de ruído acontece nesse tamanho menor, o que é muito mais rápido. Quando a remoção de ruído termina, uma segunda rede, chamada decodificador, expande a representação latente de volta para uma imagem em resolução total.

Fotógrafo de filme em um laboratório escuro tradicional segurando uma tira de negativos de 35mm em direção a uma luz de segurança vermelho-âmbar, miniaturas comprimidas visíveis em sequência ao longo da tira, bandejas de revelação químicas sobre a bancada

O codificador e o decodificador juntos formam um Autoencoder Variacional (VAE). O espaço latente que ele cria não é uma compressão arbitrária; é uma representação estruturada e rica em informação que preserva as características visuais mais importantes da imagem enquanto descarta o que é redundante. Pense nisso como um negativo de filme: todas as informações de uma fotografia em resolução total comprimidas em uma tira fina e pequena de material.

Por que o espaço latente mudou tudo

Essa arquitetura é a razão pela qual a família de modelos se chama oficialmente Modelos de Difusão Latente (LDMs), mesmo que a maioria das pessoas apenas diga "modelos de difusão". O Stable Diffusion XL e o Stable Diffusion 3 são ambos modelos de difusão latente. O Flux Pro também é. Trabalhar no espaço latente em vez do espaço de pixels é o que tornou a geração de imagens por IA em alta resolução viável em hardware de consumo, em vez de exigir fazendas de servidores.

Como o texto controla o resultado

Um modelo de difusão sem condicionamento por texto geraria, a cada vez, imagens com conteúdo aleatório e com aparência estatisticamente plausível. Os prompts de texto funcionam condicionando o processo de remoção de ruído, direcionando o modelo para regiões específicas do espaço de imagens em que o conteúdo corresponde à sua descrição.

Codificadores de texto e embeddings

O texto que você digita é primeiro convertido em uma representação numérica densa por um codificador de texto. Modelos como CLIP ou T5 leem seu prompt e produzem uma sequência de vetores de alta dimensão chamados embeddings, cada um capturando o significado semântico de palavras e expressões no contexto da frase inteira. Esses vetores de embedding são passados para a U-Net em cada passo de remoção de ruído, de modo que a previsão de ruído é constantemente influenciada pelo que você pediu.

Close-up das mãos de uma mulher escrevendo anotações descritivas detalhadas em um diário de capa de couro, ao lado do diário uma fotografia impressa de uma paisagem de montanha na hora dourada, luz suave e natural de janela criando sombras delicadas

Orientação sem classificador

A força da influência do texto é controlada por uma configuração chamada guidance scale (também chamada de escala CFG, abreviação de Classifier-Free Guidance). Com valores baixos, por volta de 2 a 4, o modelo segue o texto de forma livre e produz resultados mais variados, às vezes surpreendentes. Com valores altos, por volta de 12 a 20, o modelo segue o texto de forma muito rígida, mas pode produzir imagens saturadas ou distorcidas em excesso. A maioria dos geradores de IA usa por padrão uma guidance scale entre 7 e 12, equilibrando a fidelidade ao prompt com a qualidade visual.

Nota: A orientação sem classificador funciona executando a remoção de ruído duas vezes por passo: uma vez com a sua condição de texto e outra sem ela. O modelo então amplifica a diferença entre as duas previsões. Uma guidance scale mais alta significa um fator de amplificação maior, que puxa o resultado com mais força na direção do seu prompt.

O processo de treinamento

Treinar um modelo de difusão do zero exige conjuntos de dados enormes e muito poder computacional. Modelos como o Stable Diffusion XL foram treinados com centenas de milhões de pares de imagem e legenda extraídos da internet, exigindo clusters de centenas de GPUs rodando por semanas ou meses. O que o modelo constrói nesse processo não é um banco de dados de imagens, mas uma representação interna rica da estrutura visual.

O que o modelo realmente internaliza

Durante o treinamento, para cada imagem do conjunto de dados, o processo funciona assim:

  1. Sortear um passo de tempo aleatório entre 1 e 1000
  2. Adicionar à imagem a quantidade correspondente de ruído gaussiano
  3. Passar a imagem ruidosa para a U-Net junto com o número do passo de tempo e a legenda de texto
  4. Pedir que a U-Net preveja o ruído que foi adicionado
  5. Calcular o quanto a previsão estava errada (a função de perda)
  6. Ajustar os pesos do modelo para tornar as previsões futuras mais precisas

Centenas de fotografias impressas organizadas em uma grade precisa sobre um grande quadro de cortiça natural, uma pesquisadora em pé ao lado examinando a coleção com os braços cruzados, iluminação quente de trilho no teto

Esse ciclo se repete para bilhões de pares de imagem e passo de tempo. O resultado é um modelo que internalizou a estrutura visual de uma fatia enorme da cultura visual humana e consegue ir do ruído até qualquer imagem que esteja dentro da distribuição em que foi treinado.

O papel das seeds aleatórias

O processo de remoção de ruído no sentido inverso não é determinístico. Mesmo com um prompt idêntico, rodar o modelo duas vezes com seeds aleatórias diferentes produz imagens totalmente diferentes. Isso acontece porque o ruído inicial é aleatório, e pequenas diferenças nesse ruído inicial levam a caminhos muito diferentes pelo processo de remoção de ruído. Isso é uma característica, não um defeito: é o que dá variedade visual entre várias gerações do mesmo prompt.

Fotógrafo revelando uma fotografia em filme preto e branco em um banho de revelador químico, uma imagem de retrato surgindo lentamente do papel fotográfico branco, luz de segurança vermelho-âmbar criando uma iluminação quente e dramática vinda de cima

Difusão comparada a outros modelos generativos

Os modelos de difusão não surgiram no vácuo. Duas abordagens mais antigas dominaram a geração de imagens por IA antes deles, e comparar as três ajuda a entender por que a difusão se tornou o padrão.

Contra as GANs

As Redes Adversariais Generativas (GANs) usam duas redes concorrentes: um gerador que cria imagens e um discriminador que tenta detectar falsificações. Elas podem produzir imagens nítidas e de alta fidelidade com rapidez, mas são notoriamente difíceis de treinar e propensas ao "colapso de modo", em que o gerador deixa de produzir resultados diversos e se fixa em uma faixa estreita de imagens que enganam o discriminador de forma confiável.

Os modelos de difusão são mais lentos na inferência, mas produzem saídas mais diversas e controláveis e são muito mais estáveis de treinar. A capacidade de condicionar em texto arbitrário com alta fidelidade também é muito mais natural na difusão do que nas GANs, que exigem truques de arquitetura e soluções alternativas para alcançar um controle de prompt significativo.

Contra os VAEs

Os Autoencoders Variacionais também trabalham com representações latentes e podem gerar imagens amostrando do espaço latente. No entanto, tendem a produzir resultados borrados, porque otimizam a semelhança média de pixels, e a "média" de muitas imagens plausíveis costuma ser uma mistura desbotada de todas elas. Os modelos de difusão contornam isso por completo, otimizando a previsão de ruído em vez da reconstrução de pixels, o que naturalmente produz saídas mais nítidas e detalhadas.

Tipo de modeloVelocidadeQualidadeControle por textoEstabilidade no treinamento
GANRápidoNítido, mas restritoLimitadoDifícil
VAERápidoFrequentemente borradoLimitadoEstável
DifusãoModeradoAlta fidelidade, saídas diversasExcelenteMuito estável

Dois pesquisadores sentados lado a lado em um laboratório de informática universitário moderno e iluminado, examinando diferentes imagens geradas por IA em seus grandes monitores, conversando e apontando para as telas, estilo de fotografia documental espontânea

Modelos reais, resultados reais

Os modelos que você usa nas plataformas de imagem por IA são todos construídos sobre esses princípios de difusão. Veja como os principais se encaixam no que você leu acima.

Stable Diffusion e suas versões

A arquitetura do Stable Diffusion XL introduziu um pipeline de dois estágios: um modelo base cuida da composição ampla e da estrutura, e um modelo refinador aprimora os detalhes finos em uma segunda passagem. O Stable Diffusion 3 substituiu a U-Net clássica por uma arquitetura DiT (Diffusion Transformer), que melhora de forma significativa a precisão da renderização de texto e o controle de composição.

Esses modelos são a base de centenas de versões com fine-tuning especializadas em retratos, visualização arquitetônica, fotografia de produtos e ilustração. O fine-tuning não muda o processo central de difusão; ele desloca a distribuição internalizada do modelo em direção a um estilo visual específico ou a um domínio de assunto.

Flux e a nova geração

O Flux Pro e o Flux Schnell representam o estado da arte atual em transformadores de difusão. Eles produzem fotorrealismo excepcional, renderização precisa de texto dentro das imagens geradas e forte aderência aos detalhes do prompt. O Flux Redux Dev amplia isso ao permitir a geração de variações sobre uma imagem de referência existente, para que você possa iterar a partir de um ponto de partida em vez de partir de ruído puro.

Todos esses modelos ainda seguem exatamente o mesmo processo central: adição de ruído durante o treinamento, remoção de ruído no sentido inverso na geração, compressão no espaço latente para ganhar velocidade e condicionamento por texto para moldar o resultado. As melhorias de arquitetura mudam o quão bem o modelo percorre esse processo, não o que o processo é.

O que você pode criar agora mesmo

Você não precisa treinar um modelo nem escrever uma única linha de código para colocar tudo isso em prática. Todo modelo descrito acima está disponível diretamente no navegador, no PicassoIA, sem nenhuma configuração.

Profissional criativa, mulher, digitando um prompt de texto em um gerador de imagens por IA no notebook, o monitor externo exibindo um retrato lindamente gerado, alegria genuína visível no rosto, luz natural do dia em um estúdio criativo luminoso

Comece digitando um prompt detalhado e específico no Flux Pro e observe o processo de remoção de ruído transformar suas palavras em uma cena fotorrealista. Aumente e diminua a guidance scale para ver o quanto o texto molda o resultado. Depois troque para o Stable Diffusion XL com o mesmo prompt e compare as diferenças estéticas entre dois modelos que compartilham a mesma arquitetura central, mas percorrem o processo de maneiras diferentes.

Gere o mesmo prompt duas vezes com seeds diferentes. Repare em quão diferentes são as saídas, mesmo que o processo por trás delas seja idêntico. Essa variação não é um defeito. É a natureza probabilística da difusão fazendo exatamente o que foi projetada para fazer: ir do caos à clareza, guiada pelo que você pediu, por um caminho que nenhuma geração jamais vai repetir.

Cada imagem que você gera é uma travessia pelo ruído. Agora você sabe exatamente o que acontece no caminho.

Compartilhe este artigo

Escolha seu idioma