Qué es un modelo de difusión, explicado de forma sencilla

Los modelos de difusión impulsan todos los principales generadores de imágenes con IA que se usan hoy, desde Stable Diffusion hasta Flux. Este artículo explica cómo funcionan en realidad, desde la adición de ruido gaussiano hasta la eliminación inversa de ruido, la compresión en el espacio latente y el condicionamiento por texto, sin jerga matemática ni relleno.

Qué es un modelo de difusión, explicado de forma sencilla
Cristian Da Conceicao
Fundador de Picasso IA

A medio camino entre las matemáticas y la magia, un modelo de difusión toma una pantalla llena de ruido aleatorio puro y lo va esculpiendo hasta convertirlo en un rostro fotorrealista, una pintura al óleo al estilo del Renacimiento o un paisaje urbano a la hora dorada. Si alguna vez has escrito una frase en un generador de imágenes con IA y has visto aparecer algo, has presenciado un modelo de difusión en acción. Pero ¿qué ocurre realmente dentro de ese proceso? La respuesta es sorprendentemente lógica una vez que ves las dos fases en las que se apoya.

La idea detrás de los modelos de difusión

Un modelo de difusión está entrenado para eliminar ruido. Ese es todo el concepto central. Durante el entrenamiento, al modelo se le muestran millones de imágenes a las que se les añade cantidades crecientes de ruido aleatorio. Va desarrollando, paso a paso, la capacidad de reconstruir cómo era la imagen original antes de que se le añadiera el ruido. Una vez entrenado, ejecutas el proceso al revés: partes de ruido puro, y el modelo recorre hacia atrás los pasos que ha interiorizado, quitando ruido en cada etapa hasta que surge una imagen coherente.

Una extraña forma de creatividad

Suena raro que esto cuente como "creatividad". El modelo no pinta algo desde cero como lo haría un artista humano. En cambio, traza un camino a través de un mapa interiorizado de cómo son las imágenes reales en distintos niveles de corrupción, avanzando del caos hacia la claridad. El destino de ese camino, moldeado por tu prompt de texto, determina lo que ves al final.

Por eso los resultados parecen tan variados y naturales. El modelo no recupera imágenes almacenadas ni une fragmentos. Construye algo nuevo siguiendo los patrones estadísticos de cómo debería verse una imagen real en cada etapa del proceso de eliminación de ruido.

Por qué el ruido es el punto de partida

La elección de empezar con ruido es deliberada. El ruido está bien definido matemáticamente: en concreto, el ruido gaussiano, donde los valores de los píxeles siguen una distribución en forma de campana. Esa precisión matemática es lo que permite que el modelo se entrene con rigor. Ha estado expuesto a las versiones con ruido de millones de imágenes en cada nivel de corrupción, de modo que puede predecir qué debe eliminarse en cualquier etapa dada.

Nota: El ruido gaussiano se parece exactamente a la estática de un televisor. Cada píxel es un valor aleatorio extraído de una distribución normal. En los niveles máximos de ruido, la imagen original no aporta ninguna información a lo que ves.

Televisor analógico antiguo mostrando ruido de estática, el resplandor fosforescente de la pantalla CRT proyectando luz azul-blanca en una habitación tenue, luz ambiental cálida incandescente contrastando con la pantalla fría

Difusión directa: de la imagen al ruido

La fase de entrenamiento empieza destruyendo imágenes de forma sistemática. Esto se llama difusión directa, y funciona añadiendo, en cada paso temporal, una cantidad pequeña y matemáticamente precisa de ruido gaussiano a la imagen. Tras cientos de pasos temporales, la imagen original resulta completamente irreconocible. Solo queda estática pura, indistinguible de un ruido generado al azar sin ninguna imagen de por medio.

Añadir ruido, paso a paso

Piensa en ello como colocar hojas de papel calco cada vez más opacas sobre una fotografía. Tras una hoja, la foto sigue siendo casi toda visible. Tras diez hojas, está borrosa y desvaída. Tras mil hojas, no se distingue la foto en absoluto. La difusión directa hace exactamente eso con ruido a nivel de píxel, en incrementos controlados y predecibles desde el punto de vista matemático.

Retrato fotográfico impreso sobre un escritorio de madera cubierto por capas translúcidas de papel calco apiladas encima, cada capa añade más ruido visual, luz solar cálida de la tarde recorriendo la textura del papel

La idea central es que cada versión con ruido va emparejada con su etiqueta de paso temporal. Al modelo se le muestra "así se ve la imagen en el paso 200 de 1000" y "así se ve en el paso 800 de 1000". Cada paso, para cada imagen del conjunto de entrenamiento, se convierte en un ejemplo de entrenamiento etiquetado. Así se genera un conjunto de datos enorme y muy estructurado a partir de imágenes que ya existen.

Cómo es la programación del ruido

Paso temporalNivel de ruidoVisibilidad de la imagen
0NingunoOriginal perfecto
100BajoLigeramente granulada
400MedioBorrosa, contornos visibles
700AltoSolo formas vagas
1000MáximoRuido gaussiano puro

La velocidad concreta a la que se añade el ruido sigue lo que se llama la programación del ruido (noise schedule). Distintas programaciones, como la lineal, la coseno o la sigmoide, afectan a la calidad de las imágenes que el modelo puede producir al final. La mayoría de los modelos modernos usan programación coseno, que añade ruido más despacio en los extremos y más deprisa en el centro, lo que da resultados finales de mejor aspecto.

Difusión inversa: del ruido a la imagen

Una vez que el modelo ha interiorizado cada nivel de ruido de millones de imágenes, das la vuelta al proceso. Le das ruido puro y le pides que prediga qué ruido debe eliminarse para acercarse a una imagen real. Elimina un poco. Vuelves a pedirlo. Elimina un poco más. Tras entre 20 y 1000 de estos pasos de eliminación de ruido, según el muestreador elegido, ha aparecido una imagen de aspecto real.

La red neuronal de eliminación de ruido

La red neuronal dentro de un modelo de difusión no genera la imagen directamente. Predice el ruido en sí, en concreto qué ruido hay que restar en cada paso. El componente principal suele ser una arquitectura U-Net: una red neuronal con forma de letra U, con una ruta de codificador que comprime la imagen con ruido en representaciones abstractas y una ruta de decodificador que reconstruye la predicción limpia. La imagen surge de lo que queda después de restar el ruido predicho.

Fotografía aérea cenital del escritorio de un ingeniero de software, manos escribiendo en un teclado mecánico, monitor panorámico mostrando código Python y visualizaciones de matrices, lámpara de escritorio de luz cálida de tungsteno, ecuaciones escritas a mano en una libreta

¿Cuántos pasos hacen falta?

El artículo original sobre DDPM (Denoising Diffusion Probabilistic Model) requería 1000 pasos de eliminación de ruido, lo que hacía la generación tremendamente lenta. Los muestreadores modernos como DDIM (Denoising Diffusion Implicit Models), DPM++ y Euler pueden producir imágenes de alta calidad en solo 20 a 50 pasos, dando saltos más grandes e inteligentes a través del proceso de eliminación de ruido. Por eso las herramientas de imagen con IA actuales parecen casi instantáneas en comparación con las primeras implementaciones.

Nota: El muestreador es un algoritmo aparte que se sitúa sobre el modelo entrenado. Cambiar el muestreador no cambia lo que el modelo ha interiorizado. Solo cambia cómo se usan las predicciones del modelo para pasar del ruido a la imagen. Distintos muestreadores se adaptan a distintas necesidades: DDIM es rápido y constante, DPM++ ofrece más calidad con más pasos, Euler equilibra bien velocidad y fidelidad.

Dentro del espacio latente

Ejecutar la difusión directamente sobre valores de píxeles en bruto y con alta resolución sería extremadamente lento y costoso en cómputo. Una imagen de 512x512 tiene más de 786.000 valores de píxel que procesar en cada paso de eliminación de ruido. Los modelos de difusión modernos resuelven esto con un truco de eficiencia fundamental: realizan la eliminación de ruido en una representación comprimida llamada espacio latente, en lugar de en el espacio de píxeles.

El codificador y el decodificador

Antes de que empiece la difusión, una red neuronal independiente llamada codificador comprime la imagen en una cuadrícula de valores mucho más pequeña. Una imagen de 512x512 píxeles suele convertirse en una representación latente de 64x64, con un factor de compresión de 64. Toda la eliminación de ruido ocurre en este tamaño más pequeño, lo que es muchísimo más rápido. Cuando termina la eliminación de ruido, una segunda red llamada decodificador expande la representación latente de nuevo a una imagen de resolución completa.

Fotógrafo de película en un cuarto oscuro tradicional sosteniendo una tira de negativos de 35 mm hacia una luz de seguridad roja ámbar, imágenes miniatura comprimidas visibles en secuencia a lo largo de la tira, bandejas de revelado químico sobre la mesa

El codificador y el decodificador juntos forman un autocodificador variacional (VAE). El espacio latente que crea no es una compresión arbitraria; es una representación estructurada y rica en información que conserva los rasgos visuales más importantes de la imagen mientras descarta lo redundante. Piénsalo como un negativo fotográfico: toda la información de una fotografía de resolución completa comprimida en una tira fina y pequeña de material.

Por qué el espacio latente lo cambió todo

Esta arquitectura es la razón por la que la familia de modelos se llama oficialmente modelos de difusión latente (LDM), aunque la mayoría de la gente solo diga "modelos de difusión". Stable Diffusion XL y Stable Diffusion 3 son ambos modelos de difusión latente. También lo es Flux Pro. Trabajar en el espacio latente en lugar del espacio de píxeles es lo que hizo práctica la generación de imágenes con IA de alta resolución en equipos de consumo, en lugar de requerir granjas de servidores.

Cómo controla el texto el resultado

Un modelo de difusión sin condicionamiento por texto generaría cada vez imágenes de contenido aleatorio, estadísticamente plausible. Los prompts de texto funcionan condicionando el proceso de eliminación de ruido, dirigiendo al modelo hacia regiones concretas del espacio de imágenes donde el contenido coincide con tu descripción.

Codificadores de texto y embeddings

El texto que escribes se convierte primero en una representación numérica densa mediante un codificador de texto. Modelos como CLIP o T5 leen tu prompt y producen una secuencia de vectores de alta dimensión llamados embeddings, cada uno de los cuales captura el significado semántico de palabras y frases en el contexto de la frase completa. Estos vectores de embedding se pasan a la U-Net en cada paso de eliminación de ruido, así que la predicción del ruido está influida constantemente por lo que pediste.

Primer plano de las manos de una mujer escribiendo notas descriptivas detalladas en un diario de cuero, junto al diario una fotografía impresa de un paisaje montañoso a la hora dorada, luz suave y natural de ventana creando sombras delicadas

Guía sin clasificador

La intensidad de la influencia del texto se controla con un ajuste llamado guidance scale (también conocido como escala CFG, por Classifier-Free Guidance). Con valores bajos, alrededor de 2 a 4, el modelo sigue el texto de forma laxa y produce resultados más variados, a veces sorprendentes. Con valores altos, alrededor de 12 a 20, el modelo sigue el texto de forma muy estricta, pero puede producir imágenes excesivamente saturadas o distorsionadas. La mayoría de los generadores de IA usan por defecto una guidance scale entre 7 y 12, equilibrando la fidelidad al prompt con la calidad visual.

Nota: La guía sin clasificador funciona ejecutando la eliminación de ruido dos veces por paso: una con tu condición de texto y otra sin ella. Después, el modelo amplifica la diferencia entre las dos predicciones. Una guidance scale más alta significa un factor de amplificación mayor, que empuja el resultado con más fuerza hacia tu prompt.

El proceso de entrenamiento

Entrenar un modelo de difusión desde cero requiere conjuntos de datos enormes y mucha capacidad de cómputo. Modelos como Stable Diffusion XL se entrenaron con cientos de millones de pares imagen-descripción extraídos de internet, lo que requirió clústeres de cientos de GPU funcionando durante semanas o meses. Lo que el modelo construye con ese proceso no es una base de datos de imágenes, sino una rica representación interna de la estructura visual.

Lo que el modelo interioriza realmente

Durante el entrenamiento, para cada imagen del conjunto de datos, el proceso se desarrolla así:

  1. Muestrear un paso temporal aleatorio entre 1 y 1000
  2. Añadir a la imagen la cantidad correspondiente de ruido gaussiano
  3. Pasar la imagen con ruido a la U-Net junto con el número del paso temporal y la descripción de texto
  4. Pedir a la U-Net que prediga el ruido que se añadió
  5. Calcular cuánto se equivocó la predicción (la función de pérdida)
  6. Ajustar los pesos del modelo para que las predicciones futuras sean más precisas

Cientos de fotografías impresas dispuestas en una cuadrícula precisa sobre un gran tablero de corcho natural, una investigadora de pie a un lado examinando la colección con los brazos cruzados, iluminación cálida de carril en el techo

Este ciclo se repite para miles de millones de pares de imagen y paso temporal. El resultado es un modelo que ha interiorizado la estructura visual de una porción enorme de la cultura visual humana y que puede pasar del ruido hacia cualquier imagen que caiga dentro de la distribución con la que fue entrenado.

El papel de las semillas aleatorias

El proceso de eliminación de ruido inverso no es determinista. Incluso con un prompt idéntico, ejecutar el modelo dos veces con semillas aleatorias distintas produce imágenes completamente diferentes. Esto se debe a que el ruido inicial es aleatorio, y pequeñas diferencias en ese ruido inicial llevan a trayectorias muy distintas por el proceso de eliminación de ruido. Es una característica, no un defecto: es lo que te da variedad visual a lo largo de varias generaciones del mismo prompt.

Fotógrafo revelando una fotografía en película en blanco y negro dentro de un baño de revelador químico, una imagen de retrato emergiendo poco a poco del papel fotográfico blanco, luz de seguridad roja ámbar creando una iluminación cálida y dramática desde arriba

Difusión frente a otros modelos generativos

Los modelos de difusión no surgieron de la nada. Dos enfoques anteriores dominaron la generación de imágenes con IA antes que ellos, y comparar los tres aclara por qué la difusión se convirtió en el estándar.

Frente a las GAN

Las redes generativas antagónicas (GAN) usan dos redes que compiten: un generador que crea imágenes y un discriminador que intenta detectar falsificaciones. Pueden producir imágenes nítidas y de alta fidelidad con rapidez, pero son notoriamente difíciles de entrenar y propensas al "colapso de modo", donde el generador deja de producir resultados diversos y se fija en un rango estrecho de imágenes que engañan de forma fiable al discriminador.

Los modelos de difusión son más lentos en la inferencia, pero producen resultados más diversos y controlables y son mucho más estables de entrenar. La capacidad de condicionar con texto arbitrario y con alta fidelidad también resulta mucho más natural con la difusión que con las GAN, que requieren trucos arquitectónicos y soluciones alternativas para lograr un control real del prompt.

Frente a los VAE

Los autocodificadores variacionales también trabajan con representaciones latentes y pueden generar imágenes muestreando el espacio latente. Sin embargo, tienden a producir resultados borrosos porque optimizan la similitud media de píxeles, y el "promedio" de muchas imágenes plausibles suele ser una mezcla desvaída de todas ellas. Los modelos de difusión evitan esto por completo al optimizar la predicción del ruido en lugar de la reconstrucción de píxeles, lo que produce de forma natural resultados más nítidos y detallados.

Tipo de modeloVelocidadCalidadControl por textoEstabilidad del entrenamiento
GANRápidaNítida pero limitadaLimitadoDifícil
VAERápidaA menudo borrosaLimitadoEstable
DifusiónModeradaAlta fidelidad, diversaExcelenteMuy estable

Dos investigadores sentados uno al lado del otro en un laboratorio de informática universitario moderno y luminoso, examinando distintas imágenes generadas por IA en sus grandes monitores, conversando y señalando las pantallas, estilo de fotografía documental espontánea

Modelos reales, resultados reales

Los modelos que usas en las plataformas de imágenes con IA se construyen todos sobre estos principios de difusión. Así se relacionan los principales con lo que has leído hasta ahora.

Stable Diffusion y sus variantes

La arquitectura de Stable Diffusion XL introdujo un pipeline de dos etapas: un modelo base se encarga de la composición y la estructura generales, y un modelo refinador afina los detalles finos en una segunda pasada. Stable Diffusion 3 sustituyó la U-Net clásica por una arquitectura DiT (Diffusion Transformer), que mejora de forma notable la precisión al renderizar texto y el control de la composición.

Estos modelos son la base de cientos de variantes con ajuste fino especializadas en retratos, visualización arquitectónica, fotografía de producto e ilustración. El ajuste fino no cambia el proceso de difusión en sí; desplaza la distribución interiorizada del modelo hacia un estilo visual concreto o un dominio temático específico.

Flux y la nueva generación

Flux Pro y Flux Schnell representan lo más avanzado actualmente en transformadores de difusión. Producen un fotorrealismo excepcional, renderizado preciso de texto dentro de las imágenes generadas y una fuerte adherencia a los detalles del prompt. Flux Redux Dev amplía esto permitiendo generar variaciones a partir de una imagen de referencia existente, de modo que puedes iterar desde un punto de partida en lugar de hacerlo desde ruido puro.

Todos estos modelos siguen aún exactamente el mismo proceso básico: añadir ruido durante el entrenamiento, eliminarlo en orden inverso al generar, comprimir en el espacio latente para ganar velocidad y usar el condicionamiento por texto para dar forma al resultado. Las mejoras de arquitectura cambian hasta qué punto el modelo recorre ese proceso, no en qué consiste el proceso.

Lo que puedes crear ahora mismo

No necesitas entrenar un modelo ni escribir una sola línea de código para poner todo esto en práctica. Cada modelo descrito arriba está disponible directamente en el navegador en PicassoIA, sin ninguna configuración.

Mujer profesional creativa escribiendo un prompt de texto en un generador de imágenes con IA en su equipo portátil, su monitor externo mostrando un retrato generado de gran belleza, una alegría genuina visible en su rostro, luz de día natural en un estudio creativo luminoso

Empieza escribiendo un prompt detallado y específico en Flux Pro y observa cómo el proceso de eliminación de ruido convierte tus palabras en una escena fotorrealista. Sube y baja la guidance scale para ver cuánto da forma el texto al resultado. Después cambia a Stable Diffusion XL con el mismo prompt y compara las diferencias estéticas entre dos modelos que comparten la misma arquitectura base pero la recorren de formas distintas.

Genera el mismo prompt dos veces con semillas distintas. Fíjate en lo diferentes que son los resultados, aunque el proceso subyacente sea idéntico. Esa variación no es un defecto. Es la naturaleza probabilística de la difusión haciendo exactamente lo que fue diseñada para hacer: avanzar del caos a la claridad, guiada por lo que pediste, por un camino que ninguna generación compartirá con otra.

Cada imagen que generas es un recorrido por el ruido. Ahora sabes exactamente qué ocurre en el camino.

Compartir este artículo

Elige tu idioma