A medio camino entre las matemáticas y la magia, un modelo de difusión toma una pantalla llena de ruido aleatorio puro y lo va esculpiendo hasta convertirlo en un rostro fotorrealista, una pintura al óleo al estilo del Renacimiento o un paisaje urbano a la hora dorada. Si alguna vez has escrito una frase en un generador de imágenes con IA y has visto aparecer algo, has presenciado un modelo de difusión en acción. Pero ¿qué ocurre realmente dentro de ese proceso? La respuesta es sorprendentemente lógica una vez que ves las dos fases en las que se apoya.
La idea detrás de los modelos de difusión
Un modelo de difusión está entrenado para eliminar ruido. Ese es todo el concepto central. Durante el entrenamiento, al modelo se le muestran millones de imágenes a las que se les añade cantidades crecientes de ruido aleatorio. Va desarrollando, paso a paso, la capacidad de reconstruir cómo era la imagen original antes de que se le añadiera el ruido. Una vez entrenado, ejecutas el proceso al revés: partes de ruido puro, y el modelo recorre hacia atrás los pasos que ha interiorizado, quitando ruido en cada etapa hasta que surge una imagen coherente.
Una extraña forma de creatividad
Suena raro que esto cuente como "creatividad". El modelo no pinta algo desde cero como lo haría un artista humano. En cambio, traza un camino a través de un mapa interiorizado de cómo son las imágenes reales en distintos niveles de corrupción, avanzando del caos hacia la claridad. El destino de ese camino, moldeado por tu prompt de texto, determina lo que ves al final.
Por eso los resultados parecen tan variados y naturales. El modelo no recupera imágenes almacenadas ni une fragmentos. Construye algo nuevo siguiendo los patrones estadísticos de cómo debería verse una imagen real en cada etapa del proceso de eliminación de ruido.
Por qué el ruido es el punto de partida
La elección de empezar con ruido es deliberada. El ruido está bien definido matemáticamente: en concreto, el ruido gaussiano, donde los valores de los píxeles siguen una distribución en forma de campana. Esa precisión matemática es lo que permite que el modelo se entrene con rigor. Ha estado expuesto a las versiones con ruido de millones de imágenes en cada nivel de corrupción, de modo que puede predecir qué debe eliminarse en cualquier etapa dada.
Nota: El ruido gaussiano se parece exactamente a la estática de un televisor. Cada píxel es un valor aleatorio extraído de una distribución normal. En los niveles máximos de ruido, la imagen original no aporta ninguna información a lo que ves.

Difusión directa: de la imagen al ruido
La fase de entrenamiento empieza destruyendo imágenes de forma sistemática. Esto se llama difusión directa, y funciona añadiendo, en cada paso temporal, una cantidad pequeña y matemáticamente precisa de ruido gaussiano a la imagen. Tras cientos de pasos temporales, la imagen original resulta completamente irreconocible. Solo queda estática pura, indistinguible de un ruido generado al azar sin ninguna imagen de por medio.
Añadir ruido, paso a paso
Piensa en ello como colocar hojas de papel calco cada vez más opacas sobre una fotografía. Tras una hoja, la foto sigue siendo casi toda visible. Tras diez hojas, está borrosa y desvaída. Tras mil hojas, no se distingue la foto en absoluto. La difusión directa hace exactamente eso con ruido a nivel de píxel, en incrementos controlados y predecibles desde el punto de vista matemático.

La idea central es que cada versión con ruido va emparejada con su etiqueta de paso temporal. Al modelo se le muestra "así se ve la imagen en el paso 200 de 1000" y "así se ve en el paso 800 de 1000". Cada paso, para cada imagen del conjunto de entrenamiento, se convierte en un ejemplo de entrenamiento etiquetado. Así se genera un conjunto de datos enorme y muy estructurado a partir de imágenes que ya existen.
Cómo es la programación del ruido
| Paso temporal | Nivel de ruido | Visibilidad de la imagen |
|---|
| 0 | Ninguno | Original perfecto |
| 100 | Bajo | Ligeramente granulada |
| 400 | Medio | Borrosa, contornos visibles |
| 700 | Alto | Solo formas vagas |
| 1000 | Máximo | Ruido gaussiano puro |
La velocidad concreta a la que se añade el ruido sigue lo que se llama la programación del ruido (noise schedule). Distintas programaciones, como la lineal, la coseno o la sigmoide, afectan a la calidad de las imágenes que el modelo puede producir al final. La mayoría de los modelos modernos usan programación coseno, que añade ruido más despacio en los extremos y más deprisa en el centro, lo que da resultados finales de mejor aspecto.
Difusión inversa: del ruido a la imagen
Una vez que el modelo ha interiorizado cada nivel de ruido de millones de imágenes, das la vuelta al proceso. Le das ruido puro y le pides que prediga qué ruido debe eliminarse para acercarse a una imagen real. Elimina un poco. Vuelves a pedirlo. Elimina un poco más. Tras entre 20 y 1000 de estos pasos de eliminación de ruido, según el muestreador elegido, ha aparecido una imagen de aspecto real.
La red neuronal de eliminación de ruido
La red neuronal dentro de un modelo de difusión no genera la imagen directamente. Predice el ruido en sí, en concreto qué ruido hay que restar en cada paso. El componente principal suele ser una arquitectura U-Net: una red neuronal con forma de letra U, con una ruta de codificador que comprime la imagen con ruido en representaciones abstractas y una ruta de decodificador que reconstruye la predicción limpia. La imagen surge de lo que queda después de restar el ruido predicho.

¿Cuántos pasos hacen falta?
El artículo original sobre DDPM (Denoising Diffusion Probabilistic Model) requería 1000 pasos de eliminación de ruido, lo que hacía la generación tremendamente lenta. Los muestreadores modernos como DDIM (Denoising Diffusion Implicit Models), DPM++ y Euler pueden producir imágenes de alta calidad en solo 20 a 50 pasos, dando saltos más grandes e inteligentes a través del proceso de eliminación de ruido. Por eso las herramientas de imagen con IA actuales parecen casi instantáneas en comparación con las primeras implementaciones.
Nota: El muestreador es un algoritmo aparte que se sitúa sobre el modelo entrenado. Cambiar el muestreador no cambia lo que el modelo ha interiorizado. Solo cambia cómo se usan las predicciones del modelo para pasar del ruido a la imagen. Distintos muestreadores se adaptan a distintas necesidades: DDIM es rápido y constante, DPM++ ofrece más calidad con más pasos, Euler equilibra bien velocidad y fidelidad.
Dentro del espacio latente
Ejecutar la difusión directamente sobre valores de píxeles en bruto y con alta resolución sería extremadamente lento y costoso en cómputo. Una imagen de 512x512 tiene más de 786.000 valores de píxel que procesar en cada paso de eliminación de ruido. Los modelos de difusión modernos resuelven esto con un truco de eficiencia fundamental: realizan la eliminación de ruido en una representación comprimida llamada espacio latente, en lugar de en el espacio de píxeles.
El codificador y el decodificador
Antes de que empiece la difusión, una red neuronal independiente llamada codificador comprime la imagen en una cuadrícula de valores mucho más pequeña. Una imagen de 512x512 píxeles suele convertirse en una representación latente de 64x64, con un factor de compresión de 64. Toda la eliminación de ruido ocurre en este tamaño más pequeño, lo que es muchísimo más rápido. Cuando termina la eliminación de ruido, una segunda red llamada decodificador expande la representación latente de nuevo a una imagen de resolución completa.

El codificador y el decodificador juntos forman un autocodificador variacional (VAE). El espacio latente que crea no es una compresión arbitraria; es una representación estructurada y rica en información que conserva los rasgos visuales más importantes de la imagen mientras descarta lo redundante. Piénsalo como un negativo fotográfico: toda la información de una fotografía de resolución completa comprimida en una tira fina y pequeña de material.
Por qué el espacio latente lo cambió todo
Esta arquitectura es la razón por la que la familia de modelos se llama oficialmente modelos de difusión latente (LDM), aunque la mayoría de la gente solo diga "modelos de difusión". Stable Diffusion XL y Stable Diffusion 3 son ambos modelos de difusión latente. También lo es Flux Pro. Trabajar en el espacio latente en lugar del espacio de píxeles es lo que hizo práctica la generación de imágenes con IA de alta resolución en equipos de consumo, en lugar de requerir granjas de servidores.
Cómo controla el texto el resultado
Un modelo de difusión sin condicionamiento por texto generaría cada vez imágenes de contenido aleatorio, estadísticamente plausible. Los prompts de texto funcionan condicionando el proceso de eliminación de ruido, dirigiendo al modelo hacia regiones concretas del espacio de imágenes donde el contenido coincide con tu descripción.
Codificadores de texto y embeddings
El texto que escribes se convierte primero en una representación numérica densa mediante un codificador de texto. Modelos como CLIP o T5 leen tu prompt y producen una secuencia de vectores de alta dimensión llamados embeddings, cada uno de los cuales captura el significado semántico de palabras y frases en el contexto de la frase completa. Estos vectores de embedding se pasan a la U-Net en cada paso de eliminación de ruido, así que la predicción del ruido está influida constantemente por lo que pediste.

Guía sin clasificador
La intensidad de la influencia del texto se controla con un ajuste llamado guidance scale (también conocido como escala CFG, por Classifier-Free Guidance). Con valores bajos, alrededor de 2 a 4, el modelo sigue el texto de forma laxa y produce resultados más variados, a veces sorprendentes. Con valores altos, alrededor de 12 a 20, el modelo sigue el texto de forma muy estricta, pero puede producir imágenes excesivamente saturadas o distorsionadas. La mayoría de los generadores de IA usan por defecto una guidance scale entre 7 y 12, equilibrando la fidelidad al prompt con la calidad visual.
Nota: La guía sin clasificador funciona ejecutando la eliminación de ruido dos veces por paso: una con tu condición de texto y otra sin ella. Después, el modelo amplifica la diferencia entre las dos predicciones. Una guidance scale más alta significa un factor de amplificación mayor, que empuja el resultado con más fuerza hacia tu prompt.
El proceso de entrenamiento
Entrenar un modelo de difusión desde cero requiere conjuntos de datos enormes y mucha capacidad de cómputo. Modelos como Stable Diffusion XL se entrenaron con cientos de millones de pares imagen-descripción extraídos de internet, lo que requirió clústeres de cientos de GPU funcionando durante semanas o meses. Lo que el modelo construye con ese proceso no es una base de datos de imágenes, sino una rica representación interna de la estructura visual.
Lo que el modelo interioriza realmente
Durante el entrenamiento, para cada imagen del conjunto de datos, el proceso se desarrolla así:
- Muestrear un paso temporal aleatorio entre 1 y 1000
- Añadir a la imagen la cantidad correspondiente de ruido gaussiano
- Pasar la imagen con ruido a la U-Net junto con el número del paso temporal y la descripción de texto
- Pedir a la U-Net que prediga el ruido que se añadió
- Calcular cuánto se equivocó la predicción (la función de pérdida)
- Ajustar los pesos del modelo para que las predicciones futuras sean más precisas

Este ciclo se repite para miles de millones de pares de imagen y paso temporal. El resultado es un modelo que ha interiorizado la estructura visual de una porción enorme de la cultura visual humana y que puede pasar del ruido hacia cualquier imagen que caiga dentro de la distribución con la que fue entrenado.
El papel de las semillas aleatorias
El proceso de eliminación de ruido inverso no es determinista. Incluso con un prompt idéntico, ejecutar el modelo dos veces con semillas aleatorias distintas produce imágenes completamente diferentes. Esto se debe a que el ruido inicial es aleatorio, y pequeñas diferencias en ese ruido inicial llevan a trayectorias muy distintas por el proceso de eliminación de ruido. Es una característica, no un defecto: es lo que te da variedad visual a lo largo de varias generaciones del mismo prompt.

Difusión frente a otros modelos generativos
Los modelos de difusión no surgieron de la nada. Dos enfoques anteriores dominaron la generación de imágenes con IA antes que ellos, y comparar los tres aclara por qué la difusión se convirtió en el estándar.
Frente a las GAN
Las redes generativas antagónicas (GAN) usan dos redes que compiten: un generador que crea imágenes y un discriminador que intenta detectar falsificaciones. Pueden producir imágenes nítidas y de alta fidelidad con rapidez, pero son notoriamente difíciles de entrenar y propensas al "colapso de modo", donde el generador deja de producir resultados diversos y se fija en un rango estrecho de imágenes que engañan de forma fiable al discriminador.
Los modelos de difusión son más lentos en la inferencia, pero producen resultados más diversos y controlables y son mucho más estables de entrenar. La capacidad de condicionar con texto arbitrario y con alta fidelidad también resulta mucho más natural con la difusión que con las GAN, que requieren trucos arquitectónicos y soluciones alternativas para lograr un control real del prompt.
Frente a los VAE
Los autocodificadores variacionales también trabajan con representaciones latentes y pueden generar imágenes muestreando el espacio latente. Sin embargo, tienden a producir resultados borrosos porque optimizan la similitud media de píxeles, y el "promedio" de muchas imágenes plausibles suele ser una mezcla desvaída de todas ellas. Los modelos de difusión evitan esto por completo al optimizar la predicción del ruido en lugar de la reconstrucción de píxeles, lo que produce de forma natural resultados más nítidos y detallados.
| Tipo de modelo | Velocidad | Calidad | Control por texto | Estabilidad del entrenamiento |
|---|
| GAN | Rápida | Nítida pero limitada | Limitado | Difícil |
| VAE | Rápida | A menudo borrosa | Limitado | Estable |
| Difusión | Moderada | Alta fidelidad, diversa | Excelente | Muy estable |

Modelos reales, resultados reales
Los modelos que usas en las plataformas de imágenes con IA se construyen todos sobre estos principios de difusión. Así se relacionan los principales con lo que has leído hasta ahora.
Stable Diffusion y sus variantes
La arquitectura de Stable Diffusion XL introdujo un pipeline de dos etapas: un modelo base se encarga de la composición y la estructura generales, y un modelo refinador afina los detalles finos en una segunda pasada. Stable Diffusion 3 sustituyó la U-Net clásica por una arquitectura DiT (Diffusion Transformer), que mejora de forma notable la precisión al renderizar texto y el control de la composición.
Estos modelos son la base de cientos de variantes con ajuste fino especializadas en retratos, visualización arquitectónica, fotografía de producto e ilustración. El ajuste fino no cambia el proceso de difusión en sí; desplaza la distribución interiorizada del modelo hacia un estilo visual concreto o un dominio temático específico.
Flux y la nueva generación
Flux Pro y Flux Schnell representan lo más avanzado actualmente en transformadores de difusión. Producen un fotorrealismo excepcional, renderizado preciso de texto dentro de las imágenes generadas y una fuerte adherencia a los detalles del prompt. Flux Redux Dev amplía esto permitiendo generar variaciones a partir de una imagen de referencia existente, de modo que puedes iterar desde un punto de partida en lugar de hacerlo desde ruido puro.
Todos estos modelos siguen aún exactamente el mismo proceso básico: añadir ruido durante el entrenamiento, eliminarlo en orden inverso al generar, comprimir en el espacio latente para ganar velocidad y usar el condicionamiento por texto para dar forma al resultado. Las mejoras de arquitectura cambian hasta qué punto el modelo recorre ese proceso, no en qué consiste el proceso.
Lo que puedes crear ahora mismo
No necesitas entrenar un modelo ni escribir una sola línea de código para poner todo esto en práctica. Cada modelo descrito arriba está disponible directamente en el navegador en PicassoIA, sin ninguna configuración.

Empieza escribiendo un prompt detallado y específico en Flux Pro y observa cómo el proceso de eliminación de ruido convierte tus palabras en una escena fotorrealista. Sube y baja la guidance scale para ver cuánto da forma el texto al resultado. Después cambia a Stable Diffusion XL con el mismo prompt y compara las diferencias estéticas entre dos modelos que comparten la misma arquitectura base pero la recorren de formas distintas.
Genera el mismo prompt dos veces con semillas distintas. Fíjate en lo diferentes que son los resultados, aunque el proceso subyacente sea idéntico. Esa variación no es un defecto. Es la naturaleza probabilística de la difusión haciendo exactamente lo que fue diseñada para hacer: avanzar del caos a la claridad, guiada por lo que pediste, por un camino que ninguna generación compartirá con otra.
Cada imagen que generas es un recorrido por el ruido. Ahora sabes exactamente qué ocurre en el camino.