Pasa algo curioso cuando escribes "a red fox sitting in autumn leaves" en un generador de imágenes con IA y, 10 segundos después, aparece una imagen con calidad de fotografía que parece tomada con una Canon R5. No hubo ninguna cámara real. Ningún fotógrafo compuso la toma. Una máquina construyó esa imagen a partir de números.
Ese proceso no es magia. Es una cadena sorprendentemente elegante de matemáticas, probabilidad y reconocimiento de patrones que tardó décadas de investigación en volverse práctica. Aquí tienes exactamente cómo funciona, capa por capa.
Qué ocurre en el momento en que escribes un prompt
Tus palabras se convierten en números
Antes de generar cualquier imagen, el modelo tiene que hacer algo para lo que fue entrenado con enorme precisión: interpretar lo que significan tus palabras, no como lenguaje, sino como una posición en un espacio matemático.
Cuando escribes "a red fox in autumn leaves", tu texto pasa por un componente llamado codificador de texto. El más común se llama CLIP (Contrastive Language-Image Pretraining), desarrollado por OpenAI. CLIP se entrenó con cientos de millones de pares imagen-texto de internet, aprendiendo a asociar el significado de las frases con el contenido visual de las fotos.
El resultado es un embedding de texto: una lista de cientos o miles de números que codifican el significado semántico de tu prompt. Piensa en ello como coordenadas GPS, pero en lugar de latitud y longitud, estás ubicando un concepto dentro de un espacio de 768 o 1024 dimensiones.
💡 Por eso importa cómo escribes el prompt. "A fox" y "a cunning fox with amber eyes" caen en posiciones distintas de ese espacio, y esa diferencia cambia lo que construye el generador.

Esos números navegan por el espacio latente
El modelo no trabaja con las imágenes tal como tú las ves. Trabaja en lo que se llama espacio latente: una representación matemática comprimida de las imágenes, donde los visuales parecidos se agrupan.
En el espacio latente, "a forest at dawn" y "a forest at dusk" son vecinos cercanos. "A beach" y "a mountain" están muy separados. El embedding de texto que generaste se convierte en un objetivo: una ubicación en este espacio a la que el modelo intentará llegar.
Esta compresión es lo que hace que los generadores de imágenes actuales sean rápidos. Trabajar en el espacio de píxeles completo implicaría operar con millones de valores a la vez. Trabajar en el espacio latente significa operar con miles de valores comprimidos y, al final, decodificar el resultado de vuelta a la resolución completa. Ese paso de decodificación lo realiza un componente llamado VAE (Variational Autoencoder).
Modelos de difusión: el motor real
Empezar con ruido puro
Aquí está la parte contraintuitiva. El proceso de generación no parte de tu prompt para construir una imagen desde cero. Parte de ruido aleatorio, el equivalente visual a la interferencia de un televisor viejo, y desde ahí trabaja hacia atrás.
Durante el entrenamiento, el modelo vio millones de imágenes reales. Para cada una, observó cómo los investigadores añadían ruido de forma progresiva, paso a paso, hasta que la imagen se convertía en interferencia totalmente irreconocible. Después, el modelo aprendió a hacer lo contrario: dada una imagen con ruido y la descripción original en texto, ¿puede predecir cómo era la versión con menos ruido?
Tras entrenar con miles de millones de ejemplos así, el modelo se vuelve extraordinariamente bueno en esta operación inversa. No memoriza imágenes concretas. Absorbe los patrones estadísticos de cómo se relacionan entre sí los objetos, las texturas, la luz y las superficies.

Eliminar el ruido paso a paso
Cuando pulsas "generate", la secuencia es la siguiente:
- El modelo empieza con un tensor de ruido completamente aleatorio (una cuadrícula de números al azar)
- Pasa el ruido por la red de eliminación de ruido, que predice cómo debería verse una versión un poco menos ruidosa
- Aplica esa predicción para obtener la versión ligeramente más limpia
- Repite este proceso de 20 a 50 veces (estos son tus pasos de muestreo)
- Por último, decodifica el resultado del espacio latente de vuelta al espacio de píxeles
En cada pasada, la imagen se vuelve más clara y coherente. Primero aparece la estructura (formas generales, composición) y después llega el detalle (texturas, rostros, bordes finos) en los pasos posteriores.
💡 Más pasos suele significar más calidad, pero con rendimientos decrecientes. Pasar de 20 a 40 pasos a menudo marca una diferencia visible. Pasar de 40 a 80 rara vez la marca, y tarda el doble.
Por qué supera a los enfoques anteriores
Antes de que los modelos de difusión se impusieran hacia 2022, el enfoque dominante eran las GAN (Generative Adversarial Networks). Las GAN enfrentan dos redes: un generador que intenta crear imágenes convincentes y un discriminador que intenta detectar falsificaciones. El ciclo de retroalimentación entre ambas mejora poco a poco la calidad del resultado.
Las GAN son rápidas e impresionantes, pero notoriamente inestables de entrenar, propensas al "colapso de modo" (cuando el generador se queda atascado produciendo resultados muy parecidos) y difíciles de escalar a alta resolución y temas diversos.
Los modelos de difusión son más lentos por imagen, pero más estables de entrenar, producen resultados mucho más variados y responden mucho mejor al condicionamiento por texto. La contrapartida merece la pena: por eso todos los grandes generadores de imágenes actuales usan la difusión como mecanismo central.
Cómo aprendió el modelo a ver

Miles de millones de pares imagen-texto
El factor más importante en lo que un modelo puede generar son sus datos de entrenamiento. Modelos como PicassoIA Image y GPT Image 2 se entrenan con conjuntos de datos que contienen de cientos de millones a miles de millones de pares imagen-texto extraídos de la web, bibliotecas de fotos de stock con licencia y colecciones curadas.
Para cada imagen, los datos de entrenamiento incluyen un pie que describe lo que aparece en ella. "Mujer paseando a un golden retriever por un parque en un día soleado." "Primer plano de una taza de café con arte latte." "Vista aérea de Manhattan de noche."
El modelo nunca memoriza estas imágenes. En cambio, extrae relaciones estadísticas: qué patrones visuales tienden a aparecer juntos, cómo se comporta la luz en distintas superficies, cómo suelen verse los rostros humanos desde diferentes ángulos, en qué se diferencia la textura del pelaje de la del tejido.
| Escala del conjunto de datos de entrenamiento | Número aproximado de imágenes | Modelos de ejemplo |
|---|
| Pequeño y curado | 100K a 1M | Primeros LoRA de Stable Diffusion |
| Mediano extraído de la web | 100M a 500M | SDXL, primeras variantes de Flux |
| Grande y propietario | 1B+ | GPT Image 2, Seedream 4.5 |
CLIP: el puente entre palabras y píxeles
CLIP merece una explicación propia porque es el componente que conecta el lenguaje con los patrones visuales. CLIP se entrenó con un objetivo concreto: dado un lote de imágenes y un lote de pies, emparejar cada imagen con su pie correcto. Si haces esto con cientos de millones de ejemplos, acabas con un modelo que comprende a fondo la relación entre el contenido visual y el lenguaje que lo describe.
Por eso puedes escribir "impressionist painting of a harbor at sunset" y el modelo maneja no solo "harbor" y "sunset", sino también el contexto estilístico y emocional de "impressionist". Ha visto miles de cuadros de Monet con pies que mencionan el impresionismo.
💡 CLIP también es la razón por la que funcionan los prompts negativos. Decirle al modelo "no blurry backgrounds" desplaza el embedding objetivo lejos de las zonas del espacio latente asociadas con el desenfoque.
Lo que almacena realmente la red neuronal
El modelo no guarda un catálogo de imágenes. Almacena pesos: miles de millones de números de coma flotante que codifican los patrones estadísticos aprendidos durante el entrenamiento. Estos pesos viven en la arquitectura U-Net, una red neuronal con forma de letra U, con una ruta de codificación que comprime la información y una ruta de decodificación que la vuelve a expandir, y con conexiones de salto que unen ambos lados.
El número de parámetros (pesos) de los modelos actuales cuenta una historia:
- Stable Diffusion 1.x: ~860 millones de parámetros
- SDXL: ~6.600 millones de parámetros
- Flux dev: ~12.000 millones de parámetros
Más parámetros suele significar más capacidad para representar relaciones visuales complejas, mejor coherencia y un seguimiento más fiel de las instrucciones.
La arquitectura dentro de la caja negra
U-Net y el mecanismo de atención
La U-Net que está en el corazón de un modelo de difusión es la que realiza la eliminación de ruido. Toma un latente con ruido, lo examina y predice el ruido que se añadió, para que el sistema pueda restarlo.
Dentro de la U-Net hay capas de atención: operaciones matemáticas que permiten que cada parte de la imagen observe a todas las demás y, al mismo tiempo, el embedding de texto. Así es como el modelo garantiza la coherencia: asegura que la cola del zorro esté unida a su cuerpo, que la fuente de luz sea coherente en toda la imagen y que las hojas de otoño rodeen de verdad al zorro en lugar de flotar en posiciones aleatorias.
Arquitecturas más nuevas como el Diffusion Transformer (DiT), usado en modelos como Flux 2 Klein 9B y Seedream 4.5, sustituyen la U-Net tradicional por bloques de transformador en todo el modelo, lo que mejora de forma notable la coherencia a largo alcance y el seguimiento del prompt.

Cómo el condicionamiento hace que las imágenes coincidan con los prompts
La red de eliminación de ruido no trabaja aislada. En cada paso, está condicionada por dos cosas:
- El embedding de texto de tu prompt (la salida de CLIP o de T5)
- El nivel de ruido actual (en qué paso del proceso te encuentras)
Este condicionamiento se aplica mediante atención cruzada, donde las capas de atención de la red que predice el ruido observan el embedding de texto junto con las características de la imagen en cada capa. El resultado es que cada paso de eliminación de ruido se guía por lo que pediste.
Así es también como funcionan los prompts negativos. La mayoría de las implementaciones ejecutan dos pasadas paralelas por la red: una condicionada por tu prompt positivo y otra por el prompt negativo. La predicción final se acerca al positivo y se aleja del negativo.
Escala CFG: el dial de la creatividad
La escala CFG (Classifier-Free Guidance) es el control deslizante que probablemente hayas visto en las interfaces de generación. Controla con qué fuerza el modelo se ajusta a tu prompt frente a generar con libertad.
- CFG bajo (1 a 3): El modelo genera con libertad, a menudo con resultados vivos y sorprendentes, pero omitiendo partes de tu prompt
- CFG medio (5 a 9): El punto dulce para la mayoría de las generaciones, con seguimiento del prompt y variedad natural
- CFG alto (12 o más): Seguimiento muy literal del prompt, que suele producir resultados sobresaturados y llenos de artefactos
La matemática: en cada paso, el modelo calcula la predicción final como la predicción no condicionada más la escala CFG multiplicada por la diferencia entre la predicción condicionada y la no condicionada. Un CFG de 1 significa que no hay amplificación de la guía. Un CFG de 7 significa que la influencia del prompt se amplifica siete veces con respecto a la base.
Por qué la calidad de la imagen varía tanto
Pasos de muestreo y velocidad frente a calidad

El eliminador de ruido funciona en bucle, y cada pasada se llama paso de muestreo. Los distintos muestreadores (también llamados planificadores) determinan cómo se elimina el ruido en cada paso. Entre los más comunes están:
| Muestreador | Velocidad | Ideal para |
|---|
| Euler | Rápido | Borradores rápidos, resultados constantes |
| DPM++ 2M | Rápido | Resultados de alta calidad, con menos pasos |
| DDIM | Moderado | Resultados reproducibles, flujos de trabajo de animación |
| Heun | Más lento | Mayor precisión por paso |
Los muestreadores modernos como DPM++ pueden dar resultados excelentes en 20 pasos. Algunos modelos, como Wan 2.7 Image Pro, están entrenados para funcionar en 4 a 8 pasos, lo que logra mejoras de velocidad notables sin sacrificar el fotorrealismo.
Números de semilla y reproducibilidad
Cada generación parte de un tensor de ruido aleatorio concreto. La semilla es el número que se usa para generar ese tensor. Dos generaciones con prompts idénticos, ajustes idénticos y semillas idénticas producirán imágenes idénticas.
Así es como fijas una composición que te gusta y la iteras. Cambiar el prompt manteniendo la semilla suele producir variaciones que conservan la misma disposición básica y la misma iluminación, con contenidos distintos llenando la escena. Es una de las herramientas más potentes, y menos usadas, del kit de cualquier escritor de prompts.
Resolución, relación de aspecto y memoria
La mayoría de los modelos de difusión se entrenaron con una resolución concreta (normalmente 512x512 o 1024x1024). Generar en otras resoluciones o relaciones de aspecto exige un ajuste fino con datos de múltiples resoluciones o usar enfoques de mosaico y escalado.
Modelos como Hunyuan Image 2.1 y Seedream 4.5 admiten de forma nativa resoluciones de 2K y 4K, porque se entrenaron con datos de alta resolución desde el principio. Generar en 4K requiere bastante más memoria de GPU (VRAM), ya que la representación latente escala con la resolución de salida.
Modelos populares y en qué se diferencia cada uno

No todos los generadores de imágenes usan los mismos pesos ni la misma arquitectura. Así se diferencian los principales y cuándo conviene recurrir a cada uno:
Flux: el gigante de código abierto
Flux Redux Dev y Flux 2 Klein 9B se basan en la arquitectura Flux de Black Forest Labs, que sustituyó la U-Net tradicional por un Diffusion Transformer completo. El resultado es que el texto dentro de las imágenes se genera notablemente mejor, con una anatomía más precisa y un seguimiento del prompt más sólido que en los modelos de difusión anteriores. Flux destaca en fotorrealismo y en escenas complejas con varios sujetos.
GPT Image 2: el seguidor de instrucciones
GPT Image 2 integra el modelo de lenguaje de OpenAI directamente en la generación de imágenes, lo que le da una capacidad de seguimiento de instrucciones inusualmente fuerte. Puedes describir escenarios complejos con varias relaciones espaciales ("pon la taza de café a la izquierda del equipo portátil y muestra la hoja de cálculo en pantalla") y normalmente acierta. Es el líder actual en precisión de prompts.
Seedream y Hunyuan: los nuevos aspirantes
Seedream 4.5, de ByteDance, y Hunyuan Image 2.1, de Tencent, representan la nueva generación de transformadores de difusión de alta resolución. Ambos producen salidas de 2K a 4K de forma nativa, con una excelente textura de piel, detalle fino e iluminación fotorrealista. Seedream tiene un rendimiento especialmente bueno en fotografía de retrato y en imágenes de moda.
ControlNet: cuando necesitas un control preciso
Mapas de pose, profundidad y bordes
La generación estándar de texto a imagen es probabilística: describes lo que quieres, pero no controlas la composición con precisión. ControlNet cambia eso al añadir un condicionamiento estructural sobre el prompt de texto.
ControlNet toma una imagen de referencia y extrae información estructural específica:
- Mapas de pose: Posiciones de las articulaciones del esqueleto de un cuerpo humano, para que puedas dictar exactamente cómo está de pie o sentada una persona
- Mapas de profundidad: La distancia espacial de cada parte de la escena, que conserva la estructura 3D de la imagen original
- Mapas de bordes (Canny): Los contornos de los objetos, para reutilizar una composición con contenido distinto
- Mapas de segmentación: Etiquetas de regiones a nivel de píxel que indican qué hay en cada zona de la imagen
Estilo frente a estructura
Introduces el mapa estructural junto con tu prompt de texto, y el modelo genera una imagen que respeta ambos. Así es como los creadores profesionales mantienen poses de personaje coherentes en una serie, o reutilizan una composición de fondo con una iluminación y un tema completamente distintos.
La combinación de ControlNet con modelos como PicassoIA Image Editor Pro te da precisión estructural y una salida fotorrealista de alta fidelidad al mismo tiempo, algo que antes requería un fotógrafo profesional y un estudio reservado.
Empieza a crear tus propias imágenes

Toda esta tecnología es accesible sin escribir una sola línea de código. En PicassoIA puedes experimentar con todos los modelos de los que trata este artículo, incluido GPT Image 2 para prompts de máxima precisión, Flux Redux Dev para resultados fotorrealistas y Seedream 4.5 para la fotografía de retrato en 4K. Todo desde una pestaña del navegador, sin ninguna configuración previa.
La mejor forma de entender a fondo cómo funcionan estos modelos es ponerlos a prueba tú mismo. Prueba el mismo prompt en Flux y en GPT Image 2 y compara cómo maneja cada uno una descripción espacial compleja. Prueba escalas CFG de 3 frente a 12 con la misma semilla. Prueba 10 pasos de muestreo frente a 40 y observa en qué punto deja de notarse la diferencia.

El resultado que obtienes no es suerte aleatoria. Es el fruto de miles de millones de patrones estadísticos aprendidos, guiados por tus palabras, que convergen a lo largo de decenas de pasos de eliminación de ruido en algo que parece capturado por una cámara. Ahora que conoces el mecanismo, puedes empezar a usarlo con intención.