Cómo funcionan los modelos de difusión sin censura: la mecánica real del arte de IA sin restricciones

Un desglose completo de la arquitectura de los modelos de difusión sin censura, desde la eliminación de ruido en el espacio latente y la codificación de texto con CLIP hasta la retirada de filtros de seguridad y cómo el ajuste fino NSFW cambia lo que pueden producir los generadores de imágenes de IA.

Cómo funcionan los modelos de difusión sin censura: la mecánica real del arte de IA sin restricciones
Cristian Da Conceicao
Fundador de Picasso IA

El momento en que un prompt de texto se convierte en una imagen fotorrealista, se ejecutan en secuencia miles de millones de operaciones matemáticas que transforman ruido aleatorio puro en información visual coherente, que coincide exactamente con lo que describiste. Los modelos de difusión sin censura hacen lo mismo, pero sin las barreras que la mayoría de las plataformas comerciales instalan por defecto. El resultado es una generación de imágenes por IA que responde a toda la gama de intención creativa humana, desde lo mundano hasta lo provocador. Entender cómo funciona no es solo curiosidad técnica: revela la arquitectura fundamental de la generación de imágenes por IA moderna y explica por qué algunos modelos producen resultados que otros simplemente no pueden alcanzar.

Qué significa realmente "sin censura" en la IA

La mayoría de la gente supone que quitar los filtros de seguridad de un modelo de difusión es un interruptor sencillo escondido en un archivo de configuración. La realidad es bastante más compleja, y también más interesante.

El verificador de seguridad por defecto

Las versiones estándar de Stable Diffusion incluyen un verificador de seguridad, un modelo de clasificación secundario que inspecciona cada imagen generada antes de que llegue a ti. Cuando detecta contenido que clasifica como inapropiado, sustituye la salida por una imagen negra. El verificador de seguridad no forma parte del modelo de difusión en sí; funciona como un filtro de posprocesado que se aplica una vez terminada la generación.

Quitarlo es tan sencillo como definir safety_checker=None en la configuración del pipeline. Pero eso por sí solo no convierte un modelo en "sin censura". Un modelo entrenado exclusivamente con conjuntos de datos limpios seguirá teniendo dificultades para generar contenido explícito o provocador de forma convincente, porque los datos de entrenamiento determinan lo que el modelo sabe representar. El filtro es la parte menos interesante de la restricción.

Los datos de entrenamiento son el filtro real

La capa de restricción más importante está en los datos de entrenamiento. Modelos como el Stable Diffusion original se entrenaron con LAION-5B, un enorme conjunto de datos extraído de la web y filtrado para eliminar el contenido explícitamente NSFW antes de empezar el entrenamiento. El modelo nunca vio ese material, así que tiene una capacidad limitada para generarlo con cierta constancia o calidad.

Los modelos realmente sin censura se ajustan finamente con conjuntos de datos que incluyen contenido para adultos, desnudo artístico e imágenes provocadoras junto con sus descripciones. Este proceso de ajuste fino modifica los pesos de la arquitectura U-Net para que el modelo construya una representación interna rica de la figura humana, de las condiciones de iluminación íntimas y de las composiciones provocadoras que los modelos filtrados simplemente no tienen. La diferencia de calidad entre un modelo base filtrado al que se le ha quitado el verificador de seguridad y un modelo sin censura bien ajustado es abismal.

Un retrato fotorrealista que representa la calidad de las figuras humanas generadas por IA

El proceso de difusión: del ruido a la imagen

Para entender por qué los datos de entrenamiento sin censura importan tanto, hay que ver paso a paso cómo los modelos de difusión generan imágenes.

Difusión directa e inversa

Los modelos de difusión se entrenan en un proceso de dos fases. En el proceso directo, al modelo se le muestran millones de imágenes reales y observa cómo se añade ruido gaussiano a cada una en pasos incrementales, hasta que la imagen original queda completamente oculta por la estática. El modelo observa esta destrucción en distintos niveles y etapas de ruido, y construye un mapa interno de lo que cada cantidad de ruido hace a los distintos conceptos visuales.

En el proceso inverso, el modelo se entrena para predecir y restar ese ruido, paso a paso, hasta que vuelve a surgir una imagen limpia. No es una tarea de memorización: el modelo construye una comprensión estadística de qué información visual es más probable que exista bajo cualquier estado de ruido dado, condicionada por el prompt de texto proporcionado.

Durante la inferencia, es decir, cuando generas una imagen, el modelo parte de ruido aleatorio puro y aplica el proceso inverso repetidamente. Cada paso de eliminación de ruido acerca un poco más la representación latente a una imagen coherente que coincide con tu prompt. Este es el bucle de eliminación de ruido, y se ejecuta tantas veces como pasos de muestreo configures, normalmente entre 20 y 50 en la mayoría de los modelos.

El espacio latente

Los modelos de difusión modernos no operan directamente sobre datos de píxeles. Trabajan en una representación comprimida llamada espacio latente, codificada y decodificada por un autoencoder variacional (VAE). Una imagen estándar de 512x512 píxeles se convierte en una representación latente mucho más pequeña de 64x64. Esta compresión hace que la generación sea mucho más rápida y permite que el proceso de eliminación de ruido capture la estructura semántica de alto nivel, la composición, la iluminación y la identidad del sujeto, en lugar de patrones de ruido a nivel de píxel.

El decodificador del VAE traduce después el latente final sin ruido de vuelta a una imagen de resolución completa. La calidad de este decodificador importa muchísimo para la salida fotorrealista, por eso los modelos ajustados finamente suelen incluir pesos de VAE personalizados junto con la U-Net. Un VAE entrenado con una gama más amplia de anatomía humana y tonos de piel producirá resultados más precisos y detallados que uno genérico, y esta es otra razón por la que el ajuste fino sin censura va más allá de los pesos de la U-Net.

Infraestructura de servidores GPU que impulsa la generación de imágenes por IA a gran escala

Cómo CLIP convierte las palabras en imágenes

El proceso de difusión explica cómo el ruido se convierte en imagen. Pero ¿cómo influye realmente tu prompt de texto en la imagen que se genera?

El codificador de texto CLIP

Stable Diffusion y sus derivados usan CLIP (Contrastive Language-Image Pretraining) como codificador de texto. CLIP se entrenó con cientos de millones de pares imagen-texto para crear un espacio de incrustación compartido, donde los conceptos parecidos, ya se expresen como palabras o como contenido visual, se agrupan numéricamente. El modelo aprendió que una fotografía de una mujer en la playa y la frase de texto "mujer en la playa" deben quedar cerca en ese espacio matemático.

Cuando escribes un prompt, CLIP lo convierte en un vector de números llamado incrustación de texto, que codifica el significado semántico de tu descripción. Esta incrustación se introduce en las capas de atención cruzada de la U-Net en cada paso de eliminación de ruido, orientando al modelo hacia los conceptos visuales que coinciden con tus palabras. Cuanto más rico y específico sea tu texto, con más precisión puede CLIP codificar tu intención y con más exactitud puede generarla la U-Net.

El ajuste fino sin censura suele incluir actualizaciones también del codificador de texto, no solo de la U-Net. Cuando un modelo ha estado expuesto a imágenes explícitas emparejadas con vocabulario descriptivo específico, el espacio de incrustación interno de CLIP se desplaza para colocar esos conceptos en posiciones más útiles respecto a las representaciones visuales que genera la U-Net. Esta alineación es lo que permite que los modelos sin censura respondan de forma fiable a prompts explícitos, en lugar de producir resultados vagos o anatómicamente incoherentes.

Guía sin clasificador

Uno de los parámetros más importantes de cualquier modelo de difusión es la escala CFG, también llamada escala de guía sin clasificador. Los valores CFG altos empujan al modelo a ajustarse más estrictamente al prompt en cada paso de eliminación de ruido, a costa de cierta naturalidad y variedad de la imagen. Los valores bajos permiten una desviación creativa mayor respecto al texto, lo que puede producir resultados más orgánicos, pero quizá no reproduzca los detalles concretos que pediste.

La guía sin clasificador funciona ejecutando el proceso de eliminación de ruido dos veces en cada paso: una con tu incrustación de texto (generación condicionada) y otra sin texto alguno (generación no condicionada). El modelo amplifica después la diferencia entre ambas salidas según el factor de la escala CFG, empujando el resultado un poco más en la dirección que señala tu texto.

En la generación sin censura, la escala CFG importa porque el modelo necesita suficiente guía para producir el contenido concreto que describes, sin estar tan rígidamente limitado que recurra a los patrones visuales "seguros" más representados en sus pesos base. Una escala CFG entre 5 y 9 suele dar el mejor equilibrio para contenido NSFW, según el modelo concreto y el muestreador.

Consejo de prompt: los prompts negativos son tan importantes como los positivos. Úsalos para suprimir la falta de nitidez, las extremidades de más y las distorsiones anatómicas, que son más comunes en modelos empujados hacia contenido en los límites de su distribución de entrenamiento.

Investigador analizando los parámetros de un modelo en su estación de trabajo

Modelos populares y su arquitectura

Las distintas arquitecturas de modelo abordan la generación sin censura de maneras diferentes. Así se comparan los más destacados.

SDXL y sus derivados

SDXL introdujo una arquitectura de dos etapas: un modelo base que genera un latente de baja resolución, seguido de un modelo refinador que añade detalle de alta frecuencia en una segunda pasada. El mayor número de parámetros (3.500 millones frente a los 860 millones de Stable Diffusion 1.5) da a SDXL una anatomía, una coherencia de iluminación y un control de composición muy superiores. Esa mayor capacidad es también lo que hace tan eficaz el ajuste fino de SDXL para contenido sin censura: hay simplemente más espacio en el modelo para representaciones matizadas.

SDXL Lightning es una versión destilada que logra una calidad comparable en solo 4 pasos de muestreo, lo que lo hace práctico para iterar rápido cuando pruebas composiciones y poses. La contrapartida es una adherencia algo menor a los detalles finos del prompt, pero en la mayoría de los casos la ganancia de velocidad compensa la pérdida de precisión.

Las versiones de la comunidad, como Dreamshaper XL Turbo, añaden entrenamiento adicional sobre la base de SDXL, lo que produce modelos rápidos y capaces de generar figuras humanas fotorrealistas en una amplia variedad de estilos.

ModeloArquitecturaPasos de muestreoIdeal para
SDXLUNet de doble etapa20-30Mucho detalle, escenas complejas
SDXL LightningSDXL destilado4-8Velocidad, iteración rápida
Dreamshaper XLSDXL con ajuste fino10-20Realismo estilizado
Realistic Vision v5.1Ajuste fino de SD 1.520-30Retratos fotorrealistas

Realistic Vision y Photon

Realistic Vision v5.1 sigue siendo uno de los modelos con resultados más fiables en fotografía humana fotorrealista. Se ajustó a fondo sobre conjuntos de datos de fotografía de alta calidad y produce textura de piel, detalle de mechones de cabello y un comportamiento de iluminación natural que muchos modelos más nuevos y grandes todavía tienen dificultades para igualar. Su tamaño relativamente pequeño (basado en SD 1.5) también significa tiempos de generación más rápidos en la mayoría de los equipos.

Luma Photon adopta un enfoque distinto, priorizando la adherencia al prompt y la precisión compositiva frente a la coherencia estilística. Destaca en escenas complejas con varios sujetos y en ángulos de cámara poco habituales, y demuestra cómo las mejoras de CLIP junto con el ajuste fino de la U-Net pueden cambiar mucho lo que un modelo prioriza durante la generación.

Retrato al aire libre con luz natural que representa la capacidad fotorrealista de la IA

Flux y la arquitectura DiT

Flux Schnell LoRA y Flux Pro Finetuned representan una ruptura fundamental con la arquitectura clásica de difusión U-Net. Flux usa un Transformador de Difusión (DiT), que sustituye las capas convolucionales de la U-Net por mecanismos de autoatención y atención cruzada en toda la red. El resultado es una adherencia al texto notablemente mejor, una anatomía más coherente en poses complejas y un manejo mejorado de las relaciones espaciales entre varios sujetos.

Las versiones LoRA son especialmente útiles para aplicaciones sin censura. LoRA (Low-Rank Adaptation) permite ajustes de pesos dirigidos sin reentrenar el modelo completo, de modo que la arquitectura base de Flux se mantiene intacta mientras pesos LoRA separados y ligeros añaden nuevas capacidades de generación. Varios LoRA pueden combinarse y ponderarse en el momento de la inferencia, lo que permite perfiles de generación muy personalizados que mezclan estilos y tipos de contenido distintos.

Cómo el ajuste fino crea modelos sin censura

El ajuste fino es el proceso que transforma de verdad un modelo base censurado en uno sin censura. Es más matizado que simplemente exponer al modelo a imágenes explícitas.

Qué ocurre durante el ajuste fino

Cuando un desarrollador ajusta finamente un modelo existente con contenido NSFW, ejecuta pasadas de entrenamiento adicionales con un conjunto de datos seleccionado de imágenes explícitas o provocadoras, cada una emparejada con descripciones de texto. Las actualizaciones de gradiente durante este proceso ajustan los pesos de la U-Net, sobre todo en las capas de atención cruzada donde las incrustaciones de texto interactúan con los mapas de características visuales, y construyen asociaciones más fuertes entre el vocabulario descriptivo y las representaciones visuales que el modelo debe generar.

El ajuste fino no borra las capacidades existentes del modelo. Superpone nuevas asociaciones a las ya existentes, por eso un ajuste fino sin censura bien ejecutado conserva la misma inteligencia compositiva, la misma sensibilidad a la luz y la misma gama estilística de su modelo base. En cambio, un ajuste fino mal ejecutado puede introducir artefactos, degradar la precisión anatómica o hacer que el modelo ignore partes del prompt que chocan con la distribución estrecha de sus datos de ajuste.

LoRA frente a ajuste fino completo

Hay dos enfoques dominantes para crear modelos sin censura, y cada uno implica contrapartidas distintas:

  • Ajuste fino completo: se actualizan todos los pesos del modelo en cada pasada de entrenamiento. Produce los resultados más integrados y con mejor coherencia anatómica, pero requiere una gran capacidad de GPU, días de entrenamiento y corre el riesgo de un "olvido catastrófico" de las capacidades del modelo base si no se gestiona con cuidado.
  • Ajuste fino LoRA: se insertan pequeñas matrices de descomposición de rango en capas de pesos específicas y solo esas matrices se actualizan durante el entrenamiento. Es mucho más barato de entrenar, fácil de compartir como archivos pequeños, compatible con la combinación en el momento de la inferencia y con un riesgo mínimo de degradar la calidad del modelo base.

La mayoría de los modelos sin censura disponibles públicamente son ajustes finos completos de bases SD 1.5 o SDXL, o pesos LoRA diseñados para aplicarse sobre modelos base Flux Schnell LoRA o SDXL.

Entorno de investigación académica que representa el desarrollo de modelos de IA

Métodos de muestreo y por qué importan

No todos los modelos de difusión usan el mismo algoritmo de muestreo, y la elección tiene un impacto medible en la calidad de la salida, sobre todo en el detalle anatómico fino.

Comparativa de muestreadores habituales

El muestreador determina cómo pasa el modelo del latente con ruido a la imagen limpia en cada paso de eliminación de ruido. Distintos muestreadores usan enfoques matemáticos diferentes para estimar la trayectoria óptima de eliminación de ruido.

MuestreadorVelocidadCalidadMejor uso
Euler AncestralRápidoBuenaBorradores rápidos, salidas estilizadas
DPM++ 2M KarrasMediaExcelenteCalidad de retrato, detalle de piel
DDIMRápidoModeradaResultados constantes y reproducibles
UniPCRápidoMuy buenaUso general, resultados equilibrados

DPM++ 2M Karras produce siempre la textura de piel más nítida y el renderizado de cabello más natural para sujetos humanos fotorrealistas. Es el muestreador preferido para la generación NSFW en modelos como Stable Diffusion 3.5 Large, donde la mayor capacidad del modelo se beneficia de una trayectoria de muestreo más precisa.

Pasos de muestreo y su efecto

Más pasos producen resultados más refinados, pero con rendimientos decrecientes a partir de cierto umbral. Para la mayoría de los modelos sin censura, el desglose práctico es el siguiente:

  • 10-15 pasos: calidad de vista previa rápida, adecuada para probar composiciones y poses antes de lanzar una generación completa
  • 20-30 pasos: calidad estándar para resultados finales, suficiente para la mayoría de los casos
  • 40-50 pasos: máxima extracción de detalle, vale la pena el tiempo extra para imágenes principales o contenido que se vaya a escalar

El número óptimo de pasos depende en gran medida del muestreador. Las versiones Lightning y Turbo usan destilación de coherencia durante el entrenamiento para producir resultados de alta calidad en 4-8 pasos, un número de pasos que produciría resultados borrosos e incoherentes con un muestreador estándar en un modelo sin destilar.

Figura elegante en una piscina infinita que representa una salida visual de IA de alta fidelidad

Cómo obtener resultados de calidad con modelos sin censura

Conocer la arquitectura es una cosa. Usarla para generar imágenes de alta calidad de forma constante exige un enfoque sistemático para escribir prompts.

Una estructura de prompt que funciona

Los prompts más eficaces para modelos sin censura siguen una estructura constante que imita cómo un encargo fotográfico describiría una sesión de fotos:

  1. Descripción del sujeto con atributos físicos concretos (color de pelo, complexión, tono de piel)
  2. Pose y acción con indicaciones de dirección claras ("sentada con las piernas cruzadas, mirando a la izquierda")
  3. Ropa o la falta de ella con detalles concretos de tejido y color
  4. Entorno y fondo con especificaciones de la fuente de luz
  5. Detalles de cámara y objetivo para anclar la estética fotográfica (85 mm f/1.4, a la altura de los ojos)
  6. Modificadores de calidad al final (8K fotorrealista, grano de película Kodak Portra 400)

La precisión lo es todo. "Una mujer hermosa en la playa" dará resultados mediocres, porque el modelo tiene demasiada libertad para rellenar los detalles con lo que sea estadísticamente medio en sus datos de entrenamiento. "Una mujer con pelo castaño rojizo y pecas claras, en bikini blanco, sentada con las piernas cruzadas sobre arena blanca a la hora dorada, fotografiada con objetivo de 85 mm f/1.4, iluminación lateral cálida desde la derecha, textura de arena fina en primer plano, grano de película Kodak Portra 400, 8K fotorrealista" produce un resultado mucho más constante y detallado.

Piensa en el prompt como un conjunto de restricciones que reduce progresivamente el espacio de muestras del modelo. Cada detalle concreto que añades elimina una clase de salidas posibles y empuja la generación hacia exactamente lo que describes.

Estudio creativo que representa el flujo de trabajo iterativo de creación de imágenes con IA

Prompts negativos que realmente ayudan

Para el contenido NSFW fotorrealista, los prompts negativos no son opcionales. Son la herramienta principal para eliminar los artefactos de generación más comunes:

  • deformed, ugly, bad anatomy, disfigured: evita errores estructurales en las figuras humanas
  • blurry, low resolution, jpeg artifacts, pixelated: mantiene la nitidez de la imagen
  • cartoon, illustration, painting, drawing, sketch: ancla el estilo fotorrealista
  • extra limbs, missing fingers, fused fingers, malformed hands: apunta a los fallos anatómicos más habituales
  • watermark, logo, text, signature: elimina las superposiciones no deseadas que aparecen con frecuencia

Al usar Realistic Vision v5.1 o Dreamshaper XL Turbo, añadir oversaturated, plastic skin, waxy, airbrushed al prompt negativo mejora aún más el realismo de la piel, al alejar al modelo del aspecto sobreprocesado que aparece cuando los datos de ajuste fino se inclinan hacia fotografía muy editada.

La semilla también merece atención. Cuando encuentres una generación que te guste, anota el valor de la semilla y reutilízalo con pequeñas variaciones del prompt para iterar de forma sistemática, en lugar de volver a generar desde cero cada vez. Es la forma más rápida de pasar de un buen resultado a uno excelente.

Fotografía de estilo de vida costero que representa los estándares de calidad de la salida de IA

Empieza a crear en PicassoIA

Los modelos de difusión, con o sin censura, solo son tan potentes como la plataforma que los pone en tus manos. PicassoIA te da acceso directo a todo el espectro de modelos de texto a imagen, desde los resultados fotorrealistas de Realistic Vision v5.1 hasta la precisión arquitectónica de Flux Pro Finetuned y la gama estilística de Dreamshaper XL Turbo. Controlas directamente los pasos de muestreo, la escala CFG, la semilla y los prompts negativos, lo que significa que puedes reproducir resultados exitosos e iterar de forma sistemática en lugar de esperar a que una generación salga bien por suerte.

La plataforma también ofrece Luma Photon para trabajos de composición complejos y SDXL Lightning para flujos de trabajo centrados en la velocidad, en los que quieres probar muchas ideas en poco tiempo. Todos los modelos descritos en este artículo son accesibles sin configuración, sin requisitos de hardware local y sin las horas de configuración que exigen los pipelines autoalojados.

Todo lo descrito en este artículo, desde la compresión en el espacio latente hasta las incrustaciones de texto de CLIP y el bucle de eliminación de ruido, ocurre cada vez que pulsas generar. La física del proceso de difusión no es teórica: se ejecuta en tiempo real en cada imagen que creas. Elige un modelo que encaje con lo que quieres producir, escribe un prompt específico y estructurado, fija tu escala CFG entre 6 y 8, añade tus prompts negativos y mira qué sale. El primer resultado rara vez es el definitivo, pero la segunda y la tercera iteración, guiadas por lo que el modelo te muestra, avanzan deprisa hacia exactamente lo que tenías en mente.

Galería de arte con imágenes generadas por IA que representa la variedad de resultados posibles

Compartir este artículo

Elige tu idioma