Cómo funcionan los generadores de IA NSFW por dentro

Una mirada por dentro a toda la pila tecnológica de los generadores de IA NSFW: cómo los modelos de difusión procesan los prompts, cómo funcionan los filtros de seguridad, qué hardware se usa y cómo modelos ajustados como Flux Dev producen personas fotorrealistas con un detalle asombroso.

Cómo funcionan los generadores de IA NSFW por dentro
Cristian Da Conceicao
Fundador de Picasso IA

Si alguna vez has escrito un prompt sugerente en un generador de IA y has visto cómo una imagen fotorrealista aparece en segundos, has sido testigo de una de las cadenas más complejas del aprendizaje automático moderno funcionando a toda velocidad. Detrás de ese indicador de carga pasa mucho más de lo que la mayoría imagina. El proceso implica compresión, matemáticas de ruido, modelos de lenguaje, aceleración por hardware y una maraña de decisiones de seguridad que varían muchísimo de una plataforma a otra.

Este artículo desglosa cada capa de esa cadena, desde el momento en que tu prompt llega al servidor hasta el último píxel que aparece en tu pantalla.

Qué es lo que realmente genera el resultado

El texto entra, los píxeles salen

La tecnología central de prácticamente todos los generadores de imágenes con IA actuales es un modelo de difusión latente. El término suena técnico, pero el concepto es sencillo: en lugar de trabajar directamente con imágenes de píxeles de tamaño completo (lo que requeriría muchísima memoria), el modelo opera en un espacio matemático comprimido llamado espacio latente. Las imágenes se codifican en una representación mucho más pequeña, se manipulan y después se decodifican de nuevo en píxeles visibles.

Los dos modelos que realizan ese trabajo de codificación y decodificación forman el VAE (Autoencoder Variacional). Comprime la imagen objetivo en números y luego la reconstruye. Esta compresión es la razón por la que las imágenes de IA pueden generarse en segundos y no en horas.

Un pasillo de centro de datos hipermoderno con racks de servidores iluminados que representan la infraestructura detrás de la generación de IA

El espacio latente del que nadie habla

El espacio latente no es solo un truco de almacenamiento. Es un sistema de coordenadas de alta dimensión en el que los conceptos parecidos se sitúan cerca unos de otros. El rostro de una mujer, el de un hombre y el de un gato no viven en puntos al azar. Se agrupan en regiones con sentido matemático. Por eso la IA puede mezclar conceptos sin costuras: pedir "una mujer con ojos felinos" funciona porque esos dos conceptos son adyacentes en el espacio latente.

El contenido NSFW también vive en ese espacio. No existe un "departamento NSFW" separado dentro del modelo. El contenido explícito y el no explícito existen como vectores en el mismo espacio continuo, separados solo por la distancia entre coordenadas. Cuando el filtro de seguridad de una plataforma se activa, en esencia está desviando el modelo de ciertas regiones de ese espacio.

Cómo funcionan realmente los modelos de difusión

Ruido dentro, imagen fuera

El proceso de generación empieza con ruido aleatorio puro, no con un lienzo en blanco. El modelo está entrenado para eliminar ese ruido gradualmente en una serie de pasos, guiado por tu prompt de texto. Cada paso predice con un poco más de claridad cómo debería ser la imagen final. Tras 20 a 50 de estos pasos (según el planificador y el modelo), emerge una imagen coherente.

Así se ve conceptualmente ese proceso:

Rango de pasosQué ocurre
Pasos 1-5Se forman la composición general y los bloques de color
Pasos 6-15Se definen las formas principales, los rostros y los cuerpos
Pasos 16-30Aparecen los detalles finos, la textura de la piel y los mechones de pelo
Pasos 30-50Afilado de altas frecuencias y coherencia final

El número de pasos es configurable. Más pasos suelen producir resultados más nítidos y coherentes, pero tardan más. Modelos como Flux Schnell están optimizados específicamente para ofrecer una calidad excelente en solo 4 pasos, lo que los hace bastante más rápidos que las arquitecturas anteriores.

Fotografía macro de primer plano de una placa de circuito de una GPU de gama alta, con pistas de cobre y chips de silicio, que representa el hardware de los modelos de difusión de IA

El papel de CLIP en los prompts

Tu prompt de texto no entra directamente en el proceso de difusión. Primero pasa por un codificador de texto, normalmente un modelo llamado CLIP (Contrastive Language-Image Pretraining) o una variante como T5. Este codificador convierte tus palabras en un embedding numérico, un vector que captura el significado semántico de tu prompt y lo sitúa en el mismo espacio de alta dimensión que los latentes de la imagen.

💡 Por eso la redacción del prompt importa tanto. "Mujer guapa en bikini en la playa" y "modelo de moda de baño en el mar" producirán embeddings distintos y, por tanto, imágenes distintas, aunque describan una escena parecida.

La guidance scale (a menudo llamada escala CFG) controla con qué fuerza el modelo obedece tu prompt. Un valor más alto obliga al modelo a seguir tu texto con más rigidez, a menudo a costa de la naturalidad. Un valor más bajo le da al modelo más libertad creativa, pero puede producir resultados que se desvían del prompt.

Filtros NSFW y cómo funcionan

Verificadores de seguridad en el momento del entrenamiento

El filtrado NSFW ocurre en dos etapas completamente distintas: durante el entrenamiento y durante la inferencia. El filtrado en el momento del entrenamiento tiene que ver con qué datos llega a ver alguna vez el modelo. Muchos modelos base, como las primeras versiones de Stable Diffusion, se entrenaron con LAION-5B, un conjunto de datos extraído de internet público que incluía contenido explícito. Esos modelos conservaron la capacidad de producir imágenes para adultos porque esa información quedó integrada en sus pesos.

Los modelos posteriores introdujeron el filtrado NSFW a nivel del conjunto de datos, eliminando el contenido explícito antes del entrenamiento. El resultado fue un modelo que, de verdad, no sabía producir contenido explícito, y no uno al que simplemente se le impedía hacerlo.

Sistemas de filtrado en tiempo de ejecución

El filtrado en tiempo de ejecución es la segunda línea de defensa. Es lo que la mayoría de los usuarios encuentra como una restricción a nivel de plataforma. Hay tres enfoques comunes:

  1. Clasificadores de prompts: Un modelo separado lee el texto de entrada y marca los prompts potencialmente inseguros antes de que empiece la generación.
  2. Clasificadores de salida: Una vez generada la imagen, un modelo de seguridad (como los clasificadores NSFW basados en CLIP) examina el resultado y bloquea la entrega si detecta contenido explícito.
  3. Borrado de conceptos: Algunas plataformas aplican técnicas que eliminan literalmente ciertos conceptos del espacio latente del modelo, haciendo imposible generarlos sin importar cómo esté redactado el prompt.

Un joven desarrollador frente a una estación de trabajo con dos monitores, en un estudio poco iluminado por la noche, trabajando en código de generación de imágenes con IA

Cómo difieren las plataformas en la aplicación de las normas

No todas las plataformas de imágenes con IA toman las mismas decisiones de filtrado, y esas decisiones moldean toda la experiencia del usuario.

Tipo de plataformaEnfoqueCapacidad de salida
Para consumidores (generales)Filtrado agresivo de prompts y resultadosSolo contenido apto para todos los públicos (SFW)
Plataformas para creadoresFiltrado selectivo, verificación de edadDesnudo artístico
Plataformas de IA para adultosFiltrado mínimo, modelos con ajuste finoCapaces de contenido explícito
Código abierto (local)Controlado por el usuarioSin restricciones

Las plataformas que permiten contenido NSFW de buen gusto o artístico, como la fotografía glamour y el desnudo sugerido, suelen usar la verificación de edad junto con clasificadores de resultados ajustados para bloquear solo el contenido más explícito y permitir todo lo que quede por debajo de ese umbral.

El hardware que hace todo el trabajo

Clústeres de GPU y costos de cómputo

Cada solicitud de generación de imágenes es un problema de multiplicación de matrices ejecutado a gran escala. El cálculo real ocurre en clústeres de GPU (unidades de procesamiento gráfico), porque las GPU están diseñadas específicamente para el cálculo paralelo que requieren los modelos de difusión. Una sola generación de imagen de alta resolución, de 1024x1024, puede requerir miles de millones de operaciones de coma flotante.

El hardware que ejecuta la mayoría de los generadores de IA alojados incluye:

  • GPU NVIDIA A100 o H100 para modelos premium de alta calidad
  • NVIDIA L40S para cargas de inferencia de gama media
  • AMD MI300X para un despliegue a escala con mejor relación costo-eficiencia

Ejecutar un modelo como Flux 1.1 Pro Ultra a escala cuesta dinero real por imagen, por eso la mayoría de las plataformas funcionan con modelos de créditos o de suscripción.

Un laboratorio moderno de investigación en IA, con científicos analizando diagramas de redes neuronales en una gran mesa táctil

Por qué importa la velocidad de inferencia

La velocidad no es solo un asunto de experiencia de usuario. Una inferencia más rápida significa un cómputo más barato por imagen, lo que afecta directamente a lo que una plataforma puede permitirse ofrecer gratis. Dos innovaciones han reducido drásticamente el tiempo de inferencia en los últimos años:

  • Modelos destilados: modelos entrenados para imitar a modelos más grandes con menos pasos. Flux Schnell y DreamShaper XL Turbo son ejemplos claros. Sacrifican una pequeña parte de la calidad a cambio de una generación 10 veces más rápida.
  • Cuantización: reducir la precisión numérica de los pesos del modelo (de float32 a int8 o menos) disminuye la huella de memoria y aumenta el rendimiento sin una pérdida de calidad visualmente significativa.

Los datos de entrenamiento y su papel en el estilo del resultado

Lo que aprendieron los modelos

El "estilo" de un generador de imágenes con IA es totalmente producto de aquello con lo que se entrenó. Los modelos base, como SDXL, se entrenaron con cientos de millones de imágenes emparejadas con descripciones, y absorbieron los patrones estadísticos de todo, desde la fotografía de archivo y las revistas de moda hasta el arte digital y los fotogramas de cine.

Por eso algunos modelos producen de forma natural una estética de foto de archivo, mientras que otros tienden hacia resultados artísticos o pictóricos. La composición del conjunto de datos de entrenamiento es el predictor más importante del estilo visual por defecto de un modelo.

💡 Si quieres iluminación cinematográfica y estéticas de fotografía de cine, los modelos entrenados intensamente con conjuntos de datos de fotografía de alta calidad darán mejores resultados que los entrenados con imágenes generales de internet.

Una mujer hermosa de cabello rubio platino fotografiada en perfil de tres cuartos con la luz dorada de última hora de la tarde, que representa la calidad de los retratos de IA de alta calidad

Cambiar el estilo con LoRA

LoRA (Low-Rank Adaptation) es una técnica de ajuste fino que permite a los creadores entrenar un pequeño conjunto de pesos adicionales sobre un modelo base, desplazando su salida hacia un aspecto o sujeto concreto. Los archivos LoRA suelen pesar solo unos cientos de megabytes, pero pueden alterar muchísimo el resultado de un modelo.

Para los modelos capaces de generar contenido NSFW, el ajuste fino con LoRA es especialmente potente:

  • Un "LoRA de retrato realista" desplaza el modelo hacia texturas de piel fotográficas e iluminación natural
  • Un "LoRA de fotografía de moda" empuja el resultado hacia estéticas editoriales de alto contraste
  • Un LoRA específico de un sujeto puede hacer que el modelo genere de forma coherente un rostro o un tipo de cuerpo concreto

El modelo p-image-lora de PicassoIA expone directamente esta capacidad de ajuste fino y te permite aplicar pesos LoRA a tus generaciones para estilos de salida muy concretos.

Modelos diseñados para imágenes realistas

En qué se diferencian los modelos ajustados

El modelo base de Stable Diffusion y sus sucesores se entrenaron con conjuntos de datos generales. Los modelos ajustados dan un paso más, continuando el entrenamiento con subconjuntos seleccionados y de alta calidad de estilos visuales concretos. Así surgen los modelos fotorrealistas que destacan con sujetos humanos.

Realistic Vision v5.1 es un buen ejemplo: se basa en la arquitectura SDXL, pero se ajustó de forma extensiva con conjuntos de datos fotográficos para producir sujetos humanos con textura de piel real, anatomía precisa e iluminación natural, algo con lo que los modelos base suelen tener problemas.

De forma similar, Flux Dev, de Black Forest Labs, representa una arquitectura de nueva generación que trata la generación de imágenes de manera distinta a los modelos anteriores basados en U-Net. Flux opera sobre el espacio de píxeles completo a la vez en lugar de procesarlo de forma jerárquica, lo que da como resultado una precisión anatómica notablemente mejor y un resultado fotorrealista constante.

Una mujer glamurosa de cabello rojo largo en una playa tropical con el océano turquesa detrás, que representa la capacidad fotorrealista de los modelos de IA modernos

Los mejores modelos para resultados fotorrealistas

Cuando se trata de sujetos humanos fotorrealistas con piel, cabello e iluminación naturales, varios modelos superan de forma constante a los demás:

ModeloArquitecturaIdeal para
Flux DevFlux TransformerFotorrealismo, precisión anatómica
Flux ProFlux TransformerResultados de calidad comercial
Flux 1.1 Pro UltraFlux TransformerResultados de ultra alta resolución
Realistic Vision v5.1Ajuste fino de SDXLEstilo de retrato fotográfico
Stable Diffusion 3.5 LargeMMDiTEquilibrio entre calidad y velocidad

Cómo usar Flux Dev en PicassoIA

Paso a paso: tu primera generación

Como Flux Dev es uno de los modelos con mejor rendimiento para sujetos humanos fotorrealistas, así se usa exactamente en PicassoIA:

  1. Abre la página del modelo a través del enlace a la colección de Flux Dev
  2. Escribe tu prompt con detalles específicos: sujeto, entorno, iluminación, ángulo de cámara y especificaciones de la lente
  3. Fija la relación de aspecto en 16:9 para planos cinematográficos amplios o en 1:1 para trabajos de retrato
  4. Ajusta la guidance scale entre 3,5 y 4,5 para Flux Dev (más baja de lo que usarías con SDXL)
  5. Fija los pasos entre 28 y 35 para obtener la mejor calidad
  6. Pulsa generar y espera entre 10 y 15 segundos a que tu imagen esté lista

Una mujer segura de sí misma, de cabello oscuro y rizado, en una terraza en la azotea a la hora dorada, usando una tableta para crear imágenes generadas por IA

Consejos para mejores prompts

La calidad de tu resultado depende directamente de lo específico que sea tu prompt. Los prompts vagos producen resultados genéricos. Los prompts específicos producen resultados notables.

Prompt débil: beautiful woman at the beach

Prompt fuerte: close-up portrait of a woman with sun-kissed skin and loose dark waves, lying on white sand at a tropical beach, afternoon rim light creating a warm halo on her hair, 85mm f/1.4 lens, natural skin texture, Kodak Portra 400 film grain

Otros consejos que mejoran el resultado de forma constante:

  • Incluye la dirección de la luz: "luz volumétrica de la mañana desde la izquierda" o "contraluz de última hora de la tarde"
  • Especifica la cámara y la lente: "85 mm f/1.4", "gran angular de 35 mm", "macro de 100 mm"
  • Añade la película: "Kodak Portra 400", "Fuji Superia 400", "Kodak Gold 200"
  • Describe la textura de la piel: "poros naturales visibles", "piel cálida y luminosa", "marcas sutiles de bronceado"
  • Define la atmósfera: "íntima", "editorial", "fotografía de glamour", "editorial de moda"

💡 Flux Dev responde excepcionalmente bien a las descripciones de cámara e iluminación. Incluir especificaciones de lente y referencias a películas en tu prompt produce de forma constante un resultado más fotográfico y menos artificial.

Una mujer elegante de cabello oscuro y piel bronceada reclinada sobre una tumbona de lino crema junto a ventanales altos, con la luz suave de la mañana

El recorrido del prompt al píxel, resumido

Cuando pulsas "generar", esto es cada paso que ocurre en milisegundos detrás de escena:

  1. Tokenización: tu texto se divide en tokens y se pasa a un codificador CLIP o T5
  2. Embedding: el codificador convierte los tokens en vectores numéricos que representan el significado semántico
  3. Inicialización del ruido: se crea un tensor de ruido aleatorio en el espacio latente
  4. Bucle de eliminación de ruido: entre 20 y 50 iteraciones de eliminación de ruido guiada, cada paso moldeado por tus embeddings de texto
  5. Decodificación VAE: el tensor latente final se decodifica de nuevo al espacio de píxeles
  6. Comprobación de seguridad: un clasificador de salida examina el resultado en busca de infracciones de las normas
  7. Entrega: la imagen de píxeles se comprime y se envía a tu pantalla

Todo el proceso se ejecuta en hardware GPU y puede completarse en 3 a 15 segundos, según el modelo y la infraestructura.

Vista aérea cenital de un teléfono que muestra la interfaz de generación de imágenes con IA junto a una libreta con prompts creativos sobre mármol blanco

Crea tus propias imágenes en PicassoIA

Ahora que sabes exactamente qué funciona bajo el capó, estás en una posición mucho mejor para usar estas herramientas con intención. La diferencia entre una imagen de IA mediocre y una realmente espectacular no es cuestión de suerte. Consiste en saber qué modelo maneja mejor tu sujeto, cómo escribir un prompt que sitúe el espacio latente exactamente donde quieres y cómo responde el proceso de eliminación de ruido a tus ajustes de guidance.

PicassoIA te da acceso a la gama completa de estos modelos en un solo lugar, desde Flux Dev y Flux Pro hasta Realistic Vision v5.1 y Stable Diffusion 3.5 Large. Tanto si creas fotografía de glamour, retratos artísticos o imágenes editoriales de moda, los modelos están disponibles y la cadena funciona rápido.

Elige un modelo, escribe un prompt específico y mira lo que produce el espacio latente.

Compartir este artículo

Elige tu idioma