Stable Diffusion 3.5: características y cómo usarlo

Stable Diffusion 3.5 de Stability AI supone un avance importante en la síntesis de imágenes de código abierto. Tres variantes distintas, Large, Medium y Large Turbo, ofrecen resultados fotorrealistas, una tipografía muy mejorada y una arquitectura Multimodal Diffusion Transformer que cambia la forma en que los prompts interactúan con la generación. En el artículo encontrarás comparativas de versiones, consejos prácticos para escribir prompts y instrucciones paso a paso para empezar a generar imágenes con SD 3.5 en PicassoIA.

Stable Diffusion 3.5: características y cómo usarlo
Cristian Da Conceicao
Fundador de Picasso IA

Stable Diffusion lleva años siendo el motor de la generación de imágenes de código abierto. Pero el lanzamiento de Stable Diffusion 3.5 de Stability AI cambió la conversación por completo. No es un parche incremental ni un simple lavado de cara de marketing. SD 3.5 trae una arquitectura fundamentalmente distinta, tres variantes de modelo con fortalezas realmente diferentes y un nivel de fotorrealismo que cierra la brecha con los modelos comerciales de código cerrado. Si esperabas a que la generación de imágenes con IA de código abierto alcanzara a las mejores herramientas propietarias, este es el momento.

Qué es realmente SD 3.5

Manos escribiendo en un teclado mecánico con una interfaz de generación de imágenes con IA visible en el monitor, desenfocada al fondo

Stable Diffusion 3.5 es una familia de modelos de texto a imagen publicada por Stability AI en octubre de 2024. El término "familia" importa aquí. A diferencia de lanzamientos anteriores, que llegaban como un único modelo, SD 3.5 viene en tres configuraciones pensadas para distintos equipos y casos de uso. La base común es la arquitectura Multimodal Diffusion Transformer, o MMDiT-X, que procesa los tokens de texto e imagen juntos en lugar de por separado.

Este procesamiento conjunto es lo que separa a SD 3.5 de los enfoques de difusión anteriores. En modelos como SD 1.5 o SDXL, el codificador de texto producía un embedding, y la U-Net lo consultaba en distintas etapas. En MMDiT-X, los tokens de texto y los visuales interactúan a través de las mismas capas de atención al mismo tiempo. El resultado es un modelo que responde de forma más directa al lenguaje del prompt, maneja mejor los prompts complejos con varios sujetos y genera texto dentro de las imágenes con mucha más precisión.

De SD 1.x a SD 3.5

La evolución de los modelos Stable Diffusion cuenta una historia clara. SD 1.5 trajo la generación de código abierto al alcance de todos, pero tenía problemas con la anatomía coherente y los prompts complejos. SDXL mejoró notablemente la resolución y el detalle, y sentó las bases de decenas de ajustes finos. SD 3 introdujo el backbone DiT (Diffusion Transformer). SD 3.5 refina ese backbone con la variante MMDiT-X, mejora la calidad de los datos de entrenamiento y lanza modelos que compiten de verdad con los resultados de GPT-Image y Midjourney.

El salto de SDXL a SD 3.5 es mayor que el salto de SD 1.5 a SDXL. Conviene dejarlo claro, porque afecta a qué ajustes finos, LoRA y flujos de trabajo merece la pena construir de cara al futuro.

Las tres variantes del modelo

SD 3.5 no llega como un solo modelo. Llega como tres:

ModeloParámetrosIdeal para
SD 3.5 Large8BMáxima calidad, prompts complejos
SD 3.5 Large Turbo8B (destilado)Generación rápida, calidad cercana a Large
SD 3.5 Medium2.5BGPU de consumo, ideal para ajuste fino

La variante Medium es la que más probablemente acabe convirtiéndose, con el tiempo, en modelos especializados mediante ajuste fino, ya que cabe sin problemas en una tarjeta de 10 GB de VRAM. Las variantes Large necesitan hardware más potente, pero ofrecen resultados notablemente mejores en escenas complejas.

Las características de SD 3.5 que importan

Retrato fotorrealista de una joven con ojos oscuros y pelo castaño, luz dorada de la hora mágica desde la derecha, fondo con bokeh de 85 mm f/1.8

No todas las características que se anuncian en un modelo nuevo tienen un efecto real en la práctica. Estas sí lo tienen.

Tipografía que de verdad funciona

Los modelos de difusión anteriores trataban el texto dentro de las imágenes como un problema de textura. Podían aproximar las formas de las letras, pero deformaban siempre las palabras a partir de unos pocos caracteres. SD 3.5 trata la generación de texto como parte de su competencia central, y no como algo secundario.

La arquitectura MMDiT-X procesa los tokens de texto del prompt al mismo nivel de atención que los tokens espaciales, lo que significa que el modelo tiene una representación interna mucho mejor de cómo deben ser las letras y de dónde deben aparecer. En la práctica, puedes pedirle a SD 3.5 Large que incluya un cartel, una etiqueta o una tarjeta de título con una frase corta y obtener resultados legibles en la primera generación. Solo por esto se abren casos de uso comerciales importantes que antes eran poco prácticos con modelos de código abierto.

Fotorrealismo mejorado

Fotografía aérea con dron de un valle de montaña con niebla al amanecer, niebla volumétrica de la mañana, río sinuoso que refleja el cielo naranja y rosa, paisaje fotorrealista en 8K

El fotorrealismo en la generación de imágenes es una cualidad específica. No es solo nitidez ni resolución. Es la forma en que la luz se comporta sobre las superficies, los cambios sutiles de color en las sombras, la microtextura de la piel y la tela, y la profundidad coherente que sugieren los planos desenfocados. SD 3.5 Large maneja todo esto claramente mejor que SDXL.

El modelo se entrenó con un conjunto de datos curado de alta calidad, y la mejora se ve en las comparativas. Los retratos muestran la piel con detalle hasta el nivel del poro. Las fotos de arquitectura tienen una perspectiva correcta, sin artefactos de distorsión. Las imágenes de producto muestran propiedades de material coherentes en todo el encuadre. Para quienes dependían de ajustes finos especializados como RealVisXL v3.0 Turbo para obtener resultados fotorrealistas con SDXL, el modelo base SD 3.5 Large parte de un nivel mucho más alto.

La arquitectura MMDiT-X

Los fundamentos técnicos merecen un breve vistazo, incluso si no vas a construir modelos tú mismo. Los modelos de difusión tradicionales basados en U-Net codifican la información espacial de forma jerárquica. El Multimodal Diffusion Transformer, en cambio, usa capas de atención que permiten que los parches de texto e imagen se influyan mutuamente de manera equilibrada durante todo el proceso de eliminación de ruido.

Esto tiene dos efectos prácticos. Primero, el modelo mantiene una coherencia mucho más sólida entre lo que se describe y lo que se genera, sobre todo en escenas con varios objetos. Si pides "una bolsa roja a la izquierda y una bolsa azul a la derecha", es mucho menos probable que el modelo confunda las posiciones o los colores. Segundo, el modelo maneja mejor las estructuras de prompt inusuales o complejas, como las posiciones relativas, las descripciones en capas y los conceptos negados, con mucha más fiabilidad.

Large frente a Medium frente a Turbo

Plano general de un moderno laboratorio de investigación de IA de noche, investigadores en estaciones de trabajo iluminadas con visualizaciones de datos de colores, gran pantalla digital, fotografía corporativa fotorrealista

Elegir la variante adecuada es más una decisión práctica que teórica.

Qué versión elegir

SD 3.5 Large es el modelo de referencia en calidad. Úsalo cuando la calidad de generación sea la prioridad y el tiempo de cómputo no sea un límite. Produce el detalle más nítido, la mejor adherencia al prompt y el render de texto más fiable.

SD 3.5 Large Turbo está destilado a partir del modelo Large mediante entrenamiento adversarial. Puede producir imágenes de alta calidad en cuatro a ocho pasos, en lugar de veinte a treinta. La diferencia de calidad con el modelo Large completo se aprecia al inspeccionar de cerca, pero es mínima en la mayoría de resultados prácticos. Úsalo cuando necesites iterar más rápido sin bajar al nivel Medium.

SD 3.5 Medium es el objetivo para el ajuste fino. Sus 2.500 millones de parámetros significan que puede entrenarse en hardware de consumo, lo que ya ha dado lugar a una oleada de ajustes finos de la comunidad orientados a estilos, rostros y categorías de producto concretos. En prompts complejos ofrece una calidad notablemente inferior a las variantes Large, pero en tareas especializadas y concretas, un Medium bien entrenado puede superar al modelo Large base.

Velocidad frente a calidad: las contrapartidas

💡 Recomendación práctica: Para resultados finales de producción, usa SD 3.5 Large. Para prototipar rápido o cuando necesites docenas de variaciones, usa Large Turbo. Para modelos especializados con ajuste fino en hardware limitado, usa Medium.

El número de pasos importa mucho con estos modelos. Ejecutar SD 3.5 Large con 20 pasos produce un resultado claramente mejor que con 10. A diferencia de algunos modelos anteriores, en los que la curva de calidad se aplana rápido, SD 3.5 se beneficia del rango completo de pasos recomendado cuando el objetivo es el máximo detalle.

Cómo escribir mejores prompts para SD 3.5

Fotografía de moda de una mujer segura de sí misma con un blazer crema a medida en una calle de la ciudad bañada por el sol, bokeh de fondo de 85 mm f/1.8, iluminación natural de fotografía callejera

SD 3.5 procesa los prompts de forma distinta a los modelos basados en U-Net. Las estrategias que funcionaban bien con SD 1.5 y SDXL se mantienen en parte, pero la nueva arquitectura premia otros hábitos.

Una estructura de prompt que funciona

SD 3.5 responde bien a descripciones en lenguaje natural, en lugar de las listas de etiquetas separadas por comas que dominaban el uso de SDXL. Puedes escribir una frase como "a woman standing in a sunlit kitchen, looking out a window, photorealistic, morning light from the left" y obtener resultados coherentes.

Dicho esto, los modificadores de calidad siguen ayudando. Estos términos mejoran la calidad del resultado de forma fiable:

  • photorealistic, hyperrealistic, 8K
  • iluminación cinematográfica, luz volumétrica
  • enfoque nítido, grano de película, Kodak Portra 400
  • objetivo de 85 mm, profundidad de campo f/1.8
  • foto RAW, mucho detalle

Para sujetos con detalles físicos específicos, descríbelos al principio del prompt. El modelo presta más atención a los conceptos que aparecen antes en la secuencia de tokens, así que los elementos más importantes deben ir primero.

Los prompts negativos siguen funcionando

A pesar de los cambios de arquitectura, los prompts negativos siguen siendo eficaces. Las exclusiones habituales, como deformed, blurry, low quality, cartoon, illustration, watermark, siguen suprimiendo esas cualidades de forma fiable. En concreto para retratos, añadir plastic skin, airbrushed, smooth skin, uncanny valley al prompt negativo mantiene la textura facial con aspecto natural en lugar de excesivamente procesada.

Una diferencia notable con SDXL: SD 3.5 es mucho menos propenso a errores anatómicos desde el principio, así que la lista de prompt negativo para partes del cuerpo puede ser más corta o incluso omitirse en muchos casos.

Cómo usar SD 3.5 en PicassoIA

Fotografía de producto en plano cenital sobre mármol blanco, cuerpo de cámara profesional con objetivo fijo, impresiones de retratos generados con IA dispersas, carta de calibración de color, luz de estudio suave y difusa desde arriba

Stable Diffusion 3.5 Large está disponible directamente en PicassoIA, así que puedes usarlo sin instalar nada en local, sin requisitos de GPU ni configuración de un entorno de Python.

Paso a paso con SD 3.5 Large

Paso 1: Abre la página del modelo

Entra en Stable Diffusion 3.5 Large en PicassoIA. La interfaz se carga directamente en tu navegador y no necesitas una cuenta para empezar.

Paso 2: Escribe tu prompt

En el campo del prompt, describe tu imagen en lenguaje natural. Empieza por el sujeto principal, luego el entorno, después la iluminación y, por último, los modificadores de estilo. Mantén entre 50 y 150 palabras para obtener mejores resultados. Los prompts más cortos pueden funcionar, pero suelen producir resultados genéricos.

Paso 3: Ajusta los parámetros

Los parámetros que conviene ajustar:

  • Steps: Ponlo entre 28 y 40 para la máxima calidad. Ponlo entre 8 y 12 para ganar velocidad con Large Turbo.
  • CFG Scale: 3,5-4,5 es el punto óptimo para SD 3.5. Subirlo más puede provocar sobresaturación y la aparición de artefactos.
  • Aspect Ratio: 16:9 para paisaje, 9:16 para retrato y 1:1 para formatos cuadrados.

Paso 4: Añade un prompt negativo

Incluso con un prompt positivo limpio, añade exclusiones básicas de calidad: blurry, low quality, distorted, watermark, text, deformed

Paso 5: Genera e itera

Lanza tu primera generación. Si el resultado está cerca pero no es perfecto, ajusta descriptores concretos en lugar de reescribir todo el prompt. Pequeños cambios, como añadir "luz de contorno suave desde la derecha" o cambiar "photorealistic" por "hyperrealistic photograph", pueden modificar el resultado de forma notable.

Parámetros que conviene ajustar

💡 Consejo sobre CFG: SD 3.5 se calibró para valores de CFG más bajos que SDXL. Si obtienes resultados sobresaturados o con exceso de nitidez, baja el CFG de 7 a 4 y vuelve a generar.

El parámetro semilla (seed) te permite reproducir resultados exactos. Cuando encuentres una generación que te guste, anota el valor de la semilla. Puedes reutilizarlo con pequeñas variaciones del prompt para crear variaciones coherentes de la misma escena. Es útil para series de imágenes de producto o para mantener la coherencia de personajes en varias imágenes.

En cuanto al sampler, DPM++ 2M Karras y Euler a funcionan bien con SD 3.5. El modelo no es tan sensible a la elección del sampler como lo era SD 1.5, pero DPM++ tiende a producir degradados ligeramente más suaves en retratos, mientras que Euler a puede dar bordes más nítidos en fotos de arquitectura y producto.

SD 3.5 frente a otros modelos

Toma en ángulo bajo de una plaza histórica de una ciudad europea al atardecer, primer plano cálido de adoquines con reflejos del cielo húmedo, fachadas barrocas ornamentadas, gran angular de 24 mm

Elegir entre modelos consiste en ajustar la herramienta a la tarea. SD 3.5 no es la mejor opción para todo.

SDXL todavía tiene su lugar

SDXL Lightning 4Step y los ajustes finos especializados de SDXL, construidos en torno a estéticas concretas, siguen produciendo resultados distintivos que SD 3.5 no reproduce exactamente. El ecosistema de SDXL tiene miles de LoRA entrenados con estilos artísticos, rostros y tipos de producto específicos. Si tu flujo de trabajo depende de un LoRA concreto que todavía no se ha adaptado a SD 3.5, SDXL sigue siendo la opción práctica.

Stable Diffusion (el modelo original basado en 1.5) conserva una base de seguidores por sus características estéticas y por el enorme volumen de ajustes finos construidos sobre él. Para estilos de ilustración artística y cercanos al anime, el ecosistema 1.5 sigue dando resultados competitivos, a pesar de la antigüedad de la arquitectura base.

Dónde gana Flux en su lugar

Flux Dev y Flux Pro, de Black Forest Labs, son la principal alternativa competitiva a SD 3.5 en el espacio de pesos abiertos. Flux tiende a dar mejores resultados en fotografía de arquitectura, en imágenes de producto con un detalle geométrico preciso y en cualquier escena que requiera relaciones espaciales muy exactas. SD 3.5 Large tiene ventaja en retratos y sujetos humanos, donde la composición de sus datos de entrenamiento muestra ventajas claras en detalle facial y fidelidad de la textura de la piel.

La comparación honesta: ningún modelo domina en todas las categorías. Usar ambos a través de PicassoIA no requiere ningún esfuerzo de configuración, así que probar los dos en tu caso de uso concreto es el enfoque más directo.

Caso de usoModelo recomendado
Fotografía de retratoSD 3.5 Large
Arquitectura e interioresFlux Dev
Fotos de productoSD 3.5 Large o Flux
Texto en la imagenSD 3.5 Large
Iteración rápidaSD 3.5 Large Turbo
Estilo anime / ilustraciónAjustes finos de SDXL
Ajuste fino en GPU de consumoSD 3.5 Medium

Casos de uso reales

Primer plano de manos sosteniendo una tableta que muestra una comparación de imágenes generadas con IA, antes y después, luz de la mañana por la ventana, 50 mm f/2.8, estilo editorial fotorrealista

Las características descritas arriba se traducen en aplicaciones creativas prácticas que antes eran difíciles o imposibles con los modelos de código abierto anteriores.

Fotografía de retrato

SD 3.5 Large produce retratos con un detalle de piel, pelo y ojos que compite con la fotografía de estudio. El modelo maneja bien configuraciones de luz complicadas: luz dividida, luz de contorno con fondo oscuro, luz natural de ventana con sombras suaves. Para aplicaciones comerciales de retrato, como fotos de perfil para webs, imágenes de moda o referencias de personajes, produce resultados utilizables directamente, sin un posprocesado extenso.

La coherencia de la anatomía entre generaciones es muchísimo mejor que en SDXL. Las manos, que resultaban especialmente difíciles para los modelos anteriores, se renderizan con el número correcto de dedos y poses naturales en una proporción alta de generaciones, sin necesidad de trucos con el prompt negativo.

Fotos de producto

La fotografía de producto es uno de los casos de uso que más crecen en la generación de imágenes con IA dentro de los flujos de trabajo profesionales. El fotorrealismo mejorado de SD 3.5 hace que las imágenes de producto parezcan colocadas en entornos reales, en lugar de montadas sobre ellos. El modelo maneja superficies reflectantes, materiales transparentes y entornos de fondo complejos con una iluminación coherente en toda la superficie del producto.

Combinado con las mejoras en la renderización de texto, puedes incluir etiquetas de marca o carteles en las imágenes de producto y obtener resultados legibles. Una botella con etiqueta, un libro con título, un paquete con un nombre de marca: todo esto son resultados viables con SD 3.5 Large, donde los modelos anteriores habrían producido aproximaciones deformadas.

Obras creativas

Joven profesional creativo en un escritorio de pie en un espacio de coworking luminoso, revisando imágenes de retratos generadas con IA en un monitor curvo, fondo con pared de plantas, retrato ambiental de 35 mm f/2.0

Para trabajo creativo no fotorrealista, SD 3.5 con un prompt de estilo adecuado produce texturas de pintura al óleo, estéticas de fotografía analógica y estilos de ilustración editorial que son de alta calidad y, a la vez, muy distintivos. La mayor adherencia al prompt del modelo hace que las composiciones de escenas complejas con varios sujetos que interactúan se acerquen de verdad a la intención descrita, lo que abre briefs creativos más ambiciosos.

La naturaleza de pesos abiertos de SD 3.5 también significa que la comunidad creativa ya ha empezado a ajustar finamente la variante Medium para estilos artísticos concretos, y esa biblioteca de ajustes finos solo crecerá a medida que el modelo madure. Los artistas que quieran una estética específica pueden esperar a un ajuste fino de la comunidad o entrenar el suyo sobre la base Medium.

Empieza a generar con SD 3.5 ahora mismo

Todas las características descritas en este artículo están disponibles de inmediato a través de PicassoIA, sin instalación local, sin entorno de Python y sin necesidad de GPU. El modelo Stable Diffusion 3.5 Large está listo para usarse directamente en tu navegador.

Además de SD 3.5, PicassoIA te da acceso a Stable Diffusion 3, Flux Dev, Flux Pro, RealVisXL v3.0 Turbo y más de 90 modelos de texto a imagen en un solo lugar. Puedes comparar resultados entre modelos sin cambiar de plataforma, que es la forma más rápida de descubrir qué funciona de verdad para tu tema y tu estilo concretos.

Empieza con el prompt que tienes en mente, pruébalo primero con SD 3.5 Large y luego compáralo con una o dos alternativas. Tras unas cuantas rondas de pruebas, la correspondencia entre modelo y tarea se vuelve intuitiva. El nivel mínimo de calidad de la generación de código abierto ha subido mucho con SD 3.5, y la mejor forma de comprobarlo es generar algo tú mismo.

Compartir este artículo

Elige tu idioma