Kolors: el modelo de imágenes de IA de Kuaishou explicado

Kolors es el modelo de difusión texto a imagen de código abierto de Kuaishou Technology, construido sobre una arquitectura de difusión latente con un codificador de texto ChatGLM para prompts en chino y en inglés. Este artículo explica cómo funciona el modelo por dentro, qué lo diferencia de SDXL y de otros modelos punteros, y por qué produce resultados tan nítidos y fotorrealistas en retratos, imágenes de producto y casos de uso bilingües.

Kolors: el modelo de imágenes de IA de Kuaishou explicado
Cristian Da Conceicao
Fundador de Picasso IA

Kolors llegó en 2024 como uno de los lanzamientos más interesantes desde el punto de vista técnico dentro de la escena de investigación en IA de China. Desarrollado por Kuaishou Technology, la empresa detrás de la plataforma de video corto Kuaishou, este modelo texto a imagen pasó a ser de código abierto casi de inmediato y atrajo mucha atención de investigadores y desarrolladores que se habían acostumbrado a lanzamientos dominados por Occidente.

Lo que hizo que la gente se fijara no fue solo la calidad de imagen, que es realmente impresionante, sino las decisiones de arquitectura que hay debajo. Kolors usa un codificador de texto basado en transformers, tomado de ChatGLM, en lugar del codificador CLIP en el que se apoyan la mayoría de los modelos occidentales. Esa única decisión tiene consecuencias importantes en cómo se interpretan los prompts y en lo bien que el modelo maneja la entrada en chino en todo el abanico de aplicaciones comerciales y creativas.

Este artículo cubre cómo funciona Kolors a nivel técnico, qué produce, cómo se compara con otros modelos punteros y dónde encaja en el panorama, en rápida evolución, de la generación de imágenes de código abierto.

Qué es Kolors realmente

Kolors es un modelo de difusión texto a imagen a gran escala desarrollado por el equipo de Kolors de Kuaishou y publicado al público a mediados de 2024. El nombre completo del modelo es Kolors-diffusers y se puso a disposición en Hugging Face con pesos que cualquiera puede descargar y ejecutar. Está construido sobre un marco de difusión latente, lo que significa que las imágenes se generan y procesan en un espacio latente comprimido en lugar de a resolución completa de píxeles, algo que es más rápido y más eficiente en memoria.

La arquitectura tiene sus raíces en la misma familia de ideas que dio lugar a SDXL. Pero Kolors se aparta de forma notable en un componente clave: el codificador de texto. Ese cambio no es un retoque menor. Redefine qué tipos de prompts puede manejar el modelo y quién puede usarlo de forma eficaz.

Construido sobre difusión latente

En un modelo de difusión latente, el proceso de eliminación de ruido en sí ocurre en un espacio latente de baja dimensión. Un autocodificador variacional (VAE) comprime las imágenes en este espacio durante el entrenamiento, y en la inferencia el modelo genera en ese espacio comprimido antes de que el decodificador del VAE reconstruya la imagen final en píxeles.

Esto significa que la parte computacionalmente costosa, la eliminación de ruido iterativa, opera sobre un tensor mucho más pequeño que el que requerirían los píxeles en bruto. Kolors usa un latente de 4 canales con un factor de reducción de 8, así que una imagen de 1024x1024 se procesa como un latente de 128x128. La UNet dentro de Kolors se entrena para predecir el ruido en cada paso del proceso de difusión en este espacio comprimido, y después pasa el resultado al decodificador del VAE para el render final.

Ingeniero de IA revisando retratos generados en un monitor profesional en un estudio fotográfico

El codificador de texto ChatGLM

Aquí es donde Kolors realmente se separa de la competencia. En lugar de CLIP, que codifica el texto en una secuencia de longitud fija de 77 tokens con una profundidad semántica limitada, Kolors usa ChatGLM3-6B como codificador de texto. ChatGLM es un modelo de lenguaje bilingüe chino-inglés de la Universidad de Tsinghua y Zhipu AI, y maneja prompts largos y matizados con mucha más soltura que CLIP.

La diferencia práctica es real y medible. CLIP se entrenó con datos de la web en los que predomina el inglés y tiene dificultades con tres tipos de input:

  • Prompts largos que superan los 77 tokens
  • Caracteres chinos y sus matices semánticos
  • Instrucciones de composición complejas con varios sujetos y relaciones

ChatGLM resuelve los tres casos. Admite hasta 256 tokens de input, tiene capacidad bilingüe nativa a nivel de entrenamiento y aporta la profundidad de un transformer que procede de un modelo de lenguaje de 6.000 millones de parámetros entrenado específicamente para la comprensión chino-inglés.

💡 La diferencia clave: Kolors puede aceptar un prompt completo en chino y producir resultados que describen con precisión lo pedido, mientras que SDXL o bien traduciría mal o ignoraría por completo el contenido semántico.

Por qué Kolors destaca

En 2024 hay decenas de modelos texto a imagen de código abierto. ¿Qué le da a Kolors una razón para existir más allá de otro ajuste fino de SDXL?

Texto bilingüe en las imágenes

La mayoría de los modelos occidentales generan caracteres chinos deformados o irregulares cuando se les pide incluir texto en imágenes. Kolors maneja la tipografía china con una precisión notablemente mayor, porque su codificador de texto entiende a fondo el peso semántico de los tokens chinos. Esto importa muchísimo en casos de uso comercial en mercados de habla china: banners de productos para comercio electrónico, diseño de carteles, gráficos para redes sociales y capturas de pantalla para tiendas de aplicaciones.

La misma capacidad se extiende al render de texto en inglés. Kolors compite con los modelos dedicados a texto en imagen para escrituras latinas, aunque no es sistemáticamente superior. Eso sí, es el único modelo importante de código abierto que maneja ambas escrituras de forma fiable en una sola arquitectura, sin necesidad de ningún paso previo de traducción.

Retrato fotorrealista impresionante de una joven con un vestido de seda carmesí que muestra la calidad de salida de la IA

Calidad de salida fotorrealista

Kolors produce imágenes con un fuerte sesgo hacia el fotorrealismo. Las texturas de la piel, el detalle de las telas, la iluminación ambiental y la profundidad del entorno se renderizan con una calidad natural que compite con las versiones afinadas de SDXL y con FLUX.1 Dev. El modelo se entrenó con un gran conjunto de datos propietario seleccionado por Kuaishou, que incluía fotografía de alta resolución e imágenes comerciales obtenidas a través del ecosistema de medios de la plataforma.

En comparaciones a ciegas realizadas por la comunidad de IA poco después del lanzamiento, Kolors superó con regularidad a SDXL base en varios benchmarks:

MétricaSDXL baseKolors
Puntuación de preferencia humana75,2 %85,6 %
Realismo de la textura de la pielMedioAlto
Precisión con prompts en chinoDeficienteAlta
Seguimiento de prompts (largos)MedioAlto
Render de texto (chino)FallaCorrecto
Precisión compositivaMediaAlta

Estas cifras proceden de la sección de evaluación del artículo de investigación de Kolors y representan la metodología de benchmark interna de Kuaishou. Las pruebas independientes de la comunidad han confirmado en líneas generales la tendencia, sobre todo en retratos y en imágenes de producto sobre superficies, donde el fotorrealismo es la medida principal.

Código abierto y gratuito para ejecutar

Kuaishou publicó Kolors con una licencia abierta que permite el uso comercial. Los pesos completos, el VAE y las configuraciones del planificador están disponibles gratis en Hugging Face. Cualquiera con una GPU adecuada puede ejecutarlo en local sin costos de API. Fue una decisión estratégica deliberada: publicarlo en abierto crea un ecosistema de ajustes finos, entrenadores de LoRA y aplicaciones derivadas que amplían el alcance del modelo mucho más allá de lo que Kuaishou podría producir por su cuenta.

Equipo diverso de profesionales creativos colaborando alrededor de una mesa de conferencias con equipos portátiles y tabletas

Análisis detallado de la arquitectura de Kolors

Para entender por qué funciona Kolors hace falta echar un vistazo a lo que ocurre dentro del modelo. Si no te interesan los detalles técnicos, puedes saltarte esta sección sin perder el hilo del artículo.

La UNet como columna vertebral

Kolors usa una UNet modificada como columna vertebral de eliminación de ruido, con una estructura similar a la UNet de SDXL pero entrenada desde cero con la canalización de datos de Kuaishou. Estas son las decisiones estructurales que definen su comportamiento:

  • Soporte de resolución: entrenamiento nativo a 1024x1024 con soporte de condicionamiento para varias relaciones de aspecto
  • Capas de atención: la atención cruzada condiciona la generación con los embeddings de texto de ChatGLM en varias profundidades de la UNet
  • Conexiones de salto: las conexiones de salto estándar de la UNet preservan la estructura espacial durante la ruta de sobremuestreo
  • Condicionamiento por paso de tiempo: los embeddings sinusoidales de paso de tiempo comunican a la red en qué etapa de eliminación de ruido se encuentra durante toda la inferencia

La UNet recibe el tensor latente con ruido y la proyección del condicionamiento de texto al mismo tiempo, predice el componente de ruido que hay que eliminar e itera. Los muestreadores habituales, como DDIM, DPM++ 2M Karras y Euler, son compatibles con Kolors. Normalmente, entre 20 y 50 pasos producen resultados de alta calidad, y entre 25 y 35 es el punto práctico idóneo para equilibrar velocidad y calidad.

Primer plano de hardware GPU de gama alta con las aletas del disipador y el detalle de la placa de circuitos en foco nítido

Cómo fluyen los tokens por el modelo

La canalización de condicionamiento de texto de Kolors es más compleja que la configuración de dos codificadores de SDXL. Esta es la secuencia de procesamiento desde el prompt en bruto hasta el condicionamiento de la imagen:

  1. El prompt de entrada llega en chino o en inglés, hasta 256 tokens
  2. El tokenizador de ChatGLM3-6B codifica el texto en IDs de token con tokenización de subpalabras sensible al idioma
  3. El codificador ChatGLM produce embeddings contextuales ricos con la forma [batch, seq_len, 4096]
  4. La capa de proyección transforma los embeddings de 4096 dimensiones a la dimensión de embedding interna de la UNet
  5. La atención cruzada en las capas de la UNet a varias profundidades condiciona cada paso de generación con estas proyecciones

Los embeddings de ChatGLM aportan bastante más información contextual que los de CLIP, porque ChatGLM es un transformer autorregresivo completo, no un modelo contrastivo entrenado con pares de imagen y texto. Por eso Kolors maneja con más fiabilidad los prompts de composición: "una mujer con un abrigo rojo de pie frente a un edificio verde en una noche lluviosa" se entiende como una escena compuesta, no como un grupo estadístico de asociaciones entre imagen y texto.

VAE y espacio latente

Kolors usa un VAE estándar regularizado por KL con 4 canales latentes. El codificador transforma las imágenes de píxeles en latentes con una compresión espacial de 8x durante el entrenamiento, y el decodificador reconstruye las imágenes completas en la inferencia. El equipo de Kolors usó los pesos del VAE publicados de SDXL como inicialización, y esa es una de las razones por las que las características del espacio latente son en gran medida compatibles con algunas herramientas y comunidades cercanas a SDXL.

Pasillo de un centro de datos empresarial moderno con gestión estructurada de cables y luces indicadoras

Kolors frente a otros modelos

¿Dónde se sitúa realmente Kolors en el panorama general de modelos?

Puntos fuertes y débiles de un vistazo

ModeloCodificador de textoSoporte de chinoPesos abiertosMejor en
KolorsChatGLM3-6BExcelenteSíRetratos, fotorrealismo, bilingüe
SDXLCLIP + OpenCLIPDeficienteSíVelocidad, tamaño del ecosistema LoRA
FLUX.1 DevT5-XXL + CLIPLimitadoSíDetalle fino, precisión del prompt
GPT Image 2Visión de GPT-4oBuenoNoSeguimiento de instrucciones, texto en imagen
Midjourney v6PropietarioAceptableNoEstilo artístico, estética

Kolors ocupa un nicho concreto: generación fotorrealista con soporte bilingüe nativo con acceso de código abierto. Ningún otro modelo de esta comparativa cubre esa combinación. FLUX.1 Dev se acerca en fotorrealismo, pero le falta profundidad en el idioma chino. GPT Image 2 maneja mejor el chino, pero es de código cerrado y solo se usa por API.

Donde Kolors es relativamente más débil: su ecosistema de ajustes finos LoRA es más pequeño que el de SDXL, la velocidad de inferencia es más lenta que la de FLUX.1 Schnell y hay menos versiones de checkpoints con estilos entrenados por la comunidad disponibles para descargar.

Cuándo elegir Kolors

Elige Kolors cuando:

  • Tu público habla chino y los prompts estarán mayoritariamente en chino
  • Necesitas retratos fotorrealistas o imágenes comerciales de producto con calidad de publicación
  • Quieres pesos de código abierto con una licencia favorable al uso comercial para desplegar en producción
  • Estás creando un producto bilingüe y quieres un solo modelo para atender a ambos públicos lingüísticos

Busca otra opción cuando:

  • La velocidad máxima de inferencia es la prioridad (FLUX Schnell es notablemente más rápido)
  • Necesitas el ecosistema de ajustes finos y LoRA más grande (SDXL sigue liderando ahí)
  • Se requiere composición de escenas complejas con seguimiento exacto de instrucciones (FLUX.1 Dev funciona mejor)

Casos de uso reales

Fotografía de retrato y moda

Kolors produce una calidad de retrato que puede sustituir a la fotografía de archivo en muchos contextos comerciales. El render de los tonos de piel es natural en una amplia gama de etnias, la iluminación es coherente sin brillos de aspecto artificial y el modelo reproduce el comportamiento de las telas de la ropa con una precisión sorprendente. Los fotógrafos de moda y los equipos de producción de comercio electrónico en China lo adoptaron rápidamente para generar imágenes de producto y referencias de modelos a una escala que la fotografía tradicional no puede igualar en costos.

Configuración de doble monitor en paralelo que muestra comparaciones de resultados de imágenes generadas por IA para evaluar la calidad

Visualización de productos

Las marcas chinas usan Kolors de forma activa para generar imágenes de producto en contexto sin costosas sesiones de fotos en estudio. Una marca de cosmética para la piel puede producir un frasco de sérum sobre una estantería de baño de mármol, con iluminación y sombras cáusticas precisas, a una fracción del costo de la fotografía tradicional. El soporte nativo de prompts bilingües significa que el equipo de marketing puede trabajar directamente en chino, sin ningún paso previo de traducción ni aproximaciones de idioma.

El manejo que hace el modelo de las superficies reflectantes, la transparencia de los materiales y la interacción entre superficie y luz es especialmente sólido para la visualización de productos, un trabajo que depende de la precisión en el render de materiales.

Redes sociales y creación de contenido

La propia plataforma de Kuaishou es un producto de video corto que compite directamente con TikTok en China. Kolors se integra directamente en las herramientas de creación de la plataforma. Los creadores de contenido pueden generar miniaturas, ilustraciones de banner y gráficos promocionales íntegramente en chino, con resultados que encajan con las expectativas visuales de la estética de las redes sociales chinas, sin ningún paso intermedio en inglés.

Pantalla de smartphone que muestra un retrato hermoso generado por IA sostenido en la mano en una cafetería

Ejecutar Kolors en la práctica

Por API

La forma más sencilla de ejecutar Kolors sin hardware local es a través de la API de Replicate. El modelo está alojado en kwai-kolors/kolors y acepta parámetros de difusión estándar: prompt, prompt negativo, pasos, guidance scale y semilla. Una llamada típica cuesta una fracción de céntimo por imagen y produce una salida de 1024x1024 en unos 10 a 20 segundos de tiempo de inferencia.

model: kwai-kolors/kolors
prompt: "一位穿着白色连衣裙的女子站在樱花树下"
num_inference_steps: 50
guidance_scale: 5.0
width: 1024
height: 1024

El prompt en chino de arriba se traduce como: "Una mujer con un vestido blanco de pie bajo cerezos en flor". Kolors lo interpreta de forma nativa, sin ningún paso de traducción.

Requisitos para una instalación local

Para el despliegue en local, la configuración mínima es:

  • GPU: RTX 3090 con 24 GB de VRAM para una inferencia cómoda a 1024x1024
  • Framework: Diffusers 0.30.0 o posterior de Hugging Face
  • Checkpoint: Kwai-Kolors/Kolors disponible directamente en Hugging Face Hub

El modelo se integra con la clase KolorsPipeline de Diffusers, que gestiona automáticamente la tokenización de ChatGLM. Cargarlo con precisión float16 cabe en entre 18 y 20 GB de VRAM. En una RTX 4090, una inferencia de 30 pasos a 1024x1024 tarda unos 8 a 12 segundos.

💡 Consejo: aplica torch.compile() a la UNet para obtener una mejora de velocidad de inferencia del 20 al 30 % en GPU de las generaciones Ada y Ampere. Combínalo con la atención SDPA para ahorrar más memoria sin pérdida de calidad.

Ajuste fino con LoRA

Kolors admite el ajuste fino con LoRA mediante los scripts de entrenamiento estándar de Diffusers, con pequeñas modificaciones para adaptarse a la ruta de condicionamiento de ChatGLM. Entrenar un LoRA de estilo en Kolors requiere aproximadamente de 20 a 50 imágenes de referencia y de 1000 a 2000 pasos de entrenamiento en una GPU de 24GB para obtener una calidad razonable. También se admite el ajuste fino completo al estilo dreambooth para tareas de coherencia de identidad.

El equipo de Kuaishou publicó modelos complementarios, entre ellos Kolors-IP-Adapter para la generación de retratos con identidad coherente y Kolors-ControlNet para el condicionamiento por pose, profundidad y bordes Canny. Estas incorporaciones hacen que el conjunto práctico de herramientas alrededor de Kolors sea bastante más completo de lo que sugeriría una evaluación del modelo base por sí solo.

Profesional creativo escribiendo prompts para imágenes de IA en un teclado mecánico en un espacio de trabajo con poca luz

El panorama general

Kolors representa algo que merece atención más allá de sus cifras individuales de benchmark. Forma parte de una oleada más amplia de modelos de IA de alta calidad procedentes de equipos de investigación chinos, que han recibido relativamente poca visibilidad en los debates occidentales sobre el desarrollo de modelos punteros.

Kuaishou, como ByteDance y el DAMO Academy de Alibaba, tiene la profundidad de ingeniería, los recursos computacionales y los datos de entrenamiento propietarios necesarios para producir modelos que compiten con los occidentales o los superan en dominios concretos. Kolors no supera a Midjourney v6 en estilo estético puro. Pero supera a SDXL base en la mayoría de los benchmarks de fotorrealismo, al tiempo que es de código abierto, admite dos idiomas de forma nativa, tiene licencia comercial y es gratuito para alojarlo uno mismo.

Metrópolis densa del este de Asia al anochecer, fotografiada desde una azotea elevada, con estelas de luz de vehículos debajo

La publicación también validó el enfoque de usar modelos de lenguaje (LLM) como codificadores de texto para la generación de imágenes. T5-XXL, usado en Stable Diffusion 3 y en FLUX.1 Dev, demostró el concepto desde el lado occidental. Kolors demostró que funciona al menos igual de bien, y probablemente mejor en idiomas que no son el inglés, usando ChatGLM. La búsqueda de mejores arquitecturas de condicionamiento de texto para modelos de difusión continúa, y Kolors es un dato relevante en esa historia en marcha.

Para los equipos que crean productos para usuarios de habla china, Kolors no es una curiosidad ni una alternativa experimental. Es actualmente la opción de código abierto más sólida para combinar calidad de imagen fotorrealista con soporte nativo de prompts en chino en un único modelo con licencia comercial.

Empieza a crear tus propias imágenes

La forma más rápida de experimentar lo que puede producir la generación de imágenes con IA actual, sin hardware local, descargas de modelos ni credenciales de API, es usar una plataforma que ya haya resuelto la infraestructura. PicassoIA aloja decenas de modelos texto a imagen de última generación que puedes ejecutar directamente en tu navegador, sin configuración.

Si quieres generación fotorrealista con el estilo que popularizó Kolors, FLUX.1 Dev ofrece resultados muy detallados y fieles al prompt en PicassoIA. Para trabajos creativos con muchas instrucciones en los que el texto en las imágenes importa, GPT Image 2 está disponible sin necesidad de configuración. Ambos funcionan con la infraestructura de PicassoIA, así que escribes un prompt y ves los resultados en segundos.

Tanto si produces fotografía de retrato, imágenes de producto, recursos para redes sociales o simplemente pruebas lo que estos modelos pueden generar a partir de una descripción detallada, PicassoIA reúne la generación de imágenes de nivel punta en un solo lugar. Escribe tu prompt, elige tu modelo y mira qué sale.

Compartir este artículo

Elige tu idioma