Kolors : le modèle d’IA de génération d’images de Kuaishou expliqué

Kolors est le modèle open source de texte vers image à diffusion de Kuaishou Technology, bâti sur une architecture de diffusion latente avec un encodeur de texte ChatGLM pour les prompts en chinois comme en anglais. Cet article détaille le fonctionnement interne du modèle, ce qui le distingue de SDXL et d’autres modèles de pointe, et pourquoi il produit des résultats aussi nets et photoréalistes pour les portraits, les visuels de produits et les usages bilingues.

Kolors : le modèle d’IA de génération d’images de Kuaishou expliqué
Cristian Da Conceicao
Fondateur de Picasso IA

Kolors est apparu en 2024 comme l’une des sorties les plus intéressantes sur le plan technique de la scène de recherche en IA chinoise. Développé par Kuaishou Technology, l’entreprise derrière la plateforme de vidéos courtes Kuaishou, ce modèle de texte vers image est passé en open source presque immédiatement et a suscité une attention réelle de la part des chercheurs et des développeurs, habitués aux sorties de modèles dominées par l’Occident.

Ce qui a attiré l’attention, ce n’est pas seulement la qualité d’image, réellement impressionnante, mais les choix d’architecture sous-jacents. Kolors utilise un encodeur de texte basé sur un transformer, emprunté à ChatGLM, plutôt que l’encodeur CLIP sur lequel s’appuie la plupart des modèles occidentaux. Ce choix unique a des conséquences importantes sur la manière dont les prompts sont interprétés et sur la capacité du modèle à traiter les saisies en chinois dans l’ensemble des applications commerciales et créatives.

Cet article explique comment Kolors fonctionne techniquement, ce qu’il produit, comment il se compare aux autres modèles de pointe et où il se situe dans le paysage, en évolution rapide, de la génération d’images open source.

Ce qu’est vraiment Kolors

Kolors est un modèle de texte vers image à diffusion de grande taille, développé par l’équipe Kolors de Kuaishou et publié au public au milieu de l’année 2024. Son nom complet est Kolors-diffusers ; il a été mis à disposition sur Hugging Face, avec des poids que chacun peut télécharger et exécuter. Il repose sur un cadre de diffusion latente, ce qui signifie que les images sont générées et traitées dans un espace latent compressé plutôt qu’en pleine résolution de pixels, une approche à la fois plus rapide et plus économe en mémoire.

L’architecture puise ses racines dans la même famille d’idées que celle qui a donné naissance à SDXL. Mais Kolors s’en écarte nettement sur un composant critique : l’encodeur de texte. Cette différence n’est pas une simple retouche. Elle modifie le type de prompts que le modèle peut traiter et les personnes qui peuvent l’utiliser efficacement.

Construit sur la diffusion latente

Dans un modèle de diffusion latente, le processus de débruitage proprement dit a lieu dans un espace latent de faible dimension. Un autoencodeur variationnel (VAE) compresse les images dans cet espace pendant l’entraînement, et, lors de l’inférence, le modèle génère dans cet espace compressé avant que le décodeur VAE ne reconstruise l’image finale en pixels.

Cela signifie que la partie coûteuse en calcul, le débruitage itératif, opère sur un tenseur bien plus petit que ne l’exigeraient les pixels bruts. Kolors utilise un latent à 4 canaux avec un facteur de réduction de 8 : une image de 1024x1024 est donc traitée comme un latent de 128x128. Le UNet intégré à Kolors est entraîné à prédire le bruit à chaque étape du processus de diffusion dans cet espace compressé, puis transmet le résultat au décodeur VAE pour le rendu final.

Ingénieur en IA examinant des portraits générés sur un moniteur professionnel dans un studio photo

L’encodeur de texte ChatGLM

C’est ici que Kolors se distingue réellement de la concurrence. Au lieu de CLIP, qui encode le texte dans une séquence de longueur fixe de 77 tokens avec une profondeur sémantique limitée, Kolors utilise ChatGLM3-6B comme encodeur de texte. ChatGLM est un grand modèle de langage bilingue chinois-anglais développé par l’université Tsinghua et Zhipu AI, et il gère les prompts longs et nuancés bien mieux que CLIP.

La différence pratique est réelle et mesurable. CLIP a été entraîné sur des données web majoritairement anglophones, collectées automatiquement, et peine avec trois catégories de saisies :

  • Les prompts longs, au-delà de 77 tokens
  • Les caractères chinois et leurs nuances sémantiques
  • Les instructions de composition complexes, avec plusieurs sujets et relations

ChatGLM répond aux trois. Il prend en charge jusqu’à 256 tokens en entrée, dispose d’une capacité bilingue native dès l’entraînement, et apporte la profondeur d’un transformer issu d’un modèle de langage de 6 milliards de paramètres, entraîné spécifiquement à la compréhension du chinois et de l’anglais.

💡 La différence essentielle : Kolors peut accepter un prompt complet en chinois et produire des résultats fidèlement décrits, alors que SDXL traduirait mal ou ignorerait entièrement le contenu sémantique.

Pourquoi Kolors se démarque

Il existe des dizaines de modèles open source de texte vers image disponibles en 2024. Qu’est-ce qui donne à Kolors une raison d’être au-delà d’un simple fine-tuning de SDXL de plus ?

Du texte bilingue dans les images

La plupart des modèles occidentaux produisent des caractères chinois illisibles ou incohérents lorsqu’on leur demande d’intégrer du texte dans les images. Kolors gère la typographie chinoise avec une précision nettement supérieure, car son encodeur de texte saisit en profondeur le poids sémantique des tokens chinois. Cela compte énormément pour les usages commerciaux sur les marchés sinophones : bannières de produits pour le commerce en ligne, affiches, visuels pour les réseaux sociaux et captures d’écran pour les boutiques d’applications.

Cette capacité s’étend au rendu du texte en anglais. Kolors est compétitif face aux modèles spécialisés dans le texte dans l’image pour les écritures latines, sans leur être systématiquement supérieur. Il est en revanche le seul grand modèle open source à traiter de façon fiable les deux écritures dans une même architecture, sans aucune étape de prétraitement par traduction.

Portrait photoréaliste saisissant d’une jeune femme en robe de soie cramoisie illustrant la qualité des résultats de l’IA

Une qualité de rendu photoréaliste

Kolors produit des images avec un fort penchant vers le photoréalisme. Les textures de la peau, les détails des tissus, l’éclairage ambiant et la profondeur des environnements sont rendus avec une qualité naturelle qui rivalise avec les versions affinées de SDXL et avec FLUX.1 Dev. Le modèle a été entraîné sur un vaste jeu de données propriétaire constitué par Kuaishou, qui comprenait des photographies haute résolution et des visuels commerciaux issus de l’écosystème média de la plateforme.

Lors de comparaisons en aveugle menées par la communauté de l’IA peu après la sortie, Kolors a systématiquement obtenu de meilleurs scores que SDXL de base sur plusieurs benchmarks :

CritèreSDXL BaseKolors
Score de préférence humaine75,2 %85,6 %
Réalisme des textures de peauMoyenÉlevé
Précision des prompts en chinoisFaibleÉlevée
Respect des prompts longsMoyenÉlevé
Rendu de texte (chinois)ÉchecRéussi
Précision de compositionMoyenneÉlevée

Ces chiffres proviennent de la section d’évaluation de l’article sur Kolors et représentent la méthodologie de benchmark interne de Kuaishou. Les tests indépendants menés par la communauté ont largement confirmé cette tendance, en particulier pour les sujets en portrait et les produits posés sur une surface, où le photoréalisme est le critère principal.

Open source et gratuit à exécuter

Kuaishou a publié Kolors sous une licence ouverte qui autorise l’usage commercial. Les poids complets, le VAE et les configurations du planificateur sont librement disponibles sur Hugging Face. Toute personne disposant d’un GPU adapté peut l’exécuter en local, sans frais d’API. Ce choix stratégique était délibéré : une publication ouverte construit un écosystème de fine-tuners, d’entraîneurs de LoRA et d’applications dérivées qui étendent la portée du modèle bien au-delà de ce que Kuaishou pourrait produire en interne.

Équipe diversifiée de professionnels de la création collaborant autour d’une table de conférence avec ordinateurs portables et tablettes

Plongée dans l’architecture de Kolors

Comprendre pourquoi Kolors fonctionne suppose un bref regard sur ce qui se passe à l’intérieur du modèle. Si les détails techniques ne vous intéressent pas, vous pouvez passer cette section sans perdre le fil de l’article.

Le UNet comme colonne vertébrale

Kolors utilise un UNet modifié comme colonne vertébrale de débruitage, d’une structure proche de celle du UNet de SDXL, mais entraîné depuis zéro sur le pipeline de données de Kuaishou. Les choix structurels qui définissent son comportement :

  • Prise en charge des résolutions : entraînement natif en 1024x1024 avec prise en charge du conditionnement multi-formats
  • Couches d’attention : l’attention croisée conditionne la génération sur les embeddings de texte issus de ChatGLM, à plusieurs profondeurs du UNet
  • Connexions de saut : les connexions standard du UNet (skip connections) standard du UNet préservent la structure spatiale pendant le chemin de suréchantillonnage
  • Conditionnement par pas de temps : les embeddings sinusoïdaux de pas de temps indiquent au réseau, tout au long de l’inférence, à quelle étape du débruitage il se trouve

Le UNet reçoit simultanément le tenseur latent bruité et le conditionnement textuel projeté, prédit la composante de bruit à retirer, puis itère. Les échantillonneurs courants, dont DDIM, DPM++ 2M Karras et Euler, sont tous compatibles avec Kolors. En général, 20 à 50 étapes donnent des résultats de haute qualité, 25 à 35 constituant le compromis pratique entre vitesse et qualité.

Gros plan sur du matériel GPU haut de gamme montrant les ailettes du dissipateur et le détail du circuit imprimé, net au premier plan

Comment les tokens circulent dans le modèle

Le pipeline de conditionnement textuel de Kolors est plus complexe que la configuration à deux encodeurs de SDXL. Voici la séquence de traitement, du prompt brut au conditionnement de l’image :

  1. Le prompt d’entrée arrive en chinois ou en anglais, jusqu’à 256 tokens
  2. Le tokeniseur de ChatGLM3-6B encode le texte en identifiants de tokens, avec une tokenisation en sous-mots tenant compte de la langue
  3. L’encodeur ChatGLM produit des embeddings contextuels riches, de forme [batch, seq_len, 4096]
  4. La couche de projection fait correspondre les embeddings de dimension 4096 à la dimension d’embedding interne du UNet
  5. L’attention croisée des couches du UNet, à plusieurs profondeurs, conditionne chaque étape de génération sur ces projections

Les embeddings de ChatGLM portent nettement plus d’information contextuelle que ceux de CLIP, car ChatGLM est un transformer autorégressif complet, et non un modèle contrastif entraîné sur des paires image-texte. C’est pourquoi Kolors gère plus fiablement les prompts de composition : « une femme en manteau rouge debout devant un bâtiment vert un soir de pluie » est comprise comme une scène composée, et non comme un simple amas statistique d’associations image-texte.

VAE et espace latent

Kolors utilise un VAE standard régularisé par KL, avec 4 canaux latents. L’encodeur fait correspondre les images en pixels à des latents avec une compression spatiale de 8x pendant l’entraînement, et le décodeur reconstruit les images complètes lors de l’inférence. L’équipe de Kolors a utilisé les poids de VAE publiés de SDXL comme initialisation, ce qui explique en partie pourquoi les caractéristiques de l’espace latent sont globalement compatibles avec certains outils et communautés proches de SDXL.

Couloir de salle serveur de centre de données d’entreprise moderne, avec gestion structurée des câbles et voyants lumineux

Kolors face aux autres modèles

Où Kolors se situe-t-il réellement dans le paysage plus large des modèles ?

Forces et faiblesses en un coup d’œil

ModèleEncodeur de textePrise en charge du chinoisPoids ouvertsPoints forts
KolorsChatGLM3-6BExcellenteOuiPortraits, photoréalisme, bilinguisme
SDXLCLIP + OpenCLIPFaibleOuiVitesse, taille de l’écosystème LoRA
FLUX.1 DevT5-XXL + CLIPLimitéeOuiDétails fins, précision des prompts
GPT Image 2Vision GPT-4oBonneNonSuivi des instructions, texte dans l’image
Midjourney v6PropriétaireCorrecteNonStyle artistique, esthétique

Kolors occupe une niche précise : la génération photoréaliste avec une prise en charge bilingue native, dans un cadre d’accès open source. Aucun autre modèle de ce comparatif ne réunit cette combinaison. FLUX.1 Dev s’en rapproche sur le photoréalisme, mais manque de profondeur en chinois. GPT Image 2 gère mieux le chinois, mais il est fermé et n’est accessible que par API.

Là où Kolors est relativement plus faible : son écosystème de fine-tunes LoRA est plus restreint que celui de SDXL, sa vitesse d’inférence est inférieure à celle de FLUX.1 Schnell, et il existe moins de versions stylistiques de checkpoints entraînées par la communauté et disponibles en téléchargement.

Quand choisir Kolors

Choisissez Kolors lorsque :

  • Votre audience parle chinois et vos prompts seront principalement en chinois
  • Vous avez besoin de portraits photoréalistes ou de visuels de produits commerciaux de qualité publication
  • Vous voulez des poids open source avec une licence compatible avec un usage commercial pour un déploiement en production
  • Vous développez un produit bilingue et souhaitez un seul modèle pour servir les deux publics linguistiques

Tournez-vous vers autre chose lorsque :

  • La vitesse d’inférence maximale est la priorité (FLUX Schnell est nettement plus rapide)
  • Vous avez besoin du plus grand écosystème de fine-tunes et de LoRA (SDXL reste en tête sur ce point)
  • La composition de scènes complexes avec un suivi précis des instructions est indispensable (FLUX.1 Dev fait mieux)

Cas d’usage concrets

Photographie de portrait et de mode

Kolors produit une qualité de portrait qui peut remplacer les photos de banques d’images dans de nombreux contextes commerciaux. Le rendu des teints est naturel pour une large gamme d’origines, l’éclairage est cohérent sans reflets qui paraissent artificiels, et le modèle gère le comportement des tissus avec une précision surprenante. Les photographes de mode et les équipes de production e-commerce en Chine l’ont adopté rapidement pour générer des visuels de produits et des images de référence de mannequins, à une échelle que la photographie traditionnelle ne peut pas égaler sur le plan économique.

Configuration à double écran affichant des comparaisons d’images générées par l’IA pour l’évaluation de la qualité

Visualisation de produits

Des marques chinoises utilisent activement Kolors pour générer des visuels de produits en contexte, sans séances photo en studio coûteuses. Une marque de soins pour la peau peut produire un flacon de sérum posé sur une tablette de salle de bain en marbre, avec un éclairage caustique et des ombres précis, pour une fraction du coût de la photographie traditionnelle. La prise en charge native des prompts bilingues signifie que l’équipe marketing peut travailler directement en chinois, sans aucun prétraitement par traduction ni approximation linguistique.

La gestion des surfaces réfléchissantes, de la transparence des matériaux et de l’interaction entre surface et lumière est particulièrement solide pour la visualisation de produits, un travail qui dépend de la précision du rendu des matériaux.

Réseaux sociaux et création de contenus

La plateforme de Kuaishou est son propre service de vidéos courtes, qui fait directement concurrence à TikTok en Chine. Kolors alimente directement les outils de création intégrés à la plateforme. Les créateurs de contenus peuvent générer des miniatures, des bannières et des visuels promotionnels entièrement en chinois, avec des résultats qui répondent aux attentes visuelles des réseaux sociaux chinois, sans aucune étape intermédiaire en anglais.

Écran de smartphone affichant un superbe portrait généré par l’IA, tenu à la main dans un café

Exécuter Kolors en pratique

Via API

La façon la plus simple d’exécuter Kolors sans matériel local passe par l’API de Replicate. Le modèle est hébergé à kwai-kolors/kolors et accepte les paramètres de diffusion standard : prompt, prompt négatif, étapes, guidance scale et seed. Un appel typique coûte une fraction de centime par image et produit un résultat en 1024x1024 en environ 10 à 20 secondes de temps d’inférence.

model: kwai-kolors/kolors
prompt: "一位穿着白色连衣裙的女子站在樱花树下"
num_inference_steps: 50
guidance_scale: 5.0
width: 1024
height: 1024

Le prompt en chinois ci-dessus se traduit par : « Une femme en robe blanche debout sous des cerisiers en fleurs. » Kolors l’interprète nativement, sans aucune étape de traduction.

Configuration locale requise

Pour un déploiement local, la configuration minimale est :

  • GPU : RTX 3090 avec 24 Go de VRAM pour une inférence confortable en 1024x1024
  • Framework : Diffusers 0.30.0 ou version ultérieure, depuis Hugging Face
  • Checkpoint : Kwai-Kolors/Kolors, disponible directement sur le Hub de Hugging Face

Le modèle s’intègre à la classe KolorsPipeline de Diffusers, qui gère automatiquement la tokenisation de ChatGLM. Un chargement en précision float16 tient dans 18 à 20 Go de VRAM. Sur une RTX 4090, une inférence de 30 étapes en 1024x1024 prend environ 8 à 12 secondes.

💡 Astuce : appliquez torch.compile() au UNet pour gagner 20 à 30 % de vitesse d’inférence sur les GPU des générations Ada et Ampere. Associez-le à l’attention SDPA pour une efficacité mémoire supplémentaire, sans perte de qualité.

Fine-tuning LoRA

Kolors prend en charge le fine-tuning LoRA via les scripts d’entraînement Diffusers standard, avec quelques modifications mineures pour s’adapter au chemin de conditionnement ChatGLM. Entraîner un LoRA de style sur Kolors nécessite environ 20 à 50 images de référence et de 1 000 à 2 000 étapes d’entraînement sur un GPU de 24 Go pour obtenir une qualité raisonnable. Le fine-tuning complet de type dreambooth est également pris en charge pour les tâches de cohérence d’identité.

L’équipe de Kuaishou a publié des modèles complémentaires, dont Kolors-IP-Adapter pour la génération de portraits à identité cohérente et Kolors-ControlNet pour le conditionnement par pose, profondeur et contours Canny. Ces ajouts rendent la boîte à outils autour de Kolors nettement plus complète qu’une simple évaluation du modèle de base ne le laisserait penser.

Professionnel de la création tapant des prompts d’images IA sur un clavier mécanique dans un espace de travail peu éclairé

Le tableau d’ensemble

Kolors mérite l’attention au-delà de ses seuls chiffres de benchmark. Il fait partie d’une vague plus large de modèles d’IA de grande qualité issus d’équipes de recherche chinoises, qui ont reçu relativement peu de visibilité dans les débats occidentaux sur le développement des modèles de pointe.

Kuaishou, comme ByteDance et le DAMO Academy d’Alibaba, dispose de la profondeur d’ingénierie, des ressources de calcul et des données d’entraînement propriétaires nécessaires pour produire des modèles qui rivalisent avec leurs équivalents occidentaux, voire les dépassent, dans des domaines précis. Kolors ne bat pas Midjourney v6 sur le style esthétique pur. Mais il surpasse SDXL de base sur la plupart des benchmarks de photoréalisme, tout en étant open source, en prenant nativement en charge deux langues, en étant sous licence commerciale et en étant gratuit à héberger soi-même.

Métropole dense d’Asie de l’Est au crépuscule, photographiée depuis un toit en hauteur, avec des traînées lumineuses de véhicules en contrebas

La sortie de ce modèle a aussi validé l’approche consistant à utiliser de grands modèles de langage comme encodeurs de texte pour la génération d’images. T5-XXL, utilisé dans Stable Diffusion 3 et FLUX.1 Dev, a fait la preuve du concept côté occidental. Kolors a montré que cela fonctionne au moins aussi bien, et probablement mieux pour les langues autres que l’anglais, grâce à ChatGLM. La recherche d’architectures de conditionnement textuel plus performantes pour les modèles de diffusion se poursuit, et Kolors constitue un jalon significatif dans cette histoire en cours.

Pour les équipes qui conçoivent des produits destinés à des utilisateurs sinophones, Kolors n’est ni une curiosité ni une alternative expérimentale. C’est aujourd’hui l’option open source la plus solide pour associer une qualité d’image photoréaliste à une prise en charge native des prompts en chinois, dans un seul modèle sous licence commerciale.

Commencez à créer vos propres images

La façon la plus rapide de découvrir ce que la génération d’images par IA moderne peut produire, sans matériel local, sans téléchargement de modèles ni identifiants d’API, consiste à utiliser une plateforme qui a déjà pris en charge l’infrastructure. PicassoIA héberge des dizaines de modèles de texte vers image de pointe que vous pouvez exécuter directement dans votre navigateur, sans aucune configuration.

Si vous voulez une génération photoréaliste dans le style popularisé par Kolors, FLUX.1 Dev produit des résultats très détaillés et fidèles au prompt sur PicassoIA. Pour un travail créatif riche en instructions, où le texte dans les images compte, GPT Image 2 est disponible sans aucune configuration. Les deux tournent sur l’infrastructure de PicassoIA : vous rédigez un prompt et voyez les résultats en quelques secondes.

Que vous produisiez des photos de portrait, des visuels de produits, des contenus pour les réseaux sociaux ou que vous testiez simplement ce que ces modèles peuvent générer à partir d’une description détaillée, PicassoIA réunit une génération d’images de niveau état de l’art en un seul endroit. Rédigez votre prompt, choisissez votre modèle et voyez ce qui en sort.

Partager cet article

Choisissez votre langue