Kolors: o modelo de imagem de IA da Kuaishou explicado
Kolors é o modelo de difusão de texto para imagem de código aberto da Kuaishou Technology, construído sobre uma arquitetura de difusão latente com um codificador de texto ChatGLM para prompts em chinês e em inglês. Este artigo explica como o modelo funciona por dentro, o que o diferencia de SDXL e de outros modelos de ponta, e por que ele produz resultados tão nítidos e fotorrealistas em retratos, imagens de produtos e casos de uso bilíngues.
O Kolors surgiu em 2024 como um dos lançamentos tecnicamente mais interessantes da cena de pesquisa em IA da China. Desenvolvido pela Kuaishou Technology, empresa por trás da plataforma de vídeos curtos Kuaishou, esse modelo de texto para imagem tornou-se de código aberto quase imediatamente e chamou a atenção de pesquisadores e desenvolvedores que já estavam acostumados a lançamentos de modelos dominados pelo Ocidente.
O que fez as pessoas pararem para olhar não foi apenas a qualidade da imagem, que é genuinamente impressionante, mas as decisões de arquitetura por trás dela. O Kolors usa um codificador de texto baseado em transformer emprestado do ChatGLM, em vez do codificador CLIP em que a maioria dos modelos ocidentais se apoia. Essa escolha única tem consequências significativas para a forma como os prompts são interpretados e para o quão bem o modelo lida com entradas em chinês em toda a gama de aplicações comerciais e criativas.
Este artigo aborda como o Kolors funciona tecnicamente, o que ele produz, como se compara com outros modelos de ponta e onde ele se encaixa no cenário da geração de imagens de código aberto, que muda rapidamente hoje em dia.
O que é o Kolors, de fato
O Kolors é um modelo de difusão de texto para imagem em larga escala desenvolvido pela equipe Kolors da Kuaishou e lançado publicamente em meados de 2024. O nome completo do modelo é Kolors-diffusers e ele foi disponibilizado no Hugging Face com pesos que qualquer pessoa pode baixar e executar. Ele é construído sobre um framework de difusão latente, o que significa que as imagens são geradas e processadas em um espaço latente comprimido, e não na resolução completa de pixels, o que é mais rápido e mais eficiente em memória.
A arquitetura tem raízes na mesma família de ideias que deu origem ao SDXL. Mas o Kolors se afasta significativamente em um componente crítico: o codificador de texto. Essa mudança não é um ajuste pequeno. Ela redefine que tipos de prompts o modelo consegue processar e quem pode usá-lo com eficácia.
Construído sobre difusão latente
Em um modelo de difusão latente, o processo de remoção de ruído propriamente dito acontece em um espaço latente de baixa dimensão. Um Variational Autoencoder (VAE) comprime as imagens nesse espaço durante o treinamento e, na inferência, o modelo gera no espaço comprimido antes do decodificador do VAE reconstruir a imagem final em pixels.
Isso significa que a parte computacionalmente cara, a remoção iterativa de ruído, opera sobre um tensor muito menor do que os pixels brutos exigiriam. O Kolors usa um latente de 4 canais com fator de redução de 8, então uma imagem de 1024x1024 é processada como um latente de 128x128. A UNet dentro do Kolors é treinada para prever o ruído em cada etapa do processo de difusão nesse espaço comprimido e, em seguida, passa o resultado para o decodificador do VAE para a renderização final.
O codificador de texto ChatGLM
É aqui que o Kolors realmente se diferencia da concorrência. Em vez do CLIP, que codifica o texto em uma sequência de tamanho fixo de 77 tokens com profundidade semântica limitada, o Kolors usa o ChatGLM3-6B como codificador de texto. O ChatGLM é um modelo de linguagem bilíngue chinês-inglês da Universidade Tsinghua e da Zhipu AI, e lida com prompts longos e nuançados com muito mais naturalidade do que o CLIP.
A diferença prática é real e mensurável. O CLIP foi treinado com dados da web em que predomina o inglês e tem dificuldade com três categorias de entrada:
Prompts longos, acima de 77 tokens
Caracteres chineses e sua nuance semântica
Instruções compostas complexas, com vários sujeitos e relações
O ChatGLM resolve os três casos. Ele oferece suporte a até 256 tokens de entrada, tem capacidade bilíngue nativa no nível do treinamento e traz a profundidade de um transformer que vem de um modelo de linguagem de 6 bilhões de parâmetros treinado especificamente para a compreensão de chinês e inglês.
💡 A diferença central: o Kolors consegue aceitar um prompt completo em chinês e produzir resultados que descrevem com precisão o que foi pedido, enquanto o SDXL ou traduziria mal o conteúdo ou o ignoraria por completo.
Por que o Kolors se destaca
Há dezenas de modelos de texto para imagem de código aberto disponíveis em 2024. O que dá ao Kolors motivo para existir além de mais um ajuste fino do SDXL?
Texto bilíngue em imagens
A maioria dos modelos ocidentais produz caracteres chineses ilegíveis ou inconsistentes quando precisa incluir texto nas imagens. O Kolors lida com a tipografia chinesa com precisão visivelmente maior porque o codificador de texto entende o peso semântico dos tokens chineses em profundidade. Isso importa muito para casos de uso comerciais em mercados de língua chinesa: banners de produtos para e-commerce, design de cartazes, gráficos para redes sociais e capturas de tela para lojas de aplicativos.
A mesma capacidade se estende à renderização de texto em inglês. O Kolors é competitivo com modelos dedicados de texto em imagem para escritas latinas, embora não seja consistentemente superior a eles. Ainda assim, é o único grande modelo de código aberto que lida com os dois sistemas de escrita de forma confiável em uma única arquitetura, sem precisar de nenhuma etapa de tradução prévia.
Qualidade de saída fotorrealista
O Kolors produz imagens com forte tendência ao fotorrealismo. Texturas da pele, detalhes de tecido, iluminação ambiente e profundidade do ambiente são renderizados com uma qualidade natural que concorre com variantes de SDXL ajustadas e com o FLUX.1 Dev. O modelo foi treinado com um grande conjunto de dados proprietário, curado pela Kuaishou, que incluía fotografia em alta resolução e imagens comerciais obtidas pelo ecossistema de mídia da plataforma.
Em comparações cegas conduzidas pela comunidade de IA logo após o lançamento, o Kolors pontuou consistentemente acima do SDXL base em vários benchmarks:
Métrica
SDXL Base
Kolors
Pontuação de preferência humana
75,2%
85,6%
Realismo da textura da pele
Médio
Alto
Precisão com prompts em chinês
Ruim
Alta
Seguimento de prompts (longos)
Médio
Alto
Renderização de texto (chinês)
Falha
Aprovado
Precisão composicional
Média
Alta
Esses números vêm da seção de avaliação do artigo do Kolors e representam a metodologia interna de benchmark da Kuaishou. Testes independentes da comunidade confirmaram amplamente a tendência, especialmente para retratos e imagens de produtos sobre superfícies, em que o fotorrealismo é a principal medida.
Código aberto e gratuito para executar
A Kuaishou lançou o Kolors sob uma licença aberta que permite uso comercial. Os pesos completos, o VAE e as configurações do scheduler estão disponíveis gratuitamente no Hugging Face. Qualquer pessoa com uma GPU adequada pode executá-lo localmente sem custos de API. Essa foi uma escolha estratégica deliberada: lançar de forma aberta constrói um ecossistema de ajustes finos, treinadores de LoRA e aplicações derivadas que estendem o alcance do modelo muito além do que a Kuaishou conseguiria produzir internamente.
Um mergulho na arquitetura do Kolors
Entender por que o Kolors funciona exige um breve olhar sobre o que acontece dentro do modelo. Se você não tiver interesse nos detalhes técnicos, pode pular esta seção sem perder o fio do artigo.
A UNet como base
O Kolors usa uma UNet modificada como base de remoção de ruído, de estrutura semelhante à UNet do SDXL, mas treinada do zero com o pipeline de dados da Kuaishou. As decisões estruturais que definem seu comportamento:
Suporte a resolução: treinamento nativo em 1024x1024 com condicionamento para múltiplas proporções
Camadas de atenção: a atenção cruzada condiciona a geração aos embeddings de texto do ChatGLM em múltiplas profundidades da UNet
Conexões de pulo: as conexões de pulo padrão da UNet preservam a estrutura espacial durante o caminho de upsampling
Condicionamento por timestep: embeddings de timestep senoidais informam à rede em que estágio da remoção de ruído ela está durante toda a inferência
A UNet recebe o tensor latente com ruído e o condicionamento de texto projetado ao mesmo tempo, prevê o componente de ruído a ser removido e itera. Amostradores comuns, como DDIM, DPM++ 2M Karras e Euler, são todos compatíveis com o Kolors. Tipicamente, de 20 a 50 etapas produzem resultados de alta qualidade, sendo de 25 a 35 o ponto ideal prático para equilibrar velocidade e qualidade.
Como os tokens fluem pelo modelo
O pipeline de condicionamento de texto do Kolors é mais complexo do que a configuração de dois codificadores do SDXL. Aqui está a sequência de processamento, do prompt bruto até o condicionamento da imagem:
O prompt de entrada chega em chinês ou inglês, com até 256 tokens
O tokenizador do ChatGLM3-6B codifica o texto em IDs de token com tokenização de subpalavras sensível ao idioma
O codificador ChatGLM produz embeddings contextuais ricos com formato [batch, seq_len, 4096]
A camada de projeção mapeia os embeddings de 4096 dimensões para a dimensão de embedding interna da UNet
A atenção cruzada nas camadas da UNet, em múltiplas profundidades, condiciona cada etapa de geração a essas projeções
Os embeddings do ChatGLM carregam muito mais informação contextual do que os embeddings do CLIP porque o ChatGLM é um transformer autorregressivo completo, e não um modelo contrastivo treinado com pares de imagem e texto. É por isso que o Kolors lida com prompts compostos de forma mais confiável: "uma mulher com um casaco vermelho em pé na frente de um prédio verde numa noite chuvosa" é entendido como uma cena composta, e não como um agrupamento estatístico de associações entre imagem e texto.
VAE e espaço latente
O Kolors usa um VAE padrão regularizado por KL com 4 canais latentes. O codificador mapeia imagens em pixels para latentes com compressão espacial de 8x durante o treinamento, e o decodificador reconstrói as imagens completas na inferência. A equipe do Kolors usou os pesos do VAE do SDXL lançados publicamente como inicialização, o que é um dos motivos pelos quais as características do espaço latente são amplamente compatíveis com algumas ferramentas e comunidades ligadas ao SDXL.
Kolors ou outros modelos
Onde o Kolors realmente se situa no panorama mais amplo de modelos?
O Kolors ocupa um nicho específico: geração fotorrealista com suporte bilíngue nativo com acesso de código aberto. Nenhum outro modelo desta comparação cobre essa combinação. O FLUX.1 Dev chega perto no fotorrealismo, mas não tem a profundidade em língua chinesa. O GPT Image 2 lida melhor com o chinês, mas é de código fechado e disponível apenas por API.
Onde o Kolors é relativamente mais fraco: seu ecossistema de ajustes finos com LoRA é menor que o do SDXL, a velocidade de inferência é mais lenta que a do FLUX.1 Schnell, e o modelo tem menos variações de checkpoint de estilo treinadas pela comunidade disponíveis para download.
Quando escolher o Kolors
Escolha o Kolors quando:
Seu público fala chinês e os prompts serão majoritariamente em chinês
Você precisa de retratos fotorrealistas ou imagens comerciais de produtos com qualidade de publicação
Você quer pesos de código aberto com uma licença favorável ao uso comercial para implantação em produção
Você está criando um produto bilíngue e quer um único modelo para atender os dois públicos linguísticos
Procure outra opção quando:
A velocidade máxima de inferência é a prioridade (o FLUX Schnell é consideravelmente mais rápido)
Você precisa do maior ecossistema de ajustes finos e LoRA (o SDXL ainda lidera nisso)
É exigida composição de cenas complexas com seguimento exato de instruções (FLUX.1 Dev tem melhor desempenho)
Casos de uso no mundo real
Fotografia de retratos e moda
O Kolors produz resultados com qualidade de retrato que podem substituir fotos de banco de imagens em muitos contextos comerciais. A renderização do tom de pele é natural em uma ampla gama de etnias, a iluminação é coerente, sem especularidade de aparência artificial, e o modelo lida com o comportamento do tecido das roupas com precisão surpreendente. Fotógrafos de moda e equipes de produção de e-commerce na China adotaram o modelo rapidamente para gerar imagens de produtos e quadros de referência de modelos em uma escala que a fotografia tradicional não consegue igualar com custo razoável.
Visualização de produtos
Marcas chinesas usam ativamente o Kolors para gerar imagens de produtos em contexto sem sessões de fotos caras em estúdio. Uma marca de cuidados com a pele pode produzir um frasco de sérum sobre uma prateleira de banheiro de mármore, com iluminação cáustica e sombra precisas, por uma fração do custo da fotografia tradicional. O suporte nativo a prompts bilíngues significa que a equipe de marketing pode trabalhar diretamente em chinês, sem nenhuma tradução prévia ou aproximação de idioma.
O tratamento do modelo para superfícies reflexivas, transparência de materiais e interação entre superfície e luz é particularmente forte para o trabalho de visualização de produtos, que depende da precisão na renderização de materiais.
Redes sociais e criação de conteúdo
A própria plataforma da Kuaishou é um produto de vídeos curtos que concorre diretamente com o TikTok na China. O Kolors alimenta diretamente as ferramentas de criação dentro da plataforma da Kuaishou. Criadores de conteúdo podem gerar miniaturas, artes de banner e gráficos promocionais inteiramente em chinês, com resultados que correspondem às expectativas visuais da estética das redes sociais chinesas, sem nenhuma etapa intermediária em inglês.
Executando o Kolors na prática
Via API
A forma mais simples de executar o Kolors sem hardware local é pela API do Replicate. O modelo está hospedado em kwai-kolors/kolors e aceita parâmetros padrão de difusão: prompt, prompt negativo, etapas, guidance scale e seed. Uma chamada típica custa uma fração de centavo por imagem e produz saída de 1024x1024 em cerca de 10 a 20 segundos de tempo de inferência.
O prompt em chinês acima se traduz como: "Uma mulher com um vestido branco em pé sob cerejeiras em flor." O Kolors o interpreta nativamente, sem nenhuma etapa de tradução.
Requisitos para configuração local
Para implantação local, a configuração mínima é:
GPU: RTX 3090 com 24 GB de VRAM para inferência confortável em 1024x1024
Framework: Diffusers 0.30.0 ou mais recente, do Hugging Face
Checkpoint: Kwai-Kolors/Kolors disponível diretamente no Hugging Face Hub
O modelo se integra à classe KolorsPipeline do Diffusers, que lida com a tokenização do ChatGLM automaticamente. Carregado com precisão float16, ele cabe em 18 a 20 GB de VRAM. Em uma RTX 4090, a inferência de 30 etapas em 1024x1024 leva aproximadamente de 8 a 12 segundos.
💡 Dica: aplique torch.compile() à UNet para uma melhoria de 20 a 30% na velocidade de inferência em GPUs das gerações Ada e Ampere. Combine com atenção SDPA para mais eficiência de memória sem perda de qualidade.
Ajuste fino com LoRA
O Kolors oferece suporte a fine-tuning com LoRA por meio dos scripts de treinamento padrão do Diffusers, com pequenas modificações para acomodar o caminho de condicionamento do ChatGLM. Treinar um LoRA de estilo no Kolors exige cerca de 20 a 50 imagens de referência e de 1.000 a 2.000 passos de treinamento em uma GPU de 24GB para obter uma qualidade razoável. O fine-tuning completo, no estilo dreambooth, também é compatível com tarefas de consistência de identidade.
A equipe da Kuaishou lançou modelos complementares, incluindo o Kolors-IP-Adapter para geração de retratos com identidade consistente e o Kolors-ControlNet para condicionamento por pose, profundidade e bordas canny. Essas adições tornam o conjunto prático de ferramentas em torno do Kolors consideravelmente mais completo do que sugeriria uma avaliação do modelo base isolado.
A visão geral
O Kolors representa algo que merece atenção além dos seus números individuais de benchmark. Ele faz parte de uma onda mais ampla de modelos de IA de alta qualidade de equipes de pesquisa chinesas que receberam relativamente pouca visibilidade nas discussões ocidentais sobre o desenvolvimento de modelos de ponta.
A Kuaishou, assim como a ByteDance e o DAMO Academy da Alibaba, tem profundidade de engenharia, recursos computacionais e dados de treinamento proprietários para produzir modelos que competem com ou superam os equivalentes ocidentais em domínios específicos. O Kolors não supera o Midjourney v6 em estética pura. Mas ele supera o SDXL base na maioria dos benchmarks de fotorrealismo, ao mesmo tempo que é de código aberto, oferece suporte nativo a dois idiomas, tem licença comercial e pode ser hospedado por conta própria sem custo.
O lançamento também validou a abordagem de usar modelos de linguagem (LLM) como codificadores de texto para geração de imagens. O T5-XXL, usado no Stable Diffusion 3 e no FLUX.1 Dev, comprovou o conceito pelo lado ocidental. O Kolors mostrou que funciona pelo menos tão bem, e provavelmente melhor para idiomas que não são o inglês, usando o ChatGLM. A busca por arquiteturas de condicionamento de texto melhores para modelos de difusão continua, e o Kolors é um dado relevante nessa história em andamento.
Para equipes que criam produtos para usuários de língua chinesa, o Kolors não é uma curiosidade nem uma alternativa experimental. Hoje, é a opção de código aberto mais forte para combinar qualidade de imagem fotorrealista com suporte nativo a prompts em chinês em um único modelo com licença comercial.
Comece a criar suas próprias imagens
A forma mais rápida de experimentar o que a geração de imagens por IA moderna pode produzir, sem hardware local, downloads de modelos ou credenciais de API, é usar uma plataforma que já cuidou da infraestrutura. A PicassoIA hospeda dezenas de modelos de texto para imagem de ponta que você pode executar diretamente no navegador, sem nenhuma configuração.
Se você quer geração fotorrealista no estilo que o Kolors popularizou, o FLUX.1 Dev entrega resultados muito detalhados e fiéis ao prompt na PicassoIA. Para trabalhos criativos com muitas instruções, em que o texto nas imagens importa, o GPT Image 2 está disponível sem nenhuma configuração necessária. Os dois rodam na infraestrutura da PicassoIA, então você escreve um prompt e vê os resultados em segundos.
Seja você produzindo fotografia de retratos, imagens de produtos, recursos para redes sociais ou apenas testando o que esses modelos conseguem produzir a partir de uma descrição detalhada, a PicassoIA reúne a geração de imagens de nível de ponta em um só lugar. Escreva seu prompt, escolha seu modelo e veja o que sai.