Comment les modèles d’IA open source sont entraînés : ce qui se passe vraiment

Les modèles d’IA open source comme Flux et Stable Diffusion ne sont pas apparus tout faits. Ils ont été construits au fil de mois de collecte de données, de boucles d’entraînement itératives et de matériel à très grande échelle. Cet article détaille comment fonctionne ce processus, ce qui rend un modèle réellement open source, et comment les mêmes poids entraînés alimentent les outils d’image par IA que vous utilisez aujourd’hui.

Comment les modèles d’IA open source sont entraînés : ce qui se passe vraiment
Cristian Da Conceicao
Fondateur de Picasso IA

La première fois que vous saisissez un prompt dans un générateur d’images par IA et qu’une image photoréaliste apparaît en quelques secondes, il est facile d’oublier que le modèle à l’œuvre n’a pas toujours été aussi performant. Il est parti d’une page blanche, de milliards de nombres aléatoires, et il a été façonné en quelque chose d’utile grâce à un processus qui a duré des mois, mobilisé des milliers de GPU et des pétaoctets de données. Ce processus s’appelle l’entraînement, et pour les modèles d’IA open source, c’est un processus que n’importe qui peut, en principe, reproduire, inspecter ou étendre.

Cet article détaille précisément comment les modèles d’IA open source sont entraînés, depuis la collecte des données brutes jusqu’à la mise à l’épreuve des poids finaux par la communauté.

Ce que signifie vraiment « entraînement »

Le modèle part de zéro

Avant le début de l’entraînement, un réseau de neurones n’est rien d’autre qu’une grande collection de paramètres numériques appelés poids. À l’initialisation, ces poids sont généralement aléatoires. Le réseau ne sait pas à quoi ressemble un chat, ce que signifie la grammaire ou comment prédire le pixel suivant d’une image. Tout cela vient de l’exposition aux données.

L’entraînement consiste à ajuster ces poids sur des millions d’itérations jusqu’à ce que le modèle produise de façon fiable des résultats utiles. Imaginez un apprentissage par la répétition, sauf que l’« apprenant » n’est pas un cerveau humain mais une fonction mathématique dotée de milliards de boutons réglables.

Les données sont tout

L’ingrédient le plus important de l’entraînement n’est ni l’architecture ni le matériel. Ce sont les données. Un modèle ne vaut que ce qu’on lui a montré. Si le jeu de données est biaisé, incomplet ou de mauvaise qualité, ces défauts sont directement intégrés au comportement du modèle.

Pour les modèles de génération d’images comme Flux Dev ou Stable Diffusion, les données d’entraînement se composent de centaines de millions de paires image-texte : une photo de coucher de soleil associée à la légende « golden hour over the ocean », et ainsi de suite. Le modèle apprend à associer contenu visuel et langage en voyant suffisamment de ces paires.

Équipe d’annotation de données travaillant dans un open space lumineux, étiquetant des images d’entraînement

D’où viennent les données

Crawls du web et jeux de données sous licence

La majorité des données d’entraînement des grands modèles d’IA open source provient de crawls du web. Des projets comme Common Crawl parcourent des milliards de pages web et mettent ces données à disposition pour la recherche et l’usage commercial. Pour les modèles d’images en particulier, des jeux de données comme LAION-5B ont compilé des paires image-texte issues de tout internet, fournissant la matière première nécessaire à un entraînement à grande échelle.

En parallèle des crawls publics, les organisations utilisent de plus en plus des jeux de données sous licence provenant de banques d’images, de publications scientifiques et de dépôts organisés. Cela compte plus que jamais, alors que le cadre juridique entourant les données d’entraînement continue d’évoluer.

Note : Toutes les données disponibles sur internet ne sont pas légalement utilisables pour l’entraînement. Les modèles open source varient fortement dans leur transparence sur la provenance des données, et cet écart de transparence se creuse à mesure que les contestations juridiques s’accumulent.

La qualité prime sur le volume

Des jeux de données plus volumineux ne produisent pas automatiquement de meilleurs modèles. Des chercheurs de Stability AI et de Black Forest Labs (l’équipe derrière Flux Schnell et Flux Pro) ont systématiquement constaté que filtrer les images de faible qualité, supprimer les doublons et équilibrer la représentation des sujets produit des résultats nettement meilleurs que la simple accumulation de données.

La curation des données est une discipline à part entière. Des équipes d’annotateurs et des pipelines de filtrage automatisés investissent des efforts considérables pour s’assurer que ce qui entre dans la boucle d’entraînement vaut vraiment la peine d’être appris.

Data scientist devant une station de travail multi-écrans, sélectionnant et annotant des jeux de données d’images dans un IDE sombre

La boucle d’entraînement, étape par étape

Passe avant, prédictions et perte

Une fois les données prêtes, l’entraînement se déroule en boucle continue. À chaque itération, le modèle reçoit un lot d’exemples d’entraînement et produit des prédictions. Pour un modèle de génération d’images, cela peut signifier : à partir d’une version bruitée d’une image et d’un prompt textuel, prédire à quoi ressemblait l’image originale et propre.

L’écart entre la prédiction du modèle et la bonne réponse est mesuré par une fonction de perte. La perte est un nombre unique : plus elle est basse, meilleur est le résultat du modèle ; plus elle est haute, moins bon il est. Au début de l’entraînement, la perte est élevée parce que les poids sont encore essentiellement aléatoires. Le but de tout l’entraînement est de faire baisser ce nombre, de façon constante, sur des millions d’itérations.

La rétropropagation expliquée simplement

Une fois la perte calculée, le modèle doit déterminer quels poids ont contribué à l’erreur, et dans quelle mesure. Cela se fait par la rétropropagation, un algorithme qui remonte les couches du réseau et calcule le gradient de la perte par rapport à chaque poids.

Un gradient est une direction et une intensité : il indique si l’augmentation ou la diminution d’un poids donné fera monter ou descendre la perte. Avec des centaines de milliards de poids dans un modèle moderne, calculer tous ces gradients simultanément demande un appareillage mathématique considérable, mais la logique sous-jacente est simple.

Gros plan de mains d’un chercheur sur un clavier, avec des courbes de perte d’entraînement affichées sur un écran derrière

Comment fonctionne la descente de gradient

Après que la rétropropagation a calculé les gradients, la descente de gradient les utilise pour mettre à jour les poids. Le principe est direct : déplacer chaque poids légèrement dans la direction qui réduit la perte.

La taille de chaque pas est contrôlée par le taux d’apprentissage. Trop grand, le modèle dépasse la cible et rebondit sans jamais se stabiliser. Trop petit, l’entraînement prend une éternité.

Une analogie utile : imaginez la perte comme un paysage physique, avec des montagnes et des vallées. Les poids actuels du modèle le placent en un point de ce terrain. La descente de gradient consiste à faire, de façon répétée, de petits pas vers le bas, en direction de la vallée la plus basse.

Vue aérienne d’un paysage montagneux accidenté avec des courbes de niveau, illustrant l’optimisation par descente de gradient

Cette boucle (passe avant, calcul de la perte, rétropropagation des gradients, mise à jour des poids) se répète des milliards de fois au cours d’un entraînement. Chaque passage sur un lot de données s’appelle une étape ; un passage complet sur l’ensemble du jeu de données est une époque.

TermeCe que cela signifie
Fonction de perteMesure l’erreur entre la prédiction et la réalité
RétropropagationCalcule quels poids ont causé l’erreur
Descente de gradientMet à jour les poids pour réduire l’erreur
Taux d’apprentissageContrôle l’ampleur de chaque mise à jour des poids
ÉpoqueUn passage complet sur le jeu de données d’entraînement

Ce qui fait qu’un modèle est « open source »

Poids ouverts ou open source complet

Cette distinction compte plus qu’on ne le pense. Un modèle à poids ouverts rend ses paramètres entraînés téléchargeables publiquement. Vous pouvez le faire tourner en local, le fine-tuner et construire des applications dessus. Des modèles comme SDXL et Stable Diffusion 3.5 Large relèvent de cette catégorie.

Un modèle entièrement open source publie aussi le code d’entraînement, le jeu de données et la documentation couvrant l’ensemble du pipeline. Bien moins de modèles atteignent ce niveau d’exigence.

Bon à savoir : « Open source » en IA ne recouvre pas toujours la même réalité que dans le logiciel. Beaucoup de modèles d’IA populaires que l’on qualifie d’open source ne partagent que les poids, pas la recette complète utilisée pour les créer.

Pourquoi c’est important pour les créateurs

Les poids ouverts comptent énormément pour les praticiens. Ils permettent d’exécuter l’inférence sans frais d’API, de faire tourner le modèle sur votre propre matériel et de modifier les poids pour des cas d’usage précis. Ils permettent aussi à la communauté d’auditer le modèle à la recherche de biais, de développer des outils de sécurité et de publier des versions améliorées.

Des modèles comme Flux 1.1 Pro Ultra et Imagen 4 représentent des philosophies différentes sur ce spectre : certains privilégient l’accessibilité grâce aux poids ouverts, tandis que d’autres restent propriétaires pour des raisons de qualité ou de sécurité.

Développeur open source en réunion dans une salle de conférence vitrée, avec des graphiques GitHub projetés

Le fine-tuning après le pré-entraînement

LoRA et adaptateurs

Le pré-entraînement produit un modèle à usage général, mais ce n’est presque jamais l’étape finale. Le fine-tuning adapte un modèle pré-entraîné pour qu’il performe mieux sur un domaine ou un style précis. Le problème est que le fine-tuning complet d’un modèle à un milliard de paramètres est coûteux et lent.

LoRA (Low-Rank Adaptation) contourne ce problème en gelant les poids d’origine du modèle et en insérant de petites matrices entraînables dans des couches précises. Au lieu de tout réentraîner, vous n’entraînez que les poids de l’adaptateur LoRA, qui représentent une infime fraction du nombre total de paramètres. Le résultat est un modèle qui se comporte différemment de façon ciblée tout en conservant l’ensemble de ses connaissances de base.

C’est exactement ainsi que fonctionne Flux Dev LoRA sur PicassoIA. Le modèle Flux Dev de base reste fixe, pendant qu’un petit ensemble de poids appris oriente le résultat vers des styles visuels, des personnages ou des sujets précis. Toute personne disposant d’un matériel modeste peut entraîner un LoRA sur quelques centaines d’images et obtenir un modèle qui génère de façon fiable une esthétique spécifique.

Poste de travail à domicile avec un GPU visible dans une tour d’ordinateur, exécutant un script de fine-tuning dans un terminal

RLHF et alignement

Pour les modèles de langage et, de plus en plus, pour les générateurs d’images, l’apprentissage par renforcement à partir de retours humains (RLHF) est utilisé après le pré-entraînement pour mieux aligner les résultats sur ce que les gens veulent réellement. Le processus consiste à faire noter les résultats du modèle par des évaluateurs humains, à entraîner un modèle de récompense distinct à partir de ces notes, puis à utiliser l’apprentissage par renforcement pour orienter le modèle principal vers les comportements les mieux notés.

Le RLHF distingue un modèle pré-entraîné brut, capable de produire n’importe quoi, d’un modèle qui produit de façon fiable des résultats utiles, sûrs et de haute qualité. Il est coûteux en calcul et demande une conception soignée, mais son effet sur la qualité perçue des résultats est considérable.

Manuel ouvert affichant des équations de rétropropagation, avec un crayon posé sur la notation mathématique

Le matériel nécessaire

Grappes de GPU à grande échelle

Entraîner un grand modèle d’IA demande une grappe coordonnée de centaines, voire de milliers de GPU fonctionnant en parallèle pendant des semaines ou des mois. Les entraînements actuels pour les modèles de pointe utilisent des grappes NVIDIA H100 reliées par NVLink à haute bande passante et par un réseau InfiniBand, afin de répartir le calcul sur des milliers de puces simultanément.

Le parallélisme est nécessaire pour une raison simple : une seule passe avant-arrière dans un grand modèle produit plus d’opérations en virgule flottante qu’un GPU isolé ne peut en accomplir dans un délai raisonnable. Répartir le travail sur de nombreux GPU, chacun traitant une tranche des données ou un segment du modèle, est la seule approche praticable à grande échelle.

Vue en contre-plongée d’une installation massive de baies de serveurs GPU dans un centre de données hyperscale

Pourquoi l’entraînement coûte des millions

Un seul GPU NVIDIA H100 coûte plus de 25 000 $, et un entraînement compétitif peut en mobiliser des milliers pendant des mois. À cela s’ajoutent l’électricité (les grands entraînements consomment des mégawatts), l’infrastructure de refroidissement, les frais de calcul dans le cloud et le travail des équipes de recherche.

C’est pourquoi seule une poignée d’organisations peut entraîner de très grands modèles de fondation à partir de zéro. La communauté open source s’appuie généralement sur ces modèles de fondation par fine-tuning et adaptation, ce qui coûte des ordres de grandeur de moins et produit tout de même des résultats remarquables.

Approche d’entraînementCoût approximatifQui s’en charge
Pré-entraînement à partir de zéro$1M à $100M+Grands laboratoires de recherche, startups bien financées
Fine-tuning complet$10K à $500KÉquipes de recherche de taille moyenne
Fine-tuning LoRA$50 à $5 000Chercheurs individuels, petites équipes
InférenceQuelques cents par requêteTout le monde

Les modèles open source qui alimentent l’art par IA aujourd’hui

Flux, Stable Diffusion et autres

Les modèles qui alimentent la génération d’images par IA moderne descendent presque tous de la tradition open source. Stable Diffusion a démontré en 2022 qu’un modèle de génération d’images de haute qualité pouvait être entraîné puis publié ouvertement, déclenchant une explosion d’innovations communautaires. Des milliers de fine-tunes, de LoRA et de modèles dérivés ont suivi en quelques mois.

Flux Dev et Flux Pro de Black Forest Labs représentent l’étape suivante : une architecture basée sur des transformers, entraînée à plus grande échelle, avec une compréhension du texte et un photoréalisme nettement améliorés. La démarche d’entraînement s’appuie sur les mêmes principes que ceux décrits dans cet article, appliqués avec davantage de données, davantage de calcul et des raffinements architecturaux qui ont amélioré la cohérence et le respect du prompt.

SDXL a élargi le Stable Diffusion original en augmentant à la fois la taille du modèle et celle du jeu de données d’entraînement, ce qui a produit des résultats nettement plus détaillés et à plus haute résolution. Stable Diffusion 3.5 Large est allé encore plus loin en adoptant une architecture de transformer de diffusion multimodal, qui produit des compositions plus nettes et un meilleur alignement sémantique.

Chacun de ces modèles est passé par le même processus fondamental : curation du jeu de données, pré-entraînement avec minimisation de la perte par descente de gradient, puis fine-tuning pour aligner les résultats sur les préférences humaines.

Essayez-les dès maintenant sur PicassoIA

Professionnel de la création parcourant une grille d’images générées par IA sur un grand écran dans un studio à domicile

Tous les modèles évoqués ici sont accessibles directement sur PicassoIA. Pas d’installation locale, pas de configuration matérielle, pas besoin de gérer des fichiers de poids ni des environnements Python. Vous pouvez expérimenter avec :

  • Flux Dev : le modèle phare à poids ouverts de Black Forest Labs, idéal pour la génération photoréaliste détaillée.
  • Flux Schnell : la version distillée, plus rapide, conçue pour l’itération rapide et le prototypage.
  • Flux Dev LoRA : Flux Dev avec des adaptateurs LoRA personnalisés pour une génération de style précis.
  • SDXL : toujours l’un des modèles d’images open source les plus polyvalents disponibles.
  • Stable Diffusion 3.5 Large : la dernière architecture de Stability AI, avec les améliorations du transformer multimodal.
  • Flux 1.1 Pro : un rendu de qualité professionnelle issu de la famille Flux, avec un photoréalisme affiné.
  • Imagen 4 : le dernier modèle texte vers image de Google, avec un détail et un rendu des couleurs exceptionnels.

Utiliser dès maintenant les modèles entraînés

L’écart entre « comment fonctionne l’entraînement » et « ce que vous pouvez réellement créer » est plus petit qu’il n’y paraît. Lorsque vous saisissez un prompt dans une interface texte vers image, les poids interrogés sont le produit direct de tout ce qui a été décrit plus haut : des mois de curation des données, des milliards de mises à jour de gradient et un travail d’alignement minutieux. La qualité que vous voyez dans le résultat reflète des décisions prises à chaque étape de ce pipeline.

Pour la plupart des créateurs, l’essentiel n’est pas de savoir comment entraîner un modèle à partir de zéro, mais de savoir travailler avec les couches d’adaptation qui reposent sur les poids pré-entraînés. Les fine-tunes LoRA vous permettent d’orienter un modèle de base puissant vers un visage, un style artistique ou un concept visuel précis, à partir de quelques centaines d’images d’entraînement et d’un matériel modeste. C’est la partie de l’entraînement de l’IA open source réellement accessible aux particuliers aujourd’hui, dès maintenant, sans budget de recherche.

À essayer : si vous voulez voir comment différentes approches d’entraînement influencent la qualité des résultats, soumettez le même prompt à Flux Schnell, Flux Dev et SDXL côte à côte sur PicassoIA. Les différences de photoréalisme, de respect du prompt et de composition reflètent directement les choix d’entraînement faits pour chaque modèle.

Chaque fois que vous générez une image, vous êtes le dernier maillon d’un pipeline qui a commencé avec des pétaoctets de données, des milliards de mises à jour de paramètres et le travail collaboratif de chercheurs qui ont choisi de partager leurs travaux ouvertement. Les modèles de PicassoIA sont le résultat de ce travail, prêts à l’emploi sans toucher à une seule ligne de code d’entraînement.

Commencez par Flux Dev ou Stable Diffusion 3.5 Large et découvrez ce que des millions d’itérations d’entraînement peuvent produire à partir d’une seule phrase.

Partager cet article

Choisissez votre langue