La qualité des images NSFW générées par IA a beaucoup changé (et voici pourquoi c’est important)

La qualité des images NSFW générées par IA a radicalement changé ces dernières années : des rendus en plastique à l’anatomie déformée, on est passé à des résultats presque photographiques qu’il faut examiner de près. Cet article détaille ce qui a changé, les modèles à l’origine de cette évolution, et comment le rendu de la peau, la physique de l’éclairage et la précision anatomique en sont arrivés là.

La qualité des images NSFW générées par IA a beaucoup changé (et voici pourquoi c’est important)
Cristian Da Conceicao
Fondateur de Picasso IA

Il y a deux ans, si vous demandiez à une IA de générer une femme photoréaliste sur une plage, vous obteniez quelque chose qui ressemblait à une figure de cire en train de fondre au soleil. Peau raide, proportions fausses, yeux vitreux sans profondeur, éclairage qui n’avait aucun sens physique. On reconnaissait ces images comme étant de l’« IA » à trois mètres. Aujourd’hui, ce même prompt produit des résultats qui laissent sans voix, des images qu’il faut examiner de près pour les distinguer d’une véritable photographie. La qualité des images NSFW générées par IA a beaucoup changé, et cette évolution s’est produite plus vite que presque tout le monde dans le domaine ne l’anticipait.

Des pixels flous au photoréalisme

Il existe, dans la génération d’images par IA, un avant et un après qui ne passe pas inaperçu. La coupure se situe à peu près au milieu de l’année 2023, et tout ce qui se trouve de l’autre côté paraît aujourd’hui daté.

À quoi ressemblaient vraiment les premières images d’IA

Les premiers modèles de diffusion produisaient des images avec des défauts caractéristiques, devenus des mèmes à part entière. Des mains à six doigts. Des dents qui se fondaient en une seule masse. Des yeux légèrement décalés. Une peau au reflet lisse et plastique qui ne ressemblait jamais vraiment à de la chair. Les cheveux formaient souvent un enchevêtrement de mèches mal définies, et la texture des tissus était suggérée plutôt que rendue.

Pour les contenus NSFW, ces limites étaient brutales. Tout l’intérêt de cette catégorie d’images repose sur la crédibilité. Un léger défaut sur le visage rompt immédiatement le charme. Une silhouette aux proportions anatomiquement douteuses paraît inquiétante plutôt qu’attirante. Les modèles généraient des choses techniquement suggestives, mais visuellement peu convaincantes.

Femme à l’heure dorée sur un toit, détail photoréaliste de la peau obtenu avec l’émulation du film Kodak Portra 400

Le premier virage : SDXL et le saut de résolution

Le premier bond qualitatif significatif est venu avec SDXL, la réponse de Stability AI aux limites de détail des modèles précédents. Passer à une résolution de base plus élevée et à un pipeline de génération en deux étapes a permis aux images de contenir davantage de détails fins sans se dégrader en bruit. Les visages sont devenus plus stables. Les mains se sont améliorées, même si elles restaient un point faible.

Plus important encore, SDXL a introduit l’écosystème des modèles checkpoint affinés, capables de se spécialiser. Une fois une base solide établie, la communauté a produit des modèles entraînés spécifiquement sur des jeux de données photographiques, comme Realistic Vision v5.1 et RealVisXL v3.0 Turbo, qui ont poussé vers un photoréalisme authentique avec un rendu de la peau nettement amélioré.

💡 Ce qui a changé : le passage de SD 1.5 à SDXL n’a pas été une amélioration progressive. Ce fut un progrès qualitatif, dans la manière dont le modèle conservait les détails à pleine résolution, en particulier sur les visages et les textures fines.

Les modèles qui ont tout changé

La véritable révolution s’est produite par vagues, chacune relevant le niveau minimal de ce qui était considéré comme un résultat acceptable.

Flux et le nouveau standard

Flux Dev, de Black Forest Labs, a offert une sensation réellement différente de tout ce qui l’avait précédé. Là où les modèles antérieurs peinaient à maintenir la cohérence sur l’ensemble du cadre, Flux produisait des images au détail constant d’un bord à l’autre. L’éclairage se comportait de manière physique. Les tissus tombaient avec du poids. La peau présentait une diffusion sous la surface, cette légère translucidité où la lumière traverse les tissus fins, au niveau des oreilles et des doigts, que les modèles précédents n’avaient jamais réussi à reproduire.

Flux 1.1 Pro Ultra a poussé cette approche plus loin grâce à une génération native en haute résolution, ce qui signifie que le modèle n’upscalait pas une image plus petite, mais effectuait le rendu à pleine résolution dès le départ. La différence est visible : aucun adoucissement dû à l’étape d’upscaling, aucune perte des détails de fréquence intermédiaire dans la texture de la peau. Pour les usages NSFW en particulier, cela a fait une différence décisive.

Plan bas en contre-plongée sur une plage, texture photoréaliste de la peau et éclairage naturel, objectif 24 mm Kodak Ektar

La dernière génération, Flux 2 Pro et Flux 2 Max, affine encore l’architecture. Les couleurs sont plus riches sans être sursaturées. La plage tonale des ombres et des hautes lumières se rapproche davantage d’une photographie correctement exposée que de la plage légèrement compressée des modèles d’IA antérieurs. Les scènes complexes avec plusieurs sujets tiennent désormais ensemble au lieu de dériver vers l’incohérence.

Realistic Vision et une peau d’une grande justesse

Les modèles de photoréalisme conçus spécifiquement, comme Realistic Vision v5.1, ont montré ce que le fine-tuning sur des données photographiques sélectionnées pouvait accomplir. Ces modèles ont été entraînés sur des images dont la référence était de véritables photographies, et non des données synthétiques, ce qui leur a permis d’apprendre les schémas statistiques de la vraie peau : sa variation constante, l’apparence des pores sous une lumière rasante, la façon dont la couleur passe de la joue à la mâchoire.

Pour les contenus NSFW, cela a compté énormément. La différence entre attirant et inquiétant dans une silhouette générée par IA tient souvent à quelques décisions de rendu de la peau : la texture présente-t-elle une variation naturelle, ou est-elle uniforme d’une manière que la peau ne l’est jamais ? L’éclairage produit-il des dégradés d’ombre appropriés sur les courbes du corps ? L’image possède-t-elle ces micro-imperfections qui donnent l’impression d’une prise de vue plutôt que d’une synthèse ?

Portrait en très gros plan montrant le détail des pores, peau translucide, motifs de fibres de l’iris sous un objectif macro 100 mm

Stable Diffusion 3.5 et la profondeur de composition

Stable Diffusion 3.5 Large a apporté ce qui manquait aux modèles précédents : une meilleure compréhension de la composition. Il ne s’agissait pas seulement de la qualité du rendu, mais de la mise en place des sujets dans des environnements cohérents sur le plan physique. Les ombres tombaient dans les bonnes directions. Les sources de lumière ambiante affectaient l’ensemble de la scène de façon cohérente. La profondeur de champ donnait l’impression d’une véritable propriété optique plutôt que d’un flou appliqué après coup.

Cette amélioration de la composition compte particulièrement pour les scènes NSFW, car la crédibilité dépend autant de l’environnement que de la silhouette. Un sujet magnifiquement rendu placé devant un arrière-plan physiquement impossible rompt immédiatement le réalisme. Les améliorations architecturales de SD 3.5 ont fait fonctionner l’ensemble du cadre comme un tout.

Ce que « qualité » signifie vraiment dans l’IA NSFW

Dans ce contexte, la qualité ne se résume pas à un seul élément. C’est un ensemble de problèmes de rendu distincts qu’il faut résoudre simultanément.

La texture de la peau est le véritable test

La peau humaine est l’une des surfaces les plus complexes qu’un modèle génératif doive reproduire. Elle n’a pas une couleur uniforme, ni une texture uniforme, ni un éclairage uniforme. Une même zone de peau paraîtra complètement différente selon l’angle de la lumière qui la frappe. Sous une lumière latérale rasante, chaque pore projette une minuscule ombre. Sous une lumière diffuse venant du dessus, la texture s’aplatit. Au niveau de l’oreille, la lumière traverse les tissus et les rend translucides, d’un rose vif.

Les modèles antérieurs produisaient une peau lisse d’une manière qu’aucune peau humaine n’est réellement. La nouvelle génération, en particulier les modèles basés sur Flux et GPT Image 1.5, traite la peau comme un matériau optique complexe doté de propriétés sous-surfaciques réelles. Le résultat : des images qui paraissent photographiées plutôt que rendues.

ModèleTexture de la peauPrécision de l’éclairageAnatomieRéalisme global
SD 1.5 (2022)Lisse/plastiqueFaibleIncohérenteFaible
SDXL (2023)AmélioréeMoyenneMeilleureMoyen
Flux Dev (2024)ÉlevéeBonneSolideÉlevé
Flux 1.1 Pro UltraExcellenteExcellenteTrès bonneTrès élevé
Flux 2 MaxQuasi photographiqueExcellenteExcellenteQuasi photographique

Éclairage, ombres et atmosphère

L’éclairage est le domaine où les modèles d’IA ont historiquement le plus clairement échoué, et c’est là que l’amélioration a été la plus spectaculaire. Les premiers modèles appliquaient l’éclairage comme une sorte d’étalonnage colorimétrique, une teinte chaude ou froide qui suggérait une source lumineuse sans en simuler réellement une. Les ombres ne correspondaient pas aux positions lumineuses implicites. Les hautes lumières se brûlaient sans la transition progressive de la photographie réelle.

Les modèles actuels, en particulier Imagen 4 et Imagen 4 Ultra de Google, gèrent l’éclairage avec une véritable précision physique. Un sujet placé près d’une fenêtre aura des reflets dans les yeux qui correspondent à la position de cette fenêtre. L’ombre sur son cou tombera selon l’angle correct. La lumière de remplissage ambiante, renvoyée par le mur, teintera convenablement la zone d’ombre. C’est de la photographie, et non une approximation.

Vue aérienne en plongée depuis un drone, plage de sable volcanique, femme en bikini noir, lumière zénithale de midi, photoréaliste 8k

Anatomie et proportions

Le problème anatomique de la première IA ne se limitait pas aux doigts. Il s’agissait d’un échec général du raisonnement spatial : le modèle n’avait pas de représentation interne solide de la manière dont un corps humain occupe l’espace en trois dimensions. Les torses étaient parfois trop longs ou trop courts. Les épaules pouvaient être très asymétriques. Les silhouettes assises présentaient des proportions qui n’avaient aucun sens géométrique à l’examen attentif.

Les modèles actuels ont largement résolu ce problème pour les poses standard. Une silhouette debout ou allongée, en plan moyen, présentera des proportions qui résistent à l’examen. Les défaillances restantes apparaissent surtout dans les angles inhabituels, les raccourcis extrêmes ou les interactions complexes entre plusieurs sujets. Pour les usages créatifs NSFW typiques, le problème anatomique est en pratique résolu.

💡 Astuce de pro : si l’anatomie se dégrade encore dans des poses inhabituelles, Flux Schnell combiné au guidage de pose ControlNet peut verrouiller la structure de la silhouette avant la passe de détail.

Comment les plateformes ont rattrapé leur retard

La qualité du modèle ne détermine pas à elle seule la qualité du résultat. Les outils qui entourent le modèle comptent tout autant.

Résolution et outils d’upscaling

L’une des améliorations les plus marquantes concerne l’upscaling après génération. Les modèles de super-résolution peuvent désormais prendre une image de 1024x1024 et produire une version en 4096x4096 qui paraît réellement photographiée plutôt qu’agrandie par interpolation bilinéaire. La combinaison d’un modèle de base performant et d’une étape d’upscaling dédiée par super-résolution produit des résultats que le modèle de base seul ne peut atteindre, quel que soit son niveau. Chaque étape de la chaîne, de la génération initiale jusqu’à la passe d’upscaling, renforce la fidélité globale.

Femme en peignoir de spa devant une coiffeuse de salle de bain de luxe, lumière du matin à travers un verre dépoli, plan de travail en marbre, flacons de parfum en cristal

Inpainting et correction des zones problématiques

Même les meilleurs modèles produisent parfois une image parfaite à 95 % avec un défaut gênant. L’inpainting a beaucoup progressé parallèlement aux modèles eux-mêmes. Là où les premiers outils d’inpainting laissaient des coutures visibles et des textures mal raccordées, les outils actuels peuvent régénérer un visage, une main ou un élément d’arrière-plan avec une intégration sans couture. La zone masquée est régénérée en tenant pleinement compte du contexte environnant.

Pour les contenus NSFW, cela est particulièrement utile, car les images comportent souvent des zones précises, un visage ou une partie particulière du corps, où les exigences de réalisme sont les plus élevées. Pouvoir cibler ces zones pour une passe de qualité sans perturber le reste de la composition est une évolution du flux de travail qui augmente nettement la qualité atteignable.

Le prompt a lui aussi changé

Les meilleurs modèles exigent de meilleurs prompts pour exploiter pleinement leur niveau de qualité. Le langage de prompt qui fonctionnait pour SD 1.5 (« a beautiful woman, high quality, 4k ») donne des résultats médiocres sur les architectures modernes.

Écrire pour le photoréalisme

Le prompt photoréaliste moderne s’apparente davantage à la description d’un plan tel que la rédigerait un directeur de la photographie qu’à une liste de mots-clés. Au lieu de « beautiful skin, realistic », les prompts efficaces décrivent des phénomènes optiques précis : « diffusion sous la surface visible au niveau des oreilles », « éclairage à la Rembrandt créant une zone lumineuse triangulaire sur la pommette », « pores projetant des micro-ombres sous une lumière latérale rasante ».

💡 Ce qui fonctionne aujourd’hui : décrivez ce que fait la lumière, et pas seulement ce que contient la scène. « Une lumière matinale à 15 degrés, venant de la gauche, qui projette de longues ombres sur le lin » produit un éclairage nettement meilleur que l’expression générique « lumière naturelle ».

Femme en combinaison de satin vert forêt dans un jardin au crépuscule, lumière de l’heure bleue avec lanterne chaleureuse, roses en bokeh 85 mm f/1.4

Langage photographique et émulation de film

L’évolution la plus fiable du prompting a été l’adoption du vocabulaire photographique réel. Préciser une focale (85 mm contre 24 mm) modifie la compression spatiale de l’image et l’intensité du flou d’arrière-plan. Préciser une ouverture influe sur le rendu de la profondeur de champ. Des termes d’émulation de film comme « Kodak Portra 400 » ou « Fujifilm Pro 400H » indiquent au modèle des informations précises sur le rendu des couleurs, le caractère du grain et la courbe tonale, que des termes génériques comme « esthétique film » ne transmettent pas.

Cette précision explique en partie pourquoi les mêmes modèles qui donnent des résultats médiocres aux utilisateurs débutants produisent des résultats époustouflants pour les photographes qui formulent leurs prompts avec le vocabulaire de leur métier.

Femme sur un lit d’hôtel, texture de draps en coton égyptien blanc, lumière latérale de l’après-midi à travers des rideaux de lin, bralette en soie

De 2022 à 2026 : une comparaison directe

Les chiffres racontent une histoire, mais la comparaison visuelle est plus parlante. Voici ce qui a réellement changé, génération après génération :

ÉpoqueModèle de référencePeauMainsÉclairageCrédibilité
2022Stable Diffusion 1.5Plastique/lisse5 à 6 doigts fréquentsPlat/incohérentImmédiatement identifiable comme IA
2023SDXLTexture amélioréeSurtout correctesProfondeur moyenneReconnaissable comme IA
Début 2024Flux DevQuasi réalisteFiablesPhysiqueSouvent convaincant
Fin 2024Flux 1.1 Pro UltraPhotographiqueQuasi parfaitesExcellentDifficile à distinguer
2025-2026Flux 2 Max, Imagen 4 UltraIndiscernablePhotographiquesQuasi parfaitNécessite un examen attentif

La trajectoire ne ralentit pas. Chaque génération d’architecture a apporté des améliorations qui auraient semblé invraisemblables deux ans plus tôt.

Plan de révélation d’une piscine à débordement sur une villa en bord de falaise, vue sur la mer Méditerranée, lumière dorée de fin d’après-midi, peau humide qui luit

Où se situe aujourd’hui le plafond de qualité

La réponse honnête est que, pour les scénarios maîtrisés, les poses standard, les sujets uniques et un éclairage bien décrit, les modèles actuels ont pratiquement résolu le photoréalisme. Les images générées par Flux 2 Max, Imagen 4 Ultra et Seedream 4 demandent un examen attentif pour être distinguées de photographies. Les signes techniques typiques des premières images d’IA, la peau plastique, la dérive des yeux, l’incohérence de l’éclairage, ont disparu dans les usages courants.

Il reste des défis aux limites : les compositions complexes à plusieurs personnages, les poses extrêmes, le rendu de texte dans des environnements, et ces scènes réelles chaotiques que la photographie capture sans y penser. Ce sont encore des domaines de recherche actifs, et ils s’améliorent tous les quelques mois.

💡 Le plafond pratique : pour la création NSFW en particulier, le plafond de qualité est désormais limité presque uniquement par la maîtrise du prompt et le choix du modèle, et non par les limites architecturales du modèle. Un prompt bien construit sur un modèle performant comme Flux 1.1 Pro Ultra produira des résultats qui auraient été considérés comme techniquement impossibles en 2022.

Femme en chemise de lin blanc dans une cuisine baignée de soleil, jet de zeste d’agrume capturé en plein vol, lumière de fenêtre du matin, Kodak Portra 400

Voyez-le par vous-même

La meilleure façon de ressentir cette évolution de la qualité est de passer le même prompt à travers différentes générations de modèles, les unes après les autres. PicassoIA réunit tous ces modèles au même endroit : Flux Schnell pour itérer rapidement, Flux 1.1 Pro Ultra pour une qualité maximale, Realistic Vision v5.1 pour le style photographique affiné, et GPT Image 1.5 pour la vision d’OpenAI sur le réalisme.

Vous pouvez exécuter le même prompt sur chaque modèle et voir en temps réel la façon exacte dont le résultat diffère. Expérimentez avec le langage photographique : essayez d’écrire « 85 mm f/1.4, Kodak Portra 400, lumière matinale volumétrique venant de la gauche » lors de votre prochaine génération, et comparez le résultat avec un prompt générique. Les résultats vous montreront plus concrètement que n’importe quel article à quoi ressemble réellement l’évolution de la qualité. Choisissez un modèle, rédigez une description détaillée de scène, et voyez où se situe réellement le plafond actuel.

Partager cet article

Choisissez votre langue