Pourquoi l’upscaling par IA n’a rien de magique (et ce qu’il fait vraiment à vos photos)

Une plongée dans la mécanique réelle de la super-résolution par IA : pourquoi l’upscaling donne parfois des résultats saisissants et parfois d’étranges artefacts, et comment obtenir de meilleurs résultats de façon constante avec n’importe quelle image passée dans les meilleurs outils actuels.

Pourquoi l’upscaling par IA n’a rien de magique (et ce qu’il fait vraiment à vos photos)
Cristian Da Conceicao
Fondateur de Picasso IA

Vous avez vu les démonstrations. Une miniature floue et pixelisée est déposée dans un upscaler par IA, et quelques secondes plus tard, une image nette et détaillée apparaît. On dirait de la magie. Mais voici ce qui se passe réellement : ce nouveau détail ne se trouvait pas dans la photo d’origine. L’IA l’a prédit, à partir de motifs statistiques assimilés pendant l’entraînement. Une fois cette distinction bien intégrée, tout le reste de l’upscaling par IA (quand il fonctionne à merveille, quand il échoue et quand le résultat vous induit en erreur) commence à avoir du sens.

Ce que fait réellement l’upscaling par IA

Des pixels aux prédictions

L’interpolation traditionnelle (bicubique ou bilinéaire) étire simplement les pixels existants et mélange les valeurs de leurs voisins. Le résultat est une image plus grande, uniformément plus douce. Vous avez ajouté des pixels sans ajouter la moindre information.

L’upscaling par IA fonctionne différemment. Un réseau de neurones entraîné sur des millions de paires d’images, chacune composée d’une entrée basse résolution et de sa version haute résolution correspondante, assimile des motifs statistiques sur l’apparence du monde à un grossissement plus fort. Il modélise les textures qui tendent à apparaître quand on zoome sur de l’herbe. Il intériorise la manière dont les contours des photos d’architecture s’accentuent habituellement. Il répertorie à quoi ressemblent généralement les pores de la peau à 4x l’échelle d’origine.

Quand vous lui soumettez votre image, il ne récupère rien. Il prédit quel était probablement le détail, en s’appuyant sur ces motifs assimilés comme guide.

C’est le point le plus important à retenir sur l’upscaling par IA : il s’agit de prédiction, et non de restauration.

Vue macro du grain de pixels à la frontière entre zones nettes et zones floues d’une photographie, prise sur une table lumineuse avec un rétroéclairage froid

Le problème des données d’entraînement

Chaque modèle de super-résolution ne vaut que par les données sur lesquelles il a été entraîné. Un modèle entraîné massivement sur des portraits de studio professionnels ajoutera des pores de peau convaincants aux gros plans de visages. Donnez-lui une image macro d’un scarabée, et ce même raisonnement sur la texture de la peau sera appliqué à un sujet où il n’a rien à faire.

💡 Le modèle ne sait pas ce qu’il regarde. Il reconnaît seulement que certaines configurations de pixels tendent à correspondre à certaines structures haute résolution, d’après les exemples qu’il a traités pendant l’entraînement.

C’est pourquoi la qualité de l’upscaling varie fortement selon le sujet. Un modèle a pu traiter trente millions de visages humains pendant son entraînement, mais seulement quelques milliers d’images en gros plan de murs en pierre calcaire brute. Votre mur en calcaire sera upscalé nettement moins fidèlement que votre portrait, même si les deux images sources ont la même résolution et le même taux de compression.

La diversité des sujets du jeu de données d’entraînement est l’un des facteurs les moins évoqués de la qualité de l’upscaling, mais elle explique systématiquement pourquoi des résultats qui paraissent incohérents de l’extérieur sont en réalité très prévisibles, une fois que l’on sait ce qui se trouve à l’intérieur du modèle.

Pourquoi les résultats varient autant

Une retoucheuse photo contrariée face à un tirage flou de portrait épinglé sur un liège dans un studio faiblement éclairé

Images sources de mauvaise qualité

Le facteur le plus déterminant du résultat d’un upscaling est l’état de l’image source. C’est ici que la métaphore de la magie s’effondre complètement.

Si votre source est un JPEG fortement compressé, l’IA est confrontée à un problème inhabituel. Les artefacts de blocs JPEG ne sont pas du flou. Ce sont des corruptions de données qui créent des frontières carrées aux arêtes marquées là où la scène d’origine n’en avait aucune. L’upscaler doit décider si ces frontières dures représentent de vraies arêtes du sujet ou du bruit de compression. Il prend souvent de mauvaises décisions, soit en conservant les artefacts en blocs dans le résultat, soit en les étalant en grosses taches cireuses.

Le flou de bougé pose un problème encore plus difficile. Un visage flouté par la vibration de l’appareil pendant une longue exposition a véritablement perdu de l’information spatiale. Ce flou n’est pas un problème de résolution. Les données de forme ne sont tout simplement pas là. Aucune inférence statistique ne peut reconstruire un visage qui était en mouvement.

Voici un aperçu pratique de la manière dont les conditions courantes d’une source interagissent avec l’upscaling par IA :

Condition de la sourceRésultat de l’upscaling
Photo nette, basse résolution nativeExcellent. Des contours nets fournissent au modèle une entrée solide
Mise au point optique douce (faible profondeur de champ)Bon. Les dégradés doux s’upscalent sans artefacts majeurs
Artefacts de blocs JPEGMédiocre. Le modèle confond les bords de blocs avec une vraie structure
Flou de bougé ou vibrations de l’appareilMédiocre. L’information de forme est perdue, pas seulement la résolution
Film numérisé avec grainVariable. Dépend fortement des données d’entraînement du modèle
Capture d’écran ou enregistrement d’écranBon. Pixels propres, contraste marqué, contours définis
Image web fortement sous-échantillonnéeMédiocre. Les multiples rééchantillonnages cumulent les erreurs

Le sujet compte

Des sujets différents donnent des résultats très différents, même avec le même modèle au même facteur d’agrandissement, sur des images de qualité d’origine similaire :

  • Visages humains : la plupart des modèles y sont les plus performants. Les jeux de données d’entraînement penchent fortement vers les portraits
  • Textes et chiffres : souvent déformés. L’IA lit une forme de glyphe approximative et devine le caractère
  • Motifs répétitifs fins : les tissages, les moustiquaires et les mailles créent tous du moiré à certains facteurs d’agrandissement
  • Fourrure et plumes d’animaux : cela dépend du modèle. Certains s’en sortent bien, d’autres produisent un lissage plastique
  • Architecture : généralement fiable, mais l’arrondi des angles et l’adoucissement des géométries sont des points de défaillance fréquents
  • Scènes de nuit bruitées : difficile. Les motifs de bruit concurrencent les détails réels de la scène pour l’attention du modèle

Le problème des hallucinations

Quand l’IA invente de faux détails

Le terme « hallucination » est emprunté à la terminologie plus large de l’IA. En super-résolution, il désigne le cas où le modèle ajoute un détail d’apparence plausible mais factuellement inexact par rapport à la scène d’origine.

L’exemple le plus clair : vous upscalez une photo d’une personne portant une chemise imprimée. L’original est trop peu résolu pour montrer clairement le motif. L’IA invente un motif de tissu réaliste, parce qu’elle a traité des milliers de chemises imprimées en haute résolution et sait à quoi elles ressemblent généralement. Mais le motif qu’elle invente n’a rien à voir avec celui qui se trouvait réellement sur la chemise. Quelqu’un qui ne connaît pas l’original ne le remarquera pas. Quelqu’un qui le connaît verra immédiatement que c’est faux.

Portrait en très gros plan avec une netteté rasoir sur des cils individuels, la texture de l’iris et de fins pores de peau

C’est pourquoi l’upscaling par IA suscite la controverse dans les usages judiciaires, journalistiques et d’archivage. Le résultat est esthétiquement plausible mais pas factuellement exact. Ces deux qualités ne sont pas la même chose.

Visages, texte et motifs fins

Trois catégories où l’hallucination est la plus visible et la plus lourde de conséquences :

Visages : l’IA ajoute une texture de peau, des détails de pores et une netteté des cils d’un réalisme frappant. En photographie de portrait, c’est souvent souhaitable. Pour la vérification d’identité ou la documentation, cela devient un problème, car les traits ajoutés sont inventés, et non récupérés.

Texte : le petit texte est presque toujours déformé dans les images upscalées. Le modèle voit la forme approximative d’un glyphe et reconstruit ce qu’il pense être le caractère. De mauvais caractères apparaissent régulièrement. Ne vous fiez jamais à un texte upscalé pour son exactitude, quel que soit le contexte.

Motifs fins : tissages, grillages, tôles perforées et textures d’écran créent tous de l’aliasing lorsqu’ils sont upscalés. La fréquence de répétition du motif interfère avec la grille de pixels et produit des artefacts visibles de ringing et de moiré autour des contours.

💡 Si l’exactitude compte davantage que l’apparence, utilisez la source d’origine à basse résolution, et non une version upscalée.

Comparer les principales approches

ESRGAN et ses descendants

Real-ESRGAN fait partie des architectures d’upscaling open source les plus largement déployées. Elle repose sur une structure de réseau antagoniste génératif, où un générateur produit des sorties haute résolution et un discriminateur pénalise tout ce qui ne paraît pas photographiquement réaliste. Le modèle s’entraîne sur des dégradations synthétiques, dont le flou, le bruit, les artefacts JPEG et leurs combinaisons, afin de gérer les entrées désordonnées que présentent les photos réelles.

La force de cette approche tient à la qualité du rendu. Les images ressortent nettes et détaillées, avec une structure de grain naturelle et des textures de surface réalistes. Le revers est une hallucination de détails occasionnelle, en particulier sur les visages et le texte, car la mission du générateur est de paraître réaliste, pas d’être exact.

Deux tirages d’architecture côte à côte sur une surface blanche, montrant la différence entre des arêtes d’origine nettes et des arêtes upscalées cireuses et trop retravaillées

Crystal Upscaler repose sur cette architecture, avec des modifications adaptées au travail sur les portraits, qui réduisent la tendance au sur-accentuage et améliorent la précision autour des transitions de la peau. Clarity Pro Upscaler pousse plus loin l’accentuation créative, en ajoutant une texture visible qui rend les images plus détaillées, au prix d’un écart légèrement plus grand par rapport à la source.

L’upscaling par diffusion

Les upscalers par diffusion, plus récents, traitent la super-résolution comme un problème génératif plutôt que comme un problème de régression. Ils partent d’une version bruitée de l’entrée basse résolution et la débruitent par itérations vers une sortie haute résolution, guidés par les pixels d’origine sans y être strictement contraints.

Recraft Creative Upscale utilise cette approche pour ajouter de la profondeur et des détails inventés à fort grossissement. Les résultats paraissent plus riches que ceux des sorties GAN, mais ils s’écartent davantage de la source. Cela fonctionne bien pour les projets créatifs où l’objectif est une image de haute qualité, et non un agrandissement fidèle.

Recraft Crisp Upscale adopte l’approche inverse, en privilégiant la fidélité à l’original plutôt que l’ajout de texture créative. C’est le meilleur choix lorsque vous avez besoin que l’image agrandie corresponde à ce qui se trouvait réellement dans le cadre.

Pour les facteurs d’agrandissement les plus élevés, Image Upscale by Topaz Labs prend en charge un agrandissement allant jusqu’à 6x avec une bonne préservation des détails, et Google Upscaler livre des résultats 4x propres avec un minimum d’artefacts de traitement. Pour un upscaling rapide et polyvalent sur tout type d’image, P Image Upscale produit des résultats nets en une seconde environ. Pour les photos anciennes ou abîmées, Increase Resolution by Bria est conçu spécifiquement pour les besoins de restauration.

Utiliser la super-résolution sur PicassoIA

Un retoucheur photo devant une station de travail à double écran, tenant une bande imprimée et la comparant à la version affichée à l’écran

Choisir le bon modèle

PicassoIA vous donne accès à neuf modèles de super-résolution au même endroit. Voici comment choisir le bon pour votre entrée :

Cas d’usageModèle recommandé
Photos générales, tous sujetsP Image Upscale
Photos de portrait et de visagesCrystal Upscaler
Détail maximal avec texture créativeClarity Pro Upscaler
Photos anciennes, abîmées ou numériséesIncrease Resolution
Upscaling maximal en 6xImage Upscale
Rester proche du détail d’origineRecraft Crisp Upscale
Ajouter de la profondeur créativeRecraft Creative Upscale
4x propre sans artefactsGoogle Upscaler

Pas à pas sur PicassoIA

  1. Rendez-vous dans la section super-résolution de PicassoIA et sélectionnez un modèle dans le tableau ci-dessus
  2. Importez votre image source dans le meilleur format disponible (PNG ou TIFF de préférence plutôt que JPEG)
  3. Sélectionnez votre facteur d’agrandissement (2x, 4x ou 6x selon le modèle)
  4. Lancez la prédiction et attendez le résultat
  5. Téléchargez le résultat et zoomez à 100 % avant de décider s’il répond à vos besoins
  6. Si le premier modèle ne donne pas ce dont vous avez besoin, essayez un second modèle sur la même image source

💡 Évaluez toujours les images upscalées à 100 % de zoom. Les miniatures rendent tout net. Les défauts n’apparaissent qu’à plein grossissement.

Quand utiliser l’upscaling par IA

Une vaste prairie vallonnée à l’heure dorée, avec des brins d’herbe d’une netteté rasoir au premier plan et des chênes détaillés à mi-distance

Les cas où cela fonctionne bien

La super-résolution par IA tient véritablement ses promesses lorsque :

  • Vous disposez d’un original propre et net, et avez simplement besoin de l’imprimer en plus grand
  • Vous travaillez avec des photographies argentiques numérisées en bon état, sans dégâts des eaux ni rayures importantes
  • Vous devez agrandir un portrait et souhaitez qu’une texture de peau d’apparence réaliste soit ajoutée au passage
  • Vous préparez des images pour l’impression grand format, où un léger détail issu de la prédiction est acceptable
  • Le sujet est quelque chose sur lequel le modèle a été fortement entraîné : personnes, objets courants, paysages

Les cas où cela montre ses limites

Évitez l’upscaling par IA, ou appliquez-le avec prudence, lorsque :

  • La source présente d’importants artefacts de blocs JPEG (nettoyez-les d’abord avec un outil dédié)
  • L’image présente du flou de bougé ou des vibrations de l’appareil (l’information manque réellement, elle n’est pas simplement réduite)
  • Vous devez lire ou vérifier un texte présent dans le cadre
  • Le résultat servira à la vérification d’identité, au journalisme ou à l’archivage documentaire
  • Le sujet contient des motifs répétitifs fins : tissage de tissu, grillage métallique, tôle perforée ou captures d’écran d’interfaces à motifs

Une amélioration de flux de travail pratique pour les sources endommagées : appliquez les outils de restauration de PicassoIA sur l’image source avant la super-résolution. Nettoyer d’abord, upscaler ensuite donne presque toujours de meilleurs résultats que d’upscaler directement une source abîmée.

Obtenir de meilleurs résultats

Préparer l’image avant l’upscaling

Vue à plat de photographies imprimées et d’une loupe sur un bureau en bois, avec des notes manuscrites et une tasse de café

Une qualité de sortie constante vient d’une qualité d’entrée constante. Ces étapes améliorent de façon fiable les résultats avant de passer quoi que ce soit dans un modèle de super-résolution :

  1. Supprimez d’abord les artefacts de compression. Les blocs JPEG déroutent les modèles d’upscaling. Une légère passe de débruitage ou un outil dédié de suppression d’artefacts avant l’upscaling donne à l’IA des contours plus propres sur lesquels travailler.
  2. N’upscalez pas plus que nécessaire. Un upscaling 2x à partir d’un original bien exposé paraît souvent meilleur qu’un 4x à partir de la même image, même si votre taille d’impression finale exige un 4x. Upscaler en deux étapes (2x, puis encore 2x) produit parfois un résultat plus propre qu’une seule passe en 4x.
  3. Accentuez la source avant l’upscaling. Si la source est légèrement douce, un léger masque de netteté appliqué avant l’upscaling donne à l’IA un signal plus clair sur la position réelle des contours, ce qui produit un résultat plus net à l’arrivée.
  4. Utilisez des formats d’entrée sans perte. Donnez au modèle un fichier PNG ou TIFF, et non un JPEG. Chaque recompression JPEG ajoute des artefacts qui s’accumulent lors de l’upscaling.

Post-traitement après l’upscaling

La sortie brute d’un modèle de super-résolution n’est que rarement l’étape finale. Voici les corrections courantes qui améliorent le résultat upscalé :

  • Adoucissez l’accentuation agressive. Beaucoup de modèles ajoutent un contraste de contours marqué qui peut paraître artificiel. Un très léger flou de 0,3 à 0,5 pixel en post-traitement ramène le résultat à un aspect naturel.
  • Ajoutez un léger grain de film. Les images upscalées paraissent parfois trop lisses ou plastiques. Ajouter un bruit fin correspondant à l’émulation de votre film d’origine restitue une qualité photographique naturelle.
  • Inspectez manuellement les zones de texte. Tout texte de la sortie upscalée doit être comparé caractère par caractère à la source. Corrigez les mauvais caractères si l’exactitude compte un tant soit peu.
  • Recadrez et composez après l’upscaling. Donnez au modèle le plus de contexte possible. Ne recadrez pas avant la super-résolution : le modèle s’appuie sur les pixels environnants pour fonder chaque prédiction.

L’écart entre attentes et réalité

Une photo de famille ancienne des années 1960 posée sur un bureau en bois ancien, présentant des tons sépia délavés, des taches d’eau et des rayures de surface

L’écart de perception autour de l’upscaling par IA vient de la manière dont les démonstrations sont sélectionnées. Elles montrent presque toujours un scénario idéal : une photo propre et bien exposée d’un sujet humain, une compression minimale, un facteur d’agrandissement modeste. Dans ces conditions, les résultats sont vraiment remarquables.

Les entrées réelles sont plus désordonnées. Des captures d’écran enregistrées depuis les réseaux sociaux, des diapositives numérisées avec poussière et rayures, des photos de concert de 2014, des images de téléphone prises en faible lumière avec une réduction de bruit agressive intégrée. Ce sont les entrées avec lesquelles la plupart des gens travaillent réellement, et ce ne sont pas celles que montrent les démonstrations.

Comprendre ce que fait réellement l’IA, à savoir prédire un détail plausible à partir de motifs statistiques, aide à calibrer les attentes avec justesse. Vous obtiendrez des résultats régulièrement solides si vous partez d’entrées propres et d’objectifs d’échelle réalistes. Vous obtiendrez des résultats irréguliers ou décevants si vous demandez au modèle de reconstruire une information qui n’était jamais là.

La différence entre un modèle qui « fonctionne » et un modèle qui « ne fonctionne pas » pour vos images ne vient souvent pas du modèle lui-même. Elle vient de l’état de la source.

Cela dit, les neuf modèles disponibles sur PicassoIA couvrent un large éventail de types d’entrées et d’objectifs. Faire passer la même image source dans Real-ESRGAN, Crystal Upscaler et Topaz Image Upscale simultanément, puis comparer les sorties à 100 % de zoom, est un moyen rapide et pratique de trouver le meilleur choix pour une image donnée. Chaque modèle fait des paris statistiques différents sur ce que le détail manquant était probablement. Voir ces différents paris côte à côte est le moyen le plus rapide d’acquérir une intuition fiable sur le modèle à privilégier en premier.

Essayez avec vos propres images

Une jeune professionnelle de la création dans un bureau domestique scandinave lumineux, tenant une tablette et regardant avec satisfaction le résultat upscalé à l’écran

Le moyen le plus rapide de bâtir une véritable intuition sur ce que l’upscaling par IA peut et ne peut pas faire consiste à passer vos propres images dans plusieurs modèles différents et à comparer les résultats à plein zoom. Aucune quantité de lecture ne remplace l’expérience directe avec des images que vous connaissez bien.

PicassoIA réunit les neuf modèles de super-résolution au même endroit, ce qui vous permet de comparer Real-ESRGAN avec Google Upscaler et Topaz Image Upscale sans changer de compte ni de plateforme. Vous pouvez aussi passer de P Image Upscale pour des tests rapides à Clarity Pro Upscaler lorsque vous voulez pousser le détail fin aussi loin que possible.

Commencez par une image que vous connaissez bien, un sujet dont vous vous souvenez à quoi il ressemblait réellement. Ce point de repère fait immédiatement apparaître là où l’IA a inventé un détail plausible mais faux, et là où elle a vraiment obtenu le bon résultat. Après quelques sessions, vous aurez une idée précise des modèles qui conviennent à chaque type d’entrée, et ce savoir pratique vous fera gagner beaucoup de temps sur vos projets réels.

Rendez-vous sur picassoia.com/en/all-models pour parcourir toute la gamme de super-résolution et lancer votre première image.

Partager cet article

Choisissez votre langue