Comment fonctionne l’amélioration vidéo par IA (et pourquoi elle compte vraiment)

Un regard détaillé sur les réseaux de neurones, les pipelines d’upscaling et les méthodes d’interpolation d’images qui font fonctionner les outils vidéo d’IA modernes. De la restauration de vieilles séquences à la production de contenus 4K nets, cet article décortique la science réelle derrière la façon dont l’IA voit et reconstruit la vidéo.

Comment fonctionne l’amélioration vidéo par IA (et pourquoi elle compte vraiment)
Cristian Da Conceicao
Fondateur de Picasso IA

La plupart des gens ont déjà regardé de vieilles séquences en se disant la même chose : pourquoi sont-elles si mauvaises ? La réponse ne tient pas seulement au temps. Elle tient à la physique, aux limites du matériel et à la manière fondamentale dont les caméras captaient la lumière avant l’apparition des capteurs modernes. Ce que l’IA fait aujourd’hui à ces images n’a rien de magique. C’est de la reconnaissance de motifs, exécutée à une échelle à laquelle l’œil humain ne peut pas rivaliser, appliquée à des millions de pixels, des dizaines de fois par seconde.

Voici comment cela fonctionne réellement.

Ce que la qualité vidéo signifie vraiment

Le problème que portent les images brutes

Chaque fichier vidéo est une suite d’images fixes individuelles appelées images (frames). Un clip standard à 24 ips contient 24 de ces images par seconde. Chaque image comporte un nombre fixe de pixels, et ces pixels portent trois valeurs : rouge, vert et bleu. La qualité d’une vidéo dépend de deux éléments : le nombre de pixels présents dans chaque image, et la quantité d’information que chaque pixel contient réellement.

Les vieilles séquences échouent sur les deux plans. Les caméras des années 80 et 90 filmaient en basse résolution. Les codecs de compression jetaient des informations de pixels pour économiser de l’espace de stockage. La pellicule se dégradait avec le temps, en introduisant du grain, des rayures et une dérive des couleurs. Le résultat est une image molle, bruitée et délavée.

Se contenter d’« agrandir » l’image ne règle pas le problème. Étirer une image en 480p jusqu’au 1080p ne fait que produire des pixels plus gros et plus flous. C’est pour cette raison que l’upscaling traditionnel a toujours donné de piètres résultats.

Ce que l’IA fait et que l’interpolation ne peut pas faire

L’upscaling traditionnel repose sur l’interpolation bicubique : il calcule la moyenne des pixels voisins pour combler les vides lorsqu’une image est étirée. Le résultat est toujours une supposition floue.

La super-résolution basée sur l’IA fonctionne autrement. Au lieu de calculer des moyennes, un réseau de neurones a vu des millions d’exemples de paires d’images en basse et en haute résolution. Il a appris à quoi ressemblent les détails haute fréquence (contours, textures, traits fins) lorsqu’ils manquent dans un contenu en basse résolution. Quand il traite vos images, il ne calcule pas de moyenne. Il prédit ce qui était probablement présent.

Gros plan d’une bande de film montrant la texture et le grain de la pellicule

La différence est spectaculaire. Un réseau de neurones peut ajouter des pores de peau crédibles à un visage flou, accentuer les fils individuels d’un tissu et reconstruire les contours du texte sans les halos parasites qui affectaient les anciennes méthodes.

Les modèles principaux au travail

Les réseaux de super-résolution

L’épine dorsale du traitement vidéo par IA est le modèle de super-résolution, souvent abrégé en SR. Il s’agit de réseaux de neurones convolutifs (CNN) ou, plus récemment, d’architectures basées sur la diffusion, entraînés spécifiquement pour agrandir des contenus visuels.

L’architecture la plus connue est ESRGAN (Enhanced Super Resolution Generative Adversarial Network). Elle utilise un réseau générateur qui produit le résultat agrandi et un réseau discriminateur qui compare ce résultat à de vraies images en haute résolution. Les deux réseaux s’affrontent pendant l’entraînement jusqu’à ce que le générateur devienne assez bon pour tromper le discriminateur de façon constante.

Le résultat est d’une netteté stupéfiante. Real ESRGAN Video applique cette architecture à des séquences vidéo, en traitant image par image pour produire une sortie en 4K à partir d’une source en basse résolution.

Data scientist analysant des grilles d’images vidéo sur deux écrans, de nuit

Interpolation d’images et estimation du mouvement

Un problème propre à la vidéo (par opposition aux images fixes) est la cohérence temporelle. Si vous agrandissez chaque image séparément, de légères différences dans la manière dont le modèle reconstruit les détails peuvent provoquer un scintillement. Le résultat doit rester cohérent dans le temps, et pas seulement dans l’espace, au sein d’une même image.

C’est là qu’interviennent l’estimation et la compensation du mouvement. L’IA analyse les vecteurs de mouvement entre les images, en suivant où se déplacent les objets, à quelle vitesse et dans quelle direction. Elle utilise ces données pour s’assurer que les détails reconstruits restent cohérents lorsque les objets traversent la scène.

L’interpolation d’images va plus loin. En analysant deux images existantes, le modèle génère une image intermédiaire qui s’insère logiquement dans le mouvement. C’est ainsi qu’une séquence à 24 ips devient une séquence à 60, voire 120 ips, sans que la caméra d’origine ait jamais capturé ces images supplémentaires.

Projecteur de film super 8 vintage diffusant un faisceau de lumière dans une pièce sombre

Réduction temporelle du bruit

Chaque capteur produit du bruit. Les séquences tournées en faible luminosité sont particulièrement touchées, avec une variation aléatoire des pixels qui ressemble à un grain statique. Si le grain du film peut être esthétiquement recherché, le bruit numérique est presque toujours indésirable.

La réduction de bruit traditionnelle travaillait sur une seule image à la fois : on floutait légèrement les pixels, le bruit s’atténuait, mais tous les détails fins s’atténuaient aussi. C’est un outil grossier.

La réduction temporelle du bruit basée sur l’IA analyse plusieurs images simultanément. En comparant la même zone sur plusieurs images adjacentes, le modèle distingue le bruit (aléatoire, qui change d’une image à l’autre) des détails réels (cohérents). Il supprime le bruit tout en préservant l’information d’image sous-jacente.

Comment l’IA lit chaque image

Couches convolutives et cartes de caractéristiques

Au sein d’un réseau de super-résolution, l’image d’entrée traverse une série de couches convolutives. Chaque couche applique un filtre sur l’ensemble de l’image, produisant une carte de caractéristiques qui met en évidence des propriétés précises : contours, textures, dégradés de luminosité, transitions de couleur.

Dans les premières couches, le réseau détecte des caractéristiques simples comme les contours horizontaux et verticaux. Dans les couches plus profondes, il les combine en éléments plus complexes : visages, textures de tissu, lettres, feuillages. Aux couches finales, le réseau a construit une représentation riche et multidimensionnelle de ce que contient l’image, et il s’en sert pour reconstruire la sortie en haute résolution.

Monteur vidéo professionnel devant un poste de travail équipé de plusieurs écrans

Pourquoi les données d’entraînement changent tout

La qualité d’un modèle de super-résolution est directement liée à la qualité et à la variété de ses données d’entraînement. Un modèle entraîné principalement sur des paysages aura du mal avec les visages. Un modèle entraîné sur du grain de pellicule gérera mieux ce grain qu’un modèle entraîné sur des images numériques propres.

Les meilleurs modèles commerciaux ont été entraînés sur des dizaines de millions de paires d’images et de vidéos, soigneusement sélectionnées pour couvrir des types de contenus variés : scènes d’intérieur et d’extérieur, visages, texte, mouvement, environnements peu éclairés, et bien plus. Cette diversité leur permet de bien se généraliser à des images du monde réel, au lieu de ne fonctionner que sur des contenus précis.

C’est aussi pourquoi des modèles comme Topaz Video Upscale se situent à un niveau différent des alternatives open source. Le pipeline d’entraînement propriétaire et la sélection du jeu de données représentent des années d’itérations sur des contenus réels, issus de vrais créateurs.

Upscaling ou restauration : deux problèmes différents

Ces termes sont souvent utilisés l’un pour l’autre, mais ils répondent à des défauts différents des images. Savoir quel problème vous avez réellement fait la différence entre un résultat net et un rendu retouché à l’excès.

Portrait en lumière naturelle de fenêtre façon Rembrandt, mettant en valeur la texture de la peau

Quand l’upscaling est ce dont vous avez besoin

L’upscaling résout le problème de résolution. Votre séquence source existe, elle est intacte, mais elle ne compte pas assez de pixels pour les écrans modernes. Une vidéo en 1080p sur un écran 4K paraît molle. Un vieil enregistrement en 480p est très mauvais sur n’importe quel moniteur récent.

Les modèles d’upscaling prennent ce faible nombre de pixels et en synthétisent d’autres, cohérents avec ce que l’image devrait contenir. Le matériau source n’est pas abîmé. Il lui faut simplement plus de résolution.

Crystal Video Upscaler gère ce cas directement, en produisant des séquences allant jusqu’à la 4K à partir de sources en définition standard ou HD. C’est l’outil adapté lorsque votre séquence est propre mais simplement en basse résolution.

Quand la restauration est le vrai besoin

La restauration traite les séquences endommagées : artefacts de compression, grain de pellicule, bruit numérique, dégradation des couleurs, lignes d’entrelacement issues de vieux enregistrements télévisés, et incohérences de fréquence d’images.

Un modèle de restauration ne se contente pas d’ajouter des pixels. Il supprime activement les informations d’artefacts qui n’ont rien à faire là, rétablit la fidélité des couleurs et stabilise le rendu visuel. Le travail est plus complexe, car le modèle doit distinguer le signal (le contenu réel de l’image) du bruit (dégât ou artefact), ce qui exige une bonne compréhension des conditions de capture d’origine.

Runway Upscale v1 combine les deux approches, en associant l’augmentation de la résolution à la suppression des artefacts pour produire un rendu propre et net à partir d’un matériau source dégradé.

Vue aérienne de boîtes de bobines de film anciennes et de vieilles photographies sur un bureau en bois

Ce qui change réellement dans le rendu

Résolution et netteté

Le résultat le plus visible du traitement vidéo par IA est une image plus nette et plus détaillée. Des détails fins invisibles dans la source deviennent nettement visibles dans le rendu : mèches de cheveux isolées, trame d’un tissu, texte sur les panneaux, traits du visage. Il ne s’agit pas de netteté au sens traditionnel (qui se contente d’accentuer le contraste sur les contours), mais d’une véritable reconstruction des détails haute fréquence.

Facteur de renduUpscaling traditionnelSuper-résolution par IA
Augmentation de la résolution2x à 4x (flou)2x à 4x (net, détaillé)
Qualité des contoursAuréolés, mousPropres, définis
Texture fineEstompéeReconstruite
Gestion des artefactsAucuneSuppression active
Cohérence du mouvementAucuneAnalyse temporelle

Suppression du bruit et du grain

Le bruit numérique disparaît grâce à l’analyse temporelle. Le grain de pellicule est plus nuancé : une suppression totale peut donner à la séquence un aspect clinique et trop retravaillé. Les meilleurs modèles permettent de contrôler la quantité de grain à conserver ou à supprimer, ce qui vous laisse garder une impression esthétique tout en éliminant le bruit purement technique.

💡 Astuce : pour des archives que vous voulez voir paraître naturelles, réglez la réduction de bruit entre 50 et 70 % plutôt qu’au maximum. Une suppression totale donne souvent à de vieilles images l’allure d’une séquence tournée la veille avec un téléphone bon marché.

Fluidité du mouvement

L’interpolation d’images ajoute des images pour augmenter la fluidité perçue. Une séquence à 24 ips traitée à 60 ips paraît nettement plus fluide, ce qui est particulièrement précieux pour les images de sport, les séquences au ralenti ou tout contenu à fort mouvement. Le modèle prédit ce qui doit apparaître entre les images à partir des vecteurs de mouvement, en produisant des transitions naturelles plutôt qu’estompées.

Directeur de la photographie examinant un moniteur de diffusion 4K dans un studio professionnel

Comment utiliser le traitement vidéo par IA sur PicassoIA

Crystal Video Upscaler

Crystal Video Upscaler, de philz1337x, est conçu pour les séquences en définition standard et HD qui ont besoin d’un gain de résolution jusqu’à la 4K. Pour obtenir les meilleurs résultats :

  • Entrée : utilisez la version la plus propre disponible de votre fichier source. Si vous avez plusieurs exports, choisissez celui au débit binaire le plus élevé.
  • Facteur d’échelle : commencez par 2x pour des séquences déjà en HD. Utilisez 4x pour des sources SD inférieures à 720p.
  • Netteté : laissez la valeur par défaut pour un rendu naturel. La pousser trop fort introduit des artefacts de ringing autour des contours très contrastés.
  • Sortie : le modèle produit du MP4. Pour un usage d’archive, exportez au débit binaire maximal disponible.

Topaz Video Upscale

Topaz Video Upscale est l’option de niveau professionnel, particulièrement performante sur les séquences bruitées et les matériaux aux conditions mixtes. Elle prend en charge une sortie en 4K et une interpolation à 120 ips.

  • Intensité de la réduction du bruit : réglez sur « Forte » pour les séquences de caméra tournées en faible luminosité. Utilisez « Faible » pour un matériau source bien éclairé afin d’éviter un rendu trop retravaillé.
  • Interpolation d’images : activez-la uniquement lorsque la fluidité est l’objectif. Pour un contenu de cinéma, conserver la fréquence d’images d’origine préserve l’aspect cinématographique.
  • Stabilisation : le modèle inclut une stabilisation du mouvement qui corrige les tremblements à main levée. Activez-la pour les séquences sources tremblantes.

Runway Upscale v1

Runway Upscale v1 est particulièrement efficace pour les images anciennes ou dégradées : transferts VHS, vidéos web compressées et enregistrements à faible débit. Le modèle gère bien la suppression des artefacts en même temps que l’augmentation de la résolution.

  • Cas d’usage idéal : les travaux de restauration où la source présente un effet de blocs de compression ou des bandes de couleurs visibles.
  • Qualité de sortie : lancez le traitement au réglage de résolution maximal que votre source permet.

Pour un montage vidéo au-delà de l’upscaling, Bria's Video Increase Resolution pousse la sortie jusqu’à la 8K, tandis que Real ESRGAN Video applique directement l’architecture basée sur les GAN aux séquences vidéo pour des résultats nets, image par image.

Photographe sportif au niveau du sol capturant un athlète en sprint, net au point

Choisir le bon outil

Le bon outil dépend de ce qui ne va pas dans votre séquence, et pas seulement de l’aspect que vous voulez obtenir en sortie.

💡 Commencez par un diagnostic. Regardez un court extrait en plein écran. Est-il flou mais par ailleurs propre ? C’est un problème de résolution. Est-il bruité ou présente-t-il des blocs de compression visibles ? C’est un problème de restauration. Saccade-t-il ou paraît-il haché ? C’est un problème de fréquence d’images.

Problème de la séquenceMeilleur outil
Basse résolution, source propreCrystal Video Upscaler
Bruit numérique, séquence en faible luminositéTopaz Video Upscale
Vidéo dégradée, compressée, ancienneRunway Upscale v1
Sortie en résolution maximale (8K)Bria Video Increase Resolution
Augmentation de la fréquence d’images (60 ips, 120 ips)Topaz Video Upscale
Netteté basée sur les GANReal ESRGAN Video

Pour les images fixes ou les images extraites d’une vidéo, Topaz Image Upscale et Google Upscaler appliquent les mêmes principes de super-résolution à des images uniques, utiles pour tirer des images fixes propres directement d’une séquence vidéo.

Essayez sur vos propres séquences

La meilleure façon de voir ce que ces modèles font réellement est de passer vos propres séquences dans ces modèles. Prenez un extrait qui vous a déçu, par exemple une scène tournée en faible luminosité ou avec un vieux téléphone, et traitez-le avec Crystal Video Upscaler ou Topaz Video Upscale sur PicassoIA.

L’IA n’a pas besoin de matériau source parfait. C’est précisément là que réside l’intérêt. Elle a été conçue pour fonctionner avec des images du monde réel, imparfaites, compressées et anciennes. Ce que vous récupérez est plus net, plus propre et plus agréable à regarder. Non pas parce que quelqu’un l’a corrigé à la main, image par image, mais parce que le modèle a vu assez d’exemples de bonnes et de mauvaises vidéos pour savoir à quoi une bonne vidéo doit ressembler.

Femme créative utilisant un ordinateur portable dans un café chaleureux, lumière naturelle d’une fenêtre

PicassoIA vous donne un accès direct aux meilleurs modèles de traitement vidéo par IA disponibles, de Crystal Video Upscaler à Topaz Video Upscale et Real ESRGAN Video, le tout au même endroit. Importez votre séquence, choisissez un modèle et découvrez ce que voit le réseau de neurones lorsqu’il regarde vos images.

Partager cet article

Choisissez votre langue