Comment fonctionnent vraiment les filtres de contenu IA (et pourquoi ils se trompent parfois)

À chaque fois que vous importez une photo ou générez une image, un classifieur automatisé tranche en quelques millisecondes. Cet article détaille les mécanismes réels du filtrage de contenu par IA : les réseaux de neurones, les données d’entraînement et les raisons pour lesquelles ces systèmes échouent de façons qui surprennent même leurs concepteurs.

Comment fonctionnent vraiment les filtres de contenu IA (et pourquoi ils se trompent parfois)
Cristian Da Conceicao
Fondateur de Picasso IA

À chaque fois que vous importez une photo, publiez un commentaire ou soumettez un prompt à un générateur d’images IA, quelque chose observe. Pas un humain. Un classifieur. Un réseau de neurones doté de millions de paramètres, entraîné sur des centaines de millions d’exemples étiquetés. Il prend sa décision en moins de 50 millisecondes, attribue un score de probabilité, puis laisse passer votre contenu ou le bloque entièrement.

Les mécanismes à l’origine de ce processus sont plus intéressants que ce que la plupart des gens imaginent, et les modes de défaillance en disent plus long que ne voudraient l’admettre les plateformes.

Ce que font réellement les filtres de contenu

Le mot « filtre » donne l’impression que la modération de contenu est un simple tamis : le contenu problématique entre, il est bloqué, et tout le reste passe. Ce n’est pas si simple.

Au cœur du système, un filtre de contenu est un classifieur binaire, ou plus précisément un classifieur multiclasse à sortie binaire. Il reçoit une entrée (une image, une chaîne de texte, un extrait audio ou une vidéo) et produit un score de probabilité pour chaque catégorie qu’il a été entraîné à détecter. Si la probabilité de « violation de la politique » dépasse un seuil défini, le contenu est signalé. En dessous de ce seuil, il passe.

Ingénieur examinant les résultats de classification de contenu sur une station de travail multi-écrans

Ce seuil est l’une des décisions les plus lourdes de conséquences de tout le système. Trop haut, il laisse passer des contenus nuisibles. Trop bas, il bloque des milliers de contenus légitimes : photos de plage, schémas médicaux, images d’allaitement, informations sur la réduction des risques. Trouver le bon seuil n’est pas un problème technique. C’est un problème de politique, et des personnes raisonnables ne s’accordent pas sur l’endroit où tracer la ligne.

Les trois couches de détection

La plupart des systèmes de modération de contenu en production fonctionnent sur trois couches distinctes, simultanément :

  1. Hachage avant classification : pour les catégories de contenus nuisibles connus, les plateformes conservent des bases de données de hachages cryptographiques (hachages perceptuels comme PhotoDNA pour les images). Avant que toute IA ne s’exécute, le contenu importé est haché et comparé à cette base. Une correspondance déclenche un blocage immédiat, avant même que le classifieur ne reçoive l’entrée.

  2. Inférence IA : le classifieur principal analyse tout ce qui a passé le contrôle de hachage. Les réseaux de neurones examinent le contenu et produisent des scores de confiance pour chaque catégorie de violation de la politique.

  3. File de revue humaine : le contenu dont le score se situe dans une zone intermédiaire incertaine (environ 35 à 65 % de confiance) est transmis à des relecteurs humains pour la décision finale. C’est là que se prennent les décisions les plus nuancées, et c’est aussi là que surviennent le plus d’erreurs.

D’où le modèle tire ses règles

Le classifieur ne « sait » pas, au sens réel, ce qui est offensant ou nuisible. Il a appris des régularités statistiques à partir d’un jeu de données étiqueté. Quelqu’un a passé du temps à marquer des contenus comme sûrs, dangereux ou entre les deux. Des milliers de personnes, pendant des mois de travail d’annotation, chacune apportant ses propres références culturelles et ses interprétations.

Ces décisions humaines transportent directement leurs biais, leurs présupposés culturels et leurs incohérences internes dans le comportement appris par le modèle. Le modèle encode la régularité sur laquelle les annotateurs ont convergé, avec le bruit qui l’accompagne.

Comment fonctionnent les filtres de reconnaissance d’images

Les filtres de contenu pour images reposent sur des réseaux de neurones convolutifs (CNN) ou, de plus en plus, sur des Vision Transformers (ViT). Ces architectures découpent une image en fragments spatiaux, identifient des caractéristiques locales dans les premières couches (contours, textures, dégradés de couleur) et les combinent dans des couches de plus en plus profondes pour reconnaître des motifs de plus haut niveau : zones de teint de peau, formes de parties du corps, configurations d’objets et relations spatiales entre les éléments du cadre.

Gros plan d’un œil reflétant des données d’écran, illustrant l’inférence visuelle de l’IA

Le modèle ne voit pas ce que voient les humains. Il traite des tenseurs de valeurs de pixels. Lorsqu’un classifieur signale une image comme NSFW, il ne porte pas un jugement esthétique ou moral. Il indique que cette configuration de pixels ressemble statistiquement à la distribution des motifs que les annotateurs humains ont étiquetés comme NSFW dans le jeu d’entraînement. Cette distinction compte davantage qu’il n’y paraît au premier abord.

Les réseaux de neurones convolutifs en action

Voici le déroulement réel du pipeline d’inférence pour une image soumise :

ÉtapeCe qui se passe
RedimensionnementImage redimensionnée à la taille d’entrée du modèle (par ex. 224x224 px)
NormalisationValeurs de pixels ramenées à la plage numérique attendue par le modèle
Passage avantL’image traverse des dizaines de couches convolutives
Extraction de caractéristiquesLes couches profondes s’activent sur des motifs visuels de haut niveau
Sortie softmaxUn score de probabilité est attribué à chaque étiquette de catégorie
Contrôle de seuilSi P(violation) dépasse le seuil, le contenu est bloqué

L’ensemble du processus prend généralement de 20 à 80 millisecondes sur un GPU. À l’échelle des plateformes, ce pipeline tourne sur des flottes de serveurs d’inférence qui traitent des millions d’images par heure.

Pourquoi la « détection de la couleur de peau » échoue sans cesse

Voici le problème qui hante les classifieurs de contenu pour images depuis le début : les premiers modèles étaient surajustés sur la détection de la peau plutôt que sur la détection du contexte.

Un classifieur entraîné principalement sur des images explicites apprend à associer les grandes zones de peau dénudée à du contenu NSFW, quel que soit le contexte ou l’intention artistique. Le résultat est prévisible : les photos de coups de soleil déclenchent le filtre, la photographie en noir et blanc de sculptures classiques est signalée, et les teints foncés sont sur-signalés de façon disproportionnée, parce qu’ils produisent des signatures de contraste différentes sur les couleurs de fond courantes.

Ce n’est pas hypothétique. Plusieurs grandes plateformes ont documenté exactement ce mode de défaillance lorsque leurs classifieurs ont rencontré, à grande échelle, la diversité réelle des contenus de leurs utilisateurs.

💡 La solution passe par le contexte, pas seulement par les pixels. Les classifieurs modernes utilisent de plus en plus des mécanismes d’attention spatiale pour modéliser les relations entre les éléments : la position des parties du corps les unes par rapport aux autres, ce que les objets environnants indiquent du cadre, et si les signaux contextuels suggèrent une intention médicale, récréative ou artistique, plutôt que de s’appuyer uniquement sur la ressemblance brute des pixels.

Chercheur examinant des schémas imprimés d’architectures de réseaux de neurones sur une table en bois

Les filtres de texte et leurs limites

La modération de texte est un défi fondamentalement différent. Contrairement aux images, le texte implique de traiter la séquence, le contexte, l’ironie, les références culturelles et l’intention. Un motif de pixels ne porte pas de sens différent selon la personne qui l’a produit ou la communauté à laquelle elle appartient. Une phrase, si.

Les premiers filtres de texte étaient des listes de mots-clés bloqués : rapides, peu coûteux et spectaculairement mauvais dès qu’il s’agit de nuances. Une liste qui repère « kill » bloque aussi les conversations sur « skill », « thriller » et « Kilimanjaro ». La deuxième génération utilisait des expressions régulières. La troisième employait des classifieurs TF-IDF, qui pondéraient la fréquence des termes par rapport au contexte du document. La génération actuelle repose sur des modèles de langage à base de transformers, affinés spécifiquement sur des exemples de violations de la politique.

Casiers de tri postal vintage illustrant une classification systématique de contenus

Listes de mots-clés ou modèles contextuels

Les différences entre les approches de modération sont spectaculaires sur toutes les dimensions qui comptent :

ApprocheVitessePrécisionGère le sarcasmeMultilingue
Liste de mots-clés bloquésTrès rapideTrès faibleNonNon
Classifieur TF-IDFRapideMoyenneDifficilementPartiellement
LLM affinéPlus lentÉlevéeMieuxOui
Ensemble (toutes les couches)LentLa plus élevéeLe mieuxOui

La plupart des systèmes en production utilisent des architectures d’ensemble. Un passage rapide par mots-clés attrape d’abord les violations évidentes. Les cas limites remontent vers des modèles de plus en plus lents et précis. L’architecture optimise le débit à l’extrémité bon marché du pipeline, et la précision à l’extrémité coûteuse.

Homme étudiant un mur de photographies disposées de manière systématique, à la recherche de motifs

Le problème du sarcasme et de l’argot

Même un modèle de langage bien entraîné peut être pris en défaut de façon constante par certains motifs linguistiques :

  • Sarcasme et ironie : « Ouais, super idée de se faire du mal » atténue le signal de danger, parce que les mots « super idée » portent une charge positive dans les associations apprises par le modèle
  • Termes codés : un vocabulaire conçu pour porter un sens au sein d’une communauté précise tout en paraissant anodin aux classifieurs automatiques, entraînés sur des violations plus explicites
  • Mélange de langues : un message qui mêle anglais, espagnol, tagalog et fautes d’orthographe volontaires, pour échapper à la distribution d’entraînement de n’importe quel modèle
  • Dérive sémantique : l’argot évolue plus vite que les cycles de réentraînement. Un terme neutre il y a huit mois peut aujourd’hui porter un sens nuisible précis qu’aucune version du modèle n’a jamais rencontré

💡 Le cycle de contournement est réel et permanent. À chaque amélioration de la modération, des utilisateurs malveillants trouvent de nouveaux chemins pour la contourner. C’est pourquoi les grandes plateformes superposent des signaux comportementaux à l’analyse du contenu : l’ancienneté du compte, les habitudes de publication, les connexions au réseau, l’historique des contenus signalés et les empreintes d’appareil entrent tous dans le score de confiance final, aux côtés du contenu lui-même.

Femme lisant et analysant un document imprimé dans la lumière chaude de l’après-midi

La détection de contenu vidéo

La vidéo ajoute une dimension temporelle qui rend le filtrage beaucoup plus complexe. Un clip de cinq secondes à 24 images par seconde contient 120 images distinctes, une piste audio complète, des métadonnées intégrées et le sens séquentiel qui naît de l’ordre de ces images. L’intention d’un clip peut changer complètement selon le contexte temporel, et non seulement selon ce qui apparaît dans une image isolée.

Baies de serveurs dans un centre de données, symbolisant l’infrastructure derrière l’analyse de contenu IA à grande échelle

Analyse image par image

L’approche la plus simple de modération vidéo échantillonne des images à intervalle fixe (chaque seconde, ou toutes les N images) et fait passer chacune dans un classifieur d’images standard. Si une image échantillonnée dépasse le seuil, la vidéo entière est signalée et mise en attente de revue.

La faiblesse est évidente : une seule image problématique affichée pendant 1/24e de seconde, entre 119 images sans danger, peut tomber entre deux points d’échantillonnage et échapper totalement à la détection. Plus important encore, le sens est temporel. Une suite d’images prises isolément sans danger peut former quelque chose de problématique, mais seulement lorsqu’on la voit en mouvement et dans l’ordre.

Les systèmes plus récents utilisent des CNN 3D et des Video Transformers, qui traitent les séquences temporelles comme des entrées unifiées. Ces modèles détectent les motifs de mouvement, le flux optique entre les images et le contexte temporel que les classifieurs à image unique manquent complètement. Le coût de calcul est nettement plus élevé, mais la précision sur les cas limites s’améliore sensiblement.

Analyse de l’audio et des transcriptions

La modération vidéo n’est pas un problème purement visuel. La piste audio passe par un pipeline d’analyse parallèle, via :

  • Reconnaissance automatique de la parole (ASR) : l’audio est transcrit en temps réel et la transcription passe dans un classifieur de texte
  • Détection de signatures audio : motifs sonores hors parole (cris, insultes perçues comme événements audio, profils sonores spécifiques) détectés par des classifieurs entraînés sur des bases d’extraits sonores étiquetés
  • Empreinte acoustique : contenus sous licence identifiés par comparaison avec une base de données, selon la même approche d’empreinte acoustique que les applications de reconnaissance musicale

Une vidéo aux images totalement sans danger mais accompagnée d’une piste audio violente déclenche quand même le système sur les plateformes qui analysent l’intégralité de l’audio. De nombreuses plateformes de second rang omettent entièrement l’analyse audio, pour des raisons de coût, ce qui crée un angle mort documenté et largement exploité.

Fiches cartonnées triées et classées dans des dossiers étiquetés sur un bureau

Le problème des données d’entraînement

Chaque filtre de contenu n’est aussi précis que ses données d’entraînement. Ce point mérite bien plus d’attention qu’il n’en reçoit habituellement dans les débats publics sur les systèmes de sécurité de l’IA.

Gros plan d’une carte électronique, représentant la couche matérielle derrière les systèmes d’apprentissage de l’IA

Garbage in, garbage out

Entraîner un classifieur de contenu à une qualité de production exige trois éléments, bien plus difficiles à obtenir qu’il n’y paraît :

  • Des millions d’exemples positifs étiquetés de contenus en violation, dans chaque catégorie que le classifieur doit couvrir
  • Des millions d’exemples négatifs étiquetés de contenus sûrs, avec une variété visuelle et thématique équivalente
  • Une équipe d’annotation qui applique des consignes cohérentes, documentées et sensibles aux contextes culturels, dans toutes les catégories et sans dégradation dans le temps

L’étiquetage est généralement confié à des travailleurs sous contrat, souvent sur des marchés à faibles revenus, sous une forte pression de temps, sur des contenus allant du banal à l’extrêmement éprouvant. Les études sur cette main-d’œuvre documentent des taux d’épuisement élevés et une dégradation mesurable de la cohérence des étiquettes, les annotateurs étant exposés de façon répétée à des contenus nuisibles sans soutien adapté.

Lorsque les étiquettes sont incohérentes, le modèle apprend des règles incohérentes. Le classifieur n’a aucun moyen de distinguer une erreur d’étiquetage d’une véritable ambiguïté du contenu. Il apprend la moyenne statistique d’un jugement humain imparfait, encodée de façon permanente jusqu’au prochain réentraînement complet.

Document avec sections surlignées, représentant les processus de revue attentive des politiques

Les biais intégrés au filtre

Biais géographique : des données d’entraînement issues principalement de plateformes occidentales anglophones encodent directement ces normes culturelles dans le modèle. Les tenues traditionnelles d’autres cultures, les pratiques de modification corporelle courantes dans certaines communautés ou les conventions artistiques ayant des siècles d’histoire culturelle sont signalées simplement parce qu’elles sortent de la distribution d’entraînement, et non parce qu’elles enfreignent une politique cohérente.

Biais temporel : les modèles sont entraînés à un moment précis. Les normes culturelles évoluent. Les contextes politiques changent. Un classifieur calibré sur ce qui constitue un discours nuisible en 2022 peut être nettement mal calibré en 2026, avec à la fois des faux positifs sur des formulations devenues acceptables et des faux négatifs sur des contenus nouvellement problématiques.

Déséquilibre des classes : les contenus sûrs sont largement plus nombreux que les contenus en violation dans n’importe quel jeu de données réel. Sans rééquilibrage rigoureux pendant l’entraînement, le modèle tend à privilégier les prédictions « sûres », car c’est statistiquement plus sûr pour la plupart des entrées. Les contenus proches de la frontière de décision qui violent réellement la politique passent à travers à un taux plus élevé que ne le laissent voir les métriques de précision globale.

Chercheur travaillant tard le soir, entouré de livres de référence et de notes manuscrites

Modération en temps réel ou différée

Tous les contenus ne sont pas examinés au même moment de leur cycle de vie. Le moment de la revue a des implications importantes pour la sécurité comme pour l’expérience utilisateur, et les plateformes font des choix très différents quant à l’endroit où placer cette ligne.

Centre des opérations de sécurité, avec des analystes surveillant des flux de données en direct sur un mur d’écrans incurvé

Le compromis entre vitesse et précision

Trois architectures temporelles distinctes existent aujourd’hui dans les systèmes en production :

  • Avant publication (synchrone) : le contenu est retenu et passe par l’ensemble complet du classifieur avant d’être mis en ligne. Sécurité maximale, latence plus élevée. Standard sur les plateformes de génération d’images IA, où le pipeline contrôle la sortie avant que l’utilisateur ne voie le moindre résultat.
  • Après publication (asynchrone) : le contenu est mis en ligne immédiatement, la classification s’exécutant en arrière-plan. Les contenus en violation sont retirés a posteriori, après avoir déjà été visibles. Courant sur les plateformes qui privilégient la faible latence et l’expérience du créateur.
  • Approche hybride : des classifieurs rapides bloquent avant publication les violations évidentes à forte confiance. Des modèles plus lents et plus précis analysent le reste de manière asynchrone, dans une file d’attente en arrière-plan. La plupart des grands réseaux sociaux utilisent cette architecture, car elle équilibre le débit et la sécurité.

Les plateformes de génération d’images IA recourent très majoritairement à la modération avant publication, car elles contrôlent le pipeline de bout en bout. La couche de sécurité se situe entre l’inférence du modèle et la livraison. Si la sortie dépasse le seuil, la plateforme peut relancer une génération, renvoyer un message d’erreur ou substituer un résultat sûr, sans que l’utilisateur ne voie jamais la sortie signalée.

La revue humaine dans la boucle

Aucun système automatisé n’atteint une précision suffisante sur toutes les catégories de contenus pour éliminer entièrement la revue humaine. L’architecture en couches standard des grandes plateformes fonctionne ainsi :

  1. Contenu sûr à forte confiance : approbation automatique et publication immédiate
  2. Contenu en violation à forte confiance : retrait automatique, sans revue humaine
  3. Contenu ambigu à faible confiance : envoi à la file de revue humaine, avec son contexte

Les relecteurs qui traitent la file doivent décider vite, souvent en moins de 30 secondes par élément pour suivre le volume, ce qui pose ses propres problèmes de cohérence. La fatigue des relecteurs, leur origine culturelle et l’heure de la journée influencent de façon mesurable la précision des décisions au niveau individuel. Il en résulte un système en cascade, où les erreurs de classification automatique et les erreurs de revue humaine s’accumulent sur des millions de décisions quotidiennes.

Équipe diversifiée discutant de décisions de politique de modération autour d’un écran partagé

Comment les plateformes d’IA gèrent le contenu NSFW

La génération d’images IA est un cas particulièrement intéressant pour la modération de contenu, car le filtre s’applique au contenu généré, et non au contenu importé. La plateforme contrôle l’ensemble du pipeline, du prompt textuel au pixel livré. Cela crée des possibilités de modération que n’ont pas les réseaux sociaux qui hébergent les contenus importés par leurs utilisateurs.

Caméras de surveillance dans une rue urbaine nocturne et mouillée, symbolisant les systèmes de surveillance automatisés

Les contrôles du niveau de sécurité

La plupart des plateformes texte vers image mettent en place la sécurité grâce à trois mécanismes, réglables indépendamment les uns des autres :

  1. Filtrage des prompts : le prompt textuel est vérifié avant le début de la génération. Les termes ou motifs signalés entraînent un rejet immédiat, avant même que le modèle ne tourne, ce qui économise le calcul d’inférence et empêche la génération.
  2. Suppression de concepts : certains concepts visuels sont supprimés dans les poids appris du modèle, grâce à des techniques comme le masquage de guidage ou l’injection d’embeddings négatifs. Les prompts qui produiraient autrement des sorties en violation donnent des résultats génériques d’apparence sûre, sans exposer la capacité sous-jacente.
  3. Classification de la sortie : l’image générée passe par un classifieur NSFW une fois l’inférence terminée. Les images dont le score dépasse le seuil sont retenues et un nouvel échantillon est tiré, jusqu’à un nombre maximal de tentatives configuré, avant de renvoyer une erreur.

Ces trois couches ne sont pas toujours toutes actives en même temps. Une plateforme peut utiliser un filtrage strict des prompts sans classification de la sortie, pour gagner en rapidité, ou bien se passer du filtrage des prompts et s’appuyer uniquement sur le contrôle de la sortie. La combinaison utilisée sur une plateforme donnée est rarement divulguée publiquement.

Ce que bascule réellement le « mode sécurisé »

Lorsqu’une plateforme propose une bascule « mode sécurisé » ou « mode adulte », elle ajuste le plus souvent le seuil de classification de la sortie, plutôt que d’ajouter ou de retirer des capacités du modèle. Le mode sécurisé fixe un seuil plus bas : davantage de contenus sont bloqués. Le mode adulte relève le seuil : davantage de contenus passent par la barrière.

Les poids du modèle sous-jacent sont identiques dans les deux configurations. La même passe avant et la même inférence génèrent les deux résultats. Seule la barrière de notation en sortie modifie ce que reçoit l’utilisateur.

💡 Certaines plateformes vont plus loin. Plutôt qu’un simple réglage de seuil, un petit nombre de plateformes maintiennent de véritables versions de modèle affinées séparément, pour les sorties sûres et les sorties sans restriction, avec des poids appris différents et des compositions de données d’entraînement distinctes. Cela produit un comportement plus cohérent et plus prévisible aux deux extrêmes qu’une bascule de seuil ne peut le faire.

Visage d’un homme plongé dans une ombre dramatique, un côté éclairé par l’écran froid d’un moniteur

Créer en ayant une visibilité totale sur le système

Comprendre le fonctionnement des filtres de contenu vous donne un véritable levier créatif. Vous savez ce qui déclenche les classifieurs au niveau des pixels, quels termes de prompt activent les couches de listes de blocage avant même le début de la génération, et comment les signaux contextuels font basculer les scores limites dans un sens ou dans l’autre. Ces connaissances ont leur place dans votre flux de travail créatif.

Femme tapant sur un ordinateur portable à la table d’un café, une tasse d’espresso à côté d’elle

PicassoIA vous donne un accès direct à l’ensemble des modèles de génération d’images, chacun avec sa propre configuration de sécurité et sa propre plage créative. PicassoIA Image est le générateur texte vers image central de la plateforme, conçu pour un travail créatif à fort volume, avec une qualité constante quel que soit le style du prompt. Pour retoucher et remixer des images existantes, PicassoIA Image Editor Pro propose l’inpainting, l’outpainting et une édition précise au niveau des objets, sans nécessiter d’outils ni de flux de travail séparés.

Pour les portraits et le travail sur les personnages, lorsque le réalisme est prioritaire, Seedream 4.5 de ByteDance produit des sorties en 4K avec une texture de peau exceptionnelle et un détail photographique remarquable. Pour le contrôle de la composition et les variations stylistiques, Flux Redux Dev et Flux Schnell LoRA de Black Forest Labs offrent un guidage structurel précis et des itérations rapides. Stable Diffusion 3 de Stability AI reste une base photoréaliste fiable, compatible avec un large éventail de flux de travail.

Diorama de chaîne de montage illustrant le traitement et la classification automatisés de contenus à grande échelle

Pour la retouche après génération, lorsque la cohérence spatiale est primordiale, Flux Fill Pro gère les tâches d’inpainting avec un remplissage tenant compte du contexte, qui produit des résultats naturellement cohérents avec le langage visuel existant de l’image. Ces sorties passent plus fiablement les classifieurs de sortie, parce que leur cohérence interne paraît photographique plutôt qu’un assemblage.

Chaque modèle de PicassoIA est accessible sur picassoia.com/en/all-models, avec des aperçus en direct, une documentation complète des paramètres et un accès aux crédits pour tester n’importe quel modèle avant de l’intégrer à votre flux de travail.

Smartphone posé sur un plan de marbre à côté d’une tasse de café du matin

Le filtre de contenu n’est pas votre adversaire. C’est un système statistique aux mécanismes documentés, aux modes de défaillance prévisibles et aux paramètres configurables. Plus vous savez précisément ce qui le déclenche et pourquoi, plus vous pouvez créer avec précision le travail que vous avez réellement en tête, sur n’importe quelle plateforme, à n’importe quel niveau de contenu.

Jeune femme debout au bord de l’océan dans la lumière dorée de l’heure dorée, naturelle et joyeuse

Partager cet article

Choisissez votre langue