Les outils d’IA volent-ils vos photos ? Ce qu’il faut savoir

Chaque fois que vous publiez une photo en ligne, elle peut discrètement devenir une donnée d’entraînement pour un modèle d’IA. Cet article explique comment les entreprises d’IA collectent les images, quels sont vos droits réels, quelles plateformes aspirent votre contenu et quelles mesures concrètes prendre pour que vos photos ne soient pas utilisées à votre insu ou sans votre autorisation.

Les outils d’IA volent-ils vos photos ? Ce qu’il faut savoir
Cristian Da Conceicao
Fondateur de Picasso IA

Chaque fois que vous publiez une photo en ligne, elle a peut-être déjà été ajoutée à un jeu de données quelque part. Les entreprises d’IA ont besoin de milliards d’images pour entraîner leurs modèles, et l’internet public est une source bien pratique. Mais cela soulève une vraie question : vos photos sont-elles utilisées à votre insu, et que pouvez-vous réellement faire ?

La réponse courte est : probablement oui. La réponse longue est bien plus complexe, juridiquement floue, et mérite d’être comprise avant de publier un nouveau selfie ou d’importer un portfolio photo.

Personne faisant défiler un fil de photos sur les réseaux sociaux, sur un smartphone, dans un café faiblement éclairé

Comment fonctionnent réellement les données d’entraînement de l’IA

Les modèles d’IA de génération d’images modernes n’inventent pas des concepts visuels à partir de rien. Ils apprennent en traitant des régularités dans des millions, parfois des milliards, de photographies et d’illustrations réelles. Ces données doivent bien provenir de quelque part.

D’où viennent les images

Les plus grands jeux de données d’entraînement du secteur, comme LAION-5B, contiennent plus de 5 milliards de paires image-texte récupérées sur des sites web publics. Common Crawl, une organisation qui indexe régulièrement l’intégralité de l’internet public, figure parmi les sources de données les plus utilisées. Toute image accessible publiquement à un robot d’indexation était considérée comme de bonne guerre.

Ces entreprises n’ont pas demandé l’autorisation. Elles n’ont pas envoyé de demandes de licence. Elles ont simplement indexé des URL accessibles publiquement et récupéré les images à très grande échelle.

Quels modèles ont utilisé des données récupérées

Modèle d’IAJeu de données connuDivulgation publique
Stable Diffusion 1.x / 2.xLAION-5BOui, documentée
MidjourneyMélange propriétaire non divulguéPartielle
DALL-E (OpenAI)Sources propriétaires, dont des données d’internetLimitée
Google ImagenPropriétaireMinimale
Adobe FireflyUniquement Adobe Stock sous licenceOui, entièrement divulguée

L’ironie, c’est que même des photos de banques d’images professionnelles marquées « tous droits réservés » ont fini dans ces jeux de données. Des photographes qui avaient vendu des licences exclusives à leurs clients ont découvert que leur travail était imité par des générateurs d’IA dont ils n’avaient jamais autorisé l’entraînement sur leurs œuvres.

💡 Fait marquant : Getty Images a poursuivi Stability AI pour avoir prétendument récupéré et utilisé plus de 12 millions d’images protégées par le droit d’auteur, sans licence. L’affaire est devenue une bataille emblématique pour l’industrie de la photographie et reste en cours devant les tribunaux.

La zone grise juridique

Le droit d’auteur n’a pas été conçu pour l’entraînement de l’IA. La plupart des cadres juridiques existants protègent les droits des créateurs sur la diffusion et la reproduction, mais entraîner une IA sur une image relève d’une catégorie plus récente, que les tribunaux sont encore en train d’examiner.

Photographe professionnelle tenant son appareil photo, de façon protectrice, contre sa poitrine dans un studio lumineux

Ce que signifie vraiment le « fair use »

Aux États-Unis, les entreprises d’IA ont avancé que l’entraînement sur des images relève du « fair use », une doctrine juridique qui permet d’utiliser une œuvre protégée sans autorisation dans certaines conditions. Les tribunaux évaluent quatre facteurs :

  1. Finalité et caractère de l’utilisation : l’usage est-il transformateur, ou reproduit-il simplement l’original ?
  2. Nature de l’œuvre protégée : les œuvres créatives bénéficient d’une protection plus forte que les œuvres factuelles.
  3. Quantité utilisée : quelle part de l’œuvre originale est consommée dans le processus ?
  4. Préjudice pour le marché : l’usage remplace-t-il ou déprécie-t-il le marché du créateur original ?

Les entreprises d’IA affirment que l’entraînement est transformateur, car le modèle ne stocke aucune copie d’une image. Il apprend plutôt des relations statistiques. Les critiques répondent que les résultats de l’IA peuvent directement concurrencer le travail du créateur original, ce que le quatrième facteur est précisément conçu pour empêcher. Les deux arguments ont une valeur juridique, et aucune décision définitive n’a encore tranché la question.

Le point de vue européen

L’approche de l’Union européenne est plus stricte. En vertu de l’AI Act européen, les systèmes d’IA à usage général doivent documenter leurs sources de données d’entraînement. En vertu du RGPD, les personnes disposent de droits sur leurs données personnelles, dont les photos de leur visage, avec la possibilité d’en demander l’accès et la suppression.

Si vous résidez dans l’UE, votre position juridique est considérablement plus solide que celle des utilisateurs de la plupart des autres juridictions.

Ce que les artistes ont réellement obtenu jusqu’ici

  • Andersen v. Stability AI : une action collective intentée par des artistes visuels, qui affirment que leurs œuvres ont été récupérées sans consentement. L’affaire est toujours en cours devant un tribunal fédéral américain.
  • Getty Images v. Stability AI : un dossier solide sur le plan des preuves, car des filigranes de Getty seraient apparus dans des contenus générés par IA.
  • Plaidoyer de la Concept Art Association : il a conduit à des auditions au Congrès des États-Unis, même si aucune loi globale n’a encore été adoptée.

Le paysage juridique évolue lentement. Pour l’instant, les créateurs travaillent en grande partie sans protections légales globales.

Ce qui est récupéré et ce qui ne l’est pas

Toutes les plateformes ne traitent pas vos images de la même façon. La différence entre elles compte énormément.

Rangées de baies de serveurs éclairées dans un centre de données stérile, photographiées au niveau du sol

Analyse plateforme par plateforme

PlateformeEntraînement IA dans les CGUOpt-out disponible
Instagram / MetaOui, pour les comptes publicsTrès limité
X (Twitter)Oui, mis à jour en 2023Aucun mécanisme clair
LinkedInOuiDisponible dans les paramètres
PinterestUsage commercial restreintPartiel
FlickrNon, sauf sous Creative CommonsOui, un opt-out existe
Adobe StockUsage sous licence uniquementSans objet, strictement contrôlé

Meta a explicitement modifié ses conditions d’utilisation pour permettre l’utilisation des contenus publics afin d’entraîner ses produits d’IA. Lorsque vous publiez publiquement sur Instagram, votre photo peut légalement servir à entraîner les modèles de Meta. Les comptes privés sont exclus. Les comptes publics ne le sont pas.

La différence avec les banques d’images

Les sites de photos de banques d’images comme Getty, Shutterstock et Adobe Stock disposent de contrats de licence qui interdisent explicitement l’entraînement de l’IA sans autorisation. C’est pourquoi les procès intentés par ces entreprises ont un poids juridique. Les réseaux sociaux, en revanche, considèrent le contenu que vous importez comme une licence implicite accordée à eux-mêmes et à leurs initiatives d’IA.

💡 Astuce : passer votre compte Instagram en privé est l’une des actions les plus rapides pour retirer vos images de la prise en compte future de l’entraînement des IA de Meta.

Vos photos et la reconnaissance faciale

Cette discussion comporte une dimension qui dépasse le droit d’auteur artistique : votre visage en tant que donnée biométrique.

Jeune femme aux cheveux longs et foncés consultant du contenu sur un ordinateur portable chez elle, l’air inquiet

Les entreprises d’IA qui développent des systèmes de reconnaissance faciale ont, elles aussi, récupéré des images à grande échelle. Microsoft, IBM et d’autres ont été épinglés pour avoir utilisé des photos Flickr, dont certaines sous licence Creative Commons interdisant explicitement l’usage commercial, afin de constituer des jeux de données d’entraînement pour la reconnaissance faciale. Les photographes concernés ne l’ont découvert que lorsque des journalistes ont enquêté et publié leurs conclusions.

Ce que capturent réellement les données d’entraînement faciales

Lorsqu’une photo de votre visage entre dans un jeu de données d’entraînement, elle contribue à :

  • Modèles de géométrie faciale : des mesures comme la distance entre vos yeux, la largeur de l’arête de votre nez ou la forme de votre mâchoire
  • Classificateurs d’expressions : des systèmes qui détectent le sourire, la surprise, la colère ou une expression neutre
  • Empreintes biométriques : des identifiants uniques liés à votre apparence physique, qui peuvent servir à vous identifier sur plusieurs photos

La préoccupation n’a rien d’abstrait. Des systèmes de reconnaissance faciale entraînés sur des données récupérées ont été déployés par des services de police, avec des cas documentés d’erreurs d’identification ayant mené à des arrestations injustifiées aux États-Unis.

Comment protéger vos photos dès maintenant

Vous n’êtes pas sans recours. Il existe des mesures concrètes à prendre dès aujourd’hui.

Gros plan d’un document juridique posé sur un bureau en marbre, avec un stylo-plume et des lunettes de lecture

Réduisez votre empreinte publique

  • Passez Instagram et vos autres comptes sociaux en privé si vous êtes préoccupé
  • Auditez votre profil X et envisagez de supprimer les anciennes photos publiques
  • Consultez les paramètres de données IA de LinkedIn et désactivez-les là où l’option existe
  • Évitez de publier les originaux en pleine résolution lorsqu’une version compressée suffit

Utilisez les filigranes avec stratégie

Les filigranes n’empêchent pas la récupération, mais ils servent à deux choses. D’abord, ils polluent les données d’entraînement. Les modèles d’IA entraînés sur des images filigranées produisent parfois des résultats avec des artefacts visuels, ce qui se produit déjà avec les filigranes Getty apparus dans des résultats de Stable Diffusion. Ensuite, ils établissent la provenance, un enregistrement vérifiable de l’auteur de l’image.

💡 Astuce pro : placez un filigrane diagonal et semi-transparent, avec votre nom ou votre domaine, au centre de l’image et non dans un coin. Les filigranes en coin sont faciles à recadrer et à retirer. Une superposition centrale est bien plus difficile à éliminer sans dégrader la qualité de l’image.

Refusez l’usage là où des outils existent

Plusieurs services existent aujourd’hui pour vous aider à retirer votre travail des jeux de données d’entraînement de l’IA :

  • Have I Been Trained (haveibeentrained.com) : recherchez vos images dans les jeux de données LAION et soumettez des demandes de retrait
  • Spawning AI : un registre d’opt-out que les principaux développeurs d’IA ont accepté de respecter
  • Glaze : un outil de l’université de Chicago qui ajoute des perturbations imperceptibles au niveau des pixels à vos images, les rendant adversariales pour les modèles d’IA qui apprennent les styles
  • Nightshade : une version plus agressive de Glaze, conçue pour corrompre activement l’entraînement des modèles lorsque les images sont utilisées

Partagez intelligemment avant d’importer

Une tactique que les photographes négligent souvent : si vous devez partager un travail en haute résolution pour un portfolio ou une validation client, envisagez de partager une version upscalée à une résolution native réduite. Un outil comme Real ESRGAN ou Google Upscaler peut générer une version visuellement impressionnante et présentable, sans vous obliger à exposer le fichier original complet. Vous pouvez aussi utiliser Topaz Image Upscale pour un upscaling jusqu’à 6x avec une excellente conservation de la qualité.

Une autre option consiste à utiliser Recraft Crisp Upscale pour des résultats nets et précis qui préservent les détails fins sans introduire d’artefacts de netteté artificielle.

Gros plan en contre-plongée sur l’écran d’un ordinateur portable affichant un tutoriel sur les filigranes, dans un bureau domestique à la lumière chaude

Enregistrez formellement votre droit d’auteur

Aux États-Unis, l’enregistrement du droit d’auteur vous donne le droit de réclamer des dommages-intérêts légaux et le remboursement des honoraires d’avocat, et pas seulement des dommages effectifs. Pour les photographes professionnels et les artistes numériques, c’est un outil important. Un droit d’auteur enregistré constitue un fondement juridique bien plus solide que la simple revendication de propriété dans une légende.

L’autre versant du débat

Cette discussion mérite d’être abordée avec honnêteté, car tous les contre-arguments ne sont pas dénués de fondement.

L’argument de l’« internet public »

Les défenseurs de l’IA soutiennent que l’entraînement sur des données accessibles publiquement n’est pas différent de l’étude, par un artiste humain, des œuvres de ses prédécesseurs. Les peintres ont appris en regardant des tableaux. Les écrivains perfectionnent leur art en lisant largement. Une IA qui fait quelque chose de comparable constitue-t-elle un vol ?

L’analogie a de vraies limites. Les artistes humains n’ingèrent pas des millions d’œuvres en quelques secondes. Ils ne reproduisent pas des régularités à l’échelle commerciale. Ils ne font pas concurrence aux créateurs dont ils ont appris, au sens économique direct. La vitesse et l’échelle de l’entraînement de l’IA créent une asymétrie que le cadrage « apprendre à partir d’exemples » ne saisit pas totalement.

Consentement contre accessibilité

Rendre quelque chose public ne revient pas à consentir à tous les usages possibles. Publier une photo sur les réseaux sociaux pour la partager avec des amis est un acte différent de l’accorder sous licence pour l’entraînement commercial d’une IA. La pratique actuelle du secteur, où tout ce qui est accessible publiquement est considéré comme de bonne guerre pour le scraping, confond deux formes de consentement réellement distinctes.

À quoi ressemblent les pratiques responsables

Certains développeurs d’IA choisissent de meilleures voies.

Femme à l’aise avec la technologie, assise à un bureau debout avec deux écrans affichant une interface de génération d’images par IA

Jeux de données sous licence et synthétiques

Adobe Firefly est l’exemple le plus net d’un outil de génération d’images par IA commercialement réussi, entraîné exclusivement sur des images Adobe Stock sous licence et sur du contenu du domaine public. Le résultat est un modèle utilisable commercialement en toute clarté juridique, car les données d’entraînement sous-jacentes ont été légitimement acquises sous licence.

Certaines entreprises se tournent aussi vers les données synthétiques, en générant des images d’entraînement par simulation ou à l’aide de modèles d’IA antérieurs, plutôt qu’en récupérant des œuvres créées par des humains.

Modèles de consentement opt-in

Un petit nombre de plateformes ont commencé à proposer aux artistes un consentement opt-in pour l’entraînement, avec rémunération. Ce modèle, où les créateurs choisissent activement de contribuer avec leurs œuvres et reçoivent quelque chose en retour, est l’approche la plus proche de la façon dont les licences créatives ont fonctionné tout au long de l’histoire.

Ce n’est pas encore la norme du secteur. Mais c’est vers là que se tournent les acteurs les plus réfléchis.

3 choses à faire cette semaine

Femme aux cheveux auburn debout dans un parc ensoleillé, se retournant avec un sourire naturel

Vous n’avez pas besoin d’attendre une loi ou une décision de justice pour agir. Voici une liste courte et pratique :

  1. Auditez vos profils publics : passez en privé les comptes qui n’ont pas besoin d’une visibilité publique. Vérifiez les paramètres de données IA de chaque plateforme.
  2. Envoyez des demandes d’opt-out : utilisez Have I Been Trained et Spawning AI pour demander le retrait des principaux jeux de données d’entraînement.
  3. Filigranez votre travail : même si cela n’empêche pas la récupération, cela crée un enregistrement public de la paternité et complique l’entraînement de l’IA sur vos images.

💡 Pour les photographes et les créateurs visuels : associez un filigrane centré à un enregistrement formel du droit d’auteur pour obtenir la combinaison la plus solide de protection pratique et juridique.

Créez selon vos propres conditions

La question de l’IA et des droits sur les photos peut sembler accablante. Mais comprendre le fonctionnement du système est la première étape pour agir intelligemment à l’intérieur.

Il existe un autre angle à considérer : plutôt que de vous inquiéter de savoir si une IA a été entraînée sur votre travail, vous pouvez utiliser vous-même des outils d’IA pour créer des images inédites selon vos propres conditions. Avec une plateforme comme Picasso IA, vous pouvez générer des images originales et photoréalistes à partir de prompts textuels, sans récupération de données, sans collecte cachée et avec un contrôle créatif total sur le résultat.

Vous pouvez aussi utiliser la suppression d’arrière-plan pour isoler proprement des sujets de vos photos existantes, appliquer un upscaling par super-résolution pour améliorer la qualité d’image avant de la partager, ou faire appel à un puissant LLM comme GPT-4o ou Claude 4 Sonnet pour rédiger des conditions de licence, analyser les CGU d’une plateforme ou préparer vos notes d’enregistrement de droit d’auteur.

Femme photographe examinant des tirages dans un studio créatif, sous une lumière dorée et chaude filtrée par des fenêtres industrielles

Les outils existent des deux côtés de ce problème. Ceux qui valent la peine d’être utilisés sont ceux qui sont transparents sur ce qu’ils font et qui vous donnent en retour un réel pouvoir créatif. Essayez de générer votre première image sur Picasso IA dès aujourd’hui et découvrez ce qui devient possible lorsque l’IA travaille pour vous, et non contre vous.

Partager cet article

Choisissez votre langue