Test de GPT Image 1.5 : vaut-il vraiment le battage ?

GPT Image 1.5 promettait un réalisme plus net, une meilleure fidélité aux prompts et moins d’artefacts que son prédécesseur. Nous l’avons testé sur la génération de portraits, l’architecture, la photographie de produits et les scènes stylisées, pour voir où il excelle et où les alternatives disponibles sur PicassoIA le devancent déjà sur chaque critère qui compte pour les flux de travail de contenu professionnels.

Test de GPT Image 1.5 : vaut-il vraiment le battage ?
Cristian Da Conceicao
Fondateur de Picasso IA

GPT Image 1.5 est arrivé en 2025 avec des promesses qui ont fait sensation sur tous les forums de design et les communautés d’IA en ligne. Un meilleur réalisme. Une meilleure fidélité aux prompts. Moins d’artefacts que le modèle GPT Image d’origine. Après plusieurs semaines de tests sur des séances de portrait, des prompts architecturaux, des scénarios de photos de produits, des tests de texte dans l’image et des compositions complexes à plusieurs sujets, le constat est bien plus net que ne le laisse entendre le discours marketing d’OpenAI. Ce test détaille ce que GPT Image 1.5 fait réellement bien, les points où il pèche de façon gênante pour les flux de travail réels, et si son coût se justifie alors que des alternatives égalent désormais, voire dépassent, sa qualité sans ses restrictions.

Ce que GPT Image 1.5 offre vraiment

GPT Image 1.5 est le dernier modèle de génération d’images d’OpenAI. Il repose sur l’architecture GPT-4o et est proposé à la fois comme point d’accès API et comme fonctionnalité intégrée aux abonnements ChatGPT Plus et Pro. Chaque génération consomme soit des crédits API, soit votre quota mensuel d’utilisation. Il n’existe pas de formule gratuite pour un volume de travail sérieux.

Les principales évolutions par rapport à l’original

Le premier modèle GPT Image proposait la première tentative d’OpenAI de rendu natif du texte dans les images, un domaine que DALL-E 3 gérait mal dans l’ensemble. GPT Image 1.5 s’appuie sur cette base avec une série d’améliorations ciblées, réelles mais pas révolutionnaires :

  • Rendu de texte plus net pour les logos, les enseignes et les courtes phrases
  • Cohérence d’éclairage améliorée dans les scènes avec plusieurs sources lumineuses
  • Meilleure anatomie des mains, point de défaillance historique de tous les modèles de diffusion
  • Vitesse de sortie accrue, avec une moyenne de 15 à 20 secondes pour une résolution standard de 1024x1024
  • Compositions à plusieurs sujets plus stables, où les objets et les personnes ne fusionnent plus au hasard

💡 À savoir : GPT Image 1.5 produit nativement uniquement des images carrées (1:1), en portrait (1024x1792) ou en paysage (1792x1024). Pour de véritables images en 16:9, il faut soit recadrer manuellement au risque de perdre des éléments du sujet, soit utiliser l’outpainting, qui peut introduire des raccords visibles.

À qui OpenAI destine ce modèle

Le modèle est clairement conçu pour les équipes produit, les services marketing et les développeurs qui ont besoin d’une génération d’images reproductible via une API stable. L’intégration du prompt système permet à GPT Image 1.5 de suivre des séries d’instructions en plusieurs tours, ce qui le rend utile pour les flux de travail itératifs où vous affinez une image par la conversation.

Le compromis, c’est un filtrage du contenu bien visible. Les garde-fous sont nettement plus stricts que ceux des alternatives open source, ce qui crée une réelle friction pour la photographie de mode, le travail éditorial et tout contenu situé dans la catégorie des contenus audacieux sur le plan stylistique, mais professionnellement légitimes.

Résultats de génération d’images IA affichés sur l’écran d’un smartphone

Génération de portraits et de visages

Les visages ont toujours été le benchmark le plus exigeant pour les générateurs d’images IA. GPT Image 1.5 fait nettement mieux que la génération précédente sur ce point, mais son plafond reste inférieur à celui des alternatives open source actuelles qui fonctionnent à pleine capacité.

Là où les visages paraissent réels

Sur des portraits de face et de trois quarts aux éclairages clairement décrits, GPT Image 1.5 produit des résultats impressionnants. Les teints sont crédibles, les yeux reçoivent correctement leurs reflets spéculaires, et les mèches de cheveux se détachent individuellement, au lieu de former la masse floue qui caractérisait les modèles antérieurs.

Le modèle gère mieux la diversité des carnations que la plupart des concurrents orientés API. Les prompts qui décrivent des peaux plus foncées donnent une répartition précise de la mélanine, sans les sous-tons gris et ternes qui apparaissent dans plusieurs modèles open source lorsqu’ils ne tournent pas avec des checkpoints spécialisés. Les taches de rousseur, les grains de beauté et les légères cicatrices sont rendus de façon cohérente lorsqu’ils sont décrits.

L’éclairage sur les visages est le domaine où GPT Image 1.5 montre sa progression la plus nette. L’éclairage Rembrandt, l’éclairage divisé et la lumière de fenêtre avec une chute réaliste passent du prompt à l’image avec une précision raisonnable. Le modèle comprend que la lumière enveloppe les visages au lieu de les frapper à plat.

Là où les visages craquent encore

Les photos de groupe avec plus de trois sujets montrent des incohérences dans les proportions des visages. Les formes d’oreilles paraissent génériques d’un sujet à l’autre. Les dents dans les sourires bouche ouverte ont une uniformité troublante qui paraît artificielle à l’examen de près.

Les profils constituent la plus grande faiblesse. Le côté du nez et la position de l’oreille se désalignent souvent à 90 degrés, ce qui devient évident lorsqu’on zoome pour vérifier la qualité avant publication.

Le rendu de l’âge est irrégulier. Un prompt demandant « une personne dans la soixantaine » renvoie parfois un visage qui paraît avoir une quarantaine d’années, avec une peau simplement un peu fatiguée, plutôt que des traits réellement vieillis avec la texture complexe d’une peau mûre.

Le problème des mains (en partie résolu)

L’anatomie des mains était la défaillance la plus visible de la version précédente. GPT Image 1.5 corrige réellement les cas les plus flagrants. Les mains à six doigts sont désormais rares. Les proportions des doigts sur des mains détendues et ouvertes paraissent naturelles dans la plupart des résultats.

Là où le modèle échoue encore : les doigts qui saisissent des objets cylindriques (tasses, stylos, rampes), les mains partiellement cachées et les mains dans des angles de raccourci inhabituels produisent toujours des erreurs. La correction est réelle mais ciblée. Les positions de main complexes restent peu fiables.

Portrait IA photoréaliste avec un détail net de la texture de la peau

Architecture et photographie de produits

C’est dans ce domaine que GPT Image 1.5 justifie sa réputation et mérite une réelle attention.

Composition de scène

Les prompts architecturaux donnent régulièrement des résultats qui peuvent tromper un observateur distrait. Les espaces intérieurs modernes avec des sources lumineuses mixtes, les vues extérieures de bâtiments avec une perspective atmosphérique juste et les scènes de rue urbaines avec une géométrie de point de fuite correcte sont tous traités avec assurance.

Le modèle interprète correctement la profondeur spatiale dans la plupart des cas, plaçant les objets à des distances cohérentes et les mettant à l’échelle proportionnellement à la scène. Il maintient une cohérence de perspective entre les éléments de premier plan, de plan intermédiaire et d’arrière-plan, mieux que la plupart des concurrents à ce niveau de prix.

Le rendu des matériaux en contexte architectural est particulièrement solide. Les textures de béton, les reflets sur le verre, les surfaces en métal brossé et les lambris en bois se lisent comme des matériaux précis plutôt que comme des approximations génériques.

Photographie de produits

Pour des photos de produits isolés sur des fonds simples, GPT Image 1.5 est réellement utile. Les surfaces réfléchissantes des appareils électroniques, le grain du cuir, l’aspect givré des emballages en verre, les distinctions entre finitions mat et brillant sur les plastiques : tout cela se rend avec des propriétés matérielles convaincantes.

Le design d’emballage ressort particulièrement bien lorsque le prompt décrit avec précision la forme du contenant, son matériau et son traitement de surface. Un prompt tel que « cylindre en aluminium noir mat avec couvercle brossé, éclairage de studio doux depuis le haut à gauche, fond blanc, photographie de produit » produit de façon fiable une image qu’une équipe produit peut utiliser comme maquette conceptuelle.

💡 Astuce pro : Décrivez les propriétés matérielles plutôt que les noms de produits. « Flacon de parfum en verre givré avec pompe dorée » donne systématiquement de meilleurs résultats que « flacon Chanel n° 5 », car le modèle génère le rendu à partir de sa compréhension des matériaux plutôt que de deviner des formes propriétaires.

Le problème du format 16:9

Presque tous les usages professionnels exigent des images en 16:9 pour les miniatures YouTube, les bannières d’accueil de site web, les en-têtes de réseaux sociaux et la publicité numérique. GPT Image 1.5 ne produit pas nativement ce format.

Vous avez deux options : recadrer et perdre du contenu sur les côtés, ou utiliser l’outpainting via l’API pour étendre l’image. L’outpainting fonctionne, mais il ajoute une étape au flux de travail et peut produire des incohérences visibles au niveau de la jointure, surtout avec des arrière-plans complexes présentant de forts dégradés de lumière.

Station de travail à double écran pour comparer des résultats de génération d’images IA

Là où GPT Image 1.5 déçoit encore

Les points positifs sont réels. Les frustrations aussi.

Rendu du texte : mieux, mais pas réglé

OpenAI a présenté l’amélioration du rendu de texte comme un atout phare de GPT Image 1.5. Pour de courtes phrases en grandes polices sans empattement, claires, cela fonctionne de façon fiable. Pour tout ce qui est plus exigeant :

  • Les mots de plus de 8 à 10 caractères commencent à remplacer des lettres de façon incohérente
  • Le texte courbe sur les étiquettes de produits et les logos circulaires reste peu fiable
  • Le crénage et l’espacement des caractères paraissent incohérents à petite taille dans l’image
  • Les écritures non latines donnent une précision bien inférieure à celle de l’anglais
  • Le texte multiligne aux tailles variées perd souvent son alignement

Si votre flux de travail exige un texte précis dans les images pour la signalétique, les emballages ou les mises en page éditoriales, GPT Image 1.5 est amélioré mais n’est pas encore une solution de production pour les cas d’usage exigeants.

Dérive du prompt sur les scènes complexes

Donnez à GPT Image 1.5 une scène avec cinq éléments précis ou plus, et il en supprimera ou modifiera certains de façon régulière. Un prompt tel que « une femme lisant un livre rouge à une table de café en bois, avec une plante verte en pot à côté d’elle et un parapluie jaune visible par la fenêtre derrière » tend à produire trois ou quatre éléments corrects sur cinq.

Ce phénomène n’est pas propre à GPT Image 1.5, la dérive du prompt est un problème répandu dans tout le secteur, mais la concurrence a récemment progressé de façon plus mesurable. Le problème est pire dans les scènes à dominante portrait, où le modèle privilégie le visage et accorde moins d’importance à la précision de l’arrière-plan.

La réalité des coûts

FormuleCoût mensuelGénérations approximatives
ChatGPT Plus20 $/moisenviron 500 images standard
ChatGPT Pro200 $/moisIllimité (avec bridage)
API qualité standardenviron 0,04 $ par imagePaiement à l’usage
API haute qualitéenviron 0,12 $ par imagePaiement à l’usage

Pour les utilisateurs particuliers qui génèrent occasionnellement, la formule Plus est raisonnable. Pour les studios ou les équipes de contenu qui réalisent des centaines d’itérations par projet, les coûts deviennent vite lourds, et le bridage de la formule Pro est plus agressif en pratique que ne le laisse entendre la documentation. Le tarif de l’API varie selon la résolution et le niveau de qualité, ce qui rend l’estimation des coûts plus difficile qu’il ne devrait l’être pour la planification budgétaire.

Professionnelle de la création travaillant tard le soir et examinant des résultats IA sur un grand écran

Le problème des restrictions de contenu

GPT Image 1.5 fonctionne sous la politique de contenu d’OpenAI, nettement plus restrictive que celle des alternatives open source et de nombreux produits API concurrents. Pour les photographes professionnels, les rédacteurs de mode, les directeurs artistiques dont le travail touche au glamour, au maillot de bain éditorial, aux campagnes beauté ou à des sujets humains artistiquement audacieux, le comportement de refus du modèle crée une réelle friction de production.

Ce qui rend la situation plus frustrante qu’un simple désaccord de principe, c’est l’incohérence. Des prompts qui fonctionnent sans problème à une première tentative renvoient parfois un refus lors d’une seconde tentative identique. L’interprétation de ce qui sort de la politique n’est pas déterministe, ce qui rend impossible de prédire de manière fiable si une direction créative donnée fonctionnera sur l’ensemble d’un projet.

GPT Image 1.5 face à la concurrence

Voici comment GPT Image 1.5 se compare aux alternatives les plus pertinentes pour un usage professionnel, selon les critères qui affectent réellement le travail au quotidien :

CritèreGPT Image 1.5P-ImageSDXL open source
Réalisme des portraitsTrès bonExcellentBon
Sortie native en 16:9NonOuiOui
Rendu du texteBonBonFaible
Souplesse du contenuRestreinteSoupleEntièrement ouverte
Coût pour 100 images4 à 12 $Inclus dans la formuleMatériel uniquement
Accès APIOuiOuiAuto-hébergé
Vitesse moyenne15 à 20 secondes8 à 15 secondesVariable
OutpaintingVia l’APIIntégréVia extension

P-Image comme alternative directe

P-Image sur PicassoIA mérite une attention particulière, car il rivalise directement sur les critères qui comptent le plus pour les studios de contenu et les équipes créatives. Il est optimisé pour des rendus photoréalistes, avec une force particulière en photographie de portrait, en travail éditorial de style de vie et en compositions cinématographiques.

Là où GPT Image 1.5 restreint le contenu et facture chaque génération, P-Image offre aux professionnels de la création davantage de latitude, avec une vitesse de génération égale ou supérieure à celle d’OpenAI. La sortie native en 16:9 supprime entièrement l’étape de recadrage.

💡 Différence concrète : Pour une équipe de contenu qui génère 200 images par mois en haute qualité, GPT Image 1.5 via l’API coûte environ 24 $. Le même volume sur PicassoIA est couvert par l’abonnement à la plateforme, sans facturation par image.

Designer comparant des photos imprimées générées par IA sur un plan de travail lumineux

Augmenter la résolution et affiner vos sorties

Dans ce domaine, la plateforme que vous utilisez compte autant que le modèle de génération lui-même. GPT Image 1.5 produit au maximum 1024 px ou 1792 px. Pour l’impression, l’affichage grand format ou les photos de produits détaillées que les clients zoomeront, il faut un upscaling (augmentation de la résolution) avec reconstruction des détails, et pas une simple interpolation.

Des outils de super-résolution qui fonctionnent vraiment

PicassoIA propose des modèles d’upscaling dédiés, optimisés pour différents cas d’usage :

Clarity Pro Upscaler ajoute des détails générés pendant l’upscaling au lieu de simplement étirer les pixels. Sur les portraits, cela donne une texture de peau plus organique que la génération de base. Sur les photos de produits, il accentue les bords des surfaces matérielles au point que les rendus en résolution web deviennent prêts pour l’impression.

Topaz Image Upscale de Topaz Labs prend en charge un agrandissement allant jusqu’à 6x avec une reconstruction intelligente des détails. Si vous préparez des images générées par IA pour des campagnes publicitaires ou des affichages grand format que l’on regardera à un mètre de distance, c’est l’outil adapté. La préservation des détails à des ratios d’upscaling extrêmes est réellement différente d’une interpolation bicubique standard.

Real ESRGAN est l’upscaler open source de référence, qui traite aussi bien les images photoréalistes que stylisées sans ajouter l’effet de halo sur-accentué que produisent de nombreux upscalers IA sur les bords des objets. Il est rapide et fiable pour des gains de résolution rapides.

P Image Upscale s’associe directement aux générations de P-Image, car il est réglé sur les caractéristiques de sortie du modèle. Utiliser un upscaler adapté plutôt qu’un upscaler générique préserve les qualités tonales et texturales de l’image de base, au lieu d’introduire une signature visuelle différente.

Loupe examinant une photo de portrait IA hyperdétaillée posée sur une table lumineuse

Des images fixes à la vidéo

La génération d’images fixes n’est qu’une partie d’un pipeline de contenu moderne. Une fois que vous disposez d’une image phare solide, qu’elle provienne de GPT Image 1.5 ou de P-Image, l’étape logique suivante pour les réseaux sociaux, les démonstrations de produits et la publicité payante est l’animation.

Seedance 2.5 de ByteDance crée des vidéos allant jusqu’à 30 secondes avec un son synchronisé natif, ce qui en fait le bon choix pour les contenus de lancement de produit et les campagnes sociales qui ont besoin de mouvement sans passe audio séparée. Pour un mouvement cinématographique à partir d’une image fixe, Wan 2.7 I2V propose une conversion image vers vidéo précise image par image, avec une physique réaliste pour les éléments en mouvement. LTX 2 Pro génère de la vidéo en 4K directement à partir de prompts texte, comblant l’écart entre les campagnes d’images fixes et les contenus en mouvement complets, sans avoir besoin d’une image source.

💡 Un flux de travail efficace : Générez une image produit phare avec P-Image, passez-la dans Clarity Pro Upscaler pour obtenir une résolution prête pour l’impression, puis animez-la avec Seedance 2.5 pour les réseaux sociaux et la publicité numérique. Vous obtenez ainsi un ensemble complet d’éléments à partir d’une seule session de prompts.

Intérieur d’un studio photo moderne avec des tirages IA grand format

Obtenir de meilleurs résultats que GPT Image 1.5 dès maintenant

Si vous utilisez actuellement GPT Image 1.5 et que vous vous heurtez à ses limites, voici comment passer à un flux de travail qui supprime la plupart de ces frictions sans reconstruire tout votre processus à partir de zéro.

Étape 1 : Passez les mêmes prompts par P-Image

Rendez-vous sur P-Image sur PicassoIA et lancez vos prompts avec la même profondeur descriptive que pour GPT Image 1.5. Les principes de rédaction de prompts qui fonctionnent là-bas fonctionnent ici. Ce qui change, c’est le résultat :

  • Précisez explicitement le format, y compris le 16:9 qui fonctionne nativement
  • Utilisez des références d’objectifs (85 mm, 50 mm, grand-angle 35 mm) pour contrôler le réalisme
  • Ajoutez des références de pellicule (Kodak Portra 400, Fuji Superia 400) pour le caractère des couleurs
  • Décrivez la direction et la qualité de la lumière plutôt que sa seule intensité

Étape 2 : Augmentez la résolution pour une livraison professionnelle

Passez vos meilleures générations par Topaz Image Upscale ou Clarity Pro Upscaler, selon l’usage final. Le web et les réseaux sociaux tolèrent un upscaling x2 sans artefacts. Pour l’impression ou l’affichage grand format, un agrandissement de x4 à x6 avec reconstruction active des détails est préférable.

Étape 3 : Supprimez les arrière-plans pour les visuels produits

Pour les photos de produits destinées aux fiches e-commerce ou aux mises en page composites, l’outil de suppression d’arrière-plan de PicassoIA traite proprement les images générées par IA. Il isole correctement les sujets, qu’il s’agisse d’images stylisées ou photoréalistes, sans les franges parasites que laissent les outils génériques face aux contours doux typiques de l’IA.

Étape 4 : Animez pour des contenus en mouvement

Vous avez sélectionné vos meilleures images fixes ? Convertissez-les en vidéo avec Wan 2.7 I2V pour un mouvement cinématographique, ou avec Seedance 2.5 pour un contenu qui a besoin d’un son natif en plus du mouvement.

Créatrice de contenu examinant une grille d’images IA sur une tablette en lumière du matin

Le verdict sans détour sur GPT Image 1.5

GPT Image 1.5 est un modèle solide, issu d’une entreprise disposant de moyens de recherche considérables. L’amélioration du réalisme des portraits par rapport à l’original est réelle. Le rendu en photographie d’architecture et de produits est réellement impressionnant pour un outil avant tout pensé pour l’API. Les corrections apportées à l’anatomie des mains sont significatives, même si elles sont incomplètes.

Mais il n’évolue pas dans le vide. Le coût par génération s’accumule au volume de production. Les restrictions de contenu créent des frictions pour le travail créatif professionnel. L’absence de sortie native en 16:9 ajoute une étape de flux de travail que les plateformes concurrentes ont déjà supprimée.

Si vous êtes déjà bien ancré dans l’écosystème OpenAI et que vous avez besoin d’images de produits ou d’architecture avec un comportement API fiable, GPT Image 1.5 mérite sa place dans votre boîte à outils.

Si vous construisez un flux de travail de contenu à partir de zéro, si vous avez besoin de sorties en 16:9 sans étapes de post-traitement, si vous voulez de la latitude créative pour un travail audacieux mais professionnel, ou si vous itérez en volume et que le coût par image compte, les outils de génération d’images de PicassoIA offrent une alternative convaincante, qui égale ou dépasse GPT Image 1.5 sur la plupart des critères qui affectent la qualité quotidienne des résultats.

Lancez votre prochain prompt sur P-Image de PicassoIA et placez les deux résultats côte à côte. La plateforme couvre plus de 91 modèles de texte vers image, des upscalers dédiés à l’impression et au web, la suppression d’arrière-plan et une suite complète de génération de vidéos depuis le même espace de travail. Ce qui demandait autrefois quatre abonnements distincts, des recharges de crédits et des onglets de navigateur tient désormais dans un seul endroit, avec une seule connexion, à un coût qui a enfin du sens pour un volume professionnel.

Partager cet article

Choisissez votre langue