API d’édition d’images : options gratuites, OpenAI, Gemini et Qwen comparées

Choisir une API d’édition d’images revient à arbitrer entre le coût par modification, la vitesse, la prise en charge des masques et le niveau de contrôle dont vous avez besoin. Cet article met côte à côte une voie gratuite, OpenAI, Gemini et Qwen, avec les formats de requête, les indicateurs de prix et un court tableau de décision pour chaque cas d’usage.

API d’édition d’images : options gratuites, OpenAI, Gemini et Qwen comparées
Cristian Da Conceicao
Fondateur de Picasso IA

La plupart des recherches sur une API d’édition d’images se terminent de la même façon : trois onglets ouverts dans le navigateur, un pour OpenAI, un pour Gemini, un pour un dépôt Qwen, et aucune idée claire de celui qui mérite un week-end d’intégration. Les trois se comportent très différemment dès que vous envoyez une vraie photo. L’un réclame un masque, un autre une conversation, le dernier un GPU. Et quelques voies moins chères existent en dehors de ces trois-là.

Cet article compare les options qui comptent en pratique : une voie gratuite, l’endpoint d’édition d’OpenAI, le modèle d’image de Gemini et la famille d’édition Qwen. Vous obtenez la forme de requête de chacune, les indicateurs de prix dignes de confiance, les modes d’échec que vous rencontrerez et un tableau qui associe chaque option à une tâche. Chaque modèle cité ici est aussi disponible sur PicassoIA, ce qui vous permet de tester le même prompt sur tous avant d’écrire la moindre ligne d’intégration.

💡 Réponse rapide : Pour des prototypes rapides et des essais illimités, commencez par un éditeur hébergé gratuit. Pour un respect strict des consignes et un contrôle par masque, choisissez OpenAI. Pour des modifications conversationnelles en plusieurs tours, choisissez Gemini. Pour les poids ouverts et les modifications riches en texte, choisissez Qwen.

Ce que fait une API d’édition d’images

Une API d’édition d’images prend une image existante et une instruction, puis renvoie une image modifiée. Cela ressemble à de la génération d’images, mais la différence change tout. Un appel de génération invente des pixels à partir de rien. Un appel d’édition doit préserver la plus grande partie de l’original, les visages, l’éclairage, l’étiquette du produit, et ne modifier que ce que vous avez demandé.

Développeur tapant sur un ordinateur portable posé sur un bureau debout, avec un éditeur de code et un petit aperçu de photo

Appels d’édition ou appels de génération

Les deux types d’appel se ressemblent sur le plan technique, mais ils échouent de manières différentes.

  • Entrée : un appel de génération prend du texte. Un appel d’édition prend une ou plusieurs images plus du texte, et parfois un masque.
  • Sortie : un appel de génération n’a aucune référence à respecter. Un appel d’édition est jugé par rapport à l’original, donc un visage légèrement décalé ou un logo modifié compte comme un bug.
  • Mode d’échec : la génération échoue en paraissant bizarre. L’édition échoue en dérivant, c’est-à-dire que les parties que vous n’avez jamais mentionnées changent discrètement.
  • Coût : les appels d’édition facturent souvent les tokens de l’image d’entrée en plus de l’image de sortie, si bien qu’une même image peut coûter plus cher à modifier qu’à créer.

Masques, références et instructions

Chaque fournisseur retient l’un de trois styles de contrôle, et ce style façonne toute votre intégration.

  1. Basé sur un masque : vous importez une seconde image où la zone à modifier est marquée. Vous obtenez un contrôle chirurgical, mais vous devez construire ou générer le masque vous-même.
  2. Instruction seule : vous décrivez la modification en langage courant et le modèle décide où l’appliquer. L’intégration est simple, mais la précision dépend de la formulation.
  3. Basé sur des références : vous envoyez deux ou trois images et vous les désignez par leur numéro, par exemple « mets la veste de l’image 2 sur la personne de l’image 1 ».

Mains d’une femme peignant une sélection sur une tablette, au-dessus d’une photo d’un salon ensoleillé

L’inpainting, qui consiste à repeindre une zone sélectionnée, est l’usage classique du masque. L’outpainting, qui élargit la toile au-delà des bords d’origine, repose généralement sur la même idée de masque, retournée à l’envers.

Les options gratuites qui fonctionnent vraiment

Gratuit est le mot le plus galvaudé de ce domaine, il est donc utile de distinguer trois sens : gratuit au téléchargement, gratuit pour un essai limité, et gratuit à l’appel en volume.

Mains d’un photographe tenant un tirage de portrait original à côté d’un tirage retouché

Poids ouverts que vous hébergez vous-même

Le téléchargement gratuit le plus solide est la famille d’édition Qwen, décrite dans sa propre section plus bas. Le modèle de base Qwen Image est une version d’environ 20 milliards de paramètres sous licence Apache 2.0, qui autorise l’usage commercial. Le piège concerne le matériel : il vous faut un GPU sérieux avec beaucoup de VRAM, ou une version quantifiée et de la patience. Votre coût passe des frais par image aux serveurs et au temps d’ingénierie.

FLUX Kontext Dev est un autre éditeur à poids ouverts. Lisez sa licence avant de mettre quoi que ce soit en production, car certaines versions destinées aux développeurs restreignent l’usage commercial.

Offres gratuites et démonstrations hébergées

Les grands fournisseurs proposent des offres gratuites pour leurs API destinées aux développeurs, mais les limites, les modèles éligibles et les plafonds de requêtes changent souvent, et la sortie d’images est fréquemment plus restreinte que celle de texte. Considérez toute offre gratuite comme un espace de prototypage, puis vérifiez la page tarifaire actuelle avant de bâtir un lancement dessus. Les pages de démonstration publiques sur les sites d’hébergement communautaires suffisent pour juger la qualité, et rien de plus. Elles font la file, se mettent en veille et disparaissent.

Où se situe PicassoIA

PicassoIA Image Editor Pro est l’éditeur natif de la plateforme, et sa page produit le présente comme illimité : ni plafond par modification ni quota quotidien. Il accepte jusqu’à trois images de référence et prend une consigne en langage courant.

Pour les développeurs, PicassoIA expose une API REST à https://api.picassoia.com/v1, avec des endpoints de style Replicate : vous créez une prédiction, vous l’interrogez, puis vous récupérez le résultat. Les limites à prendre en compte sont 5 prédictions simultanées par compte, un corps de requête de 10 Mo et des prompts allant jusqu’à 4 000 caractères. La documentation décrit les prédictions API comme actuellement gratuites, tout en mentionnant une exigence de forfait, donc confirmez les conditions exactes sur la page tarifaire avant de bâtir une activité dessus.

L’API d’édition d’images d’OpenAI

La famille GPT Image d’OpenAI est la référence en matière de respect des consignes. Elle lit bien les prompts longs et précis, rend un texte lisible dans les images et suit de près les instructions de mise en page. Sur PicassoIA, vous pouvez essayer côte à côte GPT Image 2, GPT Image 1.5 et GPT Image 1.

Gros plan d’un écran d’ordinateur portable montrant des baskets blanches en cours de modification

Forme de la requête

L’endpoint d’édition prend un formulaire multipart : une ou plusieurs images, un masque facultatif et un prompt. Là où le masque est transparent, le modèle est autorisé à modifier les pixels.

curl https://api.openai.com/v1/images/edits \
  -H "Authorization: Bearer $OPENAI_TOKEN" \
  -F "model=gpt-image-1" \
  -F "image=@room.png" \
  -F "mask=@mask.png" \
  -F "prompt=Replace the sofa with a green velvet sofa, keep the lighting"

Remplacez le nom du modèle par la version la plus récente de GPT Image que votre compte affiche. La qualité et la taille sont des paramètres distincts, et ce sont eux qui font le plus varier la facture.

💡 Astuce : Nommez ce qui doit rester inchangé, pas seulement ce qui doit changer. « Gardez le visage, la chemise et l’arrière-plan identiques » réduit nettement la dérive.

Indicateurs de prix

OpenAI facture au token, et le prix effectif par image dépend de la taille et du niveau de qualité demandés. Un signal plus clair vient de Replicate, où GPT Image 2 est facturé par image produite : environ 0,012 $ en qualité basse, 0,047 $ en moyenne et 0,128 $ en haute. La haute qualité coûte à peu près dix fois plus que la basse, donc un pipeline qui utilise la haute qualité par défaut vous réservera une surprise en fin de mois.

L’API d’édition d’images de Gemini

L’édition d’images de Google s’inscrit dans ses modèles Gemini. La famille est devenue célèbre sous le surnom de Nano Banana, et elle est disponible sous les noms Gemini 2.5 Flash Image, Nano Banana 2 et Nano Banana Pro.

Deux ingénieurs devant un tableau blanc dans un bureau lumineux, l’un pointant un schéma de boîtes et de flèches

Modifications conversationnelles

Gemini modifie les images par le même appel generateContent que celui que vous utilisez pour le texte. Vous envoyez un corps JSON à l’endpoint du modèle gemini-2.5-flash-image, avec vos identifiants dans l’en-tête de la requête, et l’image voyage en données base64 à côté de votre instruction. La réponse renvoie une image dans la même structure.

{
  "contents": [{
    "parts": [
      { "text": "Make the sky overcast and keep everything else" },
      { "inline_data": { "mime_type": "image/png", "data": "<BASE64_IMAGE>" } }
    ]
  }]
}

Aucun masque n’est nécessaire. Vous pouvez aussi poursuivre une conversation et demander une seconde modification par-dessus la première, ce qui est le moyen le plus rapide d’affiner un style visuel. Plusieurs images de référence dans une même requête en font un bon choix pour combiner une personne, un produit et une scène.

Là où il peine

Gemini est généreux en créativité et moins strict sur la préservation. Les détails fins situés hors de la zone modifiée peuvent se déplacer, et une restauration parfaite au pixel près de la zone non touchée n’est pas un point sur lequel vous pouvez compter. Les filtres de sécurité peuvent refuser des requêtes que d’autres modèles acceptent, et les sorties portent un filigrane de provenance invisible. Pour un pipeline où la partie non modifiée de l’image doit rester identique, associez Gemini à une étape de vérification ou choisissez un modèle basé sur un masque.

Les modèles d’édition d’images Qwen

L’équipe Qwen d’Alibaba a publié un modèle d’édition qui excelle dans deux domaines : la modification du texte à l’intérieur d’une image et les changements d’apparence précis et localisés. Sur PicassoIA, vous pouvez exécuter Qwen Image Edit, Qwen Image Edit Plus et Qwen Image Edit 2511.

Vue aérienne d’un bureau couvert de photos de paysages imprimées, aux ciels plus lumineux

Modifications de texte et de mise en page

Si votre travail porte sur des affiches, des emballages, des menus ou des captures d’écran, Qwen mérite un test avant tout le reste. Il peut changer les mots d’un panneau tout en conservant le style de la police et la surface sur laquelle le texte repose. Il gère aussi les modifications sémantiques, comme la rotation d’un objet ou le changement d’une pose, et les modifications d’apparence, comme la suppression d’un élément parasite dans une scène. La variante Plus est celle à essayer lorsque vous avez besoin de plusieurs images d’entrée, et les révisions plus récentes comme 2511 sont celles à tester en priorité pour la cohérence.

Hébergé ou auto-hébergé

Vous disposez de trois voies. Utilisez une API hébergée d’Alibaba Cloud ou une place de marché de modèles pour la commodité d’un paiement à l’appel. Utilisez une plateforme comme PicassoIA pour éviter de créer un compte. Ou exécutez vous-même les poids ouverts avec la bibliothèque diffusers, lorsque le volume est assez élevé pour justifier un GPU.

Les modèles vision-langage sont aussi utiles en marge. Qwen3.7-Plus et Gemini 3.5 Flash savent lire les images : vous pouvez leur demander de rédiger le prompt d’édition à partir d’un bref descriptif, ou de comparer les images avant et après et de signaler toute modification que vous n’avez pas demandée.

Coût, vitesse et adéquation

Le prix par appel n’est qu’un facteur. La latence, le taux de nouvelles tentatives et la quantité de retouches après chaque modification déterminent le coût réel.

Bureau avec une calculatrice, un carnet de chiffres et un ordinateur portable affichant un tableur flou

Comparaison du coût par modification

OptionStyle de contrôlePoint fortModèle de coût
GPT Image 2Masque, référence, instructionPrompts longs, texte dans les imagesPar image, selon le niveau de qualité
Gemini 2.5 Flash ImageInstruction, chat multi-toursCombinaison de plusieurs images, itération rapidePar image produite, offre gratuite variable
Qwen Image EditInstruction, référenceModifications de texte, changements d’apparence localisésPar appel hébergé, ou votre propre GPU
PicassoIA Image Editor ProInstruction, jusqu’à 3 référencesEssais et traitements par lots illimitésPrésenté comme illimité, à vérifier
P Image EditInstructionVitessePar appel, environ une seconde par modification

P Image Edit mérite une mention pour sa seule vitesse : il est présenté comme capable de modifier en une seconde environ, ce qui compte lorsqu’un utilisateur attend de l’autre côté d’un bouton.

Lisez ce tableau comme un point de départ, pas comme un verdict. Les nouvelles tentatives gonflent tous les chiffres qu’il contient. Si un modèle a besoin de trois essais pour produire un résultat propre et un autre d’un seul, le prix d’appel le plus bas perd son avantage. Suivez le taux de modifications acceptées de chaque modèle sur vos propres photos, puis divisez vos dépenses par le nombre de modifications acceptées. Ce chiffre unique, le coût par modification acceptée, est celui à comparer.

Photos de produits pour l’e-commerce

Les catalogues récompensent la constance plutôt que l’ingéniosité. Choisissez un modèle, un gabarit de prompt et un seed fixe lorsque l’API en propose un, puis traitez tout le lot de la même manière. Les changements d’arrière-plan, le nettoyage des ombres et les variantes de couleur sont toutes des modifications par instruction, donc Gemini et Qwen les gèrent sans masque.

Petit studio photo produit avec une tasse en céramique sur un fond blanc continu et une softbox

Trois erreurs reviennent sans cesse dans les pipelines par lots :

  • Changer de modèle en cours de lot. Deux modèles rendent le même prompt avec des dominantes de couleur différentes, et le catalogue paraît inégal.
  • Sauter le contrôle des zones non modifiées. La dérive reste invisible jusqu’à ce qu’un client repère une étiquette déformée.
  • Ignorer les limites de simultanéité. Lancer des centaines d’appels à la fois déclenche une limitation de débit, donc mettez les tâches en file d’attente et respectez le plafond du fournisseur, comme les 5 prédictions simultanées de PicassoIA.

Prévoyez une étape de vérification. Faites passer un modèle vision sur un échantillon de sorties et signalez celles dont le logo est déformé ou l’étiquette modifiée. Repérer une mauvaise image sur cinquante coûte moins cher que rembourser une commande.

Intérieurs immobiliers

Le désencombrement virtuel, le changement de couleur des murs et le remplacement du ciel sont les demandes courantes. Les masques sont rentables ici, car les sols, les fenêtres et la géométrie de la pièce ne doivent pas bouger. L’endpoint d’édition d’OpenAI, avec un masque ne couvrant que l’objet à retirer, offre le contrôle le plus serré.

Photographe immobilier vu de dos retouchant une photo d’un salon lumineux sur un écran

💡 Astuce : Les règles des annonces concernant les photos retouchées diffèrent selon la région et la place de marché. Mentionnez la modification lorsque les règles l’exigent, et ne modifiez jamais la structure, comme la taille d’une pièce.

Comment utiliser Image Editor Pro

Un modèle existe sur PicassoIA pour exactement cette tâche, voici donc le chemin le plus court de la photo au résultat.

  1. Ouvrez la page du modèle. Rendez-vous sur PicassoIA Image Editor Pro.
  2. Ajoutez vos images. Importez jusqu’à trois images de référence. La première est l’image principale, celle qui sera modifiée.
  3. Rédigez le prompt. Décrivez la modification en langage courant et désignez les imports par « image 1 », « image 2 » et « image 3 ».
  4. Réglez les options. Laissez le format sur match_input_image pour conserver les dimensions d’origine, choisissez WebP, JPG ou PNG, et fixez un seed si vous voulez reproduire le résultat.
  5. Générez et comparez. Demandez deux sorties par appel pour voir des variantes, puis enregistrez celle qui conserve intactes les zones non modifiées.
ParamètreCe qu’il faitPar défaut
imagesJusqu’à 3 images de référence, la première est principaleObligatoire
promptLa modification, avec des références comme « image 1 »Obligatoire
num_outputs1 ou 2 résultats par appel1
aspect_ratioFormat de sortie, ou correspondance avec l’entréematch_input_image
output_formatWebP, JPG ou PNGwebp
output_qualityDe 0 à 100 pour JPG et WebP95
seedRésultats reproductiblesAléatoire

Pour le code, le même modèle est accessible via l’API PicassoIA. La requête suit les conventions de Replicate, donc vérifiez les exemples officiels pour les noms exacts des champs avant de passer en production.

curl -X POST https://api.picassoia.com/v1/models/picassoia/picassoia-image-editor-pro/predictions \
  -H "Authorization: Bearer $PICASSOIA_TOKEN" \
  -H "Content-Type: application/json" \
  -d '{"input":{"images":["https://example.com/room.jpg"],"prompt":"Replace the sofa with a green velvet sofa, keep the lighting"}}'

💡 Astuce : Lancez le même prompt sur Nano Banana 2, GPT Image 2 et Qwen Image Edit 2511 avant de choisir un fournisseur. Dix minutes de test côte à côte valent mieux qu’un après-midi à lire des pages tarifaires.

Essayez vos propres modifications dès aujourd’hui

Vous avez maintenant une vue d’ensemble pratique : OpenAI pour un contrôle strict, Gemini pour des changements conversationnels rapides, Qwen pour le texte et les poids ouverts, et un éditeur hébergé gratuit pour les tests en volume. Le moyen le plus rapide de trouver ce qui vous convient est de faire passer une vraie photo de votre projet par chacun d’eux.

Ouvrez PicassoIA Image Editor Pro, importez une photo de produit, un portrait ou une pièce, et rédigez la modification pour laquelle vous paieriez autrement un retoucheur. Comparez-la aussi avec Seedream 4.5 et FLUX Kontext Pro, puis finalisez le meilleur résultat avec la super-résolution pour un export net en 2x ou 4x. Quand vous voudrez comparer davantage d’options, parcourez tous les modèles sur picassoia.com/en/all-models et commencez dès aujourd’hui à créer vos propres images.

Partager cet article

Choisissez votre langue