API d’édition d’images : options gratuites, OpenAI, Gemini et Qwen comparées
Choisir une API d’édition d’images revient à arbitrer entre le coût par modification, la vitesse, la prise en charge des masques et le niveau de contrôle dont vous avez besoin. Cet article met côte à côte une voie gratuite, OpenAI, Gemini et Qwen, avec les formats de requête, les indicateurs de prix et un court tableau de décision pour chaque cas d’usage.
La plupart des recherches sur une API d’édition d’images se terminent de la même façon : trois onglets ouverts dans le navigateur, un pour OpenAI, un pour Gemini, un pour un dépôt Qwen, et aucune idée claire de celui qui mérite un week-end d’intégration. Les trois se comportent très différemment dès que vous envoyez une vraie photo. L’un réclame un masque, un autre une conversation, le dernier un GPU. Et quelques voies moins chères existent en dehors de ces trois-là.
Cet article compare les options qui comptent en pratique : une voie gratuite, l’endpoint d’édition d’OpenAI, le modèle d’image de Gemini et la famille d’édition Qwen. Vous obtenez la forme de requête de chacune, les indicateurs de prix dignes de confiance, les modes d’échec que vous rencontrerez et un tableau qui associe chaque option à une tâche. Chaque modèle cité ici est aussi disponible sur PicassoIA, ce qui vous permet de tester le même prompt sur tous avant d’écrire la moindre ligne d’intégration.
💡 Réponse rapide : Pour des prototypes rapides et des essais illimités, commencez par un éditeur hébergé gratuit. Pour un respect strict des consignes et un contrôle par masque, choisissez OpenAI. Pour des modifications conversationnelles en plusieurs tours, choisissez Gemini. Pour les poids ouverts et les modifications riches en texte, choisissez Qwen.
Ce que fait une API d’édition d’images
Une API d’édition d’images prend une image existante et une instruction, puis renvoie une image modifiée. Cela ressemble à de la génération d’images, mais la différence change tout. Un appel de génération invente des pixels à partir de rien. Un appel d’édition doit préserver la plus grande partie de l’original, les visages, l’éclairage, l’étiquette du produit, et ne modifier que ce que vous avez demandé.
Appels d’édition ou appels de génération
Les deux types d’appel se ressemblent sur le plan technique, mais ils échouent de manières différentes.
Entrée : un appel de génération prend du texte. Un appel d’édition prend une ou plusieurs images plus du texte, et parfois un masque.
Sortie : un appel de génération n’a aucune référence à respecter. Un appel d’édition est jugé par rapport à l’original, donc un visage légèrement décalé ou un logo modifié compte comme un bug.
Mode d’échec : la génération échoue en paraissant bizarre. L’édition échoue en dérivant, c’est-à-dire que les parties que vous n’avez jamais mentionnées changent discrètement.
Coût : les appels d’édition facturent souvent les tokens de l’image d’entrée en plus de l’image de sortie, si bien qu’une même image peut coûter plus cher à modifier qu’à créer.
Masques, références et instructions
Chaque fournisseur retient l’un de trois styles de contrôle, et ce style façonne toute votre intégration.
Basé sur un masque : vous importez une seconde image où la zone à modifier est marquée. Vous obtenez un contrôle chirurgical, mais vous devez construire ou générer le masque vous-même.
Instruction seule : vous décrivez la modification en langage courant et le modèle décide où l’appliquer. L’intégration est simple, mais la précision dépend de la formulation.
Basé sur des références : vous envoyez deux ou trois images et vous les désignez par leur numéro, par exemple « mets la veste de l’image 2 sur la personne de l’image 1 ».
L’inpainting, qui consiste à repeindre une zone sélectionnée, est l’usage classique du masque. L’outpainting, qui élargit la toile au-delà des bords d’origine, repose généralement sur la même idée de masque, retournée à l’envers.
Les options gratuites qui fonctionnent vraiment
Gratuit est le mot le plus galvaudé de ce domaine, il est donc utile de distinguer trois sens : gratuit au téléchargement, gratuit pour un essai limité, et gratuit à l’appel en volume.
Poids ouverts que vous hébergez vous-même
Le téléchargement gratuit le plus solide est la famille d’édition Qwen, décrite dans sa propre section plus bas. Le modèle de base Qwen Image est une version d’environ 20 milliards de paramètres sous licence Apache 2.0, qui autorise l’usage commercial. Le piège concerne le matériel : il vous faut un GPU sérieux avec beaucoup de VRAM, ou une version quantifiée et de la patience. Votre coût passe des frais par image aux serveurs et au temps d’ingénierie.
FLUX Kontext Dev est un autre éditeur à poids ouverts. Lisez sa licence avant de mettre quoi que ce soit en production, car certaines versions destinées aux développeurs restreignent l’usage commercial.
Offres gratuites et démonstrations hébergées
Les grands fournisseurs proposent des offres gratuites pour leurs API destinées aux développeurs, mais les limites, les modèles éligibles et les plafonds de requêtes changent souvent, et la sortie d’images est fréquemment plus restreinte que celle de texte. Considérez toute offre gratuite comme un espace de prototypage, puis vérifiez la page tarifaire actuelle avant de bâtir un lancement dessus. Les pages de démonstration publiques sur les sites d’hébergement communautaires suffisent pour juger la qualité, et rien de plus. Elles font la file, se mettent en veille et disparaissent.
Où se situe PicassoIA
PicassoIA Image Editor Pro est l’éditeur natif de la plateforme, et sa page produit le présente comme illimité : ni plafond par modification ni quota quotidien. Il accepte jusqu’à trois images de référence et prend une consigne en langage courant.
Pour les développeurs, PicassoIA expose une API REST à https://api.picassoia.com/v1, avec des endpoints de style Replicate : vous créez une prédiction, vous l’interrogez, puis vous récupérez le résultat. Les limites à prendre en compte sont 5 prédictions simultanées par compte, un corps de requête de 10 Mo et des prompts allant jusqu’à 4 000 caractères. La documentation décrit les prédictions API comme actuellement gratuites, tout en mentionnant une exigence de forfait, donc confirmez les conditions exactes sur la page tarifaire avant de bâtir une activité dessus.
L’API d’édition d’images d’OpenAI
La famille GPT Image d’OpenAI est la référence en matière de respect des consignes. Elle lit bien les prompts longs et précis, rend un texte lisible dans les images et suit de près les instructions de mise en page. Sur PicassoIA, vous pouvez essayer côte à côte GPT Image 2, GPT Image 1.5 et GPT Image 1.
Forme de la requête
L’endpoint d’édition prend un formulaire multipart : une ou plusieurs images, un masque facultatif et un prompt. Là où le masque est transparent, le modèle est autorisé à modifier les pixels.
curl https://api.openai.com/v1/images/edits \
-H "Authorization: Bearer $OPENAI_TOKEN" \
-F "model=gpt-image-1" \
-F "image=@room.png" \
-F "mask=@mask.png" \
-F "prompt=Replace the sofa with a green velvet sofa, keep the lighting"
Remplacez le nom du modèle par la version la plus récente de GPT Image que votre compte affiche. La qualité et la taille sont des paramètres distincts, et ce sont eux qui font le plus varier la facture.
💡 Astuce : Nommez ce qui doit rester inchangé, pas seulement ce qui doit changer. « Gardez le visage, la chemise et l’arrière-plan identiques » réduit nettement la dérive.
Indicateurs de prix
OpenAI facture au token, et le prix effectif par image dépend de la taille et du niveau de qualité demandés. Un signal plus clair vient de Replicate, où GPT Image 2 est facturé par image produite : environ 0,012 $ en qualité basse, 0,047 $ en moyenne et 0,128 $ en haute. La haute qualité coûte à peu près dix fois plus que la basse, donc un pipeline qui utilise la haute qualité par défaut vous réservera une surprise en fin de mois.
L’API d’édition d’images de Gemini
L’édition d’images de Google s’inscrit dans ses modèles Gemini. La famille est devenue célèbre sous le surnom de Nano Banana, et elle est disponible sous les noms Gemini 2.5 Flash Image, Nano Banana 2 et Nano Banana Pro.
Modifications conversationnelles
Gemini modifie les images par le même appel generateContent que celui que vous utilisez pour le texte. Vous envoyez un corps JSON à l’endpoint du modèle gemini-2.5-flash-image, avec vos identifiants dans l’en-tête de la requête, et l’image voyage en données base64 à côté de votre instruction. La réponse renvoie une image dans la même structure.
Aucun masque n’est nécessaire. Vous pouvez aussi poursuivre une conversation et demander une seconde modification par-dessus la première, ce qui est le moyen le plus rapide d’affiner un style visuel. Plusieurs images de référence dans une même requête en font un bon choix pour combiner une personne, un produit et une scène.
Là où il peine
Gemini est généreux en créativité et moins strict sur la préservation. Les détails fins situés hors de la zone modifiée peuvent se déplacer, et une restauration parfaite au pixel près de la zone non touchée n’est pas un point sur lequel vous pouvez compter. Les filtres de sécurité peuvent refuser des requêtes que d’autres modèles acceptent, et les sorties portent un filigrane de provenance invisible. Pour un pipeline où la partie non modifiée de l’image doit rester identique, associez Gemini à une étape de vérification ou choisissez un modèle basé sur un masque.
Les modèles d’édition d’images Qwen
L’équipe Qwen d’Alibaba a publié un modèle d’édition qui excelle dans deux domaines : la modification du texte à l’intérieur d’une image et les changements d’apparence précis et localisés. Sur PicassoIA, vous pouvez exécuter Qwen Image Edit, Qwen Image Edit Plus et Qwen Image Edit 2511.
Modifications de texte et de mise en page
Si votre travail porte sur des affiches, des emballages, des menus ou des captures d’écran, Qwen mérite un test avant tout le reste. Il peut changer les mots d’un panneau tout en conservant le style de la police et la surface sur laquelle le texte repose. Il gère aussi les modifications sémantiques, comme la rotation d’un objet ou le changement d’une pose, et les modifications d’apparence, comme la suppression d’un élément parasite dans une scène. La variante Plus est celle à essayer lorsque vous avez besoin de plusieurs images d’entrée, et les révisions plus récentes comme 2511 sont celles à tester en priorité pour la cohérence.
Hébergé ou auto-hébergé
Vous disposez de trois voies. Utilisez une API hébergée d’Alibaba Cloud ou une place de marché de modèles pour la commodité d’un paiement à l’appel. Utilisez une plateforme comme PicassoIA pour éviter de créer un compte. Ou exécutez vous-même les poids ouverts avec la bibliothèque diffusers, lorsque le volume est assez élevé pour justifier un GPU.
Les modèles vision-langage sont aussi utiles en marge. Qwen3.7-Plus et Gemini 3.5 Flash savent lire les images : vous pouvez leur demander de rédiger le prompt d’édition à partir d’un bref descriptif, ou de comparer les images avant et après et de signaler toute modification que vous n’avez pas demandée.
Coût, vitesse et adéquation
Le prix par appel n’est qu’un facteur. La latence, le taux de nouvelles tentatives et la quantité de retouches après chaque modification déterminent le coût réel.
P Image Edit mérite une mention pour sa seule vitesse : il est présenté comme capable de modifier en une seconde environ, ce qui compte lorsqu’un utilisateur attend de l’autre côté d’un bouton.
Lisez ce tableau comme un point de départ, pas comme un verdict. Les nouvelles tentatives gonflent tous les chiffres qu’il contient. Si un modèle a besoin de trois essais pour produire un résultat propre et un autre d’un seul, le prix d’appel le plus bas perd son avantage. Suivez le taux de modifications acceptées de chaque modèle sur vos propres photos, puis divisez vos dépenses par le nombre de modifications acceptées. Ce chiffre unique, le coût par modification acceptée, est celui à comparer.
Photos de produits pour l’e-commerce
Les catalogues récompensent la constance plutôt que l’ingéniosité. Choisissez un modèle, un gabarit de prompt et un seed fixe lorsque l’API en propose un, puis traitez tout le lot de la même manière. Les changements d’arrière-plan, le nettoyage des ombres et les variantes de couleur sont toutes des modifications par instruction, donc Gemini et Qwen les gèrent sans masque.
Trois erreurs reviennent sans cesse dans les pipelines par lots :
Changer de modèle en cours de lot. Deux modèles rendent le même prompt avec des dominantes de couleur différentes, et le catalogue paraît inégal.
Sauter le contrôle des zones non modifiées. La dérive reste invisible jusqu’à ce qu’un client repère une étiquette déformée.
Ignorer les limites de simultanéité. Lancer des centaines d’appels à la fois déclenche une limitation de débit, donc mettez les tâches en file d’attente et respectez le plafond du fournisseur, comme les 5 prédictions simultanées de PicassoIA.
Prévoyez une étape de vérification. Faites passer un modèle vision sur un échantillon de sorties et signalez celles dont le logo est déformé ou l’étiquette modifiée. Repérer une mauvaise image sur cinquante coûte moins cher que rembourser une commande.
Intérieurs immobiliers
Le désencombrement virtuel, le changement de couleur des murs et le remplacement du ciel sont les demandes courantes. Les masques sont rentables ici, car les sols, les fenêtres et la géométrie de la pièce ne doivent pas bouger. L’endpoint d’édition d’OpenAI, avec un masque ne couvrant que l’objet à retirer, offre le contrôle le plus serré.
💡 Astuce : Les règles des annonces concernant les photos retouchées diffèrent selon la région et la place de marché. Mentionnez la modification lorsque les règles l’exigent, et ne modifiez jamais la structure, comme la taille d’une pièce.
Comment utiliser Image Editor Pro
Un modèle existe sur PicassoIA pour exactement cette tâche, voici donc le chemin le plus court de la photo au résultat.
Ajoutez vos images. Importez jusqu’à trois images de référence. La première est l’image principale, celle qui sera modifiée.
Rédigez le prompt. Décrivez la modification en langage courant et désignez les imports par « image 1 », « image 2 » et « image 3 ».
Réglez les options. Laissez le format sur match_input_image pour conserver les dimensions d’origine, choisissez WebP, JPG ou PNG, et fixez un seed si vous voulez reproduire le résultat.
Générez et comparez. Demandez deux sorties par appel pour voir des variantes, puis enregistrez celle qui conserve intactes les zones non modifiées.
Paramètre
Ce qu’il fait
Par défaut
images
Jusqu’à 3 images de référence, la première est principale
Obligatoire
prompt
La modification, avec des références comme « image 1 »
Obligatoire
num_outputs
1 ou 2 résultats par appel
1
aspect_ratio
Format de sortie, ou correspondance avec l’entrée
match_input_image
output_format
WebP, JPG ou PNG
webp
output_quality
De 0 à 100 pour JPG et WebP
95
seed
Résultats reproductibles
Aléatoire
Pour le code, le même modèle est accessible via l’API PicassoIA. La requête suit les conventions de Replicate, donc vérifiez les exemples officiels pour les noms exacts des champs avant de passer en production.
curl -X POST https://api.picassoia.com/v1/models/picassoia/picassoia-image-editor-pro/predictions \
-H "Authorization: Bearer $PICASSOIA_TOKEN" \
-H "Content-Type: application/json" \
-d '{"input":{"images":["https://example.com/room.jpg"],"prompt":"Replace the sofa with a green velvet sofa, keep the lighting"}}'
💡 Astuce : Lancez le même prompt sur Nano Banana 2, GPT Image 2 et Qwen Image Edit 2511 avant de choisir un fournisseur. Dix minutes de test côte à côte valent mieux qu’un après-midi à lire des pages tarifaires.
Essayez vos propres modifications dès aujourd’hui
Vous avez maintenant une vue d’ensemble pratique : OpenAI pour un contrôle strict, Gemini pour des changements conversationnels rapides, Qwen pour le texte et les poids ouverts, et un éditeur hébergé gratuit pour les tests en volume. Le moyen le plus rapide de trouver ce qui vous convient est de faire passer une vraie photo de votre projet par chacun d’eux.
Ouvrez PicassoIA Image Editor Pro, importez une photo de produit, un portrait ou une pièce, et rédigez la modification pour laquelle vous paieriez autrement un retoucheur. Comparez-la aussi avec Seedream 4.5 et FLUX Kontext Pro, puis finalisez le meilleur résultat avec la super-résolution pour un export net en 2x ou 4x. Quand vous voudrez comparer davantage d’options, parcourez tous les modèles sur picassoia.com/en/all-models et commencez dès aujourd’hui à créer vos propres images.