इमेज एडिटिंग API: मुफ़्त, OpenAI, Gemini और Qwen विकल्पों की तुलना
इमेज एडिटिंग API चुनना चार चीज़ों पर निर्भर करता है: हर एडिट की लागत, स्पीड, मास्क सपोर्ट और आपको कितना कंट्रोल चाहिए। यह लेख एक मुफ़्त रास्ता, OpenAI, Gemini और Qwen को साथ-साथ रखता है, जिसमें रिक्वेस्ट का ढाँचा, प्राइस के संकेत और हर उपयोग के लिए एक छोटी निर्णय तालिका शामिल है।
इमेज एडिटिंग API की ज़्यादातर खोजें एक ही जगह खत्म होती हैं: तीन ब्राउज़र टैब खुले होते हैं, एक OpenAI का, एक Gemini का, एक Qwen रिपॉज़िटरी का, और यह साफ़ नहीं होता कि इनमें से किस पर एक वीकेंड का इंटीग्रेशन काम लगाना चाहिए। असली फ़ोटो भेजते ही तीनों बहुत अलग तरह से काम करते हैं। एक को मास्क चाहिए, एक को बातचीत चाहिए, और एक को GPU चाहिए। और कुछ सस्ते रास्ते इन तीनों से बाहर भी हैं।
यह लेख उन विकल्पों की तुलना करता है जो व्यवहार में मायने रखते हैं: एक मुफ़्त रास्ता, OpenAI का edits endpoint, Gemini इमेज मॉडल, और Qwen एडिट फ़ैमिली। आपको हर एक का रिक्वेस्ट ढाँचा, भरोसे लायक प्राइस संकेत, वे विफलता के तरीके जो आपके सामने आएँगे, और एक तालिका मिलेगी जो हर विकल्प को एक काम से जोड़ती है। यहाँ नाम लिया गया हर मॉडल PicassoIA पर भी चलता है, इसलिए आप इंटीग्रेशन कोड की एक लाइन लिखने से पहले एक ही प्रॉम्प्ट सभी पर आज़मा सकते हैं।
💡 त्वरित उत्तर: तेज़ प्रोटोटाइप और असीमित ट्रायल रन के लिए एक मुफ़्त होस्टेड एडिटर से शुरू करें। सख्त निर्देश-पालन और मास्क कंट्रोल के लिए OpenAI चुनें। बातचीत वाले, कई चरणों के एडिट के लिए Gemini चुनें। ओपन वेट्स और टेक्स्ट-भारी एडिट के लिए Qwen चुनें।
इमेज एडिटिंग API क्या करता है
इमेज एडिटिंग API एक मौजूदा तस्वीर और एक निर्देश लेता है, और बदली हुई तस्वीर लौटाता है। यह इमेज जनरेशन जैसा लगता है, लेकिन फ़र्क ही सब कुछ तय करता है। जनरेशन कॉल बिना किसी आधार के पिक्सल गढ़ता है। एडिट कॉल को मूल तस्वीर का ज़्यादातर हिस्सा बचाकर रखना होता है, जैसे चेहरे, रोशनी, प्रोडक्ट का लेबल, और सिर्फ़ वही बदलना होता है जो आपने माँगा है।
एडिट कॉल बनाम जनरेशन कॉल
दोनों तरह की कॉल वायर पर एक जैसी दिखती हैं, लेकिन उनकी विफलता अलग तरीकों से होती है।
इनपुट: जनरेशन कॉल टेक्स्ट लेती है। एडिट कॉल एक या अधिक इमेज और टेक्स्ट लेती है, और कभी-कभी मास्क भी।
आउटपुट: जनरेशन कॉल के पास मिलाने के लिए कोई संदर्भ नहीं होता। एडिट कॉल की जाँच मूल तस्वीर से होती है, इसलिए चेहरे का थोड़ा खिसकना या लोगो का बदल जाना बग माना जाता है।
विफलता का तरीका: जनरेशन अजीब दिखकर विफल होता है। एडिटिंग ड्रिफ़्ट होकर विफल होती है, यानी वे हिस्से चुपचाप बदल जाते हैं जिनका आपने ज़िक्र तक नहीं किया।
लागत: एडिट कॉल में अक्सर आउटपुट इमेज के ऊपर इनपुट इमेज टोकन भी बिल होते हैं, इसलिए वही तस्वीर बनाने से ज़्यादा महँगी एडिट हो सकती है।
मास्क, रेफ़रेंस और निर्देश
हर प्रोवाइडर तीन कंट्रोल शैलियों में से एक चुनता है, और यही शैली आपका पूरा इंटीग्रेशन तय करती है।
मास्क आधारित: आप एक दूसरी इमेज अपलोड करते हैं जिसमें बदले जाने वाले हिस्से को चिह्नित किया गया है। इससे आपको बारीक कंट्रोल मिलता है, लेकिन मास्क आपको खुद बनाना या जनरेट करना पड़ता है।
सिर्फ़ निर्देश: आप सादी भाषा में बदलाव बताते हैं और मॉडल तय करता है कि उसे कहाँ लागू करना है। इंटीग्रेशन बहुत आसान है, लेकिन सटीकता शब्दों के चुनाव पर निर्भर करती है।
रेफ़रेंस आधारित: आप दो या तीन इमेज भेजते हैं और उन्हें नंबर से बुलाते हैं, जैसे "इमेज 2 की जैकेट इमेज 1 के व्यक्ति पर लगाओ।"
इनपेंटिंग, यानी चुने हुए हिस्से को दोबारा पेंट करना, मास्क का क्लासिक उपयोग है। आउटपेंटिंग, जो कैनवास को मूल सीमाओं से आगे बढ़ाती है, आम तौर पर उसी मास्क के विचार को उल्टा करके काम करती है।
मुफ़्त विकल्प जो सचमुच काम करते हैं
इस क्षेत्र में "मुफ़्त" शब्द का सबसे ज़्यादा दुरुपयोग होता है, इसलिए तीन अर्थ अलग करना मददगार है: मुफ़्त डाउनलोड, सीमित ट्रायल के लिए मुफ़्त, और बड़ी मात्रा में मुफ़्त कॉल।
ओपन वेट्स जिन्हें आप खुद होस्ट करते हैं
सबसे मज़बूत मुफ़्त डाउनलोड Qwen एडिट फ़ैमिली है, जिसका वर्णन नीचे अपने अलग सेक्शन में है। बेसिक Qwen Image मॉडल लगभग 20 बिलियन पैरामीटर का रिलीज़ है, जो Apache 2.0 लाइसेंस के तहत आता है और इसमें कमर्शियल उपयोग की अनुमति है। पेच हार्डवेयर का है: आपको भरपूर VRAM वाला एक गंभीर GPU चाहिए, या क्वांटाइज़्ड बिल्ड और धैर्य। आपकी लागत प्रति इमेज शुल्क से हटकर सर्वर और इंजीनियरिंग समय में चली जाती है।
FLUX Kontext Dev एक और ओपन वेट एडिटर है। कुछ भी शिप करने से पहले इसका लाइसेंस ज़रूर पढ़ें, क्योंकि कुछ डेवलपर रिलीज़ कमर्शियल उपयोग पर रोक लगाते हैं।
मुफ़्त टियर और होस्टेड डेमो
बड़े प्रोवाइडर अपने डेवलपर APIs के लिए मुफ़्त टियर देते हैं, लेकिन सीमाएँ, योग्य मॉडल और रेट कैप अक्सर बदलते हैं, और इमेज आउटपुट पर अक्सर टेक्स्ट से ज़्यादा सख्त सीमा होती है। किसी भी मुफ़्त टियर को प्रोटोटाइप बनाने की जगह मानें, और लॉन्च की योजना बनाने से पहले मौजूदा प्राइसिंग पेज ज़रूर जाँचें। कम्युनिटी होस्टिंग साइट्स के सार्वजनिक डेमो पेज क्वालिटी आँकने के लिए ठीक हैं, इससे ज़्यादा कुछ नहीं। वे कतार में लगते हैं, सो जाते हैं और गायब हो जाते हैं।
PicassoIA कहाँ फ़िट बैठता है
PicassoIA Image Editor Pro प्लेटफ़ॉर्म पर मौजूद नेटिव एडिटर है, और इसका प्रोडक्ट पेज इसे असीमित बताता है: हर एडिट पर कोई सीमा नहीं और कोई दैनिक कोटा नहीं। यह तीन रेफ़रेंस इमेज तक स्वीकार करता है और सादी भाषा का प्रॉम्प्ट लेता है।
डेवलपर्स के लिए PicassoIA https://api.picassoia.com/v1 पर एक REST API देता है, जिसके एंडपॉइंट Replicate जैसे हैं: आप एक prediction बनाते हैं, उसकी स्थिति जाँचते हैं, फिर नतीजा लाते हैं। योजना बनाते समय इन सीमाओं का ध्यान रखें: प्रति अकाउंट 5 concurrent predictions, 10 MB की रिक्वेस्ट बॉडी और 4,000 अक्षर तक के प्रॉम्प्ट। डॉक्स API predictions को अभी मुफ़्त बताते हैं, फिर भी एक प्लान की शर्त का ज़िक्र करते हैं, इसलिए किसी बिज़नेस को इस पर खड़ा करने से पहले प्राइसिंग पेज पर सटीक शर्तें ज़रूर जाँच लें।
OpenAI Image Editing API
OpenAI का GPT Image फ़ैमिली निर्देश-पालन का बेंचमार्क है। यह लंबे और विशिष्ट प्रॉम्प्ट अच्छी तरह पढ़ता है, इमेज के अंदर पढ़ने लायक टेक्स्ट रेंडर करता है, और लेआउट के निर्देशों का बारीकी से पालन करता है। PicassoIA पर आप GPT Image 2, GPT Image 1.5 और GPT Image 1 को साथ-साथ आज़मा सकते हैं।
रिक्वेस्ट का ढाँचा
edits endpoint एक multipart फ़ॉर्म लेता है: एक या अधिक इमेज, एक वैकल्पिक मास्क और एक प्रॉम्प्ट। जहाँ मास्क पारदर्शी है, वहाँ मॉडल पिक्सल बदल सकता है।
curl https://api.openai.com/v1/images/edits \
-H "Authorization: Bearer $OPENAI_TOKEN" \
-F "model=gpt-image-1" \
-F "image=@room.png" \
-F "mask=@mask.png" \
-F "prompt=Replace the sofa with a green velvet sofa, keep the lighting"
मॉडल का नाम अपने अकाउंट में दिखने वाले सबसे नए GPT Image मॉडल से बदल दें। क्वालिटी और साइज़ अलग पैरामीटर हैं, और बिल को किसी भी और चीज़ से ज़्यादा ये ही तय करते हैं।
💡 टिप: सिर्फ़ यह न बताएँ कि क्या बदलना है, यह भी बताएँ कि क्या जस का तस रहना चाहिए। "चेहरा, शर्ट और बैकग्राउंड बिल्कुल वैसे ही रखें" जैसा वाक्य ड्रिफ़्ट को उल्लेखनीय रूप से कम करता है।
प्राइस के संकेत
OpenAI टोकन के हिसाब से बिल करता है, और प्रति इमेज असरदार कीमत आपके माँगे गए साइज़ और क्वालिटी टियर पर निर्भर करती है। एक साफ़ संकेत Replicate से मिलता है, जहाँ GPT Image 2 प्रति आउटपुट इमेज के हिसाब से बिल होता है: लगभग $0.012 कम क्वालिटी पर, $0.047 मीडियम पर और $0.128 हाई पर। हाई क्वालिटी लो से लगभग दस गुना महँगी है, इसलिए जो पाइपलाइन डिफ़ॉल्ट रूप से हाई रखती है, वह महीने के आख़िर में चौंका देगी।
Gemini एडिट उसी generateContent कॉल के ज़रिए होता है जिसे आप टेक्स्ट के लिए इस्तेमाल करते हैं। आप gemini-2.5-flash-image मॉडल endpoint पर JSON बॉडी भेजते हैं, अपने क्रेडेंशियल रिक्वेस्ट हेडर में रखते हैं, और इमेज आपके निर्देश के साथ base64 डेटा के रूप में जाती है। जवाब में उसी ढाँचे में इमेज लौटती है।
इसमें मास्क की ज़रूरत नहीं होती। आप चैट जारी रख सकते हैं, पहले बदलाव के ऊपर दूसरा बदलाव माँग सकते हैं, और किसी लुक को निखारने का यह सबसे तेज़ तरीका है। एक ही रिक्वेस्ट में कई रेफ़रेंस इमेज होने से यह किसी व्यक्ति, प्रोडक्ट और दृश्य को मिलाने के लिए अच्छा विकल्प बन जाता है।
कहाँ यह लड़खड़ाता है
Gemini रचनात्मकता में उदार है, लेकिन संरक्षण के मामले में उतना सख्त नहीं। एडिट किए गए हिस्से के बाहर की बारीक चीज़ें खिसक सकती हैं, और अछूते हिस्से की हूबहू पिक्सल-परफ़ेक्ट बहाली पर भरोसा नहीं किया जा सकता। सेफ़्टी फ़िल्टर ऐसे अनुरोधों को मना कर सकते हैं जिन्हें दूसरे मॉडल स्वीकार कर लेते हैं, और आउटपुट में एक अदृश्य प्रोवेनेंस वॉटरमार्क होता है। ऐसी पाइपलाइन के लिए जहाँ इमेज का अछूता हिस्सा हूबहू वैसा ही रहना चाहिए, Gemini के साथ एक जाँच चरण जोड़ें या मास्क आधारित मॉडल चुनें।
Qwen Image Edit मॉडल
Alibaba की Qwen टीम ने एक एडिटिंग मॉडल जारी किया है जो दो क्षेत्रों में चमकता है: तस्वीर के अंदर का टेक्स्ट बदलने में और सटीक, स्थानीय रूप-रंग बदलावों में। PicassoIA पर आप Qwen Image Edit, Qwen Image Edit Plus और Qwen Image Edit 2511 चला सकते हैं।
टेक्स्ट और लेआउट एडिट
अगर आपका काम पोस्टर, पैकेजिंग, मेन्यू या स्क्रीनशॉट से जुड़ा है, तो किसी भी और चीज़ से पहले Qwen को आज़माना चाहिए। यह साइन पर लिखे शब्द बदल सकता है और फ़ॉन्ट की शैली और उस सतह को बरकरार रख सकता है जिस पर टेक्स्ट है। यह सिमेंटिक एडिट भी संभालता है, जैसे किसी वस्तु को घुमाना या पोज़ बदलना, और अपीयरेंस एडिट भी, जैसे दृश्य से कोई अनचाहा तत्व हटाना। जब आपको कई इनपुट इमेज चाहिए, तो Plus वेरिएंट आज़माएँ, और स्थिरता के लिए 2511 जैसे नए रिवीज़न पहले परखें।
होस्टेड या सेल्फ़-होस्टेड
आपके पास तीन रास्ते हैं। प्रति कॉल भुगतान की सुविधा के लिए Alibaba Cloud या किसी मॉडल मार्केटप्लेस का होस्टेड API लें। अकाउंट सेटअप से बचने के लिए PicassoIA जैसे प्लेटफ़ॉर्म का उपयोग करें। या जब वॉल्यूम GPU की ज़रूरत को सही ठहराए, तब diffusers लाइब्रेरी के साथ ओपन वेट्स खुद चलाएँ।
विज़न लैंग्वेज मॉडल मुख्य काम के अलावा सहायक भूमिका निभाते हैं। Qwen3.7-Plus और Gemini 3.5 Flash इमेज पढ़ सकते हैं, इसलिए आप किसी एक से छोटे ब्रीफ़ से एडिट प्रॉम्प्ट लिखवा सकते हैं, या पहले और बाद की इमेज की तुलना करवाकर ऐसा हर बदलाव चिह्नित करवा सकते हैं जो आपने नहीं माँगा था।
लागत, स्पीड और फ़िट
प्रति कॉल कीमत सिर्फ़ एक इनपुट है। लेटेंसी, रीट्राई रेट और हर एडिट के बाद की सफ़ाई का काम असली लागत तय करते हैं।
P Image Edit अकेले स्पीड के लिए ध्यान देने लायक है: इसे लगभग एक सेकंड में एडिट करने वाला बताया गया है, जो तब मायने रखता है जब बटन के दूसरी ओर कोई उपयोगकर्ता इंतज़ार कर रहा हो।
तालिका को फ़ैसला नहीं, शुरुआती बिंदु मानें। रीट्राई हर संख्या को बढ़ा देते हैं। अगर एक मॉडल को साफ़ नतीजे के लिए तीन कोशिशें चाहिए और दूसरे को एक, तो कम स्टिकर कीमत हार जाती है। अपनी तस्वीरों पर हर मॉडल का स्वीकृत एडिट रेट ट्रैक करें, फिर कुल खर्च को स्वीकृत एडिट की संख्या से भाग दें। यही एक आँकड़ा, यानी प्रति स्वीकृत एडिट लागत, तुलना का सही पैमाना है।
ई-कॉमर्स प्रोडक्ट फ़ोटो
कैटलॉग चतुराई से ज़्यादा स्थिरता को इनाम देते हैं। एक मॉडल, एक प्रॉम्प्ट टेम्पलेट चुनें, और जहाँ API देता हो वहाँ एक तय सीड रखें, फिर पूरे बैच को एक ही तरीके से चलाएँ। बैकग्राउंड बदलना, शैडो साफ़ करना और कलर वेरिएंट, ये सब निर्देश वाले एडिट हैं, इसलिए Gemini और Qwen इन्हें बिना मास्क के संभाल लेते हैं।
बैच पाइपलाइन में तीन गलतियाँ बार-बार दिखती हैं:
बैच के बीच मॉडल बदलना। दो मॉडल एक ही प्रॉम्प्ट को अलग रंग-झुकाव के साथ रेंडर करते हैं, और कैटलॉग असमान दिखता है।
अछूते हिस्से की जाँच छोड़ना। ड्रिफ़्ट तब तक अदृश्य रहता है जब तक कोई ग्राहक मुड़ा हुआ लेबल न देख ले।
concurrency सीमाओं को नज़रअंदाज़ करना। सैकड़ों कॉल एक साथ दागने से थ्रॉटलिंग शुरू होती है, इसलिए जॉब्स को कतार में लगाएँ और प्रोवाइडर की सीमा का पालन करें, जैसे PicassoIA पर 5 concurrent predictions।
एक वेरिफ़िकेशन चरण का बजट रखें। आउटपुट के नमूने पर विज़न मॉडल चलाएँ और मुड़े लोगो या बदले लेबल वाली इमेज चिह्नित करें। पचास में से एक खराब इमेज पकड़ना ऑर्डर का रिफ़ंड करने से सस्ता पड़ता है।
रियल एस्टेट इंटीरियर
वर्चुअल डिक्लटरिंग, दीवार के रंग बदलना और आसमान बदलना आम माँगें हैं। यहाँ मास्क काम आते हैं, क्योंकि फ़र्श, खिड़कियाँ और कमरे की ज्यामिति नहीं हिलनी चाहिए। जिस चीज़ को हटाना है सिर्फ़ उस पर मास्क के साथ OpenAI का edits endpoint सबसे सख्त कंट्रोल देता है।
💡 टिप: एडिट की गई फ़ोटो के लिस्टिंग नियम क्षेत्र और मार्केटप्लेस के हिसाब से अलग होते हैं। नियम माँगें तो एडिट का खुलासा करें, और कमरे के आकार जैसी संरचना कभी न बदलें।
Image Editor Pro कैसे इस्तेमाल करें
PicassoIA पर इसी काम के लिए एक मॉडल मौजूद है, इसलिए यहाँ फ़ोटो से नतीजे तक का सबसे छोटा रास्ता है।
अपनी इमेज जोड़ें। तीन रेफ़रेंस इमेज तक अपलोड करें। पहली इमेज मुख्य इमेज है जिसे एडिट किया जाता है।
प्रॉम्प्ट लिखें। सादी भाषा में बदलाव बताएँ और अपलोड को "इमेज 1", "इमेज 2" और "इमेज 3" कहकर संदर्भित करें।
विकल्प सेट करें। आस्पेक्ट रेशियो match_input_image पर छोड़ें ताकि मूल आयाम बने रहें, WebP, JPG या PNG चुनें, और नतीजा दोहराना हो तो सीड लॉक करें।
जनरेट करें और तुलना करें। वेरिएशन देखने के लिए हर कॉल पर दो आउटपुट माँगें, फिर वह सेव करें जो अछूते हिस्सों को सुरक्षित रखता हो।
पैरामीटर
यह क्या करता है
डिफ़ॉल्ट
images
3 रेफ़रेंस इमेज तक, पहली मुख्य है
ज़रूरी
prompt
एडिट, "इमेज 1" जैसे रेफ़रेंस के साथ
ज़रूरी
num_outputs
हर कॉल पर 1 या 2 नतीजे
1
aspect_ratio
आउटपुट का आकार, या इनपुट से मिलाएँ
match_input_image
output_format
WebP, JPG या PNG
webp
output_quality
JPG और WebP के लिए 0 से 100
95
seed
दोहराए जा सकने वाले नतीजे
रैंडम
कोड के लिए वही मॉडल PicassoIA API के ज़रिए उपलब्ध है। रिक्वेस्ट Replicate के नियमों का पालन करती है, इसलिए शिप करने से पहले सटीक फ़ील्ड नामों के लिए आधिकारिक उदाहरण ज़रूर जाँचें।
curl -X POST https://api.picassoia.com/v1/models/picassoia/picassoia-image-editor-pro/predictions \
-H "Authorization: Bearer $PICASSOIA_TOKEN" \
-H "Content-Type: application/json" \
-d '{"input":{"images":["https://example.com/room.jpg"],"prompt":"Replace the sofa with a green velvet sofa, keep the lighting"}}'
💡 टिप: प्रोवाइडर चुनने से पहले वही प्रॉम्प्ट Nano Banana 2, GPT Image 2 और Qwen Image Edit 2511 पर चलाएँ। दस मिनट की साथ-साथ जाँच प्राइसिंग पेज पढ़ने में बिताए एक दोपहर से बेहतर है।
आज अपने एडिट आज़माएँ
अब आपके पास व्यावहारिक तस्वीर है: सख्त कंट्रोल के लिए OpenAI, तेज़ बातचीत वाले बदलावों के लिए Gemini, टेक्स्ट और ओपन वेट्स के लिए Qwen, और बड़े पैमाने पर परखने के लिए एक मुफ़्त होस्टेड एडिटर। अपना सही विकल्प खोजने का सबसे तेज़ तरीका है कि अपने प्रोजेक्ट की एक असली फ़ोटो इन सभी पर चलाकर देखें।
PicassoIA Image Editor Pro खोलें, एक प्रोडक्ट शॉट, एक पोर्ट्रेट या एक कमरा अपलोड करें, और वह एडिट लिखें जिसके लिए आप वरना किसी रीटचर को पैसे देते। उसे Seedream 4.5 और FLUX Kontext Pro के मुकाबले भी रखकर देखें, फिर सबसे अच्छे नतीजे को सुपर रेज़ोल्यूशन से 2x या 4x का साफ़ और तीखा एक्सपोर्ट बनाने के लिए निखारें। जब और विकल्प तुलना करने के लिए तैयार हों, तो picassoia.com/en/all-models पर हर मॉडल देखें और आज ही अपनी इमेज बनाना शुरू करें।