Cursor और Codex के लिए OpenAI इमेज जनरेशन MCP: सेटअप, लागत और समाधान
Cursor और Codex में OpenAI इमेज जनरेशन MCP जोड़ें और अपने कोडिंग एजेंट को प्रोजेक्ट के भीतर हीरो बैनर, आइकन और एडिट बनाने दें। दोनों एडिटर के लिए कॉपी करने लायक कॉन्फ़िग, GPT Image 2 सेटिंग, हर रेंडर की असली लागत, टाइमआउट के समाधान, और सर्वर को छोड़ने वाला ब्राउज़र रास्ता।
आप Cursor में लैंडिंग पेज का आधा काम कर चुके हैं, हीरो सेक्शन को एक फ़ोटो चाहिए, और एजेंट के पास ग्रे प्लेसहोल्डर बॉक्स के सिवा कुछ नहीं है। Cursor और Codex के लिए OpenAI इमेज जनरेशन MCP यह काम एक कदम में कर देता है: एजेंट एक इमेज टूल कॉल करता है, फ़ाइल आपके प्रोजेक्ट फ़ोल्डर में आ जाती है, और ब्राउज़र का एक भी टैब खोले बिना लेआउट को असली तस्वीर मिल जाती है।
इस आर्टिकल में दोनों एडिटर के लिए सटीक कॉन्फ़िग, ज़रूरी मॉडल सेटिंग, एक रेंडर की लागत, और वे एरर दिखाए गए हैं जो पूरी दोपहर बर्बाद कर देते हैं। इसमें उन लोगों के लिए एक नो-सर्वर रास्ता भी है जो कॉन्फ़िगर करने के बजाय क्लिक करना पसंद करते हैं।
अपने एडिटर में इमेज जनरेशन क्यों रखें
आम रूटीन धीमा होता है। आप एडिटर छोड़ते हैं, किसी इमेज साइट पर जाते हैं, याद से प्रॉम्प्ट लिखते हैं, फ़ाइल डाउनलोड करते हैं, नाम बदलते हैं, उसे /public में खींचते हैं, और कोड में पाथ ठीक करते हैं। हर स्टेप छोटा है, लेकिन मिलकर वे दिन में एक दर्जन बार आपका फ़ोकस तोड़ते हैं।
MCP इमेज टूल इस चक्र को समेट देता है। एजेंट को पहले से पता होता है कि पेज किस बारे में है, क्योंकि उसने अभी मार्कअप लिखा है, इसलिए वह संदर्भ से प्रॉम्प्ट लिख सकता है, फ़ाइल सेव कर सकता है और उसी टर्न में उसका रेफ़रेंस भी दे सकता है।
एजेंट आपके लिए क्या करता है
प्रॉम्प्ट लिखता है आसपास के कोड से, इसलिए प्राइसिंग पेज और रेसिपी ब्लॉग को अलग-अलग तस्वीरें मिलती हैं
टूल कॉल करता है और साइज़, क्वालिटी व बैकग्राउंड चुनता है
फ़ाइल सेव करता है और <img> टैग या CSS अपडेट करता है
फ़ीडबैक पर फिर से चलता है, जैसे "गर्म रोशनी, कम स्टॉक फ़ोटो जैसा"
एजेंट को प्रॉम्प्ट रेसिपी दें
जब आप एजेंट को खाली पन्ने के बजाय एक रेसिपी देते हैं, तो वह बेहतर प्रॉम्प्ट लिखता है। इसे अपने प्रोजेक्ट रूल्स में सेव करें, और तस्वीरें पेज-दर-पेज एक जैसी रहेंगी:
विषय और क्रिया: फ़्रेम में क्या है और वह क्या कर रहा है
सेटिंग: उसके आसपास का कमरा, सड़क या लैंडस्केप
रोशनी: दिशा और दिन का समय, जैसे बाईं ओर से आती खिड़की की नरम रोशनी
कैमरा: लेंस की लंबाई, कोण और दूरी, जैसे आँख की ऊँचाई पर 35mm लेंस
फ़ॉर्मेट: आस्पेक्ट रेशियो, और क्या तस्वीर में हेडलाइन के लिए खाली जगह चाहिए
हर प्रॉम्प्ट में एक तय स्टाइल वाक्य जोड़ें, जैसे "natural light, fine film grain, realistic textures", तो आपका हीरो बैनर, ब्लॉग थंबनेल और एम्प्टी स्टेट एक ही सेट जैसे दिखेंगे। उसी टर्न में एजेंट से alt text भी लिखवाएँ, क्योंकि उसे पहले से पता है कि तस्वीर में क्या दिखता है।
जब बिल्ट-इन टूल काफ़ी हो
Codex CLI पर कम्युनिटी के लेख बताते हैं कि जब OpenAI ने 21 अप्रैल 2026 को gpt-image-2 लॉन्च किया, तब इसके साथ बिल्ट-इन इमेज जनरेशन और $imagegen स्किल भी आया था, और यह अलग API क्रेडेंशियल की जगह आपके ChatGPT लॉगिन पर चलता है। अगर यह आपके इंस्टॉल से मेल खाता है और आपको हफ़्ते में एक तस्वीर चाहिए, तो आपको MCP की ज़रूरत शायद बिल्कुल न पड़े।
MCP सर्वर तभी काम का है जब:
आपको Cursor और Codex में एक ही टूल चाहिए, एक जैसी सेटिंग के साथ।
आपको डिफ़ॉल्ट की जगह क्वालिटी, बैकग्राउंड और साइज़ पर नियंत्रण चाहिए।
आपको मौजूदा स्क्रीनशॉट या फ़ोटो पर मास्क-आधारित एडिट चाहिए।
आप बाद में प्रोवाइडर बदलने की योजना बनाते हैं, बिना अपना वर्कफ़्लो बदले।
💡 पहले जाँच लें: सर्वर जोड़ने से पहले codex --version चलाएँ और Codex के मौजूदा डॉक्स में MCP और इमेज वाले सेक्शन पढ़ें। कोई बिल्ट-इन टूल जिसे आप भूल गए हैं, वही आपका सबसे सस्ता विकल्प है।
सर्वर क्या देता है
npm पर ज़्यादातर OpenAI इमेज सर्वर, जनरेशन और एडिटिंग के लिए Images API एंडपॉइंट के पतले रैपर हैं। लोकप्रिय imagegen-mcp पैकेज दो टूल देता है, और उसका README gpt-image-1, dall-e-2 और dall-e-3 को सपोर्टेड मॉडल के रूप में सूचीबद्ध करता है। नतीजे टेम्पररी फ़ाइलों में सेव होते हैं, और टूल फ़ाइल पाथ के साथ base64 डेटा भी लौटाता है।
दो टूल, दो काम
टूल
आप भेजते हैं
सबसे अच्छा किसके लिए
text-to-image
प्रॉम्प्ट, साइज़, क्वालिटी, संख्या
हीरो बैनर, एम्प्टी-स्टेट आर्ट, आइकन, प्लेसहोल्डर
image-to-image
सोर्स इमेज, प्रॉम्प्ट, वैकल्पिक मास्क
स्क्रीनशॉट का एक हिस्सा ठीक करना, फ़ोटो को नई स्टाइल देना, कोई ऑब्जेक्ट हटाना
एक सामान्य एडिट: अपने प्रोडक्ट की फ़ोटो भेजें, बैकग्राउंड पर मास्क लगाएँ और शांत सेटिंग माँगें। मास्क वाला हिस्सा बदलता है जबकि बाकी इमेज वैसी ही रहती है, जिससे हर वर्ज़न में प्रोडक्ट खुद सुरक्षित रहता है।
मौजूदा OpenAI इमेज मॉडल, स्नैपशॉट gpt-image-2-2026-04-21, जनरेशन, एडिट और बैच के लिए सूचीबद्ध
आपके सर्वर की सूची में यह होना चाहिए
gpt-image-1
पिछली पीढ़ी, और वही जिसका नाम README में दिया गया है
पुराना है, इसलिए बाद में अपडेट करना पड़ सकता है
dall-e-3
पुराना मॉडल
हर रिक्वेस्ट में एक इमेज (n=1)
dall-e-2
चारों में सबसे पुराना
इसे केवल लेगेसी वर्कफ़्लो के लिए रखें
अगर आपके इंस्टॉल किए गए वर्ज़न में gpt-image-2 अभी सूचीबद्ध नहीं है, तो पैकेज अपडेट करें या कोई और सर्वर चुनें जिसमें यह हो। API खुद gpt-image-2 को सादे मॉडल ID के रूप में लेता है, और OpenAI के डॉक्स इसके लिए v1/images/generations, v1/images/edits और v1/batch एंडपॉइंट सूचीबद्ध करते हैं।
Cursor में सेटअप करें
Cursor MCP सर्वर एक mcp.json फ़ाइल से पढ़ता है। आपको एक OpenAI क्रेडेंशियल, PATH पर Node.js और लगभग दो मिनट चाहिए।
ग्लोबल या प्रोजेक्ट स्कोप चुनें
ग्लोबल:~/.cursor/mcp.json टूल को हर प्रोजेक्ट में उपलब्ध कराता है।
प्रोजेक्ट:.cursor/mcp.json उसे एक ही रिपो तक सीमित रखता है, ताकि फ़ोल्डर खोलने वाले साथियों को भी वही टूल मिले।
जब इमेज टूल किसी एक प्रोडक्ट का हो, तब प्रोजेक्ट फ़ाइल इस्तेमाल करें, और जब आप उसे हर जगह चाहें, तब ग्लोबल फ़ाइल। दोनों हालात में सीक्रेट को फ़ाइल से बाहर रखें और Cursor को उसे आपके एनवायरनमेंट से पढ़ने दें।
अपने शेल प्रोफ़ाइल में OPENAI_API_KEY एक्सपोर्ट करें, फिर Cursor को रीस्टार्ट करें ताकि एडिटर प्रोसेस उसे ले सके। MCP सेटिंग खोलें, तो openai-image सर्वर कनेक्टेड दिखना चाहिए, जिसमें दो टूल सूचीबद्ध हों। Cursor Customize साइडबार से किसी सर्वर को बिना डिलीट किए चालू या बंद भी कर सकता है।
💡 अप्रूवल चालू रखें। Cursor डिफ़ॉल्ट रूप से MCP टूल चलाने से पहले पूछता है। जो टूल हर रेंडर पर बिल करता है, उसके लिए यह पुष्टि एक फ़ीचर है, परेशानी नहीं। इमेज टूल को अनुमति-सूची में तभी डालें जब आपने एक हफ़्ते का इस्तेमाल देख लिया हो।
Codex में सेटअप करें
Codex अपनी MCP सेटिंग config.toml में रखता है। आप एक कमांड से सर्वर जोड़ सकते हैं या फ़ाइल खुद एडिट कर सकते हैं।
env_vars आपके शेल से वेरिएबल आगे भेजता है, इसलिए फ़ाइल में कोई सीक्रेट नहीं जाता। फ़ाइल ~/.codex/config.toml पर रहती है, और भरोसेमंद प्रोजेक्ट अपनी .codex/config.toml साथ ला सकता है।
दोनों टाइमआउट जितने दिखते हैं, उससे कहीं ज़्यादा मायने रखते हैं। डिफ़ॉल्ट रूप से Codex सर्वर शुरू होने के लिए 10 सेकंड और टूल कॉल के लिए 60 सेकंड इंतज़ार करता है। पहली npx रन पैकेज डाउनलोड करता है, और हाई क्वालिटी रेंडर में भी समय लग सकता है, इसलिए दोनों डिफ़ॉल्ट वैल्यू तंग हैं। ऊपर दी गई वैल्यूज़ मेरा सुझाव हैं, कोई ज़रूरी शर्त नहीं।
Codex में प्रति-सर्वर अप्रूवल सेटिंग default_tools_approval_mode भी है, जिसके मान prompt और approve जैसे हैं। इसे prompt पर सेट करने से Cursor वाली वही आदत मिलती है, यानी खर्च से पहले पुष्टि। अपने वर्ज़न के सटीक विकल्पों के लिए Codex के MCP डॉक्स जाँचें।
GPT Image 2 की लागत क्या है
MCP सर्वर मुफ़्त सॉफ़्टवेयर है। हर रेंडर का भुगतान आप OpenAI को करते हैं। 1024 बाय 1024 पर, थर्ड-पार्टी प्राइस लिस्ट GPT Image 2 की कीमत लगभग इस तरह बताती हैं:
क्वालिटी
आम उपयोग
हर रेंडर की अनुमानित लागत
लो
लेआउट ड्राफ़्ट, थंबनेल, प्रॉम्प्ट टेस्ट
लगभग $0.006
मीडियम
ब्लॉग इमेज, प्रोडक्ट मॉकअप
लगभग $0.053
हाई
फ़ाइनल हीरो आर्ट, टेक्स्ट-भारी ग्राफ़िक्स
लगभग $0.211
💡 ये आँकड़े रीसेलर की प्राइस लिस्ट से हैं, OpenAI के अपने पेज से नहीं। OpenAI टोकन के हिसाब से बिलिंग करता है, इसलिए बड़े साइज़, इनपुट इमेज वाले एडिट और लंबे प्रॉम्प्ट कुल रकम बदल देते हैं। बजट बनाने से पहले OpenAI के प्राइसिंग पेज पर पुष्टि कर लें।
ड्राफ़्ट सस्ते में, फ़ाइनल महंगे में
कंपोज़िशन और वर्डिंग तय करने के लिए लो क्वालिटी में 40 ड्राफ़्ट रेंडर चलाएँ, लगभग $0.24। फिर 5 हाई क्वालिटी फ़ाइनल पर खर्च करें, लगभग $1.06। पूरा सेशन लगभग $1.30 पर आता है। एक अच्छी तस्वीर पाने के लिए दस अंधाधुंध हाई क्वालिटी कोशिशें अकेले लगभग $2.11 लगतीं।
खर्च की सीमा तय करें
OpenAI डैशबोर्ड में मासिक खर्च की सीमा सेट करें।
एडिटर के लिए अलग प्रोजेक्ट क्रेडेंशियल बनाएँ, ताकि आप उसे अकेले रद्द कर सकें।
आदत पक्की होने तक टूल अप्रूवल चालू रखें।
विकल्पों की तुलना न कर रहे हों तो हर कॉल में एक ही इमेज माँगें।
आम एरर के समाधान
ज़्यादातर फ़ेल्योर पाँच पैटर्न में आते हैं। कुछ भी और बदलने से पहले यह टेबल देखें।
लक्षण
संभावित कारण
समाधान
सर्वर लाल रहता है या कभी कनेक्ट नहीं होता
पहला npx डाउनलोड धीमा है, या npx PATH पर नहीं है
कमांड एक बार टर्मिनल में चलाएँ, फिर Codex में startup_timeout_sec बढ़ाएँ
हर कॉल पर 401 एरर
क्रेडेंशियल एडिटर के एनवायरनमेंट में नहीं है
OPENAI_API_KEY एक्सपोर्ट करें, फिर एडिटर को पूरी तरह रीस्टार्ट करें
बड़े रेंडर पर टूल कॉल टाइमआउट हो जाती है
Codex डिफ़ॉल्ट रूप से 60 सेकंड इंतज़ार करता है
tool_timeout_sec बढ़ाएँ, या क्वालिटी मीडियम कर दें
"Model not found" या 403
आपके अकाउंट या सर्वर की मॉडल सूची में यह मॉडल नहीं है
OpenAI डैशबोर्ड में मॉडल एक्सेस जाँचें और सर्वर अपडेट करें
इमेज पाथ एक गायब फ़ाइल की ओर इशारा करता है
सर्वर ने एक टेम्पररी फ़ोल्डर में लिखा
एजेंट से कहें कि फ़ाइलें आपके assets फ़ोल्डर में कॉपी करे
जब सर्वर कभी कनेक्ट न हो
पहले टर्मिनल में ठीक वही command और args चलाएँ। अगर npx वहाँ पैकेज डाउनलोड कर लेता है, तो अगली बार एडिटर खुलने पर यह तेज़ी से शुरू होगा। Windows पर कुछ सेटअप npx को सिर्फ़ शेल के ज़रिए ही शुरू करते हैं, इसलिए कमांड के रूप में cmd और args के रूप में ["/c", "npx", "-y", "imagegen-mcp", "--models", "gpt-image-1"] आज़माएँ। Codex में किसी और बात पर शक करने से पहले startup_timeout_sec बढ़ाएँ।
मेरी इमेज कहाँ गई
सर्वर हर नतीजा एक टेम्पररी फ़ोल्डर में लिखता है, इसलिए अगली सफ़ाई में फ़ाइल गायब हो सकती है। अपने प्रोजेक्ट रूल्स में एक स्थायी निर्देश जोड़ें: Cursor के लिए .cursor/rules, या Codex के लिए AGENTS.md।
💡 एक काम करने वाला नियम: "इमेज जनरेट करने के बाद उसे public/images/ में कॉपी करें, उसे एक वर्णनात्मक फ़ाइल नाम दें, और ऐसा alt text लिखें जो इमेज का वर्णन करे।"
एक लंबा, साफ़-साफ़ बताने वाला प्रॉम्प्ट पेस्ट करें। मॉडल मल्टी-पार्ट निर्देशों का पालन करता है और इमेज के अंदर पढ़ने लायक टेक्स्ट रेंडर करता है।
नीचे दी टेबल से आस्पेक्ट रेशियो और क्वालिटी चुनें।
बैकग्राउंड चुनें, फिर बताएँ कि कितनी इमेज चाहिए (1 से 10)।
जनरेट करें, फ़ाइल डाउनलोड करें और उसे अपने assets फ़ोल्डर में ले जाएँ।
सेटिंग
विकल्प
कब चुनें
quality
low, medium, high, auto
ड्राफ़्ट के लिए low, फ़ाइनल के लिए high
aspect_ratio
1:1, 3:2, 2:3, 16:9, 9:16, साथ में 3840x2160 तक के फ़िक्स्ड साइज़
हीरो बैनर के लिए 16:9
background
auto, transparent, opaque
आइकन और कटआउट के लिए Transparent
output_format
png, jpeg, webp
ट्रांसपेरेंसी चाहिए तो PNG या WebP
number_of_images
1 से 10
एक ही कॉन्सेप्ट के कई विकल्प
input_images
एक या ज़्यादा रेफ़रेंस इमेज
एडिट और स्टाइल गाइडेंस के लिए
फ़ॉर्म में आपके अपने OpenAI क्रेडेंशियल के लिए एक वैकल्पिक फ़ील्ड भी है। इसे खाली छोड़ दें तो रिक्वेस्ट PicassoIA के प्रॉक्सी से होकर जाती है।
💡 प्रॉम्प्ट का शॉर्टकट:GPT 5.6 Sol या Claude Sonnet 5 जैसे लार्ज लैंग्वेज मॉडल से एक लाइन के आइडिया को विस्तृत प्रॉम्प्ट में बदलवाएँ, फिर नतीजा इमेज फ़ॉर्म में पेस्ट करें।
PicassoIA API और MCP कनेक्टर
PicassoIA डेवलपर API और MCP कनेक्टर भी देता है। बेस URL https://api.picassoia.com/v1 है, रिक्वेस्ट में pia_sk_ से शुरू होने वाला Bearer क्रेडेंशियल इस्तेमाल होता है, और एंडपॉइंट Replicate स्टाइल के हैं: पहले प्रिडिक्शन बनाएँ, फिर उसका स्टेटस पोल करें। इसके ज़रिए चार मॉडल उपलब्ध हैं: PicassoIA Image, PicassoIA Image Editor Pro और दो वीडियो मॉडल।
curl -X POST https://api.picassoia.com/v1/models/picassoia/picassoia-image/predictions \
-H "Authorization: Bearer $PICASSOIA_API_KEY" \
-H "Content-Type: application/json" \
-d '{"input": {"prompt": "wooden desk with a laptop, soft morning light", "aspect_ratio": "16:9"}}'
फिर GET /v1/predictions/{id} को तब तक कॉल करें जब तक statussucceeded न पढ़े, और इमेज URL output से पढ़ें। प्लान करने लायक सीमाएँ: एक अकाउंट पर एक समय में 5 प्रिडिक्शन, प्रॉम्प्ट 4,000 अक्षर तक, और 10 MB रिक्वेस्ट बॉडी।
GPT Image 2 उन चार API मॉडलों में से एक नहीं है। तो बँटवारा सीधा है: Cursor या Codex के अंदर OpenAI का मॉडल चाहिए तो ऊपर वाला OpenAI सर्वर इस्तेमाल करें, और कोड से PicassoIA के अपने इमेज मॉडल चाहिए तो PicassoIA API इस्तेमाल करें। API पेज पर अभी प्रिडिक्शन मुफ़्त दिखाए गए हैं, लेकिन साइट पर कहीं और प्लान की शर्तें अलग तरह से लिखी हैं, इसलिए उस पर भरोसा करने से पहले प्राइसिंग पेज पर शर्तें जाँच लें।
आज ही अपनी पहली इमेज बनाएँ
छोटे से शुरू करें। PicassoIA पर GPT Image 2 खोलें, वह प्रॉम्प्ट पेस्ट करें जो आप अपने एजेंट को देते, और लो क्वालिटी में तीन वैरिएशन जनरेट करें। उनकी तुलना करें, एक विजेता चुनें और उसे हाई क्वालिटी में दोबारा चलाएँ। इन दस मिनटों में आपको अपने प्रॉम्प्ट के बारे में एक घंटे की कॉन्फ़िग-ट्वीकिंग से ज़्यादा बता देंगे।
पहले आज़माने लायक तीन प्रॉम्प्ट:
हीरो बैनर: आपके प्रोडक्ट के मूड से मेल खाता एक चौड़ा 16:9 सीन, जिसमें हेडलाइन के लिए बाईं ओर जगह हो
एम्प्टी स्टेट: एक शांत, सरल फ़ोटो-स्टाइल सीन, जो यूज़र को डेटा जोड़ने से पहले स्क्रीन पर दिखता है
सोशल प्रीव्यू: एक बोल्ड 3:2 इमेज, जिसके अंदर दो शब्दों का कैप्शन रेंडर हो
जब तस्वीरें सही लगने लगें, तो वही सेटिंग Cursor या Codex में जोड़ें और सेविंग का काम एजेंट को करने दें। अगर पहले और विकल्प देखना चाहते हैं, तो पूरी मॉडल सूची picassoia.com/en/all-models पर है। कोई मॉडल चुनें, PicassoIA पर अपना पहला प्रॉम्प्ट चलाएँ, और लंच तक देखें कि आपके प्रोजेक्ट फ़ोल्डर में क्या आ गया।