GPT Image 1.5: AI से असली दिखने वाली फ़ोटो कैसे बनाएँ
GPT Image 1.5 अब तक AI का बनाया असली कैमरे के सबसे करीब का टूल है। यह लेख सटीक प्रॉम्प्ट स्ट्रक्चर, कैमरा की भाषा, लाइटिंग के शब्द और सब्जेक्ट-आधारित तरीके बताता है, जो असली दिखने वाली इमेज को साफ़ तौर पर नकली दिखने वाली इमेज से अलग करते हैं।
GPT Image 1.5 ज़्यादातर AI इमेज मॉडल जैसा महसूस नहीं होता। यह रेंडर नहीं करता। यह फ़ोटो खींचता है। फ़र्क तब तक बारीक लगता है जब तक आप उसे देख नहीं लेते, और एक बार देख लेने के बाद उसे अनदेखा करना मुश्किल होता है: त्वचा पर रोशनी जिस तरह पड़ती है, धुंधला बैकग्राउंड फिर भी जिस तरह भौतिक जगह जैसा लगता है, और चीज़ों में जो वज़न होता है। यह लेख GPT Image 1.5 का इस्तेमाल करके "साफ़ तौर पर AI" और "फ़ोटो भी हो सकती है" के बीच की दूरी मिटाने के बारे में है, और इसके लिए हम आपको सटीक फ़्रेमवर्क देंगे।
GPT Image 1.5 असल में क्या है
सिर्फ़ एक और टेक्स्ट-टू-इमेज मॉडल नहीं
ज़्यादातर इमेज जनरेटर सुंदर आउटपुट बनाने के लिए ट्रेन किए जाते हैं। GPT Image 1.5 सटीक आउटपुट बनाने के लिए ट्रेन किया गया है। यह OpenAI की मल्टीमॉडल रिसर्च पाइपलाइन से निकला है, वही वंश जिसने GPT-4o को विज़ुअल इनपुट पर तर्क करने की क्षमता दी। यह पृष्ठभूमि मायने रखती है: मॉडल को सिर्फ़ यह नहीं दिखाया गया कि फ़ोटो कैसी दिखती हैं, बल्कि यह भी कि असली फ़ोटोग्राफ़ी कैसे काम करती है, जैसे पर्सपेक्टिव डिस्टॉर्शन, लेंस का व्यवहार, डेप्थ फ़ॉलऑफ़ और वातावरणीय धुंध।
परिणाम एक ऐसा मॉडल है जो फ़ोटोग्राफ़िक लॉजिक को लगभग किसी भी दूसरे उपलब्ध विकल्प से बेहतर संभालता है। 85mm पोर्ट्रेट माँगें, तो यह बैकग्राउंड को सूक्ष्म रूप से कंप्रेस करेगा, ठीक वैसे जैसे असली 85mm लेंस करता है। सुबह की रोशनी माँगें, तो यह हिसाब लगाएगा कि उस कोण पर परछाइयाँ कहाँ पड़ेंगी। यह संयोग से होने वाला व्यवहार नहीं है — यह भौतिक वास्तविकता की सीखी हुई समझ है।
पिछले वर्ज़न से कैसे अलग है
OpenAI के पिछले इमेज मॉडल इलस्ट्रेशन, कॉन्सेप्ट आर्ट और विज़ुअल स्टोरीटेलिंग में अच्छे थे। GPT Image 1.5 का फ़ोकस तेज़ी से फ़ोटोरियलिज़्म और निर्देशों का पालन की ओर गया है। जहाँ DALL-E 3 "खिड़की के पास किताब पढ़ती एक महिला" को पेंटिंग जैसी नरमी के साथ समझ सकता है, वहीं GPT Image 1.5 उसे डॉक्यूमेंट्री जैसी सटीकता के साथ रेंडर करता है: लकड़ी की खिड़की की चौखट का दाना, काँच पर हल्की चमक, और जिस तरह उसके बाल तीन आयामों में गिरते हैं।
यह नेगेटिव स्पेस और कंपोज़िशन को भी ज़्यादा सोच-समझकर संभालता है। मॉडल को लगता है कि फ़्रेम में जो नहीं है वह उतना ही मायने रखता है जितना जो है। यह एक फ़ोटोग्राफ़िक समझ है जो ज़्यादातर दूसरे मॉडलों में नहीं होती।
AI फ़ोटो अब भी नकली क्यों लगती हैं
5 साफ़ पहचान वाले संकेत
सबसे अच्छे मॉडलों के साथ भी ज़्यादातर AI इमेज असली होने की जाँच में फ़ेल हो जाती हैं। यह रहा कारण:
समस्या
कैसी दिखती है
ऐसा क्यों होता है
बहुत चिकनी त्वचा
प्लास्टिक जैसी बनावट, रोम-छिद्र नहीं
मॉडल कमियों का औसत निकाल देते हैं
एकसमान बोकेह
बैकग्राउंड का ब्लर बिल्कुल एक-जैसा होता है
लेंस ऑप्टिक्स की समझ नहीं होती
गलत परछाईं का लॉजिक
असंभव कोणों से पड़ती परछाइयाँ
रोशनी के स्रोत की मॉडलिंग असंगत होती है
डरावने आँखों के रिफ़्लेक्शन
सममित या कृत्रिम कैचलाइट्स
कई स्रोतों से इंटरपोलेट किए गए होते हैं
बहुत परफ़ेक्ट कम्पोज़िशन
केंद्रित, स्थिर, Instagram-clean
"अच्छी" दिखने वाली इमेज की ओर ट्रेनिंग का झुकाव
मॉडल अकेले क्या ठीक नहीं कर सकता
GPT Image 1.5 इनमें से कई समस्याएँ अपने-आप ठीक कर देता है, खासकर परछाई के तर्क और लेंस के व्यवहार की। लेकिन त्वचा की बनावट, कंपोज़िशन की विविधता और ग्रेन ऐसे क्षेत्र हैं जहाँ प्रॉम्प्ट ही भार उठाता है। जब तक आप नहीं बताते, मॉडल अपूर्णताएँ नहीं जोड़ेगा। जब तक आप कोई निचला कोण नहीं बताते, वह नीचे से शॉट नहीं लेगा। जब तक आप फ़िल्म स्टॉक का नाम नहीं लेते, वह फ़िल्म ग्रेन नहीं जोड़ेगा। आपको उसकी भाषा बोलनी होगी।
💡 मुख्य बात: असली फ़ोटो अपूर्ण होती हैं। आपके प्रॉम्प्ट को अपूर्णता साफ़ शब्दों में माँगनी होगी। अगर आपका प्रॉम्प्ट विज्ञापन की कॉपी जैसा लगता है, तो आउटपुट स्टॉक फ़ोटो जैसा दिखेगा।
फ़ोटोरियलिस्टिक प्रॉम्प्ट बनाना
मुख्य प्रॉम्प्ट फ़ॉर्मूला
अपने प्रॉम्प्ट में सबसे बड़ा सुधार है चार परतों की सटीकता जोड़ना: सब्जेक्ट, एनवायरनमेंट, लाइट और कैमरा। ज़्यादातर लोग सब्जेक्ट सही लिखते हैं और बाकी तीन को नज़रअंदाज़ कर देते हैं।
[Subject with natural imperfection] + [Specific environment with texture details] + [Named light source, direction, and quality] + [Camera model, lens, f-stop, ISO] + [Film stock or color grade] + [--ar 16:9 --style raw]
पहले और बाद का उदाहरण यह रहा:
कमज़ोर: खिड़की के पास बैठी एक महिला
मज़बूत: अपने बीस के आखिरी वर्षों में एक महिला, प्राकृतिक झाईं और थोड़े हवा से बिखरे बालों के साथ, एक मिनिमलिस्ट टोक्यो अपार्टमेंट में फ़र्श से छत तक की खिड़की के बगल में बैठी, एक बादल भरे दिन दोपहर 4 बजे, बाईं ओर से फैली हल्की धूसर रोशनी जिसमें कड़ी परछाइयाँ नहीं, Sony A7IV पर 85mm f/1.8 लेंस से खींची गई, Kodak Portra 400 कलर ग्रेड, दिखने वाला फ़िल्म ग्रेन, --ar 16:9 --style raw
दूसरे प्रॉम्प्ट में मॉडल के पास किसी आम चीज़ पर डिफ़ॉल्ट करने की गुंजाइश नहीं बचती।
काम करने वाली कैमरा और लेंस की भाषा
फ़ोटोरियलिज़्म के लिए प्रॉम्प्ट इंजीनियरिंग में यह सबसे कम इस्तेमाल होने वाला टूल है। अलग-अलग लेंस बुनियादी रूप से अलग इमेज बनाते हैं, और GPT Image 1.5 इन फ़र्कों को समझता है।
लेंस
प्रभाव
सबसे अच्छा किसके लिए
24mm f/2.8
चौड़ा, किनारों पर हल्का डिस्टॉर्शन
आर्किटेक्चर, इंटीरियर, एनवायरनमेंट
50mm f/1.8
प्राकृतिक पर्सपेक्टिव, सपाट कंप्रेशन
स्ट्रीट, डॉक्यूमेंट्री, सामान्य पोर्ट्रेट
85mm f/1.4
कंप्रेस्ड बैकग्राउंड, सुंदर बोकेह
अंतरंग पोर्ट्रेट, क्लोज़-अप
135mm f/2.0
मज़बूत कंप्रेशन, उथला DOF
डिटेल-प्रधान पोर्ट्रेट, दूर के सब्जेक्ट
लेंस के साथ हमेशा एक असली कैमरा बॉडी जोड़ें: Sony A7IV, Nikon Z8, Canon R5, Leica M11। इससे मॉडल आम "फ़ोटो" सौंदर्य के बजाय पेशेवर फ़ोटोग्राफ़ी के नियमों में टिका रहता है।
लाइटिंग की शब्दावली जो सब कुछ बदल देती है
"अच्छी लाइटिंग" प्रॉम्प्ट इंजीनियरिंग का सबसे बेकार वाक्यांश है। साफ़ लाइटिंग की भाषा साफ़ और असली लगने वाले नतीजे देती है।
यह शब्दावली इस्तेमाल करें:
दिशा: ऊपर-बाईं ओर से, ठीक पीछे से, 30 डिग्री के निचले कोण से
गुणवत्ता: कड़ी सीधी धूप, नरम बादल वाला प्रसार, गर्म ट्यूंगस्टन इनडोर चमक, गोल्डन आवर की वॉल्यूमेट्रिक किरणें
सब्जेक्ट के साथ संपर्क: बालों के बीच से प्राकृतिक हेलो बनाना, गालों की हड्डियों पर त्रि-आयामी परछाइयाँ डालना, सफ़ेद दीवार से आती परावर्तित रोशनी से दृश्य भरना
रंग तापमान: 5500K दिन की रोशनी, 2800K मोमबत्ती जैसी गर्माहट, सर्दियों की सुबह का नीला-धूसर रंग
💡 प्रो टिप: प्राथमिक रोशनी के साथ एक द्वितीयक फ़िल-लाइट जोड़ें, ठीक वैसे ही जैसे एक असली फ़ोटोग्राफ़र करता है। उदाहरण: "प्राथमिक रोशनी: दाईं ओर से कड़ी दोपहर की धूप जिससे गहरी परछाइयाँ बनें। फ़िल: चमकदार कंक्रीट फ़र्श से आती नरम परावर्तित रोशनी।"
PicassoIA पर GPT Image 1.5 का इस्तेमाल
GPT Image 1.5 सीधे PicassoIA पर उपलब्ध है, जहाँ आप इसे API एक्सेस, बिलिंग सेटअप या डेवलपमेंट एनवायरनमेंट के बिना चला सकते हैं। यह रहा प्लेटफ़ॉर्म पर मॉडल से सबसे अच्छे नतीजे पाने का तरीका।
अपना प्रॉम्प्ट लिखें ऊपर दिए फ़ॉर्मूले से: सब्जेक्ट + एनवायरनमेंट + लाइट + कैमरा
आस्पेक्ट रेशियो सेट करें: सिनेमाई दृश्यों के लिए 16:9, पोर्ट्रेट के लिए 4:5, प्रोडक्ट शॉट के लिए 1:1
अंत में स्टाइल मॉडिफ़ायर जोड़ें: --style raw इलस्ट्रेशन के बजाय फ़ोटोरियलिज़्म का संकेत देता है
चलाएँ और जाँचें: ऊपर बताए AI के पहचान वाले संकेत देखें। अगर त्वचा एकसमान दिखे, तो साफ़ बनावट वाली भाषा के साथ दोबारा कोशिश करें
सेटिंग्स और पैरामीटर जो आज़माने लायक हैं
कुछ संयोजन जो लगातार अच्छे नतीजे देते हैं:
पोर्ट्रेट: 85mm भाषा + खिड़की की रोशनी + Kodak Portra 400 + दिखने वाले रोमकूप/झाईं
एनवायरनमेंट: चौड़ा लेंस + नामित जगह + खास मौसम/दिन का समय + फ़िल्म ग्रेन
प्रोडक्ट: ओवरहेड मैक्रो शॉट + नामित संगमरमर/लकड़ी की सतह + ऊपर से नरम स्टूडियो लाइट
💡 मॉडल नेगेटिव विवरणों को अच्छी तरह समझता है। "कोई कृत्रिम रोशनी नहीं, कोई डिजिटल पोस्ट-प्रोसेसिंग लुक नहीं, कोई स्टॉक फ़ोटो कंपोज़िशन नहीं" जैसे वाक्य जोड़ने से नतीजे एडिटोरियल रियलिज़्म की ओर जाते हैं।
सब्जेक्ट के अनुसार
ऐसे पोर्ट्रेट जो आँखों को धोखा दें
पोर्ट्रेट सबसे कठिन श्रेणी है। मानव आँखें विकास के दौरान चेहरों में सूक्ष्म गड़बड़ी पहचानने के लिए तैयार हुई हैं। यह अनकैनी वैली की समस्या है। GPT Image 1.5 के साथ इसे पार करने के लिए तरीका है विश्वसनीय अपूर्णता जोड़ना।
असली चेहरों में ये होते हैं:
असमान त्वचा का रंग: नाक पर थोड़ा गर्म, आँखों के नीचे थोड़ा ठंडा
असममितता: एक आँख थोड़ी ऊँची, एक नासिका थोड़ी चौड़ी
मौसम के अनुरूप बनावट: सर्दी में रूखी त्वचा, गर्म मौसम में हल्की चमक
स्वाभाविक रूप से बिखरे बाल: माथे पर कुछ लटें, सिर के ऊपरी हिस्से पर हल्का फ़्रिज़
यह सब अपने प्रॉम्प्ट में शामिल करें। निर्देश मिलने पर मॉडल इसे बहुत अच्छे से संभालता है। इसके बिना आपको ऐसा चेहरा मिलता है जो किसी ऐसे व्यक्ति ने रीटच किया लगता है जिसने असली इंसान कभी देखा ही नहीं।
लैंडस्केप और आर्किटेक्चर
लैंडस्केप में GPT Image 1.5 को सबसे स्वाभाविक बढ़त मिलती है। मॉडल वातावरणीय पर्सपेक्टिव को संभालता है, जैसे दूर की पहाड़ियों का धुंध में घुलना या सुबह के कोहरे का पानी की सतह के ठीक ऊपर टिके रहना, और यह उल्लेखनीय सटीकता के साथ होता है।
यहाँ के नियम:
हमेशा दिन का समय और मौसम बताएँ: ये रोशनी के व्यवहार को ख़ास तौर पर सीमित करते हैं
मौसम जोड़ें: बादल वाले दिन सुंदर समान रोशनी देते हैं; बारिश चमकदार सतहें बनाती है
दूरी की परतें बताएँ: नज़दीकी अग्रभूमि, मध्य में सब्जेक्ट, दूर का बैकग्राउंड। इससे गहराई बनती है
कई पैमानों पर बनावट शामिल करें: रास्ते पर बजरी, रेलिंग पर जंग, पत्थर पर काई
प्रोडक्ट और स्टिल लाइफ़
प्रोडक्ट फ़ोटोग्राफ़ी देखने में सरल लगती है, पर असल में बहुत माँगने वाली है। चुनौती यह है कि असली प्रोडक्ट फ़ोटो में नियंत्रित, सोची-समझी अपूर्णता होती है: बोतल पर एक उंगली का निशान, वज़न का आभास देने वाली हल्की परछाई, एक ऐसी सतह जिसे इस्तेमाल किया गया हो।
GPT Image 1.5 के साथ स्टिल लाइफ़ के लिए:
नामित सतह सामग्री इस्तेमाल करें (कैरारा संगमरमर, अखरोट की लकड़ी, धूसर लिनेन), सिर्फ़ "सफ़ेद बैकग्राउंड" नहीं
परछाई का प्रकार बताएँ: "ऊपर और थोड़ा बाईं ओर से एक ही स्रोत से आती लंबी नरम परछाइयाँ"
निर्जीव प्रोडक्ट में जैविक तत्व जोड़ें, जैसे जड़ी-बूटी की टहनी या पंखुड़ियाँ, ताकि क्लिनिकल एहसास टूटे
सतह की अत्यधिक बारीक बनावट के लिए 50mm या 100mm के साथ मैक्रो लेंस की भाषा इस्तेमाल करें
कॉपी करने लायक प्रॉम्प्ट टेम्पलेट
पोर्ट्रेट फ़ॉर्मूला
[Subject with specific age, skin tone, hair type, natural imperfections] in [named location with specific time and season], wearing [specific fabric with texture description]. [Primary light: direction, quality, source]. [Secondary fill: brief description]. Caught in a [candid/contemplative/natural] moment. Shot on [camera body] with [lens] at [f-stop], ISO [number]. [Film stock] color grade, organic film grain, photorealistic, 8K. --ar 16:9 --style raw
एनवायरनमेंट फ़ॉर्मूला
[Aerial/low-angle/eye-level] view of [named location with cultural specificity] at [time of day] in [season/weather]. [Distance layer 1: specific texture]. [Distance layer 2: main subject]. [Distance layer 3: background quality and atmosphere]. [Light behavior at this time of day]. Shot at [focal length] f/[stop], [film stock] color grading, natural grain. --ar 16:9 --style raw
4 गलतियाँ जो रियलिज़्म को बिगाड़ देती हैं
1. सामान्य विशेषण इस्तेमाल करना: "सुंदर", "शानदार", "अद्भुत" मॉडल को फ़ोटोग्राफ़ी के बारे में कुछ नहीं बताते। इनकी जगह साफ़ और निरीक्षण-आधारित भाषा लिखें।
2. बैकग्राउंड को भूल जाना: भले ही वह आउट-ऑफ़-फ़ोकस हो, बैकग्राउंड भौतिक रूप से विश्वसनीय होना चाहिए। "धुंधला बैकग्राउंड" कोई जगह नहीं है। "गर्म पेंडेंट लाइट वाला धुंधला गोदाम का इंटीरियर" है।
3. फ़िल्म ग्रेन छोड़ देना: डिजिटल रूप से साफ़ AI रेंडर डिजिटल रूप से साफ़ दिखते हैं। असली फ़ोटो में, आधुनिक डिजिटल फ़ोटो में भी, नॉइज़, माइक्रो-कंट्रास्ट और रंग चैनलों में सूक्ष्म बदलाव होते हैं। हमेशा कोई फ़िल्म स्टॉक या डिजिटल नॉइज़ का समकक्ष बताएँ।
4. सब कुछ केंद्र में रखना: असली फ़ोटोग्राफ़र स्वाभाविक रूप से रूल ऑफ़ थर्ड्स का इस्तेमाल करते हैं। कंपोज़िशन की भाषा जोड़ें: "सब्जेक्ट फ़्रेम के बाएँ तीसरे हिस्से में स्थित", "फ़्रेम के खाली दाएँ आधे हिस्से की ओर देखता हुआ"। इससे AI की सममित डिफ़ॉल्ट आदत टूटती है।
अब आपकी बारी, देखें यह क्या करता है
रेंडर की हुई दिखने वाली AI फ़ोटो और Sony A1 पर खींची गई दिखने वाली फ़ोटो के बीच का फ़र्क लगभग पूरी तरह प्रॉम्प्ट की सटीकता पर टिका है। GPT Image 1.5 में क्षमता है। सवाल यह है कि क्या आपके प्रॉम्प्ट उसे वह जानकारी देते हैं जिसकी उसे ज़रूरत है।
PicassoIA आपको बिना किसी सेटअप की झंझट के मॉडल तक पहुँच देता है। ऊपर दिया पोर्ट्रेट फ़ॉर्मूला लें, अपना सब्जेक्ट डालें और चलाएँ। नतीजे की तुलना अपने पिछले प्रॉम्प्ट से करें। बनावट, रोशनी के व्यवहार और कंपोज़िशन के रियलिज़्म में फ़र्क तुरंत दिखेगा।
GPT Image 1.5 के अलावा PicassoIA फ़ोटोरियलिज़्म पर केंद्रित विकल्प भी देता है, जैसे Flux 1.1 Pro Ultra, Realistic Vision v5.1 और Qwen Image 2, जिनमें से हर एक की अलग-अलग सब्जेक्ट श्रेणियों में अपनी ताकत है। प्लेटफ़ॉर्म आपको इनके बीच तुरंत बदलने और आउटपुट की साथ-साथ तुलना करने देता है।
फ़ोटोरियलिस्टिक AI फ़ोटोग्राफ़ी अब सही मॉडल तक पहुँच की बात नहीं रही। यह इस बात की बात है कि आप जो चाहते हैं उसे माँगना कैसे जानते हैं।