बैकग्राउंड हटाने वाला AI कैसे काम करता है: पिक्सल-परफ़ेक्ट कटआउट के पीछे का विज्ञान

बैकग्राउंड हटाने का काम पहले घंटों की मैनुअल पेन टूल मेहनत मांगता था। AI हर पिक्सल को उसके संदर्भ में पढ़कर, सिमेंटिक सेगमेंटेशन चलाकर और सॉफ़्ट किनारों के लिए अल्फ़ा मैट कैलकुलेट करके यह काम सेकंडों में कर देता है। यह लेख कन्वोल्यूशनल न्यूरल नेटवर्क से लेकर इमेज मैटिंग तक असली विज्ञान समझाता है, और बताता है कि कुछ सब्जेक्ट अब भी मॉडल को क्यों चकमा दे देते हैं।

बैकग्राउंड हटाने वाला AI कैसे काम करता है: पिक्सल-परफ़ेक्ट कटआउट के पीछे का विज्ञान
Cristian Da Conceicao
Picasso IA के संस्थापक

बैकग्राउंड हटाने के लिए पहले घंटों की सावधानी वाली पेन टूल मेहनत लगती थी। 400% ज़ूम पर हर बाल को अलग-अलग ट्रेस करना पड़ता था और उम्मीद करनी पड़ती थी कि सब्जेक्ट और बैकग्राउंड का रंग-कॉन्ट्रास्ट इतना अच्छा हो कि काम बन जाए। एक ही फ़ोटो में पूरी दोपहर लग सकती थी।

AI ने इसे पूरी तरह बदल दिया है। फ़ोटो अपलोड करें और सेकंडों में साफ़ कटआउट वापस मिल जाता है। जो जादू जैसा लगता है, वह असल में पिक्सल स्तर पर होने वाले फ़ैसलों का एक सटीक क्रम है। यह लेख बताता है कि मॉडल ठीक-ठीक क्या करता है, उस पल से लेकर जब वह आपकी इमेज पढ़ता है, उस पल तक जब वह साफ़ फ़ोरग्राउंड एक्सट्रैक्शन तैयार करता है।

बाल के किनारों वाले जटिल स्ट्रैंड दिखाता क्लोज़-अप पोर्ट्रेट, जिसके पीछे धुंधला जंगली फूलों वाला बैकग्राउंड है

AI फ़ोटो में असल में क्या देखता है

हर पिक्सल को एक लेबल मिलता है

डिजिटल इमेज पिक्सल के ग्रिड से बनती है। हर पिक्सल तीन संख्याएँ रखता है: लाल, हरा और नीला चैनल मान, जो 0 से 255 तक होते हैं। यही कच्चा इनपुट है। 1920x1080 इमेज में लगभग बीस लाख ऐसे तीन-संख्या वाले डेटा पॉइंट होते हैं।

बैकग्राउंड हटाने वाला मॉडल उन बीस लाख डेटा पॉइंट को देखता है और हर पिक्सल को दो में से एक वर्गीकरण देता है: फ़ोरग्राउंड या बैकग्राउंड। इस असाइनमेंट प्रक्रिया को पिक्सल क्लासिफ़िकेशन कहते हैं, और यही हर AI बैकग्राउंड इरेज़र की नींव है।

मॉडल हर पिक्सल को अकेले नहीं जाँचता। वह हर पिक्सल को उसके पड़ोसियों के संदर्भ में जाँचता है, उस बड़े क्षेत्र के संदर्भ में जिसका वह हिस्सा है, और पूरी इमेज में दिखने वाली बड़े पैमाने की संरचनाओं के संदर्भ में भी। भरोसेमंद फ़ैसले के लिए उसे तीनों स्तरों के संदर्भ की ज़रूरत होती है।

पिक्सल बनाम ऑब्जेक्ट

एक गुलाबी-सा गर्म पिक्सल मानव त्वचा का हो सकता है, फूल की पंखुड़ी का, सैल्मन रंग के टेबलक्लॉथ का, या भूमध्यसागरीय विला की दीवार का। अकेला रंग मॉडल को लगभग कुछ नहीं बताता।

असल बात स्थानिक संबंध की है। एक गुलाबी पिक्सल के चारों ओर अगर ऐसे ही गुलाबी पिक्सल हैं जो चेहरे की बनावट से मेल खाते हैं, वह गहरे बालों जैसी बनावट के पास है और कपड़े जैसी बनावट के ऊपर है, तो वह लगभग निश्चित रूप से त्वचा है। हरी पत्तियों जैसी बनावट से घिरा गुलाबी पिक्सल लगभग निश्चित रूप से त्वचा नहीं है।

इसीलिए बैकग्राउंड हटाने वाले AI को किसी भी हिस्से को सही लेबल देने से पहले पूरी इमेज पढ़नी पड़ती है। मॉडल पहले दृश्य की समग्र तस्वीर बनाता है, फिर उसे पिक्सल-दर-पिक्सल लागू करता है।

डिज़ाइनर के वर्कस्पेस का एरियल व्यू, जिसकी स्क्रीन पर फ़ोटो एडिटिंग की पहले-और-बाद की तुलना खुली है

केंद्र में न्यूरल नेटवर्क

CNN इमेज कैसे पढ़ते हैं

लगभग सभी बैकग्राउंड हटाने वाले मॉडलों की बुनियाद एक कन्वोल्यूशनल न्यूरल नेटवर्क (CNN) है, खासकर एक वेरिएंट जिसे एन्कोडर-डिकोडर नेटवर्क कहते हैं।

यह इस तरह काम करता है:

  1. एन्कोडर चरण: नेटवर्क इमेज को कन्वोल्यूशनल लेयरों की एक श्रृंखला से संकुचित करता है। शुरुआती लेयर किनारे और रंग के ग्रेडिएंट पहचानती हैं। बीच की लेयर बनावट पहचानती हैं: फ़र, कपड़ा, त्वचा, पत्तियाँ। बाद की लेयर ऑब्जेक्ट और सिमेंटिक संरचनाएँ पहचानती हैं: चेहरे, हाथ, कुर्सियाँ, इमारतें।
  2. बॉटलनेक: पूरी तरह संकुचित प्रतिनिधित्व इमेज के अर्थ को उच्च सिमेंटिक स्तर पर पकड़ता है।
  3. डिकोडर चरण: नेटवर्क फिर विस्तार करता है, बॉटलनेक की उच्च-स्तरीय सिमेंटिक जानकारी को एन्कोडर से बची निचली-स्तरीय स्थानिक डिटेल के साथ जोड़ता है। यहीं वह अब तक सीखी हर बात का इस्तेमाल करके पिक्सल-स्तरीय लेबल देता है।

💡 एन्कोडर और डिकोडर लेयरों के बीच के स्किप कनेक्शन बेहद अहम हैं। ये मॉडल को "मुझे पता है यह मानव चेहरा है" (नेटवर्क की गहराई से) और "यह खास पिक्सल चेहरे के किनारे पर है" (शुरुआती लेयर से) जैसी दोनों जानकारियाँ जोड़ने देते हैं। साफ़ कटआउट के लिए दोनों ही जानकारी ज़रूरी है।

ट्रेनिंग डेटा असल में क्या करता है

मॉडल ये नियम साफ़ निर्देशों से नहीं सीखता। वह इन्हें लाखों उदाहरणों को प्रोसेस करके हासिल करता है।

ट्रेनिंग के दौरान मॉडल ऐसी इमेज देखता है जिनके साथ उनके ग्राउंड ट्रुथ मास्क होते हैं: सटीक पिक्सल-दर-पिक्सल लेबल, जो बताते हैं कि क्या फ़ोरग्राउंड है और क्या बैकग्राउंड। मॉडल एक अनुमान लगाता है, उस अनुमान की तुलना ग्राउंड ट्रुथ से होती है, और अंतर (लॉस) से मॉडल के आंतरिक वज़न बदले जाते हैं। यह प्रक्रिया अरबों बार दोहराई जाती है।

नतीजा कोडेड नियमों का सेट नहीं होता। वह एम्बेडेड एसोसिएशनों का जाल होता है, ऐसे सांख्यिकीय पैटर्न जो मॉडल के वज़न में इतनी गहराई से बैठ जाते हैं कि वह उन इमेज पर भी सामान्यीकरण कर सकता है जो उसने पहले कभी नहीं देखीं। जब आप अपनी फ़ोटो अपलोड करते हैं, तो मॉडल वही पैटर्न लागू कर रहा होता है।

ट्रेनिंग डेटा की गुणवत्ता मॉडल की गुणवत्ता का अकेला सबसे बड़ा कारक है। विविध, उच्च-गुणवत्ता वाली एनोटेटेड इमेज और साफ़ ग्राउंड ट्रुथ मास्क पर ट्रेन किया गया मॉडल, सीमित या शोर वाले डेटा पर ट्रेन किए गए मॉडल से लगातार बेहतर कटआउट देगा।

घुंघराले ताँबई बालों वाली महिला का स्टूडियो पोर्ट्रेट, जो जटिल किनारा-सेगमेंटेशन की चुनौती दिखाता है

सेगमेंटेशन: दृश्य को बाँटना

सिमेंटिक बनाम इंस्टेंस सेगमेंटेशन

बैकग्राउंड हटाने में मुख्य रूप से दो सेगमेंटेशन तरीके इस्तेमाल होते हैं:

प्रकारयह क्या करता हैकिसके लिए सबसे अच्छा
सिमेंटिक सेगमेंटेशनहर पिक्सल को एक श्रेणी का लेबल देता है (व्यक्ति, आसमान, मेज़)आम बैकग्राउंड हटाना
इंस्टेंस सेगमेंटेशनहर अलग ऑब्जेक्ट को अलग से लेबल करता हैएक फ़्रेम में कई सब्जेक्ट

ज़्यादातर बैकग्राउंड हटाने वाले टूल शुरुआत के लिए सिमेंटिक सेगमेंटेशन इस्तेमाल करते हैं: "सब्जेक्ट" श्रेणी (व्यक्ति, प्रोडक्ट, जानवर) में आने वाली हर चीज़ को लेबल करते हैं और बाकी सब बैकग्राउंड मान लेते हैं।

इंस्टेंस सेगमेंटेशन एक कदम आगे जाता है, और एक ही श्रेणी के अलग-अलग इंस्टेंस में फ़र्क करता है। अगर फ़ोटो में दो लोग हैं, तो इंस्टेंस सेगमेंटेशन उन्हें अलग-अलग ऑब्जेक्ट के रूप में पहचान सकता है। ज़्यादातर सिंगल-सब्जेक्ट फ़ोरग्राउंड एक्सट्रैक्शन के लिए सिमेंटिक सेगमेंटेशन काफ़ी है और कहीं ज़्यादा तेज़ है।

बाल इतने मुश्किल क्यों हैं

बैकग्राउंड हटाने में बाल तकनीकी रूप से सबसे कठिन तत्व हैं, और यही दिखाता है कि यह समस्या दिखने से कहीं ज़्यादा मुश्किल क्यों है।

इंसानी बाल का एक स्ट्रैंड आम तौर पर 60 से 120 माइक्रोमीटर चौड़ा होता है। सामान्य फ़ोटो रिज़ॉल्यूशन पर अलग-अलग स्ट्रैंड एक या दो पिक्सल घेरते हैं। उड़ते हुए बाल एक अर्ध-पारदर्शी ट्रांज़िशन ज़ोन बनाते हैं, जहाँ बाल का स्ट्रैंड, बैकग्राउंड का रंग और आसपास की हवा सब-पिक्सल स्तर पर घुल-मिल जाते हैं।

अब यह केवल पिक्सल क्लासिफ़िकेशन की समस्या नहीं रही। यह पारदर्शिता अनुमान की समस्या है। मॉडल को सिर्फ़ यह तय नहीं करना होता कि "फ़ोरग्राउंड या बैकग्राउंड", बल्कि यह भी कि "0 से 100% के पैमाने पर, ठीक-ठीक कितना फ़ोरग्राउंड है?" इस भिन्नात्मक मान को अल्फ़ा वैल्यू कहते हैं, और ट्रांज़िशन ज़ोन के हर पिक्सल के लिए इसे निकालने को इमेज मैटिंग कहते हैं।

वही चुनौती फ़र, पंखों और अर्ध-पारदर्शी कपड़ों पर भी लागू होती है। कोई भी चीज़ जो भौतिक रूप से अपने बैकग्राउंड में घुल जाती है, उसे क्लासिफ़िकेशन नहीं, मैटिंग चाहिए।

दोपहर की बैकलाइट में चमकते जटिल फ़र वाले गोल्डन रिट्रीवर का चित्र, पीछे धुंधला बगीचा

इमेज मैटिंग: सॉफ़्ट किनारों का इलाज

अल्फ़ा चैनल और पारदर्शिता

जब बैकग्राउंड हटाने वाला मॉडल साफ़ कटआउट देता है, तो वह कोई बाइनरी ब्लैक-एंड-व्हाइट मास्क नहीं बनाता। वह अल्फ़ा मैट बनाता है: एक ग्रेस्केल इमेज जिसके हर पिक्सल में एक पारदर्शिता मान होता है।

  • शुद्ध सफ़ेद (255) का मतलब है पूरी तरह फ़ोरग्राउंड
  • शुद्ध काला (0) का मतलब है पूरी तरह बैकग्राउंड
  • बीच के ग्रे मान का मतलब है आंशिक रूप से पारदर्शी

ये बीच के मान ही बालों, फ़र, पंखों और झीने कपड़ों को बैकग्राउंड हटाने के बाद प्राकृतिक दिखाते हैं, न कि ऐसे जैसे उन्हें कैंची से काटा गया हो।

जब कटआउट को नए बैकग्राउंड पर कम्पोज़िट किया जाता है, तो रेंडरर उन अल्फ़ा मानों का उपयोग करके मूल फ़ोरग्राउंड पिक्सल और नए बैकग्राउंड पिक्सल को अनुपात में मिलाता है। 128 अल्फ़ा मान वाला पिक्सल (50% अपारदर्शिता) अपना 50% रंग फ़ोरग्राउंड से और 50% नए बैकग्राउंड से लेता है। यह ब्लेंडिंग सही होने पर अदृश्य रहती है, और गलत होने पर तुरंत साफ़ दिख जाती है।

AI मैट का अनुमान कैसे लगाता है

शुरुआती मैटिंग एल्गोरिदम अल्फ़ा मानों का अनुमान लगाने के लिए हाथ से बने फ़ॉर्मूले इस्तेमाल करते थे, जो फ़ोरग्राउंड पिक्सल और ज्ञात बैकग्राउंड के बीच रंग के अंतर पर आधारित थे। इसके लिए यूज़र को बैकग्राउंड का रंग बताना पड़ता था, जिससे वे जटिल असली इमेज के लिए अव्यावहारिक हो जाते थे।

आधुनिक AI मैटिंग एक दूसरा न्यूरल नेटवर्क, या मुख्य सेगमेंटेशन नेटवर्क पर एक विशेष हेड, इस्तेमाल करती है, जो खास तौर पर ट्रांज़िशन ज़ोन पर ध्यान देता है। इसने लाखों उदाहरणों से सीखा है कि आंशिक रूप से पारदर्शी किनारे कैसे दिखते हैं, बाल अलग-अलग तरह के बैकग्राउंड के सामने कैसे नरम पड़ते हैं, और बिना किसी मैनुअल इनपुट के साफ़ अल्फ़ा मैट कैसे बनाया जाता है।

💡 सब्जेक्ट और बैकग्राउंड में मज़बूत कॉन्ट्रास्ट होने पर नतीजे नाटकीय रूप से बेहतर क्यों आते हैं। अल्फ़ा अनुमान नेटवर्क के पास काम करने के लिए ज़्यादा सिग्नल होता है। जब त्वचा का रंग और बैकग्राउंड का रंग लगभग एक जैसे हों, तो सबसे अच्छे मॉडल भी नरम और कम भरोसेमंद मैट देते हैं।

खिड़की की पीछे से आती प्राकृतिक रोशनी में चमकती धूप वाले घर के ऑफ़िस डेस्क पर बैठा कंटेंट क्रिएटर

रियल-टाइम प्रोसेसिंग: यह तेज़ कैसे रहती है

मॉडल कम्प्रेशन की तकनीकें

सबसे अच्छे बैकग्राउंड हटाने को शक्ति देने वाले न्यूरल नेटवर्क बड़े होते हैं। रिसर्च मॉडलों में सैकड़ों मिलियन पैरामीटर हो सकते हैं। हर इमेज के लिए उन्हें पूरे पैमाने पर चलाना व्यावहारिक इस्तेमाल के लिए बहुत धीमा और महंगा होता।

प्रोडक्शन मॉडल कई कम्प्रेशन रणनीतियाँ इस्तेमाल करते हैं:

  • क्वांटाइज़ेशन: मॉडल वज़न को 32-बिट फ़्लोट की जगह 8-बिट इंटीजर में दर्शाना, जिससे मेमोरी उपयोग में 75% की कमी आती है और सटीकता पर न्यूनतम असर पड़ता है
  • प्रूनिंग: ऐसे वज़न या पूरे न्यूरॉन हटाना जो सटीकता में बहुत कम योगदान देते हैं
  • नॉलेज डिस्टिलेशन: एक छोटे "स्टूडेंट" मॉडल को बड़े "टीचर" मॉडल के आउटपुट की नकल करने के लिए ट्रेन करना
  • कुशल आर्किटेक्चर: MobileNet और EfficientNet जैसे खास डिज़ाइन, जो कंप्यूट लागत के एक अंश में लगभग अत्याधुनिक सटीकता देते हैं

नतीजा एक ऐसा मॉडल है जो आम हार्डवेयर पर पूरे रिज़ॉल्यूशन की इमेज एक सेकंड से कम में प्रोसेस कर सकता है, या समर्पित GPU इंफ़्रास्ट्रक्चर पर मिलीसेकंड में।

एज बनाम क्लाउड प्रोसेसिंग

ज़्यादातर उपभोक्ता-स्तरीय बैकग्राउंड हटाने वाले टूल इमेज सर्वर-साइड प्रोसेस करते हैं। इमेज समर्पित GPU हार्डवेयर वाले सर्वर को भेजी जाती है, मॉडल उसी हार्डवेयर पर चलता है, और नतीजा वापस भेजा जाता है।

कुछ टूल, खासकर मोबाइल ऐप, कम्प्रेस्ड मॉडल सीधे डिवाइस पर चलाते हैं। ऑन-डिवाइस प्रोसेसिंग के प्राइवेसी फ़ायदे हैं (इमेज डिवाइस से बाहर नहीं जाती), पर मॉडल को फ़ोन चिप में फ़िट करने के लिए ज़रूरी आक्रामक कम्प्रेशन के कारण आम तौर पर सटीकता कम होती है।

प्रोफ़ेशनल-ग्रेड टूल क्लाउड प्रोसेसिंग इस्तेमाल करते हैं, जहाँ सटीकता लेटेंसी से ज़्यादा मायने रखती है, जिससे बड़े और सक्षम मॉडल चलाना संभव होता है जो एज केस को भरोसेमंद ढंग से संभालते हैं।

प्रोडक्ट शूट के लिए साफ़ स्टूडियो बैकड्रॉप के सामने बरगंडी ब्लेज़र में ई-कॉमर्स मॉडल की फ़ोटो

बैकग्राउंड AI अब भी कहाँ संघर्ष करता है

काँच, शीशे और धुआँ

पिक्सल क्लासिफ़िकेशन और अल्फ़ा मैटिंग का तरीका इसलिए काम करता है क्योंकि "फ़ोरग्राउंड" बनाम "बैकग्राउंड" के लिए यह सुसंगत दृश्य पैटर्न पर निर्भर है। तीन तरह के सब्जेक्ट इन पैटर्नों को मूल रूप से तोड़ देते हैं।

पारदर्शी ऑब्जेक्ट (काँच, क्रिस्टल, साफ़ प्लास्टिक) अपने पीछे का बैकग्राउंड दिखने देते हैं। मॉडल की ट्रेनिंग उसे सिखाती है कि सब्जेक्ट के पीछे की चीज़ें बैकग्राउंड हैं। पारदर्शी ऑब्जेक्ट इस धारणा का उल्लंघन करते हैं। ज़्यादातर मॉडल या तो काँच वाले हिस्से को बैकग्राउंड मान लेते हैं, या पारदर्शी क्षेत्र में असंगत, धब्बेदार नतीजे देते हैं।

रिफ़्लेक्टिव सतहें (शीशे, पॉलिश की गई धातु, पानी) अपने भीतर बैकग्राउंड की परावर्तित इमेज रखती हैं। मॉडल को सब्जेक्ट क्षेत्र के भीतर बैकग्राउंड के रंग दिखते हैं और वह सचमुच उलझ जाता है, क्योंकि उसकी ट्रेनिंग में ऐसी ऑब्जेक्ट कभी आईं ही नहीं जिनके भीतर उनका अपना बैकग्राउंड हो।

धुआँ, धुंध और अर्ध-पारदर्शी कपड़े ग्रेडिएंट पारदर्शिता की चुनौतियाँ हैं। ये लगभग अपारदर्शी से लगभग अदृश्य तक बदलते हैं, और इसके लिए अल्फ़ा मानों को एक बड़े अनियमित क्षेत्र में धीरे-धीरे बदलना पड़ता है। ज़्यादातर मॉडल इसे मध्यम सफलता से संभालते हैं, पर शायद ही कभी पूरी तरह सही, खासकर जब धुएँ या कपड़े में जटिल मोशन ब्लर हो।

जटिल रंग मिलान

जब सब्जेक्ट और बैकग्राउंड में एक जैसे रंग हों, जैसे जंगल में हरी जैकेट पहने व्यक्ति, या सफ़ेद दीवार के सामने सफ़ेद कपड़े, तब सेगमेंटेशन नेटवर्क के पास कमज़ोर सिग्नल होता है। वह किनारों को ढूँढने के लिए रंग के कॉन्ट्रास्ट पर भरोसा नहीं कर सकता और पूरी तरह आकार और बनावट की विशेषताओं पर निर्भर रहना पड़ता है।

नतीजे आम तौर पर काम लायक होते हैं, पर अक्सर फ़ोटो एडिटर में मैनुअल सुधार चाहिए होता है। यह खास तौर पर AI की विफलता नहीं है। यह इमेज डेटा में एक वास्तविक अस्पष्टता को दर्शाता है: जब रंग मिलते हैं, तो काम करने के लिए कम जानकारी होती है, चाहे प्रोसेसिंग कैसे भी की जाए।

रात में लैपटॉप स्क्रीन, जिस पर AI बैकग्राउंड हटाने का इंटरफ़ेस और पोर्ट्रेट की पहले-और-बाद की तुलना दिख रही है

BRIA का मॉडल इसे कैसे संभालता है

BRIA को क्या अलग बनाता है

BRIA का बैकग्राउंड हटाने वाला मॉडल PicassoIA पर उपलब्ध टूल है, और इसे खास तौर पर उन एज केस के लिए बनाया गया है जिन पर सामान्य-उद्देश्य इमेज सेगमेंटेशन मॉडल ठोकर खाते हैं।

BRIA का तरीका सिमेंटिक सेगमेंटेशन को एक समर्पित मैटिंग नेटवर्क के साथ जोड़ता है, जो ट्रांज़िशन ज़ोन पर ध्यान देता है। नतीजा है साफ़ सब्जेक्ट एक्सट्रैक्शन, उचित रूप से फ़ेदर्ड किनारे, सटीक बाल-अलगाव, और सही-सही कैलिब्रेटेड अल्फ़ा वैल्यू, जो किसी भी नए बैकग्राउंड पर बिना दिखने वाली झालर या रंग रिसाव के प्राकृतिक रूप से कम्पोज़िट होती हैं।

यह मॉडल इन चीज़ों के लिए अनुकूलित है:

  • पोर्ट्रेट और लोग: मानव शरीर रचना पर मज़बूत ट्रेनिंग से जटिल या असामान्य पोज़ में भी भरोसेमंद बॉडी सेगमेंटेशन
  • प्रोडक्ट: ई-कॉमर्स कटआउट के लिए खास तौर पर प्रभावी, जहाँ कैटलॉग प्रस्तुति के लिए ऑब्जेक्ट के साफ़ और तीखे किनारे ज़रूरी हैं
  • जानवर: केंद्रित मैटिंग नेटवर्क ट्रेनिंग के कारण कई सामान्य मॉडलों से बेहतर फ़र और पंखों की बनावट संभालता है
  • जटिल बैकग्राउंड: सही काम करने के लिए साफ़, कॉन्ट्रास्ट वाले बैकग्राउंड की ज़रूरत नहीं होती, और भीड़-भाड़ वाले या बनावट वाले माहौल में भी अच्छा प्रदर्शन करता है

PicassoIA पर चरण-दर-चरण

PicassoIA पर BRIA Remove Background मॉडल का इस्तेमाल अपलोड से लेकर साफ़ कटआउट तक लगभग बीस सेकंड लेता है:

  1. मॉडल खोलें: PicassoIA पर Remove Background पेज पर जाएँ
  2. अपनी इमेज अपलोड करें: अपलोड एरिया पर क्लिक करें और अपने डिवाइस से कोई भी फ़ोटो चुनें। मॉडल JPEG, PNG और WebP फ़ॉर्मेट स्वीकार करता है
  3. मॉडल चलाएँ: जनरेट बटन पर क्लिक करें। BRIA GPU एक्सेलेरेशन के साथ इमेज सर्वर-साइड प्रोसेस करता है, और सेगमेंटेशन व मैटिंग दोनों एक ही पास में लागू करता है
  4. नतीजा डाउनलोड करें: आउटपुट एक PNG फ़ाइल है जिसका बैकग्राउंड पूरी तरह पारदर्शी है (अल्फ़ा चैनल सहित), और किसी भी एडिटिंग सॉफ़्टवेयर में किसी भी नए बैकग्राउंड पर रखने के लिए तैयार है

💡 BRIA मॉडल से सबसे अच्छे नतीजों के लिए, ऐसी इमेज अपलोड करें जिसमें सब्जेक्ट अच्छी रोशनी में हो और मोशन ब्लर न हो। मैटिंग नेटवर्क तब सबसे अच्छा काम करता है जब मूल इमेज में हर किनारे का विवरण तीखा हो। धुंधला इनपुट कटआउट में धुंधले किनारे देता है। यह मॉडल की नहीं, भौतिकी की सीमा है।

नीले गहरे समुद्र के ऊपर भूमध्यसागरीय छत पर सफ़ेद सुंदर ड्रेस पहने महिला का एरियल व्यू

तुरंत बैकग्राउंड हटाने के आम उपयोग:

  • ई-कॉमर्स फ़ोटोग्राफ़ी: प्रोडक्ट शॉट्स से स्टूडियो या घरेलू बैकग्राउंड हटाकर उन्हें कैटलॉग लिस्टिंग के लिए साफ़ सफ़ेद या लाइफ़स्टाइल बैकग्राउंड पर रखें
  • पोर्ट्रेट फ़ोटोग्राफ़ी: भीड़-भाड़ वाले बैकग्राउंड से सब्जेक्ट निकालें और पूरे स्टूडियो सेटअप के बिना अधिक आकर्षक माहौल में कम्पोज़िट करें
  • कंटेंट क्रिएशन: थंबनेल, सोशल मीडिया ग्राफ़िक्स और प्रेज़ेंटेशन स्लाइड के लिए साफ़ PNG एसेट बनाएँ जिन्हें पारदर्शी लेयर चाहिए
  • मार्केटिंग सामग्री: हर बार नए सिरे से शूट किए बिना, कई कैंपेन बैकग्राउंड में इस्तेमाल के लिए प्रोडक्ट इमेज आइसोलेट करें

साफ़ सफ़ेद सतह और सटीक मेटल किनारे की डिटेल वाला लग्ज़री घड़ी का प्रोडक्ट शॉट

अब इसे असली फ़ोटो पर आज़माएँ

भीड़-भाड़ वाले बैकग्राउंड और साफ़ कटआउट के बीच का फ़ासला पहले कई घंटों का तकनीकी काम था। अब यह बीस सेकंड का अपलोड है।

मॉडल कैसे काम करता है, यह जानने से आप शूट और एडिट करने का तरीका बदल सकते हैं। अब आप समझते हैं कि सब्जेक्ट और बैकग्राउंड के बीच साफ़ अलगाव AI को ज़्यादा सिग्नल क्यों देता है। आप जानते हैं कि काँच की ऑब्जेक्ट सचमुच कठिन क्यों हैं: मॉडल कमज़ोर होने की वजह से नहीं, बल्कि दृश्य की अस्पष्टता असली होने की वजह से। आप यह भी समझते हैं कि घुंघराले बाल आधुनिक टूल से इतने साफ़ कटआउट क्यों देते हैं: अल्फ़ा मैटिंग नेटवर्क ने लाखों एनोटेटेड उदाहरणों से सीखा है कि उन अर्ध-पारदर्शी स्ट्रैंड किनारों को पिक्सल स्तर पर कैसे संभालना है।

अगर आपकी फ़ोटो में बैकग्राउंड रुकावट बन रहा है, तो PicassoIA पर BRIA Remove Background मॉडल को अभी आज़माना सार्थक है। कोई पोर्ट्रेट, प्रोडक्ट शॉट या पालतू जानवर की फ़ोटो अपलोड करें और देखें कि मॉडल किनारों के साथ क्या करता है। बाल और फ़र पर नतीजे खास तौर पर मज़बूत हैं। यह बैकग्राउंड हटाने वाले AI का वह हिस्सा है जिसने हाल के वर्षों में सबसे नाटकीय सुधार किया है, और असली इमेज पर इसे साफ़ काम करते देखना सबसे संतोषजनक है।

यह लेख शेयर करें

अपनी भाषा चुनें

संबंधित लेख