AI कंटेंट फ़िल्टर असल में कैसे काम करते हैं (और वे कभी-कभी गलती क्यों करते हैं)

आप जब भी कोई फ़ोटो अपलोड करते हैं या इमेज जनरेट करते हैं, तो एक ऑटोमेटेड क्लासिफ़ायर कुछ ही मिलीसेकंड में उस पर फ़ैसला लेता है। यह लेख AI कंटेंट फ़िल्टरिंग के असली तंत्र को समझाता है: न्यूरल नेटवर्क, ट्रेनिंग डेटा, और ये सिस्टम उन तरीकों से क्यों विफल होते हैं जो उन्हें बनाने वालों को भी चौंका देते हैं।

AI कंटेंट फ़िल्टर असल में कैसे काम करते हैं (और वे कभी-कभी गलती क्यों करते हैं)
Cristian Da Conceicao
Picasso IA के संस्थापक

जब भी आप कोई फ़ोटो अपलोड करते हैं, कमेंट पोस्ट करते हैं, या किसी AI इमेज जनरेटर को प्रॉम्प्ट देते हैं, तो कोई चीज़ देख रही होती है। कोई इंसान नहीं। एक क्लासिफ़ायर। लाखों पैरामीटर वाला एक न्यूरल नेटवर्क, जिसे सैकड़ों मिलियन लेबल वाले उदाहरणों पर ट्रेन किया गया है। यह 50 मिलीसेकंड से कम समय में फ़ैसला लेता है, एक प्रोबेबिलिटी स्कोर देता है, और या तो आपका कंटेंट आगे जाने देता है या पूरी तरह रोक देता है।

इस प्रक्रिया के पीछे की तकनीक ज़्यादातर लोगों की उम्मीद से कहीं ज़्यादा दिलचस्प है, और इसकी विफलता के तरीके प्लेटफ़ॉर्म जितना स्वीकार करना पसंद करते हैं, उससे कहीं ज़्यादा खुलासा करने वाले हैं।

कंटेंट फ़िल्टर असल में क्या करते हैं

"फ़िल्टर" शब्द सुनकर लगता है कि कंटेंट मॉडरेशन एक सीधी छलनी है: बुरा कंटेंट अंदर आए, बुरा कंटेंट रुके, बाकी सब गुज़र जाए। असल में यह इतना सरल नहीं है।

अपने मूल में, एक कंटेंट फ़िल्टर बाइनरी क्लासिफ़ायर है, या ज़्यादा सटीक रूप से, बाइनरी आउटपुट वाला मल्टी-क्लास क्लासिफ़ायर। यह इनपुट लेता है (एक इमेज, टेक्स्ट स्ट्रिंग, ऑडियो क्लिप या वीडियो) और हर उस कैटेगरी के लिए प्रोबेबिलिटी स्कोर देता है जिसे पहचानने के लिए इसे ट्रेन किया गया था। अगर "नीति का उल्लंघन" की प्रोबेबिलिटी तय थ्रेशोल्ड से ऊपर जाती है, तो कंटेंट फ़्लैग हो जाता है। थ्रेशोल्ड से नीचे हो तो वह गुज़र जाता है।

मल्टी-मॉनिटर वर्कस्टेशन पर कंटेंट क्लासिफ़िकेशन के नतीजों की समीक्षा करता इंजीनियर

यह थ्रेशोल्ड पूरे सिस्टम के सबसे अहम फ़ैसलों में से एक है। इसे बहुत ऊँचा रखें तो हानिकारक कंटेंट निकल जाता है। बहुत नीचा रखें तो हज़ारों वैध कंटेंट ब्लॉक हो जाते हैं: बीच की फ़ोटो, मेडिकल डायग्राम, स्तनपान की इमेज, हार्म-रिडक्शन की जानकारी। सही थ्रेशोल्ड ढूँढना तकनीकी समस्या नहीं है। यह एक नीति की समस्या है, और समझदार लोग भी इस पर बुरी तरह असहमत होते हैं कि लकीर कहाँ खींचनी चाहिए।

पहचान की तीन परतें

ज़्यादातर प्रोडक्शन कंटेंट मॉडरेशन सिस्टम एक साथ तीन अलग-अलग परतों पर काम करते हैं:

  1. प्री-क्लासिफ़िकेशन हैशिंग — ज्ञात हानिकारक सामग्री की कैटेगरी के लिए प्लेटफ़ॉर्म क्रिप्टोग्राफ़िक हैश डेटाबेस रखते हैं (इमेज के लिए PhotoDNA जैसे परसेप्चुअल हैश)। कोई भी AI चलने से पहले, अपलोड किए गए कंटेंट का हैश बनाकर इस डेटाबेस से मिलाया जाता है। मिलान मिलने पर क्लासिफ़ायर को इनपुट मिलने से पहले ही तुरंत ब्लॉक हो जाता है।

  2. AI इनफ़रेंस — मुख्य क्लासिफ़ायर उस हर कंटेंट पर चलता है जो हैश जाँच पार कर चुका है। न्यूरल नेटवर्क कंटेंट का विश्लेषण करते हैं और नीति-उल्लंघन की हर कैटेगरी पर कॉन्फ़िडेंस स्कोर निकालते हैं।

  3. ह्यूमन रिव्यू क्यू — जो कंटेंट बीच की अनिश्चित रेंज (लगभग 35-65% कॉन्फ़िडेंस) में आता है, उसे अंतिम फ़ैसले के लिए ह्यूमन रिव्यूअर के पास भेजा जाता है। सबसे बारीक फ़ैसले असल में यहीं होते हैं, और सबसे ज़्यादा गलतियाँ भी यहीं होती हैं।

मॉडल को उसके नियम कहाँ से मिलते हैं

क्लासिफ़ायर किसी भी सार्थक अर्थ में यह "नहीं जानता" कि क्या आपत्तिजनक या हानिकारक है। इसने एक लेबल वाले डेटासेट से सांख्यिकीय पैटर्न सीखे हैं। किसी ने बैठकर कंटेंट को सुरक्षित, असुरक्षित, या इन दोनों के बीच का टैग किया। महीनों के एनोटेशन काम में हज़ारों लोगों ने, हर एक अपनी सांस्कृतिक पृष्ठभूमि और व्याख्या के साथ, यह काम किया।

वे मानवीय फ़ैसले अपने पूर्वाग्रह, सांस्कृतिक धारणाएँ और आंतरिक असंगतियाँ सीधे मॉडल के सीखे हुए व्यवहार में डाल देते हैं। मॉडल वही पैटर्न एन्कोड करता है जिस पर एनोटेटर सहमत हुए, शोर और सब कुछ समेत।

इमेज पहचान फ़िल्टर कैसे काम करते हैं

इमेज कंटेंट फ़िल्टर कन्वोल्यूशनल न्यूरल नेटवर्क (CNNs) पर बने होते हैं, और तेज़ी से बढ़ती संख्या में Vision Transformers (ViTs) पर। ये आर्किटेक्चर एक इमेज को स्पेशियल पैच में तोड़ते हैं, शुरुआती परतों में लोकल फ़ीचर (किनारे, टेक्सचर, रंग के ग्रेडिएंट) पहचानते हैं, और फिर गहरी परतों में उन्हें जोड़कर ऊँचे स्तर के पैटर्न पहचानते हैं: त्वचा के रंग वाले हिस्से, शरीर के अंगों के आकार, ऑब्जेक्ट की व्यवस्था, और फ़्रेम में तत्वों के बीच स्पेशियल संबंध।

मॉनिटर का डेटा परावर्तित करती आँख की क्लोज़-अप तस्वीर, AI विज़ुअल इनफ़रेंस का प्रतीक

मॉडल वह नहीं देखता जो इंसान देखते हैं। वह पिक्सल वैल्यू के टेंसर प्रोसेस करता है। जब कोई क्लासिफ़ायर किसी इमेज को NSFW फ़्लैग करता है, तो वह कोई सौंदर्य या नैतिक फ़ैसला नहीं ले रहा होता। वह बस यह बता रहा होता है कि यह पिक्सल कॉन्फ़िगरेशन उन पैटर्न्स के वितरण से सांख्यिकीय रूप से मिलता है जिन्हें ट्रेनिंग सेट में इंसानी एनोटेटरों ने NSFW टैग किया था। यह फ़र्क जितना शुरुआत में दिखता है, उससे कहीं ज़्यादा मायने रखता है।

कन्वोल्यूशनल न्यूरल नेटवर्क की कार्यप्रणाली

एक अकेली इमेज सबमिशन के लिए इनफ़रेंस पाइपलाइन असल में ऐसे चलती है:

चरणक्या होता है
रीसाइज़इमेज को मॉडल के इनपुट साइज़ (जैसे 224x224px) पर स्केल किया जाता है
नॉर्मलाइज़पिक्सल वैल्यू को मॉडल की अपेक्षित संख्यात्मक रेंज में मैप किया जाता है
फ़ॉरवर्ड पासइमेज दर्जनों कन्वोल्यूशनल परतों से गुज़रती है
फ़ीचर एक्सट्रैक्शनगहरी परतें हाई-लेवल विज़ुअल पैटर्न पर सक्रिय होती हैं
Softmax आउटपुटहर कैटेगरी लेबल को एक प्रोबेबिलिटी स्कोर मिलता है
थ्रेशोल्ड जाँचअगर P(violating) थ्रेशोल्ड से ऊपर है, तो कंटेंट ब्लॉक किया जाता है

पूरी प्रक्रिया में आम तौर पर GPU पर 20 से 80 मिलीसेकंड लगते हैं। प्लेटफ़ॉर्म के स्केल पर, यह पाइपलाइन इनफ़रेंस सर्वर के बेड़ों पर चलती है, जो प्रति घंटे लाखों इमेज प्रोसेस करते हैं।

"स्किन कलर डिटेक्शन" क्यों बार-बार विफल होता है

यहाँ वह समस्या है जिसने शुरुआत से ही इमेज कंटेंट क्लासिफ़ायर को परेशान किया है: शुरुआती मॉडल संदर्भ पहचानने के बजाय स्किन डिटेक्शन पर ओवरफ़िट थे।

ज़्यादातर स्पष्ट इमेज पर ट्रेन किया गया क्लासिफ़ायर खुली त्वचा के बड़े हिस्सों को NSFW कंटेंट से जोड़ना सीख लेता है, चाहे संदर्भ या कलात्मक इरादा कुछ भी हो। नतीजा अनुमानित है: धूप से झुलसी त्वचा की फ़ोटो फ़िल्टर को ट्रिगर करती है, शास्त्रीय मूर्तियों की ब्लैक-एंड-व्हाइट फ़ोटोग्राफ़ी फ़्लैग हो जाती है, और गहरे स्किन टोन असमान रूप से ज़्यादा फ़्लैग होते हैं, क्योंकि आम बैकग्राउंड रंगों के मुकाबले उनकी कंट्रास्ट सिग्नेचर अलग होती है।

यह कोई काल्पनिक बात नहीं है। कई बड़े प्लेटफ़ॉर्म ने दस्तावेज़ों में दर्ज किया है कि जब उनके क्लासिफ़ायर को बड़े पैमाने पर यूज़र कंटेंट की वास्तविक विविधता का सामना करना पड़ा, तो ठीक यही विफलता सामने आई।

💡 इलाज पिक्सल नहीं, संदर्भ है। आधुनिक क्लासिफ़ायर तेज़ी से स्पेशियल अटेंशन मैकेनिज़्म का इस्तेमाल करते हैं ताकि तत्वों के बीच संबंध मॉडल किए जा सकें: शरीर के अंग एक-दूसरे के सापेक्ष कहाँ दिखते हैं, आसपास की वस्तुएँ सेटिंग के बारे में क्या बताती हैं, और क्या संदर्भ संकेत मेडिकल, मनोरंजक या कलात्मक इरादे की ओर इशारा करते हैं, न कि केवल कच्चे पिक्सल की समानता पर निर्भर रहने के बजाय।

लकड़ी की मेज़ पर छपे न्यूरल नेटवर्क आर्किटेक्चर के डायग्राम देखता शोधकर्ता

टेक्स्ट-आधारित फ़िल्टर और उनकी सीमाएँ

टेक्स्ट मॉडरेशन एक मूल रूप से अलग चुनौती है। इमेज के उलट, टेक्स्ट को क्रम, संदर्भ, व्यंग्य, सांस्कृतिक संदर्भ और इरादे को प्रोसेस करना पड़ता है। एक पिक्सल पैटर्न का अर्थ इस पर निर्भर नहीं करता कि उसे किसने बनाया या वह किस समुदाय से है। एक वाक्य का अर्थ इस पर निर्भर करता है।

शुरुआती टेक्स्ट फ़िल्टर कीवर्ड ब्लॉकलिस्ट थे: तेज़, सस्ते, और बारीकियों को समझने में बुरी तरह नाकाम। जो ब्लॉकलिस्ट "kill" को पकड़ती है, वह "skill", "thriller" और "Kilimanjaro" वाली बातचीत को भी रोक देती है। दूसरी पीढ़ी ने रेगुलर एक्सप्रेशन इस्तेमाल किए। तीसरी ने TF-IDF क्लासिफ़ायर इस्तेमाल किए, जो दस्तावेज़ के संदर्भ के मुकाबले टर्म फ़्रीक्वेंसी स्कोर करते थे। मौजूदा पीढ़ी ट्रांसफ़ॉर्मर-आधारित लैंग्वेज मॉडल इस्तेमाल करती है, जिन्हें खास तौर पर नीति-उल्लंघन के उदाहरणों पर फ़ाइन-ट्यून किया गया है।

व्यवस्थित तरीके से छँटते पुराने पोस्टल खाने, जो व्यवस्थित कंटेंट वर्गीकरण का प्रतीक हैं

कीवर्ड लिस्ट बनाम संदर्भ मॉडल

मॉडरेशन के तरीकों में हर उस पहलू पर भारी अंतर है जो मायने रखता है:

तरीकागतिसटीकताव्यंग्य संभालता हैबहुभाषी
कीवर्ड ब्लॉकलिस्टबहुत तेज़बहुत कमनहींनहीं
TF-IDF क्लासिफ़ायरतेज़मध्यमसंघर्ष करता हैआंशिक
फ़ाइन-ट्यून किया LLMज़्यादा धीमाउच्चबेहतरहाँ
एन्सेंबल (सभी परतें)धीमासबसे ज़्यादासबसे अच्छाहाँ

ज़्यादातर प्रोडक्शन सिस्टम एन्सेंबल आर्किटेक्चर इस्तेमाल करते हैं। एक तेज़ कीवर्ड पास पहले साफ़ उल्लंघन पकड़ता है। किनारे के मामले धीमे, ज़्यादा सटीक मॉडलों तक भेजे जाते हैं। यह आर्किटेक्चर पाइपलाइन के सस्ते सिरे पर थ्रूपुट और महंगे सिरे पर सटीकता के लिए अनुकूलित होता है।

व्यवस्थित ढंग से रखी गई फ़ोटो की दीवार का अध्ययन करता आदमी, पैटर्न का विश्लेषण करते हुए

व्यंग्य और स्लैंग की समस्या

एक अच्छी तरह ट्रेन किया गया लैंग्वेज मॉडल भी कुछ खास भाषाई पैटर्न से लगातार मात खा सकता है:

  • व्यंग्य और विडंबना: "हाँ, खुद को चोट पहुँचाना बेहतरीन आइडिया है" हार्म सिग्नल को दबा देता है, क्योंकि "बेहतरीन आइडिया" शब्दों का मॉडल के सीखे हुए संबंधों में सकारात्मक भार होता है
  • डॉग व्हिसल: कोडेड भाषा, जो किसी खास समुदाय के भीतर अर्थ रखने के लिए बनाई जाती है, जबकि उन स्वचालित क्लासिफ़ायरों को हानिरहित दिखती है जो ज़्यादा स्पष्ट उल्लंघनों पर ट्रेन किए गए हैं
  • भाषाओं का मिश्रण: एक ही संदेश में अंग्रेज़ी, स्पेनिश, टैगालॉग और जानबूझकर की गई स्पेलिंग मिलाना, ताकि वह किसी भी एक मॉडल के ट्रेनिंग वितरण से बाहर चला जाए
  • सिमैंटिक ड्रिफ़्ट: स्लैंग रीट्रेनिंग चक्रों से ज़्यादा तेज़ी से बदलता है। जो शब्द आठ महीने पहले तटस्थ था, वह अब ऐसा विशिष्ट हानिकारक अर्थ रख सकता है जो मॉडल के किसी भी वर्ज़न ने कभी नहीं देखा

💡 एवेज़न का चक्र असली है और लगातार चलता है। हर मॉडरेशन अपग्रेड के लिए, प्रतिकूल यूज़र उसके आसपास नए रास्ते ढूँढ लेते हैं। इसीलिए बड़े प्लेटफ़ॉर्म कंटेंट विश्लेषण के ऊपर व्यवहारिक संकेतों की परतें चढ़ाते हैं: अकाउंट की उम्र, पोस्टिंग के पैटर्न, नेटवर्क कनेक्शन, रिपोर्ट किए गए कंटेंट का इतिहास और डिवाइस फ़िंगरप्रिंट, ये सब कंटेंट के साथ अंतिम ट्रस्ट स्कोर में शामिल होते हैं।

दोपहर की गुनगुनी रोशनी में छपा दस्तावेज़ पढ़ती और विश्लेषण करती महिला

वीडियो कंटेंट पहचान

वीडियो एक समय आयाम जोड़ता है, जिससे फ़िल्टरिंग कहीं ज़्यादा जटिल हो जाती है। 24fps पर पाँच सेकंड की क्लिप में 120 अलग-अलग फ़्रेम होते हैं, एक पूरा ऑडियो ट्रैक, एम्बेडेड मेटाडेटा, और वह अनुक्रमिक अर्थ जो इस बात से उभरता है कि फ़्रेम किस क्रम में हैं। किसी क्लिप का इरादा पूरी तरह बदल सकता है, और यह सिर्फ़ इस पर निर्भर नहीं करता कि किसी एक फ़्रेम में क्या दिखता है, बल्कि टेम्पोरल संदर्भ पर भी।

AI कंटेंट विश्लेषण के पीछे बड़े पैमाने के इंफ़्रास्ट्रक्चर का प्रतिनिधित्व करते डेटा सेंटर के सर्वर रैक

फ़्रेम-दर-फ़्रेम विश्लेषण

सबसे सरल वीडियो मॉडरेशन तरीका एक तय अंतराल पर फ़्रेम सैंपल करता है (हर सेकंड, या हर N फ़्रेम) और हर फ़्रेम को एक स्टैंडर्ड इमेज क्लासिफ़ायर से चलाता है। अगर कोई सैंपल किया गया फ़्रेम थ्रेशोल्ड से ऊपर स्कोर करता है, तो पूरा वीडियो फ़्लैग होकर समीक्षा के लिए रोक लिया जाता है।

कमज़ोरी साफ़ है: 119 सुरक्षित फ़्रेमों के बीच 1/24 सेकंड के लिए दिखने वाला एक उल्लंघन करने वाला फ़्रेम सैंपलिंग बिंदुओं के बीच गिर सकता है और पूरी तरह पकड़ से बच सकता है। इससे भी ज़्यादा ज़रूरी बात यह है कि अर्थ समय से जुड़ा होता है। सुरक्षित दिखने वाले फ़्रेमों का क्रम तभी कोई समस्याग्रस्त चीज़ बन सकता है जब उसे गति और अनुक्रम में देखा जाए।

नए सिस्टम 3D CNNs और वीडियो ट्रांसफ़ॉर्मर इस्तेमाल करते हैं, जो टेम्पोरल अनुक्रमों को एकीकृत इनपुट के रूप में प्रोसेस करते हैं। ये मॉडल मोशन पैटर्न, फ़्रेमों के बीच ऑप्टिकल फ़्लो, और टेम्पोरल संदर्भ पहचानते हैं, जिन्हें सिंगल-फ़्रेम क्लासिफ़ायर पूरी तरह से छूट जाते हैं। कंप्यूटेशन की लागत काफ़ी ज़्यादा है, लेकिन किनारे के मामलों पर सटीकता काफ़ी सुधरती है।

ऑडियो और ट्रांसक्रिप्ट स्कैनिंग

वीडियो मॉडरेशन केवल विज़ुअल समस्या नहीं है। ऑडियो ट्रैक एक समानांतर विश्लेषण पाइपलाइन से गुज़रता है:

  • ऑटोमैटिक स्पीच रिकग्निशन (ASR): ऑडियो रियल टाइम में ट्रांसक्राइब होता है और ट्रांसक्रिप्ट एक टेक्स्ट क्लासिफ़ायर से गुज़रता है
  • ऑडियो सिग्नेचर डिटेक्शन: गैर-बोली वाले ऑडियो पैटर्न (चीखें, ऑडियो घटना के रूप में गालियाँ, खास साउंड प्रोफ़ाइल) लेबल वाले साउंड क्लिप डेटासेट पर ट्रेन किए गए क्लासिफ़ायरों से पहचाने जाते हैं
  • एकूस्टिक फ़िंगरप्रिंटिंग: लाइसेंस वाला कंटेंट डेटाबेस मिलान से पहचाना जाता है, उसी एकूस्टिक फ़िंगरप्रिंटिंग तरीके से जो म्यूज़िक रिकग्निशन ऐप्स में इस्तेमाल होता है

जिस वीडियो के विज़ुअल पूरी तरह सुरक्षित हैं लेकिन ऑडियो ट्रैक हिंसक है, वह भी उन प्लेटफ़ॉर्म पर सिस्टम को ट्रिगर करता है जो पूरी ऑडियो स्कैनिंग चलाते हैं। कई निचले स्तर के प्लेटफ़ॉर्म लागत की वजह से ऑडियो विश्लेषण पूरी तरह छोड़ देते हैं, और इस तरह एक दस्तावेज़ित कमज़ोरी पैदा होती है, जिसका व्यापक रूप से फ़ायदा उठाया जाता है।

मेज़ पर लेबल वाले फ़ाइल फ़ोल्डरों में छाँटे जाते इंडेक्स कार्ड

ट्रेनिंग डेटा की समस्या

हर कंटेंट फ़िल्टर उतना ही सटीक होता है जितना उसका ट्रेनिंग डेटा। AI सेफ़्टी सिस्टम के बारे में सार्वजनिक चर्चाओं में आम तौर पर जितना ध्यान मिलता है, इसे उससे कहीं ज़्यादा ध्यान मिलना चाहिए।

AI लर्निंग सिस्टम के पीछे की हार्डवेयर परत को दिखाता सर्किट बोर्ड का क्लोज़-अप

गार्बेज इन, गार्बेज आउट

प्रोडक्शन क्वालिटी पर कंटेंट क्लासिफ़ायर ट्रेन करने के लिए तीन ऐसी चीज़ें चाहिए जो दिखने से कहीं ज़्यादा मुश्किल से मिलती हैं:

  • हर उस कैटेगरी में लाखों लेबल वाले उल्लंघन करने वाले कंटेंट के पॉज़िटिव उदाहरण, जिसे क्लासिफ़ायर को कवर करना है
  • समान विज़ुअल और विषयगत विविधता के साथ लाखों लेबल वाले सुरक्षित कंटेंट के नेगेटिव उदाहरण
  • एक लेबलिंग वर्कफ़ोर्स, जो हर कैटेगरी पर लगातार, दस्तावेज़ित और सांस्कृतिक रूप से जागरूक दिशानिर्देश लागू करता है, बिना समय के साथ गिरावट के

लेबलिंग आम तौर पर कॉन्ट्रैक्ट वर्कर्स करते हैं, जो अक्सर कम आय वाले बाज़ारों में होते हैं, और तंग समय-सीमा में ऐसे कंटेंट पर काम करते हैं जो साधारण से लेकर बेहद विचलित करने वाला होता है। इस वर्कफ़ोर्स के अध्ययन बर्नआउट की ऊँची दरें और लेबलिंग की स्थिरता में मापी जा सकने वाली गिरावट दर्ज करते हैं, क्योंकि एनोटेटर पर्याप्त सहायता के बिना बार-बार हानिकारक कंटेंट के संपर्क में आते हैं।

जब लेबल असंगत होते हैं, तो मॉडल असंगत नियम सीखता है। क्लासिफ़ायर के पास लेबलिंग की गलती और खुद कंटेंट की वास्तविक अस्पष्टता के बीच फ़र्क करने की कोई व्यवस्था नहीं होती। वह अपूर्ण मानवीय फ़ैसले का सांख्यिकीय औसत सीखता है, जो अगले पूर्ण रीट्रेनिंग चक्र तक स्थायी रूप से एन्कोड रहता है।

संवेदनशील हिस्सों को हाइलाइट किया गया दस्तावेज़, जो सावधानीपूर्वक नीति समीक्षा की प्रक्रिया का प्रतीक है

फ़िल्टर में बना पूर्वाग्रह

भौगोलिक पूर्वाग्रह: मुख्य रूप से अंग्रेज़ी बोलने वाले पश्चिमी प्लेटफ़ॉर्म से लिया गया ट्रेनिंग डेटा उन सांस्कृतिक मानदंडों को सीधे मॉडल में एन्कोड कर देता है। अन्य संस्कृतियों के पारंपरिक परिधान, कुछ समुदायों में आम शरीर-संशोधन की प्रथाएँ, या सदियों के सांस्कृतिक इतिहास वाली कलात्मक परंपराएँ इसलिए फ़्लैग हो जाती हैं क्योंकि वे ट्रेनिंग वितरण से बाहर आती हैं, किसी सुसंगत नीति का उल्लंघन करने के कारण नहीं।

कालिक पूर्वाग्रह: मॉडल एक खास समय बिंदु पर ट्रेन होते हैं। सांस्कृतिक मानदंड बदलते हैं। राजनीतिक संदर्भ बदलते हैं। 2022 में हानिकारक भाषण क्या है, इसके आधार पर कैलिब्रेट किया गया क्लासिफ़ायर 2026 तक काफ़ी गलत कैलिब्रेट हो सकता है, जिससे नई स्वीकार्य भाषा पर फ़ॉल्स पॉज़िटिव और नए समस्याग्रस्त कंटेंट पर फ़ॉल्स नेगेटिव, दोनों होते हैं।

क्लास इम्बैलेंस: किसी भी वास्तविक दुनिया के डेटासेट में सुरक्षित कंटेंट उल्लंघन करने वाले कंटेंट से कहीं ज़्यादा होता है। ट्रेनिंग के दौरान सावधानीपूर्वक री-बैलेंसिंग के बिना, मॉडल सुरक्षित अनुमानों की ओर झुकना सीख लेता है, क्योंकि ज़्यादातर इनपुट पर यही सांख्यिकीय रूप से सुरक्षित है। डिसिज़न बाउंड्री के पास का वह कंटेंट जो वास्तव में नीति का उल्लंघन करता है, सारांश सटीकता मेट्रिक्स जितना दिखाते हैं उससे ज़्यादा दर से निकल जाता है।

किताबों और हाथ से लिखे नोट्स के बीच देर रात तक काम करता शोधकर्ता

रियल-टाइम बनाम विलंबित मॉडरेशन

हर कंटेंट को उसके जीवनचक्र के एक ही बिंदु पर नहीं जाँचा जाता। जाँच के समय का सुरक्षा परिणामों और यूज़र अनुभव, दोनों पर गहरा असर होता है, और प्लेटफ़ॉर्म इस लकीर को कहाँ खींचते हैं, इसमें बहुत अलग-अलग चुनाव करते हैं।

घुमावदार डिस्प्ले वॉल पर लाइव डेटा फ़ीड देखते विश्लेषकों वाला सिक्योरिटी ऑपरेशन्स सेंटर

गति बनाम सटीकता का समझौता

आज प्रोडक्शन सिस्टम में तीन अलग-अलग टाइमिंग आर्किटेक्चर मौजूद हैं:

  • प्री-पब्लिकेशन (सिंक्रोनस): कंटेंट को रोककर लाइव होने से पहले क्लासिफ़ायर के पूरे टूल्स के सेट से चलाया जाता है। अधिकतम सुरक्षा, ज़्यादा लेटेंसी। AI इमेज जनरेशन प्लेटफ़ॉर्म पर मानक, जहाँ पाइपलाइन यूज़र को कोई भी नतीजा दिखने से पहले ही आउटपुट को नियंत्रित करती है।
  • पोस्ट-पब्लिकेशन (एसिंक्रोनस): कंटेंट तुरंत लाइव हो जाता है, और क्लासिफ़िकेशन बैकग्राउंड में चलता है। उल्लंघन करने वाला कंटेंट पहले ही दिखने के बाद पीछे से हटाया जाता है। कम लेटेंसी और क्रिएटर-फ़र्स्ट अनुभव को प्राथमिकता देने वाले प्लेटफ़ॉर्म पर आम।
  • हाइब्रिड तरीका: तेज़ क्लासिफ़ायर पब्लिकेशन से पहले साफ़ तौर पर उच्च-कॉन्फ़िडेंस उल्लंघनों को रोकते हैं। धीमे, ज़्यादा सटीक मॉडल बाकी कंटेंट का बैकग्राउंड क्यू में एसिंक्रोनस विश्लेषण करते हैं। ज़्यादातर बड़े सोशल प्लेटफ़ॉर्म यह आर्किटेक्चर इस्तेमाल करते हैं, क्योंकि यह थ्रूपुट और सुरक्षा के बीच संतुलन बनाता है।

AI इमेज जनरेशन प्लेटफ़ॉर्म लगभग पूरी तरह प्री-पब्लिकेशन मॉडरेशन इस्तेमाल करते हैं, क्योंकि वे आउटपुट पाइपलाइन को शुरू से अंत तक नियंत्रित करते हैं। सेफ़्टी लेयर मॉडल इनफ़रेंस और डिलीवरी के बीच बैठती है। अगर आउटपुट थ्रेशोल्ड से ऊपर स्कोर करता है, तो प्लेटफ़ॉर्म दोबारा सैंपल ले सकता है, एरर मैसेज लौटा सकता है, या यूज़र को फ़्लैग हुआ आउटपुट दिखाए बिना उसकी जगह एक सुरक्षित नतीजा दे सकता है।

लूप में ह्यूमन रिव्यू

कोई भी ऑटोमेटेड सिस्टम सभी कंटेंट कैटेगरी पर इतनी सटीकता नहीं पा सकता कि ह्यूमन रिव्यू पूरी तरह खत्म हो जाए। बड़े प्लेटफ़ॉर्म के लिए मानक लेयर्ड आर्किटेक्चर इस तरह काम करता है:

  1. उच्च-कॉन्फ़िडेंस सुरक्षित कंटेंट: अपने-आप अप्रूव करें और तुरंत पब्लिश करें
  2. उच्च-कॉन्फ़िडेंस उल्लंघन करने वाला कंटेंट: बिना ह्यूमन रिव्यू के अपने-आप हटाएँ
  3. कम-कॉन्फ़िडेंस अस्पष्ट कंटेंट: संदर्भ के साथ ह्यूमन रिव्यू क्यू में भेजें

क्यू पर काम करने वाले ह्यूमन रिव्यूअर को जल्दी फ़ैसले लेने होते हैं, अक्सर वॉल्यूम के साथ चलने के लिए हर आइटम पर 30 सेकंड से कम में, और इससे उनकी अपनी स्थिरता की समस्याएँ पैदा होती हैं। रिव्यूअर की थकान, सांस्कृतिक पृष्ठभूमि और दिन के समय का असर, ये सब व्यक्तिगत स्तर पर फ़ैसलों की सटीकता को मापने योग्य रूप से प्रभावित करते हैं। नतीजा एक ऐसा कैस्केड सिस्टम है, जिसमें ऑटोमेटेड क्लासिफ़िकेशन की गलतियाँ और ह्यूमन रिव्यू की गलतियाँ रोज़ाना लाखों फ़ैसलों में जुड़ती चली जाती हैं।

स्क्रीन के इर्द-गिर्द बैठकर मॉडरेशन नीति के फ़ैसलों पर चर्चा करती विविध टीम

AI प्लेटफ़ॉर्म NSFW कंटेंट कैसे संभालते हैं

AI इमेज जनरेशन कंटेंट मॉडरेशन का एक खास तौर पर दिलचस्प मामला है, क्योंकि फ़िल्टर जनरेट किए गए कंटेंट पर लागू होता है, अपलोड किए गए कंटेंट पर नहीं। प्लेटफ़ॉर्म टेक्स्ट प्रॉम्प्ट से लेकर डिलीवर होने वाले पिक्सल तक पूरी पाइपलाइन नियंत्रित करता है। इससे ऐसे मॉडरेशन के मौके बनते हैं जो यूज़र कंटेंट अपलोड करने वाले सोशल प्लेटफ़ॉर्म के पास नहीं होते।

बारिश से चमकती रात की शहर की सड़क पर स्वचालित निगरानी का प्रतीक सर्विलांस कैमरे

सेफ़्टी लेवल कंट्रोल

ज़्यादातर टेक्स्ट-टू-इमेज प्लेटफ़ॉर्म सेफ़्टी तीन मैकेनिज़्म से लागू करते हैं, जिन्हें एक-दूसरे से स्वतंत्र रूप से कॉन्फ़िगर किया जा सकता है:

  1. प्रॉम्प्ट फ़िल्टरिंग: जनरेशन शुरू होने से पहले टेक्स्ट प्रॉम्प्ट की जाँच होती है। चिह्नित शब्द या पैटर्न मॉडल चलने से पहले ही तुरंत अस्वीकार करवा देते हैं, जिससे इनफ़रेंस कंप्यूट बचता है और जनरेशन पूरी तरह रुक जाती है।
  2. कॉन्सेप्ट सप्रेशन: मॉडल के सीखे हुए वेट्स में खास विज़ुअल कॉन्सेप्ट दबा दिए जाते हैं, गाइडेंस मास्किंग या नेगेटिव एम्बेडिंग इंजेक्शन जैसी तकनीकों से। जो प्रॉम्प्ट वरना उल्लंघन करने वाले आउटपुट देते, वे अब मूल क्षमता उजागर किए बिना सामान्य, सुरक्षित दिखने वाले नतीजे देते हैं।
  3. आउटपुट क्लासिफ़िकेशन: इनफ़रेंस पूरा होने के बाद जनरेट की गई इमेज एक NSFW क्लासिफ़ायर से गुज़रती है। थ्रेशोल्ड से ऊपर स्कोर करने वाली इमेज रोकी जाती हैं और नया सैंपल लिया जाता है, एक कॉन्फ़िगर्ड अधिकतम रीट्राई संख्या तक, उसके बाद एरर लौटाया जाता है।

ये तीनों परतें हमेशा एक साथ सक्रिय नहीं होतीं। कोई प्लेटफ़ॉर्म स्पीड के लिए सख्त प्रॉम्प्ट फ़िल्टरिंग चला सकता है बिना आउटपुट क्लासिफ़िकेशन के, या प्रॉम्प्ट फ़िल्टरिंग पूरी तरह छोड़कर केवल आउटपुट गेटिंग पर निर्भर रह सकता है। किसी भी प्लेटफ़ॉर्म पर इस्तेमाल हो रहा संयोजन शायद ही सार्वजनिक रूप से बताया जाता है।

"सेफ़ मोड" असल में क्या बदलता है

जब कोई प्लेटफ़ॉर्म "सेफ़ मोड" या "एडल्ट मोड" टॉगल दिखाता है, तो आम तौर पर वह मॉडल क्षमताएँ जोड़ने या हटाने के बजाय आउटपुट क्लासिफ़िकेशन थ्रेशोल्ड समायोजित कर रहा होता है। सेफ़ मोड कम थ्रेशोल्ड सेट करता है: ज़्यादा कंटेंट रोका जाता है। एडल्ट मोड थ्रेशोल्ड ऊँचा करता है: ज़्यादा कंटेंट गेट से गुज़रता है।

दोनों कॉन्फ़िगरेशन में अंतर्निहित मॉडल वेट्स एक जैसे हैं। वही फ़ॉरवर्ड पास और वही इनफ़रेंस रन दोनों नतीजे जनरेट करते हैं। आउटपुट पर केवल स्कोरिंग गेट बदलता है, और वही तय करता है कि यूज़र को क्या मिलेगा।

💡 कुछ प्लेटफ़ॉर्म इससे आगे जाते हैं। सरल थ्रेशोल्ड समायोजन के बजाय, कुछ ही प्लेटफ़ॉर्म सेफ़ और अनरिस्ट्रिक्टेड आउटपुट के लिए वास्तव में अलग फ़ाइन-ट्यून किए गए मॉडल वर्ज़न रखते हैं, जिनके सीखे हुए वेट्स और ट्रेनिंग डेटा की संरचना अलग होती है। इससे दोनों छोरों पर ऐसा व्यवहार बनता है जो थ्रेशोल्ड टॉगल से कहीं ज़्यादा सुसंगत और अनुमानित होता है।

मॉनिटर की नीली रोशनी से आधे चेहरे पर पड़ती नाटकीय छाया में आदमी का चेहरा

सिस्टम की पूरी दृश्यता के साथ रचें

कंटेंट फ़िल्टर कैसे काम करते हैं, यह जानने से आपको असली रचनात्मक बढ़त मिलती है। आप जानते हैं कि पिक्सल स्तर पर क्लासिफ़ायरों को क्या ट्रिगर करता है, कौन-से प्रॉम्प्ट शब्द जनरेशन शुरू होने से पहले ही ब्लॉकलिस्ट परतों को सक्रिय करते हैं, और संदर्भ संकेत सीमारेखा वाले स्कोरों को किसी भी दिशा में कैसे खिसकाते हैं। यह ज्ञान आपके रचनात्मक वर्कफ़्लो का हिस्सा होना चाहिए।

कैफ़े की मेज़ पर लैपटॉप पर टाइप करती महिला, बगल में एस्प्रेसो कप

PicassoIA आपको इमेज जनरेशन मॉडलों की पूरी रेंज तक सीधी पहुँच देता है, जिनमें से हर एक की अपनी सेफ़्टी कॉन्फ़िगरेशन और रचनात्मक दायरा है। PicassoIA Image प्लेटफ़ॉर्म का मुख्य टेक्स्ट-टू-इमेज जनरेटर है, जो प्रॉम्प्ट की हर शैली में लगातार क्वालिटी के साथ हाई-वॉल्यूम रचनात्मक काम के लिए बना है। मौजूदा इमेज को एडिट और रीमिक्स करने के लिए, PicassoIA Image Editor Pro इनपेंटिंग, आउटपेंटिंग और सटीक ऑब्जेक्ट-स्तर एडिटिंग देता है, बिना अलग टूल या वर्कफ़्लो की ज़रूरत के।

पोर्ट्रेट और कैरेक्टर वर्क के लिए, जहाँ रियलिज़्म सबसे ज़रूरी है, ByteDance का Seedream 4.5 स्किन टेक्सचर और फ़ोटोग्राफ़िक डिटेल के साथ 4K आउटपुट देता है। कंपोज़िशनल कंट्रोल और स्टाइलिस्टिक वैरिएशन के लिए, Black Forest Labs के Flux Redux Dev और Flux Schnell LoRA सटीक स्ट्रक्चरल गाइडेंस और तेज़ इटरेशन देते हैं। Stability AI का Stable Diffusion 3 अब भी कई वर्कफ़्लो में व्यापक संगतता के साथ भरोसेमंद फ़ोटोरियलिस्टिक आधार बना हुआ है।

AI से कंटेंट प्रोसेसिंग और वर्गीकरण को बड़े पैमाने पर दिखाता असेंबली लाइन डायोरामा

जनरेशन के बाद की एडिटिंग के लिए, जहाँ स्पेशियल कोहेरेंस सबसे ज़्यादा मायने रखता है, Flux Fill Pro कॉन्टेक्स्ट-अवेयर फ़िल से इनपेंटिंग काम संभालता है, जो इमेज की मौजूदा विज़ुअल भाषा के भीतर स्वाभाविक रूप से सुसंगत नतीजे देता है। इसका आउटपुट क्लासिफ़ायरों को ज़्यादा भरोसेमंद ढंग से पार करता है, क्योंकि इसकी आंतरिक कोहेरेंस फ़ोटोग्राफ़िक लगती है, जोड़-तोड़ से बनी हुई नहीं।

PicassoIA पर हर मॉडल picassoia.com/en/all-models पर उपलब्ध है, जिसमें लाइव प्रीव्यू, पूरा पैरामीटर डॉक्यूमेंटेशन, और किसी भी मॉडल को अपने वर्कफ़्लो में अपनाने से पहले उसे आज़माने के लिए क्रेडिट-आधारित एक्सेस शामिल है।

सुबह की कॉफ़ी के कप के बगल में संगमरमर की सतह पर रखा स्मार्टफ़ोन

कंटेंट फ़िल्टर आपका दुश्मन नहीं है। यह एक सांख्यिकीय सिस्टम है, जिसके दस्तावेज़ित तंत्र, अनुमानित विफलताएँ और कॉन्फ़िगर किए जा सकने वाले पैरामीटर हैं। आप जितनी बारीकी से जानेंगे कि यह क्या ट्रिगर करता है और क्यों, उतनी ही बारीकी से आप वह काम बना पाएँगे जो आप सच में बनाना चाहते हैं, किसी भी प्लेटफ़ॉर्म पर, किसी भी कंटेंट स्तर पर।

गोल्डन आवर की रोशनी में समुद्र तट की लहरों के किनारे खड़ी प्रसन्न युवा महिला, सहज और खुश

यह लेख शेयर करें

अपनी भाषा चुनें

संबंधित लेख