2027 में आपको जानने चाहिए ये AI शब्द

जब लोग LLM, inference या diffusion model जैसे शब्द बोलने लगें तो सिर हिलाकर चुप रहना बंद करें। यह लेख 2027 के लिए 30 ज़रूरी AI शब्दों को सरल भाषा में समझाता है, असली उदाहरणों, तुलनाओं के साथ और बिना किसी तकनीकी फ़ालतू बात के।

2027 में आपको जानने चाहिए ये AI शब्द
Cristian Da Conceicao
Picasso IA के संस्थापक

इस साल आप शायद ऐसी किसी बातचीत में रहे होंगे जहाँ कोई कह रहा था "बस LLM को LoRA adapter के साथ फ़ाइन-ट्यून करो और temperature कम कर दो" और कमरे में आधे लोग सिर हिलाने लगे जैसे सब समझ गए हों। वही पल, वह एहसास कि बाकी सब धाराप्रवाह बोल रहे हैं और आप दो कदम पीछे हैं, ठीक इसी वजह से यह लेख लिखा गया है।

2027 में AI की रफ़्तार धीमी नहीं पड़ रही। शब्दावली भी उतनी ही तेज़ी से बढ़ रही है। चाहे आप इमेज जनरेटर इस्तेमाल करने वाले डिज़ाइनर हों, चैटबॉट आज़मा रहे मार्केटर हों, या बस टेक्नोलॉजी की बातचीत में अपनी बात रखना चाहते हों, सही शब्दों को जानना पहला असली कदम है।

यह कोई पाठ्यपुस्तक नहीं है। यह उन AI शब्दों का सीधा-सादा विवरण है जो असल बातचीत में सचमुच आते हैं, और उन्हें उस स्पष्टता के साथ समझाया गया है जिससे ज़्यादातर टेक लेखन जानबूझकर बचता है।

कॉफ़ी शॉप में अपने कीबोर्ड पर टाइप करता एक एकाग्र आदमी, Kodak Portra फ़िल्म ग्रेन

आज AI की शब्दावली क्यों मायने रखती है

अंतर तेज़ी से बढ़ रहा है

2023 में "ChatGPT" क्या है, यह जानना भी आपको खाने की मेज़ पर ज़्यादातर लोगों से आगे रख देता था। 2026 में वह बुनियादी स्तर काफ़ी आगे बढ़ चुका है। AI का उत्पादक इस्तेमाल करने वाले लोग एक अलग भाषा बोल रहे हैं, और हर नए प्रोडक्ट रिलीज़ के साथ धाराप्रवाह यूज़र्स और उलझे हुए दर्शकों के बीच की दूरी बढ़ रही है।

अच्छी खबर? एक बार कोई शैक्षणिक भाषा का मुलम्मा उतार दे, तो AI की शब्दावली मुश्किल नहीं है। इनमें से ज़्यादातर शब्द ऐसे विचारों का वर्णन करते हैं जिन्हें आप पहले से सहज रूप से समझते हैं। उन्हें बस सरल अंग्रेज़ी या हिंदी में अनुवाद और एक ठोस उदाहरण चाहिए।

इस लेख को कैसे इस्तेमाल करें

नीचे हर शब्द के साथ एक-पंक्ति की परिभाषा है, जहाँ मदद करे वहाँ एक असली दुनिया का उदाहरण है, और यह नोट कि वह शब्द आपको कहाँ मिलेगा। शुरू से आखिर तक पढ़ें या उस हिस्से पर जाएँ जो अभी आप जिस काम पर हैं उससे मेल खाता हो।

सफ़ेद मेज़ पर रखी एक नोटबुक का ऊपर से लिया गया फ़्लैट ले शॉट, जिसके लाइन वाले पन्नों पर AI शब्दावली के शब्द हाथ से लिखे हैं, सुबह की रोशनी

मूल बुनियादी शब्द

सबसे पहले, तीन बुनियादी शब्द AI की बातचीत में लगातार आते हैं। ये नींव हैं।

Model क्या है?

मॉडल वह प्रशिक्षित सिस्टम है जो AI के आउटपुट बनाता है। जब आप प्रॉम्प्ट टाइप करते हैं और बदले में इमेज मिलती है, तो आप एक model इस्तेमाल कर रहे होते हैं। इसे एक बहुत परिष्कृत फ़ंक्शन की तरह समझें: इनपुट अंदर जाता है, आउटपुट बाहर आता है।

Models इस बात में अलग होते हैं कि उनका आकार कितना है (उनमें कितने parameters हैं), उन्हें किस डेटा पर प्रशिक्षित किया गया है, और उनकी क्षमता कैसी है (टेक्स्ट, इमेज, ऑडियो, वीडियो, या इन सबके मेल)।

💡 जब कोई पूछता है "आप कौन सा model इस्तेमाल कर रहे हैं?", तो वह उस विशेष AI सिस्टम के बारे में जानना चाहता है जो आपका अनुरोध प्राप्त कर रहा है, न कि उस ऐप या प्लेटफ़ॉर्म के बारे में जो उसे लपेटे हुए है।

Parameters और Weights

Parameters (जिन्हें कभी-कभी weights भी कहा जाता है) model के भीतर के वे संख्यात्मक मान हैं जो प्रशिक्षण के दौरान समायोजित किए गए थे। जब आप "70-billion parameter model" सुनते हैं, तो वह संख्या बताती है कि model में कितने अलग-अलग समायोज्य मान हैं।

ज़्यादा parameters आम तौर पर ज़्यादा क्षमता का मतलब होते हैं, लेकिन साथ में ज़्यादा compute की लागत भी। एक 7B model साधारण हार्डवेयर पर तेज़ चलता है। एक 405B model को सिर्फ़ लोड होने के लिए भी भारी इन्फ़्रास्ट्रक्चर चाहिए।

Training बनाम Inference

ये दोनों शब्द हर AI model की ज़िंदगी के दो अलग चरणों का वर्णन करते हैं।

चरणक्या होता हैकौन करता है
Trainingmodel भारी डेटा से सीखता है और अपने parameters समायोजित करता हैAI कंपनियाँ (OpenAI, Google, Black Forest Labs, आदि)
Inferenceप्रशिक्षित model आपके इनपुट का जवाब देता हैआप, किसी ऐप या API के ज़रिए

जब आप कोई भी AI टूल इस्तेमाल करते हैं, तो आप हमेशा इनफ़रेंस कर रहे होते हैं। आप कुछ भी दोबारा प्रशिक्षित नहीं कर रहे। model का ज्ञान उसकी training cutoff पर जमा हुआ है, इसीलिए उसे हाल की घटनाओं की जानकारी नहीं हो सकती।

घुंघराले लाल बालों वाली एक युवा महिला, जो ग्रे सोफ़े पर बैठकर अपने लैपटॉप को देख रही है, शाम की परिवेशी रोशनी

Large Language Models की भाषा

Large Language Models, या LLMs, वह AI श्रेणी है जो चैटबॉट, राइटिंग असिस्टेंट और हर उस चीज़ के पीछे है जो मुख्य रूप से टेक्स्ट के साथ काम करती है। यहाँ छह शब्द हैं जो बताते हैं कि वे कैसे काम करते हैं।

Tokens

Token टेक्स्ट का एक छोटा टुकड़ा है, औसतन लगभग तीन-चौथाई शब्द के बराबर। जब कोई LLM आपका संदेश प्रोसेस करता है, तो वह सब कुछ, आपका प्रॉम्प्ट और उसका अपना जवाब भी, कुछ करने से पहले tokens में बदल देता है।

Tokens इसलिए मायने रखते हैं क्योंकि:

  • Models एक बार में अधिकतम एक निश्चित संख्या तक ही प्रोसेस कर सकते हैं (context window)
  • API की कीमत लगभग हमेशा प्रति हज़ार tokens के हिसाब से तय होती है
  • लंबे दस्तावेज़ उम्मीद से कहीं तेज़ी से सीमा तक पहुँच जाते हैं

💡 "1,000 tokens" लगभग 750 शब्दों के बराबर है। एक सामान्य छोटा निबंध लगभग 1,500 tokens में समा जाता है।

Context Window

Context window टेक्स्ट की वह कुल मात्रा है, जो tokens में मापी जाती है, जिसे कोई model एक बार में प्रोसेस कर सकता है। विंडो के बाहर की हर चीज़ model के लिए अदृश्य है।

अगर आप किसी AI के साथ लंबी बातचीत कर रहे हैं और वह चैट के पहले हिस्सों को "भूलने" लगता है, तो आप context window की सीमा तक पहुँच गए हैं। model भ्रमित नहीं हुआ। वह सचमुच उस तक पहुँच ही नहीं सकता जो उसकी विंडो से बाहर गिर गया।

आज के LLMs की context windows बहुत बढ़ चुकी हैं। कुछ अब लाखों tokens संभालते हैं, जिससे एक ही सेशन में पूरी किताब का विश्लेषण या कोडबेस की गहरी पड़ताल संभव हो जाती है।

Prompt और System Prompt

Prompt AI model को आपका इनपुट है: वह सवाल जो आप पूछते हैं, वह काम जो आप बताते हैं, वह इमेज जो आप अपलोड करते हैं। आप जो भी टाइप करते हैं या भेजते हैं, वह सब आपका prompt है।

System prompt निर्देशों का एक अदृश्य सेट है जो आपकी बातचीत शुरू होने से पहले लोड होता है। AI models के ऊपर बने प्रोडक्ट इसी के ज़रिए model को एक व्यक्तित्व देते हैं, उसका व्यवहार सीमित करते हैं, या अपने-आप कोई खास संदर्भ लोड करते हैं। जब कोई customer service bot हमेशा एक तय लहजे में जवाब देता है और असंबंधित विषयों पर बात करने से मना कर देता है, तो वह व्यवहार system prompt में परिभाषित होता है।

Prompt engineering प्रॉम्प्ट्स को सावधानी से गढ़ने की प्रक्रिया है, ताकि कहीं बेहतर आउटपुट मिलें। यह कुछ हद तक कला है, कुछ हद तक विज्ञान, और अब तेज़ी से एक मान्यता-प्राप्त पेशेवर कौशल भी।

Temperature

Temperature नियंत्रित करता है कि model के आउटपुट कितने अनियमित या रचनात्मक होंगे। यह आम तौर पर 0 और 1 के बीच की संख्या होती है, हालाँकि कुछ सिस्टम 2 तक की अनुमति देते हैं।

  • कम temperature (0.1 से 0.3): अनुमान लगाने लायक, केंद्रित, और अक्सर दोहराव वाला। तथ्यात्मक या तकनीकी कामों के लिए आदर्श, जहाँ सटीकता विविधता से ज़्यादा ज़रूरी हो।
  • मध्यम temperature (0.6 से 0.8): रचनात्मकता और सुसंगतता का संतुलन। ज़्यादातर लेखन और बातचीत के कामों में अच्छा चलता है।
  • ऊँचा temperature (1.0+): जंगली, रचनात्मक, कभी-कभी असंगत। मंथन सत्रों के लिए उपयोगी, जहाँ आपको अप्रत्याशित मेल चाहिए।

AI शब्दावली के डायग्राम से भरे व्हाइटबोर्ड के सामने खड़े दो सहकर्मी, प्राकृतिक दिन की रोशनी, लो-एंगल शॉट

Image और Video AI के शब्द

यह हिस्सा AI इमेज जनरेटर के पीछे की शब्दावली कवर करता है, जो LLMs से पूरी तरह अलग श्रेणी के model से चलते हैं।

Diffusion Model

Diffusion model आज व्यापक रूप से इस्तेमाल होने वाले ज़्यादातर AI इमेज जनरेटरों के पीछे की आर्किटेक्चर है। इसका मूल विचार हैरान करने वाला सरल है: शुद्ध रैंडम noise से शुरू करें, फिर उसे चरण-दर-चरण denoise करते जाएँ, जब तक एक सुसंगत इमेज न उभर आए।

Black Forest Labs का Flux 2 Klein, OpenAI का GPT Image 2 और Wan 2.7 Image Pro, ये सब diffusion-आधारित या diffusion से प्रभावित आर्किटेक्चर हैं। हर denoising चरण इमेज को और निखारता है, इसीलिए (एक सीमा तक) steps बढ़ाने से क्वालिटी बेहतर होती है, पर जनरेशन का समय भी बढ़ता है।

LoRA

LoRA का मतलब है Low-Rank Adaptation। यह किसी model को किसी खास स्टाइल, व्यक्ति या कॉन्सेप्ट पर ढालने की तकनीक है, पूरे model को शुरू से दोबारा प्रशिक्षित किए बिना।

व्यवहार में, LoRA एक छोटी फ़ाइल होती है, अक्सर कुछ सौ मेगाबाइट की, जिसे आप किसी base model के ऊपर लोड करते हैं ताकि उसके आउटपुट बदले जा सकें। अगर आप चाहते हैं कि कोई इमेज जनरेटर लगातार किसी खास विज़ुअल स्टाइल या किसी खास किरदार की इमेज बनाए, तो उन उदाहरणों पर प्रशिक्षित LoRA ही मानक समाधान है।

💡 LoRA को एक प्लगइन की तरह सोचें जो base model को बदले बिना उसका डिफ़ॉल्ट स्टाइल बदल देता है।

Latent Space

Latent space वह आंतरिक गणितीय प्रतिनिधित्व है जिसे model इमेज, टेक्स्ट या ऑडियो को vectors के रूप में एन्कोड करने के लिए इस्तेमाल करता है। आप इसे सीधे कभी नहीं देखते। जब कोई diffusion model इमेज बनाता है, तो असली गणना latent space में होती है, उसके बाद ही अंतिम इमेज पिक्सेल में वापस डिकोड होती है।

यह शब्द इस चर्चा में अक्सर आता है कि AI models कॉन्सेप्ट कैसे मिलाते हैं: दो इमेज को मिलाना, किसी स्टाइल को धीरे-धीरे बदलना, या विज़ुअल कंटेंट पर semantic search करना। यह सारा हेरफेर latent space में होता है।

एक महिला के हाथों का क्लोज़-अप, जिनमें स्मार्टफ़ोन है और उस पर AI चैट इंटरफ़ेस दिख रहा है, दोपहर की गर्म गोल्डन रोशनी, मैक्रो लेंस

जनरेशन की शब्दावली

Text-to-Image

Text-to-image किसी भी ऐसे सिस्टम का वर्णन करता है जो एक टेक्स्ट प्रॉम्प्ट लेता है और एक जनरेट की हुई इमेज लौटाता है। यह सबसे सुलभ AI क्षमताओं में से एक बन गई है, जिसमें दर्जनों अलग model अलग सौंदर्य और ताकत देते हैं।

Picasso IA जैसे प्लेटफ़ॉर्म कई text-to-image models को एक जगह लाते हैं, GPT Image 2 से फ़ोटोरियलिस्टिक नतीजों के लिए, Seedream 4.5 से 4K-क्वालिटी डिटेल के लिए, और Hunyuan Image 2.1 से स्टाइलाइज़्ड आउटपुट के लिए। हर model एक ही प्रॉम्प्ट को अलग तरह से समझता है और एक अलग विज़ुअल पहचान बनाता है।

Text-to-Video

Text-to-video उसी विचार को चलती इमेज तक ले जाता है। आप एक दृश्य का वर्णन करते हैं (या कोई स्रोत इमेज देते हैं) और model सुसंगत मूवमेंट वाली एक छोटी वीडियो क्लिप बनाता है।

यह श्रेणी 2025 और 2026 के दौरान काफ़ी परिपक्व हुई। AI-जनरेटेड वीडियो और असली फ़ुटेज के बीच की क्वालिटी का फ़ासला काफ़ी कम हो गया है। अब models फ्रेम-दर-फ्रेम एक जैसे किरदार, यथार्थ भौतिकी, और स्वाभाविक दिखने वाला मूवमेंट बनाते हैं, जहाँ पहले के वर्ज़न धुंधले या विकृत आउटपुट देते थे।

Multimodal

Multimodal model एक से ज़्यादा प्रकार के इनपुट या आउटपुट के साथ काम करता है। जो model इनपुट के रूप में इमेज और टेक्स्ट दोनों लेता है, या आउटपुट के रूप में टेक्स्ट और ऑडियो दोनों दे सकता है, वह multimodal है।

2027 के ज़्यादातर सबसे उन्नत models किसी न किसी हद तक multimodal हैं। यह शब्द बताता है कि सिस्टम अब हर बातचीत में एक ही माध्यम तक सीमित नहीं है, जिससे कहीं ज़्यादा जटिल वर्कफ़्लो खुलते हैं।

चश्मा पहने 40 के दशक का एक आदमी, जो एक चमकदार यूनिवर्सिटी लाइब्रेरी में पढ़ रहा है, मेहराबदार खिड़कियों से आती दोपहर की धूप, 85mm लेंस

वे तकनीकी शब्द जो आपको हर जगह दिखेंगे

Fine-Tuning

Fine-tuning एक पहले से प्रशिक्षित model को किसी छोटे, खास डेटासेट पर प्रशिक्षण जारी रखने की प्रक्रिया है, ताकि उसे किसी खास काम या क्षेत्र के लिए ढाला जा सके। मेडिकल साहित्य पर फ़ाइन-ट्यून किया गया सामान्य LLM क्लिनिकल सवालों पर बेहतर प्रदर्शन करता है। प्रोडक्ट फ़ोटोग्राफ़ी पर फ़ाइन-ट्यून किया गया सामान्य इमेज model ज़्यादा तीखे और सुसंगत प्रोडक्ट शॉट बनाता है।

Fine-tuning शुरू से प्रशिक्षण (जिसकी लागत लाखों डॉलर हो सकती है) और प्रॉम्प्टिंग (जिसमें model में कोई बदलाव नहीं करना पड़ता) के बीच का रास्ता है। जब संगठनों को किसी model का विशेष व्यवहार चाहिए, तो ज़्यादातर वे यही बीच का रास्ता अपनाते हैं।

Hallucination

Hallucination तब होता है जब कोई AI model आत्मविश्वास भरा लगने वाला आउटपुट देता है जो तथ्यात्मक रूप से गलत हो। model झूठ नहीं बोल रहा होता। वह पैटर्न-मिलान कर रहा होता है, और ऐसे तरीके से जो एक विश्वसनीय लगने वाला, पर गलत नतीजा पैदा करता है।

LLMs फ़र्ज़ी स्रोत, आँकड़े, नाम और ऐतिहासिक घटनाएँ गढ़ लेते हैं। इमेज models इमेज में टेक्स्ट (बिगड़े या बेमतलब अक्षर) या गलत शारीरिक बनावट भी गढ़ सकते हैं। यह समझना कि hallucination इन models के काम करने के तरीके की एक संरचनात्मक प्रवृत्ति है, कोई ठीक करने वाला बग नहीं, यह बदल देता है कि आप AI के आउटपुट का इस्तेमाल और जाँच कैसे करते हैं।

💡 AI-जनरेटेड तथ्यों की हमेशा किसी प्राथमिक स्रोत से पुष्टि करें। model का आत्मविश्वास भरा लहजा सटीकता का सबूत नहीं है।

RAG

RAG का मतलब है Retrieval-Augmented Generation। यह एक तकनीक है जिसमें model को किसी बाहरी ज्ञान स्रोत से जोड़ा जाता है, जैसे दस्तावेज़ों की लाइब्रेरी, कोई डेटाबेस, या कोई वेबसाइट, ताकि वह जवाब बनाने से पहले प्रासंगिक जानकारी खोज सके।

RAG उन कामों में hallucination को काफ़ी घटा देता है जिनमें गहरी जानकारी चाहिए, क्योंकि model केवल अपने प्रशिक्षण डेटा पर निर्भर रहने के बजाय वास्तविक, खोजे गए कंटेंट से काम करता है। जब कोई चैटबॉट आपकी कंपनी के दस्तावेज़ीकरण के किसी खास पैराग्राफ़ को सही-सही उद्धृत करता है, तो लगभग निश्चित रूप से RAG उसकी आर्किटेक्चर का हिस्सा है।

Embedding

Embedding टेक्स्ट, इमेज या ऑडियो के एक टुकड़े का high-dimensional space में vector के रूप में संख्यात्मक प्रतिनिधित्व है। मिलते-जुलते कॉन्सेप्ट समान संख्यात्मक निर्देशांकों पर आ जाते हैं, और यही बात semantic similarity को कंप्यूटर द्वारा मापने योग्य बनाती है।

Embeddings semantic search की नींव हैं (बिना सटीक कीवर्ड मिलान के प्रासंगिक कंटेंट खोजना), साथ ही recommendation systems की, और यह भी कि RAG retrieval असल में अंदर से कैसे काम करता है। ये उपयोगकर्ताओं के लिए अदृश्य रहते हैं, पर आधुनिक AI ऐप्स में जो "स्मार्ट" लगता है, उसके बड़े हिस्से को ये ही चलाते हैं।

एक स्टार्टअप ऑफ़िस में एक बड़े मॉनिटर के चारों ओर जुटे चार युवा प्रोफ़ेशनल्स का विविध समूह, प्राकृतिक दिन की रोशनी, शहर का नज़ारा

वे शब्द जो बताते हैं AI कैसे बनता है

Neural Network

Neural network एक गणनात्मक आर्किटेक्चर है जो ढीले तौर पर मस्तिष्क की संरचना से प्रेरित है। इसमें आपस में जुड़े नोड्स की परतें होती हैं जो इनपुट डेटा को भारित गणितीय क्रियाओं की एक श्रृंखला से आउटपुट में बदलती हैं।

हर आधुनिक AI मॉडल, चाहे वह LLM हो, डिफ़्यूज़न मॉडल हो या स्पीच रिकॉग्नाइज़र, न्यूरल नेटवर्क पर बना होता है। यह शब्द बहुत व्यापक है। यह कहना कि "यह एक न्यूरल नेटवर्क इस्तेमाल करता है", कुछ-कुछ वैसा ही है जैसे यह कहना कि "यह सॉफ़्टवेयर पर चलता है।" तकनीकी रूप से यह सच है, लेकिन वर्णन का सबसे उपयोगी स्तर शायद ही कभी यही होता है।

Transformer

Transformer वह विशेष neural network आर्किटेक्चर है जो 2026 में लगभग सभी सबसे उन्नत AI models को शक्ति देता है। यह 2017 के एक शोध पत्र में पेश हुई थी और कुछ ही वर्षों में इसने पूरे क्षेत्र को पूरी तरह बदल दिया।

Transformers इतने हावी हैं कि व्यवहार में "LLM" और "large transformer model" लगभग समानार्थी हो गए हैं। जब कोई "foundation model" या "base model" कहता है, तो लगभग हमेशा वह एक बड़े transformer का वर्णन कर रहा होता है।

Attention Mechanism

Attention mechanism transformers के भीतर का मूल नवाचार है। यह model को आउटपुट के हर हिस्से को बनाते समय इनपुट के अलग-अलग हिस्सों के महत्व को गतिशील रूप से तौलने देता है।

जब कोई LLM एक वाक्य लिखता है, तो attention mechanism लगातार पूछ रहा होता है: "इस समय इस संदर्भ के कौन-से दूसरे हिस्से सबसे ज़्यादा मायने रखते हैं?" यही गतिशील भार वह चीज़ है जिससे transformers को टेक्स्ट में दूर तक फैले संबंधों और इमेज में जटिल पैटर्न संभालने की क्षमता मिलती है।

सीधे काले बालों वाली एक महिला, जो घर के स्टूडियो में खिड़की की रोशनी के बीच अपने डेस्कटॉप कंप्यूटर पर AI से बनी इमेज को खुशी से देख रही है

सुरक्षा और व्यापार की शब्दावली

Alignment

Alignment AI models को मानवीय मूल्यों और इरादों के अनुरूप व्यवहार कराने की चुनौती को दर्शाता है। एक aligned model केवल सटीक आउटपुट नहीं देता। वह मददगार, ईमानदार और सुरक्षित आउटपुट देता है।

RLHF (Reinforcement Learning from Human Feedback) आज इस्तेमाल में सबसे आम alignment तकनीक है। मानव रेटर model के आउटपुट का मूल्यांकन करते हैं, और model को उन पैटर्न को पसंद करने के लिए प्रशिक्षित किया जाता है जिन्हें उन्होंने सकारात्मक रेट किया। ज़्यादातर उपभोक्ता AI प्रोडक्ट सार्वजनिक रिलीज़ से पहले विस्तृत alignment प्रक्रियाओं से गुज़रते हैं।

Guardrails

Guardrails वे प्रतिबंध हैं जो किसी model के भीतर या उसके आसपास इसलिए बनाए जाते हैं ताकि कुछ खास आउटपुट रोके जा सकें। जो चैटबॉट हिंसक कंटेंट बनाने से मना कर देता है, उसके पास guardrails हैं। जो इमेज जनरेटर कुछ श्रेणियों की इमेज ब्लॉक करता है, वह guardrails लागू कर रहा है।

Guardrails model के प्रशिक्षण के दौरान भीतर बनाए जा सकते हैं (कुछ आउटपुट को सांख्यिकीय रूप से असंभाव्य बनाकर), या application layer पर लगाए जा सकते हैं (model प्रोसेसिंग से पहले और बाद में इनपुट और आउटपुट दोनों को फ़िल्टर करके)। ज़्यादातर उपभोक्ता AI प्रोडक्ट दोनों तरीकों को मिलाकर इस्तेमाल करते हैं।

API

API (Application Programming Interface) वह कनेक्शन है जो एक सॉफ़्टवेयर को दूसरे से बात करने देता है। जब कोई कंपनी कहती है "हमारे model को API के ज़रिए इस्तेमाल करें", तो उनका मतलब होता है कि आप अपने कोड से प्रोग्रामैटिक तरीके से उनके model को अनुरोध भेज सकते हैं और जवाब वापस पा सकते हैं।

ज़्यादातर AI प्रोडक्ट असल में इसी तरह बने हैं। जो ऐप आप इस्तेमाल करते हैं, उसने लगभग निश्चित रूप से वह model प्रशिक्षित नहीं किया जिस पर वह चलता है। वह उस कंपनी के API को कॉल करता है जिसने प्रशिक्षण किया था, और उसके ऊपर इंटरफ़ेस की एक परत जोड़ता है।

Open Source बनाम Closed Source

एक ओपन-सोर्स मॉडल के ओपन वेट्स सार्वजनिक रूप से जारी किए जाते हैं। कोई भी इसे बिना अनुमति या लागत के डाउनलोड, चला, संशोधित या फाइन-ट्यून कर सकता है। Llama, Mistral और Stable Diffusion प्रमुख ओपन-सोर्स मॉडल हैं।

Closed-source model अपने weights निजी रखता है। आप उसे केवल कंपनी के API के ज़रिए, और केवल उनकी शर्तों पर, इस्तेमाल कर सकते हैं। ज़्यादातर फ़्रंटियर models इसी श्रेणी में आते हैं।

Open SourceClosed Source
लागतस्थानीय रूप से चलाने के लिए मुफ़्तहर क्वेरी या सब्सक्रिप्शन के हिसाब से भुगतान
गोपनीयतापूर्ण (आपके हार्डवेयर पर चलता है)डेटा बाहरी सर्वर पर प्रोसेस होता है
प्रदर्शनmodel के हिसाब से काफ़ी अलगअक्सर श्रेणी में सर्वश्रेष्ठ
कस्टमाइज़ेशनफ़ाइन-ट्यून करने का पूरा नियंत्रणAPI जो उजागर करता है, उतना ही सीमित

डेनिम जैकेट पहने एक आदमी, जो व्यस्त शहरी सड़क पर चलते हुए अपना फ़ोन देख रहा है, शरद ऋतु की दोपहर की रोशनी, 50mm लेंस

त्वरित संदर्भ: एक नज़र में 30 शब्द

इस लेख की पूरी शब्दावली यहाँ एक ही स्कैन करने लायक तालिका में दी गई है, जिससे जल्दी दोहराया जा सके।

शब्दएक-पंक्ति परिभाषा
Modelएक प्रशिक्षित सिस्टम जो इनपुट लेकर आउटपुट देता है
Parameters / Weightsmodel के भीतर के संख्यात्मक मान, जो प्रशिक्षण के दौरान तय होते हैं
Trainingmodel के parameters समायोजित करके उसे सिखाने की प्रक्रिया
Inferenceआउटपुट बनाने के लिए प्रशिक्षित model चलाना
Tokenभाषा प्रोसेस करने के लिए इस्तेमाल होने वाला टेक्स्ट का एक छोटा टुकड़ा (~3/4 शब्द)
Context Windowएक बार में model जितना अधिकतम टेक्स्ट प्रोसेस कर सकता है
PromptAI model को आपका इनपुट
System Promptपहले से लोड किए गए निर्देश जो व्यवहार को अदृश्य रूप से आकार देते हैं
Temperatureआउटपुट में अनियमितता और रचनात्मकता को नियंत्रित करता है
Diffusion Modelऐसी आर्किटेक्चर जो रैंडमनेस से denoise करके इमेज बनाती है
LoRAएक छोटी फ़ाइल जो base model का स्टाइल बिना उसे दोबारा प्रशिक्षित किए बदलती है
Latent Spaceवह आंतरिक गणितीय स्थान जहाँ models कॉन्सेप्ट का प्रतिनिधित्व करते हैं
Text-to-Imageटेक्स्ट विवरण से इमेज बनाना
Text-to-Videoटेक्स्ट या इमेज इनपुट से वीडियो क्लिप बनाना
Multimodalएक साथ कई प्रकार के इनपुट या आउटपुट के साथ काम करना
Fine-Tuningछोटे, लक्षित डेटासेट से पहले से प्रशिक्षित model को ढालना
Hallucinationआत्मविश्वास भरा लेकिन तथ्यात्मक रूप से गलत AI आउटपुट
RAGठोस जवाबों के लिए model को बाहरी दस्तावेज़ों से जोड़ना
Embeddingटेक्स्ट, इमेज या ऑडियो का संख्यात्मक vector प्रतिनिधित्व
Neural Networkसभी आधुनिक AI का मूल गणनात्मक आर्किटेक्चर
Transformerआज ज़्यादातर AI models को शक्ति देने वाली विशेष neural आर्किटेक्चर
Attention Mechanismtransformers जनरेशन के दौरान संदर्भ को गतिशील रूप से कैसे तौलते हैं
Alignmentmodels को मानवीय मूल्यों के अनुरूप व्यवहार कराना
Guardrailsकुछ खास model आउटपुट को रोकने वाले प्रतिबंध
APIवह कनेक्शन परत जो सॉफ़्टवेयर को model की क्षमताओं तक पहुँचने देती है
Open Sourceसार्वजनिक रूप से उपलब्ध weights वाले models
Closed Sourceकेवल किसी कंपनी के API के ज़रिए उपलब्ध models
LLMLarge Language Model, जो मुख्य रूप से टेक्स्ट पर प्रशिक्षित transformer है
Inference Costएक model क्वेरी चलाने की compute और मौद्रिक लागत
Prompt Engineeringबेहतर model आउटपुट पाने के लिए इनपुट गढ़ने का कौशल

सुनहरे बालों वाली एक महिला, जो धूप वाले आर्ट स्टूडियो में टैबलेट पर AI से बनी आर्टवर्क देख रही है, स्काइलाइट की प्राकृतिक रिम लाइटिंग

अब कुछ बनाना शुरू करें

इस शब्दावली को पढ़ना पहला कदम है। असली स्पष्टता टूल्स इस्तेमाल करने से आती है। जब तक आप इमेज जनरेटर पर स्लाइडर नहीं घुमाते और देखते कि असल में क्या बदलता है, तब तक "latent space" को पूरी तरह नहीं समझ पाएँगे। temperature 0.2 और temperature 1.0 का फ़र्क तब तक महसूस नहीं होगा जब तक आप वही प्रॉम्प्ट दोनों तरह से चलाकर नतीजों की तुलना न करें।

Picasso IA आपको एक ही जगह 90 से ज़्यादा text-to-image models तक सीधी पहुँच देता है, जिनमें Flux 2 Klein, Wan 2.7 Image Pro, Seedream 4.5 और GPT Image 2 शामिल हैं। आप इनके बीच बदल सकते हैं, आउटपुट की साथ-साथ तुलना कर सकते हैं, LoRA adapters के साथ प्रयोग कर सकते हैं, और देख सकते हैं कि अलग-अलग आर्किटेक्चर एक ही प्रॉम्प्ट को असल समय में कैसे समझते हैं।

इस लेख में आपने जो शब्दावली पढ़ी, वह कुछ घंटों के प्रैक्टिकल काम में सहज हो जाती है। इस लेख से एक शब्द चुनें, किसी AI टूल में उसके संबंधित कंट्रोल को खोजें, उसे उसकी चरम सीमा तक ले जाएँ, और देखें क्या होता है। धाराप्रवाहता ऐसे ही बनती है, सिर्फ़ पढ़ने से नहीं, बल्कि पढ़ने के बाद करने से।

यह लेख शेयर करें

अपनी भाषा चुनें

संबंधित लेख