इस साल आप शायद ऐसी किसी बातचीत में रहे होंगे जहाँ कोई कह रहा था "बस LLM को LoRA adapter के साथ फ़ाइन-ट्यून करो और temperature कम कर दो" और कमरे में आधे लोग सिर हिलाने लगे जैसे सब समझ गए हों। वही पल, वह एहसास कि बाकी सब धाराप्रवाह बोल रहे हैं और आप दो कदम पीछे हैं, ठीक इसी वजह से यह लेख लिखा गया है।
2027 में AI की रफ़्तार धीमी नहीं पड़ रही। शब्दावली भी उतनी ही तेज़ी से बढ़ रही है। चाहे आप इमेज जनरेटर इस्तेमाल करने वाले डिज़ाइनर हों, चैटबॉट आज़मा रहे मार्केटर हों, या बस टेक्नोलॉजी की बातचीत में अपनी बात रखना चाहते हों, सही शब्दों को जानना पहला असली कदम है।
यह कोई पाठ्यपुस्तक नहीं है। यह उन AI शब्दों का सीधा-सादा विवरण है जो असल बातचीत में सचमुच आते हैं, और उन्हें उस स्पष्टता के साथ समझाया गया है जिससे ज़्यादातर टेक लेखन जानबूझकर बचता है।

आज AI की शब्दावली क्यों मायने रखती है
अंतर तेज़ी से बढ़ रहा है
2023 में "ChatGPT" क्या है, यह जानना भी आपको खाने की मेज़ पर ज़्यादातर लोगों से आगे रख देता था। 2026 में वह बुनियादी स्तर काफ़ी आगे बढ़ चुका है। AI का उत्पादक इस्तेमाल करने वाले लोग एक अलग भाषा बोल रहे हैं, और हर नए प्रोडक्ट रिलीज़ के साथ धाराप्रवाह यूज़र्स और उलझे हुए दर्शकों के बीच की दूरी बढ़ रही है।
अच्छी खबर? एक बार कोई शैक्षणिक भाषा का मुलम्मा उतार दे, तो AI की शब्दावली मुश्किल नहीं है। इनमें से ज़्यादातर शब्द ऐसे विचारों का वर्णन करते हैं जिन्हें आप पहले से सहज रूप से समझते हैं। उन्हें बस सरल अंग्रेज़ी या हिंदी में अनुवाद और एक ठोस उदाहरण चाहिए।
इस लेख को कैसे इस्तेमाल करें
नीचे हर शब्द के साथ एक-पंक्ति की परिभाषा है, जहाँ मदद करे वहाँ एक असली दुनिया का उदाहरण है, और यह नोट कि वह शब्द आपको कहाँ मिलेगा। शुरू से आखिर तक पढ़ें या उस हिस्से पर जाएँ जो अभी आप जिस काम पर हैं उससे मेल खाता हो।

मूल बुनियादी शब्द
सबसे पहले, तीन बुनियादी शब्द AI की बातचीत में लगातार आते हैं। ये नींव हैं।
Model क्या है?
मॉडल वह प्रशिक्षित सिस्टम है जो AI के आउटपुट बनाता है। जब आप प्रॉम्प्ट टाइप करते हैं और बदले में इमेज मिलती है, तो आप एक model इस्तेमाल कर रहे होते हैं। इसे एक बहुत परिष्कृत फ़ंक्शन की तरह समझें: इनपुट अंदर जाता है, आउटपुट बाहर आता है।
Models इस बात में अलग होते हैं कि उनका आकार कितना है (उनमें कितने parameters हैं), उन्हें किस डेटा पर प्रशिक्षित किया गया है, और उनकी क्षमता कैसी है (टेक्स्ट, इमेज, ऑडियो, वीडियो, या इन सबके मेल)।
💡 जब कोई पूछता है "आप कौन सा model इस्तेमाल कर रहे हैं?", तो वह उस विशेष AI सिस्टम के बारे में जानना चाहता है जो आपका अनुरोध प्राप्त कर रहा है, न कि उस ऐप या प्लेटफ़ॉर्म के बारे में जो उसे लपेटे हुए है।
Parameters और Weights
Parameters (जिन्हें कभी-कभी weights भी कहा जाता है) model के भीतर के वे संख्यात्मक मान हैं जो प्रशिक्षण के दौरान समायोजित किए गए थे। जब आप "70-billion parameter model" सुनते हैं, तो वह संख्या बताती है कि model में कितने अलग-अलग समायोज्य मान हैं।
ज़्यादा parameters आम तौर पर ज़्यादा क्षमता का मतलब होते हैं, लेकिन साथ में ज़्यादा compute की लागत भी। एक 7B model साधारण हार्डवेयर पर तेज़ चलता है। एक 405B model को सिर्फ़ लोड होने के लिए भी भारी इन्फ़्रास्ट्रक्चर चाहिए।
Training बनाम Inference
ये दोनों शब्द हर AI model की ज़िंदगी के दो अलग चरणों का वर्णन करते हैं।
| चरण | क्या होता है | कौन करता है |
|---|
| Training | model भारी डेटा से सीखता है और अपने parameters समायोजित करता है | AI कंपनियाँ (OpenAI, Google, Black Forest Labs, आदि) |
| Inference | प्रशिक्षित model आपके इनपुट का जवाब देता है | आप, किसी ऐप या API के ज़रिए |
जब आप कोई भी AI टूल इस्तेमाल करते हैं, तो आप हमेशा इनफ़रेंस कर रहे होते हैं। आप कुछ भी दोबारा प्रशिक्षित नहीं कर रहे। model का ज्ञान उसकी training cutoff पर जमा हुआ है, इसीलिए उसे हाल की घटनाओं की जानकारी नहीं हो सकती।

Large Language Models की भाषा
Large Language Models, या LLMs, वह AI श्रेणी है जो चैटबॉट, राइटिंग असिस्टेंट और हर उस चीज़ के पीछे है जो मुख्य रूप से टेक्स्ट के साथ काम करती है। यहाँ छह शब्द हैं जो बताते हैं कि वे कैसे काम करते हैं।
Tokens
Token टेक्स्ट का एक छोटा टुकड़ा है, औसतन लगभग तीन-चौथाई शब्द के बराबर। जब कोई LLM आपका संदेश प्रोसेस करता है, तो वह सब कुछ, आपका प्रॉम्प्ट और उसका अपना जवाब भी, कुछ करने से पहले tokens में बदल देता है।
Tokens इसलिए मायने रखते हैं क्योंकि:
- Models एक बार में अधिकतम एक निश्चित संख्या तक ही प्रोसेस कर सकते हैं (context window)
- API की कीमत लगभग हमेशा प्रति हज़ार tokens के हिसाब से तय होती है
- लंबे दस्तावेज़ उम्मीद से कहीं तेज़ी से सीमा तक पहुँच जाते हैं
💡 "1,000 tokens" लगभग 750 शब्दों के बराबर है। एक सामान्य छोटा निबंध लगभग 1,500 tokens में समा जाता है।
Context Window
Context window टेक्स्ट की वह कुल मात्रा है, जो tokens में मापी जाती है, जिसे कोई model एक बार में प्रोसेस कर सकता है। विंडो के बाहर की हर चीज़ model के लिए अदृश्य है।
अगर आप किसी AI के साथ लंबी बातचीत कर रहे हैं और वह चैट के पहले हिस्सों को "भूलने" लगता है, तो आप context window की सीमा तक पहुँच गए हैं। model भ्रमित नहीं हुआ। वह सचमुच उस तक पहुँच ही नहीं सकता जो उसकी विंडो से बाहर गिर गया।
आज के LLMs की context windows बहुत बढ़ चुकी हैं। कुछ अब लाखों tokens संभालते हैं, जिससे एक ही सेशन में पूरी किताब का विश्लेषण या कोडबेस की गहरी पड़ताल संभव हो जाती है।
Prompt और System Prompt
Prompt AI model को आपका इनपुट है: वह सवाल जो आप पूछते हैं, वह काम जो आप बताते हैं, वह इमेज जो आप अपलोड करते हैं। आप जो भी टाइप करते हैं या भेजते हैं, वह सब आपका prompt है।
System prompt निर्देशों का एक अदृश्य सेट है जो आपकी बातचीत शुरू होने से पहले लोड होता है। AI models के ऊपर बने प्रोडक्ट इसी के ज़रिए model को एक व्यक्तित्व देते हैं, उसका व्यवहार सीमित करते हैं, या अपने-आप कोई खास संदर्भ लोड करते हैं। जब कोई customer service bot हमेशा एक तय लहजे में जवाब देता है और असंबंधित विषयों पर बात करने से मना कर देता है, तो वह व्यवहार system prompt में परिभाषित होता है।
Prompt engineering प्रॉम्प्ट्स को सावधानी से गढ़ने की प्रक्रिया है, ताकि कहीं बेहतर आउटपुट मिलें। यह कुछ हद तक कला है, कुछ हद तक विज्ञान, और अब तेज़ी से एक मान्यता-प्राप्त पेशेवर कौशल भी।
Temperature
Temperature नियंत्रित करता है कि model के आउटपुट कितने अनियमित या रचनात्मक होंगे। यह आम तौर पर 0 और 1 के बीच की संख्या होती है, हालाँकि कुछ सिस्टम 2 तक की अनुमति देते हैं।
- कम temperature (0.1 से 0.3): अनुमान लगाने लायक, केंद्रित, और अक्सर दोहराव वाला। तथ्यात्मक या तकनीकी कामों के लिए आदर्श, जहाँ सटीकता विविधता से ज़्यादा ज़रूरी हो।
- मध्यम temperature (0.6 से 0.8): रचनात्मकता और सुसंगतता का संतुलन। ज़्यादातर लेखन और बातचीत के कामों में अच्छा चलता है।
- ऊँचा temperature (1.0+): जंगली, रचनात्मक, कभी-कभी असंगत। मंथन सत्रों के लिए उपयोगी, जहाँ आपको अप्रत्याशित मेल चाहिए।

Image और Video AI के शब्द
यह हिस्सा AI इमेज जनरेटर के पीछे की शब्दावली कवर करता है, जो LLMs से पूरी तरह अलग श्रेणी के model से चलते हैं।
Diffusion Model
Diffusion model आज व्यापक रूप से इस्तेमाल होने वाले ज़्यादातर AI इमेज जनरेटरों के पीछे की आर्किटेक्चर है। इसका मूल विचार हैरान करने वाला सरल है: शुद्ध रैंडम noise से शुरू करें, फिर उसे चरण-दर-चरण denoise करते जाएँ, जब तक एक सुसंगत इमेज न उभर आए।
Black Forest Labs का Flux 2 Klein, OpenAI का GPT Image 2 और Wan 2.7 Image Pro, ये सब diffusion-आधारित या diffusion से प्रभावित आर्किटेक्चर हैं। हर denoising चरण इमेज को और निखारता है, इसीलिए (एक सीमा तक) steps बढ़ाने से क्वालिटी बेहतर होती है, पर जनरेशन का समय भी बढ़ता है।
LoRA
LoRA का मतलब है Low-Rank Adaptation। यह किसी model को किसी खास स्टाइल, व्यक्ति या कॉन्सेप्ट पर ढालने की तकनीक है, पूरे model को शुरू से दोबारा प्रशिक्षित किए बिना।
व्यवहार में, LoRA एक छोटी फ़ाइल होती है, अक्सर कुछ सौ मेगाबाइट की, जिसे आप किसी base model के ऊपर लोड करते हैं ताकि उसके आउटपुट बदले जा सकें। अगर आप चाहते हैं कि कोई इमेज जनरेटर लगातार किसी खास विज़ुअल स्टाइल या किसी खास किरदार की इमेज बनाए, तो उन उदाहरणों पर प्रशिक्षित LoRA ही मानक समाधान है।
💡 LoRA को एक प्लगइन की तरह सोचें जो base model को बदले बिना उसका डिफ़ॉल्ट स्टाइल बदल देता है।
Latent Space
Latent space वह आंतरिक गणितीय प्रतिनिधित्व है जिसे model इमेज, टेक्स्ट या ऑडियो को vectors के रूप में एन्कोड करने के लिए इस्तेमाल करता है। आप इसे सीधे कभी नहीं देखते। जब कोई diffusion model इमेज बनाता है, तो असली गणना latent space में होती है, उसके बाद ही अंतिम इमेज पिक्सेल में वापस डिकोड होती है।
यह शब्द इस चर्चा में अक्सर आता है कि AI models कॉन्सेप्ट कैसे मिलाते हैं: दो इमेज को मिलाना, किसी स्टाइल को धीरे-धीरे बदलना, या विज़ुअल कंटेंट पर semantic search करना। यह सारा हेरफेर latent space में होता है।

जनरेशन की शब्दावली
Text-to-Image
Text-to-image किसी भी ऐसे सिस्टम का वर्णन करता है जो एक टेक्स्ट प्रॉम्प्ट लेता है और एक जनरेट की हुई इमेज लौटाता है। यह सबसे सुलभ AI क्षमताओं में से एक बन गई है, जिसमें दर्जनों अलग model अलग सौंदर्य और ताकत देते हैं।
Picasso IA जैसे प्लेटफ़ॉर्म कई text-to-image models को एक जगह लाते हैं, GPT Image 2 से फ़ोटोरियलिस्टिक नतीजों के लिए, Seedream 4.5 से 4K-क्वालिटी डिटेल के लिए, और Hunyuan Image 2.1 से स्टाइलाइज़्ड आउटपुट के लिए। हर model एक ही प्रॉम्प्ट को अलग तरह से समझता है और एक अलग विज़ुअल पहचान बनाता है।
Text-to-Video
Text-to-video उसी विचार को चलती इमेज तक ले जाता है। आप एक दृश्य का वर्णन करते हैं (या कोई स्रोत इमेज देते हैं) और model सुसंगत मूवमेंट वाली एक छोटी वीडियो क्लिप बनाता है।
यह श्रेणी 2025 और 2026 के दौरान काफ़ी परिपक्व हुई। AI-जनरेटेड वीडियो और असली फ़ुटेज के बीच की क्वालिटी का फ़ासला काफ़ी कम हो गया है। अब models फ्रेम-दर-फ्रेम एक जैसे किरदार, यथार्थ भौतिकी, और स्वाभाविक दिखने वाला मूवमेंट बनाते हैं, जहाँ पहले के वर्ज़न धुंधले या विकृत आउटपुट देते थे।
Multimodal
Multimodal model एक से ज़्यादा प्रकार के इनपुट या आउटपुट के साथ काम करता है। जो model इनपुट के रूप में इमेज और टेक्स्ट दोनों लेता है, या आउटपुट के रूप में टेक्स्ट और ऑडियो दोनों दे सकता है, वह multimodal है।
2027 के ज़्यादातर सबसे उन्नत models किसी न किसी हद तक multimodal हैं। यह शब्द बताता है कि सिस्टम अब हर बातचीत में एक ही माध्यम तक सीमित नहीं है, जिससे कहीं ज़्यादा जटिल वर्कफ़्लो खुलते हैं।

वे तकनीकी शब्द जो आपको हर जगह दिखेंगे
Fine-Tuning
Fine-tuning एक पहले से प्रशिक्षित model को किसी छोटे, खास डेटासेट पर प्रशिक्षण जारी रखने की प्रक्रिया है, ताकि उसे किसी खास काम या क्षेत्र के लिए ढाला जा सके। मेडिकल साहित्य पर फ़ाइन-ट्यून किया गया सामान्य LLM क्लिनिकल सवालों पर बेहतर प्रदर्शन करता है। प्रोडक्ट फ़ोटोग्राफ़ी पर फ़ाइन-ट्यून किया गया सामान्य इमेज model ज़्यादा तीखे और सुसंगत प्रोडक्ट शॉट बनाता है।
Fine-tuning शुरू से प्रशिक्षण (जिसकी लागत लाखों डॉलर हो सकती है) और प्रॉम्प्टिंग (जिसमें model में कोई बदलाव नहीं करना पड़ता) के बीच का रास्ता है। जब संगठनों को किसी model का विशेष व्यवहार चाहिए, तो ज़्यादातर वे यही बीच का रास्ता अपनाते हैं।
Hallucination
Hallucination तब होता है जब कोई AI model आत्मविश्वास भरा लगने वाला आउटपुट देता है जो तथ्यात्मक रूप से गलत हो। model झूठ नहीं बोल रहा होता। वह पैटर्न-मिलान कर रहा होता है, और ऐसे तरीके से जो एक विश्वसनीय लगने वाला, पर गलत नतीजा पैदा करता है।
LLMs फ़र्ज़ी स्रोत, आँकड़े, नाम और ऐतिहासिक घटनाएँ गढ़ लेते हैं। इमेज models इमेज में टेक्स्ट (बिगड़े या बेमतलब अक्षर) या गलत शारीरिक बनावट भी गढ़ सकते हैं। यह समझना कि hallucination इन models के काम करने के तरीके की एक संरचनात्मक प्रवृत्ति है, कोई ठीक करने वाला बग नहीं, यह बदल देता है कि आप AI के आउटपुट का इस्तेमाल और जाँच कैसे करते हैं।
💡 AI-जनरेटेड तथ्यों की हमेशा किसी प्राथमिक स्रोत से पुष्टि करें। model का आत्मविश्वास भरा लहजा सटीकता का सबूत नहीं है।
RAG
RAG का मतलब है Retrieval-Augmented Generation। यह एक तकनीक है जिसमें model को किसी बाहरी ज्ञान स्रोत से जोड़ा जाता है, जैसे दस्तावेज़ों की लाइब्रेरी, कोई डेटाबेस, या कोई वेबसाइट, ताकि वह जवाब बनाने से पहले प्रासंगिक जानकारी खोज सके।
RAG उन कामों में hallucination को काफ़ी घटा देता है जिनमें गहरी जानकारी चाहिए, क्योंकि model केवल अपने प्रशिक्षण डेटा पर निर्भर रहने के बजाय वास्तविक, खोजे गए कंटेंट से काम करता है। जब कोई चैटबॉट आपकी कंपनी के दस्तावेज़ीकरण के किसी खास पैराग्राफ़ को सही-सही उद्धृत करता है, तो लगभग निश्चित रूप से RAG उसकी आर्किटेक्चर का हिस्सा है।
Embedding
Embedding टेक्स्ट, इमेज या ऑडियो के एक टुकड़े का high-dimensional space में vector के रूप में संख्यात्मक प्रतिनिधित्व है। मिलते-जुलते कॉन्सेप्ट समान संख्यात्मक निर्देशांकों पर आ जाते हैं, और यही बात semantic similarity को कंप्यूटर द्वारा मापने योग्य बनाती है।
Embeddings semantic search की नींव हैं (बिना सटीक कीवर्ड मिलान के प्रासंगिक कंटेंट खोजना), साथ ही recommendation systems की, और यह भी कि RAG retrieval असल में अंदर से कैसे काम करता है। ये उपयोगकर्ताओं के लिए अदृश्य रहते हैं, पर आधुनिक AI ऐप्स में जो "स्मार्ट" लगता है, उसके बड़े हिस्से को ये ही चलाते हैं।

वे शब्द जो बताते हैं AI कैसे बनता है
Neural Network
Neural network एक गणनात्मक आर्किटेक्चर है जो ढीले तौर पर मस्तिष्क की संरचना से प्रेरित है। इसमें आपस में जुड़े नोड्स की परतें होती हैं जो इनपुट डेटा को भारित गणितीय क्रियाओं की एक श्रृंखला से आउटपुट में बदलती हैं।
हर आधुनिक AI मॉडल, चाहे वह LLM हो, डिफ़्यूज़न मॉडल हो या स्पीच रिकॉग्नाइज़र, न्यूरल नेटवर्क पर बना होता है। यह शब्द बहुत व्यापक है। यह कहना कि "यह एक न्यूरल नेटवर्क इस्तेमाल करता है", कुछ-कुछ वैसा ही है जैसे यह कहना कि "यह सॉफ़्टवेयर पर चलता है।" तकनीकी रूप से यह सच है, लेकिन वर्णन का सबसे उपयोगी स्तर शायद ही कभी यही होता है।
Transformer
Transformer वह विशेष neural network आर्किटेक्चर है जो 2026 में लगभग सभी सबसे उन्नत AI models को शक्ति देता है। यह 2017 के एक शोध पत्र में पेश हुई थी और कुछ ही वर्षों में इसने पूरे क्षेत्र को पूरी तरह बदल दिया।
Transformers इतने हावी हैं कि व्यवहार में "LLM" और "large transformer model" लगभग समानार्थी हो गए हैं। जब कोई "foundation model" या "base model" कहता है, तो लगभग हमेशा वह एक बड़े transformer का वर्णन कर रहा होता है।
Attention Mechanism
Attention mechanism transformers के भीतर का मूल नवाचार है। यह model को आउटपुट के हर हिस्से को बनाते समय इनपुट के अलग-अलग हिस्सों के महत्व को गतिशील रूप से तौलने देता है।
जब कोई LLM एक वाक्य लिखता है, तो attention mechanism लगातार पूछ रहा होता है: "इस समय इस संदर्भ के कौन-से दूसरे हिस्से सबसे ज़्यादा मायने रखते हैं?" यही गतिशील भार वह चीज़ है जिससे transformers को टेक्स्ट में दूर तक फैले संबंधों और इमेज में जटिल पैटर्न संभालने की क्षमता मिलती है।

सुरक्षा और व्यापार की शब्दावली
Alignment
Alignment AI models को मानवीय मूल्यों और इरादों के अनुरूप व्यवहार कराने की चुनौती को दर्शाता है। एक aligned model केवल सटीक आउटपुट नहीं देता। वह मददगार, ईमानदार और सुरक्षित आउटपुट देता है।
RLHF (Reinforcement Learning from Human Feedback) आज इस्तेमाल में सबसे आम alignment तकनीक है। मानव रेटर model के आउटपुट का मूल्यांकन करते हैं, और model को उन पैटर्न को पसंद करने के लिए प्रशिक्षित किया जाता है जिन्हें उन्होंने सकारात्मक रेट किया। ज़्यादातर उपभोक्ता AI प्रोडक्ट सार्वजनिक रिलीज़ से पहले विस्तृत alignment प्रक्रियाओं से गुज़रते हैं।
Guardrails
Guardrails वे प्रतिबंध हैं जो किसी model के भीतर या उसके आसपास इसलिए बनाए जाते हैं ताकि कुछ खास आउटपुट रोके जा सकें। जो चैटबॉट हिंसक कंटेंट बनाने से मना कर देता है, उसके पास guardrails हैं। जो इमेज जनरेटर कुछ श्रेणियों की इमेज ब्लॉक करता है, वह guardrails लागू कर रहा है।
Guardrails model के प्रशिक्षण के दौरान भीतर बनाए जा सकते हैं (कुछ आउटपुट को सांख्यिकीय रूप से असंभाव्य बनाकर), या application layer पर लगाए जा सकते हैं (model प्रोसेसिंग से पहले और बाद में इनपुट और आउटपुट दोनों को फ़िल्टर करके)। ज़्यादातर उपभोक्ता AI प्रोडक्ट दोनों तरीकों को मिलाकर इस्तेमाल करते हैं।
API
API (Application Programming Interface) वह कनेक्शन है जो एक सॉफ़्टवेयर को दूसरे से बात करने देता है। जब कोई कंपनी कहती है "हमारे model को API के ज़रिए इस्तेमाल करें", तो उनका मतलब होता है कि आप अपने कोड से प्रोग्रामैटिक तरीके से उनके model को अनुरोध भेज सकते हैं और जवाब वापस पा सकते हैं।
ज़्यादातर AI प्रोडक्ट असल में इसी तरह बने हैं। जो ऐप आप इस्तेमाल करते हैं, उसने लगभग निश्चित रूप से वह model प्रशिक्षित नहीं किया जिस पर वह चलता है। वह उस कंपनी के API को कॉल करता है जिसने प्रशिक्षण किया था, और उसके ऊपर इंटरफ़ेस की एक परत जोड़ता है।
Open Source बनाम Closed Source
एक ओपन-सोर्स मॉडल के ओपन वेट्स सार्वजनिक रूप से जारी किए जाते हैं। कोई भी इसे बिना अनुमति या लागत के डाउनलोड, चला, संशोधित या फाइन-ट्यून कर सकता है। Llama, Mistral और Stable Diffusion प्रमुख ओपन-सोर्स मॉडल हैं।
Closed-source model अपने weights निजी रखता है। आप उसे केवल कंपनी के API के ज़रिए, और केवल उनकी शर्तों पर, इस्तेमाल कर सकते हैं। ज़्यादातर फ़्रंटियर models इसी श्रेणी में आते हैं।
| Open Source | Closed Source |
|---|
| लागत | स्थानीय रूप से चलाने के लिए मुफ़्त | हर क्वेरी या सब्सक्रिप्शन के हिसाब से भुगतान |
| गोपनीयता | पूर्ण (आपके हार्डवेयर पर चलता है) | डेटा बाहरी सर्वर पर प्रोसेस होता है |
| प्रदर्शन | model के हिसाब से काफ़ी अलग | अक्सर श्रेणी में सर्वश्रेष्ठ |
| कस्टमाइज़ेशन | फ़ाइन-ट्यून करने का पूरा नियंत्रण | API जो उजागर करता है, उतना ही सीमित |

त्वरित संदर्भ: एक नज़र में 30 शब्द
इस लेख की पूरी शब्दावली यहाँ एक ही स्कैन करने लायक तालिका में दी गई है, जिससे जल्दी दोहराया जा सके।
| शब्द | एक-पंक्ति परिभाषा |
|---|
| Model | एक प्रशिक्षित सिस्टम जो इनपुट लेकर आउटपुट देता है |
| Parameters / Weights | model के भीतर के संख्यात्मक मान, जो प्रशिक्षण के दौरान तय होते हैं |
| Training | model के parameters समायोजित करके उसे सिखाने की प्रक्रिया |
| Inference | आउटपुट बनाने के लिए प्रशिक्षित model चलाना |
| Token | भाषा प्रोसेस करने के लिए इस्तेमाल होने वाला टेक्स्ट का एक छोटा टुकड़ा (~3/4 शब्द) |
| Context Window | एक बार में model जितना अधिकतम टेक्स्ट प्रोसेस कर सकता है |
| Prompt | AI model को आपका इनपुट |
| System Prompt | पहले से लोड किए गए निर्देश जो व्यवहार को अदृश्य रूप से आकार देते हैं |
| Temperature | आउटपुट में अनियमितता और रचनात्मकता को नियंत्रित करता है |
| Diffusion Model | ऐसी आर्किटेक्चर जो रैंडमनेस से denoise करके इमेज बनाती है |
| LoRA | एक छोटी फ़ाइल जो base model का स्टाइल बिना उसे दोबारा प्रशिक्षित किए बदलती है |
| Latent Space | वह आंतरिक गणितीय स्थान जहाँ models कॉन्सेप्ट का प्रतिनिधित्व करते हैं |
| Text-to-Image | टेक्स्ट विवरण से इमेज बनाना |
| Text-to-Video | टेक्स्ट या इमेज इनपुट से वीडियो क्लिप बनाना |
| Multimodal | एक साथ कई प्रकार के इनपुट या आउटपुट के साथ काम करना |
| Fine-Tuning | छोटे, लक्षित डेटासेट से पहले से प्रशिक्षित model को ढालना |
| Hallucination | आत्मविश्वास भरा लेकिन तथ्यात्मक रूप से गलत AI आउटपुट |
| RAG | ठोस जवाबों के लिए model को बाहरी दस्तावेज़ों से जोड़ना |
| Embedding | टेक्स्ट, इमेज या ऑडियो का संख्यात्मक vector प्रतिनिधित्व |
| Neural Network | सभी आधुनिक AI का मूल गणनात्मक आर्किटेक्चर |
| Transformer | आज ज़्यादातर AI models को शक्ति देने वाली विशेष neural आर्किटेक्चर |
| Attention Mechanism | transformers जनरेशन के दौरान संदर्भ को गतिशील रूप से कैसे तौलते हैं |
| Alignment | models को मानवीय मूल्यों के अनुरूप व्यवहार कराना |
| Guardrails | कुछ खास model आउटपुट को रोकने वाले प्रतिबंध |
| API | वह कनेक्शन परत जो सॉफ़्टवेयर को model की क्षमताओं तक पहुँचने देती है |
| Open Source | सार्वजनिक रूप से उपलब्ध weights वाले models |
| Closed Source | केवल किसी कंपनी के API के ज़रिए उपलब्ध models |
| LLM | Large Language Model, जो मुख्य रूप से टेक्स्ट पर प्रशिक्षित transformer है |
| Inference Cost | एक model क्वेरी चलाने की compute और मौद्रिक लागत |
| Prompt Engineering | बेहतर model आउटपुट पाने के लिए इनपुट गढ़ने का कौशल |

अब कुछ बनाना शुरू करें
इस शब्दावली को पढ़ना पहला कदम है। असली स्पष्टता टूल्स इस्तेमाल करने से आती है। जब तक आप इमेज जनरेटर पर स्लाइडर नहीं घुमाते और देखते कि असल में क्या बदलता है, तब तक "latent space" को पूरी तरह नहीं समझ पाएँगे। temperature 0.2 और temperature 1.0 का फ़र्क तब तक महसूस नहीं होगा जब तक आप वही प्रॉम्प्ट दोनों तरह से चलाकर नतीजों की तुलना न करें।
Picasso IA आपको एक ही जगह 90 से ज़्यादा text-to-image models तक सीधी पहुँच देता है, जिनमें Flux 2 Klein, Wan 2.7 Image Pro, Seedream 4.5 और GPT Image 2 शामिल हैं। आप इनके बीच बदल सकते हैं, आउटपुट की साथ-साथ तुलना कर सकते हैं, LoRA adapters के साथ प्रयोग कर सकते हैं, और देख सकते हैं कि अलग-अलग आर्किटेक्चर एक ही प्रॉम्प्ट को असल समय में कैसे समझते हैं।
इस लेख में आपने जो शब्दावली पढ़ी, वह कुछ घंटों के प्रैक्टिकल काम में सहज हो जाती है। इस लेख से एक शब्द चुनें, किसी AI टूल में उसके संबंधित कंट्रोल को खोजें, उसे उसकी चरम सीमा तक ले जाएँ, और देखें क्या होता है। धाराप्रवाहता ऐसे ही बनती है, सिर्फ़ पढ़ने से नहीं, बल्कि पढ़ने के बाद करने से।