AI टेक्स्ट से संगीत कैसे बनाता है (और यह असल में काम क्यों करता है)

आप जो मूड, जॉनर और टेम्पो चाहते हैं, उसके बारे में कुछ शब्द टाइप करते हैं। कुछ ही सेकंड बाद वोकल, मेलडी, हार्मनी और रिदम के साथ पूरा गाना बजने लगता है। यह लेख टेक्स्ट एंबेडिंग से लेकर ऑडियो डिफ़्यूज़न तक, हर स्तर पर AI म्यूज़िक जनरेशन का काम समझाता है और बताता है कि अभी आपको कौन-से मॉडल इस्तेमाल करने चाहिए।

AI टेक्स्ट से संगीत कैसे बनाता है (और यह असल में काम क्यों करता है)
Cristian Da Conceicao
Picasso IA के संस्थापक

आप "1950 के दशक की स्टाइल में एक उदास जैज़ बैलेड, महिला वोकल, धीमा टेम्पो, बारिश वाली रात का मूड" टाइप करते हैं और एंटर दबाते हैं। तीस सेकंड बाद आपके पास एक पूरा गाना होता है। असली इंस्ट्रूमेंट। असली भावना। असली मेलडी। यह साइंस फ़िक्शन नहीं है। आधुनिक AI म्यूज़िक जनरेशन यही करती है, और यह अभी, इसी वक़्त हो रहा है।

एक होम स्टूडियो में लैपटॉप पर गाने के बोल टाइप करते हुए हाथ

"टेक्स्ट टू म्यूज़िक" का असल मतलब क्या है

यह वाक्यांश सुनने में सरल लगता है, लेकिन इन चार शब्दों में काफ़ी इंजीनियरिंग छिपी है। जब AI टेक्स्ट से संगीत बनाता है, तो वह किसी लाइब्रेरी से पहले से रिकॉर्ड की गई क्लिप उठाकर आपको नहीं देता। वह ऑडियो को शुरू से संश्लेषित करता है, एक-एक गणितीय फ़ैसले के साथ, और पूरी तरह इस पर निर्भर रहता है कि आपके शब्द क्या बता रहे हैं।

यह सर्च इंजन नहीं है

शुरुआती "AI म्यूज़िक" टूल असल में बढ़े-चढ़े सर्च इंजन थे। आप एक जॉनर टाइप करते थे, और सिस्टम एक पहले से टैग किए गए लाइब्रेरी ट्रैक को लौटा देता था। आधुनिक टेक्स्ट-टू-म्यूज़िक मॉडल इससे मूल रूप से अलग हैं। वे ऐसा ऑडियो बनाते हैं जो पहले कभी अस्तित्व में नहीं था, नोट-दर-नोट, बीट-दर-बीट।

यह फ़र्क मायने रखता है, क्योंकि इससे आप क्या कर सकते हैं, यह बदल जाता है। सर्च इंजन सिर्फ़ वही लौटा सकता है जो उसके डेटाबेस में पहले से है। एक जनरेटिव मॉडल, अगर आप माँगें, तो थेरेमिन सोलो और फुसफुसाते हुए फ़्रेंच बोलों वाला 1970 के दशक का फ़ंक ट्रैक बना सकता है। इस खास मेल को पहले लगभग निश्चित रूप से कभी रिकॉर्ड नहीं किया गया होगा।

आपके प्रॉम्प्ट को तीन बातें बतानी होती हैं

मॉडल कैसे काम करता है, इसमें जाने से पहले यह सोचना मददगार है कि म्यूज़िक प्रॉम्प्ट में असल में कौन-सी जानकारी होती है:

  1. मूड और भावना (उदास, उत्साही, तनावपूर्ण, शांत)
  2. संरचना और टेम्पो (धीरे-धीरे बढ़ता, तेज़, 140 BPM, लगातार बढ़ती तीव्रता)
  3. साउंड का पैलेट (इंस्ट्रूमेंट, जॉनर, वोकल स्टाइल, प्रोडक्शन का दौर)

तीनों आयामों में आप जितने साफ़-साफ़ होंगे, मॉडल उतनी ही सटीकता से वह दे पाएगा जो आप चाहते हैं।

वोकल रिकॉर्डिंग बूथ में एक पेशेवर कंडेंसर माइक्रोफ़ोन

मॉडल आपके शब्द कैसे पढ़ता है

यहीं पर चीज़ें सचमुच दिलचस्प हो जाती हैं। मॉडल आपके शब्दों को उस तरह "नहीं पढ़ता" जैसे आप पढ़ते हैं। वह उन्हें संख्याओं में बदलता है, खासकर एक ऐसे फ़ॉर्मेट में जिसे टेक्स्ट एंबेडिंग कहते हैं, यानी एक घना वेक्टर प्रतिनिधित्व जो अर्थ को पकड़ता है।

टेक्स्ट एंबेडिंग को सरल भाषा में समझें

इसे ऐसे सोचें: शब्द "जैज़" और वाक्यांश "देर रात के ब्रास इंस्ट्रूमेंट, धुआँसा माहौल" मॉडल के गणितीय स्पेस में संख्याओं के लगभग एक जैसे समूहों में बदल जाते हैं। वे एक जैसे नहीं होते, लेकिन करीबी पड़ोसी होते हैं। मॉडल इस नज़दीकी का इस्तेमाल करके अपने ऑडियो जनरेशन को उन आवाज़ों की ओर ले जाता है जो आपके वर्णन से मेल खाती हैं।

इसीलिए धुंधले प्रॉम्प्ट आम नतीजे देते हैं। "अच्छा म्यूज़िक" एक बहुत बड़े, बिखरे हुए इलाके के बीच में बैठता है। "नरम एकॉस्टिक गिटार, फ़िंगरपिकिंग पैटर्न, ओपन ट्यूनिंग, सूर्योदय की सुबह वाला मूड" एक सटीक निर्देशांक है, जो मॉडल को कहीं ज़्यादा ठोस साउंड लक्ष्य की ओर ले जाता है।

विशिष्टता सब कुछ क्यों बदल देती है

अस्पष्ट प्रॉम्प्टविशिष्ट प्रॉम्प्टसंभावित नतीजा
"happy song""upbeat ska with brass, 160 BPM, beach party energy"आम पॉप बनाम असली ska ट्रैक
"sad piano""solo piano, minor key, very slow, Satie-influenced, rain outside"आम उदास संगीत बनाम कुछ भावनाओं को जगाने वाला
"rock music""heavy guitar riffs, 90s grunge production, dropped D tuning, raw vocals"कुछ भी बनाम ऐसा ट्रैक जो Seattle 1993 जैसा सुनाई दे

धूप वाले लिविंग रूम में आँखें बंद करके हेडफ़ोन पर गाना सुनता एक आदमी

आवाज़ के पीछे का इंजन

एक बार मॉडल के पास आपका टेक्स्ट एंबेडिंग के रूप में आ जाए, तो उसे उस गणितीय प्रतिनिधित्व को असली ऑडियो में बदलना होता है। इस क्षेत्र पर अभी दो मुख्य आर्किटेक्चरल तरीके हावी हैं।

ऑडियो में ट्रांसफ़ॉर्मर मॉडल

ट्रांसफ़ॉर्मर, वही आर्किटेक्चर जो लार्ज लैंग्वेज मॉडल को चलाता है, म्यूज़िकल सीक्वेंस की भविष्यवाणी के लिए ढाला जा सकता है। वाक्य में अगला शब्द अनुमानित करने के बजाय ये मॉडल ऑडियो टोकन के सीक्वेंस में अगले टोकन का अनुमान लगाते हैं। इन्हें संगीत के विशाल डेटासेट पर ट्रेन किया जाता है, और ये सीखते हैं कि कौन-सी आवाज़ें एक साथ अच्छी लगती हैं: कॉर्ड प्रोग्रेशन, रिदम पैटर्न, मेलोडी के उतार-चढ़ाव, हार्मोनिक तनाव और राहत।

फ़ायदा: ट्रांसफ़ॉर्मर लॉन्ग-रेंज कोहेरेंस में बहुत अच्छे होते हैं। वे पूरे तीन मिनट के ट्रैक में एक म्यूज़िकल थीम बनाए रखते हैं, और यह जानबूझकर किया गया लगता है, बेतरतीब नहीं।

ऑडियो के लिए डिफ़्यूज़न मॉडल

डिफ़्यूज़न मॉडल अलग तरीके से काम करते हैं। वे शुद्ध नॉइज़ से शुरू करते हैं और उसे धीरे-धीरे डीनॉइज़ करके एक सुसंगत ऑडियो सिग्नल में बदलते हैं, हर कदम पर आपके टेक्स्ट एंबेडिंग के मार्गदर्शन में। इसे मूर्तिकला की तरह सोचें: संगमरमर के एक बेतरतीब टुकड़े (नॉइज़) से शुरू करना और उसे छीलते जाना (डीनॉइज़िंग), उस आकार के अनुसार जिसका वर्णन आपका प्रॉम्प्ट करता है।

फ़ायदा: डिफ़्यूज़न मॉडल बेहद उच्च फ़िडेलिटी वाला और प्राकृतिक लगने वाली टेक्सचर वाला ऑडियो बनाते हैं, खासकर इंस्ट्रूमेंट और वोकल के लिए।

अभी के कई सबसे अच्छे मॉडल दोनों तरीकों को मिलाते हैं: संरचना के लिए ट्रांसफ़ॉर्मर और अंतिम ऑडियो क्वालिटी के लिए डिफ़्यूज़न।

लकड़ी की मेज़ पर एक पेशेवर डिजिटल ऑडियो वर्कस्टेशन सेटअप का ऊपर से लिया गया दृश्य

एक अच्छा म्यूज़िक प्रॉम्प्ट क्या बनाता है

AI म्यूज़िक जनरेशन के लिए प्रॉम्प्ट लिखना एक कौशल है। यहाँ बताया गया है कि जो ट्रैक प्रोफ़ेशनल लगते हैं, वे किसी आम साउंड लाइब्रेरी के लूप जैसे लगने वाले ट्रैक से कैसे अलग होते हैं।

जॉनर, मूड और टेम्पो

तीन बड़ी बातों से शुरू करें। जॉनर साफ़-साफ़ बताएँ ("सिनेमैटिक ऑर्केस्ट्रल", सिर्फ़ "क्लासिकल" नहीं)। मूड को खुलकर बताएँ ("नॉस्टैल्जिक", "बेचैन", "विजयी")। टेम्पो की जानकारी दें, या तो BPM संख्या से या किसी वर्णनात्मक वाक्यांश से ("धीमी चाल", "मार्चिंग पेस", "तूफ़ानी रफ़्तार")।

💡 टिप: विशेषण रणनीति से जोड़ें। "मेलन्कोलिक इंडी फ़ोक, फ़िंगरपिक्ड एकॉस्टिक, फुसफुसाती महिला वोकल, 75 BPM, शरद ऋतु की दोपहर" मॉडल को काम करने के लिए पाँच मज़बूत बाधाएँ देता है।

इंस्ट्रूमेंट और वोकल स्टाइल

साउंड पैलेट के बारे में जितने साफ़ होंगे, उतना बेहतर। "गिटार वाला गाना" लिखने के बजाय यह कोशिश करें: "हल्के रिवर्ब के साथ परतदार एकॉस्टिक गिटार, एक साफ़ Telecaster लीड लाइन, और कोई डिस्टॉर्शन नहीं।" वोकल के लिए जेंडर, टोन (खरखरा, चमकदार, ऑपेरेटिक) और यह बताएँ कि आपको हार्मनी चाहिए या नहीं।

अपने प्रॉम्प्ट में क्या टालें

  • जीवित कलाकारों के नाम: मॉडल सीधी नकल से बचने के लिए ट्रेन किए गए हैं। इसके बजाय जो चाहिए उसकी स्टाइल की खासियतें बताएँ।
  • विरोधाभास: "तेज़ और धीमा, भारी और हल्का" मॉडल की ऑप्टिमाइज़ेशन प्रक्रिया को उलझा देता है।
  • संगीत में बदले बिना अमूर्त विचार: "अकेलेपन के बारे में एक गाना" बिना मूड, टेम्पो या जॉनर के मार्गदर्शन के बहुत कुछ संयोग पर छोड़ देता है।

धूप वाले कंज़र्वेटरी में ग्रैंड पियानो बजाती घुंघराले बालों वाली एक महिला

अभी के सबसे अच्छे AI म्यूज़िक मॉडल

यह क्षेत्र बहुत तेज़ी से बढ़ रहा है। ये वे मॉडल हैं जो अभी सबसे प्रभावशाली नतीजे दे रहे हैं।

Google Lyria 3 Pro

Google Lyria 3 Pro अभी उपलब्ध सबसे सक्षम टेक्स्ट-टू-म्यूज़िक सिस्टम में से एक है। यह सुसंगत संरचना वाले पूरे लंबाई के गाने बनाता है, जटिल जॉनर मिश्रण को अच्छी तरह संभालता है, और इतने प्राकृतिक वोकल बनाता है कि हैरान कर दे। यह एक लूप दोहराने के बजाय पूरे ट्रैक में म्यूज़िकल नैरेटिव बनाए रखने में उत्कृष्ट है।

Google Lyria 3 इसका सुलभ भाई है, जो तेज़ जनरेशन स्पीड पर अच्छी क्वालिटी देता है। ज़्यादातर क्रिएटिव इस्तेमाल के लिए यह क्वालिटी और इटरेशन की रफ़्तार के बीच सबसे अच्छा संतुलन देता है।

MiniMax Music 2.6

MiniMax Music 2.6 पॉप और कमर्शियल म्यूज़िक प्रोडक्शन में उत्कृष्ट है। यह बोलों को समझदारी से संभालता है और उन्हें मेलोडी की संरचना में स्वाभाविक रूप से बुनता है। यह मॉडल तैयार लगने वाले ट्रैक बनाता है जिनमें साफ़ वर्स-कोरस संरचना होती है, इसलिए अगर आप सोशल मीडिया, ब्रांडिंग या वीडियो स्कोरिंग के लिए कंटेंट बना रहे हैं तो यह खास तौर पर उपयोगी है।

MiniMax Music 2.5 उन उपयोगकर्ताओं के लिए एक ठोस विकल्प बना हुआ है जिन्हें वोकल वाले पूरे गाने चाहिए, लेकिन उन्हें सबसे नया वर्ज़न नहीं चाहिए।

स्टाइल ट्रांसफ़र के लिए, MiniMax Music Cover आपको कोई मौजूदा गाना लेकर उसे किसी दूसरे जॉनर में रीस्टाइल करने देता है। सोचिए आपका पसंदीदा पॉप हिट बरोक हार्पसीकॉर्ड पीस या रेगे ट्रैक के रूप में बज रहा हो। यही इस मॉडल का क्रिएटिव लचीलापन है।

ElevenLabs Music

ElevenLabs Music वॉइस सिंथेसिस में ElevenLabs की गहरी विशेषज्ञता को म्यूज़िक जनरेशन में लाता है। नतीजा AI म्यूज़िक है जिसमें वोकल की स्पष्टता और स्वाभाविकता ज़्यादातर प्रतिस्पर्धियों से आगे है। अगर वोकल परफ़ॉर्मेंस की क्वालिटी आपकी प्राथमिकता है, तो इस मॉडल पर गंभीरता से ध्यान देना चाहिए।

Stability AI Stable Audio 2.5

Stability AI का Stable Audio 2.5 खास तौर पर इंस्ट्रूमेंटल म्यूज़िक और साउंड डिज़ाइन के लिए मज़बूत है। यह बेहतरीन स्टीरियो इमेजिंग और टोनल गहराई वाला हाई-फ़िडेलिटी ऑडियो बनाता है। फ़िल्म स्कोरिंग, एम्बियंट म्यूज़िक, या ऐसी किसी भी चीज़ के लिए जिसे मिक्स में साफ़ बैठना हो, यह उपलब्ध सबसे अच्छे विकल्पों में से एक है।

MiniMax Music 01 और पुराने वर्ज़न

MiniMax Music 01 वह मॉडल था जिसने म्यूज़िक जनरेशन में MiniMax को पहचान दिलाई। आप बोल लिखते हैं, और यह उनके आसपास पूरा गाना बना देता है। MiniMax Music 1.5 ने इसमें बेहतर वोकल सुसंगति और समृद्ध इंस्ट्रूमेंटल अरेंजमेंट जोड़कर सुधार किया।

Google Lyria 2 का ज़िक्र भी करने लायक है, एक पिछले बेंचमार्क के रूप में जो छोटे जनरेशन टास्क और तेज़ प्रोटोटाइपिंग के लिए अब भी अच्छा प्रदर्शन करता है।

एक DJ के हाथ टर्नटेबल पर, पीछे नरम फ़ोकस में भीड़

PicassoIA पर AI म्यूज़िक जनरेशन का इस्तेमाल

PicassoIA इन सभी मॉडल को एक ही प्लेटफ़ॉर्म पर होस्ट करता है, यानी आप API टोकन संभाले बिना और लोकल इंस्टॉलेशन किए बिना इन्हें टेस्ट, तुलना और इटरेट कर सकते हैं।

चरण 1: सही मॉडल चुनें

लक्ष्यअनुशंसित मॉडल
वोकल और बोलों वाला पूरा गानाMiniMax Music 2.6 या Lyria 3 Pro
इंस्ट्रूमेंटल बैकग्राउंड म्यूज़िकStable Audio 2.5
सबसे अच्छी वोकल क्वालिटीElevenLabs Music
मौजूदा गाने का जॉनर रीस्टाइलMiniMax Music Cover
तेज़ इटरेशन और टेस्टिंगGoogle Lyria 3

चरण 2: इरादे के साथ अपना प्रॉम्प्ट लिखें

मॉडल का पेज खोलें। प्रॉम्प्ट फ़ील्ड में "एक अच्छा गाना" न लिखें। इसके बजाय अपनी जानकारी की परतें बनाएँ:

  1. जॉनर और सबजॉनर: "80 के दशक की प्रोडक्शन शैली वाला डार्क सिंथवेव"
  2. टेम्पो और ऊर्जा: "मध्यम टेम्पो, विरल से पूरे की ओर बढ़ता हुआ"
  3. इंस्ट्रूमेंट: "एनालॉग सिंथ बासलाइन, गेटेड रिवर्ब ड्रम, आर्पेजिएटेड लीड सिंथ"
  4. वोकल दिशा: "रिवर्ब के साथ फुसफुसाते पुरुष वोकल, अंग्रेज़ी में गाए गए, आत्मनिरीक्षण वाला टोन"
  5. भावनात्मक आर्क: "उदास शुरुआत, आखिरी तिहाई में कैथार्टिक राहत तक पहुँचता है"

चरण 3: तेज़ी से इटरेट करें

मॉडल सेकंडों से लेकर एक मिनट में जनरेट कर देते हैं। अपने पहले प्रॉम्प्ट को परफ़ेक्ट बनाने में बीस मिनट न लगाएँ। तीन या चार वैरिएशन जनरेट करें, उन्हें सुनें, पहचानें कि क्या काम कर रहा है और क्या नहीं, फिर बदलाव करें। पहले जनरेशन को अंतिम उत्पाद नहीं, ड्राफ़्ट मानें।

💡 टिप: जो एलिमेंट आपको पसंद हैं उन्हें रखें ("बासलाइन परफ़ेक्ट है") और सिर्फ़ वही बदलें जो आप बदलना चाहते हैं ("ड्रम को कम व्यस्त बनाएँ")। धीरे-धीरे परिष्कार करने से हर बार शुरू से शुरू करने की तुलना में बेहतर नतीजे मिलते हैं।

कैफ़े में चमड़े की नोटबुक में बोल लिखती एक युवा गीतकार महिला

AI म्यूज़िक क्या कर सकता है और क्या नहीं

इस तकनीक की सीमाओं के बारे में ईमानदार रहने से आप इसके बेहतर उपयोगकर्ता बनते हैं।

असली ताकतें

रफ़्तार: जिस गाने को किसी कंपोज़र को स्केच, रिकॉर्ड और प्रोड्यूस करने में आठ घंटे लगते, वह एक मिनट से कम में जनरेट हो सकता है। इससे म्यूज़िक बनाने की लागत और मेहनत का हिसाब पूरी तरह बदल जाता है, खासकर कंटेंट क्रिएटर, गेम डेवलपर और फ़िल्ममेकर के लिए जिन्हें जल्दी म्यूज़िक चाहिए।

सुलभता: संगीत के किसी सुसंगत नतीजे के लिए आपको कोई इंस्ट्रूमेंट बजाना, शीट म्यूज़िक पढ़ना या म्यूज़िक थ्योरी समझना ज़रूरी नहीं है। थ्योरी को मॉडल संभाल लेता है।

अनगिनत वैरिएशन: किसी ट्रैक के पचास वर्ज़न जनरेट करें, जिनकी ऊर्जा थोड़ी-थोड़ी अलग हो, जब तक आपको वह न मिल जाए जो आपके वीडियो सीन में पूरी तरह फ़िट बैठे। कोई मानव कंपोज़र इतनी तेज़ इटरेशन रफ़्तार नहीं दे सकता।

जॉनर ब्लेंडिंग: "अफ़्रोबीट, शास्त्रीय भारतीय रागों और ट्रैप हाई-हैट्स का मिश्रण" ऐसी चीज़ नहीं है जिसे आप आसानी से किसी सेशन म्यूज़िशियन से बनवा सकें। AI मॉडल जॉनर फ़्यूज़न को हैरान करने वाली सहजता से संभालते हैं।

असली सीमाएँ

बारीक भावनात्मक बारीकियाँ: एक अच्छा मानव गीतकार अपने काम में जीवन के अनुभव लाता है। AI ट्रेनिंग डेटा के आधार पर सांख्यिकीय रूप से संभव भावना बनाता है, जो करीब से सुनने पर कभी-कभी थोड़ी खोखली लग सकती है।

अनुमानित संरचना: मौजूदा मॉडल पारंपरिक गाने की संरचनाओं की ओर झुकते हैं। सचमुच प्रायोगिक, संरचना में अपरंपरागत संगीत उनसे निकलवाना ज़्यादा मुश्किल है।

लंबी अवधि की सुसंगति: तीन से चार मिनट से लंबे ट्रैक कभी-कभी थीमैटिक सुसंगति खो देते हैं। मॉडल शुरुआती मूड से भटक सकता है या ऐसे एलिमेंट ला सकता है जो असंबंधित लगें।

बोलों की गुणवत्ता: तेज़ी से सुधार के बावजूद, AI-जनरेटेड बोल अभी भी कभी-कभी ऐसी पंक्तियाँ बनाते हैं जो व्याकरण में ठीक हैं, पर भावनात्मक रूप से सामान्य लगती हैं। गंभीर गीतात्मक काम के लिए मानव समीक्षा और एडिटिंग अब भी मूल्यवान है।

गर्म एम्बर रोशनी वाले अंतरंग मंच पर प्रदर्शन करता चार संगीतकारों का विविध बैंड

प्रॉम्प्ट इंजीनियरिंग चीट शीट

जनरेट करना शुरू करने से पहले इस संदर्भ को बुकमार्क कर लें:

पैरामीटरकमज़ोर वर्ज़नमज़बूत वर्ज़न
जॉनर"रॉक""झंकार वाले गिटार और एंथेमिक कोरस के साथ 90 के दशक का ब्रिटपॉप"
टेम्पो"तेज़""138 BPM, ड्राइविंग फ़ोर-ऑन-द-फ़्लोर किक पैटर्न"
मूड"खुश""उत्साही मुक्ति, विजयी, उत्सव वाला पर आक्रामक नहीं"
इंस्ट्रूमेंट"गिटार के साथ""Stratocaster का साफ़ टोन, हल्का कोरस इफ़ेक्ट, फ़िंगरपिक्ड आर्पेजियो"
वोकल"गाने के साथ""गर्म बैरिटोन, बातचीत जैसी डिलीवरी, हल्का रिवर्ब, अंग्रेज़ी बोल"
दौरनिर्दिष्ट नहीं"1983 जैसा लगने के लिए बनाया गया, एनालॉग गर्माहट, कोई डिजिटल चमक नहीं"

💡 टिप: हर प्रॉम्प्ट लिखते समय इस टेबल को चेकलिस्ट की तरह इस्तेमाल करें। अगर कोई पंक्ति अब भी "कमज़ोर वर्ज़न" पर है, तो जनरेट करने से पहले उसे सुधारें।

चलते हुए मैग्नेटिक टेप का अत्यधिक क्लोज़-अप मैक्रो, जो एक विंटेज रिकॉर्डिंग टेप हेड पर चल रहा है

अपने खुद के ट्रैक बनाना शुरू करें

यहाँ जो आपने पढ़ा उसे आत्मसात करने का सबसे अच्छा तरीका है, इनमें से कोई एक मॉडल खोलकर जनरेट करना शुरू करें। अगर आपको तेज़ इटरेशन चाहिए तो Google Lyria 3 चुनें, या अगर आपका लक्ष्य वोकल वाला पूरा प्रोड्यूस्ड गाना है तो MiniMax Music 2.6 चुनें।

ऊपर बताए ढाँचे का इस्तेमाल करके अपना पहला प्रॉम्प्ट लिखें: जॉनर, टेम्पो, इंस्ट्रूमेंट, वोकल स्टाइल, भावनात्मक आर्क। उसे जनरेट करें। सुनें। एक चीज़ बदलें। फिर से जनरेट करें। दस मिनट के भीतर आपको यह बेहतर समझ आ जाएगी कि ये मॉडल भाषा पर कैसे प्रतिक्रिया देते हैं, और आप ऐसे नतीजे बना रहे होंगे जो सचमुच आपके अपने होंगे।

इस लेख में बताए गए सभी मॉडल PicassoIA के AI म्यूज़िक जनरेशन कलेक्शन में उपलब्ध हैं। प्लेटफ़ॉर्म आपको आउटपुट की साथ-साथ तुलना करने देता है, और यह हर मॉडल की खासियत को समझने का सबसे तेज़ तरीका है।

तकनीक तैयार है। सवाल सिर्फ़ इतना है कि आप इससे क्या बनाएँगे।

यह लेख शेयर करें

अपनी भाषा चुनें

संबंधित लेख