AI सॉन्ग कवर जनरेटर मुफ़्त में, अपनी आवाज़ के साथ: असल में क्या काम करता है
क्या आप बिना स्टूडियो का खर्च उठाए अपनी आवाज़ और धुन को एक तैयार ट्रैक में बदलना चाहते हैं? यह लेख मुफ़्त में आज़माया जा सकने वाला एक वर्कफ़्लो बताता है: टेक्स्ट प्रॉम्प्ट से गाने की शैली बदलें, बोलने वाली आवाज़ को क्लोन करके बोली गई परतें बनाएँ, और एक फ़ोटो को गाते हुए वीडियो में बदलें। यह भी साफ़-साफ़ बताता है कि AI आज आपकी आवाज़ के साथ क्या कर सकता है और क्या नहीं।
आधी रात को आप अपने फ़ोन में एक धुन गुनगुनाते हैं, और सुबह तक आप उसे एक चमकदार ट्रैक के रूप में सुनना चाहते हैं, ऐसी शैली में गाया हुआ जिसे आप खुद कभी रिकॉर्ड नहीं कर सकते थे। हर उस AI सॉन्ग जनरेटर के पीछे यही वादा है जो खुद को मुफ़्त और निजी बताता है। हकीकत विज्ञापनों से ज़्यादा दिलचस्प है, और थोड़ी ज़्यादा बारीक भी। कुछ टूल गाने को नई शैली में दोबारा बनाते हैं। कुछ आपकी बोलने की आवाज़ को क्लोन करते हैं। कुछ आपके चेहरे को एनिमेट करते हैं ताकि लगे कि आप हर पंक्ति गा रहे हैं। कोई एक बटन तीनों काम पूरी तरह नहीं करता, लेकिन PicassoIA पर आप इन्हें एक के बाद एक जोड़ सकते हैं और बिना स्टूडियो का खर्च उठाए काफ़ी करीबी नतीजा पा सकते हैं।
यह लेख आज क्या काम करता है, इसका ईमानदार नक्शा देता है, हर मॉडल की सटीक सेटिंग्स बताता है, और उन गलतियों के बारे में बताता है जो सबसे ज़्यादा समय बर्बाद करती हैं। इसमें बताए गए हर मॉडल का लिंक उसके पेज पर जाता है, ताकि आप पढ़ते-पढ़ते उसे खोलकर आज़मा सकें।
"अपनी आवाज़" का असल मतलब क्या है
अपनी आवाज़ का इस्तेमाल करने वाला मुफ़्त AI सॉन्ग टूल खोजेंगे तो आपको तीन बिल्कुल अलग तरह के प्रोडक्ट मिलेंगे। इन्हें आपस में मिला देना पहली कोशिश के बाद निराश होने का सबसे बड़ा कारण है, इसलिए कोई बटन दबाने से पहले इन्हें अलग-अलग समझ लेना फ़ायदेमंद है।
इस टेबल में एक चीज़ नहीं है: ऐसा कोई बटन जो किसी मशहूर गायक की आवाज़ हटाकर आपकी अपनी गायकी का टिम्बर डाल दे। इस काम के लिए अलग से वॉइस कन्वर्ज़न ऐप मौजूद हैं, और उनमें कहीं ज़्यादा सेटअप माँगा जाता है। इस लेख के मॉडल एक अलग रास्ता अपनाते हैं, जो पूरी तरह ब्राउज़र में चलता है और फिर भी आपको तैयार गाना, वॉइस लेयर और वीडियो देता है।
आपकी आवाज़ कहाँ-कहाँ जुड़ती है
आपकी आवाज़ प्रक्रिया में तीन जगहों पर आती है:
आपकी धुन। फ़ोन में कोई धुन गुनगुनाएँ या गाएँ। रीस्टाइल मॉडल मेलोडी की लाइन बनाए रखता है और उसके चारों ओर सब कुछ दोबारा बनाता है।
आपकी बोलने वाली आवाज़। 10 सेकंड से 5 मिनट लंबा नमूना क्लोन करें, फिर उसे स्पोकन इंट्रो, एड-लिब्स या टॉक-थ्रू वर्स के लिए इस्तेमाल करें।
आपका चेहरा। एक फ़ोटो और तैयार ऑडियो मिलाकर ऐसा वीडियो बनता है जिसमें आप गाते हुए दिखते हैं।
💡 शुरू में ही उम्मीदें तय करें: रीस्टाइल मॉडल गायक की आवाज़ बदल देता है। अगर आपको अंतिम गायकी अपनी गायकी के टिम्बर से हर नोट पर मिलानी है, तो वह हिस्सा खुद रिकॉर्ड करें और AI को अरेंजमेंट, बोलने वाली लेयर और वीडियो का काम करने दें।
मुफ़्त में असल में क्या मिलता है
"मुफ़्त" शब्द के पीछे बारीक अक्षरों में लिखी शर्तें छिपी होती हैं। नीचे दिए गए कई मॉडलों के PicassoIA पेज पर उन्हें मुफ़्त में आज़माने लायक बताया गया है, यानी आप पहली जनरेशन चलाकर नतीजा सुन सकते हैं और फिर तय कर सकते हैं कि आगे बढ़ना है या नहीं। मुफ़्त में आज़माना हमेशा के लिए असीमित होने जैसा नहीं है, इसलिए पूरा एल्बम बनाने की योजना बनाने से पहले साइट पर प्लान का विवरण ज़रूर जाँच लें।
मुफ़्त में आज़माना बनाम हमेशा के लिए मुफ़्त
मुफ़्त में आज़माना: किसी मॉडल को एक या दो बार चलाएँ और अपने हेडफ़ोन पर आउटपुट परखें।
क्रेडिट और प्लान: लंबे सेशन और बार-बार की रन आपके प्लान पर निर्भर हो सकते हैं।
मुफ़्त इनपुट: शून्य-लागत वाले वर्कफ़्लो के लिए शून्य-लागत वाली सोर्स सामग्री भी चाहिए। अपने लिखे गाने, पब्लिक डोमेन की धुनें, या ऐसे ट्रैक इस्तेमाल करें जिनका लाइसेंस आपके पास हो।
वे पाँच मॉडल जो आप इस्तेमाल करेंगे
MiniMax Music रीस्टाइल मॉडल: किसी गाने को नई शैली में दोबारा बनाता है। उसके पेज पर दिए उदाहरण रनों में 52 से 85 सेकंड लगे।
Music 2.6: स्टाइल प्रॉम्प्ट और वैकल्पिक बोल से एक पूरा मौलिक गाना लिखता है।
Voice Cloning: छोटे नमूने से दोबारा इस्तेमाल होने वाली आवाज़ बनाता है।
Qwen3 TTS: पहले से तय आवाज़ें, क्लोन की गई आवाज़ें, या सादे शब्दों में बताई गई आवाज़ें, 10 भाषाओं में।
Omni Human 1.5: एक फ़ोटो और एक छोटी ऑडियो क्लिप से लिप-सिंक्ड वीडियो बनाता है।
पहले कौन सा? अगर आपके पास पहले से धुन है, तो रीस्टाइल मॉडल से शुरू करें। अगर आपके पास सिर्फ़ शब्द हैं, तो Music 2.6 से शुरू करें। यह [Intro], [Verse], [Chorus], [Bridge] और [Outro] जैसे स्ट्रक्चर टैग वाले बोल स्वीकार करता है, और बोलों वाला फ़ील्ड खाली हो तो स्टाइल प्रॉम्प्ट से आपके लिए बोल भी लिख सकता है। इसमें एक इंस्ट्रुमेंटल स्विच भी है, जो आपकी क्लोन की गई आवाज़ के नीचे साफ़ बैकिंग ट्रैक के लिए काम का है।
अपना सोर्स ट्रैक तैयार करें
ख़राब इनपुट से ख़राब आउटपुट मिलता है, और ऑडियो इस मामले में लगभग किसी भी दूसरे माध्यम से ज़्यादा सख़्त है। दस मिनट की तैयारी आपके दस दोबारा जनरेशन बचा सकती है।
ऐसा गाना चुनें जिसे आप इस्तेमाल कर सकें
रीस्टाइल मॉडल को एक सोर्स गाना चाहिए। सुरक्षित विकल्प ये हैं:
आपका अपना मौलिक गाना, भले ही वह फ़ोन पर बनाया गया कच्चा डेमो हो।
पब्लिक डोमेन की धुन, जैसे कोई पारंपरिक लोकगीत या पुराना भजन।
ऐसा ट्रैक जिसे अपनाने का आपके पास लाइसेंस है।
अगर आप नतीजा सार्वजनिक रूप से पोस्ट करने की योजना बना रहे हैं, तो जिस पर आपका अधिकार साफ़ न हो उसे छोड़ दें। इस पर नीचे अधिकारों वाले हिस्से में और बात होगी। प्रॉम्प्ट टेस्ट करते समय छोटे अंश पर काम करें, और जब स्टाइल सही लगने लगे तब पूरा गाना एक बार चलाएँ।
साफ़ वोकल टेक रिकॉर्ड करें
अगर आपकी अपनी गायकी मेलोडी का संदर्भ है, तो उसे बिना गूँज वाली आवाज़ में रिकॉर्ड करें:
टँगे हुए कोटों से भरी अलमारी के अंदर गाएँ। कपड़े ज़्यादातर बेडरूम से बेहतर गूँज सोखते हैं।
फ़ोन या माइक्रोफ़ोन को मुँह से लगभग एक हाथ की दूरी पर रखें।
पंखे, बैकग्राउंड म्यूज़िक और नोटिफ़िकेशन बंद कर दें।
मेलोडी साफ़ और स्थिर लय में गाएँ। यही एक चीज़ है जिसे मॉडल बनाए रखता है, इसलिए इसे असरदार बनाएँ।
फिर MP3 या WAV एक्सपोर्ट करें। रीस्टाइल मॉडल आपका ट्रैक एक लिंक से पढ़ता है, और वह लिंक सार्वजनिक रूप से एक्सेस योग्य होना चाहिए। फ़ाइल ऐसी जगह अपलोड करें जिसे लिंक वाला कोई भी व्यक्ति खोल सके, और उसे चिपकाने से पहले प्राइवेट ब्राउज़र विंडो में लिंक टेस्ट कर लें।
💡 त्वरित जाँच: अगर लिंक साइन-इन माँगता है, तो मॉडल उसे भी नहीं पढ़ पाएगा।
यहाँ MiniMax Music रीस्टाइल मॉडल का सटीक फ़्लो है, जो इस वर्कफ़्लो का सबसे ज़्यादा मेहनत वाला काम करता है। उसका पेज सीधे बताता है: ट्रैक अपलोड करें, जो स्टाइल चाहिए उसका वर्णन करें, और एक ऐसा गाना वापस पाएँ जिसकी आवाज़, वाद्य और शैली अलग हो, जबकि मूल मेलोडी बनी रहे।
चरण-दर-चरण सेटिंग्स
PicassoIA पर मॉडल पेज खोलें।
अपना सार्वजनिक MP3 या WAV लिंक ऑडियो URL फ़ील्ड में चिपकाएँ।
प्रॉम्प्ट फ़ील्ड में लक्ष्य शैली लिखें। यह 2,000 अक्षरों तक स्वीकार करता है।
मूल बोल रखने के लिए बोलों वाला फ़ील्ड खाली छोड़ें, या अपने बोल चिपकाएँ, 3,000 अक्षरों तक।
आउटपुट फ़ॉर्मेट चुनें: शेयर करने के लिए MP3, और ऑडियो को आगे एडिट करने की योजना हो तो WAV।
सबसे अच्छी फ़िडेलिटी के लिए डिफ़ॉल्ट रखें, और बिटरेट तभी घटाएँ जब फ़ाइल का साइज़ मायने रखता हो।
चलाएँ, हेडफ़ोन पर सुनें, फिर प्रॉम्प्ट में एक चीज़ बदलकर दोबारा चलाएँ।
सेटिंग
विकल्प
डिफ़ॉल्ट
कब बदलें
आउटपुट फ़ॉर्मेट
MP3, WAV, PCM
MP3
जब आप ऑडियो को किसी दूसरे ऐप में एडिट करना चाहें
सैंपल रेट
16, 24, 32, या 44.1 kHz
44.1 kHz
जब आपको छोटी ड्राफ़्ट फ़ाइल चाहिए
बिटरेट
32, 64, 128, या 256 kbps
256 kbps
जब आप जल्दी का प्रीव्यू शेयर कर रहे हों
प्रॉम्प्ट
2,000 अक्षरों तक
ज़रूरी
हर रन में, शैली तय करने के लिए
बोल
3,000 अक्षरों तक
खाली
जब आप मूल बोलों की जगह नए शब्द चाहें
काम करने वाले प्रॉम्प्ट
ये पाँच प्रॉम्प्ट सीधे मॉडल पेज के उदाहरण रनों से लिए गए हैं। हर एक में एक शैली, एक मुख्य वाद्य या ध्वनि, और एक वोकल प्रकार का नाम है।
लक्ष्य
प्रॉम्प्ट
आरामदेह रीमेक
Lo-fi hip hop version, vinyl crackle, chill beat, warm midrange, dreamy reverb
डांस रीमिक्स
EDM remix, 128 BPM, heavy synth bass, atmospheric pads, driving four-on-the-floor beat, euphoric drop
Hard rock, distorted electric guitar riffs, powerful drums, raw male vocal, arena energy
देर रात का क्लब
Jazz arrangement, saxophone lead, smooth female vocal, mellow piano chords, late night club
एक भरोसेमंद फ़ॉर्मूला है शैली + टेम्पो या मूड + मुख्य वाद्य + वोकल प्रकार + एक दृश्य-शब्द। हर रन में एक ही शैली रखें, क्योंकि एक प्रॉम्प्ट में चार शैलियाँ मिलाने से नतीजा कीचड़ जैसा हो जाता है। गायक को दिशा देने के लिए आवाज़ का वर्णन उसी प्रॉम्प्ट में साथ ही करें: warm female vocal, raw male vocal, smooth female vocal, या soft intimate vocal।
अपने बोल जोड़ें
बोलों वाला फ़ील्ड खाली हो तो गायक आपके सोर्स गाने से निकाले गए शब्द गाता है। अपने बोल गवाने के लिए उन्हें [verse], [chorus] और [bridge] जैसे सेक्शन टैग के साथ चिपकाएँ:
[verse]
Morning light on the kitchen floor
I hum the tune I hummed before
[chorus]
This is my song, this is my sound
💡 लय मिलाएँ: हर नई पंक्ति को मूल पंक्ति के शब्दांशों की संख्या के करीब रखें। लंबी पंक्ति दबा दी जाती है, और शब्द हड़बड़ी में निकलते हैं।
अपनी असली आवाज़ मिक्स में लाएँ
रीस्टाइल मॉडल नई आवाज़ में गाता है। आपकी असली आवाज़ स्पीच मॉडल के ज़रिए ट्रैक में आती है, और यहीं क्लोनिंग काम आती है।
फ़ॉर्मेट और लंबाई: MP3, M4A, या WAV, 10 सेकंड से 5 मिनट तक, 20 MB से कम।
नॉइज़ रिडक्शन: अगर रिकॉर्डिंग में बैकग्राउंड की सरसराहट है, तो इसे चालू करें।
वॉल्यूम नॉर्मलाइज़ेशन: अगर आपकी लेवल बार-बार ऊपर-नीचे होती है, तो इसे चालू करें।
स्पीच टियर: डिफ़ॉल्ट Speech 2.6 HD है, और टर्बो तथा पुराने HD विकल्प भी उपलब्ध हैं।
आपको एक दोबारा इस्तेमाल होने वाली आवाज़ मिलती है, जिसे आप जितने चाहें उतने स्पीच रन पर लगा सकते हैं। एक इंट्रो लाइन, बोला हुआ ब्रिज, या टॉक-थ्रू वर्स लिखें और उसे अपनी क्लोन की गई आवाज़ में जनरेट करें।
💡 यहाँ की क्लोन की गई आवाज़ें टेक्स्ट-टू-स्पीच मॉडल से आती हैं, इसलिए इन्हें बोले जाने वाले शब्दों की एक परत समझें, गाए गए वोकल का विकल्प नहीं।
एक कदम में अपनी आवाज़ क्लोन करें
Qwen3 TTS एक-कदम वाला विकल्प देता है। वॉइस क्लोन मोड चुनें, एक छोटी संदर्भ क्लिप अपलोड करें, और उस क्लिप का ट्रांसक्रिप्ट रेफ़रेंस टेक्स्ट फ़ील्ड में लिखें, जैसा मॉडल पेज सुझाता है। डिलीवरी दिशा देने के लिए speak slowly and calmly या excited tone जैसा स्टाइल निर्देश जोड़ें। मॉडल पेज का अपना क्लोन उदाहरण लगभग 14 सेकंड में पूरा हुआ। भावना-नियंत्रण वाला एक और क्लोन कर सकने वाला विकल्प आज़माना हो तो Chatterbox देखें।
रीस्टाइल्ड ट्रैक पर लेयर करें
रीस्टाइल्ड गाना और अपनी क्लोन की गई वॉइस लाइनें डाउनलोड करें, फिर उन्हें किसी भी मुफ़्त ऑडियो एडिटर में मिलाएँ:
गाने को एक ट्रैक पर और अपनी वॉइस लाइनों को दूसरे ट्रैक पर रखें।
बोले जाने वाले हिस्सों के नीचे संगीत को कुछ डेसिबल धीमा करें।
आवाज़ में थोड़ा रिवर्ब जोड़ें, ताकि वह बैंड वाले उसी कमरे में लगे।
सेक्शन के बीच फ़ेड करें और एक अंतिम MP3 एक्सपोर्ट करें।
तीन मिनट के गाने के लिए यह एक सरल अरेंजमेंट काम करता है:
पल
संगीत
आवाज़
पहले 8 सेकंड
शांत इंस्ट्रुमेंटल, Music 2.6 से या रीस्टाइल्ड ट्रैक से
आपकी क्लोन की गई आवाज़ एक टाइटल लाइन बोलती है
वर्स
पूरे वॉल्यूम पर रीस्टाइल्ड ट्रैक
रीस्टाइल्ड गायक
कोरस
पूरे वॉल्यूम पर रीस्टाइल्ड ट्रैक
रीस्टाइल्ड गायक, साथ में आपका एक क्लोन्ड एड-लिब
ब्रिज
संगीत कुछ डेसिबल नीचे गिरता है
आपकी क्लोन की गई आवाज़ एक लाइन बोलती है
आउट्रो
लगभग 4 सेकंड में फ़ेड
खामोशी या एक छोटा बोला गया समापन
एक फ़ोटो से गाता हुआ वीडियो बनाएँ
जिस ट्रैक पर चेहरा हो, वह सोशल प्लेटफ़ॉर्म पर सादी ऑडियो फ़ाइल से ज़्यादा दूर तक जाता है, और उसे बनाने के लिए आपको सिर्फ़ एक तस्वीर चाहिए।
फ़ोटो और ऑडियो से वीडियो बनता है
Omni Human 1.5 एक फ़ोटो और 35 सेकंड से छोटी ऑडियो क्लिप लेता है, और लिप-सिंक्ड वीडियो लौटाता है। मॉडल पेज का अपना उदाहरण प्रॉम्प्ट, A woman sings and strums her guitar, गाने वाले उपयोग को दिखाता है।
एक समान रोशनी और सादी पृष्ठभूमि वाला सामने से लिया गया पोर्ट्रेट इस्तेमाल करें।
अपना गाना कोरस या हुक तक काटें। 35 सेकंड से लंबा ऑडियो जनरेशन को फ़ेल कर देता है।
टेस्ट करते समय फ़ास्ट मोड चालू करें। पेज के उदाहरण रनों में लगभग 3 से 6 मिनट लगे।
अगर हाव-भाव या कैमरा मूवमेंट को दिशा देनी हो, तो एक छोटा प्रॉम्प्ट जोड़ें।
मौजूदा वीडियो को सिंक करें
अगर आपके पास खुद का कोई क्लिप पहले से है, तो Lipsync 2 Pro नए ऑडियो से मेल खाने के लिए होंठों की हरकत दोबारा बनाता है। इसमें पाँच सिंक मोड हैं (loop, bounce, cut off, silence और remap), साथ में 0 से 1 तक का expressiveness नियंत्रण, और यह MP4 वीडियो व WAV ऑडियो लेता है। Kling Lip Sync किसी भी वीडियो में मुँह को ऑडियो से मिलाने का एक और विकल्प है।
प्रकाशित करने से पहले
अधिकारों से जुड़े सवाल किसी भी प्रॉम्प्ट से ज़्यादा मायने रखते हैं। यह सामान्य जानकारी है, कानूनी सलाह नहीं।
रीस्टाइल से गाना आपका नहीं हो जाता। किसी कॉपीराइट वाले गाने का दोबारा बना हुआ वर्ज़न पोस्ट करने के लिए आम तौर पर मूल कंपोज़िशन के अधिकार धारकों की अनुमति चाहिए।
पब्लिक डोमेन मदद करता है, पर एक शर्त के साथ। कोई पुरानी कंपोज़िशन इस्तेमाल के लिए मुफ़्त हो सकती है, लेकिन उसकी कोई खास रिकॉर्डिंग अब भी संरक्षित हो सकती है।
सिर्फ़ वही आवाज़ क्लोन करें जो आपकी अपनी हो या जिसके इस्तेमाल की आपके पास लिखित अनुमति हो।
AI की मदद से बने ट्रैक पर लेबल लगाएँ जहाँ भी कोई प्लेटफ़ॉर्म इसे माँगे।
छह गलतियाँ किसी भी और चीज़ से ज़्यादा घंटे बर्बाद करती हैं:
प्राइवेट सोर्स लिंक। मॉडल उसे खोल नहीं सकता, और रन फ़ेल हो जाता है।
शोर वाला क्लोनिंग नमूना। नॉइज़ रिडक्शन चालू करें या अलमारी में दोबारा रिकॉर्ड करें।
एक प्रॉम्प्ट में पाँच शैलियाँ। एक शैली और एक मूड चुनें।
एक साथ पाँच सेटिंग्स बदलना। आपको पता नहीं चलेगा कि कौन सा बदलाव काम आया।
रीस्टाइल से अपनी गायकी के टिम्बर की उम्मीद। इसकी जगह वॉइस लेयर की योजना बनाएँ।
पूरा गाना वीडियो मॉडल को भेजना। पहले उसे 35 सेकंड से कम तक काटें।
आज ही अपना पहला ट्रैक बनाएँ
अब आपकी बारी है। एक ऐसी धुन चुनें जो आपको पसंद हो, उसके 30 सेकंड अपने फ़ोन में गुनगुनाएँ, और एक साफ़ प्रॉम्प्ट के साथ उसे MiniMax Music रीस्टाइल मॉडल से चलाएँ। पहले लो-फ़ाई प्रॉम्प्ट आज़माएँ, फिर जैज़ वाला, और देखें कि एक ही धुन कैसे अलग मूड में बदल जाती है। अगर आप इसके बजाय बिल्कुल नया गाना चाहते हैं, तो अपने बोल Music 2.6 को दें और अरेंजमेंट बनाने दें।
एक असली पहला सेशन कुछ ऐसा दिखता है:
10 मिनट: अपने अलमारी वाले बूथ में धुन रिकॉर्ड करें।
10 मिनट: दो या तीन रीस्टाइल रन, हर बार एक चीज़ बदलते हुए।
10 मिनट: अपनी आवाज़ क्लोन करें और दो बोली जाने वाली लाइनें जनरेट करें।
संगीत और वॉइस मॉडल मुफ़्त में आज़माने लायक हैं, इसलिए प्रयोग की असली लागत बस कुछ मिनट की जिज्ञासा है। आप PicassoIA के इमेज मॉडल से एल्बम आर्टवर्क भी बना सकते हैं, ताकि पूरा रिलीज़ (गाना, आवाज़, वीडियो और आर्टवर्क) एक ही जगह रहे। सब कुछ picassoia.com/en/all-models पर देखें और कुछ ऐसा बनाएँ जो आपकी अपनी आवाज़ जैसा लगे।