आपके दिमाग में कोई गाना अटका है, पर आपको उसका सिर्फ़ आधा हिस्सा चाहिए: गायक, या बैंड। कुछ साल पहले इसके लिए स्टूडियो सेशन और काफ़ी किस्मत चाहिए थी। आज एक फ़्री AI वोकल रिमूवर ऑनलाइन कॉफ़ी बनाने जितने समय में ट्रैक को अलग कर सकता है, और नतीजा अक्सर इतना साफ़ होता है कि उस पर गाया जा सके, रीमिक्स किया जा सके या नोट-दर-नोट पढ़ा जा सके।
यह लेख बताता है कि तकनीक असल में कैसे काम करती है, फ़्री टूल आपको क्या देते हैं और क्या नहीं, किसी ज़िद्दी गाने से ठीक-ठाक स्प्लिट कैसे लें, और बाद में फ़ाइलों से क्या करें। शुरू में ही एक साफ़ बात: PicassoIA का अपना कोई स्टेम स्प्लिटर नहीं है। अलगाव का काम आप किसी भी फ़्री सेपरेटर से करते हैं, फिर स्टेम्स यहाँ लाकर लिरिक्स, लिरिक वीडियो और बिल्कुल नए म्यूज़िक के लिए इस्तेमाल करते हैं। स्प्लिट पहला कदम है, आख़िरी पड़ाव नहीं।

💡 त्वरित जवाब: किसी AI स्टेम सेपरेटर पर WAV (या हाई-बिटरेट MP3) अपलोड करें, वोकल्स और इंस्ट्रुमेंटल विकल्प चुनें, दोनों फ़ाइलें डाउनलोड करें और इस्तेमाल से पहले हेडफ़ोन पर सुन लें। नीचे की सारी बातें उन गानों पर इसे काम करवाने के बारे में हैं जो आसानी से नहीं मानते।
वोकल रिमूवर असल में क्या करता है
पुरानी फ़ेज़ ट्रिक बनाम AI सेपरेशन
न्यूरल नेटवर्क से पहले का आम तरीका फ़ेज़ कैंसिलेशन था। लीड वोकल आम तौर पर बिल्कुल बीच में मिक्स किए जाते हैं, इसलिए लेफ़्ट और राइट चैनल में लगभग एक जैसी गायकी होती है। एक चैनल को उल्टा करें, दोनों को जोड़ें, और जो भी दोनों चैनलों में एक जैसा है वह कैंसिल हो जाता है। सिद्धांत में आवाज़ गायब हो जाती है।
व्यवहार में किक ड्रम, बास और अक्सर स्नेयर भी बीच में ही होते हैं, इसलिए वे आवाज़ के साथ गायब हो जाते हैं। जो बचता है वह पतला, खोखला और बचे हुए रीवर्ब में डूबा हुआ लगता है, क्योंकि रीवर्ब चौड़ा होता है और कैंसिल नहीं होता।

AI सेपरेशन अलग तरीके से काम करता है। न्यूरल नेटवर्क को बड़ी संख्या में ऐसी रिकॉर्डिंग पर ट्रेन किया जाता है जिनमें हर हिस्सा पहले से पता होता है, इसलिए वह स्पेक्ट्रोग्राम के अंदर इंसानी आवाज़ की पहचान सीख लेता है: एक पर एक जमे हार्मोनिक्स, साँस वाले व्यंजन, वाइब्रेटो की लहर। एक तैयार स्टीरियो मिक्स मिलने पर वह अनुमान लगाता है कि ध्वनि का कौन-सा हिस्सा आवाज़ का है, और उस सिग्नल को अपनी अलग फ़ाइल के रूप में दोबारा बनाता है। बाकी सब दूसरी फ़ाइल में जाता है। कुछ भी आँख मूँदकर घटाया नहीं जाता, इसीलिए बास और किक बचे रहते हैं।
Demucs (Meta की रिसर्च टीम से) और Spleeter (Deezer से) जैसे ओपन-सोर्स मॉडल सबसे प्रसिद्ध उदाहरण हैं, और कई फ़्री वेब टूल इसी परिवार के विचारों पर बने हैं।
सरल भाषा में स्टेम
स्टेम संबंधित आवाज़ों का एक समूह है जिसे एक ऑडियो फ़ाइल में बाउंस किया जाता है: सारे वोकल्स, सारे ड्रम, सारा बास। ज़्यादातर टूल आपको चुनने देते हैं कि कितने स्टेम में बाँटना है।
| स्प्लिट का प्रकार | आपको मिलने वाली फ़ाइलें | सबसे अच्छा किसके लिए |
|---|
| 2 स्टेम | वोकल्स, इंस्ट्रुमेंटल | कराओके ट्रैक, acapellas, त्वरित एडिट |
| 4 स्टेम | वोकल्स, ड्रम, बास, अन्य | रीमिक्स, ड्रम या बास का अभ्यास |
| 5 से 6 स्टेम | पियानो और/या गिटार जोड़ता है | किसी एक वाद्य को अलग करके सीखना |
सटीक विकल्प टूल पर निर्भर करते हैं। दो स्टेम सबसे तेज़ होता है और आमतौर पर सबसे साफ़ भी, क्योंकि मॉडल का काम सबसे सरल होता है: आवाज़ है या नहीं। हर अतिरिक्त स्टेम एक और मौका देता है कि कोई आवाज़ गलत डिब्बे में चली जाए।

इसे सोचने का एक उपयोगी तरीका: वोकल स्टेम वही है जो उस बूथ के माइक्रोफ़ोन ने सुना होता, और इंस्ट्रुमेंटल वह सब है जो बाकी बैंड ने बजाया। मॉडल उस मूल रिकॉर्डिंग सेशन का अंदाज़ा लगा रहा है, तैयार मिक्स से पीछे की ओर काम करते हुए।
फ़्री टूल सोच-समझकर चुनें
फ़्री टियर आम तौर पर क्या सीमित करते हैं
"फ़्री" हर साइट पर अलग मतलब रखता है। कुछ भी अपलोड करने से पहले इन आम सीमाओं की जाँच करें:
- ट्रैक की लंबाई: कई फ़्री प्लान हर अपलोड को कुछ मिनटों तक सीमित करते हैं।
- रोज़ के अपलोड: हर दिन गानों की तय संख्या, फिर इंतज़ार की लाइन या पेवॉल।
- एक्सपोर्ट क्वालिटी: सिर्फ़ प्रीव्यू या केवल MP3 डाउनलोड, WAV पेड यूज़र्स के लिए आरक्षित।
- स्टेम की संख्या: फ़्री में दो स्टेम, चार या उससे ज़्यादा सब्सक्रिप्शन के पीछे।
- फ़ाइल स्टोरेज: आपका अपलोड कुछ समय तक किसी और के सर्वर पर रहता है। अगर गाना अभी रिलीज़ नहीं हुआ है, तो पहले प्राइवेसी शर्तें पढ़ें।
ब्राउज़र, डेस्कटॉप या बिल्ट-इन?
| तरीका | लागत | क्वालिटी | गति | मुख्य कमी |
|---|
| फ़ेज़ कैंसिलेशन | फ़्री | कम | तुरंत | बास और किक हटाता है, रीवर्ब रखता है |
| ब्राउज़र AI टूल | फ़्री टियर | अच्छी से बहुत अच्छी | कुछ मिनट | अपलोड सीमा, कतारें, एक्सपोर्ट सीमाएँ |
| आपके PC पर ओपन-सोर्स मॉडल | फ़्री | बहुत अच्छी | आपके हार्डवेयर पर निर्भर | सेटअप चाहिए, GPU से मदद मिलती है |
| DAW के अंदर स्टेम स्प्लिटर | सॉफ़्टवेयर में शामिल | अच्छी | तेज़ | एक ही प्रोग्राम से बंधा |
एक बार के काम के लिए ब्राउज़र टूल सही विकल्प है। अगर आप बार-बार स्प्लिट करते हैं, या अनरिलीज़्ड सामग्री के साथ काम करते हैं, तो अपनी मशीन पर ओपन-सोर्स मॉडल चलाने से फ़ाइलें दूसरों के सर्वर से दूर रहती हैं और रोज़ की सीमाएँ भी हट जाती हैं। कई बड़े म्यूज़िक-प्रोडक्शन ऐप्स अब अपना स्टेम स्प्लिटर भी देते हैं, इसलिए कुछ नया इंस्टॉल करने से पहले उसे देख लेना फ़ायदेमंद है।
💡 अपलोड से पहले: अपनी सबसे अच्छी क्वालिटी की फ़ाइल इस्तेमाल करें, गाने को पूरी लंबाई में रखें, और जो सेटिंग्स चुनी हैं उन्हें लिख लें। बाद में दो रन की तुलना तब बहुत आसान होती है जब पता हो कि क्या बदला।
एक गाने को कदम-दर-कदम स्प्लिट करें
सोर्स फ़ाइल तैयार करें
जैसा इनपुट, वैसा आउटपुट। लॉसलेस WAV या FLAC मॉडल को काम करने के लिए सबसे ज़्यादा जानकारी देती है। 256 kbps या उससे ऊपर का MP3 भी ठीक है। सबसे खराब सोर्स वह फ़ाइल है जो किसी स्ट्रीमिंग वीडियो से निकाली गई हो या स्पीकर से रिकॉर्ड की गई हो, क्योंकि कम्प्रेशन उन बारीकियों को पहले ही धुंधला कर चुका होता है जिनसे मॉडल आवाज़ और गिटार में फ़र्क करता है।
गाने को ट्रिम न करें। मॉडल पूरे ट्रैक को संदर्भ के रूप में इस्तेमाल करते हैं, और इंट्रो या आउट्रो काटने से शायद ही कोई खास समय बचता है। पहले से कोई लाउडनेस ट्रिक भी न आज़माएँ: जिस गाने को अतिरिक्त लिमिटिंग से दबाया गया हो, उसमें वोकल और वाद्यों के बीच कम जगह बचती है।
सेपरेशन चलाएँ

हर सर्विस पर प्रक्रिया लगभग एक जैसी है:
- अपनी फ़ाइल अपलोड करें, या अगर टूल सपोर्ट करता है तो लिंक पेस्ट करें।
- स्टेम की संख्या चुनें। कराओके के लिए दो स्टेम, रीमिक्सिंग के लिए चार।
- अगर टूल विकल्प देता है तो सबसे अच्छा मॉडल चुनें। धीमे "हाई क्वालिटी" मोड आम तौर पर साफ़ तौर पर बेहतर सुनाई देते हैं।
- जॉब शुरू करें और इंतज़ार करें। ज़्यादातर गाने कुछ मिनटों में पूरे हो जाते हैं।
- विकल्प हो तो WAV में डाउनलोड करें, ताकि स्टेम्स दोबारा कम्प्रेस न हों।
कान से नतीजा जाँचें
हेडफ़ोन लगाएँ और हर स्टेम को अलग-अलग सुनें। एक वर्स और एक कोरस सुनें, क्योंकि कोरस ज़्यादा घने होते हैं और समस्याएँ पहले दिखाते हैं। तीन चीज़ें जाँचें: इंस्ट्रुमेंटल में हल्की वोकल "घोस्ट", सिम्बल्स पर सरसराती या पानी जैसी बनावट, और वोकल स्टेम में कटे हुए शब्दों के अंत।
ज़्यादा सख्त जाँच के लिए, मूल ट्रैक और इंस्ट्रुमेंटल को किसी भी ऑडियो एडिटर में लोड करें, इंस्ट्रुमेंटल का पोलैरिटी उल्टा करें और दोनों को एक साथ चलाएँ। जो आप सुनेंगे वह लगभग वोकल है, साथ में वह जो मॉडल से गलत निकल गया। अगर ड्रम या कॉर्ड्स झलकते हैं, तो मॉडल ने उन्हें गलती से इंस्ट्रुमेंटल से निकाल दिया था।
💡 टिप: स्टेम को उसी वॉल्यूम पर परखें जिस पर आप उन्हें असल में इस्तेमाल करेंगे। पार्टी वॉल्यूम पर गायब हो जाने वाली घोस्ट वोकल, हेडफ़ोन पर शांत कमरे में साफ़ सुनाई दे सकती है।
कुछ गाने ठीक से क्यों नहीं बँटते
रीवर्ब, हार्मोनी और मोनो मिक्स

कुछ गाने विरोध करते हैं, और इसकी वजह शायद ही कभी टूल होता है। आम कारण ये हैं:
- भारी रीवर्ब। आवाज़ की गूँज स्टीरियो फ़ील्ड में फैल जाती है और अक्सर इंस्ट्रुमेंटल में हल्के, भुतहा कोरस की तरह बची रहती है।
- जमी हुई हार्मोनी। बैकिंग वोकल्स इंस्ट्रुमेंटल में जा सकते हैं जबकि लीड वोकल फ़ाइल में जा सकता है, या इसका उल्टा।
- विकृत वोकल्स। चीखती या बहुत अधिक सैचुरेटेड गायकी गिटारों के साथ काफ़ी फ़्रीक्वेंसी स्पेस बाँटती है।
- पुरानी मोनो रिकॉर्डिंग। फ़ेज़ ट्रिक्स को स्टीरियो इमेज चाहिए, इसलिए वे मोनो टेप पर पूरी तरह विफल हो जाते हैं। AI मॉडल फिर भी काम करते हैं, लेकिन सोर्स में अक्सर हिस और सीमित बैंडविड्थ होती है, जो ऊपरी सीमा घटा देती है।
- सैंपल्ड वोकल चॉप्स। किसी वाद्य की तरह इस्तेमाल किए गए चॉप्ड वोकल को किसी एक श्रेणी में डालना मुश्किल होता है।
आर्टिफ़ैक्ट ठीक करना
पहले नतीजे को ही अंतिम मानने की ज़रूरत नहीं है। लक्षण को समाधान से मिलाएँ:
| आपको क्या सुनाई देता है | संभावित कारण | क्या आज़माएँ |
|---|
| इंस्ट्रुमेंटल में हल्की गायकी | रीवर्ब की गूँज या बैकिंग वोकल्स | इंस्ट्रुमेंटल को सेपरेटर से दूसरी बार चलाएँ |
| पानी जैसे, घूमते सिम्बल्स | मॉडल तेज़ हाई-फ़्रीक्वेंसी डिटेल में अटक रहा है | बेहतर क्वालिटी का मॉडल या कोई दूसरा टूल चुनें |
| वोकल पतला या रोबोटिक लगता है | कम बिटरेट वाली सोर्स फ़ाइल | WAV, FLAC या 256 kbps MP3 से दोबारा शुरू करें |
| वोकल में ड्रम का रिसाव | स्नेयर या हाई-हैट की फ़्रीक्वेंसी वोकल से मिलती है | चार-स्टेम स्प्लिट इस्तेमाल करें, फिर ड्रम स्टेम हटा दें |
| शब्दों के अंत कटे हुए | मॉडल फ़ेड-आउट को नॉइज़ समझ रहा है | कोई दूसरा मॉडल आज़माएँ, या मूल मिक्स का थोड़ा हिस्सा मिलाएँ |
दो और उपाय आपके ऑडियो एडिटर में मिलते हैं। इंस्ट्रुमेंटल पर गेट या हाथ से वॉल्यूम डिप लगाने से वाक्यांशों के बीच घोस्ट वोकल हटते हैं, जब कुछ और बज नहीं रहा होता जो उन्हें छिपा सके। मिड-रेंज के ऊपरी हिस्से में, लगभग उस जगह जहाँ आवाज़ बैठती है, हल्का EQ कट बचे हुए हिस्से को दबा सकता है, बिना संगीत बिगाड़े।
पार्टी के लिए कोई हल्का घोस्ट नहीं सुनता। रिलीज़ के लिए कमज़ोर हिस्से को हाथ से दोबारा बनाएँ या पूरा ट्रैक बदल दें, जिस पर आगे फिर बात होगी।
अलग किए गए वोकल्स के असली उपयोग
ट्रैक खोजे बिना कराओके

ज़्यादातर गानों के आधिकारिक कराओके वर्ज़न मौजूद नहीं हैं, खासकर नए या कम सुने गए गानों के। दो-स्टेम स्प्लिट मिनटों में आपको इंस्ट्रुमेंटल दे देता है। उसे किसी भी प्लेयर में लोड करें, बोल दूसरी स्क्रीन पर रखें, और आपकी अपनी निजी कराओके नाइट तैयार है।
अगर गाने की रेंज आपके लिए बहुत ऊँची या बहुत नीची है, तो ज़्यादातर प्लेयर स्पीड बदले बिना पिच को कुछ सेमीटोन ऊपर-नीचे कर सकते हैं। गायक को दो-तीन स्टेप नीचे लाएँ, और जो गाना पहुँच से बाहर लगता था वह अचानक आराम से गाया जाने लगेगा।
DJs और रीमिक्सर्स के लिए Acapellas

अलग किया गया वोकल किसी रीमिक्स का कच्चा माल होता है। उसे एक नई बीट पर रखें, टेम्पो मिलाने के लिए खींचें, और फ़्रेज़ों को काटकर एक हुक बनाएँ। यहाँ चार-स्टेम स्प्लिट मदद करते हैं: ड्रम स्टेम से आप ग्रूव दोबारा बना सकते हैं, और बास स्टेम हटाने से वह निचला सिरा बदला जा सकता है जो आपके नए ट्रैक से टकराता है।
कुछ आदतें acapellas को ठीक से काम करने देती हैं। पहले टेम्पो मिलाएँ, फिर पिच की जाँच अपने नए ट्रैक से करें ताकि दोनों आपस में न लड़ें। सेपरेटर के छोड़े हिस्से पर भरोसा करने के बजाय ऊपर से थोड़ा रीवर्ब जोड़ें। अगर आप नतीजा प्रकाशित करने की योजना बना रहे हैं, तो कुछ भी करने से पहले नीचे दिया अधिकार वाला हिस्सा पढ़ लें।
बैंड के साथ अभ्यास

संगीतकार स्प्लिटिंग को अपने प्रैक्टिस रूम की तरह इस्तेमाल करते हैं। एक बासिस्ट बास स्टेम म्यूट करके लाइन लाइव बजाता है। एक गिटारिस्ट गिटार म्यूट करने के लिए छह-स्टेम स्प्लिट इस्तेमाल करता है। हार्मोनी का अभ्यास कर रहा एक गायक लीड को नीचे करके बैकिंग वोकल्स अकेले सुन सकता है। प्लेबैक को आधी स्पीड पर धीमा करें, और स्टेम आम तौर पर इतने साफ़ रहते हैं कि कठिन हिस्से के साथ-साथ बजाया जा सके।
वही टूल बोले गए ऑडियो पर भी काम करते हैं। पॉडकास्टर और वीडियो एडिटर रिकॉर्ड की गई आवाज़ से बैकग्राउंड म्यूज़िक निकालने के लिए इनका इस्तेमाल करते हैं, या किसी दूसरे एडिट के लिए म्यूज़िक रखकर संवाद हटाते हैं।
अपने स्टेम्स से क्या करें
एक साफ़ वोकल या इंस्ट्रुमेंटल मिलने के बाद वह दूसरे प्रोजेक्ट्स के लिए शुरुआती सामग्री बन जाता है। PicassoIA के पास ट्रांसक्रिप्शन, वीडियो और म्यूज़िक जनरेशन के मॉडल हैं, और तीन काम दिखाते हैं कि ये टुकड़े कैसे एक साथ फ़िट होते हैं।
वोकल स्टेम से लिरिक्स निकालें
बैंड के बिना वोकल किसी स्पीच मॉडल के लिए सुनना कहीं आसान होता है। वोकल स्टेम GPT 4o Transcribe पर अपलोड करें और भाषा उसके दो-अक्षर वाले कोड से सेट करें, जैसे en, ताकि सटीकता और गति बढ़े। मॉडल MP3, WAV, M4A, OGG और WebM फ़ाइलें स्वीकार करता है। अगर पहला ट्रांसक्रिप्ट किसी तेज़ वर्स पर अटकता है, तो Gemini 3 Pro दूसरा विकल्प है।
गाए गए शब्द बोलचाल से कठिन होते हैं, इसलिए नतीजे को गाने से मिलाकर प्रूफ़रीड करें। फिर भी, ड्राफ़्ट को ठीक करना हर लाइन कान से टाइप करने से कहीं कम समय लेता है।
वोकल को लिरिक वीडियो में बदलें

Audio To Video एक ऑडियो फ़ाइल और या तो एक इमेज या टेक्स्ट प्रॉम्प्ट लेता है, फिर एक छोटा वीडियो बनाता है जिसके विज़ुअल्स आवाज़ पर प्रतिक्रिया देते हैं। वोकल स्टेम अच्छा इनपुट है, क्योंकि मूवमेंट ड्रम के बजाय गायकी का पीछा करता है।
PicassoIA पर इसे इस्तेमाल करने का तरीका:
- मॉडल पेज खोलें और वोकल स्टेम (WAV, MP3, FLAC, OGG या M4A) अपलोड करें।
- पहले फ़्रेम के रूप में एक इमेज जोड़ें, या अगर कोई इमेज नहीं है तो प्रॉम्प्ट में दृश्य का वर्णन करें। अगर दोनों जोड़ते हैं, तो प्रॉम्प्ट बताता है कि इमेज को कैसे मूव करना चाहिए।
- गाइडेंस स्केल एडजस्ट करें। ऊँची वैल्यू आपके प्रॉम्प्ट को ज़्यादा करीब से मानती हैं, पर क्वालिटी घटा सकती हैं, इसलिए छोटे-छोटे कदमों में बढ़ाएँ।
- जनरेट करें, क्लिप देखें और प्रॉम्प्ट में बदलाव करते रहें जब तक मूवमेंट मूड से मेल न खाए।
- अपने वीडियो एडिटर में क्लिप काटकर जोड़ें और ट्रांसक्राइब किए गए बोल कैप्शन के रूप में डालें।
मॉडल छोटी क्लिप बनाता है, इसलिए एक बार में एक वर्स या एक कोरस पर काम करें।
नई बैकिंग ट्रैक बनाएँ
अगर आपके इंस्ट्रुमेंटल में ऐसे घोस्ट हैं जिन्हें आप ठीक नहीं कर सकते, या आप मूल गाना प्रकाशित नहीं कर सकते, तो एक नया बनाएँ। जिस गाने को बदल रहे हैं उसका टेम्पो, मूड और वाद्य बताएँ, और टेक्स्ट-टू-म्यूज़िक मॉडल को कुछ नया लिखने दें:
प्रॉम्प्ट ऐसे लिखें जैसे किसी सेशन बैंड को ब्रीफ़ करते हैं: "मिड-टेम्पो इंडी पॉप, 100 BPM, साफ़ इलेक्ट्रिक गिटार, नरम ब्रश वाले ड्रम, गर्म बास, महिला लीड वोकल के लिए काफ़ी जगह।" कई वर्ज़न जनरेट करें और वह चुनें जो आपके वोकल के नीचे सबसे अच्छा बैठे।
क्या गाने स्प्लिट करना कानूनी है?
फ़ाइल को बाँटने से उसका मालिकाना हक नहीं बदलता। कई जगहों पर अपने लिए निजी कराओके ट्रैक या प्रैक्टिस लूप बनाना एक ग्रे एरिया में आता है, जिसका पीछा अधिकार धारक शायद ही करते हैं। किसी व्यावसायिक रिकॉर्डिंग से बनी चीज़ को प्रकाशित करना, स्ट्रीम करना या बेचना अलग बात है: इसके लिए गाने के मालिक से अनुमति या लाइसेंस चाहिए। यह वोकल, इंस्ट्रुमेंटल और उनके किसी भी रीमिक्स पर लागू होता है। यह कानूनी सलाह नहीं है, और नियम देश-देश में अलग हैं।
सुरक्षित रास्ते सीधे हैं। अपनी रिकॉर्डिंग स्प्लिट करें, वे ट्रैक जिन्हें रीमिक्स करने का आपको लाइसेंस मिला है, और वह संगीत जो खास रीमिक्सिंग के लिए स्टेम्स के साथ रिलीज़ हुआ हो।
Picasso IA पर आज़माएँ
स्प्लिट करना आसान हिस्सा है। मज़ा तब शुरू होता है जब आप उस पर कुछ बनाते हैं। टेक्स्ट-टू-म्यूज़िक मॉडल से नया इंस्ट्रुमेंटल लिखें, Seedream 4.5 से एल्बम आर्टवर्क डिज़ाइन करें, या Audio To Video से एक कोरस को छोटी क्लिप में बदलें। PicassoIA खोलें, एक प्रॉम्प्ट लिखें और देखें कि एक दोपहर के प्रयोग से क्या निकल सकता है।
एक पसंदीदा गाना चुनें, उसे स्प्लिट करें, और टुकड़ों से कुछ नया बनाएँ। आपका अगला ट्रैक, आर्टवर्क या वीडियो एक ही प्रॉम्प्ट से शुरू होता है।