ऑडियो ट्रांसक्रिप्शन MCP: Claude और Cursor में फ़ाइलें ट्रांसक्राइब करें
ऑडियो ट्रांसक्रिप्शन MCP सर्वर से Claude और Cursor आपकी MP3, WAV और M4A फ़ाइलें सीधे पढ़ सकते हैं। यह लेख Claude Desktop, Claude Code और Cursor का कॉन्फ़िग दिखाता है, ट्रांसक्रिप्ट को नोट्स में बदलने वाले प्रॉम्प्ट बताता है, और उन एररों के समाधान देता है जो ज़्यादातर पहले सेटअप को रोक देते हैं।
अगर किसी मॉडल को 90 मिनट की MP3 दी जाए, तो उसके पास पढ़ने के लिए कुछ नहीं होता। एक ऑडियो ट्रांसक्रिप्शन MCP सर्वर यही समस्या हल करता है। यह आपकी चैट विंडो या एडिटर और एक स्पीच-टू-टेक्स्ट इंजन के बीच बैठता है, इसलिए आप लिख सकते हैं "interview-04.mp3 ट्रांसक्राइब करो और तीन सबसे अच्छे कोट्स निकालो" और Claude या Cursor के अंदर ही टेक्स्ट वापस पा सकते हैं। न टैब बदलना पड़ता है, न अपलोड फ़ॉर्म भरने पड़ते हैं, न पाँच ऐप्स के बीच कॉपी-पेस्ट करना पड़ता है।
यह लेख Claude Desktop, Claude Code और Cursor के लिए सटीक कॉन्फ़िग बताता है, गड़बड़ ट्रांसक्रिप्ट पर काम करने वाले प्रॉम्प्ट समझाता है, और उन एररों के समाधान देता है जो ज़्यादातर पहली कोशिशों को रोक देते हैं। इसमें PicassoIA पर स्पीच-टू-टेक्स्ट मॉडल का इस्तेमाल करके बिना इंस्टॉल किए एक-बार की रिकॉर्डिंग ट्रांसक्राइब करने का तरीका भी है, और रिकॉर्डिंग में कही गई बातों को इमेज में बदलने का एक तरीका भी।
ऑडियो ट्रांसक्रिप्शन MCP क्या करता है
Model Context Protocol (MCP) एक ओपन स्टैंडर्ड है, जो AI ऐप को एक छोटे सर्वर प्रोसेस के ज़रिए बाहरी टूल्स कॉल करने देता है। एक ट्रांसक्रिप्शन सर्वर कुछ टूल्स दिखाता है, आमतौर पर "इस फ़ाइल पाथ को ट्रांसक्राइब करो" या "इस लंबी रिकॉर्डिंग को बाँटो" जैसे। यह भारी काम स्पीच-टू-टेक्स्ट इंजन से करवाता है और साधारण टेक्स्ट वापस बातचीत में दे देता है। कब टूल कॉल होगा, यह क्लाइंट तय करता है।
अनुरोध का फ़्लो
जब आप ट्रांसक्रिप्ट माँगते हैं, तब यह होता है:
आप एक अनुरोध लिखते हैं जिसमें लोकल फ़ाइल का पाथ होता है।
क्लाइंट अपनी टूल लिस्ट में ट्रांसक्रिप्शन टूल देखता है और उसे चलाने की अनुमति माँगता है।
सर्वर फ़ाइल पढ़ता है और उसे क्लाउड API या लोकल Whisper मॉडल को भेजता है।
टेक्स्ट टूल के नतीजे के रूप में लौटता है, और मॉडल आगे बढ़ता है: सार बनाना, कोट्स निकालना, दोबारा लिखना।
💡 याद रखने लायक बात: इस सेटअप में मॉडल ऑडियो नहीं सुनता। वह ट्रांसक्रिप्ट पढ़ता है, इसलिए सार में कोई भी गलती उस बात से आती है जो इंजन ने सबसे पहले सुनी। कुछ भी प्रकाशित करने से पहले नाम, नंबर और तारीखें स्रोत से मिलाकर देखें।
अकेली चैट क्यों कम पड़ती है
एक फ़ाइल का ट्रांसक्रिप्ट हाथ से पेस्ट करना चल जाता है। दस फ़ाइलों पर यह टूट जाता है। सर्वर लगा हो तो आप पूरे फ़ोल्डर की ओर इशारा कर सकते हैं, टाइमस्टैम्प रख सकते हैं, और एक ही प्रॉम्प्ट में कई स्टेप जोड़ सकते हैं: ट्रांसक्राइब करो, शो नोट्स बनाओ, notes.md में सेव करो। Cursor के अंदर वही टूल कॉल नतीजा सीधे आपकी रिपॉज़िटरी में लिख सकता है, उन कोड या डॉक्स के बगल में जिनसे वह जुड़ा है। Claude Code के अंदर यह एक स्क्रिप्ट को खिला सकता है जो फ़ाइलों का नाम स्पीकर या विषय के हिसाब से बदलती है।
तीन स्थितियाँ जहाँ यह सेटअप जल्दी फ़ायदा देता है:
साप्ताहिक मीटिंग: रिकॉर्ड करें, ट्रांसक्राइब करें, और बिना किसी के मिनट्स टाइप किए एक्शन आइटम पाएँ।
इंटरव्यू और रिसर्च कॉल: रिपोर्ट के लिए टाइमस्टैम्प के साथ शब्दशः कोट्स निकालें।
पॉडकास्ट और वीडियो: ऑडियो ट्रैक से शो नोट्स, चैप्टर लिस्ट और कैप्शन के ड्राफ़्ट बनाएँ।
ट्रांसक्रिप्शन इंजन चुनें
कॉन्फ़िग फ़ाइल छूने से पहले तय करें कि ऑडियो कहाँ प्रोसेस होगा। यही एक चुनाव लागत, प्राइवेसी और स्पीड पर उस किसी भी सेटिंग से ज़्यादा असर डालता है जो आप बाद में बदलेंगे।
क्लाउड API या लोकल Whisper
पहलू
क्लाउड API
लोकल Whisper
सेटअप
कॉन्फ़िग में एक क्रेडेंशियल पेस्ट करें
रनटाइम इंस्टॉल करें, मॉडल डाउनलोड करें
प्राइवेसी
ऑडियो आपकी मशीन से बाहर जाता है
ऑडियो डिस्क पर ही रहता है
स्पीड
ज़्यादातर फ़ाइलों के लिए सेकंडों में
आपके CPU या GPU पर निर्भर
फ़ाइल सीमा
अपलोड कैप लागू होते हैं (OpenAI के ट्रांसक्रिप्शन एंडपॉइंट ने लंबे समय से अपलोड को 25 MB तक सीमित रखा है)
डिस्क और मेमोरी से सीमित
लागत
उपयोग के हिसाब से बिलिंग
सेटअप के बाद मुफ़्त
सबसे अच्छा किसके लिए
साफ़ ऑडियो पर तेज़ नतीजे
संवेदनशील रिकॉर्डिंग और ऑफ़लाइन काम
अगर रिकॉर्डिंग किसी क्लाइंट कॉल, मेडिकल नोट या किसी NDA के अंतर्गत आने वाली चीज़ की है, तो लोकल चुनें। पॉडकास्ट और सार्वजनिक वेबिनार के लिए क्लाउड API आमतौर पर सेट करना आसान होता है।
तीन सर्वर जिन्हें देखना चाहिए
कम्युनिटी प्रोजेक्ट पहले से मौजूद हैं, और उनके नाम ही बता देते हैं कि वे क्या करते हैं:
mcp-server-whisper: OpenAI के स्पीच मॉडल पर आधारित एक सर्वर।
whisper-mcp: whisper.cpp के ज़रिए Whisper मॉडल से लोकल ट्रांसक्रिप्शन, इसलिए कोई ऑडियो अपलोड नहीं होता।
fast-whisper MCP servers: GPU या अच्छे CPU पर तेज़ लोकल पहचान के लिए Faster Whisper के रैपर।
नाम बदलते हैं और प्रोजेक्ट पुराने पड़ जाते हैं। रिपॉज़िटरी खोलें, आख़िरी कमिट की तारीख देखें, पढ़ें कि सर्वर कौन से टूल दिखाता है, और इंस्टॉल कमांड इस पेज से नहीं, उसके README से कॉपी करें। इसी कारण नीचे दी गई कॉन्फ़िग में प्लेसहोल्डर इस्तेमाल हुए हैं।
💡 सुरक्षा जाँच: एक MCP सर्वर आपकी यूज़र अनुमतियों के साथ एक प्रोसेस के रूप में चलता है। सिर्फ़ वही कोड इंस्टॉल करें जिसे आपने पढ़ा हो या जिस पर भरोसा हो, और उसे पूरे होम डायरेक्टरी के बजाय रिकॉर्डिंग वाले फ़ोल्डर की ओर इशारा करवाएँ।
Claude में सेट करें
Claude Desktop सर्वर एक JSON फ़ाइल से पढ़ता है। Claude Code उन्हें एक कमांड से जोड़ता है। दोनों ही सर्वर को आपकी मशीन पर एक लोकल प्रोसेस के रूप में शुरू करते हैं।
TRANSCRIBE_TOKEN एक प्लेसहोल्डर है। उसी वेरिएबल नाम का इस्तेमाल करें जो आपके सर्वर का README माँगता है। Python सर्वर आमतौर पर npx के बजाय uvx से लॉन्च होते हैं, इसलिए command और args को उसी हिसाब से बदलें। फिर Claude Desktop को पूरी तरह बंद करें, सिर्फ़ विंडो नहीं, और उसे दोबारा खोलें। प्रोसेस शुरू होने के बाद टूल लिस्ट में नया सर्वर दिखता है।
दो नियम लोगों को उलझाते हैं: हर विकल्प सर्वर के नाम से पहले जाता है, और डबल डैश नाम को उस कमांड से अलग करता है जो सर्वर शुरू करती है। नतीजा claude mcp list से जाँचें, claude mcp get transcribe से उसका निरीक्षण करें, और claude mcp remove transcribe से हटाएँ।
💡 एंट्री को उस .mcp.json फ़ाइल में सेव करने के लिए --scope project इस्तेमाल करें जिसे आपकी टीम शेयर करती है। वहाँ कभी भी रॉ क्रेडेंशियल कमिट न करें। उसके बजाय ${TRANSCRIBE_TOKEN} जैसा एनवायरनमेंट वेरिएबल रेफ़रेंस करें और हर व्यक्ति को अपना सेट करने दें।
किसी असली फ़ाइल पर भरोसा करने से पहले एक छोटा टेस्ट चलाएँ: फ़ोन पर अपनी दस सेकंड की आवाज़ रिकॉर्ड करें, फ़ाइल अपने रिकॉर्डिंग फ़ोल्डर में डालें, और Claude से उसे ट्रांसक्राइब करने को कहें। सही ट्रांसक्रिप्ट एक ही बार में सर्वर, क्रेडेंशियल और फ़ाइल पाथ, तीनों की पुष्टि कर देता है।
Cursor में सेट करें
Cursor उसी mcpServers शेप को एक फ़ाइल से पढ़ता है। सर्वर को उस रिपो तक सीमित करने के लिए इसे किसी प्रोजेक्ट के अंदर .cursor/mcp.json में रखें, या हर जगह उपलब्ध कराने के लिए अपने होम फ़ोल्डर में ~/.cursor/mcp.json में रखें।
${env:NAME} सिंटैक्स वैल्यू को आपके शेल एनवायरनमेंट से लेता है, इसलिए फ़ाइल कमिट करने के लिए सुरक्षित रहती है। Cursor ${workspaceFolder} को command, args और env वैल्यू के अंदर भी हल करता है, जो तब काम आता है जब सर्वर को रिपो के भीतर रिकॉर्डिंग के फ़ोल्डर का पाथ चाहिए।
चैट से इसे कॉल करें
एजेंट चैट खोलें और MCP सेटिंग्स पेज देखें: सर्वर सक्षम दिखना चाहिए, उसके टूल नामों के साथ। फिर सामान्य भाषा में पूछें:
recordings/call-0612.m4a को transcribe टूल से ट्रांसक्राइब करो और टेक्स्ट को docs/call-0612.md में सेव करो। सबसे ऊपर पाँच लाइन का सार जोड़ो।
डिफ़ॉल्ट रूप से Cursor हर टूल कॉल चलने से पहले आपकी मंज़ूरी माँगता है। पहला कॉल मंज़ूर करें, आउटपुट जाँचें, और उसके बाद ही इस सर्वर के लिए ऑटो-रन चालू करने पर विचार करें।
ट्रांसक्रिप्ट पर काम करने वाले प्रॉम्प्ट
कच्चे ट्रांसक्रिप्ट लंबे और बिखरे होते हैं, इसलिए प्रॉम्प्ट तय करता है कि आपको टेक्स्ट की दीवार मिलेगी या कुछ काम का। सबसे अच्छे प्रॉम्प्ट फ़ाइल का नाम लेते हैं, बताते हैं कि क्या निकालना है, और यह भी बताते हैं कि ऑडियो अस्पष्ट हो तो मॉडल को क्या करना है।
ज़िम्मेदार व्यक्ति तय करने वाले मीटिंग नोट्स
standup-0612.m4a को ट्रांसक्राइब करो। फिर फ़ैसले, खुले सवाल और एक्शन आइटम की सूची बनाओ। हर एक्शन आइटम के लिए ज़िम्मेदार व्यक्ति और उसकी बताई गई तारीख लिखो। अगर किसी ने तारीख नहीं बताई, तो अनुमान लगाने के बजाय "कोई तारीख नहीं" लिखो।
आख़िरी वाक्य मायने रखता है। उसके बिना मॉडल खाली जगहों को एक विश्वसनीय-सी शुक्रवार की तारीख से भर देते हैं।
टाइमस्टैम्प के साथ इंटरव्यू कोट्स
interview-04.mp3 को टाइमस्टैम्प के साथ ट्रांसक्राइब करो। पाँच सबसे मज़बूत कोट्स चुनो, हर एक को शब्दशः रखो, और उसके बगल में टाइमस्टैम्प दो। जहाँ ऑडियो अस्पष्ट लगा हो, वह कोट चिह्नित करो।
शब्दशः टेक्स्ट और टाइमस्टैम्प मिलकर हर कोट को सेकंडों में रिकॉर्डिंग से मिलाने का तरीका देते हैं।
कुछ आदतें जो हर प्रॉम्प्ट पर समय बचाती हैं:
पाथ को बिल्कुल सही नाम दें, एक्सटेंशन सहित।
शब्दशः कोट्स माँगें और जहाँ शब्दों का महत्व हो वहाँ पैराफ़्रेज़ पर रोक लगाएँ।
अनिश्चितता के फ़्लैग माँगें, ताकि अस्पष्ट हिस्से चिह्नित हों, चिकने करके छिपाए न जाएँ।
एक ग्लॉसरी जोड़ें प्रोडक्ट नामों, लोगों और जार्गन की, क्योंकि इंजन स्पेलिंग का अंदाज़ा लगाते हैं।
एक घंटे से लंबी रिकॉर्डिंग के लिए चंक्स में काम करें: ट्रांसक्राइब करें, हर हिस्से का सार बनाएँ, फिर मिलाएँ।
आम एररों के समाधान
ज़्यादातर विफलताएँ पाँच कारणों तक सिमट जाती हैं। यह टेबल आपको सही कारण तक जल्दी पहुँचा देती है।
लक्षण
संभावित कारण
समाधान
टूल कभी दिखता ही नहीं
JSON सिंटैक्स एरर या पूरा रीस्टार्ट नहीं हुआ
JSON को वैलिडेट करें, ऐप को पूरी तरह बंद करके दोबारा खोलें
"command not found"
npx या uvx ऐप के PATH में नहीं है
एक्ज़िक्यूटेबल का एब्सोल्यूट पाथ इस्तेमाल करें
ऑथेंटिकेशन एरर
क्रेडेंशियल वेरिएबल गलत है या गायब है
README में दिया सटीक वेरिएबल नाम मिलाएँ
लंबी फ़ाइल पर टाइमआउट
अपलोड कैप या धीमा इंजन
फ़ाइल को 15 मिनट के हिस्सों में बाँटें
गलत लिखे नाम
इंजन ने स्पेलिंग का अंदाज़ा लगाया
ग्लॉसरी या स्टाइल प्रॉम्प्ट जोड़ें
लिस्ट में सर्वर नहीं दिख रहा
पहले सामान्य जाँच करें। एक ट्रेलिंग कॉमा पूरी फ़ाइल तोड़ देता है, और डेस्कटॉप ऐप अक्सर वह PATH नहीं पाता जो आप अपने टर्मिनल में देखते हैं, इसलिए npx शेल में चलता है पर ऐप में फ़ेल हो जाता है। एक्ज़िक्यूटेबल का एब्सोल्यूट पाथ command में डालें और फिर कोशिश करें।
फिर सर्वर कमांड को टर्मिनल में हाथ से चलाएँ। अगर वह वहाँ फ़ेल होता है, तो क्लाइंट में भी फ़ेल होगा, और टर्मिनल असली एरर दिखा देता है। Claude Desktop के लिए MCP लॉग फ़ाइलें logs फ़ोल्डर में रहती हैं: Windows पर %APPDATA%\Claude\logs और macOS पर ~/Library/Logs/Claude।
बड़ी फ़ाइलें और टाइमआउट
Claude और Cursor, दोनों ही उस टूल कॉल को छोड़ सकते हैं जो बहुत देर चलती है, और क्लाउड इंजन में अपलोड कैप होते हैं। फ़ाइल छोटी करने से दोनों समस्याएँ हल होती हैं। स्पीच के लिए स्टूडियो क्वालिटी ज़रूरी नहीं होती, इसलिए कम सैंपल रेट पर मोनो चल जाता है:
फिर मॉडल से part_000.mp3, part_001.mp3 और इसी तरह आगे के हिस्से क्रम से ट्रांसक्राइब करवाएँ, और अंत में एक प्रॉम्प्ट में नतीजे जोड़ लें।
PicassoIA पर ब्राउज़र में ट्रांसक्राइब करें
एक-बार की रिकॉर्डिंग के लिए सर्वर सेट करना काम के मुकाबले ज़्यादा मेहनत है। PicassoIA स्पीच-टू-टेक्स्ट मॉडल ब्राउज़र में चलाता है, बिना कुछ इंस्टॉल किए: GPT 4o Transcribe, GPT 4o Mini Transcribe और Gemini 3 Pro। Claude के लिए PicassoIA कनेक्टर इमेज और वीडियो जनरेशन के लिए बना है, इसलिए ट्रांसक्रिप्शन मॉडल के पेज पर होता है, और तैयार टेक्स्ट को बाद में आप Claude या Cursor में पेस्ट करते हैं।
अपनी ऑडियो फ़ाइल अपलोड करें। मॉडल MP3, MP4, MPEG, MPGA, M4A, OGG, WAV और WebM स्वीकार करता है।
Language में ISO-639-1 कोड भरें, जैसे en, es या fr। मॉडल पेज बताता है कि इसे देने से सटीकता और लेटेंसी दोनों बेहतर होती हैं।
एक वैकल्पिक Prompt जोड़ें: एक छोटा टेक्स्ट जो स्टाइल तय करे या पिछले सेगमेंट को आगे बढ़ाए। यह ऑडियो की भाषा से मेल खाना चाहिए। स्पीकर के नाम और प्रोडक्ट के शब्दों की एक लाइन अच्छा काम करती है।
Temperature को डिफ़ॉल्ट 0 पर रखें, ताकि नतीजा सबसे अनुमानित रहे।
चलाएँ, फिर ट्रांसक्रिप्ट कॉपी करें।
💡 पहले 30 सेकंड की क्लिप से टेस्ट करें। अगर नाम गलत आएँ, तो पूरे घंटे को चलाने से पहले प्रॉम्प्ट की लाइन ठीक करें।
बहुत लंबा ऑडियो, एक ही अनुरोध में ट्रांसक्रिप्ट और सार
एक ऑडियो फ़ाइल 8.4 घंटे तक, thinking level, system instruction
Gemini 3 Pro ऑडियो के साथ टेक्स्ट प्रॉम्प्ट भी लेता है, इसलिए आप एक ही बार में ट्रांसक्रिप्ट, फ़ैसलों की सूची और तीन लाइन का सार माँग सकते हैं। टेक्स्ट मिलने के बाद PicassoIA पर Claude Sonnet 5 जैसा लैंग्वेज मॉडल उसे शो नोट्स, ईमेल या चेंजलॉग में दोबारा लिख सकता है।
PicassoIA पर ट्रांसक्रिप्ट से इमेज तक
ट्रांसक्रिप्ट विज़ुअल का स्रोत भी हो सकता है। एक ब्रेनस्टॉर्म कॉल, एक ग्राहक इंटरव्यू या एक पॉडकास्ट एपिसोड ऐसे ठोस दृश्यों से भरा होता है जिन्हें लोगों ने ज़ोर से बताया है, और ये दृश्य खाली पन्ने पर गढ़े किसी भी दृश्य से बेहतर इमेज प्रॉम्प्ट बनाते हैं।
कोट्स से इमेज प्रॉम्प्ट लिखें
Claude या Cursor से ट्रांसक्रिप्ट को पाँच सीन विवरणों में बदलने को कहें, हर एक में एक सब्जेक्ट, एक सेटिंग, रोशनी और एक लेंस हो। उदाहरण के लिए:
सुबह खुलने के समय एक छोटा बेकरी काउंटर, एक बेकर ब्रेड की ट्रे कैमरे की ओर सरकाता हुआ, बाईं ओर से आती गर्म खिड़की की रोशनी, 50mm लेंस, उथला डेप्थ ऑफ़ फ़ील्ड, हवा में आटे के कण।
हर विवरण को PicassoIA के किसी इमेज मॉडल में पेस्ट करें: Flux 2 Pro, P-Image या Nano Banana Pro। एक ही प्रॉम्प्ट दो मॉडलों पर चलाकर तुलना करें, क्योंकि हर मॉडल रोशनी और टेक्सचर को थोड़ा अलग तरीके से पढ़ता है। हर प्रॉम्प्ट में एक ही सीन रखें, रोशनी की दिशा और लेंस का नाम लें, और ऊनी कपड़े, लकड़ी की बनावट या भाप जैसी सतहों का वर्णन करें। यही ब्योरे फ़ोटो जैसे नतीजे को आम नतीजे से अलग करते हैं।
आपकी अगली रिकॉर्डिंग में आपकी अगली पाँच इमेज पहले से मौजूद हैं। एक छोटी क्लिप चुनें, ऊपर बताए सेटअप से या PicassoIA पर उसे ट्रांसक्राइब करें, सबसे जीवंत दृश्य निकालें, और आज ही Picasso IA पर अपनी इमेज बनाएँ। लेंस बदलें, रोशनी खिसकाएँ, और देखें कि एक बोले गए वाक्य से कितनी दूर तक जा सकते हैं।