ऑडियो ट्रांसक्रिप्शन MCP: Claude और Cursor में फ़ाइलें ट्रांसक्राइब करें

ऑडियो ट्रांसक्रिप्शन MCP सर्वर से Claude और Cursor आपकी MP3, WAV और M4A फ़ाइलें सीधे पढ़ सकते हैं। यह लेख Claude Desktop, Claude Code और Cursor का कॉन्फ़िग दिखाता है, ट्रांसक्रिप्ट को नोट्स में बदलने वाले प्रॉम्प्ट बताता है, और उन एररों के समाधान देता है जो ज़्यादातर पहले सेटअप को रोक देते हैं।

ऑडियो ट्रांसक्रिप्शन MCP: Claude और Cursor में फ़ाइलें ट्रांसक्राइब करें
Cristian Da Conceicao
Picasso IA के संस्थापक

अगर किसी मॉडल को 90 मिनट की MP3 दी जाए, तो उसके पास पढ़ने के लिए कुछ नहीं होता। एक ऑडियो ट्रांसक्रिप्शन MCP सर्वर यही समस्या हल करता है। यह आपकी चैट विंडो या एडिटर और एक स्पीच-टू-टेक्स्ट इंजन के बीच बैठता है, इसलिए आप लिख सकते हैं "interview-04.mp3 ट्रांसक्राइब करो और तीन सबसे अच्छे कोट्स निकालो" और Claude या Cursor के अंदर ही टेक्स्ट वापस पा सकते हैं। न टैब बदलना पड़ता है, न अपलोड फ़ॉर्म भरने पड़ते हैं, न पाँच ऐप्स के बीच कॉपी-पेस्ट करना पड़ता है।

यह लेख Claude Desktop, Claude Code और Cursor के लिए सटीक कॉन्फ़िग बताता है, गड़बड़ ट्रांसक्रिप्ट पर काम करने वाले प्रॉम्प्ट समझाता है, और उन एररों के समाधान देता है जो ज़्यादातर पहली कोशिशों को रोक देते हैं। इसमें PicassoIA पर स्पीच-टू-टेक्स्ट मॉडल का इस्तेमाल करके बिना इंस्टॉल किए एक-बार की रिकॉर्डिंग ट्रांसक्राइब करने का तरीका भी है, और रिकॉर्डिंग में कही गई बातों को इमेज में बदलने का एक तरीका भी।

ऑडियो ट्रांसक्रिप्शन MCP क्या करता है

Model Context Protocol (MCP) एक ओपन स्टैंडर्ड है, जो AI ऐप को एक छोटे सर्वर प्रोसेस के ज़रिए बाहरी टूल्स कॉल करने देता है। एक ट्रांसक्रिप्शन सर्वर कुछ टूल्स दिखाता है, आमतौर पर "इस फ़ाइल पाथ को ट्रांसक्राइब करो" या "इस लंबी रिकॉर्डिंग को बाँटो" जैसे। यह भारी काम स्पीच-टू-टेक्स्ट इंजन से करवाता है और साधारण टेक्स्ट वापस बातचीत में दे देता है। कब टूल कॉल होगा, यह क्लाइंट तय करता है।

ग्रे हुडी पहने एक सॉफ़्टवेयर डेवलपर, जो अपने लैपटॉप की ओर झुका है और उसके बगल में ऑडियो रिकॉर्डिंग का एक फ़ोल्डर रखा है

अनुरोध का फ़्लो

जब आप ट्रांसक्रिप्ट माँगते हैं, तब यह होता है:

  1. आप एक अनुरोध लिखते हैं जिसमें लोकल फ़ाइल का पाथ होता है।
  2. क्लाइंट अपनी टूल लिस्ट में ट्रांसक्रिप्शन टूल देखता है और उसे चलाने की अनुमति माँगता है।
  3. सर्वर फ़ाइल पढ़ता है और उसे क्लाउड API या लोकल Whisper मॉडल को भेजता है।
  4. टेक्स्ट टूल के नतीजे के रूप में लौटता है, और मॉडल आगे बढ़ता है: सार बनाना, कोट्स निकालना, दोबारा लिखना।

💡 याद रखने लायक बात: इस सेटअप में मॉडल ऑडियो नहीं सुनता। वह ट्रांसक्रिप्ट पढ़ता है, इसलिए सार में कोई भी गलती उस बात से आती है जो इंजन ने सबसे पहले सुनी। कुछ भी प्रकाशित करने से पहले नाम, नंबर और तारीखें स्रोत से मिलाकर देखें।

अकेली चैट क्यों कम पड़ती है

एक फ़ाइल का ट्रांसक्रिप्ट हाथ से पेस्ट करना चल जाता है। दस फ़ाइलों पर यह टूट जाता है। सर्वर लगा हो तो आप पूरे फ़ोल्डर की ओर इशारा कर सकते हैं, टाइमस्टैम्प रख सकते हैं, और एक ही प्रॉम्प्ट में कई स्टेप जोड़ सकते हैं: ट्रांसक्राइब करो, शो नोट्स बनाओ, notes.md में सेव करो। Cursor के अंदर वही टूल कॉल नतीजा सीधे आपकी रिपॉज़िटरी में लिख सकता है, उन कोड या डॉक्स के बगल में जिनसे वह जुड़ा है। Claude Code के अंदर यह एक स्क्रिप्ट को खिला सकता है जो फ़ाइलों का नाम स्पीकर या विषय के हिसाब से बदलती है।

तीन स्थितियाँ जहाँ यह सेटअप जल्दी फ़ायदा देता है:

  • साप्ताहिक मीटिंग: रिकॉर्ड करें, ट्रांसक्राइब करें, और बिना किसी के मिनट्स टाइप किए एक्शन आइटम पाएँ।
  • इंटरव्यू और रिसर्च कॉल: रिपोर्ट के लिए टाइमस्टैम्प के साथ शब्दशः कोट्स निकालें।
  • पॉडकास्ट और वीडियो: ऑडियो ट्रैक से शो नोट्स, चैप्टर लिस्ट और कैप्शन के ड्राफ़्ट बनाएँ।

ट्रांसक्रिप्शन इंजन चुनें

कॉन्फ़िग फ़ाइल छूने से पहले तय करें कि ऑडियो कहाँ प्रोसेस होगा। यही एक चुनाव लागत, प्राइवेसी और स्पीड पर उस किसी भी सेटिंग से ज़्यादा असर डालता है जो आप बाद में बदलेंगे।

लकड़ी की मेज़ पर एक लैपटॉप, स्टूडियो हेडफ़ोन, हाथ में पकड़ने वाला वॉइस रिकॉर्डर और एक नोटबुक, ऊपर से ली गई फ़्लैट लेआउट तस्वीर

क्लाउड API या लोकल Whisper

पहलूक्लाउड APIलोकल Whisper
सेटअपकॉन्फ़िग में एक क्रेडेंशियल पेस्ट करेंरनटाइम इंस्टॉल करें, मॉडल डाउनलोड करें
प्राइवेसीऑडियो आपकी मशीन से बाहर जाता हैऑडियो डिस्क पर ही रहता है
स्पीडज़्यादातर फ़ाइलों के लिए सेकंडों मेंआपके CPU या GPU पर निर्भर
फ़ाइल सीमाअपलोड कैप लागू होते हैं (OpenAI के ट्रांसक्रिप्शन एंडपॉइंट ने लंबे समय से अपलोड को 25 MB तक सीमित रखा है)डिस्क और मेमोरी से सीमित
लागतउपयोग के हिसाब से बिलिंगसेटअप के बाद मुफ़्त
सबसे अच्छा किसके लिएसाफ़ ऑडियो पर तेज़ नतीजेसंवेदनशील रिकॉर्डिंग और ऑफ़लाइन काम

अगर रिकॉर्डिंग किसी क्लाइंट कॉल, मेडिकल नोट या किसी NDA के अंतर्गत आने वाली चीज़ की है, तो लोकल चुनें। पॉडकास्ट और सार्वजनिक वेबिनार के लिए क्लाउड API आमतौर पर सेट करना आसान होता है।

तीन सर्वर जिन्हें देखना चाहिए

कम्युनिटी प्रोजेक्ट पहले से मौजूद हैं, और उनके नाम ही बता देते हैं कि वे क्या करते हैं:

  • mcp-server-whisper: OpenAI के स्पीच मॉडल पर आधारित एक सर्वर।
  • whisper-mcp: whisper.cpp के ज़रिए Whisper मॉडल से लोकल ट्रांसक्रिप्शन, इसलिए कोई ऑडियो अपलोड नहीं होता।
  • fast-whisper MCP servers: GPU या अच्छे CPU पर तेज़ लोकल पहचान के लिए Faster Whisper के रैपर।

नाम बदलते हैं और प्रोजेक्ट पुराने पड़ जाते हैं। रिपॉज़िटरी खोलें, आख़िरी कमिट की तारीख देखें, पढ़ें कि सर्वर कौन से टूल दिखाता है, और इंस्टॉल कमांड इस पेज से नहीं, उसके README से कॉपी करें। इसी कारण नीचे दी गई कॉन्फ़िग में प्लेसहोल्डर इस्तेमाल हुए हैं।

💡 सुरक्षा जाँच: एक MCP सर्वर आपकी यूज़र अनुमतियों के साथ एक प्रोसेस के रूप में चलता है। सिर्फ़ वही कोड इंस्टॉल करें जिसे आपने पढ़ा हो या जिस पर भरोसा हो, और उसे पूरे होम डायरेक्टरी के बजाय रिकॉर्डिंग वाले फ़ोल्डर की ओर इशारा करवाएँ।

Claude में सेट करें

Claude Desktop सर्वर एक JSON फ़ाइल से पढ़ता है। Claude Code उन्हें एक कमांड से जोड़ता है। दोनों ही सर्वर को आपकी मशीन पर एक लोकल प्रोसेस के रूप में शुरू करते हैं।

सुबह की रोशनी में किचन टेबल पर लैपटॉप पर टाइप करती हुई डेनिम शर्ट पहने एक महिला

Claude Desktop कॉन्फ़िग

अपने सिस्टम की कॉन्फ़िग फ़ाइल खोलें:

  • macOS: ~/Library/Application Support/Claude/claude_desktop_config.json
  • Windows: %APPDATA%\Claude\claude_desktop_config.json

सर्वर को mcpServers के अंतर्गत जोड़ें:

{
  "mcpServers": {
    "transcribe": {
      "command": "npx",
      "args": ["-y", "<package-name-from-the-readme>"],
      "env": {
        "TRANSCRIBE_TOKEN": "<your-credential>"
      }
    }
  }
}

TRANSCRIBE_TOKEN एक प्लेसहोल्डर है। उसी वेरिएबल नाम का इस्तेमाल करें जो आपके सर्वर का README माँगता है। Python सर्वर आमतौर पर npx के बजाय uvx से लॉन्च होते हैं, इसलिए command और args को उसी हिसाब से बदलें। फिर Claude Desktop को पूरी तरह बंद करें, सिर्फ़ विंडो नहीं, और उसे दोबारा खोलें। प्रोसेस शुरू होने के बाद टूल लिस्ट में नया सर्वर दिखता है।

Claude Code एक लाइन में

claude mcp add --transport stdio transcribe --env TRANSCRIBE_TOKEN=<your-credential> -- npx -y <package-name-from-the-readme>

दो नियम लोगों को उलझाते हैं: हर विकल्प सर्वर के नाम से पहले जाता है, और डबल डैश नाम को उस कमांड से अलग करता है जो सर्वर शुरू करती है। नतीजा claude mcp list से जाँचें, claude mcp get transcribe से उसका निरीक्षण करें, और claude mcp remove transcribe से हटाएँ।

💡 एंट्री को उस .mcp.json फ़ाइल में सेव करने के लिए --scope project इस्तेमाल करें जिसे आपकी टीम शेयर करती है। वहाँ कभी भी रॉ क्रेडेंशियल कमिट न करें। उसके बजाय ${TRANSCRIBE_TOKEN} जैसा एनवायरनमेंट वेरिएबल रेफ़रेंस करें और हर व्यक्ति को अपना सेट करने दें।

किसी असली फ़ाइल पर भरोसा करने से पहले एक छोटा टेस्ट चलाएँ: फ़ोन पर अपनी दस सेकंड की आवाज़ रिकॉर्ड करें, फ़ाइल अपने रिकॉर्डिंग फ़ोल्डर में डालें, और Claude से उसे ट्रांसक्राइब करने को कहें। सही ट्रांसक्रिप्ट एक ही बार में सर्वर, क्रेडेंशियल और फ़ाइल पाथ, तीनों की पुष्टि कर देता है।

Cursor में सेट करें

Cursor उसी mcpServers शेप को एक फ़ाइल से पढ़ता है। सर्वर को उस रिपो तक सीमित करने के लिए इसे किसी प्रोजेक्ट के अंदर .cursor/mcp.json में रखें, या हर जगह उपलब्ध कराने के लिए अपने होम फ़ोल्डर में ~/.cursor/mcp.json में रखें।

डुअल-मॉनिटर डेस्क पर कोड एडिटर और चैट साइडबार के साथ बैठे पीछे से दिखते एक दाढ़ी वाले डेवलपर

mcp.json एडिट करें

{
  "mcpServers": {
    "transcribe": {
      "command": "npx",
      "args": ["-y", "<package-name-from-the-readme>"],
      "env": {
        "TRANSCRIBE_TOKEN": "${env:TRANSCRIBE_TOKEN}"
      }
    }
  }
}

${env:NAME} सिंटैक्स वैल्यू को आपके शेल एनवायरनमेंट से लेता है, इसलिए फ़ाइल कमिट करने के लिए सुरक्षित रहती है। Cursor ${workspaceFolder} को command, args और env वैल्यू के अंदर भी हल करता है, जो तब काम आता है जब सर्वर को रिपो के भीतर रिकॉर्डिंग के फ़ोल्डर का पाथ चाहिए।

चैट से इसे कॉल करें

एजेंट चैट खोलें और MCP सेटिंग्स पेज देखें: सर्वर सक्षम दिखना चाहिए, उसके टूल नामों के साथ। फिर सामान्य भाषा में पूछें:

recordings/call-0612.m4a को transcribe टूल से ट्रांसक्राइब करो और टेक्स्ट को docs/call-0612.md में सेव करो। सबसे ऊपर पाँच लाइन का सार जोड़ो।

डिफ़ॉल्ट रूप से Cursor हर टूल कॉल चलने से पहले आपकी मंज़ूरी माँगता है। पहला कॉल मंज़ूर करें, आउटपुट जाँचें, और उसके बाद ही इस सर्वर के लिए ऑटो-रन चालू करने पर विचार करें।

ट्रांसक्रिप्ट पर काम करने वाले प्रॉम्प्ट

प्रिंटेड इंटरव्यू ट्रांसक्रिप्ट की पंक्तियों को पीली हाइलाइटर से चिह्नित करते एक महिला के हाथ

कच्चे ट्रांसक्रिप्ट लंबे और बिखरे होते हैं, इसलिए प्रॉम्प्ट तय करता है कि आपको टेक्स्ट की दीवार मिलेगी या कुछ काम का। सबसे अच्छे प्रॉम्प्ट फ़ाइल का नाम लेते हैं, बताते हैं कि क्या निकालना है, और यह भी बताते हैं कि ऑडियो अस्पष्ट हो तो मॉडल को क्या करना है।

ज़िम्मेदार व्यक्ति तय करने वाले मीटिंग नोट्स

standup-0612.m4a को ट्रांसक्राइब करो। फिर फ़ैसले, खुले सवाल और एक्शन आइटम की सूची बनाओ। हर एक्शन आइटम के लिए ज़िम्मेदार व्यक्ति और उसकी बताई गई तारीख लिखो। अगर किसी ने तारीख नहीं बताई, तो अनुमान लगाने के बजाय "कोई तारीख नहीं" लिखो।

आख़िरी वाक्य मायने रखता है। उसके बिना मॉडल खाली जगहों को एक विश्वसनीय-सी शुक्रवार की तारीख से भर देते हैं।

टाइमस्टैम्प के साथ इंटरव्यू कोट्स

interview-04.mp3 को टाइमस्टैम्प के साथ ट्रांसक्राइब करो। पाँच सबसे मज़बूत कोट्स चुनो, हर एक को शब्दशः रखो, और उसके बगल में टाइमस्टैम्प दो। जहाँ ऑडियो अस्पष्ट लगा हो, वह कोट चिह्नित करो।

शब्दशः टेक्स्ट और टाइमस्टैम्प मिलकर हर कोट को सेकंडों में रिकॉर्डिंग से मिलाने का तरीका देते हैं।

कुछ आदतें जो हर प्रॉम्प्ट पर समय बचाती हैं:

  • पाथ को बिल्कुल सही नाम दें, एक्सटेंशन सहित।
  • शब्दशः कोट्स माँगें और जहाँ शब्दों का महत्व हो वहाँ पैराफ़्रेज़ पर रोक लगाएँ।
  • अनिश्चितता के फ़्लैग माँगें, ताकि अस्पष्ट हिस्से चिह्नित हों, चिकने करके छिपाए न जाएँ।
  • एक ग्लॉसरी जोड़ें प्रोडक्ट नामों, लोगों और जार्गन की, क्योंकि इंजन स्पेलिंग का अंदाज़ा लगाते हैं।
  • एक घंटे से लंबी रिकॉर्डिंग के लिए चंक्स में काम करें: ट्रांसक्राइब करें, हर हिस्से का सार बनाएँ, फिर मिलाएँ।

आम एररों के समाधान

काँच की दीवारों वाले मीटिंग रूम में लैपटॉप स्क्रीन पढ़ते हुए अपनी कनपटी सहलाता एक इंजीनियर

ज़्यादातर विफलताएँ पाँच कारणों तक सिमट जाती हैं। यह टेबल आपको सही कारण तक जल्दी पहुँचा देती है।

लक्षणसंभावित कारणसमाधान
टूल कभी दिखता ही नहींJSON सिंटैक्स एरर या पूरा रीस्टार्ट नहीं हुआJSON को वैलिडेट करें, ऐप को पूरी तरह बंद करके दोबारा खोलें
"command not found"npx या uvx ऐप के PATH में नहीं हैएक्ज़िक्यूटेबल का एब्सोल्यूट पाथ इस्तेमाल करें
ऑथेंटिकेशन एररक्रेडेंशियल वेरिएबल गलत है या गायब हैREADME में दिया सटीक वेरिएबल नाम मिलाएँ
लंबी फ़ाइल पर टाइमआउटअपलोड कैप या धीमा इंजनफ़ाइल को 15 मिनट के हिस्सों में बाँटें
गलत लिखे नामइंजन ने स्पेलिंग का अंदाज़ा लगायाग्लॉसरी या स्टाइल प्रॉम्प्ट जोड़ें

लिस्ट में सर्वर नहीं दिख रहा

पहले सामान्य जाँच करें। एक ट्रेलिंग कॉमा पूरी फ़ाइल तोड़ देता है, और डेस्कटॉप ऐप अक्सर वह PATH नहीं पाता जो आप अपने टर्मिनल में देखते हैं, इसलिए npx शेल में चलता है पर ऐप में फ़ेल हो जाता है। एक्ज़िक्यूटेबल का एब्सोल्यूट पाथ command में डालें और फिर कोशिश करें।

फिर सर्वर कमांड को टर्मिनल में हाथ से चलाएँ। अगर वह वहाँ फ़ेल होता है, तो क्लाइंट में भी फ़ेल होगा, और टर्मिनल असली एरर दिखा देता है। Claude Desktop के लिए MCP लॉग फ़ाइलें logs फ़ोल्डर में रहती हैं: Windows पर %APPDATA%\Claude\logs और macOS पर ~/Library/Logs/Claude।

बड़ी फ़ाइलें और टाइमआउट

Claude और Cursor, दोनों ही उस टूल कॉल को छोड़ सकते हैं जो बहुत देर चलती है, और क्लाउड इंजन में अपलोड कैप होते हैं। फ़ाइल छोटी करने से दोनों समस्याएँ हल होती हैं। स्पीच के लिए स्टूडियो क्वालिटी ज़रूरी नहीं होती, इसलिए कम सैंपल रेट पर मोनो चल जाता है:

ffmpeg -i long-call.wav -ac 1 -ar 16000 -b:a 64k long-call.mp3

अगर फिर भी बहुत बड़ी हो, तो उसे बिना री-एनकोड किए 15 मिनट के सेगमेंट में काटें:

ffmpeg -i long-call.mp3 -f segment -segment_time 900 -c copy part_%03d.mp3

फिर मॉडल से part_000.mp3, part_001.mp3 और इसी तरह आगे के हिस्से क्रम से ट्रांसक्राइब करवाएँ, और अंत में एक प्रॉम्प्ट में नतीजे जोड़ लें।

PicassoIA पर ब्राउज़र में ट्रांसक्राइब करें

एक-बार की रिकॉर्डिंग के लिए सर्वर सेट करना काम के मुकाबले ज़्यादा मेहनत है। PicassoIA स्पीच-टू-टेक्स्ट मॉडल ब्राउज़र में चलाता है, बिना कुछ इंस्टॉल किए: GPT 4o Transcribe, GPT 4o Mini Transcribe और Gemini 3 Pro। Claude के लिए PicassoIA कनेक्टर इमेज और वीडियो जनरेशन के लिए बना है, इसलिए ट्रांसक्रिप्शन मॉडल के पेज पर होता है, और तैयार टेक्स्ट को बाद में आप Claude या Cursor में पेस्ट करते हैं।

छोटे स्टूडियो में माइक्रोफ़ोन पर बोलता एक पॉडकास्ट होस्ट, बगल में अपलोड पेज दिखाता लैपटॉप

अपलोड करें और भाषा सेट करें

  1. PicassoIA पर GPT 4o Transcribe पेज खोलें।
  2. अपनी ऑडियो फ़ाइल अपलोड करें। मॉडल MP3, MP4, MPEG, MPGA, M4A, OGG, WAV और WebM स्वीकार करता है।
  3. Language में ISO-639-1 कोड भरें, जैसे en, es या fr। मॉडल पेज बताता है कि इसे देने से सटीकता और लेटेंसी दोनों बेहतर होती हैं।
  4. एक वैकल्पिक Prompt जोड़ें: एक छोटा टेक्स्ट जो स्टाइल तय करे या पिछले सेगमेंट को आगे बढ़ाए। यह ऑडियो की भाषा से मेल खाना चाहिए। स्पीकर के नाम और प्रोडक्ट के शब्दों की एक लाइन अच्छा काम करती है।
  5. Temperature को डिफ़ॉल्ट 0 पर रखें, ताकि नतीजा सबसे अनुमानित रहे।
  6. चलाएँ, फिर ट्रांसक्रिप्ट कॉपी करें।

💡 पहले 30 सेकंड की क्लिप से टेस्ट करें। अगर नाम गलत आएँ, तो पूरे घंटे को चलाने से पहले प्रॉम्प्ट की लाइन ठीक करें।

लंबी रिकॉर्डिंग के लिए मॉडल बदलें

मॉडलसबसे अच्छा किसके लिएनोट्स
GPT 4o Transcribeछोटी और मध्यम लंबाई की फ़ाइलों के सटीक ट्रांसक्रिप्टLanguage, prompt और temperature फ़ील्ड
GPT 4o Mini Transcribeतेज़ ड्राफ़्टउसी परिवार का हल्का वेरिएंट
Gemini 3 Proबहुत लंबा ऑडियो, एक ही अनुरोध में ट्रांसक्रिप्ट और सारएक ऑडियो फ़ाइल 8.4 घंटे तक, thinking level, system instruction

Gemini 3 Pro ऑडियो के साथ टेक्स्ट प्रॉम्प्ट भी लेता है, इसलिए आप एक ही बार में ट्रांसक्रिप्ट, फ़ैसलों की सूची और तीन लाइन का सार माँग सकते हैं। टेक्स्ट मिलने के बाद PicassoIA पर Claude Sonnet 5 जैसा लैंग्वेज मॉडल उसे शो नोट्स, ईमेल या चेंजलॉग में दोबारा लिख सकता है।

PicassoIA पर ट्रांसक्रिप्ट से इमेज तक

स्टैंडिंग डेस्क पर कॉर्कबोर्ड में प्रिंटेड फ़ोटो मॉकअप और इंडेक्स कार्ड लगाता एक कंटेंट क्रिएटर

ट्रांसक्रिप्ट विज़ुअल का स्रोत भी हो सकता है। एक ब्रेनस्टॉर्म कॉल, एक ग्राहक इंटरव्यू या एक पॉडकास्ट एपिसोड ऐसे ठोस दृश्यों से भरा होता है जिन्हें लोगों ने ज़ोर से बताया है, और ये दृश्य खाली पन्ने पर गढ़े किसी भी दृश्य से बेहतर इमेज प्रॉम्प्ट बनाते हैं।

कोट्स से इमेज प्रॉम्प्ट लिखें

Claude या Cursor से ट्रांसक्रिप्ट को पाँच सीन विवरणों में बदलने को कहें, हर एक में एक सब्जेक्ट, एक सेटिंग, रोशनी और एक लेंस हो। उदाहरण के लिए:

सुबह खुलने के समय एक छोटा बेकरी काउंटर, एक बेकर ब्रेड की ट्रे कैमरे की ओर सरकाता हुआ, बाईं ओर से आती गर्म खिड़की की रोशनी, 50mm लेंस, उथला डेप्थ ऑफ़ फ़ील्ड, हवा में आटे के कण।

हर विवरण को PicassoIA के किसी इमेज मॉडल में पेस्ट करें: Flux 2 Pro, P-Image या Nano Banana Pro। एक ही प्रॉम्प्ट दो मॉडलों पर चलाकर तुलना करें, क्योंकि हर मॉडल रोशनी और टेक्सचर को थोड़ा अलग तरीके से पढ़ता है। हर प्रॉम्प्ट में एक ही सीन रखें, रोशनी की दिशा और लेंस का नाम लें, और ऊनी कपड़े, लकड़ी की बनावट या भाप जैसी सतहों का वर्णन करें। यही ब्योरे फ़ोटो जैसे नतीजे को आम नतीजे से अलग करते हैं।

आपकी अगली रिकॉर्डिंग में आपकी अगली पाँच इमेज पहले से मौजूद हैं। एक छोटी क्लिप चुनें, ऊपर बताए सेटअप से या PicassoIA पर उसे ट्रांसक्राइब करें, सबसे जीवंत दृश्य निकालें, और आज ही Picasso IA पर अपनी इमेज बनाएँ। लेंस बदलें, रोशनी खिसकाएँ, और देखें कि एक बोले गए वाक्य से कितनी दूर तक जा सकते हैं।

धूप वाले को-वर्किंग स्पेस में एक लंबी लकड़ी की मेज़ के चारों ओर बैठे तीन सहकर्मी, साथ मिलकर लैपटॉप देखते हुए

यह लेख शेयर करें

अपनी भाषा चुनें

संबंधित लेख