InfiniteTalk ComfyUI वर्कफ़्लो और API: फ़्री लिप सिंक अवतार

InfiniteTalk एक ओपन-सोर्स मॉडल है जो एक फ़ोटो और एक ऑडियो फ़ाइल को ऐसे बोलते वीडियो में बदल देता है जिसमें होंठ, सिर और शरीर की हरकतें आपस में सिंक होती हैं। यह लेख ComfyUI वर्कफ़्लो, ज़रूरी सेटिंग्स, होस्टेड और सेल्फ़-होस्टेड API कॉल, और जल्दी नतीजों के लिए ब्राउज़र-आधारित विकल्प दिखाता है।

InfiniteTalk ComfyUI वर्कफ़्लो और API: फ़्री लिप सिंक अवतार
Cristian Da Conceicao
Picasso IA के संस्थापक

आपके पास एक फ़ोटो है, एक वॉइस रिकॉर्डिंग है, और कैमरा क्रू नहीं है। InfiniteTalk इन दोनों फ़ाइलों को ऐसे वीडियो में बदल देता है जिसमें तस्वीर वाला व्यक्ति सचमुच बोलता दिखता है, उसके होंठ, सिर और कंधे ऑडियो के साथ तालमेल में चलते हैं। इसके वेट्स Apache 2.0 लाइसेंस के तहत ओपन हैं, ComfyUI इन्हें आपकी अपनी GPU पर चला सकता है, और जब आपके पास GPU न हो तो होस्टेड API इन्हें चला सकता है। यह लेख दोनों रास्ते समझाता है: ComfyUI वर्कफ़्लो चरण-दर-चरण, वे सेटिंग्स जो नतीजे बदलती हैं, API कॉल, और PicassoIA पर बिना इंस्टॉल वाला विकल्प, उन दिनों के लिए जब लोकल सेटअप काम से ज़्यादा मेहनत माँगता हो।

InfiniteTalk असल में क्या करता है

InfiniteTalk MeiGen-AI टीम से आता है। कोड, वेट्स और तकनीकी रिपोर्ट 19 अगस्त 2025 को सार्वजनिक हुए। यह Wan 2.1 इमेज-टू-वीडियो मॉडल के 14B, 480P चेकपॉइंट पर बना है, और यह wav2vec2 एनकोडर के ज़रिए ऑडियो पढ़ता है। इसमें 480p और 720p दोनों आउटपुट समर्थित हैं।

इस मॉडल की एक वंशावली है। उसी समूह का पहले का MultiTalk ऑडियो-संचालित बातचीत वाले वीडियो संभालता था, और ComfyUI रैपर अब भी उसे InfiniteTalk के साथ सूचीबद्ध करता है। InfiniteTalk होंठों की हरकत के ऊपर अनलिमिटेड-लंबाई जेनरेशन और पूरे शरीर की मोशन जोड़ता है। रिपॉज़िटरी के न्यूज़ सेक्शन में अब एक उत्तराधिकारी परिवार LongCat Video Avatar का भी ज़िक्र है, इसलिए उसी टीम के सबसे नए वेट्स के लिए उसे देखें।

मैट मॉनिटर पर बीच वाक्य में बोलती एक महिला के रुके हुए वीडियो फ़्रेम को देखता एक युवा व्यक्ति

स्पार्स-फ़्रेम डबिंग, सरल शब्दों में

ज़्यादातर पुराने लिप सिंक टूल मुँह के आसपास का हिस्सा दोबारा पेंट करते हैं और बाकी चेहरा जमा रहता है। नतीजा एक बोलते मास्क जैसा दिखता है। InfiniteTalk उस चीज़ का इस्तेमाल करता है जिसे इसके लेखक स्पार्स-फ़्रेम वीडियो डबिंग कहते हैं: यह पहचान स्थिर रखने के लिए कुछ रेफ़रेंस फ़्रेम रखता है, फिर बीच के सभी फ़्रेम जेनरेट करता है ताकि होंठ, सिर का मुड़ना, मुद्रा और चेहरे के भाव सब ऑडियो के साथ चलें। लंबे क्लिप चेन्ड कॉन्टेक्स्ट विंडो से बनते हैं, जिनकी डिफ़ॉल्ट विंडो 81 फ़्रेम है। इसी वजह से बोलता वीडियो आम पाँच सेकंड की सीमा से काफ़ी आगे जा सकता है।

इमेज मोड बनाम वीडियो मोड

मोडआप क्या देते हैंसबसे अच्छा किसके लिएलंबाई
इमेज से वीडियोएक फ़ोटो और एक ऑडियो फ़ाइलनैरेटर, अवतार, गायक, प्रवक्ताक्वालिटी गिरने से पहले लगभग एक मिनट तक
वीडियो से वीडियोएक मौजूदा क्लिप और नया ऑडियोडबिंग, आवाज़ बदलना, कैमरा मूवमेंट बनाए रखनासिद्धांत में अनलिमिटेड

💡 इमेज मोड से शुरू करें। इसमें सबसे कम इनपुट चाहिए और इसकी विफलताएँ सबसे साफ़ दिखती हैं, तो किसी सोर्स वीडियो को शामिल करने से पहले आप देख लेंगे कि ऑडियो सेटिंग्स क्या बदलती हैं।

क्या यह सचमुच मुफ़्त है?

लाइसेंस मुफ़्त है। कंप्यूट मुफ़्त नहीं है। यही फ़र्क तय करता है कि आपको कौन-सा रास्ता चुनना चाहिए।

रास्ताइसकी लागतआप क्या छोड़ते हैं
लोकल ComfyUIआपकी GPU और बिजलीसेटअप का समय, VRAM की सीमाएँ, छोटे कार्ड पर धीमी रेंडरिंग
होस्टेड APIआउटपुट के हर सेकंड का बिल। लिखे जाने के समय WaveSpeed 480p पर लगभग $0.03 प्रति सेकंड और 720p पर $0.06 प्रति सेकंड बताता है, प्रति जॉब 10 मिनट तकलगातार खर्च, ग्राफ़ पर कम नियंत्रण
PicassoIA पर ब्राउज़र मॉडलकई लिपसिंक मॉडल पर आज़माने के लिए मुफ़्तएक अलग मॉडल, छोटे क्लिप

मुफ़्त की एक समय-क़ीमत भी है। पहली लोकल इंस्टॉल में नोड इंस्टॉल और डाउनलोड में दोपहर का अच्छा-खासा हिस्सा लग जाता है, और अकेले मॉडल फ़ाइलें दसियों गीगाबाइट की हैं। रास्ता इस बात से परखें कि आप कितने क्लिप बनाने वाले हैं, न कि स्टिकर प्राइस से।

हार्डवेयर की असलियत की जाँच

InfiniteTalk 14 अरब पैरामीटर वाले वीडियो मॉडल पर बना है, इसलिए मेमोरी ही पहली दीवार है जिससे आप टकराते हैं। आधिकारिक रिपॉज़िटरी एक लो VRAM मोड (--num_persistent_param_in_dit 0) भेजती है, जो स्टेप्स के बीच वेट्स को GPU से बाहर रखती है, और एक FP8 क्वांटाइज़्ड चेकपॉइंट भी देती है। ComfyUI में Kijai की FP8 स्केल्ड फ़ाइलें यही काम करती हैं। मैं कोई VRAM संख्या नहीं दूँगा, क्योंकि वह रिज़ॉल्यूशन, फ़्रेम गिनती और क्वांटाइज़ेशन के साथ बदलती है। 720p रेंडर पर शाम लगाने से पहले 480p, 10 सेकंड की क्लिप से टेस्ट करें।

खुले PC केस में लगे ग्राफ़िक्स कार्ड का मैक्रो क्लोज़-अप

ComfyUI वर्कफ़्लो बनाएँ

ComfyUI सपोर्ट Kijai के ComfyUI-WanVideoWrapper से आता है। comfy.org पर InfiniteTalk म्यूज़िक टेम्पलेट तीन नोड पैक सूचीबद्ध करता है: WanVideoWrapper, audio-separation-nodes-comfyui, और comfyui-kjnodes। मिलकर ये मॉडल लोड करते हैं, वॉइस को संगीत से अलग करते हैं, और इमेज व वीडियो की प्लंबिंग संभालते हैं।

कस्टम नोड इंस्टॉल करें

  1. ComfyUI/custom_nodes में एक टर्मिनल खोलें और रैपर को क्लोन करें।
  2. pip install -r requirements.txt से इसकी आवश्यकताएँ इंस्टॉल करें (पोर्टेबल बिल्ड में इसके बजाय बंडल्ड python_embeded इंटरप्रेटर इस्तेमाल होता है)।
  3. ComfyUI Manager के ज़रिए ऑडियो सेपरेशन और kjnodes पैक जोड़ें।
  4. नए नोड रजिस्टर होने के लिए ComfyUI को रीस्टार्ट करें।
cd ComfyUI/custom_nodes
git clone https://github.com/kijai/ComfyUI-WanVideoWrapper
pip install -r ComfyUI-WanVideoWrapper/requirements.txt

लैपटॉप, एक SSD और हाथ से लिखी सेटअप चेकलिस्ट वाली मेज़ का टॉप-डाउन दृश्य

मॉडल फ़ाइलें डाउनलोड करें

रैपर का README मॉडलों को चार फ़ोल्डरों में बाँटता है: text_encoders, clip_vision, diffusion_models, और vae। InfiniteTalk Wan 2.1 बेस के ऊपर अपने वेट्स जोड़ता है।

फ़ाइलफ़ोल्डरनोट्स
Wan 2.1 इमेज-टू-वीडियो 14Bdiffusion_modelsबेस मॉडल, FP8 स्केल्ड वर्ज़न उपलब्ध हैं
UMT5 टेक्स्ट एनकोडरtext_encodersवही जो Wan 2.1 वर्कफ़्लो इस्तेमाल करते हैं
Wan 2.1 VAEvaeदूसरे Wan वर्कफ़्लो के साथ साझा
CLIP विज़न मॉडलclip_visionरेफ़रेंस फ़ोटो पढ़ता है
InfiniteTalk Single (fp16, लगभग 5.1 GB)diffusion_modelsएक वक्ता
InfiniteTalk Multi (fp16, लगभग 5.1 GB)diffusion_modelsदो वक्ता

दोनों InfiniteTalk फ़ाइलें Hugging Face पर Kijai की WanVideo_comfy रिपॉज़िटरी के InfiniteTalk फ़ोल्डर में रहती हैं। फ़ाइल कॉपी करने के बाद अगर लोडर ड्रॉपडाउन खाली रहे, तो ComfyUI रिफ़्रेश करें और फ़ोल्डर दोबारा जाँचें।

ग्राफ़ जोड़ें

नोड के नाम रैपर के अलग-अलग वर्ज़न में बदलते रहते हैं, इसलिए शुरू से बनाने के बजाय रैपर के example_workflows फ़ोल्डर से उदाहरण वर्कफ़्लो खोलें। तर्क हमेशा एक जैसा रहता है:

  • इमेज ब्रांच: पोर्ट्रेट लोड करें, उसे लक्ष्य रिज़ॉल्यूशन पर रीसाइज़ करें, और CLIP विज़न मॉडल से एनकोड करें।
  • ऑडियो ब्रांच: ऑडियो लोड करें, वॉइस को किसी भी संगीत से अलग करें, और ऑडियो एम्बेडिंग पाने के लिए wav2vec2 एनकोडर से गुज़ारें।
  • मॉडल ब्रांच: Wan 2.1 बेस लोड करें, InfiniteTalk वेट्स को अतिरिक्त मॉडल की तरह जोड़ें, और चाहें तो स्पीड LoRA जोड़ें।
  • सैंपलर: इमेज एम्बेड्स, टेक्स्ट एम्बेड्स और ऑडियो एम्बेड्स को सैंपलर में डालें, फिर VAE से डिकोड करें।
  • आउटपुट: फ़्रेम और मूल ऑडियो को मिलाकर MP4 बनाएँ।

💡 सैंपल लेने से पहले रीसाइज़ करें। जो पोर्ट्रेट लक्ष्य आस्पेक्ट रेशियो से मेल नहीं खाता, वह ऐसे तरीकों से खिंचता या कटता है जो खराब लिप सिंक जैसा दिखता है, जबकि असल में गलती इनपुट की होती है।

ऑडियो और पोर्ट्रेट तैयार करें

ग्राफ़ नतीजे का सिर्फ़ आधा हिस्सा है। बाकी का फ़ैसला दो इनपुट फ़ाइलें करती हैं।

ऐसा ऑडियो जो साफ़ सिंक हो

सिर्फ़ वॉइस सबसे सुरक्षित इनपुट है। आवाज़ के नीचे का बैकग्राउंड म्यूज़िक होंठों के आकार धुंधले कर देता है, इसीलिए ComfyUI टेम्पलेट में ऑडियो सेपरेशन नोड शामिल हैं जो मिक्स से वोकल्स निकालते हैं। शुरुआत का खाली हिस्सा काटें, लाउडनेस बराबर करें, और जहाँ हो सके WAV में एक्सपोर्ट करें।

रिकॉर्डिंग नहीं है? उसके बजाय वॉइस जेनरेट करें। Speech 2.8 HD और ElevenLabs v3 दोनों स्क्रिप्ट को साफ़ वॉइसओवर में बदल देते हैं, जिसे सीधे ऑडियो ब्रांच में डाला जा सकता है।

इमेज मोड में लगभग एक मिनट के बाद क्वालिटी गिरती है, इसलिए मोनोलॉग के बजाय दृश्यों के लिए लिखें। लंबी स्क्रिप्ट को 20 से 40 सेकंड के हिस्सों में बाँटें, हर हिस्सा एक ही पोर्ट्रेट और एक ही सीड से रेंडर करें, और किसी भी वीडियो एडिटर में जोड़ें। पॉज़ पर कट करने से जोड़ छिप जाता है, और दोहराया गया पोर्ट्रेट दृश्य-दर-दृश्य पहचान स्थिर रखता है।

कंडेंसर माइक्रोफ़ोन के बगल में ऑडियो इंटरफ़ेस की नॉब घुमाते हाथ

काम करने वाली सोर्स फ़ोटो

पोर्ट्रेट आपके अवतार का पहला फ़्रेम है, इसलिए उसकी हर खामी पूरे वीडियो में चलती है।

  • कैमरे की ओर देखता चेहरा, होंठ आराम से या हल्के बंद।
  • कंधे दिखें, क्योंकि InfiniteTalk मुद्रा को भी एनिमेट करता है।
  • होंठों पर कड़ी छाया के बिना एक समान रोशनी।
  • हाथ, माइक्रोफ़ोन और बाल मुँह से दूर रखें।

कोई उपयुक्त फ़ोटो नहीं है? Seedream 4.5 से एक बनाएँ और न्यूट्रल एक्सप्रेशन, सामने की ओर देखता चेहरा और नरम खिड़की वाली रोशनी माँगें।

नेवी ब्लेज़र में पचास साल के आसपास की एक महिला, न्यूट्रल भाव के साथ कैमरे की ओर देखती हुई

नतीजा बदलने वाली सेटिंग्स

दो डायल ज़्यादातर काम करते हैं: सैंपलिंग स्टेप्स की संख्या और ऑडियो CFG स्केल। जब तक ये दोनों ठीक से व्यवहार न करें, बाकी सब गौण है।

स्टेप्स और ऑडियो CFG

आधिकारिक डिफ़ॉल्ट 40 सैंपलिंग स्टेप्स इस्तेमाल करते हैं। ऑडियो CFG के लिए रिपॉज़िटरी अच्छे लिप सिंक के लिए 3 से 5 के बीच की वैल्यू सुझाती है। व्यवहार में, ज़्यादा वैल्यू मुँह को ऑडियो का और सख़्ती से पालन करवाती है, और उसे ज़्यादा बढ़ाने पर चेहरा अकड़ा हुआ लगने लगता है।

सेटिंगशुरुआती वैल्यूयह क्या करती है
सैंपलिंग स्टेप्स40डिटेल और स्थिरता, रेंडर धीमे
ऑडियो CFG3 से 5ऑडियो और मुँह के बीच जोड़ की ताकत
रिज़ॉल्यूशनपहले 480p, फ़ाइनल के लिए 720pशार्पनेस बनाम रेंडर समय और मेमोरी
सीडटेस्टिंग के दौरान फ़िक्स्डएक बार में एक सेटिंग बदलने देता है

LoRA के साथ फ़ास्ट मोड

14B मॉडल पर चालीस स्टेप्स धीमे हैं। रिपॉज़िटरी दो शॉर्टकट बताती है: FusionX LoRA के साथ 8 स्टेप्स, या lightx2v LoRA के साथ 4 स्टेप्स। स्पीड LoRA इस्तेमाल करें तो ऑडियो CFG को लगभग 2 तक ले आएँ। त्वचा और बालों की कुछ बारीक टेक्सचर खो जाती है, इसलिए फ़ास्ट मोड ड्राफ़्ट के लिए और छोटे आकार में देखी जाने वाली क्लिप के लिए इस्तेमाल करें, फिर सबसे अच्छे टेक को पूरे स्टेप्स पर दोबारा रेंडर करें।

जब रेंडर बिगड़ता है, तो लक्षण आमतौर पर एक ही कारण की ओर इशारा करता है:

लक्षणसंभावित कारणसमाधान
होंठ ऑडियो से दूर खिसकते हैंऑडियो CFG बहुत कम, या वॉइस के नीचे संगीतऑडियो CFG को 4 की ओर बढ़ाएँ और वोकल्स अलग करें
अकड़ा हुआ, मास्क जैसा चेहराऑडियो CFG बहुत ज़्यादाउसे एक अंक घटाएँ और उसी सीड से दोबारा रेंडर करें
लंबी क्लिप में चेहरा धीरे-धीरे बदलता हैइमेज मोड अपनी लगभग एक मिनट की सीमा से आगेस्क्रिप्ट को दृश्यों में बाँटें और एडिटर में जोड़ें
Out of memory एरररिज़ॉल्यूशन या फ़्रेम विंडो बहुत बड़ी480p पर जाएँ, FP8 फ़ाइलें इस्तेमाल करें, या लो VRAM सेटिंग चालू करें
खामोशी में मुँह खुलता हैसाँस की आवाज़ या कमरे की गुनगुनाहट को बोलना समझा गयालोड करने से पहले नॉइज़ गेट से ऑडियो साफ़ करें

💡 सीड तय रखें, एक चीज़ बदलें। ऑडियो CFG समायोजित करते समय वही पाँच सेकंड 480p पर रेंडर करें। मुँह सही लगने लगे, तब रिज़ॉल्यूशन बढ़ाएँ।

API से InfiniteTalk कॉल करें

API दस मिनट की मैन्युअल प्रक्रिया को एक फ़ंक्शन कॉल में बदल देता है। GPU किसके पास है, इस पर निर्भर करते हुए आपके पास दो विकल्प हैं।

होस्टेड API रास्ता

WaveSpeed InfiniteTalk को POST https://api.wavespeed.ai/api/v3/wavespeed-ai/infinitetalk पर होस्ट करता है। रिक्वेस्ट में image, audio, resolution (480p या 720p), seed, एक वैकल्पिक prompt, और एक वैकल्पिक mask_image जाते हैं। आपको एक प्रेडिक्शन ID मिलता है, फिर स्टेटस अंतिम स्थिति तक पहुँचने तक हर कुछ सेकंड में एक रिज़ल्ट URL पोल करें। प्रति जॉब 10 मिनट तक का ऑडियो स्वीकार होता है।

import os, time, requests

TOKEN = os.environ["WAVESPEED_TOKEN"]
HEADERS = {"Authorization": f"Bearer {TOKEN}"}
BASE = "https://api.wavespeed.ai/api/v3"

job = requests.post(
    f"{BASE}/wavespeed-ai/infinitetalk",
    headers=HEADERS,
    json={
        "image": "https://example.com/portrait.jpg",
        "audio": "https://example.com/voice.wav",
        "resolution": "480p",
    },
).json()["data"]

while True:
    result = requests.get(f"{BASE}/predictions/{job['id']}/result", headers=HEADERS).json()["data"]
    if result["status"] not in ("created", "processing"):
        break
    time.sleep(2)

print(result["status"], result.get("outputs"))

इस स्निपेट को शुरुआती बिंदु मानें, और शिप करने से पहले मौजूदा स्कीमा के लिए मॉडल पेज देख लें। रिज़ोल्यूशन और क्यू के लोड के आधार पर, हर सेकंड के वीडियो पर लगभग 10 से 30 सेकंड के इंतज़ार की उम्मीद रखें।

आपका अपना ComfyUI एंडपॉइंट

ComfyUI पहले से एक HTTP सर्वर चलाता है, इसलिए वर्कफ़्लो को एक्सपोर्ट करते ही वह एक API बन जाता है। Save (API Format) इस्तेमाल करें, JSON के अंदर इमेज और ऑडियो फ़ाइलनेम बदलें, फिर उसे /prompt पर पोस्ट करें।

import json, time, requests

COMFY = "http://127.0.0.1:8188"
workflow = json.load(open("infinitetalk_api.json"))

prompt_id = requests.post(f"{COMFY}/prompt", json={"prompt": workflow}).json()["prompt_id"]

while True:
    history = requests.get(f"{COMFY}/history/{prompt_id}").json()
    if prompt_id in history:
        break
    time.sleep(3)

print(history[prompt_id]["outputs"])

वर्कफ़्लो में नामित फ़ाइलें पहले से ComfyUI के input फ़ोल्डर में होनी चाहिए, या पहले /upload/image एंडपॉइंट पर अपलोड की गई हों। आउटपुट में दी गई फ़ाइलनेम के साथ /view से तैयार वीडियो लाएँ।

सर्वर रैक की पंक्ति का लो-एंगल दृश्य, दूर के सिरे पर एक टेक्नीशियन

💡 पोर्ट 8188 को कभी खुले इंटरनेट पर न खोलें। ComfyUI में कोई लॉगिन नहीं है। आपके नेटवर्क के बाहर का कोई भी व्यक्ति पहुँच सके, उससे पहले इसे VPN या ऑथेंटिकेशन वाले रिवर्स प्रॉक्सी के पीछे रखें।

बोलते अवतार सचमुच कहाँ काम आते हैं

बोलता अवतार तब अपनी जगह बनाता है जब कैमरे पर किसी व्यक्ति की रिकॉर्डिंग धीमी, महँगी या दोहराना असंभव हो।

  • पाठ और ट्रेनिंग: एक इंस्ट्रक्टर की फ़ोटो और एक स्क्रिप्ट से एक जैसे वीडियो मॉड्यूल मिलते हैं, और एक वाक्य बदलने के लिए दोबारा शूट नहीं, बल्कि दोबारा रेंडर करना होता है।
  • प्रोडक्ट वॉकथ्रू: एक प्रवक्ता अवतार ऑडियो बदलकर एक ही पेज को कई भाषाओं में नैरेट कर सकता है।
  • पॉडकास्ट क्लिप: Multi मॉडल दो वक्ताओं को संभालता है, जो सोशल मीडिया के लिए इंटरव्यू के अंश के लिए ठीक है।
  • संगीत और कैरेक्टर का काम: गायक, मस्कॉट और चित्रित कैरेक्टर तब तक अच्छे चलते हैं जब तक चेहरा साफ़ दिखे।

व्हाइटबोर्ड के बगल में स्मार्टफ़ोन ट्राइपॉड पर पाठ रिकॉर्ड करता एक शिक्षक

बूम आर्म माइक्रोफ़ोन वाली पॉडकास्ट मेज़ पर हँसते दो दोस्त

💡 अनुमति लें। अपने चेहरे, किसी लाइसेंस्ड कैरेक्टर, या किसी ऐसे व्यक्ति को एनिमेट करें जिसने इसकी सहमति दी हो, और जब नतीजा असली रिकॉर्डिंग जैसा लग सकता हो, तो उसे AI से बना हुआ लेबल करें।

PicassoIA पर सेटअप छोड़ें

PicassoIA खुद InfiniteTalk होस्ट नहीं करता। लेकिन यह कई फ़ोटो और ऑडियो वाले मॉडल देता है जो ब्राउज़र टैब में उसी तरह का नतीजा देते हैं, न कोई नोड, न कोई डाउनलोड, न VRAM का हिसाब।

एक लिपसिंक मॉडल चुनें

मॉडलइनपुटजानने लायक बातें
Omni Human 1.5फ़ोटो और ऑडियो35 सेकंड से छोटा ऑडियो, वैकल्पिक टेक्स्ट प्रॉम्प्ट, फ़ास्ट मोड
Fabric 1.0फ़ोटो और ऑडियो480p या 720p आउटपुट का विकल्प
Wan 2.2 S2Vफ़ोटो, ऑडियो और प्रॉम्प्टप्रॉम्प्ट मोशन और मूड तय करता है, डिफ़ॉल्ट रूप से प्रति चंक 81 फ़्रेम
Kling Avatar v2फ़ोटो और ऑडियो (MP3, WAV, M4A, या AAC)Standard या Pro मोड, कार्टून और जानवरों को भी संभालता है
P Video Avatarफ़ोटो और टाइप की गई स्क्रिप्ट या आपका अपना ऑडियो30+ बिल्ट-इन आवाज़ें, 1080p तक
Lipsync 2 Proमौजूदा वीडियो और WAV ऑडियोएक्टिव स्पीकर डिटेक्शन और पाँच सिंक मोड

अगर आप वीडियो से वीडियो डबिंग के लिए आए हैं तो आखिरी पंक्ति मायने रखती है: Lipsync 2 Pro उस फ़ुटेज पर काम करता है जो आप पहले ही शूट कर चुके हैं। कौन-सा रास्ता सही है, यह काम पर निर्भर करता है:

  • लोकल ComfyUI चुनें एक मिनट से लंबी क्लिप, दो वक्ताओं वाले Multi मॉडल, ऐसी डबिंग के लिए जो मूल कैमरा मूव बनाए रखे, या हर सैंपलर सेटिंग पर पूरा नियंत्रण चाहिए तो।
  • होस्टेड API चुनें जब आपका अपना ऐप माँग पर अवतार बनाए और आप GPU को चालू रखने के बजाय प्रति सेकंड भुगतान करना पसंद करें।
  • PicassoIA मॉडल चुनें जब आपको अगले दस मिनट में नतीजा चाहिए, आपका ऑडियो 35 सेकंड से छोटा है, और InfiniteTalk के सटीक लुक से मेल खाने की तुलना में रफ़्तार ज़्यादा मायने रखती है।

आपकी पहली क्लिप के चरण

  1. PicassoIA पर Omni Human 1.5 पेज खोलें।
  2. सामने की ओर देखता पोर्ट्रेट अपलोड करें। चेहरे, पूरे शरीर के शॉट और चित्रित कैरेक्टर, सब काम करते हैं।
  3. 35 सेकंड से छोटी MP3 या WAV फ़ाइल अपलोड करें। अंग्रेज़ी, स्पेनिश, जापानी, कोरियाई, चीनी और इंडोनेशियाई ऑडियो समर्थित हैं।
  4. कैमरा मूवमेंट या हावभाव तय करने के लिए वैकल्पिक प्रॉम्प्ट जोड़ें, जैसे "she smiles and nods slightly"।
  5. त्वरित ड्राफ़्ट के लिए फ़ास्ट मोड चालू करें, या सबसे अच्छी डिटेल के लिए बंद रखें।
  6. अगर नतीजा दोबारा चाहिए तो सीड सेट करें, फिर जेनरेट करके वीडियो डाउनलोड करें।

💡 पहले स्क्रिप्ट लिखें, उसे Speech 2.8 HD से रिकॉर्ड करें, और हर क्लिप को 35 सेकंड की सीमा के भीतर रखें। छोटी क्लिप जोड़कर बनाया गया वीडियो एक लंबे टेक से ज़्यादा स्वाभाविक लगता है।

अपना पहला अवतार बनाएँ

एक पोर्ट्रेट चुनें, 20 सेकंड का ऑडियो रिकॉर्ड करें, और वही क्लिप दो-तीन मॉडल पर चलाएँ। नतीजों को साथ-साथ देखने में कुछ मिनट लगते हैं और यह किसी स्पेक सीट से ज़्यादा बताता है। PicassoIA पर Omni Human 1.5 या Fabric 1.0 खोलें, अपनी दोनों फ़ाइलें अपलोड करें, और एक स्थिर फ़ोटो को बोलते देखें। बाद में अगर आप लोकल पाइपलाइन चाहें, तो तब तक आप जान चुके होंगे कि अच्छा इनपुट कैसा होता है।

चमकदार लॉफ़्ट स्टूडियो में अपने स्मार्टफ़ोन को देखकर मुस्कुराती एक युवा महिला

यह लेख शेयर करें

अपनी भाषा चुनें

संबंधित लेख