InfiniteTalk ComfyUI वर्कफ़्लो और API: फ़्री लिप सिंक अवतार
InfiniteTalk एक ओपन-सोर्स मॉडल है जो एक फ़ोटो और एक ऑडियो फ़ाइल को ऐसे बोलते वीडियो में बदल देता है जिसमें होंठ, सिर और शरीर की हरकतें आपस में सिंक होती हैं। यह लेख ComfyUI वर्कफ़्लो, ज़रूरी सेटिंग्स, होस्टेड और सेल्फ़-होस्टेड API कॉल, और जल्दी नतीजों के लिए ब्राउज़र-आधारित विकल्प दिखाता है।
आपके पास एक फ़ोटो है, एक वॉइस रिकॉर्डिंग है, और कैमरा क्रू नहीं है। InfiniteTalk इन दोनों फ़ाइलों को ऐसे वीडियो में बदल देता है जिसमें तस्वीर वाला व्यक्ति सचमुच बोलता दिखता है, उसके होंठ, सिर और कंधे ऑडियो के साथ तालमेल में चलते हैं। इसके वेट्स Apache 2.0 लाइसेंस के तहत ओपन हैं, ComfyUI इन्हें आपकी अपनी GPU पर चला सकता है, और जब आपके पास GPU न हो तो होस्टेड API इन्हें चला सकता है। यह लेख दोनों रास्ते समझाता है: ComfyUI वर्कफ़्लो चरण-दर-चरण, वे सेटिंग्स जो नतीजे बदलती हैं, API कॉल, और PicassoIA पर बिना इंस्टॉल वाला विकल्प, उन दिनों के लिए जब लोकल सेटअप काम से ज़्यादा मेहनत माँगता हो।
InfiniteTalk असल में क्या करता है
InfiniteTalk MeiGen-AI टीम से आता है। कोड, वेट्स और तकनीकी रिपोर्ट 19 अगस्त 2025 को सार्वजनिक हुए। यह Wan 2.1 इमेज-टू-वीडियो मॉडल के 14B, 480P चेकपॉइंट पर बना है, और यह wav2vec2 एनकोडर के ज़रिए ऑडियो पढ़ता है। इसमें 480p और 720p दोनों आउटपुट समर्थित हैं।
इस मॉडल की एक वंशावली है। उसी समूह का पहले का MultiTalk ऑडियो-संचालित बातचीत वाले वीडियो संभालता था, और ComfyUI रैपर अब भी उसे InfiniteTalk के साथ सूचीबद्ध करता है। InfiniteTalk होंठों की हरकत के ऊपर अनलिमिटेड-लंबाई जेनरेशन और पूरे शरीर की मोशन जोड़ता है। रिपॉज़िटरी के न्यूज़ सेक्शन में अब एक उत्तराधिकारी परिवार LongCat Video Avatar का भी ज़िक्र है, इसलिए उसी टीम के सबसे नए वेट्स के लिए उसे देखें।
स्पार्स-फ़्रेम डबिंग, सरल शब्दों में
ज़्यादातर पुराने लिप सिंक टूल मुँह के आसपास का हिस्सा दोबारा पेंट करते हैं और बाकी चेहरा जमा रहता है। नतीजा एक बोलते मास्क जैसा दिखता है। InfiniteTalk उस चीज़ का इस्तेमाल करता है जिसे इसके लेखक स्पार्स-फ़्रेम वीडियो डबिंग कहते हैं: यह पहचान स्थिर रखने के लिए कुछ रेफ़रेंस फ़्रेम रखता है, फिर बीच के सभी फ़्रेम जेनरेट करता है ताकि होंठ, सिर का मुड़ना, मुद्रा और चेहरे के भाव सब ऑडियो के साथ चलें। लंबे क्लिप चेन्ड कॉन्टेक्स्ट विंडो से बनते हैं, जिनकी डिफ़ॉल्ट विंडो 81 फ़्रेम है। इसी वजह से बोलता वीडियो आम पाँच सेकंड की सीमा से काफ़ी आगे जा सकता है।
इमेज मोड बनाम वीडियो मोड
मोड
आप क्या देते हैं
सबसे अच्छा किसके लिए
लंबाई
इमेज से वीडियो
एक फ़ोटो और एक ऑडियो फ़ाइल
नैरेटर, अवतार, गायक, प्रवक्ता
क्वालिटी गिरने से पहले लगभग एक मिनट तक
वीडियो से वीडियो
एक मौजूदा क्लिप और नया ऑडियो
डबिंग, आवाज़ बदलना, कैमरा मूवमेंट बनाए रखना
सिद्धांत में अनलिमिटेड
💡 इमेज मोड से शुरू करें। इसमें सबसे कम इनपुट चाहिए और इसकी विफलताएँ सबसे साफ़ दिखती हैं, तो किसी सोर्स वीडियो को शामिल करने से पहले आप देख लेंगे कि ऑडियो सेटिंग्स क्या बदलती हैं।
क्या यह सचमुच मुफ़्त है?
लाइसेंस मुफ़्त है। कंप्यूट मुफ़्त नहीं है। यही फ़र्क तय करता है कि आपको कौन-सा रास्ता चुनना चाहिए।
रास्ता
इसकी लागत
आप क्या छोड़ते हैं
लोकल ComfyUI
आपकी GPU और बिजली
सेटअप का समय, VRAM की सीमाएँ, छोटे कार्ड पर धीमी रेंडरिंग
होस्टेड API
आउटपुट के हर सेकंड का बिल। लिखे जाने के समय WaveSpeed 480p पर लगभग $0.03 प्रति सेकंड और 720p पर $0.06 प्रति सेकंड बताता है, प्रति जॉब 10 मिनट तक
लगातार खर्च, ग्राफ़ पर कम नियंत्रण
PicassoIA पर ब्राउज़र मॉडल
कई लिपसिंक मॉडल पर आज़माने के लिए मुफ़्त
एक अलग मॉडल, छोटे क्लिप
मुफ़्त की एक समय-क़ीमत भी है। पहली लोकल इंस्टॉल में नोड इंस्टॉल और डाउनलोड में दोपहर का अच्छा-खासा हिस्सा लग जाता है, और अकेले मॉडल फ़ाइलें दसियों गीगाबाइट की हैं। रास्ता इस बात से परखें कि आप कितने क्लिप बनाने वाले हैं, न कि स्टिकर प्राइस से।
हार्डवेयर की असलियत की जाँच
InfiniteTalk 14 अरब पैरामीटर वाले वीडियो मॉडल पर बना है, इसलिए मेमोरी ही पहली दीवार है जिससे आप टकराते हैं। आधिकारिक रिपॉज़िटरी एक लो VRAM मोड (--num_persistent_param_in_dit 0) भेजती है, जो स्टेप्स के बीच वेट्स को GPU से बाहर रखती है, और एक FP8 क्वांटाइज़्ड चेकपॉइंट भी देती है। ComfyUI में Kijai की FP8 स्केल्ड फ़ाइलें यही काम करती हैं। मैं कोई VRAM संख्या नहीं दूँगा, क्योंकि वह रिज़ॉल्यूशन, फ़्रेम गिनती और क्वांटाइज़ेशन के साथ बदलती है। 720p रेंडर पर शाम लगाने से पहले 480p, 10 सेकंड की क्लिप से टेस्ट करें।
ComfyUI वर्कफ़्लो बनाएँ
ComfyUI सपोर्ट Kijai के ComfyUI-WanVideoWrapper से आता है। comfy.org पर InfiniteTalk म्यूज़िक टेम्पलेट तीन नोड पैक सूचीबद्ध करता है: WanVideoWrapper, audio-separation-nodes-comfyui, और comfyui-kjnodes। मिलकर ये मॉडल लोड करते हैं, वॉइस को संगीत से अलग करते हैं, और इमेज व वीडियो की प्लंबिंग संभालते हैं।
कस्टम नोड इंस्टॉल करें
ComfyUI/custom_nodes में एक टर्मिनल खोलें और रैपर को क्लोन करें।
pip install -r requirements.txt से इसकी आवश्यकताएँ इंस्टॉल करें (पोर्टेबल बिल्ड में इसके बजाय बंडल्ड python_embeded इंटरप्रेटर इस्तेमाल होता है)।
ComfyUI Manager के ज़रिए ऑडियो सेपरेशन और kjnodes पैक जोड़ें।
नए नोड रजिस्टर होने के लिए ComfyUI को रीस्टार्ट करें।
cd ComfyUI/custom_nodes
git clone https://github.com/kijai/ComfyUI-WanVideoWrapper
pip install -r ComfyUI-WanVideoWrapper/requirements.txt
मॉडल फ़ाइलें डाउनलोड करें
रैपर का README मॉडलों को चार फ़ोल्डरों में बाँटता है: text_encoders, clip_vision, diffusion_models, और vae। InfiniteTalk Wan 2.1 बेस के ऊपर अपने वेट्स जोड़ता है।
फ़ाइल
फ़ोल्डर
नोट्स
Wan 2.1 इमेज-टू-वीडियो 14B
diffusion_models
बेस मॉडल, FP8 स्केल्ड वर्ज़न उपलब्ध हैं
UMT5 टेक्स्ट एनकोडर
text_encoders
वही जो Wan 2.1 वर्कफ़्लो इस्तेमाल करते हैं
Wan 2.1 VAE
vae
दूसरे Wan वर्कफ़्लो के साथ साझा
CLIP विज़न मॉडल
clip_vision
रेफ़रेंस फ़ोटो पढ़ता है
InfiniteTalk Single (fp16, लगभग 5.1 GB)
diffusion_models
एक वक्ता
InfiniteTalk Multi (fp16, लगभग 5.1 GB)
diffusion_models
दो वक्ता
दोनों InfiniteTalk फ़ाइलें Hugging Face पर Kijai की WanVideo_comfy रिपॉज़िटरी के InfiniteTalk फ़ोल्डर में रहती हैं। फ़ाइल कॉपी करने के बाद अगर लोडर ड्रॉपडाउन खाली रहे, तो ComfyUI रिफ़्रेश करें और फ़ोल्डर दोबारा जाँचें।
ग्राफ़ जोड़ें
नोड के नाम रैपर के अलग-अलग वर्ज़न में बदलते रहते हैं, इसलिए शुरू से बनाने के बजाय रैपर के example_workflows फ़ोल्डर से उदाहरण वर्कफ़्लो खोलें। तर्क हमेशा एक जैसा रहता है:
इमेज ब्रांच: पोर्ट्रेट लोड करें, उसे लक्ष्य रिज़ॉल्यूशन पर रीसाइज़ करें, और CLIP विज़न मॉडल से एनकोड करें।
ऑडियो ब्रांच: ऑडियो लोड करें, वॉइस को किसी भी संगीत से अलग करें, और ऑडियो एम्बेडिंग पाने के लिए wav2vec2 एनकोडर से गुज़ारें।
मॉडल ब्रांच: Wan 2.1 बेस लोड करें, InfiniteTalk वेट्स को अतिरिक्त मॉडल की तरह जोड़ें, और चाहें तो स्पीड LoRA जोड़ें।
सैंपलर: इमेज एम्बेड्स, टेक्स्ट एम्बेड्स और ऑडियो एम्बेड्स को सैंपलर में डालें, फिर VAE से डिकोड करें।
आउटपुट: फ़्रेम और मूल ऑडियो को मिलाकर MP4 बनाएँ।
💡 सैंपल लेने से पहले रीसाइज़ करें। जो पोर्ट्रेट लक्ष्य आस्पेक्ट रेशियो से मेल नहीं खाता, वह ऐसे तरीकों से खिंचता या कटता है जो खराब लिप सिंक जैसा दिखता है, जबकि असल में गलती इनपुट की होती है।
ऑडियो और पोर्ट्रेट तैयार करें
ग्राफ़ नतीजे का सिर्फ़ आधा हिस्सा है। बाकी का फ़ैसला दो इनपुट फ़ाइलें करती हैं।
ऐसा ऑडियो जो साफ़ सिंक हो
सिर्फ़ वॉइस सबसे सुरक्षित इनपुट है। आवाज़ के नीचे का बैकग्राउंड म्यूज़िक होंठों के आकार धुंधले कर देता है, इसीलिए ComfyUI टेम्पलेट में ऑडियो सेपरेशन नोड शामिल हैं जो मिक्स से वोकल्स निकालते हैं। शुरुआत का खाली हिस्सा काटें, लाउडनेस बराबर करें, और जहाँ हो सके WAV में एक्सपोर्ट करें।
रिकॉर्डिंग नहीं है? उसके बजाय वॉइस जेनरेट करें। Speech 2.8 HD और ElevenLabs v3 दोनों स्क्रिप्ट को साफ़ वॉइसओवर में बदल देते हैं, जिसे सीधे ऑडियो ब्रांच में डाला जा सकता है।
इमेज मोड में लगभग एक मिनट के बाद क्वालिटी गिरती है, इसलिए मोनोलॉग के बजाय दृश्यों के लिए लिखें। लंबी स्क्रिप्ट को 20 से 40 सेकंड के हिस्सों में बाँटें, हर हिस्सा एक ही पोर्ट्रेट और एक ही सीड से रेंडर करें, और किसी भी वीडियो एडिटर में जोड़ें। पॉज़ पर कट करने से जोड़ छिप जाता है, और दोहराया गया पोर्ट्रेट दृश्य-दर-दृश्य पहचान स्थिर रखता है।
काम करने वाली सोर्स फ़ोटो
पोर्ट्रेट आपके अवतार का पहला फ़्रेम है, इसलिए उसकी हर खामी पूरे वीडियो में चलती है।
कैमरे की ओर देखता चेहरा, होंठ आराम से या हल्के बंद।
कंधे दिखें, क्योंकि InfiniteTalk मुद्रा को भी एनिमेट करता है।
होंठों पर कड़ी छाया के बिना एक समान रोशनी।
हाथ, माइक्रोफ़ोन और बाल मुँह से दूर रखें।
कोई उपयुक्त फ़ोटो नहीं है? Seedream 4.5 से एक बनाएँ और न्यूट्रल एक्सप्रेशन, सामने की ओर देखता चेहरा और नरम खिड़की वाली रोशनी माँगें।
नतीजा बदलने वाली सेटिंग्स
दो डायल ज़्यादातर काम करते हैं: सैंपलिंग स्टेप्स की संख्या और ऑडियो CFG स्केल। जब तक ये दोनों ठीक से व्यवहार न करें, बाकी सब गौण है।
स्टेप्स और ऑडियो CFG
आधिकारिक डिफ़ॉल्ट 40 सैंपलिंग स्टेप्स इस्तेमाल करते हैं। ऑडियो CFG के लिए रिपॉज़िटरी अच्छे लिप सिंक के लिए 3 से 5 के बीच की वैल्यू सुझाती है। व्यवहार में, ज़्यादा वैल्यू मुँह को ऑडियो का और सख़्ती से पालन करवाती है, और उसे ज़्यादा बढ़ाने पर चेहरा अकड़ा हुआ लगने लगता है।
सेटिंग
शुरुआती वैल्यू
यह क्या करती है
सैंपलिंग स्टेप्स
40
डिटेल और स्थिरता, रेंडर धीमे
ऑडियो CFG
3 से 5
ऑडियो और मुँह के बीच जोड़ की ताकत
रिज़ॉल्यूशन
पहले 480p, फ़ाइनल के लिए 720p
शार्पनेस बनाम रेंडर समय और मेमोरी
सीड
टेस्टिंग के दौरान फ़िक्स्ड
एक बार में एक सेटिंग बदलने देता है
LoRA के साथ फ़ास्ट मोड
14B मॉडल पर चालीस स्टेप्स धीमे हैं। रिपॉज़िटरी दो शॉर्टकट बताती है: FusionX LoRA के साथ 8 स्टेप्स, या lightx2v LoRA के साथ 4 स्टेप्स। स्पीड LoRA इस्तेमाल करें तो ऑडियो CFG को लगभग 2 तक ले आएँ। त्वचा और बालों की कुछ बारीक टेक्सचर खो जाती है, इसलिए फ़ास्ट मोड ड्राफ़्ट के लिए और छोटे आकार में देखी जाने वाली क्लिप के लिए इस्तेमाल करें, फिर सबसे अच्छे टेक को पूरे स्टेप्स पर दोबारा रेंडर करें।
जब रेंडर बिगड़ता है, तो लक्षण आमतौर पर एक ही कारण की ओर इशारा करता है:
लक्षण
संभावित कारण
समाधान
होंठ ऑडियो से दूर खिसकते हैं
ऑडियो CFG बहुत कम, या वॉइस के नीचे संगीत
ऑडियो CFG को 4 की ओर बढ़ाएँ और वोकल्स अलग करें
अकड़ा हुआ, मास्क जैसा चेहरा
ऑडियो CFG बहुत ज़्यादा
उसे एक अंक घटाएँ और उसी सीड से दोबारा रेंडर करें
लंबी क्लिप में चेहरा धीरे-धीरे बदलता है
इमेज मोड अपनी लगभग एक मिनट की सीमा से आगे
स्क्रिप्ट को दृश्यों में बाँटें और एडिटर में जोड़ें
Out of memory एरर
रिज़ॉल्यूशन या फ़्रेम विंडो बहुत बड़ी
480p पर जाएँ, FP8 फ़ाइलें इस्तेमाल करें, या लो VRAM सेटिंग चालू करें
खामोशी में मुँह खुलता है
साँस की आवाज़ या कमरे की गुनगुनाहट को बोलना समझा गया
लोड करने से पहले नॉइज़ गेट से ऑडियो साफ़ करें
💡 सीड तय रखें, एक चीज़ बदलें। ऑडियो CFG समायोजित करते समय वही पाँच सेकंड 480p पर रेंडर करें। मुँह सही लगने लगे, तब रिज़ॉल्यूशन बढ़ाएँ।
API से InfiniteTalk कॉल करें
API दस मिनट की मैन्युअल प्रक्रिया को एक फ़ंक्शन कॉल में बदल देता है। GPU किसके पास है, इस पर निर्भर करते हुए आपके पास दो विकल्प हैं।
होस्टेड API रास्ता
WaveSpeed InfiniteTalk को POST https://api.wavespeed.ai/api/v3/wavespeed-ai/infinitetalk पर होस्ट करता है। रिक्वेस्ट में image, audio, resolution (480p या 720p), seed, एक वैकल्पिक prompt, और एक वैकल्पिक mask_image जाते हैं। आपको एक प्रेडिक्शन ID मिलता है, फिर स्टेटस अंतिम स्थिति तक पहुँचने तक हर कुछ सेकंड में एक रिज़ल्ट URL पोल करें। प्रति जॉब 10 मिनट तक का ऑडियो स्वीकार होता है।
import os, time, requests
TOKEN = os.environ["WAVESPEED_TOKEN"]
HEADERS = {"Authorization": f"Bearer {TOKEN}"}
BASE = "https://api.wavespeed.ai/api/v3"
job = requests.post(
f"{BASE}/wavespeed-ai/infinitetalk",
headers=HEADERS,
json={
"image": "https://example.com/portrait.jpg",
"audio": "https://example.com/voice.wav",
"resolution": "480p",
},
).json()["data"]
while True:
result = requests.get(f"{BASE}/predictions/{job['id']}/result", headers=HEADERS).json()["data"]
if result["status"] not in ("created", "processing"):
break
time.sleep(2)
print(result["status"], result.get("outputs"))
इस स्निपेट को शुरुआती बिंदु मानें, और शिप करने से पहले मौजूदा स्कीमा के लिए मॉडल पेज देख लें। रिज़ोल्यूशन और क्यू के लोड के आधार पर, हर सेकंड के वीडियो पर लगभग 10 से 30 सेकंड के इंतज़ार की उम्मीद रखें।
आपका अपना ComfyUI एंडपॉइंट
ComfyUI पहले से एक HTTP सर्वर चलाता है, इसलिए वर्कफ़्लो को एक्सपोर्ट करते ही वह एक API बन जाता है। Save (API Format) इस्तेमाल करें, JSON के अंदर इमेज और ऑडियो फ़ाइलनेम बदलें, फिर उसे /prompt पर पोस्ट करें।
import json, time, requests
COMFY = "http://127.0.0.1:8188"
workflow = json.load(open("infinitetalk_api.json"))
prompt_id = requests.post(f"{COMFY}/prompt", json={"prompt": workflow}).json()["prompt_id"]
while True:
history = requests.get(f"{COMFY}/history/{prompt_id}").json()
if prompt_id in history:
break
time.sleep(3)
print(history[prompt_id]["outputs"])
वर्कफ़्लो में नामित फ़ाइलें पहले से ComfyUI के input फ़ोल्डर में होनी चाहिए, या पहले /upload/image एंडपॉइंट पर अपलोड की गई हों। आउटपुट में दी गई फ़ाइलनेम के साथ /view से तैयार वीडियो लाएँ।
💡 पोर्ट 8188 को कभी खुले इंटरनेट पर न खोलें। ComfyUI में कोई लॉगिन नहीं है। आपके नेटवर्क के बाहर का कोई भी व्यक्ति पहुँच सके, उससे पहले इसे VPN या ऑथेंटिकेशन वाले रिवर्स प्रॉक्सी के पीछे रखें।
बोलते अवतार सचमुच कहाँ काम आते हैं
बोलता अवतार तब अपनी जगह बनाता है जब कैमरे पर किसी व्यक्ति की रिकॉर्डिंग धीमी, महँगी या दोहराना असंभव हो।
पाठ और ट्रेनिंग: एक इंस्ट्रक्टर की फ़ोटो और एक स्क्रिप्ट से एक जैसे वीडियो मॉड्यूल मिलते हैं, और एक वाक्य बदलने के लिए दोबारा शूट नहीं, बल्कि दोबारा रेंडर करना होता है।
प्रोडक्ट वॉकथ्रू: एक प्रवक्ता अवतार ऑडियो बदलकर एक ही पेज को कई भाषाओं में नैरेट कर सकता है।
पॉडकास्ट क्लिप: Multi मॉडल दो वक्ताओं को संभालता है, जो सोशल मीडिया के लिए इंटरव्यू के अंश के लिए ठीक है।
संगीत और कैरेक्टर का काम: गायक, मस्कॉट और चित्रित कैरेक्टर तब तक अच्छे चलते हैं जब तक चेहरा साफ़ दिखे।
💡 अनुमति लें। अपने चेहरे, किसी लाइसेंस्ड कैरेक्टर, या किसी ऐसे व्यक्ति को एनिमेट करें जिसने इसकी सहमति दी हो, और जब नतीजा असली रिकॉर्डिंग जैसा लग सकता हो, तो उसे AI से बना हुआ लेबल करें।
PicassoIA पर सेटअप छोड़ें
PicassoIA खुद InfiniteTalk होस्ट नहीं करता। लेकिन यह कई फ़ोटो और ऑडियो वाले मॉडल देता है जो ब्राउज़र टैब में उसी तरह का नतीजा देते हैं, न कोई नोड, न कोई डाउनलोड, न VRAM का हिसाब।
अगर आप वीडियो से वीडियो डबिंग के लिए आए हैं तो आखिरी पंक्ति मायने रखती है: Lipsync 2 Pro उस फ़ुटेज पर काम करता है जो आप पहले ही शूट कर चुके हैं। कौन-सा रास्ता सही है, यह काम पर निर्भर करता है:
लोकल ComfyUI चुनें एक मिनट से लंबी क्लिप, दो वक्ताओं वाले Multi मॉडल, ऐसी डबिंग के लिए जो मूल कैमरा मूव बनाए रखे, या हर सैंपलर सेटिंग पर पूरा नियंत्रण चाहिए तो।
होस्टेड API चुनें जब आपका अपना ऐप माँग पर अवतार बनाए और आप GPU को चालू रखने के बजाय प्रति सेकंड भुगतान करना पसंद करें।
PicassoIA मॉडल चुनें जब आपको अगले दस मिनट में नतीजा चाहिए, आपका ऑडियो 35 सेकंड से छोटा है, और InfiniteTalk के सटीक लुक से मेल खाने की तुलना में रफ़्तार ज़्यादा मायने रखती है।
सामने की ओर देखता पोर्ट्रेट अपलोड करें। चेहरे, पूरे शरीर के शॉट और चित्रित कैरेक्टर, सब काम करते हैं।
35 सेकंड से छोटी MP3 या WAV फ़ाइल अपलोड करें। अंग्रेज़ी, स्पेनिश, जापानी, कोरियाई, चीनी और इंडोनेशियाई ऑडियो समर्थित हैं।
कैमरा मूवमेंट या हावभाव तय करने के लिए वैकल्पिक प्रॉम्प्ट जोड़ें, जैसे "she smiles and nods slightly"।
त्वरित ड्राफ़्ट के लिए फ़ास्ट मोड चालू करें, या सबसे अच्छी डिटेल के लिए बंद रखें।
अगर नतीजा दोबारा चाहिए तो सीड सेट करें, फिर जेनरेट करके वीडियो डाउनलोड करें।
💡 पहले स्क्रिप्ट लिखें, उसे Speech 2.8 HD से रिकॉर्ड करें, और हर क्लिप को 35 सेकंड की सीमा के भीतर रखें। छोटी क्लिप जोड़कर बनाया गया वीडियो एक लंबे टेक से ज़्यादा स्वाभाविक लगता है।
अपना पहला अवतार बनाएँ
एक पोर्ट्रेट चुनें, 20 सेकंड का ऑडियो रिकॉर्ड करें, और वही क्लिप दो-तीन मॉडल पर चलाएँ। नतीजों को साथ-साथ देखने में कुछ मिनट लगते हैं और यह किसी स्पेक सीट से ज़्यादा बताता है। PicassoIA पर Omni Human 1.5 या Fabric 1.0 खोलें, अपनी दोनों फ़ाइलें अपलोड करें, और एक स्थिर फ़ोटो को बोलते देखें। बाद में अगर आप लोकल पाइपलाइन चाहें, तो तब तक आप जान चुके होंगे कि अच्छा इनपुट कैसा होता है।