ज़्यादातर वीडियो मॉडल लॉगिन और क्रेडिट मीटर के पीछे होते हैं। MiniMax H3 के साथ ऐसा ज़रूरी नहीं है। इसके ओपन वेट्स ComfyUI में आपके अपने ग्राफ़िक्स कार्ड पर चलते हैं, और एक ही पास में 24 fps पर 15 सेकंड तक का वीडियो मिलता है, जिसमें स्टीरियो साउंडट्रैक पहले से मिक्स होता है: डायलॉग, साउंड इफ़ेक्ट और म्यूज़िक एक साथ। यह सुनने में प्लग-एंड-प्ले लगता है, और ज़्यादातर है भी, बशर्ते आप सही मॉडल फ़ाइलें चुनें, प्रॉम्प्ट उस तरह लिखें जैसा H3 चाहता है, और जानें कि LoRA कहाँ सच में मदद करता है। यह आर्टिकल MiniMax H3 ComfyUI वर्कफ़्लो को उसी क्रम में समझाता है जिसमें आपको हर समस्या आएगी: हार्डवेयर, फ़ाइलें, तीन जनरेशन मोड, प्रॉम्प्टिंग, स्पीड, कैरेक्टर LoRA और लंबी क्लिप।
MiniMax H3 असल में क्या करता है
H3 एक omni-modal वीडियो मॉडल है। साइलेंट फ़्रेम रेंडर करके दूसरे टूल से साउंड जोड़ने के बजाय यह एक ही पास में पिक्चर, आवाज़, इफ़ेक्ट और म्यूज़िक बनाता है। ComfyUI ने वर्ज़न 0.30.0 में इसका नेटिव सपोर्ट जोड़ा है, इसलिए बेसिक टेम्पलेट को किसी कस्टम नोड की ज़रूरत नहीं पड़ती।
एक ही मॉडल में तीन मोड
- टेक्स्ट टू वीडियो (T2V): सिर्फ़ एक प्रॉम्प्ट। सीन का वर्णन करें और मॉडल ऑडियो के साथ क्लिप लौटाएगा।
- इमेज टू वीडियो (I2V): एक स्टिल इमेज, साथ में वैकल्पिक फ़र्स्ट और लास्ट फ़्रेम इनपुट। मॉडल दोनों फ़्रेम के बीच की मोशन भर देता है।
- रेफ़रेंस टू वीडियो (R2V): एक प्रॉम्प्ट के साथ अधिकतम 9 रेफ़रेंस इमेज, 3 रेफ़रेंस वीडियो और 3 ऑडियो क्लिप। आप तय करते हैं कि कौन-सा रेफ़रेंस पहचान, स्टाइल, मोशन, कैमरे या आवाज़ को चलाएगा।
वेट्स भी इसी आधार पर बँटे हैं। T2V और I2V FL2VA चेकपॉइंट इस्तेमाल करते हैं, जबकि R2V Ref2VA चेकपॉइंट इस्तेमाल करता है, इसलिए अगर आपको तीनों मोड चाहिए तो अलग डाउनलोड की योजना बनाएँ।
वे नंबर जो मायने रखते हैं
| स्पेक | वैल्यू |
|---|
| क्लिप की लंबाई | 15 सेकंड तक |
| फ़्रेम रेट | 24 fps |
| ऑडियो | नेटिव 32 kHz स्टीरियो |
| स्पीच भाषाएँ | 11: अरबी, चीनी, अंग्रेज़ी, फ़्रेंच, जर्मन, इतालवी, जापानी, कोरियाई, पुर्तगाली, रूसी, स्पेनिश |
| मुख्य रेज़ोल्यूशन | 2K तक |
| टेम्पलेट प्रीसेट | 960×544, 1152×640, 1216×672 |
| न्यूनतम काम करने वाला साइज़ | 384p (256p फ़ेल होता है) |
| साइज़ नियम | चौड़ाई और ऊँचाई 32 के गुणज में |
💡 रेज़ोल्यूशन वाली लाइन ध्यान से पढ़ें। "2K तक" सीमा है। एक कम्युनिटी लेख में छोटी भुजा पर लगभग 768 px के नेटिव कैनवास का ज़िक्र है, इसलिए ऊपर के प्रीसेट को अपना वास्तविक शुरुआती बिंदु मानें और बड़े साइज़ अपने कार्ड पर टेस्ट करें।
हार्डवेयर और डिस्क की हकीकत
कुछ भी डाउनलोड करने से पहले जाँच लें कि आपकी मशीन क्या संभाल सकती है। H3 एक बड़ा मॉडल है, और "चलता है" और "अच्छी तरह चलता है" के बीच का फ़ासला बड़ा है।

कार्ड क्लास के अनुसार VRAM
नीचे के आँकड़े एक कम्युनिटी बेंचमार्क से हैं, कोई आधिकारिक स्पेक नहीं, इसलिए ड्राइवर, रेज़ोल्यूशन और क्वांटाइज़ेशन के साथ नतीजे बदल सकते हैं।
| कार्ड क्लास | क्या उम्मीद करें |
|---|
| 6 GB (RTX 2060 क्लास) | चलता है, लेकिन डिटेल धुंधली, ऑडियो खुरदुरा और लगभग 10 से 15 मिनट प्रति क्लिप |
| 12 से 16 GB (RTX 4060 क्लास) | 480p, 5 सेकंड की क्लिप लगभग 6 मिनट में, 6 GB टियर से ज़्यादा साफ़ नतीजे |
| 24 GB (RTX 4090 क्लास) | ज़्यादा रेज़ोल्यूशन और कम समझौते, और LoRA ट्रेनिंग के लिए पर्याप्त जगह |
| 32 GB और उससे ऊपर (RTX 5090, RTX 6000) | सुझाया गया टियर, ज़्यादा रेज़ोल्यूशन पर 15 सेकंड तक की लंबी क्लिप |
| Apple Silicon | 4-bit NF4 बिल्ड सिर्फ़ 8 GB से चलता है, लेकिन भीड़-भाड़ वाले सीन में क्वालिटी में साफ़ गिरावट |
मॉडल फ़ाइलें और डिस्क स्पेस
हर कॉम्पोनेंट तीन प्रिसिज़न में आता है, और चुनाव क्वालिटी और मेमोरी के बीच समझौता है। प्रून्ड INT8 डिफ़्यूज़न फ़ाइलें और nvfp4 टेक्स्ट एनकोडर वही हैं जिनकी टेम्पलेट नोट्स सिफ़ारिश करते हैं, क्योंकि ये वीडियो के लिए सबसे ज़्यादा जगह छोड़ते हैं। INT8 या BF16 की ओर तभी जाएँ जब आपके पास अतिरिक्त VRAM हो और आपके अपने तुलना वाले टेस्ट में फ़र्क दिखे।
| फ़ाइल | साइज़ | भूमिका |
|---|
| FL2VA pruned INT8 ConvRot | 19.5 GB | T2V और I2V के लिए सुझाई गई |
| FL2VA INT8 ConvRot | 31.7 GB | बड़ा INT8 विकल्प |
| FL2VA BF16 | 61.7 GB | फुल प्रिसिज़न |
| Ref2VA pruned INT8 ConvRot | 19.5 GB | R2V के लिए सुझाई गई |
| Qwen3-VL टेक्स्ट एनकोडर, nvfp4 AWQ | 14.6 GB | सुझाया गया एनकोडर |
| Qwen3-VL INT8 ConvRot | 25.3 GB | बड़ा एनकोडर विकल्प |
| Qwen3-VL BF16 | 48.0 GB | फुल प्रिसिज़न एनकोडर |
| वीडियो VAE FP16 | 4.9 GB | ज़रूरी |
| ऑडियो VAE FP32 | 0.6 GB | ज़रूरी |
हल्का T2V और I2V सेटअप (प्रून्ड INT8 डिफ़्यूज़न मॉडल, nvfp4 टेक्स्ट एनकोडर और दोनों VAE) कुल मिलाकर लगभग 39.6 GB बनता है। अगर आपको R2V भी चाहिए तो 19.5 GB और जोड़ें। सब कुछ NVMe ड्राइव पर रखें, क्योंकि स्पिनिंग डिस्क से 40 GB लोड करना बहुत तकलीफ़देह है।

ComfyUI में लोकल सेटअप
अपडेट करें और टेम्पलेट खोलें
- ComfyUI को 0.30.0 या उसके बाद वाले वर्ज़न में अपडेट करें।
- Workflow, Browse Templates, Video खोलें और कोई MiniMax H3 टेम्पलेट चुनें।
- डाउनलोड की गई फ़ाइलें
models/diffusion_models/, models/text_encoders/ और models/vae/ में रखें।
- ComfyUI को रीस्टार्ट करें ताकि लोडर नई फ़ाइलें देख सकें।
पहले एक छोटा, कम रेज़ोल्यूशन वाला T2V टेस्ट चलाएँ। अच्छा पहला टेस्ट है 384p की क्लिप, जिसमें डायलॉग का एक वाक्य हो और एक साफ़ साउंड इफ़ेक्ट, जैसे दरवाज़ा बंद होने की आवाज़। अगर पिक्चर आती है पर ऑडियो चुप है, तो गड़बड़ी की संभावना ऑडियो डिकोड पाथ में है, आपके प्रॉम्प्ट में नहीं। अगर दोनों काम करते हैं, तो आपके पास एक सुरक्षित बेसलाइन है, जिसमें आप एक बार में एक सेटिंग बदल सकते हैं।
ऑडियो आउटपुट VAEDecodeAudio नोड पर निर्भर करता है, जो टेम्पलेट में पहले से शामिल है। इमेज-टू-वीडियो नोड MiniMaxH3ImageToVideo है, और इसमें first_frame और last_frame इनपुट दिखते हैं।
ऐसी सैंपलर सेटिंग्स जो टिकती हैं
कम्युनिटी नोट्स की बेसलाइन है res_multistep सैंपलर, simple शेड्यूलर के साथ, 20 स्टेप पर। लगभग 15 स्टेप से नीचे क्वालिटी साफ़ गिरती है। अगर आपका कार्ड सपोर्ट करता है, तो लगभग 2x तेज़ जनरेशन के लिए ComfyUI को --use-sage-attention के साथ लॉन्च करें। टेस्ट रन के लिए 384p और छोटी अवधि रखें, और मोशन व ऑडियो सही होने के बाद साइज़ बढ़ाएँ।
एक-ग्राफ़ वाला विकल्प
ComfyUI-MiniMaxH3-Easy एक कम्युनिटी कस्टम नोड है, जो T2V, I2V, फ़र्स्ट और लास्ट फ़्रेम और R2V को एक कॉम्पैक्ट वर्कफ़्लो में रखता है। इसे ComfyUI/custom_nodes में रिपॉज़िटरी क्लोन करके लगाएँ, या ComfyUI Manager में इसका नाम खोजकर। जनरेशन के लिए API क्रेडेंशियल की ज़रूरत नहीं पड़ती। OpenAI, Gemini या Ollama के अकाउंट सिर्फ़ इसके वैकल्पिक प्रॉम्प्ट ऑप्टिमाइज़र के लिए इस्तेमाल होते हैं, और सैंपलर, LoRA और attention पैच सामान्य ComfyUI कनेक्शन ही रहते हैं। यह एक ही ऑडियो ट्रैक से चलने वाला डिजिटल ह्यूमन मोड भी सपोर्ट करता है, जो टॉकिंग-हेड क्लिप के लिए काम का है।
H3 के लिए डायरेक्टर की तरह प्रॉम्प्टिंग

पहले सीन, फिर शॉट
H3 उस प्रॉम्प्ट पर सबसे अच्छा प्रतिक्रिया देता है जो पहले पूरा सीन बताए (लोकेशन, किरदार, क्या हो रहा है) और फिर क्लिप को टाइम्ड शॉट में तोड़े। कैमरा मूव और आपको जो ऑडियो चाहिए, वह भी शामिल करें, सिर्फ़ पिक्चर नहीं।
उदाहरण प्रॉम्प्ट: ओसाका की एक बारिश वाली रात का बाज़ार, पीले रेनकोट में एक स्ट्रीट वेंडर कागज़ के कटोरे में शोरबा डाल रहा है। 0 से 4 सेकंड: बर्तन से उठती भाप पर धीमा पुश-इन, तिरपाल पर बारिश की थाप। 4 से 9 सेकंड: मीडियम शॉट, जब वेंडर कटोरा ग्राहक को देता है और मुस्कुराता है। 9 से 15 सेकंड: हैंडहेल्ड फ़ॉलो, जब ग्राहक भीड़ में चलता है। ऑडियो: बारिश, तेल की छन्न-छन्न, दूर की बातचीत, हल्का शमिसेन संगीत।
इसकी तुलना एक पतले प्रॉम्प्ट से करें जैसे "एक आदमी बारिश में नूडल्स बनाता है।" H3 फिर भी कुछ देखने लायक लौटाएगा, लेकिन कैमरा, गति और साउंडट्रैक सब अंदाज़े होंगे। बीट्स साफ़-साफ़ लिखने से मॉडल को फ़ॉलो करने के लिए एक टाइमलाइन मिलती है, और जब कोई शॉट चूकता है तो बदलने के लिए कुछ ठोस मिलता है। हर टेस्ट रन में एक ही बीट बदलें, ताकि पता चल सके कि कौन-सा बदलाव किस नतीजे का कारण बना।
प्रॉम्प्ट को एक जैसा रखने के लिए एक छोटी चेकलिस्ट:
- सीन: कहाँ, कब और कौन।
- शॉट: हर बीट के लिए एक लाइन, सेकंड के साथ।
- कैमरा: पुश-इन, हैंडहेल्ड फ़ॉलो, ऑर्बिट या लॉक्ड-ऑफ़।
- ऑडियो: डायलॉग, इफ़ेक्ट और म्यूज़िक, हर एक अलग नाम के साथ।

प्रॉम्प्ट में डायलॉग और साउंड
चूँकि ऑडियो पिक्चर के साथ ही बनता है, उसे नाम दें। बताएँ कौन बोल रहा है और क्या कह रहा है, फिर इफ़ेक्ट और म्यूज़िक अपनी अलग लाइन में लिखें, ताकि वे इमेज के वर्णन में घुल न जाएँ। 11 सपोर्टेड भाषाओं के साथ, आप डायलॉग उसी भाषा में लिख सकते हैं जिसमें किरदार को बोलना चाहिए। Easy नोड में # टाइप करने पर एक डायलॉग ब्लॉक खुलता है, जो रन टाइम पर उन <d>...</d> टैग में बदल दिया जाता है जिनकी H3 को ज़रूरत है।
R2V के लिए रेफ़रेंस टैग
रेफ़रेंस मोड में हर इनपुट को टैग से बुलाएँ, उसी क्रम में जिसमें आपने उन्हें कनेक्ट किया: <Picture 1>, <Video 1>, <Audio 1>। फिर बताएँ कि कौन-सा रेफ़रेंस शॉट के किस हिस्से को चलाएगा:
किरदार के चेहरे और पोशाक के लिए <Picture 1> इस्तेमाल करें, कैमरा मूवमेंट के लिए <Video 1>, और आवाज़ के लिए <Audio 1>।
Easy नोड में @Image1, @Video1 और @Audio1 आपके लिए उन टैग में बदल दिए जाते हैं।

फ़र्स्ट और लास्ट फ़्रेम कंट्रोल
दो स्टिल अक्सर सौ और शब्द लिखने से बेहतर क्लिप की दिशा तय करते हैं। I2V मोड में first_frame और last_frame दोनों वैकल्पिक हैं, और मॉडल उनके बीच की मोशन खुद बनाता है।

एंडपॉइंट स्टिल बनाएँ और मिलाएँ
ComfyUI खोलने से पहले दोनों फ़्रेम बना लें। PicassoIA Image या Seedream 5 Pro शुरुआती स्टिल बना सकते हैं, और PicassoIA Image Editor Pro जैसा एडिटिंग मॉडल उस इमेज को समापन वाली इमेज में बदलने देता है, ताकि सब्जेक्ट और लाइटिंग करीब रहें।
लेंस का एहसास, रोशनी की दिशा और सब्जेक्ट का आकार मिलाएँ। अगर पहला फ़्रेम सूर्योदय है और आखिरी सूर्यास्त, तो H3 को 15 सेकंड के अंदर पूरा दिन गढ़ना होगा। यह हो सकता है, लेकिन नतीजा टाइम-लैप्स जैसा लगेगा। ऐसे एंडपॉइंट चुनें जहाँ तक एक्शन क्लिप की लंबाई में वास्तव में पहुँच सके।
LoRA: स्पीड और पहचान
H3 के आसपास LoRA के दावे जल्दी उलझ जाते हैं। असल में दो अलग चीज़ें हैं: एक स्पीड LoRA, जो बदलता है कि आपको कितने स्टेप चाहिए, और एक आइडेंटिटी LoRA, जिसे आप अपनी इमेज पर ट्रेन करते हैं।

स्पीड के लिए Turbo LoRA
कम्युनिटी का MiniMax-H3-Turbo-LoRA (Apache 2.0, bf16 में लगभग 744 MB) सैंपलिंग स्टेप को लगभग 20 से घटाकर सिर्फ़ 4 तक ला सकता है।
| सेटिंग | वैल्यू |
|---|
| स्टेप | 4 से 8, 6 से 8 पसंद किए गए |
| LoRA स्ट्रेंथ | 1.0 |
| शेड्यूलर | simple |
| स्पीडअप | सैंपलिंग में लगभग 5x |
| सुझाई गई फ़ाइल | minimax_h3_turbo_v4_step600_ema.safetensors |
व्यावहारिक असर आपके इटरेशन लूप पर पड़ता है। मान लीजिए 12 से 16 GB कार्ड पर 20 स्टेप में 480p टेस्ट क्लिप में लगभग 6 मिनट लगते हैं। 5x सैंपलिंग स्पीडअप से हर टेस्ट लगभग डेढ़ मिनट पर आ जाएगा। यह मोटा अनुमान है, माप नहीं, और डिकोडिंग में अब भी समय लगता है, लेकिन यह समझाता है कि लोग ड्राफ़्ट के लिए Turbo क्यों चलाते हैं और फ़ाइनल रेंडर के लिए फ़ुल 20 स्टेप सेटअप।
ComfyUI-MiniMax-H3-Turbo कस्टम नोड इंस्टॉल करें, .safetensors फ़ाइल को अपने LoRA फ़ोल्डर में डालें, और मौजूदा वर्कफ़्लो में मॉडल लोडर और सैंपलर के बीच Turbo LoRA नोड लगाएँ।
💡 ज्ञात सीमा: 4 स्टेप पर भारी मोशन में v4 में स्मियर और घोस्टिंग दिख सकती है, और तेज़ एक्शन के दौरान ऑडियो का बर्ताव अभी भी सुधारा जा रहा है। स्थिर या कम मोशन वाले शॉट के लिए 4 स्टेप और एक्शन के लिए 6 से 8 स्टेप इस्तेमाल करें।
कैरेक्टर LoRA ट्रेन करना
एक क्रिएटर ने 12 GB RTX 4070 पर ai-toolkit से कैरेक्टर LoRA ट्रेन किया, क्वांटाइज़्ड मॉडल और CPU ऑफ़लोडिंग के साथ। उन्होंने जो नंबर बताए:
| सेटिंग | वैल्यू |
|---|
| डेटासेट | 512×512 पर 31 से 32 इमेज |
| LoRA रैंक | 16 |
| स्टेप | 1000, बैच साइज़ 1 |
| ट्रेनिंग के दौरान VRAM | लगभग 12 GB में से 11.7 GB |
| सिस्टम RAM | लगभग 32 से 37 GB |
| समय | लगभग 6 से 7 घंटे |
| ज़रूरी कॉन्फ़िग | num_frames: 1 और auto_frame_count: false |
दो विवरण तय करते हैं कि यह काम करेगा या नहीं। पहला, जब auto_frame_count चालू रहता है, तो स्टिल-इमेज डेटासेट को वीडियो माना जाता है और ट्रेनिंग रिपोर्ट करती है कि कोई इमेज नहीं मिली। दूसरा, फ़ुल-बॉडी शॉट मिलाने से नतीजे खराब आए। क्रिएटर ने चेहरा-केंद्रित सेट पर स्विच किया, जहाँ चेहरा फ़्रेम का ज़्यादातर हिस्सा भरता है, और एक सरल कैप्शन रखा जिसमें ट्रिगर वर्ड और सब्जेक्ट का छोटा लेबल था। तैयार LoRA LoraLoaderModelOnly नोड से लोड होता है।

💡 जब स्टिल से काम चल जाए तो H3 LoRA छोड़ें। अगर आपको सिर्फ़ फ़र्स्ट फ़्रेम या रेफ़रेंस इमेज के रूप में एक जैसा किरदार चाहिए, तो इसके बजाय इमेज-साइड LoRA ट्रेन करें। PicassoIA पर P Image Trainer p-image मॉडल के लिए कम से कम 10 इमेज वाली zip से LoRA बनाता है, डिफ़ॉल्ट 1000 स्टेप के साथ।
वीडियो LoRA की कहानी अलग है। उसी क्रिएटर ने नोट किया कि 12 GB पर वीडियो क्लिप से ट्रेनिंग शायद पहुँच से बाहर है, और कम्युनिटी बेंचमार्क व्यावहारिक वीडियो ट्रेनिंग के लिए 20 GB या उससे ज़्यादा बताते हैं। ज़्यादातर सेटअप के लिए समझदारी भरा बँटवारा सीधा है: किरदार के लिए आइडेंटिटी LoRA या रेफ़रेंस इमेज, और जब रेंडर का समय सबसे बड़ी रुकावट हो तो Turbo LoRA।
लंबी क्लिप और आम समस्याओं के हल
मोशन कॉन्टेक्स्ट के साथ क्लिप जोड़ें
एक पास में 15 सेकंड ही अधिकतम सीमा है। ComfyUI MiniMax H3 Extender निरंतरता बनाए रखते हुए कई क्लिप जोड़ता है। जब आप कोई क्लिप मंज़ूर करते हैं, तो उसका latent डिस्क पर कैश होता है और अगली क्लिप के लिए मोशन कॉन्टेक्स्ट बन जाता है, ताकि नया शॉट पिछली क्लिप के आखिरी फ़्रेम से आगे बढ़े।
- हर क्लिप के लिए अलग प्रॉम्प्ट, सीड और अवधि
- सीड मोड: Randomize, Fixed, Increment, Decrement
- वही रेफ़रेंस सीमाएँ: 9 इमेज, 3 वीडियो, 3 ऑडियो ट्रैक
- H.264, H.265/HEVC या FFV1 में एक्सपोर्ट
इसे ComfyUI Manager से या ComfyUI/custom_nodes में क्लोन करके इंस्टॉल करें। पूरे क्रम की योजना पहले कागज़ पर बनाएँ: हर क्लिप के लिए एक लाइन, और साझा किरदार रेफ़रेंस एक बार लिखे हुए, ताकि हर सेगमेंट एक ही पहचान ले और क्लिप-दर-क्लिप बदलता न जाए।

बार-बार आने वाली एरर के हल
| लक्षण | संभावित कारण | हल |
|---|
| 256p रन सीधे फ़ेल | न्यूनतम साइज़ से नीचे | 32 के गुणज में 384p या उससे ऊपर इस्तेमाल करें |
| वीडियो बिना आवाज़ के रेंडर | ऑडियो डिकोड गायब | VAEDecodeAudio जोड़ें और ऑडियो VAE लोड करें |
| धुंधली, फैली हुई डिटेल | स्टेप बहुत कम | 20 स्टेप रखें और लगभग 15 से नीचे न जाएँ |
| Turbo के साथ तेज़ मोशन पर घोस्टिंग | 4 स्टेप सेटिंग | 6 से 8 स्टेप तक बढ़ाएँ |
| LoRA ट्रेनिंग को कोई इमेज नहीं मिलती | auto_frame_count चालू है | उसे false और num_frames को 1 पर सेट करें |
| सक्षम कार्ड पर धीमे रेंडर | डिफ़ॉल्ट attention | --use-sage-attention के साथ लॉन्च करें |
PicassoIA पर आज़माएँ
MiniMax H3 इस लेख के लिखे जाने के समय PicassoIA कैटलॉग में नहीं है, लेकिन ComfyUI में जो काम यह करता है, उनके करीबी विकल्प आप ब्राउज़र में चला सकते हैं, न 40 GB डाउनलोड चाहिए और न VRAM का हिसाब रखना पड़ता है।
एक व्यावहारिक लूप अच्छा काम करता है: PicassoIA पर अपने एंडपॉइंट स्टिल और किरदार रेफ़रेंस बनाएँ, वहीं कुछ सस्ते टेस्ट चलाकर सीन और कैमरा की भाषा तय करें, फिर जीतने वाला प्रॉम्प्ट नेटिव ऑडियो वाले फ़ाइनल रेंडर के लिए अपने लोकल H3 ग्राफ़ में ले जाएँ। अपने पिछले ComfyUI टेस्ट से एक स्टिल चुनें, उसे Wan 2.7 I2V में डालें, और मोशन की तुलना अपनी H3 क्लिप से करें। यह जानने का सबसे तेज़ तरीका कि आपके प्रॉम्प्ट क्या कर सकते हैं, आज कुछ बनाना है, तो PicassoIA खोलें और अपनी पहली इमेज और वीडियो बनाएँ।