MiniMax H3 ComfyUI वर्कफ़्लो: प्रॉम्प्टिंग, LoRA और लोकल सेटअप

MiniMax H3 नेटिव स्टीरियो ऑडियो के साथ 24 fps पर 15 सेकंड तक का वीडियो बनाता है, और यह ComfyUI में लोकल रूप से चलता है। यहाँ देखें कि आपको कौन-सी मॉडल फ़ाइलें और कितनी डिस्क स्पेस चाहिए, GPU के हिसाब से VRAM टियर क्या हैं, टाइम्ड शॉट और डायलॉग का प्रॉम्प्ट कैसे लिखें, Turbo और कैरेक्टर LoRA कैसे काम करते हैं, और लंबी क्लिप कैसे जोड़ें।

MiniMax H3 ComfyUI वर्कफ़्लो: प्रॉम्प्टिंग, LoRA और लोकल सेटअप
Cristian Da Conceicao
Picasso IA के संस्थापक

ज़्यादातर वीडियो मॉडल लॉगिन और क्रेडिट मीटर के पीछे होते हैं। MiniMax H3 के साथ ऐसा ज़रूरी नहीं है। इसके ओपन वेट्स ComfyUI में आपके अपने ग्राफ़िक्स कार्ड पर चलते हैं, और एक ही पास में 24 fps पर 15 सेकंड तक का वीडियो मिलता है, जिसमें स्टीरियो साउंडट्रैक पहले से मिक्स होता है: डायलॉग, साउंड इफ़ेक्ट और म्यूज़िक एक साथ। यह सुनने में प्लग-एंड-प्ले लगता है, और ज़्यादातर है भी, बशर्ते आप सही मॉडल फ़ाइलें चुनें, प्रॉम्प्ट उस तरह लिखें जैसा H3 चाहता है, और जानें कि LoRA कहाँ सच में मदद करता है। यह आर्टिकल MiniMax H3 ComfyUI वर्कफ़्लो को उसी क्रम में समझाता है जिसमें आपको हर समस्या आएगी: हार्डवेयर, फ़ाइलें, तीन जनरेशन मोड, प्रॉम्प्टिंग, स्पीड, कैरेक्टर LoRA और लंबी क्लिप।

MiniMax H3 असल में क्या करता है

H3 एक omni-modal वीडियो मॉडल है। साइलेंट फ़्रेम रेंडर करके दूसरे टूल से साउंड जोड़ने के बजाय यह एक ही पास में पिक्चर, आवाज़, इफ़ेक्ट और म्यूज़िक बनाता है। ComfyUI ने वर्ज़न 0.30.0 में इसका नेटिव सपोर्ट जोड़ा है, इसलिए बेसिक टेम्पलेट को किसी कस्टम नोड की ज़रूरत नहीं पड़ती।

एक ही मॉडल में तीन मोड

  • टेक्स्ट टू वीडियो (T2V): सिर्फ़ एक प्रॉम्प्ट। सीन का वर्णन करें और मॉडल ऑडियो के साथ क्लिप लौटाएगा।
  • इमेज टू वीडियो (I2V): एक स्टिल इमेज, साथ में वैकल्पिक फ़र्स्ट और लास्ट फ़्रेम इनपुट। मॉडल दोनों फ़्रेम के बीच की मोशन भर देता है।
  • रेफ़रेंस टू वीडियो (R2V): एक प्रॉम्प्ट के साथ अधिकतम 9 रेफ़रेंस इमेज, 3 रेफ़रेंस वीडियो और 3 ऑडियो क्लिप। आप तय करते हैं कि कौन-सा रेफ़रेंस पहचान, स्टाइल, मोशन, कैमरे या आवाज़ को चलाएगा।

वेट्स भी इसी आधार पर बँटे हैं। T2V और I2V FL2VA चेकपॉइंट इस्तेमाल करते हैं, जबकि R2V Ref2VA चेकपॉइंट इस्तेमाल करता है, इसलिए अगर आपको तीनों मोड चाहिए तो अलग डाउनलोड की योजना बनाएँ।

वे नंबर जो मायने रखते हैं

स्पेकवैल्यू
क्लिप की लंबाई15 सेकंड तक
फ़्रेम रेट24 fps
ऑडियोनेटिव 32 kHz स्टीरियो
स्पीच भाषाएँ11: अरबी, चीनी, अंग्रेज़ी, फ़्रेंच, जर्मन, इतालवी, जापानी, कोरियाई, पुर्तगाली, रूसी, स्पेनिश
मुख्य रेज़ोल्यूशन2K तक
टेम्पलेट प्रीसेट960×544, 1152×640, 1216×672
न्यूनतम काम करने वाला साइज़384p (256p फ़ेल होता है)
साइज़ नियमचौड़ाई और ऊँचाई 32 के गुणज में

💡 रेज़ोल्यूशन वाली लाइन ध्यान से पढ़ें। "2K तक" सीमा है। एक कम्युनिटी लेख में छोटी भुजा पर लगभग 768 px के नेटिव कैनवास का ज़िक्र है, इसलिए ऊपर के प्रीसेट को अपना वास्तविक शुरुआती बिंदु मानें और बड़े साइज़ अपने कार्ड पर टेस्ट करें।

हार्डवेयर और डिस्क की हकीकत

कुछ भी डाउनलोड करने से पहले जाँच लें कि आपकी मशीन क्या संभाल सकती है। H3 एक बड़ा मॉडल है, और "चलता है" और "अच्छी तरह चलता है" के बीच का फ़ासला बड़ा है।

तीन काले पंखों वाला ग्राफ़िक्स कार्ड, खुले PC केस में लगा हुआ

कार्ड क्लास के अनुसार VRAM

नीचे के आँकड़े एक कम्युनिटी बेंचमार्क से हैं, कोई आधिकारिक स्पेक नहीं, इसलिए ड्राइवर, रेज़ोल्यूशन और क्वांटाइज़ेशन के साथ नतीजे बदल सकते हैं।

कार्ड क्लासक्या उम्मीद करें
6 GB (RTX 2060 क्लास)चलता है, लेकिन डिटेल धुंधली, ऑडियो खुरदुरा और लगभग 10 से 15 मिनट प्रति क्लिप
12 से 16 GB (RTX 4060 क्लास)480p, 5 सेकंड की क्लिप लगभग 6 मिनट में, 6 GB टियर से ज़्यादा साफ़ नतीजे
24 GB (RTX 4090 क्लास)ज़्यादा रेज़ोल्यूशन और कम समझौते, और LoRA ट्रेनिंग के लिए पर्याप्त जगह
32 GB और उससे ऊपर (RTX 5090, RTX 6000)सुझाया गया टियर, ज़्यादा रेज़ोल्यूशन पर 15 सेकंड तक की लंबी क्लिप
Apple Silicon4-bit NF4 बिल्ड सिर्फ़ 8 GB से चलता है, लेकिन भीड़-भाड़ वाले सीन में क्वालिटी में साफ़ गिरावट

मॉडल फ़ाइलें और डिस्क स्पेस

हर कॉम्पोनेंट तीन प्रिसिज़न में आता है, और चुनाव क्वालिटी और मेमोरी के बीच समझौता है। प्रून्ड INT8 डिफ़्यूज़न फ़ाइलें और nvfp4 टेक्स्ट एनकोडर वही हैं जिनकी टेम्पलेट नोट्स सिफ़ारिश करते हैं, क्योंकि ये वीडियो के लिए सबसे ज़्यादा जगह छोड़ते हैं। INT8 या BF16 की ओर तभी जाएँ जब आपके पास अतिरिक्त VRAM हो और आपके अपने तुलना वाले टेस्ट में फ़र्क दिखे।

फ़ाइलसाइज़भूमिका
FL2VA pruned INT8 ConvRot19.5 GBT2V और I2V के लिए सुझाई गई
FL2VA INT8 ConvRot31.7 GBबड़ा INT8 विकल्प
FL2VA BF1661.7 GBफुल प्रिसिज़न
Ref2VA pruned INT8 ConvRot19.5 GBR2V के लिए सुझाई गई
Qwen3-VL टेक्स्ट एनकोडर, nvfp4 AWQ14.6 GBसुझाया गया एनकोडर
Qwen3-VL INT8 ConvRot25.3 GBबड़ा एनकोडर विकल्प
Qwen3-VL BF1648.0 GBफुल प्रिसिज़न एनकोडर
वीडियो VAE FP164.9 GBज़रूरी
ऑडियो VAE FP320.6 GBज़रूरी

हल्का T2V और I2V सेटअप (प्रून्ड INT8 डिफ़्यूज़न मॉडल, nvfp4 टेक्स्ट एनकोडर और दोनों VAE) कुल मिलाकर लगभग 39.6 GB बनता है। अगर आपको R2V भी चाहिए तो 19.5 GB और जोड़ें। सब कुछ NVMe ड्राइव पर रखें, क्योंकि स्पिनिंग डिस्क से 40 GB लोड करना बहुत तकलीफ़देह है।

अखरोट की लकड़ी की मेज़ पर नोटबुक और कॉफ़ी कप के बगल में रखी पतली NVMe ड्राइव

ComfyUI में लोकल सेटअप

अपडेट करें और टेम्पलेट खोलें

  1. ComfyUI को 0.30.0 या उसके बाद वाले वर्ज़न में अपडेट करें।
  2. Workflow, Browse Templates, Video खोलें और कोई MiniMax H3 टेम्पलेट चुनें।
  3. डाउनलोड की गई फ़ाइलें models/diffusion_models/, models/text_encoders/ और models/vae/ में रखें।
  4. ComfyUI को रीस्टार्ट करें ताकि लोडर नई फ़ाइलें देख सकें।

पहले एक छोटा, कम रेज़ोल्यूशन वाला T2V टेस्ट चलाएँ। अच्छा पहला टेस्ट है 384p की क्लिप, जिसमें डायलॉग का एक वाक्य हो और एक साफ़ साउंड इफ़ेक्ट, जैसे दरवाज़ा बंद होने की आवाज़। अगर पिक्चर आती है पर ऑडियो चुप है, तो गड़बड़ी की संभावना ऑडियो डिकोड पाथ में है, आपके प्रॉम्प्ट में नहीं। अगर दोनों काम करते हैं, तो आपके पास एक सुरक्षित बेसलाइन है, जिसमें आप एक बार में एक सेटिंग बदल सकते हैं।

ऑडियो आउटपुट VAEDecodeAudio नोड पर निर्भर करता है, जो टेम्पलेट में पहले से शामिल है। इमेज-टू-वीडियो नोड MiniMaxH3ImageToVideo है, और इसमें first_frame और last_frame इनपुट दिखते हैं।

ऐसी सैंपलर सेटिंग्स जो टिकती हैं

कम्युनिटी नोट्स की बेसलाइन है res_multistep सैंपलर, simple शेड्यूलर के साथ, 20 स्टेप पर। लगभग 15 स्टेप से नीचे क्वालिटी साफ़ गिरती है। अगर आपका कार्ड सपोर्ट करता है, तो लगभग 2x तेज़ जनरेशन के लिए ComfyUI को --use-sage-attention के साथ लॉन्च करें। टेस्ट रन के लिए 384p और छोटी अवधि रखें, और मोशन व ऑडियो सही होने के बाद साइज़ बढ़ाएँ।

एक-ग्राफ़ वाला विकल्प

ComfyUI-MiniMaxH3-Easy एक कम्युनिटी कस्टम नोड है, जो T2V, I2V, फ़र्स्ट और लास्ट फ़्रेम और R2V को एक कॉम्पैक्ट वर्कफ़्लो में रखता है। इसे ComfyUI/custom_nodes में रिपॉज़िटरी क्लोन करके लगाएँ, या ComfyUI Manager में इसका नाम खोजकर। जनरेशन के लिए API क्रेडेंशियल की ज़रूरत नहीं पड़ती। OpenAI, Gemini या Ollama के अकाउंट सिर्फ़ इसके वैकल्पिक प्रॉम्प्ट ऑप्टिमाइज़र के लिए इस्तेमाल होते हैं, और सैंपलर, LoRA और attention पैच सामान्य ComfyUI कनेक्शन ही रहते हैं। यह एक ही ऑडियो ट्रैक से चलने वाला डिजिटल ह्यूमन मोड भी सपोर्ट करता है, जो टॉकिंग-हेड क्लिप के लिए काम का है।

H3 के लिए डायरेक्टर की तरह प्रॉम्प्टिंग

शॉट कार्ड्स के कॉर्क बोर्ड पर इंडेक्स कार्ड लगाता हाथ

पहले सीन, फिर शॉट

H3 उस प्रॉम्प्ट पर सबसे अच्छा प्रतिक्रिया देता है जो पहले पूरा सीन बताए (लोकेशन, किरदार, क्या हो रहा है) और फिर क्लिप को टाइम्ड शॉट में तोड़े। कैमरा मूव और आपको जो ऑडियो चाहिए, वह भी शामिल करें, सिर्फ़ पिक्चर नहीं।

उदाहरण प्रॉम्प्ट: ओसाका की एक बारिश वाली रात का बाज़ार, पीले रेनकोट में एक स्ट्रीट वेंडर कागज़ के कटोरे में शोरबा डाल रहा है। 0 से 4 सेकंड: बर्तन से उठती भाप पर धीमा पुश-इन, तिरपाल पर बारिश की थाप। 4 से 9 सेकंड: मीडियम शॉट, जब वेंडर कटोरा ग्राहक को देता है और मुस्कुराता है। 9 से 15 सेकंड: हैंडहेल्ड फ़ॉलो, जब ग्राहक भीड़ में चलता है। ऑडियो: बारिश, तेल की छन्न-छन्न, दूर की बातचीत, हल्का शमिसेन संगीत।

इसकी तुलना एक पतले प्रॉम्प्ट से करें जैसे "एक आदमी बारिश में नूडल्स बनाता है।" H3 फिर भी कुछ देखने लायक लौटाएगा, लेकिन कैमरा, गति और साउंडट्रैक सब अंदाज़े होंगे। बीट्स साफ़-साफ़ लिखने से मॉडल को फ़ॉलो करने के लिए एक टाइमलाइन मिलती है, और जब कोई शॉट चूकता है तो बदलने के लिए कुछ ठोस मिलता है। हर टेस्ट रन में एक ही बीट बदलें, ताकि पता चल सके कि कौन-सा बदलाव किस नतीजे का कारण बना।

प्रॉम्प्ट को एक जैसा रखने के लिए एक छोटी चेकलिस्ट:

  • सीन: कहाँ, कब और कौन।
  • शॉट: हर बीट के लिए एक लाइन, सेकंड के साथ।
  • कैमरा: पुश-इन, हैंडहेल्ड फ़ॉलो, ऑर्बिट या लॉक्ड-ऑफ़।
  • ऑडियो: डायलॉग, इफ़ेक्ट और म्यूज़िक, हर एक अलग नाम के साथ।

वॉइस-ओवर रूम में कंडेंसर माइक्रोफ़ोन और स्टूडियो हेडफ़ोन

प्रॉम्प्ट में डायलॉग और साउंड

चूँकि ऑडियो पिक्चर के साथ ही बनता है, उसे नाम दें। बताएँ कौन बोल रहा है और क्या कह रहा है, फिर इफ़ेक्ट और म्यूज़िक अपनी अलग लाइन में लिखें, ताकि वे इमेज के वर्णन में घुल न जाएँ। 11 सपोर्टेड भाषाओं के साथ, आप डायलॉग उसी भाषा में लिख सकते हैं जिसमें किरदार को बोलना चाहिए। Easy नोड में # टाइप करने पर एक डायलॉग ब्लॉक खुलता है, जो रन टाइम पर उन <d>...</d> टैग में बदल दिया जाता है जिनकी H3 को ज़रूरत है।

R2V के लिए रेफ़रेंस टैग

रेफ़रेंस मोड में हर इनपुट को टैग से बुलाएँ, उसी क्रम में जिसमें आपने उन्हें कनेक्ट किया: <Picture 1>, <Video 1>, <Audio 1>। फिर बताएँ कि कौन-सा रेफ़रेंस शॉट के किस हिस्से को चलाएगा:

किरदार के चेहरे और पोशाक के लिए <Picture 1> इस्तेमाल करें, कैमरा मूवमेंट के लिए <Video 1>, और आवाज़ के लिए <Audio 1>।

Easy नोड में @Image1, @Video1 और @Audio1 आपके लिए उन टैग में बदल दिए जाते हैं।

एक ही आदमी के कई कोणों से पोर्ट्रेट का कॉन्टैक्ट शीट

फ़र्स्ट और लास्ट फ़्रेम कंट्रोल

दो स्टिल अक्सर सौ और शब्द लिखने से बेहतर क्लिप की दिशा तय करते हैं। I2V मोड में first_frame और last_frame दोनों वैकल्पिक हैं, और मॉडल उनके बीच की मोशन खुद बनाता है।

सूर्योदय और सूर्यास्त के समय एक ही सड़क की दो छपी हुई तस्वीरें

एंडपॉइंट स्टिल बनाएँ और मिलाएँ

ComfyUI खोलने से पहले दोनों फ़्रेम बना लें। PicassoIA Image या Seedream 5 Pro शुरुआती स्टिल बना सकते हैं, और PicassoIA Image Editor Pro जैसा एडिटिंग मॉडल उस इमेज को समापन वाली इमेज में बदलने देता है, ताकि सब्जेक्ट और लाइटिंग करीब रहें।

लेंस का एहसास, रोशनी की दिशा और सब्जेक्ट का आकार मिलाएँ। अगर पहला फ़्रेम सूर्योदय है और आखिरी सूर्यास्त, तो H3 को 15 सेकंड के अंदर पूरा दिन गढ़ना होगा। यह हो सकता है, लेकिन नतीजा टाइम-लैप्स जैसा लगेगा। ऐसे एंडपॉइंट चुनें जहाँ तक एक्शन क्लिप की लंबाई में वास्तव में पहुँच सके।

LoRA: स्पीड और पहचान

H3 के आसपास LoRA के दावे जल्दी उलझ जाते हैं। असल में दो अलग चीज़ें हैं: एक स्पीड LoRA, जो बदलता है कि आपको कितने स्टेप चाहिए, और एक आइडेंटिटी LoRA, जिसे आप अपनी इमेज पर ट्रेन करते हैं।

मॉनिटर के बगल में अखरोट की मेज़ पर पीतल की स्टॉपवॉच

स्पीड के लिए Turbo LoRA

कम्युनिटी का MiniMax-H3-Turbo-LoRA (Apache 2.0, bf16 में लगभग 744 MB) सैंपलिंग स्टेप को लगभग 20 से घटाकर सिर्फ़ 4 तक ला सकता है।

सेटिंगवैल्यू
स्टेप4 से 8, 6 से 8 पसंद किए गए
LoRA स्ट्रेंथ1.0
शेड्यूलरsimple
स्पीडअपसैंपलिंग में लगभग 5x
सुझाई गई फ़ाइलminimax_h3_turbo_v4_step600_ema.safetensors

व्यावहारिक असर आपके इटरेशन लूप पर पड़ता है। मान लीजिए 12 से 16 GB कार्ड पर 20 स्टेप में 480p टेस्ट क्लिप में लगभग 6 मिनट लगते हैं। 5x सैंपलिंग स्पीडअप से हर टेस्ट लगभग डेढ़ मिनट पर आ जाएगा। यह मोटा अनुमान है, माप नहीं, और डिकोडिंग में अब भी समय लगता है, लेकिन यह समझाता है कि लोग ड्राफ़्ट के लिए Turbo क्यों चलाते हैं और फ़ाइनल रेंडर के लिए फ़ुल 20 स्टेप सेटअप।

ComfyUI-MiniMax-H3-Turbo कस्टम नोड इंस्टॉल करें, .safetensors फ़ाइल को अपने LoRA फ़ोल्डर में डालें, और मौजूदा वर्कफ़्लो में मॉडल लोडर और सैंपलर के बीच Turbo LoRA नोड लगाएँ।

💡 ज्ञात सीमा: 4 स्टेप पर भारी मोशन में v4 में स्मियर और घोस्टिंग दिख सकती है, और तेज़ एक्शन के दौरान ऑडियो का बर्ताव अभी भी सुधारा जा रहा है। स्थिर या कम मोशन वाले शॉट के लिए 4 स्टेप और एक्शन के लिए 6 से 8 स्टेप इस्तेमाल करें।

कैरेक्टर LoRA ट्रेन करना

एक क्रिएटर ने 12 GB RTX 4070 पर ai-toolkit से कैरेक्टर LoRA ट्रेन किया, क्वांटाइज़्ड मॉडल और CPU ऑफ़लोडिंग के साथ। उन्होंने जो नंबर बताए:

सेटिंगवैल्यू
डेटासेट512×512 पर 31 से 32 इमेज
LoRA रैंक16
स्टेप1000, बैच साइज़ 1
ट्रेनिंग के दौरान VRAMलगभग 12 GB में से 11.7 GB
सिस्टम RAMलगभग 32 से 37 GB
समयलगभग 6 से 7 घंटे
ज़रूरी कॉन्फ़िगnum_frames: 1 और auto_frame_count: false

दो विवरण तय करते हैं कि यह काम करेगा या नहीं। पहला, जब auto_frame_count चालू रहता है, तो स्टिल-इमेज डेटासेट को वीडियो माना जाता है और ट्रेनिंग रिपोर्ट करती है कि कोई इमेज नहीं मिली। दूसरा, फ़ुल-बॉडी शॉट मिलाने से नतीजे खराब आए। क्रिएटर ने चेहरा-केंद्रित सेट पर स्विच किया, जहाँ चेहरा फ़्रेम का ज़्यादातर हिस्सा भरता है, और एक सरल कैप्शन रखा जिसमें ट्रिगर वर्ड और सब्जेक्ट का छोटा लेबल था। तैयार LoRA LoraLoaderModelOnly नोड से लोड होता है।

सफ़ेद दीवार पर चिपकाई गईं बत्तीस पोर्ट्रेट प्रिंट्स की ग्रिड

💡 जब स्टिल से काम चल जाए तो H3 LoRA छोड़ें। अगर आपको सिर्फ़ फ़र्स्ट फ़्रेम या रेफ़रेंस इमेज के रूप में एक जैसा किरदार चाहिए, तो इसके बजाय इमेज-साइड LoRA ट्रेन करें। PicassoIA पर P Image Trainer p-image मॉडल के लिए कम से कम 10 इमेज वाली zip से LoRA बनाता है, डिफ़ॉल्ट 1000 स्टेप के साथ।

वीडियो LoRA की कहानी अलग है। उसी क्रिएटर ने नोट किया कि 12 GB पर वीडियो क्लिप से ट्रेनिंग शायद पहुँच से बाहर है, और कम्युनिटी बेंचमार्क व्यावहारिक वीडियो ट्रेनिंग के लिए 20 GB या उससे ज़्यादा बताते हैं। ज़्यादातर सेटअप के लिए समझदारी भरा बँटवारा सीधा है: किरदार के लिए आइडेंटिटी LoRA या रेफ़रेंस इमेज, और जब रेंडर का समय सबसे बड़ी रुकावट हो तो Turbo LoRA।

लंबी क्लिप और आम समस्याओं के हल

मोशन कॉन्टेक्स्ट के साथ क्लिप जोड़ें

एक पास में 15 सेकंड ही अधिकतम सीमा है। ComfyUI MiniMax H3 Extender निरंतरता बनाए रखते हुए कई क्लिप जोड़ता है। जब आप कोई क्लिप मंज़ूर करते हैं, तो उसका latent डिस्क पर कैश होता है और अगली क्लिप के लिए मोशन कॉन्टेक्स्ट बन जाता है, ताकि नया शॉट पिछली क्लिप के आखिरी फ़्रेम से आगे बढ़े।

  • हर क्लिप के लिए अलग प्रॉम्प्ट, सीड और अवधि
  • सीड मोड: Randomize, Fixed, Increment, Decrement
  • वही रेफ़रेंस सीमाएँ: 9 इमेज, 3 वीडियो, 3 ऑडियो ट्रैक
  • H.264, H.265/HEVC या FFV1 में एक्सपोर्ट

इसे ComfyUI Manager से या ComfyUI/custom_nodes में क्लोन करके इंस्टॉल करें। पूरे क्रम की योजना पहले कागज़ पर बनाएँ: हर क्लिप के लिए एक लाइन, और साझा किरदार रेफ़रेंस एक बार लिखे हुए, ताकि हर सेगमेंट एक ही पहचान ले और क्लिप-दर-क्लिप बदलता न जाए।

35mm फ़िल्म की पट्टियाँ लाइट टेबल पर सीधी करते सफ़ेद दस्ताने वाले हाथ

बार-बार आने वाली एरर के हल

लक्षणसंभावित कारणहल
256p रन सीधे फ़ेलन्यूनतम साइज़ से नीचे32 के गुणज में 384p या उससे ऊपर इस्तेमाल करें
वीडियो बिना आवाज़ के रेंडरऑडियो डिकोड गायबVAEDecodeAudio जोड़ें और ऑडियो VAE लोड करें
धुंधली, फैली हुई डिटेलस्टेप बहुत कम20 स्टेप रखें और लगभग 15 से नीचे न जाएँ
Turbo के साथ तेज़ मोशन पर घोस्टिंग4 स्टेप सेटिंग6 से 8 स्टेप तक बढ़ाएँ
LoRA ट्रेनिंग को कोई इमेज नहीं मिलतीauto_frame_count चालू हैउसे false और num_frames को 1 पर सेट करें
सक्षम कार्ड पर धीमे रेंडरडिफ़ॉल्ट attention--use-sage-attention के साथ लॉन्च करें

PicassoIA पर आज़माएँ

MiniMax H3 इस लेख के लिखे जाने के समय PicassoIA कैटलॉग में नहीं है, लेकिन ComfyUI में जो काम यह करता है, उनके करीबी विकल्प आप ब्राउज़र में चला सकते हैं, न 40 GB डाउनलोड चाहिए और न VRAM का हिसाब रखना पड़ता है।

अगर आपको चाहिएयह मॉडल आज़माएँ
रेफ़रेंस इमेज या क्लिप जो सब्जेक्ट को एक जैसा रखेंWan 2.7 R2V, जो 720p या 1080p देता है
एक फ़ोटो को मोशन में बदलनाWan 2.7 I2V
MiniMax का अपना वीडियो परिवारसिनेमैटिक टेक्स्ट टू वीडियो के लिए Hailuo 2.3
प्रॉम्प्ट टेस्ट करते समय तेज़ इटरेशनLTX 2.5 Fast
मुफ़्त, असीमित क्लिपSeedance 2.5 Lite या PicassoIA Video

एक व्यावहारिक लूप अच्छा काम करता है: PicassoIA पर अपने एंडपॉइंट स्टिल और किरदार रेफ़रेंस बनाएँ, वहीं कुछ सस्ते टेस्ट चलाकर सीन और कैमरा की भाषा तय करें, फिर जीतने वाला प्रॉम्प्ट नेटिव ऑडियो वाले फ़ाइनल रेंडर के लिए अपने लोकल H3 ग्राफ़ में ले जाएँ। अपने पिछले ComfyUI टेस्ट से एक स्टिल चुनें, उसे Wan 2.7 I2V में डालें, और मोशन की तुलना अपनी H3 क्लिप से करें। यह जानने का सबसे तेज़ तरीका कि आपके प्रॉम्प्ट क्या कर सकते हैं, आज कुछ बनाना है, तो PicassoIA खोलें और अपनी पहली इमेज और वीडियो बनाएँ।

यह लेख शेयर करें

अपनी भाषा चुनें

संबंधित लेख