इस गर्मी में डाउनलोड होने वाले वेट्स वाले दो वीडियो मॉडल सिर्फ़ दस दिनों के अंतर पर आए, और तब से क्रिएटर इन पर बहस कर रहे हैं। MiniMax ने 31 जुलाई 2026 को H3 को API प्रोडक्ट के रूप में घोषित किया, और 3 अगस्त को इसके वेट्स जारी किए। इसके बाद 11 अगस्त को Lightricks ने LTX 2.5 जारी किया। दोनों एक ही पास में तस्वीर और आवाज़ दोनों जनरेट करते हैं। दोनों सिनेमैटिक आउटपुट का वादा करते हैं। लेकिन लाइसेंस की बारीक शर्तें चुनाव को स्पेक शीट के सुझाव से कहीं कम साफ़ बना देती हैं।
यह तुलना उन बातों तक सीमित है जो डेडलाइन के समय मायने रखती हैं: रिज़ोल्यूशन, क्लिप की लंबाई, ऑडियो, स्पीड, कीमत, लोकल हार्डवेयर, और वेट्स का असली इस्तेमाल किसे करने की इजाज़त है। मैंने कोई लैब बेंचमार्क नहीं चलाया, इसलिए नीचे के सभी आँकड़े प्रकाशित स्पेसिफ़िकेशन और लॉन्च रिपोर्ट से हैं, और जो आँकड़े वेंडर के दावे हैं, मैंने उन्हें चिह्नित किया है।
💡 त्वरित फ़ैसला: ज़्यादातर लोगों के लिए LTX 2.5 ओपन विकल्प के रूप में ज़्यादा सुरक्षित है। MiniMax H3 अपने API के ज़रिए 2K आउटपुट और समृद्ध रेफ़रेंस इनपुट देता है, लेकिन जो वेट्स आप असल में डाउनलोड कर सकते हैं, वे हेडलाइन के सुझाव से ज़्यादा सीमित हैं।

सीधा जवाब
एक पंक्ति में विजेता
अगर आप किसी वीडियो मॉडल को अपनी मशीन पर चलाना चाहते हैं, उसे पाइपलाइन में बनाना चाहते हैं, या उसे फाइन-ट्यून करना चाहते हैं, तो ज़्यादातर पाठकों के लिए LTX 2.5 जीतता है। इसके वेट्स Hugging Face पर हैं, यह पहले दिन से ComfyUI में चला, और इसका कम्युनिटी लाइसेंस सालाना 10 मिलियन डॉलर से कम वार्षिक आवर्ती राजस्व (ARR) वाली संस्थाओं के लिए मुफ़्त है। अगर आपको संवाद के साथ 2K आउटपुट और भारी रेफ़रेंस कंट्रोल चाहिए, और आप API के ज़रिए प्रति सेकंड भुगतान करने में ठीक हैं, तो MiniMax H3 एक टेस्ट के लायक है।
"सबसे अच्छा ओपन वीडियो मॉडल" सवाल का ईमानदार जवाब इस पर निर्भर करता है कि आप शब्द ओपन को कितना महत्व देते हैं।
| ज़रूरत | बेहतर विकल्प | कारण |
|---|
| कम कानूनी सवालों के साथ सेल्फ़-होस्टिंग | LTX 2.5 | ओपन वेट्स और 10 मिलियन डॉलर ARR से कम के लिए मुफ़्त कम्युनिटी लाइसेंस |
| सबसे लंबी एक क्लिप | LTX 2.5 | Fast टियर पर 20 सेकंड तक |
| सबसे ज़्यादा बताया गया रिज़ोल्यूशन | LTX 2.5 | 4K तक, H3 के 2K के मुकाबले |
| रेफ़रेंस-भारी डायरेक्शन | MiniMax H3 | इनपुट के रूप में 9 इमेज, 3 वीडियो क्लिप और 3 ऑडियो क्लिप तक |
| मल्टीलिंगुअल संवाद | MiniMax H3 | 11 भाषाओं में लिप सिंक की रिपोर्ट |
| प्रति क्लिप सबसे कम लागत | LTX 2.5 | Fast टियर पर 0.09 डॉलर प्रति सेकंड |
यहाँ "ओपन" का मतलब क्या है
ओपन वेट्स का मतलब ओपन सोर्स नहीं है, और न ही इसका मतलब सबके लिए मुफ़्त है। इसका मतलब है कि मॉडल फ़ाइलें डाउनलोड करके आपके अपने हार्डवेयर पर चलाई जा सकती हैं। इसके बाद लाइसेंस तय करता है कि आप उनके साथ क्या कर सकते हैं। तीन सवाल इसे साफ़ करते हैं:
- डाउनलोड अधिकार: क्या आप फ़ाइलें पा भी सकते हैं?
- उपयोग अधिकार: क्या आप इनके साथ भुगतान वाला क्लाइंट वर्क डिलीवर कर सकते हैं?
- क्षेत्र अधिकार: क्या आपके रहने की जगह पर इन्हें चलाने की अनुमति है?
दोनों वेंडर राजस्व सीमा वाले कस्टम कम्युनिटी लाइसेंस इस्तेमाल करते हैं, इसलिए किसी एक पर प्रोडक्ट बनाने से पहले टेक्स्ट ज़रूर पढ़ें।

LTX 2.5 एक नज़र में
जानने लायक स्पेक्स
Lightricks ने LTX 2.5 को 22B-पैरामीटर वाले ऑडियो-वीडियो मॉडल के रूप में बनाया है, जो तस्वीर और आवाज़ दोनों एक साथ जनरेट करता है। इसकी मुख्य खासियत नेटिव मल्टीशॉट जनरेशन है। आप वाइड, मीडियम और क्लोज़-अप माँगते हैं, और मॉडल उन्हें एक ही सीक्वेंस में रेंडर करता है, जो शॉट-दर-शॉट कैरेक्टर, लाइटिंग और आवाज़ को स्थिर रखता है, बजाय अलग-अलग क्लिप्स को जोड़ने के।
कुछ और जोड़ जो ध्यान देने लायक हैं:
- ऑटोमैटिक अवधि: मॉडल आपके बताए एक्शन से क्लिप की लंबाई का अनुमान लगाता है।
- 4K HDR आउटपुट: फ़िनिशिंग के काम के लिए हाई-रिज़ोल्यूशन, हाई-डायनामिक-रेंज वीडियो।
- RAW वर्कफ़्लो: प्रोफ़ेशनल कलर पाइपलाइन के लिए बना रास्ता।
- एडिटिंग बीटा: मौजूदा फ़ुटेज को दोबारा जनरेट करने के बजाय उसमें बदलाव करने का मोड।
स्पीड के मामले में Lightricks का दावा है कि दो NVIDIA GB200 सुपरचिप्स पर 10 सेकंड की क्लिप 6.8 सेकंड में बन जाती है। यह बहुत महँगे हार्डवेयर पर वेंडर का आँकड़ा है, इसलिए इसे अपनी मेज़ के लिए वादा नहीं, बल्कि ऊपरी सीमा मानें। मैनेज्ड API के ज़रिए वही काम 1080p पर 23.7 सेकंड में होने की रिपोर्ट है, जो अब भी तेज़ है।
लाइसेंस और इकोसिस्टम
वेट्स Hugging Face पर कई वर्ज़नों में हैं: पूरा dev चेकपॉइंट, स्पीड के लिए डिस्टिल्ड वर्ज़न, और कम मेमोरी बजट के लिए int8 और NVFP4 क्वांटाइज़ेशन। रिलीज़ के दिन से ही ComfyUI सपोर्ट तैयार था, जिसमें टेक्स्ट-टू-वीडियो और इमेज-टू-वीडियो के लिए आधिकारिक वर्कफ़्लो टेम्पलेट थे।
LTX-2.x कम्युनिटी लाइसेंस फ़ाइन-ट्यूनिंग और सेल्फ़-होस्टिंग की इजाज़त देता है, और 10 मिलियन डॉलर से कम सालाना आवर्ती राजस्व वाली संस्थाओं के लिए इसकी कोई कीमत नहीं है। यह मॉडल के साथ कोई प्रतिस्पर्धी AI सिस्टम बनाने पर रोक लगाता है, और अलग समझौते के बिना सैन्य उपयोग को प्रतिबंधित करता है।

MiniMax H3 एक नज़र में
H3 क्या लाता है
H3 MiniMax का ओम्नी-मोडल वीडियो मॉडल है, और Hailuo 2.3 लाइन का उत्तराधिकारी है। यह 24 fps पर 4 से 15 सेकंड का वीडियो बनाता है, 2K तक, और नेटिव स्टीरियो साउंड (संवाद, इफ़ेक्ट्स और रूम टोन) उसी पास में बनाता है। लॉन्च रिपोर्ट 11 भाषाओं में लिप-सिंक्ड संवाद भी बताती हैं, और बेस मॉडल की पैरामीटर संख्या 33.1B बताई गई है।
H3 की खासियत इनपुट का लचीलापन है। API में कथित तौर पर अधिकतम 9 रेफ़रेंस इमेज, 3 रेफ़रेंस वीडियो क्लिप (कुल 15 सेकंड) और 3 ऑडियो क्लिप स्वीकार होते हैं, यानी कुल 12 फ़ाइलें, साथ ही 7,000 अक्षरों तक का प्रॉम्प्ट। ऑडियो रेफ़रेंस अकेले नहीं भेजे जा सकते। शॉट-दर-शॉट कैरेक्टर कंसिस्टेंसी के लिए यह काफ़ी डायरेक्टोरियल कंट्रोल है।
लॉन्च-सप्ताह की API कीमत 2K वीडियो के लिए 0.13 डॉलर प्रति सेकंड, या 7.80 डॉलर प्रति मिनट बताई गई थी, जिसमें पहली पाँच रेफ़रेंस इमेज मुफ़्त हैं और उसके बाद हर एक के लिए 0.04 डॉलर। बजट बनाने से पहले MiniMax का मौजूदा रेट कार्ड ज़रूर देखें।

लाइसेंस की पकड़
H3 की शुरुआत केवल-API प्रोडक्ट के रूप में हुई थी। वेट्स 3 अगस्त को MiniMax H3 कम्युनिटी लाइसेंस के तहत आए, और तीन बातें मायने रखती हैं:
- सिर्फ़ H3-Base जारी हुआ। दोनों चेकपॉइंट, FL2VA और Ref2VA, CFG-डिस्टिल्ड हैं।
- 2K स्टेज बंद रहा। लोकल जनरेशन 768 पिक्सल शॉर्ट एज पर चलता है। H3-Regenerate-2K मॉड्यूल को ओपन-सोर्स नहीं किया गया, और API पूरी 2K पाइपलाइन चलाता है।
- क्षेत्रीय सीमाएँ। कई लाइसेंस विश्लेषण, जिनमें होस्टिंग-प्रोवाइडर के ब्रेकडाउन भी शामिल हैं, कहते हैं कि लाइसेंस संयुक्त राज्य अमेरिका, यूरोपीय संघ, यूनाइटेड किंगडम और दक्षिण कोरिया को बाहर रखता है, और रिपोर्ट के अनुसार इन क्षेत्रों के भीतर मॉडल के आउटपुट का इस्तेमाल करने पर भी। 20 मिलियन डॉलर की राजस्व सीमा भी बताई गई है।
💡 किसी भी तीसरे पक्ष के सारांश पर भरोसा करने से पहले लाइसेंस का टेक्स्ट खुद पढ़ें, इस सारांश समेत। अगर क्षेत्रीय बहिष्कार आपके रहने की जगह पर लागू होता है, तो स्पेक शीट चाहे जितनी अच्छी दिखे, ओपन वेट्स आपके लिए नहीं हैं।
आमने-सामने की तुलना
रिज़ोल्यूशन और क्लिप की लंबाई
| फ़ीचर | LTX 2.5 | MiniMax H3 |
|---|
| रिलीज़ | 11 अगस्त 2026 | API 31 जुलाई, वेट्स 3 अगस्त 2026 |
| मॉडल का आकार | 22B पैरामीटर | 33.1B पैरामीटर |
| ओपन वेट्स | Full dev, distilled, int8, NVFP4 | केवल H3-Base (FL2VA, Ref2VA) |
| सबसे ऊँचा रिज़ोल्यूशन | 4K HDR तक | API पर 2K, लोकल पर 768p शॉर्ट एज |
| क्लिप की लंबाई | 20 सेकंड तक (Fast टियर) | 4 से 15 सेकंड |
| ऑडियो | जॉइंट ऑडियो और वीडियो | नेटिव स्टीरियो, 11 भाषाओं में संवाद |
| मल्टीशॉट | नेटिव मल्टीशॉट सीक्वेंस | एक ही जनरेशन के भीतर कई शॉट |
| रेफ़रेंस इनपुट | इमेज से वीडियो, पहला और आख़िरी फ़्रेम | 9 इमेज, 3 वीडियो, 3 ऑडियो क्लिप |
| लाइसेंस | LTX-2.x कम्युनिटी, 10M ARR से कम पर मुफ़्त | MiniMax H3 कम्युनिटी, रिपोर्ट की गई क्षेत्रीय सीमाएँ |
काग़ज़ पर LTX 2.5 के पास ज़्यादा गुंजाइश है: 4K तक और 20 सेकंड तक। लंबी क्लिप के साथ एक समझौता भी जुड़ा है, क्योंकि 20 सेकंड की सीमा 1080p या उससे कम पर लागू होती है। H3 API पर 2K और 15 सेकंड तक जाता है, और लोकल पर 768p तक। लेकिन रिज़ोल्यूशन ही क्वालिटी नहीं है। विश्वसनीय मोशन वाली साफ़ 1080p क्लिप, पिघलते हाथों वाली 4K क्लिप से बेहतर है।
चेहरे, मोशन और ऑडियो
क्लोज़-अप किसी भी वीडियो मॉडल की हर कमज़ोरी उजागर कर देते हैं: त्वचा की बनावट, पलकें झपकना, बालों की लटें, होंठों के आकार। H3 रेफ़रेंस-आधारित कंसिस्टेंसी और मल्टीलिंगुअल लिप सिंक का प्रचार करता है, जो इशारा करता है कि MiniMax संवाद-आधारित दृश्यों को निशाना बना रहा है। LTX 2.5 उसी लक्ष्य पर जॉइंट ऑडियो-वीडियो जनरेशन और मल्टीशॉट सीक्वेंस के साथ जाता है, जो शॉट बदलने पर भी आवाज़ को स्थिर रखते हैं।
मैं स्पेक शीट से उनके चेहरों की ईमानदारी से रैंकिंग नहीं कर सकता, और साइड-बाय-साइड रेंडर के बिना किसी और के लिए भी यह मुमकिन नहीं है। अपने ही मटीरियल से टेस्ट करें: एक चेहरा, संवाद की एक पंक्ति, एक कैमरा मूव।

तस्वीर का दूसरा हिस्सा साउंड है:
- LTX 2.5: ऑडियो वीडियो के साथ जॉइंट रूप से जनरेट होता है, और LTX 2.5 Fast पर इसे हर रेंडर के लिए चालू या बंद किया जा सकता है।
- H3: एक स्पेक लिस्टिंग के अनुसार 32 kHz पर स्टीरियो आउटपुट, संवाद, इफ़ेक्ट्स और रूम टोन उसी पास में।

स्पीड और लागत
प्रति सेकंड कीमत से हिसाब आसान हो जाता है। ये रिपोर्ट के अनुसार लॉन्च-सप्ताह की API कीमतें हैं, और रिज़ोल्यूशन अलग हैं (H3 2K पर, LTX 1080p तक), इसलिए यह सेब-से-सेब की तुलना नहीं है।
| क्लिप की लंबाई | LTX 2.5 Fast ($0.09/s) | LTX 2.5 Pro ($0.12/s) | H3 2K पर ($0.13/s) |
|---|
| 5 सेकंड | $0.45 | $0.60 | $0.65 |
| 10 सेकंड | $0.90 | $1.20 | $1.30 |
| 15 सेकंड | $1.35 | उपलब्ध नहीं (10 सेकंड की सीमा) | $1.95 |
| 20 सेकंड | $1.80 | उपलब्ध नहीं (10 सेकंड की सीमा) | उपलब्ध नहीं (15 सेकंड की सीमा) |
बार-बार प्रयोग करने का सबसे सस्ता तरीका Fast टियर है। Pro टियर प्रॉम्प्ट के पालन, चेहरों और टाइपोग्राफ़ी के लिए पेश किया गया है, इसलिए Fast ड्राफ़्ट सही लगने के बाद फ़ाइनल रेंडर के लिए यह ठीक रहता है।

अपने हार्डवेयर पर इन्हें चलाना
वर्कस्टेशन पर LTX 2.5
Lightricks स्पीड के लिए डिस्टिल्ड चेकपॉइंट और कसे मेमोरी बजट के लिए क्वांटाइज़्ड बिल्ड देता है। NVFP4 बिल्ड NVIDIA के सबसे नए आर्किटेक्चर को लक्षित करते हैं, इसलिए पुराने कार्ड int8 के साथ शायद बेहतर चलेंगे। लॉन्च रिपोर्ट में मुझे VRAM की कोई पक्की न्यूनतम संख्या नहीं मिली, इसलिए अपने सटीक GPU के लिए मॉडल कार्ड देखें।
एक समझदार पहला रन: ComfyUI में डिस्टिल्ड चेकपॉइंट लोड करें, 1080p पर 10 सेकंड की क्लिप रेंडर करें, और उसके बाद ही 4K या लंबी अवधि की ओर बढ़ें।

H3 की लोकल सीमाएँ
H3 रिपॉज़िटरी बहुत बड़ी है। एक होस्टिंग-प्रोवाइडर वॉकथ्रू के अनुसार, सभी क्वांटाइज़ेशन समेत पूरी डाउनलोड लगभग 600 GB की है। बेस मॉडल 33.1B डेंस पैरामीटर का है, जबकि LTX 2.5 के लिए 22B है, इसलिए आपके GPU पर भारी लोड की उम्मीद रखें। ComfyUI में H3 के चार नोड जोड़े गए हैं: EmptyMiniMaxH3LatentAV, MiniMaxH3ImageToVideo, MiniMaxH3ReferenceToVideo और MiniMaxH3SigmaShift।
लोकल पर जो मिलता है वह 768p बेस रिज़ल्ट है। मार्केटिंग पेजों पर दिखने वाली 2K पॉलिश API से आती है।
PicassoIA पर LTX 2.5 कैसे इस्तेमाल करें
इस मॉडल को आज़माने के लिए आपको GPU की ज़रूरत नहीं है। LTX 2.5 Fast Picasso IA पर चलता है और टेक्स्ट प्रॉम्प्ट या एक ही फ़ोटो लेता है। लिखने के समय H3 खुद वहाँ कैटलॉग में नहीं है। वहाँ के सबसे नए MiniMax मॉडल Hailuo 2.3 और Hailuo 2.3 Fast हैं, जो MiniMax के लुक का एक उचित साइड टेस्ट बनाते हैं।
चरण-दर-चरण
- टेक्स्ट-टू-वीडियो कलेक्शन में LTX 2.5 Fast पेज खोलें।
- अपना इनपुट चुनें। अकेला प्रॉम्प्ट लिखें, या इमेज-टू-वीडियो के लिए पहला फ़्रेम फ़ोटो अपलोड करें।
- वैकल्पिक: आख़िरी फ़्रेम इमेज जोड़ें, और मॉडल दोनों के बीच ट्रांज़िशन इंटरपोलेट करेगा।
- आस्पेक्ट रेशियो, रिज़ोल्यूशन, अवधि और फ़्रेम रेट सेट करें (नीचे की तालिका देखें)।
- सिंक्ड साउंड चाहिए तो Generate Audio चालू रखें।
- जनरेट करें, क्लिप का प्रीव्यू देखें, फिर उसे डाउनलोड करें या प्रॉम्प्ट बदलकर दोबारा चलाएँ।
सेटिंग्स और प्रॉम्प्ट टिप्स
| सेटिंग | विकल्प | नोट्स |
|---|
| आस्पेक्ट रेशियो | 16:9, 9:16 | वेब के लिए लैंडस्केप, सोशल के लिए पोर्ट्रेट |
| रिज़ोल्यूशन | 720p, 1080p, 2K, 4K | डिफ़ॉल्ट 1080p है; ऊँचे रिज़ोल्यूशन अवधि की सीमा तय करते हैं |
| अवधि | 2 से 20 सेकंड | 10 सेकंड से ऊपर केवल 720p या 1080p पर 24 या 25 fps के साथ |
| फ़्रेम रेट | 24, 25, 48, 50 | 48 और 50 fps 10 सेकंड पर सीमित होते हैं |
| Generate audio | चालू या बंद | डिफ़ॉल्ट रूप से चालू |
पहले फ़्रेम के लिए Seedream 5 Pro जैसे इमेज मॉडल से स्टिल बनाएँ, फिर उसे वीडियो मॉडल को दें। मोशन जोड़ने से पहले ही आप कंपोज़िशन तय कर लेते हैं।
प्रॉम्प्ट उसी क्रम में लिखें जिस क्रम में चीज़ें होती हैं: सब्जेक्ट, एक्शन, कैमरा मूव, लाइट, फिर साउंड। उदाहरण के लिए:
सुबह के समय एक मछुआरा छोटी लकड़ी की नाव पर रस्सी खींचता है। स्टर्न की ओर से धीमा डॉली-इन, पानी पर समुद्री धुंध तैरती हुई, गीले तख़्तों पर नीची अंबर रोशनी। लकड़ी की चरमराहट, हल्की लहरें और दूर से आती सीगलों की आवाज़।

आपको कौन सा चुनना चाहिए?
LTX 2.5 कब चुनें
- आप बिना क्षेत्रीय सवालों के सेल्फ़-होस्ट या फ़ाइन-ट्यून करना चाहते हैं।
- 15 सेकंड से लंबी क्लिप आपके लिए मायने रखती हैं।
- आप बहुत प्रयोग करते हैं और हर ड्राफ़्ट की सबसे कम लागत चाहिए।
- आप ComfyUI में काम करते हैं और पहले दिन के वर्कफ़्लो टेम्पलेट चाहते हैं।
- आपको फ़िनिशिंग पाइपलाइन के लिए 4K HDR चाहिए।
H3 कब चुनें
- आप कई रेफ़रेंस के साथ डायरेक्शन देते हैं: चेहरे, फ़ुटेज और आवाज़ की क्लिप एक ही अनुरोध में।
- आपके दृश्य मल्टीलिंगुअल संवाद पर निर्भर हैं।
- API इस्तेमाल करने में आपको कोई दिक्कत नहीं, और 2K आउटपुट लोकल कंट्रोल से ज़्यादा ज़रूरी है।
- आपने पुष्टि कर ली है कि लाइसेंस आपकी जगह और आपकी राजस्व सीमा की इजाज़त देता है।
अगर दोनों में से कोई भी फ़िट न हो, तो तीसरी राय के लिए वही प्रॉम्प्ट Kling v3 Video या Veo 3.1 पर चलाएँ।
अपनी खुद की तुलना करें
स्पेक्स की भी एक सीमा होती है। इसे तय करने का सबसे तेज़ तरीका है एक ही शॉट को दो बार रेंडर करना और आवाज़ चालू रखकर देखना। Picasso IA पर LTX 2.5 Fast खोलें, एक प्रॉम्प्ट पेस्ट करें, और उसे 1080p पर और फिर 4K पर रेंडर करें। फिर वही विवरण Hailuo 2.3 पर चलाएँ और चेहरे, मोशन और ऑडियो को साथ-साथ तुलना करें।
कस्टम पहला फ़्रेम चाहिए? उसे Picasso IA के इमेज मॉडल से बनाएँ, उसे शुरुआती इमेज के रूप में अपलोड करें, और वीडियो मॉडल को आगे का काम करने दें। कुछ प्रयोग आपको किसी भी स्पेक टेबल से ज़्यादा बताएँगे, इस टेबल से भी।