LTX 2.3 Pro का Extend Mode किसी भी दूसरे AI वीडियो टूल से कैसे अलग है

LTX 2.3 Pro का Extend Mode पहला AI वीडियो टूल है जो आर्किटेक्चर के स्तर पर कई पिछले फ़्रेमों पर कंडीशन करता है। इससे वीडियो सहज ढंग से आगे बढ़ता है और हर एक्सटेंशन में लाइटिंग, मोशन फ़िज़िक्स और सीन की ज्योमेट्री एक जैसी रहती है। यह लेख बताता है कि यह कैसे काम करता है और मौजूदा दूसरे तरीकों से कैसे अलग है।

LTX 2.3 Pro का Extend Mode किसी भी दूसरे AI वीडियो टूल से कैसे अलग है
Cristian Da Conceicao
Picasso IA के संस्थापक

ज़्यादातर AI वीडियो टूल एक्सटेंशन को बाद में सोची गई चीज़ मानते हैं। आप एक क्लिप बनाते हैं, वह खत्म हो जाती है, और अगर आपको और फ़ुटेज चाहिए, तो या तो शुरू से दोबारा जनरेट करते हैं, विज़ुअल ड्रिफ़्ट स्वीकार करते हैं, या दो क्लिप जोड़ देते हैं और उम्मीद करते हैं कि कट बहुत साफ़ न दिखे। LTX 2.3 Pro इसे आर्किटेक्चर के स्तर पर हल करता है, पोस्ट-प्रोसेसिंग के स्तर पर नहीं, और यही फ़र्क इस बात को पूरी तरह बदल देता है कि इससे आप वास्तव में क्या बना सकते हैं।

Extend Mode LTX 2.3 Pro की मुख्य क्षमता है, जो Lightricks का फ़्लैगशिप लेटेंट वीडियो डिफ़्यूज़न मॉडल है और PicassoIA पर उपलब्ध है। यह आपको मॉडल को किसी मौजूदा क्लिप के आख़िरी फ़्रेम देने और अगला तार्किक सीक्वेंस बनाने के लिए प्रॉम्प्ट करने देता है, जिसमें जोड़ के पार लाइटिंग, मोशन फ़िज़िक्स और सीन की ज्योमेट्री एक जैसी रहती है। कोई हार्ड कट नहीं। कलर ग्रेड का कोई बेमेल नहीं। जोड़ पर कोई टेम्पोरल आर्टिफ़ैक्ट नहीं आता। वीडियो कंटिन्यूएशन का यह तरीका इस समय उपलब्ध किसी भी दूसरे तरीके से मूल रूप से अलग है।

कई ट्रैक और कलर ओवरले वाली टाइमलाइन पर एक्सटेंडेड फ़ुटेज के सेगमेंट दिखाती वीडियो एडिटिंग टाइमलाइन

Extend Mode असल में क्या करता है

इसे सीधे शब्दों में समझने का सबसे आसान तरीका: Extend Mode नॉइज़ से शुरू नहीं करता। वह आपकी क्लिप से शुरू करता है।

स्टैंडर्ड वीडियो जनरेशन मॉडल एक रैंडम लेटेंट नॉइज़ वेक्टर से सैंपल लेते हैं और उसे एक लक्ष्य प्रॉम्प्ट की ओर डिकोड करते हैं। हर नया जनरेशन पिछले वाले से सांख्यिकीय रूप से स्वतंत्र होता है। जब आपको सिर्फ़ एक स्वतंत्र क्लिप चाहिए, तो यह ठीक है, लेकिन जब निरंतरता चाहिए, तो यह विनाशकारी है। मॉडल के पास यह संरचनात्मक स्मृति नहीं होती कि आपके मूल सीन में कैसा दिख रहा था, परछाइयाँ कैसे पड़ रही थीं, कैमरा किस पथ पर था, या वस्तुएँ किस दिशा में चल रही थीं।

LTX 2.3 Pro के Extend Mode में जनरेशन प्रक्रिया आपकी मौजूदा क्लिप के आख़िरी फ़्रेम के एन्कोडेड लेटेंट रिप्रेज़ेंटेशन पर कंडीशन की जाती है। वे फ़्रेम मॉडल के लेटेंट स्पेस में एन्कोड होते हैं और एक्सटेंशन के लिए डिफ़्यूज़न प्रक्रिया की शुरुआती बाधाओं का हिस्सा बन जाते हैं। डीनॉइज़िंग अब बिना संदर्भ के नहीं चल रही। वह इस बात से सीधे जुड़कर चलती है कि पहले असल में क्या हुआ था।

💡 व्यावहारिक रूप से: मान लीजिए आपकी मूल क्लिप में एक महिला दोपहर की छिटपुट धूप में चल रही है, जहाँ रोशनी ऊपर-बाईं ओर से आ रही है। एक्सटेंशन उसी महिला, उसी पार्क और उसी रोशनी की दिशा के साथ आगे बढ़ेगा। सीन की फ़िज़िक्स इसलिए बनी रहती है क्योंकि मॉडल को उन्हीं पर कंडीशन किया गया था, उसे उनका अनुमान लगाने के लिए नहीं छोड़ा गया।

यह कोई छोटा फ़र्क नहीं है। यही पूरा खेल है।

गोल्डन आवर में तटीय चट्टानों पर फ़ुटेज शूट करता फ़िल्ममेकर, पृष्ठभूमि में समुद्री लहरें

यहाँ टेम्पोरल कोहेरेंस असल में कैसे काम करती है

AI वीडियो चर्चाओं में "टेम्पोरल कोहेरेंस" शब्द ढीले-ढाले ढंग से इस्तेमाल होता है। LTX 2.3 Pro के संदर्भ में इसका असल मतलब क्या है, इसे ठीक से समझना उपयोगी है, क्योंकि यही तंत्र आउटपुट को हर I2V विकल्प से अलग महसूस कराता है।

टेम्पोरल कोहेरेंस वीडियो सीक्वेंस के फ़्रेमों में विज़ुअल जानकारी की एकरूपता को दर्शाता है। पिक्सल के स्तर पर इसका मतलब है कि वस्तुएँ अपना आकार, रंग और स्थिति बनाए रखती हैं, जैसी गति की फ़िज़िक्स से अपेक्षा हो। सिमेंटिक स्तर पर इसका मतलब है कि सीन ढीले-ढाले जुड़े फ़्रेमों की श्रृंखला के बजाय एक निरंतर अनुभव की तरह पढ़ा जाता है।

LTX 2.3 Pro यह अपने ट्रांसफ़ॉर्मर बैकबोन में कॉज़ल अटेंशन मैकेनिज़्म के ज़रिए हासिल करता है। एक्सटेंशन जनरेट करते समय अटेंशन हेड्स पिछले फ़्रेमों के लेटेंट रिप्रेज़ेंटेशन में पीछे की ओर देख सकते हैं। यह सिर्फ़ आखिरी फ़्रेम को इमेज प्रॉम्प्ट की तरह इस्तेमाल करने से आर्किटेक्चर के स्तर पर अलग है। एक अकेला इमेज प्रॉम्प्ट मॉडल को एक स्नैपशॉट देता है, यानी ऐसा संदर्भ जिसमें वेग या दिशा नहीं होती। कई पिछले फ़्रेमों पर कॉज़ल अटेंशन मॉडल को एक साथ वेग वेक्टर, समय के साथ लाइटिंग ग्रेडिएंट की दिशा, कैमरा ट्रेजेक्टरी डेटा और वस्तुओं की स्थिति के पथ देता है।

नतीजा ऐसी मोशन प्रेडिक्शन है जो फ़िज़िकली ग्राउंडेड महसूस होती है, न कि हैलुसिनेटेड। जो पानी बाईं ओर बह रहा था, वह बाईं ओर बहता रहता है। कदम के बीच में चल रहा व्यक्ति न्यूट्रल पोज़ पर लौटे बिना अपना कदम जारी रखता है। पैन करता शॉट उसी कोणीय गति और उसी क्षितिज रेखा के साथ पैन करता रहता है। ये ब्योरे ही उस फ़ुटेज को अलग करते हैं जो प्रोफ़ेशनल संदर्भ में टिकता है, उस फ़ुटेज से जो "त्वरित सोशल पोस्ट के लिए काफ़ी अच्छा" होता है।

एक फ़्रेम मॉडल को बताता है चीज़ें कहाँ हैं। कई फ़्रेम उसे बताते हैं चीज़ें कहाँ जा रही हैं, और किस रफ़्तार से।

तीन मॉनिटरों वाला प्रोफ़ेशनल वीडियो प्रोडक्शन स्टूडियो, जिन पर सिंक्रोनाइज़्ड एक्सटेंडेड वीडियो क्लिप दिख रही हैं

दूसरे मॉडल एक्सटेंशन में क्यों पीछे रह जाते हैं

तुलना सीधी है। Kling v3 Video या Veo 3 जैसे मॉडल लें। दोनों अपने-आप में उत्कृष्ट टेक्स्ट-टू-वीडियो जनरेटर हैं। लेकिन दोनों को सीमलेस वीडियो कंटिन्यूएशन को एक प्रथम-श्रेणी आर्किटेक्चरल फ़ीचर मानकर डिज़ाइन नहीं किया गया था।

जब आप इन मॉडलों पर इमेज-टू-वीडियो (I2V) मोड का इस्तेमाल करके क्लिप को "एक्सटेंड" करते हैं, तो आप आख़िरी फ़्रेम को एक स्थिर इमेज की तरह देते हैं। मॉडल फिर आपके टेक्स्ट प्रॉम्प्ट के आधार पर उस फ़्रेम से मोशन जनरेट करता है। यहीं पर जोड़ दिखने लगता है:

  • मोशन की दिशा फिर से शुरू हो जाती है: मॉडल ऐसी मोशन दिशा चुनता है जो स्थिर इमेज और प्रॉम्प्ट से मेल खाती है, न कि पिछली क्लिप के मोमेंटम से।
  • लाइटिंग स्वतंत्र रूप से दोबारा कैलकुलेट होती है: मॉडल सीन को एक जमे हुए शुरुआती बिंदु से दोबारा आँकता है, इसलिए परछाई के कोण और एक्सपोज़र थोड़े बदल सकते हैं।
  • माइक्रो-मोशन के ब्योरे खो जाते हैं: कैमरा शेक, किसी किरदार की साँस की गति, पानी की लहरों की आवृत्ति, ये सूक्ष्म ब्योरे जो फ़ुटेज को जीवंत बनाते हैं, नए सिरे से जनरेट होते हैं और लगभग कभी मूल से मेल नहीं खाते।

अगर ध्यान से देखें, तो ज़्यादातर मॉडलों में वह विज़ुअल जोड़ दिखता है जहाँ मूल क्लिप खत्म होती है और I2V एक्सटेंशन शुरू होता है। 24fps पर बड़ी स्क्रीन पर चलाने पर यह अक्सर बिना ध्यान से देखे भी दिख जाता है।

💡 इसी वजह से प्रोफ़ेशनल वीडियो क्रिएटर अक्सर I2V एक्सटेंशन को "सोशल मीडिया के लिए ठीक" कहते हैं, लेकिन ऐसी किसी चीज़ के लिए अनुपयुक्त मानते हैं जिसे प्रोफ़ेशनल संदर्भ में दिखाना हो, क्लाइंट को पेश करना हो या प्रोडक्शन रील में शामिल करना हो। जोड़ ही सबूत है।

Sora 2 Pro और Wan 2.7 T2V भी मज़बूत स्टैंडअलोन फ़ुटेज बनाते हैं, लेकिन एक्सटेंशन वर्कफ़्लो के लिए नेटिव मल्टी-फ़्रेम प्रायर कंडीशनिंग इनमें भी उसी तरह नहीं है। ये जनरेशन टूल हैं, कंटिन्यूएशन टूल नहीं। जैसे-जैसे क्रिएटर AI के साथ लंबी और ज़्यादा सुसंगत वीडियो कहानियाँ बनाने की कोशिश करते हैं, यह फ़र्क और ज़्यादा मायने रखने लगता है।

वीडियो एडिटिंग सॉफ़्टवेयर पर काम करते हाथों का क्लोज़-अप, स्क्रीन पर फ़्रेम तुलना दिख रही है

LTX 2.3 Pro को अलग करने वाली तीन बातें

1. मल्टी-फ़्रेम प्रायर कंडीशनिंग

ज़्यादातर I2V तरीके एक फ़्रेम पर कंडीशन करते हैं। LTX 2.3 Pro कई पिछले फ़्रेमों पर कंडीशन करता है, जो एक एकीकृत लेटेंट रिप्रेज़ेंटेशन में एक साथ एन्कोड होते हैं। इससे मॉडल को पर्याप्त टेम्पोरल डेटा मिलता है ताकि वह वस्तु के वेग वेक्टर, कैमरा मूवमेंट की गति और दिशा, और सीन में समय के साथ लाइटिंग ग्रेडिएंट की प्रगति का अनुमान लगा सके।

सिंगल-फ़्रेम और मल्टी-फ़्रेम कंडीशनिंग के आउटपुट की गुणवत्ता में फ़र्क मामूली नहीं है। यह संरचनात्मक है। सिंगल-फ़्रेम कंडीशनिंग ऐसी क्लिप बनाती है जो सीन को आगे बढ़ाती दिखती है। मल्टी-फ़्रेम कंडीशनिंग ऐसी क्लिप बनाती है जो फ़िज़िक्स के स्तर पर सीन की सचमुच निरंतरता होती है।

2. नेटिव 4K आउटपुट रिज़ोल्यूशन

LTX 2.3 Pro नेटिव रूप से 4K रिज़ोल्यूशन पर जनरेट करता है। एक्सटेंशन के लिए यह खास मायने रखता है, क्योंकि हाई-रिज़ोल्यूशन आउटपुट मूल और एक्सटेंडेड फ़ुटेज के बीच के जोड़ पर पोस्ट-प्रोडक्शन में काम को आसान बनाता है। 4K पर जोड़ के ऊपर क्रॉस-डिज़ॉल्व लगाने के लिए आपके पास ज़्यादा पिक्सल डेटा होता है, और फ़्रेम का बारीक ब्योरा यह भी सुनिश्चित करता है कि जोड़ पर बची हुई किसी असंगति का दर्शक को कम एहसास हो।

इसकी तुलना LTX 2.3 Fast से करें, जो रिज़ोल्यूशन की तुलना में स्पीड को प्राथमिकता देता है और तेज़ इटरेशन की ज़रूरत होने पर अच्छा विकल्प है, या मूल LTX Video से, जिसने अंतर्निहित आर्किटेक्चर स्थापित किया था लेकिन काफ़ी कम रिज़ोल्यूशन पर चलता है। अंतिम डिलीवरी के लिए LTX 2.3 Pro वही मॉडल है जो आप चाहेंगे।

3. एक्सटेंशन के भीतर प्रॉम्प्ट स्टीयरिंग

Extend Mode सीन को सिर्फ़ यंत्रवत तरीके से आगे नहीं बढ़ाता। आप एक टेक्स्ट प्रॉम्प्ट दे सकते हैं जो तय करे कि आगे क्या होता है, वह भी पिछले फ़्रेमों द्वारा तय सीमाओं के भीतर। इसका मतलब है कि आप किसी किरदार के मुड़ने, कैमरा के डॉली फ़ॉरवर्ड होने, या बादल के ऊपर से गुज़रने पर रोशनी बदलने के लिए प्रॉम्प्ट दे सकते हैं, और मॉडल वे बदलाव आज़माएगा और साथ ही पिछले फ़ुटेज की स्थापित विज़ुअल भाषा के साथ निरंतरता बनाए रखेगा।

यह डायरेक्टोरियल कंट्रोल के साथ सीन की निरंतरता है, जो सिर्फ़ यांत्रिक एक्सट्रापोलेशन से मूलतः अलग तरह का टूल है।

सुबह-सुबह जंगल की खुली जगह, देवदार के पेड़ों से होकर आती वॉल्यूमेट्रिक रोशनी की किरणें और सुबह की धुंध

LTX 2.3 Pro बनाम दूसरे वीडियो मॉडल

एक्सटेंशन के उपयोग के मामलों के लिए फ़ीचर की सीधी तुलना यहाँ है:

मॉडलएक्सटेंशन तरीकारिज़ोल्यूशनटेम्पोरल कोहेरेंसप्रॉम्प्ट स्टीयरिंग
LTX 2.3 Proमल्टी-फ़्रेम प्रायर कंडीशनिंग4Kउच्चहाँ
LTX 2 Proमल्टी-फ़्रेम प्रायर1080pउच्चहाँ
Kling v3 Videoसिंगल-फ़्रेम I2V1080pमध्यमहाँ
Veo 3सिंगल-फ़्रेम I2V1080pमध्यमहाँ
Wan 2.7 T2Vटेक्स्ट रीजनरेशन1080pएक्सटेंशन के लिए कमहाँ
Hailuo 2.3सिंगल-फ़्रेम I2V1080pमध्यमसीमित
Ray 3.2सिंगल-फ़्रेम I2VHDRमध्यमहाँ
Seedance 2.5टेक्स्ट और इमेज30 सेकंड की क्लिपएक्सटेंशन के लिए कमहाँ

तालिका स्थिति साफ़ कर देती है: LTX 2.3 Pro इस समूह का अकेला मॉडल है जो मल्टी-फ़्रेम प्रायर कंडीशनिंग को 4K आउटपुट रिज़ोल्यूशन के साथ जोड़ता है। इसका पिछला वर्ज़न LTX 2 Pro वही कंडीशनिंग आर्किटेक्चर साझा करता है, लेकिन 1080p पर चलता है, जिससे LTX 2.3 Pro हाई-फ़िडेलिटी एक्सटेंशन के काम के लिए मौजूदा शीर्ष विकल्प बन जाता है।

साथ-साथ रखे दो प्रोफ़ेशनल मॉनिटर, एक पर मूल वीडियो और दूसरे पर उसका सीमलेस एक्सटेंडेड हिस्सा

PicassoIA पर LTX 2.3 Pro का इस्तेमाल कैसे करें

LTX 2.3 Pro सीधे PicassoIA पर उपलब्ध है। व्यवहार में Extend Mode वर्कफ़्लो ऐसे चलता है:

स्टेप 1: अपनी बेस क्लिप जनरेट करें या अपलोड करें। कोई भी वीडियो क्लिप चुनें जिसे आप आगे बढ़ाना चाहते हैं। यह वह क्लिप हो सकती है जो आपने पहले LTX 2.3 Pro, LTX 2.3 Fast से बनाई थी, या कोई बाहरी फ़ुटेज जो मॉडल की इनपुट आवश्यकताओं पर खरा उतरता हो।

स्टेप 2: Extend Mode चुनें। मॉडल इंटरफ़ेस में स्टैंडर्ड जनरेशन के बजाय एक्सटेंशन विकल्प चुनें। इससे फ़्रेश नॉइज़ सैंपलिंग के बजाय मल्टी-फ़्रेम कंडीशनिंग सक्रिय होती है।

स्टेप 3: एक्सटेंशन की लंबाई तय करें। बताएँ कि कितने सेकंड की नई फ़ुटेज जनरेट करनी है। 3-5 सेकंड की रेंज में छोटे एक्सटेंशन की कोहेरेंस सबसे ज़्यादा रहती है। लंबे एक्सटेंशन अच्छे नतीजे दे सकते हैं, लेकिन क्लिप के दूर वाले सिरे की ओर प्रॉम्प्ट ड्रिफ़्ट ज़्यादा दिख सकता है।

स्टेप 4: अपना कंटिन्यूएशन प्रॉम्प्ट लिखें। मोशन और सीन में बदलावों के बारे में साफ़-साफ़ बताएँ। "महिला चलना जारी रखती है" की जगह लिखें "महिला धीरे-धीरे रुकती है और कैमरे की ओर मुड़कर देखती है, बाईं ओर से अब भी धूप आ रही है, वही पार्क की पृष्ठभूमि, हल्की हवा उसके बालों को हिला रही है।" विशिष्ट निर्देशों से मॉडल को स्थापित सीन में पालन करने के लिए साफ़ डायरेक्टोरियल मंशा मिलती है।

स्टेप 5: समीक्षा करें और दोहराएँ। एक्सटेंशन को पूरी प्लेबैक स्पीड पर देखें, फिर जोड़ वाले बिंदु पर फ़्रेम-दर-फ़्रेम आगे बढ़ें। अगर जोड़ सीमलेस नहीं है, तो थोड़ा बदला हुआ प्रॉम्प्ट लेकर दोबारा जनरेट करें, या एक्सटेंशन के आख़िरी दो फ़्रेम को नए एक्सटेंशन कॉल के लिए नई बेस क्लिप के रूप में इस्तेमाल करने की कोशिश करें।

💡 लंबी फ़ॉर्म सामग्री के लिए सबसे भरोसेमंद तरीका चेनिंग है: 5 सेकंड जनरेट करें, 5 सेकंड बढ़ाएँ, फिर एक और बार बढ़ाएँ। हर एक्सटेंशन ताज़ा पिछले फ़्रेमों पर कंडीशन होता है, इसलिए कुल क्लिप की लंबाई 30, 60 सेकंड या उससे आगे बढ़ने पर भी कोहेरेंस ऊँचा रहता है।

क्लाइंट के साथ समीक्षा करते हुए क्रिएटिव डायरेक्टर टैबलेट पर AI-जनरेटेड वीडियो फ़्रेम की ओर इशारा करते हुए

असली नतीजे: Extend Mode से क्या उम्मीद करें

आर्किटेक्चर जो वादा करता है और व्यवहार में जो देता है, उसके आधार पर ईमानदार आकलन:

जहाँ यह सबसे अच्छा चलता है:

  • स्थिर कैमरा शॉट्स जिनमें सब्जेक्ट चलते हैं (लोग चलते हुए, बहता पानी, हवा में हिलती पत्तियाँ)
  • धीमी, सोच-समझकर की गई कैमरा मूवमेंट जहाँ ट्रेजेक्टरी मूल क्लिप में साफ़ स्थापित हो चुकी हो
  • नियंत्रित कृत्रिम लाइटिंग वाले इनडोर सीन, जो फ़्रेम-दर-फ़्रेम तेज़ी से न बदलती हो
  • स्पष्ट स्थानिक गहराई वाले सीन, जहाँ कैमरा हिलने पर वस्तुएँ प्राकृतिक पैरालैक्स का पालन करती हैं

जहाँ इसके लिए ज़्यादा प्रॉम्प्ट मेहनत लगती है:

  • फ़ास्ट-कट एक्शन सीक्वेंस, जहाँ मूल और इच्छित एक्सटेंशन के बीच मोशन की दिशा अचानक बदल जाती है
  • ऐसे सीन जिनमें तेज़ डायरेक्ट लाइट स्रोत हों जो फ़्रेम-दर-फ़्रेम बदलती डायनामिक परछाइयाँ डालते हों
  • जटिल मल्टी-करैक्टर सीन, जहाँ हर किरदार की अलग मोशन वेक्टर हों जिन्हें मॉडल को एक साथ ट्रैक करना पड़े

💡 प्रायर फ़्रेम सीन की फ़िज़िक्स के बारे में जितनी ज़्यादा जानकारी एन्कोड करते हैं, एक्सटेंशन उतना ही बेहतर चलता है। स्थिर, अच्छी तरह रोशन फ़ुटेज हिलती हुई, हाई-कॉन्ट्रास्ट फ़ुटेज की तुलना में ज़्यादा साफ़ बढ़ती है। यह मॉडल की कोई सीमा नहीं है। यह इस बात का भौतिक गुण है कि मल्टी-फ़्रेम कंडीशनिंग उसे मिले डेटा से क्या अनुमान लगा सकती है।

जो सीन पहली कोशिश में सबसे संतोषजनक एक्सटेंशन देते हैं, वही लाइव-एक्शन प्रोडक्शन में सबसे अच्छे भी दिखते हैं: अच्छी रोशनी, सोच-समझकर की गई कैमरा मूवमेंट, और एक साफ़ सब्जेक्ट जिसका अपने परिवेश से स्पष्ट स्थानिक संबंध हो।

नतीजों के पीछे का आर्किटेक्चर

यह समझने के लिए थोड़ा समय देना उचित है कि Lightricks ने इसे संभव बनाने के लिए क्या बनाया, क्योंकि यही आर्किटेक्चर LTX 2.3 Pro को उन मॉडलों से अलग करता है जो वर्कअराउंड के ज़रिए एक्सटेंशन का अनुमान लगाते हैं।

LTX Video का मूल लेटेंट डिफ़्यूज़न ट्रांसफ़ॉर्मर है, न कि वह U-Net आधारित आर्किटेक्चर जिसने वीडियो डिफ़्यूज़न मॉडलों की पहली पीढ़ी पर राज किया था। टेम्पोरल मॉडलिंग के लिए ट्रांसफ़ॉर्मर आर्किटेक्चर का स्वाभाविक फ़ायदा है: सेल्फ़-अटेंशन मैकेनिज़्म को एक साथ स्थानिक और टेम्पोरल दोनों आयामों पर चलने के लिए कॉन्फ़िगर किया जा सकता है, इस गुण को स्पेशियोटेम्पोरल अटेंशन कहते हैं।

स्टैंडर्ड टेक्स्ट-टू-वीडियो ट्रांसफ़ॉर्मर में टेम्पोरल अटेंशन एक ही जनरेशन विंडो के भीतर सीमित रहता है। LTX 2.3 Pro के Extend Mode में टेम्पोरल अटेंशन विंडो एन्कोड किए गए प्रायर फ़्रेमों में पीछे की ओर बढ़ा दी जाती है। मॉडल डिफ़्यूज़न प्रक्रिया के दौरान सचमुच अपने अतीत पर ध्यान देता है, यह कोई पोस्ट-प्रोसेसिंग चरण नहीं, बल्कि डीनॉइज़िंग का ही अभिन्न हिस्सा है।

नतीजे I2V तरीकों से इतने अलग इसी वजह से हैं। I2V मॉडल को एक फ़ोटो देता है और कहता है "इसे हिलाओ।" LTX 2.3 Pro का Extend Mode मॉडल को एक स्मृति देता है और कहता है "यहीं से चलते रहो।" पहला मूवमेंट पैदा करता है। दूसरा निरंतरता पैदा करता है।

4K आउटपुट रिज़ोल्यूशन इस फ़ायदे को और बढ़ाता है। ज़्यादा रिज़ोल्यूशन पर मॉडल के पास हर प्रायर फ़्रेम में कंडीशन करने के लिए ज़्यादा स्थानिक ब्योरा होता है, जिसका मतलब है कि टेम्पोरल अटेंशन बारीक ब्योरों को ट्रैक कर सकता है: सतहों पर खास रोशनी के प्रतिबिंब, फ़्रेमों के बीच बालों की अलग-अलग लटें, और छोटे परिवेशीय तत्व जैसे हिलते पत्ते या शरीर की हरकत से बदलती कपड़े की सिलवटें।

सर्वर रैक वाला आधुनिक डेटा सेंटर, जहाँ एक टेक्नीशियन कंप्यूटिंग इंफ़्रास्ट्रक्चर की जाँच कर रहा है

लंबे वीडियो के लिए एक्सटेंशन चेनिंग

Extend Mode का सबसे व्यावहारिक उपयोग एक्सटेंशन चेनिंग है। क्योंकि Extend Mode की हर कॉल पिछली जनरेशन के सबसे ताज़ा फ़्रेमों पर कंडीशन होती है, आप कई एक्सटेंशन को जोड़कर ऐसी क्लिप बना सकते हैं जो किसी भी एक जनरेशन विंडो की सीमा से कहीं लंबी हों, और पूरे समय सीन की विज़ुअल एकरूपता बनाए रख सकते हैं।

वर्कफ़्लो:

  1. LTX 2.3 Pro से 5-10 सेकंड की बेस क्लिप जनरेट करें
  2. बेस क्लिप के आख़िरी 2-3 फ़्रेमों पर कंडीशन करते हुए 5 सेकंड बढ़ाएँ
  3. परिणाम को एक और 5 सेकंड बढ़ाएँ
  4. वांछित कुल लंबाई तक पहुँचने तक जारी रखें

हर चरण सीन की स्थापित विज़ुअल भाषा को बनाए रखता है। 5-6 चेन्ड एक्सटेंशन पर कुल विज़ुअल ड्रिफ़्ट हर चरण पर नए सिरे से जनरेट करने या I2V क्लिप को जोड़ पर सिलने की तुलना में न्यूनतम है। प्रोडक्ट डेमो, आर्किटेक्चरल वॉकथ्रू, प्रकृति डॉक्यूमेंट्री और शॉर्ट फ़िल्म सामग्री पर काम करने वाले क्रिएटरों ने इस तरह जोड़कर बनाए गए साफ़ 30-60 सेकंड के सीक्वेंस की रिपोर्ट दी है, जिनके जोड़ स्टैंडर्ड प्लेबैक स्पीड पर नहीं दिखते।

💡 अगर आप प्रोडक्ट डेमो, रियल एस्टेट वॉकथ्रू, या शॉर्ट फ़िल्म के लिए कोई वातावरण वाला सीन बना रहे हैं, तो LTX 2.3 Pro के साथ एक्सटेंशन चेनिंग उस पॉलिश्ड लंबी फ़ॉर्म फ़ुटेज का सबसे तेज़ रास्ता है, जिसके लिए वरना एक असली कैमरा क्रू चाहिए होता।

यह तकनीक PicassoIA के व्यापक वीडियो टूलसेट के साथ भी अच्छी तरह मेल खाती है। आप LTX 2.3 Pro से बेस क्लिप जनरेट कर सकते हैं, Effects लाइब्रेरी (500+ विकल्प) से विज़ुअल इफ़ेक्ट लगा सकते हैं, और अंतिम जोड़े गए सीक्वेंस को स्थिर करने या अपस्केल करने के लिए AI वीडियो रेस्टोरेशन टूल इस्तेमाल कर सकते हैं। चेन उतनी ही सरल या परतदार हो सकती है जितनी आपके प्रोजेक्ट को चाहिए।

गर्म रोशनी वाले ड्रॉइंग रूम में लैपटॉप पर AI वीडियो जनरेशन के नतीजे देखती युवा महिला

PicassoIA पर LTX 2.3 Pro से बनाना शुरू करें

LTX 2.3 Pro PicassoIA पर अपने तेज़ साथी मॉडल LTX 2.3 Fast के साथ उपलब्ध है, जब आपको तेज़ ड्राफ़्ट और इटरेशन की ज़रूरत हो। picassoia.com/en/all-models पर पूरी मॉडल लाइब्रेरी में टेक्स्ट-टू-वीडियो, इमेज-टू-वीडियो, वीडियो इफ़ेक्ट और रेस्टोरेशन टूल्स में फैले 87 से ज़्यादा वीडियो जनरेशन मॉडल शामिल हैं, इसलिए आपका प्रोजेक्ट कहीं से भी शुरू हो, पूरी पाइपलाइन उपलब्ध है।

अगर आपने पहले कभी वीडियो एक्सटेंशन पर काम नहीं किया है, तो एक सरल सीन से शुरू करें: गोल्डन आवर में किसी सड़क पर चलता व्यक्ति, पथरीले परिदृश्य से बहती नदी, या अँधेरे कमरे में मेज़ पर जलती मोमबत्ती। इन सीन प्रकारों से Extend Mode को काम करने के लिए पर्याप्त टेम्पोरल डेटा मिलता है और पहली कोशिश में सबसे संतोषजनक नतीजे मिलते हैं। लाइटिंग एक जैसी है, मोशन की साफ़ दिशा है, और स्थानिक परिवेश को मॉडल के लिए फ़्रेमों में ट्रैक करना आसान है।

वहाँ से, जैसे-जैसे आप यह समझने लगेंगे कि प्रायर-फ़्रेम कंडीशनिंग अलग-अलग तरह की इनपुट फ़ुटेज पर कैसे प्रतिक्रिया देती है, आप ज़्यादा जटिल स्थितियों की ओर बढ़ सकते हैं: मल्टी-करैक्टर सीन, तेज़ कैमरा मूवमेंट, और चेन्ड एक्सटेंशन के ज़रिए 30 सेकंड या उससे ज़्यादा में खुलने वाली कथात्मक सीक्वेंस।

Lightricks का टेम्पोरल कोहेरेंस के प्रति दृष्टिकोण किसी मौजूदा पाइपलाइन में केवल एक फ़ीचर जोड़ना भर नहीं है। यह इस बारे में एक अलग दर्शन दर्शाता है कि AI वीडियो जनरेशन को क्या करना चाहिए: सिर्फ़ अलग-थलग क्लिप नहीं, बल्कि ऐसी फ़ुटेज जिससे आप सचमुच एक प्रोडक्शन खड़ा कर सकें।

अभी PicassoIA पर LTX 2.3 Pro आज़माएँ और देखें कि आर्किटेक्चर-लेवल टेम्पोरल कंडीशनिंग आपकी पहली क्लिप में क्या फ़र्क लाती है।

यह लेख शेयर करें

अपनी भाषा चुनें

संबंधित लेख