LTX Video: شرح الفيديو بالذكاء الاصطناعي في الوقت الفعلي

LTX Video من Lightricks هو واحد من أسرع نماذج الفيديو بالذكاء الاصطناعي مفتوحة المصدر المتاحة، إذ يولّد مقاطع عالية الجودة تقريبًا في الوقت الفعلي. يشرح هذا المقال بالتفصيل كيف يعمل، ولماذا تهم السرعة في إنتاج الفيديو بالذكاء الاصطناعي، وكيف يقارن بالبدائل الأبطأ، وكيف يمكنك أن تبدأ في إنشاء فيديوهاتك الخاصة الآن دون أي إعداد.

LTX Video: شرح الفيديو بالذكاء الاصطناعي في الوقت الفعلي
Cristian Da Conceicao
مؤسس Picasso IA

غيّر LTX Video قواعد اللعبة في إنشاء فيديوهات الذكاء الاصطناعي. قبل ظهوره، كان توليد مقطع واحد مدته 5 ثوانٍ باستخدام معظم نماذج تحويل النص إلى فيديو يعني الانتظار من 2 إلى 10 دقائق في كل محاولة. خفّض LTX Video تلك المدة إلى ثوانٍ، ليصبح أول نموذج مفتوح المصدر يصل إلى توليد الفيديو في الوقت الفعلي. هذا ليس ادعاءً تسويقيًا. إنه إنجاز معماري قابل للقياس يُحدث فرقًا حقيقيًا في طريقة عملك.

يشرح هذا المقال ما هو LTX Video، وكيف يحقق سرعته، وكيف يقارن بالبدائل، وكيف تبدأ استخدامه اليوم بالتفصيل.

ما هو LTX Video فعليًا

تحرير الفيديو بالذكاء الاصطناعي على محطة عمل محمولة

LTX Video هو نموذج انتشار لتحويل النص إلى فيديو وتحويل الصورة إلى فيديو، طوّرته Lightricks، الشركة التي تقف وراء أدوات الإبداع الاحترافية للهواتف المحمولة التي يستخدمها ملايين الأشخاص حول العالم. أُطلق للعموم كمشروع مفتوح المصدر على Hugging Face، وصُمّم LTX Video منذ البداية ليعطي الأولوية لسرعة التشغيل دون التفريط في الاتساق البصري الذي يجعل الفيديو بالذكاء الاصطناعي مفيدًا فعلًا في سياقات الإنتاج.

قدّم الإصدار الأصلي فيديوهات بمعدل 24 إطارًا في الثانية وبدقة 768x512. ومنذ ذلك الحين توسّعت عائلة النموذج توسعًا كبيرًا. يتجه LTX 2 Pro نحو دقة 4K، ويركّز LTX 2 Fast على أقصى إنتاجية للتكرار السريع، ويستخدم LTX 2 Distilled تقطير النموذج لتقليص وقت التوليد أكثر. وتأتي أحدث الإصدارات، LTX 2.3 Pro وLTX 2.3 Fast، لتضع توليد فيديو بدقة 4K في أسرع طرف من الطيف المتاح في أي نموذج مفتوح المصدر.

من تطوير Lightricks، لا من مختبر أبحاث

هذا التمييز أهم مما يبدو للوهلة الأولى. بنت Lightricks LTX Video كأداة بمستوى إنتاجي احترافي، لا كنموذج تجريبي أو ورقة أكاديمية. وتعكس القرارات الهندسية هذه الأولوية: النموذج مُحسّن للتشغيل على عتاد متاح، والمعمارية مصممة لتقليل زمن الاستجابة في كل مرحلة، وإطلاقه مفتوح المصدر يتيح الاستضافة الذاتية والتحسين المباشر من المجتمع. أما معظم النماذج المنافسة فتأتي من مؤسسات تركّز على البحث أولًا، حيث تُعامل سرعة التشغيل كشأن ثانوي بعد درجات الاختبارات المعيارية.

والنتيجة نموذج صُمّم فعلًا ليُستخدم، لا ليُعرض فقط.

مفتوح المصدر منذ اليوم الأول

لم يكن إطلاق LTX Video مفتوح المصدر إفصاحًا محدودًا أو متأخرًا. فقد أُتيحت الأوزان الكاملة ومواصفات المعمارية وتفاصيل التدريب للعموم. وهذا مهم لثلاثة أسباب ملموسة: يستطيع المطورون استضافته ذاتيًا بالكامل، ويستطيع المجتمع إجراء الضبط الدقيق له لأنماط بصرية ومجالات موضوعية محددة، ولا يوجد أي قفل على مزوّد واحد عند بناء المنتجات أو سير العمل حوله.

بالنسبة للفرق التي تقيّم أدوات الفيديو بالذكاء الاصطناعي للاستخدام الإنتاجي طويل الأمد، يغيّر توفره مفتوح المصدر ملف المخاطر بشكل كبير.

لماذا تغيّر السرعة في الوقت الفعلي كل شيء

غرفة خوادم تشغّل توليد الفيديو بالذكاء الاصطناعي

السرعة في الفيديو بالذكاء الاصطناعي ليست مجرد تحسين لجودة الحياة. إنها تحوّل جوهري في ما يمكن للأداة أن تُستخدم فيه فعليًا داخل سير عمل حقيقي.

انتظار دقائق مقابل ثوانٍ

تحتاج معظم نماذج تحويل النص إلى فيديو إلى ما بين 2 و8 دقائق لتوليد مقطع قصير واحد. للوهلة الأولى، يبدو ذلك مقبولًا. عمليًا، يعني هذا أن تكرار تعديل أمر نصي واحد يتطلب إعداد مهمة توليد، ثم الانتظار، ثم تقييم النتيجة، ثم تعديل الأمر النصي، ثم الانتظار من جديد. تستغرق جلسة إبداعية تضم 10 تنويعات للأمر النصي أكثر من ساعة قبل أن ترى جميع النتائج.

يولّد LTX Video المقطع نفسه في أقل من 10 ثوانٍ على وحدات معالجة الرسوميات (GPU) من الفئة الاستهلاكية. تستغرق جلسة تضم 10 تنويعات نفسها أقل من 2 دقيقة. ينتقل سير العمل من المعالجة الدفعية ذات حلقات الملاحظات الطويلة إلى شيء يشعر بأنه تفاعلي واستكشافي حقًا.

ماذا تمنحك سرعة التكرار

القيمة الحقيقية تكمن في ما يتيحه التكرار السريع عمليًا:

  • صقل الأمر النصي بسرعة: اختبر تغييرات محددة في الصياغة وشاهد أثرها فورًا، بدلًا من الالتزام بانتظار طويل قبل التقييم
  • اختبار التكوين: فحوصات سريعة للإطار واتجاه الحركة وتكوين المشهد قبل الالتزام بتوليد نهائي أطول أو بدقة أعلى
  • معاينات حية للعملاء: شارك مفاهيم بصرية أولية في الوقت الفعلي أثناء المكالمة، بدلًا من وعد بإرسال الملفات بعد الاجتماع
  • سير عمل الإنتاج الدفعي: ولّد عشرات الإصدارات في الوقت الذي تستغرقه النماذج المنافسة لإنتاج مقطع واحد معتمد
  • التجريب منخفض المخاطر: جرّب أوامر نصية غير تقليدية وزوايا غير مألوفة وأفكارًا بصرية غير متوقعة دون القلق من ضياع وقت التوليد

💡 نصيحة احترافية: استخدم سرعة LTX Video للموافقة السريعة على المفهوم، ثم صيّر مقطعك النهائي المعتمد بدقة 4K باستخدام LTX 2 Pro أو LTX 2.3 Pro للحصول على مخرجات نهائية.

كيف يعمل النموذج من الداخل

أيدٍ تولّد محتوى فيديو بالذكاء الاصطناعي على لوحة مفاتيح

فهم سبب سرعة LTX Video يتطلب النظر إلى الخيارات المعمارية المحددة التي تفصله عن البدائل الأبطأ في عالم الفيديو مفتوح المصدر.

معمارية DiT، لا UNet

اعتمدت معظم نماذج توليد الفيديو الأولى على معماريات UNet موروثة مباشرة من نماذج انتشار الصور. تعمل UNet بمعالجة المعلومات عبر مُشفّر يضغط المدخلات إلى عنق زجاجة، ثم مُفكّك يوسّعها مرة أخرى. وهذا يصلح للصور الثابتة لكنه يتوسع بصعوبة مع الفيديو بسبب البعد الزمني الإضافي: فكل إطار إضافي يضاعف حمل الحوسبة.

يستخدم LTX Video معمارية Diffusion Transformer (DiT). تعالج المحوّلات المعلومات عبر آليات الانتباه التي تتوسع بكفاءة أكبر مع التسلسلات الأطول. وفي الفيديو، حيث يكون المقطع في الأساس تسلسلًا ممتدًا من الإطارات تربطها علاقات حركة، يترجم هذا الخيار المعماري مباشرة إلى اتساق زمني أفضل وتكلفة استدلال أقل لكل إطار.

يحسّن تصميم DiT أيضًا دقة ربط النص. إذ تدمج آلية الانتباه الأمر النصي في كل طبقة من الشبكة، لا عند عنق الزجاجة فقط، ما يعني أن النموذج يتبع أوصاف الأوامر النصية بدقة أكبر من نماذج الفيديو الأقدم القائمة على UNet.

التقطير: لماذا تتحسن السرعة

تحتاج نماذج الانتشار القياسية إلى عشرات إلى مئات خطوات إزالة الضوضاء لإنتاج مخرج نظيف. كل خطوة تمرير أمامي كامل عبر النموذج، ويتناسب زمن الاستدلال الإجمالي خطيًا مع عدد الخطوات. فالنموذج الذي يحتاج 50 خطوة سيستغرق دائمًا عشرة أضعاف الوقت مقارنةً بنموذج يعمل على 5 خطوات بالحجم المعماري نفسه.

يستخدم LTX Video تقطير درجات الاحتمال، وهي تقنية تدريب يتعلم فيها نموذج أصغر أو معدَّل أن يطابق جودة مخرجات نموذج مرجعي أكبر، مع استخدام خطوات إزالة ضوضاء أقل بكثير. ويذهب LTX 2 Distilled بهذا الأسلوب إلى أبعد حد، إذ يعمل بعدد خطوات استدلال يصل إلى 4 فقط مع الحفاظ على جودة قابلة للاستخدام للمعاينات وموافقات المسودات.

هذا هو السبب الرئيسي لتحقيق LTX Video توليدًا في الوقت الفعلي حيث تعجز النماذج المماثلة.

الضغط المكاني والزمني

قبل أن يدخل تسلسل الفيديو عملية الانتشار، يضغطه LTX Video في البعدين المكاني (دقة الإطار) والزمني (عدد الإطارات) باستخدام Video VAE، وهو مُشفّر ذاتي متغير مُكيَّف للفيديو. ينتج عن ذلك تمثيل كامن مضغوط يعمل عليه المحوّل، بدلًا من العمل مباشرة على بيانات البكسل كاملة الدقة.

والنتيجة العملية: يعالج النموذج تمثيلًا أصغر بنحو 8 مرات من الفيديو الفعلي، مع الحفاظ على أنماط الحركة والتفاصيل البصرية اللازمة للتوليد المتسق. وعند اكتمال إزالة الضوضاء، يوسّع مفكّك VAE الكامن مرة أخرى إلى دقة البكسل الكاملة.

الضغط المكاني الزمني هو السبب الجوهري الثاني الذي يجعل LTX Video يعمل بسرعة حتى على عتاد كان سيعاني مع المعماريات المنافسة.

LTX Video مقابل نماذج الفيديو الأخرى بالذكاء الاصطناعي

شاشة احترافية تعرض واجهة مقارنة الفيديو

لا يوجد LTX Video في فراغ. ولفهم مكانه، يلزم مقارنته مباشرة بالنماذج التي ينافسها عبر أبعاد السرعة والجودة والقدرات التي تهم العمل الفعلي.

النموذجالسرعةأقصى دقةمفتوح المصدرالأفضل لـ
LTX Videoفي الوقت الفعلي (~5 ثوانٍ)768pنعمالتكرار السريع، والنماذج الأولية
LTX 2 Fastسريع جدًا1080pنعمالسرعة مع دقة أعلى
LTX 2 Proسريع (~30 ثانية)4Kنعمالمخرجات النهائية، جودة عالية
LTX 2.3 Proسريع4Kنعمالتوازن بين السرعة و4K
Kling v2.6متوسط (~دقيقتان)1080pلاجودة الحركة السينمائية
Wan 2.7 T2Vمتوسط1080pنعمتصيير المشاهد التفصيلية
Sora 2بطيء (~5 دقائق)HDلاالمخرجات الفاخرة طويلة الشكل
Veo 3بطيء1080pلاالصوت الأصلي، الواقعية الفوتوغرافية

حيث يتفوق LTX Video

يتفوق LTX Video في سرعة الاستدلال بفارق كبير عبر فئة المصادر المفتوحة بأكملها. لا يقترب أي نموذج مفتوح منافس من زمن توليده عند مستويات جودة مكافئة. وبالنسبة لسير العمل الذي تهم فيه سرعة التكرار أكثر من الصقل إطارًا بإطار، فهو الخيار الواضح.

تعني طبيعته مفتوحة المصدر أيضًا أنه يعمل محليًا، ما يُلغي الاعتماد على API وتكاليف كل عملية توليد بعد نشره. بالنسبة لحالات الإنتاج عالية الحجم، يتراكم هذا الفرق الاقتصادي بسرعة.

حيث تتقدم النماذج الأخرى

ينتج Kling v2.6 وVeo 3 وSora 2 حركة أكثر صقلًا سينمائيًا، لكن بتكلفة أوقات توليد أطول بكثير. وبالنسبة للإنتاج بجودة البث، حيث يحتاج كل إطار إلى صقل احترافي، تحافظ النماذج التجارية المغلقة حاليًا على أفضلية في الجودة المدركة والتعامل مع فيزياء الحركة المعقدة.

يقدّم Seedance 1 Pro وHailuo 02 نتائج قوية في نطاق السرعة المتوسط، مع قدرات توليد صوت مدمجة لا يقدمها LTX Video بشكل أصلي، ما يجعلهما أنسب للمحتوى الذي يتطلب صوتًا متزامنًا.

كيفية استخدام LTX Video على PicassoIA

محترف إبداعي يعمل في استوديو فيديو بالذكاء الاصطناعي

تستضيف PicassoIA عائلة LTX Video كاملة، ما يعني أنه يمكنك الوصول إلى كل إصدار من LTX Video الأصلي حتى LTX 2.3 Pro دون أي تثبيت محلي أو متطلبات GPU أو إعداد تقني.

الخطوة 1: اختر الإصدار المناسب

ينبغي أن يتوافق اختيارك لنموذج LTX مع هدفك الحالي في عملية الإنتاج:

  • النماذج الأولية السريعة والموافقة على المفهوم: استخدم LTX Video أو LTX 2 Fast للحصول على ردود شبه فورية على أفكار أوامرك النصية
  • جودة مسودة بسرعة معقولة: يحقق LTX 2 Distilled توازنًا جيدًا بين السرعة والدقة البصرية
  • المخرجات النهائية: LTX 2 Pro أو LTX 2.3 Pro للأعمال النهائية بدقة 4K

الخطوة 2: اكتب أمرًا نصيًا قويًا للحركة

يستجيب LTX Video بشكل أفضل بكثير للأوامر النصية التي تصف الحركة صراحةً، لا مجرد وصف المشهد. فأوصاف المشاهد الثابتة تُنتج نتائج تبدو ساكنة بصريًا، حتى عندما تكون الحركة موجودة من الناحية التقنية.

أمر نصي ضعيف: "امرأة تمشي في حديقة"

أمر نصي قوي: "امرأة ترتدي فستانًا أزرق فاتحًا تمشي ببطء عبر حديقة مشمسة، ويتحرك شعرها بنسيم لطيف، وتتساقط أوراق في المقدمة، والكاميرا تتتبعها من الجانب الأيمن على مستوى العين"

الإضافات التي تُحدث فرقًا: اتجاه الحركة، وعناصر الحركة الثانوية مثل الشعر أو الأوراق، وسلوك الكاميرا، والتفاصيل البيئية المحددة. تُوجّه هذه الإشارات النمذجة الزمنية في عملية الانتشار مباشرة، وتُنتج حركة أكثر ديناميكية وقصدية.

الخطوة 3: كرّر أولًا بدقة المسودة

بالنسبة إلى LTX 2 Pro وLTX 2.3 Pro، ولّد بدقة 720p أثناء التكرار، وارفع الدقة فقط للقطات المعتمدة. فتوليد كل مسودة بأقصى دقة 4K يضيف وقتًا غير ضروري حتى مع نموذج سريع، والتكوين وجودة الحركة اللذان تقيّمهما يظهران بالوضوح نفسه بدقة 720p.

الخطوة 4: استخدم تحويل الصورة إلى فيديو لبدايات مضبوطة

من أكثر سير العمل فعالية مع LTX Video تزويده بإطار بداية مرجعي بدلًا من الاعتماد على النص وحده. ولّد صورة ثابتة واقعية باستخدام نموذج تحويل النص إلى صورة، ثم أدخلها إلى LTX Video كالإطار الأول للفيديو. يمنحك هذا تحكمًا دقيقًا في الشخص والتكوين والإضاءة ولوحة الألوان قبل إضافة طبقة الحركة.

💡 نصيحة سير العمل: ولّد إطار المرجع باستخدام نموذج عالي الجودة لتحويل النص إلى صورة، ثم حرّكه باستخدام LTX Video للحصول على تحكم إبداعي دقيق في الأسلوب البصري واتجاه الحركة معًا.

فريق يتعاون في إنتاج فيديو بالذكاء الاصطناعي

ما النتائج المتوقعة

أدوات إبداعية مرتبة لسير عمل إنتاج الفيديو بالذكاء الاصطناعي

ضبط توقعات دقيقة قبل التوليد يمنع الإحباط ويساعدك على اختيار النموذج المناسب لكل مهمة محددة.

نقاط القوة التي يمكنك الاعتماد عليها

  • حركة الكاميرا: تتسم لقطات البانوراما والتتبع والدولي بتماسك جيد عبر الإطارات، وهي من أبرز مزايا LTX Video قياسًا إلى فئة سرعته
  • الأشخاص في حركات بسيطة: المشي والالتفات والإيماءات الأساسية تصمد جيدًا بالدقات القياسية
  • حركة الطبيعة والأجواء: حركة الرياح عبر الأوراق، وأسطح المياه، والنار، وتأثيرات الجزيئات تبدو طبيعية ومتوقتة بإقناع
  • الالتزام بالأمر النصي: تعني معمارية DiT أن ربط النص أدق من نماذج الفيديو الأقدم القائمة على UNet، خاصةً في وصف تكوين المشهد وزاوية الكاميرا
  • جودة متسقة بالسرعة: النتائج قابلة للتكرار ويمكن التنبؤ بها، وهذا مهم لجدولة الإنتاج

القيود المعروفة

  • تفاصيل الأيدي والأصابع المعقدة: قيد مستمر في جميع نماذج انتشار الفيديو، بما فيها LTX Video. تجنّب لقطات الأيدي المقربة للحصول على نتائج نظيفة
  • المدة الطويلة: تتراجع الجودة في المقاطع التي تتجاوز 8 إلى 10 ثوانٍ لأن الاتساق الزمني ينحرف بين الإطارات
  • الدقات العالية جدًا في النموذج الأساسي: لم يُصمَّم LTX Video الأصلي لمخرجات 4K. استخدم LTX 2.3 Pro للمخرجات النهائية عالية الدقة
  • المشاهد كثيفة الفيزياء: الاصطدامات السريعة، وديناميكيات السوائل ذات التفاعلات المعقدة، وتدمير البنى ما زالت تُحدّي الاتساق الزمني للنموذج

💡 نصيحة الجودة: في التفاعلات الفيزيائية المعقدة، ركّز أمرك النصي على الأجواء والتكوين والشخصية بدلًا من إجراءات فيزيائية محددة. أوصاف الحركة الواضحة والبسيطة تُنتج أقوى النتائج.

متى يكون LTX Video منطقيًا

صانع محتوى يراجع نتائج فيديو بالذكاء الاصطناعي في مقهى

LTX Video ليس الخيار الصحيح لكل مشروع. فمعرفة متى يناسب ومتى لا يناسب توفر وقت الإنتاج وتعطي نتائج أفضل من فرض الأداة الخطأ على المهمة الخطأ.

أفضل حالات الاستخدام

محتوى التواصل الاجتماعي قصير الشكل: يقع المحتوى المخصص لمنصات مثل Instagram Reels أو TikTok في صميم قدرات LTX Video. فالسرعة تعني أنه يمكنك إنتاج مسودات محتوى أسبوع كامل في فترة بعد الظهر، والجودة كافية تمامًا لسياقات المشاهدة على الهاتف.

إعداد القصص المصورة والتصور المسبق: تصور سريع لتسلسلات اللقطات وحركات الكاميرا وتكوينات المشاهد. يستخدم المخرجون والوكالات LTX Video لنقل الأفكار البصرية قبل الالتزام بإنتاج حي مكلف أو بنماذج ذكاء اصطناعي أبطأ في التصيير.

عروض المنتجات: تحريك صور المنتجات أو عروضها إلى مقاطع فيديو قصيرة محيطة للتجارة الإلكترونية والمواد التسويقية. قدرة تحويل الصورة إلى فيديو قوية بشكل خاص في هذا الاستخدام لأنها تحافظ على المظهر الدقيق للمنتج مع إضافة الحركة.

المحتوى الخلفي والمحيطي: مقاطع بيئية متكررة، وخلفيات الفعاليات، ولقطات الأجواء حيث تكون الواقعية المطلقة أقل أهمية من الحركة والمزاج. يجد مصورو الأعراس ومنظمو الفعاليات ومصممو العروض التقديمية قيمة كبيرة هنا.

النماذج الأولية قبل التصيير النهائي: ولّد مسودات سريعة لكل مشهد، ووافق على التكوينات واتجاهات الحركة الناجحة، ثم أعد تصيير المقاطع المعتمدة باستخدام LTX 2 Pro أو نموذج مغلق متميز للمخرج النهائي المصقول.

متى تختار شيئًا آخر

إذا كان مشروعك يتطلب تصويرًا سينمائيًا بجودة البث مع فيزياء حركة طبيعية، وتفاصيل دقيقة في الوجوه والبيئات، ودقة في الإضاءة السينمائية، فإن Kling v2.6 أو Veo 3 أو Sora 2 أنسب رغم أوقات توليدها الأطول.

إذا كان محتواك يتطلب صوتًا منطوقًا أو موسيقى متزامنة، فإن Seedance 1 Pro أو Hailuo 02 يقدمان قدرات توليد صوت أصلية لا يشملها LTX Video حاليًا.

بالنسبة للفيديو طويل الشكل الذي يتجاوز 15 ثانية لكل مقطع، تتفوق معظم نماذج الفيديو المتخصصة على LTX Video في الاتساق الزمني عند المدد الممتدة.

ابدأ الإنشاء الآن

منظر جوي لاستوديو إنتاج فيديو احترافي

LTX Video ليس نموذجًا تكتفي بتقييمه من بعيد. أسرع طريقة لفهم ما يفعله هي تشغيل توليد ورؤية المخرج يظهر في الوقت الفعلي. لا يوجد بديل عن تلك اللحظة الأولى حين يُعرض أمامك فيديو وصفته بالنص بعد ثوانٍ من إرسال الأمر النصي.

تتوفر عائلة LTX الكاملة، من LTX Video الأصلي مرورًا عبر LTX 2 Distilled وLTX 2 Fast وLTX 2 Pro وLTX 2.3 Fast وصولًا إلى LTX 2.3 Pro، على PicassoIA دون أي تثبيت محلي أو متطلبات GPU أو إعداد تقني.

اكتب أمرًا نصيًا يصف ما تريد رؤيته يتحرك. حدّد هدف الدقة. ولّد. تستغرق النتيجة الأولى ثوانٍ، ومن هناك تكرّر وتصقل وتبني على ما ينجح. الفيديو بالذكاء الاصطناعي في الوقت الفعلي ليس شيئًا قادمًا، إنه موجود بالفعل، والأدوات لاستخدامه الآن متاحة في المنصة بانتظار أمرك النصي الأول.

شارك هذا المقال

اختر لغتك

مقالات ذات صلة