LTX 2.3 Pro الصوت إلى الفيديو: كيف يعمل (وما الذي يميّزه)

يقدّم LTX 2.3 Pro مسار توليد فيديو مشروطًا بالصوت، يقرأ الإيقاع والنبرة والبيانات الطيفية من أي مسار صوتي لإنتاج محتوى فيديو متزامن معه. يشرح هذا المقال كل جزء من هذه العملية: من إدخال الصوت وكشف النبضات إلى الانتشار الكامن وتصيير الإطارات، مع خطوات عملية لتجربتها بنفسك على PicassoIA.

LTX 2.3 Pro الصوت إلى الفيديو: كيف يعمل (وما الذي يميّزه)
Cristian Da Conceicao
مؤسس Picasso IA

مزامنة الصوت والفيديو بشكل صحيح كانت دائمًا من أكثر مراحل إنتاج الفيديو استهلاكًا للجهد. يقضي المحررون المحترفون ساعات في تقطيع المقاطع على النبضات، ومطابقة الطاقة البصرية مع ذروات الصوت، وضبط الإطارات بفارق أجزاء من الثانية. يغيّر LTX 2.3 Pro هذه المعادلة، إذ يجعل الصوت مدخل تكييف من الدرجة الأولى، فيتيح لنموذج التوليد قراءة الإيقاع والنبرة والبيانات الطيفية من مسار الصوت الخاص بك، وبناء مرئيات تتطابق معه منذ الإطار الأول.

هذه ليست مزامنة تُجرى في مرحلة ما بعد الإنتاج. الصوت يشكّل الفيديو أثناء التوليد نفسه، وليس بعده. إليك كيف يعمل هذا المسار بالتفصيل، خطوة بخطوة.

محلل طيف صوتي بأشرطة تردد مضيئة بتقنية LED على لوحة من الألومنيوم المصقول

ما الذي يفعله LTX 2.3 Pro بشكل مختلف

الصوت كمدخل من الدرجة الأولى

تتعامل معظم نماذج توليد الفيديو مع الصوت كإضافة لاحقة. تولّد المقطع، ثم تضيف مقطعًا صوتيًا في مرحلة ما بعد الإنتاج، وتعدّل يدويًا إذا بدا التوقيت غير دقيق. يقلب LTX 2.3 Pro، الذي طوّرته Lightricks، هذا المسار. لا يُضاف الصوت فوق الفيديو بعد توليده، بل يُدمج في إشارة التكييف التي توجّه كل خطوة من خطوات إزالة الضوضاء.

عندما تزوّد النموذج بملف صوتي، لا يكتفي بتشغيله إلى جانب الناتج. يحوّل الصوت إلى متجهات ميزات زمنية: شرائح من مخطط الطيف الميلي (mel spectrogram)، ومغلفات البدايات (onset envelopes)، وطوابع زمنية لشبكة الإيقاع. تُحقن هذه المتجهات في عملية إزالة الضوضاء في كل خطوة من خطوات الانتشار، فتدفع الحركة والطاقة البصرية نحو اللحظات في الصوت التي تحمل أكبر قدر من المعلومات. والنتيجة فيديو يعكس فيه الإيقاع البصري الإيقاع الصوتي فعلًا، لأن الاثنين بُنيا معًا.

💡 فكّر في الأمر هكذا: يعمل الصوت كمخرج خفي، يُشير إلى كل إطار متى يثبت، ومتى يقطع بحدّة، ومتى يترك ضبابية الحركة تتلاشى بشكل طبيعي.

ما وراء تحويل النص إلى فيديو التقليدي

نماذج تحويل النص إلى فيديو التقليدية مثل Wan 2.2 S2V أو Veo 3 قوية في توليد الحركة من وصف نصي، لكنها تتعامل مع الصوت بشكل مستقل، إن تعاملت معه أصلًا. فهي تنتج صوتًا يطابق مشهدًا بصريًا، لا مشهدًا يطابق صوتًا موجودًا. هذا الفرق مهم جدًا عندما يكون مسار الصوت موجودًا بالفعل ويجب أن تخدمه المرئيات: مقاطع الموسيقى المصورة، والمحتوى الصوتي للعلامات التجارية، ومواد الحملات المتزامنة.

يقع LTX 2.3 Pro ضمن فئة أصغر من النماذج التي يُعد فيها تكييف الصوت ميزة معمارية من الدرجة الأولى مدمجة في نواة الانتشار، وليس خطوة معالجة لاحقة تُضاف بعد ذلك.

مسار تكييف الصوت

شابة ترتدي سماعات استوديو وتحرر الصوت والفيديو على محطة عمل احترافية

ما يحدث بين رفع ملف الصوت الخاص بك واستلام مقطع فيديو متزامن يتضمن ثلاث مراحل معالجة مختلفة.

كشف الإيقاع ورسم خريطة الإيقاع

تحوّل المرحلة الأولى الصوت إلى هيكل زمني. تمسح خوارزمية تتبع الإيقاع الموجة الصوتية بحثًا عن أحداث البدايات: العابرات، وهجمات الإيقاع، والنبضات الإيقاعية. ثم تربطها بشبكة طوابع زمنية بالدقة الزمنية الأصلية للنموذج. بالنسبة إلى مقطع مدته 5 ثوانٍ بمعدل 24 إطارًا في الثانية، يعني ذلك 120 موضع إطار، يحمل كل منها درجة ثقة للإيقاع.

تصبح مواضع الإيقاع عالية الثقة إطارات مرتكزة. يتعامل النموذج معها كلحظات يجب أن تبلغ فيها الحركة البصرية ذروتها: تحركات الكاميرا تدفع أو تقطع، وطاقة المشهد تبلغ قمتها، وحركة الشخص تصل إلى ذروتها. تُستكمل الإطارات الواقعة بين النبضات بالاستيفاء من هذه المرتكزات، فينشأ إيقاع طبيعي من البناء والإطلاق تتوقعه أذنك ويؤكده بصرك.

💡 نصيحة: المسارات ذات الإيقاع المنتظم (ضربة طبلة ثابتة، نبض إيقاعي متساوٍ) تنتج مزامنة أكثر قابلية للتوقع. أما المسارات ذات التغيرات غير المنتظمة في السرعة فتنتج مخرجات بصرية أكثر ديناميكية وأقل قابلية للتوقع. كلاهما صالح بحسب نيتك الإبداعية.

قراءة النبرة والمزاج البصري

إلى جانب كشف الإيقاع، يُجري المسار تمريرة معالجة طيفية. يفصل الصوت إلى نطاقات ترددية (الجهير، والمتوسط، والحاد) ويتتبع الطاقة في كل نطاق مع الزمن. تدفع هيمنة الترددات المنخفضة (الجهير الثقيل، والوسادات العميقة) المخرجات البصرية نحو حركة أبطأ وأثقل: لقطات بانورامية عريضة، وتكبير بطيء، ومرئيات جوية داكنة. أما طاقة الترددات العالية (الأصوات الاصطناعية اللامعة، وأدوات الإيقاع السريعة، والأوتار الحادة) فتدفع نحو قطع أسرع، وتباينات أكثر حدة، ولوحات ألوان ذات تشبع أعلى.

هذا ليس ربطًا بقواعد مبرمجة مسبقًا. تعلّم النموذج هذه الارتباطات من التدريب على مجموعات بيانات كبيرة من الفيديو والصوت، حيث اتخذ المحررون البشر خيارات حدسية مشابهة. وتوجّه إشارة التكييف عملية الانتشار نحو ما قد يفعله محرر ماهر إزاء المسار الصوتي نفسه.

الميزات الطيفية تقود حركة الإطارات

تستخرج المرحلة الثالثة معاملات السمع الميلية (MFCCs) والمحتوى التوافقي. تحمل هذه البصمات الطيفية الدقيقة معلومات عن طابع الصوت، وحركة طبقة الصوت، والثراء النغمي، وهي أمور لا تلتقطها الموجات الصوتية البسيطة. يستخدمها النموذج لتعديل متجهات الحركة على مستوى الإطار.

عمليًا: يميل تسلسل طبقة صوت صاعدة إلى إنتاج حركة لأعلى أو توسعية. ويميل عبارة توافقية هابطة إلى إنتاج حركة تستقر أو تتباطأ. كما تخلق الكورد الممتدة حركة مستمرة وناعمة، وتنتج النوتات المتقطعة قطعات بصرية حادة ومتقطعة. هذه ميول مستمدة من التدريب، تُفعَّل بشكل مناسب لكل إطار بواسطة إشارة التكييف، وليست قواعد صارمة تُطبَّق آليًا.

المزامنة إطارًا بإطار

منظر واسع لاستوديو مونتاج احترافي بعد الإنتاج، فيه شاشات متعددة تعرض الجداول الزمنية للفيديو والصوت عند الغسق

كيف تتوافق الحركة مع الصوت

تحدث المزامنة داخل عملية الانتشار الكامن أثناء التوليد، لا في مرحلة ما بعد الإنتاج. في كل خطوة من خطوات إزالة الضوضاء، ينتبه النموذج متقاطعًا إلى موتر ميزات الصوت عند موضع الزمن المناسب. تربط آلية الانتباه المتقاطع هذه لحظة صوتية محددة بموضع إطار محدد في الفيديو المولَّد.

ولأن الانتباه يعمل في كل خطوة من خطوات إزالة الضوضاء، لا عند التهيئة فقط، فإن إشارة الصوت توجّه المسار البصري باستمرار طوال عملية التوليد كلها. وإذا جاءت نبضة متأخرة بسبب الانزياح الإيقاعي، تستجيب الحركة في مجموعة الإطارات المقابلة لها بدقة. المزامنة دقيقة على مستوى الإطار، وليست محاذاة تقريبية.

الاتساق الزمني عبر الإطارات

من المخاطر الحقيقية في التوليد المشروط بالصوت التفتت البصري: إطارات تبدو مختلفة جدًا عن بعضها لأن كل نبضة تُحدث تحولًا بصريًا دراماتيكيًا، فيصبح الناتج أقرب إلى عرض شرائح منه إلى لقطات متصلة. يعالج LTX 2.3 Pro هذه المشكلة عبر طبقات الانتباه الذاتي الزمني التي تفرض الاتساق بين الإطارات المتجاورة، بغض النظر عن قوة تكييف الصوت في أي لحظة معينة.

والنتيجة لقطات متماسكة حتى مع الصوت شديد الديناميكية. تظل الوجوه مستقرة بين النبضات. وتحافظ الخلفيات على استمرارية المنظور. وتتحرك الأجسام بتسارع وتباطؤ يتوافقان مع الفيزياء، بدلًا من أن تقفز بين الإطارات.

مخرجات 4K على نطاق واسع

مسرح حفلات خارجي عند الساعة الذهبية، وعازف غيتار ظاهر بظله على خلفية مضاءة، وأيدٍ مرفوعة للجمهور بضبابية في المقدمة

لماذا تهم الدقة للفيديو المتزامن

ظل توليد الفيديو المدفوع بالصوت محدودًا تاريخيًا بدقات منخفضة. أنتجت الأدوات الأولى مقاطع بحجم 512x512 بدت مقبولة على شاشة الهاتف، لكنها تدهورت بشكل واضح على أي شاشة أكبر. يُخرج LTX 2.3 Pro بدقة 4K، وهو ما يوسّع بشكل كبير نطاق الاستخدامات الواقعية لهذا التنسيق:

  • عرض الفعاليات المباشرة: تصمد دقة 4K على شاشات LED الكبيرة دون تشوهات واضحة
  • مقاطع موسيقى بجودة البث: مناسبة لمعايير استيعاب منصات البث
  • التكامل في الإنتاج التجاري: يمكن إدراجها في الجداول الزمنية للمونتاج الاحترافي دون إعادة تحجيم
  • محتوى الويب بملء الشاشة: لا حاجة إلى أشرطة سوداء أو حشو للدقة

يضحّي إصدار LTX 2.3 Fast بسقف الدقة مقابل سرعة التوليد، مما يجعله مفيدًا للتكرار السريع أثناء التطوير الإبداعي قبل الالتزام بتصيير 4K كامل.

الانتشار الكامن من الداخل

المعمارية التي تجعل توليد 4K ممكنًا هي نموذج انتشار الفيديو الكامن. فبدلًا من إزالة الضوضاء على مستوى البكسل (وهو أمر باهظ حسابيًا عند 4K)، يعمل النموذج في فضاء كامن مضغوط تمثل فيه كل وحدة رقعة مكانية من الصورة الكاملة. وتعمل متجهات تكييف الصوت في هذا الفضاء الكامن نفسه، وهذا ما يجعل المزامنة دقيقة وقابلة للحساب في الوقت نفسه.

بعد انتهاء إزالة الضوضاء، يعيد مفكك ترميز عالي الدقة بناء التمثيل الكامن بالدقة الكاملة، مضيفًا حدة الملمس والتفاصيل الدقيقة خلال مرحلة رفع الدقة. وهذا النهج في فك الترميز هو تطور للمسار المستخدم في LTX 2 Pro، مع تحسن كبير في دقة مفكك الترميز في الإصدار 2.3.

كيفية استخدام LTX 2.3 Pro على PicassoIA

لقطة مقربة ليدي موسيقي تضغط أوتار غيتار معدني على لوحة مفاتيح من خشب الماهوغني مع نوتات موسيقية مكتوبة بجانبها

يستضيف PicassoIA كلًا من نموذج LTX 2.3 Pro وأداة Audio to Video المخصصة من Lightricks. إليك سير العمل الكامل.

الخطوة 1: جهّز الصوت

الصيغ المدعومة: WAV وMP3 وFLAC وAAC. للحصول على نتائج قوية باستمرار:

  • استخدم مقطعًا بين 3 و10 ثوانٍ (يمكن تقسيم المسارات الأطول إلى أجزاء ومعالجتها بالتتابع)
  • اضبط مستوى الصوت على نحو -14 LUFS تقريبًا لتحقيق علو صوت ثابت في إشارة التكييف
  • أزل الصمت في بداية المقطع، لأن النموذج يقرأ الإطار الأول كالحالة الأساسية للمشهد

💡 بالنسبة لمسارات الموسيقى: صدّر مقطعًا محددًا (drop أو كورس أو مقطع شعري) بدلًا من المسار كاملًا. النموذج مدرَّب على مقاطع قصيرة، وتنتج الأقسام الأكثر تركيزًا مزامنة أدق.

الخطوة 2: اضبط المعاملات

المعاملالقيمة الموصى بهاملاحظات
الدقة4K أو 720p4K للناتج النهائي، و720p للمسودات السريعة
المدة5 ثوانٍطول التدريب الأصلي؛ يمتد بسلاسة إلى 10 ثوانٍ
الأمر النصيوصف المشهديصف المرئيات، لا محتوى الصوت
قوة الصوتمن 0.7 إلى 0.9يتحكم في تأثير الصوت مقابل حركة الأمر النصي
مقياس CFGمن 3.0 إلى 5.0القيم الأعلى تزيد الالتزام بالأمر النصي

يعمل الأمر النصي والمدخل الصوتي كشريكين. يحدد الأمر النصي المشهد والشخص والأسلوب البصري. ويحدد الصوت الطاقة الزمنية وإيقاع الحركة. صف ما تريد رؤيته، لا كيف يبدو الصوت.

الخطوة 3: وَلِّد وحمّل

عند بدء التوليد، يعمل المسار في ثلاث مراحل:

  1. المعالجة المسبقة للصوت (نحو ثانيتين): استخراج الميزات، ورسم خريطة الإيقاع، وحساب مخطط الطيف الميلي
  2. انتشار الفيديو (من 30 إلى 120 ثانية حسب الدقة): حلقة إزالة الضوضاء مع تكييف الصوت في كل خطوة
  3. فك الترميز والرفع (من 5 إلى 10 ثوانٍ): إعادة البناء من الفضاء الكامن إلى البكسل، والتخزين، وإرجاع الرابط

لا يُدمج المسار الصوتي في ملف MP4 الذي تحمّله، وهذا يمنحك تحكمًا كاملًا في تعديلات التوقيت ضمن برنامج المونتاج الخاص بك.

حالات استخدام من الواقع

مديرة إبداعية تراجع جدولًا زمنيًا متعدد الطبقات للفيديو والصوت على شاشة كبيرة في مكتب مضيء، ومعها قلم Wacom

مقاطع موسيقى دون طاقم تصوير

هنا يقدّم LTX 2.3 Pro أكبر قيمة عملية فورية. يستطيع الموسيقيون المستقلون، ومنتجو الموسيقى من غرف النوم، وشركات التسجيل الصغيرة إنتاج مقطع موسيقي كامل لمسار مدته 3 دقائق، وذلك بتقسيمه إلى مقاطع من 5 إلى 10 ثوانٍ، وتوليد فيديو لكل مقطع بأمر نصي مناسب للمشهد، ثم تحرير المقاطع معًا في أي محرر غير خطي. تعني مزامنة الصوت أن نقاط القطع تقع بشكل طبيعي قرب النبضات، فتقل تعديلات القطع اليدوية. ومخرجات 4K مناسبة لمنصة YouTube ومنصات البث وعروض الفعاليات المباشرة.

محتوى وسائل التواصل الاجتماعي على نطاق واسع

يتجاوب المحتوى السمعي البصري القصير جيدًا مع التوليد المشروط بالصوت. يمكن توليد شعار صوتي قصير لعلامة تجارية مدته 5 ثوانٍ، مُحرَّك بهوية بصرية ثابتة، على شكل دفعات، حيث يُدفع كل إصدار بالمسار الصوتي نفسه مع أوامر بصرية مختلفة لاختبار الأفكار الإبداعية. نماذج مثل Seedance 2.0 و Kling v2.6 قوية للفيديو الاجتماعي العام، لكن عندما يكون مسار الصوت هو المحور الإبداعي، ينتج LTX 2.3 Pro مزامنة أدق بشكل ملحوظ.

سرد قصص العلامات التجارية بالصوت

يمكن للعلامات التجارية التي تملك هوية صوتية، بما في ذلك الإعلانات الموسيقية القصيرة (jingles) وأصوات العلامة وبصماتها الصوتية المميزة، أن تستخدم التوليد من الصوت إلى الفيديو لإنتاج محتوى بصري يستجيب فعليًا لصوت العلامة. يحمل كل مقطع مولَّد البصمة الإيقاعية نفسها للصوت، مما يبني ارتباطًا ثابتًا بين الصوت وأسلوب الحركة البصرية عبر كل المحتوى.

LTX 2.3 Pro مقابل النماذج الأخرى

منظر جوي لمهندس تسجيل جالس عند لوحة مزج أنالوجية من Neve في غرفة تحكم احترافية

النموذجتكييف الصوتأقصى دقةتوليد يستجيب للصوت
LTX 2.3 Proمن الدرجة الأولى4Kنعم
Wan 2.2 S2Vمزامنة صوت أصلية720pنعم
Veo 3توليد الصوت فقط1080pيولّد صوتًا، ولا يتزامن مع المدخل
Sora 2لا يوجد1080pلا
Kling v2.6لا يوجد1080pلا
Ray 3.2لا يوجدHDRلا

الفرق الرئيسي يقع بين النماذج التي تولّد صوتًا ليطابق الفيديو، والنماذج التي تستجيب للصوت عند بناء إطارات الفيديو. يقع LTX 2.3 Pro و Wan 2.2 S2V في الفئة الثانية. وللمحتوى الذي يكون فيه مسار الصوت موجودًا بالفعل ويجب أن تخدمه المرئيات، فهذان النموذجان هما الخياران الأساسيان، ويتفوق LTX 2.3 Pro بميزة الدقة عند 4K.

مخرج الفيديو الموسيقي في موقع التصوير عند الساعة الذهبية في زقاق مدينة، يحمل لوح التصفيق، وطاقم يضبط عربة كاميرا في الخلفية

3 أمور تربك المسار

معرفة الآليات مفيدة. ومعرفة ما يسبب المشكلات توفّر الوقت.

1. فجوات الصمت في الصوت

يقرأ النموذج الصمت كإشارة تكييف صفرية، ويعتمد حركة أبطأ وأقل ديناميكية في تلك الإطارات. الصمت المتعمد مقبول. أما الصمت الناتج عن ملف مُصدَّر بشكل معيب أو قص غير دقيق فيخلق مقاطع بصرية مسطحة تبرز وسط المقاطع الديناميكية المحيطة بها.

2. الأوامر النصية المكتظة

عندما يصف الأمر النصي عددًا كبيرًا من الأشخاص أو الأفعال التي تتنافس على مساحة الإطار، لا تستطيع إشارة تكييف الصوت تجاوز الغموض البصري المتأصل. اجعل الأوامر مركّزة: شخص واحد، ومكان واحد، ومزاج واحد. ودع الصوت يتولى مستوى الطاقة والإيقاع الزمني.

3. تعارض الطابع العاطفي

مسار عدواني سريع الإيقاع مقترن بأمر يصف مرجًا ريفيًا هادئًا يُنتج شيئًا يبدو غير متناسق: حركة سريعة في مشهد هادئ. طابق الطابع العاطفي لأمرك النصي مع الطابع العاطفي لصوتك. يستطيع النموذج التعامل مع التباين المقصود، لكن التعارضات العرضية تُضعف جودة الناتج بشكل واضح.

ابدأ الإبداع على PicassoIA

أسطوانة فينيل تدور على حامل أسطوانات راقٍ مع إبرة مضغوطة في الأخدود، وضوء متوهج دافئ يلقي ظلالًا ذهبية على غلاف الألبوم

نموذج LTX 2.3 Pro وأداة Audio to Video من Lightricks متاحان كلاهما على PicassoIA دون أي إعداد مسبق. خذ أي مقطع صوتي، واكتب وصفًا بصريًا للمشهد، ودع النموذج يتولى عمل المزامنة الذي كان سيستغرق ساعات في سير عمل المونتاج التقليدي.

للتكرار الإبداعي الأسرع، يمنحك LTX 2.3 Fast بنية تكييف الصوت نفسها بزمن توليد أقل. جرّب مفاهيم مشاهد متعددة بسرعة قبل الالتزام بناتج 4K كامل.

إذا أردت الاطلاع على المجموعة الكاملة المتاحة، يضم PicassoIA أكثر من 87 نموذجًا لتوليد الفيديو على picassoia.com/en/all-models، تغطي كل شيء من التوليد المتزامن مع الصوت إلى تحويل النص إلى فيديو سينمائي، وتحريك الصور، وأدوات تحرير الفيديو. يُعد التوليد المدفوع بالصوت من أسرع الفئات نموًا، ويُعد LTX 2.3 Pro حاليًا أعلى خياراتها دقةً.

شارك هذا المقال

اختر لغتك

مقالات ذات صلة