مزامنة الصوت والفيديو بشكل صحيح كانت دائمًا من أكثر مراحل إنتاج الفيديو استهلاكًا للجهد. يقضي المحررون المحترفون ساعات في تقطيع المقاطع على النبضات، ومطابقة الطاقة البصرية مع ذروات الصوت، وضبط الإطارات بفارق أجزاء من الثانية. يغيّر LTX 2.3 Pro هذه المعادلة، إذ يجعل الصوت مدخل تكييف من الدرجة الأولى، فيتيح لنموذج التوليد قراءة الإيقاع والنبرة والبيانات الطيفية من مسار الصوت الخاص بك، وبناء مرئيات تتطابق معه منذ الإطار الأول.
هذه ليست مزامنة تُجرى في مرحلة ما بعد الإنتاج. الصوت يشكّل الفيديو أثناء التوليد نفسه، وليس بعده. إليك كيف يعمل هذا المسار بالتفصيل، خطوة بخطوة.

ما الذي يفعله LTX 2.3 Pro بشكل مختلف
الصوت كمدخل من الدرجة الأولى
تتعامل معظم نماذج توليد الفيديو مع الصوت كإضافة لاحقة. تولّد المقطع، ثم تضيف مقطعًا صوتيًا في مرحلة ما بعد الإنتاج، وتعدّل يدويًا إذا بدا التوقيت غير دقيق. يقلب LTX 2.3 Pro، الذي طوّرته Lightricks، هذا المسار. لا يُضاف الصوت فوق الفيديو بعد توليده، بل يُدمج في إشارة التكييف التي توجّه كل خطوة من خطوات إزالة الضوضاء.
عندما تزوّد النموذج بملف صوتي، لا يكتفي بتشغيله إلى جانب الناتج. يحوّل الصوت إلى متجهات ميزات زمنية: شرائح من مخطط الطيف الميلي (mel spectrogram)، ومغلفات البدايات (onset envelopes)، وطوابع زمنية لشبكة الإيقاع. تُحقن هذه المتجهات في عملية إزالة الضوضاء في كل خطوة من خطوات الانتشار، فتدفع الحركة والطاقة البصرية نحو اللحظات في الصوت التي تحمل أكبر قدر من المعلومات. والنتيجة فيديو يعكس فيه الإيقاع البصري الإيقاع الصوتي فعلًا، لأن الاثنين بُنيا معًا.
💡 فكّر في الأمر هكذا: يعمل الصوت كمخرج خفي، يُشير إلى كل إطار متى يثبت، ومتى يقطع بحدّة، ومتى يترك ضبابية الحركة تتلاشى بشكل طبيعي.
ما وراء تحويل النص إلى فيديو التقليدي
نماذج تحويل النص إلى فيديو التقليدية مثل Wan 2.2 S2V أو Veo 3 قوية في توليد الحركة من وصف نصي، لكنها تتعامل مع الصوت بشكل مستقل، إن تعاملت معه أصلًا. فهي تنتج صوتًا يطابق مشهدًا بصريًا، لا مشهدًا يطابق صوتًا موجودًا. هذا الفرق مهم جدًا عندما يكون مسار الصوت موجودًا بالفعل ويجب أن تخدمه المرئيات: مقاطع الموسيقى المصورة، والمحتوى الصوتي للعلامات التجارية، ومواد الحملات المتزامنة.
يقع LTX 2.3 Pro ضمن فئة أصغر من النماذج التي يُعد فيها تكييف الصوت ميزة معمارية من الدرجة الأولى مدمجة في نواة الانتشار، وليس خطوة معالجة لاحقة تُضاف بعد ذلك.
مسار تكييف الصوت

ما يحدث بين رفع ملف الصوت الخاص بك واستلام مقطع فيديو متزامن يتضمن ثلاث مراحل معالجة مختلفة.
كشف الإيقاع ورسم خريطة الإيقاع
تحوّل المرحلة الأولى الصوت إلى هيكل زمني. تمسح خوارزمية تتبع الإيقاع الموجة الصوتية بحثًا عن أحداث البدايات: العابرات، وهجمات الإيقاع، والنبضات الإيقاعية. ثم تربطها بشبكة طوابع زمنية بالدقة الزمنية الأصلية للنموذج. بالنسبة إلى مقطع مدته 5 ثوانٍ بمعدل 24 إطارًا في الثانية، يعني ذلك 120 موضع إطار، يحمل كل منها درجة ثقة للإيقاع.
تصبح مواضع الإيقاع عالية الثقة إطارات مرتكزة. يتعامل النموذج معها كلحظات يجب أن تبلغ فيها الحركة البصرية ذروتها: تحركات الكاميرا تدفع أو تقطع، وطاقة المشهد تبلغ قمتها، وحركة الشخص تصل إلى ذروتها. تُستكمل الإطارات الواقعة بين النبضات بالاستيفاء من هذه المرتكزات، فينشأ إيقاع طبيعي من البناء والإطلاق تتوقعه أذنك ويؤكده بصرك.
💡 نصيحة: المسارات ذات الإيقاع المنتظم (ضربة طبلة ثابتة، نبض إيقاعي متساوٍ) تنتج مزامنة أكثر قابلية للتوقع. أما المسارات ذات التغيرات غير المنتظمة في السرعة فتنتج مخرجات بصرية أكثر ديناميكية وأقل قابلية للتوقع. كلاهما صالح بحسب نيتك الإبداعية.
قراءة النبرة والمزاج البصري
إلى جانب كشف الإيقاع، يُجري المسار تمريرة معالجة طيفية. يفصل الصوت إلى نطاقات ترددية (الجهير، والمتوسط، والحاد) ويتتبع الطاقة في كل نطاق مع الزمن. تدفع هيمنة الترددات المنخفضة (الجهير الثقيل، والوسادات العميقة) المخرجات البصرية نحو حركة أبطأ وأثقل: لقطات بانورامية عريضة، وتكبير بطيء، ومرئيات جوية داكنة. أما طاقة الترددات العالية (الأصوات الاصطناعية اللامعة، وأدوات الإيقاع السريعة، والأوتار الحادة) فتدفع نحو قطع أسرع، وتباينات أكثر حدة، ولوحات ألوان ذات تشبع أعلى.
هذا ليس ربطًا بقواعد مبرمجة مسبقًا. تعلّم النموذج هذه الارتباطات من التدريب على مجموعات بيانات كبيرة من الفيديو والصوت، حيث اتخذ المحررون البشر خيارات حدسية مشابهة. وتوجّه إشارة التكييف عملية الانتشار نحو ما قد يفعله محرر ماهر إزاء المسار الصوتي نفسه.
الميزات الطيفية تقود حركة الإطارات
تستخرج المرحلة الثالثة معاملات السمع الميلية (MFCCs) والمحتوى التوافقي. تحمل هذه البصمات الطيفية الدقيقة معلومات عن طابع الصوت، وحركة طبقة الصوت، والثراء النغمي، وهي أمور لا تلتقطها الموجات الصوتية البسيطة. يستخدمها النموذج لتعديل متجهات الحركة على مستوى الإطار.
عمليًا: يميل تسلسل طبقة صوت صاعدة إلى إنتاج حركة لأعلى أو توسعية. ويميل عبارة توافقية هابطة إلى إنتاج حركة تستقر أو تتباطأ. كما تخلق الكورد الممتدة حركة مستمرة وناعمة، وتنتج النوتات المتقطعة قطعات بصرية حادة ومتقطعة. هذه ميول مستمدة من التدريب، تُفعَّل بشكل مناسب لكل إطار بواسطة إشارة التكييف، وليست قواعد صارمة تُطبَّق آليًا.
المزامنة إطارًا بإطار

كيف تتوافق الحركة مع الصوت
تحدث المزامنة داخل عملية الانتشار الكامن أثناء التوليد، لا في مرحلة ما بعد الإنتاج. في كل خطوة من خطوات إزالة الضوضاء، ينتبه النموذج متقاطعًا إلى موتر ميزات الصوت عند موضع الزمن المناسب. تربط آلية الانتباه المتقاطع هذه لحظة صوتية محددة بموضع إطار محدد في الفيديو المولَّد.
ولأن الانتباه يعمل في كل خطوة من خطوات إزالة الضوضاء، لا عند التهيئة فقط، فإن إشارة الصوت توجّه المسار البصري باستمرار طوال عملية التوليد كلها. وإذا جاءت نبضة متأخرة بسبب الانزياح الإيقاعي، تستجيب الحركة في مجموعة الإطارات المقابلة لها بدقة. المزامنة دقيقة على مستوى الإطار، وليست محاذاة تقريبية.
الاتساق الزمني عبر الإطارات
من المخاطر الحقيقية في التوليد المشروط بالصوت التفتت البصري: إطارات تبدو مختلفة جدًا عن بعضها لأن كل نبضة تُحدث تحولًا بصريًا دراماتيكيًا، فيصبح الناتج أقرب إلى عرض شرائح منه إلى لقطات متصلة. يعالج LTX 2.3 Pro هذه المشكلة عبر طبقات الانتباه الذاتي الزمني التي تفرض الاتساق بين الإطارات المتجاورة، بغض النظر عن قوة تكييف الصوت في أي لحظة معينة.
والنتيجة لقطات متماسكة حتى مع الصوت شديد الديناميكية. تظل الوجوه مستقرة بين النبضات. وتحافظ الخلفيات على استمرارية المنظور. وتتحرك الأجسام بتسارع وتباطؤ يتوافقان مع الفيزياء، بدلًا من أن تقفز بين الإطارات.
مخرجات 4K على نطاق واسع

لماذا تهم الدقة للفيديو المتزامن
ظل توليد الفيديو المدفوع بالصوت محدودًا تاريخيًا بدقات منخفضة. أنتجت الأدوات الأولى مقاطع بحجم 512x512 بدت مقبولة على شاشة الهاتف، لكنها تدهورت بشكل واضح على أي شاشة أكبر. يُخرج LTX 2.3 Pro بدقة 4K، وهو ما يوسّع بشكل كبير نطاق الاستخدامات الواقعية لهذا التنسيق:
- عرض الفعاليات المباشرة: تصمد دقة 4K على شاشات LED الكبيرة دون تشوهات واضحة
- مقاطع موسيقى بجودة البث: مناسبة لمعايير استيعاب منصات البث
- التكامل في الإنتاج التجاري: يمكن إدراجها في الجداول الزمنية للمونتاج الاحترافي دون إعادة تحجيم
- محتوى الويب بملء الشاشة: لا حاجة إلى أشرطة سوداء أو حشو للدقة
يضحّي إصدار LTX 2.3 Fast بسقف الدقة مقابل سرعة التوليد، مما يجعله مفيدًا للتكرار السريع أثناء التطوير الإبداعي قبل الالتزام بتصيير 4K كامل.
الانتشار الكامن من الداخل
المعمارية التي تجعل توليد 4K ممكنًا هي نموذج انتشار الفيديو الكامن. فبدلًا من إزالة الضوضاء على مستوى البكسل (وهو أمر باهظ حسابيًا عند 4K)، يعمل النموذج في فضاء كامن مضغوط تمثل فيه كل وحدة رقعة مكانية من الصورة الكاملة. وتعمل متجهات تكييف الصوت في هذا الفضاء الكامن نفسه، وهذا ما يجعل المزامنة دقيقة وقابلة للحساب في الوقت نفسه.
بعد انتهاء إزالة الضوضاء، يعيد مفكك ترميز عالي الدقة بناء التمثيل الكامن بالدقة الكاملة، مضيفًا حدة الملمس والتفاصيل الدقيقة خلال مرحلة رفع الدقة. وهذا النهج في فك الترميز هو تطور للمسار المستخدم في LTX 2 Pro، مع تحسن كبير في دقة مفكك الترميز في الإصدار 2.3.
كيفية استخدام LTX 2.3 Pro على PicassoIA

يستضيف PicassoIA كلًا من نموذج LTX 2.3 Pro وأداة Audio to Video المخصصة من Lightricks. إليك سير العمل الكامل.
الخطوة 1: جهّز الصوت
الصيغ المدعومة: WAV وMP3 وFLAC وAAC. للحصول على نتائج قوية باستمرار:
- استخدم مقطعًا بين 3 و10 ثوانٍ (يمكن تقسيم المسارات الأطول إلى أجزاء ومعالجتها بالتتابع)
- اضبط مستوى الصوت على نحو -14 LUFS تقريبًا لتحقيق علو صوت ثابت في إشارة التكييف
- أزل الصمت في بداية المقطع، لأن النموذج يقرأ الإطار الأول كالحالة الأساسية للمشهد
💡 بالنسبة لمسارات الموسيقى: صدّر مقطعًا محددًا (drop أو كورس أو مقطع شعري) بدلًا من المسار كاملًا. النموذج مدرَّب على مقاطع قصيرة، وتنتج الأقسام الأكثر تركيزًا مزامنة أدق.
الخطوة 2: اضبط المعاملات
| المعامل | القيمة الموصى بها | ملاحظات |
|---|
| الدقة | 4K أو 720p | 4K للناتج النهائي، و720p للمسودات السريعة |
| المدة | 5 ثوانٍ | طول التدريب الأصلي؛ يمتد بسلاسة إلى 10 ثوانٍ |
| الأمر النصي | وصف المشهد | يصف المرئيات، لا محتوى الصوت |
| قوة الصوت | من 0.7 إلى 0.9 | يتحكم في تأثير الصوت مقابل حركة الأمر النصي |
| مقياس CFG | من 3.0 إلى 5.0 | القيم الأعلى تزيد الالتزام بالأمر النصي |
يعمل الأمر النصي والمدخل الصوتي كشريكين. يحدد الأمر النصي المشهد والشخص والأسلوب البصري. ويحدد الصوت الطاقة الزمنية وإيقاع الحركة. صف ما تريد رؤيته، لا كيف يبدو الصوت.
الخطوة 3: وَلِّد وحمّل
عند بدء التوليد، يعمل المسار في ثلاث مراحل:
- المعالجة المسبقة للصوت (نحو ثانيتين): استخراج الميزات، ورسم خريطة الإيقاع، وحساب مخطط الطيف الميلي
- انتشار الفيديو (من 30 إلى 120 ثانية حسب الدقة): حلقة إزالة الضوضاء مع تكييف الصوت في كل خطوة
- فك الترميز والرفع (من 5 إلى 10 ثوانٍ): إعادة البناء من الفضاء الكامن إلى البكسل، والتخزين، وإرجاع الرابط
لا يُدمج المسار الصوتي في ملف MP4 الذي تحمّله، وهذا يمنحك تحكمًا كاملًا في تعديلات التوقيت ضمن برنامج المونتاج الخاص بك.
حالات استخدام من الواقع

مقاطع موسيقى دون طاقم تصوير
هنا يقدّم LTX 2.3 Pro أكبر قيمة عملية فورية. يستطيع الموسيقيون المستقلون، ومنتجو الموسيقى من غرف النوم، وشركات التسجيل الصغيرة إنتاج مقطع موسيقي كامل لمسار مدته 3 دقائق، وذلك بتقسيمه إلى مقاطع من 5 إلى 10 ثوانٍ، وتوليد فيديو لكل مقطع بأمر نصي مناسب للمشهد، ثم تحرير المقاطع معًا في أي محرر غير خطي. تعني مزامنة الصوت أن نقاط القطع تقع بشكل طبيعي قرب النبضات، فتقل تعديلات القطع اليدوية. ومخرجات 4K مناسبة لمنصة YouTube ومنصات البث وعروض الفعاليات المباشرة.
محتوى وسائل التواصل الاجتماعي على نطاق واسع
يتجاوب المحتوى السمعي البصري القصير جيدًا مع التوليد المشروط بالصوت. يمكن توليد شعار صوتي قصير لعلامة تجارية مدته 5 ثوانٍ، مُحرَّك بهوية بصرية ثابتة، على شكل دفعات، حيث يُدفع كل إصدار بالمسار الصوتي نفسه مع أوامر بصرية مختلفة لاختبار الأفكار الإبداعية. نماذج مثل Seedance 2.0 و Kling v2.6 قوية للفيديو الاجتماعي العام، لكن عندما يكون مسار الصوت هو المحور الإبداعي، ينتج LTX 2.3 Pro مزامنة أدق بشكل ملحوظ.
سرد قصص العلامات التجارية بالصوت
يمكن للعلامات التجارية التي تملك هوية صوتية، بما في ذلك الإعلانات الموسيقية القصيرة (jingles) وأصوات العلامة وبصماتها الصوتية المميزة، أن تستخدم التوليد من الصوت إلى الفيديو لإنتاج محتوى بصري يستجيب فعليًا لصوت العلامة. يحمل كل مقطع مولَّد البصمة الإيقاعية نفسها للصوت، مما يبني ارتباطًا ثابتًا بين الصوت وأسلوب الحركة البصرية عبر كل المحتوى.
LTX 2.3 Pro مقابل النماذج الأخرى

الفرق الرئيسي يقع بين النماذج التي تولّد صوتًا ليطابق الفيديو، والنماذج التي تستجيب للصوت عند بناء إطارات الفيديو. يقع LTX 2.3 Pro و Wan 2.2 S2V في الفئة الثانية. وللمحتوى الذي يكون فيه مسار الصوت موجودًا بالفعل ويجب أن تخدمه المرئيات، فهذان النموذجان هما الخياران الأساسيان، ويتفوق LTX 2.3 Pro بميزة الدقة عند 4K.

3 أمور تربك المسار
معرفة الآليات مفيدة. ومعرفة ما يسبب المشكلات توفّر الوقت.
1. فجوات الصمت في الصوت
يقرأ النموذج الصمت كإشارة تكييف صفرية، ويعتمد حركة أبطأ وأقل ديناميكية في تلك الإطارات. الصمت المتعمد مقبول. أما الصمت الناتج عن ملف مُصدَّر بشكل معيب أو قص غير دقيق فيخلق مقاطع بصرية مسطحة تبرز وسط المقاطع الديناميكية المحيطة بها.
2. الأوامر النصية المكتظة
عندما يصف الأمر النصي عددًا كبيرًا من الأشخاص أو الأفعال التي تتنافس على مساحة الإطار، لا تستطيع إشارة تكييف الصوت تجاوز الغموض البصري المتأصل. اجعل الأوامر مركّزة: شخص واحد، ومكان واحد، ومزاج واحد. ودع الصوت يتولى مستوى الطاقة والإيقاع الزمني.
3. تعارض الطابع العاطفي
مسار عدواني سريع الإيقاع مقترن بأمر يصف مرجًا ريفيًا هادئًا يُنتج شيئًا يبدو غير متناسق: حركة سريعة في مشهد هادئ. طابق الطابع العاطفي لأمرك النصي مع الطابع العاطفي لصوتك. يستطيع النموذج التعامل مع التباين المقصود، لكن التعارضات العرضية تُضعف جودة الناتج بشكل واضح.
ابدأ الإبداع على PicassoIA

نموذج LTX 2.3 Pro وأداة Audio to Video من Lightricks متاحان كلاهما على PicassoIA دون أي إعداد مسبق. خذ أي مقطع صوتي، واكتب وصفًا بصريًا للمشهد، ودع النموذج يتولى عمل المزامنة الذي كان سيستغرق ساعات في سير عمل المونتاج التقليدي.
للتكرار الإبداعي الأسرع، يمنحك LTX 2.3 Fast بنية تكييف الصوت نفسها بزمن توليد أقل. جرّب مفاهيم مشاهد متعددة بسرعة قبل الالتزام بناتج 4K كامل.
إذا أردت الاطلاع على المجموعة الكاملة المتاحة، يضم PicassoIA أكثر من 87 نموذجًا لتوليد الفيديو على picassoia.com/en/all-models، تغطي كل شيء من التوليد المتزامن مع الصوت إلى تحويل النص إلى فيديو سينمائي، وتحريك الصور، وأدوات تحرير الفيديو. يُعد التوليد المدفوع بالصوت من أسرع الفئات نموًا، ويُعد LTX 2.3 Pro حاليًا أعلى خياراتها دقةً.