حدث تغيير في عالم الذكاء الاصطناعي عام 2023، ولم يكن تغييرًا طفيفًا. ما بدأ بمقاطع مشوّشة مدتها ثانيتان لأشخاص يتحوّلون إلى أشكال غير قابلة للتمييز، أصبح خلال ثمانية عشر شهرًا لقطات واقعية بدقة 1080p لا يمكن تمييزها عن تصوير الكاميرات الحقيقي. وقد فاجأت سرعة هذه القفزة حتى الباحثين داخل المختبرات المسؤولة عنها.
فهم كيفية عمل توليد الفيديو بالذكاء الاصطناعي فعلًا ليس تمرينًا أكاديميًا. إذا كنت تريد كتابة أوامر نصية أفضل، أو اختيار النموذج المناسب، أو ببساطة ألا تُفاجأ بما تستطيع هذه الأدوات فعله وما لا تستطيعه، فأنت بحاجة إلى معرفة ما يجري داخل النظام. تشرح هذه المقالة الموضوع من مبادئه الأولى، دون مصطلحات تقنية لذاتها ودون تبسيط مخلّ.

ما هو توليد الفيديو بالذكاء الاصطناعي فعلًا
يتصور معظم الناس أن توليد الفيديو بالذكاء الاصطناعي يعني أن النموذج "يتخيل" مشهدًا ثم يشغّله. وهذه نقطة بداية مفيدة، لكنها تغفل الآلية الفعلية. ما تفعله هذه النماذج أقرب إلى إزالة الضوضاء المُتحكَّم بها عبر الزمن.
إنه ليس مجرد تشغيل لصور متتالية
حاولت المحاولات الأولى لتوليد الفيديو التعامل مع المهمة على أنها توليد عدد كبير من الصور بتتابع سريع. وهذا النهج يفشل بسرعة. فالصور المنفردة الجيدة لا تضمن اتساقها البصري مع بعضها، لذلك تنتج الأساليب التي تعالج الإطارات واحدًا تلو الآخر أشخاصًا يرتعشون، وخلفيات تتشوه، وشخصيات تتغير ملامح وجوهها بين اللقطات.
تحل الأنظمة الحديثة هذه المشكلة بمعاملة الزمن بوصفه بُعدًا بنيويًا داخل البيانات، لا شيئًا يُضاف لاحقًا. يُدرَّب النموذج على التفكير في تسلسلات من الإطارات في وقت واحد، لا في إطار واحد معزول.
البنيتان المهيمنتان
توجد حاليًا بنيتان أساسيتان تقفان وراء أفضل أنظمة تحويل النص إلى فيديو:
| البنية | الآلية الأساسية | نماذج تمثيلية |
|---|
| الانتشار الكامن | إزالة الضوضاء تكراريًا في فضاء كامن مضغوط | Wan 2.7، LTX 2 Pro، Stable Diffusion Video |
| محوّل الانتشار (DiT) | تنبؤ قائم على الرقع عبر المكان والزمن | Sora 2، Veo 3، Kling v3 |
تنتج كلتا البنيتين نتائج عالية الجودة. تميل نماذج الانتشار إلى أن تكون أسرع وأكثر كفاءة في المعاملات. وتميل الأنظمة القائمة على المحوّلات إلى إنتاج حركة أكثر اتساقًا في المقاطع الطويلة. وغالبًا ما تجمع أقوى النماذج الحديثة أفكارًا من النهجين معًا.
كيف يقرأ النموذج كلماتك
قبل توليد أي إطار، يحوّل النموذج أمرك النصي إلى تمثيل رياضي يستطيع استخدامه فعلًا. تُسمى هذه الخطوة ترميز النص، وجودتها تحدد جودة كل ما يليها.
التجزئة إلى توكنات ومرمّز النص
يُقسَّم أمرك النصي إلى توكنات، وهي عادةً وحدات جزئية من الكلمات لا كلمات كاملة، ثم يمرّ عبر مرمّز نصي. تستخدم معظم النماذج الحالية إصدارًا من CLIP أو T5، أو مرمّزًا مخصصًا دُرِّب خصيصًا لتوليد الفيديو. يتحول كل توكن إلى متجه عالي الأبعاد، وتُسمى مجموعة المتجهات كاملةً تضمين النص.
في فضاء التضمين هذا، تتجمع العبارات المتقاربة في المعنى بالقرب من بعضها هندسيًا. فعبارتا "كلب يركض في مطر غزير" و"كلب مبلّل يندفع عبر البرك" تنتجان تضمينات قريبة هندسيًا. وهذه هي الآلية التي يربط بها النموذج المعنى بالصور.
ماذا تعني "الالتزام بالأمر النصي" فعلًا
لا يعالج النموذج اللغة بالطريقة التي يعالجها الإنسان. فقد بنى عبر التدريب ارتباطات إحصائية بين أنماط النص وأنماط الصور، من مجموعات بيانات ضخمة مزدوجة من مقاطع الفيديو وأوصافها. ولهذا تكتسب الدقة كل هذه الأهمية.
💡 نصيحة عملية: الأوصاف الملموسة والبصرية تنتج نتائج أفضل من الأوصاف المجردة. فعبارة "امرأة ذات شعر أحمر مجعد وسترة مطر صفراء تسير بخطى سريعة في شارع ضيق مرصوف بالحجارة تحت مطر غزير" تتفوق بثبات على عبارة "شخص يمشي في المطر".
كل تفصيل محدد إضافي تقدمه يضيّق مساحة التوليد ويقرّب المخرجات من شيء واقعي ومقصود.
ما يجري داخل الانتشار الكامن للفيديو
تستخدم معظم أنظمة تحويل النص إلى فيديو المتقدمة، ومنها Wan 2.7 T2V وLTX 2 Pro، الانتشار الكامن. ويستحق هذا الأمر فهمًا دقيقًا لأنه يفسّر مباشرةً قوة النماذج الحالية وقيودها.

عملية التحوّل من الضوضاء إلى الإشارة
يعمل الانتشار في مرحلتين:
- الانتشار الأمامي (التدريب): تُفسد مقاطع الفيديو الحقيقية تدريجيًا بإضافة ضوضاء غاوسية حتى تصبح ضوضاءً عشوائية خالصة. ويُدرَّب النموذج على عكس هذه العملية.
- الانتشار العكسي (التشغيل): ينطلق النموذج من ضوضاء عشوائية ويطبق خطوات كثيرة صغيرة لإزالة الضوضاء، موجَّهًا بتضمين نصك، حتى يظهر فيديو متماسك.
ما يجعل الانتشار الكامن فعّالًا بشكل خاص أن هذه العملية لا تجري في فضاء البكسلات الخام. فنموذج منفصل يسمى VAE (المُرمّز التلقائي المتغير) يضغط الفيديو أولًا إلى تمثيل أصغر بكثير. ثم يعمل الانتشار على هذه التمثيلات المضغوطة، وهو أسرع بكثير من العمل مباشرةً على البكسلات.
لماذا يصعب الفيديو أكثر من الصور
في توليد الصور، يملك التمثيل الكامن ثلاثة أبعاد: الارتفاع والعرض والقنوات. أما في الفيديو فله أربعة: الارتفاع والعرض والقنوات، والزمن.
يحتوي فيديو مدته 5 ثوانٍ بمعدل 24 إطارًا في الثانية على 120 إطارًا. أي أنه يحمل بيانات أكثر بمقدار 120 مرة من صورة واحدة. يجب على النموذج أن يحافظ على الاتساق البصري عبر كل هذه الإطارات، مع ضمان حركة سلسة ومعقولة فيزيائيًا طوال الوقت. ويجب أن تمتد آليات الانتباه في هذه النماذج عبر المكان والزمن معًا، فتنتبه لا إلى البكسلات القريبة داخل الإطار فحسب، بل إلى المناطق المقابلة لها عبر الإطارات في التسلسل.
الجزء الأصعب: الاتساق الزمني
إذا جربت أداة لتوليد الفيديو بالذكاء الاصطناعي ولو مرة واحدة، فأنت تعرف بالفعل أكثر أنماط الفشل شيوعًا: يتغير وجه الشخص في منتصف المقطع، وتتشوه اليد إلى شيء غريب، ويومض عنصر في الخلفية بين حالة وأخرى. ولهذه المشكلة تحديدًا اسم وسبب واضح.

ما الذي يسبب انجراف الزمن
الاتساق الزمني يعني الحفاظ على الهوية نفسها والفيزياء نفسها والمظهر البصري نفسه عبر الزمن. وهو أمر صعب لثلاثة أسباب رئيسية:
- تتراكم أخطاء التنبؤ الصغيرة في كل خطوة من خطوات إزالة الضوضاء عبر إطارات كثيرة
- لا تملك النماذج ذاكرة صريحة لشكل الإطار 1 عندما تولّد الإطار 60
- تتغير الأجسام المتحركة مظهرها بشكل مشروع بسبب تغير المنظور والإضاءة، مما يصعّب على النموذج التمييز بين التغيير الصحيح والخطأ
تعالج البنى الأحدث هذه المشكلة بنوافذ انتباه زمنية أكبر، أي أن النموذج ينتبه إلى عدد أكبر من الإطارات في الوقت نفسه أثناء التوليد. وقد أحرزت نماذج مثل Kling v2.1 Master وSeedance 2.0 وVeo 3.1 تقدمًا ملحوظًا في معالجة نمط الفشل هذا تحديدًا.
فيزياء لا تعرفها هذه النماذج
لا تملك نماذج توليد الفيديو الحالية محرك فيزياء مدمجًا. فهي تقرّب السلوك الفيزيائي من خلال استيعابها ملايين الساعات من لقطات العالم الحقيقي، لا من فهم أولي لقوانين الجاذبية أو الاحتكاك أو ديناميكا الموائع.
ولهذا سترى:
- السوائل تتصرف بغرابة في سيناريوهات قليلة التمثيل في بيانات التدريب
- الأصابع والأيدي تتشوه لأنها معقدة إحصائيًا ومتنوعة بشدة عبر عينات التدريب
- الأقمشة والشعر يبدو متسقًا في إطار ثم يصبح عشوائيًا فجأة في الإطار الذي يليه
💡 نصيحة عملية: تجنّب الأوامر النصية التي تتطلب تفاعلات فيزيائية معقدة بين عدة أجسام. فشخص يمشي، أو سيارة تتحرك، أو ورقة تسقط كلها تعمل بثبات. أما شخص يسكب مشروبًا بينما يدير وجهه ليناوله لشخص آخر، فهذا يحمل تعقيدًا كافيًا لإحداث مشكلات في معظم النماذج الحالية.
ما الذي تُدرَّب عليه هذه النماذج فعلًا
الفرق بين نموذج متوسط لتوليد الفيديو بالذكاء الاصطناعي ونموذج متطور كثيرًا ما يعود إلى جودة البيانات، لا إلى البنية وحدها.

مشكلة البيانات على نطاق واسع
يتطلب تدريب نموذج تنافسي لتحويل النص إلى فيديو:
- مئات الملايين من مقاطع الفيديو ذات الجودة البصرية العالية وبمواضيع متنوعة
- تسميات توضيحية مزدوجة دقيقة، إما مكتوبة يدويًا أو منتجة بواسطة نموذج لغوي بصري
- تنوع في الحركة: التصوير البانورامي، واليد الحرة، والثابت، والحركة البطيئة، والحركة السريعة، والتصوير الجوي، وتحت الماء
- تنوع في الموضوعات: البشر، والحيوانات، والبيئات الطبيعية، والعمارة، وأنماط الحركة المجردة
استثمرت مختبرات مثل Google و ByteDance و Kuaishou في مجموعات بيانات خاصة تتجاوز بكثير ما هو متاح للعموم. وهذا سبب رئيسي في أن النماذج مفتوحة المصدر، مع أنها ممتازة، ما زالت متأخرة عن أبرز العروض التجارية في جودة الحركة والمعقولية الفيزيائية.
3 أمور تفصل النماذج القوية عن الضعيفة
عند تقييم أي نموذج لتحويل النص إلى فيديو، تخبرك هذه الصفات الثلاث بأكثر مما تخبرك به أي نتيجة اختبار معياري منشورة:
- معقولية الحركة: هل تبدو الحركة كشيء يمكن أن يحدث فعلًا وفق قوانين الفيزياء؟
- ثبات الشخصية: هل يبدو الشخص نفسه في الإطار 100 كما في الإطار 1؟
- الالتزام بالأمر النصي: هل تعكس النتيجة التفاصيل المحددة في أمرك النصي، أم تنتج مشهدًا عامًا؟
النماذج التي تنتج نتائج حقيقية الآن
تحرّك مجال تحويل النص إلى فيديو بسرعة كبيرة. هذه هي النماذج التي تقدم باستمرار مخرجات بجودة احترافية حتى عام 2025.

Google Veo 3 و Veo 3.1
وضع Veo 3 معيارًا جديدًا بوصفه أول نموذج متاح على نطاق واسع يولّد الفيديو مع صوت متزامن أصلي، لا صوتًا يُضاف في مرحلة ما بعد الإنتاج، بل صوتًا يُولَّد بالتوازي مع المحتوى البصري. ويُحسّن Veo 3.1 هذا بثبات حركة أفضل بدقة 1080p. وللمحتوى الذي يحتاج إلى سرد بصري وصوتي معًا في خطوة توليد واحدة، لا يضاهي هذان النموذجان أحدًا. ويقدم Veo 3 Fast قدرة الصوت نفسها بأزمنة تصيير أسرع للتكرار السريع.
Sora 2 من OpenAI
يستخدم Sora 2 بنية محوّل الانتشار (DiT) التي تعامل الفيديو بوصفه تسلسلًا من رقع فيديو مضغوطة يُتنبأ بها عبر الزمن. وتكمن قوته الأساسية في الاتساق في المقاطع الطويلة. فبينما تنهار كثير من النماذج بعد 5 ثوانٍ، يحافظ Sora 2 على الاتساق البصري لمدة 20 ثانية أو أكثر. ويوسّع Sora 2 Pro هذا بدقة أعلى وعرض أقوى للتفاصيل الدقيقة.
Kling v3 من Kuaishou
أصبح Kling v3 Video خيارًا قويًا للمبدعين الذين يحتاجون إلى حركة سينمائية مع ثبات عالٍ للشخصيات. ويتيح Kling v3 Motion Control تحديد حركات الكاميرا مباشرةً، بدلًا من تقريبها عبر صياغة الأمر النصي. وإذا كان محتواك يتطلب أنواعًا محددة من اللقطات، مثل الاقتراب التدريجي أو التصوير البانورامي أو السحب العلوي، فإن التحكم في الحركة لدى Kling هو الخيار الأكثر موثوقية المتاح حاليًا. ويقدم Kling v2.6 توازنًا جيدًا بين السرعة والجودة لسير عمل الإنتاج.
Seedance 2.0 من ByteDance
Seedance 2.0 هو النموذج الرائد الحالي من ByteDance، ويوفر توليد تحويل النص إلى فيديو وتحويل الصورة إلى فيديو مع صوت مدمج. واتساقه الزمني من بين الأفضل المتاحة، خاصةً للشخصيات البشرية في الحركة. ويحافظ Seedance 2.0 Fast على جودة النموذج الكامل مع خفض زمن التوليد بشكل كبير، مما يجعله مناسبًا للمحتوى بصيغ مواقع التواصل بكميات كبيرة.
Wan 2.7 وLTX 2 Pro
يُعد Wan 2.7 T2V من أقوى الخيارات مفتوحة الأوزان المتاحة، وينتج مخرجات بدقة 1080p مع حركة فيزيائية متينة. أما نظيره Wan 2.7 I2V فيحرك الصور الثابتة بأمانة لافتة للموضوع. ويستهدف LTX 2 Pro سوق دقة 4K، مما يجعله الخيار الصحيح للقطات الإنتاجية المخصصة للعرض الاحترافي. ويذهب LTX 2.3 Pro أبعد من ذلك بتفاصيل مكانية أكثر حدة.
كيفية استخدام نماذج تحويل النص إلى فيديو
مع أكثر من 100 نموذج لتحويل النص إلى فيديو متاح، يهم اختيار النموذج المناسب لمهمتك بقدر أهمية كتابة أمر نصي جيد.

طابق النموذج مع المهمة
المعلمات التي تهم فعلًا
تعرض معظم النماذج عناصر تحكم تؤثر بشكل كبير في جودة المخرجات:
- المدة: المقاطع القصيرة (3 إلى 5 ثوانٍ) أكثر اتساقًا زمنيًا من الأطول لمعظم النماذج الحالية
- الدقة: تحسّن الدقة الأعلى التفاصيل الدقيقة المرئية، لكنها تزيد تكلفة الحوسبة وزمن التوليد
- قيمة البذرة: تثبيت قيمة البذرة أثناء تعديل أمرك النصي يُبقي التوليد الأساسي مستقرًا، فتستطيع قياس أثر كل تغيير
- نسبة العرض إلى الارتفاع: حدد صيغة المخرجات المقصودة قبل التوليد. فالقص بعد ذلك يُفقد الجودة ويغيّر التأطير.
اكتب أوامر لا تفشل
ردّ فعل معظم الناس الأول على توليد سيئ هو تغيير النموذج. وفي أغلب الأحيان تكون المشكلة في الأمر النصي.

ما الذي يجعل الأمر النصي ضعيفًا
تشترك الأوامر النصية الضعيفة في صفات متوقعة قليلة:
- مجرَّد أكثر من اللازم: "لحظة جميلة" لا تعطي النموذج أي إشارة اتجاهية تقريبًا
- عناصر كثيرة متنافسة: "قطة وكلب وطائر يلعبون معًا" تشتت الانتباه وتقلل الاتساق بين الموضوعات
- لا توجد حركة محددة: "شخص يقف في حقل" ينتج مقطعًا شبه ثابت لأنه لم يُوصف أي حركة
- تعليمات متناقضة: "لقطة مقربة بعدسة واسعة الزاوية" متناقضة فيزيائيًا وتُضعف جودة ترميز النص
تشريح أمر نصي قوي
يتبع الأمر النصي القوي لتحويل النص إلى فيديو هذه البنية:
[الشخص بمظهر محدد] + [حركة محددة] + [المكان والإضاءة] + [حركة الكاميرا وإحساس العدسة] + [الحالة المزاجية أو الأجواء]
مثال: "صياد سمك متجعد الملامح في الستينيات من عمره، بذقن رمادية خفيفة وسترة مطر برتقالية، يشد حبلًا على سطح قارب خشبي. يتأرجح القارب برفق في مياه رمادية متموجة. ضوء صباح غائم يأتي من الأعلى مباشرةً. لقطة عريضة ثابتة بمستوى العين. أجواء هادئة وكئيبة."
يمنح هذا الأمر النموذج كل ما يحتاجه: من هو الشخص، وماذا يفعل، وأين، وكيف ترى الكاميرا المشهد، وما الإحساس الذي يجب أن يعطيه المشهد.
💡 قاعدة الموضوع الواحد: إذا كنت جديدًا على توليد الفيديو بالذكاء الاصطناعي، فالتزم بموضوع واحد يؤدي فعلًا واحدًا في كل مقطع. فالتعقيد يضاعف معدلات الفشل بشكل كبير.
التكلفة الحقيقية لتجاهل الأساسيات
كل توليد فاشل هو وقت مهدور وموارد حوسبة مهدورة. والأهم من ذلك أنه زخم إبداعي مهدور. ويساعدك فهم الآليات على قضاء وقت أقل في إعادة تشغيل التوليد، ووقت أكبر في إنتاج عمل فعلي.

النماذج المتاحة اليوم أفضل بعدة مراتب مما كان موجودًا قبل عامين، ولم تتباطأ وتيرة التحسن. وقد أُغلقت الفجوة بين "عرض مذهل" و"جاهز للإنتاج" عمليًا لطيف واسع من حالات الاستخدام. ما يبقى هو التعامل مع هذه الأنظمة بقصد، مع معرفة ما تستطيع فعله وما لا تستطيعه، ولماذا تتصرف بالطريقة التي تتصرف بها.
كل ما يتعلق بقيود الفيزياء، وانجراف الزمن، وحساسية الأمر النصي، يصبح منطقيًا بمجرد أن ترى كيف تعمل البنية الأساسية. وعندما يصبح منطقيًا، تتوقف عن مقاومة النموذج وتبدأ بالعمل معه.
ابدأ الإبداع الآن
لا يوجد بديل عن تشغيل هذه النماذج بنفسك. فالفجوة بين قراءة شيء عن الانتشار ومشاهدة أول مقطع مدته 10 ثوانٍ يُصيَّر أمامك فجوة حقيقية، والمفاجآت، الإيجابية والسلبية، تبني الحدس أسرع من أي قدر من النظرية.

كل النماذج التي تناولتها هذه المقالة، ومنها Veo 3، و Sora 2، و Kling v3، و Seedance 2.0، و Wan 2.7 T2V، و LTX 2 Pro، متاحة في مكان واحد. ابدأ بأمر نصي بسيط ومحدد: موضوع واحد، وفعل واحد، وإضاءة واضحة. ثم ابنِ عليه. ستبدأ الآليات الموصوفة في هذه المقالة بالاتضاح في اللحظة التي ترى فيها كيف يستجيب نموذج لكلماتك في الوقت الفعلي.