كيف يعمل الذكاء الاصطناعي لتحويل الصورة إلى فيديو فعليًا (ولماذا يزداد تحسّنًا باستمرار)

هل تساءلت يومًا عمّا يحدث فعليًا عندما تُدخل صورة إلى أداة فيديو بالذكاء الاصطناعي؟ يشرح هذا المقال الآليات الحقيقية، من نماذج الانتشار إلى الاتساق الزمني، حتى تتوقف عن اعتبارها سحرًا وتبدأ بمعرفة كيف تولّد الحركة من صورة ثابتة واحدة.

كيف يعمل الذكاء الاصطناعي لتحويل الصورة إلى فيديو فعليًا (ولماذا يزداد تحسّنًا باستمرار)
Cristian Da Conceicao
مؤسس Picasso IA

يحدث أمر غريب عندما تُدخل صورة فوتوغرافية واحدة إلى أداة فيديو حديثة بالذكاء الاصطناعي. خلال ثوانٍ، تبدأ الغيوم في الانجراف، ويبدأ سطح المحيط في التموّج، ويدير الشخص في الإطار رأسه ببطء. لم تعد الصورة جامدة. إنها تتنفس. ما الذي يحدث فعليًا داخل هذه النماذج خلال تلك الثوانٍ القليلة؟ يفكك هذا المقال كل شيء، من الرياضيات إلى الحركة، حتى تتوقف عن اعتبار الأمر سحرًا وتبدأ برؤية الآليات الحقيقية وراء واحدة من أكثر التقنيات إبهارًا في الذكاء الاصطناعي حاليًا.

ما الذي يراه الذكاء الاصطناعي فعليًا

قبل أن يتحرك أي شيء، يجب على النموذج أن يقرأ صورتك، والقراءة في هذا السياق تعني شيئًا محددًا جدًا.

الصورة الفوتوغرافية ليست سوى أرقام

من منظور النموذج، صورتك الفوتوغرافية هي موتر: مصفوفة ثلاثية الأبعاد من الأرقام تمثل شدة البكسلات عبر قنوات الأحمر والأخضر والأزرق. تحتوي صورة بدقة 1024x576 على أكثر من 1.7 مليون رقم بقليل. لا يرى الذكاء الاصطناعي الأشياء كما يراها الإنسان. إنه يعالج أنماطًا إحصائية داخل تلك المصفوفات العددية، أنماطًا اكتسبها أثناء التدريب على ملايين أزواج الصور والفيديو.

هذا يعني أن النموذج لا يملك فهمًا دلاليًا لما هي "الموجة". لقد رأى أنماط بكسلات كافية تشبه الموجات، ومقاطع فيديو قصيرة كافية لتلك الموجات وهي تتحرك، ليبني نموذجًا احتماليًا لكيفية تغيّر هذه البكسلات مع الوقت. بمعنى آخر، تُرمَّز الحركة كنمط إحصائي من التغيّر العددي.

الفضاء الكامن: حيث يتم العمل

معالجة البكسلات الخام مكلفة حسابيًا، لذلك لا تعمل نماذج تحويل الصورة إلى فيديو الحديثة في فضاء البكسلات مباشرة. بدلًا من ذلك، تستخدم المشفّر الذاتي المتغيّر (VAE) لضغط الصورة إلى تمثيل كامن أصغر، عادةً ما يكون أصغر بمقدار 8 إلى 16 مرة في كل بعد مكاني.

تتحول صورتك بدقة 1024x576 إلى موتر مضغوط بحجم 128x72 يطفو فيما يسميه الباحثون الفضاء الكامن. يحتفظ هذا التمثيل المضغوط بالمعنى الدلالي للصورة، والتكوين، والأشخاص، وظروف الإضاءة، دون حمل كل بكسل زائد. يحدث توليد الحركة كله في هذا الفضاء الكامن. ولا يحوّل النموذج النتيجة إلى بكسلات قابلة للعرض إلا في خطوة فك الترميز الأخيرة.

💡 العمل في الفضاء الكامن ليس مجرد تحسين للسرعة. إنه يجبر النموذج على الاستدلال على مستوى البُنى والمفاهيم بدلًا من قيم البكسلات الفردية، وهذا ينتج حركة أكثر سلاسة وتماسكًا عبر الإطارات.

أيدي باحث على لوحة مفاتيح داخل غرفة خوادم مع مصابيح مؤشرات كهرمانية

محرك الانتشار في الأساس

تُبنى معظم نماذج تحويل الصورة إلى فيديو الرائدة اليوم على نماذج الانتشار، وهي البنية الأساسية نفسها التي تُشغّل أفضل أنظمة تحويل النص إلى صورة. إذا استخدمت أي مولّد صور حديث، فقد تعاملت بالفعل مع هذه التقنية.

إضافة الضوضاء ثم إزالتها

يعمل الانتشار في مرحلتين: عملية أمامية وعملية عكسية.

في العملية الأمامية (وقت التدريب)، يأخذ النموذج بيانات تدريب نظيفة، في هذه الحالة مقاطع فيديو حقيقية، ويضيف إليها تدريجيًا ضوضاء غاوسية عشوائية حتى تصبح البيانات غير قابلة للتمييز تمامًا. تجري هذه العملية عبر آلاف الخطوات الصغيرة.

في العملية العكسية (وقت الاستدلال، عندما تستخدمه فعليًا)، يجب على النموذج أن يزيل تلك الضوضاء. يبدأ من سحابة من الضوضاء الصرفة، ويتنبأ بالضوضاء ويزيلها تكراريًا خطوة بخطوة، موجَّهًا بإشارة الشرط: صورتك المدخلة إضافةً إلى أي أمر نصي قدمته. بعد عدد كافٍ من خطوات إزالة الضوضاء، يظهر فيديو متماسك مما كان في الأصل ساكنًا.

ما يُدرَّب النموذج فعليًا على القيام به هو التنبؤ بدالة تنبؤ الضوضاء: بالنظر إلى عينة مشوشة عند مستوى ضوضاء معين، ما الإشارة النظيفة الأصلية؟ تبني البنية، وهي عادةً U-Net أو تصميم قائم على Transformer، قدرة التنبؤ هذه بدقة تكفي لأن يُنتج تشغيلها بالعكس نتائج واقعية كالصور الفوتوغرافية باستمرار.

كيف يغيّر الفيديو المعادلة

بالنسبة للصور الثابتة، يعمل الانتشار في الفضاء ثنائي الأبعاد. أما بالنسبة للفيديو، فيجب على النموذج أن يعمل عبر فضاء ثلاثي الأبعاد: العرض والارتفاع والزمن. وهنا تصبح البنية أكثر تعقيدًا بكثير.

بدلًا من إزالة الضوضاء من إطار واحد، يزيل النموذج الضوضاء من مجموعة من الإطارات في آنٍ واحد. يتفاوت عدد الإطارات حسب النموذج، وعادةً يتراوح بين 16 و81 إطارًا حسب المدة المستهدفة ومعدل الإطارات. تُزال الضوضاء من كل الإطارات في كل خطوة، والأهم من ذلك أن النموذج يطبّق آليات انتباه ثلاثية الأبعاد تسمح لكل إطار أن "يرى" جميع الإطارات الأخرى أثناء إزالة الضوضاء.

هذا الانتباه ثلاثي الأبعاد هو ما يمنع الفيديو من أن يبدو كعرض شرائح لصور غير مترابطة. يُولَّد كل إطار مع وعي كامل بجيرانه.

منظر علوي لطاولة تحرير أفلام عليها شرائح تماس فوتوغرافية مرتبة في صفوف

الاتساق الزمني: التحدي الحقيقي

توليد الإطارات مشكلة. أما جعل تلك الإطارات تتدفق بسلاسة إلى بعضها فهو مشكلة منفصلة تمامًا، وأصعب.

لماذا يجب أن تتوافق الإطارات مع بعضها

تخيّل توليد 25 إطارًا مستقلًا لشخص يمشي. حتى لو بدا كل إطار مثاليًا على حدة، فبدون الاتساق الزمني سيتغيّر لون سترة الشخص عشوائيًا بين الإطارات، وستهتز خطواته، وستومض الخلفية بملامس غير متسقة. ستبدو النتيجة مختلفة تمامًا عن الحركة الحقيقية.

الاتساق الزمني هو الخاصية التي تجعل الإطارات المتجاورة متسقة مع بعضها عبر الزمن. تحقق النماذج الحديثة ذلك من خلال عدة آليات:

  • طبقات الانتباه الزمني: آليات انتباه مخصصة تعالج المعلومات على محور الزمن، وليس على المحاور المكانية فقط
  • القناع السببي: تقيّد بعض البنى كل إطار بالانتباه إلى الإطارات السابقة فقط، محاكيةً الطريقة التي يتكشّف بها الفيديو سببيًا عبر الزمن
  • تثبيت المرساة: يعمل الإطار الأول (صورتك المدخلة) كمرساة شرطية قوية. يجب أن يظل كل إطار لاحق متسقًا إحصائيًا مع تلك المرساة
  • الإشراف على التدفق البصري: دُرّبت بعض النماذج على إشارات تدفق بصري صريحة تعلّمها كيف يجب أن تتحرك البكسلات بين الإطارات

التدفق البصري وتوقع الحركة

التدفق البصري مفهوم كلاسيكي في رؤية الحاسوب: لكل بكسل في الإطار N، أي متجه يصف إزاحته إلى الإطار N+1؟ في تحرير الفيديو التقليدي، كان التدفق البصري يُحسب صراحةً باستخدام خوارزميات. أما في توليد الفيديو الحديث بالذكاء الاصطناعي، فيطوّر النموذج تدفقًا بصريًا ضمنيًا كجزء من هدف تدريبه.

لهذا تنتج نماذج عالية الجودة مثل Wan 2.6 I2V أو Kling v3 Video حركة تبدو معقولة فيزيائيًا: أنماط الحركة متسقة إحصائيًا مع كيفية تحرك الأجسام الحقيقية في العالم الواقعي، بما في ذلك التفاصيل الدقيقة مثل الحركة الثانوية (شعر يتطاير عندما يدير الرأس، وقماش يتدلى مع خطوات الشخص).

امرأة تقارن إطارين لحركة منظر طبيعي جنبًا إلى جنب على جهاز لوحي

أوامر الحركة وإشارات الشرط

منح النموذج صورتك ليس سوى البداية. تقبل معظم أنظمة تحويل الصورة إلى فيديو الحديثة مدخلات إضافية توجّه نوع الحركة واتجاهها وشدتها.

الأوامر النصية التي توجّه الحركة

إضافة أمر نصي مثل "أمواج محيط تتكسر، حركة بطيئة" لا تصف المحتوى فحسب. إنها تُوجّه فعليًا عملية إزالة الضوضاء. يُشفَّر النص إلى متجه عالي الأبعاد باستخدام نموذج لغوي (غالبًا CLIP أو T5)، ويُحقن هذا المتجه في طبقات الانتباه المتقاطع لنموذج الانتشار في كل خطوة من خطوات إزالة الضوضاء.

هذا يعني أن النص ليس أمرًا ثانويًا. إنه إشارة حيّة تُعدّل طريقة تفسير النموذج لصورتك، ونوع أنماط الحركة التي يولّدها. فوصف حركة الكاميرا ("حركة بانورامية بطيئة نحو اليسار")، أو سلوك الشخص ("امرأة تضحك")، أو الظروف المحيطة ("رياح تهبّ بين الأشجار")، كلها تزيح توزيع الاحتمالات على مقاطع الفيديو الممكنة نحو النتيجة التي تريدها.

💡 الدقة في الأمر مهمة: كلما كان وصف الحركة أكثر تحديدًا، استطاع النموذج تقييد مخرجاته بشكل أفضل. "غيوم تتحرك" ضعيف. أما "غيوم ركامية متوسطة ببطء تنجرف قطريًا من الركن السفلي الأيسر إلى الركن العلوي الأيمن" فيمنح النموذج الكثير ليعمل به.

نقاط البذرة والتحكم في الكاميرا

تقبل بعض النماذج اليوم مدخلات صريحة للتحكم في الكاميرا. يتيح Kling v2.6 Motion Control تحديد مسارات الكاميرا، ويتيح Minimax Video 01 Director ضبط أنواع محددة من حركة الكاميرا. تعمل هذه الميزات بحقن تضمينات وضعية الكاميرا في إشارة الشرط إلى جانب الصورة والنص.

والنتيجة فئة جديدة من التحكم الإبداعي لم تكن ممكنة أبدًا مع أساليب الاستيفاء بين الإطارات القديمة.

منظور من زاوية منخفضة لشاشة منحنية كبيرة تعرض خط زمني للفيديو مع إطارات مفتاحية

النماذج التي تقوم بذلك اليوم

ازداد عدد نماذج تحويل الصورة إلى فيديو القادرة بسرعة خلال الأشهر الـ 18 الماضية. إليك كيف تختلف العائلات الرئيسية في أسلوبها وطابع مخرجاتها.

سلسلة Wan: السرعة مقابل الجودة

تقدم عائلة نماذج Wan من Wan-Video واحدًا من أوسع النطاقات المتاحة حاليًا من المفاضلات بين السرعة والجودة. يُحسَّن كلٌّ من Wan 2.6 I2V Flash و Wan 2.5 I2V Fast للتوليد السريع مع ترابط زمني جيد، بينما يُعطي Wan 2.2 I2V A14B الأولوية للجودة مع أعداد معاملات أعلى.

تعتمد بنية Wan على عمود فقري من نوع DiT (Diffusion Transformer) بدلًا من U-Net التقليدي، وهي تتوسع بكفاءة أكبر مع الحسابات، وتتعامل مع متطلبات الانتباه ثلاثي الأبعاد في توليد الإطارات المتعددة بطريقة أكثر طبيعية.

النموذجالسرعةالدقةالإطارات
Wan 2.6 I2V Flashسريع جدًا720p16-33
Wan 2.5 I2V Fastسريع720p33
Wan 2.6 I2Vقياسي720p+33-81

Kling والنهج السينمائي

تتبع Kling، وهي من قسم الذكاء الاصطناعي في Kuaishou، نهجًا معماريًا مختلفًا مع تركيز قوي على جودة الحركة السينمائية. ينتج Kling v3 Video و Kling v2.6 باستمرار نتائج تتضمن حركة ثانوية طبيعية المظهر: فيزياء الشعر، وديناميكية الأقمشة، وأنماط الضوء المنعكسة على الماء. ويأتي هذا من التدريب على لقطات سينمائية منتقاة عالية الجودة بدلًا من فيديوهات الإنترنت العامة.

بالنسبة لتحريك الصور تحديدًا، يظل Kling v2.1 من أكثر النماذج موثوقية لأخذ صورة شخصية وتوليد حركة مقنعة للرأس والوجه.

Minimax Hailuo: حركة واقعية كالصور الفوتوغرافية

تستهدف سلسلة Hailuo من Minimax قبل كل شيء الواقعية كالصور الفوتوغرافية. Hailuo 2.3 و Hailuo 2.3 Fast قويان بشكل خاص في محتوى البورتريه والجمال، إذ ينتجان حركة تحافظ على الهوية جيدًا عبر الإطارات. ويتخصص نموذج Video 01 Live في تحريك الصور الثابتة مع التركيز على الحفاظ على ملامح الشخص طوال المقطع.

💡 بالنسبة للبورتريهات وتحريك الوجوه تحديدًا، تتفوق النماذج المدرّبة على بيانات وجوه عالية الدقة، مثل Hailuo 2.3 و Kling v2.1، باستمرار على النماذج ذات الأغراض العامة.

منظر جانبي لامرأة أمام محطة عمل بثلاث شاشات مضاءة بوهج الشاشات

مناهج سابقة تستحق المعرفة

تُوضح بعض النماذج الأقدم، التي لا تزال متاحة، كيف تطور هذا المجال. I2VGen XL من فريق البحث في Alibaba كان من أوائل نماذج تحويل الصورة إلى فيديو واسعة النطاق ذات التوليد على مرحلتين: مرور أولي خشن للحركة يليه مرور تحسين للدقة العالية. كما تميّز PIA (Personalized Image Animator) بقبوله وحدات حركة إضافية، ما سمح بتطبيق أنماط حركة مختلفة على الصورة نفسها دون إعادة تدريب.

تعتمد هذه المناهج السابقة بدرجة أكبر على قوالب حركة صريحة بدلًا من الاستنتاج الإحصائي العام، ما جعلها أسرع لكنها أقل مرونة من أنظمة DiT الحالية.

لقطة مقربة لحاسوب محمول بواجهة تقليب الفيديو تعرض لقطات بطيئة لغابة

ما الذي يجعل المقطع يبدو حقيقيًا

ليست كل الفيديوهات المولّدة بالذكاء الاصطناعي مقنعة بالقدر نفسه. يعود الفرق عادةً إلى عاملين.

الفيزياء مقابل الأنماط الإحصائية

لا تحاكي نماذج تحويل الصورة إلى فيديو الحالية الفيزياء. لا يوجد محرك ديناميكا للأجسام الصلبة، ولا محاكاة للسوائل، ولا نظام نوابض للأقمشة. تأتي واقعية الحركة بالكامل من الأنماط الإحصائية المكتسبة أثناء التدريب على بيانات فيديو حقيقية.

لهذا تداعيات محددة جدًا: تؤدي النماذج أفضل أداء على الموضوعات التي صادفتها كثيرًا في بيانات التدريب. أجسام البشر ووجوههم، والبيئات الطبيعية (الماء والأشجار والغيوم)، واهتزاز الكاميرا، كلها تظهر بكميات هائلة في الفيديوهات الواقعية. هذه الموضوعات تتحرك بإقناع. أما الموضوعات المجردة، أو ظروف الإضاءة غير المعتادة، أو الصور المدخلة التي تبدو اصطناعية، فغالبًا ما تنتج تشوهات لأن النموذج يملك أنماطًا إحصائية أقل ليستند إليها.

ولهذا أيضًا يكافئ هندسة الأوامر لهذه النماذج وصفُ سيناريوهات مألوفة وواقعية كالصور الفوتوغرافية بدلًا من السيناريوهات المجردة أو المنمّقة.

مقايضات الدقة وFPS والمدة

يواجه كل نموذج لتحويل الصورة إلى فيديو مثلثًا حسابيًا: الدقة ومعدل الإطارات والمدة. لا يمكنك تعظيم الثلاثة معًا في الوقت نفسه.

الأولويةما تضحي به
دقة عالية (1080p+)إطارات أقل أو مدة أقصر
FPS عالٍ (24fps+)دقة أقل أو مدة أقصر
مدة طويلة (10 ثوانٍ+)دقة أقل أو FPS أقل

تتجه نماذج مثل LTX 2.3 Pro من Lightricks نحو مخرجات بدقة 4K، بينما يقايض Wan 2.1 I2V 480p الدقة مقابل السرعة والتكلفة. واختيار النموذج المناسب يعني مطابقة هذه المقايضات مع حالة استخدامك المحددة، بدلًا من الاكتفاء بما يحتل المرتبة الأعلى في لوحة المتصدرين.

💡 بالنسبة لمحتوى وسائل التواصل الاجتماعي حيث تكفي دقة 720p بوضوح، غالبًا ما تحقق النماذج السريعة مثل Wan 2.6 I2V Flash أو Hailuo 2.3 Fast نتائج أفضل لكل توليد من النماذج عالية الدقة التي تعمل عند أقصى جودة لها.

امرأة تنحني فوق طاولة إضاءة تقارن صورة مدينة ثابتة بنسختها المتحركة

اختيار نموذج لحالة استخدامك

مع أكثر من 80 خيارًا متاحًا لتوليد الفيديو، يكون مطابقة النموذج للمهمة أهم من اختيار الاسم الذي يبدو الأكثر إبهارًا. إليك مرجعًا سريعًا:

حالة الاستخدامالنماذج الموصى بها
تحريك البورتريه والوجوهKling v2.1، Hailuo 2.3
حركة المناظر الطبيعية والطبيعةWan 2.6 I2V، Wan 2.5 I2V
مخرجات بجودة سينمائيةKling v3 Video، Kling v2.6
السرعة قبل كل شيءWan 2.6 I2V Flash، Hailuo 2.3 Fast
التحكم في حركة الكاميراKling v2.6 Motion Control
مخرجات بدقة عاليةLTX 2.3 Pro

امرأة تراجع إطارات حركة تدريجية مثبتة على لوح فلين في استوديو مضاء بأشعة الشمس

جرّبه بصورك الخاصة

التقنية الموصوفة أعلاه ليست نظرية. كل نموذج مذكور في هذا المقال متاح الآن على PicassoIA، دون الحاجة إلى إعداد واجهات API أو إدارة الحوسبة أو تثبيت أي شيء. خذ صورة لديك بالفعل، واكتب وصفًا قصيرًا للحركة، واختر نموذجًا بناءً على الجدول أعلاه، ثم شغّله. الفجوة بين معرفة طريقة عمل هذا وممارسته الفعلية هي نقرة واحدة.

تتحسن النماذج مع كل دورة إصدار. ما ينتجه Wan 2.5 I2V اليوم أفضل بكثير مما كان ممكنًا قبل 12 شهرًا، والإصدارات القادمة قيد التطوير بالفعل. البقاء فضوليًا والتجريب بانتظام هو أفضل طريقة لتبقى متقدمًا على ما هو ممكن.

سواء كنت تحرّك البورتريهات، أو تُحيي المناظر الطبيعية، أو تبني محتوى اجتماعيًا على نطاق واسع، فهذه الأدوات تكافئ الأشخاص الذين يستخدمونها فعليًا. ابدأ بصورة واحدة وشاهد ما يحدث.

امرأة تمسك هاتفًا ذكيًا في غرفة مظلمة، والشاشة تضيء وجهها أثناء مشاهدتها فيديو لجبل

شارك هذا المقال

اختر لغتك

مقالات ذات صلة