أن تأخذ صورة فوتوغرافية واحدة وتراها تتنفس وتتحرك وتدبّ فيها الحياة في مقطع فيديو لم يعد مؤثرًا خاصًا محجوزًا لاستوديوهات هوليوود. HunyuanVideo 2.0، أحدث نموذج لتحريك الصور من Tencent، يتيح هذه القدرة مباشرةً في متصفحك أو هاتفك أو حاسوبك، ويفعل ذلك بمستوى من الاتساق الزمني والواقعية البصرية يختلف فعلًا عن المحاولات السابقة لهذه التقنية.

الأمر هنا لا يتعلق بإنشاء رسوم كرتونية أو تحريكات بأسلوب مُصمَّم. يقرأ HunyuanVideo 2.0 المعلومات المكانية المضمّنة في الصورة الفوتوغرافية، ويستنتج كيف ستتحرك الإضاءة والمنظور والأشخاص على نحو واقعي، ثم يولّد إطارات فيديو تمتد من تلك اللحظة المجمّدة بطريقة تبدو معقولة من الناحية الفيزيائية. يدير الشخص في البورتريه رأسه، وتبدأ أمواج المحيط بالتكسّر، وتلتقط واجهة المدينة ظلال غيمة عابرة. تتحول اللحظة المجمّدة إلى مشهد حيّ.
ماذا يفعل HunyuanVideo 2.0 فعلًا
قبل الدخول في الكيفية، من المفيد أن نفهم ما الذي يميّز هذا النموذج عن الجيل السابق من أدوات تحويل الصورة إلى فيديو.
يقرأ إمكانات الحركة لا البكسلات فقط
عاملت معظم نماذج تحريك الصور الأولى الصورة الفوتوغرافية المدخلة كمادة قابلة للتشويه. طبّقت خوارزميات التدفق البصري لمحاكاة الحركة، فنتج عن ذلك "تأثير الجيلي" الشهير، حيث تبدو الأجسام كأنها تذوب أو تتمدد بشكل غير طبيعي عبر الإطارات. يعمل HunyuanVideo 2.0 بطريقة مختلفة. فهو يعتمد على عمود فقري لتوليد الفيديو قائم على الانتشار، يتعامل مع الصورة المصدر كأول إطار في مقطع فيديو متماسك، ثم يولّد الإطارات اللاحقة من خلال فهم متعلَّم لكيفية تصرّف الفيزياء الواقعية والتشريح والبيئة عبر الزمن.
والنتيجة أن صورة شخص لا تُشوَّه ببساطة بانزياح ملمس بشرته. يتحرك الشعر وفق طريقة حركته الفعلية تحت تأثير الجاذبية ومقاومة الهواء. تتحرك طيّات القماش بما يتناسب مع وزن المادة. وتستجيب عناصر الخلفية مثل الأشجار أو الماء للرياح والجاذبية المفترضة، بدلًا من أن تُمدّ أو تُمسح عبر الإطار.

القفزة من الإصدار 1.0 إلى 2.0
كان HunyuanVideo الأصلي لافتًا بالفعل بجودة تحويل النص إلى فيديو، إذ أنتج بعضًا من أكثر الحركات سلاسةً التي شوهدت في نماذج الفيديو مفتوحة المصدر وقت إطلاقه. وسّع الإصدار 2.0 هذه القدرة بإضافة تكييف مخصص للصورة، أي أصبح بالإمكان تثبيت التوليد على إطار أول محدد. وهذه هي الميزة التي تجعل سير عمل تحويل الصورة إلى فيديو عمليًا فعلًا، لأنها تضمن أن يبدو الفيديو الناتج كالصورة المدخلة تمامًا، لا أن يستخدمها كمصدر إلهام فضفاض.
كما حسّن الإصدار 2.0 اتساق الهوية طوال مدة المقطع كاملةً. فقد كانت الإصدارات السابقة تُظهر أحيانًا الأشخاص وهم ينحرفون أو يتحولون بعيدًا عن الصورة الأصلية بعد الثانية الأولى أو الثانية، أما البنية المحدّثة فتحافظ على الهوية ودقة الألوان وتكوين المشهد بموثوقية أكبر بكثير عبر نافذة التوليد كلها. ويظهر ذلك بوضوح خاص مع البورتريهات، حيث تكون ملامح الوجه أكثر التفاصيل حساسيةً للحفاظ عليها.
كيف تبدو التوقعات الواقعية فعلًا
HunyuanVideo 2.0 ليس زرًا سحريًا. يولّد النموذج استمرارات معقولة لحظة مجمّدة، لكنه ما زال مقيّدًا بما هو معقول فيزيائيًا. لن يضيف أجسامًا لم تكن في الإطار الأصلي، ولا يستطيع إحداث تغييرات درامية في المشهد، أو القطع إلى زاوية جديدة، أو تغيير وقت اليوم. وما يُحسن فعله بتميّز هو تحريك المشهد القائم بطريقة تبدو طبيعية ومقنعة.
النقطة المثالية لهذا النموذج هي الصور التي تتضمن شخصًا واضحًا، وتكوينًا قويًا، وقدرًا من إمكانات الحركة الضمنية. شخص في منتصف ضحكة، أو موجة على وشك التكسّر، أو راكب دراجة في زاوية، أو منتج تتساقط عليه قطرات ماء. هذه العناصر تحمل بالفعل طاقة حركية يستطيع النموذج متابعتها بإقناع.
لماذا غيّر تحويل الصور إلى فيديو بالذكاء الاصطناعي كل شيء
ظلت الصورة الفوتوغرافية الوسيط المهيمن للمحتوى البصري الشخصي والتجاري منذ أكثر من 150 عامًا. فكل ألبوم زفاف، وكل أرشيف عائلي، وكل كتالوج منتجات، وكل إعلان عقاري مبني على صور ثابتة. وكان القيد العملي دائمًا أن الصور الثابتة ساكنة، والمحتوى الساكن يخسر معركة الانتباه.

الصور الثابتة كانت تواجه مشكلة
تميل منصات التواصل الاجتماعي بشكل متزايد إلى تفضيل المحتوى المصوّر في خوارزمياتها. فالمنشور الذي يحتوي على فيديو يحصد وصولًا أكبر بكثير من المنشور نفسه بصورة فوتوغرافية على معظم المنصات الكبرى. لكن إنتاج الفيديو يتطلب معدات ووقتًا ومهارات مونتاج، وغالبًا زيارة ثانية إلى الموقع. وبالنسبة لمعظم الأفراد والشركات الصغيرة، ظل إنتاج محتوى فيديو من كل صورة يملكونها بعيدًا عن متناولهم.
يسدّ تحويل الصور إلى فيديو بالذكاء الاصطناعي هذه الفجوة تمامًا. تصبح كل صورة في أرشيفك الحالي مقطع فيديو محتملًا دون إعادة تصوير أي شيء. تتحول لقطات منتجاتك إلى محتوى قابل للتمرير. وتصبح صور سفرك لحظات سينمائية. وتتحول بورتريهاتك إلى أصول شخصية متحركة. وتتحول واجهات عقاراتك إلى عقارات تنبض بالحياة بضوء متحرك وتفاصيل بيئية.
ما الذي بنته Tencent
بنى فريق الأبحاث في الذكاء الاصطناعي لدى Tencent نموذج HunyuanVideo على بنية انتشار قائمة على المحوّلات (transformers)، ودُرّب على مجموعة بيانات ضخمة من مقاطع فيديو مقرونة بإطاراتها الأولى المقابلة. أتاح هذا الأسلوب في التدريب للنموذج أن يتعلم العلاقة الإحصائية بين مشهد ثابت والنطاق المعقول للحركات التي يمكن أن تليه. وعندما تُدخل صورة فوتوغرافية، يستعين النموذج بهذه الأنماط المتعلَّمة لتوليد حركة معقولة فيزيائيًا ومتماسكة جماليًا.
يتميز النموذج بقوة خاصة في التعامل مع منطقة الانتقال بين الشخص في المقدمة والخلفية، وهي مشكلة كانت من أصعب المشكلات تاريخيًا في توليد تحويل الصورة إلى فيديو. عندما يتحرك الشخص، يجب أن تستجيب الخلفية خلفه بتناسق، فتكشف محتوى جديدًا للخلفية كان مخفيًا بالشخص في الإطار الأصلي. يتعامل HunyuanVideo 2.0 مع ذلك بكفاءة لم تستطع النماذج السابقة مجاراتها.
جعل إصدار HunyuanVideo مفتوح الأوزان منه واحدًا من أكثر نماذج تحريك الصور عالية الجودة سهولةً في الوصول، ويعني دمجه في منصات مثل PicassoIA أنك لا تحتاج إلى GPU محلي قوي لاستخدامه. يعمل الحساب على الخوادم، وتحصل على النتيجة في متصفحك.
كيف يقارن HunyuanVideo 2.0 بالنماذج الأخرى
HunyuanVideo 2.0 ممتاز، لكنه ليس الخيار القوي الوحيد لتحويل الصورة إلى فيديو المتاح حاليًا. ومعرفة مواطن تفوقه ومواطن تفوق البدائل ستساعدك على اختيار الأداة المناسبة لكل مشروع.

المفاضلة بين السرعة والجودة
تتجه السرعة والجودة في اتجاهين متعاكسين في جميع نماذج تحويل الصورة إلى فيديو الحالية. فالمخرجات عالية الجودة تحتاج إلى خطوات انتشار أكثر، ما يعني أوقات توليد أطول. أما النماذج الأسرع فتستخدم خطوات أقل أو بنى مقطّرة (distilled) تضحي ببعض التفاصيل مقابل السرعة.
يقع HunyuanVideo 2.0 في فئة الجودة العالية وسرعة متوسطة. إنه ليس الخيار الأسرع، لكنه في تحريك البورتريهات ومشاهد الطبيعة ولقطات المنتجات ينتج بعضًا من أكثر النتائج طبيعيةً المتاحة حاليًا في أي فئة سرعة.
أفضل البدائل الآن
💡 في تصوير البورتريه تحديدًا، ينتج HunyuanVideo 2.0 وKling v2.1 باستمرار أكثر التحريكات طبيعيةً للوجه مع الحفاظ على هوية ثابتة عبر الإطارات.
كيفية استخدام HunyuanVideo على PicassoIA
تستضيف PicassoIA نموذج HunyuanVideo إلى جانب أكثر من 80 نموذجًا آخر لتوليد الفيديو، ما يعني أنه يمكنك تشغيل النموذج في متصفحك دون أي تثبيت محلي أو عتاد GPU مخصص.

خطوة بخطوة لتحويل الصورة إلى فيديو
الخطوة 1: جهّز الصورة المصدر
يعمل النموذج بأفضل شكل مع الصور الفوتوغرافية التي تتضمن أشخاصًا واضحين وتكوينًا قويًا. ينبغي أن يكون الوجه في البورتريهات واضح التركيز. تعمل صور المناظر الطبيعية بأفضل شكل عندما يكون الأفق مستويًا ويملأ الموضوع الرئيسي معظم الإطار. تجنّب الصور التي تحتوي على تشوهات ضغط رقمي واضحة، أو حبيبات كثيفة ناتجة عن إعدادات ISO عالية، أو ضبابية حركة شديدة في الأصل. تمنح الصورة النظيفة جيدة التعريض النموذج أكبر قدر من المادة للعمل عليه.
الخطوة 2: افتح HunyuanVideo على PicassoIA
انتقل إلى صفحة نموذج HunyuanVideo على PicassoIA. سترى حقل رفع الصورة وحقل إدخال الأمر النصي. ارفع صورتك الفوتوغرافية مباشرة من جهازك. يقبل النموذج صيغتي JPEG وPNG القياسيتين.
الخطوة 3: اكتب أمر الحركة النصي
تمنح الصورة المرفوعة التوليد أساسه البصري، لكن الأمر النصي هو ما يوجّه الحركة. لا تصف ما هو موجود بالفعل في الصورة. بدلًا من ذلك، صف ما ينبغي أن يحدث أثناء الفيديو. فعبارة "نسمة هواء لطيفة تمر بين الشعر، وتتحرك الخلفية الضبابية ببطء، وإمالة رأس طبيعية وخفيفة نحو اليمين" تمنح النموذج تعليمات حركة محددة دون أن تتعارض مع المحتوى البصري للصورة.
الخطوة 4: اضبط إعدادات التوليد
بالنسبة لمعظم الصور الفوتوغرافية، تعطي إعدادات المدة والدقة الافتراضية نتائج قوية من المحاولة الأولى. وإذا احتجت إلى مخرجات بجودة أعلى ويمكنك الانتظار أطول، فإن زيادة عدد خطوات تشغيل النموذج حيثما توفر ذلك كخيار ستحسّن الاتساق الزمني على حساب وقت التوليد. ابدأ بالإعدادات الافتراضية ولا تعدّلها إلا إذا أظهر المخرج الأول مشكلات واضحة في الاتساق.
الخطوة 5: راجع وكرّر
ينطوي توليد الفيديو بالذكاء الاصطناعي على اختلاف ملحوظ بين عملية تشغيل وأخرى. قد لا يكون الناتج الأول مطابقًا تمامًا لما أردته. فإجراء تعديلات طفيفة على الأمر النصي الخاص بالحركة، أو مجرد ضبط قيمة بذرة عشوائية مختلفة، سيعطي نتائج مختلفة بوضوح انطلاقًا من الصورة المصدر نفسها. اعتبر التوليد الأول مسودة، وكرّر المحاولة انطلاقًا منه.
كتابة أوامر نصية تعمل
أكبر خطأ في تحويل الصورة إلى فيديو بالذكاء الاصطناعي هو كتابة أوامر نصية تصف المحتوى البصري الموجود بالفعل في الصورة بدلًا من توجيه الحركة. إليك الفرق العملي:
أمر ضعيف: "امرأة بشعر بني طويل تقف في حقل من الزهور"
هذا يصف ما يستطيع النموذج رؤيته بالفعل. لا يعطي أي توجيه للحركة ولا أي معلومات مفيدة.
أمر جيد: "يتحرك الشعر برفق بفعل نسيم دافئ بطيء، ينتقل الشخص بثقله قليلًا نحو اليمين، تتمايل أزهار البرية في المقدمة، تنجرف الغيوم ببطء من اليسار إلى اليمين في الخلفية، والكاميرا ثابتة"
يخبر هذا النموذج بما ينبغي أن يتغير مع الزمن، وأي العناصر ينبغي أن تتحرك، وكيف ينبغي أن يبدو المشهد أثناء الحركة.
💡 الأفعال القصيرة والمحددة للحركة تتفوق على الأوصاف الطويلة في كل مرة. كلمات مثل "تنجرف" و"تتموج" و"تستدير" و"تتمايل" و"ترتفع" و"تلتفت" و"تميل" و"تستقر" تمنح النموذج أفعالًا فيزيائية واضحة يولّدها عبر الإطارات.
5 أنواع من الصور تنجح أفضل
لا تستجيب كل الصور الفوتوغرافية بالقدر نفسه لتوليد تحويل الصورة إلى فيديو. تنتج هذه الفئات الخمس نتائج قوية باستمرار مع HunyuanVideo 2.0 والبدائل المتاحة على PicassoIA.
لقطات البورتريه
البورتريهات هي أقوى حالة استخدام لتحريك الصور الفوتوغرافية إلى فيديو. تمنح صورة شخصية جيدة الإضاءة بخلفية نظيفة أو ضبابية بنعومة النموذج شخصًا معزولًا ببنية تشريحية واضحة. يتقن النموذج توليد تعبيرات دقيقة وواقعية للوجه، وحركة طبيعية للشعر، وانزياح القماش، وإعادة تموضع خفيفة للرأس. استخدم أمرًا نصيًا يحدد الاتجاه والطاقة: "إدارة بطيئة للرأس نحو اليسار، وتظهر ابتسامة خفيفة، ويسقط الشعر بشكل طبيعي على الكتف، ويُرى التنفس بوضوح."

المناظر الطبيعية والطبيعة
تحمل البيئات الطبيعية إمكانات حركة مدمجة: يجري الماء، وتتحرك الأشجار، وتنجرف الغيوم، ويتحرك الضوء عبر التضاريس. ستتحرك صورة طبيعية بأفق مثير وعمق تكويني قوي بإقناع. جرّب Wan 2.7 I2V تحديدًا لتحريك المناظر الطبيعية. يتعامل مع الحركة البيئية، بما في ذلك الماء المتدفق والنباتات المتجاوبة، بدرجة عالية جدًا من الاتساق الزمني عبر المقطع المولّد.
ينبغي أن تركز أوامر الحركة للمناظر الطبيعية على الفيزياء البيئية: "تتكسر الأمواج وتنحسر، ويمتد الزبد الأبيض على الرمال الداكنة ثم يتراجع، ويطفو نورس ببطء من اليمين إلى اليسار عبر السماء العليا."
تصوير المنتجات والتصوير التجاري
يُعد تصوير المنتجات من أعلى الاستخدامات قيمةً لتحويل الصور إلى فيديو بالنسبة للشركات. يمكن أن تتحول لقطة منتج ثابتة إلى عرض دوّار، أو عرض لسكب سائل، أو مشهد نمط حياة يُظهر المنتج في لحظة استخدام.

في تصوير المنتجات، أبقِ الحركة محدودة ومدروسة. تجنّب الأوامر التي تطلب حركات كاميرا درامية أو تغييرات واسعة في المشهد. وبدلًا من ذلك، جرّب: "زجاجة العطر تلتقط وهجًا بطيئًا من ضوء دافئ ينجرف من اليسار إلى اليمين، وتستقر قطرات السائل على سطح الزجاج، وتزداد حدة الملصق وضوحًا قليلًا."
يستحق P Video Animate على PicassoIA التجربة بشكل خاص مع محتوى المنتجات. فهو سريع، ويتعامل جيدًا مع تفاصيل الأشياء الدقيقة، وينتج مخرجات نظيفة تناسب الاستخدام التجاري دون تنميق مبالغ فيه.
الصور المعمارية
تقدم العمارة فرصًا قوية لتحويل الصور إلى فيديو. يمكن توليد حركة الغيوم، وتغيّر الضوء، والحركة الطبيعية للناس والمركبات داخل المشهد بإقناع من لقطة خارجية أو داخلية ثابتة.

تعطي اللقطات المعمارية بزاوية عريضة أكثر النتائج إرضاءً، لأن فيها محتوى مشهد محيطيًا أكبر يستطيع النموذج تحريكه. جرّب: "تنجرف الغيوم ببطء عبر الجزء العلوي من الإطار، وينساب ضوء ما بعد الظهيرة الماثل على الواجهة الخرسانية، وتتحرك خطوط الظلال تدريجيًا مع حركة الشمس."
تصوير الشارع
تصوير الشارع توثيقي بطبيعته، ويمكن لتحريك الصور إلى فيديو أن يعيد إلى هذه اللحظات المجمّدة إحساسًا بالزمن والحركة. يستطيع النموذج أن يستمر بإقناع في الحركة الضمنية الموجودة أصلًا في مشهد شارع ثابت.

تستجيب مشاهد الشوارع التي تضم أشخاصًا في منتصف الحركة، أو بائعين أثناء العمل، أو نشاطًا سوقيًا حيويًا، بشكل خاص للتحريك. جرّب Kling v3 Video لتحريك الشوارع بطابع سينمائي، لأنه يتعامل مع المشاهد متعددة الأشخاص بتماسك زمني قوي عبر أنواع متعددة من الأشخاص.
أخطاء شائعة وكيفية تجنّبها
جودة الإدخال الرديئة تضر بكل مخرج
تضعف تشوهات ضغط JPEG، والضوضاء الكثيفة الناتجة عن إعدادات ISO عالية، وضبابية الحركة في الصورة الأصلية قدرةَ النموذج على قراءة المشهد بدقة وتوليد حركة متسقة منه. والقاعدة بسيطة: سقف جودة المخرج يحدده مستوى جودة المدخل. إذا كنت ترفع صورة فوتوغرافية خصيصًا لتحريكها، فاختر أعلى نسخة متاحة. استخدم الملف الأصلي غير المضغوط أو المضغوط بخفة بدلًا من نسخة من وسائل التواصل الاجتماعي أو لقطة شاشة.
إذا كانت صورتك ناقصة التعريض أو مشوشة أو متضررة بأي شكل آخر، فكّر في تمريرها عبر أداة رفع دقة أو استعادة أولًا. يمكن لـنماذج رفع الدقة والتحسين المتاحة على PicassoIA أن ترفع دقة الصورة وتزيل الضوضاء قبل دخولها إلى سير عمل توليد الفيديو، وغالبًا ما تنتج النسخة المنقّاة نتائج تحريك أفضل بشكل ملحوظ.
تعارض الأمر النصي مع الصورة
يتخذ النموذج الصورة مرساةً قوية للإطار الأول، لكن الأمر النصي الذي يحاول تغيير الكثير عن المصدر سيُنتج مخرجًا مربكًا أو غير متماسك. إذا كانت صورتك تُظهر شخصًا ينظر إلى اليسار، وكان أمرك النصي "يدير الشخص وجهه كليًا نحو الكاميرا"، فسيضطر النموذج إلى التوفيق بين تعارض هندسي كبير. وينتج عن ذلك عادةً تشوهات في الشكل، أو انزياح في الهوية، أو انقطاع بصري مفاجئ في منتصف المقطع المولّد.
التزم بالنطاق الفيزيائي المعقول الذي توحي به الصورة. إذا كان الشخص في منظر جانبي، فحرّك الصورة بما يتسق مع كونه في منظر جانبي. وإذا كان المشهد نهارًا بإضاءة طبيعية، فلا تطلب تغييرات درامية في إضاءة الليل أو إضاءة صناعية دافئة بشكل مصطنع. اعمل مع الصورة لا ضدها.
💡 فكّر في الأمر هكذا: النموذج يكمل قصة بدأت بالفعل. أمرك النصي هو الجملة التالية، لا إعادة كتابة للفصل.
ابدأ بإنشاء تحريكات الصور الخاصة بك
الأدوات متاحة، والجودة موجودة، وسير العمل بسيط بما يكفي لتنتقل من صورة فوتوغرافية إلى مقطع فيديو جاهز خلال دقائق. كل صورة التقطتها حتى الآن أصبحت مادة مصدر محتملة لمحتوى فيديو عبر منصات التواصل الاجتماعي والقنوات التجارية والمشاريع الشخصية.
تمنحك PicassoIA وصولًا مباشرًا إلى HunyuanVideo، وP Video Animate، وWan 2.7 I2V، وKling v2.1، وSeedance 2.0، وGen4 Turbo، وHailuo 2.3، وأكثر من 80 نموذجًا آخر لتوليد الفيديو، وكلها متاحة في المتصفح دون أي متطلبات عتاد محلي أو تثبيت برامج.
ابدأ ببورتريه. ارفع صورة فوتوغرافية لديك بالفعل، واكتب أمرًا نصيًا بسيطًا للحركة يركّز على ما ينبغي أن يتحرك لا على ما هو موجود في الإطار، ثم شغّل التوليد. بعد ذلك جرّب منظرًا طبيعيًا، ثم لقطة منتج. كل صورة تعلّمك شيئًا مختلفًا عن طريقة قراءة هذه النماذج للمحتوى البصري وتحريكه، وينضبط أسلوب الأمر النصي الفعّال بسرعة بعد عدد قليل من المحاولات.
قد تكون أفضل صورة في أرشيفك هي أفضل فيديو مستقبلي لديك بالفعل.