أطلقت Tencent شيئًا مهمًا في أواخر عام 2024، ولم تكن صامتة بشأنه. وصل Hunyuan Video كنموذج تحويل نص إلى فيديو مفتوح المصدر بالكامل، يضم 13 مليار معامل، وقادر على توليد مقاطع فيديو سينمائية عالية الحركة، تضاهي ما كانت معظم واجهات API التجارية المغلقة تفرضه من أسعار مرتفعة للوصول إليها. في مجال توليد الفيديو بالذكاء الاصطناعي، كان ذلك إعلانًا واضحًا: رُفع المستوى، وأصبح متاحًا للجميع.
ما هو Hunyuan Video فعليًا

Hunyuan Video نموذج واسع النطاق لتوليد الفيديو، طوّره قسم أبحاث الذكاء الاصطناعي في Tencent. يضم 13 مليار معامل، ما يضعه في الصف الأول من نماذج الفيديو المفتوحة المصدر من حيث الحجم. يقبل النموذج أمرًا نصيًا كمدخل، وينتج مقاطع فيديو ليست متماسكة بصريًا فحسب، بل قابلة للتصديق من الناحية الفيزيائية، بحركة واقعية، وإضاءة متسقة، وسلوك دقيق للأجسام عبر الإطارات.
ما يميّزه عن كثير من البدائل المفتوحة المصدر السابقة هو سقف الجودة. قبل Hunyuan Video، كانت الفجوة بين توليد الفيديو المفتوح المصدر والعروض التجارية مثل Sora أو Runway واضحة وكبيرة. وقد قلّص Hunyuan هذه الفجوة بشكل ملموس.
الإصدار الذي فاجأ الجميع
أغلب الإصدارات الكبرى لفيديوهات الذكاء الاصطناعي في 2024 جاءت من شركات ناشئة أو مختبرات أبحاث ذات حضور عام واضح. أما إصدار Tencent فكان مختلفًا. نشرت الشركة أوزان النموذج، والورقة التقنية، وكود التشغيل في الوقت نفسه، ما منح المطورين وصولًا فوريًا ومباشرًا. لا قوائم انتظار، ولا حاجة إلى مفاتيح API لتجربته.
لم يكن التوقيت عشوائيًا. كان فريق Tencent للذكاء الاصطناعي يعمل على هذا منذ أكثر من عامين، ويطوّر بنية توليد الصور لديه قبل أن يوسّع البنية نفسها إلى الفيديو. والنتيجة نموذج بدا ناضجًا لا تجريبيًا.
الانفتاح في عالم مغلق

إصدار Hunyuan Video مفتوح المصدر له أهمية عملية حقيقية. يستطيع الباحثون دراسة البنية دون قيود. ويستطيع المطورون تشغيله محليًا على أجهزة كافية. ويستطيع مزوّدو المنصات دمجه مباشرة. وقد أفرز هذا الانفتاح بالفعل موجة من الإصدارات المضبوطة بدقة، مستهدفةً أساليب بصرية محددة، وأنواعًا معينة من الحركة، ومجالات متخصصة مثل تحريك المنتجات وفيديو البورتريه.
وعلى نطاق المنظومة الأوسع، يشير ذلك إلى أن Tencent تنوي المنافسة على الجودة وسهولة الوصول معًا، لا خلف جدار مدفوع.
كيف تعمل البنية

يعكس التصميم التقني لنموذج Hunyuan Video خيارات مقصودة تفسّر جزءًا كبيرًا من ميزته في الجودة. فهم المكونات الأساسية يوضح لماذا تعمل أنواع معينة من الأوامر النصية بشكل أفضل، وكيف تحصل على أقصى استفادة من النموذج.
محوّل الانتشار في قلب النموذج
يستخدم Hunyuan Video بنية Diffusion Transformer (DiT) بدلًا من التصميم القائم على UNet الذي سيطر على نماذج توليد الفيديو الأولى. تتعامل نماذج DiT مع توليد الفيديو كمشكلة نمذجة تسلسلية، إذ تطبّق آليات انتباه المحوّلات على البُعدين المكاني والزمني معًا في الوقت نفسه.
وهذا مهم عمليًا. تعالج بنى UNet المعلومات المكانية جيدًا، لكنها تواجه صعوبة في الحفاظ على علاقات زمنية متسقة في المقاطع الأطول. يتيح نهج DiT القائم على الانتباه للنموذج أن يأخذ في الاعتبار تسلسل الإطارات كاملًا معًا خلال عملية إزالة الضوضاء، فينتج حركة أكثر تماسكًا عبر مدة المقطع كلها.
💡 يعالج العمود الفقري من نوع المحوّل رقعًا من الفيديو بشكل مشترك عبر المكان والزمن، بدلًا من معالجة كل إطار على حدة. هذا القرار المعماري الواحد يفسّر معظم تفوق Hunyuan Video في جودة الحركة مقارنة بالنماذج المفتوحة المصدر الأقدم.
مطابقة التدفق بدلًا من جدولة الضوضاء

بدلًا من جدولة الضوضاء القياسية من نوع DDPM المستخدمة في معظم نماذج الانتشار، يستخدم Hunyuan Video مطابقة التدفق المصحَّح (rectified flow matching) كهدف للتدريب. والنتيجة العملية مسارات إزالة ضوضاء أنظف أثناء التشغيل. يميل التوليد إلى الكفاءة أكثر، إذ يحتاج إلى خطوات أقل لجودة مماثلة، وتُظهر المخرجات تفاصيل دقيقة أكثر حدة في كل أجزائها.
أصبحت مطابقة التدفق نهج التدريب السائد في نماذج الفيديو الجيلية الجديدة. وهي الخيار الأساسي نفسه الذي اعتمدته نماذج أحدث مثل Wan 2.7 T2V وLTX 2 Pro. وحين اختارت Tencent مطابقة التدفق لـHunyuan Video، كانت تسير في الاتجاه الذي يتجه إليه المجال.
VAE ثلاثي الأبعاد يفهم الزمن
يستخدم النموذج Variational Autoencoder (VAE) سببيًا ثلاثي الأبعاد لترميز الفيديو وفكّ ترميزه. تقوم VAE الخاصة بالصور القياسية بضغط المعلومات المكانية ثنائية الأبعاد. أما VAE السببي ثلاثي الأبعاد فيوسّع ذلك ليضغط المعلومات الزمنية أيضًا، أي أن التمثيل الكامن يلتقط الحركة والتغيّر عبر الزمن، لا المظهر الثابت فقط.
تضمن خاصية "السببية" أن ترميز كل إطار لا يستخدم إلا المعلومات من الإطارات الحالية والسابقة، لا المستقبلية أبدًا. وهذا يحافظ على الاتساق الزمني باحترام الاتجاه الطبيعي للزمن في الفضاء الكامن المتعلَّم، ويفتح إمكانات لتطبيقات البث حيث لا تكون الإطارات المستقبلية متاحة وقت الترميز.
ما الذي يستطيع فعله فعليًا

المواصفات أقل أهمية من المخرجات الفعلية، لكنها تضبط التوقعات بشكل صحيح.. فيما يلي ما ينتجه Hunyuan Video بالإعدادات القياسية:
مواصفات الدقة والمدة
| المعامل | القيمة |
|---|
| الدقة الافتراضية | 720p (1280x720) |
| الحد الأقصى المدعوم | 1080p مع التحسين |
| مدة المقطع | 5 ثوانٍ (افتراضيًا) |
| نسب العرض إلى الارتفاع | 16:9، 9:16، 1:1 |
| معدل الإطارات | 24fps |
| عدد المعاملات | 13 مليار |
دقة 720p الافتراضية توازن عمليًا. تشغيل 13 مليار معامل بدقة 1080p يحتاج ذاكرة VRAM كبيرة. على وحدة A100 واحدة بسعة 80GB، يستغرق توليد مقطع بدقة 720p مدته 5 ثوانٍ نحو 4 إلى 8 دقائق، حسب عدد خطوات التشغيل وتهيئة العتاد.
جودة الحركة والاتساق الزمني

هنا يتميز Hunyuan Video فعلًا. يشير الاتساق الزمني إلى مدى ثبات الأجسام والإضاءة والعلاقات المكانية عبر جميع إطارات المقطع. كثير من النماذج المفتوحة المصدر السابقة تنتج مقاطع تتغير فيها مظاهر الأشخاص بشكل خفي بين الإطارات، أو تقفز فيها الإضاءة بطريقة غير طبيعية، أو تنجرف فيها الخلفيات من إطار إلى آخر.
يتعامل Hunyuan Video مع هذه الأعطال بأفضلية واضحة على معظم نظرائه المفتوحة المصدر. تبقى الوجوه ثابتة. وتبدو حركة الكاميرا، حين يوحي بها الأمر النصي، متعمّدة وسلسة. أما الحركات المعقدة مثل الماء والقماش والشعر فتتصرف وفق قواعد قابلة للتصديق من الناحية الفيزيائية، بدلًا من الوميض بين حالات مختلفة.
💡 لأفضل نتائج في الاتساق الزمني، صِف حركة الكاميرا صراحةً في أمرك النصي. عبارات مثل "دفعة بطيئة للأمام (dolly push)" أو "لقطة عريضة ثابتة" أو "تتبّع يدوي لطيف" تمنح النموذج توجيهات حركة قوية يرتكز عليها التوليد.
كيف يقف أمام المنافسة

المشهد في توليد فيديو الذكاء الاصطناعي مزدحم في 2027. يتنافس Hunyuan Video مع Sora وKling وRunway وWan Video وعشرات الخيارات الأخرى. إليك مقارنة صريحة لمكانه الحالي:
Hunyuan Video مقابل نماذج تحويل النص إلى فيديو الأخرى
المقايضة الأساسية لـHunyuan Video تقع بين سهولة الوصول والجودة. فبوصفه إصدارًا بأوزان مباشرة، يتطلب تشغيله محليًا عتادًا قويًا. لكن عبر المنصات التي دمجته، تصبح ميزة الجودة متاحة دون متطلبات العتاد تلك.
وما يتفوق فيه Hunyuan Video هو الواقعية الفيزيائية والالتزام بالأمر النصي. يميل إلى تفسير الأوامر النصية المعقدة والدقيقة بحرفية أكبر من النماذج الأخف. فإذا كتبت وصفًا تفصيليًا لمشهد بظروف إضاءة محددة وزوايا كاميرا وسلوكيات للشخص، فمن المرجح أن يحاول Hunyuan Video تنفيذها كلها، بدلًا من التوسط نحو تفسير عام.
أما ما يتخلّف فيه عن الخيارات التجارية فقط فهو سرعة التوليد وأقصى دقة. نماذج مثل Kling v3 أو Veo 3.1 تولّد النتائج أسرع، وتدعم مقاطع أطول بشكل أصلي.
الخلاصة: إذا كانت أولوياتك الوصول المفتوح المصدر، وإمكانات الضبط الدقيق، والواقعية الفيزيائية، فإن Hunyuan Video هو الخيار الأقوى في فئته. وإذا كانت السرعة وسهولة الاستخدام أهم، فالبدائل التجارية منافسة بالفعل.
كيفية استخدام Hunyuan Video على PicassoIA

أسهل طريقة لتوليد الفيديوهات باستخدام Hunyuan Video دون إعداد عتاد محلي هي عبر منصة PicassoIA. النموذج مدمج فيها مباشرة، ما يلغي إعداد GPU وإدارة الاعتماديات التي يتطلبها تشغيل الأوزان محليًا.
خطوة بخطوة على المنصة
الخطوة 1. افتح صفحة نموذج Hunyuan Video على PicassoIA.
الخطوة 2. اكتب أمرك النصي. كن محددًا بشأن الشخص، والبيئة، والإضاءة، والحركة. الأوامر الغامضة تنتج نتائج عامة.
الخطوة 3. اختر نسبة العرض إلى الارتفاع. استخدم 16:9 للمشاهد الأفقية، و9:16 للصور العمودية أو محتوى السوشيال ميديا، و1:1 للتنسيقات المربعة.
الخطوة 4. حدّد عدد خطوات التشغيل. عدد أكبر من الخطوات (40 إلى 50) يعطي جودة أعلى على حساب وقت التوليد. وعدد أقل (20 إلى 25) أسرع لكنه يفقد التفاصيل الدقيقة.
الخطوة 5. أرسل الطلب وانتظر حتى يُصيَّر مقطعك. يختلف وقت التوليد حسب حمل الطابور والإعدادات التي اخترتها.
الخطوة 6. راجع المخرجات. إذا بدت الحركة جامدة، فأضف لغة حركة أكثر تحديدًا إلى أمرك النصي. وإذا انجرف الشخص، فأضف "photorealistic, temporally consistent" في نهاية الأمر النصي.
نصائح عملية للأوامر النصية
💡 بنية موثوقة للأمر النصي: [الشخص] [الفعل] في [البيئة]، [وصف الإضاءة]، [زاوية الكاميرا وحركتها]، cinematic, photorealistic, 8K.
هناك أنماط محددة تحسّن مخرجات Hunyuan Video بثبات:
- صِف اتجاه الإضاءة صراحةً: "ضوء صباحي من اليسار"، "شمس ذهبية من الأعلى"، "ضوء غائم ناعم ومنتشر"
- سمِّ سلوك الكاميرا: "دفعة بطيئة للأمام"، "لقطة عريضة ثابتة"، "تتبّع يدوي لطيف"
- ثبّت الشخص: أدرج موضع الشخص واتجاهه لتقليل الانجراف الزمني عبر الإطارات
- استخدم جملًا وصفية: يتعامل Hunyuan Video مع أوصاف المشاهد الكاملة بشكل أفضل من قوائم الكلمات المفتاحية المجردة
- حدّد سلوك المواد: اذكر ما إذا كان القماش يجب أن يتدفق، أو الماء أن يتموج، أو الشعر أن يتحرك مع الريح
هذه التفاصيل لا تكلّف شيئًا لإضافتها إلى الأمر النصي، وهي ترفع بشكل ملموس الحد الأدنى لجودة ما ينتجه Hunyuan Video.
أي حالات الاستخدام تناسبه أكثر

ليس Hunyuan Video مناسبًا بالقدر نفسه لكل مهام توليد الفيديو. بعض حالات الاستخدام تلعب مباشرة على نقاط قوته.
صُنّاع المحتوى وصانعو الأفلام
بالنسبة للمبدعين الذين يحتاجون إلى لقطات واقعية فيزيائيًا، يعد Hunyuan Video حاليًا من أفضل الخيارات المفتوحة المصدر المتاحة. يستفيد محتوى نمط الحياة، ومشاهد الطبيعة، وتصور العمارة، ولقطات سياق المنتجات جميعها من محاكاته الفيزيائية القوية للضوء والحركة وسلوك المواد.
يتفوق بشكل خاص في المشاهد التي تتطلب حضورًا ثابتًا للشخص. فلقطة منتج يبقى فيها المنتج وبيئته مستقرين طوال مدة المقطع هي بالضبط الحالة التي تظهر فيها ميزة الاتساق الزمني لدى Hunyuan بوضوح أكبر.
بالنسبة لصُنّاع محتوى السوشيال ميديا، يجعل دعم نسبة 9:16 استخدامه مباشرة في الفيديو العمودي القصير دون قص أو إعادة تأطير، وهو سير عمل أعطته منصات مثل Seedance 2.0 وPixverse v5.6 الأولوية أيضًا.
الباحثون والمطورون
تمنح الأوزان المفتوحة نموذج Hunyuan Video قيمةً فريدة في الضبط الدقيق والتكيّف مع المجالات. وقد أنتج مجتمع الباحثين بالفعل إصدارات مُعدّلة بالضبط الدقيق تستهدف جماليات بصرية محددة، وأنماطًا للرسوم المتحركة، ومجالات محتوى متخصصة. يتيح تشغيل النموذج الأساسي محليًا للباحثين البناء عليه بطرق لا تستطيع واجهات API المغلقة دعمها من الأساس.
يستفيد المطورون الذين يدمجون الفيديو القائم على الذكاء الاصطناعي في التطبيقات من إمكانية الاستضافة الذاتية، إذ يتجنبون تكاليف API عن كل عملية توليد عند الحجم الكبير، ويحتفظون بالتحكم الكامل في بيئة تشغيل النموذج. وهذه ميزة عملية حقيقية لأحمال العمل الإنتاجية.
سير عمل تحسين الفيديو
يتناسب Hunyuan Video أيضًا بطبيعية مع خطوط إنتاج الفيديو الأوسع. اقرنه بنموذج رفع دقة بعد التوليد لرفع دقة مخرجات 720p إلى 1080p أو أعلى. واستخدمه إلى جانب أدوات تحسين فيديو الذكاء الاصطناعي للتثبيت أو تقليل الضوضاء. تجعل البنية المفتوحة دمج خط الإنتاج أمرًا سهلًا بطرق لا تستطيع النماذج المغلقة مضاهاتها.
جرّبه بنفسك
أسرع طريقة لترى ما ينتجه Hunyuan Video فعلًا هي تشغيل أمر نصي مباشرة على PicassoIA. اكتب مشهدًا مفصلًا، وحدّد الإضاءة وزاوية الكاميرا، ثم قارن النتيجة بما تحصل عليه من Kling v3، أو Wan 2.7 T2V، أو Veo 3.1. تشغيل الأمر نفسه عبر عدة نماذج هو أكثر الطرق مباشرة لبناء فهم حدسي لما يفعله كل نموذج بشكل مختلف، ولإيجاد الأداة المناسبة لنوع المحتوى الذي تنتجه.
إلى جانب الفيديو، يمنحك PicassoIA الوصول إلى أكثر من 90 نموذجًا لتحويل النص إلى صورة، وأدوات رفع دقة، وأدوات إزالة الخلفية، وإمكانات مزامنة الشفاه، ما يجعله مساحة عمل متكاملة لتوليد المحتوى البصري بأي حجم.
ابدأ مع Hunyuan Video وانظر ما الذي يستطيع 13 مليار معامل مفتوح المصدر أن يفعله بفكرتك.