شهد عالم الفيديو بالذكاء الاصطناعي ترقية مهمة. يصل HunyuanVideo 2.0 من Tencent مع مخرجات 4K أصلية، واتساق زمني محسّن، وفهم أفضل بكثير للأوامر النصية المعقدة. إذا كنت تتابع تحوّل توليد الفيديو بالذكاء الاصطناعي من مقاطع تجريبية إلى لقطات جاهزة للإنتاج، فهذا الإصدار يستحق اهتمامك الكامل. إليك ما تغيّر تحديدًا، وما يعنيه عمليًا، وكيف يمكنك البدء في استخدام HunyuanVideo على PicassoIA الآن.
ما هو HunyuanVideo 2.0 فعلًا

HunyuanVideo هو نموذج Tencent المفتوح الأوزان لتحويل النص إلى فيديو، وقد صدر أولًا في أواخر 2024 ليكون من أقوى أنظمة توليد الفيديو المتاحة للعموم في ذلك الوقت. أرسى الإصدار 1.0 أساسًا قويًا يضم 13 مليار معامل، ومخرجات بدقة 720p، وتماسكًا جيدًا في الحركة تفوّق على كثير من المنافسين التجاريين. يأخذ الإصدار 2.0 هذا الأساس ويعيد بناء مكونات أساسية لرفع سقف الدقة ومعالجة الوميض الزمني الذي أثقل كاهل الإصدار الأول.
من مختبرات Tencent إلى متصفحك
ما يجعل HunyuanVideo لافتًا، بعيدًا عن مواصفاته الخام، هو طبيعته المفتوحة الأوزان. أتاحت Tencent الأوزان للعموم، ما مكّن المجتمع من ضبط النموذج بدقة، وتكميمه، ونشره على عشرات المنصات خلال أسابيع من إطلاقه الأول. يستمر النمط نفسه مع الإصدار 2.0، إذ يمكنك الوصول إلى النموذج عبر صفحة Hunyuan Video على PicassoIA مباشرة في متصفحك، دون أي إعداد محلي أو ضبط إعدادات CUDA أو إدارة لذاكرة VRAM.
الفرق بين الإصدارين 1.0 و2.0
قفزة الإصدار ليست تجميلية. إليك مقارنة مباشرة لما تغيّر بين الإصدارين:
| الميزة | HunyuanVideo 1.0 | HunyuanVideo 2.0 |
|---|
| أقصى دقة | 720p | 4K أصلية |
| الوميض الزمني | متوسط | منخفض بشكل ملحوظ |
| الالتزام بالأمر النصي | جيد | محسّن بشكل كبير |
| تعقيد الحركة | فيزياء أساسية | تفاعل بين عدة كائنات |
| معدل الإطارات | 24fps | 24fps / 30fps |
| التحكم في الكاميرا | محدود | أكثر استجابة |
الدقة 4K الأصلية هي العنوان الرئيسي، لكن التحسينات الزمنية قد تكون أهم بالنسبة للعمل الإبداعي الفعلي.
لماذا تغيّر 4K كل شيء

الدقة في فيديو الذكاء الاصطناعي ليست مجرد عدد من البكسلات. عند 720p، يحمل الفيديو المولَّد نعومة تكشف فورًا أنه اصطناعي عند عرضه على شاشة حديثة. تظهر آثار الضغط وتدهور التفاصيل بمجرد أن تضع المقطع بجانب مادة مصوّرة بكاميرا حقيقية. يزيل الإخراج بدقة 4K معظم هذه العلامات. تضيق الفجوة بين مقطع HunyuanVideo 2.0 المبني على أمر نصي جيد وتصوير الكاميرا الفعلي بشكل ملحوظ عند هذه الدقة.
فيزياء توليد الفيديو عالي الدقة بالذكاء الاصطناعي
توليد الفيديو بدقة 4K ليس مجرد رفع دقة لمخرجات 720p. يتطلب توليد 4K الأصلي من النموذج أن يتخذ قرارات بشأن التفاصيل بكثافة بكسلات تعادل أربعة أضعاف. وهذا يعني أن مسامات الوجه، ونسيج القماش، وتموّجات سطح الماء، وملمس اللحاء كلها يجب أن تُتوقع بتماسك إطارًا تلو الآخر، عند دقة تظهر فيها الأخطاء بوضوح. يحقق HunyuanVideo 2.0 ذلك عبر مشفّر تلقائي متغيّر (VAE) مطوّر يعمل بدقة مكانية أعلى قبل أن تبدأ عملية الانتشار، فيحافظ على الدقة المكانية طوال التوليد بدلًا من استعادتها لاحقًا.
💡 نصيحة احترافية: يعني الإخراج 4K الأصلي أنه يمكنك التكبير أثناء المونتاج دون فقدان في الجودة، فتحصل على تغطية إضافية فعّالة كانت ستتطلب عادةً زاوية كاميرا منفصلة.
ماذا يعني "4K الأصلية" لمولّدات الذكاء الاصطناعي
يُستخدم المصطلح بإفراط في هذا المجال. تُخرج بعض الأدوات بدقة 1080p ثم تستخدم رفع الدقة بالذكاء الاصطناعي للوصول إلى 4K. وتولّد أدوات أخرى بدقة منخفضة داخليًا ثم تُكمل الإطارات بالاستيفاء. أما 4K في HunyuanVideo 2.0 فمُولَّدة بشكل أصلي، أي أن الدقة الكاملة موجودة منذ خطوة تشغيل النموذج الأولى. يُحدث هذا الفرق أهمية كبيرة عند التكبير على التفاصيل الدقيقة: عناصر النص داخل المشهد، وخلفيات الحشود، والفصل المعقد بين المقدمة والخلفية، كلها تصمد بطريقة لا يصمد بها الفيديو المرفوع دقته.
إذا أردت مقارنة النماذج القادرة على 4K جنبًا إلى جنب، فإن LTX 2.3 Pro وكذلك LTX 2.3 Fast من Lightricks يستهدفان هما أيضًا مخرجات 4K، ويقدمان مفاضلات مثيرة للاهتمام بين سرعة التوليد والتماسك الزمني.
الترقيات الأساسية في الإصدار 2.0

إلى جانب الدقة، أعادت Tencent بناء عدة أنظمة فرعية في الإصدار 2.0 تؤثر على سهولة الاستخدام اليومية بطرق تهم أكثر مما توحي به قائمة المواصفات.
اتساق الحركة على نطاق واسع
من أكثر الشكاوى شيوعًا حول HunyuanVideo 1.0 الوميض الزمني، حيث كانت الكائنات تتغير بشكل خفي في الحجم أو الشكل أو الملمس بين الإطارات حتى عندما لا يفترض أن يتغير شيء في المشهد. ظهر ذلك بوضوح أكبر في الشعر وأقمشة الملابس وملامس الخلفية. يقدم الإصدار 2.0 آلية انتباه مُعاد تصميمها عبر البعد الزمني، تعامل الإطارات المتجاورة كوحدة متماسكة بدلًا من تنبؤات مستقلة. والنتيجة مخرجات أكثر سلاسة بشكل ملحوظ، دون التأثير الشبيه بالوميض الستروبوسكوبي الذي جعل مقاطع 1.0 صعبة الاستخدام في السياقات الاحترافية.
الالتزام بالأمر النصي
كان هذا ضعفًا مُقلَّلًا من شأنه في الإصدار 1.0. فالأوامر التي تصف حركات كاميرا محددة، أو تموضعًا دقيقًا للشخص، أو أفعالًا مركبة، كانت غالبًا تنتج مخرجات تلتقط جزءًا فقط من التعليمات. تتضمن تحسينات تدريب 2.0 لدى Tencent محاذاة أفضل لمشفّر النص، ما يُترجم الأوامر التركيبية المعقدة بموثوقية أعلى. يمكنك الآن كتابة شيء مثل "لقطة مقربة لامرأة تسكب القهوة في كوب خزفي أبيض، والبخار يرتفع ببطء، وضوء نافذة المطبخ من اليسار" وتتوقع تنفيذًا متسقًا بدلًا من مشهد مطبخ عام يغفل نصف التفاصيل.
التفاعل بين عدة كائنات

عانى الإصدار 1.0 عندما تطلب الأوامر شخصين أو أكثر يتفاعلان مع بعضهما أو مع أدوات. يُظهر الإصدار 2.0 تحسنًا واضحًا هنا. محادثة بين شخصين، أو يد تضع جسمًا على طاولة، أو كلب يسترجع كرة من الماء، كلها سيناريوهات تُعرض الآن بمعقولية فيزيائية أكبر بكثير. تعلّم النموذج علاقات مكانية أفضل بين الكائنات، وكيف يجب أن تتحرك نسبةً إلى بعضها مع مرور الوقت.
💡 للصنّاع: يفتح التعامل مع عدة كائنات إمكانيات لسرد قصصي بالفيديو لم تكن متاحة مع الإصدار 1.0. تستفيد من هذه الترقية فورًا مقاطع السرد القصير، وعروض المنتجات، ومحتوى وسائل التواصل الاجتماعي التي تضم عناصر متعددة تتفاعل مع بعضها.
كيف يقف HunyuanVideo 2.0 بين المنافسين

مع وجود كثير من نماذج الفيديو القوية المتاحة الآن، يتمثل السؤال الحقيقي في موضع HunyuanVideo 2.0 ضمن سير العمل لدى الصانع. إليك تصنيف صادق له مقارنةً بالمشهد الحالي.
مقارنة أبرز النماذج الآن
أين يتفوق HunyuanVideo
يتفوق HunyuanVideo 2.0 تحديدًا في سيناريوهين: الدقة البصرية الخالصة بدقة 4K والمرونة من خلال الأوزان المفتوحة. إذا كانت أولويتك أعلى جودة صورة ممكنة في الإطارات المولَّدة دون الحاجة إلى صوت أصلي، فهذا هو النموذج المناسب. وإذا احتجت إلى صوت متزامن مدمج لمنصات التواصل الاجتماعي، فإن Kling v3 أو Veo 3.1 خيارات أفضل لهذا المتطلب تحديدًا.
المفاضلة بين السرعة والجودة
توليد 4K مكلف حسابيًا. توقع أوقات توليد أطول مقارنةً بالنماذج 720p أو 1080p. للتكرار السريع ومراجعات المسودات، يقدم LTX 2.3 Fast مخرجات 4K بسرعة أعلى بكثير. المقابل هو تماسك زمني أقل قليلًا في المشاهد ذات الحركة المعقدة. يجمع سير عمل احترافي شائع بين LTX 2.3 Fast لتمريرات المسودات السريعة وHunyuanVideo 2.0 للتصيير النهائي بعد تثبيت الاتجاه الإبداعي.
كيف تستخدم HunyuanVideo 2.0 على PicassoIA

يمنحك PicassoIA وصولًا مباشرًا عبر المتصفح إلى HunyuanVideo دون تنزيل أوزان النموذج أو إعداد بيئات CUDA أو إدارة VRAM. يعمل التوليد على البنية التحتية لوحدات GPU الخاصة بالمنصة، وتُنزَّل النتائج مباشرة إلى جهازك.
خطوة بخطوة على المنصة
1. افتح صفحة النموذج. انتقل إلى PicassoIA HunyuanVideo واضغط على Generate.
2. اكتب أمرًا نصيًا منظّمًا. استخدم هذا التنسيق للحصول على أفضل النتائج:
- الشخص والفعل يُوصفان أولًا
- البيئة وسياق الخلفية ثانيًا
- الإضاءة والجو ثالثًا
- حركة الكاميرا تُوصف أخيرًا
مثال: "طاهٍ بمئزر أبيض ينزلق بمقلاة حديد زهر فوق موقد غاز، وألسنة لهب ترتفع لحظيًا حول الحواف. مطبخ مطعم احترافي بأسطح من الستانلس ستيل. إضاءة دافئة من الأعلى من اليمين. تكبير بطيء للخارج يكشف المطبخ كاملًا."
3. اضبط الدقة. اختر الإخراج بدقة 4K. يزداد وقت التوليد، لكن القفزة في الجودة كبيرة لأي مخرج نهائي سيُعرض على شاشة حديثة.
4. راجع وكرّر. لاحظ قيمة البذرة التي تظهر مع نتيجتك. استخدام القيمة نفسها مع أمر نصي معدّل قليلًا يتيح لك استكشاف التنويعات المختلفة دون البدء من خط أساس عشوائي تمامًا.
أفضل إعدادات الأوامر النصية لمخرجات 4K
- اجعل الأوامر محددة دون حشو. ثلاث إلى أربع تعليمات متمايزة في الأمر الواحد تعطي نتائج أفضل من عشرة متطلبات متراكمة. لا يستفيد النموذج من حشو الكلمات المفتاحية.
- صِف الإضاءة بوضوح. يستجيب HunyuanVideo 2.0 جيدًا لأوصاف الإضاءة الاتجاهية مثل "ضوء الصباح من اليسار" أو "شمس منتصف النهار الحادة من الأعلى".
- سمِّ حركات الكاميرا بدقة. "دولي بطيء للأمام" ينتج نتائج مختلفة وأكثر موثوقية من "الكاميرا تتحرك للداخل".
- تجنب النفي في الأوامر. بدلًا من "لا خلفية ضبابية"، اكتب "مقدمة حادة وخلفية حادة في كامل المشهد".
💡 مكسب سريع: إذا احتوى مخرجك على آثار حركة غير مرغوبة، فأضف "كاميرا ثابتة، دون حركة للكاميرا" إلى نهاية الأمر النصي. غالبًا ما يثبّت ذلك التوليد بشكل ملحوظ، خاصة في لقطات التفاصيل المقرّبة.
3 طرق لرفع جودة المخرجات أكثر

الحصول على فيديو 4K جيد من HunyuanVideo 2.0 أمر، وإيصاله إلى المعيار الإنتاجي أمر آخر يتطلب خطوات إضافية يتجاوزها معظم الصنّاع تمامًا.
الجمع مع الدقة الفائقة
حتى مع 4K الأصلية، تستفيد بعض التفاصيل الدقيقة في فيديو الذكاء الاصطناعي من تمرير للدقة الفائقة لتحسين وضوح الحواف وتقليل نعومة الضغط. تستطيع أدوات الدقة الفائقة في PicassoIA معالجة الفيديو الذي نزّلته إطارًا تلو الآخر، فتستخلص مزيدًا من الوضوح من لقطات 4K الحادة أصلًا. هذا فعّال بشكل خاص في لقطات المنتجات المقربة ولقطات تفاصيل الوجه التي يهم فيها الملمس الدقيق.
السلسلة مع استعادة الفيديو
بعد التوليد، يصحّح تمرير المقطع عبر أداة استعادة الفيديو بالذكاء الاصطناعي الوميض الخفيف الذي قد يُدخله حتى النموذج المحسّن زمنيًا في الإصدار 2.0 أحيانًا. تعمل أدوات استعادة الفيديو بالذكاء الاصطناعي في PicassoIA على المواد المولَّدة بالفعل بفعالية تعادل عملها على المواد المصوّرة بكاميرا حقيقية، فتثبّت المخرجات وتستعيد التفاصيل التي أضعفها الضغط أثناء الترميز. يمكنك العثور على هذه الأدوات في قسم جميع النماذج ضمن فئة استعادة الفيديو.
استخدام صور مرجعية
رغم أن HunyuanVideo 2.0 نموذج لتحويل النص إلى فيديو، يمكنك ضبط توليداتك بإحكام أكبر بتوليد صورة مرجعية تطابق الإطار الأول المقصود بدقة، ثم وصف تلك الصورة بتفاصيل دقيقة داخل أمرك النصي. تحسّن هذه التقنية الاتساق بين مفهومك والمخرج بشكل كبير عندما يكون تكوين المشهد محددًا. وإذا أردت تحريك صورة مرجعية مباشرة بدلًا من وصفها نصيًا، فإن Wan 2.7 I2V هو النظير لتحويل الصورة إلى فيديو، ويقبل إدخال صورة مباشرًا وينتج الحركة منها.
ماذا يعني فيديو الذكاء الاصطناعي بدقة 4K للصنّاع

غالبًا ما يركز الحديث حول فيديو الذكاء الاصطناعي على ما لا يستطيع فعله. يغيّر HunyuanVideo 2.0 هذا الحديث. مع مخرجات 4K وتماسك زمني محسّن، أصبح المحتوى المرئي قابلًا للاستخدام فعلًا في أغراض تجارية كانت مستبعدة مع الأجيال السابقة. فيديوهات YouTube، وإعلانات المنتجات، ومحتوى الإعلانات على وسائل التواصل، وأفلام العلامات التجارية القصيرة، كلها أصبحت في المتناول دون طاقم تصوير.
الآثار العملية كبيرة:
- خفض التكاليف: فيديو منتج مدته 15 ثانية كان يتطلب استئجار استوديو وإضاءة ومشغّل كاميرا، أصبح بالإمكان توليده ومراجعته والموافقة عليه خلال ساعات.
- سرعة الوصول إلى السوق: يحدث التكرار في دقائق لا في أيام. يمكنك اختبار خمسة توجهات إبداعية في فترة بعد الظهر، واعتماد الأقوى منها قبل نهاية يوم العمل.
- سهولة الوصول: صار بإمكان المبدعين دون خلفية في إنتاج الأفلام إنتاج لقطات تبدو احترافية عند عرضها على شاشات الاستهلاك الحديثة.
- ميزة الأوزان المفتوحة: يستطيع المطورون ضبط HunyuanVideo دقيقًا على مجموعات بيانات مخصصة، مما يتيح إنشاء أدوات متخصصة لتوليد الفيديو لصناعات محددة دون قيود ترخيص أو حدود على معدل طلبات API.
سقف 4K تحديدًا مهم لأنه يتوافق مع ما تتطلبه منصات التوزيع الاحترافية فعلًا. فمستوى 4K في YouTube، وتسليمات منصات البث، وإعلانات العرض بالتنسيقات الكبيرة، كلها لها عتبات دقة لا يستطيع فيديو الذكاء الاصطناعي بدقة 720p و1080p تجاوزها. يتجاوزها HunyuanVideo 2.0.
جرّب HunyuanVideo 2.0 على PicassoIA الآن

لا تحتاج إلى GPU أو خادم أو إعداد تقني لتشغيل HunyuanVideo 2.0. تشغّل PicassoIA النموذج مباشرة في المتصفح، ويمكنك الحصول على أول فيديو بدقة 4K خلال أقل من دقيقتين من قراءة هذا المقال.
تتيح لك المنصة أيضًا الوصول إلى أكثر من 100 نموذج آخر لتحويل النص إلى فيديو من الواجهة نفسها، ما يعني أنه يمكنك مقارنة مخرجات HunyuanVideo 2.0 مع Kling v3، ومع Seedance 2.5، ومع Veo 3.1، ومع LTX 2.3 Pro، باستخدام الأمر النصي نفسه تمامًا. هذه القدرة على الاختبار جنبًا إلى جنب مفيدة فعلًا لتطوير استراتيجيات الأوامر النصية التي تعمل بموثوقية عبر نماذج متعددة.
اكتب أمرًا نصيًا، واختر 4K، ثم ولّد. هذا هو سير العمل كله.
توجّه إلى PicassoIA HunyuanVideo وشاهد كيف يبدو فيديو الذكاء الاصطناعي بدقة 4K عندما تبنيه بنفسك.