Wan 2.7: أحدث نموذج فيديو بالذكاء الاصطناعي من Alibaba يجب أن تعرفه

Wan 2.7 هو أحدث نموذج فيديو مفتوح الأوزان بالذكاء الاصطناعي من Alibaba، ويطرح قدرات تحويل النص إلى فيديو، وتحويل الصورة إلى فيديو، وتحويل المرجع إلى فيديو في إصدار واحد. يتناول هذا المقال ما يميّزه، وكيف يقارن بالمنافسين التجاريين، وكيفية استخدام الأنماط الثلاثة في سير عمل إبداعي حقيقي.

Wan 2.7: أحدث نموذج فيديو بالذكاء الاصطناعي من Alibaba يجب أن تعرفه
Cristian Da Conceicao
مؤسس Picasso IA

لم يصل Wan 2.7 مصحوبًا بجولة إعلامية. صدر كنموذج من فريق الأبحاث في Alibaba يجمع ثلاث قدرات مختلفة في إصدار واحد، وخلال ساعات بدأت نتائج الاختبارات المعيارية تتدفق من باحثين كانوا قد حمّلوا الأوزان وبدأوا تشغيل اختباراتهم. هذا النوع من الاستقبال يخبرك بشيء مهم عن سلسلة Wan: فقد نالت اهتمامًا جادًا في مجتمع فيديو الذكاء الاصطناعي المفتوح المصدر.

سلسلة Wan هي العائلة الرائدة لنماذج توليد الفيديو لدى Alibaba، وتُطوَّر ضمن قسم أبحاث الذكاء الاصطناعي لديها. في حين ركّزت كثير من شركات التقنية الصينية على أدوات فيديو مغلقة لا تعمل إلا عبر API، اتّبعت Alibaba نهجًا مختلفًا مع Wan، إذ أصدرت أوزان النموذج علنًا وتركت مجتمع الأبحاث يبني عليها. يواصل Wan 2.7 هذا التقليد مع قفزة ملموسة في الدقة وجودة الحركة وتعدد الاستخدامات.

مهندس فيديو محترف يعمل في إعداد إنتاج سينمائي

ما الذي تغيّر في 2.7

الجيل السابق، Wan 2.6 T2V، كان قادرًا بالفعل على تحويل النص إلى فيديو بدقة 720p وتحريك الصور. يرفع Wan 2.7 السقف أعلى في ثلاثة مجالات محددة:

  • إخراج أصلي بدقة 1080p في أنماط التوليد الثلاثة كلها
  • تماسك زمني محسّن، أي حركة أقل اهتزازًا وانجرافًا في المقاطع الأطول
  • تحويل المرجع إلى فيديو ميزةً أساسية، لا فكرة ثانوية

💡 التماسك الزمني هو ما يفصل فيديو الذكاء الاصطناعي بجودة احترافية عن المقاطع الوامضة وغير المتسقة التي جعلت أدوات تحويل النص إلى فيديو الأولى تبدو كحيل استعراضية تُبهر دون أن تفيد. يأخذ Wan 2.7 هذا الأمر بجدية.

تركز تحسينات البنية على العمود الفقري لانتشار الفيديو، الذي يعالج الآن تسلسلات التوكنات الأطول بكفاءة أكبر. والنتيجة العملية: انتقالات حركة أنعم، وثبات أفضل للأشخاص عبر الإطارات، وتفاصيل أدق في الأنسجة المعقدة مثل الشعر والأقمشة وأسطح المياه.

سلسلة Wan

من المفيد أن تفهم موقع 2.7 في مسار التطور. تحركت السلسلة بسرعة:

الإصدارالدقةالميزة المميزة
Wan 2.1480p / 720pأساس مفتوح المصدر متين
Wan 2.2720pإصدارات سريعة، دعم مزامنة الصوت
Wan 2.5720p-1080pحركة أفضل، تحسينات في I2V
Wan 2.61080pجودة مصقولة، إصدار flash
Wan 2.71080pT2V + I2V + R2V، إصدار كامل

كل إصدار بنى على سابقه بدلًا من أن يحل محله. ما زال إصدار Wan 2.2 I2V Fast مفيدًا في حالات واضحة عندما تحتاج إلى السرعة على حساب أقصى جودة. أما Wan 2.7 فهو الفئة المتميزة.

مركز بيانات ضخم يشغّل بنية توليد فيديو الذكاء الاصطناعي

ثلاثة أنماط في إصدار واحد

معظم نماذج توليد الفيديو تتخصص. إما تحوّل النص إلى فيديو، أو تحرّك الصور، ونادرًا ما تفعل الاثنين بمستوى عالٍ. يأتي Wan 2.7 بثلاثة أنماط متميزة تغطي أكثر سير عمل توليد الفيديو شيوعًا دون أن تضطر إلى تبديل الأدوات.

تحويل النص إلى فيديو (T2V)

يأخذ Wan 2.7 T2V أمرًا نصيًا ويعيد مقطع فيديو كاملًا بدقة 1080p. يتولى النموذج حركة الكاميرا وحركة الأشخاص وتكوين المشهد من الأمر النصي وحده. النتائج أوضح بملحوظة من تلك التي أنتجتها إصدارات Wan السابقة، مع معالجة أفضل لعناصر الأمر المعقدة مثل مشاهد الحشود وتأثيرات الطقس والبيئات المعمارية.

بالنسبة إلى الأوامر التي تتضمن حركة فيزيائية، مثل جريان الماء أو النار أو الأقمشة في الريح، يظهر 2.7 أوضح تحسن على أسلافه. تحمل الحركة القريبة من الفيزياء وزنًا أكثر إقناعًا.

تحويل الصورة إلى فيديو (I2V)

يحرّك Wan 2.7 I2V صورة ثابتة تقدمها. هذا هو النمط الأكثر استخدامًا في سير العمل الفعلي لأنه يمنحك تحكمًا دقيقًا في الإطار الأول. لست تخمّن شكل المشهد. أنت من يأتي به.

يتعامل إصدار 2.7 مع الحالات الحدّية التي أربكت النماذج السابقة: وجوه ذات إضاءة غير معتادة، ومشاهد فيها عدة أشخاص متداخلين، ولقطات معمارية ذات أنماط هندسية متكررة. كل هذه حالات صعبة تاريخيًا في تحريك الصور، لأن النموذج يحتاج إلى استنتاج العمق والحركة دون أن يرى الإطار الذي قبله أو بعده.

💡 للحصول على أفضل النتائج مع I2V، استخدم صورًا مصدرية عالية الدقة مع موضوعات بؤرية واضحة. يقرأ Wan 2.7 العمق الضمني في الصورة ويستخدمه لتوليد حركة منظور واقعية.

تحويل المرجع إلى فيديو (R2V)

Wan 2.7 R2V هو النمط الذي يثير أكبر قدر من النقاش. تقدّم صورة مرجعية لشخصية أو جسم، ويولّد النموذج فيديو يظهر فيه هذا الموضوع في مشهد جديد أو سياق حركي جديد. هذا ليس تحريكًا للصورة. إنه استخلاص الموضوع مع توليد المشهد.

لهذا تطبيقات واضحة في الإعلان، والسرد القصصي القائم على الشخصيات، وأي موقف تحتاج فيه إلى هوية بصرية ثابتة عبر عدة مقاطع فيديو.

مخرج إبداعي يراجع تشغيل الفيديو على شاشة إنتاج

لماذا يهم إخراج 1080p

القفزة إلى إخراج 1080p أصلي تبدو كنقطة في ورقة المواصفات. عمليًا، تغيّر ما يمكنك فعلًا استخدام فيديو الذكاء الاصطناعي من أجله.

الدقة مقابل الجودة

ثمة فرق يستحق الإشارة: الدقة والجودة الإدراكية ليستا الشيء نفسه. نماذج الفيديو الأولى بدقة 1080p كانت ترفع الدقة داخليًا، فتقدم نتائج حادة لكنها غير متسقة بصريًا. يصيّر Wan 2.7 بدقة 1080p بشكل أصلي، ما يعني أن التفاصيل الدقيقة موجودة فعلًا وليست مستكملة بالاستيفاء. خصلات الشعر، والنصوص الخلفية، وأنماط نسيج الأقمشة: كلها تصمد عند الحجم الكامل.

عند 720p، يعمل فيديو الذكاء الاصطناعي بشكل جيد للصور المصغّرة على الويب، ومعاينات وسائل التواصل، والتصور المبدئي الخشن. أما عند 1080p مع الحد الأدنى للجودة في Wan 2.7، فيصبح الإخراج صالحًا للقطات الداعمة للبث، ومحتوى YouTube، وفيديوهات العروض التقديمية، وأعمال الإعلانات القصيرة.

ثبات الحركة عبر الإطارات

الشيء الآخر الذي تفرضه 1080p على النموذج هو أن يُتقن ثبات الحركة. عند الدقات الأقل، تكون الاختلافات الصغيرة بين الإطارات أقل وضوحًا. أما عند 1080p، فإن تغيّر طول شعر الشخص من إطار إلى آخر، أو وميض يد بنسبة خاطئة، يصبح ملحوظًا فورًا.

درجات ثبات الحركة في Wan 2.7 على الاختبارات المعيارية القياسية من بين الأعلى لأي نموذج فيديو مفتوح الأوزان صدر حتى الآن. ويمكن ملاحظة ذلك في استقرار المخرجات من إطار إلى آخر، وليس فقط في رقم معيار مُعلن.

عدسة كاميرا سينمائية احترافية تُظهر دقة بصرية

كيف يقارن بالمنافسين

أصبح مجال فيديو الذكاء الاصطناعي تنافسيًا بجدية. لمقارنة Wan 2.7 بإنصاف، يجب النظر إلى ما يتقنه كل نموذج فعلًا.

Wan 2.7 مقابل النماذج التجارية المغلقة

يمثل Kling v3 من Kuaishou و Veo 3 من Google المعايير الحالية لتوليد الفيديو التجاري المغلق. ينتج كلاهما مخرجات ممتازة. وSora 2 من OpenAI يتعامل مع الفيديو السردي الطويل بشكل أفضل من معظم المنافسين حاليًا.

وهذه هي النقاط التي يتميز فيها Wan 2.7:

العاملWan 2.7النماذج التجارية
أوزان النموذج متاحةنعم (مفتوحة)لا
الضبط الدقيق المخصص ممكننعملا
مرجع ثابت للموضوعقوي (R2V)متفاوت
التكلفة لكل توليدمنخفضة (استضافة ذاتية)الدفع حسب الاستخدام
إخراج أصلي بدقة 1080pنعمنعم (معظمها)
توليد صوت أصليلابعضها (Veo 3، Sora 2)

الصوت هو الفجوة الأوضح لدى Wan 2.7 مقارنة بالنماذج المغلقة. يولّد Veo 3 وHailuo 02 الصوت المتزامن بشكل أصلي. أما Wan 2.7 فلا. في سير العمل الذي تهم فيه الموسيقى أو الأصوات المحيطة، ستحتاج إلى مسار صوت منفصل أو إلى نموذج مختلف.

المصدر المفتوح كميزة حقيقية

تستحق طبيعة Wan 2.7 المفتوحة الأوزان أن تُؤخذ بجدية كميزة، لا كاعتبار للتكلفة فقط. الضبط الدقيق على أساليب بصرية خاصة، والدمج في مسارات مخصصة، والنشر في بيئات غير متصلة بالإنترنت، وتشغيل تكييفات LoRA لموضوعات محددة: لا شيء من هذا ممكن مع النماذج المغلقة. Wan 2.7 قابل للتوسيع فعلًا بطرق لا يتيحها Seedance 2.0 ونظراؤه المغلقون.

مساحة عمل لصانع محتوى مُعدّة لإنتاج الفيديو

حالات استخدام تنجح فعلًا

صنّاع المحتوى وفيديو وسائل التواصل

فيديو المحتوى القصير هو التطبيق الأوضح. يولّد Wan 2.7 T2V مقاطع مقنعة مدتها من 5 إلى 10 ثوانٍ من أوامر نصية، وهي المدة المطلوبة تمامًا لأغلفة وسائل التواصل، ومقدمات المشاهد، وإدراجات اللقطات الداعمة. ويعني إخراج 1080p عدم وجود آثار رفع دقة عند النشر على المنصات التي تدعم الآن 1080p60 بشكل أصلي.

بالنسبة إلى صنّاع المحتوى، سير العمل الأكثر فائدة فورًا هو I2V: خذ صورة ثابتة أو أصلًا فوتوغرافيًا لديك، وحرّكه باستخدام Wan 2.7، واحصل على نسخة متحركة خلال دقائق.

التصور المسبق في إنتاج الأفلام

التصور المسبق، أي رسم اللقطات الأولية قبل التصوير الرئيسي، كان يتطلب تقليديًا إما فنانًا ثلاثي الأبعاد ماهرًا أو استوديو خارجيًا مكلفًا. Wan 2.7 ليس بديلًا كاملًا عن أيهما. لكن للتواصل السريع حول زاوية الكاميرا وحركة الموضوع وتوزيع المشهد التقريبي مع المخرج أو مدير التصوير، أصبح التصور المسبق بالفيديو بالذكاء الاصطناعي مفيدًا فعلًا عند مستوى جودة 2.7.

نمط R2V ذو صلة خاصة هنا: يمكنك أن تأخذ صورة مرجعية لممثل أو موقع وتولّد أفكارًا للمشاهد مع الحفاظ على هويته البصرية المحددة.

فيديو المنتجات والتسويق

عروض المنتجات، ولقطات العلامات التجارية لأنماط الحياة، ولقطات التسويق الداعمة مجالات تصبح فيها نسبة الجودة إلى التكلفة في Wan 2.7 مقنعة. لقطة منتج بحركة بسيطة، ومشهد لنمط حياة مع دمج المنتج، ولقطة تأسيسية للموقع: كل ذلك ممكن من أوامر نصية أو صور مرجعية بدقة 1080p دون ميزانية إنتاج فيديو كاملة.

عتاد GPU عالي الأداء يتيح توليد فيديو الذكاء الاصطناعي

كيفية استخدام Wan 2.7 على PicassoIA

يستضيف PicassoIA أنماط Wan 2.7 الثلاثة، ما يجعلها متاحة دون الحاجة إلى إعداد بنية GPU محلية. إليك كيفية استخدام كل واحد منها بفعالية.

استخدام Wan 2.7 T2V

  1. انتقل إلى Wan 2.7 T2V على PicassoIA
  2. اكتب أمرًا نصيًا مفصّلًا يصف مشهدك، يتضمن الموضوع والبيئة والإضاءة واتجاه الحركة
  3. حدّد المدة (5 أو 10 ثوانٍ) وفق حالة استخدامك
  4. اختر إخراج 1080p للحصول على أقصى جودة
  5. أرسل الطلب وانتظر نحو 60 إلى 90 ثانية للتوليد

نصيحة للأمر النصي: يستجيب Wan 2.7 T2V جيدًا لمصطلحات توجيه الكاميرا. عبارات مثل "panning بطيء إلى اليسار"، أو "تراجع جوي"، أو "لقطة متوسطة ثابتة" تؤثر بشكل ملموس في حركة الكاميرا في المخرجات.

استخدام Wan 2.7 I2V

  1. انتقل إلى Wan 2.7 I2V على PicassoIA
  2. ارفع صورتك المصدرية (يفضل بدقة 1080p أو أعلى)
  3. أضف أمرًا نصيًا لتوجيه الحركة يصف ما يجب أن يتحرك وكيف
  4. اجعل أمر الحركة قصيرًا ومحددًا، مثلًا: "الكاميرا تقترب ببطء، والأوراق تخشخش برفق"
  5. ولّد المقطع وراجعه بالدقة الكاملة قبل التنزيل

نصيحة للمعاملات: إذا كانت صورتك تحتوي على خط أفق واضح، يفسّره النموذج تلقائيًا كفرصة لحركة dolly أو اقتراب. تجنّب تحميل أمر الحركة بتوجيهات متعارضة.

استخدام Wan 2.7 R2V

  1. انتقل إلى Wan 2.7 R2V على PicassoIA
  2. ارفع صورة الموضوع المرجعية (تعمل أفضل مع خلفية نظيفة أو عزل واضح للموضوع)
  3. اكتب أمرًا نصيًا للمشهد يصف أين وكيف تريد أن يظهر الموضوع
  4. كن محددًا في الحركة: "الموضوع يمشي إلى الأمام في شارع مرصوف بالحجارة، وضوء بعد الظهر من اليسار"
  5. راجع الاتساق بين المرجع والشخصية المولّدة عبر المقطع كله

💡 يعمل R2V بأفضل شكل عندما تحتوي صورة المرجع على تحديد واضح وقوي للموضوع. صورة فوتوغرافية عالية التباين بخلفية بسيطة تمنح النموذج أنقى إشارة يعمل عليها.

محترفان يتعاونان على واجهة إنتاج فيديو

الحدود الحقيقية لنموذج Wan 2.7

التقييم الصادق أهم من الضجيج.

ما يعاني منه

المقاطع الطويلة ذات الاستمرارية السردية ما زالت صعبة. يولّد Wan 2.7 المقاطع في نطاق 5 إلى 10 ثوانٍ بفعالية. فيديو مدته 60 ثانية بشخصيات ثابتة تتحرك عبر قصة متماسكة ليس ما صُمم له هذا النموذج. وهذا ما زال مشكلة غير محلولة لدى معظم نماذج الفيديو المفتوحة في هذا الجيل.

عرض النص داخل الفيديو ضعيف. أي سير عمل يتطلب نصًا مقروءًا على الشاشة ينبغي أن يعتمد على التركيب بعد الإنتاج، لا على أن يولّده النموذج.

الحركة الشديدة، بما فيها الرياضات السريعة، والقطعات السريعة للكاميرا، والحركة عالية معدل الإطارات، تنتج آثارًا أكثر من عمل الكاميرا الأبطأ والمدروس الذي يتألق فيه Wan 2.7 حقًا. اعمل مع نقاط قوة النموذج لا ضدها.

متى تستخدم البدائل

للتوليد السريع مع متطلبات جودة أقل، ما زال Wan 2.2 T2V Fast يستحق النظر فيه. إنه أسرع بملحوظة على حساب بعض الجودة. لتوليد الصوت الأصلي، فإن Veo 3 أو Hailuo 02 هما الخياران المناسبان. وللتحريك المدفوع بالصوت تحديدًا، يتعامل Wan 2.2 S2V بشكل جيد مع توليد الفيديو المتزامن مع الصوت.

شاشة مراقبة تعرض مخرجات فيديو سينمائية حيّة بالذكاء الاصطناعي

ابدأ توليد فيديو الذكاء الاصطناعي الآن

Wan 2.7 هو أقوى نموذج فيديو مفتوح الأوزان متاح حاليًا، بمزيج من الدقة وتعدد الاستخدامات والاتساق لم يوجد بهذا السعر من قبل. يغطي الإصدار ذو الأنماط الثلاثة الغالبية العظمى من سير العمل الإبداعي الفعلي دون الحاجة إلى أداة مختلفة لكل مهمة.

أسرع طريقة لترى ما يفعله هي تشغيله. يمنحك PicassoIA وصولًا مباشرًا إلى أنماط Wan 2.7 الثلاثة دون أي إعداد محلي: لا GPU، ولا أوزان نموذج لتحميلها، ولا ملفات إعداد. تكتب أمرًا نصيًا أو ترفع صورة، فتحصل على فيديو بالذكاء الاصطناعي بدقة 1080p في أقل من دقيقتين.

جرّب Wan 2.7 T2V لتوليد فيديو من أمر نصي، أو Wan 2.7 I2V لتحريك صورة ثابتة لديك، أو Wan 2.7 R2V لوضع موضوع محدد في مشهد جديد تمامًا. ارتفع الحد الأدنى للجودة في توليد الفيديو المفتوح المصدر ارتفاعًا كبيرًا مع هذا الإصدار. لم يكن هناك وقت أفضل لتبدأ في استخدامه.

فريق وكالة إبداعية يعمل عند الغسق مع خلفية أفق المدينة

شارك هذا المقال

اختر لغتك

مقالات ذات صلة