Open-Sora: دليل إلى بديل Sora المجاني

غيّر Open-Sora النقاش حول توليد الفيديو بالذكاء الاصطناعي حين أُطلق كإطار عمل مفتوح بالكامل. يشرح هذا المقال بنيته، ومن يقف خلفه، وكيف يقارن بالبدائل المدفوعة، وأي النماذج مفتوحة المصدر تستحق التشغيل اليوم.

Open-Sora: دليل إلى بديل Sora المجاني
Cristian Da Conceicao
مؤسس Picasso IA

شهد توليد الفيديو بالذكاء الاصطناعي المفتوح المصدر نقطة تحول حين صدر Open-Sora للعموم. لشهور، تصدّر Sora من OpenAI العناوين بوصفه النموذج المرجعي لتحويل النص إلى فيديو، لكن الوصول إليه كان مرتبطًا بالاشتراك. قدّم Open-Sora شيئًا مختلفًا: إطار عمل مفتوح بالكامل يمكن لأي شخص يملك وحدة GPU وفضولًا أن يشغّله ويدرسه ويطوّره.

كود Open-Sora وخط معالجة الفيديو بالذكاء الاصطناعي على حاسوب محمول لمطوّر

ما هو Open-Sora

Open-Sora تطبيق مفتوح المصدر لمفاهيم البنية المعمارية التي يقوم عليها Sora من OpenAI. طوّره فريق Colossal-AI، وهو إطار عمل لتوليد الفيديو قائم على محوّل الانتشار (DiT)، ويحوّل أوامر نصية إلى مقاطع فيديو. وخلافًا للمنتج التجاري الذي يستلهم منه، فإن قاعدة كود Open-Sora متاحة للجميع على GitHub، وأوزانه قابلة للتنزيل، وخط التدريب الخاص به موثّق لإمكانية إعادة الإنتاج.

الاسم نفسه يحمل رسالة: ما كان مملوكًا ملكية خاصة يمكن أن يصبح متاحًا. المشروع ليس نسخة من أوزان Sora الفعلية ولا من بيانات تدريبه. إنه إعادة بناء قائمة على الأبحاث المنشورة، تتبع التوجه المعماري نفسه للنموذج الأصلي.

باحث يدرس مخططات بنية الشبكات العصبونية عند لوحة بيضاء

البنية المعمارية وراءه

يعتمد Open-Sora في جوهره على محوّل الانتشار (Diffusion Transformer - DiT). هذه طريقة عمل العملية:

  1. يُرمَّز الأمر النصي إلى تمثيل كامن باستخدام مرمّز نصي (عادةً إصدارات T5 أو CLIP)
  2. يعمل نموذج DiT في فضاء فيديو كامن مضغوط باستخدام مرمّز ذاتي التباين للفيديو (VAE)
  3. تعمل تكرارات إزالة الضوضاء على تحسين الكامن المشوّش تدريجيًا حتى يصبح تسلسل فيديو متماسكًا
  4. يعيد مفكّك VAE بناء الفيديو النهائي من الكامن المحسَّن

هذا هو المسار العام نفسه الذي تعتمده معظم نماذج توليد الفيديو الحديثة، بما فيها التجارية. الفرق الجوهري أن Open-Sora يتيح فحص كل مكوّن وتعديله.

💡 بنية DiT هي الأساس نفسه الذي تستخدمه كثير من نماذج الفيديو الرائدة اليوم. معرفة طريقة عملها تمنحك ميزة حقيقية عند كتابة الأوامر لأي أداة تحويل نص إلى فيديو.

Colossal-AI: من بناه

الفريق وراء Open-Sora هو Colossal-AI، وهي مجموعة بحثية متخصصة في البنية التحتية للتدريب الموزّع للذكاء الاصطناعي على نطاق واسع. تشتهر بجعل تدريب النماذج الكبيرة أسهل عبر تحسين الذاكرة وتقنيات الحوسبة المتوازية. Open-Sora هو محاولتهم لفعل الشيء نفسه في توليد الفيديو: أخذ شيء مكلف وجعله متاحًا للجميع. انطلق المشروع على GitHub في أوائل 2024 وجذب الانتباه فورًا من باحثين كانوا ينتظرون بالضبط هذا النوع من الأساس المفتوح.

مركز بيانات احترافي مع رفوف حوسبة GPU لتدريب نماذج الذكاء الاصطناعي

لماذا يهم

كان مجال توليد الفيديو يعاني قبل Open-Sora من مشكلة واضحة: أفضل النماذج كانت إما مدفوعة أو مغلقة المصدر. كان بإمكان الباحثين دراسة النتائج، لكن لم يكن بإمكانهم فحص الآلية. غيّر Open-Sora هذا الوضع بثلاث طرق محددة.

1. قابلية إعادة الإنتاج في البحث

تكون الأوراق البحثية المنشورة عن نماذج توليد الفيديو مفيدة بقدر النماذج التي تصفها. وعندما تكون الأوزان وكود التدريب مغلقة، يصعب التحقق من الأوراق أو البناء عليها. يمنح Open-Sora مجتمع البحث أساسًا عمليًا يستطيع أي أحد إعادة إنتاجه أو اختباره بقسوة أو تحسينه. وهذه مساهمة مهمة بصرف النظر عن جودة المخرجات.

2. إتاحة التكلفة

تدريب نماذج توليد الفيديو وتشغيلها مكلف. ومع أن Open-Sora ما زال يتطلب قدرة حوسبية معتبرة، فقد خضع للتحسين ليعمل على عدد أقل من وحدات GPU مقارنةً بنظرائه التجاريين. وقد أدمج فريق Colossal-AI خبرته في التدريب الموزّع داخل الإطار مباشرة، مما يجعل النموذج في متناول المؤسسات التي لا تملك مجموعة من مئة وحدة GPU.

3. التطوير بالمجتمع

لأن الكود مفتوح، تحدث التحسينات بسرعة. يستطيع المجتمع الضبط الدقيق على مجموعات بيانات مخصصة، أو إضافة طرق جديدة للتحكم بالشروط، أو استبدال مكوّنات كاملة. وهكذا يتسارع الذكاء الاصطناعي المفتوح المصدر: ليس فريقًا واحدًا يعمل في السر، بل مئات الباحثين يدفعون في وقت واحد.

شاشتان متجاورتان تقارنان إطارات فيديو مولّدة بالذكاء الاصطناعي

Open-Sora مقابل Sora من OpenAI

يتشارك هذان النموذجان الاسم، لكن من الناحية العملية لا يتشاركان الكثير غيره.

الميزةOpen-SoraSora من OpenAI
الوصولمجاني، مفتوح المصدراشتراك مدفوع
الأوزانمتاحة للعموممغلقة
بيانات التدريبمجموعات بيانات عامة منتقاةخاصة
جودة الفيديوجيدة، وتتحسن بسرعةرائدة في الصناعة
أقصى دقة720p (الإصدار 1.2)حتى 1080p
الاستخدام التجاريمسموح (Apache 2.0)مقيّد بشروط الخدمة
التخصيصكامللا يوجد

فجوة الجودة حقيقية. فنماذج OpenAI، المتاحة الآن باسم Sora 2 وSora 2 Pro، تنتج لقطات لم تضاهها النماذج مفتوحة المصدر بعد بالكامل في الاتساق الزمني والتفاصيل الدقيقة. لكن بالنسبة إلى المطوّرين والباحثين والمبدعين الذين يحتاجون إلى الشفافية أو التخصيص أو التجربة بلا تكلفة، يسد Open-Sora فجوة حاسمة لا تستطيع المنتجات التجارية سدّها ببساطة.

💡 Open-Sora لا يحاول التفوق على Sora في الجودة. إنه يحاول أن يضمن أن الاتجاه الذي مهّده Sora متاح للجميع.

كيف يعمل Open-Sora عمليًا

صورة مقرّبة ليدين تكتبان كودًا على لوحة مفاتيح ميكانيكية لتشغيل نماذج الذكاء الاصطناعي المفتوحة

يتطلب تشغيل Open-Sora بعض المتطلبات المسبقة. إنه ليس تطبيق ويب بنقرة واحدة. هذا ما تبدو عليه عملية الإعداد الأولى لمن يجرّبه للمرة الأولى.

ما تحتاجه

  • جهاز Linux أو نسخة سحابية (يُنصح بـ Ubuntu 20.04 أو أحدث)
  • وحدة GPU من NVIDIA بذاكرة VRAM لا تقل عن 24 جيجابايت (A100 أو H100 للتوليد بالدقة الكاملة)
  • Python 3.10 أو أحدث، وPyTorch، ومكتبة Colossal-AI مثبتة
  • أوزان Open-Sora منزّلة من Hugging Face

تدفق التحويل من الأمر النصي إلى الفيديو

يتبع خط المعالجة تسلسلًا واضحًا: يُمرَّر الأمر النصي إلى مرمّز نصي من نوع T5، فيولّد تمثيلًا كامنًا. يبدأ هذا الكامن بالضوضاء، ويشغّل نموذج DiT تكرارات إزالة الضوضاء عبر البعدين المكاني والزمني معًا. وبعد اكتمال إزالة الضوضاء، يعيد مفكّك VAE بناء إطارات الفيديو الفعلية من الفضاء الكامن المحسَّن ويكتبها في ملف MP4.

مقارنة بين أمر نصي ضعيف وآخر قوي:

  • ضعيف: "شخص يمشي في مدينة"
  • قوي: "امرأة ترتدي معطفًا أحمر تمشي في شارع طوكيوي مبلل بالمطر ليلًا، حركة بطيئة، عمق ميداني ضحل، انعكاسات نيون على الإسفلت الرطب، سينمائي بمعدل 24 إطارًا في الثانية"

يقوم تحديد الأمر الثاني بمعظم العمل. فاتجاه الحركة وسلوك الكاميرا وظروف الإضاءة المكتوبة في الأمر تُترجم مباشرة إلى مخرجات أفضل.

معاملات الفيديو التي يمكنك التحكم بها

  • الدقة: من 256x256 حتى 720p حسب الإصدار
  • المدة: من ثانيتين إلى 16 ثانية لكل مقطع
  • معدل الإطارات: 8 أو 24 إطارًا في الثانية (fps)
  • نسبة العرض إلى الارتفاع: 1:1 أو 9:16 أو 16:9
  • خطوات إزالة الضوضاء: الخطوات الأكثر تعطي جودة أفضل على حساب زمن التوليد

بدائل مفتوحة المصدر تستحق المعرفة

Open-Sora ليس النموذج المفتوح المصدر الوحيد لتحويل النص إلى فيديو الذي يستحق التشغيل. لقد نما هذا النظام البيئي إلى مساحة تنافسية جادة.

شاشة تعرض شبكة من صور مصغّرة لفيديوهات مولّدة بالذكاء الاصطناعي

CogVideoX

طوّره Zhipu AI وأُطلق مفتوح المصدر، وCogVideoX 5B من أقوى نماذج الفيديو مفتوحة الأوزان المتاحة حاليًا. يستخدم مرمّز VAE ثلاثي الأبعاد مع بنية DiT مشابهة لبنية Open-Sora، لكنه يستفيد من مجموعة بيانات تدريب أكبر بكثير. تعمل نسخة 5 مليارات معامل على وحدة A100 واحدة، وتنتج حركة سلسة ومتماسكة تصمد عند مقاطع أطول حيث يميل Open-Sora إلى فقدان الاتساق.

Hunyuan Video

يمثل Hunyuan Video من Tencent أكبر نموذج لتوليد الفيديو مفتوح المصدر أُطلق حتى الآن. بحجم 13 مليار معامل، يتفوق على معظم النماذج المغلقة في الاتساق الزمني والحفاظ على التفاصيل الدقيقة. تجمع البنية بين محوّل ذي مسارين للتوكنات النصية والفيديوية، ثم تدمجها عبر محوّل ذي مسار واحد للمعالجة المشتركة. النتائج مبهرة باستمرار بالنسبة إلى إصدار ذي أوزان مفتوحة.

LTX Video

يتميز LTX Video من Lightricks بالسرعة. فبينما تحتاج معظم النماذج القائمة على DiT إلى عدة دقائق لكل مقطع، يستهدف LTX Video توليدًا شبه فوري عبر تحسينات معمارية وتقنيات التقطير. يضحّي ببعض الجودة القصوى مقابل تكرار أسرع بكثير، ما يجعله عمليًا لسير العمل الإبداعي الذي تهم فيه السرعة أكثر من الواقعية.

سلسلة Wan Video

أصبحت عائلة Wan Video واحدة من أكثر التشكيلات مفتوحة الأوزان قدرةً في المجال. ينتج Wan 2.7 T2V وWan 2.6 T2V مخرجات بدقة 1080p مع جودة حركة قوية والتزام جيد بالأوامر النصية. وتتحسن السلسلة باستمرار مع كل إصدار، وقد تقلّصت الفجوة بين أفضل نماذج Wan Video والبدائل المملوكة بشكل ملحوظ خلال السنة الماضية.

💡 إذا أردت جودة مفتوحة المصدر الأقرب إلى النماذج التجارية الآن، فإن Hunyuan Video وWan 2.7 T2V هما أفضل نقطتي انطلاق.

مفاضلة المدفوع مقابل المجاني

امرأة تعمل على حاسوب محمول في مقهى بشرفة مفتوحة مع برنامج مونتاج فيديو

قرار الاختيار بين المفتوح المصدر والتجاري ليس مسألة تكلفة فقط. إنه يتعلق بما تحاول تحسينه فعليًا.

اختر المفتوح المصدر عندما:

  • تحتاج إلى تشغيل النماذج على بنيتك التحتية الخاصة لأسباب تتعلق بخصوصية البيانات
  • تريد الضبط الدقيق على أساليب بصرية خاصة أو محتوى يحمل علامة تجارية
  • تبني منتجًا وتحتاج إلى تحكم كامل في مجموعة أدوات التوليد
  • أنت باحث تحتاج إلى تجارب قابلة لإعادة الإنتاج والتدقيق

اختر التجاري عندما:

  • تحتاج إلى أعلى جودة ممكنة للمخرجات بأقل وقت إعداد
  • تعمل ضمن موعد نهائي ضيق ولا تستطيع استكشاف أخطاء بيئات GPU وإصلاحها
  • تريد ميزات مدمجة مثل توليد الصوت أو التحكم بالكاميرا أو الوصول السلس عبر API

نماذج مثل Kling v3 Video وVeo 3 وSeedance 1 Pro تمثل الفئة التجارية. فهي أسرع في البدء، وتنتج مخرجات مصقولة، وتتعامل مع الحالات الحدّية التي ما زالت النماذج المفتوحة تعاني منها. المفاضلة حقيقية في الاتجاهين.

ما الذي يحسنه Open-Sora

رغم الفجوة في الجودة مقارنة بأفضل النماذج التجارية، يقدم Open-Sora عدة إسهامات تتجاوز المخرجات الخام.

الشفافية

كل قرار معماري موثّق. يمكنك تتبّع سبب بناء النموذج بالشكل الذي بُني به، وما بيانات التدريب المستخدمة، وكيف اختير جدول إزالة الضوضاء. هذا المستوى من الشفافية نادر في تطوير الذكاء الاصطناعي، وهو ذو قيمة حقيقية لكل من يأخذ هذه الحرفة بجدية.

المعيارية

صُمّم الإطار لاستبدال المكوّنات. تريد اختبار مرمّز نصي مختلف؟ استبدله. تريد إضافة تحكم مكاني بأسلوب ControlNet؟ البنية تستوعب هذا التعديل. وقد أنتجت هذه المرونة نظامًا متناميًا من النسخ المتفرعة والإصدارات المتخصصة المبنية على قاعدة كود Open-Sora.

توثيق خط التدريب

من إسهامات Open-Sora الأقل تقديرًا أنه يوثّق خط التدريب بالكامل. تصف معظم الأوراق البنى المعمارية لكنها تبقي تفاصيل التدريب غامضة عمدًا. أما Open-Sora فيحدد خطوات تنظيم مجموعات البيانات، ومنطق تصفية الجودة، ومراحل التدريب التدريجية بالتفصيل. لكل من يريد تدريب نموذج فيديو مخصص من الصفر، هذا التوثيق نقطة انطلاق نادرة ومفيدة.

رجل في مساحة عمل مشتركة حديثة يستخدم منصة توليد فيديو بالذكاء الاصطناعي على حاسوبه المحمول

أين يقصّر Open-Sora

الصراحة مهمة هنا. قيود Open-Sora حقيقية، ومن المفيد معرفتها قبل تخصيص الموارد.

  • اتساق الحركة في المدد الأطول يتدهور أسرع من النماذج التجارية
  • التفاصيل عالية التردد في الوجوه والأيدي تظهر فيها تشوهات تتعامل معها أفضل النماذج المغلقة الرائدة بشكل أفضل
  • عرض النص داخل إطارات الفيديو غير موثوق، وهو ضعف عام في نماذج الفيديو المفتوحة المصدر
  • تعقيد الإعداد مرتفع؛ وهو غير مناسب للمستخدمين دون خلفية تقنية
  • سرعة التشغيل أبطأ من النماذج التجارية المقطّرة عند إعدادات جودة مماثلة

هذه ليست قيودًا دائمة. إنها بالضبط المواضع التي يكون فيها إسهام المجتمع أنشط. ومع ذلك، تستحق المعرفة قبل اتخاذ قرارات البنية التحتية أو سير العمل بناءً على قدرات Open-Sora الحالية.

ماذا تعني حركة المصدر المفتوح لفيديو الذكاء الاصطناعي

مساحة عمل إبداعية من الأعلى تضم لوحات تخطيط مطبوعة وأجهزة لوحية وأدوات مونتاج الفيديو

كان إطلاق Open-Sora إشارة. فقد أثبت أن الابتكارات المعمارية في نماذج الفيديو المملوكة يمكن أن يعيد بناءها فريق صغير ومركّز يعمل علنًا. ومنذ ذلك الحين، رفعت Hunyuan Video وCogVideoX وWan Video سقف الجودة أعلى.

يعكس النمط ما حدث مع توليد الصور. لم تضاهِ Stable Diffusion جودة Midjourney عند إطلاقها، لكنها غيّرت من يتحكم في التقنية. وتُشغّل نماذج الصور مفتوحة المصدر اليوم فئات منتجات كاملة لم تكن لتوجد لو بقيت التقنية محجوبة خلف واجهات API.

يسير الفيديو على المسار نفسه. Open-Sora ليس الغاية النهائية. إنه أحد الفصول المبكرة في قصة أطول عن من يملك أدوات توليد الصور المتحركة من النص.

الأثر العملي: إذا كنت تبني أي شيء في مجال الفيديو بالذكاء الاصطناعي الآن، فإن فهم المشهد المفتوح المصدر ليس خيارًا. إنه جزء من أداء العمل بشكل صحيح، سواء انتهيت إلى إطلاق منتجك بأوزان مفتوحة المصدر أو باستدعاءات API تجارية.

الفجوة بين المفتوح والمغلق تضيق. السؤال ليس هل سيلحق توليد الفيديو المفتوح المصدر بالركب، بل متى.

جرّب توليد الفيديو بالذكاء الاصطناعي دون إعداد

كل النماذج التي نوقشت هنا، من Sora 2 وSora 2 Pro إلى Hunyuan Video وCogVideoX 5B وWan 2.7 T2V وLTX Video وKling v3 Video، متاحة على PicassoIA دون تثبيت أي تبعية. تحصل على النماذج نفسها وهي تعمل على بنية تحتية احترافية، مع نتائج خلال ثوانٍ بدلًا من الساعات التي يتطلبها الإعداد المحلي.

إذا كان المسار المفتوح المصدر يثير اهتمامك لكن إعداد وحدات GPU لا يفعل، فهذا هو الحل العملي الوسط: التقنية دون العبء. ابدأ بأمر نصي يهمك، وقارن المخرجات بين النماذج، وكوّن فكرة عما يتقنه كل نموذج قبل الالتزام بأي تقنية واحدة.

يتحرك مجال توليد الفيديو المفتوح المصدر بسرعة. أفضل طريقة للبقاء على اطلاع هي أن تبدأ التوليد الآن.

شارك هذا المقال

اختر لغتك

مقالات ذات صلة