شهد مجال توليد الفيديو بالذكاء الاصطناعي مفتوح المصدر تطورًا سريعًا في 2024، ويقع CogVideoX في قلب هذا التحول. أطلقه THUDM، مختبر الأبحاث الذي يقف وراء CogVLM ونماذج بارزة أخرى، وهو نموذج لتحويل النص إلى فيديو قائم على الانتشار، ينتج مقاطع فيديو متماسكة وسلسة بشكل لافت من أوامر نصية بسيطة. لا يتطلب اشتراكًا، ولا يقع خلف جدار واجهة API مملوكة، ولا يخفي أوزانه. هذا المزيج يضعه في فئة مختلفة حقًا عن معظم أدوات الفيديو بالذكاء الاصطناعي التي تحظى بالعناوين.
ما هو CogVideoX فعلًا
CogVideoX نموذج توليد فيديو مفتوح الأوزان مبني على بنية محوّل انتشار الفيديو. النسخة الرئيسية، CogVideoX-5B، تضم 5 مليارات معامل، وقادرة على توليد مقاطع فيديو مدتها 6 ثوانٍ بدقة 720x480 وبمعدل 8 إطارات في الثانية. يوجد أيضًا إصدار أصغر بمعاملات 2B للبيئات محدودة الموارد، وكلاهما متاح بتراخيص متساهلة تسمح بالاستخدام التجاري.
دُرّب النموذج على مجموعة كبيرة من أزواج النص والفيديو، ما يمكّنه من ربط الأوصاف اللغوية بالحركة البصرية المتماسكة. تكتب وصفًا، فيزيل النموذج الضوضاء من ضوضاء غاوسية على خطوات متعددة، فينتج مقطعًا قصيرًا تتحرك فيه الأشياء، وتتغيّر الإضاءة، وتنتقل المشاهد بتناسق زمني معقول.

مختبر THUDM وراء النموذج
THUDM (قسم تعلم الآلة بجامعة تسينغهوا) له سجل في إنتاج نماذج متعددة الوسائط مفتوحة المصدر وقادرة. قبل CogVideoX، أطلق المختبر CogVLM لفهم اللغة البصرية وGLM-4 لتوليد اللغة. يتبع CogVideoX الفلسفة نفسها: إطلاق أوزان قوية، ونشر تقارير تقنية مفصلة، وترك المجتمع يبني عليها.
هذا الدعم الأكاديمي يمنح النموذج مصداقية تفتقر إليها غالبًا الإصدارات "المفتوحة" التجارية البحتة. خيارات البنية موثّقة، وطريقة التدريب موصوفة، والقيود مذكورة بصراحة بدلًا من أن تُدفن في الحواشي.
لماذا يهم المصدر المفتوح هنا
لا تمنحك مولدات الفيديو المملوكة مثل Sora أو واجهات API التجارية أي تحكم فيما يحدث لبياناتك أو أوامرك النصية أو مخرجاتها. فقد تغيّر التسعير، أو تقيّد حالات الاستخدام، أو تتوقف ببساطة. أما نموذج مفتوح الأوزان مثل CogVideoX فيعني أنه يمكنك استضافته بنفسك، وضبطه دقيقًا على مجموعة بياناتك الخاصة، وبناء مسارات إنتاج دون الاعتماد على طرف ثالث.
بالنسبة إلى صنّاع المحتوى، يترجم هذا إلى تكلفة طويلة الأمد أقل. وبالنسبة إلى المطورين، يعني مرونة حقيقية. وبالنسبة إلى الباحثين، يعني أن البنية قابلة للفحص والتطوير من قِبل أي شخص يملك العتاد والاهتمام اللازمين.
كيف تعمل البنية

لا يستخدم CogVideoX العمود الفقري القياسي UNet. بل يعتمد على محوّل انتباه سببي ثلاثي الأبعاد، يُطلق عليه أحيانًا Expert Transformer، يعالج المكان والزمان معًا. هذا الخيار المعماري هو محور قدرة النموذج على إنتاج حركة متسقة زمنيًا عبر جميع إطارات المقطع.
العمود الفقري للانتشار
مثل معظم النماذج التوليدية الحديثة، يستخدم CogVideoX نمذجة الانتشار الاحتمالية لإزالة الضوضاء كآلية أساسية. يتعلم النموذج عكس عملية الضوضاء: إذ يُعطى تمثيلًا كامنًا لفيديو مشوّش، فيتنبأ بالضوضاء ويزيلها خطوة بخطوة حتى يبقى تمثيل كامن لفيديو نظيف.
ما يميّز CogVideoX عن نماذج الانتشار المبكرة للفيديو هو طريقة تعامله مع البعد الزمني. كانت معظم النماذج الأولى تعالج الإطارات بشكل مستقل نسبيًا، ما أدى إلى الوميض والحركة غير المتسقة. أما CogVideoX فيطبّق انتباهًا ثلاثي الأبعاد عبر الأبعاد المكانية والزمنية في آنٍ واحد، ما يتيح للنموذج أن يستدل على كيفية تغيّر البكسلات مع الزمن، لا على مكان ظهورها في كل إطار فحسب.
تصميم Expert Transformer
يستخدم العمود الفقري للمحوّل في CogVideoX استراتيجية تسوية طبقات تكيفية من نوع Expert. فبدلًا من مجموعة واحدة من معاملات التسوية لكل المحتوى، يجعل النموذج إحصاءات التسوية مشروطة بالنص المدخل. هذا يعني أن سلوك معالجة المحوّل يتغير حسب ما تصفه، ما يجعل النموذج أكثر استجابة للفروق الدلالية بين الأوامر.
يساعد هذا التصميم CogVideoX على الحفاظ على هوية الشخص عبر الإطارات. الشخص الموصوف في الأمر يبقى متسقًا بصريًا من إطار إلى آخر، بدلًا من أن ينحرف في مظهره كما فعلت بعض النماذج السابقة.
مشفّر النص وVAE الفيديو
يستخدم CogVideoX نموذج T5-XXL كمشفّر للنص، وهو نموذج اللغة نفسه ذو 11 مليار معامل المستخدم في Stable Diffusion 3 وعدد من المولّدات عالية الأداء الأخرى. ينتج T5-XXL تمثيلات دلالية غنية من الأوامر الطويلة والمفصلة، ما يمنح نموذج الفيديو مادة أكثر للعمل بها مقارنة بالمشفّرات الأبسط القائمة على CLIP.
من جهة الفيديو، يستخدم النموذج مُشفّرًا تلقائيًا متغيرًا ثلاثي الأبعاد (3D VAE) لضغط إطارات الفيديو في فضاء كامن مدمج يجري فيه الانتشار، ثم يفكّها مرة أخرى إلى فضاء البكسلات. دُرّب هذا المُشفّر على ترميز البنية المكانية والديناميكيات الزمنية معًا، لذا يحمل التمثيل الكامن معلومات الحركة قبل أن تبدأ عملية الانتشار.
CogVideoX مقابل المنافسين المغلقين

المقارنة الصادقة بين CogVideoX والنماذج المملوكة من الصف الأول دقيقة ومتعددة الجوانب. فهو لا يتفوق على Sora 2 من حيث الجودة البصرية الخام، ولا يضاهي المخرجات السينمائية لنموذج Kling v2.6 في أفضل إعداداته. لكن هذه المقارنة تغفل الهدف تمامًا.
مقارنة جودة المخرجات
لتوليد المقاطع القصيرة للأغراض العامة من النص، ينتج CogVideoX-5B مخرجات يصفها معظم المشاهدين بأنها مبهرة. تتحرك الأشياء بمنطق فيزيائي مقبول، وتتبع حركة الكاميرا الأمر بشكل معقول، وتبقى المشاهد متماسكة طوال مدة 6 ثوانٍ. دقة 720x480 الأصلية متواضعة وفق معايير 2027، لكنها كافية لمعظم حالات الاستخدام على الويب ووسائل التواصل الاجتماعي.
حيث يتخلف CogVideoX بوضوح عن النماذج المملوكة هو التفاصيل الدقيقة والحركات المعقدة. تظهر الأيدي والنصوص داخل المشاهد، والأجسام سريعة الحركة، أحيانًا بالتشوهات المألوفة في توليد الذكاء الاصطناعي. هذه قيود معروفة، وثّقها فريق THUDM بصراحة بدلًا من إخفائها.
ميزة الأوزان المفتوحة
تمنحك النماذج المغلقة مخرجات مصقولة دون أي تحكم في العملية الأساسية. أما CogVideoX فيمنحك الأوزان نفسها، وهذا يعني:
- الضبط الدقيق للنموذج على مجموعة بيانات الفيديو الخاصة بك لتخصيصه لمجال معين
- التشغيل محليًا على وحدة A100 واحدة أو وحدتي GPU استهلاكيتين بسعة 24GB
- الفحص والتعديل لبنية النموذج لأغراض البحث
- بناء مسارات الإنتاج دون تسعير API بالثانية يتغير بشكل غير متوقع
بالنسبة إلى فرق المنتجات التي تبني أدوات فيديو مدعومة بالذكاء الاصطناعي، غالبًا ما تفضّل التكلفة الإجمالية للملكية على المدى الطويل النماذج المفتوحة، حتى عندما تبدو تكلفة تشغيل النموذج لكل طلب في واجهات API المملوكة أرخص في البداية.
اختبارات معيارية ذات أهمية
في اختبارات توليد الفيديو المعيارية مثل EvalCrafter وVBench، يسجل CogVideoX-5B نتائج تنافسية مقارنةً بالنماذج التي كانت في طليعة التقنية في منتصف 2024. ويسجل نتائج جيدة بشكل خاص في الاتساق الدلالي (هل يطابق الفيديو الأمر؟) وسلاسة الحركة (هل يتحرك دون قطع مفاجئ؟).
| المقياس | CogVideoX-5B | واجهة API مغلقة نموذجية |
|---|
| المواءمة الدلالية | مرتفع | مرتفع جدًا |
| سلاسة الحركة | مرتفع | مرتفع |
| الدقة الأصلية | 720x480 | من 720p إلى 1080p |
| الأوزان المفتوحة | نعم | لا |
| قابل للضبط الدقيق | نعم | لا |
| تكلفة الاستضافة الذاتية | ~$0.01 إلى $0.05 | من $0.05 إلى $0.50+ |
ماذا يمكنك أن تبني باستخدام CogVideoX

تجعل الطبيعة المفتوحة للنموذج CogVideoX منه لبنة بناء، لا مجرد منتج استهلاكي. فقد استخدمه المطورون وصنّاع المحتوى في مجموعة واسعة من التطبيقات منذ إطلاقه، كثير منها كان سيكون مستحيلًا أو باهظ التكلفة بشكل مانع مع بدائل API مغلقة.
تحويل النص إلى فيديو عمليًا
أوضح استخدام هو ما يوحي به الاسم تمامًا: صف مشهدًا، فيولّد مقطعًا مصورًا. يتعامل CogVideoX مع طيف واسع من أساليب الأوامر، من الأوصاف السينمائية ("كلب استرداد ذهبي يركض بين أوراق الخريف، حركة بطيئة، ضوء بعد ظهيرة دافئ") إلى الرسوم المتحركة للمفاهيم المجردة ("تسارع زمني لمدينة تنمو من أرض خالية على مدى عقود").
تميل الأوامر الناجحة إلى أن تكون محددة في الموضوع والفعل والمكان والإضاءة. الأوامر الغامضة تنتج نتائج غير متسقة. أما الأوامر المفصلة التي تراعي توزيع بيانات التدريب للنموذج، أي مشاهد من العالم الحقيقي موصوفة بلغة طبيعية، فتنتج باستمرار أقوى المخرجات.
الضبط الدقيق لحالات استخدام مخصصة
هنا يتميز CogVideoX عن كل منافس مغلق. مع الوصول إلى الأوزان وإطار تدريب مثل Diffusers، يمكن للفرق ضبط النموذج دقيقًا على:
- ممثل أو شخصية محددة لمظهر متسق عبر عدة مقاطع
- أسلوب بصري محدد، مثل تدرج ألوان معين أو جماليات تصوير سينمائي بعينها
- منتج أو علامة تجارية لتوليد فيديو تجاري على نطاق واسع
- مجال متخصص ببيانات عامة محدودة، مثل التصور الطبي أو المحاكاة الصناعية
يتطلب الضبط الدقيق موارد GPU معتبرة، عادةً عدة بطاقات A100 لأوقات تنفيذ عملية، لكن القدرة على القيام به أصلًا أمر لا تقدمه حاليًا أي نماذج مملوكة للمستخدمين الخارجيين.
تشغيله محليًا
يمكن تشغيل CogVideoX-5B على وحدة GPU واحدة من نوع A100 بسعة 40GB، أو عبر وحدتي GPU استهلاكيتين بسعة 24GB باستخدام تفريغ النموذج (model offloading). توفّر مكتبة Hugging Face Diffusers تكاملًا مباشرًا، لذا لا يتطلب الإعداد سوى بضعة أسطر من Python بدلًا من أسابيع من العمل على البنية التحتية.
نصيحة: لتشغيل أسرع دون التضحية بجودة تُذكر، استخدم النسخ المكمّاة (quantized) من CogVideoX المتاحة على Hugging Face. تقلل هذه النسخ متطلبات VRAM بشكل كبير مع إبقاء جودة المخرجات قريبة من النموذج كامل الدقة.
كيف تستخدم CogVideoX 5B على PicassoIA

إذا أردت تجربة CogVideoX دون إعداد وحدة GPU خاصة بك، فإن CogVideoX 5B متاح مباشرةً على PicassoIA. تحصل على النموذج المفتوح المصدر نفسه يعمل في السحابة، دون الحاجة إلى إدارة التبعيات أو إصدارات CUDA أو شراء العتاد.
تعليمات خطوة بخطوة
- افتح CogVideoX 5B على PicassoIA في متصفحك.
- اكتب وصف الفيديو في حقل الأمر النصي. كن محددًا: اذكر الموضوع والفعل والبيئة والإضاءة.
- اضبط عدد خطوات التشغيل إن توفّر ذلك. الخطوات الأعلى (50 أو أكثر) تنتج مخرجات أكثر سلاسة مقابل زمن توليد أطول.
- اضغط على توليد وانتظر حتى يُصيَّر المقطع، وعادةً يستغرق ذلك من 60 إلى 120 ثانية في الوضع السحابي.
- نزّل الفيديو المولَّد أو شاركه مباشرةً من الواجهة.
نصائح لأوامر نصية أفضل
- ابدأ بالشخص: "امرأة ترتدي معطفًا أحمر تمشي في غابة مغطاة بالثلوج" تتفوق على "غابة مغطاة بالثلوج فيها امرأة"
- صف الحركة صراحةً: "تتحرك الكاميرا ببطء نحو اليسار" أو "يستدير الشخص ليواجه الكاميرا" يمنح النموذج توجيهًا واضحًا
- أدرج معلومات الإضاءة: "ضوء منتشر غائم"، "إضاءة جانبية في الساعة الذهبية"، أو "ضوء مصباح دافئ داخل المكان" تغيّر مزاج المخرجات بشكل كبير
- تجنّب النفي في الأوامر: قول ما لا تريده أقل فاعلية بكثير من وصف ما تريده بدقة
الاستفادة القصوى من المعاملات
عندما تكون خطوات التشغيل قابلة للضبط، فإن 30 إلى 50 خطوة هي النقطة المثالية بين السرعة والجودة. تجاوز 75 خطوة نادرًا ما يحسّن المخرجات بشكل ملموس. أما مقياس التوجيه (guidance scale)، عند إتاحته في الواجهة، فيتحكم في مدى التزام النموذج بأمرك مقابل التوليد بحرية إبداعية أكبر. القيم بين 6 و9 تعمل جيدًا مع معظم الأوامر الوصفية للمشاهد الواقعية.
القيود الحقيقية التي يجب أن تعرفها

لا تفيد أي مراجعة لنموذج دون التطرق إلى ما لا يعمل. لدى CogVideoX قيود محددة تؤثر على ما يمكنك إنتاجه فعليًا به، ومعرفتها مسبقًا توفر عليك الكثير من الإحباط.
قيود الدقة والمدة
المخرجات القياسية هي 720x480 بمعدل 8 إطارات في الثانية لمدة 6 ثوانٍ تقريبًا. لاستخدامات وسائل التواصل الاجتماعي، هذا مقبول. أما للبث التلفزيوني أو منصات البث أو إنتاجات الجودة العالية، فهو دون التوقعات الحالية. نماذج مثل LTX 2 Pro تولّد بدقة 4K، وWan 2.7 T2V يصل إلى 1080p مع مقاطع أطول. إذا كانت الدقة أو المدة متطلبك الأساسي، فهذه خيارات أقوى لسير عملك.
رفع دقة المخرجات عبر أداة رفع دقة الفيديو بالذكاء الاصطناعي يمكن أن يدفع مخرجات CogVideoX إلى 1080p بصريًا، لكن هذا يضيف خطوة معالجة ولا يستعيد تفاصيل لم تُولَّد أصلًا.
متطلبات العتاد
تشغيل CogVideoX ذاتيًا يتطلب عتادًا معتبرًا. يحتاج نموذج 5B بالدقة الكاملة إلى بطاقة GPU بسعة 40 جيغابايت. نموذج 2B أخف، لكنه ينتج مخرجات أنعم بوضوح وبدقة دلالية أقل. بالنسبة إلى معظم صنّاع المحتوى الأفراد والفرق الصغيرة، يعني هذا الاعتماد على خدمة سحابية بدلًا من تشغيل النموذج محليًا، ما يلغي جزئيًا ميزات التكلفة في الأوزان المفتوحة.
ما الذي لا يزال يخطئ فيه
- الأيدي والوجوه في الحركة غالبًا ما تظهر فيها تشوهات، خاصة مع التفاعلات المعقدة أو السريعة
- النصوص داخل المشاهد نادرًا ما تكون مقروءة أو متسقة، وهذا قيد مشترك في معظم نماذج توليد الفيديو
- حركات الكاميرا المعقدة، مثل اللقطات التتبعية الطويلة عبر الحشود، تفقد تماسكها مع امتداد مدتها
- المقاطع التي تتجاوز 6 ثوانٍ تتطلب دمج عدة توليدات معًا، ما يُدخل تحديات في الاتساق عند الوصلات
هذه مجالات بحث نشطة، وقد حسّنت النسخ التي ضبطها المجتمع دقيقًا عددًا من هذه النقاط منذ إطلاق النموذج الأساسي في منتصف 2024.
المشهد الأوسع لفيديو المصدر المفتوح

لم يظهر CogVideoX في فراغ. يضم مشهد توليد الفيديو المفتوح المصدر في 2024-2025 عدة منافسين أقوياء، لكل منهم نقاط قوة مختلفة وحالات استخدام مستهدفة مختلفة.
نماذج أخرى تستحق المتابعة
Hunyuan Video من Tencent ينتج مقاطع أطول بديناميكيات حركة أفضل ودقة أعلى. يتطلب قدرة حوسبة أكبر، ويمثل حتى أوائل 2025 السقف الحالي لجودة الفيديو المفتوح المصدر.
LTX Video من Lightricks يعطي الأولوية لسرعة التوليد، فينتج مقاطع تقريبًا في الوقت الفعلي على العتاد الاستهلاكي. سقف الجودة أدنى، لكن سرعة التكرار أسرع بكثير لسير العمل الذي يحتاج إلى نماذج أولية سريعة.
Wan 2.7 T2V من Wan-Video يقدم مستويات دقة متعددة وقدرات قوية في تحويل الصورة إلى فيديو إلى جانب تحويل النص إلى فيديو، ما يجعله أكثر تنوعًا لسير العمل الذي يتضمن تحريك مرئيات موجودة إلى جانب توليد مرئيات جديدة.
أين يقع CogVideoX
يحتل CogVideoX موقعًا محددًا في هذا المشهد: نموذج موثّق جيدًا، قابل للاستخدام تجاريًا، وقابل للضبط الدقيق، مع تطابق دلالي جيد ومتطلبات عتاد معقولة. ليس الأعلى دقة، ولا الأسرع، ولا الأغنى بالميزات. لكنه النموذج ذو أوضح توثيق وأنظف ترخيص وأحد أنشط منظومات التطوير المجتمعي.
بالنسبة إلى المطورين الذين يبنون فوق توليد الفيديو، فإن هذا المزيج من الخصائص يهم أكثر من درجات الاختبارات المعيارية الخام في كثير من السيناريوهات الواقعية.
ولّد أول فيديو بالذكاء الاصطناعي اليوم

القراءة عن CogVideoX لا تكفي وحدها. البنية مثيرة للاهتمام، وقصة المصدر المفتوح مقنعة، والاختبارات المعيارية مفيدة. لكن ما يهم فعلًا هو ما إذا كان ينتج مقاطع فيديو يمكنك استخدامها لهدفك الإبداعي أو التقني المحدد.
يتيح لك CogVideoX 5B على PicassoIA توليد مقطع خلال دقائق دون أي إعداد أو عتاد أو تهيئة. اكتب وصفًا محددًا، واضغط توليد، وشاهد ما يفعله النموذج بأمرك.
إلى جانب CogVideoX، يشغّل PicassoIA أكثر من 87 نموذجًا لتحويل النص إلى فيديو، من بينها Kling v2.6 وWan 2.7 T2V وSora 2، وكلها متاحة دون إدارة البنية التحتية أو التعامل مع مفاتيح API. إذا لم يناسب CogVideoX حالتك، فأنت على بُعد نقرة واحدة من تجربة نموذج مختلف تمامًا بنقاط قوة مختلفة.
أفضل طريقة لتكوين رأي حقيقي عن أي نموذج لتوليد الفيديو هي توليد فيديو به. ابدأ بمشهد تعرفه جيدًا، صفه بدقة، وقارن بين ما يعود إليك. هذه التجربة العملية ستخبرك أكثر من أي جدول اختبارات معيارية أو شرح تقني. ابدأ مع CogVideoX 5B وانظر إلى أين سيأخذك.