Genmo Mochi: أداة الذكاء الاصطناعي المجانية مفتوحة المصدر لتوليد الفيديو التي تستحق اهتمامك

Mochi 1 من Genmo نموذج لتوليد الفيديو بالذكاء الاصطناعي مفتوح المصدر ومجاني للاستخدام، ويتميز بثبات زمني استثنائي وجودة حركة سلسة. يشرح هذا المقال كيف يعمل Mochi 1، وما الذي يميزه عن أدوات توليد الفيديو الأخرى، وكيف يؤدي في الاختبارات الواقعية، وأين يمكنك البدء باستخدامه الآن دون أن تدفع أي مبلغ.

Genmo Mochi: أداة الذكاء الاصطناعي المجانية مفتوحة المصدر لتوليد الفيديو التي تستحق اهتمامك
Cristian Da Conceicao
مؤسس Picasso IA

شهد مجال الفيديو بالذكاء الاصطناعي المفتوح المصدر منافسًا جادًا. أطلقت Genmo نموذج Mochi 1 في أواخر عام 2024 مع إتاحة أوزان النموذج الكاملة للعموم، ومنذ ذلك الحين بدأ يدخل خطوط الإنتاج وسير العمل الإبداعي ومشاريع البحث حول العالم. إذا كنت تتابع مجال تحويل النص إلى فيديو وتتساءل عما إذا كان أي خيار مجاني يستطيع فعلًا منافسة البدائل المدفوعة، فإن Mochi 1 هو أول جواب حقيقي يستحق الاهتمام.

محترف تحرير فيديو بالذكاء الاصطناعي عند محطة العمل

ما هو Mochi 1 فعليًا

Mochi 1 نموذج انتشار لتحويل النص إلى فيديو طوّرته Genmo، وهي شركة أبحاث في الذكاء الاصطناعي تركز على توليد الفيديو متعدد الوسائط. صدر بموجب ترخيص Apache 2.0، ما يجعله أحد أكثر نماذج الفيديو المفتوحة المصدر تساهلًا المتاحة. هذا يعني أنه يمكنك تنزيله وتشغيله محليًا وتعديله وضبطه بدقة واستخدام المخرجات تجاريًا دون دفع رسوم ترخيص.

يولّد النموذج فيديوهات عالية الجودة تصل مدتها إلى 5.4 ثانية بدقة 480p، مع ثبات زمني قوي عبر الإطارات. دُرّب على مجموعة بيانات فيديو ضخمة، وصُمم خصيصًا لإنتاج حركة سلسة وطبيعية بدلًا من الحركة المتقطعة أو المشوّهة التي عانت منها البدائل المفتوحة المصدر الأقدم.

محوّل الانتشار غير المتماثل

ما يميز Mochi 1 على المستوى التقني هو بنيته. فبدلًا من استخدام بنية محوّل الانتشار المعتادة، بنت Genmo ما تسميه محوّل الانتشار غير المتماثل (AsymmDiT). يعالج هذا النهج توكنات الفيديو والنص بطريقة مختلفة جوهريًا:

  • توكنات الفيديو تحصل على الجزء الأكبر من الحوسبة وطبقات الانتباه
  • توكنات النص تتفاعل مع توكنات الفيديو عبر آلية انتباه متقاطع خفيفة الوزن
  • النتيجة: دقة أفضل وجودة حركة أعلى لكل وحدة حوسبة مستهلكة

هذا مهم لأن معظم نماذج انتشار الفيديو تعامل توكنات النص والفيديو بشكل متماثل، ما يهدر ميزانية الحوسبة على جانب النص. يضع AsymmDiT تلك الحوسبة حيث تُحدث الفرق فعلًا.

لماذا يغيّر المصدر المفتوح الأمور

تتحكم أدوات توليد الفيديو المغلقة فيما يمكنك إنشاؤه، وبأي دقة، ولأي استخدام. يزيل Mochi 1 هذه القيود تمامًا. يستطيع الباحثون ضبط النموذج بدقة على مجالات محددة، منها التصوير الطبي وتصور العمارة والأزياء. ويستطيع المطورون دمجه في تطبيقات مخصصة. ويملك المبدعون كل إطار ينتجونه.

ويتيح ترخيص Apache 2.0 أيضًا الاستخدام التجاري، ما يجعل Mochi 1 خيارًا عمليًا للوكالات واستوديوهات الإنتاج التي تحتاج إلى إبقاء تكاليف خط إنتاج المحتوى متوقعة.

مساحة عمل مطور تضم شيفرة وأوراق بحثية

ما الذي يحسنه Mochi

ليس كل إصدار مفتوح المصدر يقدم ما يعد به. يتميز Mochi 1 في ثلاثة مجالات محددة يبرزها المستخدمون باستمرار في المقارنات المجتمعية.

حركة متماسكة

أكثر أنماط الفشل شيوعًا في فيديو الذكاء الاصطناعي هو عدم الثبات الزمني: تتشوه الوجوه بين الإطارات، وتومض الأشياء، وتتغير الخلفيات بطرق غير طبيعية. يتعامل Mochi 1 مع هذا بشكل أفضل من النماذج المفتوحة السابقة. تنتج بنية AsymmDiT، مع التدريب على مجموعة بيانات منتقاة للحركة العالية، فيديوهات تتحرك فيها الأشخاص بتناغم وتبقى البيئات مستقرة طوال المقطع.

💡 نصيحة احترافية: الأوامر النصية التي تصف حركة متواصلة (شخص يمشي، ماء يتدفق، أوراق تتساقط) تنتج أفضل نتائج Mochi. أوصاف المشاهد الثابتة لا تمنح النموذج بنية حركية كافية للعمل عليها.

التعبيرية في حركة الشخصيات

من نقاط قوة Mochi المحددة التعبير الوجهي والجسدي. عندما يصف الأمر النصي شخصًا يتفاعل عاطفيًا، يميل Mochi إلى تقديم هذا التفاعل بإقناع بدلًا من الاكتفاء بتعبير متجمد مع حركة للشفاه. هذا يجعله مفيدًا بشكل خاص للمحتوى السردي والأفلام القصيرة وفيديوهات وسائل التواصل الاجتماعي التي تتطلب حضورًا حقيقيًا للشخصية.

الالتزام بالأمر النصي

يتبع Mochi 1 أوصاف الأوامر النصية المعقدة بأمانة أكبر من كثير من البدائل في الفئة السعرية نفسها (مجانًا). يمكنك تحديد حركة الكاميرا وسلوك الشخص والتفاصيل البيئية في أمر نصي واحد، وتتوقع أن يحاول النموذج تنفيذ كل ذلك. النتائج ليست مثالية دائمًا، لكن الالتزام بالنية واضح.

مقارنة جودة الفيديو عبر شاشتين

Mochi 1 مقابل نماذج الفيديو الأخرى

يستحق الأمر وضع Mochi 1 في سياق المشهد الحالي. يضم مجال تحويل النص إلى فيديو عشرات النماذج، المجانية والمدفوعة. إليك كيف يقارن Mochi بالنماذج التي يصادفها معظم المبدعين:

النموذجمفتوح المصدرالدقةجودة الحركةالترخيص
Mochi 1نعم480pممتازةApache 2.0
CogVideoX 5Bنعم480pجيدةApache 2.0
LTX Videoنعم768pجيدةApache 2.0
Hunyuan Videoنعم720pجيدة جدًامخصص
Soraلا1080pممتازةمغلق
Klingلا1080pجيدة جدًامغلق

يروي الجدول قصة واضحة: يتصدر Mochi 1 فئة المصدر المفتوح في جودة الحركة، وإن كان يتنازل عن الدقة لصالح نماذج أحدث مثل Hunyuan. بالنسبة للفرق التي تعطي الأولوية للحركة التعبيرية على الدقة الخام، يبقى Mochi أقوى خيار مجاني.

متى تكون النماذج المدفوعة منطقية

تنتج الخيارات المدفوعة مثل Kling v2.6 أو Pixverse v5 مقاطع أطول (تصل إلى 10 ثوانٍ أو أكثر)، ودقات أعلى، وتوليدًا أسرع على عتاد احترافي. إذا كنت تنتج محتوى تجاريًا على نطاق واسع وكانت الجودة غير قابلة للتفاوض، فإن الباقة المدفوعة تصبح مبررة. أما في النماذج الأولية والتجريب الإبداعي أو الإنتاجات المستقلة ذات الميزانيات الصغيرة، فيقدم Mochi 1 نتائج جدية دون اشتراك.

صانع محتوى عند مكتب في استوديو منزلي حديث

كيفية استخدام Mochi 1 على PicassoIA

تستضيف PicassoIA النموذج Mochi 1 مباشرة، ما يتيح لك تشغيله عبر المتصفح دون إعداد بيئة محلية أو تنزيل أوزان النموذج أو إدارة عتاد GPU. إليك الخطوات بالتفصيل:

الخطوة 1: افتح صفحة النموذج

انتقل إلى Mochi 1 على PicassoIA. تظهر الواجهة حقل إدخال أوامر نصية واضحًا مع أدوات التحكم في المعاملات في اللوحة الجانبية. لا يلزم حساب لمعاينة المخرجات.

الخطوة 2: اكتب أمرك النصي

الأمر النصي هو أهم متغير لديك. يستجيب Mochi 1 بأفضل شكل للأوامر النصية التي تكون:

  • محددة بشأن الحركة: "امرأة تدير رأسها ببطء نحو اليسار" أفضل من "امرأة"
  • وصفية بشأن البيئة: أدرج ظروف الإضاءة وتفاصيل الخلفية وسياق المشهد
  • موجزة لكنها كاملة: من 30 إلى 60 كلمة هي غالبًا النقطة المثالية

مثال على أمر نصي يعمل بشكل جيد: "امرأة شابة تجلس بجانب نافذة تتساقط عليها الأمطار، تدير رأسها ببطء لتنظر إلى الكاميرا، إضاءة مصباح دافئة داخل المنزل على وجهها، أضواء المدينة الضبابية في الخلفية، أجواء سينمائية ناعمة"

الخطوة 3: اضبط معاملاتك

تعرض واجهة النموذج على PicassoIA بعض المعاملات المهمة:

المعاملوظيفتهالقيمة الموصى بها
Stepsخطوات إزالة الضوضاء أثناء تشغيل النموذج64 للجودة، 30 للسرعة
CFG Scaleمدى الالتزام بالأمر النصيمن 4.5 إلى 6.0
Seedالتحكم في قابلية التكرارعشوائي للتنوع

الخطوة 4: ولّد وكرّر

اضغط على توليد وانتظر. لا يكتمل Mochi 1 فورًا، حتى على الأجهزة السحابية، لكن التوليد يستغرق عادةً أقل من 2 دقيقة. إذا لم تطابق النتيجة الأولى رؤيتك، فعدّل الأمر النصي أولًا بدلًا من المعاملات. النموذج أكثر حساسية لتغييرات اللغة منه للتعديلات الرقمية.

💡 نصيحة: أضف واصفات الحركة في بداية الأمر النصي. "Slow pan across..." أو "Close-up of hands slowly..." يحدد زاوية الكاميرا وسياق الحركة قبل وصف الموضوع الرئيسي، ويحسّن النتائج باستمرار.

الخطوة 5: ارفع الدقة عند الحاجة

بما أن Mochi 1 يُخرج الفيديو بدقة 480p، قد ترغب في تمرير النتيجة عبر أداة لرفع الدقة لتصل إلى 720p أو 1080p للنشر. تقدم PicassoIA نماذج رفع الدقة التي ترفع دقة إطارات الفيديو بفعالية دون خسارة كبيرة في التفاصيل الدقيقة.

البنية التحتية لغرفة الخوادم لاستضافة نماذج الذكاء الاصطناعي

حالات استخدام حقيقية لنموذج Mochi 1

القدرات النظرية أقل أهمية مما يبنيه الناس فعلًا بهذا النموذج. إليك الفئات التي يؤدي فيها Mochi 1 بثبات.

وسائل التواصل الاجتماعي والمحتوى القصير

أوجدت TikTok وInstagram Reels وYouTube Shorts طلبًا مستمرًا على محتوى فيديو قصير جذاب بصريًا، لكنه ليس بالضرورة سينمائيًا. تناسب مقاطع Mochi 1 التي تبلغ 5 ثوانٍ هذا الشكل تمامًا. يستطيع صانع محتوى في الموضة توليد لقطات داعمة تُظهر عارضة في بيئة خارجية طبيعية. ويستطيع مدوّن طعام تصوير وصفة في حركة. ويستطيع حساب سفر إنتاج مقاطع تشويقية عن وجهات دون طاقم تصوير.

ومخرجات 480p مقبولة للمنصات التي تعتمد على الهاتف أولًا، حيث يشاهد المستخدمون على شاشات صغيرة مع بث مضغوط.

امرأة جذابة عند رصيف شاطئ في ضوء ذهبي

الرسم القصصي والتصور المسبق

يستخدم المخرجون السينمائيون ومنتجو الإعلانات فيديو الذكاء الاصطناعي في الأنيماتيك، وهي اختبارات الحركة الأولية التي تُجرى قبل الالتزام بتصوير مكلف. يناسب Mochi 1 هذا الاستخدام لأن حركة شخصياته مقنعة بما يكفي لنقل طاقة المشهد إلى عميل أو مدير إبداعي دون صقل الإنتاج النهائي. وبالنسبة لصانعي الأفلام المستقلين تحديدًا، فإن القدرة على توليد التصور المسبق دون ميزانية ميزة تشغيلية كبيرة.

البحث وضبط النموذج بدقة

بما أن الأوزان مفتوحة بالكامل، أصبح Mochi 1 بيئة أساسية للبحث. تعمل الفرق على ضبطه بدقة على مجالات بصرية محددة: الجولات المعمارية، والمحاكاة الطبية، وديناميكيات المركبات، والتقاط حركة الرياضة. ويعني ترخيص Apache 2.0 أن هذه النسخ المضبوطة يمكن نشرها تجاريًا دون تعقيدات قانونية.

تكاملات المطورين

يمكن استدعاء النموذج عبر API من منصات مثل Replicate، ما يجعل دمج توليد فيديو الذكاء الاصطناعي في تطبيقات الويب والجوال وخطوط الأتمتة أمرًا مباشرًا. فمطور يبني أداة لبطاقات تهنئة فيديو مخصصة، على سبيل المثال، يستطيع دمج Mochi 1 كخلفية للتوليد دون بناء بنية تشغيل مخصصة من الصفر.

مطور برمجيات يفكر عند محطة عمل متعددة الشاشات

نماذج فيديو مجانية أخرى تستحق المعرفة

يُعد Mochi 1 أقوى خيار مفتوح المصدر من حيث جودة الحركة، لكنه ليس الخيار الوحيد. وحسب احتياجاتك المحددة، قد تكون هذه البدائل أنسب لمشاريع معينة:

CogVideoX 5B

CogVideoX 5B من جامعة تسينغهوا وZhipu AI نموذج آخر قوي بترخيص Apache 2.0. يتفوق في محاذاة النص والفيديو، وينتج مشاهد متماسكة عندما يصف الأمر النصي تفاعلات محددة بين الأشياء. وهو متأخر قليلًا عن Mochi في الحركة التعبيرية للشخصيات، لكنه خيار ثانٍ موثوق للمحتوى السردي.

Pyramid Flow

يستخدم Pyramid Flow نهج انتشار قائم على الهرم يتيح توليدًا فعالًا عبر دقات متعددة. وهو أسرع من Mochi على العتاد نفسه، ويقدم نتائج جيدة للمحتوى الطبيعي والبيئي، حيث تهم جودة المشهد أكثر من التعبيرية الشخصية.

Stable Diffusion Videos

يظل Stable Diffusion Videos خيارًا متينًا لمن استثمر بالفعل في منظومة Stable Diffusion. يقدم دقة أقل من Mochi، لكنه يتكامل بسهولة مع سير عمل SD الحالي وخطوط ControlNet للتحكم المنظم في الحركة.

متى تختار Wan بدلًا من ذلك

تنتج سلسلة Wan 2.7 T2V مخرجات بدقة 1080p وتدعم مدد مقاطع أطول. إذا كانت الدقة وطول المقطع أهم من الوصول المفتوح المصدر، فإن Wan 2.7 يستحق النظر. وهو متاح على PicassoIA وينتج نتائج سينمائية للمحتوى التجاري الذي يتطلب جودة جاهزة للنشر منذ البداية.

يدان تكتبان على لوحة مفاتيح ميكانيكية لكتابة أوامر الذكاء الاصطناعي

أنماط الأوامر النصية التي تعمل فعلًا

كتابة الأوامر النصية لنموذج Mochi 1 مهارة تتطور مع الممارسة، لكن بعض الأنماط تنتج نتائج قوية باستمرار من البداية.

صيغة الموضوع والحركة والبيئة والإضاءة:

ابدأ بالشخص وما يفعله، ثم صف البيئة، ثم حدد الإضاءة. يمنح هذا النموذج بنية مكانية وزمنية واضحة.

مثال: "رجل يرتدي قميصًا من الكتان يرفع فنجان قهوة ببطء نحو شفتيه، جالسًا عند طاولة مقهى خشبية على شرفة خارجية مشمسة، ضوء شمس بعد الظهر الدافئ يأتي من الأعلى إلى اليسار، عمق ميداني ضحل"

ما يجب تجنبه:

  • لا تصف أشخاصًا متعددين بأفعال متنافسة في أمر نصي واحد
  • تجنب الحالات المجردة أو العاطفية دون مرتكزات جسدية ("شعور بالفرح" لا ينتج شيئًا مفيدًا؛ "شخص يضحك وهو ينظر إلى مطر يتساقط" ينجح)
  • لا تطلب نصوصًا مراكبة أو خطوطًا محددة في الفيديو

الأوامر النصية السلبية المفيدة:

إضافة توجيه سلبي مثل "ضبابي" و"وجوه مشوهة" و"علامة مائية" و"جودة منخفضة" يحسّن المخرجات باستمرار، حتى عندما يكون الأمر النصي الأساسي مكتوبًا جيدًا. وهذا صحيح بشكل خاص للقطات المقربة للوجوه.

سباق فيديو الذكاء الاصطناعي مفتوح المصدر

ظهر Mochi 1 في لحظة كانت فيها عدة فرق ممولة جيدًا تراهن جميعًا على نماذج الفيديو المفتوحة المصدر كاستراتيجية لبناء المجتمع. أصدرت Stability AI و Tencent و Lightricks و Genmo جميعها نماذج مفتوحة الأوزان في نافذة زمنية قصيرة في أواخر 2024 وأوائل 2025. والنتيجة منظومة مفتوحة المصدر أغنى مما توقعه أي أحد.

أوضحت Genmo خارطة طريقها بشفافية: مخرجات بدقة أعلى، ومدد مقاطع أطول، ونسخ مضبوطة مدربة على فئات محتوى محددة، وكلها قيد التطوير النشط. وقد أنتج مجتمع Mochi على Hugging Face بالفعل نسخًا مضبوطة مُحسّنة للأنمي والواقعية الفوتوغرافية وفيديو البورتريه، ما يوضح مدى سرعة تكيّف النموذج المفتوح.

ما يعنيه هذا للمبدعين أن سقف جودة توليد الفيديو المجاني يرتفع بسرعة. نماذج كانت تتطلب مئات الدولارات شهريًا من الحوسبة السحابية في 2023 أصبحت متاحة الآن عبر المتصفح وأمر نصي واحد.

مساحة عمل مشتركة يعمل فيها محترفون بأدوات الإبداع بالذكاء الاصطناعي

ابدأ الإبداع الآن

إذا كنت تنتظر أداة فيديو بالذكاء الاصطناعي مجانية ومتساهلة وتنتج نتائج جيدة فعلًا، فإن Mochi 1 هو ما تبحث عنه. النموذج متاح على PicassoIA الآن، دون تنزيل ودون اشتراك.

جرّب Mochi 1 مع مشهد بورتريه قصير أو لقطة بيئية بسيطة. وبعد أن تتقن الأساسيات، جرّب أوامر نصية أطول وأكثر تفصيلًا، ومرّر المخرجات عبر إحدى أدوات رفع الدقة في PicassoIA لرفع الجودة النهائية للنشر.

إلى جانب Mochi، تستضيف PicassoIA أكثر من 100 نموذج لتوليد الفيديو في مجموعة تحويل النص إلى فيديو، تتراوح من خيارات مفتوحة المصدر مجانية إلى أقوى النماذج التجارية المتاحة. اقضِ جلسة تقارن فيها المخرجات من Mochi 1 وWan 2.7 وKling v2.6 جنبًا إلى جنب. وسيخبرك الفرق في ما يتقنه كل نموذج بأكثر مما يخبرك به أي جدول للاختبارات المعيارية.

مجتمع توليد الفيديو المفتوح المصدر يبني شيئًا مفيدًا فعلًا. Mochi 1 دليل على أنك لا تحتاج إلى دفع مبلغ مرتفع لإنشاء محتوى فيديو بالذكاء الاصطناعي مقنع.

شارك هذا المقال

اختر لغتك

مقالات ذات صلة