كان توليد الفيديو المجاني بالذكاء الاصطناعي يعني مقاطع متقطعة ومنخفضة الدقة لا تشبه الأمر النصي أبدًا. وتغيّر ذلك بسرعة. في 2027، تنتج عدة نماذج لتحويل النص إلى فيديو نتائج مبهرة فعلًا دون أي تكلفة، ولا تحتاج إلى GPU أو خلفية تقنية أو اشتراك للوصول إليها. تكتب الأمر النصي، وتنقر على توليد، فيصبح لديك خلال ثوانٍ مقطع فيديو حقيقي بالذكاء الاصطناعي جاهز للاستخدام.
يستعرض هذا المقال أفضل أدوات تحويل النص إلى فيديو المتاحة الآن، وأداء كل منها عمليًا، وما الذي يفصل الجيد عن الممتاز فيما يخص الأوامر النصية وجودة المخرجات.
ماذا يعني "تحويل النص إلى فيديو" فعلًا؟

كيف تعمل التقنية
تستخدم نماذج تحويل النص إلى فيديو عملية تُسمى الانتشار (diffusion) لتوليد تسلسلات الفيديو إطارًا تلو آخر من وصف مكتوب. تكتب الأمر النصي، فيفسّره النموذج ويركّب حركة متماسكة تطابق ما وصفته. النموذج لا يسجّل أي شيء، بل يولّد كل بكسل من الصفر.
الفرق بين النماذج الحديثة والقديمة يعود إلى أمرين: الاتساق الزمني (مدى سلاسة ربط الإطارات عبر الزمن) والمطابقة الدلالية (مدى دقة مطابقة المخرجات لكلماتك). فشلت أدوات تحويل النص إلى فيديو الأولى في الأمرين. كان وجه الشخص يتغيّر شكله بين الإطارات، أو تنتج عبارة "كلب يركض" كلبًا يكاد لا يتحرك.
نماذج مثل LTX-2 Distilled وWAN 2.6 T2V تمثل جيلًا جديدًا يحل المشكلتين بجزء بسيط من التكلفة الحسابية للأنظمة السابقة. تعمل بسرعة، ونتائجها جيدة، وهي متاحة للجميع.
ما الذي يمكن توقعه بواقعية دون مقابل

للتوليد المجاني للفيديو قيود حقيقية. فهمها مسبقًا يوفّر عليك الإحباط:
| الميزة | المستوى المجاني | المستوى المدفوع |
|---|
| مدة المقطع | 3-6 ثوانٍ | 8-60 ثانية |
| الدقة | من 480p إلى 720p | من 720p إلى 4K |
| سرعة التوليد | من 20 ثانية إلى 5 دقائق | 10-30 ثانية |
| العلامات المائية | أحيانًا | غالبًا لا توجد |
| حقوق الاستخدام التجاري | محدودة | كاملة |
| التوليدات اليومية | مقيّدة | حجم كبير |
بالنسبة إلى مقاطع وسائل التواصل الاجتماعي، والإعلانات القصيرة، واختبار الأفكار، والتجريب الإبداعي، تعمل المستويات المجانية بشكل جيد جدًا. أما لإنتاج البث التلفزيوني أو الإنتاج التجاري بكميات كبيرة، فالترقية منطقية. لكن نقطة الدخول المجانية مفيدة فعلًا، وليست مجرد عرض تجريبي.
أفضل النماذج المجانية الآن
شهد مشهد تحويل النص إلى فيديو المجاني تحولًا كبيرًا في 2025. صارت عدة نماذج قوية مفتوحة المصدر تعمل على بنية سحابية مشتركة، ما يعني أن أي شخص يملك متصفحًا يمكنه الوصول إليها دون تثبيت أي شيء محليًا.

LTX-2 Distilled: أسرع خيار مجاني
LTX-2 Distilled من Lightricks هو أسرع نموذج مجاني بالكامل لتحويل النص إلى فيديو متاح حاليًا. يولّد مقاطع مدتها 4 ثوانٍ بدقة 480p في أقل من 30 ثانية، وأحيانًا يقترب الوقت من 15 ثانية. كلمة "Distilled" في الاسم تشير إلى تقنية تدريب تضغط قدرات النموذج الكامل في نسخة أخف وأسرع.
ما يميّزه هو فيزياء الحركة المتسقة. تتحرك الأشياء في مقاطع LTX-2 Distilled كما تتوقع أن تتحرك في العالم الحقيقي. الشخص الذي يمشي يبدو كشخص يمشي، لا كشخص ينزلق. تتموج المياه بتوتر سطحي حقيقي، وتتطاير الأوراق في مسارات قابلة للتصديق.
نموذجه الشقيق، LTX-2.3-Fast، يدفع الجودة أبعد من خلال التزام أفضل بالأوامر النصية وانتقالات إضاءة أكثر طبيعية بين الإطارات. وهو أبطأ قليلًا لكنه ينتج مخرجات أوضح بشكل ملحوظ، خاصة في لقطات القرب للشخص. إذا كان LTX-2 Distilled أداتك للنماذج الأولية، فإن LTX-2.3-Fast هو الخطوة التالية نحو الإنتاج.
WAN 2.5 وWAN 2.6: جودة سينمائية مفتوحة المصدر
WAN 2.5 T2V Fast يقدّم مقاطع مدتها 5 ثوانٍ بدقة 720p، بحركة تضاهي أدوات تجارية تكلّف مالًا حقيقيًا. وتُعد سلسلة WAN من wan-video على الأرجح أقوى بنية مفتوحة المصدر لتوليد الفيديو المتاحة اليوم.
WAN 2.6 T2V يحسّن سابقه باستدلال مكاني أفضل. عندما يصف أمرك النصي حركة كاميرا، مثل "انتقال يسارًا عبر خط الأفق" أو "دفع بطيء نحو وجه الشخص"، ينفّذ WAN 2.6 الحركة فعلًا بحركة كاميرا مقنعة. وهذه قدرة نادرة بلا تكلفة، وهي تغيّر ما يمكنك تحقيقه إبداعيًا.
نصيحة: تستجيب نماذج WAN بشكل استثنائي للغة السينمائية. استخدم عبارات مثل "لقطة دولي بطيئة" أو "كاميرا محمولة" أو "الساعة الذهبية مع إضاءة خلفية" أو "تحويل التركيز إلى المقدمة". ستحصل على نتائج أكثر أجواءً بكثير مقارنة بالأوصاف البسيطة.
CogVideoX-5B: أفضل جودة مجانية لكل مقطع

CogVideoX-5B يقع في الطرف الأعلى من جودة الفيديو المجاني. يولّد مقاطع مدتها 6 ثوانٍ مع احتفاظ استثنائي بالتفاصيل عبر الإطارات، ما يعني أن المشاهد المعقدة ذات الحركات المتعددة تبقى متماسكة بصريًا من البداية إلى النهاية.
هو أبطأ من LTX-2 Distilled، ويستغرق عادة من دقيقتين إلى 4 دقائق لكل توليد حسب حمل الخادم. لكن جودة المخرجات تبرر الانتظار عندما تحتاج إلى أفضل نتيجة ممكنة من أداة مجانية. المشاهد التي فيها أشخاص متعددون، أو بيئات دقيقة، أو تفاصيل حركة دقيقة، كلها تستفيد من عمق CogVideoX-5B.
PixVerse v5.6 وHailuo 2.3 Fast: الأسلوب والسرعة
PixVerse v5.6 يتفوق في المحتوى المُنمَّط ذي التأثير القوي. إذا تضمّن أمرك إضاءة درامية، أو تسلسلات حركة سريعة، أو مشاهد عاطفية تقودها الشخصيات، فإن PixVerse يتعامل معها ببراعة بصرية أكبر من معظم البدائل. وهو يفوق توقعات فئته في المحتوى الموجّه لوسائل التواصل أولًا.
Hailuo 2.3 Fast من Minimax هو بطل السرعة للتسليم السريع. ولّد فيديو في أقل من 45 ثانية من أمر نصي أو صورة إدخال. لكن الثمن أن الأوامر المفصّلة جدًا التي تحتوي على عناصر متعددة قد تُبسَّط أحيانًا، لذا أبقِ أوصافك مركّزة ودع فكرة أو فكرتين قويتين تحملان المقطع.
كيف تكتب أوامر نصية تعمل فعلًا
معظم الناس يكتبون أوامر فيديو سيئة للسبب نفسه: يصفون ما يريدون رؤيته بدلًا من وصف كيف يجب أن يتكشّف المشهد. تحويل النص إلى فيديو يدور أساسًا حول الحركة، لا مجرد الصور.

تشريح أمر نصي قوي
كل أمر فيديو فعّال يتكون من أربعة مكونات:
- الموضوع: ما أو من في الإطار، مع تفاصيل محددة
- الحركة: ما الذي يفعله بالضبط، مع أفعال الحركة
- البيئة: أين يدور المشهد وكيف يبدو
- الكاميرا: كيف يختبر المشاهد المشهد
أمر نصي ضعيف: "كلب في حديقة"
أمر نصي قوي: "كلب من سلالة غولدن ريتريفر يركض عبر حديقة مفتوحة مشمسة، بحركة بطيئة، ولقطة تتبع منخفضة الزاوية تلاحقه من الخلف، والعشب الأخضر يتلاشى في المقدمة، وعمق ميدان سينمائي، وضوء شمس ظهيرة دافئ"
النسخة القوية تمنح النموذج مسار حركة (الركض)، وزاوية كاميرا (تتبع منخفض الزاوية)، وسرعة (حركة بطيئة)، وظرف إضاءة (ظهيرة دافئة)، وتأثير عمق (ضبابية في المقدمة). كل كلمة تقوم بعمل محدد.
3 أخطاء شائعة في الأوامر النصية

1. الإكثار من العناصر. حشو 12 تفصيلًا مختلفًا في المشهد يُربك النموذج. اختر 2 إلى 3 مرتكزات بصرية قوية وابنِ الحركة حولها. التعقيد يضر بالتماسك.
2. نسيان الحركة تمامًا. أوصاف المشاهد الثابتة تنتج مقاطع مملة تكاد لا تتحرك. كل أمر يحتاج إلى فعل حركة واحد على الأقل: يتموّج، يمشي، يدور، يسقط، يتلاشى، يدور حول جسم.
3. تجاهل لغة الكاميرا. عبارات مثل "منظر جوي" و"لقطة تتبع" و"تقريب بطيء" أو "زاوية مائلة (Dutch angle)" تشكّل جودة المخرجات بشكل كبير. النماذج المدرّبة على بيانات الأفلام تستجيب لمفردات التصوير السينمائي بطرق لا تستطيع الأوصاف البسيطة مضاهاتها.
نصيحة: اكتب أمرك كأنك توجّه مشغّل كاميرا على موقع التصوير، لا كأنك تصف صورة فوتوغرافية. النموذج يولّد فيلمًا، لا صورًا ثابتة.
كيف تستخدم LTX-2 Distilled على PicassoIA
LTX-2 Distilled يعمل مباشرة في المتصفح على PicassoIA دون الحاجة إلى تثبيت أي برنامج. إليك عملية خطوة بخطوة للحصول على أفضل النتائج من أول توليد لك:

الخطوة 1: افتح صفحة النموذج. انتقل إلى LTX-2 Distilled على PicassoIA. تُحمَّل الواجهة في المتصفح مع حقل إدخال للنص وعناصر تحكم للتوليد.
الخطوة 2: اكتب أمرك النصي. طبّق البنية ذات المكونات الأربعة الموضحة أعلاه. أبقِ الأمر دون 80 كلمة. الدقة أهم من الطول.
الخطوة 3: حدّد المدة. ابدأ بمدة 4 ثوانٍ. المقاطع الأقصر تُولَّد أسرع، وتتيح لك التحقق من اتجاه أمرك قبل الالتزام بتوليدات أطول وأبطأ.
الخطوة 4: اختر الدقة. دقة 480p تُولَّد في نحو 20 ثانية. دقة 720p تستغرق قرابة 90 ثانية. استخدم 480p أثناء مرحلة بناء الأمر، ثم انتقل إلى 720p للنسخة النهائية.
الخطوة 5: ولّد وقيّم. التوليدات الأولى تكشف غالبًا ما يحتاج إلى تعديل. لا تتخلص من توليد لأنه ليس مثاليًا. ادرس ما فعله النموذج بكلماتك، ثم طوّر من هناك.
الخطوة 6: ارفع الجودة. بعد أن ينتج أمرك الحركة والتكوين اللذين تريدهما في LTX-2 Distilled، جرّب الأمر نفسه في LTX-2.3-Fast للحصول على مخرجات أوضح بشكل ملحوظ.
المعاملات الأساسية للضبط:
- الخطوات: من 20 إلى 25 تعطي جودة قوية دون وقت توليد مفرط
- مقياس التوجيه (CFG): من 7 إلى 8 يوازن بين الالتزام بالأمر والتماسك البصري
- قيمة البذرة: ثبّت قيمة البذرة بمجرد أن تجد نتيجة جيدة، حتى تتمكن من تعديل النتائج بسلاسة دون أن تطمس العشوائية تقدمك
مجاني مقابل مدفوع: مقارنة واقعية
تقلّصت الفجوة بين تحويل النص إلى فيديو المجاني والمدفوع بشكل كبير في 2027. إليك تفصيلًا صريحًا للنماذج المتاحة على PicassoIA عبر المستويات المجانية والمستويات القائمة على النقاط:
متى يكفي المجاني
تغطي النماذج المجانية معظم الاحتياجات الشخصية والتجارية الصغيرة:
- منشورات وسائل التواصل الاجتماعي التي تقل مدتها عن 10 ثوانٍ
- تصوّر الأفكار قبل الإنتاج
- فيديوهات خلفية للعروض التقديمية
- سرد القصص الإبداعي والمشاريع الفنية
- تعلّم كيفية كتابة أوامر تحويل النص إلى فيديو
متى تضيف نقاطًا
تتضح حجة شراء النقاط عندما:
- تحتاج إلى مقاطع أطول من 6 ثوانٍ بشكل منتظم
- يتطلب مشروعك دقة 1080p أو 4K
- تنتج محتوى تجاريًا بكميات كبيرة
- تحتاج إلى تحكم دقيق في الحركة عبر عدة مقاطع مترابطة
- تريد الوصول إلى النماذج الأكثر قدرة مثل Kling v3 Video أو WAN 2.6 T2V
ماذا يمكنك أن تبني الآن
السؤال الحقيقي ليس ما تستطيع النماذج فعله نظريًا، بل ما يمكنك إنجازه عمليًا، ابتداءً من اليوم.

مقاطع لوسائل التواصل تُوقف التمرير
منصات الفيديو القصيرة تتناسب تمامًا مع مقاطع الذكاء الاصطناعي التي تدوم من 4 إلى 6 ثوانٍ. أمر نصي متقن ينتج في دقائق محتوى يوقف التمرير على Instagram Reels أو TikTok أو YouTube Shorts. خلفيات المنتجات، وتهيئة المشاهد بأجواء مميزة، والحركة المجردة، ومشاهد الطبيعة، كلها تحقق أداءً ممتازًا في هذا الشكل.
استخدم PixVerse v5.6 عندما تريد تأثيرًا بصريًا ودراما منمّقة. واستخدم WAN 2.6 T2V عندما تحتاج إلى لقطات طبيعية تنسجم بسلاسة مع المحتوى الواقعي دون أن تبدو مولّدة بالذكاء الاصطناعي.
وضع المنتجات والمحتوى الترويجي
منتج يظهر في مشهد مولّد بالذكاء الاصطناعي وجذاب بصريًا كثيرًا ما يتفوق على تصوير المنتجات التقليدي للاستخدام على الويب. يتيح لك الفيديو بالذكاء الاصطناعي إنشاء سياقات بيئية متعددة في أقل من ساعة. جودة المستوى المجاني بدقة 720p كافية تمامًا لرؤوس المواقع، وحملات البريد الإلكتروني، والإعلانات الاجتماعية.
الأفلام القصيرة والتسلسلات السردية
المقطع الواحد المدته 4 ثوانٍ مثير للاهتمام. أما تسلسل من 8 إلى 10 مقاطع مترابطة يُدمج معًا فهو فيلم قصير. ولّد مقاطع من سلسلة أوامر مترابطة تشترك في لغة بصرية واحدة. صدّرها، وحرّرها في أي محرر فيديو، وستحصل على عمل سردي متكامل بلا تكلفة.
نصيحة: حافظ على لوحة ألوان بصرية متسقة عبر تسلسل أوامرك: نفس لغة الإضاءة، ونفس مسافة الكاميرا، ونفس درجة حرارة اللون. الاتساق عبر المقاطع هو ما يفصل التسلسل الذي يُقرأ كفيلم عن مجموعة عشوائية من اللحظات المولّدة.
ابدأ في إنشاء أول مقطع لك
كل نموذج في هذا المقال متاح على PicassoIA الآن. لا تثبيت. لا قائمة انتظار. لا دفع مطلوب للبدء. تستضيف المنصة أكثر من 87 نموذجًا لتحويل النص إلى فيديو، من أدوات مفتوحة المصدر مجانية إلى أكثر النماذج التجارية قدرة المتاحة في أي مكان.
ابدأ مع LTX-2 Distilled إذا أردت نتائج خلال 20 ثانية. انتقل إلى WAN 2.5 T2V Fast أو CogVideoX-5B عندما تكون مستعدًا لدفع الجودة أبعد. وعندما تريد الارتقاء إلى مخرجات بمستوى احترافي بمدد أطول وتحكم دقيق في الحركة، فإن Kling v3 Video وVeo 3 Fast في انتظارك.
أصبح الحاجز أمام إنشاء فيديو بالذكاء الاصطناعي أقل من أي وقت مضى. اكتب أول أمر نصي لك، وولّد أول مقطع، وابنِ من هناك. الشيء الوحيد الذي يقف بينك وبين أول فيديو بالذكاء الاصطناعي هو الكلمات التي تختار كتابتها.