إن كنت تتابع مجال الذكاء الاصطناعي في الآونة الأخيرة، فمن المرجح أنك رأيت مقاطع سلسة وسينمائية لدرجة أنك لا تدرك للوهلة الأولى أنها من إنتاج الذكاء الاصطناعي. كثير من هذه المقاطع يأتي من Veo 3.1 التابع لشركة Google، وهو حاليًا من أكثر نماذج تحويل النص إلى فيديو قدرةً المتاحة للعموم. يشرح هذا المقال بالتفصيل كيفية استخدامه، بدءًا من الأمر النصي الأول وصولًا إلى مقطع نهائي بدقة 1080p مع صوت متزامن، ويوضح أي الإعدادات تهم فعلًا، وأي الأخطاء الشائعة تكلّفك أكثر وقت.

ما الذي يميّز Veo 3.1
تتعامل معظم نماذج الفيديو بالذكاء الاصطناعي مع الصوت كأمر اختياري. تحصل على مقطع صامت، ثم تقضي وقتًا في البحث عن موسيقى خلفية أو مؤثرات صوتية تأمل أن تتناسب مع إيقاع الصورة. يلغي Veo 3.1 هذه الخطوة تمامًا.
صوت أصلي في كل مقطع
يولّد Veo 3.1 صوتًا متزامنًا مع الفيديو. ينتج النموذج أصواتًا محيطة وأصواتًا بيئية، وفي بعض الحالات كلامًا قريبًا من الحوار يتناسب مع ما يحدث على الشاشة. فالأمر النصي الذي يصف عاصفة رعدية ينتج صوت المطر والرعد المتدحرج. ومشهد سوق مزدحم يأتي مع همهمة الحشود وحركتها.
يغيّر هذا سير العمل بشكل ملحوظ. فبدلًا من قضاء وقت في ما بعد الإنتاج لتكديس طبقات الصوت، تحصل على مخرج شبه نهائي في خطوة توليد واحدة. وبالنسبة إلى محتوى وسائل التواصل الاجتماعي وعروض المنتجات ورسم القصص المصوّرة، يتراكم توفير الوقت بسرعة.
1080p كنقطة بداية
كانت النماذج السابقة كثيرًا ما تقف عند 720p أو تتطلب خطوة منفصلة لرفع الدقة. يُخرج Veo 3.1 الفيديو بدقة 1080p مباشرةً، مما يجعل اللقطات صالحة للاستخدام فورًا على YouTube ووسائل التواصل الاجتماعي وعروض العملاء دون معالجة إضافية.
كما أن الترابط الحركي أقوى بشكل ملحوظ من ذلك الذي كانت تنتجه نماذج تحويل النص إلى فيديو السابقة. تحافظ الأجسام على شكلها عبر الإطارات، وتبدو حركات الكاميرا مقصودة لا منجرفة، وتحتفظ الوجوه ببنيتها طوال المقطع. كانت هذه بالضبط المشكلات التي جعلت مخرجات الفيديو السابقة بالذكاء الاصطناعي تبدو مصطنعة، حتى حين كانت الإطارات المفردة مبهرة عند النظر إليها منفردة.

Veo 3.1 مقارنةً بالإصدارات السابقة
يساعد فهم ما تغيّر بين الإصدارات على اختيار النموذج المناسب لمشروعك.
| الميزة | Veo 2 | Veo 3 | Veo 3.1 |
|---|
| دقة المخرجات | 720p | 1080p | 1080p |
| الصوت الأصلي | لا | نعم | نعم (محسّن) |
| الترابط الحركي | جيد | أفضل | الأفضل |
| اتباع الأوامر النصية | متوسط | قوي | قوي جدًا |
| إصدارات السرعة | لا | لا | Fast + Lite متاحة |
| الأنسب لـ | اختبارات سريعة | مشاريع كاملة | مخرجات جاهزة للإنتاج |
كان Veo 3 أول إصدار يقدّم الصوت الأصلي ومخرجات 1080p. ويعزز Veo 3.1 هذا الأساس: تُتبع الأوامر النصية بدقة أكبر، وجودة الصوت أكثر اتساقًا، وصارت متاحة الآن نسختان للسرعة.
يقلّل Veo 3.1 Fast زمن التوليد بشكل ملحوظ مقابل تنازل طفيف في الجودة. أما Veo 3.1 Lite فهو مُحسَّن للسرعة والتكلفة المنخفضة عندما تولّد بكميات كبيرة وتكون الدقة أقل أهمية من حجم الإنتاج. وتتوفر الإصدارات الثلاثة جميعها على PicassoIA.
كيفية استخدام Veo 3.1 على PicassoIA
تمنحك PicassoIA وصولًا مباشرًا إلى Veo 3.1 دون مفاتيح API أو إعداد تقني أو تثبيت. إليك سير العمل الكامل.
الخطوة 1: افتح النموذج
انتقل إلى فئة Text to Video على PicassoIA واختر Veo 3.1، أو توجّه مباشرةً إلى صفحة النموذج. ستصل إلى واجهة التوليد التي تضم حقل إدخال الأمر النصي ولوحة الإعدادات على الجانب.
الخطوة 2: اكتب أمرك النصي
هنا تُصنع النتائج أو تضيع. فنموذج Veo 3.1 يتبع الأوامر النصية بقوة، وهذا يعني أن الأوامر المحددة والمفصّلة تنتج مخرجات أفضل بكثير من الأوامر الغامضة.
يغطي الأمر النصي الجيد أربعة أشياء على الأقل:
- الموضوع: من أو ما الموجود في اللقطة
- البيئة: المكان وتفاصيله المحددة
- الحركة: ما الذي يتحرك، وكيف
- الأسلوب/المزاج: النبرة البصرية وطابع الإضاءة
أمر ضعيف: "مدينة ليلًا"
أمر قوي: "شارع مزدحم في طوكيو ليلًا، عشرات المارة يسيرون في كل الاتجاهات، رصيف مبلّل بالمطر يعكس واجهات المتاجر، لقطة واسعة تأسيسية، صوت محيطي طبيعي، سينمائي"
يحتوي الأمر الثاني على معلومات بصرية محددة يستطيع النموذج العمل بها فعلًا. والفرق في جودة المخرجات كبير.
الخطوة 3: اضبط المعاملات
قبل التوليد، تحقّق من هذه الإعدادات:
- المدة: يدعم Veo 3.1 مقاطع تصل إلى 8 ثوانٍ. وبالنسبة إلى معظم محتوى وسائل التواصل، تكون مدة 4 إلى 6 ثوانٍ هي الأنسب.
- نسبة العرض إلى الارتفاع: 16:9 لمقاطع YouTube والعرض الأفقي، و9:16 لمقاطع Reels و TikTok، و1:1 للأشكال المربعة.
- الصوت: مفعّل افتراضيًا. تأكد من بقائه مفعّلًا ما لم تكن تحتاج تحديدًا إلى لقطات صامتة.
الخطوة 4: ولّد المقطع وحمّله
اضغط على التوليد. يستغرق Veo 3.1 عادةً من 60 إلى 120 ثانية حسب حمل الخادم. وبعد ظهور المقطع، عاينه في المشغّل، ثم حمّل ملف MP4.

💡 نصيحة: شغّل 2 إلى 3 نسخ مختلفة من الأمر النصي نفسه قبل أن تقرر المخرج النهائي. يُدخل النموذج عشوائية في كل تشغيل، وغالبًا ما تكون إحدى النسخ أقوى بوضوح من البقية. وزمن الانتظار الإضافي يستحق العناء في الغالب.
كتابة أوامر نصية تعمل فعلًا
معظم من يحصلون على نتائج ضعيفة من فيديو الذكاء الاصطناعي يكتبون أوامر قصيرة جدًا أو مجردة جدًا. إليك كيفية إصلاح المشكلتين.
صيغة الأجزاء الأربعة
نظّم أوامرك النصية وفق هذا النمط:
[الموضوع + الفعل] + [البيئة + التفاصيل] + [حركة الكاميرا] + [الأسلوب/المزاج]
وعمليًا:
"امرأة ترتدي معطفًا مطريًا أصفر تسير ببطء على ممر فوق منحدر ساحلي، أمواج المحيط تتكسر بعيدًا تحت الممر، سماء غائمة، حركة اقتراب بطيئة للكاميرا، ألوان خافتة، سينمائي، صوت محيطي طبيعي"
يؤدي كل جزء من الصيغة وظيفة محددة:
- الموضوع: امرأة بمعطف مطري أصفر، تسير ببطء
- البيئة: ممر على منحدر ساحلي، أمواج في الأسفل، سماء غائمة
- الكاميرا: حركة اقتراب بطيئة
- الأسلوب: ألوان خافتة، سينمائي
النتيجة أكثر فائدة باستمرار من أي شيء ينتجه أمر من ثلاث كلمات.
أوامر جرّبها الآن
هذه نقاط بداية عملية يمكنك تكييفها مباشرةً:
السفر/الطبيعة:
"شروق الشمس فوق جبال ضبابية، الضباب يملأ قاع الوادي، ضوء ذهبي يعلو القمم، لقطة جوية ترتفع ببطء، لوحة ألوان دافئة، واقعي كالصور الفوتوغرافية"
الحضري/المدينة:
"تقاطع في وسط المدينة عند الغسق، سيارات ومارة في حركة، أضواء واجهات المتاجر تومض، لقطة واسعة تأسيسية، صوت محيطي طبيعي، سينمائي"
الداخلي/الأجواء:
"مكتبة مريحة ليلًا، المطر على نوافذ عالية، مصباح وحيد يلقي ضوءًا دافئًا على الكتب، حركة بانورامية بطيئة عبر الغرفة، هادئ وساكن"
شخص/بورتريه:
"خباز بمئزر أبيض يعجن العجين في مطبخ صغير، ضوء الصباح من نافذة جانبية، غبار الطحين معلّق في الهواء، لقطة متوسطة، دافئ وطبيعي"

كم ينبغي أن تكون الأوامر النصية طويلة
هناك اعتقاد شائع بأن الأوامر الأطول تنتج دائمًا نتائج أفضل. وهذا ليس دقيقًا تمامًا. فالأمر المليء بتعليمات زائدة أو متناقضة يمكن أن يربك النموذج بقدر الأمر القصير والغامض.
الهدف هو المحدد والواضح، لا الطويل فقط. يجب أن تضيف كل عبارة معلومة بصرية غير مستنتجة من شيء آخر. قارن بين هذين الأسلوبين في إضافة النمط:
مكرر: "سينمائي، واقعي كالصور الفوتوغرافية، جودة عالية، جميل، مذهل، زاهٍ، رائع"
محدد: "ضوء بعد الظهر المتأخر من الجهة اليسرى، توهّج عدسة خفيف، مظهر فيلم 35 ملم"
عدد الكلمات متقارب في الحالتين. لكن الثاني يحتوي على ثلاث تعليمات بصرية قابلة للتنفيذ، بينما لا يحتوي الأول على تقريبًا أي شيء من هذا القبيل.
💡 نصيحة: في الأوامر التي تتضمن أشخاصًا، حدّد ما الذي يفعلونه بدلًا من أن تكتفي بوصف من هم. "رجل يقف" لا يعطي النموذج شيئًا يحرّكه. أما "رجل يعدّل سترته ويرفع نظره إلى السماء" فيمنحه حركة جسدية يصيّرها عبر المدة الكاملة للمقطع.
3 أخطاء شائعة يجب تجنبها
حتى مع نموذج قوي، هناك أنماط معينة تنتج نتائج ضعيفة بانتظام.
1. عناصر كثيرة في إطار واحد
يتعامل Veo 3.1 مع التعقيد بشكل جيد، لكن المشاهد التي تضم عشرة عناصر بصرية تتنافس على الانتباه تخلق ضجيجًا. وجود موضوع أساسي واحد مع سياق داعم واضح يبدو دائمًا تقريبًا أنظف. وإذا كان مفهومك يتطلب عناصر متعددة، فكّر في تقسيمه إلى مقطعين منفصلين والتبديل بينهما في ما بعد الإنتاج.
2. تجاهل تعليمات الكاميرا
من دون تحديد حركة الكاميرا أو زاويتها، يختار النموذج واحدة عشوائيًا. وقد يكون هذا مقبولًا أحيانًا، لكنه غالبًا ليس كذلك. حتى تعليمات بسيطة مثل "لقطة ثابتة" أو "دوللي للأمام ببطء" أو "محمولة باليد، حركة خفيفة" تمنحك نتائج أكثر قابلية للتوقع بكثير.
3. استخدام المديح المجرد بدلًا من الوصف الملموس
كلمات مثل "جميل" و"رائع" و"مذهل" صفات تعبّر عن شعورك تجاه المخرج، وليست وصفًا لما ينبغي أن يبدو عليه. استبدلها بلغة بصرية محددة: "ألوان أرضية خافتة"، "إضاءة جانبية صباحية قوية"، "منزوعة التشبع مع تفاصيل ظلال دافئة". هذه تمنح النموذج شيئًا يستطيع تصييره فعلًا.

نماذج فيديو أخرى تستحق التجربة
تضم PicassoIA أكثر من 100 نموذج لتحويل النص إلى فيديو، وبعضها أنسب لحالات استخدام محددة من Veo 3.1.
للسرعة
يركّز كل من Veo 3.1 Fast وSeedance 2.0 Fast على زمن التوليد. وعندما تكرّر أفكارك بسرعة أو تولّد بكميات كبيرة، تقلّص الإصدارات السريعة أوقات الانتظار دون تراجع كبير في الجودة.
للجودة السينمائية
ينتج Kling v3 Video وRay 3.2 مقاطع ذات طابع سينمائي قوي. يتفوق Kling في تسلسلات الحركة الديناميكية السريعة، بينما يتعامل Ray مع المشاهد الجوية والمزاجية بصورة خاصة جيدة.
للتوليد المجاني
يتيح PicassoIA Video توليدًا مجانيًا غير محدود لتحويل النص إلى فيديو. الجودة أقل من النماذج المدفوعة، لكنه مفيد فعلًا لاختبار الأوامر النصية والمفاهيم البصرية قبل إنفاق النقاط على تشغيلات بجودة الإنتاج.
للدقة العالية
يولّد LTX 2.3 Pro بدقة 4K، وهي أعلى مما تحتاجه وسائل التواصل الاجتماعي، لكنها قيّمة للعرض بقياس كبير أو لمشاريع العملاء الراقية. ويُنتج Wan 2.7 T2V أيضًا مخرجات نظيفة بدقة 1080p مع ترابط حركي قوي عبر مجموعة واسعة من أنواع الأوامر النصية.
للتركيز على الصوت
يولّد Seedance 2.0 من ByteDance فيديوهات تُبنى على الصوت أولًا، حيث يتكامل تصميم الصوت مع الحركة بعمق. ويتضمن Pixverse v6 توليدًا للصوت السينمائي مع تتبّع حركي قوي للأشخاص أثناء الحركة.

إليك مقارنة أفضل النماذج حسب حالة الاستخدام:
ما بعد تحويل النص إلى فيديو
من سير العمل الذي يستحق المعرفة تحويل الصورة إلى فيديو: تقدّم صورة ثابتة كإطار بداية، ويحرّكها النموذج إلى الأمام في الزمن. يمنحك هذا تحكمًا أكبر في المحتوى البصري، لأنك تستطيع تصميم الإطار الأول بدقة باستخدام مولّد صور، ثم تمرره إلى نموذج فيديو لإضافة الحركة.
تتخصص عدة نماذج على PicassoIA في هذا:
يتناسب أسلوب تحويل الصورة إلى فيديو جيدًا مع أدوات تحويل النص إلى صورة في PicassoIA. ولّد صورة ثابتة بالموضوع والتكوين الدقيقين اللذين تحتاجهما، ثم مرّر هذه الصورة إلى نموذج فيديو لإضافة الحركة. غالبًا ما يتفوق هذا النهج ذو المرحلتين على محاولة تحديد كل شيء في أمر نصي وحده، خاصة في المشاهد التي تتطلب بنية موضوع محددة أو إطارًا دقيقًا.

💡 نصيحة: عند استخدام تحويل الصورة إلى فيديو، اترك مساحة بصرية حول موضوعك. إذا ملأ الموضوع الإطار كله، فلن يجد النموذج مكانًا يحرّك الكاميرا نحوه. قليل من المساحة الفارغة يسمح للنموذج باختيار حركة كاميرا تبدو طبيعية لا خانقة.
أين يهم الصوت أكثر
يكون لتوليد الصوت الأصلي في Veo 3.1 أكبر أثر في ثلاث حالات محددة:
محتوى وسائل التواصل: المقاطع القصيرة ذات الصوت المدمج تبدو أكثر صقلًا بوضوح وتحافظ على الانتباه لفترة أطول. الصمت أو مقطع موسيقي جاهز غير متناسق يشير إلى ضعف الجهد بطريقة يلتقطها الجمهور فورًا، حتى لو لم يستطع التعبير عن السبب.
رسم القصص المصوّرة والتصوّر المسبق: عند عرض تسلسل مشهد على عميل أو متعاون، يجعل وجود صوت حقيقي في المقطع المزاج مفهومًا فورًا دون شرح. أما التصوّر المسبق الصامت فيحتاج إلى وصف لفظي أكبر بكثير لسد الفجوة.
عروض المنتجات والتجارب: إذا كنت تعرض كيف سيكون شعور مكان أو منتج أو تجربة ما، يردم الصوت الفجوة بين "يبدو أنه يمكن أن يوجد" و"يبدو حقيقيًا بما يكفي لترغب فيه". وهذا صحيح بوجه خاص في أي شيء يتعلق بالطبيعة أو المدن أو الأجواء.
في الحالات التي تحتاج فيها تحديدًا إلى لقطات صامتة، اكتم الصوت عند التحميل أو عطّل توليد الصوت قبل التشغيل. لكن ترك الصوت مفعّلًا افتراضيًا والقرار لاحقًا في ما بعد الإنتاج يُعد في الغالب نقطة بداية أفضل.

ابدأ في صنع فيديوهاتك الخاصة
كل ما يصفه هذا المقال متاح الآن على PicassoIA. لا تثبيت، ولا مفاتيح API، ولا إعداد تقني. Veo 3.1 متاح مباشرةً في المتصفح، إلى جانب Veo 3.1 Fast وVeo 3.1 Lite، وأكثر من 100 نموذج آخر لتحويل النص إلى فيديو، من الخيارات المجانية وحتى أدوات الإنتاج بدقة 4K.
إذا أردت اختبار أوامرك النصية قبل إنفاق النقاط، فابدأ بأداة PicassoIA Video، وهو مولّد المنصة المجاني غير المحدود. استخدمه لشحذ هيكل أوامرك ولمعرفة كيف تؤثر الأوصاف المختلفة في المخرجات، ثم انتقل إلى Veo 3.1 حين تكون مستعدًا لنتائج بجودة الإنتاج.
الكتالوج الكامل للنماذج موجود على picassoia.com/en/all-models. تصفح حسب الفئة لتجد أدوات لكل جزء من سير عمل الفيديو: التوليد والتحرير ورفع الدقة والصوت والترميم.
أسرع طريقة لتتحسن في هذا هي أن تشغّل الأوامر النصية فعلًا وترى ما يعود. اكتب مشهدًا، ووّلد المقطع، وانظر إلى ما نجح وما لم ينجح، ثم عدّل. حلقة التغذية الراجعة هذه تعلّمك في 20 دقيقة من التجريب أكثر مما قد تعلّمك ساعات من القراءة عنه أبدًا.
