ظلّت Google تعمل على هذه اللحظة لسنوات، و Veo 3.1 هو أوضح دليل حتى الآن على أن توليد الفيديو بالذكاء الاصطناعي لم يعد لعبة. إنه أداة بمستوى الإنتاج الاحترافي. صدر هذا النموذج لتحويل النص إلى فيديو عن Google DeepMind، ويُنتج من أمر نصي واحد لقطات بدقة 1080p مع صوت أصلي متزامن، وفي كثير من السيناريوهات يصعب تمييز النتائج عن تصوير الكاميرا الحقيقي. سواء كنت صانع محتوى، أو مخرج أفلام، أو مجرد شخص يتساءل عن موقع توليد الفيديو بالذكاء الاصطناعي في 2027، فهذا الشرح يغطي كل ما يستحق المعرفة.
ما هو Veo 3.1 فعلًا

Veo 3.1 هو أقدر نموذج لتحويل النص إلى فيديو متاح للعموم من Google DeepMind حتى الآن. وهو نموذج توليد فيديو قائم على الانتشار (diffusion)، دُرّب على مجموعة ضخمة من اللقطات السينمائية ولقطات العالم الحقيقي، ثم خضع للضبط الدقيق ليتبع التعليمات المكتوبة باللغة الطبيعية بدقة عالية. وعلى عكس النماذج السابقة التي كانت تتطلب خطوات منفصلة لتوليد الصوت، يُنتج Veo 3.1 الصوت بشكل أصلي إلى جانب الفيديو، فيولّد الكلام والأصوات المحيطة والموسيقى المتزامنة زمنيًا مع ما يحدث على الشاشة.
تشير "3.1" في الاسم إلى تحسين تدريجي على Veo 3: اتساق حركة أفضل، والتزام أدق بالأوامر النصية، وجودة بصرية أكثر ثباتًا عبر المقاطع الأطول. وهذا ليس إعادة تصميم كاملة للبنية، بل تحديث كبير في الضبط يعالج أكثر أنماط الإخفاق شيوعًا في الإصدار السابق.
البنية التي تقف خلفه
في جوهره، يستخدم Veo 3.1 بنية محوّل انتشار للفيديو (video diffusion transformer)، وهو نهج حلّ إلى حد كبير محل الأساليب القديمة القائمة على الشبكات المتكررة في هذا المجال. يعمل النموذج في فضاء كامن (latent space)، إذ يرمّز إطارات الفيديو إلى تمثيلات مضغوطة، ثم يستخدم عملية الانتشار لإزالة الضوضاء منها بدءًا من ضوضاء عشوائية وصولًا إلى المخرج المطلوب. ويُطبَّق تكييف النص في كل خطوة عبر آليات الانتباه المتقاطع (cross-attention)، مما يسمح للنموذج بقراءة الأمر النصي باستمرار، لا عند البداية فقط.
ما يجعله فعالًا بشكل خاص في الحركة هو التدريب المشترك على الاتساق الزمني. فبدلًا من معاملة كل إطار على حدة، يُنمذج Veo 3.1 العلاقات بين الإطارات المتجاورة بشكل صريح. ولهذا تتحرك الأجسام بسلاسة وتنتقل المشاهد دون الوميض أو التشوه اللذين أثقلا كاهل نماذج الفيديو بالذكاء الاصطناعي السابقة.
توليد الصوت الأصلي

إمكانية الصوت الأصلي هي ما يفصل Veo 3.1 بوضوح عن الإصدارات السابقة. فالإصدارات السابقة من Veo ومعظم النماذج المنافسة تنتج فيديوهات صامتة تحتاج إلى عمل صوتي منفصل. أما Veo 3.1 فيولّد الصوت في المرحلة نفسها، أي أن خطوات الأقدام تتزامن مع لحظة ملامستها الأرض، وحركة الشفاه تتطابق مع الكلام، والأصوات المحيطة تملأ المشهد بشكل طبيعي.
يتحقق ذلك عبر عملية توليد مشتركة للصوت والفيديو، حيث يُكيَّف كلاهما على الإدخال النصي نفسه. الصوت هنا لا يُسترجع من مكتبة ولا يُطابَق معها، بل يُولَّد في سياقه، ولذلك يبدو أكثر إقناعًا بكثير من أي طريقة تركّب الصوت لاحقًا على الفيديو.
💡 ملاحظة: الصوت الأصلي هو أحد الأسباب الرئيسية التي تجعل مخرجات Veo 3.1 تبدو أكمل من مخرجات النماذج المنافسة، التي ما تزال تتطلب منك تجميع الصوت بشكل منفصل.
Veo 3.1 مقابل الإصدارات السابقة

فهم موقع Veo 3.1 ضمن سلسلة الإصدارات يساعد على ضبط التوقعات. كان التطور من Veo 2 إلى Veo 3 قفزة كبيرة: إذ قدّم ذلك التحديث الصوت الأصلي، وحسّن الالتزام بالأوامر النصية بشكل ملحوظ، ورفع أقصى دقة إلى 1080p. ويبني Veo 3.1 على هذا الأساس بدلًا من إعادة اختراعه.
| الميزة | Veo 2 | Veo 3 | Veo 3.1 |
|---|
| أقصى دقة | 720p | 1080p | 1080p |
| الصوت الأصلي | لا | نعم | نعم (محسّن) |
| الالتزام بالأمر النصي | جيد | جيد جدًا | ممتاز |
| اتساق الحركة | متوسط | جيد | جيد جدًا |
| سرعة التوليد | بطيء | متوسط | أسرع |
من Veo 2 إلى Veo 3.1
القفزة من Veo 2 إلى Veo 3.1 مهمة من الناحية العملية. كان Veo 2 ينتج فيديوهات مثيرة للإعجاب بالفعل، لكنه كان يتعثر في الحركة المعقدة، والمشاهد التي تضم أكثر من شخص، وعرض النصوص. ويتعامل Veo 3 و3.1 مع هذه الحالات بشكل أفضل بكثير، خاصة عندما تصف الأوامر النصية أفعالًا محددة، أو حركات كاميرا، أو ظروفًا بيئية.
حيث كان Veo 2 غالبًا ما يولّد فيديوهات تبدو من صنع الذكاء الاصطناعي بسبب عدم اتساق طفيف في الملمس وعيوب غريبة في الحركة، ينتج Veo 3.1 لقطات تجتاز النظرة الأولى العابرة بانتظام. والتحسّن في وجوه البشر وأيديهم، وهي من أصعب الموضوعات تاريخيًا على الفيديو المولَّد، ملحوظ بشكل خاص.
فئات السرعة: Fast وLite
أطلقت Google Veo 3.1 بعدة تهيئات للسرعة. يضحّي Veo 3.1 Fast ببعض الجودة مقابل تقليل كبير في زمن التوليد، مما يجعله مناسبًا للتكرار السريع أثناء العملية الإبداعية. أما Veo 3.1 Lite فهو نسخة مضغوطة مُحسّنة للبيئات الأقل في القدرة الحاسوبية، مع الحفاظ على جودة معقولة.
يمثل Veo 3.1 الكامل الخيار الأعلى جودة، وهو الذي يُستخدم عندما تكون جودة المخرج هي الأولوية. وفي المشاريع التي تحتاج إلى التكرار السريع عبر كثير من تنويعات الأوامر النصية قبل الاعتماد على نتيجة نهائية، فإن البدء بنموذج Veo 3.1 Fast ثم إنهاء العمل بالنموذج الكامل هو سير عمل عملي.
ما مدى جودة الفيديو؟

تقييم صريح: Veo 3.1 من بين أفضل نماذج تحويل النص إلى فيديو المتاحة في 2027. بالنسبة للمشاهد المباشرة، ولقطات القرب، وتسلسلات الأفعال البسيطة، ولقطات الطبيعة، تكون النتائج واقعية كالصور الفوتوغرافية ومقنعة للغاية. أما في التفاعلات المعقدة بين عدة شخصيات، أو حركات اليد الدقيقة، أو العلاقات المكانية الشديدة الدقة، فما تزال هناك قيود سيلاحظها أصحاب العين الخبيرة.
الدقة ومعدل الإطارات
يُخرج Veo 3.1 بدقة 1080p وبمعدل قياسي هو 24 إطارًا في الثانية، وهو مناسب لمعظم حالات المحتوى الرقمي، بما في ذلك وسائل التواصل الاجتماعي، والنشر على الويب، وأفلام الفيديو القصيرة. والدقة هنا حقيقية وليست ناتجة عن رفع دقة مخرج أدنى، مما يعني أن التفاصيل الدقيقة مثل ملمس القماش، وسلوك سطح الماء، والإضاءة البيئية تصمد عند عرضها بملء الشاشة.
اتساق معدل الإطارات قوي. من أهم مؤشرات الجودة في الفيديو المولّد بالذكاء الاصطناعي هو ما إذا كانت الحركة سلسة أم "متقطعة"، ويحافظ Veo 3.1 على إيقاع زمني ثابت طوال مدة المقطع.
اتساق الحركة

يشير اتساق الحركة إلى مدى بقاء الأجسام والأشخاص وحركة الكاميرا متسقة ومقنعة عبر الزمن. وهنا يظهر Veo 3.1 أوضح تحسيناته مقارنة بالنماذج السابقة. فالشخص الذي يمشي داخل الإطار يحافظ على تناسب ثابت، وسلوك ثابت للملابس، واستجابة ثابتة للإضاءة طوال المقطع. وحركات الكاميرا مثل الدوران الأفقي والعمودي وتتبع اللقطات تكون سلسة لا مرتجّة.
النموذج قوي بشكل خاص في:
- الحركة البيئية: الرياح في الأشجار، وتدفق الماء، وحركة الحشود في الخلفية
- أفعال الشخص الواحد: المشي، والإيماءات، والتفاعلات البسيطة مع الأشياء
- اللقطات الموجّهة بالكاميرا: يُحترم التوجيه الصريح لزاوية الكاميرا وحركتها
- انتقالات الإضاءة: مشاهد تتحول من داخل المكان إلى خارجه، أو عبر وقت من اليوم
ما يزال اتساق الحركة يعاني في: التفاعلات السريعة والمعقدة بين عدة أجسام، ومشاهد الرياضة، والمشاهد التي يتفاعل فيها شخصان عن قرب.
Veo 3.1 مقابل المنافسين

أصبح مجال توليد الفيديو بالذكاء الاصطناعي شديد التنافس في 2027. وVeo 3.1 لا يعمل في فراغ، إذ ينافس عروضًا قوية من OpenAI وRunway وKwai وغيرها، وكلها متاحة عبر PicassoIA.
مقارنة مع Sora 2
Sora 2 من OpenAI هو المنافس الأقرب من حيث الموقع والقدرات. كلا النموذجين يستهدف جودة سينمائية بدقة 1080p مع توليد صوت أصلي. والفروق دقيقة:
- يميل Veo 3.1 إلى إنتاج ألوان بشرة وإضاءة بيئية تبدو أكثر طبيعية بقليل
- يُظهر Sora 2 أداءً أقوى في الأوامر النصية التجريدية وذات الطابع الأسلوبي
- يتمتع Veo 3.1 بتزامن صوتي أكثر قابلية للتنبؤ في المشاهد التي يغلب عليها الحوار
- يتفوق Sora 2 Pro في مدة المقطع والدقة للاستخدامات الاحترافية
لا يوجد نموذج أفضل بشكل قاطع عبر كل أنواع الأوامر النصية. يتفوق Veo 3.1 في اللقطات الطبيعية ذات الطابع الوثائقي، بينما يُفضَّل Sora 2 غالبًا للمحتوى الإبداعي والقائم على السرد.
مقارنة مع Kling وRunway
يظل Kling v3 من Kwai تنافسيًا، خاصة في الفيديو الذي يحافظ على ثبات الشخصيات عبر تسلسلات أطول. وتُعد إمكانات التحكم في الحركة عبر Kling v3 Motion Control من أدق الإمكانات في هذا المجال.
يركّز Gen 4.5 من Runway على المرونة الإبداعية وسير عمل تحرير الفيديو، مما يجعله خيارًا قويًا لمحترفي ما بعد الإنتاج.
يتفوق Veo 3.1 على الاثنين في جودة المخرج الخام للقطات الواقعية كالصور الفوتوغرافية، لكن الفارق ضيق عند القمة، والخيار الصحيح يعتمد كليًا على حالة الاستخدام التي تعمل عليها.
💡 نصيحة: للتكرار السريع دون التضحية بالكثير من الجودة، يستحق Seedance 2.0 أن يُشغَّل إلى جانب Veo 3.1. كما يدعم الصوت الأصلي ويُولّد بدقة 1080p.
كتابة أوامر نصية تعمل فعلًا

الحصول على مخرج عالي الجودة من Veo 3.1 يتطلب فهم الطريقة التي يفسّر بها النموذج النص. فعلى عكس مولّدات الصور التي يمكنك فيها غالبًا إلقاء قائمة من كلمات الأسلوب، يستجيب Veo 3.1 بشكل أفضل للأوامر النصية المنظمة على طريقة السرد، التي تصف المشهد كما لو كنت تخرج فيلمًا لطاقم تصوير.
ما الذي يستجيب له Veo 3.1
دُرّب النموذج على لقطات سينمائية، لذلك يفهم لغة صناعة الأفلام بشكل طبيعي. استخدم مصطلحات توجيه الكاميرا بوضوح:
- زاوية الكاميرا: "لقطة من زاوية منخفضة"، "منظر من الأعلى"، "لقطة متوسطة بمستوى العين"
- الحركة: "اندفاع بطيء بعربة التصوير (dolly)"، "لقطة تتبع محمولة باليد"، "لقطة عريضة ثابتة"
- الإضاءة: "ضوء الصباح الطبيعي الناعم من اليسار"، "إضاءة غائمة منتشرة"
- المزاج والإيقاع: "هادئ وتأملي"، "حيوي وسريع الإيقاع"
- تفاصيل الشخص: صف الملابس، والعمر التقريبي، والفعل، والموضع داخل الإطار
يبدو الأمر النصي المنظم جيدًا لنموذج Veo 3.1 كموجز مخرج. مثال: "امرأة في الثلاثينيات من عمرها تمشي في شارع مدينة مبلل بالمطر ليلًا. لقطة تتبع من زاوية منخفضة عند مستوى الركبة، تتابع حركتها. أضواء الشوارع الكهرمانية الدافئة تنعكس في البرك. مطر خفيف، وصوت جوي هادئ. واقعي، سينمائي، 24 إطارًا في الثانية."
أخطاء شائعة يجب تجنبها
تحميل الأمر النصي بالكثير من العناصر: محاولة وصف عدد كبير من العناصر في أمر نصي واحد تجعل النموذج يمزج التفاصيل أو يُسقطها. مشهد واحد، وفعل واحد، وظرف إضاءة واحد يعمل بشكل أفضل بكثير من دمج ثلاثة منها معًا.
إهمال توجيه الصوت: بما أن Veo 3.1 يولّد الصوت بشكل أصلي، صف بيئة الصوت صراحةً. فعبارات مثل "أصوات هادئة لمقهى محيطة" أو "أصوات طيور طبيعية ونسيم خفيف" توجّه توليد الصوت نحو النتيجة الصحيحة.
أوصاف الشخص الغامضة: عبارة "شخص يمشي" تترك للنموذج مساحة واسعة جدًا. أما "رجل طويل يرتدي معطفًا رماديًا يمشي" فتُقيّده بطريقة مفيدة.
طلب حركة متزامنة كثيرة: أشخاص متعددون، ومركبات، وحركة كاميرا، وطقس، كلها في مقطع واحد، تميل إلى إضعاف الاتساق. بسّط المشهد لتقوية المخرج.
كيفية استخدام Veo 3.1 على PicassoIA

Veo 3.1 متاح مباشرة على PicassoIA دون الحاجة إلى حساب Google AI أو إعداد API. إليك كيفية توليد أول مقطع لك.
خطوة بخطوة
الخطوة 1: انتقل إلى صفحة نموذج Veo 3.1 على PicassoIA. سترى حقل إدخال الأمر النصي وإعدادات التوليد.
الخطوة 2: اكتب أمرك النصي باستخدام أسلوب لغة صناعة الأفلام الموضح أعلاه. نقطة بداية جيدة: "شابة تجلس عند نافذة مقهى في باريس، وضوء الصباح يتدفق عبر الزجاج. لقطة متوسطة، كاميرا ثابتة، ضوء نهاري دافئ وناعم. أصوات مقهى محيطة وحركة مرور بعيدة."
الخطوة 3: اختر مدة المقطع. ابدأ بمقاطع أقصر (من 5 إلى 8 ثوانٍ) للتحقق من المشهد قبل الالتزام بأوقات توليد أطول.
الخطوة 4: حدّد بيئة الصوت في أمرك النصي. وضّح ما إذا كنت تريد أصواتًا محيطة، أو حوارًا، أو موسيقى، أو صمتًا. وهذا يشكّل مخرج الصوت الأصلي بشكل مباشر.
الخطوة 5: ولّد وراجع. نزّل المقطع. إذا كان اتساق الحركة أو تفاصيل المشهد المحددة غير دقيقة، فحسّن الأمر النصي وأعد التوليد. استخدم Veo 3.1 Fast للتكرارات التجريبية السريعة قبل تشغيل النموذج الكامل.
نصائح المعاملات
- نسبة العرض إلى الارتفاع: تُعد 16:9 الخيار الافتراضي والتنسيق الأفضل دعمًا في Veo 3.1.
- الأوامر النصية السلبية: عند توفرها، استخدمها لاستبعاد أنماط الإخفاق، مثل "بدون ضبابية حركة"، و"بدون وميض"، و"بدون أيدٍ مشوّهة".
- قيم البذرة: بمجرد أن تجد تكوينًا يعجبك، دوّن قيمة البذرة وأعد استخدامها مع تعديلات طفيفة على الأمر النصي للحفاظ على ثبات بصري عبر سلسلة من المقاطع.
- اختيار الفئة المناسبة: استخدم Veo 3.1 Lite للمسودات، وVeo 3.1 Fast للتكرار متوسط الجودة، والنموذج Veo 3.1 الكامل للمخرج النهائي.
ما الذي يمكنك بناؤه به فعلًا

التطبيقات العملية لنموذج Veo 3.1 أوسع مما يتصوره معظم الناس في البداية. إليك المجالات التي يُستخدم فيها الآن:
إنتاج المحتوى الاجتماعي: فيديوهات قصيرة لمنصات Instagram وTikTok وYouTube كانت ستتطلب طاقم تصوير. يستطيع صانع محتوى واحد إنتاج محتوى سينمائي مصقول على نطاق واسع باستخدام Veo 3.1.
التصور المسبق للأفلام: يستخدم المخرجون والمنتجون توليد الفيديو بالذكاء الاصطناعي لتصوّر المشاهد مسبقًا قبل الالتزام بالتصوير. وجودة Veo 3.1 أصبحت كافية الآن لعروض التصور المسبق الموجهة للعملاء.
المحتوى الإعلاني: بدأت العلامات التجارية في توليد فيديوهات مرتبطة بالمنتجات، ولقطات لنمط الحياة، وإعلانات مفاهيمية بجزء بسيط من تكلفة الإنتاج التقليدي.
المحتوى التعليمي: يمكن توضيح المفاهيم المعقدة بلقطات واقعية كالصور الفوتوغرافية تُظهر عمليات أو بيئات أو سيناريوهات قد يكون تصويرها مكلفًا أو مستحيلًا عمليًا.
الأفلام القصيرة السردية: يولّد الكتّاب لقطات لاختبار فكرة الأفلام القصيرة، مستخدمين الفيديو بالذكاء الاصطناعي كأداة لسرد القصة وعرض المشروع.
القيد الرئيسي ما يزال مدة المقطع والتحكم في التفاصيل المحددة داخل المشهد. وبالنسبة للتسلسلات السردية المعقدة التي تتطلب شخصيات متسقة عبر كثير من المشاهد، يقوم سير العمل على توليد مقاطع منفصلة ثم تحريرها معًا. وفي هذه الحالات، تصبح أدوات مثل Kling Avatar v2 لثبات الشخصيات، وWan 2.7 I2V لتحويل الصورة إلى فيديو، جزءًا من مجموعة الأدوات الإنتاجية إلى جانب Veo 3.1.
جرّبه بنفسك
أفضل طريقة لمعرفة ما يستطيع Veo 3.1 فعله لحالة الاستخدام الخاصة بك هي تشغيله بأوامرك النصية أنت. فالكتابة عن جودة الفيديو بالذكاء الاصطناعي لها حدود. والفرق بين أمر نصي جيد وآخر ممتاز شيء تشعر به في المخرج، وهذا الحدس ينمو بسرعة بمجرد أن تبدأ في التوليد.
يمنحك PicassoIA وصولًا مباشرًا إلى Veo 3.1، وVeo 3.1 Fast، وVeo 3.1 Lite، إلى جانب مجموعة كاملة من نماذج تحويل النص إلى فيديو المنافسة، بما في ذلك Sora 2، وKling v3، وSeedance 2.0. وتشغيل الأمر النصي نفسه عبر نماذج متعددة جنبًا إلى جنب هو أسرع طريقة لترى أيها يناسب مشروعك.
ابدأ بمشهد تعرفه جيدًا، شيء لديك صورة بصرية واضحة له في ذهنك، واكتب الأمر النصي كموجز مخرج. ستخبرك النتائج بأكثر مما تخبرك به أي مقارنة مكتوبة. توجّه إلى Veo 3.1 على PicassoIA وابدأ في الإنشاء.