Veo 3.1، أحدث نموذج لتوليد الفيديو من Google DeepMind، أُطلق بوعود طموحة للسلامة: فلتر محتوى متعدد الطبقات، وعلامة مائية SynthID، ومصنّف وقت تشغيل النموذج يحجب المحتوى الموجّه للبالغين والضار قبل أن يُصيَّر أصلًا. كان الإطلاق متأنيًا والتوثيق دقيقًا. ثم بدأ مجتمع اختبار المحتوى بتشغيل مجموعات منهجية من الأوامر النصية، وأظهرت النتائج قصة أكثر تعقيدًا.
يوثّق هذا المقال ما كشفته تلك الاختبارات: فئات المحتوى المحددة التي اجتازت طبقة الأمان في Veo 3.1، والفئات التي جرى حجبها بشكل موثوق، وما تعنيه بيانات التناقض لمن يبني سير عمل إبداعيًا حول محتوى مُولَّد بالذكاء الاصطناعي قريب من فئة البالغين. نوثّق أيضًا نماذج توليد الصور على PicassoIA التي تتجاوز لعبة الفلتر كليًا وتمنح نتائج متوقعة.
ما هو Veo 3.1 فعليًا
أُطلق Veo 3.1 في منتصف عام 2025، وهو الجيل الثالث من نموذج توليد الفيديو لدى Google DeepMind. يولّد فيديوهات عالية الجودة ومتسقة زمنيًا من الأوامر النصية والصور المرجعية، مع توليد صوت أصلي ينتج أصواتًا متزامنة دون خط معالجة منفصل. تحقق البنية تماسكًا في الحركة، وفيزياء إضاءة واقعية، وانتقالات مشاهد معقدة بمستويات جودة تفوقت في الاختبارات المعيارية على النماذج المنافسة في معظم التقييمات المستقلة.
يتوفر الوصول عبر قنوات متعددة: منصة VideoFX من Google للاستخدام الفردي، وتكامل أدوات المنشئين في YouTube، وVertex AI API للنشر المؤسسي. تطبّق كل قناة سياسة المحتوى نفسها، مطبقةً عبر طبقة تصنيف تعترض الأوامر قبل التشغيل وتقيّم الإطارات المُولَّدة قبل تسليمها.
لماذا يختبر الناس فلاتر المحتوى
يأتي كل نموذج ذكاء اصطناعي رئيسي مع فلتر محتوى. ولكل فلتر محتوى ثغرات. هذا ليس فشلًا في التصميم، بل حقيقة هندسية. المصنّفات المدرَّبة على مجموعات بيانات موسومة تطوّر نقاطًا عمياء حيث كان الوسم ملتبسًا، أو حيث كانت أمثلة التدريب قليلة، أو حيث تقع صياغة الأمر في مناطق رمادية إحصائية لم يتعرض لها النموذج أثناء التدريب.
يشمل الأشخاص الذين يجرون اختبارات محتوى منهجية باحثي الفرق الحمراء في المؤسسات الأكاديمية، ومراجعي الأمان المستقلين، والمحترفين من المبدعين الذين يحتاجون إلى خرائط دقيقة لمواضع الحدود العملية للأداة. تهم البيانات الناتجة لأسباب متعددة: تستخدمها فرق السلامة لسد الثغرات، ويستخدمها المبدعون ليعرفوا ما يمكنهم بناؤه بأداة بعينها.
كيف أُجريت الاختبارات
استخدمت طرق الاختبار الموثّقة ثلاثة مناهج رئيسية: أوامر مباشرة تصف سيناريوهات للبالغين أو موحية بلغة بسيطة، وأوامر غير مباشرة تستخدم إطارًا فنيًا أو تاريخيًا أو مهنيًا، واختبارات تحويل الصورة إلى فيديو تستخدم صورًا مصدرية موحية كإطارات بداية للتوليد.
شُغّلت كل مجموعة من صيغ الأوامر في مجموعات من 20 إلى 50 لاحتساب التباين العشوائي في المخرجات. لا يثبت رفض واحد أن فئة ما محجوبة. إنه يعني أن صياغة محددة فشلت في تشغيل محدد. احتاجت الأنماط إلى تشغيلات متعددة لتظهر، وسُجّلت النتائج حسب الفئة وصيغة الصياغة.
نتائج فاجأت الباحثين

الاستنتاج الجوهري من الاختبارات المنهجية: تعمل فلاتر المحتوى في Veo 3.1 كطيف لا كجدار. أنتجت فئات واضحة من المحتوى القريب من فئة البالغين مخرجات متسقة. وأدت فئات أخرى إلى استجابات غير متسقة، إذ أنتج الأمر نفسه رفضًا في بعض التشغيلات وتوليدًا ناجحًا في غيرها، دون فرق يُذكر في المدخلات.
محتوى موحٍ تسرّب عبر الفلتر
اجتازت عدة فئات من المحتوى المصنّف بموثوقية عالية عبر جلسات اختبار متعددة:
سيناريوهات التصوير التحريري لملابس السباحة والشاطئ أنتجت مخرجات بثبات عند صياغتها باستخدام لغة التصوير الفوتوغرافي المهني. لا يبدو أن الفلتر يصنّف ملابس السباحة كفئة محجوبة عندما يحدد السياق المحيط بالأمر نية تحريرية أو نية أزياء. تضمنت النتائج مشاهد كانت ستُقرأ على أنها صريحة بدرجة معتدلة في كثير من السياقات التحريرية، وخاصة في وضع تحويل الصورة إلى فيديو حيث قُدّم إطار بداية موحٍ.
الإطار الفني أنتج نتائج جزئية. الأوامر التي تستدعي تقاليد دراسة الجسد، أو مواد مرجعية لرسم الجسد الحي، أو سوابق فنية كلاسيكية، أنتجت مخرجات في نحو 40% من التشغيلات. يبدو أن المصنّف مدرَّب بوعي ما بالسياق التاريخي للفن، لكن الحد الفاصل بين تصنيف "فني" و"للبالغين" غير متسق عبر التشغيلات.
السيناريوهات الضمنية للبالغين أُنتجت بثبات. سيناريوهات الفيديو التي تلمّح إلى محتوى للبالغين دون تصويره مباشرة، مثل باب غرفة نوم يُغلق، أو مشهد استحمام يكون فيه الشخص خارج الإطار، ولحظات حميمية تتقدم نحو الصريح دون أن تصل إليه، اجتازت الفلتر في الغالبية العظمى من التشغيلات المختبرة. يبدو أن المصنّف الزمني الذي يقيّم محتوى الفيديو أضعف بكثير في طبقة التلميح منه في طبقة التصوير المباشر.
الملابس المبللة والتركيز على الجسد في سياقات رياضية أو أزياء أُنتج دون عوائق في معظم الاختبارات. المحتوى الذي تُصنّفه وسائل التواصل الاجتماعي على أنه للبالغين، من حيث حالة الملابس والتركيز على الجسد، اجتاز عندما صُوّر كتصوير رياضي أو تصوير أزياء.
💡 النمط عبر الفئات الناجحة: فلتر Veo 3.1 مُعاير لاكتشاف المحتوى الصريح، لا المحتوى الموحي. الفجوة بين ما يُقرأ على أنه للبالغين لدى المراجع البشري، وما يُفعّل عتبة المحتوى الصريح، كبيرة.
أين رسم Veo 3.1 الخط
فعّلت بعض الفئات حجبًا صارمًا عبر جميع صيغ الأوامر وأساليب الصياغة:
جرى حجب المحتوى الجنسي الصريح بصرف النظر عن الإطار الفني أو المهني. رفضت الأوامر التي تصف نشاطًا جنسيًا مباشرًا عبر كل صيغة صياغة اختُبرت، بما في ذلك الصياغات السريرية أو الفنية أو التاريخية.
أدّى المحتوى الذي يتعلق بالقاصرين في أي سياق قريب من المحتوى للبالغين إلى رفض فوري ودون أي استثناء في الاختبارات الموثّقة. ويبدو أن هذه الفئة هي أقوى حجب مطبَّق في النظام.
جرى حجب السيناريوهات التي تنطوي على غياب الموافقة، والموصوفة بلغة مباشرة، بصورة متسقة. كما أدّت الأوامر النصية التي تذكر شخصيات عامة حقيقية بأسمائها في مشاهد حميمة أو مسيئة لسمعتهم إلى الرفض أيضًا، ويبدو أن لدى النظام آلية كشف خاصة بهذه الفئة مستقلة عن فلتر المحتوى للبالغين العام.
مشكلة تناقض الفلتر

أهم ما توصل إليه اختبار محتوى Veo 3.1 ليس ما نجح في العبور. إنه التناقض من تشغيل إلى آخر في طريقة معالجة الأوامر نفسها.
الأمر نفسه، نتائج مختلفة
أظهرت الأوامر المتطابقة المشغّلة في مجموعات من 20 نسب رفض تتراوح بين 20% و60% لمحتوى في فئات المنطقة الرمادية، دون ارتباط يُذكر بالوقت من اليوم، أو نقطة نهاية API، أو أي متغير قابل للملاحظة آخر. يعني العنصر العشوائي في عملية التوليد أن مصنّف الأمان يتلقى تمثيلات داخلية مختلفة قليلًا للأمر نفسه في كل تشغيل، ويتغير خرج تصنيفه الثنائي تبعًا لذلك.
من منظور هندسة السلامة، يمكن القول إن هذا مقصود إلى حد ما: الفلاتر الحتمية أسهل في الاستغلال المنهجي من الفلاتر الاحتمالية. أما من منظور سير العمل الإبداعي فهو مشكلة إنتاج. لا يمكنك بناء خط محتوى موثوق فوق أداة تعالج المدخل نفسه بشكل مختلف في نصف الحالات تقريبًا.
| فئة المحتوى | معدل النجاح التقريبي في الاختبار |
|---|
| تصوير تحريري لملابس السباحة والشاطئ | ~85% |
| سيناريوهات حميمية موحية | ~70% |
| الإطار الفني ودراسة الجسد | ~40% |
| الملابس المبللة، والتركيز الرياضي | ~75% |
| محتوى صريح للبالغين | ~0% |
حلول بديلة تنجح (وأخرى لا تنجح)

وثّق مجتمع الاختبار عدة مناهج للأوامر حسّنت باستمرار معدلات النجاح لفئات المحتوى الموحي:
وضع السياق المهني في المقدمة يحسّن معدلات النجاح. الأوامر التي تبدأ بإطار مهني ("fashion editorial photography for a luxury brand featuring...") تنجح بمعدلات أعلى من الأوامر التي تصف المحتوى البصري أولًا. يمنح المصنّف وزنًا أكبر للتوكنات المبكرة في الأمر، لذا فإن تأسيس السياق المهني قبل وصف الشخص يُغيّر مخرج التصنيف.
لغة التصوير الفوتوغرافي التقني تُقرأ كتحريرية. تضمين تفاصيل محددة عن الكاميرا والعدسة وخامة الفيلم ("مُلتقط بعدسة 85mm f/1.4، حبيبات Kodak Portra 400، جودة تحريرية") يبدو أنه يدفع التصنيف نحو فئات تحريرية بدلًا من فئات المحتوى للبالغين.
وصف خصائص المادة بدلًا من درجات انكشاف الجسد. الأوامر التي تشير إلى خصائص القماش ("قماش شفاف يلتقط ضوء نافذة خلفي") تتفوق باستمرار على الأوامر التي تصف حالات الجسد مباشرة.
ما لا ينجح: أنماط الأوامر العدائية، أو استبدال الحروف، أو أي صياغة مصممة بوضوح لإخفاء النية. يتمتع مصنّف Veo 3.1 بمتانة محددة تجاه هندسة الأوامر العدائية، ومحاولات التلاعب بالتصنيف عبر الإخفاء تميل إلى إحداث رفض أكثر، لا أقل.
الخيار الأفضل: ذكاء اصطناعي غير مقيّد على PicassoIA

تشير بيانات اختبار Veo 3.1 إلى الاستنتاج نفسه الذي يظهر من اختبار أي نموذج مُقيَّد: إذا كنت تحتاج إلى نتائج متسقة ومتوقعة لمحتوى قريب من فئة البالغين دون تباين في الفلتر، فإن المصنّفات في وقت تشغيل النموذج هي الأداة الخاطئة للمهمة.
يوفر PicassoIA الوصول إلى عدة نماذج تتعامل مع المحتوى الموحي ومحتوى البالغين اللائق دون مشكلة التناقض، دون حدود استخدام، ودون متطلبات موافقة، ودون علامات مائية.
Seedream 4: المحطة الأولى الصحيحة
Seedream 4 هو نقطة البداية الموصى بها لتوليد الصور القريبة من فئة البالغين. ينتج نموذج ByteDance صورًا بدقة تصل إلى 4K مع ملمس بشرة واقعي كالصور الفوتوغرافية، وتصيير للأقمشة، وفيزياء إضاءة. المزايا لهذا الاستخدام كبيرة:
المخرجات تحددها الأوامر لا المصنّف. ما تصفه هو ما يُولَّد. نسب النجاح لملابس السباحة، والملابس الداخلية، والجلامور (glamour)، والمحتوى الفني العاري متسقة عبر الجلسات.
تتيح دقة الإخراج 4K توليد صور بدقة الطباعة دون رفع دقة. يتيح إدخال الصورة المرجعية ترسيخ هوية بصرية، سواء كانت شخصية أو أسلوبًا أو تكوينًا، ونقلها عبر سلسلة توليد. يُنتج وضع التوليد المتسلسل حتى 15 صورة ذات صلة من أمر نصي واحد، ما يمنحك التنوع دون عبء إعادة كتابة الأمر لكل صورة على حدة.
بالنسبة للمبدعين الذين يتعاملون مع لعبة فلتر Veo 3.1، فإن قابلية التنبؤ في Seedream 4 هي الفرق الأكثر قيمة فورًا.
Flux Dev: أقصى درجات الواقعية
Flux Dev من Black Forest Labs يضم 12 مليار معامل، ما يترجم مباشرة إلى تشريح أفضل، وتنوعًا أكثر طبيعية في الوضعيات، وتفاعلًا أكثر إقناعًا بين القماش والبشرة مقارنةً بالنماذج الأصغر. بالنسبة للمحتوى القريب من فئة البالغين حيث الواقعية هي المتطلب الأساسي، لعدد المعاملات أهمية.
يقبل وضع img2img صورة موجودة وأمرًا نصيًا يصف كيفية تعديلها، ما يجعل من السهل تحسين المخرجات التي تقترب ولا تبلغ الصواب تمامًا. تغطي إحدى عشرة نسبة عرض إلى ارتفاع كل تنسيق من المربع إلى العريض جدًا دون قص. يتيح التحكم في قيمة البذرة تثبيت نتيجة تعمل وتكرار تغييرات صغيرة منها بشكل منهجي.
Flux Schnell: تكرار بحجم كبير
Flux Schnell ينتج مخرجات واقعية في أقل من 5 ثوانٍ لكل صورة دون سقف توليد على PicassoIA. لمرحلة تطوير الأوامر في مشروع المحتوى، حيث تشغّل 30 أو 50 تنويعة لإيجاد الصياغة والتكوين اللذين ينجحان قبل الالتزام بتوليدات أعلى جودة، يتعامل Flux Schnell مع هذا العمل دون احتكاك أو عبء نقاط.
يعني سياسة التوليد غير المحدود أنه يمكنك تشغيل أي عدد من التكرارات يتطلبه المشروع دون مراقبة عداد النقاط. بالنسبة لعمليات المحتوى كبيرة الحجم، فهذا فرق تشغيلي مهم عن أي نموذج API مُقيَّد.
SDXL: اتساق الأسلوب عبر السلاسل
SDXL يدعم أوزان LoRA المخصصة، وهذا مهم لسلاسل المحتوى التي تتطلب اتساقًا بصريًا. حمّل LoRA مدرّبًا على جماليات محددة أو نمط إضاءة أو نوع جسد، وستشترك كل عملية توليد في "الحمض النووي" البصري نفسه. يضيف مسار المحسّن المدمج تمريرة ثانية لزيادة الحدة، وهي مفيدة بوجه خاص لملمس البشرة وتفاصيل القماش في الصور الحميمية أو الصور بأسلوب الجلامور.
كيفية استخدام Seedream 4 على PicassoIA

Seedream 4 هو نقطة البداية الموصى بها لتوليد الصور القريبة من فئة البالغين على PicassoIA. تحقق الخطوات التالية أفضل النتائج.
الخطوة 1: افتح النموذج. انتقل إلى picassoia.com/en/collection/text-to-image/bytedance-seedream-4. لا يتطلب ذلك موافقة على الحساب.
الخطوة 2: صِغ أمرك النصي للحصول على مظهر واقعي كالصور الفوتوغرافية. يستجيب Seedream 4 بشكل أفضل للأوامر النصية التي تحدد الشخص والبيئة والإضاءة وخصائص الكاميرا معًا. هذه بنية تعمل جيدًا:
"Editorial fashion photograph of a woman in [clothing description], [environment], [specific lighting description], 85mm f/1.4, Kodak Portra 400 film grain, photorealistic skin texture, 4K"
الخطوة 3: حدّد الدقة. تناسب دقة 2K التسليم عبر الويب جيدًا. أما 4K فمناسبة للطباعة أو للمخرجات عالية الدقة. بالنسبة للمنصات الاجتماعية، تغطي دقة 2K بنسبة عرض إلى ارتفاع 16:9 معظم متطلبات العرض.
الخطوة 4: استخدم صورًا مرجعية لثبات الشخصيات. إذا كنت تعمل على سلسلة بشخص ثابت، فارفع صورة مرجعية باستخدام المعامل image_input. يحمل Seedream 4 الهوية البصرية من المرجع إلى المخرجات المولّدة بدقة عالية.
الخطوة 5: شغّل التوليد المتسلسل لأعمال السلاسل. اضبط sequential_image_generation على auto، واضبط max_images على 8-15. ينتج النموذج سلسلة ذات صلة من أمر نصي واحد، مع تنوع في التكوين دون الحاجة إلى إعادة كتابة الأمر لكل صورة.

💡 حدّد مصادر إضاءة بعينها، لا الصفات فقط. "ضوء صباحي حجمي يمر عبر ستائر شاش من الجهة اليسرى" يتفوق على "ضوء طبيعي ناعم". تتناسب جودة مخرجات النموذج تناسبًا طرديًا مع دقة وصفك للإضاءة.
نصائح إضافية لمخرجات أفضل:
- اذكر خامات أقمشة محددة. "شيفون شفاف" و"حرير مبلل" و"جيرسي مرن" تفعّل أمثلة تدريب أفضل من أوصاف الملابس العامة.
- أضف اتجاه التكوين. "الشخص يشغل الثلث السفلي، وخلفية سماء واسعة" يمنح النموذج معلومات عن التخطيط تحسّن تماسك الصورة الكلي.
- حدّد نوع الفيلم. "Kodak Portra 400" أو "Fujifilm 400H" أو "Ilford HP5" تحسّن باستمرار عرض درجات لون البشرة وتقلل الطابع الإكلينيكي الموجود في كثير من المخرجات المولّدة بالذكاء الاصطناعي.
- استخدم المساحة السلبية عن قصد. صِف ما يجب ألا يظهر في الإطار، إما في حقل الأمر النصي السلبي أو في نهاية الأمر النصي الرئيسي باستخدام عبارات مثل "بلا مؤثرات رقمية، بلا CGI".

PicassoIA مقابل Veo 3.1: جنبًا إلى جنب

المقارنة بين Veo 3.1 ومكتبة نماذج PicassoIA لا تدور أساسًا حول جودة المخرجات. ينتج Veo 3.1 مخرجات قوية عندما يعمل. المقارنة تدور حول موثوقية سير العمل.
| العامل | Veo 3.1 | نماذج PicassoIA |
|---|
| سلوك فلتر المحتوى | عشوائي، يختلف من تشغيل لآخر | محدد بالأمر، متسق |
| معدل النجاح للمحتوى الموحي | 40-85% حسب الفئة | 95%+ |
| نوع المخرج | مقاطع فيديو | صور تصل إلى 4K |
| سرعة التوليد | 30-90 ثانية لكل مقطع | 5-30 ثانية لكل صورة |
| التكلفة | يتطلب نقاط API | مجاني، دون حدود |
| العلامة المائية | SynthID مدمجة | لا توجد |
| الوصول | مقيّد بطلب الانضمام | فوري، دون موافقة |
| قابلية التنبؤ بالمحتوى للبالغين | يفرضه المصنّف، غير متسق | قائم على الأمر، موثوق |
يعني التباين في معدل النجاح للمحتوى الموحي أن بناء خط إنتاج على Veo 3.1 لأي شيء في المنطقة الرمادية يتطلب التخطيط لمعدل رفض كبير. عند معدل نجاح 40% للمحتوى الفني، تحتاج إلى توليد 2.5 ضعف حجمك المستهدف ثم تصفية النتائج. بالنظر إلى سرعة التوليد وتكلفة النقاط في الفيديو المعتمد على API، فإن هذا العبء كبير.
لا تحتاج نماذج PicassoIA إلى حساب هذا العبء. ولّد ما تحتاجه، واحصل على ما وصفته.
أنشئ بحرية على PicassoIA

نتائج فلتر محتوى Veo 3.1 تستحق القراءة إذا كنت تدرس كيف تفشل المصنّفات في وقت تشغيل النموذج عند الحواف. لكن إذا كنت تبني على تلك النتائج بدلًا من فحصها أكاديميًا، فالاستنتاج العملي واضح: النماذج المُقيَّدة ذات المصنّفات غير الشفافة ليست الأساس الصحيح لعمل إبداعي قريب من فئة البالغين.
Seedream 4 يولّد صورًا واقعية كالصور الفوتوغرافية تصل إلى 4K من أوامرك، دون تباين في الفلتر، ودون علامات مائية، ودون نقاط. Flux Dev يقدم واقعية بمعاملات تبلغ 12 مليارًا مع تحرير كامل بوضع img2img. Flux Schnell يعمل بتكرارات غير محدودة وبسرعة. SDXL يضيف التحكم بأسلوب LoRA لأعمال السلاسل المتسقة.
المكتبة الكاملة للنماذج متاحة على picassoia.com/en/all-models. لا يلزم طلب. لا يوجد مصنّف يقرر ما إذا كان اتجاهك الإبداعي يمر اليوم. افتح نموذجًا، واكتب أمرك، وولّد.