لماذا يُوسَم Veo 3.1 أوامر المحتوى البالغ بالحظر باستمرار؟

نظرة معمّقة في نظام السلامة لدى Veo 3.1، ولماذا يُبلِّغ عن أوامر الفيديو ذات الطابع البالغ أو الموحي أو الناضج بصرامة أكبر من النماذج المنافسة. تفاصيل عمّا يُشغّل نظام الكشف، وكيف يقارن Veo 3.1 بكل من Seedance 2.5 وKling v2.6 وWan 2.7، وأي المنصات توفر المرونة التي يحتاجها المبدعون.

لماذا يُوسَم Veo 3.1 أوامر المحتوى البالغ بالحظر باستمرار؟
Cristian Da Conceicao
مؤسس Picasso IA

كتبت أمرًا عاديًا تمامًا. ربما كان امرأة ترتدي فستانًا صيفيًا على شاطئ، أو تقريبًا بطيئًا على عارضة أزياء في استوديو. أعاد Veo 3.1 رسالة تفيد بتعليق المحتوى لأسباب تتعلق بالسلامة، دون فيديو، ودون تفسير مفصّل يتجاوز رسالة رفض مقتضبة. يحدث هذا باستمرار، والإحباط مبرَّر، لأن الأمر لم يكن إباحيًا، ولم يكن صريحًا، وفي كثير من الحالات لم يكن حتى موحيًا بأي معنى ذي قيمة. فما الذي يحدث فعلًا؟

يُعد Veo 3.1 من أكثر نماذج توليد الفيديو بالذكاء الاصطناعي قدرةً المتاحة اليوم، إذ يقدّم مخرجات بدقة 1080p مع صوت أصلي بطريقة لا تستطيع معظم المنافسات مضاهاتها حتى الآن. لكن إشراف المحتوى لديه مُعايَر لحالة استخدام مختلفة تمامًا عمّا يحتاجه معظم المحترفين المبدعين. فهم سبب تعليمه لأوامر معينة، وما يمكنك فعله حيال ذلك، يوفّر الوقت والنقاط.

صورة مقرّبة ليدين على لوحة مفاتيح هولوغرافية مع إشعار تحذير بوجود محتوى مُعلَّم

فلتر السلامة لدى Google يُعطي الأولوية للحجم

Veo 3.1 منتج من Google DeepMind، يُنشر على نطاق واسع عبر تطبيقات المستهلكين وواجهات API المؤسسية والتكاملات الخارجية. وعندما يعمل نموذج بهذا الحجم، لا تُحدَّد سياسة سلامة المحتوى بالرغبة في منع المخرجات الضارة فحسب، بل أيضًا بالتعرض للمساءلة القانونية وعلاقات المعلنين والمتطلبات التنظيمية في عشرات الولايات القضائية في آنٍ واحد.

صُمم نظام السلامة لسيناريو الحالة الأسوأ، لا لحالة الاستثناء الخاصة بمبدع محترف لديه مشروع إبداعي شرعي. تُعتبر الإيجابيات الكاذبة، أي الأوامر المُعلَّمة رغم أنها بريئة فعلًا، تكلفةً مقبولة في سبيل هذا التوازن. لهذا السبب تُرفض أوامر كانت ستجتاز أي مراجعة بشرية معقولة، لأن نظامًا آليًا محسّنًا للحجم يتولى الأمر.

تتفاقم المشكلة لأن كل إصدار من Veo كان أكثر تحفظًا من سابقه. كان Veo 2 يملك فلترًا محكمًا. وكان Veo 3 أشد. أما Veo 3.1 فهو أشد من ذلك، ولا يوجد في الخط الإنتاجي إصدار أخف. ويطبق كلٌّ من Veo 3.1 Fast وVeo 3.1 Lite طبقة السلامة نفسها بالحساسية نفسها التي يطبقها النموذج الكامل.

ثلاث طبقات كشف تعمل معًا

لا يعمل إشراف المحتوى في Veo 3.1 كمرشح كلمات بسيط. بل يُشغّل ثلاث آليات كشف متوازية على الأقل، تعمل جميعها في الوقت نفسه:

مطابقة التضمين الدلالي. يحوّل النموذج أمرك إلى فضاء متجهات دلالي، ويتحقق من قربه من مجموعات المفاهيم المُعلَّمة. هذا يعني أنك لا تحتاج إلى استخدام كلمة مُعلَّمة بعينها. فالكلمات القريبة دلاليًا من مفاهيم إشكالية في فضاء التضمين تُفعّل الفلتر أيضًا. فكلمة "Swimwear" أقرب في ذلك الفضاء إلى الفئات المُعلَّمة من عبارة "summer clothing"، حتى لو كان المخرج البصري الذي تصفه متطابقًا.

تقييم النية السياقية. حتى إن لم يُفعّل أي عنصر منفرد علامة، يُقيَّم الأمر بكامله من حيث النية المستنتجة. فالأمر الذي يجمع بين شخص أنثى، وإعداد خاص، وقرب الكاميرا من الجسد، وإضاءة دافئة حميمية، يُعدّ عالي الخطورة أكثر من أي من هذه العناصر وحده. يقيّم النظام أنماط التركيب، لا المصطلحات الفردية فقط.

تحليل مشروط بالصورة. في سير عمل تحويل الصورة إلى فيديو، تُحلَّل صورة المدخل قبل بدء أي توليد. قد تُفعّل صورة مصدر لامرأة ترتدي بيكيني علامةً في مرحلة تحليل الصورة بغضّ النظر عمّا يقوله الأمر النصي. وهذا يصطاد سير العمل الذي يحاول استخدام أوامر نصية محايدة مع صور مصدر موحية.

غرفة خوادم ذكاء اصطناعي مع إشارة تنبيه حمراء تمثل حجم البنية التحتية لإشراف المحتوى

ما الذي يقرأه الفلتر أولًا

قبل بدء أي توليد فيديو، يمرّر Veo 3.1 أمرك النصي عبر مصنّف للسلامة. دُرِّب هذا المصنّف على مجموعة بيانات كبيرة من محتوى مُعلَّم ومحتوى مُعتمَد، ويطبّق درجات عبر فئات ضرر متعددة في وقت واحد، لا على المحتوى البالغ وحده. قد يُقيَّم أمر واحد من حيث المحتوى الجنسي والعنف والتحرش وقضايا حقوق النشر في الوقت نفسه.

لا يعرف المصنّف أنك مصوّر أزياء محترف، ولا أن جمهورك يتألف من بالغين ناضجين اختاروا المحتوى الموجّه للبالغين، ولا أن المشهد الذي تصفه أقل صراحةً من جلسة تصوير لمجلة أزياء قياسية. إنه يطبّق فلترًا شاملًا يجب أن يعمل مع كل مستخدم في كل سياق، من المراهقين في التطبيقات الاستهلاكية إلى عملاء API في المؤسسات.

أنماط الأوامر التي تُفعّل علامة الرفض

معرفة الأنماط المحددة التي ترفع درجة الخطورة تتيح لك العمل بفعالية أكبر ضمن النظام، أو اتخاذ قرار أسرع بالتحول إلى نموذج آخر حين يقع المحتوى فعلًا خارج ما يقبله Veo 3.1.

أوصاف الملابس التي تُطلق التنبيهات

أوصاف القطع التي تُظهر أقل قدر من التغطية هي الأكثر موثوقية في تفعيل العلامات. تُفعّل كلمات مثل "bikini" و"lingerie" و"swimsuit" و"sheer" و"topless" و"revealing" التفعيل باستمرار. لكن البدائل الوصفية تفعل الشيء نفسه أيضًا: فعبارات "barely covered" و"revealing outfit" و"straps only" و"minimal clothing" كلها قريبة دلاليًا من الفئات المُعلَّمة بسبب طريقة تدريب نموذج التضمين.

يلتقط النظام أيضًا مصطلحات الأزياء والجلامور حين تجتمع معًا. فعبارة "Glamour shot" مع شخص أنثى ومع إعداد استوديو ومع قرب الكاميرا من الجسد تُنشئ علامة حتى دون وجود وصف للملابس في الأمر. نمط التركيب مهم بقدر أهمية المصطلحات الفردية.

امرأة ترتدي بيكيني أبيض عند مسبح لا نهائي يطل على المحيط، تمثل سيناريوهات المحتوى المُعلَّم بالذكاء الاصطناعي

لغة الكاميرا التي يعتبرها Veo خطرة

توصيفات الكاميرا واللقطات التي تؤكد قرب الجسد مصدر كبير ومُقلَّل من شأنه غالبًا للعلامات. تزيد هذه العبارات درجة الخطورة باستمرار:

  • "Close-up of legs, waist, or torso"
  • "Slow zoom on the subject's body"
  • "Tight shot from waist down"
  • "Camera tilts up from feet to face"
  • "Extreme close-up of skin, lips, or curves"
  • "Mid-shot centered on chest or hips"

تتراكم لغة التأطير التي توحي بالتلصص، ولو دون قصد، مع عوامل الخطورة الأخرى في الأمر. فحركة بطيئة للكاميرا نحو شخص محايد في مكان عام محايد تمر دون مشكلة. أما الحركة نفسها عند تطبيقها على امرأة ترتدي ملابس قليلة في مكان خاص فلا تمر.

الأماكن التي ترفع درجة الخطورة

تحمل المساحات الخاصة والحميمية درجات خطورة أساسية أعلى، حتى مع أوامر محايدة تمامًا وأشخاص محايدين:

  • غرف النوم، لا سيما ليلًا أو مع إضاءة رومانسية ناعمة
  • الحمامات ومناطق الاستحمام
  • غرف تغيير الملابس ومناطق الخزائن
  • غرف الفنادق والأجنحة الخاصة
  • أي مكان يوصف صراحةً بأنه "private" أو "intimate"

الأماكن العامة أكثر أمانًا بكثير. شاطئ في منتصف النهار، وشارع في المدينة، واستوديو تظهر فيه المعدات، وشرفة مطعم في الهواء الطلق. تخفض إشارات السياق هذه درجة الخطورة الإجمالية للأمر، حتى حين تكون عناصر أخرى فيه مركّزة على الجسد أو ملابسها قليلة.

Veo 3.1 مقابل الإصدارات السابقة

سلوك التعليم في Veo 3.1 أشد بوضوح مما أبلغ عنه المستخدمون في الإصدارات السابقة. هذا النمط مقصود ومتّسق عبر خط المنتجات.

النموذجمستوى التعليمالصوت الأصليأقصى دقة
Veo 2مرتفعلا1080p
Veo 3مرتفع جدًانعم1080p
Veo 3 Fastمرتفع جدًانعم1080p
Veo 3.1الأعلىنعم1080p
Veo 3.1 Fastالأعلىنعم1080p
Veo 3.1 Liteالأعلىنعم720p

لا يوجد أي خيار إعداد لتقليل الحساسية. لا توجد معلمة API، ولا إصدار من النموذج، ولا أسلوب في صياغة الأوامر يعطّل فلتر السلامة بالكامل. وإذا كان استخدامك يتطلب توليد محتوى يحظره Veo 3.1 باستمرار، فالحل هو استخدام نموذج مختلف، لا الاستمرار في تعديل الأمر نفسه عبر رفض متكرر.

شاشة تعرض مقارنة مقسومة بين محتوى فيديو بالذكاء الاصطناعي مُعلَّم ومُعتمَد

كيف تتعامل النماذج المنافسة مع ذلك

نهج إشراف المحتوى في Veo 3.1 ليس المعيار السائد في الصناعة. تتبنى نماذج أخرى مقاربات مختلفة بشكل ملحوظ، والفروق مهمة للعمل الإبداعي الاحترافي.

Seedance 2.5 ونهج ByteDance

يتعامل Seedance 2.5 باستمرار مع محتوى الجلامور والملابس البحرية والمحتوى المرتكز على الجسد، الذي يحجبه Veo 3.1 تمامًا. تعايّر ByteDance فلتر Seedance للمحتوى الموحي لا للتحفظ الأقصى، فتقبل الأول وترفض المواد الصريحة فعلًا فقط. ينتج النموذج فيديوهات تصل مدتها إلى 10 ثوانٍ مع صوت متزامن بدقة 1080p، ما يجعله منافسًا مباشرًا في الجودة لنموذج Veo، مع سياسة أكثر تساهلًا بكثير.

يتبع Seedance 2.0 وSeedance 2.0 Mini سياسة المحتوى نفسها. تقبل الثلاثة أوامر تصف ملابس قليلة، وإعدادات الشاطئ والمسبح مع تأطير قريب، وسيناريوهات تصوير الجلامور التي يرفضها Veo رفضًا قاطعًا.

💡 اختبار سريع: إن تم تعليم أمرك على Veo 3.1، فأرسله إلى Seedance 2.5 دون أي تعديل. كثيرًا ما ستحصل على توليد نظيف من المحاولة الأولى.

Kling v2.6 وv3

كان Kling v2.6 وKling v3 Video من Kwai من بين أكثر النماذج الكبرى مرونةً تاريخيًا في محتوى الأزياء والجمال ونمط الحياة الذي يتضمن عمل كاميرا مركّزًا على الجسد. يعرض النموذجان الجلد وملمس القماش والحركة الواقعية بدقة عالية، ويقبل كلاهما نطاقًا أوسع من الأوامر مقارنةً بخط Veo 3.x.

يستحق Kling v2.5 Turbo Pro الاختبار أيضًا في سير العمل عالي الإنتاجية الذي تحتاج فيه إلى سرعة توليد أعلى وسياسة محتوى أكثر تساهلًا.

Wan 2.7 لسير العمل المفتوح

يمنح Wan 2.7 T2V وWan 2.7 I2V المبدعين المحترفين أكبر قدر من المرونة في محتوى نمط الحياة الناضج دون الحاجة إلى جهد كبير في هندسة الأوامر للالتفاف على الفلاتر. Wan 2.7 نموذج مفتوح الأوزان، ويعكس نشر PicassoIA ذلك بسياسة محتوى أقل تقييدًا بكثير مما تفرضه Google تجاريًا.

امرأة جميلة في مقهى في الهواء الطلق تستخدم هاتفًا ذكيًا مع منصة فيديو بالذكاء الاصطناعي

استخدام Veo 3.1 على PicassoIA

إن أردت العمل مع Veo 3.1 تحديدًا، فهناك أساليب في الصياغة تقلل معدل الرفض دون التضحية بالجودة الإبداعية.

خطوة بخطوة على المنصة

  1. افتح Veo 3.1 على PicassoIA وابدأ بكتابة وصف مشهدك.
  2. ابدأ بالبيئة لا بالشخص. حدّد المكان بالكامل قبل تقديم الشخص.
  3. استخدم لغة ملابس محايدة: "dressed for the beach" بدلًا من "bikini"، و"summer outfit" بدلًا من "revealing dress"، و"athletic wear" بدلًا من "sports bra and shorts".
  4. صُغ لغة الكاميرا حول الحركة لا حول القرب: "camera slowly pulls back to reveal" بدلًا من "tight close-up of"، و"gentle pan across the scene" بدلًا من "slow zoom into her body".
  5. تجنّب الأماكن الخاصة كلما أمكن. إن كان المشهد يصلح في الهواء الطلق، فانقله إلى الهواء الطلق.
  6. أرسل الأمر. إن تم تعليمه، فأزل لغة قرب الكاميرا أولًا، ثم تفاصيل الملابس، ثم واصفات المكان، واختبر بعد كل إزالة لتحديد العنصر الذي يُفعّل الرفض.
  7. مع Veo 3.1 Fast: تنطبق القواعد نفسها، مع مخرجات أسرع والحساسية نفسها للفلتر. مع Veo 3.1 Lite: مخرجات بدقة أقل، ونفس قواعد المحتوى.

أوامر تنجح مقابل أوامر تفشل

💡 تنجح: "A woman in a summer dress walking along a beach at golden hour, wide establishing shot, gentle ocean breeze, warm natural light, 1080p cinematic"

💡 تفشل: "A woman in a bikini on the beach, slow zoom on her legs, warm afternoon sun, close-up framing on the lower body"

الفرق: لا تحديد للملابس مع تأطير واسع، مقابل تحديد للملابس مع توجيه للكاميرا على الجسد. الأمر الثاني يفشل لا بسبب كلمة واحدة، بل بسبب التركيب.

💡 تنجح: "Fashion model in a white dress in a rooftop studio, professional lighting, editorial photography style, mid-distance shot"

💡 تفشل: "Fashion model in sheer lingerie in a studio, dramatic intimate lighting, tight shot of torso, extreme close-up of skin texture"

أزِل تفاصيل الملابس وابعد الكاميرا، فسيوافق Veo 3.1 غالبًا على ما حجبه سابقًا.

إلى أين تذهب حين يرفضك Veo

حين لا تحل تعديلات الأمر المشكلة، ويقع المحتوى الذي تحتاج إلى إنشائه خارج ما يقبله Veo 3.1، فالتحول إلى نموذج آخر هو القرار الصائب. إنفاق النقاط على رفض متكرر ليس سير عمل.

Seedance للجلامور والملابس البحرية

يُعد Seedance 2.5 التوصية الأساسية لمحتوى الملابس البحرية والجلامور ونمط الحياة الذي يحجبه Veo باستمرار. يتعامل مع المجال الكامل للمحتوى الموحي غير الصريح، وينتج فيديو بدقة 1080p مع صوت متزامن، ويعمل بسرعات توليد تنافسية. ويُعد Seedance 1.5 Pro بديلًا احتياطيًا جيدًا لهذه الفئة حين تريد مقاطع أقصر أو مخرجات بجماليات مختلفة.

Kling لمحتوى الأزياء المرتكز على الجسد

يتفوّق Kling v3 Video في محتوى الأزياء والجمال مع عمل كاميرا قوي مركّز على الجسد. يعرض النموذج ملمس القماش وتفاصيل البشرة والحركة الواقعية بدقة عالية، ويقبل أوامر تتضمن تأطيرًا قريبًا، وأوصافًا للملابس البحرية، وواصفات لأماكن حميمية يحجبها Veo 3.1 افتراضيًا.

امرأة ترتدي ملابس سباحة بيضاء على سطح عمارة سكنية عند الغسق، تمثل محتوى غير مقيّد في نماذج فيديو بديلة بالذكاء الاصطناعي

Wan 2.7 لأقصى قدر من المرونة

يمنحك Wan 2.7 T2V أوسع قبول للأوامر في المحتوى الناضج بين نماذج الفيديو عالية الجودة على PicassoIA. وفي عمل تحويل الصورة إلى فيديو بصور مصدر موحية تُرفض في مرحلة تحليل الصورة في Veo، يُعد Wan 2.7 I2V بديلًا مباشرًا. يتجاوز فحص السلامة المشروط بالصورة الذي يطبّقه Veo 3.1 على صور المدخل.

التكلفة الحقيقية للتصفية المفرطة

هناك كلفة لاحقة لإشراف المحتوى المتشدد نادرًا ما تظهر في مقاييس سلامة المنتج. فدور الأزياء، ومبدعو نمط الحياة، ومنصات المحتوى البالغ، والمصورون الفنيون مستخدمون مشروعون لديهم مشاريع إبداعية مشروعة. وحين يرفض الفلتر جلسة تصوير لمجلة أزياء، أو تحريك صورة جلامور، أو مفهوم فني لعُري ضمني، فهؤلاء المستخدمون لا يصبحون أمهر في هندسة الأوامر بين ليلة وضحاها. بل يتحولون إلى منصات أخرى.

ينتج Veo 3.1 بعضًا من أقوى مخرجات الفيديو المتاحة حاليًا. فالسينمائية مثيرة للإعجاب فعلًا، ومزامنة الصوت أصلية وعالية الجودة، ودقة 1080p تحفظ التفاصيل الدقيقة جيدًا. لو عايرت Google سياسة المحتوى بقدر أقل قليلًا من التحفظ، دون التخلي عن إنفاذ السلامة الجوهري، لخدم النموذج سوقًا إبداعيًا احترافيًا أكبر بكثير.

إلى أن يتغير ذلك، فإن سير العمل المنطقي هو استخدام Veo 3.1 لفئات المحتوى التي يتعامل معها بسلاسة: السرديات السينمائية، واللقطات بأسلوب الوثائقيات، ومقاطع المنتجات، ومقاطع المناظر الطبيعية، ومحتوى الحركة التجريدية. أما للجلامور والأزياء ونمط الحياة والعمل الإبداعي الناضج، فالأدوات الأفضل هي Seedance 2.5، أو Kling v3، أو Wan 2.7.

اختيار النموذج حسب حالة الاستخدام

نوع المحتوىأفضل نموذجلماذا يعمل
السرد السينمائيVeo 3.1أفضل حركة وصوت أصلي
مقاطع سينمائية سريعةVeo 3.1 Fastالجودة نفسها، وتوليد أسرع
مخرجات الفيديو الطويلةSeedance 2.5تصل إلى 10 ثوانٍ، وفلتر متساهل
الملابس البحرية والجلامورSeedance 2.5يقبل أوامر مركّزة على الجسد
محتوى الأزياء والجسدKling v3 Videoعرض قوي للبشرة وملمس القماش
محتوى نمط الحياة الناضجWan 2.7 T2Vأكثر سياسة محتوى مرونة
تحريك الصور بمحتوى ناضجWan 2.7 I2Vيتجاوز فحص السلامة على مستوى الصورة
محتوى ناضج بميزانية محدودةKling v2.6جودة بتكلفة أقل لكل توليد

عرض علوي لمقارنة نماذج فيديو بالذكاء الاصطناعي على مكتب رخامي أبيض مع هاتف ذكي وفنجان قهوة

ابدأ الإبداع على PicassoIA

يتيح لك PicassoIA الوصول إلى جميع النماذج الواردة في هذه المقالة ضمن منصة واحدة. ومنها Veo 3.1، وVeo 3.1 Fast، وSeedance 2.5، وKling v3 Video، وWan 2.7 كلها متاحة دون تبديل الحسابات أو إدارة بيانات اعتماد API منفصلة.

سير العمل العملي: جرّب أمرك على Veo 3.1 أولًا للحصول على أفضل جودة سينمائية. إن تم تعليمه، فانقل الأمر نفسه دون تغيير إلى Seedance 2.5 أو Kling v3. أما في عمل تحويل الصورة إلى فيديو بصور مصدر يرفضها Veo في مرحلة تحليل الصورة، فإن Wan 2.7 I2V هو البديل المباشر.

💡 يمكنك تصفح مجموعة نماذج توليد الصور والفيديو كاملة على picassoia.com/en/all-models لإيجاد الأنسب لما تبنيه، سواء كان محتوى سينمائيًا يتعامل معه Veo 3.1 دون احتكاك، أو عملًا إبداعيًا ناضجًا يحتاج إلى بيئة أقل تقييدًا.

النماذج موجودة، والمنصة موجودة. ما يغيّره هذا الفهم هو معرفة أي أداة تختار أولًا، وأيها تلجأ إليها حين تقول الأولى "لا".

بورتريه إبداعي لامرأة ذات عينين عنبريتين في معرض فني، يمثل الحرية الفنية في إنشاء المحتوى بالذكاء الاصطناعي

فريق إبداعي يراجع فيديو مُولَّدًا بالذكاء الاصطناعي في مكتب وكالة حديث ليلًا

شارك هذا المقال

اختر لغتك

مقالات ذات صلة