كيف تعمل مولّدات الذكاء الاصطناعي لمحتوى NSFW خلف الكواليس

نظرة من الداخل على مجموعة التقنيات الكاملة وراء مولّدات الذكاء الاصطناعي لمحتوى NSFW: كيف تعالج نماذج الانتشار الأوامر النصية، وكيف تعمل مرشّحات الأمان، وما الأجهزة التي تشغّلها، وكيف تنتج النماذج المضبوطة بدقة مثل Flux Dev صورًا واقعية لأشخاص بتفاصيل مذهلة.

كيف تعمل مولّدات الذكاء الاصطناعي لمحتوى NSFW خلف الكواليس
Cristian Da Conceicao
مؤسس Picasso IA

إذا كتبت يومًا أمرًا نصيًا موحيًا في مولّد للذكاء الاصطناعي وشاهدت صورة واقعية تتشكّل خلال ثوانٍ، فقد رأيت واحدًا من أكثر مسارات تعلم الآلة الحديثة تعقيدًا وهو يعمل بكامل سرعته. يحدث خلف دائرة التحميل الدوّارة أكثر بكثير مما يدركه معظم الناس. تشمل العملية الضغط، والرياضيات الخاصة بالضوضاء، ونماذج اللغة، وتسريع الأجهزة، وشبكة معقدة من قرارات الأمان تختلف بشدة من منصة إلى أخرى.

يفصّل هذا المقال كل طبقة من هذا المسار، من لحظة وصول أمرك النصي إلى الخادم حتى البكسل الأخير الذي يظهر على شاشتك.

ما الذي يُنتج المخرجات فعلًا

النص يدخل، والبكسلات تخرج

التقنية الأساسية وراء معظم مولّدات الصور بالذكاء الاصطناعي الحديثة هي نموذج الانتشار الكامن (latent diffusion model). يبدو المصطلح تقنيًا، لكن الفكرة بسيطة: بدلًا من العمل مباشرة على صور البكسل كاملة الحجم (وهو ما يتطلب ذاكرة ضخمة)، يعمل النموذج داخل فضاء رياضي مضغوط يسمى الفضاء الكامن (latent space). تُرمَّز الصور إلى تمثيل أصغر بكثير، ثم تُعالَج، ثم تُفكّ شفرتها مرة أخرى إلى بكسلات مرئية.

النموذجان اللذان يقومان بعملية الترميز وفك الترميز يشكّلان VAE (المُرمِّز التلقائي التبايني)، إذ يضغط الصورة المستهدفة إلى أرقام ثم يعيد بناءها. هذا الضغط هو السبب في أن صور الذكاء الاصطناعي تُولَّد خلال ثوانٍ بدلًا من ساعات.

ممر حديث جدًا في مركز بيانات تصطف فيه رفوف خوادم مضيئة تمثل البنية التحتية وراء توليد الذكاء الاصطناعي

الفضاء الكامن الذي لا يتحدث عنه أحد

الفضاء الكامن ليس مجرد حيلة للتخزين. إنه نظام إحداثيات عالي الأبعاد تقع فيه المفاهيم المتشابهة بالقرب من بعضها. وجه امرأة ووجه رجل ووجه قطة لا تعيش في نقاط عشوائية، بل تتجمع في مناطق ذات معنى رياضي. لهذا يستطيع الذكاء الاصطناعي دمج المفاهيم بسلاسة، فطلب "امرأة بعينين تشبهان عيون القطط" ينجح لأن هذين المفهومين متجاوران في الفضاء الكامن.

يعيش المحتوى من نوع NSFW في ذلك الفضاء أيضًا. لا يوجد "قسم NSFW" منفصل داخل النموذج. يوجد المحتوى الصريح وغير الصريح كمتجهات في الفضاء المتصل نفسه، ويفصل بينهما فقط المسافة الإحداثية. وعندما يُفعَّل مرشّح الأمان في المنصة، فإنه يعمل عمليًا على توجيه النموذج بعيدًا عن مناطق معينة من ذلك الفضاء.

كيف تعمل نماذج الانتشار فعلًا

ضوضاء تدخل، وصورة تخرج

تبدأ عملية التوليد بضوضاء عشوائية نقية، وليس بلوحة فارغة. دُرِّب النموذج على إزالة هذه الضوضاء تدريجيًا عبر سلسلة من الخطوات، موجَّهًا بالأمر النصي الذي تكتبه. تتنبأ كل خطوة بشكل أوضح قليلًا بما ينبغي أن تبدو عليه الصورة النهائية. بعد 20 إلى 50 خطوة من هذه الخطوات (حسب جدولة الخطوات والنموذج)، تظهر صورة متماسكة.

هذا ما تبدو عليه هذه العملية مفاهيميًا:

نطاق الخطواتما الذي يحدث
الخطوات 1-5تتشكّل التركيبة العامة وكتل الألوان
الخطوات 6-15تتضح الأشكال الكبيرة والوجوه والأجساد
الخطوات 16-30تظهر التفاصيل الدقيقة وملمس البشرة وخصلات الشعر
الخطوات 30-50تحديد الحواف عالية التردد والتماسك النهائي

عدد الخطوات قابل للضبط. تنتج خطوات أكثر عادةً نتائج أكثر حدّة وتماسكًا، لكنها تستغرق وقتًا أطول. نماذج مثل Flux Schnell مُحسَّنة خصيصًا لتقديم جودة ممتازة في 4 خطوات فقط، ما يجعلها أسرع بكثير من البنى القديمة.

صورة ماكرو قريبة للوحة دوائر GPU عالية الجودة مع مسارات نحاسية ورقائق سيليكون تمثل أجهزة نماذج الانتشار

دور CLIP في الأوامر النصية

لا ينتقل أمرك النصي مباشرة إلى عملية الانتشار. أولًا يمرّ عبر مُرمِّز نصي، وأشهره نموذج يسمى CLIP (التدريب المسبق التبايني للغة والصورة) أو نسخة مشابهة منه مثل T5. يحوّل هذا المُرمِّز كلماتك إلى تضمين عددي، أي متجه يلتقط المعنى الدلالي لأمرك ويضعه في الفضاء عالي الأبعاد نفسه الذي تعيش فيه الصور الكامنة.

💡 هذا هو سبب أهمية صياغة الأمر النصي. "امرأة جميلة ترتدي بيكيني على الشاطئ" و"عارضة ملابس سباحة عند المحيط" ستنتجان تضمينات مختلفة، وبالتالي صورًا مختلفة، رغم أنهما تصفان مشهدًا متشابهًا.

يتحكم مقياس التوجيه (guidance scale)، الذي يُسمّى غالبًا مقياس CFG، في مدى التزام النموذج بأمرك. القيمة الأعلى تجبر النموذج على اتباع نصك بصرامة أكبر، وغالبًا على حساب الطبيعية. أما القيمة الأدنى فتمنح النموذج حرية إبداعية أكبر، لكنها قد تنتج نتائج خارج الأمر.

مرشّحات NSFW وكيفية عملها

أدوات فحص الأمان أثناء التدريب

يحدث ترشيح NSFW في مرحلتين مختلفتين تمامًا: أثناء التدريب وأثناء التشغيل. يتعلق الترشيح أثناء التدريب بالبيانات التي يراها النموذج أصلًا. دُرِّبت نماذج أساسية كثيرة، مثل الإصدارات الأولى من Stable Diffusion، على مجموعة LAION-5B، وهي بيانات جُمعت من الإنترنت العام وتضمنت محتوى صريحًا. احتفظت تلك النماذج بالقدرة على إنتاج صور للبالغين لأن هذه المعلومات كانت مدمجة في أوزانها.

قدّمت نماذج لاحقة ترشيح NSFW على مستوى مجموعة البيانات، فأُزيل المحتوى الصريح قبل التدريب. كانت النتيجة نموذجًا لا يعرف فعلًا كيف ينتج مخرجات صريحة، وليس نموذجًا مُنع فقط من فعل ذلك.

أنظمة الترشيح أثناء التشغيل

الترشيح أثناء التشغيل هو خط الدفاع الثاني. وهو ما يصادفه معظم المستخدمين بوصفه قيدًا على مستوى المنصة. هناك ثلاثة أساليب شائعة:

  1. مصنِّفات الأوامر: يقرأ نموذج منفصل النص الذي تكتبه ويعلّم الأوامر التي قد تكون غير آمنة قبل أن يبدأ التوليد أصلًا.
  2. مصنِّفات المخرجات: بعد توليد الصورة، يفحصها نموذج أمان (مثل مصنِّفات NSFW القائمة على CLIP) ويمنع تسليمها إذا اكتشف محتوى صريحًا.
  3. محو المفاهيم (Concept erasure): تطبّق بعض المنصات تقنيات تزيل مفاهيم معينة فعليًا من الفضاء الكامن للنموذج، ما يجعل توليدها مستحيلًا مهما كانت صياغة الأمر.

مطوّر شاب أمام محطة عمل بشاشتين في استوديو خافت الإضاءة ليلًا يعمل على كود توليد صور الذكاء الاصطناعي

كيف تختلف المنصات في التطبيق

لا تتخذ كل منصات صور الذكاء الاصطناعي الخيارات نفسها في الترشيح، وهذه الخيارات تشكّل تجربة المستخدم كلها.

نوع المنصةالنهجقدرة المخرجات
منصات المستهلكين (العامة)ترشيح صارم للأوامر النصية والمخرجاتمحتوى آمن للعمل (SFW) فقط
منصات المبدعينترشيح انتقائي مع التحقق من العمرعري فني
منصات الذكاء الاصطناعي للبالغينترشيح أدنى ونماذج مضبوطة بدقةقادرة على المحتوى الصريح
مفتوحة المصدر (محليًا)يتحكم فيها المستخدمبلا قيود

عادةً ما تستخدم المنصات التي تسمح بمحتوى NSFW الراقي أو الفني، مثل تصوير الجلامور (glamour) والعري الموحى به، التحقق من العمر مع مصنِّفات للمخرجات مضبوطة لحجب المحتوى الأكثر صراحة فقط، مع السماح بكل ما هو دون هذا الحد.

الأجهزة التي تقوم بكل العمل

مجموعات GPU وتكاليف الحوسبة

كل طلب لتوليد صورة هو مسألة ضرب مصفوفات تعمل على نطاق ضخم. تجري الحوسبة الفعلية على مجموعات GPU (وحدات معالجة الرسومات)، لأن هذه الوحدات صُمّمت خصيصًا للحسابات المتوازية التي تحتاجها نماذج الانتشار. قد يتطلب توليد صورة واحدة عالية الدقة بحجم 1024x1024 مليارات العمليات الحسابية العائمة.

تشمل الأجهزة التي تشغّل معظم مولّدات الذكاء الاصطناعي المستضافة ما يلي:

  • NVIDIA A100 أو H100 وحدات GPU لنماذج الجودة العالية المتميزة
  • NVIDIA L40S لأحمال تشغيل النماذج متوسطة المستوى
  • AMD MI300X لنشر فعّال من حيث التكلفة على نطاق واسع

تشغيل نموذج مثل Flux 1.1 Pro Ultra على نطاق واسع يكلّف مالًا حقيقيًا مع كل صورة، ولهذا تعمل معظم المنصات بنظام النقاط أو الاشتراكات.

مختبر أبحاث حديث للذكاء الاصطناعي حيث يحلل باحثون مخططات الشبكات العصبية على طاولة كبيرة تعمل باللمس

لماذا تهم سرعة تشغيل النموذج

السرعة ليست مسألة تجربة مستخدم فقط. فتشغيل النموذج بسرعة أكبر يعني حوسبة أرخص لكل صورة، وهذا يؤثر مباشرة فيما تستطيع المنصة أن تقدّمه مجانًا. ساهم ابتكاران في خفض وقت التشغيل بشكل كبير في السنوات الأخيرة:

  • النماذج المقطّرة (Distilled models): نماذج دُرِّبت لتقليد نماذج أكبر في عدد أقل من الخطوات. تُعد Flux Schnell وDreamShaper XL Turbo أمثلة بارزة عليها. إنها تقايض قدرًا صغيرًا من الجودة مقابل توليد أسرع بعشر مرات.
  • التكميم (Quantization): تقليل دقة الأرقام في أوزان النموذج (من float32 إلى int8 أو أقل) يقلّص حجم الذاكرة المطلوب ويزيد الإنتاجية دون فقدان جودة ملحوظ بصريًا.

بيانات التدريب ودورها في أسلوب المخرجات

ما الذي تعلّمته النماذج

"أسلوب" مولّد الصور بالذكاء الاصطناعي نتاج كامل لما دُرِّب عليه. النماذج الأساسية (Base models) مثل SDXL دُرِّبت على مئات الملايين من الصور المقترنة بتعليقات، واستوعبت الأنماط الإحصائية لكل شيء، من صور الأرشيف ومجلات الأزياء إلى الفن الرقمي ولقطات الأفلام.

لهذا تنتج بعض النماذج بشكل طبيعي أسلوب صور الأرشيف، بينما تميل نماذج أخرى إلى المخرجات الفنية الشبيهة باللوحات. تكوين مجموعة بيانات التدريب هو أكبر مؤشر منفرد على الأسلوب البصري الافتراضي للنموذج.

💡 إذا أردت إضاءة سينمائية وجماليات تصوير الأفلام، فإن النماذج المدرّبة بكثافة على مجموعات بيانات تصوير عالية الجودة ستنتج نتائج أفضل من تلك المدرّبة على صور عامة من الإنترنت.

امرأة جميلة بشعر أشقر بلاتيني مُصوّرة بزاوية ثلاثة أرباع مع ضوء ذهبي في أواخر النهار تمثل جودة صور البورتريه بالذكاء الاصطناعي

تعديل الأسلوب باستخدام LoRA

LoRA (التكيّف منخفض الرتبة) تقنية ضبط دقيق تتيح للمبدعين تدريب مجموعة صغيرة من الأوزان الإضافية فوق نموذج أساسي، فتنقل مخرجاته نحو مظهر أو موضوع محدد. كثيرًا ما تكون ملفات LoRA بضع مئات من الميغابايت فقط، لكنها قادرة على تغيير مخرجات النموذج بشكل كبير.

بالنسبة إلى النماذج القادرة على NSFW، يكون ضبط LoRA بالغ القوة بشكل خاص:

  • "LoRA للبورتريه الواقعي" ينقل النموذج نحو ملمس البشرة الفوتوغرافي والإضاءة الطبيعية
  • "LoRA لتصوير الأزياء" يدفع المخرجات نحو الجماليات التحريرية عالية التباين
  • LoRA خاص بموضوع معين يمكن أن يجعل النموذج ينتج باستمرار وجهًا أو نوع جسد محددًا

يتيح النموذج p-image-lora على PicassoIA قدرة الضبط الدقيق هذه بشكل مباشر، فيمكنك تطبيق أوزان LoRA على توليداتك للحصول على أساليب مخرجات محددة للغاية.

نماذج مبنية للصور الواقعية

كيف تختلف النماذج المضبوطة بدقة

دُرِّب نموذج Stable Diffusion الأساسي وخلفاؤه على مجموعات بيانات واسعة. وتذهب النماذج المضبوطة بدقة خطوة أبعد، إذ تواصل التدريب على مجموعات فرعية منتقاة وعالية الجودة من أساليب بصرية محددة. ومن هنا نشأت النماذج الواقعية الفوتوغرافية التي تتفوق في تصوير البشر.

يُعد Realistic Vision v5.1 مثالًا بارزًا: فهو مبني على بنية SDXL، لكنه خضع لضبط دقيق مكثف على مجموعات بيانات فوتوغرافية لإنتاج أشخاص بملمس بشرة حقيقي وتشريح دقيق وإضاءة طبيعية، وهي أمور تعاني منها النماذج الأساسية كثيرًا.

وبالمثل، يمثل Flux Dev من Black Forest Labs جيلًا جديدًا من البنى يتعامل مع توليد الصور بطريقة مختلفة عن نماذج U-Net القديمة. يعمل Flux على فضاء البكسل الكامل دفعة واحدة بدلًا من معالجته بشكل هرمي، ما ينتج دقة تشريحية أفضل بكثير ومخرجات واقعية متسقة.

امرأة ساحرة بشعر أحمر طويل على شاطئ استوائي مع محيط فيروزي خلفها تمثل قدرة النماذج الحديثة على إنتاج مخرجات واقعية كالصور الفوتوغرافية

أفضل النماذج لنتائج واقعية كالصور الفوتوغرافية

عندما يتعلق الأمر بتوليد صور بشرية واقعية بملمس طبيعي للبشرة والشعر والإضاءة، تتفوق عدة نماذج باستمرار على غيرها:

النموذجالبنيةالأفضل لـ
Flux DevFlux Transformerالواقعية الفوتوغرافية ودقة التشريح
Flux ProFlux Transformerمخرجات بجودة تجارية
Flux 1.1 Pro UltraFlux Transformerمخرجات بدقة عالية جدًا
Realistic Vision v5.1ضبط دقيق لنموذج SDXLأسلوب البورتريه الفوتوغرافي
Stable Diffusion 3.5 LargeMMDiTتوازن بين الجودة والسرعة

كيفية استخدام Flux Dev على PicassoIA

خطوة بخطوة: أول توليد لك

بما أن Flux Dev من أفضل النماذج أداءً لتوليد صور بشرية واقعية، فإليك الطريقة الدقيقة لاستخدامه على PicassoIA:

  1. افتح صفحة النموذج عبر رابط مجموعة Flux Dev
  2. اكتب أمرك النصي مع تفاصيل محددة: الشخص، والبيئة، والإضاءة، وزاوية الكاميرا، ومواصفات العدسة
  3. اضبط نسبة العرض إلى الارتفاع على 16:9 للقطات السينمائية العريضة أو 1:1 لأعمال البورتريه
  4. اضبط مقياس التوجيه بين 3.5 و4.5 لنموذج Flux Dev (أقل مما ستستخدمه مع SDXL)
  5. اضبط الخطوات على 28-35 للحصول على أفضل جودة
  6. اضغط على توليد وانتظر 10-15 ثانية للحصول على صورتك

امرأة واثقة بشعر مجعد داكن على شرفة سطح منزل في الساعة الذهبية تستخدم جهازًا لوحيًا لإنشاء صور بالذكاء الاصطناعي

نصائح لأوامر نصية أفضل

جودة مخرجاتك مرتبطة مباشرة بدقة أمرك النصي. الأوامر الغامضة تنتج نتائج عامة، والأوامر المحددة تنتج نتائج لافتة.

أمر ضعيف: beautiful woman at the beach

أمر قوي: close-up portrait of a woman with sun-kissed skin and loose dark waves, lying on white sand at a tropical beach, afternoon rim light creating a warm halo on her hair, 85mm f/1.4 lens, natural skin texture, Kodak Portra 400 film grain

نصائح إضافية تحسّن المخرجات باستمرار:

  • حدّد اتجاه الإضاءة: "ضوء صباحي حجمي من اليسار" أو "إضاءة خلفية في أواخر النهار"
  • حدّد الكاميرا والعدسة: "85mm f/1.4"، "عدسة واسعة 35mm"، "ماكرو 100mm"
  • أضف نوع الفيلم: "Kodak Portra 400"، "Fuji Superia 400"، "Kodak Gold 200"
  • صف ملمس البشرة: "مسام واضحة ومرئية"، "بشرة دافئة مضيئة"، "آثار تسمير خفيفة"
  • حدّد الأجواء: "حميمي"، "تحريري"، "تصوير جلامور"، "جلسة تصوير لمجلة أزياء"

💡 يستجيب Flux Dev بشكل ممتاز لأوصاف الكاميرا والإضاءة. إدراج مواصفات العدسات وإشارات نوع الفيلم في أمرك النصي ينتج باستمرار مخرجات أكثر فوتوغرافية وأقل اصطناعية.

امرأة أنيقة بشعر داكن وبشرة برونزية مستلقية على أريكة من الكتان الكريمي بجانب نوافذ عالية في ضوء الصباح الناعم

مسار الأمر النصي إلى البكسل، ملخصًا

عندما تضغط على "توليد"، إليك كل خطوة تحدث في أجزاء من الثانية خلف الكواليس:

  1. التقطيع إلى توكنات: يُقسَّم نصك إلى توكنات ويُمرَّر إلى مُرمِّز CLIP أو T5
  2. التضمين: يحوّل المُرمِّز التوكنات إلى متجهات عددية تمثل المعنى الدلالي
  3. تهيئة الضوضاء: يُنشأ موتر ضوضاء عشوائي في الفضاء الكامن
  4. حلقة إزالة الضوضاء: 20-50 تكرارًا لإزالة الضوضاء الموجّهة، تتشكّل كل خطوة منها بتضميناتك النصية
  5. فك ترميز VAE: يُفكّ ترميز الموتر الكامن النهائي مرة أخرى إلى فضاء البكسل
  6. فحص الأمان: يفحص مصنِّف المخرجات النتيجة بحثًا عن انتهاكات السياسة
  7. التسليم: تُضغط صورة البكسل وتُرسل إلى شاشتك

يعمل المسار كله على أجهزة GPU ويمكن أن يكتمل خلال 3-15 ثانية حسب النموذج والبنية التحتية.

لقطة علوية لهاتف ذكي يعرض واجهة توليد صور بالذكاء الاصطناعي بجانب دفتر يحوي أوامر إبداعية على رخام أبيض

أنشئ صورك الخاصة على PicassoIA

الآن وقد عرفت بالضبط ما يعمل في الداخل، فأنت في موقع أفضل بكثير لاستخدام هذه الأدوات بوعي. الفجوة بين صورة ذكاء اصطناعي متوسطة وأخرى مذهلة حقًا ليست حظًا. إنها معرفة أي نموذج يتعامل مع موضوعك بشكل أفضل، وكيفية كتابة أمر نصي يضع الفضاء الكامن في المكان الذي تريده تمامًا، وكيفية استجابة عملية إزالة الضوضاء لإعدادات التوجيه لديك.

يتيح لك PicassoIA الوصول إلى مجموعة كاملة من هذه النماذج في مكان واحد، من Flux Dev و Flux Pro إلى Realistic Vision v5.1 وStable Diffusion 3.5 Large. سواء كنت تنشئ تصوير جلامور أو بورتريهات فنية أو صورًا لجلسات تصوير لمجلات الأزياء، فالنماذج متاحة والمسار يعمل بسرعة.

اختر نموذجًا، واكتب أمرًا نصيًا محددًا، وشاهد ما ينتجه الفضاء الكامن.

شارك هذا المقال

اختر لغتك

مقالات ذات صلة