الصور تبدو حقيقية. ليست واقعية "بمقاييس الذكاء الاصطناعي"، بل واقعية فعلًا، بتفاصيل مسام الجلد، وإضاءة طبيعية. إذا تساءلت يومًا عما يعمل خلف الكواليس عندما تنتج مولدات الصور NSFW بالذكاء الاصطناعي صورة شخصية واقعية من أمر نصي، فهذه المقالة تشرح العملية كاملة، خطوة بخطوة، دون تجريد.

عملية الانتشار، مبسّطة
ما علاقة الضوضاء بالصور
تعمل نماذج الانتشار عبر تعلّم عكس عملية تدمير. أثناء التدريب، تُعرض على النموذج صور حقيقية، وتُفسد هذه الصور تدريجيًا بكميات متزايدة من ضوضاء غاوسية (Gaussian) على مدى مئات الخطوات، حتى تبدو كأنها ضجيج أبيض خالص. مهمة النموذج أن يتعلّم، عند كل مستوى من الضوضاء، كيف كانت النسخة "النظيفة" على الأرجح.
أثناء وقت تشغيل النموذج (عندما تكتب أمرًا نصيًا)، تسير العملية في الاتجاه المعاكس. يبدأ النموذج بمصفوفة ضوضاء عشوائية تمامًا، ويزيل الضوضاء خطوة بخطوة بطريقة تتوجهها أوامرك النصية. بعد 20 إلى 50 خطوة لإزالة الضوضاء، تحصل على صورة متماسكة.
💡 لهذا السبب تهم "خطوات تشغيل النموذج". المزيد من الخطوات يعني مزيدًا من دورات التحسين. عدد قليل جدًا يجعل الصورة باهتة وغير واضحة. وعدد كبير جدًا يدخلك في مرحلة تناقص العائد. معظم النماذج تعمل بأفضل شكل بين 25 و40 خطوة.
من بكسلات عشوائية إلى مخرجات مثالية
لا تحدث إزالة الضوضاء في فضاء البكسلات مباشرة، لأن ذلك سيكون مكلفًا حسابيًا إلى حد يمنع ذلك. بدلًا من ذلك، تحدث في الفضاء الكامن، وهو تمثيل رياضي مضغوط للصورة. يقوم المُشفِّر التلقائي المتغير (VAE) بترميز الصورة إلى هذا الفضاء الكامن، وتؤدي عملية الانتشار عملها هناك، ثم يحوّل مفكك الترميز في VAE النتيجة في النهاية إلى صورة كاملة الدقة.
لهذا السبب تستطيع النماذج القائمة على الفضاء الكامن، مثل Stable Diffusion، العمل على أجهزة المستهلكين. أنت لا تعالج ملايين البكسلات مباشرة، بل تعمل على تمثيل مدمج أصغر بنحو 64 مرة، وهذا هو السبب الكامل في أن التقنية أصبحت متاحة خارج مختبرات الأبحاث.

مُشفِّر النص: كيف تتحول الكلمات إلى صور
CLIP وكيف يقرأ أمرك النصي
عندما تكتب أمرًا نصيًا في مولد صور بالذكاء الاصطناعي، لا ينتقل نصك مباشرة إلى نموذج الانتشار. يُعالَج أولًا بواسطة مُشفِّر نصي، وغالبًا CLIP (Contrastive Language-Image Pretraining)، الذي يحوّل كلماتك إلى متجه عددي كثيف يلتقط المعنى الدلالي.
دُرِّب CLIP على مئات الملايين من أزواج الصور والتعليقات من الإنترنت. تعلّم أن يضع المفاهيم المتشابهة قريبة من بعضها في فضاء التضمين الخاص به. "امرأة جميلة عند الغروب" و"تصوير بورتريه بالساعة الذهبية" تنتهيان قريبتين من بعضهما في ذلك الفضاء، ولهذا السبب تنتج الأوامر النصية المتقاربة نتائج متشابهة بصريًا.
تستخدم البنى الأحدث، مثل Flux 1.1 Pro وFlux 1.1 Pro Ultra، مزيجًا من مُشفِّري CLIP وT5 النصيين، ما يمنحها التزامًا أعلى بكثير بالأوامر النصية مقارنة بنماذج Stable Diffusion السابقة. يتعامل مُشفِّر T5 مع الأوامر الأطول والأكثر تعقيدًا دون أن يفقد الخيط الدلالي.
لماذا تهم كلمات الأمر النصي كثيرًا
يعمل تضمين النص كإشارة تكييف طوال عملية إزالة الضوضاء. في كل خطوة، تتحقق شبكة U-Net (الشبكة العصبية الأساسية التي تنفذ إزالة الضوضاء): هل تطابق الصورة المزالة ضوضاؤها جزئيًا ما يقوله تضمين النص أنها يجب أن تبدو عليه؟ إذا لم تتطابق، تعدّلها.
ولهذا أيضًا تملك كلمات معينة تأثيرًا كبيرًا. الصفات التي تصف الملمس والإضاءة والأسلوب، مثل "Kodak Portra" و"f/1.4 bokeh" و"golden hour"، مدمجة في الارتباطات المكتسبة لـ CLIP لأنها ظهرت باستمرار إلى جانب أساليب بصرية محددة في بيانات التدريب. استخدام مصطلحات التصوير الفوتوغرافي في الأمر النصي ليس خيارًا أسلوبيًا، بل هو واجهة مباشرة مع التنظيم الداخلي للنموذج للمفاهيم البصرية.

النماذج وراء النتائج الواقعية كالصور الفوتوغرافية
Stable Diffusion وإصداراته
فتح Stable Diffusion من Stability AI الباب أمام توليد الصور الواقعية بالذكاء الاصطناعي للجمهور. بنيته للانتشار الكامن، مقرونةً بالأوزان المفتوحة، أنتجت منظومة كاملة من النسخ المضبوطة بدقة والمحسّنة لكل تخصص يمكن تخيله.
حسّن SDXL النموذج الأصلي تحسينًا كبيرًا، إذ يعمل بدقة أصلية 1024x1024 مع إعداد مُشفِّرين نصيين مزدوج. وقدّم نموذج تنقيح (refiner) لإضافة التفاصيل عالية التردد في مرحلة ثانية، ولهذا تتميز مخرجات SDXL بطابع أكثر حدة وأقرب إلى التصوير الفوتوغرافي. أما إصدار SDXL Lightning 4-Step فيكثّف هذه العملية إلى تشغيل من 4 خطوات دون التضحية كثيرًا بالجودة المدركة.
ذهب Stable Diffusion 3.5 Large أبعد من ذلك ببنية Multimodal Diffusion Transformer (MMDiT)، متخليًا تمامًا عن شبكة U-Net التقليدية. والنتيجة التزام أفضل بكثير بالنص وتراكيب أكثر تماسكًا، خاصة عند الدقات العالية.
Flux: المعيار الجديد
يمثّل Flux من Black Forest Labs الحالة الراهنة للتوليد الواقعي كالصور الفوتوغرافية ذي الأوزان المفتوحة. يستخدم بنية Rectified Flow بدلًا من انتشار DDPM القياسي، ما يعني أنه قادر على إنتاج صور عالية الجودة بخطوات أقل بكثير، وبتماسك بنيوي أفضل بشكل ملحوظ.
تمتد عائلة النماذج الكاملة من Flux Schnell (تشغيل سريع في 4 خطوات) إلى Flux 2 Pro (أعلى جودة، مع حوسبة أكبر). ما يجعل Flux ذا صلة خاصة بالمخرجات الواقعية كالصور الفوتوغرافية هو تعامله مع تشريح جسم الإنسان، وملمس الجلد، والإضاءة، وهي مجالات عانت منها النماذج القديمة بشكل معروف.
💡 التشريح مهم. عانت نماذج الانتشار السابقة من مشكلة موثّقة في الأيدي: أصابع زائدة، وأصابع ملتحمة، ونسب خاطئة. تتعامل بنية Flow Matching في Flux مع هندسة أجزاء الجسم بشكل أفضل بكثير، لأنها تستخدم مسار نقل أكثر انضباطًا بين الضوضاء والصورة.
الضبط الدقيق باستخدام LoRA
LoRA (Low-Rank Adaptation) هو الطريقة التي تُدمج بها الجماليات المتخصصة في النموذج دون إعادة تدريبه من الصفر. LoRA هو مجموعة صغيرة من تعديلات الأوزان تحوّل مخرجات النموذج نحو أسلوب أو موضوع أو جمالية محددة. ويمكن تطبيقه فوق أي نموذج أساسي وقت التشغيل بقيمة قوة قابلة للضبط.
بالنسبة للنماذج القادرة على توليد محتوى NSFW، غالبًا ما تُدرَّب LoRAs على أنواع أجسام محددة، أو أساليب إضاءة، أو جماليات فنية. وهي تضيف تكلفة حسابية ضئيلة، لكنها تغيّر طابع المخرجات بشكل كبير. نماذج مثل Flux Dev وDreamShaper XL Turbo تدعم تحميل LoRA بشكل أصلي، ما يجعلها الأساس الافتراضي للنسخ الواقعية المضبوطة بدقة.

كيف تُضاف قدرات NSFW
كيف تبدو بيانات التدريب فعلًا
كل مولد صور بالذكاء الاصطناعي هو انعكاس إحصائي لبيانات تدريبه. النماذج الأساسية مثل Stable Diffusion دُرِّبت على LAION-5B، وهي مجموعة بيانات من 5 مليارات زوج من الصور والتعليقات جُمعت من الإنترنت العام. وتضمنت هذه المجموعة حجمًا كبيرًا من محتوى للبالغين، والعري الفني، والتصوير الفوتوغرافي الناضج.
لذلك يمتلك النموذج الأساسي قدرة كامنة على توليد هذا المحتوى. السؤال هو ما إذا كانت هذه القدرة مكبوتة بفعل مرشحات الأمان وقت التشغيل أو متاحة. من المهم التوضيح: النموذج نفسه لا "يعرف" أنه ينتج محتوى للبالغين. هو يطابق الأنماط الإحصائية في بيانات التدريب، موجَّهًا بتضمين النص الذي تقدمه.
إزالة الحواجز
تطبّق عمليات النشر التجارية المعتادة مرشحات أمان على عدة طبقات:
- تصفية المدخلات: تُحظر كلمات معينة في الأمر النصي قبل وصولها إلى النموذج
- مصنِّف NSFW وقت التشغيل: تُفحص مخرجات النموذج مقابل مصنِّف ثنائي مدرَّب يصنّف الصور على أنها آمنة أو غير آمنة
- التمويه أو الحظر بعد المعالجة: تُموَّه الصور المُعلَّم عليها أو تُرفض قبل أن تصل إلى المستخدم
تعمل الإصدارات القادرة على توليد محتوى NSFW عبر إزالة هذه المرشحات أو تجاوزها مع الإبقاء على أوزان النموذج الأساسية سليمة. وبعض الإصدارات تذهب أبعد، فتخضع لضبط دقيق على مجموعات بيانات صريحة، ما يدفع المخرجات الافتراضية للنموذج نحو اتجاه أكثر بلوغًا حتى دون أوامر نصية محددة.
لماذا تبدو بعض النماذج أكثر واقعية من غيرها
تعتمد الواقعية في المحتوى NSFW على ثلاثة عوامل: جودة النموذج الأساسي، وجودة مجموعة بيانات الضبط الدقيق، وإعدادات التشغيل. النماذج القديمة مثل Stable Diffusion الأصلي تنتج مخرجات يمكن تمييزها بسهولة كصور من الذكاء الاصطناعي: الجلد يبدو بلاستيكيًا، والإضاءة عامة، والتشريح خاطئ أحيانًا.
النماذج الواقعية المدرَّبة خصيصًا، مثل Realistic Vision v5.1 وRealVisXL v3.0 Turbo، خضعت للضبط الدقيق على مجموعات بيانات تصوير فوتوغرافي عالية الجودة تحديدًا، ولهذا تملك مخرجاتها الحبيبية، وخصائص عمق المجال، وتصيير الجلد الذي يميّز التصوير الفوتوغرافي الحقيقي عن الصور المُصيَّرة.

مرشحات الأمان: ماذا تحظر وكيف
كيف تعمل المرشحات الافتراضية
آلية الأمان الأكثر شيوعًا هي مصنِّف ثنائي قائم على CLIP مدرَّب على التمييز بين المحتوى الآمن وغير الآمن. يعمل بتضمين الصورة المولّدة في فضاء ميزات CLIP، ثم يفحص قربها من مجموعة من التضمينات "غير الآمنة" المعروفة.
مشكلة هذا النهج أنه احتمالي وليس قائمًا على القواعد. المصنِّف دُرِّب على أمثلة محددة لما يبدو عليه المحتوى "غير الآمن". ويمكن للمحتوى الذي يختلف شكله عن أمثلة التدريب تلك، حتى لو كان صريحًا بالقدر نفسه، أن يمرّ. ولهذا تحدث أحيانًا نتائج إشراف غير متسقة حتى على المنصات ذات التصفية المشددة.
مشكلة الالتفاف على المرشحات
للإنترنت ثقافة فرعية كاملة مكرّسة للعثور على أوامر نصية تفلت من مرشحات الأمان. أكثر الاستراتيجيات شيوعًا تشمل:
- تخفيف الدلالة: إحاطة المفاهيم الصريحة بكميات كبيرة من السياق المحايد، تسحب تضمين CLIP بعيدًا عن المناطق "غير الآمنة"
- الوصف غير المباشر: وصف النتائج دون تسمية الفئة مباشرة
- التلاعب بالتوكنات: بعض المرشحات تعمل على قائمة حظر لتوكنات دقيقة، فتتجاوزها المرادفات أو الاختلافات الطفيفة
هذا سباق تسلح مستمر. مزودو النماذج يحدّثون مرشحاتهم باستمرار، والمجتمع يجد باستمرار حلولًا التفافية جديدة. ولا يحقق أي من الطرفين انتصارًا دائمًا.
الإشراف على مستوى المنصة
بالإضافة إلى تصفية وقت التشغيل، تضيف المنصات تطبيقَ سياسات المحتوى على مستوى الحساب وعلى مستوى API. تقيّد شروط الاستخدام الأغراض التي يمكن استخدام المخرجات فيها. تؤدي المخالفات المتكررة للسياسات إلى إيقاف الحساب. وهذا يختلف عن التصفية التقنية، فهو طبقة تحكّم قانونية وتجارية تعمل بشكل مستقل عن النموذج نفسه.
تقدم بعض المنصات مستويات NSFW مقيّدة بالعمر للمستخدمين البالغين الموثّقين، حيث يُستبدل مرشح وقت التشغيل بمصنِّف أقل صرامة يسمح بالعري الفني، مع الاستمرار في حظر المحتوى الإباحي الصريح. وهذا هو النهج الذي يوازن بين إتاحة الوصول والنشر المسؤول.

دور مقياس CFG وخطوات التشغيل
ما الذي يتحكم فيه مقياس CFG
مقياس Classifier-Free Guidance (CFG) هو المعامل الذي يتحكم في مدى التزام النموذج بأمرك النصي مقابل مقدار الحرية الإبداعية التي يأخذها. عند CFG 1.0، يتجاهل النموذج أمرك النصي تقريبًا ويولّد ما يبدو طبيعيًا بالنظر إلى الضوضاء. وعند CFG 20 فما فوق، يلتزم بأمرك النصي بصرامة شديدة لدرجة أن المخرجات تصبح مشبعة بالألوان ومشوهة تشريحيًا.
النقطة المثالية للمخرجات الواقعية كالصور الفوتوغرافية تقع عادةً بين 5 و9. في هذا النطاق، يلتزم النموذج بالأمر النصي عن كثب، مع الاحتفاظ بحرية كافية لإنتاج ملمس جلد وإضاءة وتكوين يبدون طبيعيين.
💡 لأوامر تصوير البورتريه والجلامور (glamour): CFG بين 6 و7 ينتج باستمرار أكثر درجات ألوان البشرة والإضاءة طبيعية. القيم الأعلى تدفع الألوان نحو التشبع الزائد، وتزيد احتمال ظهور تشوهات حول الحواف والتفاصيل الدقيقة.
كم عدد الخطوات التي تحتاجها فعلًا
عدد خطوات التشغيل الأكبر يعني مزيدًا من دورات إزالة الضوضاء، وهذا يعني عمومًا جودة أعلى حتى نقطة معينة. وتتغير العلاقة على النحو التالي:
- 4 إلى 8 خطوات (نماذج من فئة Schnell، وSDXL Lightning 4-Step): سريعة، وجودة مقبولة، مناسبة للتكرار والمعاينة
- 20 إلى 30 خطوة (النطاق القياسي): تفاصيل قوية، وتشريح جيد، مناسبة للمخرج النهائي
- 40 إلى 60 خطوة (منطقة تناقص العائد): تفاصيل دقيقة أفضل بقليل، مع حوسبة أكبر بكثير لكل صورة
بالنسبة لمعظم حالات الاستخدام الواقعية كالصور الفوتوغرافية، فإن 28 إلى 35 خطوة عند CFG 6.5 هي خط الأساس الموثوق. وما بعد ذلك، تكون قد أنفقت حوسبة مقابل تحسينات بالكاد تُرى بأحجام العرض العادية. مكاسب الجودة الحقيقية تأتي من نماذج أساسية أفضل ومن أوامر نصية أفضل، لا من تشغيل المزيد من الخطوات.

ابدأ بإنشاء صورك الخاصة
التقنية متاحة الآن، دون الحاجة إلى إعداد أي جهاز محلي. تتيح لك PicassoIA الوصول المباشر إلى أفضل النماذج المذكورة في هذه المقالة، مع إدارة بنية التشغيل الفعلية على الخادم.
بالنسبة لأعمال الجلامور (glamour) والبورتريه الواقعي كالصور الفوتوغرافية، فإن النماذج التي تقدم الطابع الأكثر ثباتًا للتصوير الحقيقي هي:
بنية الأمر النصي الأنسب للنتائج الواقعية كالصور الفوتوغرافية تتبع النمط نفسه لموجز التصوير الاحترافي: الشخص، والإضاءة، والكاميرا، ونوع الفيلم. فعبارة "امرأة ترتدي كتانًا أبيض على شرفة مشمسة، ضوء بعد الظهر حجمي، 85mm f/1.8، Kodak Portra 400" تتفوق باستمرار على أوصاف عامة مثل "جميلة" أو "واقعية".

إذا أردت الذهاب أبعد، فإن كلًا من Flux Dev وSDXL Multi ControlNet LoRA يدعمان تكييف ControlNet، الذي يتيح لك التحكم في الوضعية والتكوين والبنية باستخدام صورة مرجعية. وهذه هي الطريقة للحصول على نتائج متسقة عبر مخرجات متعددة، بدلًا من الاعتماد على الأوامر النصية وحدها.
النماذج مدرَّبة، والبنية التحتية تعمل في السحابة. المتغير الوحيد هو جودة أوامرك النصية واستعدادك للتكرار.
