جودة صور NSFW بالذكاء الاصطناعي تغيّرت كثيرًا (وإليك لماذا يهم ذلك)

تغيّرت جودة صور NSFW بالذكاء الاصطناعي بشكل كبير خلال السنوات القليلة الماضية، إذ انتقلت من مخرجات تبدو بلاستيكية ذات تشريح مشوّه إلى نتائج تقترب من الصور الفوتوغرافية وتحتاج إلى فحص دقيق. يشرح هذا المقال ما الذي تغيّر، والنماذج التي قادت هذا التحول، وكيف تطوّر تصيير البشرة وفيزياء الإضاءة والدقة التشريحية حتى بلغت ما هي عليه اليوم.

جودة صور NSFW بالذكاء الاصطناعي تغيّرت كثيرًا (وإليك لماذا يهم ذلك)
Cristian Da Conceicao
مؤسس Picasso IA

قبل عامين، إذا طلبت من الذكاء الاصطناعي توليد امرأة واقعية كالصور الفوتوغرافية على شاطئ، كنت ستحصل على شيء يشبه تمثالًا شمعيًا يذوب تحت الشمس. بشرة جامدة، ونسب خاطئة، وعيون زجاجية بلا عمق، وإضاءة لا تتفق مع أي منطق فيزيائي. كانت الصور تُعرف بأنها "من صنع الذكاء الاصطناعي" من مسافة ثلاثة أقدام. أما اليوم، فالأمر الذي يطلبه الأمر النصي نفسه ينتج نتائج تخطف الأنظار، صور تحتاج إلى فحص دقيق كي يُميَّز بينها وبين التصوير الفوتوغرافي الحقيقي. لقد تغيّرت جودة صور NSFW بالذكاء الاصطناعي كثيرًا، وحدث هذا التقدم أسرع مما توقعه أي شخص تقريبًا في هذا المجال.

من البكسلات الباهتة إلى الواقعية الفوتوغرافية

هناك قبل وبعد في توليد الصور بالذكاء الاصطناعي، والفرق بينهما ليس طفيفًا. يقع الفاصل تقريبًا في منتصف عام 2023، وكل ما هو على الجانب الآخر منه يبدو قديمًا الآن.

كيف بدت صور الذكاء الاصطناعي الأولى فعلًا

أنتجت نماذج الانتشار الأولى صورًا تحمل عيوبًا مميزة أصبحت مادة للميمز بذاتها. أيادٍ بست أصابع. أسنان تذوب في كتلة واحدة. عيون تنحرف قليلًا عن محورها. بشرة ذات لمعان ناعم بلاستيكي لا يبدو أبدًا كأنه نسيج حي. وكان الشعر في الغالب كتلة متشابكة من خصلات غير محددة، أما ملمس الأقمشة فكان يُلمَّح إليه ولا يُصوَّر فعليًا.

بالنسبة إلى المحتوى NSFW تحديدًا، كانت هذه القيود قاسية. فالغاية الكاملة من هذا النوع من الصور هي المصداقية. أي خلل بسيط في الوجه يكسر الوهم فورًا. والشخصية ذات النسب المشكوك فيها تُشعر المشاهدَ بالانزعاج بدلًا من الجاذبية. كانت النماذج تولّد أشياء توحي بالإثارة من الناحية التقنية، لكنها غير مقنعة بصريًا.

امرأة عند الساعة الذهبية على سطح منزل، تفاصيل بشرة واقعية بمحاكاة فيلم Kodak Portra 400

التحول الأول: SDXL وقفزة الدقة

جاءت أولى القفزات النوعية في الجودة مع SDXL، رد Stability AI على محدودية التفاصيل في النماذج السابقة. أتاح الانتقال إلى دقة أساسية أعلى ومسار توليد من مرحلتين أن تحتفظ الصور بتفاصيل دقيقة أكثر دون أن تنهار إلى ضوضاء. أصبحت الوجوه أكثر ثباتًا. وتحسّنت الأيادي، لكنها ظلت نقطة ضعف.

والأهم من ذلك أن SDXL قدّم منظومة من نماذج checkpoint المضبوطة بدقة، والتي يمكن أن تتخصص. بعد أن أصبح هناك أساس قوي، أنتج المجتمع نماذج مدرّبة خصيصًا على مجموعات بيانات فوتوغرافية، نماذج مثل Realistic Vision v5.1 وRealVisXL v3.0 Turbo، دفعت نحو واقعية فوتوغرافية حقيقية مع تحسن كبير في تصيير البشرة.

💡 ما الذي تغيّر: لم يكن الانتقال من SD 1.5 إلى SDXL تحسنًا تدريجيًا. لقد كان تحسنًا من فئة مختلفة في قدرة النموذج على الحفاظ على التفاصيل بالدقة الكاملة، لا سيما في الوجوه والملامس الدقيقة.

النماذج التي غيّرت كل شيء

جاءت الثورة الحقيقية على موجات، كل واحدة منها ترفع الحد الأدنى لما يُعدّ مقبولًا من المخرجات.

Flux والمعيار الجديد

جاء Flux Dev من Black Forest Labs بإحساس مختلف فعلًا عن كل ما سبقه. فبينما كانت النماذج السابقة تكافح للحفاظ على الاتساق عبر الإطار كله، أنتج Flux صورًا تحتفظ بالتفاصيل نفسها من الحافة إلى الحافة. تصرفت الإضاءة وفق قواعد فيزيائية. وانسدلت الأقمشة بثقل. واكتسبت البشرة تشتتًا تحت السطح، تلك الشفافية الخفيفة حيث يمر الضوء عبر الأنسجة الرقيقة في الأذنين والأصابع، وهو ما عجزت عنه النماذج السابقة دائمًا.

دفع Flux 1.1 Pro Ultra هذا التحسن أبعد، بتوليد أصلي عالي الدقة، أي أن النموذج لم يكن يرفع دقة صورة أصغر، بل كان يصيّر بالدقة الكاملة منذ البداية. والفرق واضح: لا تنعيم ناتج عن خطوة رفع الدقة، ولا فقدان للتفاصيل المتوسطة التردد في ملمس البشرة. بالنسبة إلى تطبيقات NSFW تحديدًا، أحدث هذا فرقًا حاسمًا.

لقطة شاطئ من زاوية منخفضة تُظهر ملمس بشرة واقعيًا وإضاءة طبيعية، بعدسة 24mm بمحاكاة Kodak Ektar

يحسّن الجيل الأحدث، Flux 2 Pro وFlux 2 Max، البنية أكثر. الألوان أغنى دون أن تصبح مشبعة بشكل مفرط. ويبدو المدى اللوني في الظلال والإضاءات أقرب إلى تصوير فوتوغرافي معرّض بشكل صحيح، بدلًا من المدى المضغوط قليلًا الذي اتسمت به نماذج الذكاء الاصطناعي السابقة. وتحافظ المشاهد المعقدة التي تضم عدة أشخاص على تماسكها بدلًا من أن تنزلق إلى الفوضى.

Realistic Vision والبشرة الدقيقة في المخرجات

أظهرت النماذج المصممة خصيصًا للواقعية الفوتوغرافية، مثل Realistic Vision v5.1، ما يمكن أن يحققه الضبط الدقيق على بيانات فوتوغرافية منتقاة. دُرّبت هذه النماذج على صور كانت فيها الحقيقة الأساسية صورًا فوتوغرافية فعلية، لا بيانات اصطناعية، وهذا يعني أنها تعلمت الأنماط الإحصائية للبشرة الحقيقية: كيف لا تكون متجانسة تمامًا أبدًا، وكيف تظهر المسام تحت الضوء الجانبي المائل، وكيف يتغير اللون من الخد إلى الفك.

بالنسبة إلى محتوى NSFW، كان لهذا أثر كبير. الفرق بين الجاذبية والانزعاج في شخصية مولّدة بالذكاء الاصطناعي يعتمد غالبًا على عدد قليل من قرارات تصيير البشرة: هل يحمل الملمس تنوعًا طبيعيًا، أم أنه متجانس بطريقة لا تكون عليها البشرة أبدًا؟ هل تنتج الإضاءة تدرجات ظل مناسبة على منحنيات الجسم؟ هل تحمل الصورة نوع العيوب الدقيقة التي تجعل الشيء يبدو مصوَّرًا لا مُركَّبًا؟

صورة شخصية قريبة جدًا تُظهر تفاصيل المسام الفردية، وبشرة شفافة، وأنماط ألياف القزحية، بعدسة ماكرو 100mm

Stable Diffusion 3.5 والعمق التكويني

قدّم Stable Diffusion 3.5 Large شيئًا تفتقر إليه النماذج السابقة: فهمًا أفضل للتكوين. لم يكن الأمر متعلقًا بجودة التصيير وحدها، بل بوضع الأشخاص في بيئات منطقية من الناحية الفيزيائية. سقطت الظلال في الاتجاهات الصحيحة. وأثرت مصادر الضوء المحيطة على المشهد كله بشكل متسق. وبدا عمق المجال كخاصية بصرية حقيقية، لا كتمويه يُطبَّق في النهاية.

يهم هذا التحسن التكويني مشاهد NSFW تحديدًا، لأن المصداقية تعتمد على البيئة بقدر اعتمادها على الشخصية. فالشخص المصوّر بإتقان أمام خلفية مستحيلة فيزيائيًا يكسر الواقعية فورًا. وقد عنت التحسينات المعمارية في SD 3.5 أن الإطار بأكمله يعمل كوحدة واحدة.

ماذا تعني "الجودة" فعلًا في NSFW بالذكاء الاصطناعي

الجودة في هذا السياق ليست شيئًا واحدًا. إنها مجموعة من مشكلات التصيير المنفصلة التي يجب حلها جميعًا في وقت واحد.

ملمس البشرة هو الاختبار الحقيقي

البشرة البشرية من أكثر الأسطح تعقيدًا التي يحتاج النموذج التوليدي إلى إعادة إنتاجها. فهي ليست متجانسة اللون، ولا متجانسة الملمس، ولا متجانسة الإضاءة. تبدو المساحة نفسها من البشرة مختلفة تمامًا بحسب زاوية الضوء الساقطة عليها. تحت الضوء الجانبي المائل، تلقي كل مسامة ظلًا صغيرًا. تحت الضوء العلوي المنتشر، يتسطح الملمس. وعند الأذن، يمر الضوء عبر الأنسجة ويجعلها شفافة ذات لون وردي.

أنتجت النماذج السابقة بشرة ناعمة بطريقة لا تشبه بشرة الإنسان الحقيقية أبدًا. أما الجيل الأحدث، وخاصة النماذج المبنية على Flux وGPT Image 1.5، فيتعامل مع البشرة كمادة بصرية معقدة ذات خصائص تحت السطحية فعلية. والنتيجة صور تبدو مُصوَّرة لا مُصيَّرة.

النموذجملمس البشرةدقة الإضاءةالتشريحالواقعية الإجمالية
SD 1.5 (2022)ناعم/بلاستيكيضعيفةغير متسقةمنخفضة
SDXL (2023)محسّنمعتدلةأفضلمعتدلة
Flux Dev (2024)عالٍجيدةمتينةعالية
Flux 1.1 Pro Ultraممتازممتازةجيد جدًاعالية جدًا
Flux 2 Maxقريب من الصور الفوتوغرافيةممتازةممتازقريب من الصور الفوتوغرافية

الإضاءة والظلال والأجواء

الإضاءة هي المجال الذي فشلت فيه نماذج الذكاء الاصطناعي بأوضح صورة في الماضي، وهو المجال الذي شهد أكبر تحسن. كانت النماذج الأولى تطبّق الإضاءة كنوع من تصحيح الألوان، أي صبغة دافئة أو باردة توحي بمصدر ضوء دون أن تحاكيه فعليًا. ولم تتطابق الظلال مع مواضع الضوء المفترضة. وكانت الإضاءات تحترق دون الانتقال التدريجي الذي يتميز به التصوير الفوتوغرافي الحقيقي.

تتعامل النماذج الحالية، ولا سيما Imagen 4 وImagen 4 Ultra من Google، مع الإضاءة بدقة فيزيائية حقيقية. فالشخص الواقف قرب نافذة ستظهر في عينيه انعكاسات ضوئية تتطابق مع موضع النافذة. وسيسقط الظل على عنقه بالزاوية الصحيحة. وسيلوّن الضوء المنعكس من لون الجدار الجانب المظلل بشكل مناسب. هذا تصوير فوتوغرافي، لا تقريب.

لقطة جوية علوية بطائرة مسيّرة، شاطئ رملي بركاني، امرأة ببكيني أسود، ضوء علوي عند الظهيرة، واقعية فوتوغرافية 8k

التشريح والنسب

لم تكن مشكلة التشريح في الذكاء الاصطناعي المبكر متعلقة بالأصابع فقط. بل كانت فشلًا عامًا في الاستدلال المكاني: إذ لم يكن لدى النموذج تمثيل داخلي متين لكيفية شغل جسم الإنسان للفراغ ثلاثي الأبعاد. كان الجذع أحيانًا أطول من اللازم أو أقصر من اللازم. وكان الكتفان غير متناظرين بشكل فادح. وكانت الشخصيات الجالسة تحمل نسبًا لا معنى هندسيًا لها عند التدقيق فيها.

تمكنت النماذج اليوم إلى حد كبير من حل هذه المشكلة على مستوى الوضعيات القياسية. فالشخصية الواقفة أو المستلقية في لقطة متوسطة المسافة ستحمل نسبًا تصمد أمام التدقيق. وتميل أوضاع الفشل المتبقية إلى الظهور في الزوايا غير المعتادة، أو الاختزال الحاد، أو التفاعلات المعقدة بين عدة أشخاص. أما بالنسبة إلى حالات الاستخدام الإبداعي الشائعة في NSFW، فقد أصبحت مشكلة التشريح محلولة فعليًا.

💡 نصيحة احترافية: إذا تعطّل التشريح في الوضعيات غير المعتادة، فإن Flux Schnell مع توجيه الوضعية عبر ControlNet يمكنه تثبيت بنية الشخصية قبل تشغيل مرحلة التفاصيل.

كيف لحقت المنصات بالركب

لا تحدد جودة النموذج وحدها جودة المخرجات. فالأدوات المحيطة بالنموذج لها أهمية موازية.

أدوات الدقة ورفع الدقة

من أكثر التحسينات تأثيرًا تحسين رفع الدقة بعد التوليد. يمكن لنماذج الدقة الفائقة الآن أن تأخذ صورة 1024x1024 وتنتج نسخة 4096x4096 تبدو مُصوَّرة فعلًا، لا مكبّرة بالاستيفاء الخطي. يُنتج الجمع بين نموذج أساسي قوي وخطوة رفع دقة مخصصة نتائج لا يستطيع النموذج الأساسي وحده بلوغها مهما بلغت جودته. وكل خطوة في السلسلة، من التوليد الأولي إلى مرحلة رفع الدقة، تراكم الأمانة الكلية للصورة.

امرأة بثوب استحمام في حمام فاخر أمام منضدة الحمام، ضوء صباحي عبر زجاج مصنفر، سطح رخامي، زجاجات عطر كريستال

التعديل الموضعي وإصلاح المناطق الإشكالية

حتى أفضل النماذج تنتج أحيانًا صورة مثالية بنسبة 95% مع عيب واحد مُشتِّت. وقد نضج التعديل الموضعي بشكل كبير جنبًا إلى جنب مع النماذج نفسها. فبينما أنتج التعديل الموضعي المبكر خطوطًا فاصلة مرئية وملمسًا غير متطابق، تستطيع الأدوات الحالية إعادة توليد وجه أو يد أو عنصر في الخلفية بتكامل سلس. تُعاد توليد المنطقة المقنّعة مع إدراك كامل للسياق المحيط بها.

بالنسبة إلى محتوى NSFW، يفيد هذا تحديدًا لأن الصور غالبًا ما تحتوي على مناطق محددة، كوجه أو منطقة جسدية بعينها، تكون فيها رهانات الواقعية أعلى ما يكون. إن القدرة على استهداف هذه المناطق لإجراء تحسين للجودة دون المساس بباقي التكوين تغيير في سير العمل يرفع بشكل كبير الجودة التي يمكن تحقيقها.

الأمر النصي تغيّر أيضًا

تحتاج النماذج الأفضل إلى أوامر نصية أفضل لاستخراج سقف جودتها الكامل. فلغة الأوامر التي نجحت مع SD 1.5 ("امرأة جميلة، جودة عالية، 4k") تنتج نتائج متوسطة على البنى الحديثة.

الكتابة من أجل الواقعية الفوتوغرافية

أصبحت أوامر الواقعية الفوتوغرافية الحديثة أقرب إلى كتابة وصف لقطة لمدير التصوير منها إلى قائمة كلمات مفتاحية. فبدلًا من "بشرة جميلة، واقعية"، تصف الأوامر الفعّالة ظواهر بصرية محددة: "تشتت تحت السطح مرئي عند الأذنين"، "إضاءة رامبرانت تخلق بريقًا مثلثيًا على عظمة الخد"، "مسام تلقي ظلالًا مجهرية تحت ضوء جانبي مائل".

💡 ما ينجح الآن: صِف ما يفعله الضوء، لا ما يحتويه المشهد فقط. فـ"ضوء صباحي بزاوية 15 درجة من اليسار يخلق ظلالًا طويلة عبر الكتان" ينتج إضاءة أفضل بكثير من عبارة "ضوء طبيعي" العامة.

امرأة بفستان سليب (slip dress) من الساتان الأخضر الداكن في حديقة عند الغسق، ضوء الساعة الزرقاء مع فانوس دافئ، خلفية ضبابية بورود بعدسة 85mm f/1.4

لغة الكاميرا ومحاكاة الأفلام

كان التطور الأكثر موثوقية في الأوامر النصية هو تبني لغة التصوير الفوتوغرافي الفعلية. فتحديد البعد البؤري (85mm مقابل 24mm) يغيّر الضغط المكاني للصورة ومقدار تمويه الخلفية. وتحديد فتحة العدسة (f-stop) يؤثر في تصيير عمق المجال. وتخبر مصطلحات محاكاة الأفلام، مثل "Kodak Portra 400" أو "Fujifilm Pro 400H"، النموذج بشيء محدد عن إعادة إنتاج الألوان وطابع الحبيبات ومنحنى التدرج اللوني، وهو ما لا تخبره به عبارات عامة مثل "طابع الفيلم".

هذا التحديد هو جزء من السبب في أن النماذج نفسها التي تنتج نتائج متوسطة للمستخدمين المبتدئين تنتج نتائج مذهلة للمصورين الذين يكتبون الأوامر بمفردات حرفتهم.

امرأة على سرير فندق، ملمس ملاءات قطن مصري أبيض، ضوء جانبي بعد الظهر عبر ستائر من الكتان، حمالة صدر من الحرير

من 2022 إلى 2026: مقارنة مباشرة

تحكي الأرقام قصة، لكن المقارنة البصرية أكثر تأثيرًا ومباشرة. وإليك ما تغيّر فعليًا، جيلًا بعد جيل:

الحقبةالنموذج المميزالبشرةالأيديالإضاءةالمصداقية
2022Stable Diffusion 1.5بلاستيكية/ناعمة5-6 أصابع شائعةمسطحة/غير متسقةواضحة الذكاء الاصطناعي فورًا
2023SDXLملمس محسّنصحيحة في الغالبعمق معتدلمعروفة أنها من الذكاء الاصطناعي
أوائل 2024Flux Devقريبة من الواقعموثوقةفيزيائيةمقنعة في الغالب
أواخر 2024Flux 1.1 Pro Ultraفوتوغرافيةشبه مثاليةممتازةيصعب تمييزها
2025-2026Flux 2 Max، Imagen 4 Ultraلا يمكن تمييزهافوتوغرافيةشبه مثاليةتتطلب فحصًا دقيقًا

لا يتباطأ هذا المسار. فكل جيل معماري جلب تحسينات كانت ستبدو غير معقولة قبل عامين.

لقطة لظهور حمام سباحة لا متناهٍ عند فيلا على حافة الجرف، إطلالة على البحر المتوسط، ضوء ذهبي في وقت متأخر من بعد الظهر، بشرة مبللة تلمع

أين يقف سقف الجودة الآن

الإجابة الصادقة أنه بالنسبة إلى السيناريوهات المضبوطة، والوضعيات القياسية، والأشخاص الفرديين، والإضاءة الموصوفة جيدًا، فقد حلّت النماذج الحالية واقعية الصور فعليًا. وتتطلب الصور التي تولّدها Flux 2 Max وImagen 4 Ultra وSeedream 4 فحصًا حقيقيًا لتمييزها عن الصور الفوتوغرافية. أما العلامات التقنية المحددة التي ميزت مخرجات الذكاء الاصطناعي السابقة، كالبشرة البلاستيكية وانحراف العينين وتضارب الإضاءة، فقد اختفت في حالات الاستخدام العادية.

ما يبقى هو تحديات في الحالات الحدّية: تكوينات معقدة تضم عدة أشخاص، ووضعيات متطرفة، وتصيير النصوص في البيئات، ومشاهد الواقع الفوضوية التي تلتقطها الصورة الفوتوغرافية دون تفكير. هذه ما زالت مجالات بحثية نشطة، وتتحسن كل بضعة أشهر.

💡 السقف العملي: بالنسبة إلى العمل الإبداعي في NSFW تحديدًا، أصبح سقف الجودة محدودًا تقريبًا بالكامل بمهارة الأمر النصي واختيار النموذج، لا بالقيود المعمارية للنموذج. فالأمر النصي المصاغ جيدًا على نموذج قوي مثل Flux 1.1 Pro Ultra سينتج نتائج كانت ستُعدّ مستحيلة تقنيًا في 2022.

امرأة بقميص كتان أبيض في مطبخ مغمور بالشمس، رذاذ حمضيات ملتقط في الهواء، ضوء صباحي من النافذة، Kodak Portra 400

شاهده بنفسك

أفضل طريقة للإحساس بهذا التحول في الجودة هي تشغيل الأمر النصي نفسه عبر أجيال مختلفة من النماذج الواحد تلو الآخر. يجمع PicassoIA كل هذه النماذج في مكان واحد: Flux Schnell للتكرار السريع، وFlux 1.1 Pro Ultra لأقصى جودة، وRealistic Vision v5.1 للأسلوب الفوتوغرافي المضبوط بدقة، وGPT Image 1.5 لرؤية OpenAI للواقعية.

يمكنك تشغيل الأمر النصي نفسه على كل نموذج ومشاهدة كيف يختلف الناتج بالضبط في الوقت الفعلي. جرّب لغة الكاميرا: اكتب "85mm f/1.4، Kodak Portra 400، ضوء صباحي حجمي من اليسار" في توليدك القادم وقارنه بأمر نصي عام. ستُظهر لك النتائج بشكل أوضح من أي مقال ما يبدو عليه تحول الجودة فعليًا في التطبيق. اختر نموذجًا، واكتب وصفًا مفصلًا للمشهد، وشاهد أين يقع السقف الحالي فعلًا.

شارك هذا المقال

اختر لغتك

مقالات ذات صلة