كيف تعمل نماذج الانتشار غير الخاضعة للرقابة: الآليات الحقيقية وراء فن الذكاء الاصطناعي غير المقيّد

شرح مفصّل لبنية نماذج الانتشار غير الخاضعة للرقابة، من إزالة الضوضاء في الفضاء الكامن إلى ترميز النص بواسطة CLIP، ثم إزالة مرشحات الأمان، وكيف يغيّر الضبط الدقيق لمحتوى NSFW ما يمكن لمولّدات الصور بالذكاء الاصطناعي إنتاجه.

كيف تعمل نماذج الانتشار غير الخاضعة للرقابة: الآليات الحقيقية وراء فن الذكاء الاصطناعي غير المقيّد
Cristian Da Conceicao
مؤسس Picasso IA

في اللحظة التي يتحوّل فيها أمر نصي إلى صورة واقعية كالصور الفوتوغرافية، تجري مليارات العمليات الرياضية بالتتابع، فتحوّل الضوضاء العشوائية الخالصة إلى معلومات بصرية متماسكة تطابق تمامًا ما وصفته. تفعل نماذج الانتشار غير الخاضعة للرقابة الشيء نفسه، لكن دون الضوابط التي تضعها معظم المنصات التجارية افتراضيًا. والنتيجة توليد صور بالذكاء الاصطناعي يستجيب لكامل نطاق القصد الإبداعي البشري، من العادي إلى المثير للجدل. ومعرفة طريقة عمل ذلك ليست مجرد فضول تقني، فهي تكشف البنية الأساسية لتوليد الصور بالذكاء الاصطناعي الحديث، ولماذا تنتج بعض النماذج نتائج لا تستطيع غيرها إنتاجها.

ماذا يعني "غير الخاضع للرقابة" فعليًا في الذكاء الاصطناعي

يفترض معظم الناس أن إزالة مرشحات الأمان من نموذج انتشار مجرد مفتاح تشغيل وإيقاف مخفي في ملف إعدادات. الواقع أعقد بكثير، وأكثر إثارة للاهتمام.

أداة الفحص الافتراضية للأمان

تأتي إصدارات Stable Diffusion القياسية مع أداة فحص للأمان، وهي نموذج تصنيف ثانوي يفحص كل صورة مولّدة قبل أن تصلك. عندما تكتشف محتوى تصنّفه على أنه غير لائق، تستبدل المخرجات بصورة سوداء. أداة الفحص هذه ليست جزءًا من نموذج الانتشار نفسه؛ بل تعمل كمرشح للمعالجة اللاحقة يُطبَّق بعد اكتمال التوليد.

إزالتها بسيطة، إذ يكفي ضبط safety_checker=None في إعدادات خط المعالجة. لكن هذا وحده لا يجعل النموذج "غير خاضع للرقابة". فالنموذج المدرَّب حصريًا على بيانات نظيفة سيظل يعجز عن توليد محتوى صريح أو مثير بإقناع، لأن بيانات التدريب نفسها تحدد ما يعرف النموذج كيف يصوّره. المرشح هو أقل جوانب القيد إثارة للاهتمام.

بيانات التدريب هي المرشح الحقيقي

تكمن الطبقة الأهم من القيود في بيانات التدريب. فنماذج مثل Stable Diffusion الأصلي دُرِّبت على LAION-5B، وهي مجموعة بيانات ضخمة مجمّعة من الويب، جرى ترشيحها لإزالة المحتوى الصريح من نوع NSFW قبل بدء التدريب. لم يرَ النموذج تلك المواد أبدًا، لذلك تكون قدرته على توليدها بثبات وجودة محدودة.

النماذج غير الخاضعة للرقابة حقًا تُضبط دقيقًا على مجموعات بيانات تتضمن محتوى للبالغين، والعُري الفني، والصور المثيرة، إلى جانب تعليقاتها الوصفية. تعدّل عملية الضبط الدقيق هذه الأوزان في بنية U-Net، فيبني النموذج تمثيلًا داخليًا غنيًا للجسم البشري، وظروف الإضاءة الحميمية، والتراكيب المثيرة التي تفتقر إليها النماذج المفلترة. والفرق في جودة المخرجات بين نموذج أساسي مفلتر أُزيلت منه أداة الفحص، ونموذج غير خاضع للرقابة مضبوط دقيقًا بالشكل الصحيح، فرق شاسع.

بورتريه واقعي يمثّل جودة صور البشر المولّدة بالذكاء الاصطناعي

عملية الانتشار من الضوضاء إلى الصورة

لترى لماذا تهم بيانات التدريب غير الخاضعة للرقابة بهذا القدر، تحتاج إلى رؤية كيف تولّد نماذج الانتشار الصور خطوة بخطوة.

الانتشار الأمامي والعكسي

تُدرَّب نماذج الانتشار باستخدام عملية من مرحلتين. في العملية الأمامية، يُعرض على النموذج ملايين الصور الحقيقية، ويراقب كيف تُضاف إليها ضوضاء غاوسية على خطوات متدرجة، حتى تتلاشى الصورة الأصلية تمامًا تحت التشويش. يراقب النموذج هذا التدمير عند مستويات ضوضاء ومراحل مختلفة، ويبني خريطة داخلية لما تفعله كميات مختلفة من الضوضاء بمفاهيم بصرية مختلفة.

في العملية العكسية، يُدرَّب النموذج على توقع تلك الضوضاء وطرحها خطوة بخطوة، حتى تظهر صورة نظيفة من جديد. هذه ليست مهمة حفظ؛ فالنموذج يبني فهمًا إحصائيًا لأي معلومات بصرية يُرجَّح وجودها تحت أي حالة ضوضاء معيّنة، مشروطةً بالأمر النصي المقدَّم.

أثناء التشغيل، أي عندما تولّد صورة فعليًا، يبدأ النموذج من ضوضاء عشوائية خالصة، ويطبّق العملية العكسية مرارًا. تنقل كل خطوة لإزالة الضوضاء التمثيل الكامن قليلًا نحو صورة متماسكة تطابق أمرك النصي. وهذه هي حلقة إزالة الضوضاء، وتعمل بعدد خطوات أخذ العينات الذي تحدده، وعادةً بين 20 و50 خطوة لمعظم النماذج.

الفضاء الكامن

لا تعمل نماذج الانتشار الحديثة مباشرة على بيانات البكسل. بل تعمل داخل تمثيل مضغوط يُسمّى الفضاء الكامن، يُرمَّز ويُفكّ ترميزه بواسطة المشفّر التلقائي المتغيّر (VAE). تتحوّل صورة قياسية بحجم 512x512 في فضاء البكسل إلى تمثيل كامن أصغر بكثير بحجم 64x64. هذا الضغط يجعل التوليد أسرع بكثير، ويسمح لعملية إزالة الضوضاء بالتقاط البنية الدلالية العليا والتكوين والإضاءة وهوية الشخص، بدلًا من أنماط الضوضاء على مستوى البكسل.

يترجم مفكّك الترميز في VAE الكامن النهائي الذي أُزيلت ضوضاؤه إلى صورة كاملة الدقة. وجودة هذا المفكّك مهمة جدًا للمخرجات الواقعية كالصور الفوتوغرافية، ولهذا تتضمن النماذج المضبوطة دقيقًا غالبًا أوزان VAE مخصصة إلى جانب U-Net. فالـ VAE المدرَّب على نطاق أوسع من تشريح الجسم البشري وألوان البشرة سيُنتج مخرجات أدق وأكثر تفصيلًا من النسخة العامة، وهذا سبب آخر يجعل الضبط الدقيق غير الخاضع للرقابة يمتد إلى أبعد من أوزان U-Net وحدها.

بنية خوادم GPU تشغّل توليد صور الذكاء الاصطناعي على نطاق واسع

كيف يحوّل CLIP الكلمات إلى صور

تشرح عملية الانتشار كيف تتحول الضوضاء إلى صورة. لكن كيف يؤثر أمرك النصي فعليًا في الصورة المولّدة؟

مشفّر النص CLIP

تستخدم Stable Diffusion ومشتقاتها نموذج CLIP (Contrastive Language-Image Pretraining) كمشفّر للنص. دُرِّب CLIP على مئات الملايين من أزواج الصور والنصوص ليُنشئ فضاء تضمين مشتركًا تتجمع فيه المفاهيم المتشابهة عدديًا، سواء عُبّر عنها بكلمات أو بمحتوى بصري. تعلّم النموذج أن صورة لامرأة على شاطئ وعبارة النص "امرأة على شاطئ" ينبغي أن تقعا قريبتين من بعضهما في هذا الفضاء الرياضي.

عندما تكتب أمرًا نصيًا، يحوّله CLIP إلى متجه من الأرقام يُسمّى تضمين النص، ويرمّز المعنى الدلالي لوصفك. يُغذّى هذا التضمين في طبقات الانتباه المتقاطع في U-Net عند كل خطوة من خطوات إزالة الضوضاء، فيوجّه النموذج نحو المفاهيم البصرية التي تطابق كلماتك. وكلما كان نصك أغنى وأكثر تحديدًا، استطاع CLIP ترميز قصدك بدقة أكبر، واستطاع U-Net توليده بدقة أعلى.

غالبًا ما يشمل الضبط الدقيق غير الخاضع للرقابة تحديثات لمشفّر النص أيضًا، لا على U-Net وحده. فعندما يتعرّض النموذج لصور صريحة مقرونة بمفردات وصفية محددة، يتحوّل فضاء التضمين الداخلي لـ CLIP ليضع تلك المفاهيم في مواضع أكثر فائدة بالنسبة للتمثيلات البصرية التي يولّدها U-Net. وهذه المواءمة هي ما يتيح للنماذج غير الخاضعة للرقابة الاستجابة بموثوقية للأوامر الصريحة، بدلًا من إنتاج نتائج غامضة أو غير متسقة تشريحيًا.

التوجيه الخالي من المصنِّف

من أهم المعاملات في أي نموذج انتشار مقياس CFG، ويُسمّى أيضًا مقياس التوجيه الخالي من المصنِّف. تدفع قيم CFG الأعلى النموذج إلى الالتزام بالأمر النصي بصرامة أكبر عند كل خطوة لإزالة الضوضاء، على حساب بعض الطبيعية في الصورة وتنوعها. أما القيم الأدنى فتسمح بانحراف إبداعي أكبر عن النص، ما قد ينتج نتائج أكثر عضوية، لكنه قد يفوّت تفاصيل محددة طلبتها.

يعمل التوجيه الخالي من المصنِّف بتشغيل عملية إزالة الضوضاء مرتين عند كل خطوة: مرة مع تضمين نصك (توليد مشروط)، ومرة دون أي نص (توليد غير مشروط). ثم يضخّم النموذج الفرق بين هذين الناتجين بعامل مقياس CFG، فيدفع النتيجة أبعد في الاتجاه الذي يشير إليه نصك.

بالنسبة إلى التوليد غير الخاضع للرقابة، يهم مقياس CFG لأن النموذج يحتاج إلى توجيه كافٍ لإنتاج المحتوى المحدد الذي تصفه، دون أن يكون مقيّدًا بصرامة تجعله يلجأ إلى الأنماط البصرية "الآمنة" الأكثر تمثيلًا في أوزانه الأساسية. ويقدّم مقياس CFG بين 5 و9 عادةً أفضل توازن لمحتوى NSFW، بحسب النموذج المحدد والمُعيِّن (sampler).

نصيحة للأوامر: الأوامر النصية السلبية لا تقل أهمية عن الإيجابية. استخدمها لكبح التشوش، والأطراف الزائدة، والتشوهات التشريحية، وهي أمور تزداد شيوعًا في النماذج المدفوعة نحو محتوى على أطراف توزيع بيانات تدريبها.

باحث يحلل معاملات النموذج عند محطة عمل

النماذج الشائعة وبنيتها

تتعامل بنى النماذج المختلفة مع التوليد غير الخاضع للرقابة بطرق متباينة. فيما يلي مقارنة بين أبرز النماذج.

SDXL ومشتقاته

قدّم SDXL بنية من مرحلتين: نموذج أساسي يولّد كامنًا منخفض الدقة، يتبعه نموذج مُحسِّن يضيف تفاصيل عالية التردد في مرور ثانٍ. يمنح عدد المعاملات الأكبر (3.5 مليار مقابل 860 مليون في Stable Diffusion 1.5) نموذج SDXL تشريحًا أفضل بكثير، وتماسكًا أكبر في الإضاءة، وتحكمًا تكوينيًا أدق. وهذه السعة الأكبر هي ما يجعل الضبط الدقيق لـ SDXL فعّالًا جدًا للمحتوى غير الخاضع للرقابة، إذ يتوفر في النموذج متسع أكبر للتمثيلات الدقيقة.

SDXL Lightning نسخة مقطّرة تحقق جودة قريبة في 4 خطوات فقط لأخذ العينات، ما يجعله عمليًا للتكرار السريع عند اختبار التكوينات والوضعيات. الثمن هو التزام أقل قليلًا بالتفاصيل الدقيقة للنص، لكن في معظم حالات الاستخدام يفوق مكسب السرعة فقدان الدقة.

تضيف الضبوط المجتمعية مثل Dreamshaper XL Turbo تدريبًا إضافيًا فوق أساس SDXL، فتنتج نماذج سريعة وقادرة على توليد أشكال بشرية واقعية كالصور الفوتوغرافية عبر طيف واسع من الأساليب.

النموذجالبنيةخطوات أخذ العيناتالأفضل لـ
SDXLUNet ثنائي المراحل20-30تفاصيل عالية، مشاهد معقدة
SDXL LightningSDXL مقطّر4-8السرعة، التكرار السريع
Dreamshaper XLSDXL مضبوط دقيقًا10-20واقعية منمّقة
Realistic Vision v5.1ضبط دقيق على SD 1.520-30بورتريهات واقعية كالصور الفوتوغرافية

Realistic Vision وPhoton

يظل Realistic Vision v5.1 من أكثر النماذج قدرة وثباتًا في تصوير البشر الواقعي كالصور الفوتوغرافية. فقد خضع لضبط دقيق مكثف على مجموعات بيانات تصوير عالية الجودة، ويُنتج ملمس بشرة، وتفاصيل خصلات الشعر، وسلوكًا طبيعيًا للإضاءة تعجز نماذج أحدث وأكبر كثيرًا عن مضاهاته. وحجمه الأصغر نسبيًا (المبني على SD 1.5) يعني أيضًا أوقات توليد أسرع على معظم العتاد.

يتّبع Luma Photon نهجًا مختلفًا، إذ يعطي الأولوية لاتباع الأمر النصي والدقة التكوينية على حساب الاتساق الأسلوبي. ويتفوق في المشاهد المعقدة متعددة الأشخاص وزوايا الكاميرا غير المعتادة، ويوضح كيف يمكن لتحسينات CLIP، إلى جانب الضبط الدقيق لشبكة U-Net، أن تغيّر بشكل جذري ما يعطيه النموذج الأولوية أثناء التوليد.

صورة شخصية طبيعية في الهواء الطلق تمثل قدرة الذكاء الاصطناعي على إخراج صور واقعية كالصور الفوتوغرافية

Flux وبنية DiT

يمثل Flux Schnell LoRA وFlux Pro Finetuned انحرافًا جوهريًا عن بنية الانتشار الكلاسيكية U-Net. يستخدم Flux محوّلًا للانتشار (DiT)، مستبدلًا الطبقات الالتفافية في U-Net بآليات الانتباه الذاتي والانتباه المتقاطع في كل أرجائه. والنتيجة التزام أفضل بكثير بالنص، وتشريح أكثر تماسكًا عبر الوضعيات المعقدة، وتحسّن في التعامل مع العلاقات المكانية بين أشخاص متعددين.

إصدارات LoRA مفيدة بشكل خاص للتطبيقات غير الخاضعة للرقابة. أسلوب LoRA (Low-Rank Adaptation) يتيح تعديلات موجّهة للأوزان دون إعادة تدريب النموذج كاملًا، أي أن بنية Flux الأساسية تبقى سليمة، بينما تحقن أوزان LoRA خفيفة ومنفصلة قدرات توليد جديدة. ويمكن دمج عدة LoRA وترجيحها أثناء التشغيل، ما يتيح ملفات توليد مخصصة للغاية تمزج أساليب وأنواع محتوى مختلفة.

كيف يصنع الضبط الدقيق النماذج غير الخاضعة للرقابة

الضبط الدقيق هو العملية التي تحوّل النموذج الأساسي الخاضع للرقابة إلى نموذج غير خاضع لها فعليًا. وهو أكثر دقة من مجرد عرض صور صريحة على النموذج.

ما الذي يحدث أثناء الضبط الدقيق

عندما يضبط المطوّر نموذجًا موجودًا دقيقًا على محتوى NSFW، فإنه يُجري مرورات تدريب إضافية باستخدام مجموعة بيانات منتقاة من الصور الصريحة أو المثيرة، تُقرن كل منها بتعليقات نصية وصفية. تعدّل تحديثات التدرج خلال هذه العملية أوزان U-Net، ولا سيما في طبقات الانتباه المتقاطع حيث تتفاعل تضمينات النص مع خرائط الملامح البصرية، فتبني ارتباطات أقوى بين المفردات الوصفية والتمثيلات البصرية التي ينبغي للنموذج توليدها.

لا يمحو الضبط الدقيق القدرات الموجودة في النموذج. بل يضيف ارتباطات جديدة فوق الارتباطات القائمة، ولهذا يحتفظ الضبط الدقيق غير الخاضع للرقابة المُنفَّذ جيدًا بالذكاء التكويني نفسه، وحساسية الإضاءة، والمدى الأسلوبي لنموذجه الأساسي. أما الضبط الدقيق السيئ التنفيذ فيمكن أن يُدخل تشوهات، أو يُضعف الدقة التشريحية، أو يتسبب في تجاهل النموذج لأجزاء من الأوامر تتعارض مع التوزيع الضيق لبيانات الضبط الدقيق.

LoRA مقابل الضبط الدقيق الكامل

هناك نهجان مهيمنان لإنشاء النماذج غير الخاضعة للرقابة، ولكل منهما مزايا وعيوب مختلفة:

  • الضبط الدقيق الكامل: تُحدَّث كل أوزان النموذج في كل مرور تدريب. ينتج أكثر النتائج تكاملًا مع أفضل اتساق تشريحي، لكنه يتطلب حوسبة GPU كبيرة، وأيامًا من التدريب، ويحمل خطر "النسيان الكارثي" لقدرات النموذج الأساسي إذا لم يُدَر بعناية.
  • ضبط LoRA الدقيق: تُدرج مصفوفات تفكيك منخفضة الرتبة في طبقات أوزان محددة، ولا تُحدَّث أثناء التدريب إلا تلك المصفوفات. تكلفة تدريبها أقل بكثير، وسهلة المشاركة كملفات صغيرة، ومتوافقة مع الدمج أثناء التشغيل، وتحمل أقل قدر من خطر تدهور جودة النموذج الأساسي.

معظم النماذج غير الخاضعة للرقابة المتاحة للعموم إما ضبط دقيق كامل لأساس SD 1.5 أو SDXL، أو أوزان LoRA مصممة لتُطبَّق فوق نماذج أساسية من Flux Schnell LoRA أو SDXL.

بيئة بحث أكاديمية تمثّل تطوير نماذج الذكاء الاصطناعي

مُعيِّنات أخذ العينات ولماذا تهم

لا تستخدم جميع نماذج الانتشار خوارزمية أخذ العينات نفسها، والاختيار له أثر قابل للقياس في جودة المخرجات، خاصة في التفاصيل التشريحية الدقيقة.

مقارنة المُعيِّنات الشائعة

يحدد المُعيِّن كيف ينتقل النموذج من الكامن المشوّش إلى الصورة النظيفة عند كل خطوة لإزالة الضوضاء. تستخدم المُعيِّنات المختلفة مقاربات رياضية متباينة لتقدير المسار الأمثل لإزالة الضوضاء.

المُعيِّنالسرعةالجودةأفضل استخدام
Euler Ancestralسريعجيدةالمسودات السريعة، المخرجات المنمّقة
DPM++ 2M Karrasمتوسطممتازةجودة البورتريه، تفاصيل البشرة
DDIMسريعمتوسطةمخرجات متسقة قابلة للتكرار
UniPCسريعجيدة جدًاالاستخدام العام، نتائج متوازنة

ينتج DPM++ 2M Karras باستمرار أوضح ملمس للبشرة وأكثر طبيعية في رسم خصلات الشعر للأشخاص في الصور الواقعية كالصور الفوتوغرافية. وهو المُعيِّن المفضل لتوليد NSFW على نماذج مثل Stable Diffusion 3.5 Large، حيث تستفيد السعة الأكبر للنموذج من مسار أخذ عينات أدق.

خطوات أخذ العينات وأثرها

تنتج الخطوات الأكثر مخرجات أكثر صقلًا، لكن بعوائد متناقصة بعد حد معيّن. وبالنسبة لمعظم النماذج غير الخاضعة للرقابة، يبدو التقسيم العملي كما يلي:

  • 10-15 خطوة: جودة معاينة سريعة، مناسبة لاختبار التكوينات والوضعيات قبل الالتزام بتوليد كامل
  • 20-30 خطوة: الجودة القياسية للمخرجات النهائية، وكافية لمعظم حالات الاستخدام
  • 40-50 خطوة: أقصى استخراج للتفاصيل، ويستحق الوقت الإضافي للصور الرئيسية أو المحتوى الذي سيُرفع دقته لاحقًا

يعتمد عدد الخطوات المثالي بشدة على المُعيِّن. تستخدم إصدارات Lightning وTurbo التقطير بالتماسك أثناء التدريب لإنتاج نتائج عالية الجودة في 4-8 خطوات، وهو عدد خطوات كان سيُنتج نتائج مشوشة وغير متماسكة من مُعيِّن قياسي على نموذج غير مقطّر.

منظر أنيق لشخصية في مسبح لا متناهٍ يمثّل مخرجات الذكاء الاصطناعي عالية الدقة

الحصول على نتائج عالية الجودة من النماذج غير الخاضعة للرقابة

معرفة البنية شيء، واستخدامها لتوليد صور عالية الجودة بشكل ثابت يتطلب نهجًا منهجيًا في كتابة الأوامر.

بنية الأمر النصي المجدية

تتبع الأوامر النصية الأكثر فعالية للنماذج غير الخاضعة للرقابة بنية ثابتة تحاكي الطريقة التي يصف بها موجز التصوير الفوتوغرافي جلسة التصوير:

  1. وصف الشخص مع سمات جسدية محددة (لون الشعر، والبنية، ولون البشرة)
  2. الوضعية والحركة مع وضوح في الاتجاه ("جالس متربعًا، ينظر إلى اليسار")
  3. الملابس أو غيابها مع تفاصيل محددة للقماش واللون
  4. البيئة والخلفية مع تحديد مصدر الإضاءة
  5. تفاصيل الكاميرا والعدسة لتثبيت الجماليات الفوتوغرافية (85mm f/1.4، مستوى العين)
  6. مُعدِّلات الجودة في النهاية (8K واقعي كالصور الفوتوغرافية، حبيبات فيلم Kodak Portra 400)

التحديد هو كل شيء. فعبارة "امرأة جميلة على شاطئ" ستنتج نتائج متوسطة، لأن النموذج يملك حرية واسعة لملء التفاصيل بما هو متوسط إحصائيًا في بيانات تدريبه. أما عبارة "امرأة بشعر أحمر داكن وعلى بشرتها نمش خفيف، ترتدي بيكيني أبيض، جالسة متربعة على رمال بيضاء عند الساعة الذهبية، بعدسة 85mm f/1.4، إضاءة جانبية دافئة من اليمين، ملمس رمل ناعم في المقدمة، حبيبات فيلم Kodak Portra 400، 8K واقعي كالصور الفوتوغرافية" فتنتج مخرجات أكثر ثباتًا وتفصيلًا بكثير.

فكّر في الأمر النصي كمجموعة من القيود تضيّق تدريجيًا فضاء العينات لدى النموذج. كل تفصيل محدد تضيفه يستبعد فئة من المخرجات المحتملة، ويدفع التوليد نحو ما تصفه بالضبط.

بيئة استوديو إبداعي تمثّل سير عمل تكراري لتوليد الصور بالذكاء الاصطناعي

أوامر سلبية تنفع فعلًا

بالنسبة إلى محتوى NSFW الواقعي كالصور الفوتوغرافية، لا تُعد الأوامر السلبية اختيارية. فهي الأداة الأساسية للقضاء على أكثر عيوب التوليد شيوعًا:

  • deformed, ugly, bad anatomy, disfigured — يمنع الأخطاء البنيوية في الأشكال البشرية
  • blurry, low resolution, jpeg artifacts, pixelated — يحافظ على حدة الصورة
  • cartoon, illustration, painting, drawing, sketch — يثبّت الأسلوب الواقعي كالصور الفوتوغرافية
  • extra limbs, missing fingers, fused fingers, malformed hands — يستهدف أكثر أنماط الفشل التشريحي شيوعًا
  • watermark, logo, text, signature — يزيل الطبقات المتراكبة غير المرغوبة التي تظهر كثيرًا

عند استخدام Realistic Vision v5.1 أو Dreamshaper XL Turbo، فإن إضافة oversaturated, plastic skin, waxy, airbrushed إلى الأمر السلبي تحسّن واقعية البشرة أكثر، لأنها تبعد النموذج عن المظهر المفرط في المعالجة الذي يظهر عندما تميل بيانات الضبط الدقيق نحو تصوير فوتوغرافي معدّل بكثافة.

يستحق تحديد قيمة البذرة أيضًا الانتباه. عندما تجد توليدًا يعجبك، سجّل قيمة البذرة وأعد استخدامها مع تعديلات صغيرة في الأمر النصي لتكرار النتائج بشكل منهجي، بدلًا من إعادة التوليد من الصفر في كل مرة. هذه أسرع طريقة منفردة للانتقال من نتيجة جيدة إلى نتيجة ممتازة.

تصوير لنمط حياة ساحلي يمثّل معايير جودة مخرجات الذكاء الاصطناعي

ابدأ التوليد على PicassoIA

نماذج الانتشار، سواء كانت خاضعة للرقابة أو غير ذلك، لا تكون أقوى من المنصة التي تضعها بين يديك. يمنحك PicassoIA وصولًا مباشرًا إلى كامل طيف نماذج تحويل النص إلى صورة، من المخرجات الواقعية كالصور الفوتوغرافية لدى Realistic Vision v5.1 إلى الدقة المعمارية لدى Flux Pro Finetuned، والمدى الأسلوبي لدى Dreamshaper XL Turbo. تتحكم في خطوات أخذ العينات، ومقياس CFG، والـ seed، والأوامر السلبية مباشرة، ما يعني أنك تستطيع تكرار النتائج الناجحة والتكرار بشكل منهجي، بدلًا من انتظار توليد محظوظ.

توفر المنصة أيضًا Luma Photon للعمل التكويني المعقد، وSDXL Lightning لسير العمل الذي تكون فيه السرعة أولوية، حيث تريد اختبار أفكار كثيرة في وقت قصير. وكل نموذج يرد وصفه في هذه المقالة متاح دون إعداد، ودون متطلبات عتاد محلي، ودون ساعات الضبط التي تتطلبها خطوط المعالجة المستضافة ذاتيًا.

كل ما ورد في هذه المقالة، من ضغط الفضاء الكامن إلى تضمينات نص CLIP إلى حلقة إزالة الضوضاء، يحدث في كل مرة تضغط فيها على توليد. فعمليات الانتشار ليست نظرية؛ إنها تعمل في الوقت الفعلي على كل صورة تنشئها. اختر نموذجًا يطابق ما تريد إنتاجه، واكتب أمرًا نصيًا محددًا ومنظمًا، واضبط مقياس CFG بين 6 و8، وأضف أوامرك السلبية، وشاهد ما يخرج. نادرًا ما تكون النتيجة الأولى هي النهائية، لكن التكرارين الثاني والثالث، المستندين إلى ما يُظهره لك النموذج، يتقدمان بسرعة نحو ما كان في ذهنك بالضبط.

معرض فني يعرض صورًا مولّدة بالذكاء الاصطناعي يمثّل نطاق المخرجات الممكنة

شارك هذا المقال

اختر لغتك

مقالات ذات صلة