تنهار معظم مولّدات الصور بالذكاء الاصطناعي بمجرد أن تضع شخصين في الإطار نفسه. تندمج الأجساد، وتتكرر الوجوه، وتتحول الأيدي إلى بقع غير مفهومة. كل من حاول إنشاء مشهد +18 متعدد الشخصيات بأداة عادية يعرف هذا الإحباط: الأمر النصي يطلب شخصين، والنتيجة تعطيك كارثة تشريحية واحدة.
يتغير هذا الوضع عندما تستخدم النموذج المناسب.
يحتاج أفضل مولّد ذكاء اصطناعي +18 لتعدد الشخصيات في مشهد واحد إلى القيام بعدة أمور في الوقت نفسه: الحفاظ على هوية متميزة لكل شخصية، وفهم العلاقات المكانية بشكل صحيح، وتصيير تشريح واقعي تحت الضغط، والبقاء أمينًا لنيتك الإبداعية. ليست هناك أدوات كثيرة تجتاز هذا المعيار. والأدوات التي تفعل تستحق أن تعرفها بالتفصيل.
يستعرض هذا المقال مولّدات الصور بالذكاء الاصطناعي التي تقدم فعلًا نتائج لمشاهد +18 متعددة الشخصيات، وما الذي يميز كل واحدة منها، وكيف تستخرج أفضل ما فيها بالضبط.

لماذا تُعد مشاهد تعدد الشخصيات صعبة
الحائط التقني الذي تصطدم به معظم النماذج
تولّد نماذج الانتشار الصور عبر إزالة التشويش تدريجيًا من حقل من البكسلات. عندما يشغل شخص واحد الإطار، يكون لدى النموذج إشارة نظيفة نسبيًا للعمل بها. أما إضافة شخص ثانٍ فتجعل هذه الإشارة معقدة. يصبح على النموذج الآن أن يوازن بين مجموعتين من المعطيات التشريحية، ومصدرين للضوء على البشرة، ومجموعتين من الأيدي، ووجهين، وعلاقة مكانية بينهما.
دُرِّبت معظم النماذج على مجموعات بيانات يهيمن عليها الأشخاص المنفردون. وعندما تُدفع إلى نطاق تعدد الشخصيات، تعوّض ذلك بالمتوسطات. والنتيجة: أجزاء جسم تتسرب بين الشخصيات، أو وجوه متطابقة لشخصيات مختلفة، أو شخص يبدو وكأن له ثلاث أذرع.
النماذج التي تتعامل مع هذا بشكل جيد إما دُرِّبت على مجموعات بيانات أغنى لأشكال متعددة، أو تدعم ميزات معمارية مثل فصل الانتباه، أو تسمح بتحكم خارجي عبر أدوات مثل مراجع الوضعيات في ControlNet.
ما الذي يجعل المشهد يعمل فعلًا
تحتاج صورة +18 ناجحة متعددة الشخصيات إلى ثلاثة أمور تعمل بانسجام:
- حدود واضحة لكل شكل: ينبغي أن يُقرأ جسد كل شخص كنظام تشريحي مستقل بذاته، لا كشكل مدموج.
- إضاءة متسقة لكل شكل: ينبغي أن يقع الشخصان تحت مصدر الضوء نفسه بطريقة معقولة من الناحية الفيزيائية.
- الالتزام بالأمر النصي لكل شخصية: إذا كتبت "امرأة سمراء على اليسار، وامرأة شقراء على اليمين"، فينبغي للنموذج أن يحترم ذلك، لا أن يبدّل بينهما أو يتجاهل التعليمات.
النماذج المصنّفة أدناه هي التي تحقق الشروط الثلاثة كلها.
معايير التصنيف الحقيقية
دقة التشريح مع توسّع المشهد
يتداعى التشريح بسرعة مع زيادة عدد الشخصيات. الأيدي هي نقطة الفشل الكلاسيكية، لكن مع أشكال متعددة تظهر أيضًا أخطاء في طول الجذع، ومشكلات في عدد الأطراف، وتشوهات في المنظور حيث لا تشترك الأشكال الموجودة على العمق نفسه في الحجم نفسه. أفضل النماذج في هذا الجانب لديها معطيات تشريحية قوية مدمجة فيها عبر الضبط الدقيق على مجموعات بيانات عالية الجودة للأجسام البشرية.
الالتزام بالأمر النصي مع عدة موضوعات
هل يحترم النموذج أوصاف الأشخاص عندما يكون هناك اثنان أو أكثر؟ النماذج الضعيفة تمزج صفات الشخصيات. أما النماذج القوية فتُبقي السمراء سمراء والحمراء حمراء عبر كل توليدة. وهذا بالغ الأهمية في محتوى +18 حيث تكون هوية الشخصية وتميزها جزءًا من النية الإبداعية.
المفاضلة بين السرعة والجودة
تستغرق بعض النماذج 20 إلى 30 ثانية لكل صورة، بينما تُنجز أخرى في 3 إلى 5 ثوانٍ. في العمل الإبداعي التكراري، حيث تعدّل الأوامر النصية وتعيد التوليد كثيرًا، تهم السرعة. ويوضح التصنيف أدناه موقع كل نموذج على هذا الطيف.

أفضل النماذج لمشاهد +18 متعددة الشخصيات
💡 جميع النماذج أدناه متاحة مباشرة على PicassoIA. وقد خضع كل واحد منها لاختبار لجودة الإخراج متعدد الشخصيات، ومعالجة التشريح، والالتزام بالأمر النصي.
المعيار الذهبي الحالي للمشاهد الواقعية متعددة الشخصيات. يعمل Flux 1.1 Pro Ultra بدقة فائقة الارتفاع، وقد بُني لنوع الأوامر النصية الكثيفة والغنية بالتفاصيل التي تتطلبها المشاهد متعددة الأشكال. يتعامل مع اللغة المكانية بدقة: عبارات مثل "يقف خلف"، و"يواجه بعضهما"، و"على جانبين متقابلين من الإطار" تتحول إلى هندسة مشهد متماسكة.
بالنسبة لمحتوى +18، تكمن قوته في تصيير نسيج البشرة. فالمسام، والتشتت تحت السطح، والتنوع الطبيعي في درجات اللون بين الأفراد، كلها تُعالج بمستوى لا تستطيع النماذج الأرخص مجاراته. والثمن الذي تدفعه هو زمن التوليد: توقّع 15 إلى 25 ثانية لكل صورة بأعلى جودة. يستحق الأمر كل ثانية عندما تكون النتيجة بهذه النظافة.
الأنسب: المشاهد عالية الدقة التي يجب أن يكون ناتجها النهائي قريبًا من الصورة الفوتوغرافية. لقطات متعددة الشخصيات بأسلوب المجلات، وسيناريوهات الإضاءة الداخلية المعقدة، وأي مشهد تريد فيه أن يبدو الشخصان كأشخاص حقيقيين التقطهم مصوّر محترف.
تدفع نماذج Flux من الجيل الثاني التعامل مع تعدد الشخصيات إلى أبعد من ذلك. يقع Flux 2 Pro في النقطة المثالية بين السرعة وجودة المخرجات. أما Flux 2 Max فيضحّي ببعض سرعة التوليد مقابل تفاصيل أغنى وتشريح أكثر انضباطًا. يحافظ كلاهما على فصل قوي بين الأشكال، ويستجيبان جيدًا للأوصاف التفصيلية للملابس والوضعية والموضع لكل شخصية.
ما يميز سلسلة Flux 2 في المحتوى للبالغين هو تحسّن معالجتها لـ العلاقات المكانية. فالمشاهد التي تتضمن قربًا جسديًا بين الشخصيات، كالجلوس معًا، أو الوقوف متقاربين، أو التداخل داخل الإطار، تُصيَّر بوضعية أجسام صحيحة هندسيًا بشكل أكثر تكرارًا من نماذج الأجيال السابقة.
الأنسب لـ: سير العمل الإبداعي التكراري حين تحتاج إلى نتائج موثوقة عبر توليدات متعددة. المشاهد التي تضم شخصين في قرب شديد أو تفاعل جسدي.

إذا كانت الواقعية أولويتك وتريد السرعة أيضًا، فإن RealVisXL v3.0 Turbo هو النموذج الذي يجب اللجوء إليه. مبني على معمارية SDXL مع ضبط دقيق كثيف للواقعية، وقد دُرِّب خصيصًا على مجموعات بيانات من التصوير الفوتوغرافي الواقعي. تتمتع المخرجات بالملمس والإضاءة وعلم الألوان الخاص بكاميرا احترافية.
بالنسبة لمشاهد +18 متعددة الشخصيات، يؤدي RealVisXL أداءً جيدًا بشكل خاص مع التكوينات الطبيعية بأسلوب نمط الحياة: مجموعات على الشاطئ، ولقطات داخلية عفوية، ومشاهد تحاكي التصوير الفوتوغرافي للمجلات. يُولّد الإصدار "Turbo" في 3 إلى 8 ثوانٍ دون التراجع في الجودة الذي تتوقعه من نموذج مُقطَّر.
الأنسب لـ: التكرار السريع. المشاهد متعددة الأشكال بأسلوب نمط الحياة والصور العفوية. عندما تحتاج إلى مخرجات بكميات كبيرة دون التفريط في المصداقية في التشريح وملمس البشرة.
هذا هو الخيار المخصص للمستخدمين المتقدمين في محتوى +18 متعدد الشخصيات. يتيح SDXL Multi ControlNet LoRA إدخال مراجع وضعيات مباشرة في مسار التوليد، ما يعني أنك تستطيع التحكم بدقة في موضع كل شخصية، وكيفية وقوفها أو جلوسها، وكيف ترتبط أجسادها ببعضها في الفضاء.
بالنسبة لمشاهد +18 متعددة الشخصيات، يُحدث هذا تحولًا جذريًا. فبدلًا من أن تأمل أن يفسّر النموذج عبارة "تميل نحوه من اليمين" تفسيرًا صحيحًا، تزوده بهيكل وضعية مرجعي فيتبعه بدقة. وبالجمع مع ضبط LoRA الدقيق لأنماط جمالية محددة، يقدم هذا النموذج مستوى من التحكم في التكوين لا يستطيع أي نموذج يعتمد على الأوامر النصية وحدها مجاراته.
💡 ControlNet هو الأداة الأكثر فعالية لإزالة أخطاء اندماج الأجساد في مشاهد تعدد الشخصيات. إذا كنت جادًا في هذا النوع من المحتوى، فأضفه إلى سير عملك.
الأنسب لـ: التحكم التكويني الدقيق. وضع الشخصيات بشكل مخصص. مشاهد متعددة الأشكال بجودة احترافية حيث تكون دقة الوضعية أمرًا لا يقبل المساومة.

مفضّل لدى المجتمع منذ سنوات، ويتفوق Realistic Vision v5.1 كثيرًا على ما يُتوقع منه في المخرجات متعددة الشخصيات. ضُبط خصيصًا لإنتاج أشكال بشرية شديدة الواقعية، وهذا الأساس يظهر بوضوح عندما تضع شخصين أو أكثر في الإطار. تحافظ نسب الجسم على اتساقها. وتبقى درجات لون البشرة متميزة. وتحافظ الوجوه على هويتها الفردية عبر التكوين.
ليس أسرع النماذج ولا أعلاها دقة في هذه القائمة، لكن اتساقه لافت. ستحصل على مخرجات قابلة للاستخدام في نسبة أعلى بكثير من التوليدات مقارنة بالنماذج الأساسية غير المدربة. ولأي شخص يطوّر مهاراته في الأوامر النصية لمشاهد معقدة، فهذا نقطة بداية ممتازة.
الأنسب لـ: أشكال بشرية متسقة وقابلة للتصديق. مشاهد تحتاج إلى موثوقية تشريحية عبر مجموعة من التوليدات.
قدّم Stable Diffusion 3.5 Large معمارية متعددة الوسائط تعالج النص والمعلومات البصرية بتماسك أكبر من إصدارات SD السابقة. ويترجم هذا مباشرة إلى تعامل أفضل مع تعدد الشخصيات: يقرأ النموذج الجمل العلائقية مثل "امرأتان تواجهان بعضهما" كوصف مكاني، لا كموضوعين فرعيين منفصلين غير مرتبطين.
يستفيد الإصدار 3.5 Large من عدد كبير من المعاملات، ما يمنحه سعة أكبر لتمثيل تفاصيل كل شكل فردي دون أن تتسرب إلى بعضها. والمشاهد التي تحمل علاقات سردية بين الشخصيات، كأن ينظر شكل إلى الآخر، أو أن يمد أحدهما يده نحو الآخر، تُصيَّر بتماسك أفضل من معظم النماذج المنافسة.
الأنسب لـ: أوصاف المشاهد المعقدة ذات الموضع العلائقي المحدد. المشاهد التي تهم فيها العلاقة السردية بين الشخصيات بقدر أهمية الجانب البصري.

نماذج إضافية تستحق التجربة
كيف تستخدم Flux 1.1 Pro Ultra لمشاهد المجموعات
بما أن Flux 1.1 Pro Ultra هو النموذج الأعلى تصنيفًا لهذا الاستخدام، إليك شرحًا خطوة بخطوة للحصول على أفضل النتائج على PicassoIA.
الخطوة 1: اكتب أوصافًا منفصلة لكل شخصية
الخطأ الأكبر في الأمر النصي هو معاملة الشخصيات المتعددة ككتلة وصف واحدة. بدلًا من ذلك، تناول كل شخصية على حدة:
أمر نصي ضعيف: Two women in bikinis at the beach
أمر نصي قوي: Woman 1: tall, dark curly hair, deep olive skin, black string bikini, standing at the water's edge. Woman 2: petite, short blonde pixie cut, light skin with freckles, red bandeau bikini, seated on a towel to the left of Woman 1. Both laughing, facing each other.
يعالج النموذج الأوصاف كتسلسلات من التوكنات. فالأوصاف الأكثر تحديدًا والمفصولة بشكل أوضح تمنحه مدخلات أنظف وتنتج شخصيات أكثر تميزًا.
الخطوة 2: ثبّت هندسة المشهد
بعد وصف شخصياتك، صف الإطار المكاني الذي توجد فيه:
- زاوية الكاميرا: low-angle shot from knee height
- الموضع النسبي: Woman 1 standing three feet in front of Woman 2
- البيئة: late afternoon beach, wet sand, waves in background
- الإضاءة: golden hour light from camera-left, catching both figures
هذا يمنح النموذج إطارًا مكانيًا متماسكًا تُسقط فيه الشخصيتان، بدلًا من تركه يضعهما حيث تقع افتراضاته.
الخطوة 3: أضف واصفات التصوير الفوتوغرافي التقنية
يستجيب Flux 1.1 Pro Ultra بقوة للغة أسلوب التصوير الفوتوغرافي. اختم أمرك النصي بواصفات مثل:
Shot on Canon EOS R5, 85mm f/1.8 portrait lens, natural skin texture, Kodak Portra 400 film grain, RAW 8K photography
تدفع هذه التوكنات مخرجات النموذج نحو التصيير الواقعي، وبعيدًا عن الجماليات العامة للفن بالذكاء الاصطناعي.

استراتيجيات الأوامر النصية التي تنجح فعلًا
ضع وسمًا صريحًا لكل شخصية
يرقّم كثير من المستخدمين المتمرسين شخصياتهم داخل الأوامر النصية: [Character 1: ...] [Character 2: ...]. لا تحمل بنية الأقواس هذه معنى تركيبيًا خاصًا في معظم النماذج، لكن الفصل البصري يساعد آلية الانتباه لدى النموذج على إبقاء وصفي الشخصيتين متميزين أثناء التوليد.
وبديل آخر هو استخدام مراسي الاتجاه: "على اليسار"، و"على اليمين"، و"في المقدمة"، و"خلفها" كلها تمنح النموذج خطافات هندسية لربط كل وصف بموضع محدد في الإطار.
ثبّت إضاءتك
تُعد الإضاءة غير المتسقة ثاني أكثر أسباب الفشل شيوعًا في مشاهد تعدد الشخصيات بعد اندماج التشريح. إذا كان مشهدك يحتوي على مصدر ضوء رئيسي واحد، فاذكره بوضوح:
إضاءة صباحية حجمية قادمة من النافذة في الزاوية العلوية اليسرى، تسقط على الشخصيتين. ظلال ناعمة على الجانب الأيمن من كل وجه. درجة حرارة لون دافئة تبلغ 5600K.
كلما حددت مصدر الضوء بدقة أكبر، زادت احتمالية أن تُصيَّر الشخصيتان تحت ظروف إضاءة متماسكة فيزيائيًا.
طريقة الأمر النصي "الإخراجي"
بدلًا من وصف الصورة كأنها لوحة، صف المشهد كما يفعل المخرج السينمائي وهو يعطي التعليمات:
الكاميرا على ارتفاع الصدر، وموجهة للأعلى قليلًا. امرأتان في منتصف العشرينيات تجلسان على طرفي أريكة بيضاء متقابلتين. الجالسة على اليسار تنظر مباشرة إلى الكاميرا. الجالسة على اليمين تنظر إلى رفيقتها. ضوء النافذة الطبيعي القادم من يمين الكاميرا يضيء الاثنتين بالتساوي.
تنتج هذه الطريقة نتائج متسقة بشكل لافت لأنها تمنح النموذج مرساة للمنظور (موضع الكاميرا) ومرساة سردية (من ينظر إلى أين ولماذا). يملأ النموذج التفاصيل البصرية، وأنت تتحكم في الاتجاه.

نظرة سريعة على مقارنة النماذج
أخطاء شائعة تقضي على مخرجات تعدد الشخصيات
دمج الأوصاف: كتابة "امرأتان جميلتان بشعر طويل داكن" دون سمات مميزة بينهما ستنتج نتيجة مدمجة ومتوسطة. أعطِ كل شخصية ثلاث صفات مميزة على الأقل: لون الشعر، ولون البشرة، ولون الملابس أو أسلوبها.
تخطي الأوامر النصية السلبية: تدعم معظم النماذج الأوامر النصية السلبية. استخدمها بقوة: extra limbs, duplicate faces, merged bodies, blurry features, disfigured, conjoined, extra arms هي محددات قياسية تساعد على توجيه النموذج بعيدًا عن أنماط فشله التشريحية.
تحميل المشهد بأكثر من اللازم: أكثر من ثلاث شخصيات في مشهد واحد يرفع معدل الأخطاء بشكل ملحوظ عبر جميع النماذج. بالنسبة لأربعة أشخاص أو أكثر، استخدم مراجع وضعيات ControlNet وزد عدد الخطوات إذا كان النموذج يدعم ذلك.
نسيان مرساة الإضاءة: بدون إضاءة صريحة، سيُصيّر النموذج غالبًا كل شكل تحت ظروف إضاءة مختلفة قليلًا، فيبدو المشهد مركّبًا لا موحدًا. مصدر ضوء واحد موصوف جيدًا من أكثر الإصلاحات فعالية التي يمكنك تطبيقها على أي أمر نصي لتعدد الشخصيات.
استخدام لغة موضعية غامضة: "قريبتان من بعضهما" ليست مفيدة. أما "امرأة 1 على اليسار بزاوية ثلاثة أرباع نحو الكاميرا، وامرأة 2 على اليمين تواجه امرأة 1" فتمنح النموذج هندسة فعلية يعمل بها.

ما الذي تتطلبه فئة +18 فعلًا
هناك فرق جوهري بين المحتوى الإيحائي للبالغين والمحتوى الصريح. النماذج المصنّفة في هذا المقال قادرة على طيف واسع، لكن الطرف الإيحائي ينتج نتائج متعددة الشخصيات أكثر اتساقًا بكثير، ويتطلب تصحيحًا لاحقًا أقل بكثير.
المشاهد التي تتضمن:
- ملابس السباحة والملابس الداخلية: نسبة نجاح عالية عبر جميع النماذج الرئيسية. وضعيات طبيعية، وبيئات شاطئية، ومساحات داخلية حميمية. يبقى التشريح سليمًا عندما يُوصف كل شخص على حدة.
- الحميمية الضمنية: شخصان في قرب شديد، ولغة جسد مناسبة، وتواصل بصري مقصود. يعمل بشكل أفضل مع Flux 1.1 Pro Ultra و RealVisXL v3.0 Turbo.
- التكوين الفني: أشكال مرتدية جزئيًا، وإضاءة السيلويت، وظلال درامية. يتعامل SD 3.5 Large و Flux 2 Max مع هذه الفئة بأكبر قدر من التحكم الجمالي.
العامل الحاسم في الفئات الثلاث هو التحديد الدقيق. فكلما وصفت المشهد والملابس والإضاءة ولغة الجسد لكل شخصية بدقة أكبر، أصبحت المخرجات أنظف وأكثر قصدية.

ابنِ مشاهدك متعددة الشخصيات على PicassoIA
كل نموذج موصوف في هذا المقال متاح مباشرة في مجموعة PicassoIA لتحويل النص إلى صورة. لا حاجة إلى إعداد GPU محلي، ولا تثبيتات. كل نموذج على بعد بضع نقرات وجاهز للتشغيل.
ابدأ مع Flux 1.1 Pro Ultra عندما تريد أعلى جودة مخرجات ممكنة. واستخدم RealVisXL v3.0 Turbo عندما تكرر بسرعة عبر عدة إصدارات من الأوامر النصية. واتجه إلى SDXL Multi ControlNet LoRA في اللحظة التي تحتاج فيها إلى تحكم دقيق في مكان وقوف كل شخصية وكيف ترتبط أجسادها في الإطار.
تنطبق استراتيجيات الأوامر النصية الواردة في هذا المقال، من وسم الشخصيات ومراسي الإضاءة إلى الطريقة الإخراجية، على كل نموذج تجربه. ابدأ بشخصين في مشهد بسيط، واضبط بنية الأمر النصي أولًا. ثم توسّع إلى مشاهد أكثر تعقيدًا بشخصيات أكثر وإضاءة أكثر وسرد أكثر. الأدوات جاهزة، وما تبنيه بها متروك لك.