يضم Picasso AI كل نموذج لا يملكه Midjourney: الشرح الكامل

إذا كنت عالقًا في نهج Midjourney القائم على نموذج واحد، فأنت تفوّت مساحة إبداعية كبيرة. يغطي هذا الشرح كل نموذج لا يقدمه، من Flux Pro إلى Realistic Vision v5.1، ويوضح الفجوات الدقيقة وسبب أهميتها للعمل الإنتاجي الحقيقي في البورتريهات ولقطات المنتجات والمحتوى متعدد الأساليب.

يضم Picasso AI كل نموذج لا يملكه Midjourney: الشرح الكامل
Cristian Da Conceicao
مؤسس Picasso IA

ينتج Midjourney صورًا جميلة. لا أحد سيجادل في ذلك. لكن عندما تحاول القيام بشيء خارج مساره البصري الواحد، مثل توليد بورتريه واقعي للغاية بتفاصيل المسام على مستوى البشرة، أو تجربة 50 نمطًا بصريًا مختلفًا في جلسة واحدة دون دفع ثمن كل توليد، أو الانتقال من الواقعي إلى الرسم الزيتي ثم إلى الأنمي ضمن سير العمل نفسه، ستصل بسرعة إلى حاجز يوقفك. اتساع النماذج غير موجود. وهذه الفجوة هي بالضبط النقطة التي يجب أن يبدأ عندها الحديث.

هذا ليس حديثًا عن أن Midjourney سيئ. الأمر يتعلق بما يحدث حين يتطلب مشروعك أكثر مما تستطيع أداة واحدة تقديمه. عندما تعمل على تصميمات تقديم المنتجات، ومحتوى وسائل التواصل الاجتماعي على نطاق واسع، والبورتريهات التحريرية، أو فن المفاهيم الذي يجب أن يطابق الإحاطة بدقة، فإن نموذجًا مغلقًا واحدًا بميل جمالي واحد لا يكفي. السؤال ليس "أي ذكاء اصطناعي ينتج صورًا أجمل؟". السؤال هو "أي منصة تمنحني الأداة المناسبة لكل مهمة محددة؟". وهنا يصبح عنوان Picasso AI يضم كل نموذج لا يملكه Midjourney أكثر من مجرد عنوان: إنها حقيقة عملية لها تبعات حقيقية على سير العمل.

رجل يجلس متربعًا ويدرس صورًا مولّدة بالذكاء الاصطناعي على جهاز لوحي في شقة دور علوي بسيطة التصميم

ما الذي يحصرك فيه Midjourney فعليًا

Midjourney نموذج مغلق. تحصل على محرك واحد، وميل جمالي واحد، وهيكل تسعير واحد. تحسّنت المنصة بشكل ملحوظ عبر الإصدارات، لكن كل مخرج يحمل التوقيع الأساسي نفسه: تلك الجودة الشبيهة بالرسم الزيتي قليلًا التي تجعل صورة Midjourney قابلة للتعرف عليها من بعيد.

هذه ميزة حين تريد ذلك المظهر تحديدًا. وهي قيد حين لا تريده.

إليك ما لا يقدمه لك Midjourney:

  • نماذج أساسية متعددة ببيانات تدريب وخصائص مخرجات مختلفة جذريًا
  • بنى مفتوحة المصدر مثل Stable Diffusion، التي تقف خلفها سنوات من الضبط الدقيق من المجتمع
  • نماذج متخصصة في البورتريه مضبوطة بدقة للبشرة الواقعية والشعر وبنية الوجه
  • إصدارات محسّنة للسرعة تنتج مخرجات قابلة للاستخدام في أقل من خمس ثوانٍ لكل توليد
  • عناصر تحكم في Scheduler والتوجيه تتيح لك ضبط عملية الانتشار على المستوى التقني
  • سير عمل img2img كامل ترفع فيه صورة مرجعية وتعيد توجيهها بأمر نصي
  • الأوامر النصية السلبية التي تستبعد صراحةً العناصر غير المرغوبة من المخرج
  • قيم بذرة قابلة للتكرار مع تحكم كامل في التكرار انطلاقًا من نقطة بداية ثابتة

عندما تجمع هذه الفجوات معًا في سير عمل حقيقي لإنتاج المحتوى، تتوقف عن كونها مضايقات بسيطة، وتتحول إلى ساعات من الحلول البديلة والتنقل بين المنصات وتراجع جودة المخرجات.

صورتان مطبوعتان موضوعتان جنبًا إلى جنب وتُقارنان على طاولة من الرخام

تشكيلة النماذج التي لا يتحدث عنها أحد

يضم كتالوج PicassoIA لتحويل النص إلى صورة أكثر من 90 نموذجًا. ليست 90 نسخة من نموذج واحد، بل معماريات متميزة ولكل منها نقاط قوة مختلفة وميول جمالية مختلفة وعناصر تحكم تقنية مختلفة. عائلة Flux وحدها تغطي ثلاث حالات استخدام مختلفة. إضافة إلى ذلك، تحصل على متخصصين في البورتريه، ومحركات متعددة الأساليب، ومعمارية Stable Diffusion مفتوحة المصدر مع انكشاف تقني كامل.

إليك أين تصبح الفجوة ملموسة.

Flux Schnell: السرعة على نطاق واسع

يولّد Flux Schnell صورة كاملة بدقة ميغابكسل واحد في أقل من خمس ثوانٍ باستخدام أربع خطوات لإزالة التشويش. إذا كنت تشغّل 50 تنويعًا للأمر النصي لتجد الاتجاه البصري الصحيح، فإن الانتظار 30 إلى 45 ثانية لكل صورة على منصة أخرى يكلّفك وقتًا عمليًا حقيقيًا طوال الجلسة. أما Flux Schnell فلا.

يدعم النموذج 11 نسبة عرض إلى ارتفاع، ويُخرج الملفات بصيغ webp أو jpg أو png مع جودة قابلة للضبط من 0 إلى 100، ويعمل على PicassoIA دون أي حد للتوليد. يمكنك تكرار جلسة مفهوم كاملة دون أن تراقب عداد النقاط. تتيح لك معلمة البذرة إعادة إنتاج أي نتيجة بدقة حين تجد ما يستحق التطوير لاحقًا.

💡 متى تستخدمه: صياغة المفاهيم الأولية، والتكرار السريع، وتوليد دفعات لمراجعة العميل، وأي سير عمل يكون فيه الوصول السريع للاتجاه الصحيح أهم من الجودة المطلقة للمخرج. Flux Schnell ليس النموذج المناسب للعمل التفصيلي على المخرج النهائي. لا شيء يتفوق عليه في السرعة.

Flux Dev: الدقة دون تنازلات

Flux Dev نموذج من 12 مليار معامل مصمم للمستخدمين الذين يحتاجون إلى أن يظهر الأمر النصي فعليًا في الصورة. تفسّر معظم مولّدات الذكاء الاصطناعي كلماتك بشكل فضفاض، فتُليّن التفاصيل أو تتجاهل أجزاء من وصفك تمامًا. صُمم Flux Dev لاتباع الأوامر النصية بدقة حقيقية، لذلك عندما تصف مشهدًا محددًا أو ظرف إضاءة أو تفصيلة في الموضوع، تعكس الصورة هذه التفاصيل باستمرار.

يدعم تحويل النص إلى صورة وتعديل img2img معًا، ويدعم 11 نسبة عرض إلى ارتفاع، ويمنحك التحكم في خطوات تشغيل النموذج من 28 إلى 50 لموازنة الجودة مع سرعة التوليد. يتحكم معامل التوجيه في مدى التزام النموذج الصارم بنصك مقابل تكوين الصورة بحرية أكبر. يتيح لك معامل البذرة تثبيت نتيجة والتكرار منها، مع تغيير متغير واحد في كل مرة.

لقطة مقرّبة لبورتريه امرأة ذات شعر بني محمر في حديقة مشمسة، مع ملمس طبيعي للبشرة وخلفية بوكيه

💡 الأفضل لـ: نماذج المنتجات، وفن المفاهيم حيث يجب أن تطابق التكوينات الإحاطة، والصور التحريرية، وأي سير عمل يكون فيه "قريب بما يكفي" غير كافٍ فعلًا.

Flux Pro: حين يجب أن تلتزم الإحاطة

يضيف Flux Pro عنصر تحكم في التوجيه وإعداد للفاصل فوق أساس الدقة في Flux Dev. يحدد التوجيه مدى قرب المخرج من وصفك النصي. أما الفاصل فيُدخل تباينًا في التكوين بين التشغيلات، وهو مفيد حين تريد مجموعة من الخيارات من الأمر النصي نفسه بدلًا من نتائج متشابهة في كل مرة.

يقبل النموذج أيضًا صورة كأمر إلى جانب نصك، ما يمنحك آلية توجيه قائمة على المرجع تتجاوز ما تستطيع الكلمات وحدها فعله. في أعمال العلامات التجارية التي تحتاج فيها إحاطة النص وصورة مرجعية بصرية إلى توجيه المخرج في الوقت نفسه، يتعامل Flux Pro مع المدخلين معًا. إنه النموذج الذي يكسب مكانه في خطوط إنتاج الوكالات.

الميزةFlux SchnellFlux DevFlux Pro
سرعة التوليدأقل من 5 ثوانٍ15-30 ثانية20-40 ثانية
دقة الأوامر النصيةجيدةعاليةعالية جدًا
دعم img2imgلانعمنعم
إدخال الصورة كأمر نصيلالانعم
التحكم في التوجيهأساسينعمنعم مع Interval
أفضل استخدامالمسودات السريعةأعمال الدقةالإنتاج القائم على الإحاطة

مساحة عمل حديثة لوكالة إبداعية، فيها مصممون يعملون على مكاتب واقفة، وتعرض كل شاشة صورًا مختلفة مولّدة بالذكاء الاصطناعي

بورتريهات واقعية بالشكل الصحيح

هنا تظهر أهم نقطة ضعف عملية في نهج Midjourney القائم على نموذج واحد. تتطلب الوجوه البشرية الواقعية تدريبًا متخصصًا. تنتج النماذج العامة بشرة تبدو ناعمة أكثر من اللازم، وأيدي تخرج مشوهة تشريحيًا، وإضاءة تبدو مصطنعة حتى حين يكون التكوين صحيحًا بخلاف ذلك.

Realistic Vision v5.1

صُمم Realistic Vision v5.1 خصيصًا لمعالجة هذه المشكلة. ضُبط النموذج على بورتريهات بشرية واقعية، مع تركيز متعمد على ثلاث نقاط فشل متكررة في المولّدات العامة: واقعية ملمس البشرة، ودقة بنية الوجه، وسلوك الإضاءة الطبيعية.

ما تحصل عليه فعليًا مع هذا النموذج:

  • تفاصيل بشرة على مستوى المسام تصمد أمام القص المقرّب دون أن تبدو مصقولة بالفرشاة الهوائية أو بلاستيكية
  • تحكم بالأمر النصي السلبي لاستبعاد أكثر عيوب البورتريه شيوعًا قبل ظهورها
  • جدولتان مزدوجتان (EulerA وMultistepDPM-Solver) لخصائص تصيير مختلفة ولتعريف الحواف
  • دقة مخصصة تصل إلى 1024 بكسل على أي محور
  • تكامل VAE ينتج تشبعًا لونيًا أغنى وتفاصيل أدق من مخرجات النموذج الأساسي القياسي
  • نطاق مقياس التوجيه من 3.5 إلى 7 لموازنة الالتزام بالأمر النصي مقابل التنوع الإبداعي

يستبعد الأمر النصي السلبي الافتراضي في Realistic Vision بالفعل أكثر عيوب بورتريهات الذكاء الاصطناعي شيوعًا: القزحيات المشوهة، والحدقات المشوهة، والأصابع الزائدة، والأيدي المتحوّلة، والنسب السيئة، والأعناق الطويلة، والتصيير بأسلوب CGI. يمكنك توسيع هذا الأمر السلبي أو تعديله بحسب ما يحتاج مخرجك المحدد إلى تجنبه.

رجل جنوب آسيوي عند مكتب أبيض يحلل لوحة اختيار النماذج على حاسوب محمول، مع ضوء نافذة طبيعي من اليسار

بالنسبة لمصوري المنتجات وصناع المحتوى على وسائل التواصل أو المصممين الذين يحتاجون إلى صور بشرية متسقة عند الطلب، ينتج هذا النموذج مخرجات تبدو كأنها من مصور بورتريه ماهر. هذه قدرة لا يكررها محرك Midjourney العام بشكل موثوق.

نطاق أساليب يتجاوز مظهرًا واحدًا

Dreamshaper XL Turbo

يتعامل Dreamshaper XL Turbo مع النطاق الكامل للأساليب البصرية ضمن نموذج واحد: البورتريهات الواقعية، والرسوم الزيتية، وشخصيات الأنمي، ولوحات بأسلوب المانغا، وفن مفاهيم البيئات. يعمل بدقة SDXL الأصلية (1024x1024) وينتج نتائج قابلة للاستخدام حتى بست خطوات إزالة تشويش فقط، وعادةً في أقل من عشر ثوانٍ.

تمنحك سبع جدولات تحكمًا ذا معنى في جمالية التصيير. تنتج DDIM خصائص حواف مختلفة عن K_EULER. يؤدي تبديل الجدولات على الأمر النصي نفسه إلى تحويل المخرج من حاد وفوتوغرافي إلى ناعم وشبيه بالرسم الزيتي دون تغيير كلمة واحدة من النص. يهم هذا حين تعمل عبر صيغ محتوى وأساليب متعددة ضمن الأسبوع نفسه.

فريق وسائل تواصل يحتاج إلى لقطة منتج واقعية يوم الاثنين، وتوضيح لشخصية بأسلوب الأنمي يوم الخميس، لا يحتاج إلى تغيير المنصات أو الحسابات أو سير العمل. نموذج واحد، وواجهة واحدة، ونطاق أساليب كامل.

💡 نصيحة الجدولة: ابدأ باستخدام K_EULER لمعظم الأعمال. انتقل إلى DPMSolverMultistep حين تريد تعريفًا أحدّ للحواف. يمنح HeunDiscrete نتائج أكثر شبهًا بالرسم الزيتي وذات ملمس على الأمر النصي نفسه.

لقطة مقرّبة ليدي امرأة بأظافر مطلية بطريقة الفرنسي تكتب على لوحة مفاتيح بيضاء، ويظهر على شاشة ثانوية منظر طبيعي مولّد بالذكاء الاصطناعي وغير واضح

كلاسيكيات Stable Diffusion

يظل Stable Diffusion الأساس لمنظومة توليد الصور مفتوحة المصدر. يعمل على PicassoIA بست جدولات، وتحكم في الدقة من 64 بكسل إلى 1024 بكسل بزيادات دقيقة، ودعم للأمر النصي السلبي، ومقياس توجيه قابل للتعديل.

قيمته الحقيقية في التحكم التقني الذي يكشفه. تنتج خيارات الجدولة الست نتائج مختلفة بشكل ملموس: فلكل من DDIM وK_EULER وDPMSolverMultistep وK_EULER_ANCESTRAL وPNDM وKLMS خصائص مميزة. إذا كنت تفهم نماذج الانتشار وتريد أدوات تتحكم فعليًا في المخرج على المستوى التقني، فإن Stable Diffusion يمنحك تلك المساحة. Midjourney لا يكشف أيًا منها.

كيفية استخدام Flux Dev على PicassoIA

بما أن Flux Dev من أكثر النماذج المتاحة تنوعًا، إليك الطريقة الدقيقة للحصول على أفضل النتائج:

الخطوة 1: اكتب أمرًا نصيًا محددًا يتبع Flux Dev الأوامر النصية بأمانة عالية، لذلك تنتج الأوامر الغامضة نتائج غامضة. صف الموضوع واتجاه الإضاءة والخلفية والمزاج وأي تفاصيل تكوينية بعبارات واضحة.

مثال: "صورة RAW، بورتريه مقرّب لامرأة في الثلاثينيات من عمرها في مقهى مشمس، ضوء دافئ بعد الظهر من اليسار، عمق ميداني ضحل، ملمس طبيعي للبشرة، خلفية جدار بلون الكريمة، 85mm f/1.8"

الخطوة 2: اضبط نسبة العرض إلى الارتفاع قبل التوليد اختر النسبة التي تناسب استخدامك المقصود. 16:9 لبانرات الويب، و1:1 لمنشورات وسائل التواصل، و9:16 للقصص العمودية. تغييرها بعد ذلك يكلفك توليدًا آخر.

الخطوة 3: اضبط خطوات التشغيل على 28-35 تمنحك 28 خطوة مخرجًا سريعًا ونظيفًا لمعظم المواضيع. أما 35 إلى 50 فتضيف تفاصيل أدق على حساب وقت التوليد. بالنسبة لمعظم الأعمال التجارية، تُعد 28 نقطة البداية الصحيحة.

الخطوة 4: ثبّت البذرة للتكرار عندما تحصل على نتيجة تستحق التطوير، دوّن رقم البذرة. عدّل شيئًا واحدًا في أمرك النصي وشغّل مجددًا بالبذرة نفسها. سترى بالضبط ما الذي تغيّر بدلًا من الحصول على تكوين مختلف تمامًا.

الخطوة 5: استخدم img2img للعمل القائم على المراجع ارفع صورة مرجعية واضبط قوة الأمر النصي على 0.6 إلى 0.8. القيم الأدنى تحافظ على بنية الصورة الأصلية أكثر. القيم الأعلى تسمح للأمر النصي بتجاوز التكوين البصري بدرجة أكبر. ابدأ من 0.7 ثم عدّل من هناك.

امرأة سوداء واثقة بشعر مجعد طبيعي وبليزر خردلي تقف أمام صورة مطبوعة كبيرة في معرض

💡 إعداد التوجيه: ابدأ بالقيمة 3.5 في التشغيل الأول. ارفعه إلى ما بين 5 و7 إذا لم يتبع المخرج وصفك النصي بدرجة كافية. خفّضه دون 3 إذا أردت تنوعًا تكوينيًا أكبر بين التشغيلات.

ما الذي تحصل عليه فعليًا مقابل Midjourney

امرأة في مقهى وأمامها حاسوب MacBook مفتوح يعرض شبكة من الصور المولّدة بالذكاء الاصطناعي في المتصفح

القدرةMidjourneyPicassoIA
إجمالي نماذج تحويل النص إلى صورة190+
نماذج مفتوحة المصدرلانعم (SDXL, SD, Flux)
نماذج متخصصة في البورتريهلانعم (Realistic Vision v5.1)
نماذج محسّنة للسرعةلانعم (Flux Schnell)
نموذج واحد متعدد الأساليبلانعم (Dreamshaper XL Turbo)
سير عمل img2imgمحدودكامل (Flux Dev, Flux Pro)
الأوامر النصية السلبيةلانعم
اختيار Schedulerلانعم (حتى 7 خيارات)
التحكم في مقياس التوجيهلانعم
التحكم في تباين Intervalلانعم (Flux Pro)
التحكم في قيمة البذرةجزئيكامل
حدود التوليدنعملا
أنماط الأنمي والمانغامحدودنعم
رفع الدقة Super Resolutionلانعم
إزالة الخلفيةلانعم
تحويل النص إلى فيديولانعم (87 نموذجًا)
تبديل الوجوهلانعم
توليد الموسيقى بالذكاء الاصطناعيلانعم

الفجوة ليست هامشية. إنها هيكلية. بنت Midjourney منتجًا حول نموذج مغلق واحد مضبوط جيدًا. أما PicassoIA فقد بنت منصة حول منحك النموذج المناسب لكل مهمة محددة.

لمن يُحدث هذا فرقًا فعليًا

ليس كل شخص يحتاج إلى 90 نموذجًا. إذا كان سير عملك هو "توليد صور لوسائل التواصل الاجتماعي"، وكان أسلوب Midjourney يطابق ما تبحث عنه، فلا يوجد احتكاك يستحق الحل. لكن إذا انطبق أي من هذه الأوصاف على وضعك، تصبح فجوة النماذج ذات أهمية كبيرة:

صناع المحتوى الذين ينتجون عبر صيغ بصرية متعددة، واقعية ومرسومة وبأسلوب الأنمي، يحتاجون إلى منصة تتعامل معها جميعًا في مكان واحد دون اشتراكات أو حسابات منفصلة أو عبء التنقل بين الأدوات.

فرق المنتجات التي تبني نماذج أولية مرئية وصورًا لنمط الحياة تحتاج إلى دقة في الأوامر النصية ودعم img2img. إن إدخال صورة مرجعية مع إعادة توجيه نصية عمل حقيقي وقابل للتكرار. وهو يحتاج إلى نموذج مبني للتعامل مع المدخلين بشكل نظيف.

مصورو البورتريه والمحررون الذين يريدون صورًا مرجعية بمساعدة الذكاء الاصطناعي يحتاجون إلى نموذج مدرّب خصيصًا على الوجوه. محرك عام يصيب الوجوه أحيانًا ليس كالنموذج المبني خصيصًا لهذه الفئة من المخرجات.

المطورون والمستخدمون المتقدمون الذين يفهمون نماذج الانتشار يريدون اختيار الجدولة وعناصر التحكم في التوجيه والبذور القابلة للتكرار. يحتاجون إلى مساحة تقنية لا تكشفها إلا المنصات القائمة على المصادر المفتوحة.

الوكالات التي تدير إنتاجًا بكميات كبيرة وتغطي مئات الأصول عبر إحاطات وأساليب وعملاء مختلفين تحتاج إلى توليد غير محدود دون أن يؤثر ضغط التسعير لكل صورة في القرارات الإبداعية.

لقطة منخفضة الزاوية ومثيرة لناطحة سحاب زجاجية مع لوحة إعلانية كبيرة تعرض شبكة من صور بورتريه مولّدة بالذكاء الاصطناعي

اختر نموذجًا وابدأ الآن

النماذج المذكورة في هذا المقال تعمل على PicassoIA الآن، في متصفحك، دون أي إعداد، ودون حدود للنقاط أو حدود للتوليد. اختر النموذج الذي يناسب المهمة الفعلية أمامك:

  • مسودات المفاهيم السريعة: Flux Schnell بأقل من خمس ثوانٍ لكل صورة
  • إنتاج دقيق للأوامر النصية: Flux Dev مع img2img والتحكم الكامل في البذرة
  • أعمال العلامات التجارية القائمة على الإحاطة: Flux Pro مع إدخال الصورة كأمر نصي وتباين Interval
  • بورتريهات واقعية: Realistic Vision v5.1 مع تفاصيل البشرة على مستوى المسام
  • محتوى متعدد الأساليب: Dreamshaper XL Turbo عبر الصور الفوتوغرافية والأنمي والرسوم التوضيحية
  • التحكم التقني: Stable Diffusion مع ستة أنواع من Scheduler وتحكم كامل في الدقة

اكتب أمرًا نصيًا. اختر نموذجًا. شاهد ما يعود إليك. يظهر الفرق بين نموذج واحد وتسعين نموذجًا في اللحظة التي تصبح فيها إحاطتك محددة بما يكفي بحيث لم يعد ذوق عام يكفي.

شارك هذا المقال

اختر لغتك

مقالات ذات صلة