ظلّ Stable Diffusion لسنوات المحرّك الأساسي لتوليد الصور مفتوحة المصدر. لكن إطلاق Stable Diffusion 3.5 من Stability AI غيّر المشهد تمامًا. هذا ليس تحديثًا طفيفًا ولا تجديدًا تسويقيًا. يقدّم SD 3.5 بنية مختلفة جوهريًا، وثلاثة إصدارات للنموذج تتميّز كل منها بنقاط قوة واضحة، ومستوى من الواقعية يقلّص الفجوة مع النماذج التجارية المغلقة. إذا كنت تنتظر أن يلحق توليد الصور بالذكاء الاصطناعي المفتوح بأفضل الأدوات المملوكة، فهذه هي اللحظة.
ما هو SD 3.5 فعليًا

Stable Diffusion 3.5 عائلة من نماذج تحويل النص إلى صورة أطلقتها Stability AI في أكتوبر 2024. كلمة "عائلة" مهمة هنا. فعلى عكس الإصدارات السابقة التي صدرت كنموذج واحد، يأتي SD 3.5 في ثلاث تهيئات مصمّمة لإعدادات عتادية واستخدامات مختلفة. الأساس المشترك هو بنية Multimodal Diffusion Transformer، أو MMDiT-X، التي تعالج توكنات النص والصورة معًا، لا بشكل منفصل.
هذه المعالجة المشتركة هي ما يميّز SD 3.5 عن أساليب الانتشار السابقة. ففي نماذج مثل SD 1.5 أو SDXL، كان مشفّر النص ينتج تمثيلًا مضمّنًا، ويرجع إليه U-Net في مراحل مختلفة. أما في MMDiT-X، فيتفاعل توكنات النص والتوكنات البصرية عبر طبقات الانتباه نفسها في الوقت ذاته. والنتيجة نموذج يستجيب للغة الأمر النصي بشكل أكثر مباشرة، ويتعامل مع الأوامر المعقدة التي تتضمن عدة عناصر بارتباك أقل، ويولّد النص داخل الصور بدقة أعلى بكثير.
من SD 1.x إلى SD 3.5
تحكي مسيرة نماذج Stable Diffusion قصة واضحة. جاء SD 1.5 بتوليد مفتوح المصدر في متناول الجميع، لكنه كان يعاني في تماسك التشريح والأوامر المعقدة. حسّن SDXL الدقة والتفاصيل بشكل ملحوظ، ووضع الأساس لعشرات الإصدارات المضبوطة. قدّم SD 3 العمود الفقري القائم على DiT (Diffusion Transformer). ويطوّر SD 3.5 هذا العمود الفقري بإصدار MMDiT-X، ويحسّن جودة بيانات التدريب، ويطلق نماذج تنافس فعليًا مخرجات GPT-Image وMidjourney.
القفزة من SDXL إلى SD 3.5 أكبر من القفزة من SD 1.5 إلى SDXL. ويستحق ذلك التوضيح لأنه يؤثر في قرارات تحديد الإصدارات المضبوطة وLoRA وسير العمل التي تستحق البناء عليها مستقبلًا.
الإصدارات الثلاثة للنموذج
لا يصدر SD 3.5 كنموذج واحد. بل يصدر في ثلاثة:
| النموذج | عدد المعاملات | الأفضل لـ |
|---|
| SD 3.5 Large | 8B | أعلى جودة، والأوامر النصية المعقدة |
| SD 3.5 Large Turbo | 8B (مقطّر) | توليد سريع، بجودة قريبة من Large |
| SD 3.5 Medium | 2.5B | وحدات معالجة الرسوميات للمستهلكين، والضبط الدقيق |
إصدار Medium هو الأرجح ليُضبط بدقة إلى نماذج متخصصة مع الوقت، لأنه يتسع بسهولة في بطاقة بذاكرة VRAM سعتها 10 غيغابايت. أما إصدارات Large فتحتاج إلى عتاد أقوى، لكنها تقدّم نتائج أفضل بوضوح في المشاهد المعقدة.
ميزات SD 3.5 التي تهم فعليًا

ليست كل ميزة معلنة في نموذج جديد ذات معنى عمليًا. هذه الميزات تستحق الذكر فعلًا.
طباعة تعمل بالفعل
كانت نماذج الانتشار السابقة تعامل النص داخل الصور كمشكلة نسيج. كانت تستطيع تقريب أشكال الحروف، لكنها كانت تشوّه الكلمات باستمرار بعد بضعة أحرف. يعامل SD 3.5 توليد النص كجزء من كفاءته الأساسية، لا كفكرة لاحقة.
تعالج بنية MMDiT-X توكنات النص في الأمر النصي على مستوى الانتباه نفسه الذي تعالج عليه التوكنات المكانية، ما يعني أن النموذج يملك تمثيلًا داخليًا أفضل بكثير لشكل الحروف ومكان ظهورها. عمليًا، يمكنك أن تطلب من SD 3.5 Large تضمين لافتة أو تسمية أو عنوان بعبارة قصيرة، والحصول على نتائج قابلة للقراءة من أول توليد. وهذا وحده يفتح حالات استخدام تجاري واسعة كانت غير عملية سابقًا مع النماذج مفتوحة المصدر.
واقعية محسّنة

الواقعية في توليد الصور صفة محددة. فهي ليست مجرد حدّة أو دقة. إنها الطريقة التي يتصرف بها الضوء حول الأسطح، وتحوّلات اللون الدقيقة في الظلال، والنسيج الصغير في الجلد والقماش، والعمق المتماسك الذي توحي به المستويات الخارجة عن التركيز. يتعامل SD 3.5 Large مع كل ذلك بوضوح أفضل بكثير من SDXL.
دُرّب النموذج على مجموعة بيانات عالية الجودة ومنتقاة، ويظهر التحسّن في المقارنات. تُظهر البورتريهات الجلد بتفاصيل تصل إلى مستوى المسام. وتحافظ لقطات العمارة على المنظور الصحيح دون تشوهات. وتُظهر صور المنتجات خصائص مادية متسقة عبر الكادر. بالنسبة للمستخدمين الذين اعتمدوا على إصدارات مضبوطة متخصصة مثل RealVisXL v3.0 Turbo للحصول على مخرجات واقعية من SDXL، يبدأ نموذج SD 3.5 Large الأساسي من حدّ أعلى بكثير.
بنية MMDiT-X
يستحق الأساس التقني نظرة موجزة حتى لو كنت لا تبني النماذج بنفسك. تشفّر نماذج الانتشار القائمة على U-Net المعلومات المكانية بطريقة هرمية. أما Multimodal Diffusion Transformer فيستخدم طبقات انتباه تسمح لرقع النص والصورة بالتأثير في بعضها بالتساوي طوال عملية إزالة الضوضاء.
لهذا أثران عمليان. أولًا، يحافظ النموذج على تطابق أقوى بكثير بين ما يُوصف وما يُولَّد، خصوصًا في المشاهد متعددة العناصر. فإذا طلبت "حقيبة حمراء على اليسار وحقيبة زرقاء على اليمين"، فمن المرجح جدًا ألا يخلط النموذج بين المواضع أو الألوان. ثانيًا، يتعامل النموذج مع بنى الأوامر النصية غير المعتادة أو المعقدة بقوة أكبر، فيتعامل مع المواضع النسبية والأوصاف المتعددة الطبقات والمفاهيم المنفية بموثوقية أعلى بكثير.
Large مقابل Medium مقابل Turbo

اختيار الإصدار المناسب قرار عملي أكثر منه نظريًا.
أي إصدار تختار
SD 3.5 Large هو النموذج المرجعي في الجودة. استخدمه عندما تكون جودة التوليد هي الأولوية ولا يشكّل زمن الحوسبة قيدًا. ينتج أدق التفاصيل، وأفضل التزام بالأمر النصي، وأكثر عرض موثوق للنص.
SD 3.5 Large Turbo مقطّر من نموذج Large باستخدام التدريب الخصومي. يمكنه إنتاج صور عالية الجودة في أربع إلى ثماني خطوات بدلًا من عشرين إلى ثلاثين. يظهر فرق الجودة مقارنة بنموذج Large الكامل عند الفحص الدقيق، لكنه ضئيل في معظم المخرجات العملية. استخدمه عندما تحتاج إلى تكرار أسرع دون النزول إلى مستوى Medium.
SD 3.5 Medium هو الهدف المناسب للضبط الدقيق. عدد معاملاته البالغ 2.5B يعني أنه يمكن تدريبه على عتاد المستهلكين، وهذا أنتج بالفعل موجة من الإصدارات المضبوطة من المجتمع تستهدف أساليب ووجوهًا وفئات منتجات محددة. يقدّم جودة أقل بوضوح من إصدارات Large في الأوامر النصية المعقدة، لكن في المهام المتخصصة المركّزة، يمكن لإصدار Medium مضبوط جيدًا أن يتفوق على نموذج Large الأساسي.
المفاضلات بين السرعة والجودة
💡 إرشاد عملي: للمخرجات النهائية للإنتاج، استخدم SD 3.5 Large. للنماذج الأولية السريعة أو عندما تحتاج عشرات التنويعات، استخدم Large Turbo. للنماذج المتخصصة المضبوطة على عتاد محدود، استخدم Medium.
لعدد الخطوات تأثير كبير مع هذه النماذج. تشغيل SD 3.5 Large بعدد 20 خطوة ينتج مخرجات أفضل بوضوح من تشغيله بعدد 10 خطوات. على عكس بعض النماذج السابقة التي يتسطّح فيها منحنى الجودة بسرعة، يستفيد SD 3.5 من نطاق الخطوات الموصى به كاملًا عندما يكون الهدف أقصى درجات التفاصيل.
كتابة أوامر نصية أفضل لـ SD 3.5

يعالج SD 3.5 الأوامر النصية بشكل مختلف عن النماذج القائمة على U-Net. تنطبق استراتيجيات الأوامر التي نجحت مع SD 1.5 وSDXL جزئيًا، لكن البنية الجديدة تكافئ عادات مختلفة.
بنية الأمر النصي التي تنجح
يستجيب SD 3.5 جيدًا لـ الأوصاف باللغة الطبيعية بدلًا من قوائم الوسوم المفصولة بفواصل التي سيطرت على الأوامر النصية في SDXL. يمكنك أن تكتب جملة مثل "امرأة تقف في مطبخ مشمس، تنظر من النافذة، واقعية كالصورة الفوتوغرافية، ضوء صباحي من اليسار"، وتحصل على نتائج متماسكة.
ومع ذلك، ما زالت مُعدِّلات الجودة مفيدة. المصطلحات التالية تحسّن جودة المخرجات بشكل موثوق:
- واقعي كالصورة الفوتوغرافية، واقعي للغاية، 8K
- إضاءة سينمائية، ضوء حجمي
- تركيز حاد، حبيبات الفيلم، Kodak Portra 400
- عدسة 85mm، عمق ميداني f/1.8
- صورة RAW فوتوغرافية، تفاصيل عالية
بالنسبة للأشخاص الذين لهم تفاصيل جسدية محددة، صِفها مبكرًا في الأمر النصي. يولي النموذج اهتمامًا أكبر للمفاهيم التي تظهر أولًا في تسلسل التوكنات، لذا يجب أن تأتي أهم عناصرك في المقدمة.
الأوامر النصية السلبية ما زالت تعمل
رغم التغييرات المعمارية، تظل الأوامر النصية السلبية فعّالة. ما زالت الاستثناءات الشائعة مثل deformed, blurry, low quality, cartoon, illustration, watermark تكبح تلك الصفات بموثوقية. وبالنسبة للبورتريهات تحديدًا، فإن إضافة plastic skin, airbrushed, smooth skin, uncanny valley إلى الأمر النصي السلبي تُبقي نسيج الوجه يبدو طبيعيًا لا مُعالَجًا بإفراط.
فرق واحد ملحوظ عن SDXL: يكون SD 3.5 أقل عرضة بكثير لأخطاء التشريح من الأساس، ما يعني أن قائمة الأوامر السلبية الخاصة بأجزاء الجسم يمكن أن تكون أقصر أو تُحذف تمامًا في كثير من الحالات.
كيف تستخدم SD 3.5 على PicassoIA

Stable Diffusion 3.5 Large متاح مباشرة على PicassoIA، ما يعني أنه يمكنك تشغيله دون أي تثبيت محلي، أو متطلبات GPU، أو إعداد بيئة Python.
خطوة بخطوة مع SD 3.5 Large
الخطوة 1: افتح صفحة النموذج
انتقل إلى Stable Diffusion 3.5 Large على PicassoIA. تُحمَّل الواجهة مباشرة في متصفحك دون الحاجة إلى حساب للبدء.
الخطوة 2: اكتب الأمر النصي
في حقل الأمر النصي، صِف صورتك باللغة الطبيعية. ابدأ بالعنصر الرئيسي، ثم البيئة، ثم الإضاءة، ثم مُعدِّلات الأسلوب. اجعله بين 50 و150 كلمة للحصول على أفضل النتائج. قد تنجح الأوامر الأقصر، لكنها تميل إلى إنتاج مخرجات عامة.
الخطوة 3: اضبط المعاملات
المعاملات التي يجب ضبطها:
- الخطوات: اضبطها على 28-40 للحصول على أقصى جودة. اضبطها على 8-12 للسرعة مع Large Turbo.
- مقياس CFG: القيمة 3.5-4.5 هي النقطة المثالية لـ SD 3.5. الارتفاع أكثر من ذلك قد يسبب تشبّعًا مفرطًا للألوان وإدخال تشوهات.
- نسبة العرض إلى الارتفاع: 16:9 للمناظر الطبيعية، و9:16 للبورتريه، و1:1 للتنسيقات المربعة.
الخطوة 4: أضف أمرًا نصيًا سلبيًا
حتى مع أمر نصي إيجابي نظيف، أضف استثناءات الجودة الأساسية: blurry, low quality, distorted, watermark, text, deformed
الخطوة 5: ولّد وكرّر
شغّل أول توليد. إذا كانت النتيجة قريبة لكنها غير مثالية، فعدّل الأوصاف المحددة بدلًا من إعادة كتابة الأمر النصي كاملًا. تغييرات صغيرة مثل إضافة "إضاءة حافّية ناعمة من اليمين" أو تغيير "واقعي كالصورة الفوتوغرافية" إلى "صورة فوتوغرافية واقعية للغاية" يمكن أن تغيّر المخرجات بشكل ملموس.
معاملات للضبط
💡 نصيحة CFG: جرت معايرة SD 3.5 على قيم CFG أقل من SDXL. إذا كانت النتائج مشبعة بالألوان أو مفرطة الحدّة، فخفّض CFG من 7 إلى 4 وأعد التوليد.
تتيح لك معلمة قيمة البذرة (seed) إعادة إنتاج المخرجات نفسها بدقة. عندما تجد نتيجة توليد تعجبك، دوّن قيمة البذرة. يمكنك إعادة استخدامها مع تعديلات طفيفة على الأمر النصي لإنشاء إصدارات متسقة من المشهد نفسه. وهذا مفيد لمجموعات صور المنتجات أو لثبات الشخصيات عبر عدة صور.
بالنسبة إلى أداة أخذ العينات (sampler)، يعمل كل من DPM++ 2M Karras وEuler a جيدًا مع SD 3.5. النموذج ليس حساسًا لاختيار أداة أخذ العينات كما كان SD 1.5، لكن DPM++ يميل إلى إنتاج تدرجات أنعم قليلًا للبورتريهات، بينما يمكن لأداة Euler a أن تنتج حوافًا أحدّ للّقطات المعمارية وصور المنتجات.
SD 3.5 مقابل نماذج أخرى

اختيار النموذج يعني مطابقة الأداة للمهمة. SD 3.5 ليس الخيار الأفضل لكل شيء.
SDXL ما زال له مكانه
ما زال SDXL Lightning 4Step والإصدارات المضبوطة المتخصصة من SDXL المبنية على أساليب جمالية محددة تنتج مخرجات مميزة لا يعيد SD 3.5 إنتاجها بالضبط. يضم نظام SDXL البيئي آلاف LoRA المدرّبة على أساليب فنية ووجوه وأنواع منتجات محددة. إذا كان سير عملك يعتمد على LoRA معيّن لم يُنقل بعد إلى SD 3.5، فإن SDXL يظل الخيار العملي.
يحتفظ Stable Diffusion (النموذج الأصلي المبني على 1.5) بمتابعيه بفضل خصائصه الجمالية المميزة وحجم الإصدارات المضبوطة الهائل المبنية عليه. بالنسبة لأساليب الرسم الشبيهة بالأنيمي والرسم التوضيحي الفني، ما زال نظام 1.5 البيئي ينتج نتائج تنافسية رغم قِدم النموذج الأساسي.
حيث يتفوق Flux بدلًا من ذلك
يمثل Flux Dev وFlux Pro من Black Forest Labs البديل التنافسي الأساسي لنموذج SD 3.5 في فئة الأوزان المفتوحة. يميل Flux إلى إنتاج نتائج أقوى في تصوير العمارة، وصور المنتجات ذات التفاصيل الهندسية الدقيقة، وأي مشهد يتطلب علاقات مكانية دقيقة للغاية. يحافظ SD 3.5 Large على أفضلية في تصوير البورتريه والأشخاص، حيث تُظهر تركيبة بيانات تدريبه مزايا واضحة في دقة تفاصيل الوجه وأمانة نسيج الجلد.
المقارنة الصادقة: لا يهيمن أي من النموذجين في كل الفئات. واستخدام كليهما عبر PicassoIA لا يكلّفك أي عناء في الإعداد، لذا فإن اختبار كليهما في حالتك الخاصة هو الطريقة الأكثر مباشرة.
| حالة الاستخدام | النموذج الموصى به |
|---|
| تصوير البورتريه | SD 3.5 Large |
| العمارة والتصميم الداخلي | Flux Dev |
| صور المنتجات | SD 3.5 Large أو Flux |
| النص داخل الصورة | SD 3.5 Large |
| التكرار السريع | SD 3.5 Large Turbo |
| أسلوب الأنيمي والرسم التوضيحي | إصدارات SDXL المضبوطة |
| الضبط الدقيق على وحدة GPU للمستهلكين | SD 3.5 Medium |
حالات استخدام واقعية

تترجم الميزات الموصوفة أعلاه إلى تطبيقات إبداعية عملية كانت صعبة أو مستحيلة مع نماذج مفتوحة المصدر السابقة.
تصوير البورتريه
ينتج SD 3.5 Large صور بورتريه بتفاصيل الجلد والشعر والعينين تنافس تصوير الاستوديو. يتعامل النموذج مع إعدادات الإضاءة الصعبة بكفاءة: الإضاءة المنقسمة، والإضاءة الحافّية مع خلفية داكنة، وضوء النافذة الطبيعي مع ظلال ناعمة. وبالنسبة لتطبيقات البورتريه التجارية مثل صور الملف الشخصي للمواقع، أو جلسات التصوير لمجلات الأزياء، أو المراجع الخاصة بالشخصيات، يُنتج مخرجات قابلة للاستخدام مباشرة دون معالجة لاحقة مكثفة.
يتحسّن اتساق التشريح عبر التوليدات بشكل ملحوظ مقارنة بنموذج SDXL. تُعرض الأيدي، التي كانت صعبة للغاية على النماذج السابقة، بعدد أصابع صحيح ووضعيات طبيعية في نسبة عالية من التوليدات دون أي حلول بديلة عبر الأمر النصي السلبي.
صور المنتجات
يُعد تصوير المنتجات من أسرع حالات استخدام توليد الصور بالذكاء الاصطناعي نموًا في سير العمل المهني. تحسّن الواقعية في SD 3.5 يجعل صور المنتجات تبدو موضوعة في بيئات حقيقية لا مركّبة عليها. يتعامل النموذج مع الأسطح العاكسة والمواد الشفافة والبيئات الخلفية المعقدة مع إضاءة متسقة عبر سطح المنتج.
مع تحسينات عرض النص، يمكنك تضمين ملصقات أو لافتات تجارية في صور المنتجات والحصول على نتائج مقروءة. زجاجة بملصق، وكتاب بعنوان، وعبوة باسم تجاري: كل هذه مخرجات ممكنة من SD 3.5 Large، حيث كانت النماذج السابقة ستنتج تقريبات مشوّهة.
الأعمال الفنية الإبداعية

في الأعمال الإبداعية غير الواقعية، ينتج SD 3.5 مع أسلوب توجيه مناسب ملامح لوحات زيتية، وجماليات تصوير الأفلام، وأساليب رسم توضيحي تحريرية، وكلها عالية الجودة ومميزة. يعني التزام النموذج الأقوى بالأمر النصي أن تركيبات المشاهد المعقدة ذات العناصر المتفاعلة المتعددة تقترب فعليًا من المقصود، ما يفتح المجال أمام أفكار إبداعية أكثر طموحًا.
كما أن الطبيعة مفتوحة الأوزان لـ SD 3.5 تعني أن مجتمع المبدعين بدأ بالفعل ضبط إصدار Medium لأساليب فنية محددة، وستتوسع مكتبة هذه الإصدارات المضبوطة مع نضج النموذج. يستطيع الفنانون الذين يريدون أسلوبًا معينًا أن ينتظروا إصدارًا مضبوطًا من المجتمع، أو أن يدرّبوا نموذجهم الخاص على أساس Medium.
ابدأ توليد الصور مع SD 3.5 الآن
كل ميزة موصوفة في هذا المقال متاحة لك فورًا عبر PicassoIA، دون تثبيت محلي، ولا بيئة Python، ولا حاجة إلى GPU. نموذج Stable Diffusion 3.5 Large جاهز للاستخدام مباشرة في متصفحك.
إلى جانب SD 3.5، يمنحك PicassoIA الوصول إلى Stable Diffusion 3، وFlux Dev، وFlux Pro، وRealVisXL v3.0 Turbo، وأكثر من 90 نموذجًا آخر لتحويل النص إلى صورة في مكان واحد. يمكنك مقارنة المخرجات عبر النماذج دون التنقل بين منصات مختلفة، وهذه أسرع طريقة للوصول إلى ما يعمل فعلًا لموضوعك المحدد ومتطلبات أسلوبك.
ابدأ بالأمر النصي الذي في ذهنك، وشغّله عبر SD 3.5 Large أولًا، ثم قارن مع بديل أو اثنين. بعد بضع جولات من الاختبار، تصبح مطابقة النموذج للمهمة بديهية. لقد ارتفع الحد الأدنى لجودة التوليد مفتوح المصدر كثيرًا مع SD 3.5، وأفضل طريقة لرؤية هذا التحوّل هي أن تولّد شيئًا بنفسك.