في منطقة تقع بين الرياضيات والسحر، يأخذ نموذج الانتشار شاشة مليئة بالضوضاء العشوائية الخالصة ويشكّلها تدريجيًا لتصبح وجهًا واقعيًا، أو لوحة زيتية بأسلوب عصر النهضة، أو مشهدًا لمدينة عند الساعة الذهبية. إذا سبق لك أن كتبت جملة في مولّد صور بالذكاء الاصطناعي وشاهدت صورة تظهر، فقد رأيت نموذج انتشار يعمل. لكن ما الذي يحدث فعلًا داخل هذه العملية؟ الإجابة منطقية بشكل مدهش بمجرد أن تعرف المرحلتين اللتين تعتمد عليهما.
الفكرة وراء نماذج الانتشار
نموذج الانتشار مُدرَّب على إزالة الضوضاء. هذا هو المفهوم الأساسي كله. خلال التدريب، يُعرض على النموذج ملايين الصور مع إضافة كميات متزايدة من الضوضاء العشوائية إليها. يبني النموذج القدرة، خطوة بخطوة، على إعادة تكوين الصورة الأصلية قبل إضافة الضوضاء. وبعد التدريب، تشغّل العملية بالاتجاه المعاكس: تبدأ من ضوضاء خالصة، ويسير النموذج عبر الخطوات التي تعلّمها، فيزيل الضوضاء في كل مرحلة حتى تظهر صورة متماسكة.
نوع غريب من الإبداع
قد يبدو غريبًا أن يُعدّ هذا "إبداعًا". فالنموذج لا يرسم شيئًا من الصفر كما يفعل الفنان البشري. بل يتتبّع مسارًا عبر خريطة داخلية لما تبدو عليه الصور الحقيقية عند مستويات مختلفة من التشويش، متنقلًا من الفوضى نحو الوضوح. والوجهة على ذلك المسار، التي يحدّدها أمرك النصي، هي ما تراه في النهاية.
لهذا تبدو النتائج متنوعة وطبيعية إلى هذا الحد. فالنموذج لا يسترجع صورًا مخزّنة ولا يجمع أجزاء من صور أخرى. إنه يبني شيئًا جديدًا باتباع الأنماط الإحصائية لما ينبغي أن تبدو عليه الصورة الحقيقية في كل مرحلة من مراحل إزالة الضوضاء.
لماذا تكون الضوضاء نقطة البداية
اختيار البدء بالضوضاء مقصود. فالضوضاء معرّفة رياضيًا بدقة، وتحديدًا الضوضاء الغاوسية، حيث تتبع قيم البكسلات توزيعًا على شكل جرس. هذه الدقة الرياضية هي ما يسمح للنموذج بالتدريب بصرامة. فقد تعرّض لنسخ مشوّشة من ملايين الصور عند كل مستوى من التشويش، ولهذا يستطيع أن يتنبأ بما ينبغي إزالته في أي مرحلة معيّنة.
ملاحظة: تشبه الضوضاء الغاوسية تمامًا الضجيج الأبيض على شاشة التلفاز. كل بكسل قيمة عشوائية مأخوذة من توزيع طبيعي. وعند أقصى مستويات الضوضاء، لا تقدّم الصورة الأصلية أي معلومات لما تراه.

الانتشار الأمامي: من الصورة إلى الضوضاء
تبدأ مرحلة التدريب بتدمير الصور بشكل منهجي. يُعرف هذا باسم الانتشار الأمامي، ويعمل بإضافة كمية صغيرة ومحسوبة رياضيًا بدقة من الضوضاء الغاوسية إلى الصورة في كل خطوة زمنية. وبعد مئات الخطوات الزمنية، تصبح الصورة الأصلية غير قابلة للتمييز تمامًا. لا يبقى سوى ضوضاء خالصة، لا يمكن تمييزها عن ضوضاء عشوائية مولّدة دون أي صورة على الإطلاق.
إضافة الضوضاء خطوة بخطوة
فكّر في الأمر كأنك تضع طبقات متزايدة العتامة من ورق الاستنساخ الشفاف فوق صورة فوتوغرافية. بعد ورقة واحدة، تبقى الصورة مرئية في معظمها. وبعد عشر أوراق، تصبح ضبابية وباهتة. وبعد ألف ورقة، لا تستطيع رؤية الصورة على الإطلاق. يفعل الانتشار الأمامي هذا تمامًا بالضوضاء على مستوى البكسل، وبزيادات محسوبة وقابلة للتوقع رياضيًا.

الفكرة المحورية أن كل نسخة مشوّشة مقترنة بعلامة الخطوة الزمنية الخاصة بها. يُعرض على النموذج: "هذا ما تبدو عليه الصورة عند الخطوة 200 من أصل 1000"، و"هذا ما تبدو عليه عند الخطوة 800 من أصل 1000". كل خطوة، لكل صورة في مجموعة التدريب، تصبح مثالًا تدريبيًا موسومًا. وهكذا تُنتج مجموعة بيانات واسعة وغنية البنية من صور موجودة أصلًا.
كيف يبدو جدول الضوضاء
| الخطوة الزمنية | مستوى الضوضاء | وضوح الصورة |
|---|
| 0 | لا يوجد | الأصل مثالي |
| 100 | منخفض | حبيبية طفيفة |
| 400 | متوسط | ضبابية، والخطوط الخارجية مرئية |
| 700 | مرتفع | أشكال غامضة فقط |
| 1000 | أقصى مستوى | ضوضاء غاوسية خالصة |
يتبع المعدل المحدد الذي تُضاف به الضوضاء ما يُعرف باسم جدول الضوضاء. تؤثر جداول مختلفة، مثل الخطي أو جيب التمام (cosine) أو السيني (sigmoid)، في جودة الصور التي يستطيع النموذج إنتاجها في النهاية. وتستخدم معظم النماذج الحديثة جدولة الجيب تمام، التي تضيف الضوضاء ببطء أكبر عند الطرفين وبسرعة أكبر في المنتصف، مما يُنتج مخرجات نهائية أفضل مظهرًا.
الانتشار العكسي: من الضوضاء إلى الصورة
بمجرد أن يستوعب النموذج كل مستوى من مستويات الضوضاء لملايين الصور، تقلب الاتجاه. تعطيه ضوضاء خالصة وتطلب منه أن يتنبأ بالضوضاء التي ينبغي إزالتها للاقتراب من صورة حقيقية. يزيل قدرًا قليلًا. تطلب منه مرة أخرى، فيزيل قدرًا أكبر. وبعد 20 إلى 1000 من خطوات إزالة الضوضاء هذه، حسب المُعيّن (sampler) المختار، تتشكّل صورة تبدو حقيقية.
شبكة الإزالة العصبية للضوضاء
الشبكة العصبية داخل نموذج الانتشار لا تولّد الصورة مباشرة. بل تتنبأ بالضوضاء نفسها، وتحديدًا ما الضوضاء التي ينبغي طرحها في كل خطوة. والمحرك الأساسي عادةً هو بنية U-Net: شبكة عصبية على شكل حرف U، فيها مسار مشفّر يضغط الصورة المشوشة إلى تمثيلات مجردة، ومسار فك ترميز يعيد بناء التنبؤ النظيف. وتظهر الصورة مما يتبقى بعد طرح الضوضاء المتنبأ بها.

كم عدد الخطوات التي يحتاجها الأمر؟
ورقة DDPM (Denoising Diffusion Probabilistic Model) الأصلية تطلبت 1000 خطوة لإزالة الضوضاء، وهو ما جعل التوليد بطيئًا بشكل مؤلم. أما المُعيّنات الحديثة مثل DDIM (Denoising Diffusion Implicit Models) و DPM++ و Euler، فيمكنها إنتاج صور عالية الجودة في 20 إلى 50 خطوة فقط، عبر خطوات أكبر وأذكى في عملية إزالة الضوضاء. ولهذا تبدو أدوات الصور الحديثة بالذكاء الاصطناعي فورية تقريبًا مقارنةً بالتطبيقات الأولى.
ملاحظة: المُعيّن (sampler) خوارزمية منفصلة تقع فوق النموذج المدرَّب. تغيير المُعيّن لا يغيّر ما استوعبه النموذج. بل يغيّر فقط كيفية استخدام تنبؤات النموذج للانتقال من الضوضاء إلى الصورة. تناسب المُعيّنات المختلفة احتياجات مختلفة: DDIM سريع ومتّسق، و DPM++ يقدّم جودة أعلى مع خطوات أكثر، و Euler يوازن بين السرعة والدقة بشكل جيد.
داخل الفضاء الكامن
تشغيل الانتشار مباشرة على قيم البكسلات الخام بدقة عالية سيكون بطيئًا للغاية ومكلفًا حسابيًا. فالصورة بحجم 512x512 تحتوي على أكثر من 786,000 قيمة بكسل فردية يجب معالجتها في كل خطوة لإزالة الضوضاء. تحل نماذج الانتشار الحديثة هذه المشكلة بحيلة حاسمة لتحسين الكفاءة: تنفّذ إزالة الضوضاء في تمثيل مضغوط يُسمى الفضاء الكامن (latent space)، بدلًا من فضاء البكسلات.
المشفّر وفاكّ التشفير
قبل أن يبدأ الانتشار، تضغط شبكة عصبية منفصلة تُسمى المشفّر الصورة إلى شبكة أصغر بكثير من القيم. وتتحول صورة 512x512 بكسل عادةً إلى تمثيل كامن بحجم 64x64، أي بعامل ضغط قدره 64. تجري كل عملية إزالة الضوضاء عند هذا الحجم الأصغر، وهو أسرع بكثير. وعندما تنتهي إزالة الضوضاء، تُوسّع شبكة ثانية تُسمى فاكّ التشفير (decoder) التمثيل الكامن إلى صورة كاملة الدقة.

يشكّل المشفّر وفاكّ التشفير معًا المشفّر التلقائي المتغيّر (VAE). والفضاء الكامن الذي ينشئه ليس ضغطًا عشوائيًا؛ بل هو تمثيل منظّم وغني بالمعلومات، يحافظ على أهم الملامح البصرية للصورة مع التخلص مما هو زائد. فكّر فيه كأنه سالب فيلم: كل معلومات صورة فوتوغرافية كاملة الدقة مضغوطة على شريط رفيع وصغير من المادة.
لماذا غيّر الفضاء الكامن كل شيء
هذه البنية هي سبب تسمية عائلة النموذج رسميًا نماذج الانتشار الكامنة (LDMs)، رغم أن معظم الناس يكتفون بقول "نماذج الانتشار". وStable Diffusion XL وStable Diffusion 3 كلاهما نموذجا انتشار كامن. وكذلك Flux Pro. فالعمل في الفضاء الكامن بدلًا من فضاء البكسلات هو ما جعل توليد الصور عالية الدقة بالذكاء الاصطناعي عمليًا على العتاد الاستهلاكي، بدلًا من الحاجة إلى مزارع خوادم.
كيف يتحكم النص في المخرجات
نموذج الانتشار بدون تكييف نصي سيولّد في كل مرة صورًا لمحتوى عشوائي يبدو معقولًا إحصائيًا. تعمل الأوامر النصية عبر تكييف عملية إزالة الضوضاء، فتوجّه النموذج نحو مناطق محددة من فضاء الصور حيث يتطابق المحتوى مع وصفك.
مشفّرات النص والتضمينات
يُحوَّل النص الذي تكتبه أولًا إلى تمثيل رقمي كثيف بواسطة مشفّر نصي. تقرأ نماذج مثل CLIP أو T5 أمرك النصي وتُنتج تسلسلًا من المتجهات عالية الأبعاد تُسمى التضمينات (embeddings)، يلتقط كل منها المعنى الدلالي للكلمات والعبارات في سياق الجملة كاملة. وتُمرَّر متجهات التضمين هذه إلى U-Net في كل خطوة من خطوات إزالة الضوضاء، فيتأثر التنبؤ بالضوضاء باستمرار بما طلبته.

التوجيه الخالي من المصنِّف
تتحكم في قوة تأثير النص إعدادات تُسمى مقياس التوجيه (guidance scale)، ويُعرف أيضًا باسم CFG، أي Classifier-Free Guidance. عند القيم المنخفضة حول 2 إلى 4، يتبع النموذج النص بشكل فضفاض، وينتج نتائج أكثر تنوعًا وأحيانًا مفاجئة. وعند القيم المرتفعة حول 12 إلى 20، يتبع النموذج النص بصرامة شديدة، لكنه قد ينتج صورًا مشبعة بالألوان بشكل مبالغ فيه أو مشوّهة. وتستخدم معظم مولّدات الذكاء الاصطناعي قيمة افتراضية لمقياس التوجيه بين 7 و12، موازنةً بين دقة الالتزام بالأمر النصي والجودة البصرية.
ملاحظة: يعمل التوجيه الخالي من المصنِّف بتنفيذ إزالة الضوضاء مرتين في كل خطوة: مرة مع شرطك النصي، ومرة بدونه. ثم يضخّم النموذج الفرق بين التنبؤين. ويعني مقياس التوجيه الأعلى عاملَ تضخيم أكبر، مما يسحب النتيجة بقوة أكبر نحو أمرك النصي.
عملية التدريب
يتطلب تدريب نموذج انتشار من الصفر مجموعات بيانات ضخمة وقدرة حاسوبية كبيرة. فنماذج مثل Stable Diffusion XL دُرِّبت على مئات الملايين من أزواج الصور والتعليقات المستخرجة من الإنترنت، وتطلّبت مجموعات من مئات وحدات GPU تعمل لأسابيع أو شهور. وما يبنيه النموذج من تلك العملية ليس قاعدة بيانات من الصور، بل تمثيل داخلي غني لبنية الصورة البصرية.
ما الذي يستوعبه النموذج فعليًا
خلال التدريب، تسير العملية لكل صورة في مجموعة البيانات على النحو التالي:
- اختيار خطوة زمنية عشوائية بين 1 و 1000
- إضافة كمية الضوضاء الغاوسية المقابلة للصورة
- تغذية الصورة المشوشة إلى U-Net مع رقم الخطوة الزمنية والتعليق النصي
- مطالبة U-Net بالتنبؤ بالضوضاء التي أُضيفت
- حساب مدى خطأ التنبؤ (دالة الخسارة)
- تعديل أوزان النموذج لجعل التنبؤات المستقبلية أدق

تتكرر هذه الدورة لمليارات أزواج الصورة والخطوة الزمنية. والنتيجة نموذج استوعب البنية البصرية لشريحة ضخمة من الثقافة البصرية البشرية، ويستطيع الانتقال من الضوضاء نحو أي صورة تقع ضمن التوزيع الذي دُرِّب عليه.
دور بذور العشوائية
عملية إزالة الضوضاء العكسية ليست حتمية. حتى مع أمر نصي مطابق، يؤدي تشغيل النموذج مرتين بقيم بذرة عشوائية مختلفة إلى صور مختلفة تمامًا. والسبب أن الضوضاء الابتدائية عشوائية، وأن الفروق الصغيرة في تلك الضوضاء الأولية تقود إلى مسارات مختلفة جدًا عبر عملية إزالة الضوضاء. وهذه ميزة وليست عيبًا: فهي ما يمنحك التنوع البصري عبر عدة توليدات من الأمر النصي نفسه.

الانتشار مقابل نماذج التوليد الأخرى
لم تظهر نماذج الانتشار من فراغ. فقد سيطر نهجان أقدم على توليد الصور بالذكاء الاصطناعي قبلها، ومقارنة الثلاثة توضح سبب أن يصبح الانتشار المعيار.
مقابل GANs
الشبكات التوليدية التنافسية (GANs) تستخدم شبكتين متنافستين: مولّد ينشئ الصور، ومميّز يحاول كشف الصور المزيفة. يمكنها إنتاج صور حادة وعالية الدقة بسرعة، لكنها صعبة التدريب بشكل معروف، وعرضة لما يُسمى "انهيار الأنماط" (mode collapse)، حيث يتوقف المولّد عن إنتاج مخرجات متنوعة ويتعلّق بنطاق ضيق من الصور التي تخدع المميّز بشكل موثوق.
نماذج الانتشار أبطأ في تشغيل النموذج، لكنها تنتج مخرجات أكثر تنوعًا وقابلية للتحكم، وهي أكثر استقرارًا بكثير أثناء التدريب. كما أن القدرة على التكييف مع نص تعسفي بدقة عالية أكثر طبيعية مع الانتشار منها مع GANs، التي تحتاج إلى حيل معمارية وحلول بديلة لتحقيق تحكم ذي معنى بالأمر النصي.
مقابل VAEs
المشفّرات التلقائية المتغيّرة تعمل أيضًا مع تمثيلات كامنة، ويمكنها توليد الصور بأخذ عينات من الفضاء الكامن. ومع ذلك، تميل نتائجها إلى الضبابية لأنها تحسّن التشابه المتوسط بين البكسلات، و"المتوسط" لصور عديدة معقولة غالبًا ما يكون مزيجًا باهتًا منها جميعًا. تتجنب نماذج الانتشار ذلك تمامًا بتحسين التنبؤ بالضوضاء بدلًا من إعادة بناء البكسلات، وهو ما ينتج بشكل طبيعي مخرجات أحد وأكثر تفصيلًا.
| نوع النموذج | السرعة | الجودة | التحكم بالنص | استقرار التدريب |
|---|
| GAN | سريع | حاد لكنه ضيق | محدود | صعب |
| VAE | سريع | غالبًا ضبابي | محدود | مستقر |
| الانتشار | متوسط | دقة عالية ومتنوعة | ممتاز | مستقر جدًا |

نماذج حقيقية ونتائج حقيقية
كل النماذج التي تستخدمها على منصات الصور بالذكاء الاصطناعي مبنية على مبادئ الانتشار هذه. وإليك كيف ترتبط النماذج الكبرى بما قرأته أعلاه.
Stable Diffusion وإصداراته
قدّمت بنية Stable Diffusion XL مسارًا من مرحلتين: نموذج أساسي يتولى التكوين والبنية العامة، ونموذج مُحسِّن (refiner) يُحدّد التفاصيل الدقيقة في مرور ثانٍ. واستبدل Stable Diffusion 3 شبكة U-Net الكلاسيكية ببنية DiT (Diffusion Transformer)، التي تحسّن بشكل ملحوظ دقة عرض النصوص والتحكم في التكوين.
هذه النماذج هي الأساس لمئات الإصدارات المضبوطة بدقة، والمتخصصة في البورتريه، والتصوير المعماري، وتصوير المنتجات، والرسوم التوضيحية. ولا يغيّر الضبط الدقيق عملية الانتشار الأساسية؛ بل يُزيح التوزيع الداخلي للنموذج نحو أسلوب بصري أو مجال موضوعي محدد.
Flux والجيل الجديد
يمثّل Flux Pro وFlux Schnell أحدث ما وصلت إليه محوّلات الانتشار. فهما ينتجان واقعية فوتوغرافية استثنائية، ودقة في عرض النصوص داخل الصور المولّدة، والتزامًا قويًا بتفاصيل الأمر النصي. ويوسّع Flux Redux Dev هذا بإتاحة توليد تنويعات فوق صورة مرجعية موجودة، فيمكنك التكرار انطلاقًا من نقطة بداية بدلًا من البدء من ضوضاء خالصة.
كل هذه النماذج ما زالت تتبع العملية الأساسية نفسها تمامًا: إضافة الضوضاء الأمامية أثناء التدريب، وإزالة الضوضاء العكسية وقت التوليد، وضغط الفضاء الكامن لتحقيق السرعة، وتكييف النص لتشكيل المخرجات. تغيّر التحسينات المعمارية مدى جودة اجتياز النموذج لهذه العملية، لا ماهيتها.
ما الذي يمكنك إنشاؤه الآن
لا تحتاج إلى تدريب نموذج أو كتابة سطر واحد من الشيفرة لتطبيق هذا كله عمليًا. فكل نموذج مذكور أعلاه متاح مباشرة في المتصفح على Picasso IA، دون أي إعداد.

ابدأ بكتابة أمر نصي مفصّل ومحدد في Flux Pro، وشاهد عملية إزالة الضوضاء وهي تترجم كلماتك إلى مشهد واقعي كالصور الفوتوغرافية. اضبط مقياس التوجيه صعودًا ونزولًا لترى مدى قوة تأثير النص في النتيجة. ثم انتقل إلى Stable Diffusion XL بالأمر النصي نفسه، وقارن الفروق الجمالية بين نموذجين يتشاركان البنية الأساسية نفسها لكنهما يسلكان مسارها بطرق مختلفة.
ولّد الأمر النصي نفسه مرتين ببذور مختلفة. لاحظ مدى اختلاف المخرجات، رغم أن العملية الأساسية واحدة. هذا التنوع ليس عيبًا، بل هو الطبيعة الاحتمالية للانتشار وهي تؤدي تمامًا ما صُمّمت له: الانتقال من الفوضى إلى الوضوح، موجَّهةً بما طلبته، عبر مسار لن تتشاركه أي توليدتين معًا.
كل صورة تولّدها هي مسار عبر الضوضاء. والآن تعرف تمامًا ما الذي يحدث على طول الطريق.