ما هي نماذج الانتشار بكلمات بسيطة

تقف نماذج الانتشار وراء أكثر مولّدات الصور بالذكاء الاصطناعي واقعية اليوم. يشرح هذا المقال بدقة كيف تعمل، بدءًا من فكرة حقن الضوضاء وصولًا إلى عملية إزالة الضوضاء العكسية، دون الحاجة إلى أي خلفية تقنية، مع أمثلة حقيقية وتشبيهات واضحة ومقارنات مباشرة.

ما هي نماذج الانتشار بكلمات بسيطة
Cristian Da Conceicao
مؤسس Picasso IA

إذا سبق لك أن كتبت جملة وشاهدت الحاسوب يولّد صورة واقعية كالصور الفوتوغرافية من لا شيء، فقد رأيت نموذج انتشار يعمل أمامك. تقف هذه النماذج خلف معظم مولّدات الصور بالذكاء الاصطناعي الكبرى اليوم، من Stable Diffusion إلى Flux Dev، وطريقة عملها أبسط بكثير مما يتوقعه معظم الناس. يشرح هذا المقال نماذج الانتشار دون معادلات، ودون مصطلحات معقدة، ودون تجاهل الأجزاء المهمة فعلًا.

قطرة حبر تنتشر في الماء، تمثل مفهوم الانتشار على المستوى الجزيئي

مشكلة الضوضاء التي لا يتحدث عنها أحد

تبدأ معظم الشروحات لنماذج الانتشار بالرياضيات المعقدة، وهذا ليس المكان الصحيح للبدء. المكان الصحيح هو سؤال أبسط بكثير: ماذا لو استطعت أن تعلّم الحاسوب أن يتراجع عن العشوائية؟

فكّر في ما يحدث عندما تقلّب قطرة حبر في كأس ماء. ينتشر الحبر ويختلط، وفي النهاية لا تعود قادرًا على تحديد المكان الذي بدأ منه. تُسمّى هذه العملية، أي الانتشار والتجانس وفقدان البنية، الانتشار (diffusion). وهي تحدث مع الحبر في الماء، ومع الحرارة عبر قضيب معدني، ومع العطر في الغرفة.

تستعير نماذج الانتشار هذه الفكرة وتشغّلها بالاتجاه المعاكس.

لماذا تُعد الضوضاء نقطة بداية منطقية

في عالم الصور، تعني "الضوضاء" قيمًا عشوائية للبكسلات. خذ أي صورة فوتوغرافية وأضف إلى كل بكسل قيمًا عشوائية كافية، فستنتهي بتشويش بصري أشبه بشاشة تلفاز معطّلة. تختفي الصورة الأصلية تمامًا.

هذه هي نقطة البداية لكل نموذج انتشار. ليس لأنها مثيرة للاهتمام، بل لأنها مفيدة. الضوضاء الخالصة سهلة التوليد. لا تحتاج إلى مجموعة بيانات من الصور لإنتاج بكسلات عشوائية، فيمكنك إنشاؤها فورًا من لا شيء.

الفكرة التي جعلت نماذج الانتشار عملية هي التالية: إذا استطعت تدريب شبكة عصبية على أخذ صورة مشوّشة قليلًا والتنبؤ بشكل النسخة النظيفة منها، يمكنك ربط هذه العملية مئات المرات معًا للانتقال من الضوضاء الخالصة إلى صورة متماسكة.

كيف يعمل نموذج الانتشار فعليًا

باحث أمام حاسوب مع مخططات تدريب شبكة عصبية ومنحنيات الخسارة على عدة شاشات

في جوهره، نموذج الانتشار شبكة عصبية لها مهمة واحدة: التنبؤ بالضوضاء في الصورة. يبدو ذلك بسيطًا أكثر من اللازم، لكن هذه القدرة الواحدة، عند توسيعها بكمية كافية من البيانات والحوسبة، تنتج المخرجات الواقعية التي تراها اليوم.

الخطوة الأولى هي التدمير المتعمّد

يبدأ التدريب بتدمير الصور عمدًا. يأخذ الباحثون ملايين الصور الفوتوغرافية الحقيقية ويضيفون إليها ضوضاء غاوسية عشوائية بطريقة مضبوطة وعلى مستويات مختلفة. عند مستوى الضوضاء 1، تبدو الصورة طبيعية تقريبًا، لكنها أكثر حبيبية قليلًا. وعند مستوى 500، تكون متضررة بشدة. وعند مستوى 1,000، تصبح تشويشًا خالصًا.

لكل نسخة مشوّشة، يُقال للشبكة: هذه الصورة المشوّشة، وهذا مستوى الضوضاء، والآن تنبأ بشكل الضوضاء. عبر ملايين أمثلة التدريب، تصبح الشبكة بارعة جدًا في التعرف على أنماط الضوضاء عند كل درجة من درجات الشدة.

الخطوة الثانية هي حيث يحدث السحر

بعد التدريب، تشغّل النموذج بالاتجاه المعاكس. تبدأ بصورة ضوضاء عشوائية تمامًا، وتمررها إلى الشبكة، وتطلب منها التنبؤ بالضوضاء عند الخطوة 1,000، ثم تطرح جزءًا من تلك الضوضاء، وبعدها تطلب منها التنبؤ بالضوضاء عند الخطوة 999، وتطرح مجددًا، وهكذا تكرر العملية.

بعد 1,000 من خطوات إزالة الضوضاء الصغيرة هذه، يتحوّل التشويش إلى صورة متماسكة. لم يُطلب من الشبكة يومًا أن ترسم شيئًا محددًا، بل طُلب منها فقط أن تزيل الضوضاء. لكن لأنها تعلّمت من ملايين الصور الفوتوغرافية الحقيقية، تبدو الصورة التي تظهر كأنها صورة فوتوغرافية حقيقية.

💡 الفكرة الجوهرية: لا تولّد نماذج الانتشار الصور بالرسم من الصفر. إنها تولّدها بالطرح، عبر إزالة الضوضاء حتى تظهر البنية.

ما الذي تتعلمه الشبكة فعليًا

خمس صور مطبوعة على لوحة فلين تُظهر تراكب الضوضاء تدريجيًا من الوضوح إلى التشويش الخالص

أكثر ما يثير الدهشة في نماذج الانتشار هو ما تتعلمه الشبكة العصبية فعليًا أثناء التدريب. فهي لا تتعلم رسم العيون أو الأشجار أو الوجوه. إنها تتعلم البنية الإحصائية للصور، أي الأنماط التي تجعل ترتيبات البكسلات تبدو كأشياء حقيقية بدلًا من أن تكون ضوضاء عشوائية.

شرح حلقة التدريب

إليك شكل حلقة التدريب بعبارات بسيطة:

  1. خذ صورة حقيقية من مجموعة البيانات
  2. اختر مستوى ضوضاء عشوائيًا بين 1 و1,000
  3. أضف إلى الصورة بالضبط مقدار الضوضاء هذا
  4. اعرض الصورة المشوّشة ومستوى الضوضاء على الشبكة
  5. اطلب من الشبكة التنبؤ بالضوضاء الأصلية التي أُضيفت
  6. قارن التنبؤ بالضوضاء الفعلية
  7. عدّل أوزان الشبكة لتجعل التنبؤ التالي أفضل قليلًا
  8. كرر ذلك مليارات المرات

بعد عدد كافٍ من التكرارات، تكون الشبكة قد رأت أمثلة كثيرة جدًا، حتى استوعبت معنى "الصورة الطبيعية" على مستوى إحصائي عميق. تعرف، دون أن يُقال لها صراحةً، أن بكسلات السماء تميل إلى الظهور فوق بكسلات الأرض، وأن الوجوه تملك تماثلًا معينًا، وأن الملمس يتكرر بطرق يمكن التنبؤ بها.

لماذا تغيّر 1,000 خطوة كل شيء

حاولت الأساليب المبكرة للانتشار الانتقال مباشرة من الضوضاء إلى الصورة في خطوة واحدة. كانت النتائج ضعيفة، إذ كانت القفزة أكبر من اللازم، وكان يجب استنتاج قدر كبير من المعلومات دفعة واحدة.

يغيّر تقسيم العملية إلى 1,000 خطوة صغيرة صعوبة كل خطوة على حدة بشكل كبير. في كل خطوة، تحتاج الشبكة إلى تصحيح صغير فقط، والتصحيحات الصغيرة أسهل في التنبؤ بدقة. ويؤدي تراكم 1,000 تصحيح صغير ودقيق إلى نتيجة كبيرة ودقيقة.

لهذا ركزت الأعمال اللاحقة بقوة على تقليل عدد الخطوات المطلوبة، مثل استخدام SDXL Lightning 4Step لتحقيق نتائج جيدة في 4 خطوات فقط، أو Flux Schnell الذي ينتج صورًا حادة خلال ثوانٍ.

الأمامي مقابل العكسي بعبارات بسيطة

يد تمسح بلطف ضوضاء التلفاز عن لوح زجاجي مصنفر لتكشف عن منظر جبلي واضح تحته

للنصفين في نموذج الانتشار أسماء رسمية: العملية الأمامية والعملية العكسية. عمليًا، يسهل وصفهما.

اتجاه يدمّر واتجاه يبني

العمليةالاتجاهما الذي يحدثمتى تعمل
الأماميةمن الصورة إلى الضوضاءتضيف ضوضاء غاوسية تدريجيًا حتى تُدمَّر الصورةأثناء التدريب فقط
العكسيةمن الضوضاء إلى الصورةتزيل الضوضاء تدريجيًا حتى تُعاد بناء الصورةأثناء تشغيل النموذج (توليد الصور)

لا تملك العملية الأمامية أي معاملات قابلة للتعلم. إنها مجرد صيغة رياضية تضيف الضوضاء. أما العملية العكسية فهي المكان الذي تعيش فيه الشبكة العصبية. كل الذكاء يكمن في تعلم تشغيل ذلك الاتجاه الثاني.

دور U-Net

يُسمّى التصميم العصبي الذي تستخدمه معظم نماذج الانتشار U-Net. يأتي الاسم من شكلها: تضغط الصورة إلى تمثيل صغير (أسفل حرف U)، ثم توسّعها إلى حجمها الكامل (الجانب الأيمن من حرف U)، مع وصلات بين المستويات المتطابقة على كل جانب.

يتميز هذا التصميم بقدرة جيدة بشكل خاص على معالجة الصور لأن:

  • الضغط يلتقط البنية العامة (هل هذا مشهد داخلي أم خارجي؟)
  • التوسيع يعيد بناء التفاصيل الدقيقة (كيف يبدو ملمس العشب هنا؟)
  • الوصلات المتجاوزة تسمح للتفاصيل الدقيقة بالانتقال مباشرة من الضغط إلى التوسيع دون أن تضيع

تحوّلت نماذج أحدث مثل Flux Dev إلى بنى قائمة على المحوّلات (transformers) بدلًا من U-Net، وهي تعالج الدقات العالية جدًا بكفاءة أكبر وتتيح متابعة أدق للأوامر النصية.

الأوامر النصية وكيف توجّه الضوضاء

منظر علوي من الأعلى ليدين تكتبان أمرًا نصيًا على لوحة مفاتيح حاسوب محمول فوق مكتب أبيض نظيف

شرح كيفية توليد نموذج الانتشار للصور من الضوضاء هو الجزء الأول من القصة. أما الجزء الثاني فهو شرح كيف تتحكم الأوامر النصية في الصورة التي تظهر. هنا تختلف نماذج تحويل النص إلى صورة عن نماذج الانتشار البسيطة.

CLIP وجسر الربط بين الكلمات والصور

تستخدم نماذج الانتشار الموجّهة بالنص نموذجًا منفصلًا يُسمّى CLIP (أو مرمّزات نصية مشابهة) لترجمة الأمر النصي المكتوب إلى تمثيل عددي. دُرّب CLIP على مئات الملايين من أزواج الصورة والنص من الإنترنت، فتعلّم أي الكلمات والعبارات تميل إلى الظهور مع أي مفاهيم بصرية.

عندما تكتب أمرًا نصيًا، يحوّله CLIP إلى متجه، أي قائمة من الأرقام تمثل المعنى الدلالي لنصك في فضاء تكون فيه المفاهيم المتقاربة قريبة من بعضها. ينتج الأمر "تفاحة حمراء على طاولة خشبية" متجهًا قريبًا رياضيًا من متجهات مفاهيم مرتبطة مثل "فاكهة" و"طبيعة صامتة في مطبخ" و"ضوء طبيعي".

يُمرَّر ذلك المتجه بعد ذلك إلى نموذج الانتشار في كل خطوة من خطوات إزالة الضوضاء، ويعمل كدليل ثابت يجذب الصورة الناشئة نحو المفهوم الموصوف. ومن دون هذا التوجيه، سيولّد النموذج صورًا عشوائية واقعية كالصور الفوتوغرافية لا علاقة لها بكلماتك.

التوجيه الخالي من المصنّف

توجد تقنية تُسمى التوجيه الخالي من المصنّف (classifier-free guidance) تجعل نتائج تحويل النص إلى صورة أوضح بشكل ملحوظ وأكثر التزامًا بالأمر النصي. إليك الفكرة الأساسية:

في كل خطوة من خطوات إزالة الضوضاء، يعمل النموذج مرتين:

  1. مرة مع الأمر النصي، فيتنبأ بالضوضاء بناءً على وصفك
  2. ومرة بدون أي أمر نصي، فيتنبأ بالضوضاء من الصورة وحدها

يجمع التنبؤ النهائي بالضوضاء بين الاثنين: يبدأ بالتنبؤ دون أمر نصي، ثم يضيف نسخة مضخّمة من الفرق بين التنبؤين. هذا التضخيم (إعداد مقياس التوجيه الذي تراه في كثير من الواجهات) يدفع المخرجات بقوة أكبر نحو أمرك النصي، مقابل بعض التنوع في الصورة.

💡 نصيحة عملية: تنتج قيم مقياس التوجيه الأعلى (7-10) صورًا تطابق أمرك النصي بحرفية أكبر. أما القيم الأدنى (3-5) فتنتج نتائج أكثر إبداعًا لكنها أحيانًا غير متوقعة.

نماذج الانتشار الشائعة حاليًا

صورتان فوتوغرافيتان مطبوعتان جنبًا إلى جنب على لوح أردوازي داكن، اليسرى مشوشة وناعمة، واليمنى حادة جدًا بتفاصيل نابضة

تغيّر مشهد نماذج الانتشار بسرعة. فالنموذج الذي كان متقدمًا قبل عامين يتفوق عليه غالبًا بوضوح ما هو متاح اليوم. إليك الوضع الحالي.

Stable Diffusion وإصداراته

كان Stable Diffusion النموذج الذي أتاح توليد الصور بالانتشار للجمهور. صدر في 2022 عن Stability AI، وكان أول نموذج كبير لتحويل النص إلى صورة مفتوح الأوزان، أي أن أي شخص يستطيع تشغيله على جهازه الخاص.

كان ابتكاره الأساسي هو الانتشار الكامن (latent diffusion): فبدلًا من تشغيل عملية إزالة الضوضاء مباشرة على قيم البكسلات (وهو أمر مكلف حسابيًا عند الدقات العالية)، تعمل العملية في "فضاء كامن" مضغوط، ولا تُفكّ إلى بكسلات إلا في النهاية. وقد جعل ذلك التوليد عالي الجودة عمليًا على أجهزة المستخدمين العاديين.

ومنذ ذلك الحين توسعت العائلة بشكل كبير:

  • Stable Diffusion 3.5 Large يستخدم بنية قائمة على المحوّلات لتحسين ملحوظ في الالتزام بالأوامر النصية وتصيير التفاصيل الدقيقة
  • Stable Diffusion 3.5 Medium يقدم توازنًا جيدًا بين الجودة وسرعة التوليد للاستخدام اليومي
  • SDXL قدّم دقة أصلية أعلى ومعالجة أفضل للتركيبات المعقدة متعددة الأشخاص

Flux والجيل الجديد

شابة ذات شعر داكن تتصفح معرض صور بورتريه مولّدة بالذكاء الاصطناعي على لوحها الرقمي من أريكتها

تمثل عائلة Flux من Black Forest Labs الطليعة الحالية لنماذج الانتشار مفتوحة المصدر. بناها كثير من الباحثين أنفسهم الذين صنعوا Stable Diffusion، ويستخدم Flux نهج مطابقة التدفق (flow matching) بدلًا من الانتشار التقليدي، وهذا يجعله من الناحية التقنية قريبًا من نماذج الانتشار لا نموذج انتشار خالصًا، لكنه يعمل على المبادئ الجوهرية نفسها ويُدرَّب بالطريقة نفسها.

النموذجالأفضل فيالسرعة
Flux Schnellالنماذج الأولية السريعة، والحجم الكبيرسريع جدًا (1-4 خطوات)
Flux Devالعمل الإبداعي عالي الجودةمتوسطة
Flux Proمخرجات بمستوى تجاريمتوسطة
Flux 1.1 Proأقصى جودة للإنتاجمتوسطة
Flux 2 Proتوليد الصور وتحريرهامتوسطة

ما يميز Flux هو تعامله المتفوق مع النصوص داخل الصور، والتفاصيل التشريحية الدقيقة، والدقة في تنفيذ الأوامر. فحيث كانت النماذج السابقة تعاني من رسم يد متماسكة أو كلمة مقروءة في مشهد، يتعامل Flux مع الأمرين بموثوقية.

نماذج بارزة أخرى

يمتد نظام نماذج الانتشار إلى ما هو أبعد من هاتين العائلتين. وإليك بعض النماذج الأخرى الجديرة بالمعرفة:

  • Imagen 4 من Google يقدم واقعية فوتوغرافية غنية ودقة إضاءة استثنائية عبر مجموعة واسعة من الموضوعات
  • Kandinsky 2 من AI Forever يدعم الأوامر متعددة اللغات بقوة، مما يجعله أكثر سهولة للمستخدمين حول العالم
  • Material Diffusion يتخصص في توليد خامات قابلة للتكرار بسلاسة للعمل ثلاثي الأبعاد وتطوير الألعاب وتصميم المنتجات
  • Realistic Vision v5.1 خضع للضبط الدقيق خصيصًا لتصوير البورتريه وتصوير نمط الحياة

جرّب هذه النماذج الآن

أيدٍ تمسك صورة بورتريه مطبوعة مولّدة بالذكاء الاصطناعي، بإضاءة الساعة الذهبية الغنية وتفاصيل حادة جدًا

لا تحتاج إلى GPU ولا بيئة Python ولا أي خلفية تقنية لتشغيل هذه النماذج اليوم. يمنحك PicassoIA وصولًا مباشرًا إلى أكثر من 91 نموذج انتشار لتحويل النص إلى صورة عبر واجهة متصفح، دون أي تثبيت.

إليك ما يمكنك فعله الآن:

  • توليد البورتريهات والمناظر الطبيعية ولقطات المنتجات باستخدام Flux Dev أو Stable Diffusion 3.5 Large
  • التجربة بين السرعة والجودة عبر مقارنة Flux Schnell مع Flux 1.1 Pro Ultra
  • تحرير الصور الموجودة باستخدام أدوات التعديل الموضعي وتوسيع الصورة التي تستخدم الانتشار لملء الصور أو مدّها بشكل طبيعي
  • رفع دقة الصور واستعادتها باستخدام نماذج الدقة الفائقة التي تطبق مبادئ إزالة الضوضاء نفسها لاستعادة التفاصيل الدقيقة

امرأة ذات شعر مجعد تبتسم أمام حاسوبها المحمول الذي يعرض نتائج صور مولّدة بالذكاء الاصطناعي في مكتب منزلي مشرق

أفضل طريقة لبناء الحدس حول ما يفعله نموذج الانتشار هي استخدامه بنفسك. اكتب أمرًا نصيًا، وشاهد النتيجة، وغيّر كلمة واحدة، وشاهد كيف تتغير. الحدس الذي تبنيه من بضع دقائق من التجربة العملية يستحق أكثر من ساعات من قراءة الشروحات.

تعمل نماذج الانتشار لأنها تعلّمت من العالم. كل صورة تولدها تحمل البصمة الإحصائية لملايين الصور الفوتوغرافية الحقيقية. وعندما تكتب وصفًا فتظهر صورة، فما تراه هو نموذج قضى مليارات خطوات التدريب في تعلم الإجابة عن سؤال واحد: كيف يبدو العالم حين تُزال كل العشوائية؟

هذا السؤال، حين يُطرح على نطاق واسع، يثبت أنه ينتج شيئًا قريبًا جدًا من الواقع.

شارك هذا المقال

اختر لغتك

مقالات ذات صلة