كيف تعمل مولّدات الصور بالذكاء الاصطناعي فعلًا (ولماذا تفاجئ نتائجها الجميع)

هل تساءلت يومًا ماذا يحدث حين تكتب وصفًا نصيًا فتظهر بعد ثوانٍ صورة مذهلة؟ يشرح هذا المقال التقنية الحقيقية وراء مولّدات الصور بالذكاء الاصطناعي، من نماذج الانتشار إلى بيانات التدريب، ومن تضمينات CLIP إلى خطوات أخذ العينات، بشروح واضحة دون جدران من المصطلحات.

كيف تعمل مولّدات الصور بالذكاء الاصطناعي فعلًا (ولماذا تفاجئ نتائجها الجميع)
Cristian Da Conceicao
مؤسس Picasso IA

يحدث أمر غير مألوف حين تكتب "ثعلب أحمر جالس بين أوراق الخريف" في مولّد صور بالذكاء الاصطناعي، فتظهر بعد 10 ثوانٍ صورة بجودة الصور الفوتوغرافية، تبدو وكأنها التُقطت بكاميرا Canon R5. لم تكن هناك كاميرا فعلية، ولم يُركّب أي مصوّر اللقطة. آلة بنت تلك الصورة من أرقام.

هذه العملية ليست سحرًا. إنها سلسلة أنيقة بشكل مدهش من الرياضيات والاحتمالات والتعرّف على الأنماط، واستغرق جعلها عملية عقودًا من البحث. إليك الشرح الدقيق لكيفية عملها، طبقةً طبقة.

ماذا يحدث في اللحظة التي تكتب فيها أمرًا نصيًا

تتحوّل كلماتك إلى أرقام

قبل توليد أي صورة، يحتاج النموذج إلى فعل شيء تدرّب عليه بإتقان شديد: تفسير معنى كلماتك، لا بوصفها لغة، بل بوصفها موقعًا في فضاء رياضي.

حين تكتب "ثعلب أحمر في أوراق الخريف"، يُمرَّر نصك إلى مكوّن يسمى مشفّر النص (text encoder). وأشيعها هو CLIP (Contrastive Language-Image Pretraining)، الذي طوّرته OpenAI. دُرّب CLIP على مئات الملايين من أزواج الصور والنصوص من الإنترنت، فتعلّم ربط معاني الجمل بالمحتوى البصري للصور.

الناتج هو تضمين النص (text embedding): قائمة من مئات أو آلاف الأرقام تُرمّز المعنى الدلالي لأمرك النصي. فكّر فيه كإحداثيات GPS، لكن بدلًا من خطوط الطول والعرض، أنت تحدّد موقع مفهوم داخل فضاء ذي 768 بُعدًا أو 1024 بُعدًا.

💡 لهذا تهمّ صياغة الأمر النصي. "ثعلب" و"ثعلب ماكر ذو عينين كهرمانيتين" تقعان في مواضع مختلفة داخل ذلك الفضاء، وهذا الفرق يغيّر ما يبنيه المولّد.

البنية التحتية لخوادم توليد الصور بالذكاء الاصطناعي

تتنقّل هذه الأرقام داخل الفضاء الكامن

لا يعمل النموذج مع الصور كما تراها أنت. إنه يعمل داخل ما يُسمّى الفضاء الكامن (latent space): تمثيل رياضي مضغوط للصور تتجمع فيه المرئيات المتشابهة معًا.

في الفضاء الكامن، "غابة عند الفجر" و"غابة عند الغسق" جاران قريبان. أما "شاطئ" و"جبل" فبعيدان عن بعضهما. يصبح تضمين النص الذي ولّدته هدفًا: موقعًا في هذا الفضاء يحاول النموذج الوصول إليه.

هذا الضغط هو ما يجعل مولّدات الصور الحديثة سريعة. فالعمل في فضاء البكسلات الكامل يتطلب معالجة ملايين القيم دفعة واحدة. أما العمل في الفضاء الكامن فيعني معالجة آلاف القيم المضغوطة، ثم فكّ ضغط النتيجة وإعادتها إلى الدقة الكاملة في النهاية. يتولى خطوة فكّ الضغط هذه مكوّن يُسمّى VAE (Variational Autoencoder).

نماذج الانتشار: المحرك الحقيقي

البدء من ضوضاء خالصة

وهنا الجزء المخالف للبديهة. لا تبدأ عملية التوليد بأمرك النصي وتبني الصورة من الصفر. بل تبدأ بضوضاء عشوائية، أي المعادل البصري للتشويش على شاشة تلفاز قديم، ثم تعمل عكسيًا من هذه النقطة.

أثناء التدريب، رأى النموذج ملايين الصور الحقيقية. ولكل صورة، شاهد الباحثين يضيفون الضوضاء إليها تدريجيًا، خطوة بخطوة، حتى تصبح الصورة تشويشًا غير قابل للتعرّف عليه. ثم تعلّم النموذج أن يفعل العكس: بالنظر إلى صورة مشوشة والوصف النصي الأصلي، هل يستطيع أن يتنبأ بشكل النسخة الأقل تشويشًا؟

بعد التدريب على مليارات من هذه الأمثلة، يصبح النموذج بارعًا بشكل استثنائي في هذا العكس. فهو لا يحفظ صورًا بعينها. بل يستوعب الأنماط الإحصائية لكيفية ارتباط الأشياء والملمس والضوء والأسطح ببعضها.

تفاصيل قريبة لعين بصورة واقعية

إزالة الضوضاء خطوة بخطوة

عند الضغط على "توليد"، يحدث التسلسل التالي:

  1. يبدأ النموذج بموتر ضوضاء عشوائي تمامًا (شبكة من أرقام عشوائية)
  2. يمرّر الضوضاء عبر شبكة إزالة الضوضاء، التي تتنبأ بشكل نسخة أقل تشويشًا قليلًا
  3. يطبّق هذا التنبؤ ليحصل على النسخة الأنظف قليلًا
  4. يكرّر هذه العملية من 20 إلى 50 مرة (وهذه هي خطوات أخذ العينات (sampling steps) لديك)
  5. وأخيرًا يفكّ ضغط النتيجة من الفضاء الكامن ويعيدها إلى فضاء البكسلات

في كل مرور، تصبح الصورة أوضح وأكثر تماسكًا. يظهر الهيكل أولًا (الأشكال التقريبية والتكوين)، ثم تصل التفاصيل (الملمس والوجوه والحواف الدقيقة) في الخطوات اللاحقة.

💡 عمومًا، كلما زادت الخطوات ارتفعت الجودة، لكن بعوائد متناقصة. الانتقال من 20 إلى 40 خطوة يُحدث فرقًا واضحًا في الغالب. أما الانتقال من 40 إلى 80 فنادرًا ما يُحدث فرقًا، لكنه يستغرق ضعف الوقت.

لماذا تتفوّق على الأساليب القديمة

قبل أن تصبح نماذج الانتشار هي السائدة حوالي عام 2022، كان الأسلوب الرائد هو GANs (Generative Adversarial Networks). تضع GANs شبكتين في مواجهة بعضهما: مولّد يحاول إنشاء صور مقنعة، ومميّز يحاول اكتشاف الصور المزيفة. تحسّن حلقة التغذية الراجعة بينهما جودة الناتج تدريجيًا.

شبكات GANs سريعة ومبهرة، لكنها غير مستقرة أثناء التدريب بشكل معروف، وعرضة لـ"انهيار الأنماط" (mode collapse) حيث يعلق المولّد في إنتاج مخرجات متشابهة جدًا، وصعبة التوسّع إلى دقة عالية وموضوعات متنوعة.

نماذج الانتشار أبطأ لكل صورة، لكنها أكثر استقرارًا في التدريب، وتنتج مخرجات أكثر تنوعًا بكثير، وتستجيب بشكل أفضل بكثير لشرط النص. وهذه المفاضلة تستحق ذلك: لهذا تستخدم كل مولّد صور رئيسي اليوم الانتشار آليةً أساسية له.

كيف تعلّم النموذج أن يرى

امرأة تراجع صورًا مطبوعة على لوحة فلين

مليارات أزواج الصور والنصوص

أهم عامل فيما يستطيع النموذج توليده هو بيانات تدريبه. نماذج مثل PicassoIA Image وGPT Image 2 مدرّبة على مجموعات بيانات تحتوي على مئات الملايين إلى مليارات أزواج من الصور والنصوص، مجمّعة من الويب ومكتبات الصور الاحترافية المرخّصة والمجموعات المنتقاة.

لكل صورة، تتضمن بيانات التدريب تعليقًا يصف ما فيها. "امرأة تمشي مع كلب غولدن ريتريفر في حديقة في يوم مشمس." "قريب لفنجان قهوة عليه رسم لاتيه." "منظر جوي لمانهاتن ليلًا."

لا يحفظ النموذج هذه الصور أبدًا. بل يستخلص علاقات إحصائية: أي الأنماط البصرية تميل إلى الظهور معًا، وكيف يتصرف الضوء على الأسطح المختلفة، وكيف تبدو الوجوه البشرية عادةً من زوايا مختلفة، وكيف يختلف ملمس الفرو عن ملمس القماش.

حجم مجموعة بيانات التدريبعدد الصور التقريبينماذج أمثلة
منتقاة وصغيرةمن 100 ألف إلى مليونLoRAs الأولى في Stable Diffusion
من الويب بحجم متوسطمن 100 مليون إلى 500 مليونSDXL، والإصدارات الأقدم من Flux
ملكية خاصة كبيرةأكثر من مليارGPT Image 2، Seedream 4.5

CLIP: الجسر بين الكلمات والبكسلات

يستحق CLIP شرحًا خاصًا به لأنه المكوّن الذي يربط اللغة بالأنماط البصرية. دُرّب CLIP بهدف محدد: بالنظر إلى مجموعة من الصور ومجموعة من التعليقات، يطابق كل صورة مع تعليقها الصحيح. وحين يُفعل ذلك على مئات الملايين من الأمثلة، ينتهي الأمر بنموذج يستوعب بعمق العلاقة بين المحتوى البصري واللغة المستخدمة لوصفه.

لهذا يمكنك أن تكتب "لوحة انطباعية لميناء عند الغروب" ويتعامل النموذج ليس فقط مع "ميناء" و"غروب" بل مع السياق الأسلوبي والعاطفي لكلمة "انطباعية". لقد رأى آلاف لوحات مونيه مع تعليقات تذكر المدرسة الانطباعية.

💡 CLIP هو أيضًا سبب نجاح الأوامر النصية السلبية. إخبار النموذج بـ"لا خلفيات ضبابية" يزيح تضمين الهدف بعيدًا عن المناطق في الفضاء الكامن المرتبطة بالضبابية.

ما الذي تخزّنه الشبكة العصبية فعلًا

لا يخزّن النموذج كتالوجًا للصور. بل يخزّن الأوزان (weights): مليارات من الأرقام العشرية التي تُرمّز الأنماط الإحصائية المستخلصة من التدريب. تعيش هذه الأوزان في بنية U-Net، وهي شبكة عصبية على شكل حرف U، فيها مسار مشفّر يضغط المعلومات ومسار مفكك يوسّعها مجددًا، مع وصلات تخطٍّ (skip connections) تربط الجانبين.

يروي عدد المعاملات (الأوزان) في النماذج الحديثة قصة:

  • Stable Diffusion 1.x: نحو 860 مليون معامل
  • SDXL: نحو 6.6 مليار معامل
  • Flux dev: نحو 12 مليار معامل

عمومًا، كلما زادت المعاملات زادت قدرة النموذج على تمثيل العلاقات البصرية المعقدة، وتحسّن تماسكه، وقوي التزامه بالتعليمات.

البنية الداخلية للصندوق الأسود

U-Net وآلية الانتباه

تتولى U-Net في قلب نموذج الانتشار إزالة الضوضاء فعليًا. تأخذ الفضاء الكامن المشوّش، وتفحصه، وتتنبأ بالضوضاء المضافة إليه، ليتمكن النظام من طرحها.

داخل U-Net توجد طبقات الانتباه (attention layers): عمليات رياضية تسمح لكل جزء من الصورة بأن ينظر إلى كل جزء آخر، وإلى تضمين النص في الوقت نفسه. بهذا يضمن النموذج التماسك، فيتأكد من أن ذيل الثعلب متصل بجسده، وأن مصدر الضوء ثابت عبر الصورة كلها، وأن أوراق الخريف تحيط بالثعلب فعليًا بدلًا من أن تطفو في مواضع عشوائية.

تستبدل البنى الأحدث مثل Diffusion Transformer (DiT)، المستخدمة في نماذج مثل Flux 2 Klein 9B وSeedream 4.5، شبكة U-Net التقليدية بكتل Transformer في كل أرجائها، ما يحسّن بشكل كبير التماسك على المدى البعيد والالتزام بالأمر النصي.

عملية تحميض الأفلام في غرفة مظلمة

كيف يجعل الشرط الصور تطابق الأوامر النصية

لا تعمل شبكة إزالة الضوضاء بمعزل عن غيرها. في كل خطوة، تُشرَط بأمرين:

  • تضمين النص من أمرك النصي (ناتج CLIP أو T5)
  • مستوى الضوضاء الحالي (أي خطوة من العملية أنت فيها)

يُطبَّق هذا الشرط عبر الانتباه المتقاطع (cross-attention)، حيث تنظر طبقات الانتباه في شبكة تنبؤ الضوضاء إلى تضمين النص جنبًا إلى جنب مع سمات الصورة في كل طبقة. والنتيجة أن كل خطوة من خطوات إزالة الضوضاء تُوجَّه بما طلبته.

وهكذا تعمل الأوامر النصية السلبية أيضًا. تُجري أغلب التطبيقات مرورين متوازيين عبر الشبكة: أحدهما مشروط بأمرك النصي الإيجابي، والآخر بالأمر السلبي. يتحرك التنبؤ النهائي نحو الإيجابي وبعيدًا عن السلبي.

مقياس CFG: مفتاح الإبداع

مقياس CFG (Classifier-Free Guidance) هو المنزلق الذي رأيته على الأرجح في واجهات التوليد. يتحكم في مدى التزام النموذج بأمرك النصي مقابل توليده بحرية.

  • CFG منخفض (من 1 إلى 3): يولّد النموذج بحرية، فيأتي غالبًا بنتائج حيوية ومفاجئة لكنه يتجاهل أجزاء من أمرك النصي
  • CFG متوسط (من 5 إلى 9): النقطة المثالية لمعظم عمليات التوليد، مع الالتزام بالأمر النصي وتنوّع طبيعي
  • CFG مرتفع (12 فأكثر): التزام حرفي شديد بالأمر النصي، وغالبًا ما ينتج عنه نتائج مشبعة بالألوان ومليئة بالتشوهات

الحساب: عند كل خطوة، يحسب النموذج التنبؤ النهائي بوصفه التنبؤ غير المشروط مضافًا إليه مقياس CFG مضروبًا في الفرق بين التنبؤين المشروط وغير المشروط. قيمة CFG تساوي 1 تعني عدم تضخيم التوجيه. وقيمة CFG تساوي 7 تعني أن تأثير الأمر النصي يُضخَّم سبع مرات مقارنةً بالخط الأساسي.

لماذا تتفاوت جودة الصور بهذا الشكل

خطوات أخذ العينات والسرعة مقابل الجودة

مصوّر يوجّه عارضة في استوديو

يعمل مُزيل الضوضاء في حلقة، ويُسمى كل مرور خطوة أخذ عينات (sampling step). تحدد أدوات أخذ العينات (samplers)، وتُسمى أيضًا جدوِلات (schedulers)، كيفية إزالة الضوضاء في كل خطوة. ومن أشهرها:

أداة أخذ العيناتالسرعةالأفضل لـ
Eulerسريعةالمسودات السريعة، والنتائج المتسقة
DPM++ 2Mسريعةمخرجات عالية الجودة، وخطوات أقل
DDIMمتوسطةالنتائج القابلة للتكرار، وسير عمل الرسوم المتحركة
Heunأبطأدقة أعلى لكل خطوة

يمكن للأدوات الحديثة مثل DPM++ أن تنتج نتائج ممتازة في 20 خطوة. بعض النماذج مثل Wan 2.7 Image Pro مدرّبة على العمل في 4 إلى 8 خطوات، ما يحقق تسريعًا كبيرًا دون التضحية بالواقعية الفوتوغرافية.

أرقام البذرة وإمكانية التكرار

يبدأ كل توليد من موتر ضوضاء عشوائي محدد. البذرة (seed) هي الرقم المستخدم لتوليد ذلك الموتر. يُنتج توليدان بأمر نصي متطابق وإعدادات متطابقة وبذرة متطابقة صورتين متطابقتين.

بهذه الطريقة تثبّت تكوينًا أعجبك وتعمل على تطويره. فتغيير الأمر النصي مع الإبقاء على البذرة يُنتج غالبًا تنويعات تحافظ على التخطيط الأساسي نفسه والإضاءة نفسها، مع محتوى مختلف يملأ المشهد. وهي من أقوى الأدوات وأقلها استخدامًا في صندوق أدوات كاتب الأوامر النصية.

الدقة ونسبة العرض إلى الارتفاع والذاكرة

دُرّبت معظم نماذج الانتشار على دقة محددة (عادةً 512x512 أو 1024x1024). ويتطلب التوليد بدقات أو نسب عرض إلى ارتفاع مختلفة إما ضبطًا دقيقًا على بيانات متعددة الدقات، أو استخدام تقنيات التقسيم إلى بلاطات ورفع الدقة.

نماذج مثل Hunyuan Image 2.1 وSeedream 4.5 تدعم بشكل أصلي دقتي 2K و4K، لأنها دُرّبت على بيانات عالية الدقة منذ البداية. ويتطلب التوليد بدقة 4K ذاكرة GPU (VRAM) أكبر بكثير، لأن التمثيل الكامن يتغير حجمه مع دقة الخرج.

أشهر النماذج وما يميّز كلًا منها

رجل يقارن جودة الصور على ثلاث شاشات

لا تستخدم كل مولّدات الصور الأوزان نفسها أو البنية نفسها. إليك كيف تختلف المولّدات الكبرى وفي أي حالة تلجأ إلى كل منها:

Flux: العملاق مفتوح المصدر

Flux Redux Dev وFlux 2 Klein 9B مبنيان على بنية Flux من Black Forest Labs، التي استبدلت شبكة U-Net التقليدية بـ Diffusion Transformer كامل. والنتيجة تحسّنٌ كبيرٌ في تصيير النصوص داخل الصور، وتشريح أدق، والتزام أقوى بالأمر النصي مقارنةً بنماذج الانتشار السابقة. يتفوق Flux في الواقعية الفوتوغرافية والمشاهد المعقدة متعددة الأشخاص.

GPT Image 2: متّبع التعليمات

يدمج GPT Image 2 نموذج اللغة الكبير من OpenAI مباشرةً في توليد الصور، ما يمنحه قدرة استثنائية على اتباع التعليمات. يمكنك وصف سيناريوهات معقدة فيها علاقات مكانية متعددة ("ضع فنجان القهوة على يسار الحاسوب المحمول، واعرض جدول البيانات على الشاشة") وغالبًا ما يصيب في تنفيذها. وهو الرائد الحالي في دقة الأوامر النصية.

Seedream وHunyuan: المنافسان الجدد

Seedream 4.5 من ByteDance، وHunyuan Image 2.1 من Tencent، يمثّلان الجيل الجديد من محولات الانتشار عالية الدقة. ينتج كلاهما مخرجات بدقة من 2K إلى 4K بشكل أصلي، مع ملمس بشرة ممتاز وتفاصيل دقيقة وإضاءة واقعية كالصور الفوتوغرافية. ويتميز Seedream بأداء قوي بشكل خاص في تصوير البورتريه وصور الأزياء.

ControlNet: عندما تحتاج إلى تحكم دقيق

خرائط الوضعية والعمق والحواف

التوليد القياسي من النص إلى الصورة احتمالي: تصف ما تريده لكنك لا تتحكم في التكوين بدقة. يغيّر ControlNet ذلك بإضافة شرط بنيوي فوق الأمر النصي.

يأخذ ControlNet صورة مرجعية ويستخلص منها معلومات بنيوية محددة:

  • خرائط الوضعية (Pose maps): مواضع مفاصل الهيكل العظمي لجسم بشري، بحيث تحدد بدقة كيف يقف الشخص أو يجلس
  • خرائط العمق (Depth maps): المسافة المكانية لكل جزء من المشهد، مع الحفاظ على البنية ثلاثية الأبعاد للأصل
  • خرائط الحواف (Canny): الخطوط الخارجية والكنتورات للأجسام، بحيث يمكنك إعادة استخدام تكوين بمحتوى مختلف
  • خرائط التجزئة (Segmentation maps): تسميات المناطق على مستوى البكسل، توضح ما في كل جزء من الصورة

النمط مقابل البنية

أنت تُغذّي الخريطة البنيوية إلى جانب أمرك النصي، فيولّد النموذج صورة تحترم الاثنين معًا. وهكذا يحافظ المبدعون المحترفون على وضعيات شخصيات متسقة عبر سلسلة من الصور، أو يعيدون استخدام تكوين خلفية بإضاءة وموضوع مختلفين تمامًا.

يمنحك الجمع بين ControlNet ونماذج مثل PicassoIA Image Editor Pro دقةً بنيويةً ومخرجاتٍ واقعيةً كالصور الفوتوغرافية وعالية الدقة في الوقت نفسه، وهو مزيج كان يتطلب في السابق مصورًا محترفًا واستوديو محجوزًا.

ابدأ بتوليد صورك الخاصة

مكتب إبداعي مع واجهة توليد الصور بالذكاء الاصطناعي

كل هذه التقنيات متاحة دون كتابة سطر واحد من الشيفرة. على PicassoIA يمكنك تجربة كل نموذج تناوله هذا المقال، بما في ذلك GPT Image 2 للصياغة الدقيقة للأوامر النصية، وFlux Redux Dev للمخرجات الواقعية كالصور الفوتوغرافية، وSeedream 4.5 لتصوير البورتريه بدقة 4K. كل ذلك من تبويب متصفح واحد، دون أي إعداد مسبق.

أفضل طريقة لاستيعاب كيفية عمل هذه النماذج هي أن تختبرها بنفسك بحالات قصوى. جرّب الأمر النصي نفسه على Flux وGPT Image 2، وقارن كيف يتعامل كل منهما مع وصف مكاني معقد. جرّب قيم CFG بين 3 و12 على البذرة نفسها. جرّب 10 خطوات لأخذ العينات مقابل 40، وانظر عند أي نقطة تتوقف عن ملاحظة الفرق.

بورتريه لامرأة في ضوء الصباح الطبيعي

النتيجة التي تحصل عليها ليست حظًا عشوائيًا. إنها نتاج مليارات الأنماط الإحصائية المتعلَّمة، موجَّهة بكلماتك، تتلاقى عبر عشرات خطوات إزالة الضوضاء لتصبح شيئًا يبدو وكأن كاميرا التقطته. والآن وقد عرفت الآلية، يمكنك أن تبدأ باستخدامها بقصد.

شارك هذا المقال

اختر لغتك

مقالات ذات صلة