يُعدّ الوجه البشري بلا شك أكثر الأشياء البصرية تعقيدًا التي يضطر الدماغ إلى معالجتها. في أجزاء من الثانية، تستطيع أن تعرف إن كان شخص ما متعبًا أو يكذب أو على وشك البكاء. تستطيع أن تتعرف على صديق عبر شارع مزدحم في ضوء خافت. لقد تدرّبت على مليارات الوجوه منذ يوم ولادتك.
يحتاج الذكاء الاصطناعي إلى تعلّم الشيء نفسه في غضون أيام، انطلاقًا من الصفر، ولا يملك سوى الأرقام.
ما يبدو كاختصار مستحيل أنتج نتائج تطمس فعلًا الخط الفاصل بين الاصطناعي والحقيقي. نماذج مثل Flux Pro وStable Diffusion 3.5 Large باتت تنتج بورتريهات مقنعة إلى درجة أن المصورين المحترفين يجدون صعوبة في اكتشاف الفرق. لكن كيف تتعلم دالة رياضية رسم أنف؟ وكيف تكتشف الشبكة العصبية أن العينين تأتيان في زوج، أو أن الضوء يتصرف بثبات عبر الوجه البشري؟
تشرح هذه المقالة بالتفصيل كيف يحدث ذلك، من أول بكسل خام وصولًا إلى البورتريه النهائي.

ماذا يرى الذكاء الاصطناعي فعلًا
ليست وجوهًا، بل أرقام
أول ما ينبغي فهمه هو أن نموذج الذكاء الاصطناعي لا يملك أي مفهوم عن"الوجه". عندما يعالج صورة، فإنه يرى شبكة من البكسلات. كل بكسل يتكوّن من ثلاثة أرقام تمثل شدة اللون الأحمر والأخضر والأزرق على مقياس من 0 إلى 255. الصورة بحجم 512x512 تساوي 786,432 رقمًا مرتبة في مصفوفة.
لا يوجد أنف في تلك البيانات. ولا توجد عاطفة. ولا توجد هوية. هناك فقط قائمة طويلة جدًا من الأرقام.
يتمثل التحدي الأساسي في توليد الوجوه بالذكاء الاصطناعي في جعل الشبكة العصبية تتعلم الأنماط الإحصائية داخل تلك الأرقام، والتي تتوافق مع السمات التي يتعرف عليها الإنسان بوصفها وجهًا. الأنف يظهر دائمًا بين العينين والفم. ولون البشرة عبر الوجه الواحد يتفاوت ضمن نطاق محدود. والضوء يسقط دائمًا بثبات من اتجاه واحد في بورتريه مُضاء بشكل واقعي.
هذه انتظامات إحصائية. ومهمة الشبكة العصبية أن تتعلمها بالتكرار، تمامًا كما يتعلم الطفل أن أربع أرجل وفروة تعني عادةً "كلب" بعد أن يرى مئات الكلاب.
الرياضيات خلف الوجه البشري
العمود الفقري الرياضي لهذا التعلّم عملية تُسمى الانتشار العكسي (backpropagation). عندما يُجري النموذج تنبؤًا (أي يُخرج مجموعة من قيم البكسلات)، تُقارن النتيجة بما يبدو عليه الوجه "الحقيقي"، ويُحسب الخطأ. تنتقل إشارة الخطأ عكسيًا عبر الشبكة، فتدفع ملايين المعاملات الداخلية دفعات طفيفة جدًا في الاتجاه الذي كان سينتج نتيجة أفضل.
كرّر هذا مليارات المرات عبر ملايين صور الوجوه، وستبدأ الشبكة في استيعاب هندسة الوجه البشري. ليس لأن أحدًا أخبرها ما هو الوجه، بل لأن الأنماط في البيانات جعلت "الوجه" أكثر تشكيلات الأرقام احتمالًا.

كيف تشكّل بيانات التدريب المخرجات
ملايين الوجوه كفصل دراسي
تتحدد جودة أي نموذج لتوليد الوجوه بالذكاء الاصطناعي تقريبًا بالكامل بجودة بيانات تدريبه وكميتها. تُدرَّب النماذج واسعة النطاق على مجموعات بيانات تحتوي على عشرات الملايين من الصور الفوتوغرافية: صور المخزون، وصور Creative Commons، وبيانات الويب المنتقاة. بعض مجموعات البيانات المستخدمة في البحث الأكاديمي عن الوجوه تحتوي على مئات الملايين من الصور.
لا يرى النموذج أيًا من هذه الصور مرة أخرى بعد التدريب. ما يحتفظ به ليس ذاكرة لوجوه محددة، بل نموذجًا إحصائيًا مضغوطًا لشكل الوجوه. يعيش هذا التمثيل المضغوط فيما يسميه الباحثون الفضاء الكامن: نظام إحداثيات مجرد متعدد الأبعاد تتجمع فيه الوجوه المتشابهة معًا، والانتقال بين الإحداثيات ينتج تحولات وجهية متوقعة.
كيف يعمل الفضاء الكامن عمليًا: إذا أخذت نقطة في الفضاء الكامن تمثل امرأة شابة ذات شعر بني ثم حرّكتها في اتجاه محدد، فقد تنزلق تدريجيًا نحو وجه أكبر سنًا. وإذا تحركت في اتجاه آخر، يتغير لون الشعر. وإذا تحركت في اتجاه ثالث، يتحول الضوء على الوجه من الدافئ إلى البارد. هندسة هذا الفضاء تُرمّز كل سمة وجهية تعلّمها النموذج من بيانات تدريبه.
ماذا يحدث عندما تكون البيانات متحيزة
إذا مالت بيانات التدريب بشدة نحو فئة ديموغرافية واحدة، يتعلم النموذج أن يرسم تلك الفئة بدقة أكبر من غيرها. النماذج الأولى القائمة على GAN، والتي دُرّبت بشكل أساسي على أشخاص ذوي بشرة فاتحة، أنتجت نتائج أضعف بوضوح عند توليد ألوان بشرة داكنة. فملمس البشرة، وطريقة تشتت الميلانين للضوء، وتدرجات اللون الدقيقة حول العينين والشفتين، كانت كلها أقل تمثيلًا في التوزيع المتعلَّم.
الحل يكمن في بيانات تدريب أكثر تنوعًا وفي انتقاء أكثر قصدية للبيانات. وقد حققت النماذج الحديثة مثل Flux 1.1 Pro Ultra وImagen 4 Ultra تقدمًا ملحوظًا في هذا الجانب، إذ تنتج نتائج واقعية عبر نطاق أوسع بكثير من التنوع البشري مقارنةً بالأجيال السابقة.

GANs: شبكتان تتصارعان
لمعظم سنوات 2010 وحتى مطلع 2020، كانت البنية السائدة لتوليد الوجوه بالذكاء الاصطناعي هي الشبكة التوليدية التنافسية (Generative Adversarial Network)، أو GAN. المفهوم، الذي قدّمه Ian Goodfellow عام 2014، تنافسي بأسلوب أنيق.
مهمة المولّد
المولّد شبكة عصبية تبدأ من ضجيج عشوائي وتحاول إنتاج صورة تبدو كأنها جاءت من مجموعة التدريب. في سياق توليد الوجوه، يحاول إنشاء وجه بشري مقنع من لا شيء سوى متجه عشوائي من الأرقام.
في المراحل الأولى من التدريب يفشل بشكل صارخ. تبدو المخرجات كضجيج ذائب وضبابي مرتب بشكل غامض في هيئة بيضاوية. لا شيء يشبه الوجه. لكن لديه معلمًا.
دور المميِّز
المميِّز شبكة عصبية ثانية تُدرَّب على التمييز بين الصور الفوتوغرافية الحقيقية والصور المزيفة التي يولّدها المولّد. يتلقى مزيجًا من صور التدريب الحقيقية والمخرجات الاصطناعية، ويتعلم تصنيفها.
هذه هي الديناميكية الأساسية: هدف المولّد الوحيد هو خداع المميِّز، وهدف المميِّز ألا يُخدع. وبينما تتحسن الشبكتان في الوقت نفسه، تدفع كل منهما الأخرى نحو أداء أعلى. يُنتج المولّد وجوهًا واقعية بشكل متزايد لأن الطريقة الوحيدة لخداع مميِّز متطور بشكل متزايد هي إنتاج تزييفات متطورة بشكل متزايد.
حلقة التدريب التنافسية هذه، التي تتكرر عبر ملايين التكرارات، هي الطريقة التي تعلّمت بها أنظمة مثل StyleGAN إنتاج بورتريهات أذهلت العالم عند إطلاقها.
| مكوّن GAN | الدور | نمط الفشل |
|---|
| المولّد | يُنشئ صورًا مزيفة من الضجيج | انهيار الأنماط: ينتج عددًا قليلًا فقط من أنواع الوجوه |
| المميِّز | يُصنّف الحقيقي مقابل المزيف | فرط التخصيص: يحفظ صور التدريب عن ظهر قلب |
| حلقة التدريب | تتحسن الشبكتان معًا | عدم الاستقرار: تهيمن إحدى الشبكتين |

نماذج الانتشار غيّرت كل شيء
هيمنت GAN على توليد الوجوه حتى نحو عامي 2021 و2022، حين بدأت بنية مختلفة تنتج نتائج متفوقة بشكل مذهل: نماذج الانتشار (diffusion models).
من الضجيج إلى الوجه
تعمل عملية الانتشار بالعكس مما قد تتوقعه. فبدلًا من تدريب نموذج على بناء وجه من لا شيء، يُدرَّب الانتشار نموذجًا على إزالة الضجيج.
أثناء التدريب، تُفسد صور الوجوه الحقيقية بشكل منهجي عبر إضافة ضجيج غاوسي عشوائي على مراحل متعددة. يتعلم النموذج التنبؤ بهذا الضجيج وإزالته في كل مرحلة، فيستعيد الصورة الأصلية. وبعد آلاف التكرارات التدريبية، يصبح النموذج بارعًا بشكل استثنائي في مهمة إزالة الضجيج هذه.
وقت التشغيل، تسير العملية بالاتجاه المعاكس: تبدأ من ضجيج عشوائي خالص، وتطبّق نموذج إزالة الضجيج مرارًا، فتنبثق تدريجيًا صورة متماسكة من الفوضى. يوجّه الأمر النصي اتجاه إزالة الضجيج عبر الفضاء الكامن، فيدفع الصورة الناشئة نحو "بورتريه واقعي لامرأة ذات شعر أحمر وعينين زرقاوين" بدلًا من أي تشكيلة أخرى.
لماذا يتفوق الانتشار على GAN في الوجوه
| الجانب | GAN | نموذج الانتشار |
|---|
| تنوع الصور | محدود بسبب انهيار الأنماط | عالٍ: يأخذ عينات من التوزيع المتعلَّم كاملًا |
| استقرار التدريب | معروف بعدم استقراره | أكثر قابلية للتنبؤ والتكرار |
| الواقعية | قوية لكن الشوائب شائعة | تفاصيل دقيقة وملمس متفوقان |
| التحكم بالأمر النصي | يتطلب مشفّر نصوص منفصلًا | توجيه نصي مدمج أصلًا |
| دقة تشريح الوجه | قد ينتج هندسة مشوهة | تماثل ثنائي أكثر اتساقًا |
الفكرة الجوهرية: لا تتعلم نماذج الانتشار شكل الوجوه فحسب. بل تتعلم توزيع الاحتمالات لجميع الوجوه الممكنة، موزونًا بحسب مدى "واقعية" كل تشكيلة إحصائيًا. لهذا تنتج نماذج مثل Flux Dev مخرجات متنوعة وغير مكررة حتى من الأوامر النصية المتطابقة: كل توليد هو عينة جديدة من ذلك التوزيع المتعلَّم.

الأجزاء الصعبة التي ما زال الذكاء الاصطناعي يخطئ فيها
الأيدي والأسنان والتفاصيل الصغيرة
رغم التقدم الاستثنائي، لا يزال توليد الوجوه بالذكاء الاصطناعي يعاني من نقاط عمياء مستمرة. الأسنان داخل فم مفتوح صعبة بشكل معروف: على النموذج أن يولّد مجموعة من الأشياء المتسقة هندسيًا، ولكل منها شكل خاص، تتبع انحناء الفك في الفضاء ثلاثي الأبعاد. أنتجت النماذج الأولى باستمرار أسنانًا ممسوحة أو ذائبة أو مكررة بشكل خاطئ.
الأقراط والمجوهرات الصغيرة تمثل تحديًا مشابهًا. فهي أجسام صغيرة ومتماثلة يجب أن تتواجد في أزواج عند نقاط محددة بدقة على جانبي الوجه. وغالبًا ما ينهار الاستدلال المكاني المطلوب عند المقاييس الصغيرة، فينتج إكسسوارات غير متطابقة أو مشوهة.
الأيدي، رغم أنها ليست جزءًا من الوجه نفسه، تظل أشهر نمط فشل في الصور المولّدة بالذكاء الاصطناعي. والسبب هو ذاته: تعقيد هندسي عالٍ، وحجم صغير، والحاجة إلى تناسق تشريحي دقيق عبر عشرات الأجزاء المفصلية.
عيون لا تتطابق تمامًا
العين البشرية بنية معقدة بشكل استثنائي. فإلى جانب التشريح العام للقزحية والحدقة والصلبة، هناك انعكاسات الضوء المسماة catchlights، والشكل الدقيق لحواف الجفون، والحقيقة البالغة الأهمية بأن العينين يجب أن تنظرا في الاتجاه نفسه بأحجام قزحية متطابقة.
أنتجت النماذج الأولى كثيرًا عيونًا تنظر في اتجاهات مختلفة قليلًا، أو بألوان قزحية أو أحجام غير متطابقة. وهذا هو تأثير الوادي الغريب (uncanny valley) في أكثر صوره تحديدًا: يبدو الوجه "غريبًا" قبل أن يتمكن المشاهد من تحديد السبب بوعي.
حققت النماذج الحديثة تحسنًا كبيرًا في هذا الجانب. فالنماذج الرائدة الحالية مثل Realistic Vision v5.1 وSeedream 4 تنتج عيونًا متماسكة ومتطابقة تشريحيًا عبر معظم تكوينات الأوامر النصية، بما في ذلك اتجاهات النظر المعقدة والجفون المغلقة جزئيًا.

كيف يشكّل الأمر النصي الوجه
الأمر النصي في نموذج الانتشار ليس زخرفة. إنه تعليمة مباشرة لعملية إزالة الضجيج، توجّه المناطق التي ينبغي أن تُؤخذ منها المخرجات في الفضاء الكامن. والفرق بين نتيجة عادية تُنسى بسهولة وبورتريه مذهل غالبًا ما يعود بالكامل إلى مدى دقة وصف الأمر النصي لما كان المصور سيعدّه قبل الضغط على زر الغالق.
التحديد يغيّر كل شيء
الأوامر النصية الغامضة تنتج وجوهًا عامة. الأوامر النصية المحددة تنتج وجوهًا محددة.
قارن بين هذين الأمرين النصيين:
- غامض: "بورتريه لامرأة"
- محدد: "لقطة قريبة لامرأة في أواخر 30 من عمرها ذات بشرة زيتونية وعينين بنيتين داكنتين وتجاعيد ضحك خفيفة، مصوّرة بعدسة 85mm في ضوء العصر الذهبي، مع حبيبات فيلم Kodak Portra، وإضاءة Rembrandt من يسار الكاميرا"
الأمر النصي الثاني لا يصف الشخص فحسب. بل يصف الإضاءة، وإعداد الكاميرا، ونوع الفيلم، والمزاج العاطفي. ولأن النموذج تعلّم من ملايين الصور الفوتوغرافية الحقيقية التي تتمتع بكل هذه الخصائص، فإن كل تفصيل محدد إضافي يضيّق المنطقة المأخوذ منها عينات من الفضاء الكامن، فينتج نتيجة أكثر تماسكًا وقصدية.
دور الأوامر النصية السلبية
تقبل معظم نماذج توليد الوجوه الحديثة الأوامر النصية السلبية: نصوص تصف ما لا تريد ظهوره. ومن الإدخالات الشائعة لتوليد الوجوه:
blurry, out of focus يقلل من الملامح الوجهية الناعمة أو غير الواضحة
deformed, asymmetrical يقلل من الأخطاء التشريحية
plastic, smooth, artificial skin يحافظ على ملمس البشرة الطبيعي
watermark, text يزيل العناصر المتراكبة
extra teeth, mismatched eyes يستهدف إخفاقات تشريحية محددة
عند استخدامها بمهارة، تكون الأوامر النصية السلبية بقوة نظيرتها الإيجابية. فهي لا تُزيل الاحتمالات بقدر ما تحوّل وزن الاحتمال بعيدًا عن المناطق في الفضاء الكامن المرتبطة بتلك الصفات.

توليد وجوه واقعية الآن
يمنحك PicassoIA وصولًا مباشرًا إلى أقوى نماذج توليد الوجوه المتاحة، دون إعداد محلي ودون متطلبات أجهزة. فبنى الانتشار نفسها التي تستخدمها الاستوديوهات المحترفة متاحة في تبويب متصفح.
اختيار النموذج المناسب
تتمتع النماذج المختلفة بنقاط قوة متفاوتة في توليد الوجوه بحسب هدفك:
| النموذج | الاستخدام الأمثل | أسلوب المخرجات |
|---|
| Flux Pro | البورتريهات الواقعية، الأوامر النصية المعقدة | بشرة وإضاءة واقعية للغاية |
| Flux 1.1 Pro Ultra | تفاصيل وجه بدقة عالية تبلغ 4 ميغابكسل | ملمس دقيق بجودة الاستوديو |
| Imagen 4 Ultra | ألوان بشرة طبيعية، دقة الإضاءة | أصالة فوتوغرافية |
| Realistic Vision v5.1 | أسلوب بورتريه سينمائي، مظهر الفيلم | جمالية التصوير الفوتوغرافي بالفيلم الطبيعي |
| Seedream 4 | تفاصيل 4K، أنواع وجوه متنوعة | حادة، نابضة بالحياة، دقة عالية |
| Flux Schnell | التكرار السريع، اختبار الأوامر النصية | سرعة فورية، جودة قوية |
كتابة أوامر نصية تعمل فعلًا
اتبع هذا الهيكل للحصول على توليد وجوه قوي وثابت:
- الشخص: الفئة العمرية، والعرق، ولون الشعر، ولون العينين، وأي ملامح مميزة
- التعبير: دقيق وعاطفي، وليس عامًا ("ابتسامة صادقة خفيفة مع تجعيدة خفيفة حول العينين" وليس فقط "يبتسم")
- الإضاءة: الاتجاه والجودة ("ضوء صباح حجمي من يسار الكاميرا، إضاءة تجميل بصندوق octabox، إضاءة خلفية في الساعة الذهبية")
- تفاصيل الكاميرا: البعد البؤري والفتحة ("85mm f/1.4"، "100mm macro f/2.8")
- الفيلم أو تدرج الألوان: Kodak Portra 400، Fujifilm PRO Neg Hi، ألوان دافئة، ظلال باردة
- معدّلات الجودة: RAW 8K، واقعي كالصور الفوتوغرافية، حبيبات فيلم طبيعية، ملمس مسام البشرة
نصيحة للأمر النصي: كلما بدا أمرك النصي كأنه تكليف لمصور محترف، ازدادت النتيجة واقعية. فكّر في "كيف كنت سأوجّه هذه اللقطة على موقع التصوير؟" بدلًا من "كيف أصف صورة؟". النموذج تعلّم من التصوير الفوتوغرافي الحقيقي. تحدّث بلغته.

البيانات خلف الصورة
توليد الوجوه بالذكاء الاصطناعي ليس سحرًا. إنه مطابقة أنماط على نطاق هائل، تعمل داخل بنى رياضية صقلتها عقود من البحث. كل بورتريه يولّده النموذج هو، بالمعنى التقني، استيفاء عبر أنماط شوهدت في بيانات التدريب، موجَّه بعملية إزالة الضجيج نحو التشكيلة المحددة التي يصفها الأمر النصي.
ما يجعله يبدو كالسحر هو الحجم: العدد الهائل من الأنماط المستوعبة، والدقة التي يتنقل بها النموذج عبر الفضاء الكامن، والأمانة التي يُصيّر بها التفاصيل الصغيرة اللامتناهية التي تجعل الوجه البشري يبدو حيًا.
مسام البشرة. عدم التماثل في الابتسامة الطبيعية. الطريقة المحددة التي يلتف بها الضوء حول عظمة الخد. الظل الخافت الذي تلقيه الشفة السفلى على الذقن. الزاوية الدقيقة التي تلتقط بها القزحية انعكاس الضوء. هذه ليست ميزات برمجها أحد صراحةً في النموذج. لقد ظهرت لأن النموذج عُرض عليه عدد كافٍ من الأمثلة حتى تعلّم أن يتوقعها، ثم تعلّم أن يُنتجها.
إدراك ذلك يغيّر طريقة استخدامك لهذه الأدوات. أنت لا تكتب تعليمات في آلة صور عشوائية. أنت تزوّد نظامًا استوعب اللغة البصرية الكاملة للبورتريه البشري بإحداثيات. وكلما وصفت تلك الإحداثيات بدقة أكبر، استطاع النظام أن يصل إليها بدقة أكبر.

ضعه موضع التنفيذ
كل وجه في هذه المقالة تم توليده بالنماذج نفسها المتاحة لك الآن. الفضاءات الكامنة نفسها. عمليات إزالة الضجيج نفسها. البنى نفسها المدرّبة على البيانات نفسها.
الفرق بين مخرج عام وبورتريه يوقف الناس أثناء التمرير يكمن تقريبًا بالكامل في طريقة وصفك لما تريد. اتجاه الإضاءة. اختيار العدسة. نوع الفيلم. التعبير الدقيق على وجه موصوف بدقة. أنت الآن تعرف كيف تعمل العملية على المستوى الميكانيكي، وهذا يعني أنك تعرف بالضبط أي أدوات يجب تحريكها.
افتح Flux Pro أو Imagen 4 Ultra أو Seedream 4 على PicassoIA، ووظّف هذه المعرفة. اكتب الأمر النصي كتكليف لمصور. أضف أوامرك النصية السلبية. اضبط النموذج ليتناسب مع هدف أسلوبك.
الوجه الذي تتخيله موجود بالفعل في مكان ما داخل الفضاء الكامن. عليك فقط أن تصل إليه.