كيف تعمل تقنية تبديل الوجوه بالذكاء الاصطناعي من الداخل

تجاوز تبديل الوجوه بالذكاء الاصطناعي منذ زمن بعيد مجرد المرشحات الترفيهية. يشرح هذا المقال كل خطوة تستخدمها التقنية، من اكتشاف نقاط الوجه المرجعية والمشفّرات العميقة إلى التوليد القائم على GAN وخوارزميات المزج السلس. سترى ما يحدث فعلًا داخل النموذج، بلغة مبسّطة.

كيف تعمل تقنية تبديل الوجوه بالذكاء الاصطناعي من الداخل
Cristian Da Conceicao
مؤسس Picasso IA

لا يتوقف معظم مستخدمي تطبيقات تبديل الوجوه كثيرًا عند ما يحدث فعلًا داخل الخوارزمية. يرفعون صورتين، ويضغطون زرًا، ويشاهدون وجه شخص آخر يظهر في المكان الذي كان فيه وجههم. تبدو النتيجة متقنة السلاسة، وأحيانًا بشكل مُربك. لكن العملية التي تنتجها تتضمن طبقات متعددة من التعلم العميق تعمل بتسلسل دقيق، وتحل كل طبقة مشكلة تقنية محددة. يكشف هذا المقال كل ذلك.

ما الذي يراه النموذج أولًا

قبل أن يحدث أي تبديل، يحتاج الذكاء الاصطناعي إلى العثور على الوجه في صورتك وتحديد ملامحه. يبدو هذا بسيطًا، لكن التحدي كبير، إذ تظهر الوجوه بزوايا ومسافات وظروف إضاءة ودرجات حجب مختلفة. يجب أن يكون النموذج متينًا بما يكفي للتعامل مع كل ذلك.

امرأتان في مساحة عمل مشتركة تمثلان مفاهيم رصد الوجوه

خوارزميات رصد الوجوه

تعتمد أنظمة تبديل الوجوه الحديثة على شبكة رصد وجوه مخصصة كمرحلة أولى. تعتمد معظمها على نسخ من MTCNN (Multi-Task Cascaded Convolutional Networks) أو RetinaFace، وكلاهما ينتج مستطيلات تحيط بكل وجه مكتشف في الإطار.

تُدرَّب هذه الكاشفات على ملايين الصور الموسومة. تتعلم التعرف على الأنماط المرتبطة بالوجوه البشرية، مثل النسب بين العينين، وموضع الأنف بالنسبة إلى الذقن، وانحناء خط الفك، بغض النظر عن لون البشرة أو العمر أو شعر الوجه. والناتج مستطيل إحاطة ضيق في فضاء البكسلات، يخبر المرحلة التالية بدقة أين تنظر.

رسم نقاط الوجه المرجعية في العمل

بعد تحديد موضع الوجه، ينفّذ النموذج مسحًا لنقاط الوجه المرجعية لتحديد ما بين 68 و478 نقطة محددة على سطح الوجه. تحدد هذه النقاط زوايا العينين، وحواف الشفتين، وطرف الأنف، وحدود الأذنين الخارجية، وعشرات النقاط الوسيطة على امتداد كل خط محيطي.

صورة مقربة لعين مع شبكة عصبية خفيفة من نقاط المرجع فوقها

تخدم شبكة نقاط المرجع هذه غرضين. أولًا، تمنح النظام فهمًا هندسيًا لشكل الوجه، فيتمكن من تشويه وجه المصدر ليطابق وضعية الهدف ونسبه. ثانيًا، تحدد حدود المنطقة اللازمة للتجزئة، وستستخدمها مرحلة المزج لاحقًا.

مفهوم: كلما زاد عدد النقاط المرجعية، كان التشويه أدق. استخدمت الأنظمة القديمة 68 نقطة، بينما تستخدم النماذج المتقدمة الحالية 478 نقطة (MediaPipe) أو شبكات كثيفة مخصصة تضم آلاف الرؤوس لنتائج أكثر سلاسة.

داخل خط المشفّر والفكّ

يقوم جوهر معظم أنظمة تبديل الوجوه الحديثة على بنية المشفّر والفكّ، وتُسمى أحيانًا المشفّر التلقائي (autoencoder). تشترك شبكتان منفصلتان في مشفّر واحد، ولكل منهما فكّ خاص بها.

كيف يلتقط المشفّر هوية الوجه

يأخذ المشفّر صورة الوجه ويضغطها إلى متجه كامن، وهو تمثيل عددي مدمج يلتقط خصائص الهوية الأساسية، مثل المسافات بين الملامح، والبنية العظمية العامة، والشكل المميز لكل عنصر.

صُمِّم المشفّر ليتجاهل الإضاءة والتعبير والزاوية. يركز فقط على ملامح الهوية الثابتة التي تجعل الوجه فريدًا. هذا الفصل مقصود. فأنت تريد من المشفّر أن يلتقط "من" هذا الشخص، لا "ما الذي يفعله الآن".

المشفّر شبكة عصبية التفافية (CNN) تقلّل دقة الصورة المدخلة تدريجيًا عبر طبقات متعددة، تستخلص في كل منها ميزات أعلى مستوى. وبحلول الطبقة الأخيرة من المشفّر، تكون المعلومات المكانية قد اختفت تقريبًا. ما يتبقى هو الهوية.

دور الفكّ في إعادة البناء

يحصل كل شخص في عملية التبديل على فكّ مخصص به. أثناء التدريب، يتعلم الفكّ A إعادة بناء الوجوه "التابعة" للشخص A، بينما يتولى الفكّ B الشخص B. بعد التدريب:

  • تُشفَّر صورة وجه الشخص A إلى متجه كامن
  • يُمرَّر ذلك المتجه إلى الفكّ B بدلًا من الفكّ A
  • يعيد الفكّ B بناء وجه يحمل مظهر الشخص B، لكنه يستخدم معلومات هوية الشخص A بوصفها القوة الموجِّهة

امرأة تدرس واجهة تبديل الوجوه على شاشة حاسوب

تكون النتيجة وجهًا مُصنّعًا يحمل ملامح هوية الشخص A، معروضًا بالأسلوب الذي تعلّمه الفكّ B. ولهذا احتاجت عمليات التبديل الأولى على طراز DeepFake غالبًا إلى تدريب خاص بكل زوج من الأشخاص، إذ كان لا بد من فكّ مخصص لكل هوية.

أنظمة حديثة مثل تلك التي تشغّل منصات منها Flux 2 Pro وFlux 1.1 Pro Ultra قد عمّمت هذه الفكرة عبر تدريب مسبق واسع النطاق، ما يتيح تبديلًا بلقطة واحدة دون إعادة تدريب لكل وجه جديد.

شبكات GAN ولماذا تهم

غالبًا ما تبدو مخرجات المشفّر التلقائي وحدها ضبابية قليلًا أو "مسطّحة". ويعود السبب إلى طريقة تدريب هذه الشبكات: إذ يميل تقليل خطأ إعادة البناء على مستوى البكسل إلى إنتاج مخرجات متوسطة وناعمة. هنا تدخل الشبكات التوليدية التنافسية (GANs) إلى خط العمل.

غرفة خوادم مع بنية تحتية حوسبية للشبكات العصبية

المولّد مقابل المميّز

تضيف شبكة GAN شبكة ثانية، هي المميّز، ومهمتها الوحيدة التمييز بين صور الوجوه الحقيقية والصور المولّدة. يُدرَّب المولّد (شبكة تصنيع الوجه) والمميّز معًا في حلقة تنافسية:

المكوّنالدورإشارة التدريب
المولّدينشئ صور وجوه اصطناعيةيُعاقَب عندما يكتشف المميّز الصور المزيفة
المميّزيصنّف الوجوه الحقيقية والمزيفةيُعاقَب عندما يخدعه المولّد
الخسارة المجمّعةتدفع إلى تحسين الجودةيتحسن المولّد حتى لا يعود المميّز قادرًا على التمييز

يدفع هذا الضغط التنافسي المولّد إلى إنتاج مخرجات أكثر واقعية باطراد. تظهر ملمس البشرة وتفاصيل المسام والانعكاسات الخفيفة على الجلد والتعابير الدقيقة تدريجيًا، لأن المولّد يتعلم أن هذه التفاصيل الدقيقة هي ما يبحث عنه المميّز.

بيانات التدريب ودقة النموذج

تتناسب جودة تبديل الوجوه القائم على GAN طرديًا مع جودة بيانات التدريب وتنوعها. النماذج المدرَّبة على:

  • ظروف إضاءة متنوعة تتعامل مع الظلال بشكل أفضل في المخرجات
  • أعراق وألوان بشرة متعددة تتعمم على مدخلات متنوعة دون تشوهات
  • صور مصدر عالية الدقة تُنتج تصنيعًا أكثر حدة عند أحجام المخرجات نفسها
  • وضعيات رأس متنوعة تتجنب العيب الشائع الذي يجعل الوجوه المبدّلة تبدو "مسطّحة" في الصور الجانبية

تستخدم أكبر النماذج الحالية مجموعات بيانات تضم عشرات الملايين من صور الوجوه. وجودة التوصيف (صناديق الإحاطة، والنقاط المرجعية، وتسميات الهوية) مهمة بقدر الكمية الخام.

مشكلة المزج

حتى أفضل تركيب لوجه مُصنَّع يفشل إذا بدا الحد الفاصل بين المنطقة المبدّلة والصورة الأصلية غير صحيح. وغالبًا هنا يُكتشف تبديل الوجوه: فرق لوني خفيف عند حافة الوجه، أو حد حاد تتغير عنده درجة البشرة فجأة.

منظر جوي علوي لامرأة يمثل رصد الوجوه من الأعلى

تصحيح الألوان ومطابقة لون البشرة

بعد تصنيع منطقة الوجه، ينفّذ النظام خطوة نقل الألوان لمطابقة إحصاءات ألوان الوجه المصنّع مع الصورة الأصلية المحيطة. وتشمل الطرق:

  • مطابقة المدرج التكراري: تُحاذي توزيع ألوان الوجه المبدّل مع الهدف
  • نقل ألوان Reinhard: يستخدم المتوسط والانحراف المعياري لقنوات الألوان في فضاء LAB اللوني
  • التكيّف اللوني العصبي: شبكات متعلمة تتنبأ بتحولات لونية تصحيحية بناءً على السياق

هذه الخطوة خفية لكنها حاسمة. فنقل الألوان المُنفَّذ جيدًا هو ما يجعل التبديل يبدو وكأنه "ينتمي" إلى الصورة الأصلية.

طرق تحسين الحواف

عند حد الوجه، يستخدم المزج الإخفاء بالقناع الشفاف (alpha masking) ومعالجة صور بواسون (Poisson image editing). يُلَيَّن قناع تجزئة الوجه المشتق من النقاط المرجعية (يُحوَّل إلى حواف ناعمة) على طول الحواف، فينشئ منطقة انتقال سلسة تمتزج فيها الصورتان تدريجيًا.

منطقة الخلل الشائعة: خط الشعر وحدود الأذن هما الأصعب في المزج النظيف. تحتوي هذه المناطق على تفاصيل بنيوية دقيقة (خصلات شعر منفردة، وحواف غضروف الأذن) لا يستطيع أي من نموذج تصنيع الوجه أو قناع المزج البسيط التعامل معها بكمال. لهذا السبب تستخدم أحدث الأنظمة شبكات تجزئة شعر منفصلة.

يُنتج تحرير بواسون (حل معادلة تفاضلية لمطابقة حقول التدرج عند الحد) انتقالات غير مرئية إدراكيًا حتى على مستوى البكسل. وقد استُعير هذا الأسلوب من تركيب الصور الكلاسيكي، ويظل من أكثر أساليب مزج الحدود فعالية المتاحة.

التبديل في الوقت الفعلي مقابل تبديل الصورة الواحدة

ليست كل عمليات تبديل الوجوه متساوية. فالمتطلبات الحسابية لتبديل صورة واحدة عالي الجودة تختلف كثيرًا عمّا يتطلبه التبديل المباشر في الفيديو.

صورة مقربة لشخصين بملامح وجه مختلفة جنبًا إلى جنب

المفاضلات في المعالجة

الوضعمتطلب زمن الاستجابةسقف الجودةحالة الاستخدام النموذجية
صورة واحدةبلا حدعالٍ جدًاتحرير الصور، إنشاء المحتوى
فيديو دفعيدقائق إلى ساعاتعالٍما بعد إنتاج الأفلام
الوقت الفعلي (30 إطارًا في الثانية)33 ميلي ثانية لكل إطارمتوسطالبث المباشر، المكالمات
الوقت الفعلي (60 إطارًا في الثانية)16 ميلي ثانية لكل إطارأقلالألعاب، تطبيقات الواقع المعزز

تضطر أنظمة الوقت الفعلي إلى تقديم تنازلات: عدد أقل من نقاط المرجع، وبنى شبكات أصغر، وتعقيد أقل في المزج. وأهم ابتكار في نماذج الوقت الفعلي الحديثة هو التقطير (distillation)، أي تدريب شبكة "طالبة" صغيرة على محاكاة مخرجات شبكة "معلّمة" أكبر. يمكن للشبكة الطالبة أن تعمل بسرعة كافية للوقت الفعلي، مع إنتاج جودة قريبة من الشبكة المعلّمة الأغلى تكلفة.

متطلبات العتاد

تُنفَّذ عمليات تبديل الصور المفردة على الأنظمة الحديثة في ثوانٍ باستخدام وحدات GPU للمستهلكين. تتعامل وحدة GPU متوسطة المستوى بذاكرة VRAM سعتها 8GB مع معظم مسارات الصورة الواحدة دون تباطؤ. أما التبديل الفوري بدقة HD فيتطلب موارد GPU مخصصة: وحدة GPU بذاكرة VRAM سعتها من 12 إلى 16GB لتشغيل سلس بمعدل 30fps.

يُخفي تشغيل النموذج السحابي (وهو الأسلوب الذي تعمل به معظم تطبيقات الويب، بما فيها منصات الذكاء الاصطناعي) هذا الأمر كليًا. تتم الحسابات الثقيلة على عتاد من فئة الخوادم، ولا تتلقى أنت سوى الصورة أو تدفق الفيديو الناتج.

كيف تتعامل النماذج عالية الجودة مع الإضاءة

تُعد الإضاءة من أصعب جوانب تبديل الوجوه المقنع. يجب أن يبدو الوجه المصنّع مضاءً من الاتجاه نفسه وبالشدة نفسها التي يُضاء بها باقي المشهد.

امرأة ترتدي سترة بجوار إضاءة نافذة طبيعية تُظهر ملمس بشرة دقيقًا

خوارزميات إعادة الإضاءة

تتضمن خطوط تبديل الوجوه عالية الجودة خطوة إعادة إضاءة تقدّر مصادر الضوء المحيطة والموجّهة في الصورة الهدف، ثم تطبّق إضاءة مماثلة على الوجه المصنّع. وتشمل الطرق:

  • تقريب التوافقيات الكروية: يمثل البيئة الضوئية العامة كمجموع دوال أساس منخفضة التردد، وهو سريع لكنه محدود في التفاصيل
  • شبكات إعادة الإضاءة العصبية: شبكات متعلمة من البداية إلى النهاية تتنبأ مباشرة بشكل الوجه تحت ظروف إضاءة مختلفة
  • تتبع أشعة الظل: أساليب تعتمد على الفيزياء تحسب كيف تُلقي هندسة الوجه الظلال وتستقبلها، بناءً على مواضع الضوء المقدّرة

من دون إعادة الإضاءة، سيبدو وجه منقول من صورة استوديو ساطعة إلى مشهد داخلي خافت خاطئًا فورًا، مهما كانت جودة المزج.

إعادة إنتاج الظلال والانعكاسات

إلى جانب الإضاءة العامة، تتطلب النتائج الواقعية انعكاسات ضوئية دقيقة (الومضات الصغيرة اللامعة على البشرة الدهنية أو المبللة) وإعادة إنتاج الظلال. تثبّت هذه التأثيرات الضوئية الثانوية الوجه بصريًا بالمشهد.

تحقق البنى الحديثة ذلك عبر التدريب التنافسي باستخدام مجموعات بيانات متنوعة الإضاءة. يتعلم المميّز معاقبة الوجوه التي لا "تتناسب" مع سياق إضاءتها، فيدفع المولّد إلى استيعاب إضاءة متسقة مع المشهد.

ماذا يحدث عند استخدام توليد الصور بالذكاء الاصطناعي

يمنحك تبديل الوجوه بالذكاء الاصطناعي فهمًا حقيقيًا لكيفية عمل مولّدات الصور الواقعية بالذكاء الاصطناعي، لأنها تشترك في جزء كبير من التقنية الأساسية نفسها. تستخدم نماذج مثل Flux Pro وStable Diffusion 3.5 Large وRealistic Vision v5.1 بنى قائمة على الانتشار، تشترك في مفاهيم جوهرية مع تصنيع الوجوه: تعلم التمثيل الكامن، والتحسين التنافسي، وتوليد الملمس عالي الدقة.

عند توليد صورة شخصية واقعية باستخدام Flux 1.1 Pro Ultra أو SDXL، تتعامل الشبكة مع الضوء والظل وملمس البشرة وهندسة الوجه وفق مبادئ مبنية على السلالة البحثية نفسها التي تقوم عليها تقنية تبديل الوجوه. والفرق أن النموذج توليدي لا تبديلي: فبدلًا من نقل ملامح شخص إلى آخر، يولّد النموذج ملامح الوجه من الصفر، استنادًا إلى وصف نصي أو صورة مرجعية.

امرأة ذات شعر أحمر مجعّد على أريكة تستخدم هاتفًا ذكيًا مع أدوات ذكاء اصطناعي

لمن يرغب في تجربة نقل الأسلوب من صورة إلى صورة أو التوليد المشروط بالوجه، تتيح أدوات مثل Flux Kontext Pro وQwen Image 2 تحرير الصور باستخدام الأوامر النصية، بما في ذلك تغيير مظهر الوجه والتعبير والسياق بأسلوب واقعي كالصور الفوتوغرافية.

فجوات الدقة الحقيقية التي لا تزال موجودة

حتى مع كل هذه التقنية، يعاني تبديل الوجوه بالذكاء الاصطناعي من أنماط فشل معروفة يعمل الباحثون بنشاط على حلها:

  • وضعيات الرأس الحادة (الصورة الجانبية الكاملة، أو النظر لأعلى أو لأسفل بحدة) ما زالت تُنتج تشوهات في التشويه لدى معظم النماذج
  • الحجب (النظارات، واليدان أمام الوجه، والأقنعة الجزئية) يكسر شبكة النقاط المرجعية، فيفشل التبديل أو يبدو مشوهًا
  • المدخلات منخفضة الدقة تضخّم كل تشوه في المراحل اللاحقة؛ إذ لا يستطيع المزج أن يعمل إلا بما تنتجه مرحلة التصنيع
  • ملمس بشرة غير مألوف (النمش الكثيف، والبهاق، والتجاعيد العميقة) قد تربك خوارزميات تصحيح الألوان

البحث مستمر. تُظهر البنى القائمة على المحوّلات (Transformers) المطبقة على تمثيل الوجه تحسنًا في كل أنماط الفشل هذه، وتستمر الفجوة بين الحالات الصعبة والحالات البسيطة في الضيق مع كل جيل جديد من النماذج.

أنشئ صورًا شخصية مع Picasso IA الآن

بعد أن عرفت بدقة ما يحدث داخل كل عملية تبديل وجوه، أصبح لديك سياق حقيقي لتقييم أدوات الصور بالذكاء الاصطناعي. سواء أردت توليد صور شخصية واقعية، أو تجربة تعديلات مشروطة بالوجه، أو تطبيق توليد الصور بمستوى احترافي، فإن مبادئ التعلم العميق نفسها هي ما يعمل خلف الكواليس.

امرأة ترتدي فستانًا أصفر على سطح مبنى عند الساعة الذهبية، مثال على صورة شخصية واقعية

على Picasso IA، تتوفر لك أكثر من 90 نموذجًا لتوليد الصور، بما في ذلك Flux 2 Pro للمخرجات المشروطة بالنص والصورة، وImagen 4 Ultra للصور الشخصية عالية التفاصيل، وGPT Image 1.5 للتوليد الإبداعي مع معالجة دقيقة للنصوص. توضح تقنية تبديل الوجوه بالذكاء الاصطناعي الموصوفة في هذا المقال كيفية تعامل كل هذه النماذج مع هندسة الوجه والإضاءة والملمس على مستوى البكسل.

اختر نموذجًا. اكتب أمرًا نصيًا مفصّلًا. وشاهد ما تنتجه بنية المشفّر والفكّ عندما تضع هذه المفاهيم موضع التنفيذ.

شارك هذا المقال

اختر لغتك

مقالات ذات صلة