كيف يعمل الذكاء الاصطناعي لإزالة الخلفيات: العلم وراء القصاصات المثالية على مستوى البكسل

كانت إزالة الخلفية تستغرق ساعات من العمل اليدوي بأداة القلم. أما الذكاء الاصطناعي فيفعل ذلك في ثوانٍ، عبر قراءة كل بكسل في سياقه، وتشغيل التجزئة الدلالية، وحساب أقنعة ألفا للحواف الناعمة. يشرح هذا المقال العلم الحقيقي، من الشبكات العصبية الالتفافية إلى مطابقة الصور، ولماذا ما زالت بعض الأشياء تُربك النموذج.

كيف يعمل الذكاء الاصطناعي لإزالة الخلفيات: العلم وراء القصاصات المثالية على مستوى البكسل
Cristian Da Conceicao
مؤسس Picasso IA

كانت إزالة الخلفية تتطلب ساعات من العمل الدقيق بأداة القلم، مع التكبير إلى 400% لتتبع كل شعرة على حدة، والأمل في أن يكون تباين الألوان بين الشخص والخلفية كافيًا. وقد تستنزف صورة واحدة فترة بعد الظهر كاملة.

غيّر الذكاء الاصطناعي ذلك تمامًا. ارفع صورة فتعود إليك قصاصة نظيفة خلال ثوانٍ. ما يبدو كأنه سحر هو في الحقيقة سلسلة دقيقة من القرارات تحدث على مستوى البكسل. يشرح هذا المقال بالتفصيل ما يفعله النموذج، من اللحظة التي يقرأ فيها صورتك حتى اللحظة التي ينتج فيها استخراجًا نظيفًا للمقدمة.

صورة مقرّبة لشخص تُظهر حواف خصلات الشعر المعقدة أمام خلفية زهور برية ضبابية

ماذا يرى الذكاء الاصطناعي فعلًا في الصور

كل بكسل يحصل على تصنيف

الصورة الرقمية شبكة من البكسلات. يخزن كل بكسل ثلاثة أرقام: قيم قنوات الأحمر والأخضر والأزرق، وتتراوح بين 0 و255. هذا هو الإدخال الخام. تحتوي صورة بدقة 1920x1080 على نحو مليوني نقطة بيانات من هذا النوع المكوّن من ثلاثة أرقام.

يأخذ نموذج إزالة الخلفية تلك المليوني نقطة بيانات، ويسند إلى كل بكسل تصنيفًا من اثنين: المقدمة أو الخلفية. تُسمّى عملية الإسناد هذه تصنيف البكسلات، وهي الأساس الذي تقوم عليه كل أداة ممحاة خلفيات تعمل بالذكاء الاصطناعي.

لا يفحص النموذج كل بكسل بمعزل عن غيره. بل يفحصه في سياق جيرانه، والمنطقة الأوسع التي ينتمي إليها، والبنى واسعة النطاق المرئية عبر الصورة كلها. ويحتاج إلى المستويات الثلاثة من السياق كي يتخذ قرارًا موثوقًا.

البكسلات مقابل الأجسام

قد ينتمي بكسل وردي دافئ إلى جلد إنسان، أو بتلة زهرة، أو مفرش طاولة بلون السلمون، أو جدار فيلا متوسطية. اللون وحده لا يخبر النموذج بالكثير.

ما يهم هو العلاقة المكانية. بكسل وردي تحيط به بكسلات وردية أخرى بنمط يتوافق مع هندسة الوجه، وقريب من منطقة ذات ملمس شعري داكن، وفوق منطقة ذات ملمس يشبه القماش: هذا البكسل هو على الأرجح جلد. أما بكسل وردي تحيط به ملمسات تشبه أوراق الشجر الخضراء فهو على الأرجح ليس جلدًا.

لهذا السبب تحتاج أداة إزالة الخلفية بالذكاء الاصطناعي إلى قراءة الصورة كاملة قبل أن تتمكن من تصنيف أي جزء منها بشكل صحيح. يبني النموذج أولًا صورة للمشهد ككل، ثم يطبقها بكسلًا بكسل.

منظر جوي لمساحة عمل مصمم جرافيك مع مقارنة قبل وبعد لتعديل الصورة على الشاشة

الشبكة العصبية في القلب

كيف تقرأ الشبكات الالتفافية الصور

البنية التي تشغّل تقريبًا كل نماذج إزالة الخلفية هي الشبكة العصبية الالتفافية (CNN)، وتحديدًا نسخة تُسمّى شبكة المُرمِّز والمُفكِّك.

إليك طريقة عملها:

  1. مرحلة المُرمِّز: تضغط الشبكة الصورة عبر سلسلة من الطبقات الالتفافية. تكتشف الطبقات الأولى الحواف وتدرجات الألوان. وتكتشف الطبقات الوسطى الملمسات: الفراء والقماش والجلد والأوراق. وتكتشف الطبقات الأخيرة الأجسام والبنى الدلالية: الوجوه والأيدي والكراسي والمباني.
  2. عنق الزجاجة: يلتقط التمثيل المضغوط بالكامل معنى الصورة على مستوى دلالي عالٍ.
  3. مرحلة المُفكِّك: تتوسع الشبكة مجددًا، فتدمج المعلومات الدلالية عالية المستوى القادمة من عنق الزجاجة مع التفاصيل المكانية منخفضة المستوى المحفوظة من المُرمِّز. وهنا تُسند تسميات على مستوى البكسل باستخدام كل ما استوعبته الشبكة.

💡 توصيلات التخطي بين طبقات المُرمِّز والمُفكِّك حاسمة. فهي تتيح للنموذج دمج "أعرف أن هذا وجه إنسان" (من عمق الشبكة) مع "هذا البكسل المحدد يقع على حافة الوجه" (من طبقة مبكرة). كلتا المعلومتين ضروريتان لقصاصة نظيفة.

ما الذي تفعله بيانات التدريب فعلًا

لا يستوعب النموذج هذه القواعد من تعليمات صريحة. بل يكتسبها عبر معالجة ملايين الأمثلة.

أثناء التدريب، يرى النموذج صورًا مقترنة بأقنعتها المرجعية الصحيحة (ground truth): تسميات دقيقة على مستوى كل بكسل تبيّن بالضبط ما هو مقدمة وما هو خلفية. يقدّم النموذج تنبؤًا، ثم يُقارَن هذا التنبؤ بالمرجع، ويُستخدم الفرق (الخسارة) لضبط الأوزان الداخلية للنموذج. تتكرر هذه العملية مليارات المرات.

والنتيجة ليست مجموعة من القواعد المبرمجة. إنها شبكة من الارتباطات المضمّنة، وأنماط إحصائية مترسخة في أوزان النموذج إلى درجة تمكّنه من التعميم على صور لم يرها من قبل. وعندما ترفع صورتك، يطبّق النموذج تلك الأنماط.

جودة بيانات التدريب هي العامل الأكبر تأثيرًا في جودة النموذج. النموذج المدرَّب على صور متنوعة وعالية الجودة ومشروحة بأقنعة مرجعية نظيفة سيُنتج قصاصات أفضل باستمرار من نموذج مدرَّب على بيانات محدودة أو مشوّشة.

صورة استوديو لامرأة بشعر أحمر مجعّد تُظهر تحديات التجزئة المعقدة للحواف

التجزئة: تقسيم المشهد

التجزئة الدلالية مقابل تجزئة النسخ

توجد نهجان رئيسيان للتجزئة يُستخدمان في إزالة الخلفية:

النوعماذا يفعلالأنسب لـ
التجزئة الدلاليةتصنّف كل بكسل ضمن فئة (شخص، سماء، طاولة)إزالة الخلفية بشكل عام
تجزئة النسختصنّف كل جسم فردي على حدةعدة موضوعات في إطار واحد

تستخدم معظم أدوات إزالة الخلفية التجزئة الدلالية نقطة انطلاق: تُصنَّف كل ما ينتمي إلى فئة "الموضوع" (شخص، منتج، حيوان) وتُعامَل بقية الصورة على أنها خلفية.

تذهب تجزئة النسخ أبعد من ذلك، فتميّز بين النُسخ الفردية من الفئة نفسها. إذا كان هناك شخصان في الصورة، فيمكن لتجزئة النسخ تحديدهما ككائنين منفصلين. وبالنسبة لمعظم عمليات استخراج المقدمة لموضوع واحد، تكفي التجزئة الدلالية وتكون أسرع بشكل ملحوظ.

لماذا يصعب الشعر إلى هذا الحد

يُعد الشعر أكثر العناصر تطلبًا تقنيًا في إزالة الخلفية، وهو يوضح لماذا هذه المشكلة أصعب مما تبدو.

تتراوح عادةً سماكة خصلة الشعر البشري بين 60 و120 ميكرومترًا. وفي دقة الصور المعتادة، تشغل الخصلات الفردية بكسلًا أو بكسلين. وتخلق الشعيرات الطائرة منطقة انتقال شبه شفافة، تمتزج فيها الخصلة ولون الخلفية والهواء المحيط عند مستوى أقل من البكسل.

لم تعد هذه مشكلة تصنيف بكسلات. إنها مشكلة تقدير الشفافية. يحتاج النموذج إلى تحديد ليس فقط "مقدمة أم خلفية"، بل "كم من المقدمة بالضبط، على مقياس من 0 إلى 100%؟". تُسمّى هذه القيمة الكسرية قيمة ألفا، وحسابها لكل بكسل في منطقة الانتقال يُسمّى مطابقة الصور (image matting).

ينطبق التحدي نفسه على الفراء والريش والأقمشة شبه الشفافة. كل ما يمتزج مع خلفيته على المستوى الفيزيائي يحتاج إلى المطابقة، لا إلى التصنيف وحده.

كلب golden retriever بفرو معقد الحواف يلتقط ضوء الخلفية بعد الظهر أمام حديقة ضبابية

مطابقة الصور: حل الحواف الناعمة

قنوات ألفا والشفافية

عندما ينتج نموذج إزالة الخلفية قصاصة نظيفة، فهو لا يولّد قناعًا ثنائيًا بالأبيض والأسود. إنه ينتج قناع ألفا (alpha matte): صورة بتدرجات الرمادي تحمل فيها كل بكسل قيمة شفافية.

  • الأبيض الخالص (255) يعني مقدمة بالكامل
  • الأسود الخالص (0) يعني خلفية بالكامل
  • القيم الرمادية بينهما تعني شفافية جزئية

تلك القيم الوسيطة هي ما يجعل الشعر والفراء والريش والأقمشة الشفافة تبدو طبيعية بعد إزالة الخلفية، بدلًا من أن تبدو كأنها قُصّت بالمقص.

عندما تُدمج القصاصة مع خلفية جديدة، يستخدم المُصيِّر قيم ألفا لمزج بكسل المقدمة الأصلي مع بكسل الخلفية الجديد بنسبة تناسبه. البكسل ذو قيمة ألفا 128 (عتامة 50%) يأخذ 50% من لونه من المقدمة و50% من الخلفية الجديدة. هذا المزج غير مرئي عند إجرائه بشكل صحيح، ويظهر فورًا عند إجرائه بشكل خاطئ.

كيف يقدّر الذكاء الاصطناعي القناع

استخدمت خوارزميات المطابقة المبكرة صيغًا مصممة يدويًا لتقدير قيم ألفا استنادًا إلى فرق اللون بين بكسل المقدمة والخلفية المعروفة. وكانت هذه الصيغ تتطلب من المستخدم تحديد لون الخلفية، ما جعلها غير عملية للصور المعقدة من العالم الحقيقي.

تستخدم المطابقة الحديثة بالذكاء الاصطناعي شبكة عصبية ثانية، أو رأسًا متخصصًا ضمن شبكة التجزئة الرئيسية، يركز تحديدًا على منطقة الانتقال. لقد استوعب من ملايين الأمثلة شكل الحواف شبه الشفافة، وكيف يلين الشعر أمام أنواع الخلفيات المختلفة، وكيفية إنتاج قناع ألفا نظيف دون أي إدخال يدوي.

💡 لهذا السبب تكون النتائج أفضل بكثير عندما يكون التباين قويًا بين الموضوع والخلفية. تملك شبكة تقدير ألفا إشارة أوضح لتعمل بها. وعندما يتشابه لون البشرة ولون الخلفية تقريبًا، تنتج حتى أفضل النماذج أقنعة أنعم وأقل ثقة.

صانعة محتوى على مكتب منزلي مشرق بضوء النافذة الطبيعي من الخلف

المعالجة الفورية: كيف تبقى سريعة

حيل ضغط النموذج

الشبكات العصبية التي تشغّل أفضل أدوات إزالة الخلفية كبيرة. قد تحتوي النماذج البحثية على مئات الملايين من المعاملات. وتشغيلها بالحجم الكامل لكل صورة سيكون بطيئًا ومكلفًا جدًا للاستخدام العملي.

تستخدم النماذج الإنتاجية عدة استراتيجيات للضغط:

  • التكميم (Quantization): تمثيل أوزان النموذج بأعداد صحيحة من 8 بت بدلًا من أعداد عشرية من 32 بت، ما يقلل استهلاك الذاكرة بنسبة 75% مع خسارة ضئيلة في الدقة
  • التقليم (Pruning): إزالة أوزان فردية أو خلايا عصبية كاملة تسهم بالقليل في الدقة
  • تقطير المعرفة (Knowledge distillation): تدريب نموذج "تلميذ" أصغر ليحاكي مخرجات نموذج "معلّم" أكبر
  • البنى الفعّالة: تصاميم مصممة خصيصًا مثل MobileNet وEfficientNet، تحقق دقة قريبة من أحدث ما توصل إليه العلم بجزء صغير من تكلفة الحوسبة

والنتيجة نموذج يمكنه معالجة صورة بالدقة الكاملة في أقل من ثانية على عتاد عادي، أو في أجزاء من الثانية على بنية GPU مخصصة.

المعالجة على الجهاز مقابل السحابة

تعالج معظم أدوات إزالة الخلفية الموجهة للمستخدمين الصور على الخادم. تُرسل الصورة إلى خادم مزوّد بعتاد GPU مخصص، ويعمل النموذج على ذلك العتاد، ثم تُعاد النتيجة.

تشغّل بعض الأدوات، خصوصًا تطبيقات الجوال، نماذج مضغوطة مباشرة على الجهاز. وللمعالجة على الجهاز مزايا تتعلق بالخصوصية (فالصورة لا تغادر الجهاز أبدًا)، لكنها عادةً ما تقدّم دقة أقل بسبب الضغط الشديد اللازم لتشغيل النموذج على شريحة هاتف.

تستخدم الأدوات الاحترافية المعالجة السحابية حيث تكون الدقة أهم من زمن الاستجابة، ما يتيح تشغيل نماذج أكبر وأكثر قدرة تتعامل مع الحالات الصعبة بموثوقية.

عارضة أزياء ترتدي سترة بورغندية تُصوَّر أمام خلفية استوديو نظيفة لجلسة تصوير منتجات

أين ما زال الذكاء الاصطناعي للخلفيات يتعثر

الزجاج والمرايا والدخان

ينجح نهج تصنيف البكسلات ومطابقة الصور لأنه يعتمد على أنماط بصرية متسقة لـ"المقدمة" مقابل "الخلفية". وثلاثة أنواع من الموضوعات تكسر هذه الأنماط كليًا.

الأجسام الشفافة (الزجاج والكريستال والبلاستيك الصافي) تسمح للخلفية بالظهور من خلالها. يُظهر تدريب النموذج أن الأشياء الواقعة خلف الموضوع هي خلفية. والأجسام الشفافة تخرق هذا الافتراض. أغلب النماذج إما تعامل منطقة الزجاج على أنها خلفية، أو تنتج نتائج غير متسقة ومتقطعة عبر المنطقة الشفافة.

الأسطح العاكسة (المرايا والمعادن المصقولة والماء) تحتوي على صورة منعكسة للخلفية داخلها. يرى النموذج ألوان الخلفية داخل منطقة الموضوع فيتشوش فعلًا، لأن تدريبه لم يصادف أجسامًا تحتوي على خلفيتها داخلها.

الدخان والضباب والأقمشة شبه الشفافة تمثل تحديات شفافية متدرجة. فهي تنتقل من معتمة تقريبًا إلى غير مرئية تقريبًا، وتتطلب قيم ألفا تتغير تدريجيًا عبر منطقة كبيرة وغير منتظمة. تتعامل أغلب النماذج مع ذلك بنجاح معتدل، لكن نادرًا ما تنجح تمامًا، خصوصًا عندما يحمل الدخان أو القماش ضبابية حركة معقدة.

تطابقات الألوان المعقدة

عندما يشترك الموضوع والخلفية في ألوان متشابهة، كشخص يرتدي سترة خضراء في غابة أو ملابس بيضاء أمام جدار أبيض، تكون إشارة شبكة التجزئة ضعيفة. فهي لا تستطيع الاعتماد على تباين الألوان لتحديد الحواف، وتعتمد كليًا على ملامح الشكل والملمس.

النتائج عادةً ما تكون قابلة للاستخدام، لكنها كثيرًا ما تحتاج إلى تصحيح يدوي في محرر الصور. وهذا ليس إخفاقًا للذكاء الاصطناعي تحديدًا، بل يعكس غموضًا حقيقيًا في بيانات الصورة: فعندما تتطابق الألوان تقل المعلومات المتاحة للعمل بها، مهما كانت طريقة المعالجة.

شاشة حاسوب محمول ليلًا تعرض واجهة إزالة الخلفية بالذكاء الاصطناعي مع مقارنة قبل وبعد لصورة شخص

كيف يتعامل نموذج BRIA مع ذلك

ما الذي يميّز BRIA

نموذج إزالة الخلفية من BRIA متاح على PicassoIA، وقد صُمم خصيصًا للتعامل مع الحالات الحدّية التي تُربك نماذج تجزئة الصور للأغراض العامة.

يجمع نهج BRIA بين التجزئة الدلالية وشبكة مطابقة متخصصة تركز على منطقة الانتقال. والنتيجة استخراج نظيف للموضوع مع حواف مُنعَّمة بشكل صحيح، وفصل دقيق للشعر، وقيم ألفا مضبوطة تُدمج بشكل طبيعي مع أي خلفية جديدة دون أطراف مرئية أو تسرب للألوان.

النموذج محسّن من أجل:

  • البورتريهات والأشخاص: تدريب قوي على تشريح الجسم البشري يعني تجزئة موثوقة للجسم حتى في الوضعيات المعقدة أو غير المعتادة
  • المنتجات: فعّال بشكل خاص لقصاصات التجارة الإلكترونية، حيث تكون الحواف النظيفة والحادة للأجسام ضرورية لعرض الكتالوج
  • الحيوانات: يتعامل مع ملمسات الفراء والريش بشكل أفضل من كثير من النماذج العامة، بفضل تدريب شبكة المطابقة المتخصصة
  • الخلفيات المعقدة: لا يحتاج إلى خلفية نظيفة ومتباينة ليعمل بشكل صحيح، ويؤدي أداءً جيدًا حتى في البيئات المزدحمة أو المحمّلة بالملمس

خطوة بخطوة على PicassoIA

باستخدام نموذج BRIA Remove Background على PicassoIA، يستغرق الأمر نحو عشرين ثانية من الرفع حتى القصاصة النظيفة:

  1. افتح النموذج: زر صفحة Remove Background على PicassoIA
  2. ارفع صورتك: انقر على منطقة الرفع واختر أي صورة من جهازك. يقبل النموذج تنسيقات JPEG وPNG وWebP
  3. شغّل النموذج: انقر على زر التوليد. يعالج BRIA الصورة على الخادم بتسريع GPU، ويطبّق التجزئة والمطابقة معًا في تمريرة واحدة
  4. حمّل النتيجة: المخرج ملف PNG بخلفية شفافة تمامًا (مع قناة ألفا)، جاهز لوضعه على أي خلفية جديدة في أي برنامج تحرير

💡 للحصول على أفضل النتائج مع نموذج BRIA، ارفع صورًا يكون فيها الموضوع جيد الإضاءة وغير مموّه بالحركة. تعمل شبكة المطابقة بأفضل شكل عندما تكون تفاصيل الحواف الفردية حادة في الصورة الأصلية. فالإدخال الضبابي ينتج حوافًا ضبابية في القصاصة. هذا حد فيزيائي، وليس حدًا للنموذج.

منظر جوي لامرأة ترتدي فستانًا أبيض على شرفة متوسطية مع بحر أزرق عميق في الأسفل

حالات الاستخدام الشائعة لإزالة الخلفية الفورية:

  • تصوير المنتجات للتجارة الإلكترونية: إزالة خلفيات الاستوديو أو الخلفيات المرتجلة من لقطات المنتجات، ووضعها على خلفيات بيضاء نظيفة أو خلفيات أسلوب حياة لقوائم الكتالوج
  • تصوير البورتريه: استخراج الأشخاص من الخلفيات المزدحمة ودمجهم في أجواء أكثر جاذبية دون الحاجة إلى إعداد استوديو كامل
  • صناعة المحتوى: إنشاء أصول PNG نظيفة للصور المصغرة وجرافيكس وسائل التواصل الاجتماعي وشرائح العروض التي تتطلب طبقة شفافة
  • المواد التسويقية: عزل صور المنتجات لاستخدامها عبر حملات متعددة بخلفيات مختلفة دون إعادة تصوير كل نسخة

لقطة منتج لساعة فاخرة على سطح أبيض نظيف مع تفاصيل دقيقة لحافة المعدن

جرّبه الآن على صورة حقيقية

كان سدّ الفجوة بين الخلفية المزدحمة والقصاصة النظيفة مهمة تقنية تستغرق ساعات. أما الآن فهي رفع لا يستغرق سوى عشرين ثانية.

إن معرفة طريقة عمل النموذج تغيّر طريقة التصوير والتحرير. تعرف الآن لماذا يمنح الفصل القوي بين الموضوع والخلفية الذكاء الاصطناعي إشارة أوضح يعمل بها. وتعرف لماذا تُعد الأجسام الزجاجية صعبة فعلًا، ليس لأن النموذج ضعيف، بل لأن الغموض البصري حقيقي. وتعرف لماذا يُنتج الشعر المجعّد قصاصات نظيفة بهذا الشكل مع الأدوات الحديثة: فشبكة مطابقة ألفا استوعبت من ملايين الأمثلة المشروحة كيفية التعامل مع حواف الخصلات شبه الشفافة على مستوى البكسل.

إذا كانت لديك صور تعيق خلفياتها ما تريد إبرازه، فإن نموذج BRIA Remove Background على PicassoIA يستحق التجربة الآن. ارفع بورتريهًا أو لقطة منتج أو صورة حيوان أليف، وشاهد ما يفعله النموذج بالحواف. النتائج على الشعر والفراء قوية بشكل خاص. وهو الجزء من الذكاء الاصطناعي لإزالة الخلفيات الذي تحسّن أكثر من غيره في السنوات الأخيرة، والأكثر إمتاعًا أن تراه يعمل بنظافة على صورة حقيقية.

شارك هذا المقال

اختر لغتك

مقالات ذات صلة