هل يفهم الذكاء الاصطناعي المشاعر البشرية بعد؟ ما الذي يُظهره العلم فعلًا

يستطيع الذكاء الاصطناعي اليوم مسح وجهك وقراءة نبرة صوتك وتحليل كلماتك ليخمّن ما تشعر به. لكن بين رصد تعبير الوجه والإحساس به فجوة يحتاج كل باحث وفريق منتجات وكل شخص فضولي إلى معرفتها. يشرح هذا المقال أين يقف الذكاء الاصطناعي العاطفي اليوم، وأين يتعثر بشدة، وما يعنيه ذلك لمن يبنون هذه الأنظمة ويستخدمونها.

هل يفهم الذكاء الاصطناعي المشاعر البشرية بعد؟ ما الذي يُظهره العلم فعلًا
Cristian Da Conceicao
مؤسس Picasso IA

في مركز اتصال ما، يقيّم ذكاء اصطناعي نبرات أصوات العملاء وفق مستوى الإحباط لحظة بلحظة. وفي مستشفى ما، يحلل برنامج أنماط كلام المريض بحثًا عن علامات الاكتئاب. وفي وادي السيليكون، يتجادل فريق حول ما إذا كان أيٌّ من هذا يعني معرفة ما يشعر به شخص ما فعلًا. لم يعد سؤال قدرة الذكاء الاصطناعي على تفسير المشاعر البشرية سؤالًا أكاديميًا بحتًا. إنه يقع عند تقاطع علم الأعصاب وتعلم الآلة وجدل علمي حادّ بشكل مفاجئ، وله عواقب جدية على المنتجات التي تُبنى والأشخاص الذين تؤثر فيهم.

باحث في الذكاء الاصطناعي يحلل رسومًا بيانية لرصد المشاعر ومخططات وحدات الحركة في الوجه داخل مختبر علم الإدراك في الجامعة

ماذا يعني "رصد" شعور فعلًا

هناك تمييز بالغ الأهمية تتجاوزه معظم التغطيات الإعلامية لهذا الموضوع: رصد الشعور ومعالجة معناه الكامل أمران مختلفان تمامًا. يستطيع نظام الذكاء الاصطناعي أن يكون بارعًا جدًا في الأول، وعاجزًا تمامًا عن الثاني.

عندما يتحدث الباحثون عن الذكاء الاصطناعي العاطفي، فإنهم يقصدون أنظمة تأخذ إشارات يمكن ملاحظتها، مثل زاوية حاجبيك، أو درجة صوتك، أو اختيار الكلمات في رسالة نصية، ثم تُخرج درجة احتمالية لفئة عاطفية. سعيد. غاضب. مشمئز. خائف. هذا تمييز للأنماط. إنه قوي، ويعمل ضمن قيود محددة. لكنه ليس الشيء نفسه الذي يحدث عندما ينظر شخص إلى وجه صديقه فيشعر بما يشعر به.

القنوات الثلاث التي يعمل بها الذكاء الاصطناعي

تعمل أنظمة التعرف على المشاعر الحديثة عبر ثلاث قنوات إشارية رئيسية:

القناةما يقيسه الذكاء الاصطناعينطاق الدقة
تعابير الوجهحركة العضلات، وحدات الحركة70-85% في الظروف المضبوطة
الصوت والنبرةدرجة الصوت، والسرعة، والتوقفات، والشدة65-80% عبر مجموعات البيانات
النص واللغةمشاعر الكلمات، والبنية النحوية، والسياق80-92% للمشاعر البسيطة

لكل قناة نقاط قوتها وأنماط فشلها الخاصة. تجمع معظم الأنظمة التجارية قناتين على الأقل لتحقيق موثوقية أفضل.

مطابقة الأنماط ليست إحساسًا

يُفعّل الشعور بالتعاطف لدى الإنسان شبكةً من مناطق الدماغ المرتبطة بالتجربة المشتركة. أما الشبكة العصبية التي تصنّف تعبير وجه فلا تفعل شيئًا من هذا القبيل. إنها تحدد العلاقات المكانية بين معالم الوجه وتقارنها بآلاف الأمثلة الموسومة من بيانات التدريب.

ليس هذا نقدًا للتقنية. إنه ببساطة ما هي عليه. تبدأ المشكلة عندما تبدأ لغة التسويق بتسمية هذا "ذكاءً عاطفيًا" أو "ذكاءً اصطناعيًا للتعاطف" كأن الآلية مكافئة للنسخة البشرية. إنها ليست كذلك. ولا حتى قريبة منها.

العلم وراء الذكاء الاصطناعي لتعابير الوجه

تصوير ماكرو قريب لعين بشرية واحدة يُظهر تفاصيل استثنائية للقزحية وملمس الجلد

الإطار السائد لرصد المشاعر من الوجه بالحاسوب هو نظام ترميز حركات الوجه (FACS)، الذي طوّره عالم النفس بول إيكمان في السبعينيات. حدد إيكمان مجموعة من وحدات الحركة الوجهية العالمية، وهي حركات عضلية منفصلة زعم أنها تعبر الحدود الثقافية. رفع الجزء الداخلي من الحاجب. سحب زاوية الشفة. تجعّد الأنف.

كان الذكاء الاصطناعي المبكر للمشاعر في جوهره محلّلًا آليًا لنظام FACS. درّب نموذجًا على رصد أنماط وحدات الحركة، وربط هذه الأنماط بفئات عاطفية، وسيكون لديك نظام يعمل.

ما تفوّته وحدات الحركة

المشكلة أن نظام FACS، وبالتالي أنظمة الذكاء الاصطناعي المبنية عليه، يلتقط ما يفعله الوجه دون أن يلتقط لماذا. قد يُنتج شخص يكبح حزنه في جنازة، وشخص يركّز بشدة على نقلة في لعبة الشطرنج، أنماطًا شبه متطابقة من التوتر الدقيق حول العينين والفم. يرى الذكاء الاصطناعي الإشارات نفسها. ولا يرتكب الإنسان في الغرفة الخطأ نفسه.

وهناك أيضًا المشكلة الأساسية المتعلقة بـقواعد العرض: سلوكيات مكتسبة ثقافيًا تحكم متى يُظهر الناس مشاعرهم وكيف يفعلون ذلك. قد يكبح محترف ياباني في اجتماع عمل التعبير العاطفي الظاهر بطرق تبدو محايدة أو غير مقروءة لذكاء اصطناعي دُرّب في الأساس على مجموعات بيانات لتعابير الوجه الغربية.

مشكلة التحيّز الثقافي

بُنيت معظم مجموعات بيانات تدريب التعرف على المشاعر واسعة النطاق بصور من خلفيات ثقافية ضيقة. وعندما يُنشر نموذج دُرّب على بيانات من أمريكا الشمالية وأوروبا في الغالب، في سياقات شرق آسيا أو أفريقيا جنوب الصحراء، تنخفض الدقة بشكل ملحوظ. وجدت دراسة لمختبر MIT Media Lab عام 2019 أن أنظمة التعرف على الوجوه التجارية الكبرى أظهرت معدلات خطأ أعلى بكثير لدى الأفراد ذوي البشرة الداكنة. وتُورِّث أنظمة التعرف على المشاعر هذه التحيزات نفسها.

ملاحظة: تعابير الوجه "العالمية" أقل عالمية مما أوحت به الأبحاث الأولى. وجدت دراسات عبر الثقافات تباينًا كبيرًا في طريقة التعبير عن المشاعر وتفسيرها عبر المجتمعات المختلفة.

المشاعر في النص: أفضل مما كان متوقعًا، وأقل مما هو مطلوب

امرأة بتعبير محبط وتأمّلي تنظر إلى شاشة حاسوب محمول في شقة دافئة

معالجة المشاعر في النص، التي تُسمى عادةً في الصناعة تحليل المشاعر، هي بلا شك الأنضج بين القنوات الثلاث. تستطيع نماذج اللغة الكبيرة الحديثة مثل GPT-5 وClaude 4 Sonnet أن تحلل الفروق الدقيقة في اللغة المكتوبة بمستوى كان سيبدو غير معقول قبل خمس سنوات.

عندما يقرأ نموذج لغوي حديث عبارة "أحببت تمامًا أن أنتظر ساعتين لوجبة باردة"، فإنه لا يكتفي بعدّ الكلمات الإيجابية. إنه يلتقط السخرية. يرصد التناقض بين "أحببت" و"وجبة باردة". ويحددها على أنها محبطة وساخرة، وعلى الأرجح مراجعة سلبية.

ما ينجح فيه معالجة اللغة الطبيعية

  • رصد النبرة عبر المستويات: رسمي، عامي، مؤسسي، عاطفي
  • ربط الموضوع بالمشاعر: إدراك أن مجموعات كلمات معينة تحمل ثقلًا عاطفيًا خاصًا بمجالها
  • تتبّع الزمن: كيف تتغير النبرة العاطفية لمحادثة عبر عدة أدوار
  • تصنيف الشدة: التمييز بين الانزعاج الخفيف والغضب الحقيقي

تضيف نماذج مثل Gemini 3 Pro طبقة أخرى بالجمع بين معالجة اللغة وقراءة الصور، ما يتيح تقييم السياق العاطفي عبر العناصر البصرية والنصية لمحتوى ما في آن واحد.

حيث ما زال تحليل النص يتعثر

السخرية دون علامات واضحة. الفكاهة الداخلية بلا مرجع مشترك. كلمة "بخير" يكتبها شخص من الواضح أنه ليس بخير. ما زالت هذه الأمور صعبة بشكل مفاجئ لتحليلها بموثوقية دون سياق واسع.

السيناريولماذا يواجه الذكاء الاصطناعي صعوبة
السخرية الجافةلا توجد علامات سخرية صريحة في النص
العامية الثقافيةقد لا تتضمن بيانات التدريب استخدامات بعينها
حالات عاطفية مختلطةالإطار الثنائي يغفل التعقيد الحقيقي
السرد الطويلالنماذج قصيرة السياق تفوّت الأقواس العاطفية عبر الزمن
المشاعر الضمنيةما لا يُقال يتطلب استدلالًا يتجاوز النص

حيث يقدّم الذكاء الاصطناعي العاطفي نتائج فعلية

شخصان يضحكان معًا في محادثة عفوية وطبيعية على طاولة خشبية في مقهى قرب النافذة

رغم قيوده، يُنشر الذكاء الاصطناعي العاطفي عبر صناعات متعددة بطرق تحقق قيمة حقيقية وقابلة للقياس، تحديدًا لأن هذه التطبيقات مصممة لتتوافق مع ما تستطيع التقنية فعلًا القيام به.

جودة العمل في مراكز الاتصال

هذا على الأرجح أوسع التطبيقات التجارية انتشارًا. يراقب الذكاء الاصطناعي المكالمات الهاتفية لحظيًا، ويرصد تصاعد التوتر في صوت العميل، ويلاحظ متى تصبح نبرة الموظف حادة أو دفاعية، ويقيّم جودة المكالمات عاطفيًا بعد انتهائها.

المعيار هنا ليس الكمال. إنه أن يكون أفضل من المراجعة اليدوية لآلاف المكالمات. عند هذا الحد، يؤدي الذكاء الاصطناعي العاطفي الحالي أداءً جيدًا بما يكفي لتبرير نشره.

مراقبة الصحة النفسية

تستخدم عدة فرق بحثية سريرية مؤشرات حيوية صوتية لتتبع المرضى المصابين بالاكتئاب والقلق بين المواعيد. تترابط أنماط الكلام، والإيقاع، وتواتر التوقف، وبعض الخصائص الصوتية المتعلقة بالنغمة والإيقاع ترابطًا قابلًا للقياس مع الحالات المزاجية. يمكن لأنظمة الذكاء الاصطناعي أن ترصد تحولات مقلقة قد لا تظهر في فحص أسبوعي.

مهم: صُممت هذه الأنظمة لمساعدة الأطباء، لا لاستبدالهم. يلاحظ الذكاء الاصطناعي نمطًا. ويقرر الإنسان ما يُفعل حياله.

الواجهات التكيفية

تستخدم بعض برامج إمكانية الوصول رصدًا لحالة المستخدم العاطفية في الوقت الفعلي لتعديل سلوك الواجهة، فتُبطئ عندما يبدو المستخدم متوترًا، وتبسّط الخيارات عندما تتصاعد علامات الإحباط. يعمل هذا بشكل جيد نسبيًا في سياقات مضبوطة لمستخدم واحد يمكن معايرة النظام فيها وفق خط أساس الفرد.

حيث لا يزال الذكاء الاصطناعي العاطفي يتعثر

مجموعة متنوعة من ستة محترفين في قاعة اجتماعات يُظهرون طيفًا واسعًا من تعابير الوجه الحقيقية خلال اجتماع

الأماكن التي يفشل فيها الذكاء الاصطناعي العاطفي ليست حالات هامشية. إنها محورية في الحياة العاطفية البشرية.

مشكلة الإخفاء

لا يكتفي الناس بعرض مشاعرهم. إنهم يديرونها. يتظاهرون بالهدوء وهم خائفون في الداخل. يبتسمون لأشخاص لا يحبونهم. يُظهرون الثقة في لحظات عدم اليقين العميق.

يقرأ الذكاء الاصطناعي الذي يتعامل مع الإشارات الظاهرة الأداء لا الحالة الداخلية. هذه ليست مجرد فجوة تقنية. إنها حد أساسي: لا يمكنك قراءة التجربة الداخلية لشخص بالكامل من إشاراته الخارجية، لأن تلك الإشارات جزئيًا، وأحيانًا في معظمها، بناء اجتماعي.

الباحث الذي أمضى سنوات في دراسة الحوسبة الوجدانية يعرف ذلك. وتتجنب المواد التسويقية لمعظم منتجات الذكاء الاصطناعي العاطفي ذكره بعناية.

فخ التجميع

عند وصف أنظمة الذكاء الاصطناعي العاطفي، تُستخدم عادةً أرقام دقة إجمالية. "يحقق نموذجنا دقة 87% على مجموعة بيانات EMODB." ما يعنيه ذلك عمليًا: يُصنَّف خطأً 13 شخصًا من كل 100. وعند نشره على نطاق واسع عبر ملايين التفاعلات، يُنتج معدل الخطأ هذا أعدادًا هائلة من أشخاص حقيقيين قُرئت مشاعرهم بشكل خاطئ، واستُجيب لهم كما لو كانت تلك القراءة الخاطئة صحيحة.

التحيّز البنيوي في البيانات

ليست مجموعات البيانات المستخدمة لتدريب أنظمة التعرف على المشاعر محايدة. فهي تعكس من بناها، ومن موّلها، ومن شارك في جمع البيانات. ويُنتج ذلك أنظمة أقل دقة بشكل قابل للقياس مع:

  • النساء (تُظهر بعض الدراسات مبالغة في قراءة تعابير الوجه الأنثوية المحايدة على أنها "غاضبة")
  • أنماط التعبير الثقافية غير الغربية
  • كبار السن الذين تغيّرت عضلات وجوههم مع التقدم في العمر
  • الأشخاص المصابون بحالات عصبية معينة تؤثر في أنماط التعبير المعتادة

ما الذي يتجادل فيه الباحثون فعلًا

عالم أعصاب يرتدي معطف مختبر أبيض يفحص صور المسح الدماغي بالرنين المغناطيسي على صندوق إضاءة في منشأة بحثية سريرية

يتبنى مجال الحوسبة الوجدانية الأكاديمي، الذي أرسته روزاليند بيكارد في MIT، منظورًا طويل الأمد ومتزنًا. الحجة التأسيسية لبيكارد هي أن الآلات التي تتفاعل مع البشر تحتاج إلى التعرف على الإشارات العاطفية والاستجابة لها بشكل مناسب، ليس لأن الآلة تشعر بشيء، بل لأن تجاهل الإشارات العاطفية يجعل التفاعل بين الإنسان والآلة هشًا ومحبطًا.

الحجة المضادة، التي عبّر عنها بقوة باحثون مثل ليزا فيلدمان باريت، هي أن فئات المشاعر نفسها ليست ثابتة أو عالمية كما افترض إطار إيكمان. فالمشاعر ليست قراءات لحالات بيولوجية. إنها تُبنى بواسطة الدماغ من مزيج من إشارات الجسد الداخلية والتعلم الثقافي. وإذا كان ذلك صحيحًا، فإن المشروع كله المتمثل في "قراءة" المشاعر من الإشارات الظاهرة مبني على أساس نظري مهتز.

يمكن لنماذج مثل DeepSeek R1 الآن أن تستدل عبر هذه النقاشات بإسهاب، وتجمع المواقف الأكاديمية، وتكشف الحجج المضادة، ما يجعلها مفيدة حقًا لأي شخص يحاول فهم هذا المجال البحثي المتنازع عليه.

3 أشياء لا يستطيع الذكاء الاصطناعي فعلها بعد

  1. التعرف على المشاعر المخفية أو المكبوتة بدقة ذات معنى في ظروف الواقع خارج المختبرات والتعابير المصطنعة
  2. تفسير حالات عاطفية مختلطة حقًا تمزج عدة مشاعر في آن واحد دون دعم سياقي كثيف
  3. مراعاة خطوط الأساس الفردية: ما يبدو عليه الفرح على وجه شخص قد يبدو على وجه آخر كاهتمام مهذب

مسألة الموافقة

إلى جانب الحدود التقنية، هناك سؤال أصعب: حتى لو عمل الذكاء الاصطناعي لقراءة المشاعر بشكل مثالي، فهل ينبغي لنا نشره دون موافقة الأشخاص؟ إن قراءة الحالة العاطفية لشخص ما دون علمه تمسّ حقوق الخصوصية، وهي حقوق لم تواكبها أنظمة قانونية كثيرة بعد. وتعمل عدة مدن أمريكية والاتحاد الأوروبي حاليًا على تقييد استخدام التعرف على المشاعر في التوظيف وإنفاذ القانون والمراقبة العامة. التقنية تتحرك أسرع من الحوكمة، وهذه الفجوة مهمة.

ما يملكه المعالج النفسي وما لا يملكه الذكاء الاصطناعي

معالجة نفسية تميل إلى الأمام بتعاطف نحو مريضة في مكتب خاص دافئ ومضاء بإضاءة خافتة

يعتمد المعالج الماهر في قراءة الحالة العاطفية للمريض على التدريب بالطبع، لكنه يعتمد أيضًا على سنوات من معرفة هذا الشخص تحديدًا، وعلى الرنين العاطفي لما يُقال، وعلى الصمت بين الكلمات، وعلى الوضعية والطاقة بطريقة يشارك فيها النظام العاطفي للمعالج نفسه كأداة استشعار.

هذا ليس غامضًا. إنه نتاج تواصل غني ومجسَّد وعلائقي مع شخص آخر عبر الزمن. وهو بالضبط ما لا يملكه أي نظام ذكاء اصطناعي حالي، وما لا يلمّح حتى أكثر الباحثين تفاؤلًا إلى أنه سيأتي في المدى القريب.

إن تعقيد الحياة الاجتماعية والعاطفية البشرية، الذي يظهر في أي شارع مزدحم في المدينة حيث تدور عشرات المعاملات العاطفية المتزامنة والمتداخلة في وقت واحد، أعقد بمراتب من أن تعالجه الأنظمة الحالية بأي شكل شامل.

منظور جوي يطل مباشرة على معبر مشاة مزدحم في المدينة خلال ساعة الذروة يُظهر عشرات الأشخاص بلغة جسد متميزة

الإجابة الصادقة عن سؤال "هل يستطيع الذكاء الاصطناعي فهم المشاعر البشرية بعد" هي: يستطيع رصد إشارات معينة، في ظروف مضبوطة معينة، بدقة ذات معنى لكنها غير كاملة. وهذا مفيد حقًا لتطبيقات محددة. لكنه بعيد جدًا عن المعالجة الغنية والسياقية والمجسَّدة التي يقوم بها البشر طبيعيًا مع بعضهم كل يوم.

الفجوة لا تُغلق بالسرعة التي توحي بها العناوين الرئيسية.

وظّف الذكاء الاصطناعي العاطفي بصريًا

صورة مقربة لامرأة تُظهر تعبيرًا حزينًا خفيفًا ومتعدد الطبقات مع ضوء نافذة طبيعي يخلق ظلًا نصفيًا ناعمًا عبر الوجه

بينما ما زال الذكاء الاصطناعي يعمل على قراءة المشاعر البشرية، فقد أصبح بارعًا بشكل لافت في تمثيلها في النص والصور. وهنا تصبح التقنية ذات قيمة حقيقية للمبدعين.

يمكنك استخدام نماذج اللغة الكبيرة على PicassoIA لتقييم النبرة العاطفية لنص ما، أو رسالة علامة تجارية، أو ملخص بحثي، ثم استخدام هذا التقييم لصياغة أوامر نصية لتوليد صور تلتقط الإحساس المقصود بصريًا. نماذج مثل GPT-5، وClaude 4 Sonnet، وGemini 3 Pro، وDeepSeek R1 متاحة كلها مباشرة على PicassoIA، وجاهزة لمساعدتك في تحليل السجل العاطفي لأي محتوى.

كيفية استخدام نماذج اللغة الكبيرة في العمل على المحتوى العاطفي

  1. افتح أي نموذج لغوي كبير على PicassoIA مثل GPT-5 أو Claude 4 Sonnet
  2. الصق نصك (موجز حملة، أو مقتطف قصة، أو وصف منتج، أو حتى مدخل من يومياتك الشخصية)
  3. اطلب منه تحديد النبرة العاطفية: الشعور الأساسي، والتوترات الثانوية، وأي عناصر ساخرة أو متضاربة موجودة
  4. استخدم المخرجات لكتابة أمر نصي مفصّل لتوليد الصورة ومبني على الفهم العاطفي
  5. خذ هذا الأمر إلى نماذج تحويل النص إلى صورة في PicassoIA وولّد صورًا واقعية كالصور الفوتوغرافية تحمل الثقل العاطفي الذي حددته

جرّب هذا: صف لحظة حملت ثقلًا عاطفيًا معقدًا، كارتياح مختلط بالخسارة، أو حماسة يظللها الشك. ألصقها في GPT-5 على PicassoIA واطلب منه إنتاج أمر توليد صورة من هذا الوصف العاطفي. ثم ولّد الصورة. النتائج غالبًا ما تكون لافتة.

ما إذا كان الذكاء الاصطناعي يعرف فعلًا ما تشعر به لا يزال سؤالًا مفتوحًا يجادل فيه الباحثون بنشاط. أما ما إذا كان يستطيع مساعدتك في إظهاره، بالكلمات، والصور، والنبرة، فهذا محسوم بالفعل. توجّه إلى PicassoIA، واختر نموذجًا، وابدأ بالحالة العاطفية التي تريد تجسيدها.

شارك هذا المقال

اختر لغتك

مقالات ذات صلة