الذكاء الاصطناعي متعدد الوسائط ليس مفهومًا بحثيًا محجوبًا خلف اشتراك مدفوع أو ينتظر إصدار منتج جديد. إنه موجود بالفعل في جيبك. عندما تصوّر قائمة طعام في مطعم فيقرأها هاتفك بصوت مرتفع، أو عندما تسأل مساعدًا ذكيًا عن نوع نبتة من صورة غير واضحة، أو عندما يستمع روبوت محادثة إلى سؤالك ويرسم لك صورة ردًا عليه، فهذا هو الذكاء الاصطناعي متعدد الوسائط وهو يؤدي بالضبط ما صُمم لأجله. قد تبدو الكلمة تقنية، لأنها تصف شيئًا جديدًا فعلًا: نظام ذكاء اصطناعي يعالج أكثر من نوع من المدخلات في الوقت نفسه، تمامًا كما يفعل الإنسان بطبيعته.
ماذا يعني "متعدد الوسائط" فعليًا
يمكن تفكيك الكلمة بسهولة. تشير "الوسيلة" (Modal) إلى نمط الإدخال أو الإخراج. النص وسيلة، والصور وسيلة أخرى، والصوت ثالثة، والفيديو رابعة. يستطيع نظام الذكاء الاصطناعي متعدد الوسائط أن يستقبل وينتج عبر أكثر من هذه الوسائط في الوقت نفسه، بدلًا من أن يكون محصورًا في قناة واحدة.
ذكاء واحد وحواس متعددة
فكّر في الفرق بهذه الطريقة. يستقبل نموذج الذكاء الاصطناعي القديم الذي يعمل بالنص فقط سلسلة من الكلمات ويرد بكلمات. أما النموذج متعدد الوسائط فيستطيع أن يستقبل صورة فوتوغرافية وتسجيلًا صوتيًا وسؤالًا مكتوبًا في آن واحد، ثم يرد بنص أو بصورة مولّدة أو حتى بكلام مُصنَّع. ليست هذه ثلاث أدوات منفصلة تعمل بالتتابع، بل نموذج واحد يستدل عبر المدخلات الثلاثة في الوقت نفسه.
لهذا الفرق أهمية تفوق ما يبدو عليه. عندما تعرض صورة لطفح جلدي على مساعد صحي يعمل بالذكاء الاصطناعي، وتكتب "هل هذا أمر يستدعي القلق؟"، فالنموذج لا يشغّل مصنّف صور منفصلًا ثم يمرر النتائج إلى نموذج نصي. إنه يقوم بشيء أقرب إلى ما يفعله الطبيب: ينظر إلى الدليل البصري ويقرأ السؤال في اللحظة نفسها، ويزن الاثنين معًا.
لماذا استغرق الوصول إلى هنا كل هذا الوقت
يتطلب بناء نموذج واحد يتعامل مع النص والصور والصوت نوعًا جديدًا من البنية من الأساس. كانت نماذج الذكاء الاصطناعي الأولى تُدرَّب على نوع واحد من البيانات، لأن دمج مسارات التدريب عبر صيغ بيانات مختلفة كان مكلفًا حسابيًا إلى حد هائل، وغير محلول تقنيًا. جاء الاختراق مع البنى القائمة على المحوّلات (transformers) التي أمكن توسيعها لمعالجة رقع الصور وطيوف الصوت بالطريقة نفسها التي تعالج بها التوكنات النصية. وحين نجح هذا النهج، توسعت مجموعات بيانات التدريب لتشمل أمثلة مقترنة عبر الوسائط، وبدأت النماذج تستدل عبرها.
التحول الذي لاحظته بالفعل
إذا استخدمت أي مساعد ذكاء اصطناعي رئيسي خلال العامين الماضيين، فمن المرجح أنك صادفت ميزات متعددة الوسائط دون أن تنتبه إلى طبيعتها.
هاتفك يفعل هذا بالفعل
تأمّل ثلاثة أشياء يفعلها هاتفك بدت عادية حين ظهرت، لكنها كانت مستحيلة فعليًا قبل عشر سنوات:
- البحث البصري: وجّه الكاميرا نحو نبتة أو قطعة أثاث أو منتج واحصل على تعرّف فوري.
- الترجمة الحية: ضع هاتفك فوق لافتة بلغة أجنبية وشاهد الكلمات تتغير أمامك في الوقت الفعلي.
- الأوامر الصوتية مع السياق: قل "ذكّرني بهذا" وأنت تنظر إلى إيصال، فيقرأ هاتفك الإيصال ويفهم أن "هذا" يشير إليه.
كل واحدة من هذه الميزات ذكاء اصطناعي متعدد الوسائط: نظام يقرأ المدخلات البصرية واللفظية معًا لينتج مخرجًا مفيدًا.
حين بدأت روبوتات المحادثة ترى
جاء التحول الأهم حين اكتسبت النماذج اللغوية الكبيرة القدرة على قبول الصور مباشرة داخل المحادثة. فجأة صار بإمكانك أن تلصق لقطة شاشة وتسأل "ما الخطأ في هذا الكود؟"، أو أن تصوّر وصفة مكتوبة بخط اليد وتطلب حساب السعرات الحرارية. لم يعد روبوت المحادثة يحتاج إلى أن تكتب له ما في الصورة، فقد صار قادرًا على رؤيتها.
5 مواقف واقعية يغيّرها
هنا تتحول النظرية إلى أمثلة ملموسة. يغيّر الذكاء الاصطناعي متعدد الوسائط مهامًا يومية محددة بطرق عملية وقابلة للقياس.

قراءة الفواتير والملصقات

صوّر فاتورة خدمات، أو ملصق منتج، أو وثيقة تأمين. اسأل "ماذا يعني هذا فعليًا؟" أو "ما تاريخ انتهاء الصلاحية؟". يقرأ النموذج الصورة، ويستخرج المحتوى ذا الصلة، ويجيب عن سؤالك مباشرة. لا حاجة للكتابة، ولا لإجهاد العين في قراءة الحروف الصغيرة. بالنسبة لمن يعانون ضعف البصر، أو للوثائق بلغة لا تقرؤها بطلاقة، فهذا يمثل تغييرًا عمليًا كبيرًا في إمكانية الوصول.
وصف شيء لا تستطيع تسميته
رأيت أداة، أو نبتة، أو طائرًا، أو نقشة قماش، أو قطعة أجهزة قديمة. لا تستطيع وصفها بدقة كافية حتى ينجح البحث النصي. مع الذكاء الاصطناعي متعدد الوسائط، تصوّرها وتسأل "ما هذا؟". يتعرف النموذج عليه، ويعطيك الاسم الصحيح، وغالبًا ما يشرح لك وظيفته. يسدّ هذا فجوة ظلّت محركات البحث النصية تعاني منها لعقود.
الواجبات المنزلية والمعادلات

يستطيع الطلاب أن يصوّروا مسألة رياضيات أو مخططًا كيميائيًا أو مقالًا مكتوبًا بخط اليد، ويطلبوا المساعدة مباشرة. يرى النموذج المسألة كما هي، لا نسخة نصية تقريبية منها. يمكن تقديم برهان هندسي مع رسم بياني، أو مسألة فيزياء برسم حر مرسوم باليد، أو مخطط أحياء، وكلها تُقدَّم كما تظهر في الصفحة، ويستدل النموذج عليها ككيانات بصرية-رياضية لا كأوصاف نصية متفرقة.
الصوت مع السياق
يوجد الذكاء الاصطناعي الصوتي منذ سنوات، لكنه كان يعاني من قيد مستمر: كان يسمع الكلمات فقط، لا الموقف. يزيل الذكاء الاصطناعي الصوتي متعدد الوسائط هذا القيد. يمكنك أن تتحدث وأنت تعرض شيئًا. تقول "على أي حرارة أطبخ هذا؟" وأنت توجّه الهاتف نحو عبوة. تقول "كم عدد الحصص في هذا؟" وأنت ترفع وجبة. يسمعك النموذج ويرى ما تشير إليه في الوقت نفسه، بدلًا من أن يجبرك على وصفه بالكلمات أولًا.
العمل الإبداعي يصبح أسرع

يستخدم المصورون والمصممون والفنانون الذكاء الاصطناعي متعدد الوسائط لوصف صورة مطلوبة عبر الإشارة إلى مرجع وقول "شيء مثل هذا لكن أدفأ". يرفعون رسومات أولية ويطلبون تحسينات عليها. يعرضون صورة منتج ويطلبون تعليقًا يتناسب مع أجوائها. صارت العملية الإبداعية تقبل المدخلات البصرية في كل مرحلة، بدلًا من الاعتماد على أوصاف لفظية بحتة لا تلتقط أبدًا ما تتخيله.
النماذج التي تقف خلف ذلك
هناك عدة نماذج ذكاء اصطناعي متاحة اليوم متعددة الوسائط بالكامل، وتختلف اختلافًا ملموسًا في المدخلات التي تقبلها ومدى جودة استدلالها عبر المدخلات.

| النموذج | النص | الصور | الصوت | إخراج الصور |
|---|
| GPT-4o | نعم | نعم | نعم | نعم |
| Gemini 3 Pro | نعم | نعم | نعم | لا |
| Claude Opus 4.7 | نعم | نعم | لا | لا |
| Kimi K2.5 | نعم | نعم | لا | لا |
| Granite Vision 3.3 2B | نعم | نعم | لا | لا |
GPT-4o وتحوّل الصور
كان GPT-4o من أوائل النماذج المتاحة على نطاق واسع التي تتعامل مع النص والصور والصوت بشكل أصلي في المحادثة نفسها. فهو لا يتنقل بين نماذج متخصصة مختلفة، بل يعالج الوسائط الثلاث كلها عبر بنية واحدة. والنتيجة العملية أنك تستطيع أن تتناوب بين الكلام والكتابة وعرض الصور، ويحافظ النموذج على السياق عبرها جميعًا دون أن يفقد تتبّع ما سبق.
رهان Gemini الشامل
صُمم Gemini 3 Pro من Google منذ البداية كنموذج متعدد الوسائط. وعلى عكس الأنظمة التي أضافت الرؤية لاحقًا، دُرّب Gemini على النص والصور والصوت والفيديو في الوقت نفسه. والنتيجة استدلال متقاطع الوسائط قوي: يستطيع وصف ما يحدث في مقطع فيديو قصير، وربط هذا الوصف بمستند رفعته في الجلسة نفسها.
يتولى النموذج نفسه مهام تفريغ الصوت. يحوّل Gemini 3 Pro لتحويل الكلام إلى نص الصوت بدقة عبر لهجات ولغات كثيرة، وهذا مفيد لتفريغ الاجتماعات، وملاحظات المقابلات، وسير عمل إمكانية الوصول.
الاستدلال البصري لدى Claude
يقبل Claude Opus 4.7 من Anthropic وClaude 4 Sonnet الصور إلى جانب النص، ويتميزان بقوة خاصة في الفحص البصري التفصيلي. اعرض على Claude مخططًا واطلب منه تلخيص الاتجاه. اعرض عليه صفحة مستند كثيفة واطلب النقاط الرئيسية. لا تكمن قوته في التعرف على ما تحتويه الصورة فحسب، بل في الاستدلال على ما يعنيه ذلك المحتوى.
💡 تميل نماذج Claude إلى الأداء بشكل أفضل بصفة خاصة مع المحتوى البصري المنظم، مثل الجداول وجداول البيانات والمخططات، مقارنةً بكثير من البدائل.
Kimi والمنافسون المفتوحون
يقبل Kimi K2.5 من Moonshot AI النص والصور معًا، ويتعامل بسلاسة مع المحادثات المختلطة المدخلات. أما Granite Vision 3.3 2B من IBM فيتخصص في قراءة المخططات والجداول والمستندات المنظمة بصريًا، ما يجعله خيارًا قويًا للمهام كثيفة البيانات. وكلاهما متاح على PicassoIA ويمكن تجربتهما مجانًا.
الصوت: الوسيلة التي يُغفل عنها كثيرًا

يُقلَّل باستمرار من تقدير الجانب الصوتي للذكاء الاصطناعي متعدد الوسائط. يتصور معظم الناس الذكاء الاصطناعي الصوتي على أنه تمييز كلام أساسي، أي النوع الذي يكتب ما تقوله. وهذا نسخ، وهو مفيد. لكن الذكاء الاصطناعي الصوتي متعدد الوسائط يفعل أكثر من ذلك بكثير.
يحوّل GPT-4o Transcribe وGPT-4o Mini Transcribe الصوت المنطوق إلى نص نظيف مع علامات ترقيم، مع تمييز المتحدثين والكشف التلقائي عن اللغة. ويتعامل Granite Speech 4.1 2B مع ست لغات، وصُمم ليعمل بكفاءة حتى على عتاد متواضع.
ما يميّز هذه النماذج عن أدوات تحويل الكلام إلى نص الأقدم هو الاحتفاظ بالسياق. يتتبع النموذج أن "it" في عبارة "put it in the box" يشير إلى شيء ذُكر من قبل. يلتقط المفردات الخاصة بالمجال. ويتعامل مع المتحدثين المتداخلين في اجتماع مسجّل دون أن يفقد الخيط.
الصوت كمدخل من الدرجة الأولى
بالنسبة لكثير من الناس، يكون الصوت الطريقة الأكثر طبيعية للتواصل. أنت تطبخ ويداك مشغولتان. أنت تقود السيارة وتحتاج إلى معلومات سريعة. تفضّل الكلام على الكتابة. الذكاء الاصطناعي متعدد الوسائط الذي يقبل الصوت مدخلًا أساسيًا، لا بديلًا محدودًا، يفتح الواجهة على مواقف تكون فيها الكتابة غير عملية أو أبطأ ببساطة من الكلام.
ما يمكنك توليده به

معالجة المحتوى الموجود قدرة واحدة. أما توليد محتوى جديد فطبقة مختلفة وقوية بالقدر نفسه.
من الوصف إلى الصورة
صِف مشهدًا أو مفهوم منتج أو مزاجًا أو شخصًا بالكلمات، فيُنشئ نموذج تحويل النص إلى صورة مرئيًا من لا شيء. تشمل جودة هذه المخرجات ونطاقها الآن البورتريهات الواقعية كالصور الفوتوغرافية، والتصيّرات المعمارية، والمشاهد المرسومة، ونماذج المنتجات، كلها انطلاقًا من وصف مكتوب تكتبه أو تنطقه.
التحرير بمدخلات بصرية
ارفع صورة وصف ما تريد تغييره. أزِل جسمًا. استبدل الخلفية. اضبط الإضاءة والتدرجات. لا يطبّق النموذج مرشحًا عامًا، بل يستدل على محتوى صورتك ويجري تغييرات تحترم التكوين الحالي والمنظور وظروف الإضاءة.
الصور المرجعية كنقاط انطلاق
من أكثر سير العمل اليومية عملية استخدام صورة موجودة كسياق إبداعي. صوّر غرفة وصف كيف تريد إعادة تأثيثها. اعرض شعارًا وصف تنويعة عليه. ارفع بورتريهًا واطلب وضعه في مكان مختلف. لا يعامل النموذج مدخلك كنص يُنسخ، بل كسياق بصري يبني عليه ويعدّله تدريجيًا.
مجموعة الأدوات متعددة الوسائط في PicassoIA

تجمع PicassoIA الطيف الكامل لقدرات الذكاء الاصطناعي متعدد الوسائط في منصة واحدة، عبر أكثر من 90 نموذجًا لتوليد الصور، ومجموعة من الخيارات للاستدلال اللغوي والبصري، وأدوات مخصصة لإدخال الصوت وإخراجه.
للمحادثة والاستدلال مع الصور، تتوفر نماذج مثل Claude Opus 4.7، وGPT-5، وGemini 3 Pro مباشرة على المنصة. أما لتفريغ الصوت، فيتعامل GPT-4o Transcribe مع الصوت المنطوق بجودة إنتاجية، كما يفعل Granite Speech 3.3 8B.

قيمة وجود كل هذا في مكان واحد لا تقتصر على الراحة. إنها القدرة على ربط الوسائط ببعضها: توليد صورة من أمر نصي، ثم استخدام نموذج رؤية لوصف تلك الصورة، ثم تغذية الوصف إلى نموذج كلام لسرده بصوت مرتفع. سير عمل كان يتطلب من قبل حسابات متعددة ونسخًا ولصقًا يدويًا، صار يعمل الآن كتسلسل متصل.
💡 سير عمل عملي: ارفع لقطة شاشة لتصميم يعجبك، واستخدم نموذج رؤية لإنتاج وصف مكتوب له، ثم غذِّ هذا الوصف إلى نموذج تحويل النص إلى صورة لتوليد تنويعة. ثلاث وسائط، حلقة إبداعية واحدة، في أقل من خمس دقائق.
أين يقصّر الذكاء الاصطناعي متعدد الوسائط

الذكاء الاصطناعي متعدد الوسائط قادر فعلًا، لكن له حدود حقيقية تستحق أن نكون صريحين بشأنها.
ما زال يرتكب أخطاء بثقة
أكثر المشكلات استمرارًا هي الخطأ الواثق. يستطيع النموذج أن يصف صورة بسلطة تامة ويكون مخطئًا في رقم محدد أو اسم أو تفصيلة. قد يُسيء قراءة رقم في صورة، أو يتعرف على شخص بشكل خاطئ، أو يشير إلى شيء ليس موجودًا فعليًا في الإطار. بالنسبة للمهام التي تكون فيها الدقة حاسمة، بما في ذلك المستندات الطبية والعقود القانونية والأرقام المالية، تحقق دائمًا من مخرجات النموذج بمقارنتها بالمصدر الأصلي.
جودة الصورة أهم مما تتوقع
تعمل النماذج متعددة الوسائط بأفضل شكل مع الصور الواضحة، جيدة الإضاءة، عالية الدقة. فالصورة الضبابية المأخوذة بزاوية سيئة وفي إضاءة ضعيفة تنتج نتائج أقل موثوقية من مسح نظيف أو صورة جيدة التكوين. إذا كنت تحصل على نتائج ضعيفة من نموذج رؤية، فتحسين الصورة المصدر هو عادةً الخطوة الأكثر فعالية قبل تعديل أي شيء آخر.
الخصوصية تستحق التفكير
عندما ترفع صورة إلى نموذج ذكاء اصطناعي، فأنت ترسلها إلى خادم تابع لطرف ثالث. بالنسبة لمعظم الصور اليومية فهذا مقبول. أما بالنسبة للسجلات الطبية، أو وثائق الهوية، أو العقود، أو أي شيء يحتوي على بيانات شخصية حساسة، فتحقق من سياسة معالجة البيانات في المنصة قبل الرفع. بعض النماذج تقدم أوضاع معالجة تعطي الخصوصية الأولوية لهذا السبب تحديدًا.
ابدأ في صنع الأشياء
لا تحتاج إلى خلفية تقنية لتستخدم الذكاء الاصطناعي متعدد الوسائط جيدًا. الواجهة صُممت لتكون طبيعية: أرِه شيئًا، وأخبره بما تريد، وشاهد ما ينتجه.
تمنحك PicassoIA الوصول إلى مجموعة الأدوات متعددة الوسائط كاملةً عبر picassoia.com/en/all-models. تحويل النص إلى صورة مع أكثر من 90 نموذجًا. استدلال بصري مع نماذج من OpenAI وAnthropic وGoogle وMeta وغيرها. تفريغ صوتي يتعامل مع اللهجات والمتحدثين المتعددين وست لغات. تحويل النص إلى كلام. توليد الفيديو. كل الوسائط ممثلة، وكل نموذج موسوم بما يقبله وما ينتجه.
ابدأ بشيء بسيط: ارفع صورة حديثة واطلب من نموذج رؤية وصفها. ثم خذ هذا الوصف وغذِّ به نموذج تحويل النص إلى صورة لترى كيف يفسر الذكاء الاصطناعي صورتك بلغته البصرية الخاصة. هذه الحلقة، من صورة إلى نص إلى صورة، تستغرق أقل من دقيقتين على PicassoIA، ولا تكلّف شيئًا للبدء، وتُظهر لك حقيقة الذكاء الاصطناعي متعدد الوسائط أكثر مما يمكن لأي شرح أن يفعله.
التقنية لا تنتظر اللحظة المناسبة. إنها تعمل بالفعل. السؤال الوحيد هو ماذا ستوجّهها إليه أولًا.