لا بد أنك سمعت عبارة "نموذج الذكاء الاصطناعي" تتردد في كل حديث هذا العام. روبوتات الدردشة، ومولّدات الصور، والمساعدات الصوتية، ومساعدو البرمجة. كلها تعمل بنماذج ذكاء اصطناعي. لكن ما هو النموذج بالضبط؟ إن كنت قد توقفت عند هذا السؤال وشعرت أن الإجابات لم تكن شافية أبدًا، فهذا المقال موجّه إليك.
لا شعارات براقة. لا مبالغة. مجرد شرح بسيط وصادق لما هو نموذج الذكاء الاصطناعي، وكيف يُبنى، وما الذي يميز كل نوع عن غيره.
ما هو نموذج الذكاء الاصطناعي فعلًا
في أبسط صوره، نموذج الذكاء الاصطناعي هو دالة رياضية. يأخذ مُدخلًا، ويمرره عبر سلسلة من العمليات الحسابية، ثم ينتج مخرجًا. هذا كل شيء.
قد يكون المُدخل نصًا أو صورة أو صوتًا أو أرقامًا خامًا. وقد يكون المخرج جملة، أو صورة مولّدة، أو عبارة مترجمة، أو توقعًا. أما العمليات الحسابية التي تقع في المنتصف فهي ما يجعل النموذج مفيدًا.

فكّر في الأمر هكذا: برنامج الحاسوب العادي يتبع قواعد يكتبها المبرمج يدويًا، مثل "إذا كتب المستخدم X، فأجب بالنتيجة Y". أما نموذج الذكاء الاصطناعي فلا يتبع قواعد مكتوبة يدويًا. بدلًا من ذلك، يتعلم أنماطًا من البيانات ويستخدم تلك الأنماط للتعامل مع مواقف لم يرها من قبل.
هذا الانتقال من القواعد الصريحة إلى الأنماط المتعلَّمة هو ما يجعل نماذج الذكاء الاصطناعي مختلفة جدًا عن البرمجيات التقليدية، ويمنحها قدرات مدهشة.
💡 تعريف سريع: نموذج الذكاء الاصطناعي نظام يُدرَّب على البيانات ليتعرف على الأنماط ويتنبأ أو يولّد مخرجات، دون أن تُبرمج له قواعد لكل موقف على حدة.
كيف يتعلم النموذج
العملية التي تبني نموذج الذكاء الاصطناعي تُسمى التدريب. أثناء التدريب، يُعرض على النموذج كمّ هائل من الأمثلة. فبالنسبة إلى النموذج اللغوي، قد يكون ذلك مليارات الصفحات من النصوص. وبالنسبة إلى نموذج الصور، قد يكون ذلك مئات الملايين من الصور المقترنة بأوصاف.

إليك ما يحدث أثناء التدريب، بشكل مبسّط:
- يتنبأ النموذج بناءً على حالته الداخلية الحالية.
- تُقارَن هذه التوقعات بالإجابة الصحيحة الموجودة في بيانات التدريب.
- يُقاس الخطأ باستخدام أداة رياضية تُسمى دالة الخسارة.
- تُعدَّل قيم داخلية تُسمى الأوزان بشكل طفيف لتقليل ذلك الخطأ.
- يتكرر ذلك مليارات المرات عبر ملايين الأمثلة.
كل تعديل صغير جدًا. لكن مع مليارات التكرارات، تتراكم هذه الدفعات الصغيرة لتصبح نظامًا قادرًا على كتابة مقالات متماسكة، والإجابة عن أسئلة معقدة، أو رسم صور واقعية كالصور الفوتوغرافية انطلاقًا من وصف نصي قصير.
تعمل هذه العملية على مجموعات ضخمة من العتاد المتخصص، وغالبًا ما تستغرق أسابيع أو شهورًا، وتكلف ملايين الدولارات بالنسبة إلى أكبر النماذج.
المعاملات الكامنة داخل كل نموذج
عندما يتحدث الناس عن "نموذج بسبعة مليارات معامل" أو "نموذج 70B"، فإنهم يشيرون إلى عدد القيم القابلة للتعلم داخل النموذج. وتُسمى هذه القيم الأوزان أو المعاملات.
كل معامل مجرد رقم. لكن هذه الأرقام مجتمعة تحمل كل ما استوعبه النموذج من بيانات التدريب: العلاقات بين الكلمات، والأنماط البصرية في الصور، وبنية الشيفرة البرمجية، وإيقاع الجملة.
| حجم النموذج | المعاملات | حالة الاستخدام الشائعة |
|---|
| صغير | 1B - 7B | تطبيقات الهاتف، والاستجابات السريعة، والتلخيص |
| متوسط | 13B - 40B | المحادثة العامة، والاستدلال، والمساعدة في البرمجة |
| كبير | 70B - 180B | الاستدلال المعقد، وتحليل المستندات الطويلة |
| رائد | 200B+ | البحث، والأداء المتقدم |
عمومًا، كلما زادت المعاملات زادت قدرة النموذج على استيعاب المعلومات. لكنها تعني أيضًا حاجة أكبر إلى الحوسبة لتشغيل النموذج، وتكاليف أعلى، وأزمنة استجابة أبطأ. الأكبر ليس دائمًا الأفضل لكل مهمة.
💡 يستحق الملاحظة: نموذج أصغر خضع للضبط الدقيق لمهمة محددة سيتفوق في الغالب على نموذج عام ضخم في تلك المهمة بعينها. الحجم بُعد واحد فقط من أبعاد الجودة.
الأنواع المختلفة لنماذج الذكاء الاصطناعي
"نموذج الذكاء الاصطناعي" مصطلح جامع يشمل بنى مختلفة جدًا، مبنية لأغراض مختلفة جدًا.

النماذج اللغوية
هذه هي النماذج الأكثر تداولًا الآن. النماذج اللغوية الكبيرة (LLM) تُدرَّب على النصوص وصُمّمت لتوليد اللغة وإكمالها وتلخيصها وترجمتها. عندما تحادث مساعدًا ذكيًا، أو تطلب منه كتابة رسالة بريد إلكتروني، أو تطلب شرح مفهوم، فأنت تتعامل مع نموذج لغوي كبير.
يتنبأ النموذج بالتوكن الأرجح التالي (جزء من النص) بناءً على كل ما سبقه، فيبني الردود كلمةً كلمةً. ومن أكثر النماذج قدرة المتاحة اليوم:
ولكل منها نقاط قوة مختلفة. بعضها أسرع. وبعضها يفكر بعناية أكبر قبل الإجابة. وبعضها مفتوح المصدر، أي أن أي شخص يستطيع تشغيله على عتاده الخاص.
نماذج توليد الصور
تأخذ هذه النماذج أمرًا نصيًا وتنتج صورة واقعية كالصور الفوتوغرافية أو صورة فنية. ومعظم مولّدات الصور الحديثة تستخدم تقنية تُسمى الانتشار، حيث يتعلم النموذج إزالة الضوضاء من الستاتيك العشوائي حتى تظهر صورة متماسكة.
تعتمد جودة المخرجات بشدة على كيفية تدريب النموذج، والبيانات التي رآها، والبنية المستخدمة. تمنحك مجموعة PicassoIA لتحويل النص إلى صورة وصولًا إلى أكثر من 90 نموذجًا مختلفًا للصور، فتستطيع اختيار الأداة المناسبة تمامًا لأسلوبك وغرضك.
نماذج الرؤية
تعمل نماذج الرؤية في الاتجاه المعاكس. فهي تأخذ صورة كمُدخل وتنتج نصًا كمخرج: تعليقات، أو أوصافًا، أو وسومًا، أو إجابات عن أسئلة حول ما في الصورة. وتشغّل هذه النماذج ميزات مثل الوسم التلقائي للصور، والبحث البصري، وأدوات إمكانية الوصول.
نماذج الصوت
تحوّل نماذج تحويل الكلام إلى نص الصوت المنطوق إلى كلمات مكتوبة. أما نماذج تحويل النص إلى كلام فتفعل العكس، فتولّد صوتًا طبيعي الإيقاع من النص. ويمكن لنماذج توليد الموسيقى بالذكاء الاصطناعي أن تنشئ مقطوعات كاملة انطلاقًا من وصف قصير للأسلوب والمزاج، كلها من الصفر.
نماذج الفيديو
تتضمن بعض أحدث الإنجازات نماذج تولّد الفيديو أو تعدّله أو تثبّته. وهي مكلفة من حيث الحوسبة، لكنها تتحسن بسرعة. وهي تطبّق مبادئ نماذج الصور عبر الزمن لإنتاج تسلسلات حركية متماسكة.
كيف تُنشر النماذج
تدريب النموذج واستخدام النموذج أمران مختلفان تمامًا.

بعد تدريب النموذج، يُغلَّف في شكل قادر على استقبال المُدخلات وإعادة المخرجات بسرعة. ويُسمى ذلك تشغيل النموذج (inference). في كل مرة ترسل رسالة إلى مساعد ذكي، أو تنقر على "توليد" في أداة صور، فأنت تشغّل نموذجًا منشورًا.
معظم المستخدمين لا يتعاملون مع النماذج مباشرةً أبدًا. بل يتعاملون مع التطبيقات التي تستدعي النماذج في الخلفية. صندوق الدردشة الذكي على موقع إلكتروني، وزر تحسين الصور في تطبيق، والإكمال التلقائي في بريدك الإلكتروني. كلها واجهات مبنية فوق نماذج منشورة.
عندما تستخدم منصة مثل PicassoIA، تحصل على وصول مبسّط إلى عشرات النماذج في كل الفئات، دون الحاجة إلى إعداد البنية التحتية، أو إدارة مفاتيح API، أو القلق بشأن تكاليف الحوسبة.
النماذج المفتوحة مقابل النماذج المغلقة
من أبرز الفواصل في عالم الذكاء الاصطناعي اليوم هو المفتوح مقابل المغلق.
النماذج المغلقة (وتُسمى أيضًا الملكية الخاصة) تملكها شركات وتُستخدم عبر واجهات API. أنت تستخدم النموذج، لكنك لا ترى أبدًا أوزانه الأساسية أو شيفرة تدريبه. ومن أمثلتها سلسلة GPT من OpenAI وعائلة Claude من Anthropic.
النماذج مفتوحة المصدر تنشر أوزانها للعامة. يستطيع أي شخص تنزيلها، وتشغيلها على عتاده الخاص، أو تعديلها لأغراض محددة. وعائلة Llama من Meta هي المثال الأبرز.
| الخاصية | النماذج المغلقة | النماذج مفتوحة المصدر |
|---|
| الوصول | عبر API فقط | تنزيل أو API |
| التخصيص | محدود | ضبط دقيق كامل ممكن |
| التكلفة | الدفع حسب الاستخدام | يمكن تشغيلها محليًا دون تكلفة |
| الشفافية | صندوق أسود | فحص الأوزان والتدريب |
| أمثلة | GPT-5، Claude | Llama 4، DeepSeek |
لا يتفوق أحدهما على الآخر بالضرورة. فالنماذج المغلقة غالبًا ما تملك ضوابط أمان أقوى ووصولًا أبسط للمستخدمين العاديين. أما النماذج المفتوحة فتوفر المرونة والخصوصية، والقدرة على التكيّف مع صناعات أو مجالات محددة.
لماذا يغيّر الضبط الدقيق كل شيء
يمكن للنموذج الأساسي المدرَّب على بيانات عامة أن يفعل الكثير. لكنه غالبًا ما يحتاج إلى تحسين ليتفوق في مهام محددة.
الضبط الدقيق هو مواصلة التدريب على مجموعة بيانات أصغر ومخصصة لمهمة بعينها. فنموذج لغوي كبير عام يخضع للضبط الدقيق على نصوص طبية يصبح أفضل بكثير في الأسئلة السريرية. ونموذج صور عام يخضع للضبط الدقيق على أسلوب فني محدد سيعيد إنتاج ذلك الأسلوب باستمرار.

ولهذا قد يبدو نموذجان مبنيان على البنية الأساسية نفسها مختلفين تمامًا عند الاستخدام. فقد يكون أحدهما جافًا وتقنيًا، والآخر دافئًا وودودًا في الحديث. النموذج الأساسي مهم، لكن الضبط الدقيق هو ما يشكّل الشخصية والتخصص.
وبالنسبة إلى نماذج الصور تحديدًا، تتيح طرق الضبط الدقيق مثل LoRA (Low-Rank Adaptation) للمبدعين تدريب نموذج على إعادة إنتاج وجه شخص، أو أسلوب فني لعلامة تجارية، أو جمالية معينة بثبات، دون الحاجة إلى إعادة تدريب النموذج كله من الصفر. وهذا ما يسمح بوجود هذا العدد الكبير من النماذج المتخصصة جنبًا إلى جنب.
ماذا تعني "التوكنات" فعلًا
إن قضيت وقتًا مع النماذج اللغوية الكبيرة، فلا بد أنك سمعت كلمة التوكنات. فالنماذج لا تعالج النص حرفًا حرفًا ولا كلمةً كلمةً. بل تعالج أجزاء تُسمى توكنات.
التوكن يساوي تقريبًا من 3 إلى 4 أحرف من النص الإنجليزي في المتوسط. فقد تكون كلمة "photorealistic" توكنًا واحدًا. أما المصطلح التقني الطويل جدًا فقد يكون عدة توكنات. وعندما ترسل رسالة إلى ذكاء اصطناعي، تُقسَّم إلى توكنات قبل أن يعالجها النموذج.
لماذا يهم ذلك؟ لأن النماذج لديها نافذة سياق: حدّ لعدد التوكنات التي يمكنها التعامل معها في وقت واحد. فالنموذج الذي لديه نافذة سياق تبلغ 128,000 توكن يستطيع التعامل مع نحو 100,000 كلمة في جلسة واحدة. وهذا يكفي لاحتواء رواية كاملة.
يُعد طول السياق من أهم المواصفات العملية عند اختيار نموذج لغوي كبير. فالسياق القصير يعني أن النموذج ينسى الأجزاء السابقة من محادثة طويلة. أما السياق الطويل فيعني أنه يستطيع التعامل مع مستندات كاملة، أو مستودعات شيفرة بأكملها، أو جلسات بحث ممتدة دون أن يفقد الخيط.
دور البنية
تشير كلمة البنية إلى كيفية تنظيم النموذج داخليًا. والبنية السائدة اليوم هي Transformer، التي قُدّمت في ورقة بحثية عام 2017، وأصبحت اليوم العمود الفقري لتقريبًا كل نموذج لغوي وصوري كبير.
تستخدم نماذج Transformer آلية تُسمى الانتباه الذاتي تسمح للنموذج بتقدير أي أجزاء المُدخل هي الأكثر صلة عند توليد كل جزء من المخرج. وهذا ما يتيح للنموذج اللغوي أن "يتذكر" أن تفصيلة وردت قبل آلاف الكلمات لها صلة بالجملة الحالية.

تتخذ مجموعات البحث المختلفة خيارات معمارية مختلفة: كم عدد الطبقات التي تُرص فوق بعضها، وكيف تُبنى آلية الانتباه، وهل تُستخدم توجيه "خليط الخبراء" حيث لا تنشط إلا أجزاء من النموذج لكل مُدخل، وكيف يُتعامل مع أنواع المُدخلات المختلفة كالصور إلى جانب النص. وتتراكم هذه الخيارات لتُحدث فروقًا حقيقية في السرعة والجودة والقدرة على نطاق واسع.
ماذا يحدث عندما يهلوس النموذج
أي شرح صادق لنماذج الذكاء الاصطناعي لا بد أن يتناول هذه النقطة: النماذج تختلق أشياء.
المصطلح التقني هو الهلوسة. فقد يذكر نموذج لغوي إحصائية خاطئة بثقة، أو ينسب اقتباسًا إلى شخص خطأ، أو يختلق كتابًا غير موجود. وقد يولّد نموذج صور نصًا داخل الصورة يبدو معقولًا لكنه هراء تام.
يحدث ذلك لأن النماذج لا "تعرف" الأشياء كما يعرفها البشر. إنها تولّد مخرجات مرجّحة إحصائيًا بناءً على أنماط في بيانات التدريب. وعندما تُدفع إلى ما وراء الأنماط الموثوقة، فإنها تستقرئ وتستنتج. وأحيانًا تستنتج بشكل خاطئ.
لهذا السبب:
- التحقق من المصادر مهم عند استخدام الذكاء الاصطناعي في البحث أو في الأعمال القائمة على الحقائق
- النصوص المولّدة بالذكاء الاصطناعي داخل الصور غالبًا ما تكون غير صالحة للاستخدام دون تصحيح يدوي
- النماذج المتخصصة والمضبوطة دقيقًا غالبًا ما تهلوس بدرجة أقل ضمن مجالها من النماذج العامة
تختلف معدلات الهلوسة اختلافًا كبيرًا بين النماذج وحالات الاستخدام. فالنماذج الموجّهة نحو الاستدلال، مثل DeepSeek R1 وClaude 4 Sonnet، مصممة خصيصًا للعمل على المشكلات خطوة بخطوة قبل تقديم إجابة، وهذا يميل إلى تقليل المخرجات الواثقة لكنها خاطئة.
لماذا تختلف جودة الصور بين النماذج
إن كنت قد أدخلت الأمر النصي نفسه في نموذجين مختلفين لتحويل النص إلى صورة، فأنت تعرف أن النتائج قد تختلف اختلافًا كبيرًا. وتشكّل عدة عوامل ما يخرج في النهاية.

- بيانات التدريب: النماذج المدرَّبة على مجموعات بيانات منتقاة وعالية الجودة تنتج نتائج أكثر اتساقًا وصقلًا
- البنية: تتعامل بنى الانتشار المختلفة مع التفاصيل الدقيقة والتماسك العام بطرق متباينة
- الدقة وعدد الخطوات: عدد خطوات الانتشار الأكبر يعني عمومًا مخرجات أكثر صقلًا، لكن على حساب سرعة التوليد
- مقياس التوجيه: يتحكم في مدى التزام النموذج الصارم بالأمر النصي مقابل مدى حريته في تفسير وصفك
- تخصص الضبط الدقيق: النموذج المضبوط دقيقًا لواقعية البورتريه سيتعامل مع البشرة والضوء بطريقة مختلفة تمامًا عن نموذج مضبوط للتصور المعماري
وهذا بالضبط ما يجعل امتلاك وصول إلى نماذج كثيرة أمرًا مهمًا. فلا يوجد نموذج صور واحد يتفوق في كل فئة. ومطابقة النموذج المناسب للمهمة المحددة تنتج نتائج أفضل بكثير من الاعتماد على أداة واحدة لكل شيء.
بعد توليد الصورة، يمكن لأدوات مثل Real ESRGAN وRecraft Crisp Upscale أن ترفع الدقة أكثر، فتستعيد تفاصيل حادة ونسيجًا لم يكن موجودًا في المخرج الأصلي.
النموذج ليس هو المنتج
هناك أمر يربك كثيرين. نموذج الذكاء الاصطناعي هو التقنية الأساسية، أما المنتج فهو التطبيق المبني فوقها.
عندما تستخدم أداة كتابة بالذكاء الاصطناعي، فمن المرجح أنك تتفاعل مع نموذج لغوي كبير مثل GPT-5 أو Claude 4 Sonnet عبر API. فالشركة التي تبني الأداة هي من تقرر كيف تُعرض المُدخلات، وما التعليمات الخلفية التي تُضاف تلقائيًا، وكيف تُنسَّق المخرجات وتُفلتر.
منتجان مختلفان يستخدمان النموذج الأساسي نفسه قد يبدوان مختلفين تمامًا. فالقدرة الخام للنموذج متغير واحد. أما تصميم النظام المحيط به فهو مهم بالقدر نفسه.

ولهذا أيضًا فإن تشغيل نموذج بوصول مباشر، دون طبقة تطبيق كثيفة بينك وبينه، يُنتج في الغالب نتائج أكثر مرونة وكشفًا. فالمنصات التي تتيح لك اختيار النموذج المحدد، وضبط المعاملات، وصياغة أوامرك الخاصة، تمنحك تجربة مختلفة جوهريًا عن التطبيقات الاستهلاكية المصقولة التي تُخفي كل تفاصيلها.
ما الذي يجعل النموذج "جيدًا"
الإجابة الصادقة هي: الأمر يعتمد كليًا على ما تحتاجه منه.
| ما تحتاجه | ما الذي تحسّن من أجله |
|---|
| السرعة | نموذج أصغر، ومعاملات أقل، وبنية مقطّرة |
| الاستدلال العميق | ضبط دقيق لسلسلة التفكير، ومقياس أكبر |
| الكتابة الإبداعية | إعداد حرارة مرتفع، وبيانات تدريب متنوعة |
| دقة المعلومات | حرارة أقل، وتوليد معزّز بالاسترجاع |
| واقعية الصورة | بيانات تدريب فوتوغرافية عالية الجودة، وبنية انتشار |
| سرعة الصورة | نماذج صور مقطّرة أو مُكمَّمة |
| المستندات الطويلة | نافذة سياق كبيرة، وانتباه فعّال |
لا يوجد نموذج ذكاء اصطناعي "أفضل" واحد. هناك نماذج تناسب مهام وميزانيات وسياقات مختلفة بشكل أفضل. وأذكى المستخدمين لا يلتزمون بنموذج واحد. بل يعرفون عدة نماذج، ويختارون المناسب منها للموقف.
ابدأ الإبداع الآن
إن امتلاك صورة واضحة عمّا هي نماذج الذكاء الاصطناعي يضعك في موقع أقوى بكثير. فتتوقف عن الانبهار بالادعاءات الغامضة عن "ذكاء اصطناعي قوي"، أو الحيرة أمامها، وتبدأ في طرح أسئلة أدق: أي نوع من النماذج، ومدرَّب على أي بيانات، ومحسَّن لأي مهمة؟

أسرع طريقة لبناء حدس حقيقي هي استخدام نماذج متعددة والانتباه للفروق. قارن كيف يتعامل GPT-5 مع أمر نصي للكتابة الإبداعية مقارنةً بالنموذج Llama 4 Maverick Instruct. لاحظ كيف يقارب Gemini 3 Pro سؤالًا تحليليًا بشكل مختلف عن DeepSeek R1. شغّل الأمر النصي نفسه للصورة عبر ثلاثة نماذج مختلفة لتحويل النص إلى صورة، وادرس الفروق في التكوين والملمس والأسلوب.
هذه المقارنة العملية تبني حدسًا أكثر من أي شرح مكتوب.
تجمع PicassoIA أكثر من 90 نموذجًا لتحويل النص إلى صورة، وأبرز النماذج اللغوية الكبيرة، بما فيها GPT-5 وClaude Opus 4.7 وLlama 4 Maverick Instruct، إلى جانب أدوات متخصصة للفيديو والصوت ورفع الدقة عبر Real ESRGAN، وغير ذلك. كل شيء متاح في مكان واحد، دون الحاجة إلى إعداد بنية تحتية.
اختر نموذجًا. اكتب أمرًا نصيًا. وشاهد ما يعود إليك. هنا تبدأ التعلّم الحقيقي.