لماذا تتحسن نماذج الذكاء الاصطناعي كل شهر؟ العلم الحقيقي وراء ذلك

كل شهر، تطرح نماذج الذكاء الاصطناعي تحديثات تبدو قفزات هائلة. يشرح هذا المقال القوى الفعلية التي تقف وراء هذا التسارع: من النمو الأسّي في قدرة الحوسبة وبيانات التدريب الأغنى، إلى الاختراقات المعمارية وحلقات التغذية الراجعة التي تصقل قدرة الذكاء الاصطناعي على الاستدلال مع الوقت.

لماذا تتحسن نماذج الذكاء الاصطناعي كل شهر؟ العلم الحقيقي وراء ذلك
Cristian Da Conceicao
مؤسس Picasso IA

كل شهر يحدث شيء ما في عالم الذكاء الاصطناعي. يُطرح نموذج جديد برقم قياسي يكسر السجل السابق بهدوء، وتُصدر شركة ناشئة أوزانًا تتفوق على أنظمة الصدارة في العام الماضي. تبدو الوتيرة لا تهدأ، وأحيانًا مرهقة. لكنها ليست سحرًا، وليست ضجيجًا إعلاميًا. هناك قوى حقيقية متراكمة تقف وراء سبب تحسّن نماذج الذكاء الاصطناعي كل شهر، وفهمها يغيّر طريقة تفكيرك في كل أداة تستخدمها.

عجلة الحوسبة الدوّارة

مزيد من وحدات GPU، ومزيد من القوة

المحرّك الأكبر لتقدم الذكاء الاصطناعي هو الحوسبة الخام. أظهرت قوانين التوسّع، التي صاغها باحثو OpenAI رسميًا عام 2020، أمرًا مخالفًا للبديهة: إذا أضفت حوسبة أكثر إلى نموذج أكبر مع بيانات أكثر، يتحسن الأداء بطريقة يمكن التنبؤ بها، وتكاد تكون رياضية. لم يكن هذا واضحًا من قبل. كان الجميع يتوقع تناقص العوائد. لكن المنحنى واصل الصعود.

عرض مقرّب لدائرة إلكترونية لوحدة GPU مع مسارات نحاسية ومكونات سيليكونية

يواكب الجانب المادي هذا التقدم. تقدّم رقائق H100 من NVIDIA إنتاجية أعلى بنحو 10 أضعاف في تدريب الذكاء الاصطناعي مقارنةً بجيل A100 الذي سبقها. وتذهب رقائق B200 أبعد. كل جيل جديد من العتاد يفتح قدرات للنماذج لم تكن ممكنة من قبل، ليس لأن الخوارزميات تغيّرت، بل لأن قدرة الضرب الخام تجاوزت عتبة معينة.

ومن الأمور اللافتة بشكل خاص حلقة التغذية الراجعة: النماذج الأفضل تحقق إيرادات أكبر لشركات الذكاء الاصطناعي، وهذه الإيرادات تموّل شراء المزيد من وحدات GPU، وذلك بدوره يتيح نماذج أفضل. إنها عملية تتراكم على نفسها باستمرار.

  • إنتاجية التدريب تتضاعف تقريبًا كل 18 شهرًا مع الرقائق الجديدة
  • تحسينات عرض النطاق الترددي للذاكرة تتيح نوافذ سياق أكبر
  • سرعات الربط البيني بين الرقائق تقلّل اختناقات التدريب
  • تقنيات التبريد تتيح لمراكز البيانات حشد حوسبة أكبر في كل متر مربع

تشغيل النموذج أصبح أرخص أيضًا

التدريب ليس إلا نصف القصة. فتشغيل النموذج، أي تشغيله لتوليد الردود، أصبح أرخص بشكل ملحوظ. تقنيات مثل التكميم (خفض دقة الأرقام العشرية دون خسارة كبيرة في الجودة)، وفك الترميز التخميني، وflash attention خفّضت كلفة تشغيل النماذج الكبيرة بشكل حاد.

💡 عندما تنخفض كلفة الاستدلال 10 أضعاف، تستطيع الشركات تحمّل تشغيل نماذج أكبر بكثير في الإنتاج، ما يعني أن المستخدمين يتفاعلون مع ذكاء اصطناعي أفضل كل يوم، وليس فقط في العروض البحثية.

تفسّر هذه الحلقة الفاضلة لماذا تُتاح اليوم مجانًا نماذج كانت ستكلّف آلاف الدولارات لكل استعلام قبل ثلاث سنوات فقط. فالاستدلال الأرخص يعني نشرًا أوسع، والنشر الأوسع يعني بيانات استخدام أكثر، وبيانات الاستخدام أكثر تعني فرصًا أفضل للضبط الدقيق.

لقد تغيّرت جودة بيانات التدريب

البيانات الاصطناعية غيّرت كل شيء

لسنوات، كان عنق الزجاجة هو البيانات المصنّفة. فالتعليق البشري بطيء ومكلف. تحتاج إلى أشخاص يقرؤون النصوص، ويشاهدون الفيديوهات، ويصنّفون الصور، ويكتبون التصحيحات. وهناك سقف صارم لسرعة إنتاج بيانات تدريب عالية الجودة بالعمل البشري وحده.

كسرت البيانات الاصطناعية هذا السقف.

عالمة أبحاث في مكتب أكاديمي مضيء محاطة بثلاث شاشات تعرض تصورات بيانات وشيفرة Python

الفكرة بسيطة: تستخدم نموذج ذكاء اصطناعي قادرًا بالفعل لتوليد بيانات تدريب لنموذج أقدر منه. يولّد GPT 5 آلاف الأمثلة عالية الجودة للاستدلال، ثم تُستخدم هذه الأمثلة لتدريب الإصدار التالي. ونماذج مثل GPT 5.4 هي نتاج حلقة التحسين التكراري هذه. وينطبق الأمر نفسه على مهام الرياضيات والبرمجة والاستدلال العلمي.

نوع البياناتالوضع قبل 2023الوضع في 2025-2026
التعليقات البشريةالمصدر الأساسيمصدر تكميلي
سلاسل الاستدلال الاصطناعيةنادرةممارسة معيارية
نصوص الويب المنتقاةمهيمنةمختلطة مع البيانات الاصطناعية
آثار تنفيذ الشيفرةمحدودةمنتشرة
بيانات التفضيل التي يقيّمها الذكاء الاصطناعيتجريبيةخط أنابيب التدريب الأساسي

يمكن للنماذج المدرّبة على براهين مولّدة اصطناعيًا أن تتحقق من تلك البراهين وتوسّعها، فتنتج مجموعات تدريب أغنى من أي فريق بشري. ولهذا قفزت درجات الاستدلال الرياضي بشكل كبير في أجيال النماذج الأخيرة.

التغذية الراجعة البشرية على نطاق واسع

كان التعلّم المعزز من التغذية الراجعة البشرية، أو RLHF، التقنية التي حوّلت نماذج اللغة الخام إلى مساعدين مفيدين. فتدريب النموذج على مطابقة تفضيلات البشر، بدلًا من مجرد التنبؤ بالتوكنات التالية، أنتج مخرجات أكثر فائدة بشكل ملحوظ.

مدرّب ذكاء اصطناعي عند محطة عمل يقدّم ملاحظات مكتوبة على ردود مطبوعة للذكاء الاصطناعي، تضيئها مصباح مكتبي دافئ

لكن RLHF يعاني مشكلة توسّع خاصة به: أنت بحاجة إلى بشر يقيّمون المخرجات. والحل كان أنظمة هجينة تجمع بين تغذية راجعة بشرية محدودة ومقيّمين من الذكاء الاصطناعي يعملون كحكّام. يقيّم نموذج قادر آلاف الردود في الثانية، ويرشّح الأفضل، ويدرّب الإصدار التالي. وClaude 4 Sonnet وClaude Opus 4.7 من Anthropic هما نتاج نهج مطوّر للذكاء الاصطناعي الدستوري وتحسين التفضيلات. فتتحسن المواءمة والقدرة معًا، وتتحسنان بسرعة.

الاختراقات المعمارية لا تتوقف

من المحوّلات إلى سلاسل الاستدلال

ما زالت بنية المحوّلات، التي قُدّمت عام 2017، الأساس لكل نموذج لغوي كبير تقريبًا. لكن ما بُني فوقها تطوّر بشكل كبير. أهم تطور حديث هو التفكير الموسّع، ويُسمّى أحيانًا استدلال سلسلة الأفكار أثناء التشغيل. فبدلًا من إعادة الإجابة فورًا، تقضي النماذج حوسبة في توكنات تعمل فيها على المسألة قبل أن تلتزم برد.

💡 الفكرة أن النموذج نفسه، عندما يُمنح توكنات أكثر للتفكير قبل الإجابة، يمكن أن يتفوق بشكل كبير على نسخته ذات الإجابة الفورية في المسائل الصعبة. لا يحتاج الأمر إلى تدريب جديد، بل إلى استراتيجية تشغيل أذكى.

أظهر DeepSeek R1 ذلك بقوة: نموذج يستدل على المسائل خطوةً خطوة قبل أن يجيب، يتفوّق باستمرار على نماذج أكبر تجيب فورًا. ويطبّق Gemini 3.1 Pro الاستدلال متعدد الخطوات على تحليل المستندات المعقدة. ويطبّق Grok 4 من xAI عمقًا استدلاليًا مماثلًا على مهام استرجاع المعلومات في الوقت الفعلي.

نماذج خليط الخبراء

تحوّل معماري آخر هو تصميم خليط الخبراء (MoE). تُفعّل النماذج الكثيفة التقليدية كل المعاملات لكل توكن. أما نماذج MoE فتُفعّل مجموعة فرعية متخصصة فقط من المعاملات لكل مدخل. والنتيجة العملية: تحصل على قدرات نموذج كبير جدًا بجزء ضئيل من كلفة الاستدلال.

منظر جوي لحرم تقني مترابط عند الساعة الذهبية مع ظلال طويلة تمتد فوق مروج مشذّبة

يستخدم Llama 4 Maverick Instruct وLlama 4 Scout Instruct من Meta تصاميم MoE تتيح لهما التفوق على حجمهما المعاملي. وأصبح DeepSeek v3.1 حالة دراسية بارزة: نموذج بإجمالي 671 مليار معامل، لكن 37 مليارًا فقط نشطة لكل توكن، ويقدّم أداءً في مستوى الصدارة بجزء ضئيل من كلفة الحوسبة.

عندما تستطيع تدريب النماذج وتشغيلها بكفاءة أكبر، يمكنك التكرار بسرعة أكبر. فالمزيد من التجارب لكل دولار يعني مزيدًا من الاختراقات كل شهر.

تأثير تسريع المصادر المفتوحة

Llama من Meta غيّر قواعد اللعبة

قبل أن تُصدر Meta أوزان Llama الأصلية عام 2023، كان البحث الجاد في الذكاء الاصطناعي يتطلب إما العمل في مختبر من الصف الأول أو دفع رسوم الوصول عبر API. جعل الإصدار المفتوح التجريب في متناول الجميع. فصار بإمكان آلاف الباحثين حول العالم ضبط النماذج وفحصها وتحسينها دون انتظار دورات المنتجات المؤسسية.

مهندسا برمجيات يتعاونان عند مكاتب واقفة في مكتب تقني مفتوح ومضيء

تراكم الأثر. كل ورقة بحثية، وكل تقنية ضبط، وكل إصلاح للسلامة اكتشفه مجتمع المصادر المفتوحة، كان يعود إلى منظومة البحث الأوسع. حتى المختبرات المغلقة استفادت، إذ أثرت النتائج المنشورة من باحثي المجتمع في خرائطها الداخلية. وقد تحسّن Gemini 3 Flash وGemini 2.5 Flash من Google جزئيًا عبر أبحاث المواءمة التي نشأت في مجتمع البحث المفتوح.

تسارعت وتيرة الإصدارات أيضًا. عندما تُطلق Meta نموذج Llama 4، تتوفر للمجتمع إصدارات مضبوطة منه خلال أيام. وهذا يخلق مسار تحسين موازيًا يعمل إلى جانب دورات تطوير النماذج المغلقة، ما يضاعف عمليًا وتيرة الابتكار القابل للاستخدام.

كفاءة DeepSeek المفاجئة

كانت إصدارات DeepSeek في أواخر 2024 وخلال 2025 صدمة حقيقية للصناعة. يُقال إن DeepSeek v3 تدرّب بجزء من كلفة النماذج الغربية المماثلة، وضاهاها أو تفوق عليها في عدة اختبارات معيارية. أما الإصدار اللاحق DeepSeek R1 فطبّق التعلّم المعزز للاستدلال بطريقة تفوّقت بشكل كبير على النماذج السائدة آنذاك في مسائل الرياضيات والمنطق.

الدلالة مهمة: دورة التحسين ليست محصورة في الشركات ذات ميزانيات وحدات GPU بمليارات الدولارات. فابتكارات الكفاءة قادرة على ضغط التقدم بشكل كبير. فعندما يثبت فريق صغير نهجًا أفضل، تدرسه كل مختبرات أخرى وتتبناه خلال أشهر.

لماذا تقفز الاختبارات المعيارية بهذه السرعة

النماذج تُدرَّب للتفوق في الاختبارات المعيارية

عندما ترى نموذجًا يسجّل 95% في اختبار معياري للاستدلال، بينما كانت النماذج تسجّل 60% فيه قبل عامين، فإن هذا التحسن حقيقي جزئيًا ومنهجي جزئيًا. تشبّع الاختبارات المعيارية مشكلة معروفة. فبمجرد أن يصبح اختبار معياري مستشهَدًا به على نطاق واسع، تُدرَّب النماذج، صراحةً أو ضمنيًا، على بيانات تشبه مسائل ذلك الاختبار.

رسم بياني مطبوع لأداء الذكاء الاصطناعي في الاختبارات المعيارية على مكتب خشبي بجانب فنجان إسبريسو ودفتر حلزوني

هذا لا يعني أن النماذج لا تتحسن. بل يعني أن القفزة من 60% إلى 95% في اختبار محدد تبالغ في تقدير التحسن الحقيقي في الاستخدام الفعلي. التقدم الفعلي كبير، لكنه ليس دائمًا بالدراماتيكية التي توحي بها أرقام لوحات الترتيب. وكان رد مجتمع البحث إنشاء اختبارات معيارية أصعب وأكثر ديناميكية: مهام تشمل حل مسائل رياضية جديدة مستبعدة تحديدًا من بيانات التدريب، وكتابة شيفرة تعمل وتجتاز مجموعات اختبار غير مرئية، أو الإجابة عن أسئلة حول أحداث وقعت بعد تاريخ انتهاء التدريب.

كيف يبدو التقدم الحقيقي فعلًا

يُقاس التقدم الحقيقي على أفضل وجه عبر التقييمات العمياء، حيث يقارن البشر المخرجات دون معرفة النموذج الذي أنتجها. تُظهر هذه الاختبارات باستمرار أن أفضل النماذج اليوم تتفوق على نماذج 2023 في تقريبًا كل فئة مهام. وقد تحسّنت جودة الكتابة، وعمق الاستدلال، ودقة البرمجة، ودقة المعلومات بشكل ملموس.

💡 يمثّل Kimi K2 Instruct من Moonshot AI وKimi K2 Thinking فئة ناشئة من النماذج تؤدي أداءً ممتازًا في توليد الشيفرة والاستدلال متعدد الخطوات، وتقترب من القمة في التقييمات العمياء في 2025 و2026.

الخلاصة الصريحة: نماذج الذكاء الاصطناعي تتحسن فعلًا كل شهر. لكن الدرجة تختلف باختلاف المهمة. فالاستدلال والبرمجة تحسنا أكثر من غيرهما. والمحادثة العامة تحسنت بشكل معتدل. أما الاكتشاف العلمي الجديد فعلًا فيبقى المشكلة الأصعب.

من يقود السباق الشهري

واقع لوحة الترتيب الحالية

لم يعد مشهد نماذج الذكاء الاصطناعي في 2027 محكومًا بشركة واحدة. إنه سباق حقيقي بين عدة منافسين، تشتد فيه المنافسة في كل بُعد من أبعاد القدرة.

النموذجالمختبرأبرز نقاط قوته
GPT 5OpenAIالشمولية، اتباع التعليمات
Claude Opus 4.7Anthropicالاستدلال على سياق طويل، البرمجة
Gemini 3.1 ProGoogleالوسائط المتعددة، تحليل المستندات
Grok 4xAIالبيانات الفورية، الاستدلال العميق
DeepSeek R1DeepSeekالرياضيات، المنطق، كفاءة الحوسبة
Llama 4 MaverickMetaالأوزان المفتوحة، تنوع الاستخدامات

لا يفوز نموذج واحد في كل الفئات. تُحسّن كل شركة نقاط قوة مختلفة، ويدفع كل إصدار الآخرين إلى الرد. وهذا الضغط التنافسي هو في حد ذاته محرك رئيسي لوتيرة التحسن الشهرية.

ممر طويل لبنية تبريد مراكز البيانات مع شرائط LED زرقاء وأنابيب صناعية

الكلفة التحتية وراء كل هذا مذهلة. فتدريب واحد من الفئة العليا يكلّف عشرات الملايين من الدولارات. وتُبنى مراكز البيانات بوتيرة لم تُشهد منذ طفرة البنية التحتية للإنترنت. وتعرف كل شركة أنها إن أبطأت، سيستحوذ منافس على الريادة والسوق. هذا الوعي بنيوي، ومغروس في كل خارطة طريق وكل ميزانية ربع سنوية.

ماذا يعني هذا لتوليد صور الذكاء الاصطناعي

نماذج أفضل تعني صورًا أفضل

تنطبق على نماذج توليد الصور الديناميكيات نفسها التي تقود تحسّن النماذج اللغوية الكبيرة. فبيانات التدريب الأفضل، والمعماريات المحسّنة، ودورات التكرار الأسرع، غيّرت ما هو ممكن في صور الذكاء الاصطناعي.

مديرة إبداعية تراجع صورًا عالية الدقة على شاشة معايَرة الألوان في استوديو تصوير مظلم

قبل عامين، كانت نماذج توليد الصور تعاني مع الأيدي، والنصوص داخل الصور، والتكوينات المعقدة. أما اليوم، فتُنتج أفضل نماذج تحويل النص إلى صورة مخرجات واقعية كالصور الفوتوغرافية، ولا يُميّزها عن التصوير الحقيقي إلا فاحص خبير. وقد اتبع التحسن النمط نفسه الذي اتبعته النماذج اللغوية: حوسبة أكبر، وبيانات تدريب أفضل تشمل بيانات تعليقات مولّدة اصطناعيًا، وتحسينات معمارية مثل تحسين أخذ عينات الانتشار وتدريب الاتساق.

الوتيرة شهرية هنا أيضًا. تُطلق النماذج checkpoints جديدة، وتظهر إصدارات مضبوطة من المجتمع، ويرتفع مستوى القدرة الأساسية باستمرار. وإن لم تجرّب نماذج الصور من الجيل الحالي خلال الأشهر القليلة الماضية، فمن المرجح أن تفاجئك جودة المخرجات.

أبرز التحسينات التي تراكمت مع الوقت:

  • الالتزام بالأوامر: تتبع النماذج الآن التعليمات المفصّلة بدقة عالية
  • الواقعية الفوتوغرافية: ملمس البشرة، وفيزياء الإضاءة، وخصائص المواد أصبحت أدق بشكل كبير
  • الاتساق: تبقى الشخصيات والمشاهد متماسكة عبر عدة توليدات
  • الدقة: مخرجات 8K الأصلية تزداد شيوعًا دون معالجة لاحقة
  • السرعة: أزمنة التوليد التي كانت تستغرق دقائق أصبحت تستغرق ثوانٍ

أنشئ شيئًا بهذه النماذج الآن

لا تحتاج إلى انتظار الإصدار الشهري التالي لتستفيد من أفضل قدرات الذكاء الاصطناعي اليوم. يمنحك Picasso IA وصولًا مباشرًا إلى النماذج التي تقود هذا التقدم، ويشمل ذلك أفضل النماذج اللغوية الكبيرة للنصوص والاستدلال، إضافةً إلى مجموعة كاملة من نماذج تحويل النص إلى صورة القادرة على إنتاج صور واقعية عالية الجودة كانت مستحيلة قبل 18 شهرًا فقط.

شابة ذات شعر أسود مجعد تعمل على جهاز MacBook في مقهى مشمس بضوء الصباح الدافئ

تجمع المنصة 91 نموذجًا لتحويل النص إلى صورة، و87 نموذجًا لتوليد الفيديو، وأدوات رفع الدقة لتحسين أعمالك، ومجموعة كاملة من أبرز النماذج اللغوية في مكان واحد. يمكنك الدردشة مع GPT 5، والاستدلال على المسائل المعقدة باستخدام DeepSeek R1، وتوليد الصور بأفضل نماذج تحويل النص إلى صورة الحالية، أو تمرير صورك الموجودة عبر أداة رفع الدقة للحصول على مخرجات جاهزة للطباعة.

تعني دورة التحسين الشهرية أن المنصة تصبح أكثر قدرة في كل مرة يُطرح فيه checkpoint جديد. النماذج التي تستخدمها اليوم ستكون أفضل الشهر المقبل. وهذا ليس وعدًا، بل نمط مدعوم بثلاث سنوات من أدلة متسقة، تقوده عجلة الحوسبة، وحلقات البيانات الاصطناعية، وتعاون المصادر المفتوحة، والضغط التنافسي في سباق لا يستطيع فيه أحد التوقف.

اختر مشروعًا. افتح Picasso IA. وشاهد ما الذي ينتجه الجيل الحالي من الذكاء الاصطناعي فعلًا عندما تستخدمه.

شارك هذا المقال

اختر لغتك

مقالات ذات صلة