شهدت حرب الذكاء الاصطناعي فائزًا جديدًا. وصل Grok 4.20، أحدث إصدار من xAI، بثقة لا تطمح إليها معظم شركات الذكاء الاصطناعي إلا في أحلامها. لم يُطلق بهدوء مع بيان صحفي وقائمة من التحسينات الغامضة. خاض مواجهة مباشرة مع كل نموذج رئيسي في العالم، وخرج منها يبدو كبطل الوزن الثقيل. إذا كنت تتابع مجال الذكاء الاصطناعي خلال العامين الماضيين، فأنت تعرف أن التفوق المعلن يهم تقريبًا بقدر أرقام الاختبارات المعيارية. وقد حقق Grok 4.20 الأمرين معًا.

ماهية Grok 4.20 فعلًا
قبل أن ندخل في الأرقام، دعنا نوضح ما نتحدث عنه. Grok 4.20 هو الإصدار الرابع الكبير من سلسلة Grok لدى xAI، ويستند إلى بنية موسّعة بشكل ملحوظ مقارنةً بسابقاته. xAI، شركة أبحاث الذكاء الاصطناعي التي أسسها إيلون ماسك، تسير وفق جدول تطوير متسارع، وتطلق تحديثات للنماذج بوتيرة فاجأت المنافسين.
وتيرة التطوير في xAI
كان Grok 3 منافسًا جادًا عند إطلاقه، إذ حقق نتائج جيدة في اختبارات البرمجة وأظهر عمقًا حقيقيًا في الاستدلال فاجأ كثيرين في القطاع. لكن Grok 4.20 ليس مجرد Grok 3 مع تلميعات إضافية. تشمل التغييرات المعمارية بين الإصدارين نافذة سياق أكبر بكثير، وآلية سلسلة تفكير مُعاد هيكلتها، وما تصفه xAI بـ"البحث عن الحقيقة في الوقت الفعلي"، أي أن النموذج يحاول فعليًا التوفيق بين المعلومات المتعارضة بدلًا من اختيار الإجابة الأكثر احتمالًا إحصائيًا.
ما الذي تغيّر عن Grok 3
ثلاثة أمور هي الأهم هنا:
- نافذة السياق: توسّعت إلى 256 ألف توكن، لتساوي أو تتجاوز معظم المنافسين
- عمق الاستدلال: طبقة استدلال متعددة الخطوات مُعاد تصميمها، تتفوق على البنية السابقة في ألغاز المنطق والرياضيات
- الارتكاز على الواقع: تكامل أوثق مع البيانات الحية، ما يقلل معدلات الهلوسة في الاستعلامات القائمة على الحقائق
هذا ليس مجرد تحديث طفيف للإصدار. فالرقم .20 في الاسم يعكس جولة تدريب كبيرة بُنيت على بيانات جديدة وحلقات تغذية راجعة جديدة وضبط دقيق جديد، وهو ما يميّزه بوضوح عن الإصدارات السابقة.

مواجهة الاختبارات المعيارية
هنا تصبح الأرقام مثيرة للاهتمام. لم يُطلق Grok 4.20 ويُحتفَ به داخليًا فقط. فقد رسمت الاختبارات المستقلة ونتائج الاختبارات المعيارية العامة صورة واضحة.
البرمجة واختبار HumanEval
في اختبار HumanEval للبرمجة، سجّل Grok 4.20 نسبة 91.4%، متقدمًا على GPT-5 بنسبة 89.1% وعلى Claude 4 Sonnet بنسبة 88.7%. هذه ليست فجوة صغيرة. عند تصحيح الشيفرة الإنتاجية أو توليد دوال معقدة، تترجم هذه النقاط المئوية مباشرةً إلى أخطاء أقل وتصحيح يدوي أقل.
💡 عمليًا، يستطيع Grok 4.20 كتابة وحدات كاملة مختبرة بلغات Python وTypeScript وRust، بتكرارات أقل مما يحتاجه GPT-5 للمهمة نفسها.
ما يثير الإعجاب فعلًا في نتائج البرمجة هو الاتساق. تملك معظم النماذج قمم أداء في لغات معينة وانخفاضات في لغات أخرى. يُظهر Grok 4.20 أداءً متساويًا بشكل لافت عبر أنواع اللغات، ما يوحي بأن بيانات التدريب كانت متوازنة جيدًا وأن بنية الاستدلال تتعامل مع تعميم بنية الجمل البرمجية بكفاءة أكبر.
الاستدلال واختبار MMLU
يختبر معيار Massive Multitask Language Understanding (MMLU) المعرفة عبر 57 تخصصًا. حقق Grok 4.20 نسبة 90.8%، بينما توزعت المنافسة كما يلي:
هذه النتائج كلها متقاربة، ما يوضح أن الفئة العليا من نماذج الذكاء الاصطناعي تتنافس بجدية حاليًا. لكن Grok 4.20 يتصدر هذه القائمة، وهذا مهم لمن يختار نموذجًا لأعمال عالية المخاطر.
السرعة وإنتاجية التوكنات
وهنا يصبح الأمر عمليًا. لا يعني الذكاء الكثير إذا كان النموذج بطيئًا. يولّد Grok 4.20 في المتوسط 94 توكنًا في الثانية على أجهزة التشغيل القياسية، مقارنةً بنحو 78 توكنًا في الثانية لنموذج GPT-5. هذه الميزة في السرعة بنسبة 20% تُحدث فرقًا حقيقيًا في التطبيقات التي تتطلب استجابات سريعة، أو المحادثة الفورية، أو المعالجة المجمّعة على نطاق واسع.

Grok 4.20 مقابل GPT-5
كان GPT-5 من OpenAI الخيار الافتراضي لكثير من المطورين والشركات خلال العام الماضي. فهو قادر، وموثّق جيدًا، ويقف خلفه نظام بيئي ضخم. لكن Grok 4.20 يتفوق عليه في مجالات محددة مهمة جدًا.
أين يتفوق Grok
- دقة البرمجة: تفوّق بمقدار 2.3 نقطة مئوية في HumanEval
- السرعة: إنتاجية توكنات أسرع بنحو 20%
- البيانات الحية: الارتكاز المباشر على البيانات يقلل الهلوسة في الأحداث الحديثة
- الاستدلال الرياضي: أقوى في مسائل الرياضيات متعددة الخطوات، خاصة في الرياضيات التنافسية
أين يحافظ GPT-5 على موقعه
مزايا النظام البيئي لدى GPT-5 حقيقية. فدعم الإضافات، والانتشار الأوسع لواجهات API، والتكامل مع أدوات Microsoft، تعني أنه بالنسبة لعمليات النشر المؤسسية، يملك GPT-5 مزايا عملية لا تلتقطها أرقام الاختبارات المعيارية وحدها. كما تتمتع OpenAI بأداء قوي في مهام الكتابة الإبداعية، خاصة في تماسك السرد الطويل.
💡 إذا كنت تبني مساعدًا للبرمجة أو نظامًا للإجابة عن الأسئلة القائمة على الحقائق، فإن Grok 4.20 هو الخيار الأفضل اليوم. أما إذا كنت تبني شيئًا مدمجًا بعمق في بنية Microsoft التحتية، فتستحق ميزة النظام البيئي لدى GPT-5 أن تؤخذ في الحسبان.
يُعدّ GPT-5.2 وإصدار GPT-5 Mini الأخف من OpenAI بديلين جيدين لحالات استخدام مختلفة وميزانيات متفاوتة.

Grok 4.20 مقابل Claude 4 Sonnet
إن Claude 4 Sonnet من Anthropic ممتاز فعلًا. وهو ربما أكثر النماذج تأملًا في السوق عندما يتعلق الأمر بتنفيذ التعليمات الدقيقة، وضبط النبرة، والجودة الدقيقة للمخرجات. لطالما فضّلت نماذج Claude الجودة على السرعة، ويواصل Claude 4 Sonnet هذا التقليد.
فجوة الاستدلال
في اختبارات الاستدلال الخالصة، يتفوق Grok 4.20 على Claude 4 Sonnet. فاختبارات المنطق متعدد الخطوات، وأسئلة GPQA العلمية، ومسائل الرياضيات التنافسية، تُظهر جميعها تقدم Grok 4.20 على Claude بهامش ملحوظ. ومع ذلك، يختلف أسلوب الاستدلال لدى Claude. فبينما يميل Grok إلى الوصول سريعًا إلى إجابة واثقة، يتحفظ Claude أكثر، ويدرس التفسيرات البديلة، ويلفت الانتباه إلى الغموض. وبحسب حالة استخدامك، قد يكون أي من الأسلوبين أفضل.
جودة الكتابة
يبقى Claude 4 Sonnet الأفضل كاتبًا من الاثنين. إذا كنت تحتاج إلى محتوى طويل، أو اتساق في صوت العلامة التجارية، أو نبرة تحريرية دقيقة، فمخرجات Claude 4 Sonnet أكثر صقلًا وتحتاج إلى تحرير أقل. ويدفع إصدار Claude 4.5 Sonnet هذا الأمر إلى أبعد من ذلك.
| القدرة | Grok 4.20 | Claude 4 Sonnet |
|---|
| البرمجة | ✅ يتفوق | قوي |
| الاستدلال | ✅ يتفوق | قوي |
| الكتابة الإبداعية | جيد | ✅ يتفوق |
| السرعة | ✅ يتفوق | أبطأ |
| اتباع التعليمات | قوي | ✅ يتفوق |

Grok 4.20 مقابل Gemini 3 Pro
إن Gemini 3 Pro من Google هو القوة الكبرى متعددة الوسائط في الجيل الحالي. فعندما يتعلق الأمر بالجمع بين النص وتحليل الصور ومعالجة الفيديو والصوت في نموذج واحد، يتمتع Gemini بأفضلية بحكم تصميمه. فقد بنته Google منذ البداية للمهام متعددة الوسائط، وتظهر النتائج ذلك.
حين تنقلب الموازين
لكن في مهام اللغة الخالصة، يتفوق Grok 4.20 على Gemini 3 Pro بصورة أكثر اتساقًا. فالفجوة في MMLU ضيقة، إذ تبلغ 90.8% مقابل 89.1%، لكنها تظهر مرارًا عبر مجالات الاختبار المختلفة، ما يوحي بأنها بنيوية وليست عرضية. تتعامل نافذة السياق لدى Gemini 3 Pro بكفاءة، لكنها تُظهر تذبذبًا أكبر في المستندات الطويلة جدًا مقارنةً بـ Grok 4.20.
نظرة واقعية على الوسائط المتعددة
إذا كان سير عملك يتضمن تحليل الصور أو معالجة الفيديو أو التعامل مع مدخلات مختلطة الوسائط، فإن Gemini 3 Pro هو الخيار الأذكى. فقدرات الرؤية لديه أكثر تطورًا ببساطة. Grok 4.20 ليس مبنيًا أساسًا كنموذج متعدد الوسائط. بالنسبة لسير العمل النصي أو الذي يعتمد على النص أولًا، يفوز Grok. أما لأي شيء يتضمن صورًا أو فيديو إلى جانب النص، فلدى Gemini مزايا حقيقية.
💡 الخلاصة الصريحة: هذه أدوات مختلفة. يتفوق Grok 4.20 على Gemini في اختبارات النص، لكن Gemini 3 Pro هو الخيار الأفضل للتطبيقات متعددة الوسائط. اختر بناءً على حالة استخدامك الفعلية.
يستحق Gemini 2.5 Flash الأسرع أن تفكر فيه أيضًا، للتطبيقات الحساسة للتأخير حيث تكون مستعدًا للتضحية ببعض الدقة مقابل السرعة.

Grok 4.20 مقابل DeepSeek V3.1
إن DeepSeek V3.1 هو أكثر القصص إثارة في عالم الذكاء الاصطناعي حاليًا. مختبر صيني ينتج نماذج تنافس فعليًا أفضل المختبرات الأمريكية بجزء بسيط من ميزانية التدريب. لطالما تجاوزت DeepSeek حجمها باستمرار، و V3.1 هو أكثر إصداراتها صقلًا حتى الآن.
كفاءة التكلفة مقابل القوة الخام
لم تكن الميزة الأساسية لدى DeepSeek يومًا الأداء الخام في الاختبارات المعيارية، بل نسبة السعر إلى الأداء. يقدم DeepSeek V3.1 نتائج تقترب من جودة GPT-5 بجزء بسيط من تكلفة واجهة API. وهذه ميزة تنافسية حقيقية للمطورين والشركات التي تراقب إنفاقها على تشغيل النماذج.
يتفوق Grok 4.20 على DeepSeek V3.1 في قوائم الاختبارات المعيارية:
- MMLU: 90.8% لنموذج Grok مقابل 87.9% لنموذج DeepSeek V3.1
- HumanEval: 91.4% لـ Grok مقابل 85.2% لـ DeepSeek V3.1
- السرعة: Grok 4.20 أسرع على إعدادات التشغيل القياسية
لكن إذا كانت تكلفة كل مليون توكن هي العامل الحاسم لديك، فإن DeepSeek V3.1 وDeepSeek R1 يظلان خيارين جذابين فعلًا.
المتخصص في الاستدلال
يتبنى DeepSeek R1 نهجًا مختلفًا، إذ يركز تحديدًا على استدلال سلسلة التفكير من خلال التعلم المعزز. وهو لا يسعى لأن يكون نموذجًا عامًا. في مهام الرياضيات والاستدلال المنطقي المحددة، يستطيع R1 أن يجاري نماذج أكبر بكثير. ومع ذلك، يبقى Grok 4.20 هو الأفضل إجمالًا، لكن R1 يُظهر أن التخصص يمكنه تضييق الفجوات في مجالات مستهدفة بشكل ملحوظ.

أين ما زال لدى Grok 4.20 مجال للتحسن
لا يوجد نموذج مثالي، والنزاهة الفكرية تقتضي الاعتراف بالمواضع التي لم يحسم فيها Grok 4.20 الفوز بعد.
عمق الوسائط المتعددة
كما ذُكر سابقًا، فإن Grok 4.20 نموذج يعتمد على النص أولًا. وقد تحسنت قدرات الرؤية لديه بشكل ملحوظ منذ Grok 3، لكنه لا يضاهي Gemini 3 Pro في مهام الاستدلال البصري المعقدة. فإذا كنت تزوده بإنفوجرافيك كثيف أو تطلب منه تفسير الرسوم البيانية والمخططات بالتفصيل، فقد يتعثر مكوّن الرؤية في الحالات الحدّية.
الكتابة الإبداعية الطويلة
في المهام الإبداعية القصيرة، يتفوق Grok 4.20. أما في الكتابة الإبداعية الطويلة التي تتطلب صوتًا ثابتًا للشخصيات، وقوسًا سرديًا، واتساقًا في الأسلوب، فلا يزال Claude 4 Sonnet وClaude 4.5 Sonnet يتمتعان بالأفضلية. يميل Grok إلى المباشرة الواثقة، وهذا يناسب الكتابة التحليلية جيدًا، لكنه قد يُفقد الخيال حيويته.
نضج النظام البيئي
يمتلك GPT-5 عددًا أكبر من عمليات التكامل مع أطراف ثالثة، ومجتمع مطورين أكبر، وأدوات أكثر توثيقًا. وهذا مهم لعمليات النشر الإنتاجية حيث تكون الموثوقية والدعم وتوافق المكتبات الحالية أولويات. يلحق Grok 4.20 بالركب بسرعة، لكن فجوة النظام البيئي حقيقية وقابلة للقياس اليوم.
💡 يفوز Grok 4.20 في معركة الاختبارات المعيارية، لكنه لم يفز بعد في حرب النظام البيئي. كلاهما مهم، حسب ما تبنيه.

من يجب أن ينتقل فعلًا إلى Grok 4.20
سؤال "أي نموذج هو الأفضل" هو السؤال الخاطئ. السؤال الصحيح هو "أي نموذج هو الأفضل لهذه المهمة المحددة". ومع ذلك، يُعد Grok 4.20 أقوى نموذج عام للاستدلال والبرمجة متاح حاليًا.
إذا كان عملك هو تطوير البرمجيات، فإن Grok 4.20 هو الخيار الأول اليوم. درجات HumanEval أفضل، ومخرجات أسرع، وأداء قوي عبر لغات متعددة، وارتكاز فوري على الوثائق ومراجع API.
إذا كان عملك هو البحث وجمع المعلومات، فإن الارتكاز على البيانات الحية لدى Grok يمنحه أفضلية عملية على GPT-5 وClaude في الأسئلة المتعلقة بالأحداث الحديثة والمعلومات الراهنة.
إذا كان عملك هو الاستدلال الرياضي، فإن Grok 4.20 يتفوق باستمرار في الرياضيات التنافسية وحل المسائل متعددة الخطوات عبر كل المجالات التي جرى اختبارها.
إذا كان عملك يتضمن مدخلات متعددة الوسائط، أو الكتابة الإبداعية الطويلة، أو التكامل العميق مع أدوات Microsoft أو Google، فقد لا يكون خيارك الأمثل هو Grok 4.20. ومع ذلك، يستحق اختبار حالة استخدامك المحددة عليه. فمواقع النماذج في الاختبارات المعيارية لا تترجم دائمًا إلى تصنيفات في المهام الواقعية.

شغّل هذه النماذج الآن على PicassoIA
قراءة جداول الاختبارات المعيارية شيء، وتشغيل الأوامر النصية ومقارنة المخرجات بنفسك شيء آخر. الطريقة الوحيدة لمعرفة أفضل نموذج لعملك المحدد هي اختباره مباشرة.
تمنحك PicassoIA الوصول إلى كل اللاعبين الرئيسيين المذكورين في هذه المقالة في مكان واحد. لا حسابات API منفصلة، ولا إعدادات فوترة منفصلة، ولا تكاملات معقدة لكل مزود.
النماذج المتاحة الآن على PicassoIA:
كيف تختبر النماذج على PicassoIA
- انتقل إلى مجموعة النماذج اللغوية الكبيرة على PicassoIA
- اختر النموذج الذي تريد اختباره، مثل Grok-4
- أدخل الأمر النصي مباشرةً في الواجهة
- انتقل إلى نموذج منافس، وأدخل الأمر النصي نفسه
- قارن المخرجات جنبًا إلى جنب، وقيّم بناءً على احتياجاتك الفعلية
تفرض المنصة رسومًا على ما تستخدمه فقط، لذا تكلّف اختبارات المقارنة القليل جدًا. مئات قليلة من الأوامر النصية الموزعة على أربعة أو خمسة نماذج ستخبرك بأكثر مما تخبرك به أي جداول اختبارات معيارية.
💡 الفائز الحقيقي في أي معركة للذكاء الاصطناعي هو النموذج الذي يعمل بأفضل شكل لمهمتك المحددة. توقف عن قراءة تقارير الاختبارات المعيارية وابدأ في إجراء اختباراتك الخاصة.
إلى جانب النماذج اللغوية، تضم PicassoIA أيضًا واحدة من أوسع مجموعات أدوات توليد الصور المتاحة، بما في ذلك تحويل النص إلى صورة مع أكثر من 91 نموذجًا، وتحويل النص إلى فيديو مع أكثر من 87 نموذجًا، وأدوات متخصصة لرفع الدقة، وإزالة الخلفية، وتبديل الوجوه، ومزامنة الشفاه، وتحرير الفيديو. سواء كنت تبني منتجًا كاملًا يعمل بالذكاء الاصطناعي أو تجرّب ما هو ممكن اليوم، فإن الكتالوج يغطي مساحة أوسع من أي منصة أخرى متاحة الآن.
لقد فاز Grok 4.20 بمعركة كبيرة. لكن سباق الذكاء الاصطناعي لم ينتهِ، وقد يغيّر التحديث القادم لأي منافس الترتيب مرة أخرى. أذكى خطوة هي أن تبقى على اطلاع مباشر، وأن تواصل الاختبار، وألا تحصر نفسك في نموذج واحد عندما قد تظهر خيارات أفضل في الإصدار القادم.