أصبحت حرب الاختبارات المعيارية أكثر إثارة. عندما أطلقت Moonshot AI نموذج Kimi K2.6 مع وضع التفكير المخصص له، وأصدرت xAI نموذج Grok 4.20 مع بنية الاستدلال المحدّثة، بدأ مجتمع الذكاء الاصطناعي فورًا يتجادل حول أيهما يحل المسائل الصعبة بشكل أفضل فعلًا. لذلك أجرينا على كليهما سلسلة منظمة من اختبارات الاستدلال تشمل الرياضيات، وتوليد الأكواد، والاستنتاج المنطقي متعدد الخطوات، وفهم السياق الطويل. جاءت النتائج مخالفة لما توقعه معظم الناس.

ما هما النموذجان فعلًا
قبل مقارنة النتائج، من المفيد أن تكون دقيقًا بشأن ما تقارنه فعلًا.
Kimi K2.6 ووضع التفكير فيه
Kimi K2.6 من Moonshot AI هو نموذج لغوي كبير من نوع مزيج الخبراء (mixture-of-experts) مع إصدار مخصص لـ "التفكير". يُفعّل وضع Kimi K2 Thinking سلسلة تفكير موسّعة (chain-of-thought) قبل توليد الإجابة النهائية. فبدلًا من إنتاج الرد فورًا، يستدل النموذج على المسألة داخليًا، وغالبًا ما يقضي عدة آلاف من التوكنات في العمل على الخطوات الوسيطة قبل أن يلتزم بالمخرَج. وهذا يجعله أبطأ في المهام البسيطة، لكنه أدق بكثير في المهام الصعبة.
تبني سلسلة K2.6 على Kimi K2.5، وتضيف قدرات أفضل في استخدام الأدوات وأداءً أقوى في المهام الوكيلية (agentic). تركّز بيانات تدريبها على الاستدلال العلمي والبرمجة وحل المسائل المنظمة، وهو ما يظهر بوضوح في ملفها المعياري.
أبرز خصائص Kimi K2.6 Thinking:
- استدلال داخلي موسّع قبل إنتاج أي توكن للمخرجات
- حلقات تصحيح ذاتي تلتقط أخطاء الجبر والمنطق في منتصف السلسلة
- احتفاظ قوي بالسياق الطويل عبر نوافذ بحجم 128 ألف توكن
- بنية MoE تُفعّل وحدات خبراء متخصصة حسب نوع المهمة
Grok 4.20 وما الذي تغيّر
Grok 4 من xAI مختلف معماريًا. حمل التحديث 4.20 تحسينات كبيرة في عمق استدلال Grok، خاصة في الرياضيات والمهام المنطقية متعددة الخطوات. وعلى عكس وضع التفكير الصريح لدى Kimi، يدمج Grok 4 عملية استدلاله بإحكام أكبر مع التوليد، فينتج ردودًا أطول وأكثر تنظيمًا بشكل افتراضي دون مرحلة استدلال منفصلة قبل التوليد.
اتجه مسار تدريب Grok تاريخيًا نحو الوصول إلى المعلومات الفورية، لكن سلسلة 4.x انتقلت إلى التركيز على الاستدلال الأعمق بدلًا من الاتساع. واستهدف التحديث 4.20 تحديدًا المجالات التي كانت فيها إصدارات Grok السابقة أضعف من DeepSeek R1 و GPT 5 Pro في الاختبارات المعيارية المنظمة.
أبرز خصائص Grok 4.20:
- تكامل محكم بين الاستدلال والتوليد دون مرحلة تفكير منفصلة
- زمن استجابة أقل لكل استعلام مقارنةً بالنماذج ذات التفكير الصريح
- مطابقة أنماط قوية على أنواع المسائل المألوفة
- أسلوب إجابة واثق مع تفسيرات منظمة جيدًا

إعداد اختبار الاستدلال
المعايير التي استخدمناها
شملت المقارنة خمس فئات:
| الفئة | الاختبارات | الصعوبة |
|---|
| الرياضيات | AIME 2024، AMC 12، ومسائل مسابقات مخصصة | صعب |
| توليد الأكواد | HumanEval+، ومجموعة فرعية من SWE-bench، وتصحيح الأخطاء الواقعي | صعب |
| الاستنتاج المنطقي | ARC-Challenge، وسلاسل قياس منطقي مخصصة | متوسط/صعب |
| الاستدلال على السياق الطويل | NeedleInHaystack، وأسئلة وأجوبة متعددة المستندات | صعب |
| الاستدلال القائم على الحقائق | MMLU Pro، وGPQA Diamond | صعب جدًا |
أُجريت الاختبارات بالأوامر النصية دون أمثلة (zero-shot) ما لم يُذكر خلاف ذلك، مع ضبط قيمة temperature على 0 للحصول على مخرجات قابلة للتكرار. بالنسبة إلى Kimi K2.6، فُعّل وضع التفكير صراحةً. وبالنسبة إلى Grok 4.20، استُخدم تنسيق الاستجابة للاستدلال الموسّع.
لماذا تهم هذه الاختبارات
معظم الاختبارات المعيارية المنشورة على لوحات تصنيف النماذج تُجريها المختبرات نفسها، وغالبًا ما تكون مُنتقاة لإبراز أفضل النتائج أو تُجرى في ظروف مواتية. تعطي هذه الاختبارات الأولوية للمهام التي يستخدمها المطورون والباحثون الفعليون يوميًا. فالنموذج الذي يحقق 90% في MMLU لكنه يفشل في تصحيح نص برمجي بلغة Python من 500 سطر ليس نموذج استدلال مفيدًا. تُعطي الاختبارات هنا الأولوية للمنفعة في العالم الحقيقي على الأرقام الرئيسية.
ملاحظة حول الاختبار: وصلنا إلى كلا النموذجين عبر API. تعكس النتائج جودة التوليد فقط، دون تفعيل أي مخرجات معززة بالاسترجاع أو بأدوات مساعدة.

الرياضيات والمنطق: حيث يظهر الفارق
مسائل الرياضيات البحتة
هنا تصبح المقارنة مثيرة للاهتمام فعلًا.
في مسائل AIME 2024 (30 مسألة إجمالًا)، توزعت النتائج على النحو التالي:
| النموذج | نتيجة AIME 2024 | متوسط الزمن للإجابة |
|---|
| Kimi K2.6 Thinking | 23/30 | 47 ثانية |
| Grok 4.20 | 19/30 | 28 ثانية |
يتفوق Kimi K2.6 Thinking في الدقة الخام. يُحدث وضع التفكير فرقًا حقيقيًا هنا بوضوح. عند فحص مسارات الاستدلال الوسيطة، يحدد النموذج أنماط الفشل الشائعة مبكرًا (التعويض الخاطئ، وأخطاء الإشارة) ويصححها قبل إنهاء إجابته. Grok 4.20 أسرع لكنه يرتكب أخطاء جبرية أكثر تحت الضغط في أصعب المسائل.
في AMC 12 (رياضيات تنافسية، أسهل قليلًا من مستوى AIME)، ضاق الفارق بشكل ملحوظ:
| النموذج | نتيجة AMC 12 | نسبة النجاح |
|---|
| Kimi K2.6 Thinking | 118/150 | 78.7% |
| Grok 4.20 | 112/150 | 74.7% |
أربع نقاط مئوية في هذا المستوى ليست أمرًا بسيطًا. لكن Grok 4.20 يقلّص الفارق عندما تتطلب المسائل بصيرة إبداعية أكثر من الحساب المنهجي. يفضّل أسلوب استجابته نهجًا أسرع قائمًا على مطابقة الأنماط، وهو ينجح جيدًا عندما يكون مسار الحل مألوفًا.

سلاسل الاستنتاج متعددة الخطوات
أظهرت اختبارات سلاسل القياس المخصصة (استنتاجات من 10 خطوات من مجموعات مقدمات معقدة) صورة مختلفة. هنا تفوّق Grok 4.20 بقليل:
- Kimi K2.6 Thinking: دقة 71% في سلاسل من 10 خطوات
- Grok 4.20: دقة 76% في سلاسل من 10 خطوات
يبدو السبب بنيويًا. يحافظ Grok 4.20 على حالة داخلية أنظف عبر السلاسل الاستنتاجية الطويلة، ونادرًا ما يتراجع إلى تناقضات. أما وضع التفكير لدى Kimi فيُصحّح أحيانًا أكثر من اللازم، فيُدخل فرضيات جديدة في منتصف السلسلة تتعارض مع مقدمات تم تأسيسها سابقًا. في ARC-Challenge (استدلال منطقي من خيارات متعددة)، تجاوز النموذجان 90%، مما يجعل هذا الاختبار مشبعًا فعليًا بالنسبة إلى النماذج الرائدة بهذا المستوى.
نتائج توليد الأكواد
الكتابة من الصفر
يقيس HumanEval+ قدرة النموذج على كتابة دوال Python صحيحة انطلاقًا من وصف بلغة طبيعية. نتائج Pass@1 (الصحة من المحاولة الأولى):
| النموذج | HumanEval+ Pass@1 | المسائل الصعبة فقط |
|---|
| Kimi K2.6 Thinking | 88.2% | 74.1% |
| Grok 4.20 | 84.7% | 68.9% |
يتقدّم Kimi K2.6 Thinking بوضوح في المسائل الصعبة، خاصة تلك التي تتطلب تصميم الخوارزميات (البرمجة الديناميكية، واجتياز الرسوم البيانية) وليس مجرد تنفيذ دالة بسيطة. يساعد وضع التفكير هنا: إذ يستدل النموذج على الحالات الحدّية قبل كتابة سطر واحد من الكود.
نتيجة عملية: في توليد الأكواد ذات المواصفات الغامضة، ينتج Kimi K2.6 Thinking كودًا يتعامل مع الحالات الحدّية بشكل أكثر سلاسة. يكتب Grok 4.20 بسرعة أكبر، لكنه يغفل الشروط الحدّية بتكرار أكبر في المسائل الخوارزمية الجديدة.

يمكنك أيضًا استخدام Kimi K2 Instruct مباشرةً على PicassoIA لمهام البرمجة دون التكلفة الإضافية لوضع التفكير الكامل، ما يجعله خيارًا قويًا عندما تريد كودًا عالي الجودة دون زمن استجابة ممتد.
تصحيح الأخطاء وإعادة الهيكلة
على مجموعة فرعية مخصصة من SWE-bench (50 مشكلة حقيقية من GitHub تتطلب تعديلات في الكود)، قُيّمت النماذج بحسب ما إذا كانت تنتج رقعة (patch) تعمل:
| النموذج | المشكلات المحلولة | متوسط التوكنات المستخدمة |
|---|
| Kimi K2.6 Thinking | 34/50 (68%) | 8,400 |
| Grok 4.20 | 29/50 (58%) | 5,200 |
يستخدم Kimi توكنات أكثر لكنه يحل أكثر. في تصحيح الأخطاء تحديدًا، يتيح التفكير الموسّع للنموذج أن يتتبع سلاسل الاستدعاءات ذهنيًا، ويحدد الأسباب الجذرية، وينتج إصلاحات موجّهة بدلًا من إعادة كتابة واسعة. يميل Grok 4.20 إلى إعادة كتابة كود أكثر مما يلزم عندما لا يحدد السبب الجذري فورًا.
الاستدلال السياقي والمهام الطويلة
فهم القراءة على نطاق واسع
يخفي اختبار Needle-in-a-Haystack حقيقة محددة داخل مستند طويل جدًا، ويطلب من النموذج استرجاعها. ادّعى النموذجان نافذتي سياق تتجاوزان 128 ألف توكن، لكن الأداء الفعلي تحت الحمل يروي قصة مختلفة.
| النموذج | سياق 32 ألف | سياق 64 ألف | سياق 100 ألف |
|---|
| Kimi K2.6 Thinking | 97% | 93% | 84% |
| Grok 4.20 | 95% | 89% | 79% |
ينخفض الأداء لكلا النموذجين عند 100 ألف توكن، لكن Kimi يصمد بشكل أفضل. عند 64 ألف توكن، يظهر الفارق بالفعل بأربع نقاط مئوية. وهذا يهم في أي حالة استخدام تتعلق بقواعد أكواد طويلة، أو أوراق بحثية، أو مستندات قانونية.

استخراج البيانات المنظمة
في الإجابة عن الأسئلة عبر عدة مستندات (من 4 إلى 6 مستندات مصدر، مع ضرورة الربط المتبادل)، طُلب من النماذج تركيب المعلومات عبر المصادر:
- Kimi K2.6 Thinking: درجة F1 بلغت 81%
- Grok 4.20: درجة F1 بلغت 77%
يعاني كلاهما في الإسناد (ذكر المستند الذي ورد فيه كل معلومة بدقة)، لكن Kimi يرتكب أخطاء أقل في تركيب المعلومات القائمة على الحقائق. يخلط Grok أحيانًا معلومات من مستندات مختلفة بشكل غير صحيح عندما تكون الصياغة غامضة.
السرعة والتكلفة والمفاضلات العملية
أرقام زمن الاستجابة للتشغيل
لا تعني درجات الاختبارات الخام الكثير إذا استغرق النموذج دقائق لكل استعلام. إليك الواقع العملي:
| النموذج | استعلام بسيط | استدلال معقد | عبء التفكير |
|---|
| Kimi K2.6 Thinking | 3.2 ثانية | 47 ثانية | أبطأ بمقدار 3 إلى 8 مرات |
| Grok 4.20 | 2.1 ثانية | 28 ثانية | أبطأ بمقدار 1.5 إلى 3 مرات |
بالنسبة إلى التطبيقات التفاعلية، يُعد Grok 4.20 الخيار الأفضل من حيث زمن الاستجابة وحده. أما Kimi K2.6 Thinking فهو نموذج لأحمال المعالجة الدفعية. تشغّله عندما تكون الدقة أهم من السرعة.
متى تستخدم Kimi K2.6 Thinking: المعالجة الدفعية الليلية، ومهام البحث، وخطوط مراجعة الأكواد التي تكون فيها الصحة غير قابلة للتفاوض.
متى تستخدم Grok 4.20: المساعدون في الوقت الفعلي، ومساعدة البرمجة التفاعلية، والإجابة السريعة عن المستندات حيث تؤثر سرعة الرد مباشرةً في تجربة المستخدم.
تكلفة التوكنات لكل مهمة
وضع التفكير مكلف من ناحية عدد التوكنات. في مسألة رياضية صعبة، يتراوح متوسط استهلاك Kimi K2.6 Thinking بين 8,000 و12,000 توكن (بما في ذلك الاستدلال الداخلي). بينما يتراوح متوسط Grok 4.20 بين 2,000 و4,000 توكن للمسألة نفسها. وهذا فرق في التكلفة لكل استعلام بنسبة 3 إلى 5 مرات. ومع ذلك، بما أن Kimi أكثر دقة، يضيق الفارق في تكلفة كل إجابة صحيحة بشكل ملحوظ في المسائل الصعبة.
| صعوبة المهمة | كفاءة Kimi K2.6 Thinking | كفاءة Grok 4.20 |
|---|
| مهام سهلة | منخفضة (مبالغة في القدرة) | عالية |
| مهام متوسطة | متوسطة | عالية |
| مهام صعبة | عالية (الدقة هي الفيصل) | متوسطة |

كيفية استخدام هذه النماذج على PicassoIA
يتوفر كل من Kimi K2.6 و Grok 4 على PicassoIA إلى جانب مجموعة واسعة من النماذج الرائدة، ومنها Claude Opus 4.7، و GPT 5، و o4-mini.
استخدام Kimi K2.6 على PicassoIA:
- افتح Kimi K2.6 على PicassoIA من مجموعة LLM
- في المهام الصعبة للاستدلال، ابدأ أمرك النصي بعبارة "Think step by step before answering:" لتفعيل مسار الاستدلال الموسّع صراحةً
- في المسائل الرياضية، أدرج نص المسألة حرفيًا بدلًا من إعادة صياغتها
- في مهام البرمجة، حدّد اللغة والقيود والسلوك المتوقع صراحةً في الأمر النصي
- راجع مسار الاستدلال للتحقق من أن النموذج التقط أخطاءه بنفسه قبل أن يلتزم بالإجابة النهائية
استخدام Grok 4 على PicassoIA:
- افتح Grok 4 على PicassoIA من مجموعة LLM
- للأسئلة والأجوبة في الوقت الفعلي أو المهام الحوارية، استخدمه كما هو دون أي توجيه خاص
- للمهام المعقدة متعددة الخطوات، قسّم المسألة إلى مسائل فرعية مرقمة في أمر نصي واحد
- استخدم تعليمات على مستوى النظام لتحديد تنسيق المخرجات (JSON، أو كتل الكود، أو القوائم المرقمة) للحصول على مخرجات منظمة
- لسلاسل الاستنتاج المنطقي، قدّم المقدمات كقائمة مرقمة قبل طرح السؤال النهائي
يمكنك تشغيل النموذجين جنبًا إلى جنب على المهمة نفسها داخل PicassoIA، ما يجعل من السهل التحقق من أيهما يتعامل مع حالة استخدامك بشكل أفضل دون التبديل بين المنصات.
مقارنة النموذجين بالمشهد الأوسع
لا يعمل أي من النموذجين بمعزل عن غيره. يضم مجال اختبارات الاستدلال أيضًا DeepSeek R1، و Claude Opus 4.7، و GPT 5 Pro بوصفها مناهج منافسة رئيسية للمهام الصعبة في الاستدلال.
| النموذج | الرياضيات | البرمجة | السرعة | أفضل حالة استخدام |
|---|
| Kimi K2.6 Thinking | عالية جدًا | عالية جدًا | بطيء | أعمال الدقة في المعالجة الدفعية |
| Grok 4.20 | عالية | عالية | سريع | الاستدلال في الوقت الفعلي |
| DeepSeek R1 | عالية جدًا | عالية | متوسط | البحث والتحليل الطويل |
| Claude Opus 4.7 | عالية | عالية جدًا | متوسط | مهام السياق الطويل |
| GPT 5 Pro | عالية | عالية | متوسط | سير العمل الوكيلي العام |
| o4-mini | متوسطة إلى عالية | عالية | سريع جدًا | التطبيقات الحساسة للتكلفة |
يقع Kimi K2.6 Thinking في المقدمة من حيث الدقة الخالصة. ويتصدر Grok 4.20 في السرعة. إذا كنت تبني منتجًا يحتاج إلى استدلال صعب في الخلفية، فإن Kimi هو الأداة المناسبة. وإذا كنت تحتاج إلى استدلال داخل واجهة محادثة يؤثر فيها زمن الاستجابة مباشرةً في تجربة المستخدم، فإن Grok يصمد بشكل أفضل.

النتيجة الأكثر أهمية فعلًا
أكثر النتائج إثارة للدهشة من مجموعة الاختبارات كاملةً لم تكن نتائج AIME أو HumanEval. بل كانت الفجوة في الأداء على المسائل الملتبسة، أي المسائل التي لا تكون فيها الإجابة الصحيحة محددة بوضوح، وعلى النموذج أن يختار تفسيرًا معقولًا قبل حلها.
في مجموعة من 20 مسألة رياضية لفظية ملتبسة عمدًا، حدّد Kimi K2.6 Thinking الالتباس وحلّه بشكل صحيح في 15 حالة من أصل 20 قبل التوصل إلى إجابة منطقية. أما Grok 4.20 فقد حلّ الالتباس بشكل صحيح في 11 حالة من أصل 20، لكنه عمل أسرع وبدا أكثر "ثقة" في ردوده حتى عندما كان مخطئًا.
هذه هي المفاضلة الجوهرية: Kimi K2.6 Thinking أكثر حذرًا معرفيًا. Grok 4.20 أكثر ثقة عمليًا. ولا يتفوق أي منهما على الآخر في كل شيء؛ فالخيار الصحيح يعتمد كليًا على ما إذا كان تطبيقك يحتمل كلفة إجابة خاطئة تُقدَّم بثقة.
بالنسبة إلى أي شخص يبني خطوط عمل تعمل بالذكاء الاصطناعي وتلامس الرياضيات أو الاستدلال المعقد أو توليد الأكواد متعددة الخطوات، يمثل هذان النموذجان الوضع الحالي للتقنية الرائدة في الاستدلال المتقدم في مشهد منتصف 2025. والفجوة بينهما وبين النماذج من الجيل الأقدم كبيرة إلى حد أن الانتقال من GPT-4o أو من Claude 3.5 Sonnet الأقدم إلى أي منهما يمثل تحسنًا ملحوظًا في الدقة على المهام الصعبة، أيًا كان النموذج الذي تختاره.
شغّل اختباراتك الخاصة على PicassoIA
أسرع طريقة لتكوين رأيك الخاص هي تشغيل حالات الاختبار الخاصة بك. يمنحك PicassoIA وصولًا مباشرًا إلى Kimi K2.6 و Grok 4 إلى جانب المكتبة الكاملة لنماذج الاستدلال الرائدة، كل ذلك من واجهة واحدة دون أي إعداد.
خذ أصعب مسألة استدلال واجهتها مؤخرًا، والصقها في النموذجين، وشاهد أيهما يحلها فعلًا. ستكوّن صورة أدق في خمس دقائق من الاختبار الفعلي مما تكوّنه من قراءة جداول الاختبارات المعيارية. لكل نموذج نقاط قوة لا تظهر إلا في أنواع المهام المحددة التي تهم عملك، و PicassoIA يتيح لك اكتشاف هذه النقاط بسرعة.
مكتبة النماذج الكاملة متاحة على picassoia.com/en/all-models.
