Kimi K2.6 Thinking مقابل Grok 4.20: نتائج اختبار الاستدلال التي ستفاجئك

مواجهة مباشرة في الاستدلال بين Kimi K2.6 Thinking وGrok 4.20، تشمل حل المسائل الرياضية وتوليد الأكواد والاستنتاج المنطقي ونتائج اختبارات معيارية حقيقية، لنعرف أي نموذج يقدّم استدلالًا أفضل فعلًا متعدد الخطوات في 2027.

Kimi K2.6 Thinking مقابل Grok 4.20: نتائج اختبار الاستدلال التي ستفاجئك
Cristian Da Conceicao
مؤسس Picasso IA

أصبحت حرب الاختبارات المعيارية أكثر إثارة. عندما أطلقت Moonshot AI نموذج Kimi K2.6 مع وضع التفكير المخصص له، وأصدرت xAI نموذج Grok 4.20 مع بنية الاستدلال المحدّثة، بدأ مجتمع الذكاء الاصطناعي فورًا يتجادل حول أيهما يحل المسائل الصعبة بشكل أفضل فعلًا. لذلك أجرينا على كليهما سلسلة منظمة من اختبارات الاستدلال تشمل الرياضيات، وتوليد الأكواد، والاستنتاج المنطقي متعدد الخطوات، وفهم السياق الطويل. جاءت النتائج مخالفة لما توقعه معظم الناس.

باحث يحلل نتائج الاختبارات المعيارية على مكتب مغطى بالرسوم البيانية المطبوعة

ما هما النموذجان فعلًا

قبل مقارنة النتائج، من المفيد أن تكون دقيقًا بشأن ما تقارنه فعلًا.

Kimi K2.6 ووضع التفكير فيه

Kimi K2.6 من Moonshot AI هو نموذج لغوي كبير من نوع مزيج الخبراء (mixture-of-experts) مع إصدار مخصص لـ "التفكير". يُفعّل وضع Kimi K2 Thinking سلسلة تفكير موسّعة (chain-of-thought) قبل توليد الإجابة النهائية. فبدلًا من إنتاج الرد فورًا، يستدل النموذج على المسألة داخليًا، وغالبًا ما يقضي عدة آلاف من التوكنات في العمل على الخطوات الوسيطة قبل أن يلتزم بالمخرَج. وهذا يجعله أبطأ في المهام البسيطة، لكنه أدق بكثير في المهام الصعبة.

تبني سلسلة K2.6 على Kimi K2.5، وتضيف قدرات أفضل في استخدام الأدوات وأداءً أقوى في المهام الوكيلية (agentic). تركّز بيانات تدريبها على الاستدلال العلمي والبرمجة وحل المسائل المنظمة، وهو ما يظهر بوضوح في ملفها المعياري.

أبرز خصائص Kimi K2.6 Thinking:

  • استدلال داخلي موسّع قبل إنتاج أي توكن للمخرجات
  • حلقات تصحيح ذاتي تلتقط أخطاء الجبر والمنطق في منتصف السلسلة
  • احتفاظ قوي بالسياق الطويل عبر نوافذ بحجم 128 ألف توكن
  • بنية MoE تُفعّل وحدات خبراء متخصصة حسب نوع المهمة

Grok 4.20 وما الذي تغيّر

Grok 4 من xAI مختلف معماريًا. حمل التحديث 4.20 تحسينات كبيرة في عمق استدلال Grok، خاصة في الرياضيات والمهام المنطقية متعددة الخطوات. وعلى عكس وضع التفكير الصريح لدى Kimi، يدمج Grok 4 عملية استدلاله بإحكام أكبر مع التوليد، فينتج ردودًا أطول وأكثر تنظيمًا بشكل افتراضي دون مرحلة استدلال منفصلة قبل التوليد.

اتجه مسار تدريب Grok تاريخيًا نحو الوصول إلى المعلومات الفورية، لكن سلسلة 4.x انتقلت إلى التركيز على الاستدلال الأعمق بدلًا من الاتساع. واستهدف التحديث 4.20 تحديدًا المجالات التي كانت فيها إصدارات Grok السابقة أضعف من DeepSeek R1 و GPT 5 Pro في الاختبارات المعيارية المنظمة.

أبرز خصائص Grok 4.20:

  • تكامل محكم بين الاستدلال والتوليد دون مرحلة تفكير منفصلة
  • زمن استجابة أقل لكل استعلام مقارنةً بالنماذج ذات التفكير الصريح
  • مطابقة أنماط قوية على أنواع المسائل المألوفة
  • أسلوب إجابة واثق مع تفسيرات منظمة جيدًا

سبورة مغطاة بمعادلات رياضية وبراهين منطقية

إعداد اختبار الاستدلال

المعايير التي استخدمناها

شملت المقارنة خمس فئات:

الفئةالاختباراتالصعوبة
الرياضياتAIME 2024، AMC 12، ومسائل مسابقات مخصصةصعب
توليد الأكوادHumanEval+، ومجموعة فرعية من SWE-bench، وتصحيح الأخطاء الواقعيصعب
الاستنتاج المنطقيARC-Challenge، وسلاسل قياس منطقي مخصصةمتوسط/صعب
الاستدلال على السياق الطويلNeedleInHaystack، وأسئلة وأجوبة متعددة المستنداتصعب
الاستدلال القائم على الحقائقMMLU Pro، وGPQA Diamondصعب جدًا

أُجريت الاختبارات بالأوامر النصية دون أمثلة (zero-shot) ما لم يُذكر خلاف ذلك، مع ضبط قيمة temperature على 0 للحصول على مخرجات قابلة للتكرار. بالنسبة إلى Kimi K2.6، فُعّل وضع التفكير صراحةً. وبالنسبة إلى Grok 4.20، استُخدم تنسيق الاستجابة للاستدلال الموسّع.

لماذا تهم هذه الاختبارات

معظم الاختبارات المعيارية المنشورة على لوحات تصنيف النماذج تُجريها المختبرات نفسها، وغالبًا ما تكون مُنتقاة لإبراز أفضل النتائج أو تُجرى في ظروف مواتية. تعطي هذه الاختبارات الأولوية للمهام التي يستخدمها المطورون والباحثون الفعليون يوميًا. فالنموذج الذي يحقق 90% في MMLU لكنه يفشل في تصحيح نص برمجي بلغة Python من 500 سطر ليس نموذج استدلال مفيدًا. تُعطي الاختبارات هنا الأولوية للمنفعة في العالم الحقيقي على الأرقام الرئيسية.

ملاحظة حول الاختبار: وصلنا إلى كلا النموذجين عبر API. تعكس النتائج جودة التوليد فقط، دون تفعيل أي مخرجات معززة بالاسترجاع أو بأدوات مساعدة.

منظر علوي لمكتب باحث عليه دفاتر مفتوحة مليئة بشبكات نتائج الاختبارات

الرياضيات والمنطق: حيث يظهر الفارق

مسائل الرياضيات البحتة

هنا تصبح المقارنة مثيرة للاهتمام فعلًا.

في مسائل AIME 2024 (30 مسألة إجمالًا)، توزعت النتائج على النحو التالي:

النموذجنتيجة AIME 2024متوسط الزمن للإجابة
Kimi K2.6 Thinking23/3047 ثانية
Grok 4.2019/3028 ثانية

يتفوق Kimi K2.6 Thinking في الدقة الخام. يُحدث وضع التفكير فرقًا حقيقيًا هنا بوضوح. عند فحص مسارات الاستدلال الوسيطة، يحدد النموذج أنماط الفشل الشائعة مبكرًا (التعويض الخاطئ، وأخطاء الإشارة) ويصححها قبل إنهاء إجابته. Grok 4.20 أسرع لكنه يرتكب أخطاء جبرية أكثر تحت الضغط في أصعب المسائل.

في AMC 12 (رياضيات تنافسية، أسهل قليلًا من مستوى AIME)، ضاق الفارق بشكل ملحوظ:

النموذجنتيجة AMC 12نسبة النجاح
Kimi K2.6 Thinking118/15078.7%
Grok 4.20112/15074.7%

أربع نقاط مئوية في هذا المستوى ليست أمرًا بسيطًا. لكن Grok 4.20 يقلّص الفارق عندما تتطلب المسائل بصيرة إبداعية أكثر من الحساب المنهجي. يفضّل أسلوب استجابته نهجًا أسرع قائمًا على مطابقة الأنماط، وهو ينجح جيدًا عندما يكون مسار الحل مألوفًا.

لاعبا شطرنج في منتصف مباراة على طاولة مكتبة، ولوحة الشطرنج واضحة في المقدمة

سلاسل الاستنتاج متعددة الخطوات

أظهرت اختبارات سلاسل القياس المخصصة (استنتاجات من 10 خطوات من مجموعات مقدمات معقدة) صورة مختلفة. هنا تفوّق Grok 4.20 بقليل:

  • Kimi K2.6 Thinking: دقة 71% في سلاسل من 10 خطوات
  • Grok 4.20: دقة 76% في سلاسل من 10 خطوات

يبدو السبب بنيويًا. يحافظ Grok 4.20 على حالة داخلية أنظف عبر السلاسل الاستنتاجية الطويلة، ونادرًا ما يتراجع إلى تناقضات. أما وضع التفكير لدى Kimi فيُصحّح أحيانًا أكثر من اللازم، فيُدخل فرضيات جديدة في منتصف السلسلة تتعارض مع مقدمات تم تأسيسها سابقًا. في ARC-Challenge (استدلال منطقي من خيارات متعددة)، تجاوز النموذجان 90%، مما يجعل هذا الاختبار مشبعًا فعليًا بالنسبة إلى النماذج الرائدة بهذا المستوى.

نتائج توليد الأكواد

الكتابة من الصفر

يقيس HumanEval+ قدرة النموذج على كتابة دوال Python صحيحة انطلاقًا من وصف بلغة طبيعية. نتائج Pass@1 (الصحة من المحاولة الأولى):

النموذجHumanEval+ Pass@1المسائل الصعبة فقط
Kimi K2.6 Thinking88.2%74.1%
Grok 4.2084.7%68.9%

يتقدّم Kimi K2.6 Thinking بوضوح في المسائل الصعبة، خاصة تلك التي تتطلب تصميم الخوارزميات (البرمجة الديناميكية، واجتياز الرسوم البيانية) وليس مجرد تنفيذ دالة بسيطة. يساعد وضع التفكير هنا: إذ يستدل النموذج على الحالات الحدّية قبل كتابة سطر واحد من الكود.

نتيجة عملية: في توليد الأكواد ذات المواصفات الغامضة، ينتج Kimi K2.6 Thinking كودًا يتعامل مع الحالات الحدّية بشكل أكثر سلاسة. يكتب Grok 4.20 بسرعة أكبر، لكنه يغفل الشروط الحدّية بتكرار أكبر في المسائل الخوارزمية الجديدة.

مطوّرة تكتب على لوحة مفاتيح ميكانيكية، وإضاءة الشاشة تنير وجهها ليلًا

يمكنك أيضًا استخدام Kimi K2 Instruct مباشرةً على PicassoIA لمهام البرمجة دون التكلفة الإضافية لوضع التفكير الكامل، ما يجعله خيارًا قويًا عندما تريد كودًا عالي الجودة دون زمن استجابة ممتد.

تصحيح الأخطاء وإعادة الهيكلة

على مجموعة فرعية مخصصة من SWE-bench (50 مشكلة حقيقية من GitHub تتطلب تعديلات في الكود)، قُيّمت النماذج بحسب ما إذا كانت تنتج رقعة (patch) تعمل:

النموذجالمشكلات المحلولةمتوسط التوكنات المستخدمة
Kimi K2.6 Thinking34/50 (68%)8,400
Grok 4.2029/50 (58%)5,200

يستخدم Kimi توكنات أكثر لكنه يحل أكثر. في تصحيح الأخطاء تحديدًا، يتيح التفكير الموسّع للنموذج أن يتتبع سلاسل الاستدعاءات ذهنيًا، ويحدد الأسباب الجذرية، وينتج إصلاحات موجّهة بدلًا من إعادة كتابة واسعة. يميل Grok 4.20 إلى إعادة كتابة كود أكثر مما يلزم عندما لا يحدد السبب الجذري فورًا.

الاستدلال السياقي والمهام الطويلة

فهم القراءة على نطاق واسع

يخفي اختبار Needle-in-a-Haystack حقيقة محددة داخل مستند طويل جدًا، ويطلب من النموذج استرجاعها. ادّعى النموذجان نافذتي سياق تتجاوزان 128 ألف توكن، لكن الأداء الفعلي تحت الحمل يروي قصة مختلفة.

النموذجسياق 32 ألفسياق 64 ألفسياق 100 ألف
Kimi K2.6 Thinking97%93%84%
Grok 4.2095%89%79%

ينخفض الأداء لكلا النموذجين عند 100 ألف توكن، لكن Kimi يصمد بشكل أفضل. عند 64 ألف توكن، يظهر الفارق بالفعل بأربع نقاط مئوية. وهذا يهم في أي حالة استخدام تتعلق بقواعد أكواد طويلة، أو أوراق بحثية، أو مستندات قانونية.

لقطة مقرّبة لرسم بياني مطبوع يُظهر مخططين خطيين متداخلين على ورق فوق مكتب من خشب الجوز

استخراج البيانات المنظمة

في الإجابة عن الأسئلة عبر عدة مستندات (من 4 إلى 6 مستندات مصدر، مع ضرورة الربط المتبادل)، طُلب من النماذج تركيب المعلومات عبر المصادر:

  • Kimi K2.6 Thinking: درجة F1 بلغت 81%
  • Grok 4.20: درجة F1 بلغت 77%

يعاني كلاهما في الإسناد (ذكر المستند الذي ورد فيه كل معلومة بدقة)، لكن Kimi يرتكب أخطاء أقل في تركيب المعلومات القائمة على الحقائق. يخلط Grok أحيانًا معلومات من مستندات مختلفة بشكل غير صحيح عندما تكون الصياغة غامضة.

السرعة والتكلفة والمفاضلات العملية

أرقام زمن الاستجابة للتشغيل

لا تعني درجات الاختبارات الخام الكثير إذا استغرق النموذج دقائق لكل استعلام. إليك الواقع العملي:

النموذجاستعلام بسيطاستدلال معقدعبء التفكير
Kimi K2.6 Thinking3.2 ثانية47 ثانيةأبطأ بمقدار 3 إلى 8 مرات
Grok 4.202.1 ثانية28 ثانيةأبطأ بمقدار 1.5 إلى 3 مرات

بالنسبة إلى التطبيقات التفاعلية، يُعد Grok 4.20 الخيار الأفضل من حيث زمن الاستجابة وحده. أما Kimi K2.6 Thinking فهو نموذج لأحمال المعالجة الدفعية. تشغّله عندما تكون الدقة أهم من السرعة.

متى تستخدم Kimi K2.6 Thinking: المعالجة الدفعية الليلية، ومهام البحث، وخطوط مراجعة الأكواد التي تكون فيها الصحة غير قابلة للتفاوض.

متى تستخدم Grok 4.20: المساعدون في الوقت الفعلي، ومساعدة البرمجة التفاعلية، والإجابة السريعة عن المستندات حيث تؤثر سرعة الرد مباشرةً في تجربة المستخدم.

تكلفة التوكنات لكل مهمة

وضع التفكير مكلف من ناحية عدد التوكنات. في مسألة رياضية صعبة، يتراوح متوسط استهلاك Kimi K2.6 Thinking بين 8,000 و12,000 توكن (بما في ذلك الاستدلال الداخلي). بينما يتراوح متوسط Grok 4.20 بين 2,000 و4,000 توكن للمسألة نفسها. وهذا فرق في التكلفة لكل استعلام بنسبة 3 إلى 5 مرات. ومع ذلك، بما أن Kimi أكثر دقة، يضيق الفارق في تكلفة كل إجابة صحيحة بشكل ملحوظ في المسائل الصعبة.

صعوبة المهمةكفاءة Kimi K2.6 Thinkingكفاءة Grok 4.20
مهام سهلةمنخفضة (مبالغة في القدرة)عالية
مهام متوسطةمتوسطةعالية
مهام صعبةعالية (الدقة هي الفيصل)متوسطة

مجموعة من التقارير المعيارية الأكاديمية المطبوعة مفتوحة على مكتب من خشب الماهوغني مع نظارة قراءة

كيفية استخدام هذه النماذج على PicassoIA

يتوفر كل من Kimi K2.6 و Grok 4 على PicassoIA إلى جانب مجموعة واسعة من النماذج الرائدة، ومنها Claude Opus 4.7، و GPT 5، و o4-mini.

استخدام Kimi K2.6 على PicassoIA:

  1. افتح Kimi K2.6 على PicassoIA من مجموعة LLM
  2. في المهام الصعبة للاستدلال، ابدأ أمرك النصي بعبارة "Think step by step before answering:" لتفعيل مسار الاستدلال الموسّع صراحةً
  3. في المسائل الرياضية، أدرج نص المسألة حرفيًا بدلًا من إعادة صياغتها
  4. في مهام البرمجة، حدّد اللغة والقيود والسلوك المتوقع صراحةً في الأمر النصي
  5. راجع مسار الاستدلال للتحقق من أن النموذج التقط أخطاءه بنفسه قبل أن يلتزم بالإجابة النهائية

استخدام Grok 4 على PicassoIA:

  1. افتح Grok 4 على PicassoIA من مجموعة LLM
  2. للأسئلة والأجوبة في الوقت الفعلي أو المهام الحوارية، استخدمه كما هو دون أي توجيه خاص
  3. للمهام المعقدة متعددة الخطوات، قسّم المسألة إلى مسائل فرعية مرقمة في أمر نصي واحد
  4. استخدم تعليمات على مستوى النظام لتحديد تنسيق المخرجات (JSON، أو كتل الكود، أو القوائم المرقمة) للحصول على مخرجات منظمة
  5. لسلاسل الاستنتاج المنطقي، قدّم المقدمات كقائمة مرقمة قبل طرح السؤال النهائي

يمكنك تشغيل النموذجين جنبًا إلى جنب على المهمة نفسها داخل PicassoIA، ما يجعل من السهل التحقق من أيهما يتعامل مع حالة استخدامك بشكل أفضل دون التبديل بين المنصات.

مقارنة النموذجين بالمشهد الأوسع

لا يعمل أي من النموذجين بمعزل عن غيره. يضم مجال اختبارات الاستدلال أيضًا DeepSeek R1، و Claude Opus 4.7، و GPT 5 Pro بوصفها مناهج منافسة رئيسية للمهام الصعبة في الاستدلال.

النموذجالرياضياتالبرمجةالسرعةأفضل حالة استخدام
Kimi K2.6 Thinkingعالية جدًاعالية جدًابطيءأعمال الدقة في المعالجة الدفعية
Grok 4.20عاليةعاليةسريعالاستدلال في الوقت الفعلي
DeepSeek R1عالية جدًاعاليةمتوسطالبحث والتحليل الطويل
Claude Opus 4.7عاليةعالية جدًامتوسطمهام السياق الطويل
GPT 5 Proعاليةعاليةمتوسطسير العمل الوكيلي العام
o4-miniمتوسطة إلى عاليةعاليةسريع جدًاالتطبيقات الحساسة للتكلفة

يقع Kimi K2.6 Thinking في المقدمة من حيث الدقة الخالصة. ويتصدر Grok 4.20 في السرعة. إذا كنت تبني منتجًا يحتاج إلى استدلال صعب في الخلفية، فإن Kimi هو الأداة المناسبة. وإذا كنت تحتاج إلى استدلال داخل واجهة محادثة يؤثر فيها زمن الاستجابة مباشرةً في تجربة المستخدم، فإن Grok يصمد بشكل أفضل.

داخل غرفة خوادم عالية التقنية بصفوف من خزائن الخوادم السوداء وحزم من الكابلات

النتيجة الأكثر أهمية فعلًا

أكثر النتائج إثارة للدهشة من مجموعة الاختبارات كاملةً لم تكن نتائج AIME أو HumanEval. بل كانت الفجوة في الأداء على المسائل الملتبسة، أي المسائل التي لا تكون فيها الإجابة الصحيحة محددة بوضوح، وعلى النموذج أن يختار تفسيرًا معقولًا قبل حلها.

في مجموعة من 20 مسألة رياضية لفظية ملتبسة عمدًا، حدّد Kimi K2.6 Thinking الالتباس وحلّه بشكل صحيح في 15 حالة من أصل 20 قبل التوصل إلى إجابة منطقية. أما Grok 4.20 فقد حلّ الالتباس بشكل صحيح في 11 حالة من أصل 20، لكنه عمل أسرع وبدا أكثر "ثقة" في ردوده حتى عندما كان مخطئًا.

هذه هي المفاضلة الجوهرية: Kimi K2.6 Thinking أكثر حذرًا معرفيًا. Grok 4.20 أكثر ثقة عمليًا. ولا يتفوق أي منهما على الآخر في كل شيء؛ فالخيار الصحيح يعتمد كليًا على ما إذا كان تطبيقك يحتمل كلفة إجابة خاطئة تُقدَّم بثقة.

بالنسبة إلى أي شخص يبني خطوط عمل تعمل بالذكاء الاصطناعي وتلامس الرياضيات أو الاستدلال المعقد أو توليد الأكواد متعددة الخطوات، يمثل هذان النموذجان الوضع الحالي للتقنية الرائدة في الاستدلال المتقدم في مشهد منتصف 2025. والفجوة بينهما وبين النماذج من الجيل الأقدم كبيرة إلى حد أن الانتقال من GPT-4o أو من Claude 3.5 Sonnet الأقدم إلى أي منهما يمثل تحسنًا ملحوظًا في الدقة على المهام الصعبة، أيًا كان النموذج الذي تختاره.

شغّل اختباراتك الخاصة على PicassoIA

أسرع طريقة لتكوين رأيك الخاص هي تشغيل حالات الاختبار الخاصة بك. يمنحك PicassoIA وصولًا مباشرًا إلى Kimi K2.6 و Grok 4 إلى جانب المكتبة الكاملة لنماذج الاستدلال الرائدة، كل ذلك من واجهة واحدة دون أي إعداد.

خذ أصعب مسألة استدلال واجهتها مؤخرًا، والصقها في النموذجين، وشاهد أيهما يحلها فعلًا. ستكوّن صورة أدق في خمس دقائق من الاختبار الفعلي مما تكوّنه من قراءة جداول الاختبارات المعيارية. لكل نموذج نقاط قوة لا تظهر إلا في أنواع المهام المحددة التي تهم عملك، و PicassoIA يتيح لك اكتشاف هذه النقاط بسرعة.

مكتبة النماذج الكاملة متاحة على picassoia.com/en/all-models.

منصة نقاش في قاعة أكاديمية مع إضاءة مسرح دافئة على منصتين متماثلتين

شارك هذا المقال

اختر لغتك

مقالات ذات صلة