إذا كنت تعمل مع العقود أو قواعد الأكواد أو الأوراق البحثية أو أي مستند يتجاوز 100,000 كلمة، فأنت تعرف بالفعل أن معظم أدوات الذكاء الاصطناعي تنهار بهدوء في منتصف المستند. تبدأ في الهلوسة، أو تتجاهل السياق من الأقسام السابقة، أو تقدّم إجابات تتجاهل بوضوح نصف المدخلات. وقد دفع نموذجان هذا الجدار إلى أقصى حد في عامي 2025 و2026، وهما Gemini 3 و**Claude Opus 4.7**. يدّعي كلاهما نوافذ سياق ضخمة، واستدلالًا قويًا، وقدرة موثوقة على الاسترجاع. لكن أداءهما الفعلي يروي قصة أكثر تعقيدًا، واختيار النموذج الخطأ لعبء عمل طويل السياق خطأ مكلف.

سباق السياق الطويل الآن
ماذا يعني "نافذة السياق" فعلًا
نافذة السياق هي إجمالي النص الذي يستطيع نموذج الذكاء الاصطناعي حفظه كذاكرة عمل نشطة خلال جلسة واحدة. وتشمل تعليماتك الأساسية، وكل مستند تلصقه، وسجل المحادثة كاملًا، والردود السابقة للنموذج نفسه. وعندما يتجاوز المدخل النافذة، يقوم النموذج إما باقتطاع المحتوى الأقدم أو يبدأ دقته بالتراجع دون أن يخبرك بذلك.
الرقم الرئيسي، مثل "2 مليون توكن"، يمثل الحد الأقصى النظري. الموثوقية العملية تتراجع عادةً قبل بلوغ هذا السقف. وشكل منحنى التراجع هذا أهم بكثير من الرقم الأقصى نفسه. النموذج الذي يحافظ على دقة 95% عبر 800,000 توكن أنفع من نموذج يدّعي 2 مليون توكن لكنه يهبط إلى دقة 70% عند 500,000 توكن.
لماذا ليس الأكبر دائمًا الأفضل
حجم النافذة الخام يخلق إحساسًا زائفًا بالثقة. تلصق الفرق أرشيفًا قانونيًا كاملًا، وتحصل على إجابة متماسكة الظاهر، وتفترض أن النموذج استخدم كل شيء. وغالبًا لم يفعل. أكثر الطرق أمانًا لاختبار ما إذا كان النموذج يعالج مدخلك كاملًا هي وضع حقيقة حاسمة عمدًا قرب بداية مستند طويل، ثم السؤال عنها قرب نهاية الأمر النصي. هذا أساس اختبار "الإبرة في كومة القش" (Needle-in-a-Haystack)، وهو يكشف فروقًا حادة بين نماذج تبدو متطابقة في المواصفات الورقية.
💡 السؤال الحقيقي ليس "كم توكنًا؟" بل "ما مدى دقة استخدام النموذج لكل توكن يتلقاه؟"

الأرقام الخام لـ Gemini 3
سقف التوكنات وقوة الاسترجاع
يأتي Gemini 3 Pro بـنافذة سياق تبلغ 2 مليون توكن، أي ما يقارب 1.5 مليون كلمة من النص الإنجليزي. وهذا يكفي لعدة روايات كاملة، أو أرشيفات بريد إلكتروني تمتد لسنوات، أو ملفات قضايا قانونية كاملة، أو مستودعات برمجية ضخمة جدًا. وGemini 3 Flash يطابق هذا السقف بتكلفة أقل بكثير، مع بعض المفاضلات في عمق الاستدلال.
نتائج الاختبارات المعيارية المعتمدة لنموذج Gemini 3 Pro:
| الاختبار المعياري | Gemini 3 Pro |
|---|
| NIAH عند 1 مليون توكن | 99.1% |
| الإجابة على أسئلة متعددة المستندات (SCROLLS) | 87.4% |
| البرمجة في السياق الطويل | 84.2% |
| التركيب عبر المستندات | 81.6% |
تصمد هذه النتائج بشكل لافت عند الأطوال القصوى. درجة Gemini 3 Pro في اختبار الإبرة في كومة القش عند مليون توكن (99.1%) من بين الأعلى التي سُجّلت لأي نموذج على الإطلاق، وهذا يشير إلى أن Google عالجت إلى حد بعيد معظم مشكلة تراجع الاسترجاع على نطاق واسع.
ما غيّرته Google معماريًا
يعكس الانتقال من Gemini 2.5 Flash إلى Gemini 3 تغييرين معماريين مهمين لعمل السياق الطويل. أولًا، آليات الانتباه المتفرّق (sparse attention) تقلّل تكلفة الحوسبة التي كانت تجعل معالجة أوامر نصية بمليون توكن بطيئة بشكل يصعب تحمّله. ثانيًا، مخزن ملخصات (summary buffer) أُعيد تصميمه يحتفظ بتمثيلات مضغوطة لأقدم مقاطع السياق، بحيث لا ينسى النموذج ببساطة ما كان في الصفحة 1 عند معالجته الصفحة 500. ولهذا تبقى الأداءات فوق 99% عند مليون توكن بدل أن تنهار كما حدث في النماذج السابقة.
يستفيد Gemini 3 أيضًا من تكامل متعدد الوسائط أقوى، أي أنه يستطيع معالجة مستندات تتضمن صورًا وجداول ومخططات مدمجة ضمن نافذة السياق الطويلة نفسها. وبالنسبة للأوراق البحثية، أو التقارير المالية التي تحتوي على رسوم بيانية، أو الوثائق التقنية ذات المخططات، فهذه ميزة عملية ذات قيمة.

الأرقام الخام لـ Claude Opus 4.7
سقف التوكنات وعمق الاستدلال
يعمل Claude Opus 4.7 بنافذة سياق تبلغ 500,000 توكن، أي ما يعادل نحو 375,000 كلمة. وهذا أصغر من سقف Gemini 3 Pro بعامل أربعة. بالنسبة لمعظم الوثائق المهنية الواقعية، بما في ذلك المذكرات القانونية الكاملة، ومخطوطات الروايات الكاملة، وقواعد الأكواد البرمجية التي تبلغ 100,000 سطر، والسجلات المالية التي تمتد لعدة أشهر، تكفي 500,000 توكن. أما في معالجة الأرشيفات بالغة الضخامة، فإنها تصبح قيدًا حقيقيًا.
نتائج الاختبارات المعيارية المعتمدة لنموذج Claude Opus 4.7:
| الاختبار المعياري | Claude Opus 4.7 |
|---|
| NIAH عند 200 ألف توكن | 99.8% |
| الإجابة على أسئلة متعددة المستندات (SCROLLS) | 91.2% |
| البرمجة في السياق الطويل | 89.7% |
| التركيب عبر المستندات | 88.4% |
يحقق Claude Opus 4.7 درجات أعلى من Gemini 3 Pro في كل اختبار معياري كثيف الاستدلال، رغم نافذته الأصغر. والفجوة في الإجابة على أسئلة متعددة المستندات (91.2% مقابل 87.4%) والتركيب عبر المستندات (88.4% مقابل 81.6%) تعكس طرقًا مختلفة جوهريًا في كيفية استخدام النموذج لسياقه.
كيف يغيّر التفكير الموسّع المعادلة
يتضمن Claude Opus 4.7 وضع التفكير الموسّع (extended thinking)، حيث يخصص النموذج استدلالًا داخليًا متدرجًا ومتعمدًا قبل تقديم الإجابة النهائية. وفي المهام طويلة السياق، يظهر ذلك في تتبّع النموذج لإحالات محددة عبر أقسام المستند، ومقارنته للعبارات الصادرة عن مصادر مختلفة، وفحصه الصريح لما إذا كانت إجابته تناقض شيئًا ورد سابقًا في السياق.
هذا ليس مجرد "أخذ وقت أطول للرد". فالتفكير الموسّع يغيّر ما يفعله النموذج بالمعلومات التي يقرؤها. فهو ينتج إجابات خاطئة أقل تبدو واثقة، وهذا بالضبط نمط الفشل الذي يجعل الذكاء الاصطناعي ذي السياق الطويل خطيرًا في الأعمال عالية المخاطر.
💡 التفكير الموسّع يكون الأكثر قيمة عندما تحتاج إلى أن يربط النموذج معلومات متفرقة عبر مستند من 200 صفحة، لا أن يسترجع حقيقة واحدة مذكورة.

المواجهة المباشرة: سيناريوهات واقعية
دقة الاسترجاع عبر النافذة
في اختبار الإبرة في كومة القش، يقدّم النموذجان أداءً مبهرًا دون 200,000 توكن. وفوق 500,000 توكن، يتقدّم Gemini 3 Pro بوضوح لأن Claude Opus 4.7 ببساطة لا يستطيع قبول مدخلات بهذا الحجم. وضمن نطاق عمل Claude Opus 4.7، تكون دقة استرجاعه (99.8% عند 200 ألف توكن) أعلى بقليل من Gemini 3 Pro عند الطول نفسه.
الخلاصة: بالنسبة للمستندات التي تتسع ضمن 500,000 توكن، يسترجع Claude Opus 4.7 بدقة أكبر. أما المستندات التي تتجاوز هذا الحد، فإن Gemini 3 Pro هو الخيار الوحيد المجدي.
الاستدلال عبر المستندات المتعددة
هذا هو السيناريو الذي يفصل بين النموذجين بأوضح شكل. ففي المهام التي تتطلب من النموذج استخلاص استنتاجات من خلال دمج معلومات من ثلاثة مستندات منفصلة أو أكثر، يتفوّق Claude Opus 4.7 على Gemini 3 Pro بثلاث إلى خمس نقاط مئوية باستمرار. وتتسع الفجوة كلما زادت المسافة المنطقية بين الحقائق ذات الصلة.
مثال عملي: مراجعة صفقة اندماج واستحواذ تتطلب مقارنة متقاطعة بين بيان مالي، وملف تنظيمي، وعقد توظيف، وعدة سلاسل بريد إلكتروني. يتتبّع Claude Opus 4.7 الروابط بين هذه المستندات بدقة أكبر، وبقدر أقل من الهلوسة (confabulation) مقارنة بنموذج Gemini 3 Pro في هذا النوع من المهام.
أداء قواعد الأكواد الكبيرة
بالنسبة للمهندسين البرمجيين الذين يعملون على مستودعات كبيرة، يتعامل النموذجان مع المهام على مستوى الدوال بشكل متقارب. ويتقدّم Claude Opus 4.7 بوضوح في المهام المعمارية: فهم كيفية تفاعل 50 ملفًا أو أكثر، وتحديد الأخطاء النظامية التي تمتد عبر وحدات متعددة، أو إعادة هيكلة تجريد أساسي تعتمد عليه أنظمة أخرى. أما ميزة Gemini 3 Pro فتظهر عندما تكون قاعدة الأكواد أكبر من أن تتسع لنافذة Claude Opus 4.7.

واقع السرعة والتكلفة
زمن الاستجابة عندما تكون النافذة ممتلئة
معالجة أمر نصي بطول 200,000 توكن مكلفة حسابيًا لأي نموذج. وهذه أرقام زمن الاستجابة الواقعية للطلبات كاملة السياق:
| النموذج | زمن الإدخال (200 ألف توكن) | الزمن حتى أول توكن |
|---|
| Gemini 3 Pro | نحو 18 ثانية | نحو 22 ثانية |
| Gemini 3 Flash | نحو 9 ثوانٍ | نحو 11 ثانية |
| Claude Opus 4.7 | نحو 24 ثانية | نحو 28 ثانية |
يُعد Gemini 3 Flash الخيار الأسرع بفارق واسع. ويعكس زمن الاستجابة الأطول لـ Claude Opus 4.7 كلًا من عملية استدلاله الأكثر تروّيًا وعبء التفكير الموسّع. ويؤدي تعطيل التفكير الموسّع إلى تقليص زمن استجابة Claude بنحو 35%، مقابل بعض التراجع في الدقة في مهام الاستدلال المعقدة.
السعر لكل مليون توكن
تصبح التكلفة عاملًا حاسمًا عندما تشغّل مئات الطلبات طويلة السياق يوميًا:
| النموذج | تكلفة الإدخال (لكل مليون توكن) | تكلفة الإخراج (لكل مليون توكن) |
|---|
| Gemini 3 Pro | $3.50 | $10.50 |
| Gemini 3 Flash | $0.35 | $1.05 |
| Claude Opus 4.7 | $15.00 | $75.00 |
تكلفة Claude Opus 4.7 لكل توكن أعلى بنحو 4 أضعاف من Gemini 3 Pro، وبنحو 40 ضعفًا من Gemini 3 Flash. وبالنسبة للعمل عالي المخاطر ومنخفض الحجم حيث تبرر الدقة التكلفة، فهذه مفاضلة معقولة. أما خطوط الإنتاج التي تعالج ملايين التوكنات يوميًا، فإن Gemini 3 Flash يقدّم نسبة تكلفة إلى أداء أفضل بكثير.

تشغيل النموذجين معًا على PicassoIA
يتوفر كل من Claude Opus 4.7 وGemini 3 Pro على PicassoIA، ما يتيح لك تجربتهما دون إدارة حسابات API منفصلة أو التعامل مع إعدادات فوترة مختلفة.
استخدام Gemini 3 Pro على PicassoIA
- افتح صفحة نموذج Gemini 3 Pro على PicassoIA
- الصق مستندك في حقل الأمر النصي. بالنسبة للمدخلات الكبيرة جدًا، استخدم فواصل واضحة بين الأقسام، مثل
[DOCUMENT 1 START] و[DOCUMENT 1 END]، حتى يتمكن النموذج من تحديد موقعه داخل المحتوى
- ضع تعليمات النظام في الأعلى، وسؤالك المحدد في النهاية تمامًا. هذا الترتيب يمنح النموذج إطار مهمته قبل القراءة، ويحسّن تركيز الاسترجاع
- في مهام الاسترجاع البحتة، اطلب من النموذج أن يستشهد بالمقطع الدقيق الذي وجد فيه إجابته. هذا يفرض سلوك قراءة أكثر انضباطًا، ويكشف الهلوسة بسرعة
- للأعمال الأسرع والأقل تكلفة على الاستعلامات الأبسط، يعمل Gemini 3 Flash في الواجهة نفسها بجزء من السعر. وللحصول على أحدث قدرات الوسائط المتعددة، يتوفر أيضًا Gemini 3.1 Pro على المنصة

استخدام Claude Opus 4.7 على PicassoIA
- افتح صفحة نموذج Claude Opus 4.7 على PicassoIA
- نظّم أمرك النصي بحيث يأتي محتوى المستند كاملًا أولًا، ثم تعليماتك في النهاية. يعالج Claude المعلومات بفعالية أكبر عندما يأتي وصف المهمة بعد المحتوى الذي يحتاج إلى العمل عليه
- في التركيب عبر المستندات، رقّم صراحةً ما تريد مقارنته أو ربطه. على سبيل المثال: "1. ابحث عن كل ذكر للمسؤولية في المستند A. 2. قارنها ببنود التعويض في المستند B. 3. حدّد التناقضات بينها."
- يُفعَّل التفكير الموسّع تلقائيًا في الاستعلامات المعقدة. ومرحلة استدلال ظاهرة قبل الرد أمر طبيعي، وتنتج تركيبًا أكثر موثوقية بكثير في المهام متعددة المصادر
- للحصول على نتائج أسرع في استعلامات السياق الطويل الأبسط، يتعامل Claude 4 Sonnet وClaude 4.5 Sonnet مع السياقات الممتدة بشكل جيد وبتكلفة أقل

أيّهما تختار؟
لا يفوز أي من النموذجين في كل الحالات. والقرار الصحيح يعتمد كليًا على شكل عملك اليومي الفعلي.
اختر Gemini 3 عندما...
- تتجاوز المستندات بانتظام 500,000 توكن، مثل الأرشيفات القانونية، أو قواعد الأكواد الكاملة المتعددة المستودعات، أو سجلات المراسلات التي تمتد لسنوات
- تهمّ سرعة الاستجابة ويؤثر زمن الاستجابة مباشرة على سير عملك أو تجربة المستخدم
- خطوط المعالجة كثيفة الحجم تجعل تكلفة كل توكن عاملًا يتراكم بسرعة
- المهمة الأساسية هي الاسترجاع لا التركيب: إيجاد حقائق مذكورة، لا ربط علاقات غير مذكورة بين المصادر
- الإدخال متعدد الوسائط مثل المستندات التي تتضمن رسومًا بيانية أو مخططات أو صورًا مدمجة جزء من سير عملك
- ترغب في مقارنة النتائج الحالية مع إصدار Gemini 3.1 Pro للحصول على أداء محدّث في الوسائط المتعددة
اختر Claude Opus 4.7 عندما...
- تتسع مستنداتك ضمن 500,000 توكن، وتكون جودة الاستدلال الأولوية المسيطرة
- تتطلب المهمة ربط المعلومات عبر مستندات متعددة، لا قراءة مستند واحد بمعزل عن غيره
- للدقة عواقب حقيقية: المراجعة القانونية، وتحليل التوثيق الطبي، والعناية الواجبة المالية
- تحتاج إلى أن يُظهر النموذج استدلاله بشفافية، لا أن يقدّم إجابة نهائية دون أي أثر لكيفية الوصول إليها
- تبني سير عمل وكيلي (agentic) يتطلب التخطيط وتنفيذًا متعدد الخطوات عبر سياقات طويلة وعلى عدة أدوار
💡 يستخدم كثير من الفرق النموذجين معًا في خط المعالجة نفسه. يتولى Gemini 3 Flash الفرز الأولي للمستندات بتكلفة منخفضة، ويتولى Claude Opus 4.7 التركيب عالي المخاطر في المرحلة الأخيرة. هذا النهج المختلط يجمع نقاط قوة الاثنين دون دفع تسعير Claude عن كل توكن تتم معالجته.

جرّبه على مستنداتك الخاصة
الاختبارات المعيارية تخبرك بما يحدث في الاختبارات الموحّدة. مستنداتك ليست موحّدة. الطريقة الوحيدة لمعرفة أي النموذجين يعمل فعلًا بشكل أفضل لعبء عملك المحدد هي تشغيل كليهما على مدخلات حقيقية من سير عملك ومقارنة المخرجات مباشرة.
يمنحك PicassoIA الوصول إلى Claude Opus 4.7 وGemini 3 Pro وGemini 3 Flash على المنصة نفسها، فيمكنك تشغيل الأمر النصي ذاته بدقة عبر عدة نماذج ورؤية الفروق في طريقة استدلالها، وما تغفله، وكيف تشرح إجاباتها. وللمقارنات المرجعية، يتوفر أيضًا Gemini 2.5 Flash وClaude 3.5 Sonnet، ما يتيح لك تتبّع مقدار ما حسّنته كل شركة في موثوقية السياق الطويل خلال العام الماضي.
إلى جانب معالجة النصوص، توفر المنصة الوصول إلى توليد الصور، وإنشاء الفيديو، وتوليد الصوت، وإزالة الخلفية، والمزيد، فيمكن للرؤى التي تكشفها مستنداتك أن تغذّي سير العمل الإبداعي والإنتاجي مباشرة دون تبديل الأدوات. سواء كنت تحوّل نتائج الأبحاث إلى أصول بصرية، أو تبني خط محتوى متكاملًا من مستندات خام إلى وسائط جاهزة، فكل شيء يعمل في مكان واحد.
الصق أصعب مستنداتك. اطرح السؤال الأهم لعملك. وانظر أي النموذجين يعطيك الإجابة التي يمكنك الاعتماد عليها فعلًا.