لماذا يحقق Claude Fable 5.1 هذه النتيجة المرتفعة في Terminal-Bench 4.0

حقق Claude Fable 5.1 معدل إنجاز مهام بلغ 94.3% في Terminal-Bench 4.0، وهو أصعب تقييم وكيلي على الإطلاق. يشرح هذا المقال بنية الاستدلال، ودقة تنفيذ الأوامر في الصدفة، ومنطق التعافي من الأخطاء، وقدرات البرمجة التي دفعته إلى صدارة كل لوحة تصنيف وكيلية مهمة في عام 2027.

لماذا يحقق Claude Fable 5.1 هذه النتيجة المرتفعة في Terminal-Bench 4.0
Cristian Da Conceicao
مؤسس Picasso IA

يحمل عالم اختبارات الذكاء الاصطناعي رقمًا لافتًا يصعب تجاهله: سجّل Claude Fable 5.1 معدل إنجاز مهام إجماليًا بلغ 94.3% في Terminal-Bench 4.0، وهو أصعب تقييم وكيلي نُشر على الإطلاق. وليس هذا فرقًا ناتجًا عن التقريب ولا اختبارًا انتقائيًا لظروف مختارة بعناية. فما زال كل نموذج رائد آخر يكافح لتجاوز 80% في التقييم نفسه، والفجوة تتسع مع كل تحديث من Anthropic.

مقارنة لوحات تصنيف اختبارات الذكاء الاصطناعي على شاشة مكتب مطوّر تحت إضاءة دافئة

إذا كنت تتابع سباق لوحات تصنيف النماذج اللغوية، فأنت تعرف أن Terminal-Bench 4.0 يختلف جذريًا عن التقييمات التي سبقته. فهو ليس اختبارًا من متعدد الخيارات ولا استطلاعًا لتفضيلات البشر. يشغّل الاختبار جلسات صدفة حقيقية، ويطلق أوامر فعلية داخل حاويات Docker حيّة، ويقيّم النماذج بناءً على وصول المهام إلى حالتها المستهدفة دون أي مساعدة يدوية. والفرق بين 78% و94% في هذا الإطار ليس تجميليًا. ففي دفعة من 300 مهمة، تترجم فجوة الـ16 نقطة هذه إلى نحو 48 تدخلًا بشريًا أقل في كل تشغيل.

ماذا يختبر Terminal-Bench 4.0 فعلًا

يطرح Terminal-Bench 4.0 سؤالًا محوريًا واحدًا: هل يستطيع النموذج إنجاز العمل من البداية إلى النهاية، في بيئة UNIX حيّة ودون شبكة أمان؟

مطوّر أمام محطة عمل بثلاث شاشات ومحررات أكواد في مكتب عصري مشرق

الفئات الأساسية الأربع للمهام

يوزّع الاختبار أكثر من 300 مهمة على أربع فئات مرجّحة:

الفئةمهام تمثيليةالوزن
عمليات الصدفةمعالجة الملفات، وخطوط أنابيب grep، وإعداد cron30%
تنفيذ الأكوادتشغيل Python/Bash/TypeScript وتصحيحها وإعادة هيكلتها30%
التعافي من الأخطاءمعالجة المخرجات غير المتوقعة، وإعادة المحاولة بعد الفشل، وتكييف الخطة25%
التخطيط متعدد الخطواتربط 8 إلى 12 أمرًا للوصول إلى حالة نهائية محددة15%

تبدأ كل مهمة في حاوية Docker نظيفة بهدف محدد ومهلة زمنية صارمة. لا توجد تلميحات، ولا أسئلة توضيحية. إما أن يصل النموذج إلى الحالة المستهدفة أو لا يصل.

لماذا تتعثر معظم النماذج

يعود تجمّع النماذج الرائدة عند نسبة 75-82% إلى نمطين متكررين من الفشل. الأول أن النماذج القوية في الاستدلال لكنها غير دقيقة في صياغة أوامر الصدفة الدقيقة، تنتج أوامر تبدو معقولة لكنها تفشل في الحالات الطرفية. ويتفاقم هذا الفشل بشدة في التسلسلات متعددة الخطوات، حيث يُبطل أمر وسيط واحد معطوب كل ما يليه. والثاني أن النماذج القادرة على تنفيذ الأوامر المنفردة تنهار غالبًا في سيناريوهات التعافي من الأخطاء، إما لأنها تكرر الأمر الفاشل حرفيًا، أو تتخلى عن المهمة كليًا حين يصبح المسار غير واضح.

الجزء الداخلي لرف خوادم بكابلات الألياف الضوئية ومؤشرات LED في مركز بيانات

💡 يستحق الملاحظة: يمنح Terminal-Bench 4.0 درجات جزئية. النموذج الذي يتعافى من ثلاثة إخفاقات ويكمل المهمة يتفوق على النموذج الذي يتوقف بهدوء عند أول خطأ.

Claude Fable 5.1 في لمحة

يمثّل Claude Fable 5 أكثر خطوات Anthropic تعمّدًا نحو العمل العملي الوكيلي. ويركّز الإصدار 5.1 تحديدًا على أمرين: دقة أوامر الصدفة، وما تصفه أبحاث Anthropic بـ"تتبّع النية المستمر"، أي القدرة على إبقاء الهدف الأصلي ثابتًا عبر خطوات وسيطة كثيرة، حتى حين تزدحم رسائل الخطأ والمخرجات غير المتوقعة في نافذة السياق.

أربعة مطوّرين يقيّمون نتائج اختبارات الذكاء الاصطناعي في غرفة عمليات مكتبية ليلًا

ما الذي يميّزه

تفسّر ثلاثة قرارات معمارية معظم أفضليته في الاختبارات:

  1. تتبّع النية المستمر: يحتفظ النموذج بتمثيل عملي للهدف الأصلي طوال سلاسل طويلة من الخطوات الوسيطة. تفقد معظم النماذج المنافسة هذا الهدف حين تزدحم رسائل الخطأ ومخرجات التصحيح في نافذة السياق. أما Fable 5.1 فلا يفقده.

  2. بيانات تدريب تركز على الصدفة أولًا: درّبت Anthropic النموذج بشكل مكثف على جلسات طرفية حقيقية، لا على توثيق عن جلسات الطرفية. وتظهر الفجوة بوضوح أكبر في الحالات الطرفية: أنماط glob تحت صدفات مختلفة، وسلوكيات تخزين أنابيب الإدخال والإخراج المؤقت، ودلالات رموز الخروج عبر البيئات المختلفة.

  3. منطق إعادة المحاولة التشخيصي: عند فشل أمر، يصنّف النموذج نوع الفشل قبل اختيار إجرائه التالي. وتعامل إعادة تنفيذ الأمر نفسه كملاذ أخير لا كاستجابة افتراضية. هذا السلوك وحده يفسّر غالبية التفوق في فئة التعافي من الأخطاء.

الأرقام التي تهم

المقياسClaude Fable 5.1GPT 5Gemini 3 ProDeepSeek R1
إنجاز المهام الإجمالي94.3%81.7%79.4%77.8%
درجة عمليات الصدفة96.1%83.2%78.9%75.3%
معدل التعافي من الأخطاء91.8%74.1%71.2%68.4%
التخطيط متعدد الخطوات93.4%80.9%76.7%74.1%
كفاءة التوكنات مقارنةً بالخط الأساسي+22%الخط الأساسي-4%-11%

نتائج GPT 5 وGemini 3 Pro وDeepSeek R1 قوية حقًا. لكن عمود التعافي من الأخطاء هو المكان الذي تكمن فيه الفجوة العملية. فالفرق بمقدار 18 نقطة في التعافي من الأخطاء يعني أنه في الأتمتة الإنتاجية الحقيقية، يعمل أحد النموذجين طوال الليل بينما يستدعيك الآخر مرارًا.

كيف يتعامل مع مهام الصدفة

تُعد عمليات الصدفة المجال الذي يتفوق فيه Claude Fable 5.1 بوضوح على بقية المنافسين، وهامش التفوق قابل للتكرار بدرجة كبيرة عبر عدة تشغيلات مستقلة للاختبار.

لقطة مقرّبة ليدين تكتبان على لوحة مفاتيح ميكانيكية مع توهج الطرفية في الخلفية

تنفيذ الأوامر الفعلي

يعتمد النموذج على أوامر صدفة صريحة وقابلة للقراءة، بدلًا من الأسطر الواحدة الذكية التي تكون هشة في الحالات الطرفية. فهو يوجّه stderr مع stdout حين يكون هناك احتمال أن يحمل تدفق الأخطاء بيانات تشخيصية مفيدة، ويستخدم أعلام التشغيل التجريبي (dry-run) قبل العمليات المدمّرة دون أن يُطلب منه ذلك صراحةً.

سلوكيات محددة تظهر باستمرار في سجلات الاختبار:

  • لا أخطاء في الاقتباس المزدوج: يُعالج استبدال المتغيرات داخل علامات الاقتباس المتداخلة بشكل صحيح عبر جميع الصدفات التي جرى اختبارها.
  • توافق POSIX افتراضيًا: تنتج الأوامر النتائج نفسها على أنظمة GNU/Linux والأنظمة المشتقة من BSD دون تعديل.
  • نطاق محافظ مع الأحرف البدلية: تُفضَّل المسارات الصريحة كلما قللت من مخاطر التنفيذ.
  • استخدام ذكي للصدفات الفرعية: يظهر الاستبدال بالعمليات (process substitution) فقط حين يبسّط الأمر فعلًا، لا كعادة أسلوبية.

التعافي من الأخطاء في التطبيق

عندما يصادف النموذج خطأ "الإذن مرفوض"، تكون استجابته تشخيصية لا تفاعلية. فبدلًا من إضافة sudo دون تفكير، أو طباعة الخطأ والتوقف، يقيّم ثلاثة أمور قبل أن يتصرف: هل يمكن التعافي من الخطأ دون تصعيد الصلاحيات، وهل يوجد مسارٌ بديل يؤدي إلى الهدف نفسه، وهل يكشف الخطأ عن عيب في الخطة الأصلية نفسها.

💡 التمييز الحاسم: يتعامل النموذج مع "لا أستطيع إكمال هذه الخطوة المحددة" و"لا أستطيع بلوغ الهدف" بوصفهما وضعين مختلفين جوهريًا. وهذا التمييز هو المحرك الأساسي لدرجة التعافي من الأخطاء البالغة 91.8%.

سلاسل استدلال تنجح

مطوّر مائل إلى الأمام في تركيز عميق داخل مكتب منزلي بشاشتين

حل المشكلات خطوة بخطوة

تتطلب مهام التخطيط متعدد الخطوات في Terminal-Bench 4.0 ما بين 8 و12 قرارًا متسلسلًا، حيث تقيّد الخيارات المبكرة الخيارات اللاحقة. وجودة سلسلة التفكير حاسمة في هذه الفئة. يتبع ناتج التخطيط في Claude Fable 5.1 بنية ثابتة قبل تنفيذ أي شيء:

  1. تفكيك الهدف: تقسيم الحالة المستهدفة إلى متطلبات أولية قابلة للتحقق ومرتبة
  2. رسم الاعتماديات: تحديد الخطوات التي تعيق غيرها وترتيبها وفقًا لذلك
  3. فحص القابلية للتراجع: الإشارة إلى الخطوات الصعبة التراجع عنها قبل الالتزام بها
  4. التنفيذ التكيّفي: التقدم إلى الأمام وتحديث الخطة فورًا حين تنحرف المخرجات الوسيطة عن التوقعات

وهذا يعكس الطريقة التي يتعامل بها المهندسون ذوو الخبرة مع المهام المعقدة في الممارسة. وهو أيضًا النقيض للنمط الذي يُسقط معظم النماذج دون 80%: توليد الأمر الأكثر معقولية التالي دون نمذجة عواقبه على كل خطوة لاحقة.

لا هلوسة في المخرجات

من نقاط قوة Terminal-Bench 4.0 كتقييم أنه يكشف الأوامر المختلقة فورًا. فإذا اخترع النموذج علمًا غير موجود، تعيد الصدفة خطأ واضحًا. والمهم هو كيفية استجابة النموذج. يتعامل Claude Fable 5.1 مع هذا الخطأ بوصفه إشارة للتحقق من الواجهة الفعلية للأداة قبل المتابعة، لا تلميحًا لتخمين آخر بوسيط مختلق مختلف قليلًا.

تُظهر عدة نماذج منافسة، بما فيها إصدارات Claude السابقة، النمط المعاكس: التكرار عبر صيغ تبدو معقولة لعلم خاطئ، بدلًا من التوقف لمراجعة ما تدعمه الأداة فعلًا.

تعمّق في أداء البرمجة

مهندسة برمجيات تراجع أوراق بحث مطبوعة في محطة عمل بإضاءة الساعة الذهبية

المشاريع متعددة الملفات

يتضمن الاختبار مهامًا تتطلب تعديل ملفات مترابطة متعددة لإصلاح مجموعة اختبار معطوبة. وتكشف هذه المهام مباشرة ضعف النماذج التي تعتمد على سياق ملف واحد. ويعالج Claude Fable 5.1 ذلك ببناء رسم بياني صريح للاعتماديات قبل لمس أي ملف، وتعديل الاعتماد الأدنى مستوى أولًا، وتشغيل مجموعات اختبار جزئية بعد كل تغيير لاكتشاف الانحدارات قبل أن تتراكم لتصبح أعطالًا أكبر.

والنتيجة شيفرة تتكامل بصحة مع سياقها المحيط، لا شيفرة سليمة محليًا فقط ومعزولة عن محيطها.

التصحيح تحت الضغط

تتضمن أصعب مهام البرمجة في الاختبار عناصر تضليل متعمدة: رسائل خطأ تشير إلى موقع خاطئ في قاعدة الشيفرة. ويرتبط الأداء في هذه المهام ارتباطًا مباشرًا بما إذا كان النموذج يقرأ تتبعات المكدس (stack traces) بنقد لا بحرفية.

يعامل Claude Fable 5 رسائل الخطأ بوصفها فرضيات لا حقائق. فهو يتتبع الخطأ إلى مصدره المشار إليه، ويتحقق مما إذا كان ذلك المصدر مسؤولًا فعلًا عن الفشل، ويعود إلى الوراء بحثًا عن سبب جذري أعمق حين لا يكون السطر المشار إليه هو المشكلة. وهذا هو الانضباط نفسه الذي يطبّقه مهندس أول متمرس عند التصحيح في قاعدة شيفرة غير مألوفة، وتعكسه درجات الاختبار باستمرار.

كيف يقارن بالنماذج الأخرى

لقطة علوية لجهاز MacBook مع نوافذ طرفية مقسمة ودفتر تقني على مكتب أبيض

مقابل GPT 5 وGemini 3 Pro

يتمتع GPT 5 بأداء قوي فعلًا في Terminal-Bench 4.0، إذ سجّل أعلى نتيجة تحققها OpenAI في هذه الفئة من التقييمات الوكيلية. وتتركز قوته في مهام توليد الأكواد ذات المخرجات المستهدفة المحددة جيدًا. أما أوجه قصوره مقارنةً بـ Claude Fable 5.1 فتظهر في المهام التي تتطلب التكيف مع حالة وسيطة غير متوقعة، وهي حالة تتكرر باستمرار في البيئات الواقعية لا في شروط الاختبار المضبوطة.

يتمتع Gemini 3 Pro بميزة واضحة في المهام التي تتضمن قراءة ملفات بسياق طويل، إذ تمثّل نافذة سياقه الممتدة عنصر قوة مباشرًا. لكن درجاته في عمليات الصدفة والتعافي من الأخطاء أدنى، جزئيًا لأنه يميل إلى إنتاج شروحات مفصلة بلغة طبيعية عن الإجراءات التي ينوي تنفيذها، بدلًا من تنفيذها ببساطة، وهو ما يستهلك الوقت في مواجهة مواعيد نهائية صارمة للمهام.

ينتج Grok 4 استدلالات تخطيط منهجية ومنظمة جيدًا، لكن طبقة التنفيذ لديه تُدخل صيغًا مختلفة من الأوامر تنحرف كثيرًا عن معايير POSIX، مما يخفض درجات عمليات الصدفة بطريقة تتراكم عبر المهام متعددة الخطوات.

فجوة الاختبار

إن الفارق البالغ 12 إلى 15 نقطة بين Claude Fable 5.1 والمجموعة التالية من النماذج كبير بما يكفي ليحمل عواقب تشغيلية حقيقية. فعند معدل إنجاز مهام 80% في دفعة من 300 مهمة، تحتاج إلى نحو 60 تدخلًا يدويًا. وعند 94.3%، ينخفض هذا الرقم إلى نحو 17. هذا هو الفرق العملي بين خط أنابيب يمكنك جدولته ثم تركه، وآخر يتطلب مراقبة نشطة لينجح.

بالنسبة للمطورين الذين يبنون أتمتة داخلية، فالسؤال المهم ليس "أي نموذج يسجل نتيجة أعلى على الورق"، بل "عند أي معدل إنجاز مهام يصبح الإشراف البشري غير ضروري لسير العمل المحدد هذا". ويتجاوز Claude Fable 5.1 هذه العتبة في فئات سير عمل أكثر من أي نموذج متاح حاليًا.

شغّل Claude Fable 5.1 على PicassoIA الآن

مطوّران أمام لوحة بيضاء ممتدة من الأرض حتى السقف يناقشان نتائج الاختبارات مع مخططات

Claude Fable 5 متاح على PicassoIA إلى جانب Claude Sonnet 5 وClaude Opus 4.7، ومع الكتالوج الكامل لنماذج OpenAI وGoogle. لا حاجة إلى مفتاح API من Anthropic. ولا إعداد محلي.

خطوات التشغيل

الخطوة 1. افتح صفحة نموذج Claude Fable 5 على PicassoIA.

الخطوة 2. في حقل موجّه النظام، صِف بيئة التشغيل التي تتضمنها مهمتك. فتحديد الصدفة والأدوات المتاحة والقيود ذات الصلة يحسّن جودة المخرجات في المهام الوكيلية بشكل ملحوظ.

الخطوة 3. في الأمر النصي للمستخدم، صِف الحالة النهائية المستهدفة لا الخطوات الفردية التي تظن أنها ضرورية. دع النموذج يخطط للتسلسل. فوصف النتيجة المطلوبة ينتج خطط إجراءات أفضل من تحديد الخطوات الفردية.

الخطوة 4. راجع خطة النموذج قبل التنفيذ. يُخرج Claude Fable 5.1 تسلسل إجراءات مرقّمًا قبل أن يحاول أي شيء. وهذه نقطة تفتيشك لاكتشاف سوء الفهم مبكرًا، قبل أن تتفاقم عواقبه.

الخطوة 5. قدّم التصحيحات بلغة بسيطة عند الحاجة. يقبل النموذج تصحيحات المسار أثناء المهمة، ويستأنف من آخر حالة مؤكدة دون إعادة تشغيل التسلسل كاملًا.

💡 نصيحة عملية: في مهام البرمجة متعددة الملفات، استخدم موجّه النظام لتحديد الملفات الداخلة في النطاق. فهذا يمنع النموذج من تخمين بنية المجلدات ويُبقي استهلاك التوكنات مركّزًا على المشكلة الفعلية.

يمكنك إقران Claude Fable 5 بنماذج أخرى على PicassoIA لمراحل مختلفة من سير العمل نفسه. فـClaude Sonnet 5 أسرع وأوفر تكلفة في مراحل الصياغة والتكرار. أما Claude Fable 5 فيتولى التحقق النهائي واختبار التكامل والحالات الطرفية الأكثر أهمية في الإنتاج.

ماذا تعني هذه النتيجة للعمل الفعلي

ليست نتيجة 94.3% في Terminal-Bench 4.0 مجرد رقم في لوحة تصنيف. إنها تشير إلى ما يمكنك تفويضه واقعيًا إلى نموذج لغوي اليوم دون بناء طبقة إشراف حوله.

تتطابق فئات الاختبار الأربع مباشرة مع الاختناقات التي تُبطئ فرق الهندسة الحقيقية: نصوص صدفة تنهار عند الحالات الطرفية في الإنتاج، وتغييرات شيفرة تُدخل انحدارات في التكامل، ونشرات متعددة المراحل تحتاج من يراقب كل مرحلة. والنموذج الذي يتعامل مع هذه المهام بموثوقية كافية للتشغيل دون تدخل يغيّر اقتصاديات الأتمتة بطريقة ملموسة.

يحافظ PicassoIA على تحديث كتالوج النماذج الكامل مع إصدار النسخ الجديدة، لذا يمكنك اختبار كل إصدار في اليوم الذي يصبح فيه متاحًا، إلى جانب كل نموذج منافس، من الواجهة نفسها. وعند وصول التحديث التالي لنموذج Claude Fable، تكون المقارنة على بعد نقرة واحدة. والاختبار العملي بسيط: خذ مهمة تراجعها يدويًا في كل خطوة الآن، وشغّلها عبر النموذج. فإذا أنجزها بشكل صحيح 19 مرة من أصل 20، يصعب بعدها الاعتراض على حجة الأتمتة الكاملة.

شارك هذا المقال

اختر لغتك

مقالات ذات صلة