GPT-5.6 لبناء وكلاء الذكاء الاصطناعي متعددي الخطوات: ما الذي ينجح فعلًا

يرفع GPT-5.6 موثوقية أنظمة وكلاء الذكاء الاصطناعي متعددة الخطوات، بدقة أعلى في استدعاء الأدوات، واحتفاظ أطول بالسياق، وحلقات مهام ذاتية تُنجز سير العمل المعقدة دون إشراف. يشرح هذا المقال الإصدارات الثلاثة من GPT-5.6، ويعرض أنماط وكلاء فعلية أثبتت نجاحها، ويرشدك خطوة بخطوة إلى البناء على PicassoIA.

GPT-5.6 لبناء وكلاء الذكاء الاصطناعي متعددي الخطوات: ما الذي ينجح فعلًا
Cristian Da Conceicao
مؤسس Picasso IA

أحدث GPT-5.6 فرقًا حقيقيًا لمن يبنون خطوط عمل وكلاء متعددة الخطوات. ليس ضجيجًا إعلاميًا، بل تحسّن هادئ يظهر حين يتوقف الوكيل عن اختلاق أسماء الأدوات، ويبدأ بالتعافي من الأخطاء بمفرده، وينهي سير عمل من 12 خطوة دون أن تراقبه. هذا التحوّل مهم.

إن كنت تسعى إلى سلوك وكيل موثوق مع إصدارات GPT الأقدم، فإن GPT-5.6 هو ما رفع السقف. يتناول هذا المقال الأسباب بتفاصيل، مع التركيز على الإصدارات الثلاثة المتاحة على PicassoIA، وكيف تعمل حلقة الوكيل عمليًا، وأي الأنماط تعطي نتائج مستقرة في الإنتاج.

لماذا فشلت النماذج السابقة في الوكلاء

مخطط سير عمل وكيل الذكاء الاصطناعي على لوح أبيض

تفشل وكلاء الذكاء الاصطناعي متعددة الخطوات بطرق يمكن التنبؤ بها. ينسى النموذج ما كان يفعله بعد ثلاث أو أربع استدعاءات للأدوات. يخترع أسماء دوال غير موجودة. ويقع في حلقة إعادة محاولة لأنه لا يستطيع تحليل مخرجاته السابقة. ليس في ذلك لغز، وGPT-5.6 يعالج كل واحد من أنماط الفشل هذه بشكل مباشر.

استدعاء الأدوات دون هلوسة

أكبر تحسّن في GPT-5.6 هو دقة استدعاء الأدوات. في النماذج السابقة، كان مخطط استدعاء الدوال يتدهور مع المحادثة الطويلة: يبدأ النموذج بتقريب أسماء الوسائط، أو يهمل الحقول المطلوبة، أو يختلق معاملات اختيارية غير موجودة في مخططك.

يحافظ GPT-5.6 على المخطط. في الاختبارات عبر خطوط وكلاء تضم بين 15 و30 استدعاءً متتاليًا للأدوات، ينتج النموذج بثبات JSON صالحًا يطابق المخطط المحدد دون انحراف. بالنسبة للمطورين الذين يبنون وكلاء للإنتاج، هذا ليس أمرًا كماليًا. إنه الفرق بين منتج وعرض تجريبي.

💡 نصيحة: ما يزال GPT-5.6 يستفيد من تعريفات مخطط دقيقة وصريحة. أوصاف المعاملات الغامضة ما تزال تنتج مخرجات غامضة. كن محددًا في تعريفات أدواتك، وسيكافئك النموذج بالدقة.

سياق يستمر عبر الخطوات

مطوّر يكتب الشيفرة على حاسوب محمول، لقطة قريبة للشاشة واليدين

نافذة السياق في GPT-5.6 ليست أكبر فحسب، بل أكثر فائدة على نطاق واسع. يتتبع النموذج الحالة عبر أدوار كثيرة دون الانجراف الموضعي الذي جعل جلسات السياق الطويل السابقة غير موثوقة. عمليًا، هذا يعني أن وكيلك يمكنه الإشارة إلى نتيجة من الخطوة 2 أثناء تنفيذ الخطوة 14، دون أن تعيد حقن ذلك السياق يدويًا في كل استدعاء لاحق.

هذا مهم في سير العمل الفعلي. وكلاء البحث الذين يجلبون مصادر متعددة ويلخّصونها ويقارنون بينها. وكلاء البرمجة الذين يكتبون دالة، ثم يختبرونها، ويصحّحون الخطأ عند فشلها، ثم يعيدون الاختبار. وكلاء خطوط معالجة البيانات الذين يسحبون البيانات من API، ويعيدون تشكيلها، ويتحققون منها، ثم يكتبونها في مكان آخر. كل هذه الأنماط تعتمد على ذاكرة لا تتدهور مع نمو المحادثة.

للبنية المعمارية دلالة كبيرة. مع النماذج السابقة، كان المطورون مجبرين على الاحتفاظ بمخازن حالة خارجية تعيد حقن السياق السابق في كل خطوة، ما يعوّض عن فقدان الذاكرة لدى النموذج. يقلّل GPT-5.6 من الهيكلة التي تحتاج إلى كتابتها، لأنه يحتفظ بالسياق بموثوقية أكبر من خطوة إلى أخرى.

مقارنة بين GPT-5.6 Luna و Terra و Sol

يتيح لك PicassoIA الوصول إلى الإصدارات الثلاثة من GPT-5.6: GPT 5.6 Luna، وGPT 5.6 Terra، وGPT 5.6 Sol. تشترك في البنية الأساسية نفسها، لكنها مضبوطة لملفات استخدام مختلفة.

الإصدارنقاط القوةالاستخدام الأمثل
Lunaالسرعة، سرعة الاستجابة، التكرار السريعالنمذجة الأولية السريعة، واجهات المحادثة، الوكلاء منخفضو زمن الاستجابة
Terraموثوقية الإنتاج، المخرجات المنظّمةخطوط الإنتاج المنشورة، تكاملات API، المهام المجمّعة
Solالتفكير العميق، تخطيط المهام المعقدةتوليد الشيفرة، حل المشكلات متعددة المتغيرات

الاختيار بينها ليس نهائيًا. يمكن لبنية وكيل مصممة جيدًا أن تستخدم إصدارات مختلفة لمراحل مختلفة من سير العمل نفسه، فتوجّه القرارات الأبسط إلى Luna، وتخصّص Sol للأجزاء الصعبة.

متى تستخدم Luna

مطوّر يراجع تصورًا لمخطط شبكي على جهاز لوحي

GPT 5.6 Luna هو المسار السريع. إن كان وكيلك يحتاج إلى الاستجابة شبه الفورية، أو كنت تكرّر على الأوامر النصية أثناء التطوير، يمنحك Luna الإنتاجية المطلوبة. ملف زمن الاستجابة فيه أقل بكثير من Terra أو Sol، ما يجعله عمليًا لواجهات الوكلاء الحوارية التي تهم فيها الاستجابات دون الثانية لتجربة المستخدم.

Luna هو أيضًا الخيار الصحيح لطبقة التخطيط في نظام متعدد الوكلاء. دعه يفكك المهمة ويوجّهها، ثم سلّم المهام الفرعية إلى نموذج أكثر تروّيًا. هذا النهج المتدرج يمنحك السرعة في طبقة التنسيق والجودة في طبقة التنفيذ في آنٍ واحد.

متى تكون Sol أنسب

GPT 5.6 Sol مصمم للمشكلات الصعبة. مهام الشيفرة المعقدة، والاستدلال المنطقي متعدد الخطوات، والسيناريوهات التي يحتاج فيها النموذج إلى الإبقاء على قيود متنافسة كثيرة في ذهنه في وقت واحد. تستغرق Sol وقتًا أطول، لكنها تنتج مخرجات تحتاج إلى عدد أقل من جولات التصحيح في المعالجة اللاحقة.

في بنية وكيل من مرحلتين، النمط الذي ينجح هو Luna للفرز والتوجيه، و Sol للتنفيذ على المهام الفرعية الصعبة. تدفع كلفة زمن الاستجابة حيث تستحق الدفع، لا حيث لا تستحق.

كيف يتعامل GPT-5.6 مع حلقة الوكيل

فريق يتعاون حول شاشة لوحة تحكم للذكاء الاصطناعي

حلقة الوكيل بسيطة من حيث المبدأ: تَدرك الحالة، ثم تقرر الإجراء، ثم تستدعي الأداة، ثم تلاحظ النتيجة، ثم تكرر. ما يكسر الحلقة عمليًا هو الغموض المتراكم. بعد عدة استدعاءات للأدوات، يتدهور اتخاذ القرار لدى النموذج لأن السياق امتلأ بالضجيج من المخرجات الخام لأدوات، ورسائل الأخطاء، والحالة المكتملة جزئيًا.

يدير GPT-5.6 هذا الأمر أفضل من أسلافه لسببين محددين. أولًا، يلخّص الحالة الوسيطة بثبات أكبر بدلًا من حمل المخرجات الخام حرفيًا. ثانيًا، دُرّب بإشارات تعزيز تكافئ إتمام المهمة أكثر من الإسهاب. والنتيجة وكيل يبقى على المسار بدلًا من توسيع نطاق عمله في منتصف المهمة.

تفكيك المهام عمليًا

عندما تعطي GPT-5.6 هدفًا عامًا مثل "ابحث عن ثلاثة منافسين، ولخّص أسعارهم، وأعدّ جدول مقارنة"، فإنه يفككه بشكل طبيعي إلى مهام فرعية متتابعة دون الحاجة إلى تعدادها صراحةً. ينظر النموذج إلى الهدف كخطة يبنيها، لا كأمر نصي يرد عليه فحسب.

يكون هذا السلوك الأكثر موثوقية حين تحدد تعليماتك النظامية الأدوات المتاحة وصيغة المخرجات المتوقعة قبل بدء المهمة. يقرأ GPT-5.6 مخطط الأدوات ويخطط وفقه. إذا كان المخطط محددًا جيدًا، يكون التفكيك نظيفًا. وإذا كان المخطط غامضًا، فإن التفكيك يعكس هذا الغموض إليك.

التعافي من الأخطاء ومنطق إعادة المحاولة

عينا مطوّر منعكستان على شاشة حاسوب داكنة

من أكثر التحسينات التي لا تحظى بالتقدير الكافي في GPT-5.6 طريقة تعامله مع أخطاء الأدوات. عندما يفشل استدعاء أداة وتُعاد رسالة الخطأ في السياق، لا يكتفي النموذج بإعادة الاستدعاء نفسه بالمعاملات ذاتها. بل يعدّل المعاملات، أو يجرّب نهجًا بديلًا، أو يشير إلى أنه يحتاج إلى معلومات إضافية قبل المتابعة.

هذا السلوك التصحيحي الذاتي يقلّل بشكل ملموس من كمية هيكلة معالجة الأخطاء التي تحتاج إلى كتابتها بنفسك. كانت النماذج السابقة تتطلب منطق إعادة محاولة صريحًا، واستراتيجيات تأخير تصاعدي، وسلاسل احتياط في شيفرة التنسيق لديك. يتولى GPT-5.6 جزءًا من هذا العبء بشكل أصلي، خاصة مع الأخطاء الشائعة مثل استجابات API الفارغة، والبيانات المشوّهة، أو رسائل تقييد معدل الطلبات.

💡 مهم: ما زال تعافي GPT-5.6 من الأخطاء يحتاج إلى حواجز حماية. حدّد أقصى عدد لإعادة المحاولات في طبقة التنسيق لديك. النموذج قادر على الدوران بلا نهاية إن اقتنع بأنه يستطيع حل خطأ أداة لا يمكن حله.

كيفية استخدام GPT-5.6 على PicassoIA

سطح مكتب من أعلى مع حاسوب محمول ودفتر وفنجان قهوة

يتيح لك قسم النماذج اللغوية الكبيرة في PicassoIA الوصول المباشر إلى GPT 5.6 Luna، وGPT 5.6 Terra، وGPT 5.6 Sol دون إدارة مفاتيح API أو البنية التحتية. إليك طريقة إعداد سير عمل وكيل متعدد الخطوات.

الخطوة 1: اختر الإصدار

ابدأ باختيار الإصدار المناسب لتعقيد مهمتك. بالنسبة لمعظم سير عمل الوكلاء، ابدأ بنموذج Luna لاختبار السرعة، وانتقل إلى Sol عندما تتطلب المهمة استدلالًا أعمق. يُعد Terra الخيار الافتراضي الصحيح لأي شيء سيدخل الإنتاج حيث تكون المخرجات المنظمة المتسقة شرطًا أساسيًا.

انتقل إلى صفحة النموذج على PicassoIA، أو ابدأ من جميع النماذج وصفِّ النتائج حسب فئة النماذج اللغوية الكبيرة.

الخطوة 2: اضبط التعليمات النظامية

التعليمات النظامية هي المكان الذي يُعرَّف فيه سلوك الوكيل. تتضمن التعليمات النظامية عالية الأداء لـ GPT-5.6 تعريفًا واضحًا للدور، وملخصًا للأدوات المتاحة ومتى تُستخدم كل واحدة، والمخطط الدقيق للمخرجات النهائية، وسلوكًا صريحًا عند الفشل يحدد ما يجب فعله حين تعيد خطوة بيانات فارغة أو خطأ.

كن محددًا. يعمل GPT-5.6 بشكل أفضل مع التعليمات الدقيقة منه مع الإرشادات المفتوحة. إليك مثالًا عمليًا لوكيل بحث تنافسي:

You are a research agent with access to a web search tool and a summarization tool.

Task: given a company name, return a JSON object with the company's pricing tiers,
main features, and target customer.

Tools:
- search(query: string): returns raw search results
- summarize(text: string): returns a condensed summary

Output:
{
  "company": string,
  "pricing_tiers": string[],
  "main_features": string[],
  "target_customer": string
}

If a tool returns an error, retry once with a modified query before moving on.

الخطوة 3: حلّل المخرجات

مطوّرة تعرض بنية الذكاء الاصطناعي على الفريق

يُعد GPT 5.6 Terra موثوقًا بشكل خاص في المخرجات المنظمة. عندما تحدد مخطط JSON في التعليمات النظامية، ينتج النموذج باستمرار JSON قابلًا للتحليل دون أن يتداخل معه نص محيط أو أسوار شيفرة بصيغة Markdown مع المحلّل لديك.

بالنسبة إلى Luna و Sol، أضف خطوة معالجة لاحقة تزيل أي نص محيط قبل التحليل. دالة بسيطة تستخرج أول كتلة JSON صالحة تعالج الحالات الطرفية دون الحاجة إلى مُنفِذ مخطط على مستوى النموذج.

3 أنماط فعلية لوكلاء تنجح مع GPT-5.6

حلقة البحث ثم الكتابة

هذا أكثر أنماط الوكلاء شيوعًا: اجلب المعلومات من مصادر متعددة، ثم ادمجها، وأنتج مخرجات منظمة. يتعامل GPT-5.6 مع هذا النمط بموثوقية لأنه يحتفظ بالمحتوى المجلوب في السياق بدقة عبر خطوة الدمج، دون أن يخلط البيانات من مصادر مختلفة.

الخيار المعماري الحاسم هو إنجاز كل الجلب قبل أي كتابة. الوكلاء الذين يتناوبون بين الجلب والكتابة يُنتجون نتائج غير متسقة، لأن النموذج ينتقل بين وضع الاسترجاع ووضع التوليد في منتصف المهمة. اجلب دفعة واحدة، ثم اكتب مرة واحدة والصورة الكاملة متاحة.

دورة الشيفرة والتصحيح والاختبار

مطوّران يبرمجان معًا أمام شاشة

يتعامل GPT 5.6 Sol مع توليد الشيفرة التكراري أفضل من أي إصدار سابق من GPT. يكتب النموذج الشيفرة، ويتلقى مخرجات الاختبار، ويشخّص الفشل، ثم يكتب نسخة مصححة. يمكن لهذه الدورة أن تعمل أربع إلى ست مرات قبل أن تحتاج إلى تدخل بشري في الإعدادات المنظمة جيدًا.

تفصيل الإعداد الحاسم: مرّر رسالة الخطأ الكاملة وتتبع المكدس في نتيجة الأداة، لا نسخة ملخصة. يستخدم GPT-5.6 بيانات الخطأ الخام لتحديد موقع العلة بدقة أكبر مما يفعل مع ملخص يصفه إنسان للمشكلة. المخرجات الخام أفضل هنا.

وهذا النمط هو أيضًا المكان الذي يستحق فيه Claude Sonnet 5 التجربة كبديل. كلا النموذجين يؤدي جيدًا في دورات تكرار الشيفرة؛ والفرق العملي أن Sol يميل إلى تصحيحات أدق وأقل حجمًا، بينما يعيد Claude Sonnet 5 كثيرًا ما كتابة مزيد من السياق المحيط. لا أحد منهما أفضل بالمطلق؛ الأمر يعتمد على مدى دقة الإصلاح الذي تحتاجه.

جلب البيانات ثم تحويلها ثم التقرير

بالنسبة إلى وكلاء خطوط معالجة البيانات، يُعد GPT 5.6 Terra الخيار المناسب. النمط هو: استدعاء API للبيانات، وتطبيق تحويل محدد، والتحقق من مخطط المخرجات، ثم الكتابة إلى وجهة. يعني السلوك المضبوط للإنتاج لدى Terra أنه يتبع قواعد التحويل بثبات عبر سجلات كثيرة، دون انحراف المخطط الذي أثّر في النماذج السابقة على مجموعات البيانات الكبيرة.

إذا كان خط الإنتاج لديك يعالج مئات العناصر، فإن ثبات Terra يترجم مباشرة إلى مشكلات أقل في جودة البيانات لاحقًا، وعمل يدوي أقل في التنظيف.

نماذج تستحق المقارنة مع GPT-5.6

يضم مجال الوكلاء متعددي الخطوات عدة منافسين أقوياء. إليك نظرة صريحة على كيفية مقارنة الأكثر صلة منهم عند استخدامهم عبر PicassoIA.

Claude Sonnet 5

يتفوق Claude Sonnet 5 في الاستدلال على الوثائق الطويلة وجلسات الشيفرة المطولة. بالنسبة لحلقات الوكلاء التي تتطلب قراءة قواعد شيفرة كبيرة أو توثيقًا مطولًا، غالبًا ما ينتج Claude Sonnet 5 تقييمًا أكثر تماسكًا من GPT-5.6 Sol في المحاولة الأولى. المقايضة أن GPT-5.6 ينتج عادةً مخرجات JSON منظمة بموثوقية أكبر لسير عمل استدعاء الأدوات، ما يجعله الخيار الافتراضي الأفضل لخطوط وكلاء الإنتاج.

Deepseek R1

يُعد Deepseek R1 النموذج الاستدلالي الذي يجب قياس الأداء بمقارنته حين يحتاج وكيلك إلى العمل عبر سلاسل منطقية معقدة. يعرض خطوات تفكيره، وهذا مفيد فعلًا لتصحيح سلوك الوكيل في الإنتاج. حين تحتاج إلى مراجعة ما قرره النموذج في كل خطوة من خط طويل، فإن شفافية R1 ذات قيمة تشغيلية تتجاوز كونها مثيرة للاهتمام.

Kimi K2.6

يحقق Kimi K2.6 أداءً قويًا في مهام الشيفرة الوكيلية. إن كان الاستخدام الأساسي لوكيلك هو توليد الشيفرة وتحريرها داخل قواعد شيفرة كبيرة قائمة، فإن K2.6 بديل جاد عن Sol. يتميز خصوصًا في المهام التي تتطلب قراءة الشيفرة الموجودة وتوسيعها بتماسك، بدلًا من التوليد من الصفر.

Grok 4

يقدم Grok 4 أداءً قويًا في الاستدلال متعدد الخطوات، مع ميزة متميزة في مهام البيانات الفورية. بالنسبة لسير عمل الوكلاء الذي يعتمد على الأحداث الجارية أو المعلومات الحديثة ضمن المهمة، يستحق Grok 4 التقييم إلى جانب GPT-5.6 Terra قبل الالتزام ببنية إنتاج.

ما الذي يخطئ فيه GPT-5.6

لا يكتمل أي قسم عن نموذج دون أنماط الفشل. تظهر مشكلتان محددتان مرارًا في عمليات نشر وكلاء GPT-5.6 في الإنتاج.

تضخم التوكنات في الخطوط الطويلة

يكون GPT-5.6 مسهبًا في استدلاله الداخلي متى أُتيح له ذلك. في الخطوط الطويلة، يخلق هذا مشكلة متراكمة: كل خطوة تضيف توكنات استدلال إلى السياق، فيكبر السياق، ويزيد زمن الاستجابة، وترتفع التكلفة أسرع مما هو متوقع.

الحل على مستوى الأمر النصي. وجّه النموذج صراحةً إلى الإيجاز في استدلاله الداخلي، وإلى إرجاع المخرجات المطلوبة فقط. عبارة "كن موجزًا" غامضة جدًا. أما "أرجِع كائن JSON فقط، دون أي نص محيط أو شرح" فهي دقيقة بما يكفي ليتبعها GPT-5.6 بموثوقية عبر أدوار كثيرة.

التزام غير متسق بمخطط JSON في الحالات الطرفية

مطوّر يعمل متأخرًا في مكتب منزلي عند الغروب

يُعد GPT 5.6 Terra موثوقًا جدًا في مخرجات JSON، لكن توجد حالات طرفية. المخططات المتداخلة بعمق، ومصفوفات الكائنات ذات الحقول الاختيارية، والمخططات ذات الأنواع المتحدة تتسبب أحيانًا في أن يُسقط النموذج الحقول الاختيارية أو يسطّح البنى المتداخلة بشكل غير متوقع.

الإصلاح العملي: اختبر مخططك الدقيق بمجموعة متنوعة من المدخلات قبل النشر في الإنتاج. تحقق من كل استجابة برمجيًا، وحدّد سلوكًا احتياطيًا واضحًا لحالات عدم تطابق المخطط، بدلًا من افتراض أن المخرجات ستكون مثالية دائمًا.

💡 نصيحة: إن كان مخططك يحتوي على حقول اختيارية يحذفها النموذج باستمرار، فاجعلها مطلوبة مع قيمة افتراضية فارغة. GPT-5.6 أكثر موثوقية في تضمين الحقول المطلوبة منه في استنتاج الحقول الاختيارية التي تنطبق في سياق معين.

ابنِ وكيلك الأول على PicassoIA

أسرع طريقة لاختبار GPT-5.6 في سير عمل الوكلاء متعددي الخطوات هي البدء صغيرًا. اختر مهمة من خطوتين: اجلب شيئًا ما، ثم أعد تشكيله. اجعل ذلك يعمل بموثوقية قبل إضافة خطوات أخرى. الخطأ الشائع هو بناء خط من عشر خطوات قبل التحقق من أن كل خطوة فردية تعمل بنظافة بمعزل عن غيرها.

يجعل PicassoIA هذا سهلًا وقليل الاحتكاك. تحصل على وصول إلى GPT 5.6 Luna، وGPT 5.6 Terra، وGPT 5.6 Sol في مكان واحد، إلى جانب بدائل مثل Claude Sonnet 5، وKimi K2.6، وDeepseek R1، وGrok 4، فيمكنك تشغيل سير العمل الوكيل نفسه عبر النماذج ورؤية الفرق في جودة المخرجات دون التنقل بين المنصات.

إذا كان خط الوكيل لديك يحتاج إلى إنتاج صور ضمن مخرجاته، فإن 91 نموذجًا لتحويل النص إلى صورة على PicassoIA وأدوات تحرير الصور المدمجة توسّع ما يستطيع سير عمل مدفوع بنموذج لغوي كبير توليده. وكلاء يكتبون ثم يوضحون، كل ذلك من منصة واحدة.

ابدأ بمهمة تعرفها جيدًا. ابنِ الوكيل، وعطّله عمدًا، ولاحظ كيف يستجيب GPT-5.6 للفشل. سلوك الفشل ذاك سيخبرك بالإصدار الذي يجب نشره في الإنتاج أكثر من أي اختبار معياري.

شارك هذا المقال

اختر لغتك

مقالات ذات صلة