ما الذي سيكتبه GPT-5.6 فعلًا عندما تدفعه إلى أقصى حدوده

يأتي GPT-5.6 في ثلاثة إصدارات مختلفة، ويتصرف كل منها بطريقة مختلفة عند اختباره تحت الضغط. يستعرض هذا المقال مخرجات حقيقية من Luna وTerra وSol، ويقارن بين جودة الكتابة، وأداء الاستدلال، وسقف الإبداع، ودقة الشيفرة، وما يحدث فعلًا عندما تتجاوز الأوامر المهذبة إلى مجالات أكثر تطلبًا.

ما الذي سيكتبه GPT-5.6 فعلًا عندما تدفعه إلى أقصى حدوده
Cristian Da Conceicao
مؤسس Picasso IA

الجميع جرّب الاختبار المهذب. تطلب من النموذج تلخيص شيء ما فيلخّصه، وتطلب كتابة بريد إلكتروني فيكتبه. لكن GPT-5.6 لم يُبنَ لهذا النوع من المهام، والاختبار المهذب لا يخبرك إلا بالقليل عن المكان الذي يعمل فيه هذا النموذج فعلًا. ما الذي سيكتبه GPT-5.6 فعلًا عندما تدفعه إلى أقصى حدوده ليس فرضية، بل نتيجة. بعد تشغيل مئات الأوامر الاختبارية الصارمة على الإصدارات الثلاثة، بدءًا من استكمالات قصصية من 10,000 كلمة وصولًا إلى ألغاز منطقية متكررة ومواصفات تقنية متعمّدة الغموض، تتضح صورة واضحة. للنموذج شخصية. وله حدود. وهذه الحدود ليست حيث يظن معظم الناس.

ثلاثة إصدارات من GPT-5.6، وثلاث شخصيات

لم تُطلق OpenAI نموذجًا واحدًا باسم GPT-5.6. بل أطلقت ثلاثة نماذج تشترك في البنية الأساسية نفسها، لكنها تتباين بوضوح في حالات الاستخدام التي صُممت لها. الإصدار الذي تختاره يغيّر كل شيء فيما يجب أن تتوقعه من المخرجات.

ثلاثة إصدارات من GPT-5.6 معروضة على هواتف ذكية بدرجات ألوان مختلفة

GPT-5.6 Luna: سريع ولكنه صاحب رأي

GPT-5.6 Luna مُحسَّن للسرعة والإنتاجية في المحادثة. عندما تدفعه في مهمة إبداعية، يستجيب بسرعة، وأحيانًا أسرع مما تستطيع استيعابه. الثمن هو أنه صاحب رأي. Luna يتخذ قرارات. يحدد النبرة والبنية ومستوى التفصيل، وغالبًا قبل أن تكون قد حددت ما تريده بالكامل. هذا ممتاز للتكرار السريع. لكنه مشكلة عندما تحتاج إلى دقة صارمة في الالتزام بتعليمات أسلوب معيّن.

ما يكتبه Luna عندما تدفعه:

  • قصص قصيرة ذات صوت قوي، لكن مع تحولات متكررة في النبرة
  • شروحات محادثية تختصر التعقيد في تشبيهات
  • نصوص تسويقية تميل إلى الطابع غير الرسمي والمباشر
  • تفاصيل محددة مختلقة أحيانًا عندما يُدفع إلى مجال الوقائع

معدل الهلوسة تحت الضغط هو أبرز نقاط ضعف Luna. اطلب منه ذكر أرقام محددة أو كتابة خط زمني تاريخي من الصفر، وسيملأ الفجوات ببيانات تبدو معقولة. يبدو الناتج واثقًا، لكن البيانات مختلقة أحيانًا.

GPT-5.6 Terra: كاتب الإنتاج

تم تقديم GPT-5.6 Terra صراحةً بوصفه جاهزًا للإنتاج، وتؤكد المخرجات ذلك. حيث يرتجل Luna، يثبّت Terra. يحافظ على البنية عبر المخرجات الطويلة، ويحافظ على نبرة متسقة عبر مستندات من 3,000 كلمة، ونادرًا ما يختلق تفاصيل. عندما لا يعرف شيئًا، يقول ذلك، أو يتحفظ عليه بوضوح.

ما يكتبه Terra عندما تدفعه:

  • مقالات طويلة بتسلسل متماسك للأقسام
  • توثيق تقني لا ينحرف في منتصفه
  • أوصاف منتجات بلغة دقيقة وحشو قليل
  • تعليقات برمجية تصف بدقة ما تفعله الشيفرة

يظهر ضعف Terra في المهام الإبداعية القصيرة. اطلب منه عبارة واحدة لاذعة، وسيعيد شيئًا صحيحًا لكنه باهت. صُمم النموذج للعمق المستمر، لا للدعابة السريعة.

GPT-5.6 Sol: الشيفرة أولًا، وكل شيء آخر ثانيًا

GPT-5.6 Sol هو الإصدار المركّز على البرمجة، ويتصرف كذلك. عندما تدفعه في مهام برمجية معقدة، أو إعادة هيكلة متعددة الملفات، أو جلسات تصحيح الأخطاء مع سياق ناقص، يتفوق على شقيقيه بفارق ملحوظ. كتابته النثرية مقبولة لكنها نادرًا ما تكون ملهمة.

💡 النمط المشترك بين الإصدارات الثلاثة: أيًّا كان الإصدار الذي تختاره، تتناسب جودة المخرجات مع دقة أمرك النصي. الأوامر العامة تنتج مخرجات عامة. الأوامر المحددة تنتج أشياء تبدو قادرة بشكل مربك تقريبًا.

الاختبار الحقيقي الأول: الكتابة الإبداعية

غالبًا ما يكوّن الناس انطباعهم الأول القوي عن النموذج من خلال الكتابة الإبداعية. وهي أيضًا المجال الذي يكون فيه التباين بين المحاولات الواحدة أعلى ما يكون.

يدا كاتب على لوحة مفاتيح ميكانيكية مضاءة بمصباح مكتب كهرماني دافئ

خيال بلا قوالب آمنة

معظم النماذج اللغوية الكبيرة، عندما تُطلب منها كتابة قصة، تلجأ إلى القوالب السردية نفسها: البطل يواجه صراعًا، البطل يتغلب على الصراع، والدرس يُفهم ضمنًا. يكسر GPT-5.6 هذا النمط أكثر من أسلافه. مع أمر محدد بما يكفي، يولّد نهايات تناقض المقدمة، وشخصيات لا تجد حلًا، ونثرًا له إيقاع حقيقي بدلًا من نثر يكتفي بوصف ما يجري.

عدد الكلمات الذي يبدأ عنده النموذج بالانحراف يختلف حسب المهمة:

الإصدارنقطة الانحراف المعتادةالتعافي عند إعادة الأمر
Luna~1,500 كلمةسريع، متابعة واحدة
Terra~4,000 كلمةمتوسط، متابعة إلى اثنتين
Sol~2,000 كلمة (نثر)بطيء، يتطلب إعادة صياغة

"الانحراف" هنا يعني أن النموذج يفقد خيط التفاصيل السابقة للشخصيات، أو يبدأ في تكرار الموضوعات، أو يغيّر الصوت السردي دون أن يُطلب منه ذلك.

حيث يصبح Luna غير متوقع

عندما تدفع GPT-5.6 Luna نحو خيال ملتبس أخلاقيًا، وسيناريوهات بلا أبطال واضحين أو حلول بسيطة، يفعل شيئًا مثيرًا للاهتمام: يختار جانبًا. للنموذج إحساس ضمني قوي بالعدالة السردية. سيكتب شريرًا بإقناع لثلاث صفحات، ثم يميل بالقصة بهدوء كي يفشل مخطط الشرير بطريقة تبدو من صنع المؤلف لا عشوائية.

يمكنك التعامل مع هذا. إذا حددت في أمرك "لا تحلّ التوتر الأخلاقي"، يُبقيه Luna مفتوحًا. دون هذا التعليمة، يُغلق القصص. وهذا ليس خللًا. إنه ميل مُدرَّب. ومعرفة وجوده تتيح لك التعامل معه من خلال صياغة الأوامر.

ماذا يحدث مع الأوامر التقنية

أكثر الاختبارات كشفًا ليست الإبداعية، بل التقنية.

ثلاث شاشات عمودية تعرض شيفرة مُلوّنة الصياغة في بيئة تطوير حديثة

شيفرة تعمل فعلًا

GPT-5.6 Sol يكتب شيفرة تعمل من المحاولة الأولى في غالبية حالات الاختبار. ليس في كل حالة، وليس مع كل لغة. لكن الفارق بين معدل تشغيل Sol من المحاولة الأولى وأجيال GPT السابقة قابل للقياس. يمتلك النموذج وعيًا أقوى بأخطاء التشغيل الشائعة، ومتطلبات الاستيراد، وقيود الأنواع من أسلافه.

أقوى لغات Sol بحسب جودة المخرجات الملاحظة:

  1. Python (معالجة البيانات، وتكامل واجهات API)
  2. TypeScript (تنفيذ كامل للدوال مع الأنواع)
  3. SQL (استعلامات معقدة مع CTEs ودوال النوافذ)
  4. Bash (كتابة السكربتات مع معالجة مناسبة للأخطاء)

حيث يتعثر Sol: Rust وGo. النموذج يفهم الصياغة، لكنه يقلل من تقدير قيود مدقق الاستعارة في Rust وأنماط goroutines في Go على التوالي. الشيفرة تبدو صحيحة. وغالبًا ليست كذلك.

حالة حدّية في تصحيح الأخطاء

أكثر ما يفعله Sol فائدة هو تصحيح الأخطاء مع سياق ناقص. أعطه تتبع مكدس، ودالة جزئية، ووصفًا للسلوك المقصود، وسيحدد مصدر الخطأ بشكل صحيح في معظم الحالات دون الحاجة إلى قاعدة الشيفرة كاملة. هنا يثبت النموذج قيمته في سير عمل تطوير حقيقي.

احتاج GPT-5.4 وGPT-5.1 إلى دعم إضافي للوصول إلى الاستنتاج التشخيصي نفسه. يستدل Sol على السياق المفقود بشكل صريح، ويذكر افتراضاته قبل تقديم الإصلاح، مما يجعل المخرجات أسهل بكثير في التحقق منها.

التماسك في النصوص الطويلة: حيث تنهار النماذج

يظل الطول أصعب اختبار لأي نموذج لغوي.

باحث يحمل كومة كثيفة من أوراق مطبوعة مُعلَّقة بملاحظات في ضوء نافذة طبيعي

اختبار الانحراف عند 5,000 كلمة

عند 5,000 كلمة، تُظهر معظم النماذج واحدًا على الأقل من أنماط الفشل الثلاثة:

  1. التكرار الموضوعي: إعادة طرح نقطة سبق طرحها بصياغة مختلفة قليلًا
  2. عدم اتساق الشخصيات: شخص أو كيان مُسمّى يتصرف بما يناقض تعريفه السابق
  3. انهيار البنية: يتوقف المستند عن اتباع المخطط المقدم في البداية

يُظهر GPT-5.6 Terra أقل الإخفاقات بين الإصدارات الثلاثة عند علامة 5,000 كلمة. في الاختبار، أكمل مستندات منظمة من 5,000 كلمة بتماسك موضوعي صحيح في نحو 80% من المحاولات دون تصحيح في منتصف التشغيل.

💡 نصيحة عملية: لأي مستند يتجاوز 3,000 كلمة، زوّد Terra بمخطط مرقّم في أعلى الأمر، واطلب منه صراحةً أن يرجع إلى هذا المخطط عند كل فاصل بين الأقسام. هذا وحده يخفض معدل الانحراف بشكل ملحوظ.

Terra يبقى على المسار

ما يفعله Terra بشكل مختلف هو الحفاظ على مراجع داخلية. إذا أثبتّ مفهومًا مُسمّى أو مصطلحًا محددًا في وقت مبكر من المستند، يستخدمه Terra بثبات دون الحاجة إلى إعادة الأمر. عانت نماذج GPT السابقة من "فقدان ذاكرة جزئي" في كل فقرة، ما أجبر الكتّاب على إعادة تكرار السياق باستمرار. Terra يحتفظ بالخيط.

يقدم GPT-5 Pro تماسكًا مشابهًا في النصوص الطويلة مع إضافة آثار استدلال صريحة، وهي مفيدة للمستندات التحليلية لكنها تضيف إسهابًا كبيرًا للنصوص الإبداعية.

الاستدلال تحت الضغط

دفع النموذج في الاستدلال يختلف عن دفعه في الكتابة. أخطاء الكتابة غالبًا ما تكون قابلة للإصلاح. أخطاء الاستدلال تتراكم.

لوح أبيض كبير مغطى بمخططات منطقية وأشجار قرار مكتوبة بخط اليد

ألغاز منطقية ومسائل متعددة الخطوات

تُظهر مجموعة الألغاز المنطقية المعيارية، وألغاز الشبكات، ومسائل الرضا بالقيود، والمسائل الرياضية اللفظية متعددة الخطوات نمطًا ثابتًا عبر إصدارات GPT-5.6. الإصدارات الثلاثة كلها تؤدي جيدًا في المسائل التي تتطلب من 3 إلى 5 خطوات استنتاجية. ينخفض الأداء في المسائل التي تتطلب 8 خطوات أو أكثر دون نقاط تحقق وسيطة.

المتغير الحاسم هو ما إذا كان النموذج مسموحًا له بإظهار عمله. مع أمر سلسلة التفكير، تصل الإصدارات الثلاثة إلى إجابات صحيحة في المسائل الأصعب بشكل أكثر بكثير مما تفعله مع أوامر الإجابة المباشرة. هذا ليس جديدًا. الجديد هو جودة الاستدلال الوسيط. الخطوات أكثر ترابطًا منطقيًا في الغالب، لا مرتبطة بشكل فضفاض.

الدقة الملاحظة حسب نوع المسألة:

فئة المسألةLunaTerraSol
الاستدلال الاستنباطي (5 خطوات)87%83%79%
مسائل رياضية لفظية74%78%81%
الرضا بالقيود68%71%76%
الاستدلال المضاد للواقع82%79%70%

ميزة Sol

في كل ما يتعلق بالاستدلال العددي أو حل المسائل الخوارزمية، يتفوق GPT-5.6 Sol على الإصدارين الآخرين. الفارق ملحوظ في المسائل التي تجمع بين فهم النص النثري والحسابات. يحلل Sol القيود العددية بشكل صحيح بدرجة أكبر، خاصة عندما تكون مضمّنة في فقرات بدلًا من أن تُكتب كمعادلات صريحة.

الأمر الخام مقابل الأمر المصقول

من أكثر الاختبارات كشفًا أبسطها: الطلب نفسه، مرتين. مرة مكتوب بعناية مع السياق الكامل. ومرة مكتوب بالطريقة التي يكتب بها معظم الناس أوامرهم فعلًا.

لقطة مقرّبة لدفتر ملاحظات بعمودين من الأوامر المكتوبة بخط اليد في إضاءة جانبية

ما يتغير عندما تتوقف عن اللطف

تقلصت الفجوة في المخرجات بين أمر منظم جيدًا وأمر مختصر وخشن بشكل ملحوظ مع GPT-5.6 مقارنةً بالنماذج السابقة. النموذج أفضل في استنتاج المقصد من التعليمات غير المكتملة. هذا ليس سببًا للتوقف عن كتابة أوامر جيدة. إنه إشارة إلى أن النموذج يصبح أكثر متانة في ظروف الاستخدام الواقعية.

ما ينتجه الأمر الخام بشكل مختلف:

  • تفسير حرفي أكثر للمصطلحات الغامضة
  • أطوال مخرجات افتراضية أقصر (ما لم يُطلب غير ذلك)
  • أسئلة أكثر تُوجَّه إلى المستخدم في السياقات المحادثية
  • تباين أعلى في اختيار النبرة

النتيجة الأكثر ثباتًا: الأوامر الخام تنتج مخرجات أسرع بسقوف جودة أدنى. النموذج يفعل أقل. ويملأ افتراضات أقل. وفي بعض السياقات، هذا تحديدًا ما تريده.

أين يضع النموذج حدّه

يمتلك GPT-5.6 عتبة واضحة يتوقف عندها ويطلب التوضيح بدلًا من المتابعة بافتراض محفوف بالمخاطر. هذه العتبة أكثر معايرة من الأجيال السابقة. لا يقاطع دون داعٍ في المهام الإبداعية الملتبسة. لكنه يقاطع في المهام التقنية الملتبسة حيث قد يتسبب الافتراض في مشكلات حقيقية، مثل طلب تغيير مخطط قاعدة بيانات بنطاق غير واضح.

هذا السلوك ليس موحدًا عبر الإصدارات. GPT-5.6 Luna يقاطع أقل من غيره، ويفضّل افتراض شيء ما ووضع علامة عليه. GPT-5.6 Terra يطرح أسئلة أكثر في المهام الطويلة. GPT-5.6 Sol يطرح أكبر عدد من الأسئلة في كل ما يمس الشيفرة الإنتاجية.

GPT-5.6 مقابل المنافسة الآن

كل مقال يقارن النماذج بالاختبارات المعيارية يعتمد على عدد قليل من مجموعات البيانات العامة نفسها. هذا القسم لا يفعل ذلك. إنه يتناول جودة المخرجات الملاحظة في المهام الحقيقية.

أربعة حواسيب محمولة مفتوحة على طاولة اجتماعات تعرض واجهات محادثة ذكاء اصطناعي مختلفة من الأعلى

DeepSeek R1 وGrok 4

DeepSeek R1 وGrok 4 هما أقوى بديلين بمستويات قدرات متقاربة تقريبًا. ولكل منهما مجالات محددة يتفوق فيها على إصدارات GPT-5.6.

DeepSeek R1 يتفوق على الإصدارات الثلاثة من GPT-5.6 في الاستدلال الرياضي عند أعداد الخطوات العالية. جودة سلسلة التفكير لديه أقوى، وهو أكثر قدرة على اكتشاف أخطائه الحسابية أثناء الحساب. في مهام الاستدلال الخالص، هو منافس جاد.

Grok 4 أقوى في تركيب المعلومات الفورية والتحليل الذي يتضمن رأيًا. إنه أقل حذرًا، ما يجعله أكثر فائدة لبعض المهام الإبداعية والتحريرية. وهو أيضًا أكثر عرضة لإنتاج مخرجات تحتاج إلى تدقيق للحقائق.

يحتفظ GPT-5.6 بالتفوق في جودة المخرجات المستدامة. بالنسبة للمهام التي تتطلب 2,000 كلمة أو أكثر، أو المحادثات متعددة الأدوار مع سياق متراكم، يتفوق GPT-5.6 Terra وGPT-5.6 Sol على المنافسين في الاتساق.

واقع تكلفة التوكنات

الإصدارات ليست مُسعّرة بالتساوي، ومطابقة الإصدار المناسب للمهمة المناسبة هي المكان الذي تظهر فيه وفورات التكلفة الحقيقية:

النموذجالتكلفة النسبية لكل مليون توكنأفضل استخدام
GPT-5.6 Lunaالأدنىالمسودات السريعة، الأسئلة والأجوبة
GPT-5.6 Terraمتوسطةالنصوص الطويلة، التوثيق
GPT-5.6 Solالأعلىالشيفرة، تصحيح الأخطاء
GPT-5 Proمتميزةالاستدلال المعقد

تشغيل Sol على مهام يعالجها Luna بكفاءة كافية هو أكثر أوجه عدم الكفاءة الشائعة في التكلفة التي لوحظت في سير العمل الحقيقي. يظل GPT-5.2 خيارًا وسطًا متينًا عندما تحتاج إلى أكثر مما يقدمه Luna، لكن المهمة لا تبرر مستوى تسعير Sol.

استخدام GPT-5.6 على PicassoIA

يتطلب الوصول إلى GPT-5.6 عبر API التسجيل، ومواعيد الموافقة، وإدارة الفوترة المستمرة. PicassoIA يزيل هذه الحواجز.

مطوّر يعمل على مكتب واقف مضاء فقط بشاشات الطرفية ليلًا

بلا مفتاح API، وبلا طابور

الإصدارات الثلاثة من GPT-5.6 متاحة مباشرةً من خلال مجموعة النماذج اللغوية الكبيرة في PicassoIA دون حساب OpenAI، ودون قائمة انتظار، ودون إدارة التوكنات أو الفوترة بشكل منفصل. تختار الإصدار، وتكتب الأمر، ويبدأ الناتج فورًا.

يهم هذا أكثر ما يهم في:

  • الفرق التي لا تملك وصول API حاليًا: لا حاجة إلى إجراءات شراء
  • سير العمل الإبداعي: التبديل بين Luna للمسودات وTerra للنسخ النهائية في الجلسة نفسها
  • الاختبار: تشغيل الإصدارات الثلاثة على الأمر نفسه جنبًا إلى جنب لمقارنة شخصية المخرجات قبل الالتزام بواحد منها

أي إصدار لأي مهمة

القرار ليس معقدًا بمجرد أن تجرّب كل واحد منها:

  • كتابة المسودات الأولى، والعصف الذهني، والبحث المحادثي: GPT-5.6 Luna
  • المستندات الطويلة، والتقارير المنظمة، ونبرة متسقة عبر الأقسام: GPT-5.6 Terra
  • توليد الشيفرة، وتصحيح الأخطاء، وحل المشكلات التقنية: GPT-5.6 Sol

يمكنك أيضًا اللجوء إلى Claude Opus 4.7 عندما تتطلب المهمة دقة جراحية على حساب الحجم، أو إلى Gemini 3.5 Flash عندما تكون سرعة التنفيذ الأولوية القصوى والمهمة محددة بوضوح.

ماذا تفعل فعلًا بهذا

كل ملاحظة في هذا المقال لها دلالة عملية. GPT-5.6 ليس نموذجًا واحدًا بسلوك واحد. إنه ثلاث شخصيات مختلفة مُحسَّنة لأجزاء مختلفة من مجموعة الكتابة والاستدلال. سقف جودة المخرجات مرتفع فعلًا. أما الحد الأدنى فيعتمد بشكل شبه كامل على مدى تحديد أمرك النصي.

شاشة حاسوب محمول تعرض واجهة PicassoIA الداكنة بزاوية مائلة على مكتب من خشب البلوط

إذا كنت تشغّل GPT بأوامر مهذبة ومنسقة جيدًا وتحصل على مخرجات مهذبة ومنسقة جيدًا، جرّب شيئًا مختلفًا. أعطه قيدًا عليه أن يجد طريقة للالتفاف حوله. أخبره بالنهاية قبل أن يكتب البداية. اطلب منه أن يدافع عن موقف كان سيتحفظ عليه عادةً. راقب ما يفعله عندما يُغلَق الطريق الآمن.

هنا يصبح ما الذي سيكتبه GPT-5.6 فعلًا عندما تدفعه إلى أقصى حدوده مثيرًا للاهتمام حقًا، ومفيدًا حقًا.

الإصدارات الثلاثة، Luna وTerra وSol، متاحة الآن على PicassoIA. دون طابور، ودون إعداد API. ابدأ بالمهمة التي كنت تتجنبها لأنها بدت معقدة أكثر من اللازم على الذكاء الاصطناعي. ادفعه. وشاهد ما يكتبه.

شارك هذا المقال

اختر لغتك

مقالات ذات صلة