فاجأ GPT Image 1.5 معظم الناس. ليس لأنه جاء بإعلانات مدوّية، بل لأن الأشياء المحددة التي حسّنها كانت بالضبط المجالات التي قبِل المجال كله بصمت أنها مستحيلة الحل. النصوص داخل الصور؟ تجاهلها. وجوه متسقة عبر التكرارات؟ استخدم حلًا التفافيًا. تعليمات تركيبية معقدة؟ ولّد الصورة خمس مرات واختر الأفضل.
إذا كنت قد استبعدت نماذج تحويل النص إلى صورة بناءً على نتائج من قبل اثني عشر شهرًا، فيستحق GPT Image 1.5 نظرة ثانية، ليس بوصفه قفزة جيلية، بل بوصفه تصحيحًا موجّهًا لأكثر نقاط الاحتكاك إلحاحًا في توليد الصور بالذكاء الاصطناعي. يفصّل هذا المقال القدرات الخمس المحددة التي يتفوق فيها على التوقعات، ويوضح أين تضاهيه بدائل مماثلة على PicassoIA أو تتفوق عليه في كل منها.
ما الذي غيّره GPT Image 1.5 فعلًا
ليس DALL-E 4
تجنّبت OpenAI عن قصد تسمية هذا النموذج DALL-E 4. التسمية مقصودة: هذا ليس تحديثًا معماريًا جيليًا شاملًا. GPT Image 1.5 تحسين دقيق يستهدف أوجه قصور محددة في DALL-E 3. المجالات الخمسة التي يُظهر فيها تحسنًا قابلًا للقياس هي دقة عرض النصوص، وعمق اتباع التعليمات، والواقعية في صور الأشخاص، ووضع العناصر في الفضاء، وثبات الأسلوب بين التوليدات المختلفة.
تضع اختبارات مستقلة من مجموعات بحثية تختبر مهام اتباع الأوامر المنظمة GPT Image 1.5 باستمرار فوق DALL-E 3 وMidjourney v6 في المحاور الخمسة كلها. وهذا إنجاز ليس بالهيّن في ظل ازدحام مشهد النماذج لعام 2027.
لماذا تهم المعمارية هنا
لا تعود التحسينات في GPT Image 1.5 إلى زيادة بيانات التدريب أو إطالة جلسات التدريب وحدها. فلأن النموذج يشارك معماريّة المشفّر نفسها مع GPT-4o، فإنه يعالج معنى الأمر النصي قبل توليد البكسلات. إنه لا يطابق النمط A مع المخرج B، بل يستدل على الأمر النصي بطريقة لم تكن النماذج المعتمدة على الانتشار وحده قادرة عليها.
ولهذا يعطي طلب GPT Image 1.5 وضع عناصر في مواضع مكانية محددة، أو عرض نص مقروء داخل مشهد، نتائج أفضل من النماذج السابقة رغم حجم بيانات تدريب مشابه.
1. عرض النصوص الذي يصمد فعلًا
الوعد المكسور لعام 2022
اسأل أي مصمم جرافيك جرّب أدوات توليد الصور بالذكاء الاصطناعي بين عامي 2022 وبداية 2024 عن تجربته في توليد النصوص داخل الصور، وستسمع القصة نفسها: كانت عديمة الفائدة في الإنتاج. كانت النماذج تهلوس الحروف، أو تدمج الحروف ببعضها، أو تنتج تشويهات تبدو مقروءة لكنها تتلاشى عند أي تكبير. تراكمت الحلول الالتفافية: إضافة النص في Photoshop لاحقًا، أو استخدام أداتين منفصلتين، أو توليد صورة نظيفة ثم تركيب النص فوقها.
لم تكن هذه الحلول الالتفافية مثالية. كانت رقعًا على مشكلة منهجية، تضيف وقت معالجة لاحقة كبيرًا إلى كل سير عمل إبداعي يعتمد على الذكاء الاصطناعي.

ما الذي أصابه 1.5
ينتج GPT Image 1.5 نصوصًا مقروءة ومستقرة طباعيًا داخل الصور، بنسبة نجاح أعلى بكثير من DALL-E 3 في الأوامر ذات العبارات القصيرة من كلمة إلى ست كلمات. تحافظ الحروف على سماكة خط متسقة، وتبدو المسافات بين الحروف معقولة، ويندمج النص في الصورة بدلًا من أن يطفو بشكل محرج فوقها.
هذا ليس مثاليًا. النصوص التي تتجاوز ثماني كلمات ما زالت تتدهور بشكل ملحوظ. والخطوط المزخرفة ذات الروابط المعقدة تنهار. لكن بالنسبة إلى النصوص القصيرة والمباشرة، مثل تسميات المنتجات، وعناوين وسائل التواصل، وشعارات الإعلانات، فإن المخرجات صالحة للإنتاج بمعدل لم يكن ممكنًا من قبل.
لمن يحتاج إلى الذهاب أبعد من ذلك، صُمّم Ideogram v4 Quality على PicassoIA خصيصًا حول دقة النص داخل الصور. ويتفوق في معايير اختبار عرض العبارات القصيرة حتى على GPT Image 1.5. أما Ideogram v4 Balanced فيضحي ببعض الواقعية مقابل دقة أفضل بكثير للعبارات الأطول، مما يجعله الخيار المتخصص لأي مواصفات تصميم تتطلب نصًا مقروءً داخل الصورة نفسها.
💡 النصوص داخل الصور: لإعلانات البانر، وتصاميم وسائل التواصل، أو نماذج تغليف المنتجات، جرّب Ideogram v4 Quality قبل أي نموذج عام الغرض. فقد صُمّم لهذه المهمة تحديدًا.
| طول النص | GPT Image 1.5 | Ideogram v4 Quality |
|---|
| 1-4 كلمات | موثوق | موثوق جدًا |
| 5-8 كلمات | جيد | قوي |
| 9 كلمات فأكثر | غير متسق | متوسط |
| الخطوط المزخرفة | غير متسق | أفضل |
2. التعليمات المعقدة في تمريرة واحدة
مشكلة ربط الخصائص
النماذج السابقة قوية في التركيبات البسيطة للموضوع والبيئة. فعبارة "golden retriever على شاطئ عند غروب الشمس" تعمل بقابلية للتوقع. يظهر نمط الفشل عندما تجمع الأوامر عدة موضوعات بخصائص متميزة: ألوان ومواضع وعلاقات وأفعال متزامنة.
يطلق الباحثون على هذا اسم مشكلة ربط الخصائص: يعرف النموذج جميع العناصر، لكنه ينسب الخصائص إلى الأجسام الخطأ. يذهب المعطف الأزرق إلى الشخصية الخطأ، وتظهر المظلة في اليد الخطأ، ويجد القط نفسه في الخلفية بدلًا من عتبة الباب. جعلت هذه الأخطاء الأوامر التركيبية المعقدة تبدو كأنها يانصيب.

ما الذي يتغير عمليًا
يحسّن GPT Image 1.5 دقة ربط الخصائص في الأوامر متعددة الأجسام إلى نحو 78%، مقارنة بنسبة 52% لنموذج DALL-E 3 في اختبارات منظمة مماثلة. وهذا يعني أن النموذج ينسب الخصائص الموصوفة إلى الموضوعات الصحيحة في نحو أربعة من كل خمسة مشاهد معقدة.
وهذه قفزة كبيرة في الموثوقية. عند 52% كان توليد المشاهد المعقدة عشوائيًا بشكل أساسي. أما عند 78% فيصبح أداة عملية للمواصفات الإبداعية المتعددة الطبقات، حيث لا تكون الدقة التركيبية أمرًا اختياريًا.
للمصممين الذين يحتاجون إلى بلوغ هذا المعيار بثبات، يقدّم Krea 2 Large على PicassoIA دقة تركيبية قوية في الأوامر متعددة الموضوعات، ويتعامل Reve 2.1 مع أوصاف المشاهد العلائقية بدقة متسقة عبر تشكيلات متنوعة من الموضوعات.
💡 المشاهد المعقدة: قسّم أمرك النصي إلى مجموعات منطقية، مثل الموضوع والخصائص والموضع والبيئة، بدلًا من جملة واحدة طويلة متصلة. يستجيب كل من GPT Image 1.5 ونماذج PicassoIA بشكل أفضل لمنطق أوامر منظم من الأوصاف المكتوبة في فقرات كثيفة.
3. وجوه بشرية بلا رعب
مشكلة الثقة في الوجوه المولّدة
إخفاقات "وادي الغرابة" في صور الأشخاص المولّدة بالذكاء الاصطناعي لا تبدو سيئة فحسب. إنها تشير إلى المشاهدين، غالبًا على مستوى لاواعٍ، بأن الصورة مصطنعة. وهذا مهم جدًا في التطبيقات التي تكون فيها الأصالة هي الغاية: إعلانات نمط الحياة، والمحتوى التحريري، وشخصيات وسائل التواصل، وتصوير العلامات التجارية.
علامات الإخفاق متسقة عبر النماذج: عيون متماثلة أكثر من اللازم، وبشرة ذات نعومة شمعية لا تملكها البشرة الحقيقية، وشعر مرسوم كطبقة نسيج موحدة بدلًا من خصلات فردية، وأسنان بيضاء بشكل غير طبيعي ومصفوفة تمامًا بطرق لا يحققها أي فم حقيقي.

ما الذي أصلحه 1.5 فعلًا
يقلل GPT Image 1.5 بشكل ملحوظ من آثار "وادي الغرابة" في أوامر الصور الشخصية. تظهر البشرة ببنية مسامية مرئية وتباين طبيعي في الدرجات اللونية. تُظهر تفاصيل القزحية عدم انتظام واقعي في الصبغة بدلًا من دائرة لونية مسطحة. يظهر الشعر بتمييز فردي للخصلات وحجم طبيعي، لا كسطح موحد. وتظهر الأسنان بالتباين الطفيف والحجم الطبيعي الذي تملكه الأسنان الحقيقية.
ما زال النموذج يُظهر بعض الآثار المتبقية في اللقطات المقربة جدًا والوجوه المائلة بزوايا كانت ممثلة بنقص في بيانات التدريب. لكن بالنسبة إلى اتجاهات الصور الشخصية المواجهة وثلاثية الأرباع، فإن التحسن كبير بما يكفي لأن تجتاز المخرجات الفحص البصري العادي بانتظام.
نماذج PicassoIA التي تبلغ جودة صور شخصية مماثلة:
- Seedream 5 Pro: النموذج الرائد لـ ByteDance بدقة 2K مع عرض ممتاز لنسيج البشرة، ويُقيَّم غالبًا فوق GPT Image 1.5 في مهام الصور الشخصية المقربة من قبل مقيّمين مستقلين.
- Krea 2 Large: قوي في الصور الشخصية البيئية لكامل الجسم، مع نسب وجه دقيقة على المسافة المتوسطة.
- Reve 2.1: ممتاز لأساليب الصور الشخصية التحريرية ونمط الحياة، بتعبيرات طبيعية وغير متكلفة.
4. المنطق المكاني ووضع الأجسام
عندما يعني "أعلى اليسار" لا شيء
كانت التعليمات المكانية الاتجاهية من أكثر نقاط الضعف استمرارًا في توليد الصور بالذكاء الاصطناعي. فعبارة "يجب أن يكون النص في الأسفل" تنتج نصًا في المنتصف. وعبارة "المبنى على الجانب الأيسر" تنتج مبنى في المركز. وعبارة "ضع المنتج في الزاوية العلوية اليمنى" تنتج منتجًا في مكان ما يميل إلى اليمين بشكل غامض.
بالنسبة إلى العمل الإبداعي الاحترافي، مثل تخطيطات الإعلانات وقوالب وسائل التواصل الاجتماعي ونماذج الطباعة التجريبية، فهذه ليست مجرد مشكلة بسيطة. فهي تجعل أدوات الصور بالذكاء الاصطناعي غير صالحة للاستخدام في التركيبات المنظمة دون تعديل كبير بعد التوليد لإعادة وضع العناصر يدويًا.

سيناريوهات عملية للمصممين
يُظهر GPT Image 1.5 اتباعًا أفضل بشكل ملحوظ للتعليمات المكانية مقارنة بـ DALL-E 3. فهو يفسّر الاتجاهات الأساسية (يسار، يمين، أعلى، أسفل)، واللغة الموضعية العلائقية (أمام، خلف، بجانب)، والمناطق التركيبية (المقدمة، الخلفية، مركز الإطار) بموثوقية أعلى بكثير.
سيناريوهات التصميم الواقعية التي يهم فيها ذلك بشكل مباشر:
- المحتوى الإعلاني: "المنتج على اليمين، ومساحة للنص على اليسار لعنوان متراكب"
- بانرات وسائل التواصل: "اسم العلامة أسفل اليسار، والصورة الرئيسية محاذاة إلى اليمين"
- نماذج التجارة الإلكترونية: "المنتج في المنتصف على خلفية محايدة، والإكسسوارات مرتبة في الزوايا السفلية"
- التخطيطات التحريرية: "الشخص المصوَّر في الثلث الأيمن، والسياق البيئي يملأ الثلثين الأيسرين"
- مفاهيم التغليف: "الملصق في منتصف النصف العلوي، ونص المكونات في الربع السفلي"
💡 الدقة المكانية على PicassoIA: يتعامل Grok Imagine Image Quality من xAI مع أوامر الموضع الاتجاهي بموثوقية جيدة، ويُخرج بدقة 2K، مما يجعله بديلًا عمليًا لمهام التوليد الموجهة للتصميم.
5. ثبات الأسلوب عبر التنويعات
مشكلة الشخصية نفسها
يواجه مديرو العلامات التجارية وفرق المحتوى مشكلة محددة لا تحلها تحسينات جودة الصور العامة: يحتاجون إلى أن تبدو الشخصية نفسها متطابقة بشكل يمكن التعرف عليه عبر عشرات الصور المنفصلة المولّدة في جلسات منفصلة.
يجب أن يبدو مَسْكوت منتج أُنشئ لحملة الربع الأول كما هو نفسه في الربع الثالث. ويجب أن تظل شخصية تُستخدم في محتوى اجتماعي متسق مستقرة بصريًا عبر 50 منشورًا. كانت النماذج السابقة تجعل ذلك مستحيلًا عمليًا إلا باستخدام قيم بذرة متطابقة مع قبول تنوع شبه معدوم، وهذا يُفشل الغاية من توليد صور متعددة ومتميزة.

كيف تستفيد العلامات التجارية فعلًا
يحسّن GPT Image 1.5 ثبات الأسلوب عندما تستخدم قيم بذرة مستقرة وتحافظ على لغة وصفية متسقة عبر الأوامر. فالمعايير الأسلوبية نفسها، مثل اتجاه الإضاءة، ودرجة حرارة اللون، وتأطير التكوين، تنتج مخرجات تشترك في بصمة بصرية كافية لتُقرأ كسلسلة متماسكة لا كصور فردية عشوائية.
تظل القيود قائمة: فالثبات عبر الجلسات دون قيم البذرة ما زال غير موثوق، وهوية الوجه تنجرف بدون مراجع ثابتة صريحة.
بدائل PicassoIA لعمل الثبات:
- Reve 2.1 يدعم إدخال الصور المرجعية، مما يتيح لك تثبيت كل توليد جديد على مرجع بصري بدلًا من الاعتماد على الوصف النصي وحده.
- Seedream 5 Pro ينتج مخرجات عالية الثبات عندما تبقى الأوامر الوصفية مستقرة، مع نقل أسلوب قوي من الصور المرجعية.
- Krea 2 Medium يتفوق في الحفاظ على شخصية أسلوبية متسقة عبر مشاهد بإعدادات مختلفة، مما يجعله فعالًا للمحتوى المتسلسل للعلامات التجارية.
💡 لمطابقة الوجه بدقة: استخدم Face Swap AI من PicassoIA لإدراج وجه مرجعي في أي مشهد مولّد. يزيل ذلك الاعتماد على ثبات الأوامر النصية تمامًا، ويضمن دقة الوجه بغض النظر عن النموذج الأساسي الذي تستخدمه.
جرّب هذه النماذج على PicassoIA الآن
للصور الكثيفة بالنصوص
إذا كانت تحسينات عرض النصوص في GPT Image 1.5 هي ما تحتاجه، فابدأ بنموذج Ideogram v4 Quality على PicassoIA. صُمّم حول مشكلة النص داخل الصورة، ويتفوق باستمرار على النماذج العامة في هذه المهمة المحددة. العناوين القصيرة، وعروض الأسعار، وتسميات الأزرار، والشعارات، يتعامل معها بدقة يمكن للمصممين المحترفين الاعتماد عليها دون مرحلة تصحيح إلزامية في Photoshop بعدها.

للصور الشخصية الواقعية كالصور الفوتوغرافية
Seedream 5 Pro هو المنافس الأقرب مباشرة لنموذج GPT Image 1.5 في جودة الصور الشخصية المتاحة على PicassoIA. يعمل افتراضيًا بدقة 2K، ويتعامل بدقة مع سيناريوهات الإضاءة الطبيعية المعقدة، ويعرض نسيج البشرة بتفاصيل فردية تبدو بموثوقية كأنها تصوير فوتوغرافي حقيقي من النظرة الأولى. إذا كان موضوع مواصفاتك يدور حول الصورة الشخصية، كنمط الحياة، أو التحرير، أو شخصية العلامة التجارية، فهذا هو النموذج الذي يجب أن تبدأ به.
للصور الشخصية البيئية حيث يتفاعل الأشخاص مع المنتجات أو المساحات أو موضوعات أخرى في مشاهد معقدة، يقدّم Krea 2 Large دقة تركيبية وتناسقًا في النسب عبر التكوينات بالإطار الكامل.

للمشاهد متعددة الأجسام
المشاهد المعقدة ذات الموضوعات المتعددة، التي يحمل كل منها خصائص متميزة ومواضع مكانية مختلفة، هي المجال الذي يتألق فيه Krea 2 Large وGrok Imagine Image Quality على PicassoIA. شغّل الأمر متعدد الموضوعات المعقد نفسه عبر النموذجين، وقارن المخرجات جنبًا إلى جنب. ستظهر الفروق في دقة إسناد الخصائص والتموضع المكاني بوضوح فوري.
أين ما زال GPT Image 1.5 قاصرًا
GPT Image 1.5 خطوة مهمة إلى الأمام، لكنه ليس منتجًا مكتملًا. ما زال يُظهر نقاط ضعف متكررة تهم في السياقات المهنية:
- الأيدي والأطراف: أخطاء عدّ الأصابع أقل شيوعًا لكنها لم تختفِ تمامًا
- النصوص الطويلة: تتدهور الدقة بعد ستة إلى ثماني كلمات في عبارة واحدة
- العمارة المعقدة: النوافذ المقوّسة والأعمدة والتفاصيل الهيكلية الدقيقة غالبًا ما تتشوه
- التفاصيل الميكانيكية والإلكترونية: الأدوات والأجهزة والمعدات تُرسم بتفاصيل معقولة لكنها غير صحيحة
- سيناريوهات الإضاءة القصوى: المشاهد عالية التباين أو المضاءة من الخلف قد تنتج تصييرًا غير متسق للأسطح
لا يفوز نموذج واحد في كل حالات الاستخدام. الأداة الصحيحة تعتمد كليًا على المخرج المحدد الذي يتطلبه سير عملك، ولهذا بالضبط يهم الوصول إلى مكتبة نماذج واسعة.

ابدأ الإنشاء بهذه القدرات
المجالات الخمسة التي تفوق فيها GPT Image 1.5 على التوقعات، وهي عرض النصوص، وعمق اتباع التعليمات، والواقعية في الصور الشخصية، والتموضع المكاني، وثبات الأسلوب، ليست قدرات حصرية لـ GPT. إنها تمثل الاتجاه الذي يتحرك فيه المجال بأكمله، ويقدّم PicassoIA بالفعل نماذج متخصصة تضاهي GPT Image 1.5 أو تتفوق عليه في كل محور محدد.
ابدأ بـ Seedream 5 Pro للمخرجات الواقعية كالصور الفوتوغرافية. واستخدم Ideogram v4 Quality عندما تكون دقة النص داخل الصورة غير قابلة للتفاوض. واللجوء إلى Krea 2 Large عندما تحتاج إلى تحكم دقيق في المشاهد متعددة الموضوعات ذات الخصائص المتعددة الطبقات والمتطلبات المكانية.

مع أكثر من 90 نموذجًا لتحويل النص إلى صورة متاحًا على PicassoIA، تحصل على المرونة لاختبار كل قدرة جنبًا إلى جنب دون تبديل المنصات أو إدارة حسابات API منفصلة. صورتك التالية لا تبعد عنك سوى أمر واحد عبر picassoia.com/en/all-models.