يقع اثنان من أكثر نماذج تحويل النص إلى صورة نقاشًا حاليًا في زاويتين مختلفتين تمامًا من مشهد الذكاء الاصطناعي. يأتي GPT Image 1.5 من OpenAI، ومدمج مباشرةً في المنظومة التي تشغّل ChatGPT ومجموعة واجهات API الأوسع. ويأتي Flux 1.1 Pro من Black Forest Labs، الفريق الذي يقف وراء بنية الانتشار التي غيّرت توقعات النماذج المفتوحة والتجارية على حد سواء. ينتج كلاهما صورًا واقعية كالصور الفوتوغرافية بشكل لافت. ولكل منهما متابعون كثر بين المصممين والمسوّقين والمطورين. لكنهما يحلان مشكلات مختلفة، ويزدهران في سيناريوهات مختلفة، ويُسعّران خدماتهما بطرق مختلفة جدًا. هذا تحليل صريح يتجاوز التسويق ويوضح لك متى تستخدم كلًا منهما بالضبط.

GPT Images 1.5 في جوهره
نموذج GPT Image 1.5 من OpenAI ليس مجرد نموذج انتشار آخر مُلصق على واجهة API. إنه مبني على بنية مختلفة، تستمد أساسها متعدد الوسائط من الأساس نفسه الذي يشغّل GPT-4o. وما يعنيه ذلك عمليًا نموذج يستدل على أمرك النصي بدلًا من أن يكتفي بمطابقة الأنماط فيه.
دقة الأوامر النصية هي القصة الحقيقية
أكثر ما يلفت الانتباه في GPT Image 1.5 هو مدى التزامه بالتعليمات المعقدة متعددة الأجزاء. اطلب منه "كوب قهوة خزفي أحمر على طاولة خشبية مكتوب عليه كلمة COFFEE بخط سيريف أبيض عريض، وضوء صباحي دافئ قادم من اليسار"، وسينفّذ كل هذه العناصر في لقطة واحدة.
هذا ليس الوضع المعتاد في نماذج الانتشار. تعاني معظم أنظمة تحويل النص إلى صورة بشدة في:
- عدّ الأشياء (ثلاث تفاحات، لا اثنتان ولا أربع)
- العلاقات المكانية (الكائن A على يسار الكائن B)
- عرض النصوص المدمجة (الشعارات والملصقات والنصوص التوضيحية داخل الصور)
- الجمع بين قيود أسلوبية متعددة في صورة واحدة
يتعامل GPT Image 1.5 مع الجوانب الأربعة بشكل أفضل بوضوح من عائلة Flux في الاختبارات المضبوطة. وقد كان عرض النصوص تحديدًا نقطة ضعف تاريخية في كل نموذج لتوليد الصور تقريبًا. لا يصيب GPT Image 1.5 النص الصحيح في 100% من الحالات، لكنه ينجح في إخراج نص صحيح أكثر بكثير مما ينجح فيه Flux 1.1 Pro.
السرعة والتوفر
يولّد GPT Image 1.5 الصور في نحو 15 إلى 30 ثانية عبر واجهة API، وهي مدة مقبولة لكنها ليست سريعة للغاية. والميزة الأكبر أنه يعمل داخل واجهة ChatGPT، ما يعني أن المستخدمين غير التقنيين يمكنهم الوصول إليه دون التعامل مع API أو تثبيت أي شيء. وبالنسبة إلى الفرق التي تدفع بالفعل مقابل ChatGPT Plus أو Enterprise، فالنموذج متاح لها مباشرةً.
💡 ملاحظة: يملك GPT Image 1.5 مرشّح أمان أكثر تحفظًا من Flux. فالأزياء والجلامور وبعض الموضوعات الفنية قد تتطلب إعادة صياغة الأمر النصي حتى يمرّ. أما Flux فهو أكثر تساهلًا عمومًا مع المحتوى الإبداعي.

Flux 1.1 Pro في جوهره
Flux 1.1 Pro هو النموذج التجاري الرائد لشركة Black Forest Labs، ويقع فوق Flux Dev وFlux Schnell في خط المنتجات. يعتمد على بنية محوّل التدفق المصحَّح (rectified flow transformer)، وينتج صورًا ذات حدة استثنائية وتدرجات لونية طبيعية، ومستوى من الواقعية الفوتوغرافية يخدع المشاهد في النظرة الأولى باستمرار.
جودة الصورة الخام
إذا وضعت النموذجين جنبًا إلى جنب مع الأمر النصي نفسه لبورتريه واقعي، فإن Flux 1.1 Pro يميل إلى الفوز من حيث الجودة البصرية الخالصة. درجات البشرة أغنى، وتأثير البوكيه في الخلفية أكثر طبيعية. وتبدو الصورة بشكل عام أقرب إلى مخرجات كاميرا عالية الجودة منها إلى صورة مولّدة.
المجالات التي يتألق فيها Flux 1.1 Pro أكثر من غيرها:
- البورتريهات والأشخاص: تُعرض ملمس البشرة وتفاصيل خصلات الشعر وانعكاسات الضوء في العين بعمق مبهر
- المناظر الطبيعية والطبيعة: تأتي تدرجات الألوان عبر السماء والأوراق والمياه عضوية ودقيقة
- العمارة: تحافظ مواد البناء وملمس الحجارة والمنظور الإنشائي على تماسكها عند أي قصّ
- الأزياء والجلسات التحريرية: يبدو انسدال القماش ولمعان المواد وملمس الملابس ملموسًا حقًا
لأي حالة استخدام تكون فيها الدقة البصرية المعيار الأساسي وتكون دقة الأوامر النصية أقل أهمية، يفوز Flux في هذه الجولة بوضوح.
المرونة الإبداعية
يميل Flux 1.1 Pro عمومًا إلى مزيد من الحرية في التفسيرات الإبداعية للأمر النصي. يميل إلى إضافة خيارات تكوينية ولمسات جمالية تبدو مقصودة، حتى عندما يكون الأمر النصي مقتضبًا. وهذا ممتاز للعصف الذهني الإبداعي، لكنه قد يكون مزعجًا عندما تحتاج إلى نتائج دقيقة ومحددة. يفضّل المصممون الذين يريدون تعديل المزاج والأجواء Flux غالبًا، بينما يفضّل المطورون الذين يبنون سير عمل للمنتجات دقة GPT Image 1.5 في الغالب.
💡 نصيحة احترافية: لمخرجات بدقة أعلى من عائلة Flux، جرّب Flux 1.1 Pro Ultra، الذي يدعم مخرجات أصلية بدقة 4 ميغابكسل مناسبة لأعمال الطباعة.

تصوير البورتريه: وجهًا لوجه
تُعد البورتريهات حالة الاستخدام الأكثر شيوعًا في توليد الصور بالذكاء الاصطناعي، والفجوة بين هذين النموذجين حقيقية لكنها دقيقة.
يُنتج GPT Image 1.5 بورتريهات تتبع الأمر النصي بدقة. إذا حددت "امرأة عمرها 30 عامًا، وإضاءة جانبية دافئة، وخلفية خضراء مريمية، وابتسامة ناعمة"، فستحصل بالضبط على هذا المشهد. مع ذلك، قد تبدو الصورة أحيانًا مُصطنعة بعض الشيء، بجودة خفية تربطها العين المدربة بمخرجات الذكاء الاصطناعي.
ينتج Flux 1.1 Pro بورتريهات ذات طابع أكثر عضوية. تحمل البشرة تنوعًا دقيقًا وحقيقيًا. وتحمل العينان عمقًا يصعب وصفه لكنه سهل الملاحظة. لكن الثمن هنا أن التفاصيل التكوينية يصعب ضبطها بدقة.
لصور المنتجات والهوية البصرية للعلامات: يفوز GPT Image 1.5 لأنك تستطيع تحديد أماكن العناصر وسماتها بدقة.
للتصوير التحريري وسرد القصص البصرية: يفوز Flux 1.1 Pro لأن مخرجاته تبدو فوتوغرافية بأصالة أكبر.

المناظر الطبيعية والعمارة
يؤدي النموذجان أداءً جيدًا في المناظر الطبيعية، لكن طابع مخرجاتهما يختلف جوهريًا.
يتعامل Flux 1.1 Pro مع إحساس المشهد بشكل أفضل. أعطه وادٍ جبليًا عند الغسق، وسيعيد لك شيئًا سينمائيًا، بعمق جوي وانتقالات في درجة حرارة اللون داخل السماء، ونباتات تبدو عضوية حقًا. تحمل لقطات العمارة من Flux ملامح مواد واقعية: حجارة مرصوفة مبللة، وحجر جيري قديم، وزخارف حديدية صدئة.
يتفوق GPT Image 1.5 عندما تحتاج لقطة العمارة إلى عناصر محددة وقابلة للتعرّف عليها. شعار على واجهة مبنى، أو لافتة بعينها في مشهد شارع، أو نظام ألوان دقيق على هيكل ما: هذه أشياء يخطئ فيها Flux كثيرًا أو يتجاهلها ببساطة. أما GPT Image 1.5 فيحاول إنجازها وينجح غالبًا.
لتصوير المناظر الطبيعية البحت، يُعد Flux الخيار الأقوى. وللمشاهد التي تهم فيها الدقة المعمارية أو المعلومات المدمجة، يكون GPT Image 1.5 أكثر موثوقية.

النصوص والشعارات والطباعة
هنا تصبح المقارنة حاسمة. يقع GPT Image 1.5 في فئة مختلفة تمامًا عندما يتعلق الأمر بعرض نصوص مقروءة داخل الصور.
يعاني Flux 1.1 Pro مع النصوص. تأتي الكلمات القصيرة مقروءة أحيانًا، لكن العبارات الأطول وأسماء العلامات والتسميات كثيرًا ما تنتج أشكالًا مشوّهة للحروف. وهذا قيد معروف في البنى القائمة على الانتشار، ومع أن التقدم قد تحقق بشكل عام، لم يُغلق Flux الفجوة مع GPT Image 1.5 في هذه المهمة تحديدًا.
| المهمة | GPT Image 1.5 | Flux 1.1 Pro |
|---|
| نص قصير (1-2 كلمة) | ممتاز | مقبول |
| اسم علامة تجارية في المشهد | جيد جدًا | ضعيف |
| ملصق بنص متعدد الأسطر | جيد | ضعيف |
| نص بأسلوب الخط اليدوي | جيد | مقبول |
| الأرقام والتواريخ | جيد جدًا | مقبول |
إذا كان سير عملك يتضمن إنشاء رسومات لوسائل التواصل الاجتماعي، أو نماذج أولية بنصوص توضيحية مؤقتة، أو أي صورة تتطلب نصًا مقروءًا، فإن GPT Image 1.5 هو الخيار الجاد الوحيد بين هذين النموذجين.

السرعة والتكلفة والوصول عبر API
غالبًا ما تتحدد القرارات الواقعية بالميزانية وتعقيد التكامل. إليك موقع كل نموذج.
| العامل | GPT Image 1.5 | Flux 1.1 Pro |
|---|
| متوسط زمن التوليد | 15-30 ثانية | 10-20 ثانية |
| توفر API | نعم (OpenAI API) | نعم (Replicate، وBFL API) |
| تكلفة الصورة الواحدة | أعلى | متوسطة |
| حدود المعدل | نعم (حسب الفئة) | نعم (حسب خطة API) |
| الوصول عبر واجهة ChatGPT | نعم | لا (عبر API أو المنصة فقط) |
| دعم الضبط الدقيق | لا | نعم (عبر محولات LoRA) |
| أقصى دقة | 1024x1024 (قياسي) | حتى 4 ميغابكسل (فئة Ultra) |
يتمتع Flux 1.1 Pro بميزة واضحة في التكلفة الخام لكل صورة عند مستويات جودة متقاربة. وبالنسبة إلى سير العمل الإنتاجي كبير الحجم، يتراكم هذا الفارق بسرعة. ويستحق GPT Image 1.5 علاوة سعره لحالات الاستخدام التي تحتاج تحديدًا إلى قدراته في التعامل مع الأوامر النصية.

أين يتفوق GPT Images 1.5
استخدم GPT Image 1.5 عندما:
- تحتاج إلى عرض نص بشكل صحيح داخل الصورة (تسميات، لافتات، نماذج أولية للتغليف)
- يحتوي أمرك النصي على قيود محددة متعددة يجب أن تظهر معًا (عدد الأشياء، والموقع المكاني، واللون، والأسلوب)
- تبني سير عمل لمنتجات أو التجارة الإلكترونية تكون فيه الدقة البصرية أمرًا لا يقبل التنازل
- تريد تكاملًا أصليًا مع ChatGPT لتكرار سريع دون إعداد API
- تحتاج إلى مخرجات متوقعة ومتسقة من الأمر النصي نفسه عبر تشغيلات متعددة
- التعديل الموضعي والتحرير جزء من سير عملك، إذ يملك GPT Image 1.5 قدرات قوية للتحرير متعدد الجولات
💡 يتميز النموذج بقوة خاصة في نماذج واجهات المستخدم، ولقطات تطبيقات الهاتف، وقوالب وسائل التواصل الاجتماعي التي تهم فيها دقة النص والتخطيط بقدر أهمية الجودة البصرية.
أين يتفوق Flux 1.1 Pro
استخدم Flux 1.1 Pro عندما:
- تحتاج إلى أقصى درجة من الواقعية الفوتوغرافية في البورتريهات والمناظر الطبيعية
- يكون مشروعك تحريريًا أو فنيًا وتهم فيه الملمس البصري أكثر من دقة الأوامر النصية
- تحتاج إلى مخرجات بدقة عالية تتجاوز 1024 بكسل (انتقل إلى Flux 1.1 Pro Ultra للحصول على 4 ميغابكسل فأكثر)
- يكون الضبط الدقيق بتقنية LoRA جزءًا من سير عملك لشخصيات خاصة بالعلامة أو أساليب متسقة
- تعمل على إنتاج كبير الحجم تهم فيه تكلفة الصورة الواحدة على نطاق واسع
- تريد مرونة إبداعية أكبر في طريقة تفسير النموذج لأوامرك النصية وتكوينه لها
كيفية استخدام النموذجين على PicassoIA
يتوفر كل من GPT Image 1.5 وFlux 1.1 Pro مباشرةً على منصة PicassoIA، لذا يمكنك تجربة النموذجين دون إدارة حسابات API منفصلة أو حدود معدل أو إعدادات فوترة مستقلة.

استخدام GPT Image 1.5 على PicassoIA
- انتقل إلى صفحة نموذج GPT Image 1.5
- اكتب أمرك النصي في حقل الإدخال. كن محددًا: حدّد الموضوع والمكان واتجاه الإضاءة ولوحة الألوان وأي عناصر نصية تحتاج إلى عرضها
- اختر دقة المخرجات (1024x1024 هي القيمة القياسية الافتراضية)
- بالنسبة إلى الأوامر النصية متعددة القيود، رتّبها بوضوح: ابدأ بالموضوع الرئيسي، ثم الخلفية، ثم الإضاءة، ثم أي عناصر نصية في النهاية
- استخدم زر إعادة التوليد للتنقل بين التنويعات، لأن GPT Image 1.5 يتمتع بتنوع طبيعي حتى مع الأوامر النصية الثابتة
- نزّل صورتك مباشرةً أو احفظها عبر إدارة الأصول المدمجة في PicassoIA
نصائح لنتائج أفضل:
- ضع متطلبات النص في نهاية الأمر النصي، محاطةً بعلامات اقتباس:
a cafe menu board with "DAILY SPECIALS" in bold
- استخدم مراجع إضاءة محددة ("إضاءة Rembrandt"، "ضوء خلفي عند الساعة الذهبية") للحصول على نتائج بورتريه أكثر تحكمًا
- أضف مراجع الكاميرا للواقعية الفوتوغرافية: "واقعي كالصور الفوتوغرافية، التُقط بكاميرا Canon EOS R5، 85mm f/1.8"
استخدام Flux 1.1 Pro على PicassoIA
- انتقل إلى صفحة نموذج Flux 1.1 Pro
- اكتب أمرك النصي مع التركيز على الأجواء والمزاج البصري بدلًا من المواصفات المفصّلة المستفيضة
- اختر نسبة العرض إلى الارتفاع بحسب الاستخدام: 16:9 للتحرير، و1:1 لوسائل التواصل، وصيغ البورتريه للصور الشخصية
- للحصول على أعلى دقة للمخرجات، انتقل إلى Flux 1.1 Pro Ultra
- يتحكم معامل مقياس التوجيه في مدى التزام النموذج بأمرك النصي مقابل التوليد الحر. القيم المنخفضة تمنح Flux 1.1 Pro حرية إبداعية أكبر، والقيم المرتفعة تضبطه أكثر
- للإنتاج بالدفعات أو لسير عمل LoRA، يُعد Flux Dev بديلًا أكثر مرونة وملاءمةً للتدريب ضمن العائلة نفسها
نصائح لنتائج أفضل:
- صِف إحساس الصورة لا محتواها فقط: "ضوء صباحي يتسلل عبر إبر الصنوبر، ضباب ناعم، وحدة هادئة" ستتفوق على قائمة أشياء مسطّحة
- استخدم مراجع الكاميرا والعدسة للحصول على مخرجات واقعية كالصور الفوتوغرافية: "Leica M11، 50mm Summilux، f/1.4"
- استعن بأفلام التصوير المرجعية لتدرجات الألوان: Kodak Portra 400 للدفء، وFuji Velvia 50 للمناظر الطبيعية المشبعة بالألوان
الفرق الحقيقي
لا يتنافس هذان النموذجان فعليًا على المستخدمين أنفسهم. يُعد GPT Image 1.5 الخيار الصحيح عندما تكون الدقة وعرض النصوص والأوامر النصية متعددة القيود حاسمة. ويُعد Flux 1.1 Pro الخيار الصحيح عندما تريد أكثر المخرجات واقعيةً ممكنة، وتكون الجودة البصرية هي ما سيحكم عليه جمهورك.
بالنسبة إلى معظم سير العمل الاحترافي، تكون الإجابة الصريحة: استخدم كليهما. شغّل الأوامر النصية عبر GPT Image 1.5 عندما تحتاج إلى شيء دقيق، وعبر Flux 1.1 Pro عندما تريد شيئًا جميلًا. تضع PicassoIA النموذجين على المنصة نفسها دون الحاجة إلى التنقل بين حسابات أو واجهات API منفصلة. النموذجان متاحان الآن، فاختر أمرًا نصيًا كنت تفكر فيه منذ مدة وولّد صورته. سيصبح الفرق واضحًا لحظة رؤيتك لأول نتيجة.
