بدأ النقاش بهدوء ثم اشتعل. أعلن Gemini 3 عن ادعاءات جريئة حول الذكاء متعدد الوسائط، واستمر ChatGPT في تطوير خط معالجة الصور الخاص به مع كل نموذج جديد. والآن يطرح ملايين المبدعين والمسوّقين وأصحاب المشاريع الجانبية السؤال نفسه: أيهما يصنع صورًا أفضل فعلًا؟
هذا ليس اختبارًا مختبريًا بمتغيرات مضبوطة ومعايير أكاديمية للتقييم. إنه تحليل واقعي لأداء الأداتين عندما تُعطيانهما مهام إبداعية حقيقية، من النوع الذي يكتبه الناس في منتصف الليل عندما يحتاجون إلى صورة منتج، أو بورتريه، أو صورة مفهومية مع ثلاث فقرات من التوجيهات. النتائج أكثر تعقيدًا مما توحي به معظم مقالات المقارنة، والجواب الصحيح يعتمد بشكل كبير على نوع ما تنتجه فعلًا.
إليك كيف تبدو المخرجات والواقع اليومي للاستخدام فعلًا.

ماذا تفعل هذه الأدوات فعلًا
قبل أن تكون المقارنة عادلة، يحتاج كل من الأداتين إلى وصف واضح. فهما مبنيتان بشكل مختلف، ويعملان بنماذج أساسية مختلفة، ومُحسّنتان لأنواع مختلفة من المستخدمين. معاملتهما كأداتين متبادلتين تقود إلى استنتاجات خاطئة.
محرك الصور في Gemini 3
Gemini 3 هو أكثر مساعد ذكاء اصطناعي متعدد الوسائط تطورًا من Google. عندما يولّد الصور، فإنه يعتمد على Imagen، بنية Google الخاصة لتحويل النص إلى صورة. يمثل Imagen 4 وImagen 4 Ultra أعلى مستوى يمكن أن يصل إليه هذا النظام حاليًا: ملامح وجه حادة، وفيزياء إضاءة دقيقة، وقدرة قوية على التعامل مع أوصاف المشاهد المعقدة ذات العناصر المتعددة المتراكبة.
ما يميّز Gemini 3 أن توليد الصور ليس سوى قدرة واحدة ضمن نظام استدلال أكبر بكثير. يمكنك وصف فكرة بلغة طبيعية وحوارية، أو الإشارة إلى رسائل سابقة في جلستك، أو أن تطلب من Gemini تحسين مخرجاته بنفسه دون البدء من الصفر. لا يبدو توليد الصور ميزة إضافية منفصلة، بل يعمل داخل آلة تفكير قادرة على النقاش والجدل والتحسين.
النهج البصري في ChatGPT
يمرّر ChatGPT توليد الصور عبر GPT Image 1.5، نموذج OpenAI الرائد لتحويل النص إلى صورة. تم تدريب هذا النموذج خصيصًا على اتباع التعليمات، أي أنه يأخذ الأوامر النصية المفصّلة والمنظَّمة ويفسّرها بدقة عالية. يتعامل مع عرض النصوص داخل الصور أفضل من أي منافس تقريبًا، ويتميز بقدرة خاصة على إنتاج تكوينات نظيفة قابلة للاستخدام التجاري لا تحتاج إلى أي معالجة لاحقة قبل نشرها.
من الفروق العملية: يتوفر توليد صور ChatGPT مباشرة داخل واجهة المحادثة لمشتركي Plus، ويتكامل بإحكام مع GPT-4o للتعديل التكراري. يمكنك أن تطلب منه "اجعل الخلفية أدفأ" أو "أضف نباتًا في الزاوية اليسرى"، فيعيد معالجة الصورة وفقًا لذلك، مع الحفاظ على معظم التكوين الأصلي وتطبيق التغيير المحدد الذي طلبته.

جودة الصور وجهًا لوجه
هنا يريد معظم الناس الإجابة الحقيقية. تنتج الأداتان صورًا مبهرة في الظروف المثالية. تظهر الفروقات عندما تدفعهما نحو أوامر نصية صعبة، أو عندما تحتاج إلى فيزياء دقيقة، أو عندما تريد مخرجات ليست جميلة فحسب، بل صحيحة أيضًا.
الواقعية والتفاصيل الفوتوغرافية
تتمتع بنية Imagen في Gemini 3 بميزة موثّقة في فيزياء الإضاءة. تقع الظلال في أماكنها الصحيحة، وتعكس الأسطح القدر المناسب من الضوء بحسب مادتها، وتبدو درجات لون البشرة في أعمال البورتريه ثلاثية الأبعاد فعلًا، لا ناعمة ومصقولة. عندما تطلب "شارع ممطر ليلًا مع انعكاسات رطبة على الرصيف"، فإن Imagen 3 وخلفاؤه يتعاملون مع الانكسار والانعكاس المنتشر بطريقة مدروسة. الضوء لا يكتفي بالتوهج، بل يتصرف بشكل صحيح.
ينتج GPT Image 1.5 صورًا تبدو مصقولة للغاية. المخرجات عالية الدقة ونظيفة تقنيًا بشكل ثابت. ويتراجع أحيانًا في المؤشرات الدقيقة للتصوير الحقيقي: سلوك حبيبات الفيلم، والانحراف اللوني العدسي الواقعي، والعيوب الطفيفة للتصوير باليد. الصور تبدو ممتازة، لكنها تبدو أحيانًا أكثر من اللازم اكتمالًا في السياقات التي تكون فيها الأصالة مهمة.
جدير بالملاحظة: في تصوير المنتجات والاستخدام التجاري، غالبًا ما يكون "الإتقان المفرط" هو بالضبط ما تريده. إن ميل ChatGPT إلى الصقل ميزة في أعمال العلامات التجارية، وليس عيبًا.

عرض الألوان والدقة
يميل علم الألوان في Imagen نحو درجات طبيعية ودافئة قليلًا تُعيد إنتاجها بشكل جيد في الطباعة وعلى الشاشات المعايَرة. اطلب منه توليد غروب شمس، وسيبدو التدرج اللوني من البرتقالي إلى البنفسجي معقولًا من الناحية الفيزيائية، لا تقريبًا خوارزميًا.
يميل GPT Image 1.5 إلى مخرجات مشبعة وعالية التباين، ما لم تطلب بشكل محدد الاعتدال. تبرز الألوان على الشاشة وتبدو ممتازة في سياقات وسائل التواصل الاجتماعي حيث يُكافأ الحيوية بالانتباه. إذا احتجت إلى عمل لوني باهت بأسلوب وثائقي أو تصوير تحريري منزوع التشبع، فستحتاج إلى توجيهه صراحة بلغة درجة الحرارة اللونية والتشبع في أمرك النصي.
| المقياس | Gemini 3 (Imagen) | ChatGPT (GPT Image 1.5) |
|---|
| دقة لون البشرة | ممتازة | جيدة |
| فيزياء الإضاءة | ممتازة | جيدة |
| حيوية الألوان | متوسطة | عالية |
| النصوص داخل الصور | جيدة | ممتازة |
| حدة التفاصيل الدقيقة | عالية جدًا | عالية جدًا |
| تعقيد المشهد | قوي | قوي |
| اتباع تعليمات الأمر النصي | قوي | قوي جدًا |
| الواقعية الفوتوغرافية | عالية جدًا | عالية |
كيف يقرأ كل منهما أوامرك النصية
تعتمد جودة المخرجات بشكل كبير على مدى فهم النموذج لما قصدته فعلًا. تتعامل الأداتان مع الأوامر القصيرة بثقة. تظهر الفروقات عندما تصبح الأوامر معقدة، أو عندما تتضمن لغة توجيهية، أو عندما تتطلب من النموذج أن يستنتج ما تعتبره أنت مهمًا.

الأوامر البسيطة مقابل المعقدة
بالنسبة إلى أمر نصي مثل "امرأة تمشي عبر حقل لافندر عند الساعة الذهبية"، تنتج الأداتان نتائج جميلة. يميل Gemini 3 إلى منحك ما يبدو أقرب إلى الذكرى: ناعمًا ودافئًا، مع ذلك النوع من الأخطاء الطبيعية الذي يوحي بعصر يوم حقيقي وليس بلقطة من مكتبة صور جاهزة. أما GPT Image 1.5 فيمنحك ما قد يظهر في صفحة مجلة لنمط الحياة، مؤطّرًا بدقة، مع وضعية للنموذج مثالية بشكل مبالغ فيه.
بالنسبة إلى الأوامر المعقدة ذات خمسة أو ستة متطلبات متميزة، مثل "حانة جاز مضاءة بخفوت في نيو أورليانز، تنعكس لافتة نيون حمراء على برك المطر في الخارج، وعازفان موسيقيان مرئيان من خلال النافذة، وامرأة ترتدي معطفًا بطراز 1940s تقف على اليمين وتولّي ظهرها"، يتعامل GPT Image 1.5 مع التعليمات متعددة العناصر بمزيد من الموثوقية. يتتبع كل عنصر في الأمر بدقة. ويفسّر Gemini 3 المشهد بشكل أكثر شمولية، فيعطي الأولوية أحيانًا للجو على الدقة التكوينية، ما ينتج صورًا مذهلة لكنها تغفل عنصرين أو ثلاثة من العناصر التي ذكرتها.
التعامل مع المساحة السلبية والتكوين
هذه نقطة دقيقة لكنها مهمة للاستخدام المهني. عندما تحتاج إلى التحكم في مواضع العناصر داخل الإطار، يمنحك GPT Image 1.5 نتائج أكثر قابلية للتوقع. يفسّر اللغة التوجيهية مثل "في الزاوية اليسرى السفلية" أو "عنصر في الخلفية فقط" بدقة معقولة، ويطبقها بثبات عبر التوليدات المختلفة.
Gemini 3 أقوى عندما تريد من النموذج أن يتخذ القرارات التكوينية بدلًا منك. يتمتع بتقدير بصري حقيقي للأوامر الغامضة، فلا يلجأ إلى التكوينات المتمركزة والمتماثلة. أعطه مزاجًا وموضوعًا، وسيفسّر التأطير بطرق تفاجئك غالبًا في الاتجاه الجيد.
نصيحة عملية: إذا كان سير عملك يعتمد على تقديم مهام إبداعية قصيرة ومفتوحة، فإن Gemini 3 ينتج نتائج أكثر إثارة للاهتمام. أما إذا كنت تكتب أوامر تقنية مفصّلة ذات متطلبات تكوينية محددة، فإن GPT Image 1.5 يكافئ هذا الجهد بموثوقية أكبر.
السرعة والتكلفة والاستخدام اليومي
لا تُعد أي من الأداتين مجانية على مستوى المخرجات الذي يهم العمل المهني. لكل منهما قيود تتحول مع الوقت إلى عائق، ولكل منهما هيكل تسعير يفضّل حجم استخدام معيّن.
الخطط المجانية مقابل المدفوعة
يقدم Gemini 3 توليد الصور عبر تطبيق Gemini من Google، مع عدد محدود من التوليدات اليومية في الخطة المجانية. يحصل مشتركو Google One على حدود أعلى وإمكانية الوصول إلى نموذج Imagen 4 Ultra، الذي ينتج أكثر المخرجات حدة وواقعية. التسعير معقول مقارنة بمولدات الصور المستقلة، وهو مدمج في اشتراك يشمل أيضًا التخزين وخدمات Google الأخرى.
يتوفر توليد صور ChatGPT عبر GPT Image 1.5 لمشتركي Plus. الواجهة مصقولة، وسير عمل التكرار، حيث تصف تغييرًا وتتلقى صورة معدّلة، مفيد فعلًا للمستخدمين غير التقنيين الذين لا يريدون إعادة كتابة الأوامر النصية كاملة في كل مرة يرغبون فيها بتعديل عنصر واحد.
أيهما يناسب سير عملك
- صنّاع المحتوى الذين يحتاجون إلى إنجاز سريع وصور جاهزة لوسائل التواصل: GPT Image 1.5 يفوز في الصقل والاستخدام الفوري.
- المصورون والمصممون الذين يحتاجون إلى إضاءة وملمس دقيقين من الناحية الفيزيائية: Gemini 3 عبر Imagen 4 Ultra يفوز في الواقعية.
- فرق التسويق التي تبني أصول المنتجات: يعمل كلاهما جيدًا، لكن عرض النصوص في GPT Image 1.5 يمنحه ميزة للرسومات الترويجية التي تتضمن نصوصًا.
- الكتّاب والباحثون الذين يريدون توليد الصور مدمجًا في سير عمل حواري: واجهة الدردشة المتكاملة في Gemini 3 أكثر سلاسة بشكل ملحوظ.
- بائعو التجارة الإلكترونية الذين يحتاجون إلى نماذج منتجات نظيفة بكميات كبيرة: يتعامل GPT Image 1.5 مع الخلفيات المضبوطة وعرض المواد بجهد أقل في الأوامر النصية.

3 سيناريوهات واقعية تختلف فيها الأداتان
تصوير البورتريه
تنتج الأداتان بورتريهات تُجمّل الملامح. تتعامل بنية Imagen في Gemini 3 مع التنوع العرقي ونطاق الأعمار بدقة أكبر، متجنبة الميل إلى تنعيم الملامح أو توحيدها نحو معيار واحد للجمال. تظهر المسام والخطوط الدقيقة وعدم التماثل الطبيعي للوجه في المخرجات عندما تطلبها، وتُعرض درجات البشرة عبر طيف واسع من البشرات بدقة حقيقية لا تقريبًا خوارزميًا.
بورتريهات GPT Image 1.5 متألقة وممتازة تقنيًا، لكنها تميل إلى المثالية ما لم تطلب تحديدًا عدم الكمال أو العمر أو الشخصية. بالنسبة إلى الحملات التي تستهدف فئات ديموغرافية محددة بتمثيل بصري أصيل، لهذا الفرق وزن حقيقي في ما إذا كانت المخرجات تبدو حقيقية أو مصطنعة.
لقطات المنتجات والتجارة
هذا هو المجال الأقوى لنموذج GPT Image 1.5. ينتج صورًا لمنتجات بأسلوب الاستوديو النظيف مع خلفيات مضبوطة، وعرضًا دقيقًا للمواد مثل الجلد والزجاج والمعدن والبلاستيك المطفي، ونوع التكوين الذي يعمل فورًا في سياقات التجارة الإلكترونية دون تحرير إضافي. تعني قدرة عرض النصوص أنه يمكنك تضمين ملصق أو شعار قصير في الصورة، وستُقرأ بشكل صحيح فعلًا، وهي ميزة كبيرة مقارنةً بمعظم النماذج المنافسة.
يستطيع Gemini 3 التعامل مع لقطات المنتجات، لكنه يحتاج إلى أوامر نصية أكثر تحديدًا لتجنب توليد سياق بيئي لم تطلبه. يميل إلى إضافة جو حيث كان المقصود إعدادًا بسيطًا في الاستوديو.
العمل الإبداعي والتجريدي
يخوض Gemini 3 مخاطرات تأويلية أكبر مع الأوامر التجريدية، ما ينتج أحيانًا مخرجات مفاجئة وأصيلة فعلًا لا تشبه شيئًا رأيته من قبل. يبدو أقل تقيدًا بتوقع الصحة الواقعية الفوتوغرافية عندما يمنح الأمر مساحة إبداعية.
يميل GPT Image 1.5 مع الأوامر التجريدية إلى الارتكاز على استعارات بصرية معروفة. يحتاج إلى توجيه صريح ومحدد لدفعه نحو منطقة جديدة فعلًا، لكنه بمجرد أن تعطيه ذلك التوجيه ينفذه بدقة وقابلية تكرار.

كيفية استخدام هذه النماذج على PicassoIA
تتوفر كل من سلسلة Imagen وGPT Image 1.5 مباشرة عبر PicassoIA، ما يعني أنك تستطيع تشغيل أي من المحركين دون اشتراك منفصل في Google One أو ChatGPT Plus. إليك كيفية الاستفادة من كل منهما.
استخدام Imagen 4 Ultra
Imagen 4 Ultra هو النموذج الأعلى دقة من Google، وهو نفس البنية التي تشغّل قدرات الصور في Gemini 3. على PicassoIA:
- انتقل إلى صفحة نموذج Imagen 4 Ultra.
- اكتب أمرك النصي في حقل الإدخال. أدرج اتجاه الإضاءة وزاوية الكاميرا وتفاصيل الشخص للحصول على أفضل النتائج.
- اضبط نسبة العرض إلى الارتفاع لتطابق المخرجات المطلوبة (16:9 لصور مصغرة للفيديو، و1:1 لمنشورات وسائل التواصل، و4:3 للتحرير الصحفي).
- ولّد الصورة. ينتج Imagen 4 Ultra مخرجات بدقة عالية مع دقة ألوان فوتوغرافية وتفاصيل فيزيائية قوية.
نصائح المعاملات لنموذج Imagen 4 Ultra:
- كن صريحًا بشأن الإضاءة: "ضوء غائم ناعم من الأعلى" ينتج مخرجات مختلفة عن "إضاءة جانبية درامية من مصباح عملي بزاوية 45 درجة".
- استخدم مصطلحات التصوير الحقيقية. "عمق ميدان f/1.8"، و"ضغط تليفوتو 85 ملم"، و"حبيبات الفيلم" كلها تشير إلى النموذج بأنك تريد واقعية فوتوغرافية.
- في أعمال البورتريه، حدّد الأصل العرقي والعمر التقريبي وملامح محددة. يستجيب Imagen لذلك بدقة لا بتحسين عام.
- استخدم Imagen 4 Fast للتكرار السريع، وImagen 4 Ultra للمخرج النهائي.

استخدام GPT Image 1.5
GPT Image 1.5 هو النموذج الرائد للصور من OpenAI، وهو نفسه الذي يشغّل توليد الصور في ChatGPT. على PicassoIA:
- افتح صفحة نموذج GPT Image 1.5.
- اكتب أمرًا نصيًا منظمًا. يتعامل GPT Image 1.5 مع التعليمات الطويلة والمفصّلة بإتقان كبير. لا تتحفظ في التفاصيل.
- ضع أي نص يجب أن يظهر في الصورة بين علامتي اقتباس داخل أمرك النصي. هذا يشير إلى النموذج بأن عرض النص بدقة مطلوب.
- ولّد وراجع. إذا كانت المخرجات الأولى قريبة لكن غير دقيقة، فعدّل متغيرًا واحدًا في كل مرة بدلًا من إعادة كتابة الأمر النصي بالكامل.
نصائح المعاملات لنموذج GPT Image 1.5:
- استخدم لغة التكوين مباشرة: "قاعدة الثلث"، و"مساحة سلبية في الثلث الأيسر"، و"تخطيط متماثل ومتمركز مع عنصر في المقدمة".
- حدّد لوح الألوان صراحةً: "درجات كهرمانية دافئة وسيينا محروقة فقط"، و"لوح أزرق أحادي اللون مع عنصر أحمر واحد مميز".
- بالنسبة إلى لقطات المنتجات، سمِّ الخلفية بدقة: "خلفية منحنى أبيض لا نهائي"، و"سطح حجري رمادي مائل بملمس"، و"خلفية شفافة".
إذا أردت تشغيل الأمر النصي نفسه عبر عدة محركات للمقارنة، يتوفر على PicassoIA أيضًا Flux Pro، وFlux 1.1 Pro Ultra، وIdeogram v3 Quality، وRecraft v4، وSeedream 4 في مكان واحد. يمكنك اختبار كل محرك رئيسي لتوليد الصور بالذكاء الاصطناعي جنبًا إلى جنب دون تبديل المنصات أو إدارة اشتراكات متعددة.

أيهما يجب أن تختار؟
الجواب الصادق هو أن لا أداة تفوز في كل شيء. فكل منهما مُحسّن لأشياء مختلفة، والخيار الأفضل يعتمد كليًا على ما تحتاجه من جلسة إبداعية، لا على أي شركة أصدرت بيانات صحفية أكثر إثارة للإعجاب.
اختر Gemini 3 إذا:
- كانت الإضاءة الواقعية وفيزياء المواد أولويتك
- تريد توليد الصور ضمن محادثة أوسع والتكرار عبر اللغة الطبيعية
- الأصالة في البورتريهات والتمثيل الدقيق لأشخاص متنوعين مهمان لمشروعك
- تفضّل نتائج تركز على الجو من أوامر نصية بسيطة، وتثق بالنموذج ليفسرها بإبداع
اختر ChatGPT إذا:
- تحتاج إلى نص مقروء يُعرض داخل الصورة نفسها
- المخرجات الجاهزة للتجارة والمصقولة هي المتطلب الأساسي مع الحد الأدنى من المعالجة اللاحقة
- تكتب أوامر نصية مفصّلة ومنظمة وتريد دقة عالية في اتباع التعليمات لكل عنصر
- تبني صورًا للمنتجات أو التسويق بكميات كبيرة وتحتاج إلى اتساق عبر التوليدات
لكن إليك ما يكتشفه معظم المستخدمين في النهاية: تشغيل المحركين عبر منصة واحدة هو الأسلوب الأكثر عملية للعمل الإبداعي الحقيقي. يمنحك PicassoIA الوصول إلى Imagen 4 Ultra، وGPT Image 1.5، وعشرات النماذج الأخرى المتطورة لتحويل النص إلى صورة في مكان واحد. تكتب الأمر النصي مرة واحدة وترى ما يصنعه كل محرك منه. لا اشتراكات منفصلة، ولا تبديل بين المنصات، ولا احتكاك بين الفكرة والمخرج.
إذا كنت تعتمد على أداة واحدة لتوليد الصور بالذكاء الاصطناعي، فإن تجربة الجانب الآخر من هذه المقارنة هي أسرع طريقة لرفع سقف جودة إنتاجك الإبداعي. ابدأ بالأمر النصي نفسه الذي تستخدمه بالفعل. شغّله عبر Imagen 4، ثم عبر GPT Image 1.5، ثم عبر Flux Pro. ستكون الفروقات مفيدة، وستغيّر هذه العملية طريقة كتابتك للأوامر النصية من تلك اللحظة فصاعدًا.
الأدوات أفضل مما كانت عليه في أي وقت مضى. السؤال لم يعد هل يستطيع الذكاء الاصطناعي إنشاء صورة جيدة، بل أي ذكاء اصطناعي ينشئ الصورة المناسبة لغرضك المحدد. لديك الآن ما يكفي من المعلومات لتقرر.
