كل بضعة أشهر، ينشر أحدهم مقارنة "نهائية" لفن الذكاء الاصطناعي. معظمها يصبح قديمًا قبل أن تقرأه. هذا المقال ليس كذلك. في الوقت الحالي، أي في 2027، تدفع أداتا توليد فنون بالذكاء الاصطناعي ملايين الأشخاص إلى تجاوز المنصات المتخصصة كليًا: ChatGPT Image (المدعومة بـ DALL-E 3 وبقدرة توليد الصور الأصلية في GPT-4o) وGemini Image (المبنية على نموذج Imagen 3 من Google). كلتاهما مدمجة في روبوتات محادثة ربما تستخدمها أصلًا. وكلتاهما تحسّنتا بشكل ملحوظ. السؤال الحقيقي هو هل أيٌّ منهما جيدة بما يكفي فعلًا، أم أنك تفوّت جودة كبيرة بالبقاء داخل الحديقة المسوّرة لروبوت المحادثة.

ما هي كل أداة فعليًا
قبل مقارنة النتائج، تحتاج إلى فهم ما الذي يعمل خلف الكواليس عندما تكتب أمرًا نصيًا في ChatGPT أو Gemini.
محرك صور ChatGPT
منحت OpenAI ChatGPT قدرتين مختلفتين لتوليد الصور. المسار الأقدم يمرّر أمرك النصي عبر DALL-E 3، وهو ما يزال من أكثر نماذج تحويل النص إلى صورة موثوقية في اتباع الأوامر بدقة. أما المسار الأحدث فيستخدم قدرة توليد الصور الأصلية في GPT-4o، التي يمكنها إنتاج صور بنصوص واضحة المقروئية، والحفاظ على العلاقات بين الأجسام بشكل أفضل، والتعامل مع التعديل المتعدد الأدوار داخل المحادثة نفسها. عمليًا، يختار ChatGPT المحرك الذي سيستخدمه بناءً على طلبك، لكن يمكنك أحيانًا توجيهه بالتصريح بما تحتاجه بوضوح.
ما يجعل الأمر مثيرًا للاهتمام هو الغلاف الحواري. يمكنك أن تقول "اجعل فستانها أحمر بدلًا من ذلك"، وسيحاول ChatGPT تطبيق هذا التغيير. يمكنك لصق صورة مرجعية وطلب نسخة مختلفة منها. سير العمل يبدو بديهيًا لأنه الواجهة نفسها التي تستخدمها في كل شيء آخر.
محرك صور Gemini
يستخدم Gemini من Google نموذج Imagen 3، وهو أقدر نموذج لتحويل النص إلى صورة طورته الشركة حتى الآن. بُني Imagen 3 مع تركيز على الواقعية الفوتوغرافية والتفاصيل الدقيقة، خصوصًا في البورتريهات والمناظر الطبيعية. يتيح تطبيق Gemini توليد الصور مباشرة داخل المحادثات، وقد عملت Google على أن تبدو النتائج طبيعية ومستندة إلى نسب واقعية.
على عكس إصدارات Imagen السابقة، يُظهر Imagen 3 فهمًا محسّنًا بوضوح للعلاقات المكانية، ما يعني أنه يعاني أقل مع أشياء مثل الأيدي ومشاهد الحشود والتركيبات المعمارية المعقدة مقارنة بنماذج Google السابقة.

مواجهة جودة الصور
هنا يرغب معظم الناس في الانتقال مباشرة، وهذا مفهوم. النتائج هي ما يهم.
الواقعية والتفاصيل وملمس البشرة
تحسنت الأداتان بشكل كبير في 2027. بالنسبة إلى البورتريهات البشرية الواقعية، يميل وضع GPT-4o في ChatGPT إلى إنتاج صور بدرجات بشرة أدفأ قليلًا ومظهر أقرب إلى "التصوير التحريري". المناطق الساطعة مضبوطة، والظلال مقصودة، وغالبًا ما تبدو النتيجة كأنها أُضيئت لجلسة تصوير في مجلة.
Gemini مع Imagen 3 يميل إلى درجات بشرة أبرد وأنظف مع ملمس تفاصيل دقيقة أكثر حدة. المسام والشعيرات الفردية وأنماط نسيج القماش تُصيَّر بوضوح مثير للإعجاب. إذا كنت تولّد تصوير منتجات أو بورتريهات يهم فيها الوضوح الصارم، فإن Gemini غالبًا ما يملك تفوقًا واضحًا.
بالنسبة إلى المناظر الطبيعية والصور البيئية، تضيق الفجوة بشكل ملحوظ. تنتج الأداتان مشاهد ذات عمق وضباب جوي وظروف إضاءة واقعية. يميل ChatGPT إلى تدرج ألوان أكثر دراماتيكية، بينما ينتج Gemini نغمة لونية أكثر حيادية بأسلوب الوثائقيات.
💡 نصيحة: من أجل البورتريهات الدافئة والسينمائية، يبدو ناتج GPT-4o في ChatGPT عادةً أكثر صقلًا. أما للصور الحادة للمنتجات والمظاهر التحريرية الأبرد، فيستحق Imagen 3 في Gemini التجربة أولًا.
علم الألوان ودقة الإضاءة
مجال واحد يتفوق فيه Gemini على ChatGPT باستمرار هو دقة الإضاءة الاتجاهية. عندما تحدد "ضوء قادم من الأعلى إلى اليسار في الساعة الذهبية"، يميل Gemini إلى تنفيذ ذلك باتساق مكاني أفضل عبر الصورة كلها. تقع الظلال حيث تقتضي قوانين الفيزياء أن تقع. وتظهر إضاءة الحافة بشكل صحيح على حواف الأشخاص.
نتائج ChatGPT في طلبات الإضاءة المحددة أقل اتساقًا. أحيانًا يصيب الطلب تمامًا، وأحيانًا أخرى ينتج تموضعًا معقولًا لكنه غير دقيق للضوء. هذا يهم كثيرًا لأي شخص يستخدم فن الذكاء الاصطناعي لأغراض تجارية أو تصميمية، حيث يكون استمرارية الإضاءة أمرًا غير قابل للتفاوض.

دقة الأوامر النصية والتحكم الإبداعي
كيف يتعامل ChatGPT مع أوامرك النصية
تأتي أكبر ميزة لدى ChatGPT في دقة الأوامر النصية من العمود الفقري لنموذجه اللغوي. لأن GPT-4o يفهم اللغة الطبيعية بعمق، فهو نادرًا ما يسيء تفسير الأوامر الحوارية غير التقنية. يمكنك أن تكتب بأسلوب عفوي: "امرأة تجلس في مقهى في باريس تبدو متضجرة قليلًا، ضوء الخريف، مصوّرة على فيلم" وسيلتقط النبرة العاطفية لعبارة "متضجرة قليلًا" بشكل صحيح.
كما يتعامل مع التعليمات السلبية بشكل معقول داخل المحادثة. قل "لا نص في الصورة" وسيحترم ذلك. اطلب منه "إزالة الفوضى في الخلفية" وسيكرر المحاولة في اتجاه مفيد. بالنسبة إلى المستخدمين غير التقنيين الذين لا يعرفون مصطلحات هندسة الأوامر، هذه ميزة عملية هائلة.
الجانب السلبي هو العشوائية. نادرًا ما ينتج الأمر نفسه الصورة نفسها إذا شُغّل مرتين. لا يوجد تحكم في قيمة البذرة، ولا قفل للأسلوب، ولا إظهار للمعاملات. تحصل على ما يقرر النموذج أن يعطيك إياه.
كيف يقرأ Gemini التعليمات
Gemini قوي أيضًا في فهم اللغة الطبيعية بما أنه نموذج متعدد الوسائط من Google. لكن تفسيره للأوامر يميل إلى الحرفية قليلًا. إذا لم تحدد مزاجًا أو عاطفة، فإنه يعود إلى الحياد. وإذا لم تحدد الإضاءة، تحصل على إضاءة نهارية عامة. هذا يجعله متوقعًا ومتسقًا، وهذا مفيد، لكنه قد ينتج صورًا صحيحة تقنيًا تبدو باهتة عاطفيًا.
المجال الذي يكسب فيه Gemini نقاطًا هو الدقة في التكوين. اطلب ترتيبًا محددًا للأشياء، وسيكون Gemini أكثر ميلًا لوضعها بشكل صحيح من ChatGPT. هل تحتاج إلى ثلاثة أشياء في علاقة مكانية محددة؟ نتائج Gemini تميل إلى احترام تلك الهندسة بشكل أفضل.

| الميزة | ChatGPT Image | Gemini Image |
|---|
| الواقعية الفوتوغرافية | عالية جدًا | عالية جدًا |
| تفاصيل البشرة | دافئة، تحريرية | حادة، سريرية |
| دقة الإضاءة | متوسطة | قوية |
| مرونة الأوامر النصية | لغة طبيعية | حرفية |
| دقة التكوين | متوسطة | قوية |
| التعديل التكراري | نعم (حواري) | محدود |
| النص داخل الصور | نعم (GPT-4o) | محدود |
| التحكم في قيمة البذرة | لا | لا |
السرعة والوصول وما تدفعه
واقع الباقة المجانية
تقدم الأداتان وصولًا مجانيًا، لكن مع قيود كبيرة لا يكتشفها معظم المستخدمين العاديين إلا عند الاصطدام بها.
ChatGPT Free تمنحك الوصول إلى توليد الصور، لكنها محدودة السرعة وستدفعك نحو GPT-3.5 خلال ساعات الذروة، وهو نموذج لا يستطيع توليد الصور. عمليًا، قد تجد نفسك بدون وصول إلى توليد الصور في الأوقات التي تريده فيها فعلًا.
Gemini Free تتضمن توليد الصور بشكل أكثر موثوقية، لكنها تضع حدًا لعدد مرات التوليد يوميًا، وقد ترفض الطلبات أحيانًا استنادًا إلى سياسة المحتوى حتى مع أوامر بريئة تمامًا.
ChatGPT Plus بسعر $20 شهريًا تمنحك وصولًا ثابتًا إلى DALL-E 3 وGPT-4o. أما Google One AI Premium بسعر $20 شهريًا فتفتح Gemini Advanced مع Imagen 3. الباقات المدفوعة متقاربة في التكلفة تقريبًا.
💡 نظرة واقعية: لا تكفي أي من الباقتين المجانيتين للعمل الإبداعي المهني أو الكثيف. كلتاهما تصطدمان بحواجز سريعًا.
السرعة في الاستخدام الفعلي
من ناحية سرعة التوليد الخام، تقع الأداتان ضمن نطاق 10 إلى 30 ثانية لكل صورة بإعدادات الجودة المعتادة. قد يكون التوليد الأصلي بـ GPT-4o في ChatGPT أبطأ للمشاهد المعقدة، فيصل أحيانًا إلى 30 إلى 45 ثانية. أما Gemini مع Imagen 3 فيميل إلى أن يكون أسرع قليلًا في المتوسط، ويعيد النتائج غالبًا خلال 8 إلى 15 ثانية.
لا تقدم أي من الأداتين توليد الدفعات أو المهام المتوازية أو إظهار قائمة الانتظار. تُرسل طلبك، تنتظر، وتحصل على صورة واحدة.

مجموعة الأساليب والمرونة الإبداعية
البورتريهات والمناظر الطبيعية والعمل التجريدي
تتعامل الأداتان بثقة مع البورتريهات الواقعية والمناظر الطبيعية. يظهر الاختلاف في تنفيذ الأساليب الفنية.
يملك وضع DALL-E 3 في ChatGPT مجموعة أساليب أوسع. يمكنك طلب أساليب الرسم الزيتي وأسلوب الرسم بالقلم الرصاص والألوان المائية وتأثيرات التصوير الفوتوغرافي الكلاسيكي بدقة معقولة. ويفسر مراجع الأسلوب الفني جيدًا.
Gemini أكثر تحفظًا مع الأساليب غير الواقعية. يمكنه إنتاج رسوم توضيحية وصور مُنمّطة، لكن قوته واضحة في المجال الفوتوغرافي. إذا دفعته نحو التعبيرية التجريدية أو أعمال الكرتون المنمّطة بشدة، تصبح النتائج أقل موثوقية.
أوضاع التصوير مقابل التوضيح
بالنسبة إلى الأعمال القريبة من التصوير الفوتوغرافي (البورتريهات وصور المنتجات وتصوير الطعام والصور المعمارية)، تتنافس الأداتان على مستوى عالٍ. أما بالنسبة إلى أعمال التوضيح والتصميم، فيمنح تدريب ChatGPT الأوسع على الأساليب الفنية ميزة له.
لا تمنحك أي من الأداتين الوصول إلى معماريات نماذج متخصصة. لا يمكنك اختيار نموذج محسّن للبورتريهات، أو متخصص في المناظر الطبيعية، أو نموذج لتصوير الأزياء. تحصل على نموذج واحد وأسلوب إخراج واحد في كل جلسة، مع قدرة محدودة على توجيهه نحو أساليب جمالية محددة.
💡 نصيحة: إذا كنت تحتاج إلى أساليب توضيح متسقة عبر صور متعددة لمشروع ما، فلن يمنحك أي من ChatGPT أو Gemini قابلية التكرار التي تحتاجها. انحراف الأسلوب بين الجلسات مشكلة حقيقية.

ما لا تستطيع الأداتان فعله
قيود المحتوى وحدود السلامة
تعمل المنصتان بموجب سياسات محتوى صارمة تتجاوز حظر المحتوى الضار حقًا. الصور الموحية والعري الفني والعنف (حتى الخيالي أو التاريخي) والموضوعات السياسية المتنوعة ستؤدي إلى رفض من الأداتين، غالبًا بشكل غير متوقع.
هذه مشكلة عملية لأي شخص يعمل في مجال إبداعي تجاري، أو في رسوم توضيحية للخيال، أو في تصوير الأزياء، أو أي محتوى يقع في منطقة رمادية. الرفض دون خيار إعادة المحاولة يضيّع وقتك ويقطع سير عملك.
لا توثّق أي من الأداتين بدقة أين يقع الخط الفاصل. تكتشف ذلك عندما تصطدم به.
التعديل والتخصيص والضبط الدقيق
هذا هو السقف الصلب للمنصتين. لا يمكنك:
- رفع بيانات تدريب خاصة بك للتأثير على أسلوب النموذج
- الاختيار بين معماريات نماذج متعددة
- التحكم في معاملات التوليد (مقياس التوجيه (CFG) وعدد الخطوات والمُعيّن وغيرها)
- استخدام ControlNet للتحكم في الوضعية أو البنية
- تطبيق أوزان LoRA لإعادة إنتاج شخصية أو أسلوب بثبات
- تشغيل توليد الدفعات لإنشاء مجموعات من التنويعات
- الوصول إلى مسارات رفع الدقة بالدقة الفائقة
بالنسبة إلى العمل الإبداعي المهني وشبه المهني، هذه القيود كبيرة. غلاف روبوت المحادثة مريح للاستخدام العادي. أما لأي شيء بمستوى الإنتاج، فأنت تعمل ضد قيود الأداة لا معها.

حيث تتفوق منصات فن الذكاء الاصطناعي المتخصصة
نماذج أكثر، وتحكم أكبر
هذه هي القضية المركزية مع ChatGPT Image وGemini Image: إنهما روبوتا محادثة عامان يصادف أنهما يولّدان الصور. لم يُبنيا للعمل الإبداعي التكراري أو اختيار النماذج أو خطوط الإنتاج.
توفر منصة فن ذكاء اصطناعي متخصصة الوصول إلى عشرات أو مئات النماذج المتخصصة. هل تريد بورتريهًا أحد من أي شيء ينتجه ChatGPT؟ يقدّم Flux 1.1 Pro Ultra Finetuned مخرجات بدقة 4 ميغابكسل مع دعم الضبط الدقيق. هل تحتاج إلى تكرارات سريعة؟ يولّد Flux Fast الصور في ثوانٍ دون عدم اليقين المتعلق بقائمة الانتظار في ChatGPT أو Gemini. هل تحتاج إلى قدرات تعديل الصور؟ يتيح لك Flux Kontext Dev إعادة كتابة أي صورة بدقة، وهذا ما لا تستطيع ChatGPT أو Gemini فعله بموثوقية.
يستحق Flux Kontext Fast ملاحظة خاصة للمستخدمين الذين يريدون دقة اتباع الأوامر النصية الخاصة بنموذج Flux Kontext دون انتظار. يعالج التعديلات والتوليدات في جزء بسيط من الوقت، وهذا مهم جدًا عندما تكرر التنويعات.
يظل Stable Diffusion 3 خيارًا قويًا لمن يريد مخرجات حادة وواقعية فوتوغرافيًا مع تصيير نصوص أفضل من معظم البدائل. ويضيف Flux Schnell LoRA تحكمًا مخصصًا في الأسلوب فوق واحد من أسرع خطوط التوليد المتاحة، وهذا أمر لا يمكن تحقيقه داخل المنظومات المغلقة لـ ChatGPT أو Gemini.

كيفية توليد الصور على PicassoIA
البدء مع أي من هذه النماذج على PicassoIA يستغرق أقل من دقيقتين:
- تصفح المجموعة: زر مجموعة نماذج تحويل النص إلى صورة واختر نموذجًا يناسب نوع المخرج الذي تريده.
- اختر نموذجك: للحصول على أعلى واقعية، جرّب Flux 1.1 Pro Ultra Finetuned. للسرعة، جرّب Flux Fast.
- اكتب أمرك النصي: كن محددًا بشأن الإضاءة والموضوع والتكوين والمزاج. على عكس ChatGPT، تستجيب هذه النماذج جيدًا للغة التقنية في الأوامر: "85mm f/1.8, volumetric morning light from left, Kodak Portra 400 film grain."
- اضبط المعاملات: حدد نسبة العرض إلى الارتفاع وعدد المخرجات وأي خيارات خاصة بالأسلوب يكشفها النموذج.
- ولّد وكرر: شغّل عدة قيم بذرة أو تنويعات حتى تحصل على المخرج الدقيق الذي تحتاجه.
- ارفع الدقة عند الحاجة: استخدم نموذج الدقة الفائقة لرفع صورتك إلى دقة جاهزة للطباعة.
العملية كلها أسرع وأكثر قابلية للتحكم، وتنتج نتائج أكثر اتساقًا مما تقدمه ChatGPT أو Gemini داخل واجهات الدردشة الخاصة بهما.
💡 نصيحة للنموذج: إذا كنت قادمًا من ChatGPT أو Gemini وتريد التجربة الأكثر ألفة على الفور، فإن Flux Kontext Dev يتعامل مع الأوامر بلغة طبيعية بدقة ممتازة، ويمنحك في الوقت نفسه التحكم في المعاملات الذي كنت تفتقده.

اختر أداتك وابدأ الإبداع
ChatGPT Image وGemini Image مثيرتان للإعجاب فعلًا بالنظر إلى ما هما عليه: توليد صور مدمج في محادثة. لإنشاء الصور بسرعة وعفوية ولمرة واحدة، حيث لا تحتاج إلى قابلية التكرار أو التحكم الدقيق، فكلتاهما خيار جيد. تمنح المرونة اللغوية لـ ChatGPT أفضلية طفيفة للأوامر الإبداعية. وتمنح دقة الإضاءة والدقة التكوينية في Gemini أفضلية للمخرجات التقنية.
لكن إذا كنت تستخدم أيًا منهما للعمل الإبداعي الجاد وتتساءل لماذا تبدو النتائج غير متسقة، أو لماذا لا تستطيع إعادة إنتاج تلك الصورة التي أعجبتك، أو لماذا تواصل الأداة رفض أوامر تبدو بريئة، فالجواب ليس في الأمر النصي. الجواب هو أن روبوتات المحادثة ليست منصات لتوليد الصور.
يمنحك PicassoIA الوصول إلى أكثر من 90 نموذجًا متخصصًا لتحويل النص إلى صورة، منها Flux Fast وFlux Kontext Dev وFlux 1.1 Pro Ultra Finetuned وStable Diffusion 3، ولكل منها تحكم حقيقي في المعاملات، دون قيود على المحتوى في العمل الإبداعي المشروع، ودون عدم يقين في قائمة الانتظار. جرّب تشغيل الأمر النصي نفسه في ChatGPT وGemini وأحد هذه النماذج. ستكون الفروق في التحكم وجودة المخرجات واضحة فورًا.