ظهر GPT Image 2 بهدوء، لكن تأثيره في توليد الصور بالذكاء الاصطناعي لم يكن هادئًا على الإطلاق. يمثل أحدث نموذج لتوليد الصور من OpenAI أكبر قفزة في الجودة أطلقتها الشركة منذ DALL-E الأصلي، وإذا كنت قد استخدمت أي مولّد صور من قبل، فستلاحظ الفرق فورًا. تستهدف التحسينات المجالات الثلاثة التي أعاقت صور الذكاء الاصطناعي تاريخيًا: تصيير النصوص، والواقعية الفوتوغرافية، والالتزام بالأمر النصي. وقد عولجت الثلاثة الآن، وتبعاتها العملية كبيرة.
ما هو GPT Image 2 فعليًا

GPT Image 2 هو نموذج OpenAI المستقل من الجيل الثاني لتوليد الصور، وقد صُمّم لإنتاج صور واقعية كالصور الفوتوغرافية انطلاقًا من أوامر باللغة الطبيعية. وهو يعمل بشكل مختلف عن قدرات الصور المدمجة في GPT-4o: فهذا نموذج بصري مخصص، وليس وحدة رؤية مرفقة بنموذج لغوي.
يقبل النموذج الأوامر النصية ويعيد صورًا عالية الدقة بمجموعة من نسب العرض إلى الارتفاع. ويدعم سير عمل التعديل، ومنه التعديل الموضعي (ملء مناطق في الصورة)، وتوسيع الصورة (توسيع اللوحة خارج حدودها الأصلية)، واستبدال الكائنات، ما يجعله أكثر بكثير من أداة تحويل نص إلى صورة بسيطة. فكّر فيه كنظام متكامل لإنشاء الصور ومعالجتها، يُستخدم بلغة عادية.
من GPT Image 1 إلى GPT Image 2
كان GPT Image 1 الأصلي منافسًا لكلٍّ من Midjourney و Stable Diffusion عند إطلاقه. لكن كانت له نقاط ضعف موثقة جيدًا: تصيير النصوص كان غير موثوق، وتفكّكت الواقعية الفوتوغرافية في المشاهد المعقدة ذات الأشخاص المتعددين، وكان الالتزام بالأمر النصي متذبذبًا لأي شيء يتجاوز التراكيب البسيطة.
يعالج GPT Image 2 هذه النقاط الثلاث جميعها عبر تحسينات معمارية تظهر فورًا في المخرجات. هذه ليست تصحيحًا طفيفًا. فقد أُعيد تدريب النموذج على مجموعة بيانات أكبر وأكثر انتقاءً بدرجة كبيرة، مع تركيز خاص على وضوح الخطوط المكتوبة، وثبات التشريح البشري، والدقة التكوينية. والنتيجة العملية أن المخرجات التي كنت تحتاج سابقًا إلى 20 محاولة للوصول إليها بشكل صحيح تظهر الآن في التوليد الأول أو الثاني.
المعمارية متعددة الوسائط الأصلية
على عكس سلفه، يستخدم GPT Image 2 معمارية متكاملة للرؤية واللغة، بدلًا من معاملة الصورة والنص كمسارين منفصلين. هذا يعني أن النموذج يفسّر أمرك على المستوى الدلالي، لا أنه يكتفي بمطابقة الكلمات المفتاحية السطحية مع فضاء صور كامن.
عندما تكتب "امرأة واثقة في مقهى تحت ضوء بعد الظهر"، يعالج النموذج الحالة المزاجية، ووقت اليوم، والسياق الجوي، والخيارات التكوينية المتضمنة في الوقت نفسه. هذا الفهم الشامل هو سبب إنتاج الأوامر المعقدة والمتعددة الطبقات نتائج متماسكة الآن، بدلًا من مخرجات مجزأة تظهر فيها بعض عناصر الأمر وتختفي عناصر أخرى تمامًا.
الميزات الجديدة الأهم

ثلاث ميزات تبرز كجديدة فعلًا مقارنة بالجيل السابق. تحل كل واحدة مشكلة أحبطت مستخدمي الذكاء الاصطناعي للصور لسنوات، وتفتح سير عمل لم يكن ممكنًا من قبل.
نصوص تبدو كأن إنسانًا كتبها
كان لكل مولّد صور قبل GPT Image 2 نسخة من الفشل نفسه: تبدو النصوص في الصور المولّدة مشوّهة. لافتات بحروف مبعثرة. قوائم طعام تذوب في ضوضاء بصرية. قمصان بأحرف طباعية لا تنتمي إلى أي أبجدية معروفة.
يحل GPT Image 2 هذه المشكلة. يصيّر النموذج النصوص المقروءة بشكل أصلي، أي يمكنك تحديد كلمات أو عبارات في أمرك وستظهر بشكل صحيح في المخرج. وهذا يفتح مجالًا واسعًا من حالات الاستخدام التجارية والإبداعية: نماذج منتجات بأسماء علامات تجارية حقيقية، ورسومات لوسائل التواصل بعناوين مقروءة، وصور لعلامات تجارية تكون فيها الطباعة جزءًا من التكوين، وإيضاحات تحريرية تحمل فيها الكلمات معنى.
نصيحة: اجعل النص المطلوب قصيرًا ومحددًا. تعمل أوامر مثل "لافتة واجهة متجر تقرأ OPEN" بشكل أفضل من الفقرات الطويلة. يتعامل النموذج مع 1-4 كلمات بدقة شبه تامة، ويؤدي أداءً جيدًا مع الجمل القصيرة التي تتكون من 8-10 كلمات.
واقعية فوتوغرافية بمستوى جديد

تظهر تحسينات الواقعية الفوتوغرافية في GPT Image 2 بأوضح صورة في البورتريهات والتصوير المقرّب. تُصيَّر ملمس البشرة وتفاصيل الشعر واستجابة الإضاءة بدرجة من الدقة تجعلها تجتاز فحصًا بصريًا سريعًا كصورة فوتوغرافية فعلًا. تُظهر القزحية تنوعًا لونيًا واقعيًا. وتلتقط خصلات الشعر الضوء كلٌّ على حدة. وتُظهر البشرة تفاصيل دقيقة كالمسام والملمس الناعم، بدلًا من الأسطح المصقولة والبلاستيكية الشائعة في النماذج السابقة.
هذا لا يعني أن النموذج ينتج مخرجات مثالية في كل مرة. فما زالت المشاهد المعقدة التي تضم عدة أشخاص تُنتج أحيانًا اختلافات طفيفة في الاتساق. لكن في البورتريهات ذات الشخص الواحد وتصوير المنتجات ولقطات المناظر الطبيعية، يكون سقف الجودة أعلى بكثير مما كان عليه في GPT Image 1.
يتعامل النموذج أيضًا مع الإضاءة بدقة أكبر بكثير. حدّد "ضوء الساعة الذهبية في وقت متأخر من بعد الظهر من الجهة اليسرى" وستستجيب الظلال والإبرازات ودرجة حرارة اللون والانعكاسات المتوهجة عبر كل عناصر المشهد بشكل صحيح. لم تعد الإضاءة خانة يتم تحديدها في المخرج؛ بل صارت عنصرًا تكوينيًا نشطًا يتحكم فيه النموذج فعليًا.
اتباع الأوامر يحقق النتيجة المطلوبة فعلًا
التحسين الثالث الكبير أقل وضوحًا لكنه بالقدر نفسه من الأهمية: GPT Image 2 أدق بشكل ملحوظ في تفسير الأوامر المعقدة متعددة البنود وتنفيذها.
كانت النماذج السابقة كثيرًا ما تتعلق بكلمة أو كلمتين مهيمنتين في الأمر وتتجاهل الباقي. تطلب امرأة ترتدي معطفًا أحمر تمشي في شارع مرصوف بالحجارة تحت المطر، فتحصل على امرأة تقف في مكان داخلي ما بملابس عادية. يعالج GPT Image 2 الأمر الكامل بشكل هرمي، فيمنح وزنًا للمعدِّلات وسياق المشهد والتعليمات الأسلوبية بأمانة أكبر. تنتج الأوامر الأطول والأكثر وصفًا نتائج أفضل باستمرار، بدلًا من أن تربك النموذج أحيانًا.
كيف يقارن بالمنافسين

يدخل GPT Image 2 مجالًا تنافسيًا. فنماذج Flux وStable Diffusion وغيرها لها مجتمعات قوية وسير عمل راسخ. إليك مقارنته في الجوانب الأهم للمبدعين العاملين.

| الميزة | GPT Image 2 | Flux Kontext Fast | Flux Redux Dev |
|---|
| تصيير النصوص | ممتاز | جيد | مقبول |
| الواقعية في البورتريه | ممتاز | جيد جدًا | جيد جدًا |
| دقة الأوامر | ممتاز | جيد | جيد |
| تعديل الصور (تعديل موضعي/توسيع) | نعم | نعم | محدود |
| السرعة | سريع | سريع جدًا | سريع |
| تنوع الأساليب | متوسط | عالٍ | عالٍ |
| نص أصلي في المخرج | نعم | جزئي | جزئي |
GPT Image 2 مقابل Flux Kontext Fast
Flux Kontext Fast من أسرع نماذج تعديل الصور المتاحة، ويتفوق في سير عمل معالجة الصور الفوتوغرافية. إذا كنت تعمل على صور موجودة وتحتاج إلى تعديل عناصر محددة بسرعة، فلدى Flux Kontext Fast ميزة حقيقية ومفيدة في السرعة والتكرار.
يتفوق GPT Image 2 في توليد الصور من الصفر، خاصة عندما تكون الواقعية الفوتوغرافية ودقة الأوامر أولويتين. أما تصيير النصوص الأصلي، فالفارق بينهما شاسع: يتعامل GPT Image 2 معه بموثوقية، بينما يتعامل Flux Kontext Fast مع النص كإضافة ثانوية.
اختيار الأداة المناسبة للمهمة
- استخدم GPT Image 2 في: البورتريهات الواقعية، ولقطات المنتجات، والصور التي تحتوي على نصوص مقروءة، والمواد التسويقية التي تتطلب تكوينات محددة، والصور التحريرية
- استخدم Flux Kontext Fast في: تحرير الصور الفوتوغرافية السريع، ونقل الأساليب السريع، وسير عمل التنويعات التكرارية، والمشاريع الحساسة للسرعة
- استخدم Flux Redux Dev في: توليد تنويعات للصور انطلاقًا من مرجع، واستكشاف الأساليب الإبداعية، وبناء سلاسل من الصور بالحمض النووي البصري المتسق
الخبر الجيد أنك لست مضطرًا إلى اختيار واحد فقط. على PicassoIA، الثلاثة متاحة في الواجهة نفسها، لذا فالتبديل بينها حسب المهمة يستغرق ثوانٍ.
كيف تستخدم GPT Image 2 على PicassoIA

يتيح لك PicassoIA الوصول المباشر إلى GPT Image 2 دون الحاجة إلى حساب API لدى OpenAI أو أي إعداد تقني. إليك الخطوات الدقيقة من فتح الصفحة حتى أول مخرج لك.
الخطوة 1: افتح صفحة النموذج
انتقل إلى GPT Image 2 على PicassoIA. سترى حقل إدخال الأمر النصي، ومحدد نسبة العرض إلى الارتفاع، والمعاملات المتقدمة الاختيارية. لا حاجة إلى إعداد مفتاح API ولا إلى واجهة سطر الأوامر ولا إلى إعداد حساب، بخلاف إنشاء حسابك على PicassoIA.
الخطوة 2: اكتب أمرك النصي
اكتب أمرك النصي في حقل الإدخال. كن وصفيًا ومحددًا. كل تفصيلة ذات معنى تضيفها تمنح النموذج إشارة أوضح يعمل بها. تضمّن ما يلي:
- الموضوع: من أو ما الموجود في الصورة، مع تفاصيل جسدية محددة
- المكان: الموقع، والبيئة، والسياق المعماري، ووقت اليوم
- الإضاءة: الاتجاه، والجودة (ناعمة، قاسية)، ودرجة حرارة اللون (ضوء الساعة الذهبية، غيوم، شمس منتصف النهار)
- زاوية الكاميرا: لقطة مقرّبة، لقطة عريضة، جوية، زاوية منخفضة، مستوى العين
- العدسة والعمق: البعد البؤري، والفتحة لإحساس عمق الميدان
- الملمس والأجواء: حبيبات الفيلم، وتشطيبات المواد، والحالة المزاجية
مثال على أمر نصي: "امرأة ترتدي سترة كتانية كريمية تجلس في مقهى على شرفة مشمسة في باريس، ضوء صباح طبيعي من الجهة اليسرى يصنع ظلالًا ناعمة، عدسة بورتريه 85 ملم، عمق ميدان ضحل مع مشهد شارع في الخلفية بتأثير البوكيه، ملمس بشرة مرئي وتفاصيل شعر دقيقة، حبيبات فيلم Kodak Portra 400، واقعي كالصورة الفوتوغرافية RAW 8K"
الخطوة 3: اضبط المعاملات
يقدم GPT Image 2 على PicassoIA عناصر تحكم أساسية تشكّل المخرج بشكل كبير:
| المعامل | وظيفته | نقطة البداية المقترحة |
|---|
| نسبة العرض إلى الارتفاع | تحدد أبعاد الصورة | 16:9 للمناظر الأفقية، و1:1 لوسائل التواصل، و9:16 للقصص والريلز |
| الجودة | تتحكم في مستوى تفاصيل التصيير | عالية للمخرجات النهائية، وقياسية للمسودات |
| عدد الصور | يولّد عدة تنويعات | 3 إلى 4 للاستكشاف الأولي لأمر جديد |
الخطوة 4: حمّل صورتك واستخدمها
بمجرد توليد الصورة (عادة خلال 10 إلى 25 ثانية حسب الإعدادات)، انقر على التنزيل. المخرج صورة عالية الدقة جاهزة للاستخدام المباشر في العروض التقديمية، ومنشورات التواصل، والمواقع، ومنصات الإعلانات، أو الطباعة. لا تحتاج إلى معالجة لاحقة في معظم الحالات.
نصيحة: ولّد من 3 إلى 4 تنويعات لأمرك الأول قبل تحسين صياغته. تنتج قيم البذرة العشوائية المختلفة تفسيرات مختلفة بشكل ملموس، وغالبًا ستجد واحدة تطابق رؤيتك أفضل مما توقعت من المحاولة الأولى.
أوامر نصية تعمل فعلًا

الفارق بين مخرج GPT Image 2 متوسط ومخرج مذهل يعود تقريبًا دائمًا إلى جودة الأمر النصي. يستجيب النموذج جيدًا للأوصاف المحددة والمتعددة الطبقات. أما الأوامر الغامضة فتنتج نتائج عامة ومنسية.
تشريح الأمر النصي القوي
فكّر في أمرك النصي كإحاطة لمصوّر فوتوغرافي. لن تعطي المصور مهمة من كلمة واحدة. ستصف الموضوع، والمكان، والضوء، والزاوية، والحالة المزاجية، والأسلوب. طبّق الدقة نفسها على أوامر تحويل النص إلى صورة.
البنية التي يجب اتباعها: [Subject with physical details] [Environment and setting] [Lighting direction and quality] [Camera angle and lens] [Texture and atmosphere] [Style reference]
أمر ضعيف: "امرأة في مقهى"
أمر قوي: "امرأة ذات شعر داكن يصل إلى الكتفين تقرأ كتابًا ورقيًا على طاولة دائرية صغيرة في مقهى فرنسي هادئ، ضوء صباح دافئ من نافذة كبيرة على يمينها، عدسة 50 ملم بفتحة f/1.8، عمق ميدان ضحل مع خلفية شارع ضبابية بعدسة البوكيه، ملمس الورق مرئي على صفحات الكتاب، تفاصيل مسام البشرة، حبيبات فيلم Kodak Portra 400، واقعي كالصورة الفوتوغرافية"
يمنح الأمر القوي النموذج معلومات عن الموضوع والمكان والإضاءة والعدسة وعمق الميدان والملمس والأسلوب. كل عبارة تضيّق مساحة المخرجات نحو ما تريده فعلًا.
5 قوالب جاهزة للأوامر النصية
1. تصوير البورتريه
"بورتريه مقرّب لشخص [وصف الشخص] في [المكان]، [اتجاه الإضاءة] من [اليسار/اليمين]، عدسة 85 ملم بفتحة f/1.8، عمق ميدان ضحل مع خلفية بوكيه، ملمس بشرة مرئي وتفاصيل شعر دقيقة، واقعي كالصورة الفوتوغرافية، حبيبات فيلم Kodak Portra 400، RAW 8K"
2. لقطة منتج
"صورة منتج احترافية لـ [وصف المنتج] على [مادة السطح]، بزاوية [من الأعلى/من الجانب/بزاوية 45 درجة]، إضاءة استوديو ناعمة ومنتشرة بظلال متساوية، خلفية [بيضاء/داكنة/رخامية]، عدسة 50 ملم، تصوير تجاري، تفاصيل عالية"
3. منظر طبيعي
"صورة فوتوغرافية لمنظر طبيعي بعدسة واسعة لـ [وصف الموقع]، [وقت اليوم]، ضوء [الساعة الذهبية/الصباح/الساعة الزرقاء] حجمي، 24 ملم بفتحة f/8، عمق ميدان واسع، ألوان طبيعية بلا رفع للتشبع، RAW 8K، واقعي كالصورة الفوتوغرافية"
4. داخلي
"صورة فوتوغرافية داخلية لغرفة [نوع الغرفة] تضم [ملامح التصميم الأساسية]، ضوء طبيعي من [اتجاه النافذة]، عدسة واسعة 35 ملم، أسلوب التصوير المعماري، نغمات [دافئة/باردة]، ملمس الخشب والقماش مرئي، تكوين نظيف"
5. صورة بنص (تخصص GPT Image 2)
"[عنصر: واجهة متجر/ملصق منتج/لوحة إعلانية] عليه النص [نصك الدقيق] مكتوب بنوع الخط [خط بلا زوائد نظيف/خط يدوي مائل/خط عرض عريض]، [وصف المكان]، [الإضاءة]، واقعي كالصورة الفوتوغرافية، تفاصيل عالية، طباعة حادة"
أين يناسب GPT Image 2 العمل الحقيقي

تترجم تحسينات الواقعية الفوتوغرافية ودقة الأوامر في GPT Image 2 مباشرة إلى سير عمل مهني محدد. ثلاثة مجالات بعينها تشهد أسرع تبنٍّ في الواقع.
التسويق والإعلانات الإبداعية
تُعد صور الحملات واحدة من أوضح حالات الاستخدام الفورية. يستخدم مدراء الفن GPT Image 2 لتوليد صور رئيسية للإعلانات الرقمية، واختبار مفاهيم بصرية مختلفة بالتوازي دون جدولة جلسة تصوير، وإنتاج صور موسمية أو خاصة بحملة عند الطلب.
قدرة تصيير النصوص الأصلية مفيدة بشكل خاص للإعلانات المفاهيمية التي تظهر فيها عناوين النصوص فوق الصورة. كان هذا سير عمل يتطلب سابقًا مصمم جرافيك يدمج النص فوق خلفية مولّدة في أداة منفصلة. أما الآن فيتم ذلك بأمر واحد في خطوة توليد واحدة.
مع أدوات إزالة الخلفية ورفع الدقة الفائقة في PicassoIA، يتقلص مسار الانتقال من المخرج إلى الجاهز للاستخدام من أيام إلى دقائق.
محتوى وسائل التواصل الاجتماعي
تميل خلاصات Instagram وLinkedIn وPinterest بقوة إلى الصور الواقعية كالصور الفوتوغرافية والمُلهِمة. يولّد GPT Image 2 هذا المحتوى على نطاق واسع دون أن تحتاج العلامة التجارية إلى الاشتراك في مكتبة صور مخزنة أو جدولة جلسات تصوير متكررة لكل حملة.
بالنسبة إلى العلامات التجارية التي تحتاج إلى هوية بصرية متسقة عبر المنشورات، تعني دقة الأوامر المحسّنة أنك تستطيع وصف أسلوب متكرر بدقة، مثل نغمات الصباح الدافئة وأسلوب التأطير المحدد وطابع الإضاءة المتسق، وإعادة إنتاجه بموثوقية عبر عشرات الصور المختلفة دون البدء من الصفر في كل مرة.
نماذج المنتجات والتجارة الإلكترونية
كان عرض المنتج في سياق نمط حياة يتطلب تقليديًا تصويرًا فوتوغرافيًا فعليًا للمنتج. يستطيع GPT Image 2 وضع أوصاف المنتجات في مشاهد واقعية كالصور الفوتوغرافية ومقنعة، مع الإضاءة الصحيحة وسلوك الظلال والتفاعل مع الأسطح. تتعامل قدرة تصيير النصوص مع ملصقات العبوات وأسماء العلامات التجارية على المنتجات، وكان ذلك عائقًا تامًا أمام نماذج الصور السابقة في هذا السير.
بالنسبة إلى العلامات التجارية في مراحلها المبكرة التي لم تصنّع منتجها المادي بعد، يعني هذا توليد أصول بصرية مقنعة لعروض المستثمرين، وحملات ما قبل البيع، واختبار المفهوم قبل وجود وحدة واحدة.
ابدأ الإنشاء الآن

GPT Image 2 من تلك الأدوات التي يكون أسرع طريق لفهمها هو وضع شيء ما في صندوق الأمر النصي ومشاهدة ما يعود به. تظهر التحسينات على نماذج الجيل السابق في المخرج الأول، لا بعد أسابيع من تعلّم النظام.
GPT Image 2 متاح مباشرة على PicassoIA إلى جانب أكثر من 90 نموذجًا آخر لتحويل النص إلى صورة. إذا أردت مقارنة المخرجات عبر النماذج، يمكنك تشغيل الأمر النصي نفسه عبر Flux Kontext Fast وFlux Redux Dev في دقائق ورؤية الفرق بنفسك.
وعندما تصبح لديك صور ترضيك، يمكن لأدوات الدقة الفائقة في PicassoIA رفعها إلى أبعاد جاهزة للطباعة، وتتيح ميزة إزالة الخلفية الحصول على تركيبات نظيفة بنقرة واحدة. يقع سير العمل كاملًا، من الفكرة إلى أصل بصري جاهز للإنتاج، داخل منصة واحدة.
اختر أحد قوالب الأوامر النصية من هذا المقال، واستبدل الموضوع والمكان بموضوعك ومكانك، وشاهد ما ينتجه GPT Image 2. الصورة الأولى التي تولّدها لن تكون الأخيرة.