Imagen 4: نموذج توليد الصور الجديد من Google موضّحًا

Imagen 4 من Google هو أقدر نموذج لتوليد الصور بالذكاء الاصطناعي بنته الشركة حتى الآن، مع تحسينات كبيرة في الواقعية الفوتوغرافية، ودقة عرض النصوص داخل الصور، والالتزام بالأمر النصي. يشرح هذا المقال ما ينتجه Imagen 4 فعليًا، وكيف تختلف بنية الانتشار فيه عن الإصدارات السابقة، وأين يقف أمام Flux 2 Max وDALL-E 3 وMidjourney في المقارنات الواقعية، وأين يمكنك الوصول إليه اليوم ضمن منتجات Google.

Imagen 4: نموذج توليد الصور الجديد من Google موضّحًا
Cristian Da Conceicao
مؤسس Picasso IA

أطلقت Google للتو Imagen 4، وهو يغيّر المشهد التنافسي في تحويل النص إلى صورة بطرق تهمّ المحترفين والمبدعين غير المتخصصين على حد سواء. إذا كنت تتابع هذا المجال منذ أيام الصور الضبابية بدقة 512x512 وصولًا إلى التوليد القريب من الواقعية الفوتوغرافية اليوم، فأنت تعرف مدى سرعة تغيّر الاختبارات المعيارية. يتصدّر Imagen 4 مجموعة نماذج توليد الصور لدى Google DeepMind، ويقدّم تحسينات ملموسة في كل جانب مهم: الواقعية الفوتوغرافية، والالتزام بالأمر النصي، وعرض النصوص داخل الصور.

يتناول هذا المقال كل ما تحتاج معرفته. ما الذي يفعله Imagen 4 فعليًا، وكيف تعمل بنيته، وأين يقف مقارنةً بنماذج DALL-E 3 وFlux وMidjourney، وما الذي يعنيه ذلك لمن يعمل بأدوات توليد الصور بالذكاء الاصطناعي.

باحث في الذكاء الاصطناعي أمام محطة عمل متعددة الشاشات يراجع نتائج توليد الصور

ماذا يفعل Imagen 4 فعليًا

الواقعية الفوتوغرافية بمعيار جديد

أوضح تحسين في Imagen 4 هو مدى واقعية المخرجات. كانت الإصدارات السابقة من سلسلة Imagen تتميز بنعومة واضحة، خاصة في التفاصيل الدقيقة مثل الشعر وملمس الأقمشة والضوء المنعكس. يعالج Imagen 4 معظم ذلك.

ينتج النموذج صورًا بدقة تصل إلى 2K بشكل أصلي، مع حبيبات الصورة وعمق الميدان وعرض المواد بمستوى يُضاهي تصوير الاستوديو في ظروف كثيرة. تُظهر البورتريهات ملمس البشرة حتى مستوى المسام. وتعرض المناظر الطبيعية الضوء الحجمي بالضباب الجوي الذي تلتقطه كاميرا بحجم الإطار الكامل. كما تصمد ثنيات الأقمشة والانعكاسات الضوئية على الأسطح الزجاجية عند الفحص عن قرب.

كان التفصيل الواقعي بهذا المستوى لا يتحقق سابقًا إلا بالجمع بين نموذج أساسي قوي ومراحل متعددة لرفع الدقة والتحسين. أما Imagen 4 فيحققه في خطوة توليد واحدة.

لقطة ماكرو قريبة جدًا لعين بشرية تُظهر تفاصيل فوتوغرافية واقعية وانعكاسات الضوء

💡 يستطيع Imagen 4 عرض حبيبات الفيلم المرئية وعيوب العدسة والزيغ اللوني عند طلب "تصوير بالفيلم" أو "لقطة تناظرية". دُرِّب النموذج على تمييز الشوائب الفوتوغرافية الأصيلة من الضوضاء الرقمية.

النصوص داخل الصور: مشكلة قديمة حُلّت

ظل عرض النصوص داخل الصور نقطة الضعف في كل نموذج لتوليد الصور لسنوات. حقق DALL-E 3 تقدمًا ملموسًا. وتحسّن Midjourney v6. Imagen 4 هو أول نموذج يتعامل مع نصوص معقدة متعددة الكلمات داخل الصور بدقة ثابتة.

اطلب لافتة لمتجر باسم تجاري محدد، أو غلاف مجلة بعنوان رئيسي، أو كتابة على كعكة عيد ميلاد، وسيعرض Imagen 4 الحروف بشكل صحيح في الغالبية العظمى من الحالات. وهذا إنجاز ليس بسيطًا. فالبنى السابقة للانتشار كانت تواجه صعوبة مع النصوص لأن الحروف لا تملك علاقات مكانية متماسكة أثناء عملية إزالة الضوضاء. ويبدو أن مُرمِّز النص الأكبر لدى Imagen 4 والضبط الدقيق بالتعلّم المعزز من التغذية الراجعة البشرية (RLHF) قد عالجا هذه المشكلة على مستوى البنية.

الالتزام بالأمر النصي أعمق

إلى جانب الجودة البصرية، يتّبع Imagen 4 الأوامر النصية بدقة استثنائية. فالتعليمات التركيبية مثل "كرسي أحمر على الجانب الأيسر من الإطار مع نافذة خلفه" تُترجم إلى المخرجات مع احترام العلاقات المكانية المحددة فعليًا.

وهذا مهم للمحترفين. مصوّر منتجات يحتاج إلى ترتيب معين، ومصمم جرافيك يحتاج إلى مزاج بعينه، وصانع محتوى يحتاج إلى مشهد دون إعادة بنائه خمس مرات. يقلّل Imagen 4 من حلقة التكرار هذه بشكل ملحوظ.

كيف يقارن بالمنافسين

مصوّران في غابة صنوبر يقارنان لقطات الكاميرا في ضوء الصباح المتقطع

Imagen 4 مقابل DALL-E 3

يملك DALL-E 3، المدمج في ChatGPT، أوسع انتشار حتى الآن. معظم من ولّدوا صورة بالذكاء الاصطناعي فعلوا ذلك عبر واجهة OpenAI. يتفوق Imagen 4 في الجودة البصرية الخالصة في المقارنات المباشرة. أما DALL-E 3 فيميل إلى مظهر مُنمَّط وتوضيحي بعض الشيء حتى عند إعدادات الواقعية العالية. تبدو مخرجات Imagen 4 أقرب إلى الصور الملتقطة بكاميرا منها إلى الرسومات الناتجة عن برامج.

الميزةImagen 4DALL-E 3
الواقعية الفوتوغرافيةعالية جدًاعالية
عرض النصوصممتازجيد
الالتزام بالأمر النصيممتازجيد جدًا
الدقةتصل إلى 2K1024x1024 أصلية
الوصولGoogle AI Studio، Vertex AIChatGPT، API

Imagen 4 مقابل Flux

يُعد Flux Pro من Black Forest Labs أقوى منافس مفتوح المصدر حاليًا. و**Flux 1.1 Pro** متاح وواسع الاستخدام، ويُنتج نتائج مذهلة في تصوير البورتريه ومجلات الأزياء. أما Flux 2 Pro و**Flux 2 Max** فيذهبان أبعد في الدقة والتفاصيل.

وتتفوق نماذج Flux عادةً على Imagen 4 في المرونة الأسلوبية. تدعم منظومة Flux نماذج LoRA المضبوطة بدقة، وتوجيه الوضعيات عبر ControlNet، وسير عمل التعبئة والتعديل الموضعي. أما Imagen 4 فنموذج أكثر تحديدًا في توجهه، يتفوق في الواقعية الفوتوغرافية لكنه لا يملك منظومة المعدِّلات التي راكمتها Flux مع الوقت.

من حيث الجودة الخام للصور في المشاهد الواقعية، ينافس Imagen 4 نموذج Flux 2 Max. أما من حيث التحكم الإبداعي وتنوع الأساليب، فإن Flux يتفوق.

💡 Flux 2 Pro وFlux 2 Max متاحان الآن على PicassoIA. إذا كنت تقيس نتائجك بالمقارنة مع Imagen 4، فهذان هما نقطتا المقارنة المناسبتان.

Imagen 4 مقابل Midjourney

لا يزال Midjourney v7 يحتفظ بالتاج في الجودة الجمالية للمخرجات المُنمَّطة والفنية والسينمائية. وقد بنى المجتمع مكتبة واسعة من أعراف كتابة الأوامر النصية التي تُنتج نتائج جميلة بثبات. ولا يحاول Imagen 4 المنافسة في هذا المحور.

ويتفوق Imagen 4 على Midjourney في اتباع التعليمات للمشاهد المحددة والواقعية. يفسّر Midjourney الأوامر النصية بإبداع، فيُجمّل الصورة أو يجرّدها في أحيان كثيرة بما يبتعد عن الوصف الحرفي. أما Imagen 4 فيتعامل مع الأمر النصي كمواصفة أكثر منه اقتراحًا.

حالة الاستخدامأفضل خيار
الصور الفنية أو المُنمَّطةMidjourney v7
البورتريهات الواقعيةImagen 4 أو Flux 2 Max
عرض النصوص داخل الصورImagen 4
تصوير المنتجاتImagen 4 أو Flux Pro
الوصول المفتوح المصدر أو عبر APIنماذج Flux
توليد الدفعات الكبيرةسلسلة GPT Image

البنية التي تقف خلف المخرجات

لقطة ماكرو لرقاقة سيليكون دقيقة تُظهر تعقيد الدوائر النحاسية

"دماغ" لغوي أكبر للصور

يبني Imagen 4 على بنية نموذج الانتشار المتتالي التي قدّمتها Google في سلسلة Imagen الأصلية. الفكرة الأساسية: توليد صورة منخفضة الدقة، ثم تطبيق مراحل انتشار متتالية لرفع الدقة لإضافة التفاصيل عند كل مقياس.

ما تغيّر في Imagen 4 هو نموذج التكييف. وسّعت Google مُرمِّز النص بشكل كبير، مستخدمةً نسخة من نموذج اللغة T5 لمعالجة الأوامر النصية بعمق أكبر. وهذا هو السبب في أن عرض النصوص والاستدلال المكاني تحسّنا بشكل كبير. فالنموذج لا يكتفي بمطابقة الكلمات مع أجزاء الصورة، بل يحلّل العلاقات الدلالية في الأمر النصي ويستخدمها لتقييد التوليد في كل خطوة انتشار.

والنتيجة نموذج تتحول فيه التعليمات المعقدة إلى مخرجات متماسكة بصورة أكثر تكرارًا، مع عدد أقل من الكائنات المُهلوَسة أو الأشخاص الموضوعين في غير مكانهم داخل المشهد.

التعلّم المعزز من التغذية الراجعة البشرية

ذكرت Google أن Imagen 4 مرّ بمراحل متعددة من RLHF (التعلّم المعزز من التغذية الراجعة البشرية)، تستهدف على وجه التحديد الالتزام بالأمر النصي والجودة الجمالية. وهي الطريقة نفسها التي جعلت نماذج GPT أفضل بكثير في اتباع التعليمات بلغة طبيعية، والتي تُطبَّق الآن على توليد الصور على نطاق واسع.

الأثر العملي أن Imagen 4 يتصرف كنموذج معايَر بتفضيلات البشر، لا مجرد نموذج دُرِّب على مجموعة بيانات ضخمة. وعندما تنحرف المخرجات عمّا يريده المستخدمون فعلًا، يعيد تدريب RLHF النموذج إلى التوافق. ويظهر ذلك بوضوح أكبر في دقة التكوين، وفي تجنّب النموذج المستمر لعيوب التوليد الشائعة مثل الظلال غير المتسقة أو الأيدي غير الصحيحة تشريحيًا.

أين يمكنك الوصول إلى Imagen 4

منظر جوي من طائرة مسيّرة لحرم تقني حديث عند الساعة الذهبية بمبانٍ من الزجاج والفولاذ

Google AI Studio

يُعد Google AI Studio نقطة الوصول الأساسية الموجهة للمستخدمين. عبر واجهة Gemini، يتوفر Imagen 4 لتوليد الصور من الأوامر النصية مباشرةً في المتصفح. الواجهة نظيفة وسريعة. لا تحتاج إلى إدارة معاملات الانتشار أو إعدادات أدوات أخذ العينات. اكتب أمرًا نصيًا واحصل على صورة.

بالنسبة لمن ينتقلون من Midjourney أو توليد صور ChatGPT، تبدو التجربة مألوفة. وتميل النتائج إلى أن تكون مصقولة من أول مرة، دون حاجة إلى ضبط مكثف للأوامر النصية للوصول إلى جودة مقبولة.

Vertex AI للاستخدام الإنتاجي

للوصول عبر API والنشر الإنتاجي، تقدّم Google نموذج Imagen 4 عبر Vertex AI. وهذه هي فئة المؤسسات، المصممة لخطوط الإنتاج والتوليد كبير الحجم والدمج ضمن المنتجات والتطبيقات القائمة.

يوفّر Vertex AI أيضًا الوصول إلى Imagen 4 Ultra، وهو الإصدار الأعلى جودةً، ومُوجَّه خصيصًا لحالات الاستخدام المهنية والتجارية. ينتج مستوى Ultra تفاصيل أوضح بشكل ملحوظ ودقة لونية أفضل من نقطة API القياسية.

مدمج في Google Workspace

دمجت Google Imagen 4 في منتجات Workspace، ومنها Slides وDocs وMeet. تعمل ميزات توليد الصور في هذه الأدوات باستخدام Imagen في الخلفية، ما يجعله من أكثر نماذج توليد الصور انتشارًا بحسب عدد المستخدمين الفعلي، وإن كان يحظى باهتمام أقل في مجتمع المتحمسين مقارنةً بنموذج Midjourney أو إصدارات Stable Diffusion.

كتابة أوامر نصية تعمل مع Imagen 4

محترف إبداعي يراجع صورًا مذهلة مولّدة بالذكاء الاصطناعي على جهاز لوحي كبير

التحديد يُثمر

يعني الالتزام القوي بالأمر النصي لدى Imagen 4 أنك تحصل على ما تُدخله. الأوامر النصية الغامضة ما زالت تنتج صورًا جيدة، لكن النموذج يكافئ التحديد. بدلًا من "امرأة على الشاطئ"، جرّب "امرأة ترتدي فستانًا كتانيًا كريميًا تقف على ساحل صخري عند الساعة الذهبية، تنظر بعيدًا عن الكاميرا". يُترجم السياق الإضافي مباشرةً إلى المخرجات.

يختلف هذا عن طريقة عمل Midjourney. فمع Midjourney، كثيرًا ما تتفوق الأوامر القصيرة المُوحية على الأوامر الوصفية الطويلة لأن النموذج يفسّرها بمرونة ويضيف خياراته الجمالية الخاصة. أما Imagen 4 فأكثر حرفية. استفد من ذلك.

💡 للمخرجات الواقعية فوتوغرافيًا، أضف لغة خاصة بالكاميرا: "مُلتقطة بعدسة 85mm وفتحة f/1.8، وKodak Portra 400، وضوء طبيعي من اليسار". دُرِّب Imagen 4 على ربط هذه المفردات بالواقعية الفوتوغرافية، ويطبّق الجماليات بثبات.

3 أساليب للأوامر النصية الأفضل أداءً

ثلاثة أطر تُنتج نتائج قوية باستمرار مع Imagen 4:

  • أوامر التصوير الفوتوغرافي: مواصفات الكاميرا ونوع الفيلم واتجاه الإضاءة وخصائص العدسة. "تصوير جوي، عدسة 24mm، f/8، الساعة الذهبية، Sony A1"
  • وصف المشهد: الشخص أو الموضوع، والبيئة، ووقت اليوم، والمزاج. "تقاطع مزدحم في طوكيو ليلًا، انعكاسات المطر على الرصيف، ضبابية حركة للمشاة"
  • التوجيه التركيبي: زاوية الكاميرا، والتأطير، وعلاقات العمق. "لقطة بزاوية منخفضة تنظر إلى الأعلى، عمق ميدان ضحل، الشخص في المقدمة واضح والخلفية بوكيه"

ما الذي لا يعمل جيدًا بعد

تُنتج بعض أنماط الأوامر النصية نتائج غير متسقة مع Imagen 4:

  • طلب عدة نصوص مختلفة في صورة واحدة (ما زال غير موثوق مع أكثر من عنصرين نصيين)
  • المفاهيم المجردة جدًا أو السوريالية التي تحتاج إلى استعارة بصرية لا إلى وصف حرفي
  • طلبات محددة لأساليب بصرية محمية بحقوق النشر أو لملامح مشاهير (تُطبَّق فلاتر أمان قوية)

سباق توليد الصور بالذكاء الاصطناعي الأوسع

مشهد ليلي لمدينة بشوارع مبللة بالمطر وانعكاسات ضوئية نابضة بالكهرماني والأرجواني

Flux 2 ودفعة النماذج المفتوحة

يمثّل Flux 2 Pro و**Flux 2 Max** أقوى منافسة بمعمارية مفتوحة لنموذج Imagen 4. هذه النماذج ليست مقفلة خلف واجهة API مغلقة. يستطيع المطورون نشرها وضبطها بدقة وبناء تطبيقات متخصصة عليها.

وهذا فارق بنيوي عن Imagen 4. يعمل Imagen على بنية تحتية تابعة لشركة Google وتخضع لشروطها. أما منظومة Flux فموزّعة وقابلة للتعديل والتوسيع. وبالنسبة لكثير من حالات الاستخدام المهنية، يكون هذا الانفتاح أهم من نتائج الاختبارات المعيارية الخام.

Recraft V4 Pro منافس قوي آخر في سير عمل التصميم الجرافيكي والرسوم التوضيحية. ينتج طباعة نصية نظيفة للغاية ودقة شبيهة بالمتجهات، ما يجعله الخيار الصحيح لأصول العلامات التجارية ونماذج التصميم حيث قد يُفرط Imagen 4 في إضافة الملمس إلى المخرجات.

GPT Image 1.5 وGPT Image 2

تبقى نماذج توليد الصور لدى OpenAI في قلب هذا السباق. GPT Image 1.5 و**GPT Image 2** مدمجان بإحكام في تجربة ChatGPT، ويقدمان أداءً قويًا في اتباع التعليمات، لا سيما في المشاهد التي تتطلب تحليل أوصاف سياقية معقدة. وتستفيد سلسلة GPT Image من عمق نموذج اللغة لدى OpenAI: فالتحرير المتبادل عبر المحادثة أكثر طبيعية من النماذج المستقلة لتوليد الصور.

يتنافس Imagen 4 بشكل مباشر مع سلسلة GPT Image في الالتزام بالأمر النصي والواقعية الفوتوغرافية. ولا يتمتع أي من النموذجين بتفوق حاسم في كل حالات الاستخدام.

Ideogram V3 ومتخصصو الطباعة

بنى Ideogram V3 Turbo و**Ideogram V3 Quality** سمعتهما على عرض نصوص دقيق قبل وصول Imagen 4 بوقت طويل. ولا يزال Ideogram المتخصص الأول عندما يكون المطلب الأساسي طباعة نظيفة ومقروءة مدمجة داخل الصور. وفي الملصقات وصور وسائل التواصل الاجتماعي والمواد التسويقية ذات النصوص المحددة، يحتفظ Ideogram بأفضلية نابعة من تركيز معماري متعمّد على مشكلة النص داخل الصورة.

تضيّق تحسينات النص في Imagen 4 هذه الفجوة بدرجة كبيرة، لكن Ideogram ينتج نتائج أدق بثبات عندما يكون النص هو محور الصورة لا تفصيلًا عرضيًا.

ماذا يعني هذا للمبدعين

سقف الجودة يواصل الارتفاع

قبل عامين، كان التعرف على صورة مولّدة بالذكاء الاصطناعي أمرًا بسيطًا في معظم الأحيان. أما اليوم، فإن مخرجات Imagen 4 وFlux 2 Max وMidjourney v7 تبدو لمعظم المشاهدين في معظم السياقات لا تُميَّز عن التصوير الفوتوغرافي. وقد تجاوز سقف الجودة النقطة التي يحمل عندها هذا التمييز وزنًا عمليًا لغالبية التطبيقات.

هذا يغيّر طريقة تفكير المبدعين في أدوات توليد الصور بالذكاء الاصطناعي. لم يعد السؤال "هل هذا جيد بما يكفي؟"، بل "أي أداة تفعل ما أحتاجه، وبأي تكلفة، وبأي سير عمل؟"

التخصص بدلًا من سير العمل بنموذج واحد

مع تقوّي كل نموذج، تتمايز النماذج أيضًا. يتفوق Imagen 4 في الواقعية الفوتوغرافية وعرض النصوص. ويمتلك Midjourney v7 مساحة الجماليات الفنية. وتوفر نماذج Flux قابلية البرمجة والضبط الدقيق. ويتخصص Ideogram في الطباعة. ويخدم Recraft التصميم الجرافيكي.

لا يهيمن نموذج واحد على كل حالات الاستخدام. يبني المحترفون الذين يعملون بتوليد الصور بالذكاء الاصطناعي في عام 2027 سير عمل متعدد النماذج، فيختارون الأداة المناسبة لكل مخرج محدد، بدلًا من الاعتماد على منصة واحدة لكل شيء.

💡 يكون نهج تعدد النماذج أكثر عملية على المنصات التي تمنحك الوصول إليها جميعًا في مكان واحد. مقارنة المخرجات عبر النماذج للأمر النصي نفسه هي أسرع طريقة لمعرفة أي نموذج يناسب أي مهمة.

أنشئ صورك الخاصة بالذكاء الاصطناعي الآن

امرأة ترتدي فستان صيف أبيض منسدل على ساحل أطلسي صخري عند الساعة الذهبية

رفع Imagen 4 سقف ما يمكن أن يقدمه نموذج تحويل النص إلى صورة في الواقعية الفوتوغرافية وعرض النصوص والالتزام بالأمر النصي. وهو أقدر نموذج لتوليد الصور لدى Google حتى الآن، وينافس بجدية كل نموذج آخر من الفئة العليا في المجال.

لكن الفكرة الأهم من هذه اللحظة في توليد الصور بالذكاء الاصطناعي لا تتعلق بأي نموذج واحد بعينه. بل في أن المجال بلغ مستوى من القدرة يعتمد فيه اختيار الأداة الصحيحة على مهمتك المحددة، ويشكّل امتلاك الوصول إليها كلها في مكان واحد ميزة حقيقية.

على PicassoIA، يمكنك العمل مع Flux Pro وFlux 2 Max وGPT Image 2 وRecraft V4 Pro وIdeogram V3 Turbo، وأكثر من 90 نموذجًا آخر لتحويل النص إلى صورة، في مكان واحد. اختر أمرًا نصيًا، وشغّله عبر نماذج متعددة، وشاهد الفروق مباشرةً. وهذه أسرع طريقة لترى ما يفعله كل نموذج فعليًا، لا بقراءة عنه، بل بتشغيل أوامرك الخاصة ومقارنة النتائج جنبًا إلى جنب.

امرأة ترتدي قميص بيكيني كريمي مُفصَّلًا على شرفة سطح مبنى مع مدينة ساحلية متوسطية عند الغسق

اختر موضوعًا. اكتب أمرًا نصيًا. وشاهد ما تنتجه أفضل نماذج توليد الصور في العالم به الآن.

شارك هذا المقال

اختر لغتك

مقالات ذات صلة