ما هو Imagen؟ نموذج الصور من Google مشروحًا بالكامل

يُعد Imagen من Google من أقوى أنظمة الذكاء الاصطناعي لتحويل النص إلى صورة على الإطلاق. فمنذ إصداره الأول حتى Imagen 4 Ultra، دفعت كل نسخة الواقعية الفوتوغرافية خطوة أبعد. تشرح هذه المقالة كيف يعمل Imagen، وما الذي يميّزه عن منافسيه، وكيف تبدأ الإبداع به اليوم.

ما هو Imagen؟ نموذج الصور من Google مشروحًا بالكامل
Cristian Da Conceicao
مؤسس Picasso IA

لم يظهر Imagen من Google بهدوء. فحين كشفت Google Research عن الإصدار الأول في عام 2022، رفعت سقف ما يمكن لنماذج تحويل النص إلى صورة أن تنتجه، خاصة في المجالات التي كانت المنافسة تعاني فيها بوضوح: الواقعية الفوتوغرافية، ودقة الالتزام بالأمر النصي، والاستدلال باللغة الطبيعية. معظم الناس سمعوا بالاسم. وقلّة منهم يعرفون كيف يعمل النظام فعليًا، أو ما الذي تغيّر بين الإصدارات، أو كيف يمكن الوصول إلى أحدث إصدار.

هذه هي المقالة التي تجيب عن كل ذلك.

ما هو Imagen فعليًا

Imagen هو عائلة نماذج الانتشار (diffusion) لتحويل النص إلى صورة من Google. وعلى خلاف توليد الصور بالتنبؤ بالبكسلات وحده، يعتمد Imagen بشكل كبير على نموذج لغوي كبير لمعالجة الأمر النصي قبل أن يبدأ توليد الصورة أصلًا. هذه البنية ذات المرحلتين، معالجة اللغة أولًا ثم تركيب الصورة ثانيًا، هي ما يمنح Imagen تفوقه في الأوصاف المعقدة أو الدقيقة.

يأخذ النظام أمرًا نصيًا ويمرره عبر مشفّر نصي T5-XXL مجمَّد دُرِّب على مجموعات نصوص ضخمة، ثم يستخدم تضمينات النص هذه لتوجيه سلسلة متتالية من نماذج الانتشار. والنتيجة صورة لا تطابق الكلمات بصريًا فحسب، بل تعكس المعنى الكامن وراءها. اطلب "كلب متعب يستريح على شرفة دافئة في أواخر بعد الظهر"، وسيفسّر Imagen الجو العاطفي، لا الأسماء فقط.

💡 لماذا يهم هذا: استخدمت نماذج سابقة مثل DALL-E 2 تضمينات CLIP، وهي مدرَّبة معًا على أزواج الصورة والنص. أما تضمينات T5 فمدرَّبة على النص وحده، ما يمنح Imagen معالجة دلالية أغنى بكثير للمفاهيم المجردة والعلاقات والمعدِّلات الدقيقة.

لقطة مقرّبة ليدين تكتبان على لوحة مفاتيح بسيطة، مع معرض صور مولّدة بالذكاء الاصطناعي ضمن الشاشة خلفها بضبابية خفيفة

مبني على الانتشار، ومدعوم باللغة

البنية الأساسية هي نموذج انتشار متتالٍ (cascaded). إليك كيف يسير:

  1. يولّد نموذج الانتشار الأساسي بدقة 64x64 صورة أولية منخفضة الدقة مبنية على أمرك النصي
  2. يرفع نموذج الانتشار للدقة الفائقة بدقة 256x256 هذه الصورة، ويحسّن التكوين
  3. يُنتج نموذج الانتشار للدقة الفائقة بدقة 1024x1024 المخرج النهائي بكامل تفاصيل الملمس

تعتمد كل مرحلة على تضمينات النص نفسها، ما يعزز دقة الالتزام بالأمر النصي عند كل مستوى دقة. وتستخدم المراحل عالية الدقة بنى U-Net فعّالة تحافظ على التفاصيل دون تكلفة حوسبة متزايدة بشكل أسي.

وهذا يختلف اختلافًا ملموسًا عن أساليب الانتشار أحادية الخطوة، حيث يجب توليد الصورة كاملة بدقة عالية منذ البداية. فالتتالي يفصل المهمة الدلالية عن مهمة التفاصيل، فتصبح كلتاهما أسهل.

كيف درّبته Google

استخدم التدريب مئات الملايين من أزواج الصورة والنص من مزيج من مجموعات البيانات الداخلية ومصادر عامة مُنتقاة. كما أدمجت Google حلقات تغذية راجعة بشرية قيّم فيها المحللون جودة الصورة ودقتها وجاذبيتها الجمالية، ما دفع النموذج نحو مخرجات يفضّلها البشر فعليًا، لا مجرد ما يحصل على درجات جيدة في المقاييس الآلية.

كان التوجيه بلا مصنِّف (classifier-free guidance)، وهو الأسلوب الذي يتيح لك ضبط مدى التزام النموذج بأمرك النصي مقابل التوليد الحر، جزءًا أساسيًا من وصفة تدريب Imagen منذ البداية. وهو الآلية نفسها خلف معظم نماذج الانتشار الكبرى، لكن تنفيذ Imagen كان مضبوطًا بعناية لافتة منذ الإطلاق.

لقطة علوية مسطحة لمساحة عمل إبداعية في استوديو، تضم دفاتر وحاسوبًا محمولًا يعرض صورًا مولّدة بالذكاء الاصطناعي

الخط الزمني لإصدارات Imagen

أصدرت Google إصدارات متعددة من Imagen منذ 2022، وكل منها حمل قفزات ملموسة في القدرات. إليك تفصيل موجز.

Imagen 1 وImagen 2

قدّم Imagen 1 (2022) البنية المتتالية للانتشار ومزيج مشفّر T5 النصي. وسجّل 7.27 FID على COCO (كلما انخفض الرقم كان أفضل)، ونال أعلى الدرجات من المقيّمين البشريين في الواقعية الفوتوغرافية والتطابق مع الأمر النصي. وكان يُعتبر حينها على نطاق واسع أكثر نموذج لتحويل النص إلى صورة واقعية عُرض علنًا.

كان Imagen 2 (2023) أول إصدار متاح تجاريًا عبر منصة Vertex AI من Google Cloud. وأضاف:

  • تحسينًا ملحوظًا في عرض النصوص داخل الصور
  • توليد وجوه أفضل مع تشوهات أقل
  • دعمًا لتحرير الصور وللتعديل الموضعي (inpainting) وتوسيع الصورة (outpainting)
  • مرشحات أمان أكثر صرامة وضمانات للتوليد المسؤول
  • تكاملًا مع أدوات Google Workspace (Slides وDocs) ومنتجات Gemini المبكرة
الميزةImagen 1Imagen 2
عرض النصمحدودتحسّن ملحوظ
الوصول التجاريلانعم (Vertex AI)
دعم التحريرلا يوجدتعديل موضعي وتوسيع كامل
جودة الوجوهمتوسطةعالية
التكامل مع منتجات Googleلا يوجدWorkspace وGemini

Imagen 3 مقابل Imagen 4

الفجوة بين Imagen 3 وImagen 4 هي الأكبر في السلسلة، سواء في القدرات أو في خيارات الوصول.

مثّل Imagen 3 تحسنًا كبيرًا في محاكاة الإضاءة الطبيعية ودقة درجات لون البشرة وتكوين المشهد. درّبته Google باستخدام بيانات تفضيل بشري محسّنة، ما يعني أن النموذج استرشد بما وجده المقيّمون البشريون فعليًا أجمل وأدق، لا بالمقاييس الآلية وحدها. وقدّم Imagen 3 Fast إصدارًا محسّنًا للسرعة، للتطبيقات التي يهم فيها زمن التوليد أكثر من أقصى قدر من التفاصيل.

ذهب Imagen 4 أبعد من ذلك. يدعم دقات أصلية تصل إلى 2048x2048، وعرضًا محسّنًا بشكل كبير للنص داخل الصورة، وقدرة أقوى بكثير على الاستدلال المكاني. يتعامل النموذج مع تعليمات مثل "ضع القبعة الحمراء على الطاولة إلى يسار القط" بموثوقية أكبر بكثير من أي إصدار سابق، وهي مهمة تكشف مدى عمق معالجة العمود الفقري اللغوي في Imagen للغة الموضعية والعلاقية.

Imagen 4 Ultra هو المستوى الأعلى، وينتج مخرجات بفئة 4 ميغابكسل مع أفضل حفظ للتفاصيل وأعلى نتائج الاختبارات المعيارية في العائلة. أما Imagen 4 Fast فهو الإصدار المحسّن للسرعة، للتطبيقات التي تحتاج توليدًا سريعًا دون التضحية بقدر كبير من الجودة.

💡 توصية سريعة: بالنسبة لمعظم المستخدمين، يمثل Imagen 4 النقطة المثالية بين الجودة والسرعة. ويستحق Imagen 4 Ultra الترقية حين ستُطبع الصورة النهائية، أو تُعرض بحجم كبير، أو يُفحص تفصيلها عن قرب.

امرأة سوداء شابة بشعر مجعّد طبيعي تجلس عند طاولة مقهى وتراجع صورًا مولّدة بالذكاء الاصطناعي على جهاز لوحي

ما الذي يميّز Imagen

لا تقوم سمعة Imagen على التسويق. إنها تصمد في ثلاثة مجالات محددة تتراجع فيها منافسات كثيرة بوضوح.

عرض نصوص يعمل فعلًا

ظلّت نماذج توليد الصور بالذكاء الاصطناعي تاريخيًا سيئة جدًا في عرض النصوص داخل الصور. فالكلمات المكتوبة بشكل خاطئ، والحروف المشوّهة، والخطوط غير القابلة للقراءة كانت القاعدة في DALL-E 3 وMidjourney وإصدارات Stable Diffusion الأولى. وبالنسبة لأي شخص يحاول إنشاء نماذج منتجات أو رسومات لوسائل التواصل الاجتماعي أو مرئيات تحمل علامة تجارية باستخدام الذكاء الاصطناعي، كان هذا عائقًا حاسمًا.

غيّر Imagen 3 وImagen 4 ذلك. ينتج النموذج نصوصًا واضحة، ومكتوبة بشكل صحيح، وقابلة للقراءة داخل الصور، بما في ذلك على اللافتات والملصقات والمنتجات والبنرات. عبارات متعددة الكلمات على واجهات المتاجر، ونصوص بأسلوب الخط اليدوي على بطاقات التهنئة، وعناوين عريضة على نماذج الملصقات: يتعامل Imagen معها باتساق لم يكن متاحًا فعليًا في توليد الصور بالذكاء الاصطناعي قبل هذه العائلة من النماذج.

يفتح هذا المجال أمام حالات استخدام في نماذج المنتجات ومحتوى وسائل التواصل الاجتماعي والمرئيات الإعلانية، كانت غير عملية سابقًا مع توليد الذكاء الاصطناعي.

الواقعية الفوتوغرافية على نطاق واسع

يعني النهج المتتالي في Imagen أن كل مرحلة دقة مُحسّنة تحديدًا لدورها. يتولى النموذج الأساسي التكوين والدلالات. وتتولى نماذج الرفع الملمس والحبيبات والتفاصيل الدقيقة. وينتج هذا الفصل بين المهام صورًا يتصرف فيها الجلد والقماش والأسطح والضوء كما تتصرف في التصوير الفوتوغرافي الحقيقي.

النتيجة ليست مجرد "مظهر واقعي". إنها معايرة للخصائص البصرية التي تكون عين الإنسان أكثر حساسية لها: حدة الحواف، وبقع الضوء اللامعة، ومعالجة عمق الميدان، وثبات الألوان تحت أنواع مختلفة من الإضاءة. والمناطق التي تنتج فيها معظم نماذج الانتشار عيوبًا خفيفة، مثل تصيير الشعر وثنيات القماش والأسطح العاكسة، تبدو أنظف بوضوح في مخرجات Imagen.

السلامة بالتصميم

دمجت Google تقنية SynthID، وهي تقنية العلامات المائية الرقمية غير المرئية الخاصة بها، مباشرةً في مخرجات Imagen. تحمل كل صورة يولّدها Imagen عبر واجهات Google البرمجية (API) علامة مائية مشفّرة يمكن قراءتها بأدوات مخصصة، دون أن تغيّر الصورة بصريًا بأي شكل.

ويقترن هذا بطبقات تصنيف نشطة تفحص الأوامر النصية والمخرجات الوسيطة بحثًا عن انتهاكات للسياسات. وبالنسبة للشركات والمنصات، يجعل هذا Imagen واحدًا من أكثر النماذج أمانًا للنشر في البيئات الإنتاجية التي تهم فيها مساءلة المحتوى.

منظر جانبي لشاشة حاسوب محمول فائقة العرض تعرض تخطيطًا احترافيًا لمعرض صور مولّدة بالذكاء الاصطناعي

Imagen 4 Ultra بالتفصيل

Imagen 4 Ultra هو الرائد الحالي. إليك ما يميّزه تحديدًا عن بقية العائلة.

نتائج الاختبارات المعيارية

تقارن اختبارات Google Imagen 4 Ultra بشكل إيجابي مع كل من DALL-E 3 وMidjourney v6 في:

  • دراسات تفضيل البشر: الجودة العامة للصورة والجاذبية الجمالية عبر موضوعات متنوعة
  • دقة عرض النص: صحة الحروف على مستوى الرمز في النص المولّد داخل الصورة
  • الالتزام بالأمر النصي: مدى دقة مطابقة المخرجات للوصف الحرفي والضمني
  • درجة الواقعية الفوتوغرافية: يقيّمها مصورون محترفون دون معرفة المصدر مقارنةً بصور فوتوغرافية حقيقية

وفي فئة الواقعية الفوتوغرافية تحديدًا، يتفوق Imagen 4 Ultra باستمرار في الصور التي تتضمن جلدًا بشريًا طبيعيًا وإضاءة خارجية وملمسًا معقدًا للأقمشة، وهي المجالات التي تنتج فيها معظم النماذج عيوبًا مرئية يلتقطها الخبراء فورًا.

أين يتألق

  • تصوير البورتريه: ألوان بشرة طبيعية، وعيون واقعية، وتصيير دقيق لخصلات الشعر بالدقة الكاملة
  • تصوير المنتجات: خلفيات نظيفة قابلة للتهيئة، وانعكاسات دقيقة للمواد على المعدن والزجاج
  • التصيير المعماري: ضوء النوافذ، وملمس أسطح الداخل، والدقة الهندسية
  • مشاهد الطبيعة: انعكاسات الماء الشعاعية، وتفاصيل الأوراق، وتدرجات الإضاءة الجوية عبر السماء

💡 نصيحة احترافية: يستجيب Imagen 4 Ultra بشكل جيد بصفة خاصة للأوامر النصية التي تحدد اتجاه الإضاءة وجودتها. فإضافة "ضوء صباحي ناعم ومنتشر من الأعلى إلى اليسار" أو "شمس منتصف النهار القاسية من الأعلى مع ظلال حادة" تُحدث فرقًا كبيرًا في جودة المخرجات مقارنةً بأوصاف الإضاءة غير المحددة أو العامة.

امرأتان تجلسان جنبًا إلى جنب على مكتب استوديو بسيط، تتعاونان في مراجعة نتائج مقارنة صور الذكاء الاصطناعي على الشاشة

كيفية استخدام Imagen على PicassoIA

تتيح PicassoIA وصولًا مباشرًا إلى كامل سلسلة Imagen، بما في ذلك Imagen 3 وImagen 3 Fast وImagen 4 وImagen 4 Fast وImagen 4 Ultra، دون الحاجة إلى حساب Google Cloud أو إعداد Vertex AI. تشغّل Imagen على الواجهة نفسها التي تعمل بها كل النماذج الأخرى على المنصة.

الخطوة 1: اختر نموذجك

انتقل إلى قسم Imagen على PicassoIA. وفي معظم الحالات، ابدأ بنموذج Imagen 4. وإذا كنت تحتاج أقصى دقة للأصول الجاهزة للطباعة أو بالأحجام الكبيرة، فانتقل مباشرة إلى Imagen 4 Ultra. أما للنماذج الأولية السريعة، أو التوليد بكميات كبيرة، أو التكرار السريع على فكرة ما، فإن Imagen 4 Fast يقلل زمن التوليد بشكل ملحوظ دون تراجع كبير في الجودة.

الخطوة 2: اكتب أمرك النصي

يستجيب Imagen بشكل استثنائي للأوامر النصية الوصفية والمنظمة. يعالج النموذج معنى اللغة بعمق، لذلك لا تكتفِ بتسمية الأشياء. صف خصائصها وعلاقاتها وسياقها. فكّر في الأمر كأنك تُوجّه مصورًا، لا تُجري بحثًا في محرك بحث.

أمر نصي ضعيف: woman sitting outside

أمر نصي قوي: A woman with warm olive skin and dark curly hair sitting on a stone bench in a sunlit courtyard, afternoon light falling from the right, cobblestones and climbing roses behind her, 85mm portrait lens, shallow depth of field, Kodak Portra 400 film grain

عناصر الأوامر النصية التي يتعامل معها Imagen بشكل جيد بصفة خاصة:

  • أوصاف الإضاءة: "ضوء صباحي غائم وناعم"، "إضاءة حافة ذهبية في الساعة الذهبية من الخلف"، "إضاءة فلورسنت صناعية قاسية من الأعلى"
  • تفاصيل الكاميرا والعدسة: "عدسة بورتريه 85 ملم بفتحة f/1.4"، "زاوية عريضة 24 ملم مع تشوه طفيف"، "لقطة ماكرو مقرّبة بعمق ميدان ضحل"
  • ملمس المواد: "ألومنيوم مطفأ مصقول"، "خشب بلوط متآكل بحبيبات ظاهرة"، "حرير شارموز بلمعان خفيف"
  • العلاقات المكانية: "أمام"، "منعكس في النافذة خلفها"، "يلقي ظلًا طويلًا باتجاه اليسار"

الخطوة 3: اضبط المعاملات

في واجهة PicassoIA يمكنك التحكم في:

  • نسبة العرض إلى الارتفاع: 1:1 و16:9 و9:16 و4:3 وأكثر، بحسب مستوى النموذج
  • عدد المخرجات: توليد عدة اختلافات للأمر النصي نفسه في وقت واحد للمقارنة السريعة
  • قوة مرشح الأمان: قابلة للتعديل بحسب احتياجات المحتوى ومتطلبات المنصة

💡 نصيحة التكرار: ولّد 4 اختلافات دفعة واحدة، واختر التكوين الأقوى، ثم حسّن الأمر النصي لذلك التكوين بتعديلات محددة. يتسم Imagen باتساق عالٍ يجعل التعديلات الصغيرة على الأمر النصي تنتج تغييرات متوقعة ومضبوطة، لا تباينًا عشوائيًا كبيرًا بين المخرجات.

امرأة واثقة ترتدي سترة زرقاء داكنة مفصّلة، تقف أمام جدار عرض كبير لصور الذكاء الاصطناعي وذراعاها متقاطعتان

Imagen مقابل المنافسة

لا يوجد Imagen في فراغ. إليك كيف يقارن بالنماذج الثلاثة التي من المرجح أن تقارنه بها.

Flux مقابل Imagen

Flux Dev وFlux 1.1 Pro هما أقرب المنافسين في مجال الواقعية الفوتوغرافية. تتيح بنية مطابقة التدفق (flow matching) في Flux تفاصيل دقيقة استثنائية ومرونة أسلوبية عبر نطاق جمالي أوسع بكثير من Imagen.

Imagen 4 UltraFlux 1.1 Pro
الواقعية الفوتوغرافيةممتازةممتازة
النص داخل الصورالأفضل في فئتهجيد
تعقيد الأمر النصيعالٍ جدًاعالٍ
سرعة التوليدمتوسطةسريعة
نطاق الأساليبأضيقأوسع
دعم LoRAمحدودواسع

الخلاصة: يتفوق Flux في التنوع الأسلوبي والتخصيص والسرعة. ويتفوق Imagen في دقة الواقعية الفوتوغرافية وعرض النصوص داخل الصور.

Stable Diffusion مقابل Imagen

يمنحك Stable Diffusion 3.5 Large تحكمًا أكبر عبر الضبط الدقيق باستخدام LoRA وسير عمل ControlNet، لكنه يحتاج بصيغته الافتراضية إلى هندسة الأوامر بشكل أكبر بكثير للوصول إلى الجودة الفوتوغرافية نفسها التي ينتجها Imagen بأمر نصي باللغة الطبيعية ومُعدّ جيدًا.

يعني العمود الفقري اللغوي في Imagen أنك تقضي وقتًا أقل في تعلم "حيل الأوامر"، ووقتًا أكبر في وصف ما تريده ببساطة. وهذه ميزة حقيقية في الواقع العملي للفرق التي ليست متخصصة في الذكاء الاصطناعي.

GPT Image مقابل Imagen

GPT Image 1 هو أقوى منافس في اتباع التعليمات والتحرير الأصلي. يتعامل نموذج OpenAI بشكل جيد جدًا مع طلبات التحرير متعددة الجولات والتعليمات التركيبية المعقدة، ويجعل تكامله مع ChatGPT الوصول إليه عبر المحادثة أمرًا سهلًا.

المفاضلة: ينتج Imagen 4 Ultra مخرجات أكثر واقعية فوتوغرافيًا بتفاصيل أدق ودقة أعلى في الإضاءة، بينما يميل GPT Image 1 غالبًا نحو مظهر مصقول مُصيَّر قليلًا حتى مع أوامر الواقعية الفوتوغرافية. كلاهما ممتاز. ويعتمد الاختيار على ما إذا كنت تُحسّن لدقة التصوير الفوتوغرافي أو لمرونة التحرير عبر المحادثة.

لقطة مقرّبة جدًا لشاشة حاسوب تعرض واجهة أمر نصي لتحويل النص إلى صورة مع صورة واقعية مولّدة في اللوحة الجانبية

الاستخدامات الواقعية لنموذج Imagen

المواصفات التقنية أقل أهمية مما تفعله فعليًا بالنموذج. إليك أين يقدّم Imagen أفضل أداء في الممارسة.

التسويق والإعلان

مرئيات الحملات: يتيح عرض النص في Imagen 4 Ultra توليد نماذج بجودة اللوحات الإعلانية مع نصوص مقروءة داخل الصورة مباشرة، ما يلغي جولة إنتاج كاملة من سير العمل.

تصوير المنتجات: استبدل جلسات التصوير الاستوديوية المكلفة بصور منتجات يولّدها Imagen على خلفيات قابلة للتهيئة. وهو قوي بشكل خاص للإكسسوارات والملابس والسلع المعبأة ومنتجات الجمال حيث يهم التصيير الدقيق للمواد.

محتوى وسائل التواصل الاجتماعي: مع دعم نسبتي 9:16 و1:1، تولّد محتوى بأسلوب التصوير الفوتوغرافي على نطاق واسع لأي منصة. ويمكن للعلامات التجارية التي تعمل بتقويمات محتوى كثيفة أن تستخدم Imagen لملء المساحات المرئية التي كانت ستتطلب ميزانيات جلسات تصوير مستمرة.

المشاريع الإبداعية

لا تقتصر واقعية Imagen الفوتوغرافية على التفسيرات الحرفية. تنتج الأوامر النصية الوصفية القوية نتائج ممتازة في:

  • أغلفة الكتب بتكوينات مشهد فوتوغرافية
  • الرسوم التوضيحية التحريرية التي لا يمكن تمييزها عن الصور الفوتوغرافية الحقيقية عند طباعتها
  • فن المفاهيم عند وصفه بلغة الكاميرا والإضاءة الواقعية
  • رسم القصص المصورة مع تفاصيل مكانية وإضاءة متسقة على مستوى المشهد

تصوير المنتجات

يستخدم المعماريون ومصممو الداخل وفرق تطوير المنتجات Imagen 4 Ultra لتوليد تصيير فوتوغرافي واقعي للمساحات والأشياء دون خط إنتاج ثلاثي الأبعاد. ويؤدي وصف المواد والأبعاد وظروف الإضاءة بدقة إلى مخرجات تبدو كتصوير معماري احترافي في كثير من السيناريوهات، خاصة في العروض الأولية للعملاء أو سياقات لوحات الإلهام.

امرأة شقراء طبيعية تجلس في استوديو مشرق بسيط تحمل صورة فوتوغرافية مطبوعة وتلقي نظرة سريعة على حاسوبها المحمول المفتوح

مصطلحات تستحق المعرفة

وأنت تعمل مع Imagen، ستصادف هذه المصطلحات عبر الوثائق ونقاشات المجتمع:

  • التوجيه بلا مصنِّف (CFG): المعامل الذي يتحكم في مدى التزام النموذج بأمرك النصي. القيم الأعلى تعني تفسيرًا أكثر حرفية وتباينًا إبداعيًا أقل في المخرجات
  • خطوات الانتشار: عدد تكرارات إزالة الضوضاء لكل توليد. عادةً ما يعني عدد خطوات أكبر جودة أفضل لكن زمن توليد أبطأ
  • مشفّر T5: العمود الفقري للنموذج اللغوي الكبير الذي يستخدمه Imagen لتفسير أمرك النصي وتضمينه قبل تمريره إلى خط الانتشار
  • SynthID: العلامة المائية الرقمية غير المرئية من Google المضمّنة في كل مخرجات Imagen، ويمكن كشفها بأدوات Google دون تغيير الصورة المرئية
  • COCO FID: مسافة Fréchet Inception على مجموعة بيانات COCO، وهو الاختبار المعياري المعتمد لتقييم جودة الصورة وتنوعها عبر عائلات النماذج
  • الانتشار المتتالي (Cascaded diffusion): البنية متعددة المراحل التي يستخدمها Imagen، فيولّد بدقة منخفضة أولًا ثم يرفع الدقة تدريجيًا عبر نماذج متخصصة في كل مرحلة

داخل استوديو تقنية حديث واسع بعدة شاشات منحنية تعرض واجهات توليد صور بالذكاء الاصطناعي ومطوّر يعمل

ابدأ التوليد باستخدام Imagen اليوم

أصبحت تعرف الآن كيف يعمل Imagen، وما الذي يفصل Imagen 4 Ultra عن أسلافه، وأين يتفوق على Flux وStable Diffusion وGPT Image. وأفضل طريقة لاستيعاب كل ذلك هي توليد الصور بنفسك.

تمنحك PicassoIA وصولًا مباشرًا إلى مجموعة Imagen الكاملة، بما في ذلك Imagen 3 وImagen 4 وImagen 4 Ultra، دون الحاجة إلى أي حساب Google Cloud أو إعداد Vertex AI. افتح صفحة أي نموذج، واكتب أمرًا نصيًا وصفيًا، وشاهد ما يحدث حين يتعاون أحد أفضل النماذج اللغوية في العالم مع أحد أفضل مسارات الانتشار للصور في العالم.

ابدأ ببساطة، ثم حسّن من هناك. يستجيب النموذج للوضوح والتحديد: كلما وصفت ما تريده بدقة أكبر، اقتربت المخرجات مما في ذهنك.

جرّب Imagen 4 Ultra على PicassoIA وانظر إلى أي مدى يمكن أن يأخذك أمر نصي مكتوب جيدًا.

شارك هذا المقال

اختر لغتك

مقالات ذات صلة