ما الجديد في توليد الصور بالذكاء الاصطناعي: إلى أين تتجه التقنية

يتقدّم توليد الصور بالذكاء الاصطناعي بسرعة أكبر مما يدركه معظم الناس. يحلّل هذا المقال التحولات الحقيقية في جودة النماذج وسرعتها وثباتها والتحكم الإبداعي فيها، وهي التحولات التي تعيد تشكيل طريقة عمل المحترفين وصنّاع المحتوى مع المرئيات الناتجة عن الذكاء الاصطناعي في 2027 وما بعدها.

ما الجديد في توليد الصور بالذكاء الاصطناعي: إلى أين تتجه التقنية
Cristian Da Conceicao
مؤسس Picasso IA

يضيق الفارق بين الصورة الفوتوغرافية والصورة المولّدة بالذكاء الاصطناعي بوتيرة لم يتوقعها معظم الناس. قبل عامين، كانت الأيدي ذات الأصابع الستة والعيون المتجهة في اتجاهات خاطئة قليلًا أبرز العلامات الدالة. أما اليوم، فتنتج النماذج الرائدة صورًا تصمد أمام الفحص الدقيق، بدقة كاملة، وفي مشاهد معقدة تضم أشخاصًا متعددين. لم يحدث هذا التحول لأن الذكاء الاصطناعي أصبح "أذكى" بمعنى غامض، بل لأن تغييرات محددة وقابلة للقياس طرأت على البنية وبيانات التدريب وسرعة التشغيل. ومعرفة تلك التغييرات تكشف بدقة إلى أين يتجه توليد الصور بعد ذلك.

ثورة الدقة حدثت بالفعل

استوديو لتوليد الصور بالذكاء الاصطناعي تعرض فيه شاشات متعددة مشاهد واقعية كالصور الفوتوغرافية

عندما ظهرت نماذج الانتشار للعامة لأول مرة، كان توليد صورة نظيفة بحجم 512x512 هو المعيار. أما أي حجم أكبر فكان يتطلب حيلًا أو تقسيمًا إلى بلاطات أو رفعًا كبيرًا للدقة يُدخل بدوره تشوهات خاصة به. وقد تجاوز هذا السقف منذ ذلك الحين بدرجة كبيرة.

كيف أصبحت النماذج أكثر حدّة بهذه السرعة

جاءت القفزة في جودة المخرجات من ثلاثة أمور تحدث في الوقت نفسه: مجموعات تدريب أكبر تضم عينات منتقاة عالية الدقة، وتحسينات معمارية تحافظ على التفاصيل المكانية خلال عملية إزالة الضوضاء، ومجدوِلات أفضل قادرة على إنتاج نتائج نظيفة بعدد أقل من الخطوات. ونتيجة لذلك، أصبح إخراج بدقة ميغابكسل واحد هو التوقع الأساسي، لا إنجازًا يُذكر.

تعمل نماذج مثل Flux Dev بمعاملات يبلغ عددها 12 مليار، وتتعامل مع توليد بدقة ميغابكسل واحد بوصفه مخرجها الافتراضي. ولا يكمن معنى ذلك في عدد البكسلات وحده، بل في أن التفاصيل الدقيقة، وملمس الأقمشة، وخصلات الشعر المفردة، وتدرجات الإضاءة الناعمة، تبقى سليمة طوال عملية التوليد.

ماذا تعني الحدّة الفعلية للمبدعين

الحدّة عند التوليد تعني تقليل المعالجة اللاحقة. فعندما تكون الصورة المولّدة بالذكاء الاصطناعي نظيفة بما يكفي لاستخدامها مباشرة، ينكمش سير العمل من ثلاث أو أربع خطوات (التوليد، ثم رفع الدقة، ثم التنقيح، ثم التصدير) إلى خطوة واحدة. وهذا الاختصار في الجهد هو ما تهتم به الفرق المحترفة فعلًا عند تقييم هذه الأدوات.

💡 نصيحة: عند توليد صور للاستخدام التجاري، صدّرها دائمًا بأقصى دقة، وتجنّب إغراء تصغيرها أثناء كتابة الأمر النصي. الفرق في الجودة كبير.

صورة مقرّبة ليدي مصمم على لوح رسم تعرض منظرًا طبيعيًا مولّدًا بالذكاء الاصطناعي

سرعة دون التضحية بالجودة

حتى وقت قريب، كانت الجودة والسرعة في توليد الصور بالذكاء الاصطناعي في تعارض مباشر. فالصور الأفضل كانت تستغرق وقتًا أطول، والتوليد الأسرع كان يعني مخرجات أخشن. وقد تلاشت هذه المفاضلة إلى حد كبير.

لماذا غيّرت النماذج ذات الأربع خطوات كل شيء

كانت نماذج الانتشار التقليدية تحتاج إلى 50 خطوة أو أكثر من إزالة الضوضاء لإنتاج صورة نظيفة. وكانت كل خطوة تضيف إلى زمن التوليد. أما تطوير النماذج المقطّرة (distilled)، التي دُرّبت على محاكاة مخرجات نظيراتها الأثقل بجزء بسيط من الخطوات، فقد أنهى هذه المفاضلة كليًا.

يُنشئ Flux Schnell صورة بدقة 1 ميغابكسل في أربع خطوات لإزالة الضوضاء، ويكتمل ذلك في أقل من خمس ثوانٍ. بالنسبة إلى سير العمل الذي يتضمن عشرات تكرارات الأوامر النصية، فإن الفرق بين توليد يستغرق خمس ثوانٍ وآخر يستغرق 30 ثانية ليس شكليًا. إنه يغيّر طريقة عمل الناس فعليًا، إذ يتيح تكرارًا بصريًا سريعًا كان غير عملي من قبل.

النموذجالخطواتالسرعةالاستخدام الأمثل
Flux Schnell4أقل من 5 ثوانٍالتكرار السريع، صياغة الأفكار الأولية
Flux Dev28-5015-30 ثانيةمخرجات عالية الإخلاص، العمل على التفاصيل
Flux 1.1 Proمحسّنثوانٍالأوامر النصية الدقيقة، مخرجات متنوعة
Stable Diffusion50متغيرةالتحكم المخصص، ضبط المجدوِل

التوليد الفوري أصبح عمليًا الآن

أطلقت قفزة التقطير ذات الأربع خطوات سباقًا نحو التوليد الفوري. وقد أظهرت عدة مجموعات بحثية توليدًا بمعدلات إطارات تفاعلية في ظروف مضبوطة. ورغم أن ذلك غير متاح بعد في الأدوات الاستهلاكية العادية، فإن المسار واضح. فالنماذج التي تولّد الصور اليوم في ثوانٍ ستولّدها خلال فترة قصيرة في أجزاء من الألف من الثانية.

بالنسبة إلى محترفي المحتوى، يكون هذا التحول أهم ما يكون في سير العمل التكراري، حيث يعني رؤية النتائج فورًا البقاء في حالة التدفق الإبداعي بدلًا من تبديل السياق أثناء انتظار التصيير.

محترفة شابة تراجع مقارنات لصور شخصية على شاشة كبيرة

أكبر 3 تحولات قادمة لتحويل النص إلى صورة

تحسينات الدقة والسرعة موجودة بالفعل. أما الموجة التالية من التغييرات المهمة فتركّز على ثلاث مشكلات محددة ما زالت أفضل النماذج الحالية تعاني منها.

الثبات عبر الصور المتعددة

اطلب من أي نموذج توليد الشخصية نفسها في وضعيتين مختلفتين، وستحصل على صورتين تبدوان كأنهما لشخصين مختلفين. هذه هي مشكلة الثبات، وما زالت من أكثر التحديات التي يُعمل عليها بنشاط في هذا المجال.

تتقارب عدة مناهج نحو حل لها. فمدخلات الصور المرجعية، والتحكم في الوضعية على طراز ControlNet، وطرق المحوّلات مثل LoRA، تتيح للنماذج تثبيت مظهر الشخصية عبر التوليدات المختلفة. وهذه الحلول ليست مثالية، لكنها أفضل بكثير مما كان ممكنًا قبل 18 شهرًا. والنماذج التي تصل الآن تدعم هذه الضوابط بشكل متزايد بصورة أصيلة.

💡 نصيحة: عندما تحتاج إلى شخصيات ثابتة عبر مشروع كامل، استخدم تثبيت البذرة مع صورة مرجعية بوصفها مصدر الحقيقة. يدعم Flux Dev وضع img2img والبذور الثابتة معًا، ما يجعله مناسبًا لهذا النوع من العمل التكراري.

التشريح الدقيق والتحكم المكاني

تبقى الأيدي والأقدام وترتيبات الفضاء المعقدة أكثر أنماط الفشل وضوحًا في توليد الصور بالذكاء الاصطناعي. والسبب بنيوي: تتعلم نماذج الانتشار أنماطًا إحصائية من بيانات التدريب، بدلًا من فهم التشريح بالطريقة التي يفهمها بها الرسام المدرَّب.

يُعد التحكم في الوضعية على طراز ControlNet الوسيلة الرئيسية للتخفيف من هذه المشكلة. فبتقديم هيكل عظمي أو خريطة عمق بوصفها مرساة بنيوية، تقيّد القرارات التكوينية للنموذج بتخطيط مكاني محدد. وجودة المخرجات مع تفعيل التحكم في الوضعية أفضل بدرجة ملحوظة مما هي عليه مع الأوامر النصية وحدها.

يُدرَّب الجيل القادم من النماذج على بيانات مكانية أكثر تنظيمًا، وهذا يُفترض أن يقلل من تكرار هذه الأخطاء على مستوى النموذج الأساسي، دون الحاجة إلى مدخلات وضعية لكل توليد.

منظر جوي من الأعلى لصور مطبوعة مولّدة بالذكاء الاصطناعي مرتبة على مكتب خشبي

عرض النص بدقة داخل الصور

ظل النص المقروء داخل الصور المولّدة من أوضح علامات مخرجات الذكاء الاصطناعي تاريخيًا. فمعظم النماذج تُفسد الحروف، أو تخترع رموزًا، أو تنتج كلمات تبدو معقولة لكنها غير مقروءة.

صُمّم Ideogram v2 تحديدًا لمعالجة هذه المشكلة. فهو يعرض نصًا مقروءًا داخل الصور، بما في ذلك اللافتات والملصقات والعناوين الرئيسية، عبر تدريبه على مجموعات بيانات تقرن صراحةً النص داخل الصور بحقيقة أرضية دقيقة. والنتيجة نموذج قادر على إنتاج ملصق بعنوان مقروء أو واجهة متجر بالكلمات الصحيحة، دون خطوة منفصلة لوضع النص فوق الصورة.

تصبح هذه القدرة شائعة بشكل متزايد عبر النماذج، إذ أصبحت المناهج التدريبية والمعمارية التي مكّنتها مفهومة جيدًا ويجري اعتمادها على نطاق أوسع.

كيف يستخدم المحترفون هذه الأدوات اليوم

طباعة واقعية كبيرة الحجم مولّدة بالذكاء الاصطناعي معلّقة على جدار معرض مع إضاءة كاشفة دراماتيكية

أكثر الطرق إفادة لمعرفة الاتجاه الذي يسير فيه توليد الصور بالذكاء الاصطناعي هي النظر إلى الأماكن التي تستخدمه فيها الفرق المحترفة بجدية، لا بصورة تجريبية.

سير عمل تصوير المنتجات

كانت فرق التجارة الإلكترونية من أوائل المتبنين. وحالة الاستخدام بسيطة: تصوير المنتج على خلفية نظيفة، ثم استخدام الذكاء الاصطناعي لوضعه في أي إعداد أو موسم أو بيئة دون جلسة تصوير في استوديو. وما تغيّر مؤخرًا هو أن جودة هذه التركيبات أصبحت عالية بما يكفي لتجتاز المراجعة البصرية على نطاق واسع.

تتيح أدوات التعديل الموضعي للفرق استبدال الخلفيات، وإصلاح عدم اتساق الإضاءة، وإزالة الأشياء من لقطات المنتجات الحالية. أما توسيع الصورة فيمدّد صورة مركّبة خارج إطارها الأصلي لتناسب نسب العرض إلى الارتفاع المختلفة للمنصات. وهذه ليست قدرات نظرية موجودة في ورقة بحثية، بل هي قيد الاستخدام الإنتاجي الفعلي لدى علامات تجزئة كبرى.

إنشاء أصول العلامات التجارية والتسويق

تستخدم فرق وسائل التواصل الاجتماعي توليد الصور بالذكاء الاصطناعي لإنتاج أصول خاصة بكل منصة بحجم كان مستحيلًا من قبل دون أقسام إبداعية كبيرة. يمكن أن يتفرع وصف واحد لمنتج إلى اثني عشر اتجاهًا بصريًا مختلفًا في الوقت الذي يستغرقه إعداد موجز لمصوّر.

تحوّلت نقطة الاختناق من إنتاج الصور إلى اختيارها. فالفرق تولّد خمسين خيارًا وتنتقي خمسة. وصار الحكم التحريري للمدير الإبداعي أهم الآن لا أقل، لأن القيد الإنتاجي الخام قد أُزيل.

محترفان مبدعان يراجعان صورًا شخصية مولّدة بالذكاء الاصطناعي على لوح لوحي حول طاولة خشبية

نماذج تستحق المتابعة الآن

اختيار النموذج قرار عملي، لا فلسفي. فلكل نموذج نقاط قوة محددة، ومطابقة هذه النقاط مع المهمة تنتج نتائج أفضل من اختيار نموذج واحد لكل شيء.

Flux Dev: العمل على التفاصيل بحجم كبير

Flux Dev نموذج يضم 12 مليار معامل، وهو مصمم لمخرجات عالية الإخلاص. يدعم سير عمل تحويل النص إلى صورة وimg2img معًا، ويتعامل مع 11 نسبة عرض إلى ارتفاع، ويسمح بالتكرار مع تثبيت البذرة للحصول على نتائج ثابتة. وعندما تتطلب المهمة أقصى قدر من التفاصيل ويسمح الوقت بتوليدات تستغرق 15 إلى 30 ثانية، فهذا هو النموذج الذي ينبغي اللجوء إليه.

يتيح لك معامل التوجيه فيه الانتقال بين الالتزام الحرفي بالأمر النصي وقدر أكبر من الحرية التكوينية. فضبطه على قيمة أعلى ينتج تفسيرات أكثر حرفية للأوامر المعقدة. أما القيم الأدنى فتنتج نتائج أكثر إثارة بصريًا لكنها أقل تحكمًا.

Flux Schnell: عندما تكون السرعة هي القيد

ينتج Flux Schnell صورًا نظيفة بدقة ميغابكسل واحد في أقل من خمس ثوانٍ، عبر أربع خطوات لإزالة الضوضاء. وعلى PicassoIA يعمل دون حدود للنقاط أو قيود على التوليد، ما يعني أنه يمكنك تشغيل 50 نسخة مختلفة في جلسة واحدة دون تتبع الاستخدام.

بالنسبة إلى صياغة الأفكار، والألواح المزاجية السريعة الموجهة للعملاء، أو أي سير عمل يتطلب حجم تكرار عاليًا، يُعد Schnell الخيار العملي. والجودة تصمد جيدًا لمعظم الاستخدامات التجارية، مع أن المفاضلة الأساسية هي تفاصيل أقل دقة قليلًا مقارنة بنموذج Flux Dev عند أقصى إعداداته.

Flux 1.1 Pro: الالتزام الدقيق بالأوامر النصية

يقرأ Flux 1.1 Pro الأوامر النصية بعناية، ويعكس التفاصيل التكوينية المحددة، وأوصاف الإضاءة، وعناصر الشخص بدقة عالية. ويتيح لك إدخال الصورة الموجِّهة توجيه التكوين باستخدام صورة مرجعية إلى جانب النص، وهذا مفيد عندما يكون لديك اتجاه بصري محدد تريد مطابقته.

تضيف ميزة توسيع الأمر النصي الاختيارية تنوعًا إبداعيًا عندما تريد نتائج تتجاوز صياغتك الأولية. وهي تناسب سير العمل الإنتاجي المحترف أكثر، حيث تكون السيطرة على الأمر النصي وإمكانية التنبؤ بالمخرجات أهم من السرعة الخام.

Ideogram v2: عندما تحتاج صورتك إلى كلمات

يحل Ideogram v2 مشكلة عرض النص. فالملصقات واللافتات والإعلانات الموسومة بعلامة تجارية التي تتضمن نصًا مقروءًا لم تعد تحتاج إلى مرحلة تحرير منفصلة. يقبل النموذج أمرًا نصيًا بسيطًا، بما في ذلك الكلمات الدقيقة التي تريد عرضها، ويعرضها بوضوح في المشهد.

قدرته على التعديل الموضعي دقيقة. ارفع صورة مع قناع بالأبيض والأسود، وسيملأ النموذج المنطقة المقنّعة فقط مع ترك كل شيء آخر سليمًا. وتتيح لك إعدادات الأنماط المسبقة، ومنها Realistic وAnime وRender 3D، التحكم في النبرة البصرية دون إعادة كتابة الأمر النصي في كل مرة.

Stable Diffusion: أقصى تحكم في المعاملات

يظل Stable Diffusion الخيار الأكثر قابلية للتحكم لدى المستخدمين الذين يريدون ضبط كل جانب من عملية التوليد. فستة خيارات للمجدوِل، ودعم الأمر النصي السلبي، ومقياس توجيه قابل للتعديل، تمنحك أدوات تحكم لا تتيحها النماذج الأكثر تقييدًا.

بالنسبة إلى المستخدمين الذين بنوا سير عملهم حول سلوكيات مجدوِل محددة، أو الذين يجرون تجارب منظمة على الأوامر النصية بظروف قابلة للتكرار، فإن سطح التحكم الصريح في Stable Diffusion ميزة حقيقية.

لقطة ماكرو مقرّبة لشاشة حاسوب تعرض صورة شخصية بالذكاء الاصطناعي على مستوى البكسل مع ملمس زجاج الشاشة

كيفية استخدام Flux Dev على PicassoIA

بما أن Flux Dev من أعلى النماذج أداءً على PicassoIA، إليك شرحًا مباشرًا لكيفية الحصول على أفضل النتائج منه.

إعداد الأمر النصي خطوة بخطوة

الخطوة 1. افتح Flux Dev على PicassoIA في متصفحك. لا يلزم إعداد حساب أو تثبيت برنامج.

الخطوة 2. اكتب أمرك النصي في حقل النص. كن محددًا بشأن الشخص واتجاه الإضاءة وزاوية الكاميرا والبيئة. الأوامر الغامضة تنتج نتائج غامضة. فالأمر "امرأة في حديقة" ينتج مخرجات أضعف بكثير من "a woman in her 30s walking through a sun-dappled maple forest in early October, dappled light through the canopy, 85mm lens, shallow depth of field".

الخطوة 3. اضبط نسبة العرض إلى الارتفاع. يدعم Flux Dev 11 خيارًا منها 16:9 للّافتات الأفقية، و9:16 لقصص وسائل التواصل، و4:5 لمنشورات البورتريه على وسائل التواصل. طابق النسبة مع منصتك قبل التوليد، لا بعده.

الخطوة 4. اختر وضعك. يشغّل Go Fast نسخة مكمّمة بصيغة fp8 من النموذج للحصول على مخرجات أسرع. عطّله عندما تكون أقصى درجات الإخلاص مطلوبة.

الخطوة 5. اضبط خطوات التشغيل بين 28 و50. تنتج خطوات أكثر صورًا أكثر حدّة على حساب زمن التوليد. وفي معظم الاستخدامات، تنتج 28 خطوة نتائج ممتازة.

الخطوة 6. إذا أردت نتائج قابلة للتكرار، فاضبط بذرة ثابتة. وهذا يتيح لك تعديل صياغة الأمر النصي مع الحفاظ على نقطة البداية التكوينية ثابتة.

نسبة العرض إلى الارتفاع وإعدادات التصدير

المنصةالنسبة الموصى بهاالصيغة
ترويسة المدونة16:9JPG أو WebP
منشور Instagram4:5WebP
ترويسة Twitter/X3:1JPG
قصة أو ريل9:16WebP
مربع المنتج1:1PNG

💡 نصيحة: للنماذج الأولية للمنتجات والصور التي تحتاج إلى حواف نظيفة، صدّرها بصيغة PNG. أما بقية الصور فتعطي صيغة WebP بجودة 80 أفضل توازن بين حجم الملف ووضوح الصورة.

مكتب منزلي مضاء بأشعة الشمس مع حاسوب محمول مفتوح تظهر على شاشته واجهة توليد صور بالذكاء الاصطناعي

ابدأ التوليد على PicassoIA الآن

جودة توليد النموذج والمنصة التي تشغّله أمران منفصلان. فحتى أفضل نموذج ينتج نتائج أسوأ عندما تقيّده المنصة، أو تضيف ضغطًا عند التصدير، أو تغلّفه بواجهة مربكة.

يشغّل PicassoIA Flux Dev وFlux Schnell وFlux 1.1 Pro وIdeogram v2 وStable Diffusion، إضافة إلى أكثر من 90 نموذجًا آخر لتحويل النص إلى صورة، دون حدود للنقاط أو علامات مائية. تولّد الصورة، وتنزّل ملفًا نظيفًا، وتستخدمه. لا يوجد تتبع لتكلفة كل صورة، ولا مستوى اشتراك يحجب نماذج بعينها، ولا علامات مائية على الصادرات.

تدعم المنصة أيضًا رفع الدقة بالدقة الفائقة، وإزالة الخلفية، وتبديل الوجوه، والتعديل الموضعي، وتوسيع الصورة، وتوليد الفيديو، بحيث يبقى سير العمل من الصورة الأولية إلى الأصل النهائي في مكان واحد. ومع تحسن نماذج توليد الصور بالذكاء الاصطناعي باستمرار، يضيف PicassoIA هذه النماذج مباشرة. وتعكس التشكيلة المتاحة اليوم على picassoia.com/en/all-models أحدث ما وصل إليه المجال، لا لقطة عمرها ستة أشهر.

عين مصوّر تنظر عبر منظار كاميرا عتيقة مع تفاصيل حادة للحدقة وهيكل الكاميرا

أفضل وقت لتعتاد هذه الأدوات هو الآن، قبل أن تصبح مهارة احترافية أساسية. اختر نموذجًا واحدًا، ووَلِّد مئة صورة، وانتبه إلى المواضع التي يفاجئك فيها. بهذه الطريقة تبني حدسك حول ما تستطيعه هذه الأدوات، وتُهيّئ نفسك لاستخدام الجيل التالي من النماذج عندما يصل.

شارك هذا المقال

اختر لغتك

مقالات ذات صلة