ما الأخطاء التي يقع فيها المبتدئون في أدوات توليد الصور بالذكاء الاصطناعي (وكيف تصلحها بسرعة)

تحليل مباشر بلا حشو لأكثر الأخطاء شيوعًا التي يرتكبها المبتدئون عند استخدام أدوات توليد الصور بالذكاء الاصطناعي، من كتابة أوامر نصية غامضة إلى اختيار النموذج الخاطئ وتجاهل إعدادات الدقة. إذا بدت نتائجك غير صحيحة، فهذا هو السبب، وهذا ما يجب فعله بدلًا منه.

ما الأخطاء التي يقع فيها المبتدئون في أدوات توليد الصور بالذكاء الاصطناعي (وكيف تصلحها بسرعة)
Cristian Da Conceicao
مؤسس Picasso IA

يفتح معظم الناس أداة لتوليد الصور بالذكاء الاصطناعي، ويكتبون بضع كلمات، ويحصلون على نتيجة باهتة وعامة، فيحكمون بأن الأداة معطلة. لكنها ليست كذلك. لقد نفّذت الأداة التعليمات تمامًا كما وردت. المشكلة، في جميع الحالات تقريبًا، تكمن في ما تحتويه التعليمات، أو في ما تفتقر إليه.

هناك سبعة أخطاء محددة تفسّر الغالبية العظمى من نتائج توليد الصور بالذكاء الاصطناعي المخيبة للآمال. لا يتطلب أي منها خبرة تقنية لإصلاحه. وما إن تراها بوضوح، حتى تستطيع تصحيحها كلها في جلسة واحدة.

أوامرك النصية قصيرة جدًا

شخص يكتب أمرًا نصيًا قصيرًا على لوحة مفاتيح، مع ظهور مخرجات ذكاء اصطناعي غير واضحة على الشاشة في الخلفية

الأمر النصي مثل "امرأة جميلة في الغابة" ليس أمرًا نصيًا بالمعنى الحقيقي، بل هو موضوع عام. فالذكاء الاصطناعي لا يملك أي معلومات عن الإضاءة التي تريدها، أو زاوية الكاميرا المناسبة للصورة، أو الحالة المزاجية التي ينبغي أن تحملها، أو الأسلوب الفوتوغرافي الذي تبتغيه. لذلك يخمّن. ومتوسط كل امرأة في غابة ضمن بيانات تدريبه يكون دائمًا عامًا.

فخ الطول

دُرّبت نماذج تحويل النص إلى صورة على مليارات أزواج من الصور والتعليقات النصية. وعندما تكتب أمرًا نصيًا قصيرًا، فأنت تستمد من مركز توزيع شديد الازدحام. فتمتزج كل السمات النموذجية والمتوسطة وغير اللافتة لذلك المفهوم معًا. فتعكس النتيجة الوسيط، لا الاستثنائي.

ما الذي يتضمنه الأمر النصي الجيد فعلًا

يجيب الأمر النصي القوي عن ستة أسئلة على الأقل قبل أن يضطر النموذج إلى التخمين:

  • الشخص: من أو ما الذي يظهر في الصورة، وبأي تفاصيل محددة؟ تتحول عبارة "امرأة" إلى "امرأة عمرها 28 عامًا بشعر بني محمر ونمش، ترتدي قميصًا أبيض فضفاضًا من الكتان".
  • البيئة: ما الذي يقف خلف الشخص؟ ما الأسطح الظاهرة في الكادر؟ ما الوقت من اليوم؟
  • الإضاءة: ضوء شمس الصباح من الجهة اليسرى؟ ضوء منتشر وخافت من جهة الشمال؟ إضاءة دافئة للساعة الذهبية تأتي من الخلف لتحدد الحواف؟
  • زاوية الكاميرا والعدسة: زاوية منخفضة تنظر إلى الأعلى نحو الشخص؟ منظر جوي من الأعلى؟ ضغط عدسة بورتريه 85 مم بفتحة f/1.4 مع خلفية ضبابية ناعمة (bokeh)؟
  • المزاج والأجواء: كئيب وناعم؟ حيوي وحاد؟ حميمي ودافئ؟
  • الأسلوب ونوع الفيلم: تصوير فوتوغرافي واقعي بدقة RAW 8K، مع حبيبات فيلم Kodak Portra 400، وملمس طبيعي في كل التفاصيل.

الفرق بين أمر نصي من ست كلمات وآخر من ستين كلمة ليس مجرد إسهاب في الكلام. بل هو عدد القرارات التي تتخذها بوعي بدلًا من تركها للصدفة.

شاشتان متجاورتان في مساحة عمل إبداعية، تعرض على اليسار نتيجة ذكاء اصطناعي غامضة منخفضة الجودة، وعلى اليمين نتيجة واقعية عالية الجودة ومفصّلة

💡 نصيحة: قبل التوليد، اسأل نفسك: هل يستطيع عشرة مصورين مختلفين أن يفسّروا هذا الأمر النصي بعشر طرق مختلفة تمامًا؟ إن كانت الإجابة نعم، فأضف تفاصيل محددة حتى تقترب الإجابة من ثلاثة.

اختيار النموذج الخاطئ في كل مرة

يفترض معظم المبتدئين أن هناك "أداة توليد الصور بالذكاء الاصطناعي" واحدة يستخدمونها. في الواقع، تستضيف منصات توليد الصور بالذكاء الاصطناعي عشرات أو مئات النماذج المختلفة، وكل نموذج مُدرَّب على بيانات مختلفة ومضبوط لأنواع مختلفة من المخرجات.

ليست كل النماذج تفعل الشيء نفسه

تُدرَّب بعض النماذج بشكل أساسي على بيانات فوتوغرافية، فتنتج ألوان بشرة واقعية، وإضاءة طبيعية، وملامس مقنعة. وتُدرَّب نماذج أخرى على الرسم التوضيحي الفني، أو الأنمي، أو التصيير المعماري، أو تصوير المنتجات. وتتخصص قلة منها في البورتريهات أو الأزياء بشكل ضيق.

استخدام نموذج مُحسَّن لفن الأنمي لتوليد صورة شخصية مؤسسية واقعية ينتج صورة شخصية رديئة، ليس لأن النموذج فشل، بل لأنه صُمم لشيء مختلف تمامًا. لقد أدى النموذج عمله. أنت أعطيته العمل الخاطئ.

منظر علوي لمكتب مرتب مع ملاحظات أوامر نصية مطبوعة، وتعليقات بخط اليد، ونظارة قراءة، وقلم رصاص موضوع على الصفحة

كيف تطابق النموذج مع هدفك

الهدفنوع النموذج الذي يجب البحث عنه
بورتريهات واقعيةنموذج مضبوط للبورتريه أو الواقعية الفوتوغرافية
تصوير المنتجاتنموذج صور للاستوديو أو للاستخدام التجاري
الرسم التوضيحي الإبداعينموذج للفن أو الفن المفاهيمي
التصيير المعمارينموذج مدرَّب على العمارة
الأعمال المجردة أو الفنيةنموذج فني عام

لقطة مقرّبة لشاشة حاسوب تعرض جدول مقارنة لأسماء نماذج الذكاء الاصطناعي ومواصفاتها، مع انعكاس ناعم لنافذة يظهر على الشاشة

على PicassoIA، تضم مجموعة تحويل النص إلى صورة أكثر من 91 نموذجًا تغطي فئات واقعية وفنية ومتخصصة. إن قضاء 60 ثانية في قراءة وصف النموذج قبل التوليد يوفر ساعات من المخرجات الرديئة لاحقًا.

💡 نصيحة: تحقق من الصور النموذجية في صفحة كل نموذج قبل استخدامه. تُظهر لك هذه الصور ما يفعله النموذج في أفضل حالاته. إن لم تجد الأسلوب الذي تريده هناك، فالنموذج غالبًا غير مناسب لمشروعك.

دقة المخرجات لديك خاطئة دائمًا

رجل محبط يميل نحو شاشة حاسوبه في مكتب بسيط ومشرق، والشاشة تعرض خطأ في الدقة من أداة توليد صور بالذكاء الاصطناعي

هذا هو الخطأ الذي لا يدرك معظم المبتدئين أنه خطأ أصلًا. يولّدون صورة، ويحمّلونها، ويكبّرونها، فيرون فوضى مبكسلة أو مموّهة بنعومة. فيكون استنتاجهم أن صور الذكاء الاصطناعي ذات جودة منخفضة. وهذا الاستنتاج خاطئ. فإعدادات الدقة ببساطة تُركت على الوضع الافتراضي.

لماذا تبدو صورتك ضبابية

تولّد كثير من النماذج الصور افتراضيًا بدقة 512x512 أو 768x768 بكسل. وبهذا الحجم تبدو الصور مقبولة كصور مصغّرة أو على شاشة الهاتف. لكن بمجرد قصها أو طباعتها أو استخدامها بالحجم الكامل في تصميم، يصبح غياب الدقة الأصلية واضحًا فورًا.

هذا ليس عيبًا في توليد الصور بالذكاء الاصطناعي. إنه خيار إعداد يتركه المبتدئون دون تغيير في معظم الأحيان.

رفع الدقة بالطريقة الصحيحة

التوليد بدقة أعلى مسار واحد. أما تشغيل المخرجات عبر أداة رفع دقة مخصصة بالذكاء الاصطناعي فهو غالبًا المسار الأفضل، لأن أدوات رفع الدقة الحديثة لا تكتفي بمط البكسلات، بل تعيد بناء تفاصيل معقولة يُفترض منطقيًا أن تكون موجودة في الصورة.

يقدم PicassoIA عدة نماذج قوية لرفع الدقة:

  • Clarity Pro Upscaler: رفع دقة واقعي مع إعادة بناء قوية للبشرة والملامس. ممتاز للبورتريهات والوجوه.
  • Topaz Image Upscale: يكبّر الصور حتى 6 مرات مع الحفاظ على دقة ملامس حادة عبر الأسطح.
  • Real ESRGAN: أداة رفع دقة موثوقة بعامل 4 تتعامل مع مجموعة واسعة من أنواع الصور دون إدخال تشوهات واضحة.
  • P Image Upscale: نتائج حادة في أقل من ثانية، مفيدة عندما تكون السرعة هي الأولوية.
  • Google Upscaler: تكبير بعامل 4 دون ضغط مرئي أو تدهور في الجودة.
  • Crystal Upscaler: محسَّن تحديدًا لرفع دقة البورتريهات مع الحفاظ على لون بشرة طبيعي وتفاصيل الشعر.

سير العمل هو: ولّد الصورة بدقة مدعومة، ثم مرر الصورة عبر أداة رفع دقة لتصل إلى جودة الطباعة أو النشر. إن التعامل مع هاتين الخطوتين كمرحلتين منفصلتين يعطي نتائج أفضل باستمرار من محاولة حشر كل شيء في توليد واحد.

💡 نصيحة: بالنسبة إلى وسائل التواصل الاجتماعي، يكفي عادةً 1024x576 بدقة 72 dpi. أما للطباعة أو استخدام المنتجات، فارفع الدقة دائمًا بنموذج مخصص قبل التصدير.

قيم البذرة: ما لا يلمسه معظم المبتدئين أبدًا

شاشة حاسوب محمول تعرض شبكة من ست صور بورتريه مولّدة بالذكاء الاصطناعي من الأمر النصي نفسه، بأرقام قيم بذرة مختلفة

يعمل كل توليد صور بالذكاء الاصطناعي انطلاقًا من رقم عشوائي أساسي يُسمى قيمة البذرة. وتحدد هذه القيمة العشوائية المدمجة في الضوضاء الأولية التي يعمل عليها النموذج. فإذا غيّرت كلمة واحدة في الأمر النصي مع الإبقاء على القيمة نفسها، تحصل على تنويعة قريبة جدًا. وإذا استخدمت قيمة بذرة مختلفة تمامًا مع الأمر النصي نفسه تمامًا، تبدو الصورة مختلفة بالكامل.

نادرًا ما ينتبه المبتدئون إلى قيم البذرة. وهذا يسبب مشكلتين مختلفتين.

لا تستطيع استعادة أفضل نتائجك

عندما يخرج توليد جميل ولم تدوّن قيمة البذرة، فلن تستطيع استعادة الصورة نفسها بدقة. وستبدو الصورة التالية بالأمر النصي نفسه مختلفة. وستبدو التي بعدها مختلفة مرة أخرى. وبدون قيمة البذرة، تضيع الإعدادات التي أنتجت أفضل نتيجة لك إلى الأبد.

عندما تجد توليدًا يعجبك، فأول إجراء هو نسخ رقم قيمة البذرة. تعرض معظم منصات توليد الصور بالذكاء الاصطناعي هذا الرقم في تفاصيل التوليد أو في لوحة البيانات الوصفية للمخرجات مباشرة بعد ظهور الصورة.

لا تستطيع التكرار بأي دقة

يعني التكرار الذكي تغيير متغير واحد في كل مرة، حتى تعرف ما الذي أحدث الفرق. فإذا تغيّر أمرك النصي وفي الوقت نفسه تتغير قيمة البذرة عشوائيًا، فلن تستطيع أن تعزو أي تحسن إلى سبب بعينه. أما تثبيت قيمة البذرة فيتيح لك تعديل صياغة الأمر النصي، ووصف الإضاءة، ومعدِّلات الأسلوب، مع مقارنة مخرجات تشترك في البنية التكوينية الأساسية نفسها.

هدف التكراراستراتيجية البذرة
تحسين أمر نصي يعجبكثبّت البذرة، ونوّع الصياغة
إيجاد تكوين أفضلالأمر النصي نفسه، مع تغيير البذرة عشوائيًا 5 إلى 10 مرات
بناء سلسلة بصرية متسقةثبّت البذرة، ونوّع وصفًا واحدًا لكل صورة
استكشاف اتجاهات مختلفة تمامًابذرة عشوائية كاملة في كل توليد

نسبة العرض إلى الارتفاع التي لا يضبطها أحد بشكل صحيح

يدا امرأة تضبطان إعدادات نسبة العرض إلى الارتفاع على لوحة اللمس في حاسوب محمول، مع ضوء بعد ظهر دافئ يضيء مساحة العمل

تبدو صورة مربعة بنسبة 1:1 ممدودة لتملأ لافتة بنسبة 16:9 مشوهة فورًا. وتفقد صورة أفقية بنسبة 16:9 مقصوصة إلى 9:16 لقصة اجتماعية معظم محتواها. تبدو هذه النتائج واضحة بعد وقوعها، لكن المبتدئين يولّدون عادةً بالنسبة التي تحددها الأداة افتراضيًا، ثم يحاولون التكيف معها لاحقًا.

نسبة خاطئة، وتوليد ضائع

للسياقات المختلفة نسب قياسية موجودة لأسباب حقيقية. أما التوليد بالنسبة الخاطئة فيكلفك وقت الحوسبة، ويفرض عليك قصًا غير مناسب يستلزم دائمًا خسارة شيء ما:

  • منشورات خلاصة وسائل التواصل الاجتماعي: 1:1 أو 4:5
  • القصص والمحتوى العمودي: 9:16
  • ترويسات المدونات ولافتات المقالات: 16:9
  • تصوير المناظر الطبيعية وخلفيات الشاشة: 16:9 أو 3:2
  • الصور المصغرة للمنتجات والصور الرمزية المربعة: 1:1
  • أعمال البورتريه المطبوعة: 4:5 أو 2:3

اضبط النسبة قبل التوليد، استنادًا إلى المكان الذي ستظهر فيه الصورة فعلًا. أما تحديدها لاحقًا فيعني قص تفاصيل سبق توليدها ودفعت ثمنها من وقت الحوسبة.

💡 نصيحة: عندما لا تكون متأكدًا من المكان الذي ستظهر فيه الصورة، فولّدها بنسبة 16:9. فهي تمنحك أكبر مرونة للقص إلى أي نسبة أخرى دون فقدان الموضوع الرئيسي.

الأوامر النصية السلبية: الحقل الذي لا يملؤه أحد

يوجد حقل الأمر النصي السلبي في الواجهة. لا يلمسه معظم المبتدئين أبدًا. وهذه فرصة ضائعة مهمة، وتنعكس على المخرجات.

تخبر الأوامر النصية السلبية النموذج صراحةً بما لا يجب تضمينه. ومن دونها، يُدرج النموذج كل ما يعتبره نمطيًا لمفهومك، وغالبًا ما يعني ذلك خلفيات ضبابية حين تريدها حادة، وأيادٍ مشوهة تشريحيًا ناتجة عن ضوضاء إحصائية في بيانات التدريب، وعلامات مائية غير مرغوبة، وبشرة مسطحة أو تبدو اصطناعية، وعناصر أسلوبية لم تطلبها أبدًا.

ما الذي ينبغي أن يتضمنه الأمر النصي السلبي

يبدو أمر نصي سلبي عملي لبورتريهات واقعية على النحو التالي:

ضبابي، خارج التركيز، مشوه، مشوّه الشكل، أصابع إضافية، تشريح سيئ، علامة مائية، تراكب نص، شعار، تعريض زائد، تعريض ناقص، كرتوني، تصيير ثلاثي الأبعاد، رسم توضيحي، مرسوم بالألوان، نيون، تشبع زائد، ضوضاء، حبيبات، جودة منخفضة، مكرر، مقصوص

لا تحتاج إلى قائمة من 200 كلمة. فمجموعة مركزة من 15 إلى 20 عنصرًا خاصًا بنوع مخرجاتك ستحسّن معظم التوليدات بشكل ملحوظ. أنشئ أمرًا نصيًا سلبيًا افتراضيًا لكل نوع من أعمالك المنتظمة وأعد استخدامه. أما البدء من الصفر في كل جلسة فيهدر الميزة.

الأوامر النصية السلبية مفيدة أيضًا لتجنب تلوث الأسلوب. فإذا كنت تولّد صورًا واقعية ولا تريد أي ليونة توضيحية تتسلل إليها، فإن إضافة "رسم توضيحي، مرسوم بالألوان، فن رقمي، حواف ناعمة، بشرة ملساء" إلى أمرك النصي السلبي يدفع النموذج بقوة نحو التصوير الفوتوغرافي.

توقّع أن تكون المحاولة الأولى هي الأخيرة

شابة تجلس إلى مكتب منزلها تنظر إلى حاسوبها المحمول بتعبير راضٍ، مع ضوء الساعة الذهبية الدافئ يتدفق عبر النافذة خلفها

هذا خطأ في سير العمل أكثر منه خطأ تقنيًا، ويؤثر تأثيرًا مباشرًا في جودة المخرجات. يولّد المبتدئون صورة واحدة، ويجدونها غير متقنة، فيستنتجون إما أنهم لا يعرفون ما يفعلون، أو أن الأداة لا تعمل. ولا يؤدي أي من الاستنتاجين إلى نتيجة مفيدة.

التكرار هو العملية الفعلية

يُجري منشئو الصور المحترفون بالذكاء الاصطناعي عادةً ما بين 10 و50 توليدًا قبل الاستقرار على نتيجة نهائية. يُظهر لك التوليد الأول ما فهمه النموذج من أمرك النصي. ويصحح الثاني الثغرات. ويحسّن الثالث الإضاءة. وبحلول التكرار الخامس أو السادس، عادةً ما يظهر شيء مقنع.

إن معرفة ما الذي يجب تغييره بين التكرارات هي ما يفصل التكرار المنتج عن النقر العشوائي:

  • الشخص يبدو خاطئًا: وصف الشخص لديك غامض أو عام أكثر من اللازم
  • التكوين يبدو غير مناسب: أضف مواصفات صريحة لزاوية الكاميرا والعدسة
  • الإضاءة مسطحة: صِف مصدر الضوء واتجاهه وجودته بالكلمات
  • الأسلوب خاطئ: ربما تستخدم النموذج الخاطئ لهذا النوع من المخرجات
  • المخرجات ضبابية: اضبط إعدادات الدقة، أو مرر النتيجة عبر Clarity Pro Upscaler أو Real ESRGAN

النموذج لا يفشل. بل يُظهر لك المعلومات التي كانت مفقودة من الأمر النصي.

كيف يتصل كل هذا ببعضه

منظر علوي لمساحة عمل مرتبة تحتوي على قائمة تحقق مطبوعة على لوحة فلين محاطة بصور مرجعية صغيرة وملاحظات لاصقة تحت ضوء متوهج دافئ

يعود كل خطأ مذكور أعلاه إلى السبب الجذري نفسه: التعامل مع أدوات توليد الصور بالذكاء الاصطناعي كما لو كانت محرك بحث، لا كشريك إبداعي. تكتب كلمة مفتاحية وتتوقع نتيجة منتقاة. وهذا التصور الذهني ينتج باستمرار مخرجات متوسطة.

تستجيب هذه الأنظمة للتحديد. وتكافئ الدقة. ومخرجاتك تتحدد تقريبًا بالكامل بجودة مدخلاتك، وهو وضع أكثر قابلية للتحكم مما يدركه معظم المبتدئين بمجرد أن يروه بوضوح.

إليك قائمة تحقق لتنفيذها قبل كل جلسة توليد:

  • هل يتجاوز أمري النصي 40 كلمة مع تفاصيل محددة عن الموضوع والبيئة والإضاءة؟
  • هل اخترت نموذجًا يطابق نوع المخرجات والأسلوب الذي أقصده؟
  • هل ضبطت الدقة بشكل صحيح، أم خططت لتشغيل أداة رفع الدقة لاحقًا؟
  • هل دوّنت قيمة البذرة من توليد أريد البناء عليه، أو ثبّتها؟
  • هل ضُبطت نسبة العرض إلى الارتفاع وفق المكان الذي ستُستخدم فيه الصورة فعلًا؟
  • هل أضفت أمرًا نصيًا سلبيًا يضم 10 إلى 15 عنصرًا على الأقل لاستبعادها؟
  • هل أنا مستعد للتكرار 5 إلى 10 مرات على الأقل قبل تحديد نتيجة نهائية؟

يستغرق تنفيذ هذه القائمة قبل كل جلسة نحو 90 ثانية. والتحسن في جودة المخرجات ليس هامشيًا. إنه الفرق بين مخرجات لن تشاركها أبدًا، وأخرى ستستخدمها فعلًا.

ابدأ التوليد على PicassoIA

أسرع طريقة لاستيعاب كل ما سبق هي تنفيذ توليد واحد بالطريقة القديمة، ثم تشغيل المفهوم نفسه فورًا بأمر نصي مفصّل مناسب، والنموذج الصحيح، وإعدادات دقة سليمة، وأمر نصي سلبي مكتمل. والفرق بين المخرجين فوري، ومدهش حقًا لمعظم المبتدئين.

يمنحك PicassoIA الوصول إلى أكثر من 91 نموذجًا لتحويل النص إلى صورة، وأدوات مخصصة لرفع الدقة تشمل Clarity Pro Upscaler، وReal ESRGAN، وTopaz Image Upscale، وCrystal Upscaler، وإزالة الخلفية عبر Remove Background، ومجموعة كاملة من أدوات إنشاء الصور والفيديو، كل ذلك في منصة واحدة.

ابدأ بصورة واحدة تهمك. طبّق ما ورد أعلاه. ستوضح لك النتائج فورًا ما إذا كان أي من هذا يستحق الأخذ بعين الاعتبار.

تصفح كل النماذج المتاحة على picassoia.com/en/all-models واعثر على نقطة البداية المناسبة لمشروعك القادم.

شارك هذا المقال

اختر لغتك

مقالات ذات صلة