ربما رأيت ذلك من قبل: رسم رصاص خشن ومتعرج يُرفع في مكان ما، وبعد ثوانٍ يظهر على الشاشة لوحة زيتية مكتملة التفاصيل. يبدو الأمر سحرًا، لكنه ليس كذلك. العملية وراء ذلك من أكثر تطبيقات التعلم العميق الحديث إثارةً للاهتمام، وبمجرد أن تفهم طريقة عملها، لن تنظر إلى فن الذكاء الاصطناعي بالطريقة نفسها مرة أخرى.
يستعرض هذا المقال الآليات الفعلية، والنماذج التي تقوم بالعمل، وكيف يمكنك استخدامها اليوم.
ماذا يفعل الذكاء الاصطناعي برسمك؟
إنه لا "يلوّن" رسمك
أول ما ينبغي توضيحه: الذكاء الاصطناعي لا يملأ فراغات رسمك باللون ببساطة، كما يحدث في كتاب التلوين. الأمر أعقد بكثير. عندما تُدخل رسمًا بالرصاص إلى نموذج ذكاء اصطناعي، يحلل النظام المعلومات البنيوية المشفّرة في تلك الخطوط: الحواف والخطوط الخارجية والأشكال والعلاقات المكانية.
تمرّ هذه البيانات البنيوية عبر شبكة عصبية دُرّبت على ملايين الصور. لقد استوعب النموذج من تلك الأمثلة كيف يبدو الوجه أو الشجرة أو اليد أو المبنى بتفاصيل كاملة، سواء كانت فوتوغرافية أو تصويرية. رسمك هو في جوهره أمر نصي، أي مجموعة تعليمات تقول: "هذه هي الأشكال. الآن املأها بالواقع."
النتيجة تركيب وليست نسخة. يبتكر الذكاء الاصطناعي الملمس والإضاءة والظلال والألوان، مع احترام الهيكل الهندسي الذي قدّمته.
دور نماذج الانتشار
التقنية السائدة وراء الذكاء الاصطناعي الذي يحوّل الرسم إلى لوحة هي نماذج الانتشار. إليك النسخة المبسطة من طريقة عملها:
- أثناء التدريب، يُعلَّم النموذج أن يأخذ صورة نظيفة وأن يضيف إليها ضوضاء عشوائية تدريجيًا حتى تصبح مجرد تشويش خالص.
- يُدرَّب أيضًا على عكس هذه العملية: يبدأ من الضوضاء ويزيلها خطوة بخطوة لاستعادة الصورة الأصلية.
- عند التشغيل، تمنحه نقطة بداية (رسمك، إضافةً إلى أمر نصي، إضافةً إلى ضوضاء عشوائية)، فيقوم بإزالة الضوضاء متجهًا نحو صورة تطابق المدخلات الثلاثة في آنٍ واحد.
النتيجة لوحة أو صورة فوتوغرافية أو أي أسلوب بصري استوعبه النموذج من بيانات تدريبه.
💡 جودة النتيجة تعتمد مباشرةً على مدى وضوح رسمك وتعبيره. الخطوط القوية والواثقة تعطي نتائج أفضل في الغالب من الخطوط الباهتة أو المتقطعة.

النماذج التي تقوم بالعمل الشاق
Stable Diffusion: الأساس
يُعدّ Stable Diffusion العمود الفقري لمعظم مسارات تحويل الرسم إلى صورة. صدر كنموذج مفتوح المصدر، ما يعني أن مجتمع الباحثين بنى عليه مئات الإصدارات المضبوطة بدقة، كل منها متخصص في أساليب فنية ومستويات واقعية وموضوعات مختلفة.
يعتمد سير العمل القياسي img2img في Stable Diffusion على رسمك كنقطة انطلاق. يتحكم معامل يُسمى قوة إزالة الضوضاء في مدى ابتعاد النموذج عن الأصل. عند ضبطه على قيمة منخفضة (0.3)، تتبع النتيجة خطوطك عن قرب. وعند رفعه (0.9)، يتعامل الذكاء الاصطناعي مع رسمك كاقتراح فضفاض، فيبتكر شيئًا أكثر حرية في التفسير.
SDXL: أكبر وأوضح
حسّن SDXL بنية Stable Diffusion الأصلية بشكل ملحوظ. يعتمد على مسار من مرحلتين: نموذج أساسي يولّد التكوين العام، يتبعه مُحسِّن يُبرز التفاصيل ويصحح التناقضات. بالنسبة إلى العمل من الرسم إلى اللوحة، يعني ذلك أن الوجوه تخرج أكثر دقة تشريحيًا، وأن الملمس يبدو أكثر إحساسًا باللمس، وأن الخلفيات تتمتع بعمق حقيقي بدلًا من الضبابية الموحلة التي تنتجها النماذج القديمة.
يذهب SDXL Lightning أبعد من ذلك، إذ يقلّص التوليد إلى 4 خطوات فقط، ما يجعل تحويل الرسم قريبًا من الزمن الحقيقي دون تراجع كبير في الجودة.
Flux: المعيار الجديد
يمثل Flux Dev و Flux Schnell أحدث ما وصلت إليه التقنية في توليد الصور الواقعية والمفصّلة. يستخدم Flux بنية انتشار قائمة على المحوّلات (Transformer) بدلًا من شبكة U-Net التقليدية، ما يمنحه فهمًا أفضل للنص ودقة بنيوية أعلى بكثير.
في أعمال الرسم، تميل نماذج Flux إلى إنتاج تشريح أكثر تماسكًا، وحواف أوضح تحترم خطوطك الأصلية، وظروف إضاءة أقرب إلى الطبيعة، كل ذلك مع حاجة أقل إلى تعديلات يدوية على الأوامر النصية مقارنةً بالنماذج القديمة.
| النموذج | السرعة | الواقعية | دقة الالتزام بالرسم |
|---|
| Stable Diffusion | متوسطة | جيدة | معتدلة |
| SDXL | متوسطة | جيدة جدًا | جيدة |
| SDXL Lightning | سريعة | جيدة | معتدلة |
| Flux Dev | متوسطة | ممتازة | ممتازة |
| Flux Schnell | سريعة | جيدة جدًا | جيدة |

ControlNet: القوة المخلصة للرسم
لماذا يقصّر img2img العادي؟
تحترم معالجة img2img القياسية رسمك، لكن بشكل فضفاض. عندما ترفع قوة إزالة الضوضاء إلى حد كافٍ للحصول على نتيجة جميلة فعلًا، يبدأ النموذج بالانحراف عن تكوينك الأصلي. قد يتحرك الأنف إلى موضع مختلف قليلًا، وتتغير نسب المبنى. بالنسبة إلى الفنانين الذين يحتاجون إلى الحفاظ على نية بنيوية محددة، فهذه مشكلة حقيقية.
ControlNet Scribble يحل هذه المشكلة بشكل مباشر.
كيف يعمل ControlNet
يضيف ControlNet مسارًا منفصلًا للتحكم إلى نموذج الانتشار. فبدلًا من ترميز رسمك كمدخل آخر فقط، يستخرج منه "هيكلًا" بنيويًا، وتحديدًا خرائط الحواف أو خرائط العمق أو خطوط الرسم الخارجية، ويستخدم هذا الهيكل كقيد صارم طوال عملية التوليد بأكملها.
النتيجة: يرسم الذكاء الاصطناعي بحرية من حيث الملمس واللون والإضاءة، لكن البنية الأساسية لرسمك تُحفظ بأمانة من البداية حتى النهاية.
💡 ControlNet Scribble مدرّب تحديدًا على مدخلات الخطوط الحرة والخشنة. لا تحتاج إلى خطوط نظيفة. وهو في الواقع يعمل بشكل أفضل مع رسومات معبّرة وغير مثالية قليلًا منه مع الرسومات الهندسية الرقمية المثالية.
هذا ما يجعله أداةً مثالية للحالات التالية:
- تحويل رسومات الرصاص التقليدية إلى لوحات
- تحويل مفاهيم الفن الخام إلى رسومات توضيحية مكتملة
- الحفاظ على وضعيات الشخصيات مع تغيير الأساليب الفنية
- تصيير الرسومات المعمارية كبيئات واقعية كالصور الفوتوغرافية
يمكنك أيضًا دمج ControlNet مع SDXL باستخدام SDXL ControlNet LoRA أو SDXL Multi ControlNet LoRA الأقوى، لتطبيق إشارات تحكم متعددة في وقت واحد، مثل الجمع بين هيكل وضعية وخريطة حواف لتحقيق أقصى درجات الدقة.

كيف يعمل نقل الأسلوب عمليًا؟
نقل الأسلوب مقابل التحويل من الرسم إلى الصورة
يختلط هذان المصطلحان كثيرًا، لذا دعنا نكون دقيقين.
التحويل من الرسم إلى الصورة (أو من الرسم إلى اللوحة) يعني أخذ معلومات الخطوط البنيوية وتوليد صورة مكتملة منها. يبتكر الذكاء الاصطناعي اللون والملمس والإضاءة اعتمادًا على بيانات التدريب.
نقل الأسلوب العصبي عملية مختلفة: تأخذ صورة فوتوغرافية موجودة وتطبّق عليها الأسلوب البصري (نمط ضربات الفرشاة، ولوحة الألوان، والملمس) لعمل فني مرجعي. يبقى المحتوى كما هو، ويتغير فقط "الغلاف" الجمالي.
في الممارسة، تجمع كثير من مسارات العمل بين الاثنين. يتحول الرسم إلى صورة أساسية عبر ControlNet، ثم تُطبَّق خطوة نقل أسلوب تضيف طابعًا تصويريًا فوقها، لنتيجة من مرحلتين.
ماذا تعني "الأسلوب" بالنسبة إلى الذكاء الاصطناعي؟
عندما يحلل نموذج نقل الأسلوب لوحة لفان غوخ، فهو لا يحفظ قالبًا جاهزًا. بل يستخرج أنماطًا إحصائية من الصورة باستخدام الشبكات العصبية التلافيفية، مثل:
- اتجاه الضربات الفرشاة وتكرارها
- تغاير الألوان (أي الألوان التي تميل إلى الظهور بجوار ألوان بعينها)
- مقياس الملمس (التفاصيل الدقيقة مقابل الضربات العريضة)
- حدة الحواف مقابل نعومتها
تُشفَّر هذه الأنماط فيما يسميه الباحثون مصفوفة غرام، وهي تمثيل رياضي للأسلوب، ثم تُطبَّق على صورة المحتوى طبقة بطبقة أثناء عملية التوليد.
💡 كلما كانت صورتك المرجعية متميزة أسلوبيًا، كان تأثير نقل الأسلوب أقوى وأوضح. صورة ألوان مائية عامة تعطي نتائج ضعيفة، أما لوحة مميزة بضربات فرشاة قوية ومحددة فتعطي نتيجة لافتة.

من الرسم إلى اللوحة على PicassoIA
استخدام ControlNet Scribble
أكثر الطرق مباشرة من الرسم إلى اللوحة تستخدم ControlNet Scribble. إليك سير العمل بالتفصيل:
- جهّز رسمك: امسح رسمك ضوئيًا أو صوّره. التباين العالي هو الأفضل. قلم رصاص داكن على ورق أبيض، مصوَّر في ضوء جيد، هو الخيار المثالي.
- افتح ControlNet Scribble على PicassoIA وارفع صورتك.
- اكتب أمرك النصي: صف ما تريد أن تبدو عليه اللوحة النهائية. أدرج معلومات الأسلوب (لوحة زيتية، ألوان مائية، واقعي كالصور الفوتوغرافية)، والإضاءة (الساعة الذهبية، ضوء جانبي درامي)، وتفاصيل الشخص.
- اضبط مقياس الشرط: القيم الأعلى (0.8-1.0) تجعل النتيجة تتبع رسمك بصرامة أكبر. أما القيم الأدنى (0.4-0.6) فتمنح النموذج حرية إبداعية أكبر.
- شغّل التوليد وقارن النتائج. جرّب 3 إلى 5 تنويعات بقيم بذرة مختلفة قبل أن تختار المفضلة لديك.
ضبط نتائجك
العامل الأكبر تأثيرًا في جودة النتيجة، بعد الرسم نفسه، هو الأمر النصي. الأمر الغامض ينتج نتيجة متوسطة، والأمر المحدد ينتج شيئًا لافتًا.
أمر نصي ضعيف:
woman portrait, oil painting
أمر نصي قوي:
photorealistic portrait of a young woman, dramatic Rembrandt lighting from the upper left, rich oil paint impasto texture, deep shadows in the background, warm earth tones, visible brushstrokes on the face and neck, highly detailed eyes, fine art museum quality
الفرق في جودة النتيجة بين هذين الأمرين، على الرسم نفسه، كبير. فالدقة في الإضاءة والملمس والمزاج هي ما يفصل المخرجات العادية عن المخرجات الاستثنائية.

ما الذي يجعل الرسم جيدًا للذكاء الاصطناعي؟
جودة الخط أهم من الموهبة
لا تحتاج إلى أن تكون فنانًا مدرّبًا لتحصل على نتائج رائعة من تحويل الرسم بالذكاء الاصطناعي. لكن صفات معينة في رسمك تنتج باستمرار نتائج أفضل:
صفات الخطوط المفيدة:
- الثقة: الخطوط المفردة المتعمدة تتفوق على العلامات المتكررة والمتقطعة
- الأشكال المغلقة: المناطق المحاطة بالخطوط تُفسَّر كأجسام منفصلة
- التباين: الخطوط الداكنة على الخلفيات البيضاء تُقرأ بأكبر قدر من الموثوقية
- التناسب: الأخطاء التشريحية الفادحة (الأطراف الطويلة جدًا، والوجوه غير المتماثلة) تميل إلى البقاء في المخرجات النهائية
ما يجب تجنبه:
- التظليل المتقاطع الكثيف في مناطق الظل (يربك كاشف الحواف)
- الخطوط الخفيفة جدًا والرفيعة التي تختفي عند الدقة المنخفضة
- الأشكال المتداخلة الملتبسة دون فصل واضح بين الشكل والخلفية
💡 الرسم المصمم خصيصًا للمعالجة بالذكاء الاصطناعي يبدو مختلفًا عن الرسم المصمم للعين البشرية. بالنسبة إلى الذكاء الاصطناعي، فكّر في الخطوط الخارجية الواضحة والحد الأدنى من التفاصيل الداخلية. فالنموذج سيبتكر الملمس الداخلي بنفسه.
مسألة الدقة
معظم نماذج ControlNet تُدرَّب بدقة 512x512 أو 1024x1024. إدخال مسح ضوئي عالي الدقة جدًا لا ينتج تلقائيًا نتائج أفضل. غالبًا ما يكون من الأنفع خفض دقة الرسم إلى الدقة الأصلية للنموذج قبل المعالجة، ثم استخدام أداة رفع الدقة بعد ذلك لإعادة اللوحة النهائية إلى جودة الطباعة.
يمكن لأدوات تحسين الدقة الفائقة في PicassoIA رفع دقة المخرجات من 2x إلى 4x مع إضافة تفاصيل ملمسية حقيقية بدلًا من مجرد استيفاء البكسلات.

اختيار الأسلوب الفني المناسب للوحة
طيف الأساليب
ليست كل أساليب الرسم تستجيب بالقدر نفسه للتحويل من الرسم إلى الصورة. إليك تفصيل عملي لما يمكن توقعه:
| أسلوب اللوحة | الصعوبة بالنسبة إلى الذكاء الاصطناعي | ما يجب تحديده في الأمر النصي |
|---|
| لوحة زيتية | سهل | "ملمس سميك بالطلاء، ضربات فرشاة مرئية، لمسة ورنيش دافئة" |
| ألوان مائية | متوسط | "حواف ناعمة، انتشار الألوان على الرطب، ملمس الورق" |
| فحم | سهل | "فحم ممسوح، تظليل تدرجي، ملمس خشن" |
| انطباعية | متوسط | "ضربات فرشاة متقطعة، نقاط لون نقية، دون خطوط خارجية" |
| الواقعية الفائقة | صعب | "واقعي كالصور الفوتوغرافية، تفاصيل على مستوى المسام، تشريح مثالي" |
| فن المفاهيم | سهل | "إضاءة سينمائية، جودة لوحة مطفية، حواف حادة" |
التحكم في لوحة الألوان
يمكنك توجيه لوحة الألوان صراحةً في الأمر النصي. من مصطلحات الألوان المفيدة:
- ألوان الأرض الدافئة، السيينا المحروقة، الأومبر الخام، الأبيض التيتانيوم
- الأزرق والرمادي البارد، أزرق بروسيا، لمسات فضية
- ألوان مشبعة وعالية التباين ومتممة وزاهية
- ألوان باهتة ومكتومة ضمن نطاق ناعم من الباستيل
كلما كانت لغتك في الألوان أكثر تحديدًا، احتفظت بتحكم أكبر في النتيجة النهائية. لا تترك اللون للصدفة عندما تكفي بضع كلمات إضافية في الأمر النصي لتثبيته.

مشكلات شائعة وكيفية إصلاحها
الوجه مشوّه
الوجوه صعبة بشكل معروف على نماذج الانتشار، خاصةً عند الدقة المنخفضة. الأعراض: عيون إضافية، وملامح وجه متداخلة، وتموضع غير متماثل.
الحل: أضف هذه المصطلحات إلى أمرك النصي: "perfect facial symmetry, accurate anatomy, single face, detailed eyes, correct proportions". كما ينبغي رفع دقة الصورة إلى 768 بكسل على الأقل في الضلع القصير قبل المعالجة.
اللوحة تتجاهل رسمي
إذا كانت النتيجة لا تشبه رسمك تقريبًا، فقيمة مقياس شرط ControlNet منخفضة جدًا.
الحل: ارفعها نحو 0.9-1.0. وإذا جعل ذلك النتيجة جامدة أكثر من اللازم وخفّض الجودة العامة، فجرّب معالجة رسمك مسبقًا بكاشف حواف Canny مخصص قبل تمريره إلى ControlNet للحصول على إشارة بنيوية أنظف.
كل شيء يبدو متشابهًا
استخدام البذرة العشوائية نفسها مرارًا ينتج مخرجات متطابقة. النموذج لا يملك سببًا للتنوع.
الحل: غيّر البذرة العشوائية في كل توليد، أو فعّل خيار البذرة العشوائية. شغّل 10 تنويعات أو أكثر وانتقِ الأفضل. يمكن للرسم نفسه أن ينتج لوحات مختلفة تمامًا حسب البذرة.
الخلفية عامة
شخصية جميلة على خلفية متدرجة عامة تمامًا هي حالة فشل شائعة.
الحل: صف الخلفية صراحةً في أمرك النصي. فعبارة "استوديو باريسي مزدحم برفوف الكتب ونباتات المنزل" تنتج نتيجة أكثر إثارةً بكثير من ترك الخلفية للصدفة تمامًا.

العلم بلغة بسيطة
ماذا تعني "بيانات التدريب" فعليًا؟
عندما يقول الناس إن نموذج الذكاء الاصطناعي "دُرّب على ملايين الصور"، فهم يعنون أن هذه الصور استُخدمت لتعليم النموذج التعرف على الأنماط عبر عملية تُسمى الانتشار الخلفي. يقدم النموذج تنبؤات، ويقارنها بالحقيقة الأرضية، ويحسب الخطأ، ويعدّل مليارات الأوزان العددية الداخلية حتى تصبح التنبؤات دقيقة.
عند اكتمال التدريب، تُشفّر تلك الأوزان تمثيلًا إحصائيًا غنيًا للغاية لكيفية ارتباط العناصر البصرية ببعضها. لقد استوعب النظام أن عظمة الخد البارزة تخلق نمط إبراز محددًا، وأن الزيت على الكتان له ملمس معين عند بعد بؤري 50 ملم. لم يحدث ذلك لأنه بُرمج صراحةً على هذه الحقائق، بل لأنها ضمنية في الأنماط عبر ملايين الأمثلة التدريبية.
لماذا يعمل رسمك كإشارة؟
يوفّر رسمك معلومات عن التردد المكاني: أين توجد الحواف عالية التباين، وما الأشكال التي تحيط بها، وكيف ترتبط هذه الأشكال ببعضها في التكوين. حتى الرسم الخشن يمنح النموذج إشارة بنيوية كافية لتقييد التوليد نحو تكوينك المقصود.
يملأ النموذج كل شيء آخر من تدريبه، معتمدًا على خريطته الاحتمالية لما ينبغي أن يوجد داخل تلك الأشكال وحولها. ولهذا قد ينتج رسم بسيط من خمسة خطوط شخصًا بشريًا قابلًا للتعرف في المخرجات، بينما قد ينتج تظليل متقاطع كثيف فوضى. ما يحتاجه النموذج فعليًا هو وضوح الإشارة، لا مهارة الرسم.
جرّبه على رسوماتك الخاصة
يستطيع أي شخص يملك قلم رصاص وماسحًا ضوئيًا أن يجرب ذلك اليوم. ابحث عن رسم أنجزته قبل سنوات، أو ارسم شيئًا جديدًا خلال الدقائق العشر القادمة، ثم أدخله إلى ControlNet Scribble على PicassoIA.
الفجوة بين ما رسمته وما يخرج في النهاية هي المكان الذي تثبت فيه التقنية قيمتها. رسم رصاص يستغرق خمس دقائق لمدينة يمكن أن يتحول إلى لوحة زيتية مذهلة في أقل من 30 ثانية. ورسم بورتريه خشن يمكن أن يصبح تصييرًا واقعيًا كالصور الفوتوغرافية، يبدو أنه احتاج إلى مئات الساعات من المهارة في الرسم بالألوان.
لا يلزمك التوقف عند مخرج واحد. شغّل Flux Dev على الرسم نفسه للحصول على تفسير مختلف تمامًا. واستخدم SDXL للحصول على تفاصيل ملمسية غنية. وجرّب Flux Schnell للتكرار السريع عندما تريد اختبار اثني عشر أسلوبًا خلال دقائق لا ساعات.
الرسم هو نقطة انطلاقك. أما إمكانيات اللوحات التي يمكن أن تنبثق من نقطة البداية الواحدة تلك فهي عمليًا لا نهائية.
