كيف ينسخ الذكاء الاصطناعي أساليب الفن بهذه السرعة: العلم وراء ذلك

لا يخمّن الذكاء الاصطناعي أساليب الفن عشوائيًا. فباستخدام الشبكات العصبية الالتفافية ونماذج الانتشار ومليارات أمثلة التدريب، يستخلص "الحمض النووي البصري" لأي أسلوب فني ويعيد إنتاجه بدقة خلال ثوانٍ، من ضربات فرشاة فان غوخ إلى لوحة ألوان مونيه.

كيف ينسخ الذكاء الاصطناعي أساليب الفن بهذه السرعة: العلم وراء ذلك
Cristian Da Conceicao
مؤسس Picasso IA

هناك لحظة، حين ترى صورة من الذكاء الاصطناعي وتتعرف عليها بوصفها "بأسلوب فان غوخ" أو "مستوحاة من مونيه"، تشعر بشيء من الغرابة. الضربات الدوّارة، والطلاء الكثيف، والطريقة المحددة التي ينساب بها الضوء عند الأفق: كل ذلك حاضر، ومولَّد في ثوانٍ. كيف يعمل هذا؟ الإجابة المختصرة تتضمن الرياضيات والبيانات الضخمة وحيلة ذكية تُسمى نقل الأسلوب العصبي. أما الإجابة المفصّلة فأكثر إثارة للاهتمام.

أقرب لقطة لفرشاة رسم تلامس طلاء زيتيًا كثيفًا رطبًا على قماش، مع ضوء استوديو دافئ من اليمين، تصوير ماكرو

ما هو نقل الأسلوب فعليًا

تبدو عبارة "نقل الأسلوب" ذات طابع فني، لكنها تصف عملية حاسوبية محددة للغاية. في جوهره، نقل الأسلوب هو فصل شيئين يدمجهما البشر بالحدس: ما تصوّره الصورة (محتواها) وكيف تُصوَّر (أسلوبها).

حين تنظر إلى "ليلة النجوم"، ترى قرية وسماء. هذا هو المحتوى. أما الضربات الدوّارة، والأصفر والأزرق المحددان، والطريقة التي تبدو بها النجوم نابضة: فهذا هو الأسلوب. يستطيع البشر التمييز بين هذين بالحدس. أما تعليم الآلة فعل ذلك نفسه فمسألة مختلفة تمامًا.

ليس سحرًا، بل رياضيات

قُدّم نقل الأسلوب العصبي رسميًا في ورقة بحثية عام 2015 من إعداد Gatys وEcker وBethge. استخدم الأسلوب شبكة عصبية التفافية (CNN)، وتحديدًا VGG-19، وهي شبكة صُممت أصلًا لتصنيف الصور. ما اكتشفه الباحثون أن الطبقات المختلفة في الشبكة التفافية تُرمّز أنواعًا مختلفة من المعلومات.

تلتقط الطبقات الأولى الخصائص المنخفضة المستوى: الحواف والألوان والملمس. وتلتقط الطبقات الأعمق البنية عالية المستوى: الأجسام والمشاهد والتكوينات. وقد تبيّن أن الأسلوب يمكن استخلاصه من تحليل كيفية ترابط الخصائص عبر الطبقات الأولى. أما المحتوى فكان يسكن الطبقات الأعمق.

من خلال تحسين صورة جديدة لتطابق إحصاءات الأسلوب لعمل فني مرجعي وتمثيل المحتوى لصورة هدف، تستطيع الشبكة مزج الاثنين.

الشبكتان المشاركتان

يستخدم نقل الأسلوب الكلاسيكي شبكة CNN واحدة مدرّبة مسبقًا تعمل كـ"حكم". أما الأساليب الأحدث فتستخدم شبكتين منفصلتين:

الشبكةالدور
المولّدينشئ الصورة المُنمّطة بالأسلوب
المميّزيقيّم هل تبدو مقنعة

هذا الإعداد التنافسي، المعروف بـGAN (الشبكة التوليدية التنافسية)، يُنتج نتائج أوضح وأكثر تماسكًا من نهج التحسين الأصلي. يستمر المولّد في التحسن لأن المميّز يستمر في رصد العيوب.

كيف ترى الشبكات العصبية الفن

امرأة تدرس لوحتين في معرض حديث، تقارن النسختين الأصلية والمولّدة بالذكاء الاصطناعي تحت إضاءة مسارات السقف

لكي ينسخ الذكاء الاصطناعي أسلوبًا فنيًا، يجب أن يفهم أولًا مكوّنات هذا الأسلوب. وهذا ليس بالبساطة نفسها التي تبدو عليها مطابقة الألوان. تتميز لوحة انطباعية متقنة بـ_تردد الملمس_ محدد، أي طريقة مميزة لتوزيع ضربات الفرشاة بأحجام مختلفة. ولها لوحة ألوان بعلاقات محددة بين التشبع ودرجة الحرارة. ولها عادات في التكوين المكاني: أين يميل الفنان إلى وضع خطوط الأفق، وكم من المساحة الفارغة يستخدم.

تستخلص الشبكة التفافية كل ذلك بشكل منهجي عبر تمرير الصورة عبر ملايين المرشحات المتعلَّمة.

تفكيك الصورة طبقة تلو الأخرى

فكّر فيها كعملية تشريح. تقسّم الشبكة الصورة إلى خرائط خصائص عند كل طبقة:

  • الطبقة 1: ترصد الحواف وانتقالات الألوان
  • الطبقة 3: تحدد الأنسجة وأنماط صغيرة متكررة
  • الطبقة 7: تتعرف على أجزاء الأجسام (وجه، مظلة شجرة)
  • الطبقة 15 فما فوق: تحدد الأجسام الكاملة وعلاقاتها

تُلتقط معلومات الأسلوب بحساب مصفوفة Gram عند كل طبقة. تقيس هذه المصفوفة كيف تتواجد الخصائص المختلفة معًا عبر الصورة. ونمط هذا التواجد المشترك هو، رياضيًا، ما يحدد الأسلوب. صورتان تبدوان مختلفتين تمامًا في المحتوى لكنهما تشتركان في إحصاءات مصفوفة Gram نفسها ستبدوان كأنهما رُسمتا بيد الفنان ذاتها.

الفصل بين المحتوى والأسلوب

الفكرة الذكية هنا أن الأسلوب والمحتوى مُرمّزان في أجزاء مختلفة من الشبكة. يمكنك "ضبط" كل منهما بشكل مستقل.

تشبيه سريع: فكّر في جملة. الكلمات هي المحتوى. النبرة والإيقاع وبنية الجملة هي الأسلوب. يمكنك أن تقول الشيء نفسه بأسلوب همنغواي أو فوكنر. يفعل نقل الأسلوب العصبي الشيء نفسه مع البكسلات.

هذا الفصل هو ما يجعل النظام كله يعمل بسرعة. فبمجرد أن تملك شبكة مدرّبة تستخلص خصائص الأسلوب والمحتوى بموثوقية، يصبح توليد صورة جديدة بأسلوب معين مجرد تحسين: تشغيل نزول التدرج على لوحة فارغة حتى تستوفي القيدين معًا.

عامل السرعة: لماذا أصبح سريعًا الآن

منظر علوي لطاولة عمل فنان عليها دفاتر رسم مفتوحة، وأنابيب ألوان، وفرش، ولوحة ألوان، تحت الضوء الطبيعي

كانت طريقة Gatys الأصلية عام 2015 بطيئة بشكل مؤلم. فتوليد صورة واحدة مُنمّطة بحجم 512x512 على وحدة المعالجة المركزية (CPU) العادية كان يستغرق ساعات. أما اليوم فينتج الناتج نفسه بالجودة ذاتها في أقل من ثانية على وحدة معالجة رسومية (GPU) للمستهلك. ما الذي تغيّر؟

قوة GPU غيّرت كل شيء

كان الانتقال من الحوسبة على CPU إلى GPU أول مُسرّع كبير. فوحدات GPU صُممت للحوسبة المتوازية الضخمة، وهو بالضبط نوع الرياضيات الذي تحتاجه الشبكات العصبية. تنفّذ وحدة NVIDIA A100 الحديثة أكثر من 312 teraFLOPS من عمليات الموتر في الثانية.

لكن العتاد وحده لم يفسّر التسارع كاملًا. فقد تغيّرت البنية أيضًا.

من ساعات إلى ثوانٍ

حلّت شبكات نقل الأسلوب أحادية الاتجاه (التي قدّمها Johnson وآخرون عام 2016) محل حلقة التحسين البطيئة بشبكة مدرّبة. فبدلًا من التكرار على لوحة فارغة لآلاف الخطوات، تُدرَّب الشبكة مرة واحدة على ملايين الصور لتنفيذ تحويل أسلوبي في تمريرة أمامية واحدة.

والنتيجة: نقل أسلوب يعمل في الوقت الفعلي على الفيديو. انتقلت الحوسبة من سؤال "كيف أعدّل هذه الصورة لتبدو أقرب إلى فان غوخ؟" إلى "لقد تعلّمت بالفعل كيف أفعل ذلك، وهذا هو الناتج".

الطريقةالسرعةالجودة
التحسين (2015)من دقائق إلى ساعاتعالية
الشبكات أحادية الاتجاه (2016)10 إلى 50 ميلي ثانيةجيدة
نماذج الانتشار (2022 فما بعد)من 1 إلى 5 ثوانٍعالية جدًا
النماذج السريعة الحديثة (2024 فما بعد)أقل من ثانيةممتازة

تولّد نماذج حديثة مثل Flux Schnell الصور في أقل من ثانية. والسرعة ليست نتيجة اختصارات. بل تأتي من بنى أفضل تعلّمت أن تضغط معرفة أكبر في خطوات حوسبية أقل.

نماذج الانتشار: نهج مختلف

امرأة عند مكتب منزلي مشرق تقارن نسختين، الأصلية والمعالجة، لصورة منظر طبيعي على شاشتين

تمثل نماذج الانتشار نهجًا مختلفًا جوهريًا في تركيب الصور. فبينما تضع GAN شبكتين في مواجهة بعضهما، تتعلم نماذج الانتشار عملية أهدأ وأكثر رياضية: كيف تعكس الضوضاء.

كيف تتعلم الأسلوب من الصفر

تعمل عملية التدريب على النحو التالي:

  1. خذ صورة حقيقية
  2. أضف الضوضاء العشوائية تدريجيًا عبر خطوات كثيرة حتى تصبح الصورة ضجيجًا خالصًا
  3. درّب الشبكة على التنبؤ بالضوضاء وإزالتها في كل خطوة
  4. بعد التدريب، ابدأ من ضوضاء خالصة واعكس العملية

ما ينتجه ذلك شبكة قامت بترميز الأنماط الإحصائية لبيانات تدريبها بعمق. فحين تقول "ارسم هذا بأسلوب الانطباعية"، يكون النموذج قد رأى ما يكفي من الصور الانطباعية أثناء التدريب ليعرف بالضبط أي أنماط ضوضاء يجب أن يعكسها.

النقطة الحاسمة: الأسلوب ليس مرشحًا يُطبَّق فوق الصورة. بل هو متأصل في عملية التوليد نفسها. فالنموذج لا يضيف ضربات فرشاة إلى صورة فوتوغرافية. إنه يولّد الصورة كاملة من الصفر، وتكون ضربات الفرشاة فيها خاصية أساسية.

التدريب على مليارات الصور

دُرِّب Stable Diffusion على LAION-5B، وهي مجموعة بيانات تضم خمسة مليارات زوج من الصور والنصوص. ووسّع SDXL هذا بإضافة بيانات تدريب بدقة أعلى وجودة أفضل للتعليقات.

حين يتدرب نموذج على خمسة مليارات صورة موسومة بأوصاف أسلوبية، فإنه لا يرى "لوحة انطباعية" بضع مرات فقط. بل يراها ملايين المرات، عبر فنانين ومواضيع وظروف إضاءة ولوحات ألوان مختلفة. والنتيجة نموذج استوعب "فضاء أسلوبي" انطباعيًا أغنى بكثير من أي مجموعة أعمال لفنان واحد.

ما يعنيه هذا عمليًا: حين تكتب "ارسمها بأسلوب مونيه"، يكون النموذج قد ترمّز كل انتظام إحصائي للصور المرتبطة بمونيه: الطريقة التي تميل بها لوحته نحو الأزرق والبنفسجي، وإيقاع الضربات الأفقية على أسطح الماء، والانتشار الناعم للحواف في مرحلته المتأخرة. ينتج كل هذا في آنٍ واحد، ليس لأنه تعلّم قواعد، بل لأنه تعلّم أنماطًا.

دور LoRA في التحكم بالأسلوب

كتاب مفتوح لتاريخ الفن على طاولة مكتبة يعرض نسخًا من أعمال مونيه وفان غوخ ورامبرانت في شعاع دافئ من ضوء الشمس

من أقوى النُّهج لنسخ الأسلوب بدقة LoRA (التكيّف منخفض الرتبة). فهو يتيح للذكاء الاصطناعي تعلّم أسلوب محدد دون إعادة تدريب النموذج كله من الصفر.

الأسلوب دون إعادة تدريب كاملة

يتطلب الضبط الدقيق الكامل لنموذج مثل Stable Diffusion 3.5 Large حوسبة هائلة ومئات الآلاف من صور التدريب. أما LoRA فيغيّر الحسابات تمامًا.

يعمل LoRA بإضافة مجموعة صغيرة من مصفوفات أوزان قابلة للتدريب تُوضع إلى جانب أوزان النموذج الأصلي. هذه المصفوفات صغيرة جدًا مقارنة بالنموذج الكامل (عادةً أقل من 200 ميغابايت). لكنها موجَّهة بدقة. فهي تدفع مخرجات النموذج نحو نطاق أسلوبي محدد.

يتطلب تدريب LoRA أسلوبي ما يلي:

  • قد يكفي فقط 20 إلى 50 صورة مرجعية بالأسلوب المستهدف
  • بضع ساعات من التدريب على وحدة GPU واحدة
  • ملف مخرجات صغير يمكن تبديله وإزالته بسهولة

يذهب Flux Dev LoRA أبعد من ذلك، إذ يسمح بتطبيق أوزان LoRA مباشرة داخل مسار توليد عالي الجودة لتطبيق أسلوبي مرن.

لماذا يستخدم الفنانون LoRA

الجاذبية واضحة للفنانين المحترفين. يمكنك تدريب LoRA على أعمالك الخاصة، أو على أسلوب فنان تاريخي محدد، والحصول على ذكاء اصطناعي يولّد صورًا متسقة مع ذلك الأسلوب عند الطلب.

معامل LoRAما يتحكم فيه
صور التدريبالأسلوب البصري المُرمّز
معدل التعلّممدى قوة تغلّب الأسلوب على النموذج الأساسي
الخطواتعمق استيعاب الأسلوب
كلمة التفعيلعبارة النص التي تُنشّط LoRA

ولهذا يهم اتساق الأسلوب على نطاق الإنتاج. فشركة تنتج محتوى توضيحيًا يمكنها تدريب LoRA واحد على رسومها التوضيحية الحالية للعلامة التجارية، وتوليد مئات الصور المتسقة مع العلامة دون توظيف فنانين إضافيين لكل قطعة.

ما الذي يستطيع الذكاء الاصطناعي نسخه وما الذي لا يستطيعه

لوحة مزاج مثبتة على جدار من الفلين عليها صور مطبوعة وعينات ألوان ومطبوعات مرجعية لأساليب مرسومة، تحت ضوء طبيعي ناعم

الذكاء الاصطناعي جيد بشكل لافت في نسخ الأساليب. لكن من المهم أن نكون دقيقين في معنى "الأسلوب" هنا، وأين لا تزال النماذج الحالية تقصّر.

أنماط ضربات الفرشاة: نعم

سيولّد نموذج انتشار مدرَّب على صور انطباعية كافية أنماط ضربات فرشاة مقنعة. سيضع ضربات قصيرة وموجَّهة بالكثافة والاتجاه الصحيحين. وسيتجنب الحواف الحادة. وسيمزج الألوان بالطريقة المحددة التي تميّز الأسلوب.

ما ينسخه الذكاء الاصطناعي بجودة:

  • لوحة الألوان ومستويات التشبع
  • ملمس ضربات الفرشاة واتجاهها
  • عادات التكوين (موضع الأفق، وتأطير الشخص)
  • عرض الحواف (ناعمة، حادة، متقطعة)
  • التباين ونطاق الدرجات اللونية

النية العاطفية: ليس تمامًا

وهنا تصبح الأمور أكثر دقة. لم يكن أسلوب فان غوخ مجرد مجموعة من الخيارات التقنية. بل نشأ من حالات عاطفية محددة، وتاريخ شخصي، وقرارات فنية متعمدة اتُّخذت بقصد.

الذكاء الاصطناعي الذي يولّد "أسلوب فان غوخ" ينتج شيئًا يبدو كأعمال فان غوخ دون أي من النية الكامنة وراءها. الإحصاءات البصرية متطابقة. أما المعنى فغائب.

ما لا ينسخه الذكاء الاصطناعي:

  • نية الفنان أو دوافعه
  • القرارات الارتجالية التي تُتخذ في لحظة الإبداع
  • الطرق المحددة التي تطور بها الأسلوب مع الوقت استجابةً لأحداث الحياة
  • الإحساس المادي بالخامة (ثقل الطلاء، ومقاومة القماش)

هذا التمييز مهم عند تقييم الفن المولَّد بالذكاء الاصطناعي تقييمًا نقديًا، لكنه لا يقلل من فائدة الأداة. فالأسلوب مجموعة من الأنماط البصرية. ويستطيع الذكاء الاصطناعي نسخ هذه الأنماط بإتقان كبير. أما ما تعنيه هذه الأنماط فسؤال منفصل.

جرّبه بنفسك على PicassoIA

أستاذة فنون تحاضر أمام مقارنة معروضة بالإسقاط لصورتين شخصيتين بأسلوبين مختلفين في قاعة جامعية

التقنية الموصوفة في هذا المقال ليست حكرًا على المختبرات البحثية. فهي متاحة الآن، والعديد من النماذج على PicassoIA مصمّمة خصيصًا للتوليد القائم على الأسلوب.

أي النماذج تناسب الأسلوب بشكل أفضل

تتمتع النماذج المختلفة بنقاط قوة مختلفة في إعادة إنتاج الأساليب:

لنقل الأسلوب الواقعي الشبيه بالتصوير: Flux Dev وFlux Pro هما الخياران الأولان في أغلب الحالات. يستخدم كلاهما بنية Black Forest Labs، وهي قوية بشكل خاص في تفسير أوصاف الأسلوب في الأوامر النصية. يمكنك تحديد "لوحة زيتية، ضربات فرشاة سميكة، لوحة ألوان دافئة" وسيعكس الناتج هذه القيود بموثوقية.

لأقصى جودة وتفاصيل: يولّد Flux 1.1 Pro Ultra الصور بدقة 4 ميغابكسل، أي أن ملامس الأسلوب تظهر بالدقة الكاملة. تُصيَّر أنماط ضربات الفرشاة وملمس القماش وطبقات الطلاء بمستوى من التفاصيل يقترب من الأعمال الفنية الممسوحة ضوئيًا.

لتعديل صور فوتوغرافية موجودة إلى أسلوب جديد: يأخذ Flux Kontext Pro صورة إدخال وتعليمات نصية. يمكنك أخذ صورة فوتوغرافية وطلب عرضها بأسلوب الألوان المائية أو رسم الرصاص أو الرسم الزيتي مع الحفاظ على محتوى الأصل.

للأساليب الفوتوغرافية الواقعية: صُمّم RealVisXL v3.0 Turbo وRealistic Vision v5.1 خصيصًا لمخرجات فائقة الواقعية. وحين يكون "الأسلوب" الذي تريده تصويرًا وثائقيًا لا فنًا تصويريًا، تقدّم هذه النماذج النتيجة المطلوبة.

للتكرار السريع: يولّد Imagen 4 Fast وFlux Schnell الصور بسرعة، مما يجعلهما مثاليين لاختبار الأساليب سريعًا عندما تريد تجربة أوصاف أسلوبية متعددة بسرعة قبل اعتماد توليد نهائي.

الكتابة للأسلوب: ما ينجح فعليًا

تؤثر طريقة وصفك للأسلوب في الأمر النصي مباشرة على مدى دقة النموذج في إعادة إنتاجه. فالكلمات الأسلوبية الغامضة تنتج نتائج غامضة. أما الأوصاف التقنية المحددة فتنتج مخرجات دقيقة.

أقل فعالية:

"بأسلوب الانطباعية"

أكثر فعالية:

"ضربات زيتية فضفاضة، ملمس طلاء كثيف مرئي، حواف ناعمة، لوحة ألوان دافئة مشمسة مع ظلال زرقاء كوبالتية، معالجة متأثرة بمونيه لانعكاسات الماء، علامات فرشاة مربعة في العشب الأمامي"

يمنح الأمر النصي الثاني النموذج إحصاءات بصرية محددة يستهدفها. فكل وصف يقابل خاصية حقيقية تعلّمها النموذج من بيانات تدريبه.

نصيحة تستحق المعرفة: إضافة أدوات الفن إلى الأمر النصي تساعد في ضبط الأسلوب. فعبارات مثل "غسلة ألوان مائية على ورق بارد الضغط" و"فحم على ورق صحفي" و"غواش بلمسة مطفية" محددة بما يكفي ليملك النموذج تمثيلات قوية لها.

فنك، أمرك النصي

استوديو فن رقمي واسع مفتوح المساحة يضم محطات عمل متعددة وشاشات كبيرة تعرض أعمالًا قيد الإنجاز، وضوء نهاري طبيعي من فتحات السقف

امرأة تحمل صورة فوتوغرافية مطبوعة وتفحصها عن قرب في استوديو منزلي دافئ، بعدسة Zeiss 85mm للبورتريه مع عمق ميدان ضحل

الآلية التي تقف وراء نسخ الذكاء الاصطناعي للأسلوب مثيرة للإعجاب حقًا: شبكات عصبية التفافية تفصل المحتوى عن إحصاءات الأسلوب، ونماذج انتشار تتعلم عكس الضوضاء عبر مليارات أمثلة التدريب، ومحولات LoRA تُرمّز نطاقات بصرية محددة في بضع مئات من الميغابايتات، وشبكات أحادية الاتجاه تختصر ساعات من الحوسبة إلى أجزاء من الثانية.

لكن الجزء الأكثر إثارة للاهتمام أن كل هذا بات في متناول يدك الآن. لا تحتاج إلى خلفية بحثية لاستخدامه. كل ما تحتاجه أمر نصي ووصول إلى نموذج.

ابدأ بأسلوب تجده مثيرًا للاهتمام، سواء كانت الهندسة المشبعة بالألوان عند Klimt، أو الحبيبات أحادية اللون عند Ansel Adams، أو الخطوط الفحمية الحرة عند Egon Schiele، أو ببساطة "ضوء الشمس بعد الظهر يمر عبر ستائر من الكتان". اختر نموذجًا من القائمة أعلاه. شغّله. ثم غيّر كلمة واحدة وشغّله مرة أخرى.

هذه العملية من التكرار هي المكان الذي يعيش فيه الإبداع الحقيقي. الذكاء الاصطناعي يتولى الحوسبة، أما القرارات الجمالية فتبقى كلها لك.

جرّب الآن على PicassoIA وشاهد ما يظهر من أمرك النصي الأول.

شارك هذا المقال

اختر لغتك

مقالات ذات صلة