PixArt-Sigma: شرح نموذج الذكاء الاصطناعي مفتوح المصدر لتوليد الصور

PixArt-Sigma نموذج قوي مفتوح المصدر لتحويل النص إلى صورة، مبني على بنية Diffusion Transformer. ينتج صورًا عالية الدقة مذهلة تصل إلى 4096 بكسل، بجزء بسيط من التكلفة الحسابية للبدائل المغلقة. يشرح هذا المقال بنيته، وأسلوب تدريبه، ونتائج اختباراته المعيارية، وقيوده الحقيقية، وكيف يقارن بأبرز النماذج المتاحة اليوم.

PixArt-Sigma: شرح نموذج الذكاء الاصطناعي مفتوح المصدر لتوليد الصور
Cristian Da Conceicao
مؤسس Picasso IA

يقع PixArt-Sigma ضمن فئة من نماذج الذكاء الاصطناعي لتوليد الصور يغفل عنها معظم الناس: مفتوحة المصدر، وذات طابع بحثي، وقدرات عالية دون ضجة. أطلقه فريق PixArt في Huawei Noah's Ark Lab، وقد بنى على بنية PixArt-α السابقة، فرفع دقة الصور ودقة مطابقتها للنص ووفاءها البصري دون الحاجة إلى ميزانية البنية التحتية التي تحتاجها منافساته التجارية. إذا كنت قد قضيت وقتًا في توليد الصور باستخدام Flux Dev أو Stable Diffusion 3.5 Large، فإن فهم ما يفعله PixArt-Sigma بشكل مختلف يمنحك صورة أوضح عن طريقة عمل تقنية تحويل النص إلى صورة فعليًا.

مصوّر محترف يراجع صورًا فوتوغرافية مذهلة مولّدة بالذكاء الاصطناعي على شاشة استوديو، ضوء صباحي دافئ، واقعي كالصور الفوتوغرافية

ما هو PixArt-Sigma فعليًا

PixArt-Sigma نموذج Diffusion Transformer (DiT) لتوليد الصور من النص. الفكرة الأساسية: بدلًا من العمود الفقري التلافيفي U-Net الذي ميّز البنية الأولى لنموذج Stable Diffusion، يستخدم PixArt-Sigma كتلًا من المحوّلات (transformer) لمعالجة التمثيلات الكامنة أثناء عملية إزالة التشويش في الانتشار. أثبتت المحوّلات جدارتها على نطاق واسع في اللغة والرؤية والآن في توليد الصور، ويُعدّ PixArt-Sigma من أوضح الأمثلة على سبب أهمية هذا التحول المعماري.

صُمّم النموذج لتوليد صور بدقة تصل إلى 4096 × 4096 بكسل، وهو سقف لم تكن معظم النماذج مفتوحة المصدر في وقت إطلاقه قادرة على بلوغه. والأهم أنه صُمّم ليفعل ذلك بميزانية تدريب تمثل جزءًا بسيطًا مما تستهلكه البدائل التجارية. نشر فريق PixArt تكاليف تدريبه إلى جانب النموذج، وهذا أمر نادر في مجال تعدّ فيه الشركات إنفاق البنية التحتية ميزة تنافسية تحميها. وقد جعلت هذه الأرقام مجتمع الباحثين يولي الأمر اهتمامًا كبيرًا.

مبني على DiT لا على U-Net

الفرق المعماري بين U-Net و Diffusion Transformer ليس أكاديميًا فحسب. تعالج شبكات U-Net المعلومات المكانية عبر وصلات تخطٍّ بين طبقات المشفّر وفك التشفير. وهي تعمل جيدًا لكنها تواجه صعوبة في التوسع بكفاءة، لأن الطبقات التلافيفية لا تعمّم بالطريقة نفسها عبر الدقات المختلفة وتعقيدات الأوامر النصية. أما المحوّلات فتستخدم الانتباه الذاتي (self-attention) عبر السياق المكاني كاملًا، ما يعني أن النموذج يستطيع أن يوازن كل جزء من الصورة مع كل جزء آخر في كل خطوة من خطوات إزالة التشويش.

في جودة الصورة، يظهر ذلك بوضوح أكبر في الترابط التكويني. عندما يطلب الأمر النصي عدة أشياء تتفاعل بطريقة محددة، تميل النماذج القائمة على DiT إلى احترام العلاقات المكانية بدقة أكبر من نظيراتها القائمة على U-Net. ورث PixArt-Sigma هذه الخاصية من PixArt-α، وطوّرها بشكل ملحوظ عبر بيانات تدريب أفضل ومشفّر نصي أكبر.

منظر علوي من الجو لمساحة عمل إبداعية فيها مخططات معمارية للذكاء الاصطناعي وأدوات تصميم، ضوء طبيعي، تصوير فوتوغرافي RAW

حيلة التدريب على مرحلتين

من أهم جوانب PixArt-Sigma من الناحية العملية استراتيجية تدريبه. طوّر الفريق خط معالجة من مرحلتين يخفّض التكاليف بشكل كبير دون التضحية بجودة المخرجات النهائية:

  • المرحلة الأولى: التدريب على بيانات منخفضة التكلفة ودقة أقل لتعليم النموذج مواءمة المفاهيم بين النص والمحتوى البصري. يتعلم النموذج ما الذي يجب أن تبدو عليه الأشياء.
  • المرحلة الثانية: الضبط الدقيق على مجموعة منتقاة من أزواج الصورة والنص عالية الدقة والجودة. يتعلم النموذج كيف تُصيَّر هذه المفاهيم بتفاصيل دقيقة وبمختلف المقاييس.

يقلل هذا الأسلوب تكلفة مرحلة التدريب عالي الدقة، لأن النموذج لا يتعلم الدلالات الأساسية من الصفر بالدقة الكاملة. بلغت تكلفة التدريب المنشورة لنموذج PixArt-Sigma نحو 32,000 دولار أمريكي للتشغيل الكامل، مقارنة بتقديرات تصل إلى الملايين لنماذج تجارية مماثلة في ذلك الوقت. وأصبح هذا الرقم من أكثر الإحصائيات تداولًا في مجتمع الذكاء الاصطناعي المفتوح لتوليد الصور طوال عام 2024.

💡 قصة الكفاءة لا تهم الباحثين وحدهم. تكاليف التدريب الأقل تعني دورات تكرار أسرع، ومزيدًا من الضبوط الدقيقة التي يساهم بها المجتمع، ومزيدًا من الإصدارات المتخصصة المبنية على النموذج الأساسي دون الحاجة إلى ميزانيات مؤسسية.

كيف ينافس النماذج الأكبر

تحكي اختبارات الجودة الخام جزءًا من القصة. خضع PixArt-Sigma للتقييم باستخدام FID (Fréchet Inception Distance) ودرجات CLIP ودراسات تفضيل بشري وقت إطلاقه. في مقياس FID، كلما انخفضت القيمة كان ذلك أفضل، لأنه يقيس المسافة الإحصائية بين توزيع الصور المولّدة وتوزيع الصور الحقيقية. حقق النموذج درجات قريبة من نماذج دُرّبت بتكلفة أعلى بكثير، وهو ما أكّد صحة الخيارات المعمارية واستراتيجية تنقيح البيانات.

شابة تراجع شبكة من صور البورتريه المولّدة بالذكاء الاصطناعي على جهاز لوحي، ضوء بعد ظهر دافئ، تصوير أسلوب حياة

نتائج الاختبارات المعيارية الجديرة بالملاحظة

المقياسPixArt-SigmaPixArt-αما الذي تغيّر
FID (COCO 256px)~5.5~7.3الأقل أفضل
المشفّر النصيT5-XXLT5-Largeفهم لغوي أقوى
أقصى دقة4096px1024pxزيادة السقف 4 أضعاف
تكلفة التدريب~32 ألف دولار~28 ألف دولارتكلفة متقاربة وجودة أفضل بكثير
البنيةDiT مع انتباه محسّنDiT أساسيمُحسّن للتسلسلات الطويلة

جاء الانتقال من PixArt-α إلى Sigma من ثلاثة تغييرات متناسقة. أولًا، منح اعتماد المشفّر النصي T5-XXL النموذج فهمًا دلاليًا أغنى بكثير للأوامر النصية المعقدة. ثانيًا، أُعيد بناء خط معالجة بيانات الصور حول أزواج صورة ونص أعلى جودة مع تعليقات أدق. ثالثًا، حُسّنت آلية الانتباه داخل كتل DiT لتتعامل مع تسلسلات أطول بدقات أعلى دون أن تصبح متطلبات الذاكرة غير قابلة للإدارة.

فجوة الكفاءة

المقارنة الأهم ليست بين PixArt-Sigma وسلفه. إنها المقارنة مع النماذج التجارية التي كانت معاصرة له. عند نشر الورقة البحثية في منتصف عام 2024، كان PixArt-Sigma يقف جنبًا إلى جنب مع نماذج مثل DALL-E 3 وMidjourney v6 وStable Diffusion 3 من حيث جودة المخرجات على مجموعة واسعة من الأوامر النصية.

كانت الفجوة حقيقية لكنها لم تكن مطلقة. في البورتريهات الواقعية، ينتج Flux Dev من Black Forest Labs نتائج يفضلها معظم المستخدمين المحترفين. وفي المخرجات الأسلوبية الإبداعية، يتفوق Ideogram v3 Turbo في عرض النصوص والدقة الطباعية، وهي ميزات لا يضاهيها PixArt-Sigma. لكن في توليد المشاهد الواقعية من النص وبتكلفة بنية تحتية منخفضة، يبقى PixArt-Sigma مرجعًا مهمًا لفهم ما يمكن أن يحققه تصميم مفتوح المصدر فعّال ومبدئي.

محترفان مبدعان يتعاونان حول شاشة كبيرة تعرض مخرجات صور مولّدة بالذكاء الاصطناعي في مكتب مفتوح مشرق، ضوء طبيعي

الانفتاح يعني أكثر من كود مجاني

عندما يقول الناس إن نموذجًا "مفتوح المصدر"، فإنهم عادةً يقصدون أن أوزانه قابلة للتنزيل. مع PixArt-Sigma، يذهب الانفتاح أبعد من ذلك. كود التدريب، وبنية خط معالجة البيانات، وسكربتات التقييم، كلها متاحة للعموم على GitHub وموثّقة في الورقة البحثية المرفقة. وهذا مهم لأسباب عدة تتجاوز التكلفة.

تشغيله محليًا

يتوافق PixArt-Sigma مع مكتبة Diffusers من Hugging Face، ما يعني أن التشغيل المحلي يتبع النمط نفسه الذي تتبعه مئات النماذج الأخرى في هذا النظام البيئي. تُستضاف أوزان النموذج على Hugging Face Hub. يكتمل تشغيل نموذجي بدقة 1024 بكسل على وحدة GPU حديثة بذاكرة VRAM سعتها 24 جيجابايت في أقل من 10 ثوانٍ. للمقارنة، يتطلب Stable Diffusion 3.5 Large مواصفات أجهزة متقاربة لدقات مماثلة.

الفرق العملي للمشغّلين المحليين ضئيل من حيث الأجهزة. أما الفرق النظري فيكمن في ما يمكن فعله بالكود: يمكن تعديل PixArt-Sigma، وإعادة تدريبه انطلاقًا من checkpoint سابق، وتوسيعه دون قيود ترخيص على بنية النموذج نفسها.

صورة فوتوغرافية مطبوعة بدقة عالية تخرج من طابعة احترافية، ضوء مصباح دافئ يبرز ملمس الورق، تصوير ماكرو

التفرعات والضبوط الدقيقة من المجتمع

بما أن البنية وأسلوب التدريب موثّقان بالكامل، جذب PixArt-Sigma ضبوطًا دقيقة طوّرها المجتمع في مجالات جمالية متعددة. ضبوط مخصصة للأنمي، ونسخ بورتريه واقعية، ومحولات LoRA مخصصة لمفاهيم بعينها، دُرّبت وشُورِكت. النظام البيئي نفسه الذي أنتج آلاف الضبوط على Stable Diffusion تفاعل مع PixArt-Sigma، وإن كان ذلك على نطاق أصغر بسبب الجودة الأساسية الأعلى للنموذج المنطلق منه.

هذا أحد المجالات التي يتمتع فيها المجتمع الذي يقف خلف نماذج مثل Flux 2 Pro بميزة هيكلية: فالدعم التجاري يترجم إلى منظومة أكبر من الأدوات الرسمية، وواجهات API مُدارة، ودعم تكاملي مخصص. فريق PixArt ينشر الأبحاث، أما Black Forest Labs فتطلق منتجات. وكلاهما ذو قيمة، لكنهما يخدمان سير عمل واحتياجات مستخدمين مختلفة جوهريًا.

💡 إذا أردت تحكمًا كاملًا في كيفية ضبط نموذج بدقة لحالة استخدامك المحددة، فإن كود التدريب المفتوح يهم بقدر أهمية الأوزان المفتوحة. الأوزان تتيح لك تشغيل النموذج. أما الكود فيتيح لك أن تصبح أنت فريق النموذج.

PixArt-Sigma مقابل بقية المجال

تحرّك مجال تحويل النص إلى صورة بسرعة في عامي 2024 و2025. إليك موقع PixArt-Sigma بالنسبة إلى النماذج المتاحة حاليًا على منصات مثل PicassoIA:

النموذجالبنيةمفتوح بالكاملأبرز نقاط القوة
PixArt-SigmaDiTنعم (أوزان + كود)كفاءة التدريب، القيمة البحثية
Flux DevDiT بمطابقة التدفقالأوزان فقطالواقعية الفوتوغرافية، وجوه البشر
Stable Diffusion 3.5 LargeMM-DiTالأوزان فقطمرونة الأسلوب الإبداعي
Sana Sprint 1.6BDiT خطيالأوزانالسرعة، ومتطلبات أجهزة منخفضة
Imagen 4 Fastمغلقلادقة الأوامر النصية والاتساق
Flux ProDiT بمطابقة التدفقلاجودة المخرجات التجارية
Flux 2 ProDiT بمطابقة التدفقلادقة 4 ميغابكسل، جاهز للإنتاج

امرأة جذابة في استوديو أبيض ترتدي فستان حرير بلون الشامبانيا، إضاءة استوديو احترافية، تصوير جلسة تصوير لمجلة أزياء

الموقع الفريد لنموذج PixArt-Sigma في هذا الجدول هو الجمع بين منهجية تدريب موثّقة و_جودة مخرجات تنافسية_. معظم النماذج المفتوحة تمنحك الأوزان فقط. أما PixArt-Sigma فيمنحك معلومات كافية لإعادة إنتاج التدريب نفسه أو توسيعه بشكل ملحوظ. وهذا نوع مختلف من الانفتاح.

أين يقصّر

لا يتجاوز أي عرض أمين لنموذج PixArt-Sigma حدوده. فهم ما لا يستطيع النموذج فعله بشكل جيد لا يقل أهمية عن فهم ما يستطيع فعله.

ممر غرفة خوادم فيها خوادم مرصوصة وفني يحمل جهازًا لوحيًا، إضاءة فلورسنت زرقاء باردة، تصوير واقعي كالصور الفوتوغرافية

حدود تعقيد الأوامر النصية

يستخدم PixArt-Sigma مشفّر T5-XXL للترميز النصي، وهي ترقية مهمة. لكنه ما زال يعاني مع الأوامر متعددة الموضوعات التي تتطلب تموضعًا مكانيًا دقيقًا لعدة عناصر متفاعلة. أمر مثل "امرأة تقرأ على الجانب الأيسر من مقعد حديقة بينما يلعب طفل مع كلب على الجانب الأيمن" غالبًا ما ينتج مشهدًا يحقق جزءًا من الوصف بينما يفقد البنية المكانية.

هذا ليس حكرًا على PixArt-Sigma. إنه قيد معروف لنماذج الانتشار عمومًا. نماذج مثل RealVisXL v3.0 Turbo، المدرّبة خصيصًا على SDXL ببيانات موجهة، تحسّن هذا الأمر عبر الضبط الدقيق. لكن تحدي الاستدلال المكاني يبقى قائمًا عبر البنى المختلفة. ما تغيّر بين عامي 2024 و2025 هو أن نماذج مطابقة التدفق الأحدث مثل Flux Dev تتعامل مع هذه الأوامر بموثوقية أعلى بفضل تحسينات في البنية وتنقيح بيانات التدريب.

أسقف الدقة في الممارسة

قدرة 4096 بكسل حقيقية، لكنها تأتي مع قيود عملية لا يتوقعها معظم المستخدمين. عند أقصى دقة، يزداد زمن التشغيل بشكل ملحوظ، وتنمو متطلبات VRAM بطريقة تجعل تشغيله على وحدات GPU الاستهلاكية صعبًا. معظم المستخدمين الذين يشغّلون PixArt-Sigma محليًا يعملون بدقة 1024 بكسل أو 2048 بكسل، ثم يطبّقون أداة رفع دقة (super-resolution upscaler) كخطوة ثانية.

سير العمل ذو المرحلتين هذا هو في الواقع النهج الموصى به للاستخدام الإنتاجي: التوليد بدقة معقولة يكون فيها النموذج أكثر موثوقية، ثم رفع الدقة بنموذج مخصص. يتعامل Flux 2 Pro مع الأمر بشكل مختلف، إذ يولّد بدقة 4 ميغابكسل مع تشغيل محسّن يدير تحجيم الدقة بسلاسة أكبر عبر خيارات معمارية سبقت PixArt-Sigma.

💡 بالنسبة لمعظم سير العمل الإبداعي، فإن التوليد بدقة 1024 بكسل ثم رفع الدقة ينتج نتائج أفضل من تشغيل واحد بدقة 4096 بكسل. النموذج أكثر موثوقية في الدقات المتوسطة، وأدوات رفع الدقة المخصصة مُحسّنة تحديدًا لتلك الخطوة الثانية.

السرعة عند التوسع

PixArt-Sigma ليس نموذجًا سريعًا وفق المعايير الحالية. نماذج مثل Sana Sprint 1.6B من NVIDIA تستخدم DiT بانتباه خطي تولّد الصور في خطوة واحدة أو خطوات قليلة جدًا، ما يجعلها أسرع بمراتب عديدة. لتكرار سريع، والعصف الذهني، وسير العمل عالي الحجم، يصبح مسار الانتشار متعدد الخطوات في PixArt-Sigma عائقًا حلّته البنى الأحدث إلى حد كبير.

نماذج تدفع الحدود أبعد الآن

PixArt-Sigma نموذج بحثي. لقد تحرّك المجال منذ إطلاقه. إذا كان هدفك أفضل مخرجات ممكنة لمهمة إبداعية محددة اليوم، فهذه النماذج تستحق المعرفة:

امرأة جميلة ترتدي فستانًا بورجنديًا عند جزيرة مطبخ من الرخام مع حاسوب محمول يعرض فنًا مولّدًا بالذكاء الاصطناعي، ضوء الساعة الذهبية

Flux Dev للواقعية الفوتوغرافية

يستخدم Flux Dev من Black Forest Labs نهج مطابقة التدفق داخل بنية محوّل انتشار. النتائج للأشخاص الواقعيين، لا سيما وجوه البشر وملمس البشرة، أكثر صقلًا باستمرار من PixArt-Sigma عند المقارنة المباشرة. النسخة ذات الأوزان المفتوحة متاحة للاستخدام غير التجاري، وحجم الأعمال عالية الجودة التي شاركها الناس باستخدام Flux جعله المرجع الفعلي للواقعية الفوتوغرافية المفتوحة المصدر.

ما يتشاركه Flux Dev مع PixArt-Sigma هو أساس DiT. المسار من أبحاث PixArt المبكرة عبر تحسينات DiT المختلفة يمثل خطًا مفاهيميًا مباشرًا نحو طريقة عمل Flux. فهم PixArt-Sigma يساعد في تفسير سبب نجاح Flux بهذا الشكل: المبادئ المعمارية مترابطة، والتحسينات تدريجية ومدفوعة بالأهداف البحثية نفسها.

Stable Diffusion 3.5 للمدى الإبداعي

يستخدم Stable Diffusion 3.5 Large محوّل انتشار متعدد الوسائط (MM-DiT) يعالج رموز النص والصورة في تدفق انتباه مشترك بدلًا من ترميزها بشكل منفصل. بالنسبة للمخرجات الأسلوبية وغير الواقعية، يوفر مدى تعبيريًا أوسع من PixArt-Sigma. كما أن النظام البيئي للضبوط الدقيقة حول SD3.5 أكثر نضجًا في هذه المرحلة، مع مئات محولات LoRA للأساليب ومحولات المفاهيم المتاحة.

المقارنة بين هذين النموذجين المفتوحين توضح مدى تأثير خيارات البنية في الجماليات الناتجة. تميل مخرجات PixArt-Sigma نحو التصيير الطبيعي الواقعي الذي يعكس أولويات خط معالجة بياناته. أما SD3.5 فهو أكثر مرونة أسلوبيًا دون الحاجة إلى ضبط إضافي، لأن تدفق الانتباه المشترك يسمح لإشارات الأسلوب النصية بالتأثير في الصورة بشكل أكثر مباشرة.

منظر علوي لاستوديو وكالة إبداعية فيه مصممون أمام شاشات تعرض مشاريع صور بالذكاء الاصطناعي، جدران من الطوب المكشوف، إضاءة مصابيح إديسون

ابدأ الاستخدام الآن

إسهام PixArt-Sigma الدائم ليس في كونه أفضل نموذج متاح. إسهامه في أنه أظهر للمجتمع المفتوح المصدر أنك لا تحتاج إلى ميزانية بنية تحتية بمليارات الدولارات لإنتاج نتائج تنافسية في تحويل النص إلى صورة. قصة كفاءة التدريب التي قدّمها عام 2024 شكّلت الطريقة التي تعامل بها الجيل التالي من النماذج مع تنقيح البيانات وتحجيم الدقة والتكرار المعماري. كل نموذج قائم على DiT جاء بعده يدين بشيء لما نشره فريق PixArt.

إذا أردت تطبيق هذه الأفكار دون إعداد بيئة GPU محلية، فإن PicassoIA يتيح لك الوصول الفوري إلى النماذج التي بنت على أساس PixArt-Sigma. Flux Dev، وFlux Pro، وFlux 2 Pro، وStable Diffusion 3.5 Large متاحة كلها في مكان واحد، دون إعداد محلي، ودون قيود VRAM، ودون الحاجة إلى إعداد خاص لكل نموذج.

المبادئ نفسها التي جعلت PixArt-Sigma يستحق الدراسة، بما فيها التدريب الفعّال، والمواءمة النصية القوية، والمخرجات عالية الدقة، هي بالضبط ما عمل عليه هذه النماذج الإنتاجية وطوّرته. ابدأ التوليد. الفجوة بين فهم النظرية ورؤية ما تنتجه لا تفصلها عنك سوى أمر نصي واحد.

شابة ترتدي بيكيني عند حمام سباحة لانهائي على سطح مبنى يطل على أفق المدينة في الساعة الذهبية، تصوير احترافي لأسلوب الحياة

شارك هذا المقال

اختر لغتك

مقالات ذات صلة