غيّرت Alibaba للتو ما نتوقعه من نماذج توليد الصور المفتوحة المصدر، ولم يلاحظ معظم الناس ذلك بعد. Qwen Image ليس مجرد نموذج آخر لتحويل النص إلى صورة يتنافس على نتائج الاختبارات المعيارية. إنه بنية متعددة الوسائط تفهم السياق، وتعدّل الصور أثناء التوليد، وتُخرج نتائج تضاهي بثبات أفضل الأنظمة المملوكة في العالم. يشرح هذا المقال ماهية Qwen Image فعلًا، وكيف تعمل بنية النموذج، وما الذي تغيّر في الإصدار 2، وأين يمكنك أن تبدأ استخدامه اليوم دون كتابة أي سطر من الشيفرة.
ما هو Qwen Image فعلًا

Qwen Image هي عائلة نماذج Alibaba للرؤية واللغة متعددة الوسائط، صُمّمت لتوليد الصور وتعديلها بدقة عالية. أُطلق النموذج ضمن مظلة Qwen (Tongyi Qianwen) من قِبل أكاديمية DAMO التابعة لـ Alibaba Cloud، ويجمع بين عمود فقري من نموذج لغوي كبير ومُشفِّر بصري مخصص ومُفكِّك صور قائم على الانتشار. هذا المزيج هو ما يميّزه عن نماذج الانتشار الخالصة مثل Stable Diffusion أو Flux.
بينما تأخذ معظم نماذج الصور الأمر النصي وتمرّره عبر تمريرة توليد واحدة، يعالج Qwen Image النص وسياق الصورة والاستدلال المكاني في آنٍ واحد. النموذج لا "يرسم" الصورة من الكلمات فحسب، بل يبني تفسيرًا دلاليًا لما تريده قبل أن يُصيَّر أي بكسل.
وحدة الأبحاث الذكية في Alibaba
تنشر أكاديمية DAMO التابعة لـ Alibaba، واختصارها Discovery وAdventure وMomentum وOutlook، أبحاثها منذ عام 2017، مع تركيز على معالجة اللغة الطبيعية والرؤية الحاسوبية والذكاء الاصطناعي متعدد الوسائط. وتقع عائلة Qwen في قلب استراتيجيتها للنماذج اللغوية الكبيرة، إذ بدأت بنماذج نصية فقط قبل أن تتوسع إلى الرؤية وتوليد الصور.
يستهدف فرع توليد الصور في عائلة Qwen تحديدًا الفجوة بين اتباع التعليمات و_الجودة البصرية_، وهما أمران كانا متعارضين تاريخيًا. فالنماذج القديمة كانت إما تتبع الأوامر بدقة لكن نتائجها تبدو باهتة، أو تبدو جميلة لكنها تتجاهل نصف التعليمات.
من اللغة إلى الرؤية
تستخدم البنية مُرمِّزًا بصريًا يحوّل الصور المدخلة إلى الفضاء التضميني نفسه الذي تعيش فيه توكنات النص. وهذا هو الأساس التقني لقدرة Qwen Image على التعديل بالتعليمات. فعندما تقول للنموذج "اجعل الخلفية أغمق وأضف مطرًا"، فهو لا يشغّل أداة تعديل موضعي منفصلة، بل يعيد تفسير المشهد كاملًا وفق التعليمات المحدّثة.
💡 لهذا السبب يتعامل Qwen Image مع الأوامر متعددة الأشخاص المعقدة بشكل أفضل من كثير من النماذج المنافسة. يُفكّر مكوّن النموذج اللغوي فعليًا في العلاقات المكانية قبل التوليد.
كيف يعمل النموذج فعلًا

يعتمد Qwen Image في جوهره على عملية انتشار قائمة على مطابقة التدفق (flow matching) فوق عمود فقري من نوع Transformer. إليك المسار المبسّط:
- ترميز النص: يُقسَّم أمرك النصي إلى توكنات ويُضمَّن بواسطة نموذج Qwen اللغوي
- تكييف الرؤية: إذا قدّمت صورة مرجعية، تُرمَّز بالتوازي
- جدولة الضوضاء: يُهيّئ النموذج تمثيلًا كامنًا مشوشًا
- إزالة الضوضاء التكرارية: يصقل Transformer التمثيل الكامن تدريجيًا عبر خطوات متعددة
- فك ترميز VAE: يُفكّ ترميز التمثيل الكامن النهائي إلى صورة كاملة الدقة
صُممت هذه البنية خصيصًا لـ اتباع التعليمات على نطاق واسع. يحتوي العمود الفقري اللغوي على جزء كبير من إجمالي عدد المعاملات، ما يعني أن تفسير الأوامر لا يتدهور مع زيادة طولها أو تعقيدها.
دعم المدخلات متعددة الوسائط
يعني التصميم متعدد الوسائط أن Qwen Image يتعامل مع مدخلات لا تستطيع نماذج الانتشار الخالصة معالجتها:
| نوع المدخل | ما الذي يفعله |
|---|
| نص فقط | توليد قياسي من النص إلى الصورة |
| نص + صورة مرجعية | نقل الأسلوب أو تعديل الصورة |
| نص + قناع | التعديل الموضعي لمناطق محددة |
| صور متعددة | الدمج التركيبي |
| صورة + تعليمة تعديل | التعديل بالتعليمات |
هذا النطاق من المدخلات هو ما يفصل Qwen Image Edit عن كونه مجرد مولّد. إنه محرر يعالج اللغة الطبيعية بمستوى مساعد بشري كفء.
الإصدارات: تحويل النص إلى صورة مقابل تعديل الصور
يتفوق نموذج Qwen Image الأساسي في توليد تحويل النص إلى صورة مع التزام قوي بالأمر النصي. وتوسّع الإصدارات Qwen Image Edit وQwen Image Edit Plus هذه القدرة إلى سير عمل تعديل كامل. ويهم هذا الفرق عند الاختيار بينها:
- استخدم النموذج الأساسي عند التوليد من الصفر، أو عندما تحتاج إلى أقصى جودة بصرية لأمر نصي واحد مفصّل
- استخدم إصدارات التعديل عندما تملك صورة مصدر تريد تعديلها، أو عندما تحتاج إلى استبدال عناصر، أو عندما تعمل بشكل تكراري مع حلقات تغذية راجعة

Qwen Image 2 والإصدار 2 Pro
مثّل إطلاق Qwen Image 2 خطوة كبيرة إلى الأمام. فلم تكتفِ Alibaba بزيادة عدد المعاملات، بل أعادت بناء مسار التدريب حول تنقيح بيانات أعلى جودة ونموذج مكافأة أكثر تطورًا لمواءمة تفضيلات البشر.
ما الذي تغيّر في الإصدار 2
أبرز التحسينات في Qwen Image 2 مقارنةً بالإصدار الأول:
- مخرجات بدقة أعلى افتراضيًا، مع حفظ أفضل للتفاصيل عند 1024x1024 وما فوق
- تحسين تفكيك الأوامر: يتعامل النموذج الآن مع الأوامر الطويلة متعددة الجمل دون إسقاط الأشخاص الثانويين
- توليد أفضل للوجوه والأيدي، وهي نقطة ضعف تاريخية لنماذج الانتشار
- تشغيل أسرع للنموذج عبر تحسينات معمارية في طبقة الانتباه
- التزام أكثر اتساقًا بالأسلوب عند تقديم صور مرجعية
💡 التحسن في توليد الوجوه والأيدي وحده يجعل Qwen Image 2 يستحق الانتقال إليه في تصوير البورتريه ونمط الحياة، حيث يكون الأشخاص محور الصورة.
النسخة Pro مقابل النسخة العادية: أيهما تستخدم
Qwen Image 2 Pro هو الإصدار الأكبر والأعلى دقة. إليك متى يكون كل منهما مناسبًا:
| النموذج | الأفضل لـ | سرعة التوليد |
|---|
| Qwen Image 2 | التكرار السريع، المحتوى الاجتماعي، النماذج الأولية | أسرع |
| Qwen Image 2 Pro | المخرجات النهائية، العمل التجاري، جودة الطباعة | أبطأ |
في معظم سير العمل، يكون البدء بنموذج Qwen Image 2 لاختبار الأوامر ثم الانتقال إلى Pro للتصيير النهائي أكثر الطرق كفاءة.

جودة المخرجات في العالم الحقيقي
لا تكشف الاختبارات المعيارية إلا جزءًا من الصورة الكاملة. الاختبار الحقيقي هو أداء النموذج في أنواع الصور التي يحتاجها الناس فعلًا.
البورتريهات والأشخاص
ينتج Qwen Image مخرجات بجودة البورتريه، مع تشريح دقيق للوجه، وملمس طبيعي للبشرة، وانعكاسات صحيحة في العينين. يمنحه العمود الفقري متعدد الوسائط فهمًا أرسخ للنسب البشرية مقارنةً بنماذج مفتوحة المصدر سابقة كانت كثيرًا ما تشوّه الملامح عند تعقيد الأوامر.
في لقطات الموضة ونمط الحياة، يتعامل النموذج بشكل جيد للغاية مع ملمس الملابس: نسيج قماش مرئي، وسلوك طبيعي للانسدال، وتفاعل دقيق للضوء مع المواد المختلفة.

المناظر الطبيعية والعمارة
تظهر قدرة الاستدلال المكاني القوية بوضوح في الأوامر الجوية والطبيعية. يفسّر Qwen Image 2 Pro تعليمات مثل "وادٍ جبلي بنهر في المقدمة وغيوم عاصفة في الخلفية" على أنه مشهد متماسك مكانيًا، لا تكوين مسطّح من عناصر منفصلة.

يستفيد التوليد المعماري من تدريب النموذج على بيانات بصرية منظمة. خطوط المنظور دقيقة، وانعكاسات الواجهات الزجاجية تتبع منطقًا فيزيائيًا، وتدرجات الإضاءة على أسطح المباني تتصرف بشكل متسق مع فيزياء العالم الحقيقي.
المنتجات والعمل التجاري
في محاكاة تصوير المنتجات، يكون Qwen Image Edit Plus فعّالًا بشكل خاص. يمكنك تقديم صورة منتج واستخدام تعليمات التعديل لتغيير الخلفيات، أو ضبط الإضاءة، أو إضافة عناصر سياقية. تقلل جودة اتباع التعليمات في هذه المهمة دورات التكرار بشكل كبير مقارنةً بالتركيب اليدوي التقليدي.

كيفية استخدام Qwen Image على PicassoIA
يستضيف PicassoIA عائلة Qwen Image كاملة، ما يعني أنه يمكنك تشغيل Qwen Image وQwen Image 2 وQwen Image 2 Pro وإصدارات التعديل كلها من علامة تبويب متصفح واحدة، دون أي إعداد، ودون مفاتيح API، ودون بنية تحتية تحتاج إلى إدارة.
خطوة بخطوة على PicassoIA
الخطوة 1: اختر نموذجك
انتقل إلى Qwen Image 2 Pro للحصول على أعلى جودة للمخرجات، أو إلى Qwen Image 2 للتكرار الأسرع. لسير عمل التعديل، افتح Qwen Image Edit Plus.
الخطوة 2: اكتب أمرك النصي بتفاصيل محددة
يستجيب Qwen Image جيدًا للأوامر المفصّلة لأن العمود الفقري اللغوي يستطيع تحليل التعليمات المعقدة متعددة الجمل. ضمّن ما يلي:
- الشخص: العمر، الملابس، التعبير، الوضعية
- المحيط: داخلي أو خارجي، وقت النهار، الطقس
- الإضاءة: الاتجاه، الجودة، درجة حرارة اللون
- منظور الكاميرا: واسع، لقطة مقرّبة، جوي، زاوية منخفضة
الخطوة 3: اضبط نسبة العرض إلى الارتفاع
بالنسبة لمحتوى الويب والمدونات، تعمل نسبة 16:9 بشكل جيد مع معظم التخطيطات. يناسب المحتوى العمودي (9:16) وسائل التواصل الاجتماعي. أما المربع (1:1) فهو نظيف لصور المنتجات والصور المصغّرة.
الخطوة 4: وَلِّد وكرّر
شغّل توليدًا أول لتقييم تفسير الأمر، ثم حسّنه. إذا أُسقط شخص ثانوي، فانقله إلى بداية الأمر. وإذا كانت الألوان غير دقيقة، فكن أكثر وضوحًا في الصفات ("طوبي ترابي باهت" بدلًا من "برتقالي").
الخطوة 5: حسّن باستخدام إصدارات التعديل
إذا كان التوليد الأساسي قريبًا لكنه يحتاج إلى تغييرات موجهة، فارفعه إلى Qwen Image Edit Plus واكتب تعليمة تعديل بلغة بسيطة. يفهم النموذج صيغًا طبيعية مثل "اجعل الخلفية أدفأ" أو "استبدل السترة بمعطف".

نصائح لنتائج أفضل
💡 يستجيب Qwen Image لأوصاف الكاميرا والإضاءة بشكل أفضل من معظم النماذج المفتوحة المصدر. إضافة "85mm f/1.8، صندوق إضاءة octabox للاستوديو، ISO 200" إلى أمرك، حتى للموضوعات غير الفوتوغرافية، يساعد النموذج على ضبط الواقعية.
- تجنّب الصفات المجردة وحدها: كلمة "جميل" لا تعطي النموذج شيئًا، أما "إضاءة خلفية دافئة في الساعة الذهبية على بشرة مشمسة" فتمنحه اتجاهًا
- استشهد بأساليب تصوير حقيقية: عبارات مثل "بأسلوب صفحة مزدوجة من مجلة Condé Nast Traveler من فترة 1990s" أو "بأسلوب وثائقي من National Geographic" تمنح مرتكزات أسلوبية قوية
- استخدم مدرّب LoRA للشخصيات المتسقة: يتيح Qwen Image LoRA Trainer الضبط الدقيق على مجموعات صور مخصصة لتحقيق جماليات شخصيات أو علامات تجارية قابلة للتكرار
- جرّب عدة توليدات: شغّل من 3 إلى 4 قيم بذرة قبل تغيير الأمر النصي. يتمتع النموذج بتباين كافٍ بحيث تنتج القيم المختلفة غالبًا تكوينات مختلفة بشكل كبير
Qwen Image مقابل النماذج المنافسة

من الأفضل أن نكون صريحين بشأن موقع Qwen Image مقارنةً بالبدائل التي ربما استخدمتها.
| النموذج | اتباع الأوامر | الواقعية | التعديل | أوزان مفتوحة |
|---|
| Qwen Image 2 Pro | ممتاز | عالية جدًا | متعدد الوسائط أصلي | نعم |
| Midjourney v6 | جيد | عالية جدًا | إعادة المزج فقط | لا |
| DALL-E 3 | ممتاز | عالية | تعديل موضعي محدود | لا |
| Stable Diffusion XL | متوسط | عالية | عبر الإضافات | نعم |
| Flux 1.1 Pro | جيد جدًا | عالية جدًا | لا يوجد تعديل أصلي | جزئيًا |
الفرق الأبرز هو التعديل متعدد الوسائط الأصلي. يملك Midjourney خيارات إعادة المزج، ويملك DALL-E واجهة تعديل موضعي، لكن لا أيٌّ منهما يضاهي Qwen Image Edit Plus في التعديلات المعقدة التي تريد فيها تغيير عناصر محددة مع الحفاظ على كل ما عداها في الإطار.
تهم الأوزان المفتوحة عمليًا أيضًا. تُطلق نماذج Qwen Image مع أوزان متاحة للاستخدام البحثي، ما يعني أن منظومة الإصدارات المضبوطة بدقة ومحولات LoRA والمسارات المتخصصة تنمو عبر مساهمات المجتمع، لا عبر إصدارات Alibaba وحدها.
لماذا تهم الأوزان المفتوحة لهذا النموذج
ليس إطلاق Alibaba لأوزان النموذج مجرد خطوة تموضعية. إنه يسرّع تطوير إصدارات متخصصة لا تستطيع أي شركة واحدة بناءها وحدها. يُعد Qwen Image LoRA Trainer على PicassoIA نتيجة مباشرة لذلك، إذ يمنح المستخدمين القدرة على الضبط الدقيق للنموذج الأساسي على جماليات أو شخصيات أو أنواع منتجات محددة دون الاقتراب من البنية التحتية.
تظهر checkpoints مضبوطة بدقة بانتظام في مجتمع مفتوح المصدر، تغطي أساليب تصوير محددة، وجماليات ثقافية، وتطبيقات صناعية لا يتخصص فيها النموذج الأساسي. يراكم هذا قيمة النموذج مع الوقت بطريقة لا تستطيع النماذج المغلقة والمملوكة مجاراتها.
بالنسبة للمستخدمين التجاريين، تقلل الأوزان المفتوحة من الارتهان للمورّد. فأنت لا تراهن بخط إنتاجك على واجهة API واحدة تبقى متاحة وبسعر معقول. يمكن استضافة Qwen Image ذاتيًا، وتكييفه، وتوسيعه بشكل مستقل.
💡 الجمع بين أداء أساسي قوي والأوزان المفتوحة هو بالضبط ما يجعل هذه السلسلة من النماذج تستحق البناء عليها. كل إصدار من Alibaba يرفع سقف ما يمكن تحقيقه دون بنية تحتية مملوكة.
ابدأ الإبداع مع Qwen Image الآن
كل صورة في هذا المقال وُلّدت بنماذج توليد صور واقعية بالذكاء الاصطناعي متاحة عبر PicassoIA. التقنية جاهزة للإنتاج، وحاجز الدخول أقل مما كان عليه في أي وقت مضى.
يمنحك PicassoIA وصولًا مباشرًا عبر المتصفح إلى Qwen Image وQwen Image 2 وQwen Image 2 Pro وQwen Image Edit Plus وLoRA Trainer، دون إدارة أي بنية تحتية أو رموز API.
اختر موضوعًا، واكتب أمرًا نصيًا مفصّلًا، وشغّل أول توليد لك. أصبحت الفجوة بين ما تستطيع تخيله وما تستطيع إنتاجه فعلًا أصغر من أي وقت مضى. Qwen Image 2 Pro في انتظارك.