شهد مجال توليد الصور بالذكاء الاصطناعي لاعبًا جديدًا جادًا يستحق الانتباه. يمثل Tongyi Wanxiang 2.6 من Alibaba Cloud أحدث إصدار من واحدة من أقوى منصات تحويل النص إلى صورة في الصين، وتحسيناته في هذا الإصدار كبيرة إلى حد يجعل المحترفين المبدعين يعيدون التفكير في أدوات الذكاء الاصطناعي غير الغربية. سواء كنت تنتج محتوى لأسواق آسيوية، أو تبني مسارات إبداعية متعددة اللغات، أو تريد ببساطة معرفة اتجاه تطور هذا المجال، فإن Wanxiang 2.6 يستحق نظرة واضحة وموضوعية.

ما هو Tongyi Wanxiang 2.6 فعليًا
يُترجم اسم Tongyi Wanxiang (通义万象) تقريبًا إلى "رؤية شاملة للمعنى" باللغة الصينية، وهو اسم طموح بشكل مناسب لمنصة مصممة للتعامل مع كل شيء، من توليد الصور الواقعية فوتوغرافيًا إلى توليد الفيديو وفهم المحتوى متعدد الوسائط.
يقوم الإصدار 2.6 على أساس عائلة Tongyi الأوسع من نماذج الذكاء الاصطناعي التابعة لـ Alibaba، والتي تشمل النماذج اللغوية الكبيرة، والتعرف على الكلام، وأدوات توليد الفيديو. وهو ليس تطبيقًا استهلاكيًا مستقلًا، بل منصة تعتمد على واجهة البرمجة (API) أولًا، وموجهة لمطوري المؤسسات وصناع المحتوى ومطوري المنصات داخل منظومة Alibaba Cloud.
البنية التي تقف خلفه
يستخدم Tongyi Wanxiang 2.6 بنية قائمة على الانتشار (diffusion) مع مكونات من نوع المحوّل (transformer)، وهي مشابهة في المبدأ للطريقة التي تعمل بها نماذج مثل Stable Diffusion 3. ما يميزه هو مجموعة بيانات التدريب، التي تتضمن بكثافة صورًا عالية الجودة باللغة الصينية، ومراجع بصرية ذات خصوصية ثقافية، وتكييفًا للأوامر النصية متعددة اللغات.
يهم هذا عمليًا. عندما تكتب أمرًا نصيًا بالصينية أو تشير إلى مفاهيم ذات خصوصية ثقافية، يُظهر النموذج توافقًا أفضل بشكل ملحوظ مقارنة بالبدائل المدربة في الغرب. تُصيَّر أساليب الأنمي الياباني، وأساليب الرسم الصيني التقليدي بالحبر، والمراجع المعمارية في شرق آسيا، بدقة أعلى بوضوح مقارنة بالنماذج المدربة في الغالب على بيانات الويب باللغة الإنجليزية.
طموح Alibaba في الذكاء الاصطناعي
يندرج Tongyi Wanxiang ضمن الاستراتيجية الأوسع للذكاء الاصطناعي في Alibaba Cloud. فالبنية التحتية نفسها التي تشغّل منصات التجارة الإلكترونية في Alibaba، بما في ذلك توليد صور المنتجات في الوقت الفعلي والإنتاج الإبداعي الآلي على نطاق واسع، تدفع الاستثمار المستمر في قدرات التوليد البصري. ويعالج الإصدار 2.6 تحديدًا ثلاثة مجالات أقرّ الفريق علنًا بأنها نقاط ضعف في الإصدارات السابقة: وضوح النص في الصور المولّدة، والالتزام بالأوامر النصية للمشاهد المعقدة ذات الأشخاص المتعددين، والاتساق في المخرجات عالية الدقة التي تتجاوز دقة 2K.

ما الذي تغيّر في الإصدار 2.6
نص أوضح في الصور المولّدة
من أكثر المشكلات استمرارًا في جميع مولّدات الصور بالذكاء الاصطناعي مشكلة عرض النصوص. فغالبًا ما تظهر الكلمات والحروف داخل الصور المولّدة غير واضحة، أو مشوّشة، أو غير متسقة من حيث الأسلوب. ويُظهر Tongyi Wanxiang 2.6 تحسنًا قابلًا للقياس في هذا الجانب.
أصبح النموذج قادرًا الآن على عرض عبارات نصية قصيرة وأسماء العلامات التجارية واللافتات بدقة عندما يُطلب ذلك صراحةً. وهذا مهم للتطبيقات التجارية مثل نماذج المنتجات الأولية، وأصول المحتوى الإبداعي لوسائل التواصل الاجتماعي، والمواد الإعلانية التي يكون فيها النص الواضح أمرًا لا غنى عنه.
💡 نصيحة عملية: حتى مع هذه التحسينات، يُنتج الإبقاء على النص داخل الصورة في حدود 3 إلى 5 كلمات نتائج أفضل باستمرار. لا تزال الجمل المعقدة تفقد وضوحها عند الأحجام الصغيرة.
تكوين أفضل للمشاهد متعددة الأشخاص
كانت الإصدارات السابقة تواجه صعوبة عندما تصف الأوامر مشاهد فيها عدة أشخاص أو أجسام متمايزة تتطلب علاقات مكانية دقيقة. يقدم الإصدار 2.6 آليات انتباه مكاني محسّنة تؤدي إلى فصل أنظف بين الأشخاص والأجسام، وعرض أدق للعلاقات الموصوفة مثل "امرأة تقف خلف رجل جالس على طاولة".
يؤثر هذا التحسن مباشرة في حالات التصوير الفوتوغرافي التجاري، وجلسات الأزياء، وصور أسلوب حياة المنتجات، حيث يكون التحكم في التكوين أساسيًا.
التعامل مع الدقة فوق 2K

يدعم Wanxiang 2.6 التوليد الأصلي بدقة تصل إلى 4096 x 4096 بكسل في أوضاع إخراج معينة، مع تحسن في اتساق التفاصيل عند الأحجام الأكبر. كانت الإصدارات السابقة تُظهر تدهورًا كبيرًا في التفاصيل الدقيقة مثل ملمس الأقمشة، ومسام الجلد، وخصلات الشعر عند تكبير الصور أو توليدها بأبعاد كبيرة.
التحسن واضح: تُظهر اقتطاعات البورتريه المقرّبة من توليدات 4K تفاصيل على مستوى المسام في الجلد، ووضوحًا لكل خصلة شعر، وأنماط نسج للأقمشة كانت تتطلب سابقًا أدوات رفع دقة بعد الإنتاج لتحقيقها.
كيف يقارن بالمنافسة
هنا يكون السياق أهم ما في الأمر. Tongyi Wanxiang 2.6 لا يوجد بمعزل عن غيره. إنه يقع في سوق مزدحم بأنظمة تحويل النص إلى صورة عالية الكفاءة، وقصة المقارنة أكثر دقة من مجرد ترتيب بسيط.
في مواجهة النماذج الغربية الرائدة
يحكي الجدول قصة مثيرة. بالنسبة للواقعية الفوتوغرافية متعددة الأغراض مع سهولة الوصول، لا يزال Flux 1.1 Pro Ultra Finetuned وGPT Image 2 أقوى الأداءات بشكل عام للمحتوى المتمحور حول الغرب. أما ما يتفوق فيه Wanxiang 2.6 فهو المحتوى ذو الخصوصية الثقافية ومنظومة التكامل مع خدمات Alibaba السحابية.

في مواجهة المنافسين الصينيين في الذكاء الاصطناعي
المنافسة الأكثر إثارة للاهتمام تجري داخل منظومة الذكاء الاصطناعي الصينية نفسها.
Seedream 4.5 من ByteDance برز كمنافس جاد، مع أداء قوي بشكل خاص في مخرجات 4K والتنوع الإبداعي. ميزة ByteDance هي خط بيانات TikTok وDouyin الإبداعي، الذي يمنح Seedream توافقًا قويًا مع الاتجاهات البصرية المعاصرة.
Hunyuan Image 2.1 من Tencent ينافس مباشرة في مجال الوسائط المتعددة للمؤسسات. ويتمتع Hunyuan تاريخيًا بتكامل أقوى مع منظومة المحتوى في WeChat، بينما يرتبط Wanxiang 2.6 بروابط أعمق مع منصات التجارة الإلكترونية والبنية السحابية في Alibaba.
Dreamina 3.1 من ByteDance يستهدف فئة التصوير السينمائي بدقة 4 ميغابكسل، ويُظهر نتائج تنافسية في الصور التحريرية وصور الأزياء.
المنافسة الثلاثية بين Alibaba وByteDance وTencent تدفع تحسينات كبيرة في القدرات بوتيرة يغفلها كثير من المراقبين الغربيين.
💡 يستحق المعرفة: هذه النماذج الصينية للذكاء الاصطناعي متاحة كلها عبر منصة PicassoIA، ما يعني أنه يمكنك تجربتها دون الحاجة إلى التعامل مع عقود API للمؤسسات أو حسابات سحابية في منطقة الصين.
ما الذي يجيده Wanxiang 2.6 فعليًا
أشخاص واقعيون فوتوغرافيًا
توليد البورتريه في Wanxiang 2.6 قوي حقًا، خاصة للأشخاص من شرق آسيا. يتمتع النموذج بتمثيل تدريبي أفضل بكثير للملامح الوجهية المتنوعة من شرق آسيا، وألوان البشرة، وأنواع الشعر، مقارنة بالنماذج المدربة في الغالب على مجموعات بيانات باللغة الإنجليزية.
بالنسبة للعلامات التجارية أو صنّاع المحتوى الذين ينتجون محتوى للأسواق الناطقة بالصينية، فهذه ليست ميزة بسيطة. فقد تطلّب توليد صور واقعية كالصور الفوتوغرافية لأسلوب الحياة، وصور وضع المنتجات، ومحتوى الأزياء يضم أشخاصًا آسيويين بجودة ثابتة، في الماضي، معالجة لاحقة كبيرة أو نماذج متخصصة خضعت للضبط الدقيق.

التعامل مع الأساليب التقليدية
يتميز النموذج في التعامل مع الأساليب البصرية الصينية التقليدية بوضوح أكبر من أي بديل غربي:
- الرسم بالحبر (水墨画): تنتج الأوامر النصية الخاصة به نتائج تحمل طابع ضربات الفرشاة الأصيل والتدرج اللوني
- العمارة التقليدية، بما في ذلك مباني عصر تانغ وسونغ، تُصيَّر بنسب تاريخية دقيقة
- صور المهرجانات والاحتفالات (مهرجان الفوانيس، وعيد الربيع، ومهرجان منتصف الخريف) تُظهر تكوينًا واعيًا ثقافيًا
- المنسوجات التقليدية، بما في ذلك أنماط تطريز الحرير وتفاصيل أقمشة الهانفو، تُظهر دقة عالية
يمتد هذا إلى المراجع الجمالية اليابانية والكورية أيضًا، وإن كان بقدر أقل من الاتساق مقارنة بالمحتوى الصيني الثقافي الخالص.
تصوير منتجات التجارة الإلكترونية

يُعد هذا بلا شك أقوى تطبيق عملي لنموذج Wanxiang 2.6. فالنشاط الأساسي لـ Alibaba هو التجارة الإلكترونية، وقد جرى تحسين النموذج صراحةً لحالات التصوير التجاري للمنتجات.
تُظهر النتائج المولّدة لصور المنتجات بأسلوب الحياة، وصور المنتجات على خلفية بيضاء نظيفة، وصور المنتجات في سياقها، جودة تجارية قوية مع تحكم متسق في الإضاءة ودقة في خصائص أسطح المواد. بالنسبة للبائعين على Taobao وTmall أو منصات Alibaba الدولية، لهذه الوظيفة تأثيرات مباشرة على الإيرادات.
أين لا يزال يعاني
سهولة الوصول لمطوري العالم
هذا هو القيد العملي الأكبر. يُتاح Tongyi Wanxiang 2.6 بشكل أساسي عبر واجهة DashScope API من Alibaba Cloud، والتي تتطلب:
- رقم هاتف صيني أو حساب Alibaba Cloud موثّق للوصول الكامل
- توثيقًا مكتوبًا في الغالب بالصينية مع ترجمة إنجليزية جزئية
- تسعيرًا مبنيًا على اليوان الصيني مع تعقيدات في الفوترة الدولية
- اعتبارات زمن الاستجابة للمستخدمين البعيدين جغرافيًا عن مناطق خوادم Alibaba
بالنسبة للمطورين خارج الصين، فإن الحصول على وصول إنتاجي إلى Wanxiang 2.6 ينطوي على احتكاك لا تفرضه واجهات برمجة التطبيقات الغربية المماثلة. وهذا عائق حقيقي أمام التبني بغض النظر عن الجودة التقنية للنموذج.
اختلافات هندسة الأوامر النصية

سيجد المستخدمون المعتادون على أساليب الأوامر النصية المحسّنة لـ Flux Kontext Dev أو Wan 2.7 Image Pro أن Wanxiang 2.6 يتطلب تعديلات في الأوامر النصية. يستجيب النموذج بشكل مختلف لمحددات الجودة ذات الطابع الغربي مثل "Kodak Portra" أو "Leica lens"، ويستفيد من بناء المشهد الوصفي الأكثر تفصيلًا بدلًا من تكديس الكلمات المفتاحية.
الأوامر النصية الإنجليزية تعمل، لكن أفضل أداء للنموذج يأتي من:
- أوصاف مكانية أكثر وضوحًا لتخطيط المشهد
- مصطلحات فنية صينية مكتوبة بالحروف اللاتينية
- أوصاف للإضاءة بدلًا من مراجع الكاميرات أو الأفلام الغربية
- أوامر نصية أطول ومنظمة بدلًا من قوائم الكلمات المفتاحية القصيرة
التشريح والوضعيات المعقدة
مثل معظم نماذج الانتشار من الجيل الحالي، لا يزال Wanxiang 2.6 يعاني من التشريح البشري المعقد في الوضعيات غير المعتادة. يمكن أن تُنتج الأيدي والأقدام والتفاعلات بين أشخاص عدة في تشكيلات تتطلب جهدًا بدنيًا أخطاء تشريحية تحتاج إلى إعادة توليد أو تصحيح بالتعديل الموضعي. هذا قيد على مستوى الصناعة وليس خاصًا بنموذج Wanxiang، لكنه يستحق المعرفة قبل الاعتماد عليه في خط إنتاج.
التحول الأوسع في 2027: الذكاء الاصطناعي الآسيوي

يعكس تطور Tongyi Wanxiang وSeedream وHunyuan والمنصات المشابهة تحولًا أوسع في مشهد الذكاء الاصطناعي. فللمرة الأولى، أصبحت نماذج توليد الصور غير الغربية منافسة للمستوى العالمي الأول في مقاييس الجودة العامة، مع تقديم مزايا حقيقية في سياقات ثقافية وتجارية محددة.
هذه ليست قصة لحاق بالركب. فنماذج مثل Seedream 4.5 وWanxiang 2.6 تنتج نتائج تصمد أمام Flux 1.1 Pro Ultra Finetuned وGPT Image 2 في المقارنات المباشرة على معايير جودة الصور القياسية.
تداعيات ذلك على الإنتاج الإبداعي العالمي كبيرة:
- فرق الإبداع متعددة اللغات أصبح لديها الآن أدوات ذكاء اصطناعي تفهم سياقها الثقافي دون الحاجة إلى حلول بديلة بجماليات غربية
- إنتاج المحتوى للأسواق الآسيوية يمكن أن يتم بأدوات بُنيت خصيصًا لهذه المفردات البصرية
- مشترو الذكاء الاصطناعي للمؤسسات في منطقة آسيا والمحيط الهادئ لديهم بدائل حقيقية لمزودي الذكاء الاصطناعي السحابي الغربيين بجودة مماثلة
💡 التحول الحقيقي: لقد أُغلقت فجوة الجودة بين مولّدات الصور بالذكاء الاصطناعي الصينية والغربية فعليًا في 2027. أصبح التمايز الآن يتعلق بسهولة الوصول، ومنظومة التكامل، والتخصص الثقافي، ونقاط القوة المحددة في القدرات، وليس بجودة المخرجات الخام.
لماذا يهم التدريب متعدد الوسائط هنا
يُعد Tongyi Wanxiang 2.6 جزءًا من بنية ذكاء اصطناعي متعدد الوسائط أوسع طورتها Alibaba للتعامل مع فهم النص والصورة والصوت والفيديو ضمن عائلة نماذج موحدة. يتجه المجال بأكمله بشكل متزايد نحو هذا النهج، الذي تشارك فيه الوسائط المختلفة التمثيلات وإشارات التدريب.
الفائدة العملية لتوليد الصور تحديدًا هي الفهم الدلالي الأفضل للأوامر النصية. فعندما تصف "وعاء من الأرز المطبوخ حديثًا يتصاعد منه البخار، مصوّر لقائمة مطعم"، يمتلك النموذج متعدد الوسائط فهمًا سياقيًا لمعنى تصوير قوائم المطاعم بصريًا، وليس مجرد تسمية نصية. وهذا جزء من سبب تعامل Wanxiang 2.6 بهذا الإتقان مع تصوير الأطعمة وصور أسلوب الحياة ذات الخصوصية الثقافية.
أفضل البدائل المتاحة الآن

بما أن الوصول المباشر إلى Tongyi Wanxiang 2.6 ينطوي على احتكاك كبير لمعظم المستخدمين حول العالم، فإن هذه البدائل توفر إمكانات مماثلة، وفي بعض الحالات أداءً أفضل لحالات استخدام محددة.
أفضل الخيارات للمخرجات الواقعية فوتوغرافيًا
GPT Image 2 من بين أقوى النماذج المتاحة حاليًا للمخرجات الواقعية فوتوغرافيًا، مع عرض دقيق للنصوص والتزام قوي بالأوامر النصية عبر مجموعة واسعة من الموضوعات.
Flux 1.1 Pro Ultra Finetuned يقدم مخرجات بدقة 4 ميغابكسل مع تفاصيل دقيقة استثنائية على الجلد والأقمشة وملمس الأسطح، ما يجعله الخيار المناسب لتصوير البورتريه والمنتجات.
Wan 2.7 Image Pro يوفر توليدًا بدقة 4K مع تعامل قوي مع المشاهد المعقدة والتفاصيل البيئية.
للجماليات الشرق آسيوية تحديدًا
Qwen Image Edit Plus من فريق Qwen التابع لـ Alibaba متاح على PicassoIA ويشترك في جذور معمارية مع عائلة Tongyi. يقدم أداءً قويًا في الصور ذات الطابع الثقافي الآسيوي مع قدرات تعديل مدمجة، مما يجعله أقرب قريب متاح للوصول إلى Wanxiang 2.6.
Seedream 4.5 من ByteDance يتمتع بجودة استثنائية للأساليب الجمالية الشرق آسيوية، إلى جانب واقعية فوتوغرافية عامة قوية بأحجام مخرجات 4K.
Hunyuan Image 2.1 من Tencent يوفر بديلًا تنافسيًا مباشرًا بمخرجات 2K قوية ومعالجة موثوقة للجماليات الثقافية.
عندما تكون السرعة أهم من الدقة
Gemini 2.5 Flash Image هو الخيار الأفضل عندما تكون سرعة التوليد هي الأهم، بمخرجات سريعة جدًا مناسبة للتكرار السريع على المفاهيم وتجارب الأوامر النصية المتعددة.
ابدأ الإبداع بهذه النماذج اليوم
النماذج الواردة في هذا المقال متاحة الآن على PicassoIA. لا تحتاج إلى حساب Alibaba Cloud، ولا إلى رقم هاتف صيني، ولا إلى عقد API للمؤسسات لتبدأ في توليد صور واقعية فوتوغرافيًا بقدرات تضاهي Tongyi Wanxiang 2.6 أو تساويه في معظم حالات الاستخدام.
سواء كنت تنتج تصوير منتجات لسوق آسيوي، أو تولّد بورتريهات بتوافق جمالي شرق آسيوي، أو تختبر كيف تتعامل مولّدات الصور الحديثة بالذكاء الاصطناعي مع الأوامر ذات الخصوصية الثقافية، فإن PicassoIA يضع أكثر من 90 نموذجًا لتحويل النص إلى صورة بين يديك عبر واجهة واحدة سهلة الوصول.
ابدأ مع Qwen Image Edit Plus إذا أردت أقرب نظير معماري لـ Tongyi Wanxiang متاح خارج منظومة Alibaba. جرّب Seedream 4.5 للحصول على مخرجات عالية الدقة مع جودة جمالية شرق آسيوية قوية. أو انتقل مباشرة إلى Flux 1.1 Pro Ultra Finetuned للحصول على أعلى واقعية فوتوغرافية خام متاحة بدقة 4 ميغابكسل.
الجودة موجودة. والوصول فوري. كل ما تحتاجه هو أمر نصي.