Flux Kontext: شرح توليد الصور بالذكاء الاصطناعي عبر الصور المرجعية

Flux Kontext هو نظام الذكاء الاصطناعي من Black Forest Labs الذي يستخدم الصور المرجعية لتوليد مخرجات متسقة ومطابقة للأسلوب. سواء كنت تعيد إنتاج شخصية عبر مشاهد متعددة، أو تحافظ على هوية بصرية، أو تدمج صورتين في صورة واحدة، يشرح هذا المقال بالتفصيل كيف تعمل التقنية، وأي إصدار من Kontext تستخدم لسير عملك المحدد.

Flux Kontext: شرح توليد الصور بالذكاء الاصطناعي عبر الصور المرجعية
Cristian Da Conceicao
مؤسس Picasso IA

معظم مولّدات الصور بالذكاء الاصطناعي تتجاهل صورتك المرجعية بمجرد أن تضغط على التوليد. أما Flux Kontext فيفعل العكس. إنه يتعامل مع صورة المرجع كمرساة بنيوية، فيستخلص الهوية والأسلوب والتكوين مباشرة من صورتك المرفوعة ويدمجها في المخرجات. والنتيجة شيء لم تستطع الأوامر النصية وحدها تقديمه من قبل: اتساق بصري حقيقي عبر مشاهد وظروف إضاءة وسياقات مختلفة.

مساحة عمل الذكاء الاصطناعي مع سير عمل الصورة المرجعية على حاسوب محمول

ما هو Flux Kontext فعليًا

Flux Kontext هو عائلة من نماذج توليد الصور بالذكاء الاصطناعي طورتها Black Forest Labs، الفريق الذي يقف وراء بنية FLUX.1 الأصلية. أُطلق Kontext في عام 2025، وصُمّم خصيصًا لمعالجة إحدى أصعب المشكلات في توليد الصور بالذكاء الاصطناعي: الحفاظ على الشخص أو الشخصية أو الأسلوب البصري متسقًا عبر عدة صور مولّدة.

تتعامل نماذج تحويل النص إلى صورة التقليدية مع كل توليد كصفحة بيضاء. تكتب أمرًا نصيًا، فيهلوس النموذج صورة، ولا تملك الشخصية أو الجسم الذي ظهر في مخرجك السابق أي تأثير مباشر على المخرج التالي. يكسر Kontext هذا النمط بقبول صورة مرجعية واحدة أو أكثر كمدخل، ثم يبني عملية التوليد على ما يراه في تلك الصور.

المشكلة التي صُمم لحلها

كل من حاول بناء شخصية متسقة لكتاب مصوّر أو حملة علامة تجارية أو سلسلة على وسائل التواصل يعرف هذا الإحباط. تولّد بورتريهًا جميلًا من المحاولة الأولى، ثم تقضي ساعات في تعديل الأوامر النصية محاولًا الحصول على الوجه نفسه بملابس أو مكان مختلف. يتغير الوجه، ويتغير الشعر، وتنجرف الهوية بأكملها.

💡 صُمم Kontext لهذا السيناريو تحديدًا. غذِّه بصورتك المرجعية مرة واحدة، وسيحمل تلك الهوية البصرية إلى كل توليد جديد، مهما اختلف المشهد الجديد.

لا ينطبق هذا على الشخصيات وحدها. يستفيد تصوير المنتجات، والتصيير المعماري، وجلسات التصوير للأزياء، وأي سير عمل إبداعي يتطلب اتساقًا بصريًا عبر مخرجات متعددة، مباشرةً من تكييف الصورة المرجعية. كانت المشكلة دائمًا أن اللغة وسيلة غير دقيقة لوصف الهوية البصرية. فعبارة "شعر بني، وعظام وجنتين بارزة، وعينان لوزيتان" أقل تحديدًا بكثير من أن تُري النموذج صورة فوتوغرافية.

من بناه ومتى

أطلقت Black Forest Labs عائلة Kontext إلى جانب سلسلة FLUX.1 الحالية في أوائل عام 2025. دُرّبت النماذج على مجموعات بيانات كبيرة من الصور المزدوجة، ما علّم البنية استخلاص سمات بصرية محددة من المدخلات المرجعية والحفاظ عليها، مع الاستجابة بمرونة لتعليمات الأوامر النصية. هذا التكييف المزدوج، نص وصورة معًا، هو ما يميّز Kontext عن أدوات تحويل الصورة البسيطة التي تمزج مدخلك بأمر نصي جديد فقط. Kontext يقرأ المرجع، ولا يكتفي بنسخه.

صور مرجعية متعددة معروضة على شاشات استوديو تُظهر الاتساق

كيف يعمل توليد الصور المرجعية

تختلف آلية Kontext بشكل ملحوظ عن توليد تحويل الصورة إلى صورة المعتاد. فهم الفرق يساعدك على استخدامه بقصد أكبر والحصول على نتائج أفضل من التوليد الأول.

تكييف الصورة مقابل الأوامر النصية

في نموذج تحويل النص إلى صورة القياسي، يكون أمرك النصي هو التعليمة الوحيدة. يفسّر النموذج الكلمات ويربطها بالمفاهيم البصرية التي تعلمها أثناء التدريب. في Kontext، تصبح صورتك المرجعية قناة تعليمات ثانية تعمل بالتوازي مع أمرك النصي.

يُرمّز النموذج صورتك المرجعية إلى تمثيل كامن، أي يضغطها في ملخص رياضي كثيف لما تحويه: هندسة الوجه، ولوحة الألوان، وظروف الإضاءة، وأنماط الملمس، والصفات الأسلوبية. يُغذّى هذا الترميز إلى عملية التوليد جنبًا إلى جنب مع توكنات نصك.

الأثر العملي: عندما تكتب "ضع هذه الشخصية في شارع طوكيو ممطر ليلًا"، يملك النموذج بالفعل تمثيلًا داخليًا غنيًا لهوية هذه الشخصية. لا يحتاج إلى التخمين. إنه يستخدم ترميز المرجع للحفاظ على الهوية البصرية للشخصية أثناء استجابته لوصف المشهد الجديد.

ما يراه النموذج عندما ترفع مرجعًا

لا يقوم Kontext بعملية نسخ ولصق بسيطة. لا يستخرج البكسلات من مرجعك ويطبعها على المخرج. بدلًا من ذلك، يولّد صورة جديدة تلتقط جوهر الأصل مع الاستجابة لسياق جديد.

هذا التمييز مهم لأن المخرجات تبدو متماسكة بدلًا من أن تبدو تركيبات رديئة. فكّر فيما يتغير وما يبقى ثابتًا:

  • تتكيّف الإضاءة مع سياق المشهد الجديد تلقائيًا
  • تتغير الوضعية والتكوين وفقًا لتعليمات أمرك النصي
  • تبقى ملامح الوجه والهوية متسقة حتى مع زوايا وتعبيرات مختلفة
  • يمكن استبدال الملابس والإكسسوارات مع بقاء الوجه ونوع الجسم ثابتين عبر التوليدات
  • يمكن نقل الأسلوب والجمالية إلى موضوعات جديدة تمامًا إذا رغبت

النموذج يقرأ المعنى من مرجعك، ولا ينسخ البكسلات. لهذا تستطيع المخرجات أن تُظهر الشخصية نفسها وهي تضحك في مقهى وتبدو جادة في غابة، محافظةً على الهوية عبر حالات عاطفية وسياقات بيئية مختلفة تمامًا.

لماذا لا تكفي النصوص وحدها للاتساق

وصف الوجه بالنص فيه فقدان جوهري. اللغة الطبيعية لا تملك المفردات الكافية لالتقاط النسب الدقيقة، أو الدرجة المحددة للون عينيّ شخص ما، أو الطريقة الدقيقة في ترتيب ملامحه. قد تصف عبارة "عظام وجنتين بارزة" آلاف الوجوه المختلفة، بينما تصف صورة فوتوغرافية لوجه محدد وجهًا واحدًا بالضبط.

هذه هي الفكرة الجوهرية وراء توليد الصور المرجعية: المعلومات البصرية أكثر كثافة من النص. صورة بورتريه واحدة تحمل معلومات هوية أكثر مما يحمله أي فقرة وصفية. وصُمم Kontext للاستفادة من هذه الكثافة، فيستخدمها كقيد دقيق على عملية التوليد.

الإدخال الفردي مقابل متعدد الصور

يأخذ Flux Kontext Max هذا الأمر خطوة أبعد، إذ يقبل صورًا مرجعية متعددة في الوقت نفسه. يفتح ذلك سير عمل لم يكن ممكنًا من قبل:

  • غذِّ النموذج بصورتي بورتريه واطلب منه دمج عناصرهما البصرية في وجه جديد
  • قدّم صورة شخصية مع صورة خلفية واطلب تركيبة مشهد متسقة
  • قدّم ثلاثة مراجع للأزياء واطلب إطلالة جديدة تمزج عناصر التصميم من كل منها

التكييف متعدد الصور قوي بشكل خاص للمخرجين الإبداعيين ومطوري الألعاب وفرق العلامات التجارية الذين يحتاجون إلى دمج مراجع من مصادر متعددة في مخرج واحد متسق.

امرأة عند مسبح لا متناهي تمثل توليد بورتريه متسق بالذكاء الاصطناعي

Flux Kontext Dev مقابل Pro مقابل Max مقابل Fast

تضم عائلة Kontext أربعة نماذج، لكل منها استخدامات مستهدفة وتوازنات مختلفة بين السرعة والجودة والمرونة.

النموذجالاستخدام الأمثلالسرعةالجودةمتعدد الصور
Flux Kontext Fastالتكرار السريع، المسوداتسريع جدًاجيدةلا
Flux Kontext Devالتجريب، الاستخدام المفتوحسريععاليةلا
Flux Kontext Proالإنتاج، العمل التجاريمتوسطعالية جدًالا
Flux Kontext Maxدمج المراجع المتعددةأبطأالأعلىنعم

يتخلص Flux Kontext Fast من جزء من عبء الجودة لتحقيق توليد سريع. إذا كنت تختبر الأوامر النصية أو تكرر التكوين، فهنا تبدأ. ميزة السرعة كبيرة بما يكفي لدرجة أن تشغيل خمسة توليدات Fast للاستكشاف قبل اعتماد عرض Pro هو سير عمل أذكى فعلًا.

Flux Kontext Dev هو الإصدار مفتوح الأوزان، ما يعني أن أوزانه متاحة للعموم لأغراض البحث والتجريب. ينتج مخرجات عالية الجودة مع التزام قوي بالمرجع، وهو مثالي للمطورين الذين يبنون فوق بنية Kontext. إذا أردت تخصيص سلوك Kontext عبر الضبط الدقيق، فإن Flux Kontext Dev LoRA يتيح لك تدريب محولات خفيفة فوق النموذج الأساسي Dev لتحقيق اتساق خاص بمجال معين.

Flux Kontext Pro هو النموذج بجودة تجارية. يقدم أفضل توازن بين دقة المرجع وجودة المخرج والاستجابة للأوامر النصية. لمعظم سير العمل المهني، هذا هو الخيار الصحيح.

Flux Kontext Max هو النموذج الرائد، مصمم لأقصى جودة وتكييف متعدد الصور. عندما تحتاج إلى دمج مرجعين أو أكثر، أو تحتاج إلى أعلى اتساق ممكن على الإطلاق، فإن Max هو النموذج المناسب.

مقارنة بصندوق إضاءة تُظهر الصورة المرجعية مقابل اتساق مخرج الذكاء الاصطناعي

ماذا يمكنك أن تفعل بصورة مرجعية

نطاق التطبيقات أوسع مما يتوقعه معظم الناس في البداية. إليك الفئات الأربع التي يحقق فيها توليد الصور المرجعية أوضح قيمة.

اتساق الشخصيات عبر المشاهد

هذا هو الاستخدام الأكثر شيوعًا. لديك شخصية، حقيقية أو متخيلة، وتحتاج إلى ظهورها في سيناريوهات متعددة مع بقائها تشبه نفسها. مع Flux Kontext Pro، ترفع بورتريهًا واحدًا وتكتب أوامر لمشاهد مختلفة:

  • الشخصية في مشهد جبلي شتوي
  • الشخصية نفسها في مقهى إيطالي مشمس
  • الشخصية نفسها في زقاق مدينة مظلم ليلًا

في المخرجات الثلاثة، يبقى الوجه وبنية العظام ولون الشعر والهوية العامة ثابتة. وما يتكيّف فقط هو البيئة والإضاءة.

امرأة على الشاطئ تمثل اتساق الشخصية عبر سياقات مختلفة

نقل الأسلوب دون فقدان الهوية

يستطيع Kontext أن يأخذ البصمة الأسلوبية لصورة مرجعية ويطبقها على محتوى جديد. إذا رفعت صورة ذات تدرج لوني محدد أو مظهر سينمائي أو نهج تكويني معين، يستطيع النموذج توليد صور جديدة تتشارك تلك الجمالية، مع كونها أصيلة تمامًا في المحتوى.

هذا مفيد بشكل خاص للمصورين المحترفين لعلامات تجارية الذين أرسوا لغة بصرية خاصة بهم ويريدون توليد محتوى إضافي يتطابق مع أعمالهم الحالية دون إعادة التصوير.

💡 لنقل الأسلوب، استخدم مرجعك أساسًا لصفاته الجمالية، وصِف المحتوى الجديد بالكامل في أمرك النصي. سيطبّق النموذج المفردات البصرية لمرجعك على المشهد الجديد الموصوف.

لقطات المنتجات والأغراض

يستطيع مصورو المنتجات رفع لقطة مرجعية لمنتجهم وطلب خلفيات جديدة أو سيناريوهات عرض أو سياقات لأسلوب الحياة. يبقى المنتج واقعيًا كالصور الفوتوغرافية ومتسقًا بينما تتغير البيئة بالكامل. لا حاجة لإعادة التصوير في الموقع.

تتحول لقطة استوديو نظيفة واحدة لعطر إلى زجاجة على منضدة حمام رخامي عند الفجر، ثم في فسحة غابة مع ضباب الصباح، ثم على صينية فندق فاخر مع زهور طازجة. كل ذلك من صورة مرجعية واحدة.

سلاسل البورتريه وتوليد الحملات

يجعل Flux Kontext Max توليد سلاسل البورتريه أمرًا بسيطًا. ارفع صورة شخصية ولوحة إلهام للجماليات المرغوبة، ثم ولّد سلسلة كاملة من البورتريهات بهوية شخص متسقة عبر لمسات أسلوبية مختلفة. بالنسبة لحملات الإعلانات أو محتوى العلامات التجارية أو السلاسل التحريرية التي يكون فيها تنظيم جلسات تصوير متعددة مكلفًا، يمثل سير العمل هذا تحولًا كبيرًا في ما يمكن تحقيقه.

تكوين لوحة إلهام مسطح يُظهر تصوير المرجع وسير العمل الإبداعي

كيف تستخدم Flux Kontext على PicassoIA

نماذج Kontext الأربعة متاحة مباشرةً على PicassoIA، جاهزة للاستخدام دون أي إعداد محلي أو تهيئة API.

خطوة بخطوة مع Flux Kontext Pro

  1. انتقل إلى Flux Kontext Pro على PicassoIA
  2. ارفع صورتك المرجعية باستخدام حقل إدخال الصورة. استخدم أوضح صورة وأعلاها دقة لديك. تجنب الصور ذات الفلاتر الكثيفة أو الضغط المفرط.
  3. اكتب أمرك النصي يصف المشهد أو السياق الجديد. كن محددًا بشأن الإضاءة والبيئة والمزاج والتفاصيل الأسلوبية. لا تُعد وصف الشخص، فالنموذج يتولى ذلك من المرجع.
  4. اضبط نسبة العرض إلى الارتفاع وفقًا للاستخدام المقصود. 16:9 للمحتوى الاجتماعي والويب، و1:1 للملفات الشخصية ولقطات المنتجات، و9:16 للصيغ العمودية.
  5. شغّل التوليد وراجع المخرج. عدّل أمرك النصي لتحسين عناصر المشهد دون المساس بصورتك المرجعية.

لسير العمل متعدد الصور، انتقل إلى Flux Kontext Max وارفع صورك المرجعية الإضافية باستخدام خيار إدخال الصور المتعددة.

نصائح تنجح فعلًا

هذه التحسينات تفصل النتائج العادية عن النتائج الاحترافية:

  • استخدم صورًا مرجعية عالية الدقة. الحد الأدنى 1024x1024. يحتاج النموذج إلى التفاصيل ليعمل بها.
  • البورتريهات المواجهة للكاميرا أفضل لاتساق الشخصيات. الصور الجانبية تمنح النموذج نقاطًا أقل للارتكاز عليها.
  • كن محددًا في أمرك النصي بشأن ما يتغير. عبارة "داخل كوخ جبلي شتوي، ضوء نار دافئ، ثلج مرئي عبر النافذة" تخبر النموذج بدقة بما يبنيه حول الشخص المحفوظ.
  • تجنّب وصف مظهر الشخص في الأمر. إذا كان مرجعك يُظهر امرأة شعرها داكن، فلا تذكر لون الشعر في أمرك. الوصف الإضافي للشخص يخلق تعليمات متعارضة.
  • لنقل الأسلوب، جرّد المرجع من الموضوعات المحددة. استخدم صورة طبيعية أو معمارية بالأسلوب الذي تريده، ثم صِف موضوعًا جديدًا في الأمر. يطبّق النموذج أسلوب المرجع على المحتوى المولَّد حديثًا.
  • ابدأ بنموذج Flux Kontext Fast لتكرار الأوامر النصية، ثم انتقل إلى Pro أو Max عندما تكون راضيًا عن التكوين والمشهد.

امرأة تعمل على حاسوب محمول في مقهى في باريس مع بورتريهات بالذكاء الاصطناعي على الشاشة

أخطاء شائعة تضر بالنتائج

تحميل الأمر النصي بالتفاصيل

عند استخدام الصور المرجعية، يتغير دور أمرك النصي. لم تعد تصف الصورة كاملة، بل تصف ما هو جديد في هذا التوليد. عامِل الأمر كتعليمات للبيئة والمزاج والسياق، لا للشخص.

الإفراط في وصف الشخص يخلق تعارضات في الأمر حيث يحاول النموذج إرضاء ترميز المرجع ووصفك النصي معًا، فتنتج مخرجات لا ينتصر فيها أيهما بالكامل.

أمر مثقل مع المرجع: "امرأة جميلة بشعر أسود مجعد، وعينان بنيتان، وبشرة زيتونية، ترتدي بلايزر فحميًا، في غابة عند الغروب بضوء ذهبي"

أمر أفضل مع المرجع نفسه: "غابة عند الغروب، ضوء ذهبي دافئ، ضباب أرضي منخفض، طيور في الخلفية"

دع المرجع يحمل الشخص. استخدم الأمر لرسم العالم من حوله.

استخدام صور مرجعية منخفضة الجودة

لا يستطيع النموذج استخراج إلا ما هو موجود. الصورة المرجعية الصغيرة أو المضغوطة أو ذات الفلاتر الكثيفة تمنح عملية التكييف مادة أقل للعمل عليها، فتكون النتيجة حفاظًا أضعف على الهوية. الصور المرجعية الضبابية أو المعاكسة للضوء أو المصورة من زوايا حادة تجعل الاتساق أصعب في الحفاظ عليه عبر التوليدات.

للحصول على أفضل النتائج: إضاءة نظيفة، زاوية مباشرة، تركيز حاد، دقة لا تقل عن 1024 بكسل.

تجاهل الفروق بين النماذج

اللجوء إلى Flux Kontext Max في كل مهمة بمرجع واحد يهدر وقت التوليد. استخدم Flux Kontext Fast لاختبار الأوامر، وFlux Kontext Pro للإنتاج بمرجع واحد، واستخدم Max فقط عندما تحتاج فعلًا إلى تكييف متعدد الصور أو أقصى دقة ممكنة. غالبًا ما يكون فرق الأداء بين Fast وPro في مهمة بمرجع واحد ضئيلًا. مطابقة النموذج المناسب للمهمة المناسبة تجعل سير عملك أسرع دون التضحية بجودة المخرج.

بورتريه لامرأة واثقة تمثل مخرج اتساق شخصية بالذكاء الاصطناعي

ابدأ التوليد على PicassoIA

توليد الصور المرجعية من القدرات التي تصبح أكثر منطقية بمجرد أن تراها تعمل على صورك أنت. وصف ما يفعله Kontext بالنص لا يكفي وحده.

يتيح لك PicassoIA الوصول إلى نماذج Kontext الأربعة، Fast، وDev، وPro، وMax، دون الحاجة إلى إعداد API أو تثبيت تبعيات أو تشغيل أجهزة محلية. يمكنك رفع صورة بورتريه لديك بالفعل والبدء في اختبار اتساق الشخصية خلال دقائق.

إذا أردت تخصيصًا أعمق، فإن Flux Kontext Dev LoRA يتيح لك ضبط النموذج الأساسي Dev على مجموعة بياناتك الخاصة، وهو الطريق إلى اتساق خاص حقًا لسير العمل التجاري حيث لا تكون النتائج الجاهزة دقيقة بما يكفي.

نقطة البداية الأبسط: التقط صورة بورتريه واضحة، وانتقل إلى Flux Kontext Pro على PicassoIA، واكتب أمرًا لمشهد مختلف تمامًا. انظر كم من الهوية ينتقل. تلك النتيجة الأولى عادةً ما تجعل الفكرة كلها واضحة فورًا، ومن هناك تتضاعف حالات الاستخدام بسرعة.

استوديو عند الغسق يُظهر سير عمل توليد الصور بالذكاء الاصطناعي مع شاشات

شارك هذا المقال

اختر لغتك

مقالات ذات صلة