كيف يعمل تحسين الفيديو بالذكاء الاصطناعي (ولماذا يهم فعلًا)

نظرة مفصّلة على الشبكات العصبية وخطوط رفع الدقة وطرق استيفاء الإطارات التي تشغّل أدوات الفيديو الحديثة بالذكاء الاصطناعي. من استعادة اللقطات القديمة إلى إخراج محتوى 4K واضح، يشرح هذا المقال العلم الحقيقي وراء طريقة رؤية الذكاء الاصطناعي للفيديو وإعادة بنائه.

كيف يعمل تحسين الفيديو بالذكاء الاصطناعي (ولماذا يهم فعلًا)
Cristian Da Conceicao
مؤسس Picasso IA

يفكر معظم الناس، عند مشاهدة لقطات قديمة، في الفكرة نفسها: لماذا تبدو بهذا السوء؟ الجواب ليس الزمن وحده. السبب فيزياء، وقيود في العتاد، والطريقة الأساسية التي التقطت بها الكاميرات الضوء قبل ظهور المستشعرات الحديثة. وما يفعله الذكاء الاصطناعي اليوم بتلك اللقطات ليس سحرًا. إنه التعرّف على الأنماط، يعمل بمقياس لا تستطيع العين البشرية منافسته، ويُطبَّق على ملايين البكسلات، عشرات المرات في الثانية.

هذه هي الطريقة التي يعمل بها فعلًا.

ما المقصود بجودة الفيديو حقًا

المشكلة التي تحملها اللقطات الخام

كل ملف فيديو هو تسلسل من الصور الثابتة المنفردة تسمى الإطارات. يحتوي مقطع بمعدل 24 إطارًا في الثانية على 24 إطارًا من هذه الإطارات في كل ثانية. يحتوي كل إطار على عدد ثابت من البكسلات، وتحمل هذه البكسلات ثلاث قيم: الأحمر والأخضر والأزرق. تتحدد جودة الفيديو بأمرين: كم عدد البكسلات الموجودة في كل إطار، وكم قدر من المعلومات يحمله كل بكسل فعلًا.

تفشل اللقطات القديمة في الأمرين معًا. التقطت كاميرات الثمانينيات والتسعينيات بدقة منخفضة. وتخلّصت أنظمة الضغط من معلومات البكسلات لتوفير مساحة التخزين. وتدهور الفيلم مع الوقت، فظهرت الحبيبات والخدوش وانحراف الألوان. والنتيجة لقطات تبدو ناعمة ومشوشة وباهتة.

لا يحل "تكبير الصورة" هذه المشكلة. فتمديد إطار بدقة 480p إلى 1080p لا ينتج إلا بكسلات أكبر وأكثر ضبابية. لهذا كان التكبير التقليدي يبدو دائمًا رديئًا.

ما يفعله الذكاء الاصطناعي ولا يستطيعه الاستيفاء

يُعرف رفع الدقة التقليدي باسم الاستيفاء ثنائي التكعيب (bicubic interpolation)، وهو يحسب متوسط البكسلات المجاورة لملء الفراغات عند تمديد الصورة. والنتيجة دائمًا تخمين ضبابي.

يعمل الرفع الفائق للدقة القائم على الذكاء الاصطناعي بطريقة مختلفة. فبدلًا من حساب المتوسطات، رأت الشبكة العصبية ملايين الأمثلة من أزواج الصور منخفضة الدقة وعالية الدقة. وتعلمت كيف تبدو التفاصيل عالية التردد (الحواف والملمس والخطوط الدقيقة) عادةً حين تغيب عن المحتوى منخفض الدقة. وعندما تعالج لقطاتك، فهي لا تحسب متوسطًا، بل تتنبأ بما كان موجودًا على الأرجح.

لقطة مقرّبة لشريط فيلم يُظهر ملمس السيلولويد والحبيبات

الفرق كبير. تستطيع الشبكة العصبية أن تضيف مسام بشرة تبدو واقعية إلى وجه غير واضح، وأن تحدّد خيوط القماش الفردية، وأن تعيد بناء حواف النصوص دون هالات التشويه التي عانت منها الطرق القديمة.

النماذج الأساسية التي تقوم بالعمل

شبكات الرفع الفائق للدقة

تقوم معالجة الفيديو بالذكاء الاصطناعي على نموذج الرفع الفائق للدقة، ويُختصر غالبًا إلى SR. وهي شبكات عصبية التفافية (CNNs) أو، في الآونة الأخيرة، بنى قائمة على الانتشار (diffusion)، مدرَّبة خصيصًا على رفع دقة المحتوى المرئي.

أشهر البنى المعروفة هي ESRGAN (Enhanced Super Resolution Generative Adversarial Network). تستخدم شبكة مولّدة تنتج المخرجات مرفوعة الدقة، وشبكة مميِّزة تقارن النتيجة بصور حقيقية عالية الدقة. وتتنافس الشبكتان أثناء التدريب حتى تصبح المولّدة جيدة بما يكفي لخداع المميِّزة باستمرار.

تبدو المخرجات حادة بشكل مفاجئ. يطبّق Real ESRGAN Video هذه البنية على تسلسلات الفيديو، فيعالج كل إطار على حدة لإخراج دقة 4K من مواد مصدرها منخفض الدقة.

عالم بيانات يحلل شبكات إطارات فيديو على شاشتين ليلًا

استيفاء الإطارات وتقدير الحركة

من المشكلات الخاصة بالفيديو (على عكس الصور الثابتة) الاتساق الزمني. إذا رفعت دقة كل إطار على حدة، فقد تؤدي الفروق الطفيفة في طريقة إعادة النموذج لبناء التفاصيل إلى ومضات. فالنتيجة يجب أن تكون متسقة عبر الزمن، لا متسقة مكانيًا داخل إطار واحد فقط.

وهنا يأتي دور تقدير الحركة والتعويض عنها. يحلل الذكاء الاصطناعي متجهات الحركة بين الإطارات، فيتتبع مكان الأجسام التي تتحرك، وسرعتها، واتجاهها. ويستخدم هذه البيانات ليضمن أن تبقى التفاصيل المعاد بناؤها متسقة مع حركة الأجسام داخل المشهد.

يذهب استيفاء الإطارات أبعد من ذلك. فبتحليل إطارين موجودين، ينشئ النموذج إطارًا وسيطًا جديدًا يتلاءم منطقيًا مع الحركة. وبهذه الطريقة تتحول لقطات 24 إطارًا في الثانية إلى 60 أو حتى 120 إطارًا في الثانية دون أن تلتقط الكاميرا الأصلية تلك الإطارات الإضافية.

جهاز عرض أفلام قديم بقياس 8 ملم يطلق شعاعًا ضوئيًا في غرفة مظلمة

تقليل التشويش الزمني

ينتج كل مستشعر تشويشًا. وتتأثر لقطات الإضاءة الضعيفة بذلك بشكل خاص، إذ تظهر تباينات عشوائية في البكسلات تشبه الحبيبات الثابتة. وبينما قد تكون حبيبات الفيلم مرغوبة جماليًا، فإن التشويش الرقمي غير مرغوب فيه تقريبًا دائمًا.

كان تقليل التشويش التقليدي يعمل على إطار واحد في كل مرة: إذ تُضبَّب البكسلات قليلًا، فيتلاشى التشويش، لكن تتلاشى معه كل التفاصيل الدقيقة أيضًا. إنها أداة فجّة.

يحلل تقليل التشويش الزمني القائم على الذكاء الاصطناعي عدة إطارات في الوقت نفسه. فبمقارنة المنطقة نفسها عبر عدة إطارات متجاورة، يميّز النموذج بين التشويش (عشوائي، يتغير من إطار إلى آخر) والتفاصيل الحقيقية (ثابتة). ويزيل التشويش مع الحفاظ على معلومات الصورة الفعلية الكامنة تحته.

كيف يقرأ الذكاء الاصطناعي كل إطار

الطبقات الالتفافية وخرائط الخصائص

داخل شبكة الرفع الفائق للدقة، يمر الإطار المدخل عبر سلسلة من الطبقات الالتفافية. تطبّق كل طبقة مرشحًا على الصورة كلها، فتنتج خريطة خصائص (feature map) تبرز سمات محددة: الحواف والملمس وتدرجات السطوع وانتقالات الألوان.

في الطبقات الأولى، تكتشف الشبكة خصائص بسيطة مثل الحواف الأفقية والعمودية. وفي الطبقات الأعمق، تجمعها في خصائص أكثر تعقيدًا: الوجوه وملمس الأقمشة والحروف والأوراق الخضراء. وبحلول الطبقات الأخيرة، تكون الشبكة قد بنت تمثيلًا غنيًا متعدد الأبعاد لما في الصورة، وتستخدمه لإعادة بناء المخرجات عالية الدقة.

محرر فيديو محترف أمام محطة عمل بعدة شاشات

لماذا تغيّر بيانات التدريب كل شيء

ترتبط جودة نموذج الرفع الفائق للدقة ارتباطًا مباشرًا بجودة بيانات تدريبه وتنوعها. فالنموذج المدرَّب في الأساس على المناظر الطبيعية سيواجه صعوبة مع الوجوه. والنموذج المدرَّب على حبيبات الفيلم سيتعامل معها بشكل أفضل من النموذج المدرَّب على لقطات رقمية نظيفة.

دُرِّبت أفضل النماذج التجارية على عشرات الملايين من أزواج الصور والفيديو، مختارة بعناية لتغطي أنواعًا متنوعة من المحتوى: مشاهد داخلية وخارجية، ووجوه، ونصوص، وحركة، وبيئات إضاءة ضعيفة، وغيرها. هذا التنوع هو ما يجعلها تعمم جيدًا على اللقطات الواقعية، بدلًا من أن تعمل على محتوى محدد فقط.

ولهذا السبب أيضًا تتفوق نماذج مثل Topaz Video Upscale على البدائل مفتوحة المصدر بفارق كبير. فخط التدريب الخاص وانتقاء مجموعة البيانات يمثلان سنوات من التحسين على مواد حقيقية من صنّاع محتوى حقيقيين.

التحسين مقابل الاستعادة: مشكلتان مختلفتان

تُستخدم هذه المصطلحات بالتبادل، لكنها تعالج عيوبًا مختلفة في اللقطات. ومعرفة المشكلة التي تواجهها فعلًا هي الفارق بين نتيجة نظيفة وعمل معالَج يبدو مشوّهًا.

بورتريه بإضاءة نافذة طبيعية على طريقة رامبرانت تُظهر ملمس البشرة

متى تحتاج إلى التحسين

يحل التحسين مشكلة الدقة. فلقطتك الأصلية موجودة وسليمة، لكنها تحتوي على عدد بكسلات قليل جدًا بالنسبة للشاشات الحديثة. يبدو فيديو 1080p على شاشة 4K ناعمًا. وتبدو تسجيلات 480p القديمة رديئة على أي شاشة حديثة.

تأخذ نماذج التحسين هذا العدد القليل من البكسلات وتُنشئ بكسلات إضافية تتسق مع ما يفترض أن تحتويه الصورة. فمادة المصدر ليست تالفة، بل تحتاج فقط إلى دقة أعلى.

يتولى Crystal Video Upscaler هذه المهمة مباشرة، فيُخرج اللقطات بدقة تصل إلى 4K من مصادر بدقة قياسية أو عالية. وهو الأداة المناسبة عندما تكون لقطتك نظيفة لكنها منخفضة الدقة ببساطة.

متى تكون الاستعادة هي الحاجة الحقيقية

تتعامل الاستعادة مع اللقطات التالفة: تشوهات الضغط، وحبيبات الفيلم، والتشويش الرقمي، وتدهور الألوان، وخطوط التشابك من تسجيلات التلفزيون القديمة، وعدم اتساق معدل الإطارات.

لا يكتفي نموذج الاستعادة بإضافة البكسلات. بل يزيل فعليًا معلومات التشوه التي لا ينبغي أن تكون موجودة، ويعيد دقة الألوان، ويثبّت المخرجات البصرية. والعمل أكثر تعقيدًا لأن النموذج يجب أن يميّز بين الإشارة (محتوى الصورة الحقيقي) والتشويش (التلف أو التشوه)، وهذا يتطلب فهمًا عميقًا لظروف التقاط المادة الأصلية.

يجمع Runway Upscale v1 بين النهجين، فيطبّق زيادة الدقة إلى جانب إزالة التشوهات لإنتاج مخرجات نظيفة وحادة من مادة مصدر متضررة.

منظر جوي علوي لعلب أفلام قديمة وصور فوتوغرافية قديمة على مكتب خشبي

ما الذي يتغير فعليًا في المخرجات

الدقة والحدة

النتيجة الأكثر وضوحًا لمعالجة الفيديو بالذكاء الاصطناعي هي صور أكثر حدة وتفصيلًا. تصبح التفاصيل الدقيقة التي لم تكن مرئية في المصدر واضحة في المخرجات: الشعيرات الفردية، ونسيج القماش، والنصوص على اللافتات، وملامح الوجه. وهذا ليس شحذًا بالمعنى التقليدي (الذي يزيد التباين عند الحواف فقط)، بل إعادة بناء فعلية للتفاصيل عالية التردد.

عامل المخرجاترفع الدقة التقليديالرفع الفائق للدقة بالذكاء الاصطناعي
زيادة الدقة2x-4x (ضبابية)2x-4x (حادة ومفصلة)
جودة الحوافبهالات وناعمةنظيفة ومحددة
الملمس الدقيقممسوحمُعاد بناؤه
معالجة التشوهاتلا شيءإزالة فعّالة
اتساق الحركةلا شيءتحليل زمني

إزالة التشويش والحبيبات

يُزال التشويش الرقمي عبر التحليل الزمني. أما حبيبات الفيلم فأكثر دقة: فالإزالة الكاملة قد تجعل اللقطات تبدو باردة ومفرطة المعالجة. وتتيح أفضل النماذج التحكم في مقدار الحبيبات المطلوب الاحتفاظ به أو إزالته، فتتيح لك الحفاظ على الطابع الجمالي مع التخلص من التشويش التقني البحت.

💡 نصيحة: بالنسبة للقطات الأرشيفية التي تريد أن تبدو طبيعية، اضبط تقليل التشويش على 50-70% بدلًا من الحد الأقصى. فالإزالة الكاملة غالبًا ما تجعل اللقطات القديمة تبدو كأنها صُوّرت البارحة بهاتف رخيص.

سلاسة الحركة

يضيف استيفاء الإطارات إطارات لزيادة السلاسة المُدرَكة. فاللقطات بمعدل 24 إطارًا في الثانية المعالجة إلى 60 تبدو أكثر انسيابية بشكل ملحوظ، وهذا مفيد بشكل خاص للقطات الرياضية، والمشاهد بالحركة البطيئة، أو أي محتوى كثير الحركة. ويتنبأ النموذج بما يجب أن يظهر بين الإطارات اعتمادًا على متجهات الحركة، فينتج انتقالات تبدو طبيعية بدلًا من أن تكون ممسوحة.

مصوّر سينمائي يراجع شاشة بث 4K في استوديو احترافي

كيفية استخدام معالجة الفيديو بالذكاء الاصطناعي على PicassoIA

Crystal Video Upscaler

صُمم Crystal Video Upscaler من تطوير philz1337x للقطات بدقة قياسية وعالية التي تحتاج إلى رفع للدقة حتى 4K. للحصول على أفضل النتائج:

  • المدخل: استخدم أنظف نسخة متاحة من ملف المصدر. إذا كانت لديك عدة نسخ مصدَّرة، فاستخدم الأعلى في معدل البت (bitrate).
  • معامل المقياس: ابدأ بالقيمة 2x للقطات عالية الدقة أصلًا. واستخدم 4x للمصادر القياسية التي تقل عن 720p.
  • الحدة: أبقها على الإعداد الافتراضي للحصول على نتائج طبيعية. فرفعها كثيرًا يُدخل تأثيرات رنين حول الحواف عالية التباين.
  • المخرجات: يُخرج النموذج بصيغة MP4. للاستخدام الأرشيفي، صدّر بأعلى إعداد متاح لمعدل البت.

Topaz Video Upscale

يُعد Topaz Video Upscale الخيار الاحترافي، وهو قوي بشكل خاص مع اللقطات المشوشة والمواد ذات الظروف المختلطة. يدعم مخرجات 4K واستيفاء 120 إطارًا في الثانية.

  • قوة تقليل التشويش: اضبطها على "قوي" للقطات المصوّرة بالكاميرا في الإضاءة الضعيفة. واستخدم "منخفض" للمواد المصدر المضاءة جيدًا لتجنب مظهر المعالجة المفرطة.
  • استيفاء الإطارات: فعّله فقط عندما تكون السلاسة هي الهدف. بالنسبة لمحتوى الأفلام، فإن الإبقاء على معدل الإطارات الأصلي يحفظ الإحساس السينمائي.
  • التثبيت: يتضمن النموذج تثبيت الحركة الذي يصحح اهتزاز الكاميرا المحمولة. فعّله للقطات المصدر المهتزة.

Runway Upscale v1

يُعد Runway Upscale v1 فعّالًا بشكل خاص مع اللقطات القديمة أو المتدهورة: نقل VHS، وفيديو الويب المضغوط، والتسجيلات منخفضة معدل البت. ويتعامل النموذج جيدًا مع إزالة التشوهات إلى جانب زيادة الدقة.

  • أفضل حالة استخدام: أعمال الاستعادة حيث يظهر في المصدر كتل ضغط أو تدرّج ألوان متقطع (color banding).
  • جودة المخرجات: شغّله بأعلى إعداد دقة يدعمه المصدر.

وفيما يخص تحرير الفيديو إلى ما هو أبعد من رفع الدقة، يرفع Bria's Video Increase Resolution المخرجات حتى 8K، بينما يطبّق Real ESRGAN Video البنية القائمة على GAN مباشرة على تسلسلات الفيديو، لنتائج حادة إطارًا بإطار.

مصوّر رياضي على مستوى الأرض يلتقط رياضيًا يعدو وهو في تركيز حاد

اختيار الأداة المناسبة

تعتمد الأداة المناسبة على ما يعاني منه المقطع، لا على الشكل الذي تريد أن تبدو عليه المخرجات فقط.

💡 ابدأ بالتشخيص. شاهد مقطعًا قصيرًا بالحجم الكامل. هل هو ضبابي لكنه نظيف بخلاف ذلك؟ فهذه مشكلة دقة. هل يبدو مشوشًا أو تظهر فيه كتل ضغط مرئية؟ فهذه مشكلة استعادة. هل يتقطع أو يبدو مهتزًا؟ فهذه مشكلة معدل إطارات.

مشكلة اللقطةأفضل أداة
دقة منخفضة، ومصدر نظيفCrystal Video Upscaler
تشويش رقمي، ولقطات بإضاءة ضعيفةTopaz Video Upscale
فيديو متدهور أو مضغوط أو قديمRunway Upscale v1
مخرجات بأقصى دقة (8K)Bria Video Increase Resolution
زيادة معدل الإطارات (60 و120 إطارًا في الثانية)Topaz Video Upscale
شحذ قائم على GANReal ESRGAN Video

بالنسبة للصور الثابتة أو الإطارات المستخرجة من الفيديو، يطبّق Topaz Image Upscale وGoogle Upscaler مبادئ الرفع الفائق للدقة نفسها على الصور المفردة، وهي مفيدة لاستخراج لقطات ثابتة نظيفة مباشرة من لقطات الفيديو.

جرّبها على لقطاتك الخاصة

أفضل طريقة لترى ما تفعله هذه النماذج فعلًا هي تمرير لقطاتك الخاصة عبرها. اختر مقطعًا لم يعجبك، كأن يكون مصوّرًا في الإضاءة الضعيفة أو بهاتف قديم، ومرره عبر Crystal Video Upscaler أو Topaz Video Upscale على PicassoIA.

لا يحتاج الذكاء الاصطناعي إلى مادة مصدر مثالية. وهذه هي النقطة تحديدًا. فقد صُمم للعمل مع اللقطات الواقعية غير الكاملة والمضغوطة والقديمة. وما تحصل عليه في المقابل أكثر حدة ونظافة وأسهل في المشاهدة. ليس لأن أحدًا أصلحها يدويًا إطارًا تلو الآخر، بل لأن النموذج رأى أمثلة كافية على الفيديو الجيد والسيئ ليعرف كيف يُفترض أن يبدو الجيد.

صانعة محتوى مبدعة تستخدم حاسوبًا محمولًا في مقهى دافئ بضوء النافذة الطبيعي

تمنحك PicassoIA وصولًا مباشرًا إلى أفضل نماذج معالجة الفيديو بالذكاء الاصطناعي المتاحة، من Crystal Video Upscaler إلى Topaz Video Upscale وReal ESRGAN Video، كلها في مكان واحد. ارفع مقطعك، واختر نموذجًا، وشاهد ما ترى الشبكة العصبية عندما تنظر إلى لقطاتك.

شارك هذا المقال

اختر لغتك

مقالات ذات صلة