يفكر معظم الناس، عند مشاهدة لقطات قديمة، في الفكرة نفسها: لماذا تبدو بهذا السوء؟ الجواب ليس الزمن وحده. السبب فيزياء، وقيود في العتاد، والطريقة الأساسية التي التقطت بها الكاميرات الضوء قبل ظهور المستشعرات الحديثة. وما يفعله الذكاء الاصطناعي اليوم بتلك اللقطات ليس سحرًا. إنه التعرّف على الأنماط، يعمل بمقياس لا تستطيع العين البشرية منافسته، ويُطبَّق على ملايين البكسلات، عشرات المرات في الثانية.
هذه هي الطريقة التي يعمل بها فعلًا.
ما المقصود بجودة الفيديو حقًا
المشكلة التي تحملها اللقطات الخام
كل ملف فيديو هو تسلسل من الصور الثابتة المنفردة تسمى الإطارات. يحتوي مقطع بمعدل 24 إطارًا في الثانية على 24 إطارًا من هذه الإطارات في كل ثانية. يحتوي كل إطار على عدد ثابت من البكسلات، وتحمل هذه البكسلات ثلاث قيم: الأحمر والأخضر والأزرق. تتحدد جودة الفيديو بأمرين: كم عدد البكسلات الموجودة في كل إطار، وكم قدر من المعلومات يحمله كل بكسل فعلًا.
تفشل اللقطات القديمة في الأمرين معًا. التقطت كاميرات الثمانينيات والتسعينيات بدقة منخفضة. وتخلّصت أنظمة الضغط من معلومات البكسلات لتوفير مساحة التخزين. وتدهور الفيلم مع الوقت، فظهرت الحبيبات والخدوش وانحراف الألوان. والنتيجة لقطات تبدو ناعمة ومشوشة وباهتة.
لا يحل "تكبير الصورة" هذه المشكلة. فتمديد إطار بدقة 480p إلى 1080p لا ينتج إلا بكسلات أكبر وأكثر ضبابية. لهذا كان التكبير التقليدي يبدو دائمًا رديئًا.
ما يفعله الذكاء الاصطناعي ولا يستطيعه الاستيفاء
يُعرف رفع الدقة التقليدي باسم الاستيفاء ثنائي التكعيب (bicubic interpolation)، وهو يحسب متوسط البكسلات المجاورة لملء الفراغات عند تمديد الصورة. والنتيجة دائمًا تخمين ضبابي.
يعمل الرفع الفائق للدقة القائم على الذكاء الاصطناعي بطريقة مختلفة. فبدلًا من حساب المتوسطات، رأت الشبكة العصبية ملايين الأمثلة من أزواج الصور منخفضة الدقة وعالية الدقة. وتعلمت كيف تبدو التفاصيل عالية التردد (الحواف والملمس والخطوط الدقيقة) عادةً حين تغيب عن المحتوى منخفض الدقة. وعندما تعالج لقطاتك، فهي لا تحسب متوسطًا، بل تتنبأ بما كان موجودًا على الأرجح.

الفرق كبير. تستطيع الشبكة العصبية أن تضيف مسام بشرة تبدو واقعية إلى وجه غير واضح، وأن تحدّد خيوط القماش الفردية، وأن تعيد بناء حواف النصوص دون هالات التشويه التي عانت منها الطرق القديمة.
النماذج الأساسية التي تقوم بالعمل
شبكات الرفع الفائق للدقة
تقوم معالجة الفيديو بالذكاء الاصطناعي على نموذج الرفع الفائق للدقة، ويُختصر غالبًا إلى SR. وهي شبكات عصبية التفافية (CNNs) أو، في الآونة الأخيرة، بنى قائمة على الانتشار (diffusion)، مدرَّبة خصيصًا على رفع دقة المحتوى المرئي.
أشهر البنى المعروفة هي ESRGAN (Enhanced Super Resolution Generative Adversarial Network). تستخدم شبكة مولّدة تنتج المخرجات مرفوعة الدقة، وشبكة مميِّزة تقارن النتيجة بصور حقيقية عالية الدقة. وتتنافس الشبكتان أثناء التدريب حتى تصبح المولّدة جيدة بما يكفي لخداع المميِّزة باستمرار.
تبدو المخرجات حادة بشكل مفاجئ. يطبّق Real ESRGAN Video هذه البنية على تسلسلات الفيديو، فيعالج كل إطار على حدة لإخراج دقة 4K من مواد مصدرها منخفض الدقة.

استيفاء الإطارات وتقدير الحركة
من المشكلات الخاصة بالفيديو (على عكس الصور الثابتة) الاتساق الزمني. إذا رفعت دقة كل إطار على حدة، فقد تؤدي الفروق الطفيفة في طريقة إعادة النموذج لبناء التفاصيل إلى ومضات. فالنتيجة يجب أن تكون متسقة عبر الزمن، لا متسقة مكانيًا داخل إطار واحد فقط.
وهنا يأتي دور تقدير الحركة والتعويض عنها. يحلل الذكاء الاصطناعي متجهات الحركة بين الإطارات، فيتتبع مكان الأجسام التي تتحرك، وسرعتها، واتجاهها. ويستخدم هذه البيانات ليضمن أن تبقى التفاصيل المعاد بناؤها متسقة مع حركة الأجسام داخل المشهد.
يذهب استيفاء الإطارات أبعد من ذلك. فبتحليل إطارين موجودين، ينشئ النموذج إطارًا وسيطًا جديدًا يتلاءم منطقيًا مع الحركة. وبهذه الطريقة تتحول لقطات 24 إطارًا في الثانية إلى 60 أو حتى 120 إطارًا في الثانية دون أن تلتقط الكاميرا الأصلية تلك الإطارات الإضافية.

تقليل التشويش الزمني
ينتج كل مستشعر تشويشًا. وتتأثر لقطات الإضاءة الضعيفة بذلك بشكل خاص، إذ تظهر تباينات عشوائية في البكسلات تشبه الحبيبات الثابتة. وبينما قد تكون حبيبات الفيلم مرغوبة جماليًا، فإن التشويش الرقمي غير مرغوب فيه تقريبًا دائمًا.
كان تقليل التشويش التقليدي يعمل على إطار واحد في كل مرة: إذ تُضبَّب البكسلات قليلًا، فيتلاشى التشويش، لكن تتلاشى معه كل التفاصيل الدقيقة أيضًا. إنها أداة فجّة.
يحلل تقليل التشويش الزمني القائم على الذكاء الاصطناعي عدة إطارات في الوقت نفسه. فبمقارنة المنطقة نفسها عبر عدة إطارات متجاورة، يميّز النموذج بين التشويش (عشوائي، يتغير من إطار إلى آخر) والتفاصيل الحقيقية (ثابتة). ويزيل التشويش مع الحفاظ على معلومات الصورة الفعلية الكامنة تحته.
كيف يقرأ الذكاء الاصطناعي كل إطار
الطبقات الالتفافية وخرائط الخصائص
داخل شبكة الرفع الفائق للدقة، يمر الإطار المدخل عبر سلسلة من الطبقات الالتفافية. تطبّق كل طبقة مرشحًا على الصورة كلها، فتنتج خريطة خصائص (feature map) تبرز سمات محددة: الحواف والملمس وتدرجات السطوع وانتقالات الألوان.
في الطبقات الأولى، تكتشف الشبكة خصائص بسيطة مثل الحواف الأفقية والعمودية. وفي الطبقات الأعمق، تجمعها في خصائص أكثر تعقيدًا: الوجوه وملمس الأقمشة والحروف والأوراق الخضراء. وبحلول الطبقات الأخيرة، تكون الشبكة قد بنت تمثيلًا غنيًا متعدد الأبعاد لما في الصورة، وتستخدمه لإعادة بناء المخرجات عالية الدقة.

لماذا تغيّر بيانات التدريب كل شيء
ترتبط جودة نموذج الرفع الفائق للدقة ارتباطًا مباشرًا بجودة بيانات تدريبه وتنوعها. فالنموذج المدرَّب في الأساس على المناظر الطبيعية سيواجه صعوبة مع الوجوه. والنموذج المدرَّب على حبيبات الفيلم سيتعامل معها بشكل أفضل من النموذج المدرَّب على لقطات رقمية نظيفة.
دُرِّبت أفضل النماذج التجارية على عشرات الملايين من أزواج الصور والفيديو، مختارة بعناية لتغطي أنواعًا متنوعة من المحتوى: مشاهد داخلية وخارجية، ووجوه، ونصوص، وحركة، وبيئات إضاءة ضعيفة، وغيرها. هذا التنوع هو ما يجعلها تعمم جيدًا على اللقطات الواقعية، بدلًا من أن تعمل على محتوى محدد فقط.
ولهذا السبب أيضًا تتفوق نماذج مثل Topaz Video Upscale على البدائل مفتوحة المصدر بفارق كبير. فخط التدريب الخاص وانتقاء مجموعة البيانات يمثلان سنوات من التحسين على مواد حقيقية من صنّاع محتوى حقيقيين.
التحسين مقابل الاستعادة: مشكلتان مختلفتان
تُستخدم هذه المصطلحات بالتبادل، لكنها تعالج عيوبًا مختلفة في اللقطات. ومعرفة المشكلة التي تواجهها فعلًا هي الفارق بين نتيجة نظيفة وعمل معالَج يبدو مشوّهًا.

متى تحتاج إلى التحسين
يحل التحسين مشكلة الدقة. فلقطتك الأصلية موجودة وسليمة، لكنها تحتوي على عدد بكسلات قليل جدًا بالنسبة للشاشات الحديثة. يبدو فيديو 1080p على شاشة 4K ناعمًا. وتبدو تسجيلات 480p القديمة رديئة على أي شاشة حديثة.
تأخذ نماذج التحسين هذا العدد القليل من البكسلات وتُنشئ بكسلات إضافية تتسق مع ما يفترض أن تحتويه الصورة. فمادة المصدر ليست تالفة، بل تحتاج فقط إلى دقة أعلى.
يتولى Crystal Video Upscaler هذه المهمة مباشرة، فيُخرج اللقطات بدقة تصل إلى 4K من مصادر بدقة قياسية أو عالية. وهو الأداة المناسبة عندما تكون لقطتك نظيفة لكنها منخفضة الدقة ببساطة.
متى تكون الاستعادة هي الحاجة الحقيقية
تتعامل الاستعادة مع اللقطات التالفة: تشوهات الضغط، وحبيبات الفيلم، والتشويش الرقمي، وتدهور الألوان، وخطوط التشابك من تسجيلات التلفزيون القديمة، وعدم اتساق معدل الإطارات.
لا يكتفي نموذج الاستعادة بإضافة البكسلات. بل يزيل فعليًا معلومات التشوه التي لا ينبغي أن تكون موجودة، ويعيد دقة الألوان، ويثبّت المخرجات البصرية. والعمل أكثر تعقيدًا لأن النموذج يجب أن يميّز بين الإشارة (محتوى الصورة الحقيقي) والتشويش (التلف أو التشوه)، وهذا يتطلب فهمًا عميقًا لظروف التقاط المادة الأصلية.
يجمع Runway Upscale v1 بين النهجين، فيطبّق زيادة الدقة إلى جانب إزالة التشوهات لإنتاج مخرجات نظيفة وحادة من مادة مصدر متضررة.

ما الذي يتغير فعليًا في المخرجات
الدقة والحدة
النتيجة الأكثر وضوحًا لمعالجة الفيديو بالذكاء الاصطناعي هي صور أكثر حدة وتفصيلًا. تصبح التفاصيل الدقيقة التي لم تكن مرئية في المصدر واضحة في المخرجات: الشعيرات الفردية، ونسيج القماش، والنصوص على اللافتات، وملامح الوجه. وهذا ليس شحذًا بالمعنى التقليدي (الذي يزيد التباين عند الحواف فقط)، بل إعادة بناء فعلية للتفاصيل عالية التردد.
| عامل المخرجات | رفع الدقة التقليدي | الرفع الفائق للدقة بالذكاء الاصطناعي |
|---|
| زيادة الدقة | 2x-4x (ضبابية) | 2x-4x (حادة ومفصلة) |
| جودة الحواف | بهالات وناعمة | نظيفة ومحددة |
| الملمس الدقيق | ممسوح | مُعاد بناؤه |
| معالجة التشوهات | لا شيء | إزالة فعّالة |
| اتساق الحركة | لا شيء | تحليل زمني |
إزالة التشويش والحبيبات
يُزال التشويش الرقمي عبر التحليل الزمني. أما حبيبات الفيلم فأكثر دقة: فالإزالة الكاملة قد تجعل اللقطات تبدو باردة ومفرطة المعالجة. وتتيح أفضل النماذج التحكم في مقدار الحبيبات المطلوب الاحتفاظ به أو إزالته، فتتيح لك الحفاظ على الطابع الجمالي مع التخلص من التشويش التقني البحت.
💡 نصيحة: بالنسبة للقطات الأرشيفية التي تريد أن تبدو طبيعية، اضبط تقليل التشويش على 50-70% بدلًا من الحد الأقصى. فالإزالة الكاملة غالبًا ما تجعل اللقطات القديمة تبدو كأنها صُوّرت البارحة بهاتف رخيص.
سلاسة الحركة
يضيف استيفاء الإطارات إطارات لزيادة السلاسة المُدرَكة. فاللقطات بمعدل 24 إطارًا في الثانية المعالجة إلى 60 تبدو أكثر انسيابية بشكل ملحوظ، وهذا مفيد بشكل خاص للقطات الرياضية، والمشاهد بالحركة البطيئة، أو أي محتوى كثير الحركة. ويتنبأ النموذج بما يجب أن يظهر بين الإطارات اعتمادًا على متجهات الحركة، فينتج انتقالات تبدو طبيعية بدلًا من أن تكون ممسوحة.

كيفية استخدام معالجة الفيديو بالذكاء الاصطناعي على PicassoIA
Crystal Video Upscaler
صُمم Crystal Video Upscaler من تطوير philz1337x للقطات بدقة قياسية وعالية التي تحتاج إلى رفع للدقة حتى 4K. للحصول على أفضل النتائج:
- المدخل: استخدم أنظف نسخة متاحة من ملف المصدر. إذا كانت لديك عدة نسخ مصدَّرة، فاستخدم الأعلى في معدل البت (bitrate).
- معامل المقياس: ابدأ بالقيمة 2x للقطات عالية الدقة أصلًا. واستخدم 4x للمصادر القياسية التي تقل عن 720p.
- الحدة: أبقها على الإعداد الافتراضي للحصول على نتائج طبيعية. فرفعها كثيرًا يُدخل تأثيرات رنين حول الحواف عالية التباين.
- المخرجات: يُخرج النموذج بصيغة MP4. للاستخدام الأرشيفي، صدّر بأعلى إعداد متاح لمعدل البت.
Topaz Video Upscale
يُعد Topaz Video Upscale الخيار الاحترافي، وهو قوي بشكل خاص مع اللقطات المشوشة والمواد ذات الظروف المختلطة. يدعم مخرجات 4K واستيفاء 120 إطارًا في الثانية.
- قوة تقليل التشويش: اضبطها على "قوي" للقطات المصوّرة بالكاميرا في الإضاءة الضعيفة. واستخدم "منخفض" للمواد المصدر المضاءة جيدًا لتجنب مظهر المعالجة المفرطة.
- استيفاء الإطارات: فعّله فقط عندما تكون السلاسة هي الهدف. بالنسبة لمحتوى الأفلام، فإن الإبقاء على معدل الإطارات الأصلي يحفظ الإحساس السينمائي.
- التثبيت: يتضمن النموذج تثبيت الحركة الذي يصحح اهتزاز الكاميرا المحمولة. فعّله للقطات المصدر المهتزة.
Runway Upscale v1
يُعد Runway Upscale v1 فعّالًا بشكل خاص مع اللقطات القديمة أو المتدهورة: نقل VHS، وفيديو الويب المضغوط، والتسجيلات منخفضة معدل البت. ويتعامل النموذج جيدًا مع إزالة التشوهات إلى جانب زيادة الدقة.
- أفضل حالة استخدام: أعمال الاستعادة حيث يظهر في المصدر كتل ضغط أو تدرّج ألوان متقطع (color banding).
- جودة المخرجات: شغّله بأعلى إعداد دقة يدعمه المصدر.
وفيما يخص تحرير الفيديو إلى ما هو أبعد من رفع الدقة، يرفع Bria's Video Increase Resolution المخرجات حتى 8K، بينما يطبّق Real ESRGAN Video البنية القائمة على GAN مباشرة على تسلسلات الفيديو، لنتائج حادة إطارًا بإطار.

اختيار الأداة المناسبة
تعتمد الأداة المناسبة على ما يعاني منه المقطع، لا على الشكل الذي تريد أن تبدو عليه المخرجات فقط.
💡 ابدأ بالتشخيص. شاهد مقطعًا قصيرًا بالحجم الكامل. هل هو ضبابي لكنه نظيف بخلاف ذلك؟ فهذه مشكلة دقة. هل يبدو مشوشًا أو تظهر فيه كتل ضغط مرئية؟ فهذه مشكلة استعادة. هل يتقطع أو يبدو مهتزًا؟ فهذه مشكلة معدل إطارات.
بالنسبة للصور الثابتة أو الإطارات المستخرجة من الفيديو، يطبّق Topaz Image Upscale وGoogle Upscaler مبادئ الرفع الفائق للدقة نفسها على الصور المفردة، وهي مفيدة لاستخراج لقطات ثابتة نظيفة مباشرة من لقطات الفيديو.
جرّبها على لقطاتك الخاصة
أفضل طريقة لترى ما تفعله هذه النماذج فعلًا هي تمرير لقطاتك الخاصة عبرها. اختر مقطعًا لم يعجبك، كأن يكون مصوّرًا في الإضاءة الضعيفة أو بهاتف قديم، ومرره عبر Crystal Video Upscaler أو Topaz Video Upscale على PicassoIA.
لا يحتاج الذكاء الاصطناعي إلى مادة مصدر مثالية. وهذه هي النقطة تحديدًا. فقد صُمم للعمل مع اللقطات الواقعية غير الكاملة والمضغوطة والقديمة. وما تحصل عليه في المقابل أكثر حدة ونظافة وأسهل في المشاهدة. ليس لأن أحدًا أصلحها يدويًا إطارًا تلو الآخر، بل لأن النموذج رأى أمثلة كافية على الفيديو الجيد والسيئ ليعرف كيف يُفترض أن يبدو الجيد.

تمنحك PicassoIA وصولًا مباشرًا إلى أفضل نماذج معالجة الفيديو بالذكاء الاصطناعي المتاحة، من Crystal Video Upscaler إلى Topaz Video Upscale وReal ESRGAN Video، كلها في مكان واحد. ارفع مقطعك، واختر نموذجًا، وشاهد ما ترى الشبكة العصبية عندما تنظر إلى لقطاتك.