في المرة الأولى التي شاهدته فيها، أعدت تشغيله ثلاث مرات قبل أن يتقبّل دماغي ما يراه. تحرّك الوجه. تطابقت حركة الشفاه تمامًا. رمش العينين. ومع ذلك، كان ثمة شيء خاطئ بعمق، وبشكل يبعث على الانزعاج، في الفراغ بين الإطارات. ليس خطأ بصريًا من نوع الخلل التقني، ولا من نوع "هذا واضح أنه مزيّف". شيء أعمق. شيء جعل شعر ذراعيّ يقفان قبل أن أتمكن من تحديد السبب.
هذه هي تجربة أغرب فيديو بالذكاء الاصطناعي باختصار: وجه يرغب عقلك الواعي في تصديقه، بينما يرفضه جهازك العصبي. لقد ضاقت المسافة بين الحقيقي والاصطناعي إلى حدّ لم يعد يكشف الفرق فيه سوى شيء قديم وحيواني وسابق للغة داخلك.
هكذا يعمل الأمر فعلًا.

لحظة لا تستطيع فيها أن تُبعد نظرك
خيانة الدماغ
يعالج دماغك الوجوه بطريقة مختلفة عن أي نوع آخر من المدخلات البصرية. يُفعَّل مسار عصبي متخصص يُسمّى المنطقة المغزلية للوجه في اللحظة التي يرصد فيها أي شيء على هيئة وجه. ويحدث ذلك قبل أن تسجّل الصورة بوعيك. لهذا يحدّق الرُضّع في الوجوه منذ أيامهم الأولى، ولهذا ترى الوجوه في السحب، وفي خشب الأثاث، وفي مقابس الكهرباء.
عندما تُفعَّل هذه الدائرة على وجه مولّد بالذكاء الاصطناعي، تعمل استجابة التعرّف الأولية بشكل طبيعي. لكن مرحلة التحقق، أي المقارنة العميقة التي تجريها القشرة البصرية مع ملايين القوالب المخزنة في الذاكرة عن طريقة حركة الوجوه الحقيقية وتعبيرها، تُعيد نتيجة غير متطابقة. مدخل عالي الثقة، وعدم تطابق عالي الثقة. يولّد دماغك إشارة ليس لديه تصنيف واضح لها.
هذا هو الارتجاف. هذا هو الشيء الذي يجعلك تشعر بأنك مراقَب من كيان ليس له عيون.
لماذا ينتشر بهذه السرعة
المحتوى المقلق يحقق الانتشار. تُظهر الأبحاث النفسية حول انتشار المحتوى باستمرار أن المواد السلبية عالية الإثارة، أي تلك التي تولّد مشاعر لا تستطيع تسميتها بدقة، تُشارَك بمعدلات أعلى بكثير من المحتوى المحايد أو الإيجابي. عندما تشاهد أغرب فيديو بالذكاء الاصطناعي رأيته في حياتك، يكون أول ما يخطر لك أن ترسله إلى شخص آخر. "قل لي إنني لست الوحيد الذي يرى هذا."
يلتقي البحث عن التأكيد الاجتماعي بالانزعاج الحسّي. يصل المقطع إلى خمسة ملايين مشاهدة خلال 48 ساعة. تكافئه المنصات دون أن يقصد أحد ذلك. الخوارزمية تقرأ التفاعل، لا السبب الذي يقف وراءه.

ما هو وادي الغرابة
من الروبوتات إلى الفيديو الاصطناعي
صاغ المصطلح الباحث في الروبوتات ماساهيرو موري عام 1970. لاحظ أنه كلما صارت الروبوتات أشبه بالبشر في مظهرها، ازداد ارتياح الناس لها وألفتهم معها بثبات، حتى يبلغون عتبة محددة. عند تلك العتبة، ينخفض الارتياح فجأة إلى ما يشبه الاشمئزاز. أطلق على تلك العتبة اسم وادي الغرابة.
يمثّل المحور السيني درجة الشبه بالإنسان، ويمثّل المحور الصادي الاستجابة العاطفية. تقع شخصية الرسوم الكرتونية عند درجة شبه منخفضة، فنشعر بالراحة. ويقع الروبوت الميكانيكي الواضح عند درجة شبه متوسطة، فنجده لطيفًا. أما الوجه البشري الواقعي جدًا فيقع قرب قمة مقياس الشبه بالإنسان، فنشعر بخلل عميق. ووجه الإنسان الحي الحقيقي يقع عند 100%، فنعود إلى الشعور بالطبيعية.
لقد هبط توليد الفيديو بالذكاء الاصطناعي الحديث داخل ذلك الوادي بدقة جراحية. صارت الفجوة بين ما يولّده الذكاء الاصطناعي وما يبدو عليه الإنسان الحقيقي أصغر من الفجوة التي نستطيع أن نحددها بوعينا. أغرب مقطع فيديو مولّد بالذكاء الاصطناعي ليس أبدًا ذلك الذي تظهر فيه أخطاء واضحة. إنه ذلك الذي لا تستطيع فيه أن تجد الخلل فعلًا، لكن جسدك يعرف مسبقًا أنه موجود.
المحفزات المحددة
تشير الأبحاث حول استجابات وادي الغرابة في الوسائط الاصطناعية باستمرار إلى مجموعة من المحفزات الإدراكية التي تعمل دون الانتباه الواعي:
| المحفّز | ما الذي يسير بشكل خاطئ |
|---|
| التعابير الدقيقة | غائبة بين تحولات التعبير الكبرى |
| حركة العين | حركات السكّادات أنعم من اللازم، وتوقيتها مثالي أكثر من اللازم |
| ملمس الجلد | إضاءة موحّدة، دون تشتت تحت السطح |
| فيزياء الشعر | يتحرك ككتلة واحدة، لا كخصلات فردية |
| توقيت الرمش | فواصل منتظمة أكثر من اللازم، ومدة قصيرة جدًا |
| إزاحة مزامنة الشفاه | الصوت يسبق الصورة أو يتأخر عنها بمقدار 30 إلى 80 ميلي ثانية |
قد لا يسجّل أي واحد من هذه المحفزات بوعيك إذا ظهر منفردًا. أما اجتماعها كلها، حتى بشدة منخفضة، فيُنتج ذلك الإحساس المميز بالخطأ الذي يتداوله الناس بوصفه أغرب محتوى فيديو مولّد بالذكاء الاصطناعي على الإنترنت.

التقنية التي تصنع هذه المقاطع
كيف تعمل نماذج تحويل النص إلى فيديو
يعتمد توليد الفيديو بالذكاء الاصطناعي الحديث على نماذج الانتشار المدرّبة على مليارات الإطارات المرئية. يتعلم النموذج العلاقات الإحصائية بين أوصاف النص والتسلسلات البصرية، بين عبارة "امرأة تدير رأسها ببطء لتنظر إلى الكاميرا" والتوزيعات الدقيقة للبكسلات، وتغيّرات الإضاءة، وأنماط الحركة التي تصف هذا الفعل.
عند التوليد، يبدأ النموذج بضجيج منظّم ويزيله تدريجيًا، موجّهًا بأمرك النصي وبالافتراضات المكتسبة عن الشكل الذي يُفترض أن يبدو عليه الفيديو. والنتيجة مقطع يطابق وصفك دون أن يستمد أي لقطات حقيقية من أي مكان.
المشكلة أن هذه النماذج تتعلم المتوسطات. الوجوه البشرية الحقيقية ليست متوسطات. إنها محددة، وغير متماثلة، وقد شكّلتها حياة بعينها بطرق بعينها. أما الوجوه المولّدة بالذكاء الاصطناعي فتميل إلى متوسط مثالي، وهذا ما يُنتج ذلك الكمال المزعج. جميلة كما يكون تمثال الشمع جميلًا. صحيحة من بعيد، خاطئة عن قرب.
نماذج تدفع الحدود
تضيق الفجوة بين الاصطناعي والحقيقي بوتيرة فاجأت حتى الباحثين الذين يعملون عليها. تنتج أفضل أدوات تحويل النص إلى فيديو المتاحة حاليًا مقاطع تصمد أمام المشاهدة العادية في الظروف المعتادة. وفي PicassoIA، تقف عدة نماذج في طليعة هذه التقنية.
يقدّم Veo 3 من Google توليد فيديو مع صوت متزامن أصلي، ويتعامل مع مزامنة الشفاه والأصوات المحيطة في الوقت نفسه. وقد لوحظ أن جودة حركة الوجه في مخرجات Veo 3 من أكثر الحركات الإنسانية إقناعًا التي أنتجها أي نظام توليدي حتى الآن.
يقدّم Kling v3 Video لقطات سينمائية، مع تحسّن ملحوظ في معالجة التعابير الدقيقة مقارنةً بالإصدارات السابقة. أما الاتساق الزمني، أي مدى ثبات الوجه بوصفه الشخص نفسه من إطار إلى آخر، فهو أقوى بكثير مما كان ممكنًا قبل 12 شهرًا.
يحوّل Wan 2.7 T2V أوامر النص إلى فيديو بدقة 1080p مع تماسك حركي قوي. قدّم له أمرًا نصيًا مفصلًا عن نوع شخص محدد في ظروف إضاءة معينة، وستحصل على نتائج تتحدى إدراكك فعلًا عند المشاهدة الأولى.
يقدّم Sora 2 من OpenAI تحويل النص إلى فيديو مع صوت متزامن وحركة تراعي قوانين الفيزياء. الطريقة التي يتحرك بها القماش، والطريقة التي يتفاعل بها الشعر مع الحركة والضوء، هذه هي التفاصيل التي يتميز فيها Sora 2 عن أدوات الجيل السابق.
يولّد Hailuo 02 فيديو بالذكاء الاصطناعي بدقة 1080p وجودة إطارات سينمائية. ويتعامل عرض الوجه لديه مع الانتقال من التعبير المحايد إلى التعبير العاطفي بطريقة عجزت عنها النماذج السابقة دون ظهور تشوّهات مرئية.

لماذا تُعدّ الوجوه الجزء الأصعب
عيون لا ترمش بالشكل الصحيح
يرمش البشر بشكل لا إرادي كل أربع إلى ست ثوانٍ. يستغرق الرمش نفسه نحو 300 إلى 400 ميلي ثانية. والأهم أن معدل الرمش يتغير بدرجة كبيرة مع الحالة العاطفية والحمل الذهني. يرمش الناس أقل بكثير عندما يركزون بشدة، وأكثر تكرارًا عندما يكونون قلقين أو متعبين.
تُولّد نماذج فيديو الذكاء الاصطناعي الرمشات غالبًا بمعدلات متوسطة صحيحة إحصائيًا، لكنها تُغفل التباين المرتبط بالسياق تمامًا. قد لا يرمش وجه يلقي مونولوجًا مكثفًا لمدة 20 ثانية. أما وجه الذكاء الاصطناعي الذي يلقي المونولوج نفسه فيرمش كل خمس ثوانٍ كأنه مِترونوم. يلاحظ دماغك ذلك حتى لو لم تدرك ذلك بوعي. يصنّف المقطع بأنه "خاطئ" قبل أن تنتهي من مشاهدته.
تتحرك العينان بطريقة مختلفة أيضًا. تشمل الحركة الطبيعية للعين السكّادات الدقيقة، وهي حركات لا إرادية صغيرة جدًا تحدث عدة مرات في الثانية. هذه الحركات غير مرئية تقريبًا، لكن غيابها يخلق جودة سكونية خفية في عيون الذكاء الاصطناعي، يصفها المشاهدون المدرّبون باستمرار بأنها "ميتة" أو "زجاجية". هذا الوصف هو وادي الغرابة مضغوطًا في كلمتين.
جلد مثالي أكثر من اللازم
للجلد البشري الحقيقي تشتت تحت السطح، حيث يتغلغل الضوء قليلًا تحت الطبقة الخارجية ثم يرتد إلى الخارج، فيخلق الشفافية الدافئة المرئية في الخدين والأذنين تحت الضوء المباشر. وله مسام، يُلقي كل منها ظلًا مجهريًا يساهم في الملمس العام. وله شعر ناعم يتفاعل مع حركة الهواء. وله التاريخ الجسدي المتراكم لصاحبه: أضرار الشمس، وأنماط الشعيرات الدموية، وعدم التماثل الذي تراكم عبر السنين.
يُعرض جلد الذكاء الاصطناعي كسطح لا كحجم. الإضاءة متساوية أكثر من اللازم. والملمس متسق أكثر من اللازم من سنتيمتر إلى آخر. يبدو الجلد كأنه تنقيح فوتوغرافي احترافي قام به شخص لم يعرف متى يتوقف. جميل من الناحية التقنية، وخاطئ بعمق من الناحية الحدسية.
💡 العلامة المميزة: انظر إلى الانتقال بين الفك والحلق في فيديو الذكاء الاصطناعي. يُظهر الأشخاص الحقيقيون تباينًا في لون البشرة وملمسها عند هذا الحد. أما وجوه الذكاء الاصطناعي فغالبًا ما تمتزج من الوجه إلى الرقبة بتجانس غير طبيعي، دون أي تباين في الظلال أو تغيّر في اللون، وهو ما تُنتجه البنية التشريحية الحقيقية.

التمييز بين التزييف العميق
التزييف العميق مقابل الفيديو المولّد بالذكاء الاصطناعي
يُستخدم هذان المصطلحان بالتبادل، لكنهما يصفان عمليتين مختلفتين جوهريًا.
التزييف العميق يأخذ وجهًا من مصدر ويعيد تركيبه على فيديو مستهدف. هناك وجه شخص حقيقي في المصدر، وفيديو حقيقي في الهدف. يتعلم الذكاء الاصطناعي ترجمة مظهر الوجه A إلى وضعية الوجه B وتعبيره. الشخص موجود، والمزيّف هو الفيديو وحده.
الفيديو المولّد بالذكاء الاصطناعي ينتج وجوهًا اصطناعية من الصفر. لا شخص مصدر، ولا لقطات أصلية. الوجه مبني إحصائيًا من افتراضات مكتسبة عمّا تبدو عليه الوجوه البشرية في المجمل عبر ملايين أمثلة التدريب.
غالبًا ما يأتي أغرب محتوى فيديو مولّد بالذكاء الاصطناعي من الفئة الثانية، لأنه لا يوجد أصل تُقارن به. في التزييف العميق، قد ينطوي الكشف أحيانًا على العثور على الأصل. أما الفيديو الاصطناعي بالكامل فلا يوجد له أصل. الشخص لم يوجد قط.
| النوع | المصدر | طريقة الكشف |
|---|
| التزييف العميق | وجه شخص حقيقي موضوع على الهدف | المقارنة مع الأصل المعروف |
| تبديل الوجوه | شخصان حقيقيان يتبادلان الوجهين | عيوب الملمس والحواف |
| مولّد بالذكاء الاصطناعي | لا شخص مصدر على الإطلاق | التحليل الإحصائي وحده |
| استنساخ الصوت | تسجيل صوت حقيقي | تحليل أنماط الطيف الصوتي |
كيف تكتشف الفرق
لا توجد طريقة واحدة موثوقة للكشف في مواجهة أفضل النماذج الحالية. الجمع بين عدة إشارات يمنحك فرصًا أفضل:
- اتساق الخلفية: هل تحافظ الخلفية على عمق مكاني وتفاصيل واقعية طوال المقطع؟
- التفاعل مع الأشياء: هل تتفاعل الأيدي فعلًا مع الأشياء بشكل مادي، أم تحوم قربها دون تلامس؟
- استمرارية الإضاءة: هل تتطابق الإضاءة على الوجه مع مصادر الضوء المفترضة في المشهد؟
- تزامن الصوت والصورة: مع إغلاق عينيك، هل يبدو الصوت جزءًا أصيلًا من الفيديو، أم أنه وُضع فوقه لاحقًا؟
- انتقالات التعبير: هل تمر المشاعر بحالات وسيطة، أم تنتقل من حالة إلى أخرى دون إطارات انتقالية؟
يحرّك Kling Avatar v2 على PicassoIA الوجوه بواقعية كافية تجعل دراسة مخرجاته تدرّب عينك على معرفة المكان الدقيق الذي تظهر فيه العلامات في الممارسة. توليد المقاطع ثم البحث عن التشوّهات فيها من أكثر الطرق فعالية فعلًا للتدرّب على الكشف.

صناعة مقاطعك الغريبة بالذكاء الاصطناعي
استخدام Kling v3 Video في PicassoIA
النماذج التي تنتج أغرب محتوى فيديو مولّد بالذكاء الاصطناعي متاحة مجانًا. إذا أردت أن ترى كيف تعمل هذه التقنية من الداخل، أو أن تصنع مقاطعك السينمائية الخاصة ذات الأجواء المميزة، فهذه هي الخطوات باستخدام Kling v3 Video في PicassoIA:
الخطوة 1: الوصول إلى النموذج
افتح Kling v3 Video على PicassoIA. تمنحك الواجهة حقل الأمر النصي، وإعدادات المدة، وأدوات التحكم في الدقة.
الخطوة 2: اكتب أمرًا نصيًا محددًا
ترتبط جودة المخرجات ارتباطًا مباشرًا بدقة الأمر النصي. ضمّن ما يلي:
- وصف الشخص (العمر التقريبي، لون الشعر، الحالة العاطفية)
- زاوية الكاميرا والمسافة (لقطة مقرّبة جدًا، لقطة متوسطة، زاوية منخفضة تنظر إلى الأعلى)
- الإضاءة (منتشرة وغائمة، ضوء جانبي واحد موجّه، ضوء الشاشة وحده)
- الحركة (يدير رأسه ببطء ليواجه الكاميرا، يتحدث مباشرة إلى العدسة، ينظر إلى ما خلف الإطار من اليسار)
- الأجواء (عزلة سريرية، غرفة في وقت متأخر من الليل، ممر فارغ)
الخطوة 3: اضبط المدة والدقة
للحصول على مخرجات سينمائية، اختر أعلى دقة متاحة. المقاطع التي تمتد من خمس إلى ست ثوانٍ تحافظ على اتساق الوجه عبر الزمن بشكل أفضل من المدد الأطول بمستويات الجودة الحالية للتوليد.
الخطوة 4: أضف أوامر نصية سلبية
استبعد: "رسوم كرتونية، رسوم توضيحية، CGI، رسوم متحركة، جودة منخفضة، ضبابية، مشوّهة"
الخطوة 5: كرّر التوليد عدة مرات
نادرًا ما تكون أول نتيجة تحصل عليها هي الأفضل المتاح. كل عملية توليد تأخذ عينة من منطقة مختلفة من فضاء الاحتمالات. شغّل من ثلاث إلى خمس عمليات توليد، واختر النتيجة الأقرب إلى قصدك.
💡 نصيحة للأمر النصي: وصف الحالة العاطفية ("شخص سمع للتوّ شيئًا لم يكن من المفترض أن يسمعه") يُنتج سلوكًا أكثر إثارة للاهتمام في التعابير الدقيقة من الأوصاف الجسدية البحتة للمظهر. فقد تعلّم النموذج ارتباطات بين الحالات العاطفية وحركات العضلات الدقيقة التي تنقلها.
نصائح للواقعية السينمائية
للحصول على نتائج ذات أجواء مميزة عند العمل مع Veo 3 أو Wan 2.7 T2V أو Pixverse v5:
- حدّد الإضاءة بدقة: "مصباح مكتب واحد من جهة اليمين للكاميرا يلقي ظلًا حادًا نحو اليسار" ينتج أجواء أكثر تميزًا من "إضاءة داخلية"
- استخدم لغة الكاميرا: "لقطة متوسطة مقرّبة"، "حركة يدوية خفيفة"، "تبديل التركيز من الخلفية إلى الوجه"
- استحضر جماليات أفلام التصوير: "حبيبات فيلم Kodak"، "وهج خفيف لعدسة أنامورفيك"، "إحساس وثائقي بالكاميرا المحمولة"
- اعمل مع أشخاص منفردين: مشاهد الحشود والوجوه المتعددة تقلل الاتساق بشكل كبير بمستويات الجودة الحالية
- صف المكان، لا الشخص وحده: "ممر مكتب فارغ مضاء بمصابيح الفلورسنت في الثالثة فجرًا" يوفر سياقًا يستخدمه النموذج لتحديد إضاءة الوجه والمزاج العام

ماذا يعني هذا لطريقة مشاهدتنا للفيديو
أغرب فيديو بالذكاء الاصطناعي رأيته في حياتك ليس نهاية المطاف. إنه محطة في الطريق. تتحسن النماذج التي تولّد هذا المحتوى بوتيرة جعلت مخرجات العام الماضي تبدو كنماذج أولية مبكرة. الاتساق الزمني، ومعالجة التعابير الدقيقة، ومحاكاة عرض الجلد والإضاءة تحت السطح، كل ذلك يتجه نحو عتبة يصبح عندها الكشف البصري غير موثوق للمشاهد العادي.
يطرح هذا أسئلة حقيقية وعملية حول كيفية استهلاكنا لمحتوى الفيديو وعلاقتنا به. فكما غيّرت برامج تحرير الصور المتاحة للجميع علاقتنا بالصور الثابتة خلال آخر 30 عامًا، يغيّر توليد الفيديو بالذكاء الاصطناعي علاقتنا بالصور المتحركة الآن، وفي الوقت الفعلي.
الشعور المخيف الذي تحسّه وأنت تشاهد وجهًا اصطناعيًا ليس مجرد فضول أو رد فعل عابر. إنه نظامك البصري يقوم بآخر مرحلة كشف موثوقة قبل أن تصير الإشارة غير قابلة للتمييز عن الضجيج. ذلك الحدس يستحق الانتباه إليه طالما أنه ما زال يعمل بثبات.
مقاطع الفيديو الفيروسية المولّدة بالذكاء الاصطناعي، ومحتوى التزييف العميق، والوسائط الاصطناعية التي تتداولها مجموعات الدردشة وخلاصات التوصيات، كل ذلك تنتجه الفئة نفسها من الأدوات. ومعرفة طريقة عمل هذه الأدوات ليست اهتمامًا نظريًا. إنها المعرفة الأساسية لمشاهدة الفيديو في عام 2027 وما بعده.
💡 ما يبقى إنسانيًا بوضوح: السياق، والنية، والسبب المحدد الذي يجعل شخصًا ما يعبّر بتعبير معين في لحظة معينة وضمن حديث معين. يستطيع الذكاء الاصطناعي أن يولّد وجهًا. لكنه لا يستطيع بعد أن يولّد التاريخ الشخصي المتراكم وراء سبب ظهور ذلك الوجه بالشكل الدقيق في تلك اللحظة بالذات. هذه الخصوصية، في الوقت الحالي، هي أوضح إشارة متاحة دون الحاجة إلى خوارزمية كشف.

اصنع شيئًا يثير القلق
التقنية نفسها التي تنتج أكثر المقاطع إزعاجًا على الإنترنت هي بالضبط ما يجعل تجربة صناعة فيديو الذكاء الاصطناعي تستحق التجريب. الخط الفاصل بين المخيف والسينمائي يعتمد في معظمه على النية والحرفية، وكلاهما متاح لأي شخص يملك متصفحًا وأمرًا نصيًا دقيقًا.
يضع PicassoIA مجموعة الأدوات كاملة أمامك دون الحاجة إلى أي إعداد تقني: Kling v3 Video لتحريك الوجوه سينمائيًا مع اتساق زمني قوي، وVeo 3 لمقاطع السرد المتزامنة مع الصوت حيث يتحرك الصوت والوجه معًا بطبيعية، وWan 2.7 T2V للقطات ذات الأجواء المميزة بدقة 1080p العالية، وSora 2 لحركة تراعي الفيزياء حيث يتصرف القماش والشعر كما في الواقع، وPixverse v5 للتكرار السريع عندما تختبر تنويعات الأوامر النصية بسرعة.
لا تحتاج إلى استوديو، أو كاميرا، أو طاقم تمثيل. تحتاج إلى وصف دقيق لما تريد رؤيته، وإلى الصبر على التكرار حتى يلتقي ما تخيّلته مع ما يولّده النموذج.
أغرب فيديو بالذكاء الاصطناعي رأيته في حياتك صنعه شخص يجلس في المكان نفسه الذي تجلس فيه الآن.
