أداة ذكاء اصطناعي تقلب TikTok رأسًا على عقب الآن (والصنّاع لا يكفّون عن الحديث عنها)

تغمر الفيديوهات المولَّدة بالذكاء الاصطناعي خلاصات TikTok حول العالم. من نماذج تحويل النص إلى فيديو الواقعية كالصور الفوتوغرافية إلى أدوات مزامنة الشفاه الرائجة، تعرّف على أدوات الذكاء الاصطناعي التي تقف وراء المحتوى الأكثر مشاهدة الآن، ولماذا تكافئها خوارزمية المنصة، وما تحتاجه لتبدأ بصناعة مقاطعك الخاصة التي توقف التمرير خلال دقائق.

أداة ذكاء اصطناعي تقلب TikTok رأسًا على عقب الآن (والصنّاع لا يكفّون عن الحديث عنها)
Cristian Da Conceicao
مؤسس Picasso IA

بدأ الأمر بفيديو واحد. ستون ثانية من لقطات واقعية كالصور الفوتوغرافية: امرأة تسير في عاصفة مطرية في طوكيو، كل قطرة تعكس أضواء النيون، وكل خصلة شعر تتحرك مع الريح. كانت التعليقة المرفقة: "صنعتُ هذا في 3 دقائق دون كاميرا." تجاوزت تلك المشاركة 14 مليون مشاهدة في أقل من 48 ساعة. كانت هذه اللحظة التي توقف فيها توليد الفيديو بالذكاء الاصطناعي عن كونه مجرد نزوة، وصار الأداة التي تعيد كتابة طريقة صناعة محتوى TikTok بهدوء. الصنّاع الذين يفهمون ما يحدث الآن يكتسبون ميزة يصعب جدًا تعويضها بعد أن تنفتح.

لماذا يسيطر الفيديو بالذكاء الاصطناعي على TikTok

لم تعد الأرقام الخاصة بمحتوى الذكاء الاصطناعي على TikTok إحصاءات لمتبنّيها الأوائل. فالفيديوهات الموسومة بـ #AIGenerated و#AIVideo و#TextToVideo جمعت مليارات المشاهدات مجتمعةً في 2024. لكن نقطة البيانات الأكثر إثارة للاهتمام ليست الحجم، بل المصدر. فالمحتوى بالذكاء الاصطناعي الأعلى أداءً لا يبدو مولّدًا بالذكاء الاصطناعي. يبدو كإنتاج باهظ الثمن. هذا التحول، من "فن الذكاء الاصطناعي" إلى "محتوى كان يمكن تصويره"، هو ما غيّر كل شيء.

عامل إيقاف التمرير

تكافئ خوارزمية TikTok شيئًا واحدًا فوق كل شيء: وقت المشاهدة. عندما يوقف فيديو شخصًا عن التمرير، تُضخَّم هذه الإشارة عبر محرك التوصيات. يتمتع المحتوى المولّد بالذكاء الاصطناعي، وتحديدًا مقاطع تحويل النص إلى فيديو الواقعية كالصور الفوتوغرافية، بميزة هيكلية شبه غير عادلة هنا. يتوقف الناس لأنهم لا يستطيعون استيعاب ما يشاهدونه. هل هذا حقيقي؟ هل تم تصويره؟ كيف صنعوا هذا؟

نافذة الارتباك التي تستغرق ثلاث ثوانٍ تساوي ملايين الظهورات. الصنّاع الذين يفهمون هذا يبنون استراتيجيات محتوى كاملة حول لحظة الشك.

صانع محتوى بالذكاء الاصطناعي يسجّل فيديو TikTok في استوديو منزلي

من يصنع هذا المحتوى فعلًا

الصنّاع الذين يقودون نمو محتوى الذكاء الاصطناعي ليسوا مجرد متحمسين للتقنية. حسابات الجمال تستخدم الذكاء الاصطناعي لتوليد صور شخصية بجودة المجلات دون توظيف مصوّر. صنّاع محتوى السفر ينتجون لقطات لوجهات لم يزوروها قط. فنانو الموسيقى ينشرون فيديوهات كلمات الأغاني بمرئيات سينمائية بالذكاء الاصطناعي مبنية مباشرة على وصف المقطع الموسيقي. مدربو اللياقة يولّدون لقطات تحفيزية كانت ستتطلب فريق إنتاج كاملًا قبل ستة أشهر.

القاسم المشترك بينهم جميعًا: وجدوا أدوات أزالت الحاجز الإنتاجي بين امتلاك فكرة ونشرها. تقلّص الوقت الفاصل بين المفهوم الإبداعي والفيديو المنشور من أيام إلى دقائق.

نماذج الفيديو بالذكاء الاصطناعي وراء المحتوى الرائج

ليست كل نماذج تحويل النص إلى فيديو تنتج الجودة نفسها، والفجوة بين الفئة العليا الحالية وكل ما عداها صارت واسعة بما يكفي للتأثير مباشرة في أداء المحتوى. الصنّاع الذين ينشرون أكثر محتوى الفيديو بالذكاء الاصطناعي مشاهدةً يستخدمون مجموعة محددة من النماذج، وهذه النماذج متاحة للجميع.

Kling: النموذج الذي يتحدث عنه الجميع

يدان تمسكان هاتفًا يعرض صورة شخصية مولّدة بالذكاء الاصطناعي

أصبح Kling v3 Omni Video النموذج الأكثر ذكرًا في أوساط صنّاع الذكاء الاصطناعي. يتعامل مع فيزياء الحركة المعقدة بمستوى يفاجئ الناس باستمرار: حركة القماش مع الريح، وديناميكيات الشعر، وأسطح الماء، وسلوك النار، كلها تُصيَّر بثقل فيزيائي لا تستطيع النماذج الأرخص محاكاته. ويولّد فيديو بدقة 1080p مع صوت أصلي من أمر نصي، ما يلغي خطوة كاملة من ما بعد الإنتاج في سير العمل.

بالنسبة إلى الصنّاع الذين يبدأون بصورة رئيسية قوية، يقدّم Kling v2.6 تحريك الصورة إلى فيديو مع الحفاظ على الصورة الأصلية وإضافة حركة طبيعية وسلسة. هذا هو النموذج وراء معظم فيديوهات "صورتي دبّت فيها الحياة" التي تظهر في صفحة For You يوميًا. لا تبدو الحركة كمؤثر بصري، بل تبدو كأن الصورة الأصلية كانت فيديو أوقفه أحدهم مؤقتًا.

يذهب Kling Avatar v2 خطوة أبعد، إذ يحرّك أي وجه ليصبح فيديو كاملًا بتعابير وحركة مضبوطتين. بالنسبة إلى الصنّاع الذين يبنون محتوى تقوده الشخصيات، هذه أداة مهمة.

لماذا ينجح على TikTok: تحمل الحركة في مخرجات Kling ثقلًا سينمائيًا. لا تبدو كحشو مولّد بالذكاء الاصطناعي، بل تبدو كلقطات من تصوير حقيقي، وهذا بالضبط ما تكافئه الخوارزمية.

Veo 3 وثورة الصوت الأصلي

غيّر Veo 3 من Google الحديث عن فيديو الذكاء الاصطناعي بطريقة ما زال الصنّاع يستوعبونها. فهو يولّد صوتًا متزامنًا مباشرة مع الفيديو، وليس كخطوة منفصلة تتطلب مزامنة يدوية. ضوضاء المحيط، وأصوات الحشود، والحوار، وتأثيرات الطقس، كلها تُصنَع من الأمر النصي نفسه الذي يقود المخرجات المرئية.

يقدّم Veo 3.1 المُحدَّث دقة 1080p مع اتساق زمني محسَّن، أي أن الأشخاص يبقون ثابتين عبر الإطارات بدلًا من الانجراف. بالنسبة إلى TikTok، حيث يمثل الصوت نصف التجربة، وحيث تستخدم الخوارزمية التفاعل مع الصوت كإشارة ترتيب فعلية، يصبح توليد الصوت الأصلي ميزة تنافسية مباشرة.

💡 نصيحة Veo 3: اكتب الصوت صراحةً في أوامرك النصية. عبارات مثل "صوت المطر على سقف من الصفيح"، أو "ضوضاء مقهى هادئة في الخلفية"، أو "خطوات حادة على رصيف مبلّل" تحسّن جودة الصوت الناتج بشكل ملحوظ. يستجيب النموذج للأوصاف الصوتية المحددة، لا للعامة.

شاب يجلس في مقهى أمام حاسوبه محدَّقًا في محتوى مولّد بالذكاء الاصطناعي

الإصدار السريع Veo 3.1 Fast يقلّل وقت المعالجة للصنّاع الذين يحتاجون إلى دورات تكرار أسرع.

Pixverse واستراتيجية الحجم

صُمّم Pixverse v5.6 للسرعة والاتساق على نطاق واسع. بينما تعطي بعض النماذج الأولوية للجودة القصوى المطلقة بسرعات أبطأ، أُحسن Pixverse ليكون سريع الإنجاز دون خسارة كبيرة في الجودة. ولهذا يصبح النموذج المفضّل للصنّاع الذين ينشرون يوميًا أو عدة مرات في اليوم.

سير العمل الذي يتبعه معظم صنّاع Pixverse: توليد دفعة من 15 إلى 25 مقطعًا في جلسة واحدة، ثم اختيار أفضل ثلاثة أو أربعة للنشر. كلما زادت المخرجات، زادت فرص الوصول إلى لحظة توقف التمرير. معدل النجاح في دفعة من 20 مقطعًا من Pixverse مرتفع بما يكفي لدعم جدول نشر يومي دون أن ينفد المحتوى.

يقدّم Pixverse v4.5 وقت معالجة أطول قليلًا مع حركة سينمائية محسّنة، للصنّاع الذين يريدون الموازنة بين السرعة والجودة في المقاطع الأطول.

Seedance 2.0: حين تحتاج الشخصيات إلى الحركة

يمثل Seedance 2.0 من ByteDance حاليًا المعيار في حركة الشخصيات البشرية. الإيماءات، ولغة الجسد، وتعابير الوجه الدقيقة، ودورات المشي الطبيعية، كلها تُصيَّر بدقة استثنائية. بالنسبة إلى الصنّاع الذين يبنون محتوى سرديًا تقوده الشخصيات، أو مقاطع رقص، أو مقاطع قصص، يتفوق Seedance باستمرار على المنافسين في اختبار "هل يبدو هذا الشخص حقيقيًا".

امرأة ترتدي فستانًا أخضر مائلًا إلى الرمادي على شرفة سطح عند الساعة الذهبية

يتضمن سلفه Seedance 1.5 Pro توليد الصوت الأصلي، وما زال خيارًا قويًا للصنّاع الذين يريدون مخرجات تركز على الشخصيات ومعها الصوت. أما الصنّاع ذوو الحجم الكبير، فيمكنهم استخدام Seedance 2.0 Fast الذي يقلّل وقت المعالجة بشكل ملحوظ دون تراجع كبير في الجودة.

Hailuo 02: معيار الواقعية الفوتوغرافية

ينتج Hailuo 02 من Minimax لقطات تُخطأ باستمرار على أنها تصوير كاميرا حقيقي. يتميز النموذج بقوة محددة في تفاصيل البيئة: ظروف الإضاءة، والتأثيرات الجوية، وملمس الأسطح. غروب الشمس فوق الماء، وشارع مبلّل بالمطر ليلًا، وصباح ضبابي في وادٍ جبلي. تخرج هذه المشاهد بحضور مادي لا تستطيع النماذج الأرخص مضاهاته.

💡 أسلوب كتابة أوامر Hailuo: اكتب أمرك كما لو كنت تُوجِّه مدير تصوير. "ضوء الساعة الذهبية الخلفي من الأعلى الأيسر، عدسة 35 ملم، الشخص في المقدمة بتركيز ناعم أمام خلفية حادة، بانوراما بطيئة نحو اليمين" يعطي نتائج أفضل بكثير من "امرأة سينمائية تمشي".

النموذجالدقةالصوتالأفضل لـ
Kling v3 Omni1080pنعمالحركة السينمائية
Veo 3.11080pنعمالمشاهد الكاملة بالصورة والصوت
Pixverse v5.61080pلاالنشر بحجم كبير
Seedance 2.01080pنعمحركة الشخصيات البشرية
LTX 2.3 Pro4Kلاأقصى دقة
Hailuo 021080pلاالواقعية البيئية
Wan 2.7 T2V1080pلاالحفاظ على التفاصيل
Sora 2HDنعمالمشاهد السردية

موجة مزامنة الشفاه التي لم يتوقعها أحد

بورتريه طبيعي لامرأة في ضوء النافذة، بتعبير واثق

بينما استحوذ تحويل النص إلى فيديو على كل العناوين، أصبح اتجاه موازٍ بهدوء أحد أكثر تنسيقات المحتوى تفاعلًا على المنصة: مزامنة الشفاه بالذكاء الاصطناعي. التقط أي صورة أو فيديو، وأرفق مقطعًا صوتيًا، وسيجعل الذكاء الاصطناعي شفاه الشخص تطابق الكلمات بدقة مقنعة. تتراوح النتائج بين المضحك حقًا، والغريب بعمق، والواقعي بشكل مدهش، وكل نسخة تؤثر في الجمهور بطريقة مختلفة.

ينجح هذا التنسيق على TikTok لسبب نفسي محدد. يتعرف الدماغ على حركات الشفاه كواحدة من أكثر الإشارات الأساسية للتواصل البشري. وعندما تتزامن تلك الحركات مع صوت غير متوقع، خاصة صوت لم يكن الشخص قادرًا على إنتاجه أبدًا، يخلق هذا التنافر نوع المقاطعة المعرفية التي تُبقي المشاهدين يتابعون حتى النهاية.

ماذا يفعل الصنّاع بمزامنة الشفاه

تكاثرت التنسيقات الفرعية لمحتوى مزامنة الشفاه بسرعة. شخصيات تاريخية تعلّق على أحداث الساعة. حيوانات أليفة "تتحدث" بأصوات بشرية. شخصيات الماسكوت للعلامات التجارية تلقي عروضًا مكتوبة مسبقًا. لوحات كلاسيكية تقدّم عروض الستاند أب كوميدي. كل نسخة تحقق ملايين المشاهدات تحديدًا لأن دماغ المشاهد لا يستطيع قبول ما يعالجه كليًا.

يُعدّ Omni Human 1.5 من ByteDance حاليًا الأداة الأكثر استخدامًا لهذا التنسيق. فهو يولّد فيديو كاملًا للحديث من صورة ثابتة واحدة، مع حركة طبيعية للرأس، ومزامنة شفاه مع أي صوت، وتعابير وجه دقيقة لم تكن موجودة في الصورة الأصلية. يبدو الناتج كفيديو حقيقي من شيء لم يُصوَّر قط.

لتحريك مقاطع فيديو موجودة بدلًا من الصور الثابتة، يقدّم Kling Lip Sync وLipsync 2 Pro أدق مزامنة بين الفم والصوت متاحة حاليًا. الفرق التقني بين المزامنة المتوسطة والممتازة يعود إلى الحد الدقيق بين الشفتين والجلد المحيط بهما. تتعامل الأداتان مع هذا الحد بدقة استثنائية.

بالنسبة إلى الصنّاع الذين يعملون في أسواق متعددة، يتيح Video Translate الدبلجة الكاملة إلى أكثر من 150 لغة مع مزامنة شفاه مطابقة. فيديو مسجّل أصلًا بالإنجليزية يتحول إلى 12 نسخة مترجمة محليًا في فترة بعد الظهر. تنمو استراتيجية المحتوى متعدد اللغات بسرعة بين الصنّاع الذين يريدون الوصول إلى جمهور خارج سوقهم اللغوية الأم.

يتعامل Fabric 1.0 من Veed مع رسوم الحديث السريعة من الصور بوقت معالجة سريع، وهو مناسب للصنّاع الذين يحتاجون إلى إنجاز محتوى مزامنة الشفاه بسرعة.

الأداةالمدخلأفضل استخدام
Omni Human 1.5صورة واحدةتحريك أي صورة ثابتة
Kling Lip Syncفيديومزامنة دقيقة للفم
Lipsync 2 Proفيديودبلجة عالية الدقة
Video Translateفيديومحتوى متعدد اللغات
Fabric 1.0صورةرأس متحدث سريع

كيف تصنع محتوى الذكاء الاصطناعي الرائج: ما الذي ينجح فعلًا

مساحة عمل إبداعية بشاشة تعرض شبكة من الصور المولّدة بالذكاء الاصطناعي

هناك فجوة بين توليد محتوى بالذكاء الاصطناعي وتوليد محتوى بالذكاء الاصطناعي يحقق أداءً جيدًا. وبعد تحليل آلاف فيديوهات TikTok المولّدة بالذكاء الاصطناعي، تبدو الأنماط متسقة بما يكفي لتكون قابلة للتطبيق.

أوامر نصية توقف التمرير

تشترك أفضل مقاطع الفيديو المولّدة بالذكاء الاصطناعي في خاصية واحدة: التحديد الدقيق في الأمر النصي. الأوامر الغامضة تنتج نتائج غامضة. الفرق بين "امرأة تمشي في المطر" و"امرأة بعمر 25 عامًا ترتدي معطفًا قطنيًا كريميًا تمشي ببطء في زقاق ضيق في طوكيو عند منتصف الليل، ومطر غزير يهطل، وأضواء النيون تنعكس في برك عميقة، تُصوَّر من الخلف على ارتفاع الركبة، بعدسة 35mm، بحركة بطيئة" هو الفرق بين ما يُنسى وما ينتشر.

بنية الأمر النصي التي تعطي نتائج متسقة:

  • الشخص: من أو ما هو، مع تفاصيل بصرية محددة (العمر، الملابس، التعبير)
  • البيئة: الموقع، وقت اليوم، الفصل، ظروف الطقس
  • الإضاءة: الاتجاه، والجودة، ودرجة حرارة اللون، وسلوك الظلال
  • زاوية الكاميرا: المنظور، والمسافة، ونوع العدسة، والحركة
  • الأجواء: كيف يُحسّ المشهد بالنسبة إلى مشاهد يقف داخله بالفعل

الصنّاع الذين ينشرون أكثر المحتوى مشاهدةً بالذكاء الاصطناعي يكتبون أوامرهم كما يكتب المخرجون أوصاف اللقطات: كل عنصر مقصود ومحدد.

3 أخطاء تقتل الأداء

  1. إضافة صفات جودة بدلًا من الأوصاف: كلمات مثل "سينمائي" و"ملحمي" و"مذهل" لا تفيد. تستجيب النماذج للتفاصيل الوصفية الملموسة، لا للصفات المتعلقة بمستوى الجودة المرغوب. استبدل "إضاءة سينمائية" بالعبارة "ضوء الساعة الذهبية الخلفي من الأعلى الأيسر يخلق إضاءة حافة على كتفي الشخص".

  2. إهمال الإطار الأول: في أغلب المنصات، يكون الإطار الأول هو الصورة المصغّرة. ولّد عدة مخرجات من الأمر النصي نفسه، واختر المخرج الذي يملك أقوى تكوين افتتاحي وأكثرها جذبًا للانتباه. الصورة المصغّرة تحدد ما إذا كان أحدهم سينقر أصلًا.

  3. تجاهل الصوت المقصود: محتوى TikTok بلا استراتيجية صوت يؤدي أداءً ضعيفًا بثبات. استخدم أداة مزامنة الشفاه لإضافة حوار، أو مولّد موسيقى بالذكاء الاصطناعي لتلحين المقطع، أو اختر صوتًا رائجًا يطابق طاقة المرئيات. طبقة الصوت ليست اختيارية.

ماذا تكافئ الخوارزمية

يستجيب نظام توصيات TikTok لإشارات سلوكية محددة يستطيع محتوى الذكاء الاصطناعي تحسينها مباشرة:

  • مقاطع من 3 إلى 8 ثوانٍ بحلقات متصلة بسلاسة: ترتفع معدلات إعادة المشاهدة فتشير إلى محتوى قوي، فيُدفع أبعد
  • الشخص في المركز مع قص عمودي: مساحة إطار أقل مهدورة، وتأثير بصري أكبر في نسبة العرض إلى الارتفاع 9:16
  • المكافأة في أول 1.5 ثانية: يجب أن يقدّم الخطاف قيمته قبل أن يتحرك إبهام المشاهد
  • تطابق الصوت والصورة: المحتوى الذي يتطابق فيه مزاج المرئيات مع طاقة الصوت يحقق أداءً أفضل بكثير من المحتوى الذي تنفصل فيه هذه العناصر

شابة تتصفح هاتفها على سرير أبيض في ضوء الصباح

تتيح أدوات الفيديو بالذكاء الاصطناعي الآن لصانع واحد أن ينتج محتوى بالحجم والجودة البصرية اللذين كانا يتطلبان فريقًا من ثلاثة إلى خمسة أشخاص. هذا التفاوت في الإنتاج هو السبب الهيكلي وراء بدء محتوى الذكاء الاصطناعي في الهيمنة على فئات معينة من المحتوى على المنصة.

كيف تبدو الأشهر الستة القادمة

امرأة ترتدي ياقة عالية تمسك هاتفًا بإضاءة استوديو ناعمة

النماذج المستخدمة حاليًا في محتوى TikTok الرائج ليست السقف. إنها الحد الأدنى. يولّد LTX 2.3 Pro بالفعل فيديو بدقة 4K من أوامر نصية، وهي دقة تتجاوز معظم شاشات المشاهدة. يجمع Sora 2 من OpenAI الحركة السينمائية مع توليد صوت مدمج. يدفع Wan 2.7 T2V سير تحويل الصورة إلى فيديو إلى 1080p مع تحسن كبير في الحفاظ على التفاصيل عبر المقاطع الطويلة.

التقاء يحدث الآن، جودة الفيديو مع توليد الصوت مع دقة مزامنة الشفاه، يشير إلى سير عمل واحد: أمر نصي يدخل، وTikTok منتهٍ يخرج. لا تصوير. لا تسجيل صوت. لا مرحلة ما بعد الإنتاج. هذا السير ليس مفهومًا نظريًا. إنه موجود جزئيًا، والفجوات المتبقية تُغلق أسرع مما يتوقعه معظم الناس.

الصنّاع الذين يبنون معرفة حقيقية بهذه الأدوات الآن يرسخون ميزة تتراكم مع الوقت. تبقى معرفة استراتيجية المحتوى، وحدس هندسة الأوامر، والتقنية الخاصة بكل نموذج نافعة مع الوقت. التعلّم الذي تقوم به في 2024 ينطبق على كل نموذج يأتي بعده.

💡 يستحق الملاحظة: أنجح صنّاع محتوى الذكاء الاصطناعي ليسوا أصحاب أفضل الأوامر النصية. بل هم من ينشرون باستمرار، ويتعلمون مما يحقق الأداء، ويكررون بسرعة. الحجم وسرعة التغذية الراجعة أهم من الكمال في أي مخرج واحد.

ابدأ بصناعة المحتوى الآن

امرأة عند مكتبها تشاهد صورة مولّدة بالذكاء الاصطناعي على شاشة iMac كبيرة

كل أداة وردت في هذا المقال موجودة في مكان واحد: منصة PicassoIA. لا حسابات منفصلة، ولا توكنات API، ولا إعدادات تقنية. تكتب أمرًا نصيًا، وتختار نموذجًا، وتولّد. هذا هو سير العمل الكامل لأي شخص يبدأ اليوم.

أفضل طريقة للبدء ليست قراءة المزيد عما ينجح. بل توليد 10 مقاطع، ونشر أفضل ثلاثة منها، والانتباه إلى أيها تلتقطه الخوارزمية. التغذية الراجعة من المشاهدين الحقيقيين خلال 48 ساعة أثمن من أي قدر من النظرية عن استراتيجية محتوى الذكاء الاصطناعي.

اختر نموذجًا من هذا المقال. اكتب أمرًا نصيًا محددًا باستخدام البنية أعلاه. ولّد عدة مخرجات. انشر الأقوى. ثم كرر العملية مع تغيير شيء واحد.

لصفحة For You شهية لمحتوى ذكاء اصطناعي متقن لم تُشبَع بعد بالكامل. الصنّاع الذين يصلون إلى هناك أولًا، بمحتوى يبدو حقيقيًا، ويتحرك بسلاسة، ويبدو مقصودًا في صوته، هم من يجمعون هذا الاهتمام الآن.

النافذة مفتوحة. كل الأدوات جاهزة.

شارك هذا المقال

اختر لغتك

مقالات ذات صلة