ما الذي يُتقنه Sora 2.5 في حركة الذكاء الاصطناعي، ولماذا يهم صنّاع الفيديو

يمثّل Sora 2.5 خطوة كبيرة إلى الأمام في الفيديو المولّد بالذكاء الاصطناعي، خاصة في طريقة تعامله مع الحركة. يستعرض هذا المقال الإنجازات التقنية المحددة، من محاكاة الفيزياء إلى الاتساق الزمني، ومدى مقارنة الأدوات المنافسة على منصات مثل PicassoIA به.

ما الذي يُتقنه Sora 2.5 في حركة الذكاء الاصطناعي، ولماذا يهم صنّاع الفيديو
Cristian Da Conceicao
مؤسس Picasso IA

عندما يرفع شخص فنجان قهوة، يتموج السائل بداخله بطريقة محددة. وعندما تسقط قطعة قماش من كتف شخص ما، يتفاعل الجاذبية ومقاومة الهواء بأنماط تُعرف فورًا بأنها حقيقية. لقد عاير الإدراكُ البشري نفسه عبر ملايين السنين من مشاهدة الأجسام المادية وهي تتحرك، ولهذا السبب بدا الفيديو المولّد بالذكاء الاصطناعي دائمًا خاطئًا بالنسبة لنا، حتى حين لم نستطع تحديد السبب.

يغيّر Sora 2.5 هذا الوضع. ليس بشكل كامل. وليس بشكل مثالي. لكنه يفعل ذلك بطرق مهمة بما يكفي لتغيير طريقة تفكير صنّاع المحتوى الجادين في أدوات فيديو الذكاء الاصطناعي.

يستعرض هذا المقال المجالات المحددة التي يحقق فيها Sora 2.5 تقدمًا قابلًا للقياس: الاتساق الزمني، ومحاكاة الفيزياء، وذكاء الكاميرا. ثم ينظر في كيفية مقارنة المنظومة الأوسع لنماذج تحويل النص إلى فيديو المتاحة على PicassoIA، وما الذي تفعله المنافسة بشكل مختلف.

مشكلة الحركة التي عانى منها فيديو الذكاء الاصطناعي دائمًا

لماذا أفسدت الفيزياء كل النماذج الأولى

تعامل الجيل الأول من نماذج تحويل النص إلى فيديو مع الفيديو بوصفه تسلسلًا من الصور. تولّد إطارًا، ثم إطارًا آخر، ثم آخر، وتجمعها معًا. المشكلة أن العالم المادي لا يعمل إطارًا تلو الآخر. فالكرة التي تتدحرج على طاولة لا تُعاد تهيئتها بين الإطارات. سرعتها ودورانها وعلاقتها بالجاذبية وتفاعلها مع السطح، كل ذلك يستمر عبر الزمن كعملية فيزيائية متصلة.

أنتجت النماذج الأولى مقاطع تتسم بجودة حالمة، إذ تتحول الأجسام بشكل غير متوقع بين الإطارات، وتتبدل الخلفيات بطرق تنتهك الاتصال البصري الأساسي. كانت المعلومات البصرية مقنعة في كثير من الأحيان، لكن الفيزياء كانت خاطئة بطرق جعلت اللقطات غير صالحة للعمل الاحترافي.

حسّنت الخيارات الجديدة مفتوحة المصدر سرعة التكرار بشكل كبير. فقد دفعت نماذج مثل Wan 2.7 T2V من WanVideo وLTX 2.3 Pro من Lightricks الاتساق الزمني إلى مستويات جديدة، لكن التحدي الجوهري بقي كما هو: نماذج توليد الفيديو محسّنة لإنتاج إطارات فردية تبدو معقولة، وليس لمحاكاة دقيقة للعالم المادي.

محاكاة فيزياء حركة فيديو الذكاء الاصطناعي

كيف تبدو "عيوب الحركة" فعليًا

عيوب الحركة هي أنماط الفشل المحددة التي تكشف أصل الفيديو الاصطناعي. ومن بينها:

  • التشبّح (Ghosting): بقايا شفافة لأجسام تظهر في مواضع كانت تشغلها في إطارات سابقة
  • الارتجاف (Jitter): أجسام تهتز قليلًا بين الإطارات دون سبب مادي
  • الأيدي والأصابع المتحوّلة: من أكثر الدلائل شيوعًا، حيث يتغير عدد الأصابع أو شكل الأيدي عبر الإطارات
  • عدم استقرار الخلفية: قوام الجدران أو الأرضيات يتحرك أو يتنفس بين اللقطات
  • ديناميكا السوائل المستحيلة: ماء لا يتدفق، وقماش لا يسقط، وشعر يتجمد في منتصف الحركة ثم يقفز فجأة

يعالج Sora 2.5 هذه العيوب بشكل منهجي. يستخدم النموذج آلية انتباه مشتركة للمكان والزمن، تعالج الإطارات ليس بوصفها صورًا مستقلة، بل بوصفها أجزاء من حجم رباعي الأبعاد متصل، يكون الزمن فيه البعد الرابع. يجعل هذا النهج الاتساق الفيزيائي خاصية بنيوية في عملية التوليد، بدلًا من أن يتعلم النموذج تزييفه.

💡 الفكرة الحاسمة: لا يحاكي Sora 2.5 الفيزياء انطلاقًا من مبادئها الأولى. لقد تعلم تصورًا إحصائيًا قويًا لما تبدو عليه الحركة المعقولة فيزيائيًا، من خلال التدريب على بيانات فيديو ضخمة، ثم يطبّق هذا التصور باتساق عبر البعد الزمني.

الاتساق الزمني، وقد أُنجز أخيرًا بالشكل الصحيح

ثبات الأجسام عبر الإطارات

ثبات الأجسام هو الإدراك المعرفي الأساسي بأن الأجسام تستمر في الوجود حتى حين تخرج من الإطار أو تغيّر موضعها. بالنسبة لنماذج الفيديو بالذكاء الاصطناعي، يعني الحفاظ على ثبات الأجسام أن يبقى لون قميص الشخص نفسه حين يدير ظهره، وأن يبقى فنجان القهوة على الطاولة حين تتحرك الكاميرا بعيدًا ثم تعود، وأن يحتفظ ذيل الكلب بالطول نفسه طوال اللقطة.

كان Sora 2 متقدمًا بشكل ملحوظ على معاصريه في هذا الجانب. ويوسّع Sora 2.5 ذلك بما تصفه OpenAI بأنه تتبع محسّن لحالة العالم، حيث يحتفظ النموذج بتمثيل داخلي لمواضع الأجسام وخصائصها وعلاقاتها، ويستمر هذا التمثيل طوال مدة المقطع كاملة.

التأثير العملي لافت. ففي مقاطع الاختبار، يمكن للكاميرا أن تدور 180 درجة ثم تعود لتجد الأجسام في مواضعها تمامًا، مع ظلال وإضاءة صحيحتين لزاوية الكاميرا الجديدة. ويمكن للشخصيات أن تمشي خلف العوائق وتخرج على الجانب الآخر بشكل صحيح. ويمكن للسوائل أن تُسكب وتتجمع في الأوعية بواقعية.

الاتساق الزمني امرأة تركض في حقل قمح

كيف يغيّر التفكير على مستوى المشهد كل شيء

كان النهج القديم، من إطار إلى آخر، يطرح على كل إطار مُولَّد السؤال: "كيف يجب أن يبدو هذا الإطار؟" أما بنية Sora 2.5 فتنقل السؤال إلى: "ما الذي يحدث في هذا المشهد، وكيف يجب أن يبدو الآن؟"

قد يبدو هذا التمييز فلسفيًا، لكن عواقبه ملموسة. فالنموذج الذي يفكر على مستوى الإطار سيولّد نارًا تومض بشكل غير متوقع، لأن بكسلات النار متغيرة احتماليًا. أما النموذج الذي يفكر على مستوى المشهد فيدرك أن هذه النار المحددة بدأت من هذه النقطة المحددة وظلت تحترق لمدة هذا العدد من الثواني، وأن حالتها الراهنة تنبع سببيًا من كل ذلك.

الفرق هنا كالفرق بين توليد فيديو بالهلوسة وتذكّره.

وقد حققت نماذج مثل Ray 3.2 من Luma AI تقدمًا مهمًا في الاتساق على مستوى المشهد، خاصة في حركة الكاميرا. ويقارب Seedance 2.5 من ByteDance المشكلة من زاوية معمارية مختلفة، مع التركيز على سلاسة الحركة ومزامنة الصوت. ولكل منها نقاط قوة، لكن تتبع Sora 2.5 لحالة العالم هو حاليًا أكثر تطبيق متين لتفكير المشهد متاح تجاريًا.

Sora 2.5 والفيزياء السائلة

الماء والقماش ومحاكاة الأجسام اللينة

ثلاث فئات من المحاكاة الفيزيائية هي باستمرار الأصعب على نماذج الفيديو بالذكاء الاصطناعي: ديناميكا السوائل، ومحاكاة القماش، وفيزياء الأجسام اللينة. وهي صعبة للأسباب نفسها التي تجعلها مكلفة حسابيًا في خطوط VFX التقليدية: فالمعادلات الفيزيائية الأساسية تنتج سلوكًا فوضويًا غير خطي شديد الحساسية للظروف الابتدائية.

شاهد الماء ينسكب من إبريق في مقطع من Sora 2.5، وقارنه بأي منافس من جيلين مضيا. يضيق التيار بشكل صحيح أثناء سقوطه، ويكوّن توتر السطح التصاقًا واقعيًا بحافة الصنبور قبل أن ينقطع، وتتبع أنماط الرذاذ عند الارتطام قوانين ديناميكا السوائل. لقد شاهد النموذج لقطات كافية للماء الحقيقي، بحيث أصبح تصوره المكتسب لحركة السوائل دقيقًا حقًا.

لقطة مقرّبة لديناميكا الماء

يُظهر محاكاة القماش تقدمًا مماثلًا. فالقماش يستجيب بشكل صحيح للجاذبية والحركة: يتموج المعطف حين يدير الشخص جسده بسرعة، ويستقر بثقل دقيق، وتتشكل التجاعيد عند المفاصل ونقاط الضغط بأنماط معقولة فيزيائيًا. ويتبع الشعر اتجاه الريح باستمرار طوال المقطع، بدلًا من أن يغيّر اتجاهه بين الإطارات.

لماذا يصعب تحقيق هذه الأمور بشكل صحيح

الصعوبة ليست حسابية فقط. بل تكمن في أن فيزياء السوائل والقماش غير موضعية بعمق: ما يحدث لجزء من مادة متدفقة يعتمد على ما يحدث لكل جزء آخر في الوقت نفسه. تؤثر الموجة في الماء على الظروف في الاتجاهين، أمام التيار وخلفه. ويؤثر شد القماش عند نقطة ما في المناطق المجاورة.

تولّد نماذج الانتشار الحالية للفيديو المعلومات المكانية عبر آليات انتباه قوية، لكنها لم تُصمم صراحةً لالتقاط هذه الاعتمادات الفيزيائية غير الموضعية. ويبدو أن Sora 2.5 يعوّض ذلك بمزيج من حجم بيانات تدريب أكبر وحجم نموذج يمنحه القدرة التمثيلية على تقريب هذه التفاعلات ضمنيًا.

💡 لصنّاع المحتوى: يعني هذا أن الأوامر النصية التي تصف سيناريوهات فيزيائية معقدة (مطر يضرب سطح بركة، وحرير يتطاير في الريح، وشعر تحت الماء) أصبحت الآن أكثر احتمالًا بكثير لإنتاج لقطات قابلة للاستخدام مما كانت عليه قبل ستة أشهر فقط.

ذكاء الكاميرا الذي يبدو إنسانيًا

لغة لقطات سينمائية دون طاقم تصوير

لغة التصوير السينمائي المحترف لها مفرداتها: rack focus وdolly zoom وDutch angle وhandheld وtracking shot وcrane up. هذه المصطلحات لا تصف موضع الكاميرا وحده، بل تصف أيضًا العلاقة بين الكاميرا والشخص المصوَّر عبر الزمن، بما في ذلك ما تنقله الحركة من مشاعر.

استوعب Sora 2.5 هذه المفردات بطريقة لم تبلغها النماذج السابقة. فطلب "اقتراب بطيء بالدوللي على وجه متحدث" ينتج لقطة تحمل فيها حركة الكاميرا وزنًا وقصدًا. أما "لقطة متابعة بالكاميرا المحمولة" فتنتج اهتزازًا خفيفًا وواقعيًا للكاميرا يبدو وكأن شخصًا يشغّلها، لا أنه ارتجاف عشوائي.

لقطة سينمائية جوية لشارع مرصوف بالحجارة

وهذا مجال برز فيه Gen 4.5 من Runway بشكل خاص، كما حقق Kling v3 من Kwai تقدمًا ملحوظًا في دقة التحكم بالحركة. والمنافسة هنا متقاربة، حيث يُظهر كل نموذج نقاط قوة مختلفة في تفسير اللغة السينمائية.

التكوين الديناميكي مقابل الثابت

الكاميرا الثابتة لا تعني أن لا شيء يتحرك. فالكاميرا تبقى ساكنة، لكن الأشخاص يتحركون عبر الإطار، وتتغير الإضاءة، ويستمر النشاط المحيط. يتعامل Sora 2.5 مع مقاطع الكاميرا الثابتة بحركة محيطة جيدة بشكل خاص، أي أن الأشجار تتمايل بمصداقية، والستائر تتحرك مع تيارات الهواء، ويستمر النشاط في الخلفية بتنوع مناسب.

تطرح مقاطع الكاميرا الديناميكية تحديًا مختلفًا: مع تحرك الكاميرا، يجب أن تُعاد إسقاط الخلفية كاملةً بشكل صحيح، وأن تُملأ المناطق المحجوبة بشكل معقول، وأن تُحفظ علاقات العمق. وتدعم قوة Sora 2.5 في تتبع حالة العالم أداء الكاميرا الديناميكية مباشرة، لأن النموذج يحافظ على نموذج ثلاثي الأبعاد متماسك تتحرك الكاميرا عبره، بدلًا من توليد بكسلات خلفية جديدة أثناء التشغيل.

كيف يقارن Sora 2.5 بالمنافسين

جنبًا إلى جنب: النماذج الجديرة بالمتابعة

تقلّصت المسافة في قدرات مجال تحويل النص إلى فيديو بشكل كبير خلال العام الماضي. وإليك تقييمًا صادقًا لمواضع النماذج الكبرى:

النموذجالاتساق الزمنيدقة الفيزياءالتحكم بالكاميراالصوت الأصليأقصى دقة
Sora 2 Proممتازممتازقوينعم1080p
Veo 3.1جيد جدًاجيد جدًاجيدنعم1080p
Seedance 2.5جيدجيدجيدنعم1080p
Kling v3جيدمتوسطجيد جدًاجزئي1080p
Ray 3.2جيدمتوسطجيد جدًانعم1080p
Wan 2.7 T2Vجيدمتوسطمتوسطلا1080p
Hailuo 02جيد جدًاجيدمتوسطلا1080p

صنّاع أفلام يراجعون مقارنة لقطات فيديو

أين تتفوق كل أداة على البقية

لا يتفوق نموذج واحد في كل شيء. يُنتج Veo 3.1 من Google فيديو متزامنًا مع الصوت، بجودة صوت محيطي لا تضاهى حاليًا: فصوت المطر يبدو رطبًا، ولوقع الخطوات رنين سطح صحيح، ويتوافق توقيت الحوار بشكل طبيعي مع حركة الفم.

يبقى Kling v2.6 الخيار الأقوى لدقة التحكم بالحركة، خاصة للمحتوى الرياضي والحركي الذي تهم فيه مسارات الحركة المحددة. ويتفوق Ray 3.2 في حركات الكاميرا السينمائية، ويُنتج لقطات ذات طابع سينمائي يتناسق بشكل طبيعي مع المواد المصوّرة باحتراف.

يتميز Seedance 2.5 من ByteDance بالاتساق في المحتوى الطويل. فوجود لقطات متسقة زمنيًا تصل إلى 30 ثانية ميزة عملية كبيرة لتطبيقات سرد القصص، حيث يجب أن تتطابق عدة مقاطع متتالية.

بالنسبة لصنّاع المحتوى الذين يحتاجون إلى اختيار نقطة بداية واحدة والتكرار منها، فالنصيحة العملية هي مطابقة الأداة مع نوع المحتوى:

أفلام قصيرة وسرد قصصي يعمل الآن

ما الذي يتغير لصانعي الأفلام المستقلين

قبل وجود نماذج من فئة Sora 2.5، كان فيديو الذكاء الاصطناعي محصورًا فعلًا في مقاطع توضيحية قصيرة: عروض المنتجات، والمرئيات التجريدية، والعناصر الخلفية. لم تكن جودة الحركة كافية للعمل السردي، لأن الشخصيات لم تكن متسقة، والفيزياء تنهار، وحركات الكاميرا تبدو مصطنعة.

يغيّر الاتساق الزمني المحسّن في Sora 2.5 الحسابات بالنسبة لصنّاع المحتوى المستقلين. فصانع الأفلام الذي يستطيع كتابة أوامر نصية مفصّلة ودقيقة تقنيًا يمكنه الآن إنتاج لقطات من الأنواع الآتية:

  • لقطات تأسيسية لوصف المكان تطابق أجواء موقع محدد
  • لقطات إدراج (cutaway) تعرض أشياء أو بيئات أو أحداثًا مذكورة في الحوار
  • تسلسلات تجريدية أو رمزية يعزز فيها الواقع الفيزيائي الأثر العاطفي
  • لقطات إثبات المفهوم لعرض المشاريع على المستثمرين أو المتعاونين

ممثل مسرحي في مونولوج سردي

الإمكانات السردية التي تنفتح

الإطار المفيد ليس "الذكاء الاصطناعي يحل محل صناعة الأفلام"، بل "الذكاء الاصطناعي يوسّع ما هو ممكن عند ميزانية معينة". فالفيلم القصير بميزانية إنتاج قدرها 5,000 دولار لم يكن بإمكانه سابقًا أن يتضمن مشهدًا مصورًا من مروحية، أو تسلسلًا لحشد من مئة كومبارس، أو خلفية تاريخية تتطلب ديكورًا دقيقًا للحقبة. ومع فيديو ذكاء اصطناعي قادر بما يكفي، تصبح بعض هذه التسلسلات في المتناول.

القيد الأساسي الذي يبقى هو ثبات الشخصيات عبر المقاطع. فإذا كان فيلمك يتطلب ظهور الشخص نفسه في عدة لقطات منفصلة مولّدة بالذكاء الاصطناعي، فإن النماذج الحالية، بما فيها Sora 2.5، لن تحافظ بشكل موثوق على هندسة الوجه نفسها والخصائص الجسدية ذاتها. وهنا يسدّ Kling Avatar v2 وP Video حاجة محددة، إذ يستخدمان صورًا مرجعية لتثبيت مظهر الشخصية عبر عمليات التوليد.

الفيديو التجاري والمنتجات، بصورة جديدة

من الفكرة إلى المخرج في دقائق

بالنسبة للتطبيقات التجارية، تختلف الحسابات عن صناعة الأفلام السردية. فالفيديو التجاري عادةً قصير (من 15 إلى 60 ثانية)، ويتمحور حول اللقطات أكثر من تمحوره حول الشخصيات، ويركز بشدة على الجودة البصرية وعرض المنتج بدلًا من استمرارية القصة.

هنا تحقق تحسينات الفيزياء في Sora 2.5 أكبر عائد مباشر للممارسين. فإعلان فيديو لعلامة تجارية للعناية بالبشرة يحتاج إلى أن يبدو الماء حقيقيًا. ومقطع إعلان طعام يحتاج إلى أن يتصرف البخار والصلصة والملمس بإقناع. ويحتاج فيديو الموضة إلى أن يتحرك القماش بجمال في الريح.

إعلان فيديو تجاري لفن اللاتيه في مقهى

سير العمل لطلب فيديو تجاري يبدو الآن على هذا النحو لكثير من فرق الإنتاج:

  1. الفكرة واللوحات المصوّرة: استخدم نموذجًا لغويًا كبيرًا مثل GPT 5 أو Claude Sonnet 5 لبناء نماذج أولية سريعة للأفكار انطلاقًا من الموجز
  2. المرجع البصري: ولّد لقطات ثابتة لمواءمة توقعات العميل قبل الشروع في توليد الفيديو
  3. توليد الفيديو: أنتج المقاطع باستخدام نموذج تحويل النص إلى فيديو الأنسب لنوع المحتوى
  4. ما بعد الإنتاج: اضبط الألوان، وأضف موسيقى مرخّصة، وادمج أي لقطات للمنتج

بالنسبة لكثير من تطبيقات الفيديو التجاري القصير، يختصر هذا المسار أيامًا من مرحلة ما قبل الإنتاج إلى ساعات، ومدد الإنتاج إلى دقائق من وقت التوليد.

💡 المعيار الجودي الذي يهم: السؤال ليس ما إذا كان فيديو الذكاء الاصطناعي يبدو جيدًا مثل كاميرا RED في ظروف مضبوطة. السؤال هو ما إذا كان يبدو جيدًا بما يكفي للقناة المحددة للمخرج: وسائل التواصل الاجتماعي، وحملات البريد الإلكتروني، والعروض التقديمية، أو عروض الأفكار للعملاء. وفي كثير من هذه السياقات، تتجاوز جودة النماذج الحالية المعيار بالفعل.

البنية التقنية الكامنة وراء الحركة

لماذا تتعامل نماذج الانتشار مع الزمن بشكل مختلف

تواجه نماذج انتشار الفيديو تحديًا لا تواجهه نماذج انتشار الصور: إذ يجب أن تكون متسقة في ثلاثة أبعاد مكانية و_بُعد_ زمني واحد في آنٍ معًا. عالجت الأساليب المبكرة ذلك بالتدريب على الإطارات بشكل مستقل، ولهذا كانت العيوب الزمنية شائعة جدًا.

الابتكار المعماري الذي تعتمده نماذج من فئة Sora هو آلية انتباه مشتركة للمكان والزمن. فبدلًا من أن ينتبه النموذج فقط إلى الجيران المكانيين (البكسلات القريبة من بعضها في إطار واحد)، ينتبه إلى الجيران المكانيين-الزمنيين (الفوكسلات القريبة من بعضها في المكان والزمن معًا). يجعل هذا من الأصعب بنيويًا على النموذج أن ينتج عدم اتساق زمني، لأن أوزان الانتباه نفسها التي تضمن الاتساق المكاني المحلي تضمن أيضًا الاتساق الزمني المحلي.

سير عمل محرر فيديو على شاشتين

المقياس بوصفه تصوّرًا فيزيائيًا مسبقًا

لا يوجد محرك فيزيائي صريح داخل Sora 2.5. فالنموذج لا يشغّل معادلات محاكاة السوائل ولا يحل معادلات Navier-Stokes لحركة الماء. بل لديه بدلًا من ذلك نموذج إحصائي ضخم لما تبدو عليه الظواهر الفيزيائية الحقيقية في الفيديو، مبني على التدريب على مجموعة هائلة من اللقطات الواقعية.

ينجح هذا النهج أفضل مما هو متوقع، لأن الفيزياء في العالم الحقيقي منتظمة للغاية: الماء يتصرف بالطريقة نفسها يوم الثلاثاء وفي يوم السبت. فالنموذج الذي لديه بيانات تدريب كافية سيتعلم توزيع حركة الماء الصحيحة فيزيائيًا بإتقان، بحيث تنتج عينات مولّدة من هذا التوزيع نتائج تبدو دقيقة فيزيائيًا.

الاستنتاج هو أن حجم النموذج يترجم مباشرة إلى دقة فيزيائية. فالنماذج الأكبر المدرّبة على بيانات أكثر ستمتلك تصورات فيزيائية مسبقة أدق، وهذا بالضبط المسار الذي سلكته Sora من الإصدار 1 حتى 2.5.

أنشئ فيديو بالذكاء الاصطناعي على PicassoIA الآن

كل نموذج تناوله هذا المقال متاح من منصة واحدة. تستضيف PicassoIA Sora 2 وSora 2 Pro وVeo 3.1 وSeedance 2.5 وKling v3 وRay 3.2، وأكثر من 80 نموذجًا إضافيًا لتحويل النص إلى فيديو في مكان واحد، إلى جانب مجموعة كاملة من النماذج اللغوية الكبيرة لتحسين الأوامر النصية.

أسرع طريقة لبناء حدس حول ما يحسّنه Sora 2.5 في الحركة هي توليد مقاطع بالأمر النصي نفسه عبر نماذج متعددة، ثم مقارنة النتائج مباشرة. ابدأ بسيناريو فيزيائي بسيط (سكب ماء، وقماش في الريح، وشخص يمشي على سطح ذي ملمس) حيث يسهل تقييم دقة الفيزياء بالعين. ستظهر الفروق بين النماذج فورًا، وستكتسب بسرعة إحساسًا بالأداة التي تناسب كل نوع من المشاريع.

شابة تصوّر حديقة على PicassoIA

دقة الأمر النصي هي المهارة التي تتراكم بأسرع وتيرة. فالأوامر الغامضة تعطي نتائج متوسطة ومعممة. أما الأوامر المفصلة التي تحدد اتجاه الإضاءة، وخصائص عدسة الكاميرا، والخصائص المادية للمواد، وسرعة الحركة، فتمنح النموذج قيودًا كافية لإنتاج لقطات تطابق رؤية إبداعية واضحة.

ابدأ التوليد. الفجوة بين ما كان فيديو الذكاء الاصطناعي قادرًا على فعله قبل عام وما يستطيع فعله اليوم كبيرة بما يكفي لجعل معظم الافتراضات حول حدوده قديمة. فالنماذج المتاحة الآن، بما فيها Sora 2.5 ومنافسوه على PicassoIA، قادرة على إنتاج لقطات كانت ستتطلب قبل 18 شهرًا فقط طاقمًا كبيرًا ومعدات وبحثًا عن مواقع تصوير.

هذه الفجوة تضيق باستمرار. فالصنّاع الذين يجربون الآن يبنون الطلاقة في الأوامر النصية والحدس في سير العمل، وهو ما سيكون الأهم كلما تقدمت التقنية.

شارك هذا المقال

اختر لغتك

مقالات ذات صلة