أطلقت OpenAI في أوائل 2025 شيئًا جعل الناس يتوقفون عن التمرير: فيلم قصير وُلّد بالكامل باستخدام Sora 2، وبدا كأنه خرج من موقع تصوير حقيقي. لا تشوهات واضحة، ولا أيدٍ مشوّهة، ولا أجسام تخترق الجدران. مجرد لقطات قد تظنها للوهلة الأولى من عمل فريق تصوير حقيقي أمضى يومين في التصوير الميداني.
هذا ليس كلامًا تسويقيًا. هكذا يبدو فيديو الذكاء الاصطناعي فعلًا اليوم، والفيلم القصير هو أوضح دليل حتى الآن على أن الفجوة بين ما يُولَّد وما هو حقيقي قد تقلّصت إلى مستوى له أهميته.
انتشر المقطع في مجتمعات السينما وخلاصات وسائل التواصل الاجتماعي والمنتديات التقنية. ولم يتعرّف عدد كبير من المشاهدين للمرة الأولى على أنه مولّد بالذكاء الاصطناعي. هذا الانطباع يخبرك عن حالة التقنية أكثر من أي مخطط لاختبار معياري.

ماذا فعل Sora 2 فعلًا
Sora 2 هو نموذج OpenAI من الجيل الثاني لتحويل النص إلى فيديو. ويضم الفيلم القصير الذي أنتجه مشاهد متعددة مترابطة، مع شخصيات ثابتة وفيزياء تشبه الواقع واستمرارية بين اللقطات تبدو مخططة لا صدفة.
تنهار معظم نماذج الفيديو بالذكاء الاصطناعي بمجرد أن يتحرك شيء ما. يتطاير الشعر في الاتجاه الخاطئ، وتتموّج المياه عكس الجاذبية، وتنفصل القدمان عن الأرض أثناء المشي. أما Sora 2 فيتعامل مع كل ذلك بثبات لم تبلغه النماذج السابقة، والفيلم القصير يجعل هذا أمرًا لا يمكن تجاهله.
المشهد الذي أوقف الناس
يدور أكثر المقاطع تداولًا في الفيلم في شارع مدينة ليلي مبلول بالمطر. تتحرك الشخصية الرئيسية داخل الإطار وتتفاعل مع المحيط بطرق تبدو مرتكزة على قوانين الفيزياء. تتغيّر انعكاسات البرك مع حركة الشخصية. تتثنى الملابس وتتجعد مع حركة الجسد. وينجرف البخار المتصاعد من فتحات التهوية القريبة مع اتجاه ريح ثابت طوال المقطع كله.

هذا القدر من التماسك البيئي عبر عدة ثوانٍ هو ما يميّز Sora 2 عن كل أداة فيديو بالذكاء الاصطناعي سبقته. كانت الأنظمة السابقة تنجح في إطار واحد، لكنها تفقد الاتساق بمجرد أن يتطور المشهد بعد اللقطة الأولى.
المدة وربط المشاهد
يتجاوز الفيلم القصير المدد المعتادة لمقاطع أدوات الفيديو بالذكاء الاصطناعي، والتي تتراوح بين 10 و20 ثانية. ورغم أن المشهد الكامل يحتاج إلى دمج عدة توليدات معًا، فإن الاستمرارية البصرية تحافظ على تماسكها بطريقة تبدو مقصودة. تحتفظ الشخصيات بمظهرها عبر القطع. وتبدو ظروف الإضاءة كأنها تنتمي إلى العالم نفسه والوقت نفسه من اليوم.
جدير بالملاحظة: لا ينتج Sora 2 حتى الآن أفلامًا طويلة مستقلة بالكامل من أمر نصي واحد. ما يجعل هذا الفيلم القصير مثيرًا هو مدى جودة ارتباط كل مقطع بالتالي، لا أنه صُيّر في تمريرة واحدة متصلة.
لماذا يبدو بهذا القدر من الواقعية
الواقعية في فيلم Sora 2 القصير ليست أمرًا واحدًا. إنها مزيج من التحسينات في عدة أنظمة مترابطة تعمل معًا.

الفيزياء وسلوك الأجسام
هنا يحقق Sora 2 أكبر قفزة واضحة إلى الأمام. دُرِّبت نماذج توليد الفيديو السابقة بشكل أساسي لتبدو جيدة في الإطارات المنفردة. أما Sora 2 فدُرِّب بتركيز أكبر بكثير على كيفية تصرّف الأجسام مع الزمن، من إطار إلى الذي يليه، عبر المدة الكاملة للمقطع.
تتدفق السوائل بلزوجة صحيحة. ينحني الورق عند رفعه. يتحرك معطف ثقيل بطريقة مختلفة عن قميص خفيف في الريح نفسها. هذه التفاصيل ليست حيلًا مبرمجة يدويًا. إنها تحدث لأن النموذج استوعب العلاقات الفيزيائية، بدلًا من مطابقة الأنماط اعتمادًا على سطح الصورة وحده.
| العنصر | سلوك Sora 1 | سلوك Sora 2 |
|---|
| أسطح المياه | مسطحة، بتشوهات متكررة | ديناميكية، بتموجات تستجيب للحركة |
| الشعر والأقمشة | جامدة وغير متسقة | مرنة ومناسبة للوزن |
| الظلال | غالبًا منفصلة | متطابقة مع مصدر الضوء |
| تفاعل الأجسام | تداخل واختراق | تلامس صلب محفوظ |
| ثبات الشخصيات | تنجرف بين الإطارات | ثابتة عبر المقاطع كاملة |
الضوء والظل والعمق
يتصرف الضوء في فيلم Sora 2 كأن مدير تصوير حقيقيًا صمّم كل لقطة. عندما تمرّ الشخصية بجانب عمود إنارة، يتحول الظل في الاتجاه الصحيح وبالزاوية الصحيحة. وعندما تدخل مدخلًا، يخفت الضوء المحيط تدريجيًا بدلًا من أن ينقطع فجأة بين منطقتين.

هذا ما يُسقط معظم أنظمة الفيديو بالذكاء الاصطناعي. تستطيع هذه الأنظمة التعامل مع الإضاءة الثابتة في إطار واحد. لكنها تفشل عندما يتغير موضع مصدر الضوء بالنسبة إلى شخص متحرك، ويكون فشلها واضحًا فورًا لأي عين مدرّبة. يتعامل Sora 2 مع هذا بشكل أفضل من أي نموذج سبقه، على الأقل في المشاهد المضبوطة والموصوفة بدقة.
نصيحة عملية: إذا أردت اختبار القدرة المكانية لأي نموذج فيديو بالذكاء الاصطناعي، فراقب كيف تتحرك الظلال عندما يمشي الشخص. هذا المتغير الواحد يكشف عن وعي النموذج ثلاثي الأبعاد أكثر مما تكشفه الدقة أو الصقل الأسلوبي.
حركة الكاميرا التي تبدو مقصودة
من الجوانب التي يغفل عنها كثيرون في الفيلم القصير طريقة حركة الكاميرا نفسها. في أنظمة الفيديو بالذكاء الاصطناعي السابقة، كانت حركة الكاميرا غالبًا مهتزة أو تنجرف عشوائيًا أو تكون ناعمة بشكل مصطنع يبدو غير طبيعي. أما في فيلم Sora 2 فلحركة الكاميرا وزن. يحمل الاقتراب البطيء زخمًا. ويحتفظ الدوران الخفيف بالقصور الذاتي الذي تتوقعه من مشغّل كاميرا حقيقي خلف عدسة حقيقية.
هذا الإحساس بوجود الكاميرا كجسم مادي هو جزء من سبب شعورنا بأن اللقطات واقعية. فالدماغ البشري وهو يشاهد لقطات سينمائية لا يقيّم الأشخاص داخل الإطار فحسب، بل يقيّم الكاميرا أيضًا. وإذا تصرفت الكاميرا كآلة لا كشخص، انهارت الفكرة كلها.
Sora 1 مقابل Sora 2
لم تكتفِ OpenAI بتوسيع نطاق Sora. يمثل الجيل الثاني إعادة صياغة جوهرية لطريقة معالجة النموذج للمكان والزمن والعلاقات الفيزيائية بين الأجسام.

ما الذي تغيّر في النموذج
كان Sora الأصلي مثيرًا للإعجاب منذ إطلاقه، إذ ينتج فيديوهات متماسكة من أوامر نصية بجودة لم يرها أحد علنًا من قبل. لكن كانت له نقاط ضعف محددة: انجرفت الشخصيات في مظهرها عبر المقطع، وانهارت الفيزياء حول علامة الخمس إلى سبع ثوانٍ، وتدهورت المشاهد التي تضم أجسامًا متحركة متعددة بسرعة في المناطق الأقل بروزًا من الإطار.
يعالج Sora 2 معظم هذه المشكلات بشكل مباشر:
- التماسك الزمني أفضل بشكل ملحوظ، أي أن الأشخاص يبقون متسقين عبر مدد أطول للمقاطع
- المعالجة المكانية تحسّنت، وهذا ما يجعل تفاعلات الأجسام تبدو مرتكزة لا عائمة
- الالتزام بالأمر النصي أدق، فيُنتج النموذج بدقة أكبر ما تصفه في الإدخال النصي
- سلوك الكاميرا يبدو مخططًا، مع حركة طبيعية بدلًا من التشوهات المهتزة للإصدارات السابقة
- عمق المشهد أكثر إقناعًا، إذ تبدو عناصر المقدمة والخلفية كأنها تشغل المساحة المادية نفسها في اللحظة نفسها
أين لا يزال يتعثر
لا يخلو Sora 2 من حدود. ما يزال عرض النصوص داخل مقاطع الفيديو غير موثوق. وما تزال الوجوه التفصيلية جدًا من مسافة قريبة جدًا تُظهر مشكلات متقطعة تبدو اصطناعية. وتميل المشاهد التي تضم أكثر من أربعة أجسام متحركة مستقلة إلى تدهور الجودة في العناصر الأقل بروزًا.
لا تظهر أي من هذه القيود في الفيلم القصير، وهذا جزء مما يجعله لافتًا. من الواضح أن OpenAI اختارت سيناريوهات تبرز نقاط قوة النموذج المثبتة، وتجنبت الحالات الحدّية التي ما يزال فيها مجال للتحسين.
ما الذي يحتاج صنّاع الأفلام إلى معرفته
فيلم Sora 2 القصير ليس مجرد عرض تقني. إنه إشارة مباشرة إلى صناعة السينما بشأن تغيّر سير عمل محدد في الوقت الفعلي.

التصور المسبق تغيّر بين عشية وضحاها
أكثر التطبيقات فورية لصنّاع الأفلام العاملين هو التصور المسبق (pre-visualization). تقليديًا، يرسم المخرجون ومديرو التصوير المشاهد، ويعدّون ألواح القصة (storyboards)، أو يصوّرون لقطات مرجعية منخفضة الميزانية لنقل الرؤية إلى فريق العمل. تستغرق هذه العملية أيامًا أو أسابيع، وتكلّف مالًا حقيقيًا.
مع Sora 2، يستطيع المخرج أن يصف مشهدًا ويحصل على لقطات مرجعية واقعية في دقائق. ليس تقريبًا كرتونيًا، بل فيديو فعلي يُظهر الإضاءة والحركة والإيقاع والمزاج بدرجة كافية من الدقة لنقل مظهر محدد إلى فريق إنتاج كامل.
لصنّاع الأفلام المستقلين: هذا أهم تحول قريب المدى. لم تعد بحاجة إلى ميزانية كي تتصور لقطات طموحة مسبقًا. تحتاج إلى وصف دقيق والنموذج المناسب.
حديث الميزانية
أثار الفيلم القصير من Sora 2 نقاشًا حقيقيًا حول ما يحدث لبنود تكلفة معينة عندما يستطيع الذكاء الاصطناعي إنتاج لقطات تحل محل أنواع محددة من أعمال الإنتاج. لقطات التأسيس، والإدراجات البيئية، والمشاهد الخلفية، واللقطات الانتقالية كلها مرشحة للتوليد بالذكاء الاصطناعي في الإنتاجات التي يُحسب فيها كل دولار.
لا يلغي هذا الكاميرا البشرية من المعادلة. بل يركّزها حيث تكون أهم: اللقطة المقرّبة، والأداء، واللحظة التي تتطلب شخصًا حقيقيًا يتفاعل مع سياق حقيقي. أما عناصر الأجواء والمكان التي تحيط بهذه الأداءات، فقد أصبحت قابلة للتفاوض بطريقة لم تكن عليها من قبل.
كيفية استخدام Sora 2 على PicassoIA
الخبر الجيد أنك لا تحتاج إلى انتظار تكامل API مباشر لتبدأ العمل مع Sora 2. وهو متاح مباشرة على PicassoIA إلى جانب Sora 2 Pro للحصول على مخرجات بدقة أعلى.

إليك طريقة الحصول على نتائج متسقة وعالية الجودة من النموذج:
الخطوة 1: اكتب مشهدًا لا إطارًا
يُنتج Sora 2 نتائج أفضل عندما يصف أمرك النصي تسلسلًا بدلًا من لقطة ثابتة. بدلًا من "امرأة تقف في شارع"، جرّب "امرأة ترتدي معطفًا صوفيًا داكنًا تسير ببطء في شارع مبلول بالمطر ليلًا، تتوقف لتنظر إلى لافتة متجر حمراء، والبخار يتصاعد من المزراب على يسارها". تمنح الحركة النموذج شيئًا يبني عليه.
الخطوة 2: حدّد مصدر الضوء
الإضاءة هي المجال الذي يحقق فيه Sora 2 نتائجه. صِف المصدر واتجاهه ودرجة حرارة لونه بوضوح. تنتج عبارة "عمود إنارة كهرماني دافئ من اليمين، وضوء محيط أزرق بارد من سماء غائمة فوقنا" مخرجات أفضل بكثير من مجرد "مشهد ليلي".
الخطوة 3: حدّد نية الكاميرا
يستجيب النموذج جيدًا لتعليمات حركة الكاميرا. تمنح عبارات مثل "اقتراب بطيء من الشخص" أو "لقطة عريضة ثابتة مع خلفية واضحة الحدة" النموذج توجيهًا بنيويًا، وتنتج لقطات تبدو أكثر تعمّدًا، بهدف واضح خلف كل إطار.
الخطوة 4: استهدف مقاطع أقل من 10 ثوانٍ
للحصول على أكثر النتائج تماسكًا، استهدف لحظات محددة وقصيرة ذات بداية ونهاية واضحتين. اربط عدة مقاطع معًا في المونتاج لتكوين تسلسلات أطول، تمامًا كما جُمّع الفيلم القصير من Sora 2 نفسه.
الخطوة 5: كرّر انطلاقًا من أفضل مخرجاتك
عندما يصل المقطع إلى نحو 80% من النتيجة المقصودة، صِف ما تريد الحفاظ عليه وما يحتاج إلى تغيير. يتعامل Sora 2 Pro مع المشاهد عالية التفاصيل حيث تكون أقصى درجات الدقة هي الأولوية.
نماذج أخرى تستحق التجربة
يستضيف PicassoIA مجموعة واسعة من خيارات تحويل النص إلى فيديو إلى جانب Sora 2 وSora 2 Pro، تخدم سيناريوهات إنتاج مختلفة:
| النموذج | الاستخدام الأمثل |
|---|
| Sora 2 Pro | أقصى درجات الواقعية، ومخرجات بجودة سينمائية |
| Gen-4.5 by Runway | التحكم الإبداعي، واللقطات ذات الطابع الأسلوبي |
| Kling v3 | المشاهد التي تتمحور حول الشخصيات، ودقة الحركة |
| Veo 3 | البيئات الواقعية، والمشاهد الواسعة |
| LTX-2.3 Pro | التكرار السريع مع ثبات عالٍ |
إن اختبار نموذجين أو ثلاثة جنبًا إلى جنب بالأمر النصي نفسه هو أسرع طريقة لتكتشف أي نموذج يناسب سيناريوك المحدد وأسلوبك البصري.
ما الذي يثبته الفيلم القصير فعلًا
بعيدًا عن اللقطات المبهرة، يرسّخ فيلم Sora 2 القصير شيئًا أهم: أن فيديو الذكاء الاصطناعي تجاوز العتبة الإدراكية التي تهم في سرد القصص.

من يستفيد أكثر
الأشخاص الذين سيستفيدون أكثر من أدوات مثل Sora 2 ليسوا الاستوديوهات الكبرى. فهم يملكون ما يحتاجونه أصلًا. المستفيدون الحقيقيون هم المبدعون المستقلون، وصنّاع الأفلام ذوو الميزانيات المحدودة جدًا، ومخرجو الفيديوهات الموسيقية الذين يعملون بموارد محدودة، وصنّاع الأفلام الوثائقية الذين يحتاجون إلى لقطات لا يستطيعون تحمّل تكلفة تصويرها ميدانيًا.
يتراجع الحاجز أمام الفيديو الواقعي بوتيرة ثابتة. ما كان يتطلب طاقمًا كبيرًا ومعدات ضخمة قبل سنوات قليلة، صار يتطلب اشتراكًا وأمرًا نصيًا مفصلًا. الفجوة بين الإنتاجات الكبيرة والصغيرة تضيق، والفيلم القصير من Sora 2 هو أوضح دليل بصري على هذا التحول حتى الآن.
ما الذي رآه الجمهور
عندما انتشر المقطع للمرة الأولى، لم يتعرّف عدد كبير من المشاهدين على أنه مولّد بالذكاء الاصطناعي من المشاهدة الأولى. وهذا ليس فشلًا من الجمهور في اكتشاف المحتوى الاصطناعي. إنه نجاح للنموذج في الأمر الذي يهم فعلًا: الدماغ يقبل اللقطات كواقع معقول.
لم يبدُ الفيلم واقعيًا بسبب إحصاءات البكسل المبهرة. بدا واقعيًا لأنه نقل المعنى عبر الحركة والضوء والفضاء المادي، بطريقة تطابق طريقة إدراك الإنسان البصري لعبارة "هذا حدث فعلًا في مكان حقيقي وفي لحظة حقيقية".

هذا هو المعيار الحقيقي لفيديو الذكاء الاصطناعي. ليس الدقة، ولا جودة الإطار. بل أن يقول الدماغ نعم أو لا للواقع. اجتاز Sora 2 هذا الاختبار علنًا، على الإنترنت المفتوح، بفيلم صدّقه معظم المشاهدين من المشاهدة الأولى.
السؤال الأعمق الذي يطرحه الفيلم القصير ليس تقنيًا على الإطلاق. إنه عن ما يحدث عندما تصبح أدوات السرد الواقعي متاحة على نطاق واسع. كل مبدع كانت لديه قصة في ذهنه، لكنه يفتقر إلى موارد الإنتاج لروايتها، صار أمامه الآن طريق أقصر إلى الشاشة.
ابدأ بصناعة أفلامك الخاصة بالذكاء الاصطناعي
إذا أشعل الفيلم القصير من Sora 2 شيئًا في داخلك، فالخطوة العملية التالية هي أن تبدأ العمل مع النموذج مباشرة. كتابة أوامر فيديو قوية مهارة يمكن تعلمها. كل توليد يُظهر لك كيف يفسّر النموذج اللغة، وأين يتفوق، وأين تحتاج إلى صقل أوصافك لتقليص الفجوة بين ما تتخيله وما يظهر على الشاشة.
يتيح لك PicassoIA الوصول إلى Sora 2، وSora 2 Pro، وأكثر من 87 نموذجًا لتحويل النص إلى فيديو تغطي كل الأساليب البصرية وكل سيناريوهات الإنتاج. لا حاجة إلى طاقم. لا حاجة إلى قائمة معدات. ولا تصاريح تصوير.
تحتاج إلى مشهد في ذهنك والكلمات التي تصفه بدقة.
ابدأ هنا: افتح PicassoIA، وحمّل Sora 2، واكتب مشهدًا واحدًا بإضاءة محددة، وشخصية في حركة، ووقت محدد من اليوم. شاهد ما يعود إليك. ثم غيّر متغيرًا واحدًا وشغّله مرة أخرى. عملية التكرار هذه هي ما يبني مهارة حقيقية في إخراج فيديو بالذكاء الاصطناعي.
الفيلم القصير الذي جعل الإنترنت يشكك في الواقع صُنع بنموذج تدرّب على أنماط السرد البشري. والذي يليه قد يأتي منك.