ظلّت حركة الكاميرا الفجوة بين "فيديو الذكاء الاصطناعي" والسينما الحقيقية. كل من جرّب توجيه نموذج فيديو بعبارة "Dolly بطيء نحو الشخص" يعرف الإحباط: المشهد يتحرك أو يتشوّه، أو يتجاهل التعليمة تمامًا. HunyuanVideo 2.0 هو أول نموذج متاح على نطاق واسع يتعامل مع حركة الكاميرا كمخرج من الدرجة الأولى، وليس فكرة ثانوية مُلحقة بمسار تحويل النص إلى فيديو. هو يرمّز مسار الكاميرا كإشارة هندسية، لا كتقريب لغوي، والفرق في جودة المخرجات واضح فورًا.
ما الذي يفعله HunyuanVideo 2.0 فعلًا
تولّد معظم نماذج الفيديو الحركة من أنماط الاتساق البصري المسبقة: إذ تُدرَّب على ملايين المقاطع وتستوعب أنماطًا إحصائية عن طريقة تحرّك الأشياء. تكون حركة الكاميرا في هذه الأنظمة ضمنية. فإذا احتوت بيانات التدريب على كثير من لقطات Dolly، فقد يعيد النموذج إنتاج واحدة منها، وقد ينتج بدلًا منها تكبيرًا أو تشوّهًا أو اهتزازًا خفيفًا لا يشبه أيًّا منها.
يغيّر HunyuanVideo هذا الأمر بأن يجعل عملية التوليد مشروطة بمعاملات صريحة لمسار الكاميرا. لا يخمّن النموذج معنى "دفعة سينمائية للداخل" من النص وحده. بل يتلقى بيانات منظّمة تصف أين توجد الكاميرا، وأين يجب أن تكون، وبأي سرعة يجب أن تنتقل إلى هناك.

ما وراء أوامر الحركة البسيطة
الفرق بين شرط الكاميرا وتوجيه الحركة بالنص كبير. مع الأمر النصي، تكون عبارة "Pan يسارًا ببطء" تعليمة بلغة طبيعية يربطها النموذج بأي نمط إحصائي يرتبط في ذهنه بتلك الكلمات. أما مع شرط الكاميرا، فيتلقى النظام شيئًا أقرب إلى تعريف لمسار الكاميرا: موقع البداية، وموقع النهاية، وزوايا الدوران عبر الزمن، والعلاقة بين السرعة وعدد الإطارات.
لهذا يستطيع HunyuanVideo 2.0 إنتاج Pan جانبي يبقى موازيًا لمستوى الحدث فعلًا، بدلًا من الانجراف نحو الداخل. تحدد بيانات الشرط القيد الهندسي، لا الشكل الجمالي المرغوب فقط. وعندما يكون مسار الكاميرا محددًا رياضيًا، لا يحتاج النموذج إلى استنتاجه، بل يُفرض على مستوى البنية.
بنية DiT وشرط الكاميرا
يستخدم HunyuanVideo 2.0 بنية Diffusion Transformer (DiT)، وهي من الفئة نفسها التي تشغّل كثيرًا من مولّدات الصور عالية الجودة، لكنها هنا مطبّقة على البُعد الزمني للفيديو. تعمل آلية الانتباه في المحوّل على الرموز المكانية والزمنية معًا في الوقت نفسه.
يُحقن شرط الكاميرا في هذه العملية على مستوى آلية الانتباه، لا كبادئة نصية. تُضاف تضمينات وضعية الكاميرا، التي تمثّل الموقع والاتجاه في كل خطوة زمنية، إلى الرموز المكانية، فتخبر كل إطار فعليًا بمكان الكاميرا "الحالي" بالنسبة إلى المشهد. ثم يُدرَّب النموذج على إزالة الضوضاء من الإطارات بطريقة تحقق في وقت واحد الأمر النصي للمحتوى والقيود الهندسية لمسار الكاميرا.
تسمح هذه البنية بأن يكون الشرط قابلًا للاشتقاق بحق: يتنقّل النموذج بين مواقع الكاميرا بسلاسة بدلًا من القفز بين الإطارات المفتاحية، وهذا ما ينتج الحركة السلسة بمعدل 24fps التي لم تستطع النماذج السابقة تحقيقها بثبات. يتلقى كل إطار بيانات موقع الكاميرا، ولا توجد فجوات في إشارة الشرط.
أنواع حركة الكاميرا الستة التي يتحكم بها
يدعم HunyuanVideo 2.0 المفردات الكاملة للتصوير السينمائي المحترف. هذه ليست تقريبات، بل محاور تحكم منفصلة تقابل الطريقة التي تتحرك بها منصة كاميرا حقيقية في الفضاء.

Pan و Tilt
Pan هو الدوران الأفقي حول المحور العمودي للكاميرا. فكّر فيه كأنه تدوير رأسك يمينًا أو يسارًا مع بقاء قدميك ثابتتين. في HunyuanVideo 2.0، يُتحكم في Pan بمعامل Yaw، أي الإزاحة الزاوية بالدرجات في الثانية، وتُطبَّق بشكل منتظم أو بمنحنى تسارع وتباطؤ عبر مدة المقطع.
Tilt هو مقابله العمودي: الدوران حول المحور الأفقي لتوجيه الكاميرا إلى الأعلى أو الأسفل. يحافظ كل من Pan وTilt على موقع الكاميرا في الفضاء، ويغيّران اتجاهها فقط. وهذا التمييز مهم لأن كثيرًا من النماذج المنافسة يخلط بين Pan وTruck، فينتج إزاحة جانبية غير مقصودة حين يريد المستخدم دورانًا خالصًا.
💡 للَقطات التأسيسية التي تريد فيها كشف شخص أو شيء طويل، مثل مبنى أو شجرة أو شخص واقف، فإن Tilt لأعلى هو خيارك الأكثر موثوقية. يبدو سينمائيًا في أي سياق تقريبًا، وهو من أنظف الحركات التي يعيد HunyuanVideo 2.0 إنتاجها.
لقطات Dolly وTruck
Dolly يحرّك الكاميرا فعليًا للأمام أو للخلف على محور العدسة. يخلق Dolly-in (الدفع للداخل) إحساسًا بالحميمية، بينما يخلق Dolly-out (السحب للخلف) سياقًا ويكشف الحجم. يتعامل HunyuanVideo 2.0 مع معامل Dolly كإزاحة على المحور Z في فضاء الكاميرا، فيكون مستقلًا عن محوري Pan وTilt.
Truck هو المقابل الجانبي لحركة Dolly: تتحرك الكاميرا يمينًا أو يسارًا مع الحفاظ على اتجاهها. وتكثر لقطات Truck في تسلسلات التتبّع حين يمشي شخص موازيًا للكاميرا. وعلى عكس Pan الذي يدور، يُبقي Truck الكاميرا موجّهة في الاتجاه نفسه بينما يغيّر موقعها الفعلي جانبيًا عبر المشهد.
التمييز بين Dolly وTruck، وبين الاثنين وPan/Tilt، أمر لا تُعيد إنتاجه بموثوقية إلا النماذج ذات الشرط الهندسي الحقيقي. يُبقي HunyuanVideo 2.0 هذه المحاور مستقلة، ما يعني أنه يمكنك دمج Dolly-in مع Pan في الوقت نفسه دون أن يُفسد كل منهما الآخر.
Zoom وRoll
Zoom يختلف عن Dolly في أمر مهم واحد: يغيّر البعد البؤري بدلًا من تغيير الموقع الفيزيائي للكاميرا. ينتج Zoom تأثير ضغط بصري، إذ تتغير سرعة تحجيم الخلفية عن سرعة تحجيم المقدمة، بينما يحافظ Dolly على علاقات المنظور. يحاكي HunyuanVideo 2.0 الاثنين، إذ يُطبَّق Zoom كتعديل للبعد البؤري عبر الإطارات، لا كتغيير في الموقع الفيزيائي.
Roll (ويُسمّى أيضًا Dutch tilt في الحالات القصوى) يدور بالكاميرا حول محور العدسة، أي المحور الموجّه مباشرة نحو الشخص. يشيع الدوران الخفيف في تسلسلات الحركة وتغطية الرياضة. أما الدوران الشديد فهو خيار أسلوبي لإحداث إحساس بالتشويش. يعرض HunyuanVideo 2.0 هذا كمعامل دوران بقيم باتجاه عقارب الساعة أو عكسها، ويمكن دمجه مع أي من المحاور الخمسة الأخرى.

لماذا يغيّر الاتساق الزمني كل شيء
الحصول على إطار واحد صحيح مشكلة محلولة في الصور بالذكاء الاصطناعي. أما الحصول على 120 إطارًا تحكي قصة بصرية متماسكة تتحرك فيها الكاميرا تمامًا كما هو مقصود، فهنا تنهار معظم النماذج. الاتساق الزمني ليس ميزة تحسّن الراحة، بل هو ما يفصل اللقطات القابلة للاستخدام عن غير القابلة للاستخدام.
الاتساق من إطار إلى إطار
يعني الاتساق الزمني أن المعلومات البصرية في الإطار N+1 تتوافق مع الإطار N بطرق تتجاوز تشابه البكسلات. يجب أن تحافظ الأجسام على حجمها وموقعها ومظهرها بالنسبة إلى حركة الكاميرا. فإذا تحركت الكاميرا Dolly للداخل بمقدار 10% من عمق المشهد خلال 5 ثوانٍ، فيجب أن تكبر كل الأجسام في الإطار بمعدل يتوافق مع حركة الكاميرا عبر الفضاء ثلاثي الأبعاد، لا بشكل مستقل، ولا عشوائيًا، ولا مع انجراف خفي.
يفرض HunyuanVideo 2.0 هذا عبر الانتباه الزمني في بنية DiT. لا تنتبه خطوة إزالة الضوضاء في كل إطار إلى السياق المكاني لذلك الإطار فحسب، بل إلى المسار الزمني لكل رمز عبر المقطع كله. وهذا مكلف حسابيًا، وهو جزء من سبب حاجة النموذج إلى ذاكرة GPU كبيرة، لكن المكافأة هي حركة تصمد إطارًا تلو الآخر دون الاهتزاز والوميض الشائعين في البنى السابقة.

كيف يتجنب الانجراف
"الانجراف" في فيديو الذكاء الاصطناعي يعني أن المشهد يتغير تدريجيًا بطرق لا تسببها حركة الكاميرا: تتبدل الألوان، وتعاد تشكيل الأجسام، وتتحول عناصر الخلفية. يحدث ذلك لأن عملية الأخذ العيني الاحتمالية في النموذج تراكم أخطاءً صغيرة عبر الإطارات. وعند أعداد الإطارات المنخفضة يكون ذلك غير مرئي، أما عند 60 إطارًا فأكثر فيصبح فجًّا.
يخفف HunyuanVideo 2.0 الانجراف عبر آليتين. أولًا، يعمل شرط الكاميرا كمرساة: يُقيَّد النموذج بتوليد إطارات تحقق مسار الكاميرا، ما يحدّ من مقدار تغيّر محتوى المشهد بشكل مستقل. ثانيًا، يستخدم النموذج نهج جدولة للضوضاء يحافظ على البنية المكانية منخفضة التردد عبر الإطارات، مع السماح للتفاصيل عالية التردد بالتنوع بشكل طبيعي. وهذا يمنع ظاهرة "تموّج الملمس" الشائعة في نماذج الفيديو الانتشارية السابقة، حيث تبدو الأسطح نابضة أو متموجة حتى حين تكون الكاميرا ثابتة.
HunyuanVideo 2.0 مقابل نماذج الحركة الأخرى
أصبح مجال حركة الكاميرا تنافسيًا. تقدم عدة نماذج على PicassoIA إمكانات للتحكم في الحركة، ولكل منها نهج مختلف ومجموعة من المقايضات.

| النموذج | طريقة التحكم في الكاميرا | أقصى دقة | السرعة | أفضل استخدام |
|---|
| HunyuanVideo 2.0 | شرط هندسي 6DoF | 1080p | متوسطة | مسارات سينمائية دقيقة |
| Kling v3 Motion Control | مسار نقطي + نص | 1080p | سريعة | حركة نسبية إلى الشخص |
| Video 01 Director | أوامر كاميرا بلغة طبيعية | 1080p | سريعة | التحكم السريع والسهل في الكاميرا |
| Wan 2.7 I2V | حركة مشروطة بالصورة | 1080p | متوسطة | تحريك الصور الثابتة |
| Ray 3.2 | نص حركة سينمائي | 1080p | سريعة | واقعية جمالية بنطاق HDR |
Kling v3 Motion Control
يتّبع Kling v3 Motion Control نهجًا مختلفًا جوهريًا: يستخدم شرط المسار النقطي، حيث يحدد المستخدم كيف يجب أن تتحرك نقاط محددة في الصورة عبر الإطارات. يمنح هذا تحكمًا ممتازًا في حركة الشخص أو الجسم الفاعل، كذراع ترتفع، أو شعر تحركه الرياح، أو سيارة تتسارع، لكنه لا يرمّز موقع الكاميرا مباشرة. تظهر حركة الكاميرا كنتيجة ثانوية لطريقة تفسير النموذج لتحولات المسار واسعة النطاق عبر الإطار كله.
بالنسبة إلى المحتوى الاجتماعي وتحريك الشخصيات، غالبًا ما يكون هذا بالضبط ما تريده. أما للعمل السينمائي الدقيق بالكاميرا، حيث يجب أن يكون مسار الكاميرا مستقلًا عن حركة الشخص، فإن الشرط الهندسي في HunyuanVideo 2.0 أكثر قابلية للتنبؤ. يمثّل Kling v2.6 Motion Control نسخة أقدم قليلًا من النهج نفسه، وما زال قادرًا جدًا على سير عمل تحريك الصور.
Video 01 Director
يُعد Video 01 Director من Minimax الخيار الأسهل للتحكم في الكاميرا. يقبل أوامر كاميرا بلغة طبيعية، مثل "قرّب ببطء" و"Pan يمينًا" و"منظور من أعلى يهبط"، وينتج نتائج معقولة دون أي إعداد لمعاملات هندسية. والثمن الذي تدفعه هو انخفاض الدقة: تُفسَّر أوامر الكاميرا النصية إحصائيًا لا هندسيًا، لذلك تنتج المسارات المعقدة متعددة المحاور نتائج أقل قابلية للتنبؤ.
لمن يريد النماذج الأولية بسرعة دون ضبط معاملات الكاميرا، يُعد Video 01 Director نقطة بداية ممتازة. أما للقطات الإنتاج التي يجب أن يكون سلوك الكاميرا فيها قابلًا للتكرار ودقيقًا، فإن نظام الشرط في HunyuanVideo 2.0 يبرر وقت الإعداد الإضافي.
Wan 2.7 I2V
صُمّم Wan 2.7 I2V لتحريك الصور إلى فيديو، وينتج حركة عالية الجودة من صورة ثابتة. يأتي التحكم في الكاميرا فيه أساسًا من أمر الحركة، لكن شرط الصورة يثبّت الإطار الأول بقوة، وهذا يساعد على الاتساق الزمني عبر المقطع. إنه خيار ممتاز عندما تبدأ من صورة معروفة، مثل صورة منتج أو لقطة منظر طبيعي أو صورة شخصية، وتحتاج إلى حركة ناعمة وطبيعية انطلاقًا من تلك الصورة بالذات.
استخدام HunyuanVideo على PicassoIA
يستضيف PicassoIA HunyuanVideo مع شرط كاميرا كامل متاح عبر واجهة التوليد. سير العمل أكثر تعقيدًا من أمر تحويل نص إلى فيديو بسيط، لكن هذا العمق هو ما يجعله قيّمًا للعمل الإنتاجي الجاد.

إعداد أول لقطة لك
ابدأ بتصور ذهني واضح لمسار الكاميرا قبل أن تكتب كلمة واحدة من الأمر النصي. اسأل: أين تبدأ الكاميرا؟ أين تنتهي؟ هل تنتقل أم تدور أم الاثنان معًا؟ ما السرعة التي يجب أن تبدو بها الحركة مقارنةً بطول المقطع البالغ 5 ثوانٍ؟
من هنا، نظّم أمرك النصي في جزأين متمايزين: محتوى المشهد ووصف حركة الكاميرا. اجعلهما في جملتين منفصلتين. يتعامل النموذج معهما كإشارتي شرط مستقلتين جزئيًا، ودمجهما في عبارة واحدة يُضعف الاثنين غالبًا.
للَقطة Dolly-in كلاسيكية:
"امرأة تقف في حقل قمح مشمس، تنظر نحو الأفق. تبدأ الكاميرا واسعة على ارتفاع الخصر، ثم تتقدم بثبات نحو لقطة متوسطة قريبة خلال خمس ثوانٍ، مع إضاءة جانبية طبيعية تحافظ على اتجاه ثابت طوال الحركة."
يثبّت وصف المشهد المحتوى، ويفعّل وصف الكاميرا مسار الشرط الهندسي.
المعاملات الأكثر أهمية
عند ضبط التوليد، هناك ثلاثة إعدادات لها أكبر تأثير على جودة حركة الكاميرا.
خطوات إزالة الضوضاء: تنتج أعداد الخطوات الأعلى (40-50) مسارات حركة كاميرا أنظف. وقد تجعل الخطوات الأقل الكاميرا تبدو متقطعة أو تفوّت موقع نهايتها، خاصةً في المسارات المركبة.
مقياس التوجيه (CFG): يتحكم Classifier-Free Guidance في مدى التزام النموذج بالأمر النصي. للعمل الدقيق بالكاميرا، يحافظ CFG أعلى قليلًا (7-8) على بقاء الكاميرا على مسارها. وإذا كان مرتفعًا جدًا فستظهر لك عيوب الحدة الزائدة في المناطق الغنية بالملمس من الإطار.
قيمة البذرة (Seed): عندما تجد قيمة بذرة تنتج سلوك كاميرا جيدًا لنوع مسار محدد، سجّلها. تتفاعل قيم البذرة مع المحتوى وشرط الحركة معًا في الوقت نفسه، فقد لا تؤدي البذرة الجيدة للَقطات Dolly بالأداء نفسه للَقطات Pan، لذا تعامل معها كأصول خاصة بنوع المسار.
💡 ولّد 3 قيم بذرة مختلفة على الأقل قبل أن تلتزم بمسار كاميرا. شرط الكاميرا الهندسي ثابت، لكن التنوع في المحتوى عبر قيم البذرة كبير. تريد البذرة التي تتوافق فيها جودة الحركة والجماليات البصرية في آن واحد.
3 حالات إنتاج حقيقية

عروض فيديو المنتجات
يُعد Dolly-in بطيء مع ميل خفيف لأعلى لقطة الكشف الكلاسيكية للمنتج. فهي تنقل الجودة وتجذب عين المشاهد نحو الشخص أو الجسم مع مرور الوقت بإحساس من الوقار. يستطيع HunyuanVideo 2.0 إعادة إنتاج هذا بموثوقية على خلفية بيضاء بلا فواصل أو على ديكور منسّق، ما يجعله مفيدًا فعلًا لعمل فيديو التجارة الإلكترونية، حيث يجب أن يبدو مسار الكاميرا متسقًا عبر خط منتجات كامل.
ادمجه مع Seedance 2.0 للحصول على نسخ سريعة متزامنة مع الصوت، بعد أن تثبّت مسار الكاميرا في HunyuanVideo وتتأكد من أن اللقطة تظهر بشكل صحيح.
لقطات B-Roll سينمائية للمحتوى
تعتمد الأفلام الوثائقية على YouTube والمحتوى السياحي والتحريري الطويل بشكل كبير على لقطات B-roll لمرافقة السرد. كانت لقطة Pan واسعة تأسيسية تضيق ببطء نحو لقطة متوسطة، أو Truck يتبع شخصًا عبر بيئة، تتطلب منصة فيزيائية ومشغّلًا. مع HunyuanVideo 2.0، يمكن توليد هذه اللقطات انطلاقًا من صورة مرجعية ووصف مسار، وتكرارها في دقائق بدلًا من جدولتها على مدار يوم تصوير كامل.
أما اللقطات التي تتطلب مخرجات عالية الدقة بشكل خاص، فيتعامل LTX 2.3 Pro مع توليد 4K ويمكن استخدامه للمخرج النهائي بعد التحقق من مسار الكاميرا بدقة قياسية في HunyuanVideo. سير العمل ذو المرحلتين، أي التحقق في HunyuanVideo ثم تصيير النسخة النهائية في LTX 2.3 Pro، نمط إنتاجي عملي يستحق أن تتبناه مبكرًا.
فيديو اجتماعي بحركة كاميرا
يستفيد المحتوى قصير الشكل على المنصات العمودية من مجموعة فرعية محددة من حركات الكاميرا: كشوفات Tilt لأعلى، وZoom بطيء للتأكيد، ولقطات مدارية (قوسية) تدور حول شخص. تجعل معاملات Roll وTilt في HunyuanVideo 2.0 إنتاج هذه اللقطات أمرًا مباشرًا دون الاعتماد على التوليد بالنص وحده، الذي يصبح غير متوقع عند الحجم الكبير.
لإنتاج المحتوى الاجتماعي بحجم كبير، يتعامل Pixverse v5 وKling v2.6 مع جانب الإنتاجية بكفاءة، بينما يتعامل HunyuanVideo مع اللقطات التي تكون فيها دقة الكاميرا لا غنى عنها، وحيث يكون الفرق بين Dolly ناعم وانجراف محرج واضحًا فورًا للمشاهد.

جرّب HunyuanVideo على PicassoIA الآن
تقلّصت الفجوة بين معرفة شكل لقطة Dolly الصحيحة وإنتاجها فعلًا في فيديو الذكاء الاصطناعي بشكل كبير مع HunyuanVideo 2.0. يضع شرطه الهندسي وآليات الاتساق الزمني ومفردات الحركة بستة محاور تحكمًا سينمائيًا حقيقيًا في متناولك، دون منصة فيزيائية أو طاقم أو موقع تصوير.
يتيح PicassoIA ذلك عبر picassoia.com/en/collection/text-to-video/hunyuan-video. ابدأ بحركة كاميرا واحدة نظيفة، مثل Dolly-in بطيء أو Pan هادئ ومحسوب، وخصص وقتًا لملاحظة تفاعل أوامرك مع الشرط قبل المحاولة بمسارات مركبة. يكافئ النموذج الإعدادات المتعمدة بنتائج كانت تتطلب منصة حركة وفريق ما بعد الإنتاج قبل سنوات قليلة فقط.
عندما تكون مستعدًا للتوسّع، يمنحك الكتالوج الكامل لنماذج الحركة وتحويل النص إلى فيديو على picassoia.com/en/all-models كل شيء، من أدوات النماذج الأولية السريعة إلى توليد متزامن مع الصوت ومخرجات 4K عالية الدقة، كل ذلك في مكان واحد.
