رفعت MiniMax للتو سقف توليد الفيديو بالذكاء الاصطناعي. مع إطلاق Hailuo 2.3، قدّم المختبر البحثي الذي يتخذ من شنغهاي مقرًا له نموذجًا يتعامل مع الثبات عبر الزمن، والواقعية في الحركة، والتكوين السينمائي بشكل أفضل من أي نموذج في سلسلته السابقة. سواء كنت تجرّب تحويل النص إلى فيديو منذ بداياته الأولى، أو بدأت للتو تلاحظ هذا المجال، فإن Hailuo 2.3 يمثل خطوة واضحة إلى الأمام تستحق أن تفهمها بالتفصيل.

ما هو Hailuo 2.3 فعليًا
ليست MiniMax اسمًا مألوفًا بالقدر نفسه الذي تحظى به بعض مختبرات الذكاء الاصطناعي الغربية، لكن مخرجاتها التقنية يصعب تجاهلها. بنت الشركة سجلًا قويًا من خلال نماذجها السابقة، ومنها Video 01، وVideo 01 Live، وVideo 01 Director، وقد دفع كل منها جودة الفيديو في اتجاه مختلف.
يمثل Hailuo 2.3 تطورًا لسلسلة Hailuo، التي بدأت تكتسب زخمًا حقيقيًا مع Hailuo 02. صُمم النموذج لتوليد عالي الدقة من النص والصورة إلى فيديو، مع تركيز على حركة تبدو مستندة إلى الفيزياء بدلًا من حركة مُستَكمَلة أو مُولَّدة إطارًا بعد إطار دون منطق فيزيائي.
البنية التي يقوم عليها
لم تنشر MiniMax ورقة تقنية مفصّلة بالكامل حول البنية الكاملة لنموذج Hailuo 2.3، لكن استنادًا إلى سلوك مخرجات النموذج، يبدو أنه يعمل على عمود فقري هجين من نوع diffusion-transformer. يجمع هذا النهج بين قدرات الاستدلال المكاني لانتباه المحوّلات (transformer) وقدرات تحسين الإطارات على مستوى الإطار الواحد لنماذج الانتشار (diffusion).
النتيجة نظام قادر على الحفاظ على تماسك المشهد عبر الزمن، وهي مشكلة واجهتها أدوات تحويل النص إلى فيديو السابقة باستمرار. تبقى الشخصيات شخصيات، وتحافظ الأشياء على شكلها، ولا يرتعش الضوء بشكل عشوائي بين الإطارات.
من Hailuo 02 إلى Hailuo 2.3
الانتقال من Hailuo 02 إلى Hailuo 2.3 ليس مجرد تحديث بسيط. فقد أعادت MiniMax بناء عدة مكونات أساسية في مسار توليد الفيديو، وركزت على ثلاثة مجالات محددة: التماسك الزمني في المقاطع الأطول، ومعقولية الفيزياء في حركة الأشخاص والبيئة المحيطة، والالتزام بالأمر النصي عند التعامل مع أوصاف طويلة ومفصلة.

أبرز التحسينات في Hailuo 2.3
الثبات الزمني على نطاق واسع
هنا يكتسب Hailuo 2.3 سمعته. يعني الثبات الزمني أن الأشياء والوجوه والخلفيات تبقى مستقرة بصريًا طوال مدة المقطع، بدلًا من أن تنجرف أو تتشوّه أو ترتعش بشكل غير متوقع. عانت نماذج الفيديو بالذكاء الاصطناعي السابقة كثيرًا مع أي شيء يتجاوز بضع ثوانٍ، وغالبًا ما كانت تنتج مقاطع يتغيّر فيها مظهر الأشخاص بشكل خفي، أو تتحرك الخلفيات بطرق غير واقعية.
يمدّ Hailuo 2.3 الترابط الزمني الموثوق إلى مقاطع تصل إلى 10 ثوانٍ. وفي اختبارات مضبوطة أجريت على أشخاص ثابتين أمام خلفيات متحركة، يصمد الثبات بشكل أفضل بوضوح من Hailuo 02 Fast أو من النماذج المماثلة لدى المختبرات المنافسة.
💡 للحصول على أفضل نتائج الثبات الزمني، اجعل وصف الشخص محددًا، واجعل وصف الخلفية مختصرًا. يتعامل النموذج مع الأمامية المعقدة أمام خلفيات ثابتة بشكل أفضل بكثير من المشاهد التي تتحرك فيها الشخصية والخلفية في الوقت نفسه.
فيزياء الحركة والحركة الطبيعية
من أبرز الترقيات في Hailuo 2.3 طريقة تعامله مع الحركة الجسدية. ينساب القماش بوزن مناسب، ويتحرك الشعر في اتجاه الريح، وتتّبع رشات الماء مسارات قوسية معقولة. يبدو أن هذه السلوكيات تنبع من التمثيل الداخلي للفيزياء لدى النموذج، لا من تأثيرات مطبّقة فوق المشهد بعد التوليد.
هذا مهم جدًا في الاستخدام العملي. فالنموذج الذي ينتج إطارات حادة تقنيًا لكنه يولّد حركة غير معقولة فيزيائيًا سيبدو خاطئًا لأي مشاهد بشري خلال ثوانٍ. يحل Hailuo 2.3 جزءًا كبيرًا من هذه المشكلة.

دقة إخراج أعلى
يولّد Hailuo 2.3 فيديو بدقة تصل إلى 1080p. وهذه ترقية عملية لكل من ينتج محتوى لمنصات تهمّها الدقة، مثل YouTube وInstagram Reels أو عروض المحتوى الاحترافية. يضحّي الإصدار Hailuo 2.3 Fast بجزء من الدقة مقابل توليد أسرع بكثير، ما يجعله مفيدًا للنماذج الأولية السريعة وتكرار اتجاهات الأوامر النصية قبل الالتزام بتشغيل كامل بجودة عالية.
الإخلاص للأوامر النصية الطويلة
كانت النماذج السابقة كثيرًا ما "تنسى" عناصر من الأمر النصي الطويل في منتصف عملية التوليد. قد ينتج أمر يحدد خمسة تفاصيل للمشهد مقطعًا يلتقط اثنين أو ثلاثة منها ويتجاهل الباقي. يُظهر Hailuo 2.3 احتفاظًا أفضل بالانتباه للبُنى المعقدة للأوامر، إذ يحتفظ بتفاصيل عدد الأشخاص والعلاقات المكانية والتوجيهات الأسلوبية عبر مدة المقطع كاملة.
يفتح هذا الباب أمام توجيه إبداعي أدق من جهة الأمر النصي، بدلًا من الاعتماد على المعالجة اللاحقة أو على محاولات توليد متعددة للوصول إلى المخرج المطلوب.
كيف يقارن Hailuo 2.3 بالمنافسين
يُعدّ مجال توليد الفيديو بالذكاء الاصطناعي في 2027 تنافسيًا بحق. إليك كيف يضع Hailuo 2.3 نفسه:
| النموذج | أقصى دقة | الثبات الزمني | السرعة | الاستخدام الأمثل |
|---|
| Hailuo 2.3 | 1080p | ممتاز | متوسطة | الجودة السينمائية |
| Hailuo 2.3 Fast | 720p | جيد | سريع | التكرار السريع |
| Kling v2.6 | 1080p | ممتاز | متوسطة | مشاهد الحركة الديناميكية |
| Veo 3 | 1080p | ممتاز | بطيئة | السينمائي مع الصوت |
| Sora 2 | 1080p | جيد جدًا | بطيئة | الواقعية الإبداعية |
| Seedance 2.0 | 1080p | جيد | متوسطة | الصوت المدمج |
يقع Hailuo 2.3 بثبات في الفئة العليا من حيث الجودة البصرية الخام والترابط الزمني. أما المجال الذي يتأخر فيه عن بعض المنافسين حاليًا فهو توليد الصوت الأصلي، وهي ميزة دمجتها نماذج مثل Veo 3 وSeedance 2.0. وبالنسبة إلى المخرجات السينمائية البصرية البحتة، فهو من أقوى الخيارات المتاحة اليوم.

ما الذي يتعامل معه جيدًا (وما الذي لا يتعامل معه)
ما يتفوّق فيه Hailuo 2.3
- الوجوه والأجساد: تبقى الشخصيات البشرية مستقرة عبر الإطارات، بملمس طبيعي للبشرة ونسب واقعية طوال المقطع
- البيئات الطبيعية: تُعرض المناظر الطبيعية والطقس والمياه والسماء بمعقولية فيزيائية وسلوك متسق
- محاكاة حركة الكاميرا: يستجيب النموذج جيدًا للأوامر التي تحدد حركات الكاميرا مثل dolly أو pan أو tilt أو zoom
- استمرارية الإضاءة: تبقى مصادر الضوء ثابتة في موضعها وطابعها، بدلًا من أن تتغير بشكل غير متوقع بين الإطارات
ما الذي ما زال يعاني منه
- النص على الشاشة: مثل معظم مولّدات الفيديو الحالية، يبقى النص المقروء داخل الإطار غير موثوق ومتذبذبًا
- المشاهد شديدة التعقيد: أكثر من ثلاثة أو أربعة أشخاص متحركين ومتمايزين في الإطار نفسه قد يسببان انحرافًا في الترابط مع مرور الوقت
- الحركة السريعة جدًا: قد تنتج الحركات الفائقة السرعة، مثل تسلسلات الرياضة أو فنون القتال، آثارًا من ضبابية الحركة
فهم هذه القيود يساعدك على كتابة أوامر نصية تستثمر نقاط قوة النموذج، بدلًا من الاصطدام بحدوده القصوى من المحاولة الأولى.

حالات استخدام واقعية تنجح
المحتوى السينمائي القصير
ينتج Hailuo 2.3 فيديو يصمد عند مستوى احترافي للمقاطع السينمائية القصيرة. تستفيد من قدرات النموذج القوية في الترابط الزمني والواقعية في الحركة كل من أفلام الأزياء، وعروض المنتجات، والمقطوعات الجوّية ذات الطابع المزاجي، والمشاهد السردية القصيرة. وغالبًا ما يحتاج الفيديو الناتج إلى معالجة لاحقة قليلة أو معدومة في التطبيقات المصممة أساسًا للمنصات الاجتماعية.
فيديوهات التسويق والعلامات التجارية
بالنسبة إلى فرق التسويق التي تنتج أصول فيديو على نطاق واسع، فإن الجمع بين Hailuo 2.3 للمخرجات النهائية عالية الجودة وHailuo 2.3 Fast للتصوّر السريع للأفكار يشكّل سير عمل من مرحلتين متينًا.
💡 نصيحة لسير العمل: استخدم Hailuo 2.3 Fast لاختبار خمسة أو ستة اتجاهات مختلفة للأوامر النصية بسرعة، ثم شغّل أقوى مفهوم لديك عبر Hailuo 2.3 للحصول على المخرج النهائي عالي الدقة.
الرسم القصصي والتصوّر المسبق
تستخدم فرق الأفلام والرسوم المتحركة نماذج تحويل النص إلى فيديو بشكل متزايد كأدوات للتصوّر المسبق. تجعل قدرة Hailuo 2.3 على محاكاة حركة الكاميرا والحفاظ على ثبات المشهد منه خيارًا عمليًا للرسوم المتحركة التمهيدية والمواد التي تُعرض على العملاء، حيث تكون الجودة المرئية للعميل مهمة.

كيف تستخدم Hailuo 2.3 على PicassoIA
يتوفر كل من Hailuo 2.3 وHailuo 2.3 Fast مباشرة على PicassoIA. إليك كيف تبدأ:
الخطوة 1: افتح النموذج
انتقل إلى صفحة نموذج Hailuo 2.3. ستجد منطقة إدخال الأمر النصي مع أدوات التحكم في مدة الفيديو ونسبة العرض إلى الارتفاع وإعدادات الدقة.
الخطوة 2: اكتب أمرًا نصيًا مرتكزًا على الواقع
يكافئ Hailuo 2.3 الأوامر النصية المحددة والمرتكزة على الفيزياء. صف الشخص بوضوح، وأضف تفاصيل البيئة، وحدد اتجاه الحركة إذا أردت سلوكًا محكومًا للكاميرا.
بنية أمر نصي تنجح جيدًا:
- الشخص: "امرأة ترتدي فستانًا أبيض منسدلًا"
- البيئة: "تقف على حافة جرف تطل على المحيط عند الغسق"
- الحركة: "رياح لطيفة تحرك شعرها وفستانها، dolly بطيء إلى الأمام"
- المزاج: "سينمائي، ضوء غروب دافئ، واقعي كالصور الفوتوغرافية"
الخطوة 3: اختر Standard أو Fast
استخدم Hailuo 2.3 للحصول على أقصى جودة بدقة 1080p. واستخدم Hailuo 2.3 Fast عندما تحتاج إلى نتائج أسرع، أو عندما تكرر مفاهيم الأوامر النصية قبل الالتزام بتشغيل كامل بجودة عالية.
الخطوة 4: كرّر بتعمّد
لا تتوقف عند أول نتيجة. فتعديلات صغيرة على الأمر النصي، مثل تحديد اتجاه الضوء أو تغيير الفعل الذي يصف الحركة، يمكن أن تغيّر المخرج بشكل جذري. وكل توليد يبني فهمك لطريقة تفسير النموذج لما تكتبه.
💡 أضف عبارات مثل "كاميرا ثابتة" و"واقعي كالصور الفوتوغرافية" و"إضاءة طبيعية" لتوجيه المخرج نحو لقطات واقعية ومستقرة، لا نحو فيديو مُنمّط أو غير متسق بصريًا.

مجموعة MiniMax الكاملة
يُعد Hailuo 2.3 النموذج الرائد لشركة MiniMax في توليد الفيديو، لكن الشركة بنت سلسلة أوسع تستحق المعرفة بها:
- Video 01: النموذج الأصلي عالي الجودة، وهو قوي للاستخدام العام في تحويل النص إلى فيديو مع مخرجات موثوقة
- Video 01 Live: محسّن لتحريك الصور الثابتة وتحويلها إلى فيديو طبيعي ومستقر
- Video 01 Director: يضيف تحكمًا دقيقًا بالكاميرا، ومفيد عندما تحتاج إلى تكوينات لقطات محددة
- Hailuo 02: الإصدار السابق، ما زال قويًا لكثير من الاستخدامات القياسية وأسرع في التشغيل
- Hailuo 02 Fast: إصدار خفيف للتوليد السريع والأقل تكلفة عندما تكون الجودة ثانوية
يخدم كل نموذج جزءًا مختلفًا من سير عمل الإنتاج. ومعرفة أيّها تستخدم، ومتى، هي ما يفصل إنتاج الفيديو المدعوم بالذكاء الاصطناعي الفعّال عن دورات التوليد المهدرة.
أنماط أوامر نصية تنجح باستمرار
يتطلب الحصول على أفضل ما في Hailuo 2.3 تفكيرًا مختلفًا قليلًا في الأوامر النصية مقارنةً بتوليد الصور الثابتة. إليك أنماط تنتج نتائج قوية بشكل موثوق:
أفعال الحركة أهم مما تظن. "يمشي ببطء" و"يخطو بثقة" تنتجان مخرجات مختلفة بوضوح. كن دقيقًا في جودة الحركة وإيقاعها.
صف اتجاه الإضاءة بوضوح. "ضوء صباحي من اليسار" أو "شمس منتصف النهار من أعلى مع ظلال حادة" يمنح النموذج معلومات مكانية واضحة يستطيع استخدامها للحفاظ على إضاءة متسقة عبر الإطارات.
حدّد الكاميرا في النهاية. الأوامر التي تقدّم معلومات الشخص والبيئة قبل إضافة توجيهات الكاميرا تميل إلى أداء أفضل من تلك التي تبدأ بحركة الكاميرا.
المقاطع الأقصر تؤدي أفضل. للحصول على أقصى قدر من الترابط، ولّد في نطاق 5 إلى 6 ثوانٍ بدلًا من السعي إلى أقصى مدة. يمكن دائمًا دمج المقاطع في مرحلة ما بعد الإنتاج.
| عنصر الأمر النصي | النسخة الضعيفة | النسخة القوية |
|---|
| الشخص | "شخص" | "امرأة في الثلاثينات ترتدي معطفًا طويلًا أزرق داكنًا" |
| الحركة | "يتحرك" | "تمشي ببطء بين الأوراق المتساقطة، مع ميل خفيف للأمام" |
| الإضاءة | "إضاءة جميلة" | "ضوء نهاري منتشر وملبّد بالغيوم، ظلال ناعمة ومتساوية" |
| الكاميرا | "تبدو سينمائية" | "dolly بطيء إلى الأمام، بطول بؤري مكافئ 35 ملم" |

أين يقع هذا ضمن الصورة الأكبر
يستحق الأمر أن نبتعد قليلًا. في أوائل 2024، كانت أفضل نماذج الفيديو بالذكاء الاصطناعي تنتج مقاطع مصطنعة بوضوح، مع إخفاقات ظاهرة في الترابط، ونطاق حركة محدود، ومظهر غريب للأشخاص. وبحلول وصول Hailuo 2.3، تقلّصت الفجوة بين اللقطات المولّدة بالذكاء الاصطناعي واللقطات المصوّرة احترافيًا إلى حد أن كثيرًا من المشاهدين لم يعودوا يستطيعون تمييز الفرق فورًا في مقطع قصير.
هذا ليس مجرد إنجاز تقني. إنه يشير إلى تحول حقيقي فيما يمكن تحقيقه للمبدعين الأفراد، وفرق الإنتاج الصغيرة، والعلامات التجارية التي لا تملك ميزانيات إنتاج بصري ضخمة. يستطيع شخص واحد يملك أمرًا نصيًا محكمًا وإمكانية الوصول إلى Hailuo 2.3 أن ينتج محتوى كان سيتطلب طاقم تصوير كاملًا قبل ثمانية عشر شهرًا.
ستحمل النماذج التالية على الأرجح توليد الصوت الأصلي، ومقاطع متماسكة أطول، ومحاكاة فيزيائية أدق. ما يهم الآن أن Hailuo 2.3 يمثل السقف العملي الحالي لجودة فيديو الذكاء الاصطناعي الواقعي كالصور الفوتوغرافية، وهو جاهز بالفعل للاستخدام في العمل الإنتاجي الحقيقي.

الآن دورك
أفضل طريقة لتفهم ما يفعله Hailuo 2.3 فعلًا هي أن تشغّله بنفسك. يمنحك PicassoIA وصولًا مباشرًا إلى الإصدار القياسي وإصدار Fast، إضافة إلى بقية مجموعة MiniMax، بما في ذلك Video 01 Director للقطات المتحكَّم فيها بالكاميرا، وVideo 01 Live لتحريك صورك الخاصة.
ابدأ بمشهد بسيط: شخص واحد، وحركة واضحة، وظروف إضاءة جيدة موصوفة في أمرك النصي. قارن الفيديو الناتج من Hailuo 2.3 مع Hailuo 02 لترى فرق الجودة بعينك. ثم كرّر. النموذج يكافئ دقة الأوامر النصية، وكل توليد يعلّمك شيئًا عن كيفية الحصول على المخرج الذي تريده بالضبط.