سير عمل MiniMax H3 في ComfyUI: الأوامر النصية وLoRA والإعداد المحلي

يُنتج MiniMax H3 فيديوهات تصل مدتها إلى 15 ثانية بمعدل 24 إطارًا في الثانية مع صوت ستيريو أصلي، ويعمل محليًا في ComfyUI. تعرّف على ملفات النموذج والمساحة التخزينية التي تحتاجها، ومستويات VRAM حسب معالج الرسومات (GPU)، وكيفية كتابة أوامر نصية لمشاهد موقوتة وحوار، وكيف تعمل إصدارات Turbo وLoRA للشخصيات، وكيف تربط مقاطع أطول.

سير عمل MiniMax H3 في ComfyUI: الأوامر النصية وLoRA والإعداد المحلي
Cristian Da Conceicao
مؤسس Picasso IA

معظم نماذج الفيديو تقع خلف تسجيل دخول ومقياس للنقاط. أما MiniMax H3 فلا يلزمه ذلك. تعمل أوزانه المفتوحة داخل ComfyUI على بطاقة الرسومات الخاصة بك، ويُعيد التمرير الواحد فيديو يصل إلى 15 ثانية بمعدل 24 إطارًا في الثانية، مع مسار صوتي ستيريو مدمج فيه بالفعل: حوار ومؤثرات صوتية وموسيقى معًا. يبدو الأمر جاهزًا للتشغيل فورًا، وهو كذلك إلى حد كبير، بشرط أن تختار ملفات النموذج الصحيحة، وتكتب الأوامر النصية بالطريقة التي يتوقعها H3، وتعرف أين تفيد LoRA فعلًا. يتتبع هذا المقال سير عمل MiniMax H3 في ComfyUI بالترتيب الذي ستصادف فيه كل مشكلة: العتاد، ثم الملفات، ثم أنماط التوليد الثلاثة، ثم كتابة الأوامر النصية، والسرعة، وLoRA للشخصيات، والمقاطع الأطول.

ما الذي يفعله MiniMax H3 فعلًا

H3 نموذج فيديو متعدد الوسائط (omni-modal). فبدلًا من عرض إطارات صامتة ثم الاستعانة بأداة ثانية لإضافة الصوت، يولّد الصورة والصوت والمؤثرات والموسيقى في التمريرة نفسها. أضافت ComfyUI الدعم الأصلي له في الإصدار 0.30.0، لذا لا تحتاج القوالب الأساسية إلى أي عقدة مخصصة.

ثلاثة أنماط في نموذج واحد

  • تحويل النص إلى فيديو (T2V): أمر نصي وحده. صِف المشهد، وسيُعيد النموذج مقطعًا مع الصوت.
  • تحويل الصورة إلى فيديو (I2V): صورة ثابتة واحدة، مع مدخلات اختيارية للإطار الأول والإطار الأخير. يملأ النموذج الحركة بين الإطارين.
  • تحويل المرجع إلى فيديو (R2V): أمر نصي مع ما يصل إلى 9 صور مرجعية و3 فيديوهات مرجعية و3 مقاطع صوتية. أنت تحدد أي مرجع يتحكم في الهوية أو الأسلوب أو الحركة أو الكاميرا أو الصوت.

تنقسم الأوزان على الخط نفسه. يستخدم T2V وI2V نقاط حفظ FL2VA، بينما يستخدم R2V نقاط حفظ Ref2VA، لذا خطّط لتنزيل منفصل إذا أردت الأنماط الثلاثة كلها.

الأرقام المهمة

المواصفةالقيمة
مدة المقطعحتى 15 ثانية
معدل الإطارات24 إطارًا في الثانية
الصوتستيريو أصلي بتردد 32 كيلوهرتز
لغات الكلام11 لغة: العربية، والصينية، والإنجليزية، والفرنسية، والألمانية، والإيطالية، واليابانية، والكورية، والبرتغالية، والروسية، والإسبانية
الدقة الرئيسيةحتى 2K
إعدادات القوالب المسبقة960×544، 1152×640، 1216×672
أصغر حجم قابل للعمل384p (يفشل 256p)
قاعدة الحجمالعرض والارتفاع من مضاعفات 32

💡 اقرأ سطر الدقة بعناية. "حتى 2K" هو السقف الأقصى. يصف أحد الشروح المجتمعية حجمًا أصليًا بنحو 768 بكسل على الضلع القصير، لذا اعتبر الإعدادات المسبقة أعلاه نقطة بداية واقعية، واختبر أحجامًا أكبر على بطاقتك.

العتاد والمساحة التخزينية كما هي فعلًا

قبل أن تنزّل أي شيء، تحقق مما يستطيع جهازك حمله. H3 نموذج كبير، والفرق بين "يعمل" و"يعمل جيدًا" واسع.

بطاقة رسومات بثلاثة مراوح سوداء مركّبة في هيكل حاسوب مفتوح

VRAM حسب فئة البطاقة

الأرقام أدناه مستمدة من اختبار أداء مجتمعي واحد، وليست مواصفة رسمية، لذا توقع تفاوتًا بحسب تعريفات التشغيل والدقة والتكميم.

فئة البطاقةما يمكن توقعه
6 GB (من فئة RTX 2060)يعمل، لكن بتفاصيل مموّهة وصوت أخشن، وبمعدل 10 إلى 15 دقيقة تقريبًا لكل مقطع
12 إلى 16 GB (من فئة RTX 4060)نحو 6 دقائق لمقطع 480p مدته 5 ثوانٍ، وأنظف من فئة 6 GB
24 GB (من فئة RTX 4090)دقة أعلى مع تنازلات أقل، ومساحة كافية لتدريب LoRA
32 GB فأكثر (RTX 5090، RTX 6000)الفئة الموصى بها، مع مقاطع أطول مدتها 15 ثانية بدقة أعلى
Apple Siliconتعمل نسخة 4-bit NF4 بذاكرة 8 GB فقط، مع تراجع ملحوظ في الجودة في المشاهد المزدحمة

ملفات النموذج والمساحة التخزينية

يأتي كل مكوّن بثلاثة مستويات دقة، والاختيار موازنة بين الجودة والذاكرة. ملفات الانتشار INT8 المقلّمة ومشفّر النص nvfp4 هما ما توصي به ملاحظات القالب، لأنهما يتركان أكبر قدر من المساحة للفيديو نفسه. انتقل إلى INT8 أو BF16 فقط إذا كان لديك VRAM فائضة ويمكنك رؤية فرق في اختباراتك المقارنة الخاصة.

الملفالحجمالدور
FL2VA pruned INT8 ConvRot19.5 GBموصى به لتحويل النص إلى فيديو وتحويل الصورة إلى فيديو
FL2VA INT8 ConvRot31.7 GBخيار INT8 أكبر
FL2VA BF1661.7 GBدقة كاملة
Ref2VA pruned INT8 ConvRot19.5 GBموصى به لنوع R2V
مشفّر النص Qwen3-VL، nvfp4 AWQ14.6 GBالمشفّر الموصى به
Qwen3-VL INT8 ConvRot25.3 GBخيار مشفّر أكبر
Qwen3-VL BF1648.0 GBمشفّر بدقة كاملة
VAE الفيديو FP164.9 GBمطلوب
VAE الصوت FP320.6 GBمطلوب

يصل الإعداد الخفيف لـ T2V وI2V (نموذج الانتشار INT8 المقلّم، ومشفّر النص nvfp4، والـ VAE للفيديو والصوت) إلى نحو 39.6 GB. أضف 19.5 GB أخرى إذا أردت R2V. احتفظ بكل شيء على قرص NVMe، لأن تحميل 40 GB من قرص دوّار أمر مرهق.

قرص NVMe نحيف على مكتب من خشب الجوز بجانب حاسوب محمول وفنجان قهوة

الإعداد المحلي في ComfyUI

التحديث وفتح القالب

  1. حدّث ComfyUI إلى الإصدار 0.30.0 أو أحدث.
  2. افتح Workflow، Browse Templates، Video واختر أحد قوالب MiniMax H3.
  3. ضع الملفات التي نزّلتها في models/diffusion_models/ وmodels/text_encoders/ وmodels/vae/.
  4. أعد تشغيل ComfyUI حتى ترى أدوات التحميل الملفات الجديدة.

شغّل أولًا اختبار T2V قصيرًا منخفض الدقة. اختبار أول جيد هو مقطع 384p بجملة حوار واحدة ومؤثر صوتي واضح واحد، مثل إغلاق باب. إذا ظهرت الصورة لكن الصوت صامت، فالمشتبه به على الأرجح مسار فك ترميز الصوت وليس الأمر النصي. وإذا عمل الاثنان، فلديك خط أساس آمن تغيّر فيه إعدادًا واحدًا في كل مرة.

يعتمد إخراج الصوت على عقدة VAEDecodeAudio، والتي تتضمنها القوالب مسبقًا. عقدة تحويل الصورة إلى فيديو هي MiniMaxH3ImageToVideo، وتعرض مدخلي first_frame وlast_frame.

إعدادات أداة العينات التي تصمد

يعتمد الأساس الذي تقترحه الملاحظات المجتمعية على أداة العينات res_multistep مع مجدول الخطوات simple عند 20 خطوة. تنخفض الجودة بشكل ملحوظ دون نحو 15 خطوة. إذا كانت بطاقتك تدعم ذلك، شغّل ComfyUI باستخدام --use-sage-attention لتوليد أسرع بما يصل إلى نحو 2x. في الاختبارات السريعة، انزل إلى 384p ومدة قصيرة، ثم ارفع الحجم بعد أن تصبح الحركة والصوت صحيحين.

بديل بمخطط واحد

ComfyUI-MiniMaxH3-Easy عقدة مخصصة من المجتمع تجمع T2V وI2V والإطار الأول والأخير وR2V في سير عمل مدمج واحد. ثبّتها بنسخ المستودع داخل ComfyUI/custom_nodes، أو بالبحث عن اسمها في ComfyUI Manager. لا يحتاج التوليد إلى بيانات اعتماد API. تُستخدم حسابات OpenAI أو Gemini أو Ollama فقط في محسّن الأوامر الاختياري فيها، أما أدوات العينات وLoRA وتصحيحات الانتباه فتبقى اتصالات ComfyUI العادية. وتدعم أيضًا وضع الإنسان الرقمي المدفوع بمسار صوتي واحد، وهو مفيد لمقاطع الرأس المتحدث.

كتابة الأوامر النصية لـ H3 كمخرج

يد تثبت بطاقة فهرسة على لوحة فلين مليئة ببطاقات اللقطات

المشهد أولًا ثم اللقطات

يستجيب H3 أفضل ما يستجيب لأمر نصي يذكر المشهد العام أولًا (المكان والشخصية وما يجري)، ثم يقسّم المقطع إلى لقطات موقوتة. أدرج حركات الكاميرا والصوت الذي تريده، لا الصورة وحدها.

مثال على أمر نصي: ليلة ممطرة في سوق أوساكا، بائع شارع يرتدي معطفًا أصفر للمطر يصبّ المرق في وعاء ورقي. من 0 إلى 4 ثوانٍ: اقتراب بطيء من البخار المتصاعد من القدر، والمطر يقرع على القماش المشمّع. من 4 إلى 9 ثوانٍ: لقطة متوسطة وهو يناول الوعاء لزبون ويبتسم. من 9 إلى 15 ثانية: متابعة بكاميرا يدوية بينما يمشي الزبون إلى الحشد. الصوت: مطر، وزيت يفحّ، وأحاديث بعيدة، وموسيقى شاميسن هادئة.

قارن ذلك بأمر نصي نحيل مثل "رجل يطبخ النودلز تحت المطر". سيُعيد H3 شيئًا يمكن مشاهدته، لكن الكاميرا والإيقاع والموسيقى التصويرية ستكون كلها تخمينات. ذكر النقاط الزمنية بالتفصيل يمنح النموذج خطًا زمنيًا يتبعه، ويمنحك شيئًا ملموسًا تعدّله عندما تخطئ لقطة. غيّر نقطة زمنية واحدة في كل اختبار حتى تعرف أي تعديل أدى إلى أي نتيجة.

قائمة تحقق قصيرة تحافظ على اتساق الأوامر النصية:

  • المشهد: أين ومتى ومن.
  • اللقطات: سطر واحد لكل نقطة زمنية، مع الثواني.
  • الكاميرا: اقتراب، أو متابعة بكاميرا يدوية، أو دوران حول الشخص، أو تثبيت الكاميرا.
  • الصوت: الحوار والمؤثرات والموسيقى، يُذكر كل عنصر على حدة.

ميكروفون مكثف وسماعات استوديو في غرفة تعليق صوتي

الحوار والصوت داخل الأمر النصي

بما أن الصوت يُولَّد إلى جانب الصورة، فسمِّه صراحةً. حدّد من يتكلم وماذا يقول، ثم اذكر المؤثرات والموسيقى في سطر مستقل حتى لا تختلط بوصف الصورة. ومع 11 لغة مدعومة، يمكنك كتابة الحوار باللغة التي يجب أن تتحدث بها الشخصية. في العقدة Easy، كتابة # تفتح كتلة حوار تُحوَّل وقت التشغيل إلى وسوم <d>...</d> التي يتوقعها H3.

وسوم المرجع لـ R2V

في وضع المرجع، أشِر إلى كل مدخل بوسمه، بالترتيب نفسه الذي وصلته به: <Picture 1>، <Video 1>، <Audio 1>. ثم حدّد أي مرجع يتحكم في أي جزء من اللقطة:

استخدم <Picture 1> لوجه الشخصية وملابسها، و<Video 1> لحركة الكاميرا، و<Audio 1> للصوت.

في العقدة Easy، تُحوَّل @Image1 و@Video1 و@Audio1 إلى تلك الوسوم نيابةً عنك.

لوحة اتصال لصور شخصية لرجل واحد من زوايا عدة

التحكم بالإطار الأول والأخير

غالبًا ما تُوجّه صورتان ثابتتان المقطع بشكل أفضل من مئة كلمة إضافية في الأمر النصي. في وضع I2V، كل من first_frame وlast_frame اختياري، ويولّد النموذج الحركة بينهما.

صورتان مطبوعتان للطريق نفسه عند شروق الشمس وغروبها

بناء الصور الثابتة للنهايات ومطابقتها

أنشئ الإطارين قبل أن تفتح ComfyUI. يمكن أن ينتج PicassoIA Image أو Seedream 5 Pro الصورة الثابتة الأولى، ويتيح لك نموذج تحرير مثل PicassoIA Image Editor Pro تعديل تلك الصورة إلى الصورة الختامية، فيبقى الشخص والإضاءة متقاربين.

طابق إحساس العدسة واتجاه الضوء وحجم الشخص. إذا كان الإطار الأول شروق شمس والأخير غروبًا، فعلى H3 أن يخترع يومًا كاملًا داخل 15 ثانية. يستطيع ذلك، لكن النتيجة تبدو كفيلم تسريع زمني. اختر نقاط نهاية تستطيع الحركة الوصول إليها بواقعية ضمن مدة المقطع.

LoRA: السرعة والهوية

تختلط الادعاءات حول LoRA مع H3 بسرعة. هناك في الحقيقة شيئان منفصلان: LoRA للسرعة يغيّر عدد الخطوات التي تحتاجها، وLoRA للهوية تدرّبه على صورك.

ساعة توقيت نحاسية على مكتب من خشب الجوز بجانب شاشة

LoRA Turbo للسرعة

يخفّض MiniMax-H3-Turbo-LoRA المجتمعي (Apache 2.0، بحجم نحو 744 MB بدقة bf16) خطوات العينات من نحو 20 إلى 4 خطوات فقط.

الإعدادالقيمة
الخطواتمن 4 إلى 8، مع تفضيل 6 إلى 8
قوة LoRA1.0
المجدولsimple
التسريعنحو 5 أضعاف في العينات
الملف الموصى بهminimax_h3_turbo_v4_step600_ema.safetensors

الأثر العملي يظهر في دورة التكرار لديك. لنفترض أن مقطع اختبار 480p يستغرق نحو 6 دقائق عند 20 خطوة على بطاقة بسعة 12 إلى 16 GB. تسريع العينات بمقدار 5 أضعاف سيجعل كل اختبار يقارب دقيقة ونصف. هذا حساب تقديري وليس قياسًا، وفك الترميز ما زال يستغرق وقتًا، لكنه يفسّر لماذا يشغّل الناس Turbo للمسودات والإعداد الكامل المكوّن من 20 خطوة للنسخة النهائية.

ثبّت عقدة ComfyUI-MiniMax-H3-Turbo المخصصة، وضع ملف .safetensors في مجلد LoRA لديك، وأدرج عقدة Turbo LoRA بين أداة تحميل النموذج وأداة العينات في سير عمل موجود.

💡 حدّ معروف: عند 4 خطوات مع حركة قوية، قد يُظهر v4 تلطيخًا وأشباحًا، وما زال سلوك الصوت أثناء الحركة المكثفة قيد التحسين. استخدم 4 خطوات للّقطات الثابتة أو قليلة الحركة، و6 إلى 8 للحركة.

تدريب LoRA للشخصية

درّب أحد صنّاع المحتوى LoRA لشخصية على بطاقة RTX 4070 بسعة 12 GB باستخدام ai-toolkit، مع نموذج مكمَّم وتفريغ إلى المعالج. هذه الأرقام التي أبلغ عنها:

الإعدادالقيمة
مجموعة البياناتمن 31 إلى 32 صورة بحجم 512×512
رتبة LoRA16
الخطوات1000، حجم الدفعة 1
VRAM أثناء التدريبنحو 11.7 من 12 GB
ذاكرة النظامنحو 32 إلى 37 GB
الوقتنحو 6 إلى 7 ساعات
الإعداد الإلزاميnum_frames: 1 وauto_frame_count: false

تقرر تفصيلتان ما إذا كان هذا سينجح. أولًا، إذا بقي auto_frame_count مفعّلًا، تُعامَل مجموعة الصور الثابتة كفيديو، ويُبلغ التدريب بأنه لم يجد أي صور. ثانيًا، أعطت اللقطات المختلطة للجسم كاملًا نتائج ضعيفة. فانتقل صانع المحتوى إلى مجموعة تركّز على الوجه، حيث يملأ الوجه معظم الإطار، مع تسمية بسيطة مكوّنة من كلمة مفتاحية وعنوان قصير للشخص. يُحمَّل LoRA النهائي عبر عقدة LoraLoaderModelOnly.

شبكة من اثنتين وثلاثين مطبوعة لصور شخصية ملصقة على جدار أبيض

💡 تخطَّ LoRA الخاص بنموذج H3 عندما تكفي صورة ثابتة. إذا كنت تحتاج فقط إلى شخصية متسقة كإطار أول أو صورة مرجعية، فدرّب LoRA على جانب الصور بدلًا من ذلك. يبني P Image Trainer على PicassoIA ملف LoRA لنموذج p-image من ملف zip يضم 10 صور على الأقل، مع 1000 خطوة كقيمة افتراضية.

أما LoRA للفيديو فقصة مختلفة. لاحظ الصانع نفسه أن تدريب مقاطع الفيديو قد يتجاوز الإمكانات عند 12 GB، وتشير الاختبارات المجتمعية إلى 20 GB أو أكثر للتدريب العملي على الفيديو. لأغلب الإعدادات، التقسيم المعقول بسيط: LoRA للهوية أو صور مرجعية للشخصية، وLoRA Turbo عندما يكون زمن التوليد هو عنق الزجاجة.

المقاطع الأطول والإصلاحات الشائعة

ربط المقاطع بسياق الحركة

تمثل 15 ثانية السقف لتمريرة واحدة. تربط ComfyUI MiniMax H3 Extender عدة مقاطع مع الحفاظ على الاستمرارية. عندما توافق على مقطع، يُخزَّن مُمثّله الكامن (latent) على القرص ويصبح سياق الحركة للمقطع التالي، فتستمر اللقطة الجديدة من الإطارات الأخيرة للمقطع السابق.

  • أوامر نصية وبذور ومدد لكل مقطع
  • أوضاع البذرة: Randomize وFixed وIncrement وDecrement
  • حدود المراجع نفسها: 9 صور و3 فيديوهات و3 مسارات صوتية
  • التصدير بصيغة H.264 أو H.265/HEVC أو FFV1

ثبّتها من ComfyUI Manager أو بنسخها داخل ComfyUI/custom_nodes. خطّط للتسلسل كله على الورق أولًا: سطر واحد لكل مقطع، مع سرد المراجع المشتركة للشخصية مرة واحدة، حتى يرث كل جزء الهوية نفسها بدلًا من أن تنحرف من مقطع إلى آخر.

أيدٍ ترتدي قفازات بيضاء تصفّ شرائط من فيلم 35 مم على لوح إضاءة

إصلاح الأخطاء المتكررة

العَرَضالسبب المرجّحالحل
يفشل تشغيل 256p فورًاأقل من الحجم الأدنىاستخدم 384p أو أعلى، بمضاعفات 32
يُولَّد الفيديو بلا صوتفك ترميز الصوت مفقودأضف VAEDecodeAudio وحمّل الـ VAE الخاص بالصوت
تفاصيل ناعمة ومتلطخةخطوات قليلة جدًااستخدم 20 خطوة وتجنّب النزول تحت 15 تقريبًا
أشباح في الحركة السريعة مع Turboإعداد 4 خطواتارفع إلى 6 إلى 8 خطوات
تدريب LoRA لا يجد صورًاauto_frame_count مفعّلاجعله false واضبط num_frames على 1
تشغيل بطيء على بطاقة قادرةانتباه افتراضيشغّل مع --use-sage-attention

جرّبه على PicassoIA

لا يوجد MiniMax H3 في كتالوج PicassoIA حتى وقت كتابة هذا المقال، لكن المهام نفسها التي يتعامل معها في ComfyUI لها بدائل قريبة تستطيع تشغيلها في المتصفح، دون تنزيل 40 GB ودون إدارة ميزانية VRAM.

إذا كنت تحتاج إلىجرّب هذا النموذج
صور مرجعية أو مقاطع تُبقي الشخص متسقًاWan 2.7 R2V، ويُخرج بدقة 720p أو 1080p
تحويل صورة فوتوغرافية واحدة إلى حركةWan 2.7 I2V
عائلة الفيديو الخاصة بـ MiniMaxHailuo 2.3 لتحويل النص إلى فيديو بطابع سينمائي
تكرارات سريعة أثناء اختبار الأوامر النصيةLTX 2.5 Fast
مقاطع مجانية وغير محدودةSeedance 2.5 Lite أو PicassoIA Video

تنجح حلقة عملية: أنشئ الصور الثابتة للنهايات ومراجع الشخصيات في PicassoIA، ونفّذ بعض الاختبارات الرخيصة هناك لتحديد المشهد ولغة الكاميرا، ثم انقل الأمر النصي الفائز إلى مخطط H3 المحلي لديك من أجل النسخة النهائية بالصوت الأصلي. اختر صورة ثابتة واحدة من آخر اختبار لك في ComfyUI، وضعها في Wan 2.7 I2V، وقارن الحركة مع مقطع H3 لديك. أسرع طريقة لتكتشف ما تستطيع أوامرك النصية فعله هي أن تصنع شيئًا اليوم، لذا افتح PicassoIA وأنشئ صورك ومقاطع الفيديو الأولى.

شارك هذا المقال

اختر لغتك

مقالات ذات صلة