معظم نماذج الفيديو تقع خلف تسجيل دخول ومقياس للنقاط. أما MiniMax H3 فلا يلزمه ذلك. تعمل أوزانه المفتوحة داخل ComfyUI على بطاقة الرسومات الخاصة بك، ويُعيد التمرير الواحد فيديو يصل إلى 15 ثانية بمعدل 24 إطارًا في الثانية، مع مسار صوتي ستيريو مدمج فيه بالفعل: حوار ومؤثرات صوتية وموسيقى معًا. يبدو الأمر جاهزًا للتشغيل فورًا، وهو كذلك إلى حد كبير، بشرط أن تختار ملفات النموذج الصحيحة، وتكتب الأوامر النصية بالطريقة التي يتوقعها H3، وتعرف أين تفيد LoRA فعلًا. يتتبع هذا المقال سير عمل MiniMax H3 في ComfyUI بالترتيب الذي ستصادف فيه كل مشكلة: العتاد، ثم الملفات، ثم أنماط التوليد الثلاثة، ثم كتابة الأوامر النصية، والسرعة، وLoRA للشخصيات، والمقاطع الأطول.
ما الذي يفعله MiniMax H3 فعلًا
H3 نموذج فيديو متعدد الوسائط (omni-modal). فبدلًا من عرض إطارات صامتة ثم الاستعانة بأداة ثانية لإضافة الصوت، يولّد الصورة والصوت والمؤثرات والموسيقى في التمريرة نفسها. أضافت ComfyUI الدعم الأصلي له في الإصدار 0.30.0، لذا لا تحتاج القوالب الأساسية إلى أي عقدة مخصصة.
ثلاثة أنماط في نموذج واحد
- تحويل النص إلى فيديو (T2V): أمر نصي وحده. صِف المشهد، وسيُعيد النموذج مقطعًا مع الصوت.
- تحويل الصورة إلى فيديو (I2V): صورة ثابتة واحدة، مع مدخلات اختيارية للإطار الأول والإطار الأخير. يملأ النموذج الحركة بين الإطارين.
- تحويل المرجع إلى فيديو (R2V): أمر نصي مع ما يصل إلى 9 صور مرجعية و3 فيديوهات مرجعية و3 مقاطع صوتية. أنت تحدد أي مرجع يتحكم في الهوية أو الأسلوب أو الحركة أو الكاميرا أو الصوت.
تنقسم الأوزان على الخط نفسه. يستخدم T2V وI2V نقاط حفظ FL2VA، بينما يستخدم R2V نقاط حفظ Ref2VA، لذا خطّط لتنزيل منفصل إذا أردت الأنماط الثلاثة كلها.
الأرقام المهمة
| المواصفة | القيمة |
|---|
| مدة المقطع | حتى 15 ثانية |
| معدل الإطارات | 24 إطارًا في الثانية |
| الصوت | ستيريو أصلي بتردد 32 كيلوهرتز |
| لغات الكلام | 11 لغة: العربية، والصينية، والإنجليزية، والفرنسية، والألمانية، والإيطالية، واليابانية، والكورية، والبرتغالية، والروسية، والإسبانية |
| الدقة الرئيسية | حتى 2K |
| إعدادات القوالب المسبقة | 960×544، 1152×640، 1216×672 |
| أصغر حجم قابل للعمل | 384p (يفشل 256p) |
| قاعدة الحجم | العرض والارتفاع من مضاعفات 32 |
💡 اقرأ سطر الدقة بعناية. "حتى 2K" هو السقف الأقصى. يصف أحد الشروح المجتمعية حجمًا أصليًا بنحو 768 بكسل على الضلع القصير، لذا اعتبر الإعدادات المسبقة أعلاه نقطة بداية واقعية، واختبر أحجامًا أكبر على بطاقتك.
العتاد والمساحة التخزينية كما هي فعلًا
قبل أن تنزّل أي شيء، تحقق مما يستطيع جهازك حمله. H3 نموذج كبير، والفرق بين "يعمل" و"يعمل جيدًا" واسع.

VRAM حسب فئة البطاقة
الأرقام أدناه مستمدة من اختبار أداء مجتمعي واحد، وليست مواصفة رسمية، لذا توقع تفاوتًا بحسب تعريفات التشغيل والدقة والتكميم.
| فئة البطاقة | ما يمكن توقعه |
|---|
| 6 GB (من فئة RTX 2060) | يعمل، لكن بتفاصيل مموّهة وصوت أخشن، وبمعدل 10 إلى 15 دقيقة تقريبًا لكل مقطع |
| 12 إلى 16 GB (من فئة RTX 4060) | نحو 6 دقائق لمقطع 480p مدته 5 ثوانٍ، وأنظف من فئة 6 GB |
| 24 GB (من فئة RTX 4090) | دقة أعلى مع تنازلات أقل، ومساحة كافية لتدريب LoRA |
| 32 GB فأكثر (RTX 5090، RTX 6000) | الفئة الموصى بها، مع مقاطع أطول مدتها 15 ثانية بدقة أعلى |
| Apple Silicon | تعمل نسخة 4-bit NF4 بذاكرة 8 GB فقط، مع تراجع ملحوظ في الجودة في المشاهد المزدحمة |
ملفات النموذج والمساحة التخزينية
يأتي كل مكوّن بثلاثة مستويات دقة، والاختيار موازنة بين الجودة والذاكرة. ملفات الانتشار INT8 المقلّمة ومشفّر النص nvfp4 هما ما توصي به ملاحظات القالب، لأنهما يتركان أكبر قدر من المساحة للفيديو نفسه. انتقل إلى INT8 أو BF16 فقط إذا كان لديك VRAM فائضة ويمكنك رؤية فرق في اختباراتك المقارنة الخاصة.
| الملف | الحجم | الدور |
|---|
| FL2VA pruned INT8 ConvRot | 19.5 GB | موصى به لتحويل النص إلى فيديو وتحويل الصورة إلى فيديو |
| FL2VA INT8 ConvRot | 31.7 GB | خيار INT8 أكبر |
| FL2VA BF16 | 61.7 GB | دقة كاملة |
| Ref2VA pruned INT8 ConvRot | 19.5 GB | موصى به لنوع R2V |
| مشفّر النص Qwen3-VL، nvfp4 AWQ | 14.6 GB | المشفّر الموصى به |
| Qwen3-VL INT8 ConvRot | 25.3 GB | خيار مشفّر أكبر |
| Qwen3-VL BF16 | 48.0 GB | مشفّر بدقة كاملة |
| VAE الفيديو FP16 | 4.9 GB | مطلوب |
| VAE الصوت FP32 | 0.6 GB | مطلوب |
يصل الإعداد الخفيف لـ T2V وI2V (نموذج الانتشار INT8 المقلّم، ومشفّر النص nvfp4، والـ VAE للفيديو والصوت) إلى نحو 39.6 GB. أضف 19.5 GB أخرى إذا أردت R2V. احتفظ بكل شيء على قرص NVMe، لأن تحميل 40 GB من قرص دوّار أمر مرهق.

الإعداد المحلي في ComfyUI
التحديث وفتح القالب
- حدّث ComfyUI إلى الإصدار 0.30.0 أو أحدث.
- افتح Workflow، Browse Templates، Video واختر أحد قوالب MiniMax H3.
- ضع الملفات التي نزّلتها في
models/diffusion_models/ وmodels/text_encoders/ وmodels/vae/.
- أعد تشغيل ComfyUI حتى ترى أدوات التحميل الملفات الجديدة.
شغّل أولًا اختبار T2V قصيرًا منخفض الدقة. اختبار أول جيد هو مقطع 384p بجملة حوار واحدة ومؤثر صوتي واضح واحد، مثل إغلاق باب. إذا ظهرت الصورة لكن الصوت صامت، فالمشتبه به على الأرجح مسار فك ترميز الصوت وليس الأمر النصي. وإذا عمل الاثنان، فلديك خط أساس آمن تغيّر فيه إعدادًا واحدًا في كل مرة.
يعتمد إخراج الصوت على عقدة VAEDecodeAudio، والتي تتضمنها القوالب مسبقًا. عقدة تحويل الصورة إلى فيديو هي MiniMaxH3ImageToVideo، وتعرض مدخلي first_frame وlast_frame.
إعدادات أداة العينات التي تصمد
يعتمد الأساس الذي تقترحه الملاحظات المجتمعية على أداة العينات res_multistep مع مجدول الخطوات simple عند 20 خطوة. تنخفض الجودة بشكل ملحوظ دون نحو 15 خطوة. إذا كانت بطاقتك تدعم ذلك، شغّل ComfyUI باستخدام --use-sage-attention لتوليد أسرع بما يصل إلى نحو 2x. في الاختبارات السريعة، انزل إلى 384p ومدة قصيرة، ثم ارفع الحجم بعد أن تصبح الحركة والصوت صحيحين.
بديل بمخطط واحد
ComfyUI-MiniMaxH3-Easy عقدة مخصصة من المجتمع تجمع T2V وI2V والإطار الأول والأخير وR2V في سير عمل مدمج واحد. ثبّتها بنسخ المستودع داخل ComfyUI/custom_nodes، أو بالبحث عن اسمها في ComfyUI Manager. لا يحتاج التوليد إلى بيانات اعتماد API. تُستخدم حسابات OpenAI أو Gemini أو Ollama فقط في محسّن الأوامر الاختياري فيها، أما أدوات العينات وLoRA وتصحيحات الانتباه فتبقى اتصالات ComfyUI العادية. وتدعم أيضًا وضع الإنسان الرقمي المدفوع بمسار صوتي واحد، وهو مفيد لمقاطع الرأس المتحدث.
كتابة الأوامر النصية لـ H3 كمخرج

المشهد أولًا ثم اللقطات
يستجيب H3 أفضل ما يستجيب لأمر نصي يذكر المشهد العام أولًا (المكان والشخصية وما يجري)، ثم يقسّم المقطع إلى لقطات موقوتة. أدرج حركات الكاميرا والصوت الذي تريده، لا الصورة وحدها.
مثال على أمر نصي: ليلة ممطرة في سوق أوساكا، بائع شارع يرتدي معطفًا أصفر للمطر يصبّ المرق في وعاء ورقي. من 0 إلى 4 ثوانٍ: اقتراب بطيء من البخار المتصاعد من القدر، والمطر يقرع على القماش المشمّع. من 4 إلى 9 ثوانٍ: لقطة متوسطة وهو يناول الوعاء لزبون ويبتسم. من 9 إلى 15 ثانية: متابعة بكاميرا يدوية بينما يمشي الزبون إلى الحشد. الصوت: مطر، وزيت يفحّ، وأحاديث بعيدة، وموسيقى شاميسن هادئة.
قارن ذلك بأمر نصي نحيل مثل "رجل يطبخ النودلز تحت المطر". سيُعيد H3 شيئًا يمكن مشاهدته، لكن الكاميرا والإيقاع والموسيقى التصويرية ستكون كلها تخمينات. ذكر النقاط الزمنية بالتفصيل يمنح النموذج خطًا زمنيًا يتبعه، ويمنحك شيئًا ملموسًا تعدّله عندما تخطئ لقطة. غيّر نقطة زمنية واحدة في كل اختبار حتى تعرف أي تعديل أدى إلى أي نتيجة.
قائمة تحقق قصيرة تحافظ على اتساق الأوامر النصية:
- المشهد: أين ومتى ومن.
- اللقطات: سطر واحد لكل نقطة زمنية، مع الثواني.
- الكاميرا: اقتراب، أو متابعة بكاميرا يدوية، أو دوران حول الشخص، أو تثبيت الكاميرا.
- الصوت: الحوار والمؤثرات والموسيقى، يُذكر كل عنصر على حدة.

الحوار والصوت داخل الأمر النصي
بما أن الصوت يُولَّد إلى جانب الصورة، فسمِّه صراحةً. حدّد من يتكلم وماذا يقول، ثم اذكر المؤثرات والموسيقى في سطر مستقل حتى لا تختلط بوصف الصورة. ومع 11 لغة مدعومة، يمكنك كتابة الحوار باللغة التي يجب أن تتحدث بها الشخصية. في العقدة Easy، كتابة # تفتح كتلة حوار تُحوَّل وقت التشغيل إلى وسوم <d>...</d> التي يتوقعها H3.
وسوم المرجع لـ R2V
في وضع المرجع، أشِر إلى كل مدخل بوسمه، بالترتيب نفسه الذي وصلته به: <Picture 1>، <Video 1>، <Audio 1>. ثم حدّد أي مرجع يتحكم في أي جزء من اللقطة:
استخدم <Picture 1> لوجه الشخصية وملابسها، و<Video 1> لحركة الكاميرا، و<Audio 1> للصوت.
في العقدة Easy، تُحوَّل @Image1 و@Video1 و@Audio1 إلى تلك الوسوم نيابةً عنك.

التحكم بالإطار الأول والأخير
غالبًا ما تُوجّه صورتان ثابتتان المقطع بشكل أفضل من مئة كلمة إضافية في الأمر النصي. في وضع I2V، كل من first_frame وlast_frame اختياري، ويولّد النموذج الحركة بينهما.

بناء الصور الثابتة للنهايات ومطابقتها
أنشئ الإطارين قبل أن تفتح ComfyUI. يمكن أن ينتج PicassoIA Image أو Seedream 5 Pro الصورة الثابتة الأولى، ويتيح لك نموذج تحرير مثل PicassoIA Image Editor Pro تعديل تلك الصورة إلى الصورة الختامية، فيبقى الشخص والإضاءة متقاربين.
طابق إحساس العدسة واتجاه الضوء وحجم الشخص. إذا كان الإطار الأول شروق شمس والأخير غروبًا، فعلى H3 أن يخترع يومًا كاملًا داخل 15 ثانية. يستطيع ذلك، لكن النتيجة تبدو كفيلم تسريع زمني. اختر نقاط نهاية تستطيع الحركة الوصول إليها بواقعية ضمن مدة المقطع.
LoRA: السرعة والهوية
تختلط الادعاءات حول LoRA مع H3 بسرعة. هناك في الحقيقة شيئان منفصلان: LoRA للسرعة يغيّر عدد الخطوات التي تحتاجها، وLoRA للهوية تدرّبه على صورك.

LoRA Turbo للسرعة
يخفّض MiniMax-H3-Turbo-LoRA المجتمعي (Apache 2.0، بحجم نحو 744 MB بدقة bf16) خطوات العينات من نحو 20 إلى 4 خطوات فقط.
| الإعداد | القيمة |
|---|
| الخطوات | من 4 إلى 8، مع تفضيل 6 إلى 8 |
| قوة LoRA | 1.0 |
| المجدول | simple |
| التسريع | نحو 5 أضعاف في العينات |
| الملف الموصى به | minimax_h3_turbo_v4_step600_ema.safetensors |
الأثر العملي يظهر في دورة التكرار لديك. لنفترض أن مقطع اختبار 480p يستغرق نحو 6 دقائق عند 20 خطوة على بطاقة بسعة 12 إلى 16 GB. تسريع العينات بمقدار 5 أضعاف سيجعل كل اختبار يقارب دقيقة ونصف. هذا حساب تقديري وليس قياسًا، وفك الترميز ما زال يستغرق وقتًا، لكنه يفسّر لماذا يشغّل الناس Turbo للمسودات والإعداد الكامل المكوّن من 20 خطوة للنسخة النهائية.
ثبّت عقدة ComfyUI-MiniMax-H3-Turbo المخصصة، وضع ملف .safetensors في مجلد LoRA لديك، وأدرج عقدة Turbo LoRA بين أداة تحميل النموذج وأداة العينات في سير عمل موجود.
💡 حدّ معروف: عند 4 خطوات مع حركة قوية، قد يُظهر v4 تلطيخًا وأشباحًا، وما زال سلوك الصوت أثناء الحركة المكثفة قيد التحسين. استخدم 4 خطوات للّقطات الثابتة أو قليلة الحركة، و6 إلى 8 للحركة.
تدريب LoRA للشخصية
درّب أحد صنّاع المحتوى LoRA لشخصية على بطاقة RTX 4070 بسعة 12 GB باستخدام ai-toolkit، مع نموذج مكمَّم وتفريغ إلى المعالج. هذه الأرقام التي أبلغ عنها:
| الإعداد | القيمة |
|---|
| مجموعة البيانات | من 31 إلى 32 صورة بحجم 512×512 |
| رتبة LoRA | 16 |
| الخطوات | 1000، حجم الدفعة 1 |
| VRAM أثناء التدريب | نحو 11.7 من 12 GB |
| ذاكرة النظام | نحو 32 إلى 37 GB |
| الوقت | نحو 6 إلى 7 ساعات |
| الإعداد الإلزامي | num_frames: 1 وauto_frame_count: false |
تقرر تفصيلتان ما إذا كان هذا سينجح. أولًا، إذا بقي auto_frame_count مفعّلًا، تُعامَل مجموعة الصور الثابتة كفيديو، ويُبلغ التدريب بأنه لم يجد أي صور. ثانيًا، أعطت اللقطات المختلطة للجسم كاملًا نتائج ضعيفة. فانتقل صانع المحتوى إلى مجموعة تركّز على الوجه، حيث يملأ الوجه معظم الإطار، مع تسمية بسيطة مكوّنة من كلمة مفتاحية وعنوان قصير للشخص. يُحمَّل LoRA النهائي عبر عقدة LoraLoaderModelOnly.

💡 تخطَّ LoRA الخاص بنموذج H3 عندما تكفي صورة ثابتة. إذا كنت تحتاج فقط إلى شخصية متسقة كإطار أول أو صورة مرجعية، فدرّب LoRA على جانب الصور بدلًا من ذلك. يبني P Image Trainer على PicassoIA ملف LoRA لنموذج p-image من ملف zip يضم 10 صور على الأقل، مع 1000 خطوة كقيمة افتراضية.
أما LoRA للفيديو فقصة مختلفة. لاحظ الصانع نفسه أن تدريب مقاطع الفيديو قد يتجاوز الإمكانات عند 12 GB، وتشير الاختبارات المجتمعية إلى 20 GB أو أكثر للتدريب العملي على الفيديو. لأغلب الإعدادات، التقسيم المعقول بسيط: LoRA للهوية أو صور مرجعية للشخصية، وLoRA Turbo عندما يكون زمن التوليد هو عنق الزجاجة.
المقاطع الأطول والإصلاحات الشائعة
ربط المقاطع بسياق الحركة
تمثل 15 ثانية السقف لتمريرة واحدة. تربط ComfyUI MiniMax H3 Extender عدة مقاطع مع الحفاظ على الاستمرارية. عندما توافق على مقطع، يُخزَّن مُمثّله الكامن (latent) على القرص ويصبح سياق الحركة للمقطع التالي، فتستمر اللقطة الجديدة من الإطارات الأخيرة للمقطع السابق.
- أوامر نصية وبذور ومدد لكل مقطع
- أوضاع البذرة: Randomize وFixed وIncrement وDecrement
- حدود المراجع نفسها: 9 صور و3 فيديوهات و3 مسارات صوتية
- التصدير بصيغة H.264 أو H.265/HEVC أو FFV1
ثبّتها من ComfyUI Manager أو بنسخها داخل ComfyUI/custom_nodes. خطّط للتسلسل كله على الورق أولًا: سطر واحد لكل مقطع، مع سرد المراجع المشتركة للشخصية مرة واحدة، حتى يرث كل جزء الهوية نفسها بدلًا من أن تنحرف من مقطع إلى آخر.

إصلاح الأخطاء المتكررة
| العَرَض | السبب المرجّح | الحل |
|---|
| يفشل تشغيل 256p فورًا | أقل من الحجم الأدنى | استخدم 384p أو أعلى، بمضاعفات 32 |
| يُولَّد الفيديو بلا صوت | فك ترميز الصوت مفقود | أضف VAEDecodeAudio وحمّل الـ VAE الخاص بالصوت |
| تفاصيل ناعمة ومتلطخة | خطوات قليلة جدًا | استخدم 20 خطوة وتجنّب النزول تحت 15 تقريبًا |
| أشباح في الحركة السريعة مع Turbo | إعداد 4 خطوات | ارفع إلى 6 إلى 8 خطوات |
| تدريب LoRA لا يجد صورًا | auto_frame_count مفعّل | اجعله false واضبط num_frames على 1 |
| تشغيل بطيء على بطاقة قادرة | انتباه افتراضي | شغّل مع --use-sage-attention |
جرّبه على PicassoIA
لا يوجد MiniMax H3 في كتالوج PicassoIA حتى وقت كتابة هذا المقال، لكن المهام نفسها التي يتعامل معها في ComfyUI لها بدائل قريبة تستطيع تشغيلها في المتصفح، دون تنزيل 40 GB ودون إدارة ميزانية VRAM.
تنجح حلقة عملية: أنشئ الصور الثابتة للنهايات ومراجع الشخصيات في PicassoIA، ونفّذ بعض الاختبارات الرخيصة هناك لتحديد المشهد ولغة الكاميرا، ثم انقل الأمر النصي الفائز إلى مخطط H3 المحلي لديك من أجل النسخة النهائية بالصوت الأصلي. اختر صورة ثابتة واحدة من آخر اختبار لك في ComfyUI، وضعها في Wan 2.7 I2V، وقارن الحركة مع مقطع H3 لديك. أسرع طريقة لتكتشف ما تستطيع أوامرك النصية فعله هي أن تصنع شيئًا اليوم، لذا افتح PicassoIA وأنشئ صورك ومقاطع الفيديو الأولى.