Workflow MiniMax H3 dans ComfyUI : prompts, LoRA et installation locale

MiniMax H3 produit jusqu'à 15 secondes de vidéo à 24 fps avec un son stéréo natif, et il fonctionne en local dans ComfyUI. Découvrez les fichiers du modèle et l'espace disque nécessaires, les niveaux de VRAM selon le GPU, comment rédiger des plans chronométrés et des dialogues, le fonctionnement de Turbo et des LoRA de personnage, et comment enchaîner des clips plus longs.

Workflow MiniMax H3 dans ComfyUI : prompts, LoRA et installation locale
Cristian Da Conceicao
Fondateur de Picasso IA

La plupart des modèles vidéo sont derrière un compte et un compteur de crédits. MiniMax H3 n’a pas besoin de l’être. Ses poids ouverts fonctionnent dans ComfyUI sur votre propre carte graphique, et une seule passe renvoie jusqu’à 15 secondes de vidéo à 24 fps avec une piste stéréo déjà mixée : dialogues, effets sonores et musique ensemble. Cela paraît prêt à l’emploi, et ça l’est en grande partie, à condition de choisir les bons fichiers de modèle, d’écrire les prompts comme H3 les attend et de savoir où une LoRA apporte vraiment quelque chose. Cet article suit le workflow MiniMax H3 dans ComfyUI dans l’ordre où vous rencontrerez chaque problème : matériel, fichiers, les trois modes de génération, prompts, vitesse, LoRA de personnage et clips plus longs.

Ce que fait réellement MiniMax H3

H3 est un modèle vidéo omni-modal. Au lieu de générer des images muettes et de demander à un second outil d’ajouter le son, il synthétise l’image, la voix, les effets et la musique dans la même passe. ComfyUI le prend en charge nativement depuis la version 0.30.0, donc les modèles de base n’ont besoin d’aucun nœud personnalisé.

Trois modes dans un seul modèle

  • Texte vers vidéo (T2V) : un prompt et rien d’autre. Décrivez la scène et le modèle renvoie un clip avec son.
  • Image vers vidéo (I2V) : une image fixe, plus une première et une dernière image facultatives. Le modèle génère le mouvement entre les deux images.
  • Référence vers vidéo (R2V) : un prompt plus jusqu’à 9 images de référence, 3 vidéos de référence et 3 clips audio. Vous décidez quelle référence gouverne l’identité, le style, le mouvement, la caméra ou la voix.

Les poids suivent la même logique. T2V et I2V utilisent les checkpoints FL2VA, tandis que R2V utilise les checkpoints Ref2VA. Prévoyez donc un téléchargement distinct si vous voulez les trois modes.

Les chiffres qui comptent

CaractéristiqueValeur
Durée du clipJusqu’à 15 secondes
Fréquence d’images24 fps
AudioStéréo natif 32 kHz
Langues de parole11 : arabe, chinois, anglais, français, allemand, italien, japonais, coréen, portugais, russe, espagnol
Résolution maximaleJusqu’à 2K
Préréglages du modèle960×544, 1152×640, 1216×672
Taille minimale utilisable384p (256p échoue)
Règle de tailleLargeur et hauteur en multiples de 32

💡 Lisez attentivement la ligne sur la résolution. « Jusqu’à 2K » est le plafond. Un article de la communauté décrit un canevas natif d’environ 768 px sur le petit côté : considérez donc les préréglages ci-dessus comme votre point de départ réaliste, et testez des tailles plus grandes sur votre propre carte.

Matériel et réalité du disque

Avant de télécharger quoi que ce soit, vérifiez ce que votre machine peut supporter. H3 est un grand modèle, et l’écart entre « ça tourne » et « ça tourne bien » est considérable.

Carte graphique à trois ventilateurs noirs installée dans un boîtier de PC ouvert

VRAM selon la classe de carte

Les chiffres ci-dessous proviennent d’un benchmark communautaire, et non d’une fiche technique officielle. Attendez-vous donc à des variations selon les pilotes, la résolution et la quantification.

Classe de carteÀ quoi s’attendre
6 Go (classe RTX 2060)Ça tourne, mais avec des détails flous, un son plus rugueux et environ 10 à 15 minutes par clip
12 à 16 Go (classe RTX 4060)Environ 6 minutes pour un clip de 5 secondes en 480p, plus propre que la classe 6 Go
24 Go (classe RTX 4090)Résolution plus élevée avec moins de compromis, et assez de marge pour l’entraînement de LoRA
32 Go et plus (RTX 5090, RTX 6000)Le niveau recommandé, avec des clips de 15 secondes plus longs en résolution plus élevée
Apple SiliconUne version 4 bits NF4 tourne à partir de 8 Go, avec une baisse de qualité visible sur les scènes chargées

Fichiers du modèle et espace disque

Chaque composant existe en trois précisions, et le choix est un compromis entre qualité et mémoire. Les fichiers de diffusion INT8 élagués et l’encodeur de texte nvfp4 sont ceux que recommandent les notes des modèles, car ils laissent le plus de place à la vidéo elle-même. Passez à INT8 ou BF16 uniquement si vous disposez de VRAM en surplus et si vous voyez une différence dans vos propres tests côte à côte.

FichierTailleRôle
FL2VA INT8 ConvRot élagué19,5 GoRecommandé pour T2V et I2V
FL2VA INT8 ConvRot31,7 GoOption INT8 plus volumineuse
FL2VA BF1661,7 GoPleine précision
Ref2VA INT8 ConvRot élagué19,5 GoRecommandé pour R2V
Qwen3-VL, encodeur nvfp4 AWQ14,6 GoEncodeur recommandé
Qwen3-VL INT8 ConvRot25,3 GoOption d’encodeur plus volumineuse
Qwen3-VL BF1648,0 GoEncodeur en pleine précision
Video VAE FP164,9 GoObligatoire
Audio VAE FP320,6 GoObligatoire

La configuration légère T2V et I2V (modèle de diffusion INT8 élagué, encodeur de texte nvfp4 et les deux VAE) totalise environ 39,6 Go. Ajoutez 19,5 Go de plus si vous voulez R2V. Gardez tout sur un disque NVMe, car charger 40 Go depuis un disque mécanique est pénible.

Disque NVMe fin posé sur un bureau en noyer à côté d’un carnet et d’une tasse de café

Installation locale dans ComfyUI

Mettre à jour et ouvrir le modèle

  1. Mettez ComfyUI à jour vers la version 0.30.0 ou ultérieure.
  2. Ouvrez Workflow, Browse Templates, Video et choisissez un modèle MiniMax H3.
  3. Placez les fichiers téléchargés dans models/diffusion_models/, models/text_encoders/ et models/vae/.
  4. Redémarrez ComfyUI pour que les chargeurs détectent les nouveaux fichiers.

Commencez par un test T2V court et en basse résolution. Un bon premier test est un clip en 384p avec une seule phrase de dialogue et un effet sonore évident, comme une porte qui se ferme. Si l’image apparaît mais que l’audio est silencieux, le coupable probable est le chemin de décodage audio, et non votre prompt. Si les deux fonctionnent, vous disposez d’une base sûre pour ne modifier qu’un réglage à la fois.

La sortie audio dépend du nœud VAEDecodeAudio, que les modèles incluent déjà. Le nœud image vers vidéo est MiniMaxH3ImageToVideo, et il expose les entrées first_frame et last_frame.

Réglages du sampler qui tiennent la route

La base de référence issue des notes de la communauté est le sampler res_multistep avec le scheduler simple à 20 étapes. La qualité baisse nettement en dessous d’environ 15 étapes. Si votre carte le prend en charge, lancez ComfyUI avec --use-sage-attention pour une génération jusqu’à environ 2x plus rapide. Pour les tests, descendez à 384p avec une durée courte, puis augmentez la résolution une fois le mouvement et le son au point.

Une alternative en un seul graphe

ComfyUI-MiniMaxH3-Easy est un nœud personnalisé de la communauté qui regroupe T2V, I2V, première et dernière image, et R2V dans un workflow compact. Installez-le en clonant le dépôt dans ComfyUI/custom_nodes ou en recherchant son nom dans ComfyUI Manager. La génération ne nécessite aucun identifiant d’API. Les comptes OpenAI, Gemini ou Ollama ne servent qu’à son optimiseur de prompt facultatif, tandis que les samplers, les LoRA et les correctifs d’attention restent des connexions ComfyUI classiques. Il prend aussi en charge un mode humain numérique piloté par une seule piste audio, pratique pour les clips où une personne parle face caméra.

Écrire pour H3 comme un réalisateur

Main épinglant une fiche cartonnée sur un panneau de liège couvert de fiches de plans

La scène d’abord, puis les plans

H3 répond mieux à un prompt qui énonce d’abord la scène globale (lieu, personnage, ce qui se passe), puis découpe le clip en plans chronométrés. Indiquez les mouvements de caméra et l’audio souhaité, pas seulement l’image.

Exemple de prompt : Un marché nocturne pluvieux à Osaka, un vendeur de rue en ciré jaune versant du bouillon dans un bol en papier. 0 à 4 s : lent travelling avant sur la vapeur qui monte de la marmite, la pluie tambourine sur une bâche. 4 à 9 s : plan moyen pendant que le vendeur tend le bol à un client et sourit. 9 à 15 s : suivi caméra à l’épaule pendant que le client s’enfonce dans la foule. Audio : pluie, huile qui grésille, brouhaha lointain, musique douce de shamisen.

Comparez avec un prompt sommaire comme « un homme cuisine des nouilles sous la pluie ». H3 renverra quand même quelque chose de regardable, mais la caméra, le rythme et la bande-son seront laissés au hasard. Détailler les temps donne au modèle une chronologie à suivre, et vous offre un élément concret à corriger quand un plan rate. Modifiez une seule étape par test pour savoir quelle modification a produit quel résultat.

Une courte liste de contrôle permet de garder des prompts cohérents :

  • Scène : où, quand et qui.
  • Plans : une ligne par étape, avec les secondes.
  • Caméra : travelling avant, suivi à l’épaule, orbite ou plan fixe.
  • Audio : dialogues, effets et musique, chacun nommé séparément.

Microphone à condensateur et casque d’écoute dans une cabine de voix off

Dialogues et son dans le prompt

Comme l’audio est généré en même temps que l’image, nommez-le. Indiquez qui parle et ce qu’il dit, puis listez les effets et la musique sur leur propre ligne pour qu’ils ne se mêlent pas à la description de l’image. Avec 11 langues prises en charge, vous pouvez écrire le dialogue dans la langue que le personnage doit parler. Dans le nœud Easy, taper # ouvre un bloc de dialogue qui est converti au moment de l’exécution en balises <d>...</d> attendues par H3.

Balises de référence pour R2V

En mode référence, désignez chaque entrée par sa balise, dans l’ordre exact où vous l’avez connectée : <Picture 1>, <Video 1>, <Audio 1>. Indiquez ensuite quelle référence gouverne quelle partie du plan :

Utilisez <Picture 1> pour le visage et la tenue du personnage, <Video 1> pour le mouvement de caméra, et <Audio 1> pour la voix.

Dans le nœud Easy, @Image1, @Video1 et @Audio1 sont convertis pour vous en ces balises.

Planche contact de portraits d’un même homme sous plusieurs angles

Contrôle de la première et de la dernière image

Deux images fixes orientent souvent un clip mieux qu’une centaine de mots de plus dans le prompt. En mode I2V, first_frame et last_frame sont tous deux facultatifs, et le modèle génère le mouvement entre eux.

Deux photographies imprimées de la même route au lever et au coucher du soleil

Créer et harmoniser les images de début et de fin

Créez les deux images avant d’ouvrir ComfyUI. PicassoIA Image ou Seedream 5 Pro peuvent produire l’image d’ouverture, et un modèle d’édition comme PicassoIA Image Editor Pro vous permet d’ajuster cette image pour obtenir celle de fin, afin que le sujet et la lumière restent proches.

Faites correspondre le rendu de l’objectif, la direction de la lumière et l’échelle du sujet. Si la première image est un lever de soleil et la dernière un coucher, H3 doit inventer une journée entière en 15 secondes. Il peut le faire, mais le résultat ressemble à un time-lapse. Choisissez des images de fin que l’action peut atteindre de façon réaliste dans la durée du clip.

LoRA : vitesse et identité

Les idées reçues sur les LoRA autour de H3 s’embrouillent vite. Il y a en réalité deux choses distinctes : une LoRA de vitesse qui modifie le nombre d’étapes nécessaires, et une LoRA d’identité que vous entraînez sur vos propres images.

Chronomètre en laiton sur un bureau en noyer à côté d’un écran

La LoRA Turbo pour la vitesse

La MiniMax-H3-Turbo-LoRA de la communauté (Apache 2.0, environ 744 Mo en bf16) réduit les étapes d’échantillonnage d’environ 20 à seulement 4.

RéglageValeur
Étapes4 à 8, 6 à 8 de préférence
Force de la LoRA1,0
Schedulersimple
AccélérationEnviron 5x sur l’échantillonnage
Fichier recommandéminimax_h3_turbo_v4_step600_ema.safetensors

L’effet pratique porte sur votre boucle d’itération. Supposons qu’un clip de test en 480p prenne environ 6 minutes à 20 étapes sur une carte de 12 à 16 Go. Une accélération de 5x sur l’échantillonnage ramènerait chaque test autour d’une minute et demie. C’est un calcul approximatif et non une mesure, et le décodage prend toujours du temps, mais cela explique pourquoi les gens utilisent Turbo pour les brouillons et la configuration complète à 20 étapes pour le rendu final.

Installez le nœud personnalisé ComfyUI-MiniMax-H3-Turbo, déposez le fichier .safetensors dans votre dossier LoRA, puis insérez le nœud LoRA Turbo entre le chargeur de modèle et le sampler d’un workflow existant.

💡 Limite connue : à 4 étapes avec un mouvement intense, la v4 peut présenter du flou de traînée et des fantômes, et le comportement audio pendant les actions intenses est encore en cours d’amélioration. Utilisez 4 étapes pour les plans statiques ou à faible mouvement, et 6 à 8 pour l’action.

Entraîner une LoRA de personnage

Un créateur a entraîné une LoRA de personnage sur une RTX 4070 de 12 Go avec ai-toolkit, en utilisant un modèle quantifié et le déchargement sur CPU. Voici les chiffres qu’il a rapportés :

RéglageValeur
Jeu de données31 à 32 images en 512×512
Rang de la LoRA16
Étapes1000, taille de lot 1
VRAM pendant l’entraînementEnviron 11,7 sur 12 Go
RAM systèmeEnviron 32 à 37 Go
DuréeEnviron 6 à 7 heures
Configuration indispensablenum_frames: 1 et auto_frame_count: false

Deux détails déterminent si cela fonctionne. D’abord, si auto_frame_count reste activé, un jeu de données d’images fixes est traité comme une vidéo, et l’entraînement signale qu’aucune image n’a été trouvée. Ensuite, les plans mixtes en pied ont donné de mauvais résultats. Le créateur est passé à un jeu centré sur le visage, où celui-ci occupe l’essentiel du cadre, avec une légende simple composée d’un mot déclencheur et d’un court libellé du sujet. La LoRA finale se charge via le nœud LoraLoaderModelOnly.

Grille de trente-deux tirages de portraits scotchés sur un mur blanc

💡 Évitez la LoRA H3 quand une image suffit. Si vous avez seulement besoin d’un personnage constant comme première image ou image de référence, entraînez plutôt une LoRA côté image. P Image Trainer sur PicassoIA crée une LoRA pour le modèle p-image à partir d’un zip d’au moins 10 images, avec 1000 étapes par défaut.

Les LoRA vidéo sont une autre affaire. Le même créateur a noté que l’entraînement sur des clips vidéo est probablement hors de portée avec 12 Go, et les benchmarks de la communauté indiquent 20 Go ou plus pour un entraînement vidéo pratique. Pour la plupart des configurations, la répartition raisonnable est simple : une LoRA d’identité ou des images de référence pour le personnage, et la LoRA Turbo quand le temps de rendu est le facteur limitant.

Clips plus longs et corrections courantes

Enchaîner les clips avec un contexte de mouvement

Quinze secondes constituent le plafond d’une seule passe. Le ComfyUI MiniMax H3 Extender enchaîne plusieurs clips tout en préservant la continuité. Quand vous validez un clip, son latent est mis en cache sur le disque et devient le contexte de mouvement du suivant, de sorte que le nouveau plan reprend à partir des dernières images du clip précédent.

  • Prompts, seeds et durées par clip
  • Modes de seed : Randomize, Fixed, Increment, Decrement
  • Les mêmes limites de référence : 9 images, 3 vidéos, 3 pistes audio
  • Export en H.264, H.265/HEVC ou FFV1

Installez-le depuis ComfyUI Manager ou en le clonant dans ComfyUI/custom_nodes. Planifiez toute la séquence sur papier d’abord : une ligne par clip, avec les références de personnage communes listées une seule fois, afin que chaque segment hérite de la même identité au lieu de dériver d’un clip à l’autre.

Mains gantées de blanc alignant des bandes de film 35 mm sur une table lumineuse

Corriger les erreurs fréquentes

SymptômeCause probableCorrection
Un rendu en 256p échoue netTaille inférieure au minimumUtilisez 384p ou plus, en multiples de 32
La vidéo est rendue sans sonDécodage audio absentAjoutez VAEDecodeAudio et chargez le VAE audio
Détails flous et étirésTrop peu d’étapesUtilisez 20 étapes et évitez de descendre sous environ 15
Fantômes sur mouvement rapide avec TurboRéglage à 4 étapesPassez à 6 à 8 étapes
L’entraînement de LoRA ne trouve aucune imageauto_frame_count est activéMettez-le sur false et num_frames sur 1
Rendus lents sur une carte capableAttention par défautLancez avec --use-sage-attention

Essayer sur PicassoIA

MiniMax H3 ne figure pas au catalogue de PicassoIA à l’heure où nous écrivons, mais les mêmes tâches qu’il gère dans ComfyUI ont des équivalents proches que vous pouvez utiliser dans le navigateur, sans téléchargement de 40 Go ni budget de VRAM à gérer.

Si vous avez besoin deEssayez ce modèle
Des images ou clips de référence qui gardent un sujet cohérentWan 2.7 R2V, qui produit du 720p ou du 1080p
Une seule photo transformée en mouvementWan 2.7 I2V
La famille vidéo de MiniMaxHailuo 2.3 pour du texte vers vidéo cinématographique
Des itérations rapides pendant le test des promptsLTX 2.5 Fast
Des clips gratuits et illimitésSeedance 2.5 Lite ou PicassoIA Video

Une boucle pratique fonctionne bien : créez vos images de début et de fin ainsi que vos références de personnage dans PicassoIA, lancez-y quelques tests peu coûteux pour fixer la scène et le langage de caméra, puis reportez le prompt gagnant dans votre graphe H3 local pour le rendu final avec l’audio natif. Prenez une image de votre dernier test ComfyUI, déposez-la dans Wan 2.7 I2V, et comparez le mouvement avec votre clip H3. La façon la plus rapide de savoir ce que vos prompts peuvent faire est de créer quelque chose aujourd’hui : ouvrez donc PicassoIA et créez vos premières images et vidéos.

Partager cet article

Choisissez votre langue