La plupart des modèles vidéo sont derrière un compte et un compteur de crédits. MiniMax H3 n’a pas besoin de l’être. Ses poids ouverts fonctionnent dans ComfyUI sur votre propre carte graphique, et une seule passe renvoie jusqu’à 15 secondes de vidéo à 24 fps avec une piste stéréo déjà mixée : dialogues, effets sonores et musique ensemble. Cela paraît prêt à l’emploi, et ça l’est en grande partie, à condition de choisir les bons fichiers de modèle, d’écrire les prompts comme H3 les attend et de savoir où une LoRA apporte vraiment quelque chose. Cet article suit le workflow MiniMax H3 dans ComfyUI dans l’ordre où vous rencontrerez chaque problème : matériel, fichiers, les trois modes de génération, prompts, vitesse, LoRA de personnage et clips plus longs.
Ce que fait réellement MiniMax H3
H3 est un modèle vidéo omni-modal. Au lieu de générer des images muettes et de demander à un second outil d’ajouter le son, il synthétise l’image, la voix, les effets et la musique dans la même passe. ComfyUI le prend en charge nativement depuis la version 0.30.0, donc les modèles de base n’ont besoin d’aucun nœud personnalisé.
Trois modes dans un seul modèle
- Texte vers vidéo (T2V) : un prompt et rien d’autre. Décrivez la scène et le modèle renvoie un clip avec son.
- Image vers vidéo (I2V) : une image fixe, plus une première et une dernière image facultatives. Le modèle génère le mouvement entre les deux images.
- Référence vers vidéo (R2V) : un prompt plus jusqu’à 9 images de référence, 3 vidéos de référence et 3 clips audio. Vous décidez quelle référence gouverne l’identité, le style, le mouvement, la caméra ou la voix.
Les poids suivent la même logique. T2V et I2V utilisent les checkpoints FL2VA, tandis que R2V utilise les checkpoints Ref2VA. Prévoyez donc un téléchargement distinct si vous voulez les trois modes.
Les chiffres qui comptent
| Caractéristique | Valeur |
|---|
| Durée du clip | Jusqu’à 15 secondes |
| Fréquence d’images | 24 fps |
| Audio | Stéréo natif 32 kHz |
| Langues de parole | 11 : arabe, chinois, anglais, français, allemand, italien, japonais, coréen, portugais, russe, espagnol |
| Résolution maximale | Jusqu’à 2K |
| Préréglages du modèle | 960×544, 1152×640, 1216×672 |
| Taille minimale utilisable | 384p (256p échoue) |
| Règle de taille | Largeur et hauteur en multiples de 32 |
💡 Lisez attentivement la ligne sur la résolution. « Jusqu’à 2K » est le plafond. Un article de la communauté décrit un canevas natif d’environ 768 px sur le petit côté : considérez donc les préréglages ci-dessus comme votre point de départ réaliste, et testez des tailles plus grandes sur votre propre carte.
Matériel et réalité du disque
Avant de télécharger quoi que ce soit, vérifiez ce que votre machine peut supporter. H3 est un grand modèle, et l’écart entre « ça tourne » et « ça tourne bien » est considérable.

VRAM selon la classe de carte
Les chiffres ci-dessous proviennent d’un benchmark communautaire, et non d’une fiche technique officielle. Attendez-vous donc à des variations selon les pilotes, la résolution et la quantification.
| Classe de carte | À quoi s’attendre |
|---|
| 6 Go (classe RTX 2060) | Ça tourne, mais avec des détails flous, un son plus rugueux et environ 10 à 15 minutes par clip |
| 12 à 16 Go (classe RTX 4060) | Environ 6 minutes pour un clip de 5 secondes en 480p, plus propre que la classe 6 Go |
| 24 Go (classe RTX 4090) | Résolution plus élevée avec moins de compromis, et assez de marge pour l’entraînement de LoRA |
| 32 Go et plus (RTX 5090, RTX 6000) | Le niveau recommandé, avec des clips de 15 secondes plus longs en résolution plus élevée |
| Apple Silicon | Une version 4 bits NF4 tourne à partir de 8 Go, avec une baisse de qualité visible sur les scènes chargées |
Fichiers du modèle et espace disque
Chaque composant existe en trois précisions, et le choix est un compromis entre qualité et mémoire. Les fichiers de diffusion INT8 élagués et l’encodeur de texte nvfp4 sont ceux que recommandent les notes des modèles, car ils laissent le plus de place à la vidéo elle-même. Passez à INT8 ou BF16 uniquement si vous disposez de VRAM en surplus et si vous voyez une différence dans vos propres tests côte à côte.
| Fichier | Taille | Rôle |
|---|
| FL2VA INT8 ConvRot élagué | 19,5 Go | Recommandé pour T2V et I2V |
| FL2VA INT8 ConvRot | 31,7 Go | Option INT8 plus volumineuse |
| FL2VA BF16 | 61,7 Go | Pleine précision |
| Ref2VA INT8 ConvRot élagué | 19,5 Go | Recommandé pour R2V |
| Qwen3-VL, encodeur nvfp4 AWQ | 14,6 Go | Encodeur recommandé |
| Qwen3-VL INT8 ConvRot | 25,3 Go | Option d’encodeur plus volumineuse |
| Qwen3-VL BF16 | 48,0 Go | Encodeur en pleine précision |
| Video VAE FP16 | 4,9 Go | Obligatoire |
| Audio VAE FP32 | 0,6 Go | Obligatoire |
La configuration légère T2V et I2V (modèle de diffusion INT8 élagué, encodeur de texte nvfp4 et les deux VAE) totalise environ 39,6 Go. Ajoutez 19,5 Go de plus si vous voulez R2V. Gardez tout sur un disque NVMe, car charger 40 Go depuis un disque mécanique est pénible.

Installation locale dans ComfyUI
Mettre à jour et ouvrir le modèle
- Mettez ComfyUI à jour vers la version 0.30.0 ou ultérieure.
- Ouvrez Workflow, Browse Templates, Video et choisissez un modèle MiniMax H3.
- Placez les fichiers téléchargés dans
models/diffusion_models/, models/text_encoders/ et models/vae/.
- Redémarrez ComfyUI pour que les chargeurs détectent les nouveaux fichiers.
Commencez par un test T2V court et en basse résolution. Un bon premier test est un clip en 384p avec une seule phrase de dialogue et un effet sonore évident, comme une porte qui se ferme. Si l’image apparaît mais que l’audio est silencieux, le coupable probable est le chemin de décodage audio, et non votre prompt. Si les deux fonctionnent, vous disposez d’une base sûre pour ne modifier qu’un réglage à la fois.
La sortie audio dépend du nœud VAEDecodeAudio, que les modèles incluent déjà. Le nœud image vers vidéo est MiniMaxH3ImageToVideo, et il expose les entrées first_frame et last_frame.
Réglages du sampler qui tiennent la route
La base de référence issue des notes de la communauté est le sampler res_multistep avec le scheduler simple à 20 étapes. La qualité baisse nettement en dessous d’environ 15 étapes. Si votre carte le prend en charge, lancez ComfyUI avec --use-sage-attention pour une génération jusqu’à environ 2x plus rapide. Pour les tests, descendez à 384p avec une durée courte, puis augmentez la résolution une fois le mouvement et le son au point.
Une alternative en un seul graphe
ComfyUI-MiniMaxH3-Easy est un nœud personnalisé de la communauté qui regroupe T2V, I2V, première et dernière image, et R2V dans un workflow compact. Installez-le en clonant le dépôt dans ComfyUI/custom_nodes ou en recherchant son nom dans ComfyUI Manager. La génération ne nécessite aucun identifiant d’API. Les comptes OpenAI, Gemini ou Ollama ne servent qu’à son optimiseur de prompt facultatif, tandis que les samplers, les LoRA et les correctifs d’attention restent des connexions ComfyUI classiques. Il prend aussi en charge un mode humain numérique piloté par une seule piste audio, pratique pour les clips où une personne parle face caméra.
Écrire pour H3 comme un réalisateur

La scène d’abord, puis les plans
H3 répond mieux à un prompt qui énonce d’abord la scène globale (lieu, personnage, ce qui se passe), puis découpe le clip en plans chronométrés. Indiquez les mouvements de caméra et l’audio souhaité, pas seulement l’image.
Exemple de prompt : Un marché nocturne pluvieux à Osaka, un vendeur de rue en ciré jaune versant du bouillon dans un bol en papier. 0 à 4 s : lent travelling avant sur la vapeur qui monte de la marmite, la pluie tambourine sur une bâche. 4 à 9 s : plan moyen pendant que le vendeur tend le bol à un client et sourit. 9 à 15 s : suivi caméra à l’épaule pendant que le client s’enfonce dans la foule. Audio : pluie, huile qui grésille, brouhaha lointain, musique douce de shamisen.
Comparez avec un prompt sommaire comme « un homme cuisine des nouilles sous la pluie ». H3 renverra quand même quelque chose de regardable, mais la caméra, le rythme et la bande-son seront laissés au hasard. Détailler les temps donne au modèle une chronologie à suivre, et vous offre un élément concret à corriger quand un plan rate. Modifiez une seule étape par test pour savoir quelle modification a produit quel résultat.
Une courte liste de contrôle permet de garder des prompts cohérents :
- Scène : où, quand et qui.
- Plans : une ligne par étape, avec les secondes.
- Caméra : travelling avant, suivi à l’épaule, orbite ou plan fixe.
- Audio : dialogues, effets et musique, chacun nommé séparément.

Dialogues et son dans le prompt
Comme l’audio est généré en même temps que l’image, nommez-le. Indiquez qui parle et ce qu’il dit, puis listez les effets et la musique sur leur propre ligne pour qu’ils ne se mêlent pas à la description de l’image. Avec 11 langues prises en charge, vous pouvez écrire le dialogue dans la langue que le personnage doit parler. Dans le nœud Easy, taper # ouvre un bloc de dialogue qui est converti au moment de l’exécution en balises <d>...</d> attendues par H3.
Balises de référence pour R2V
En mode référence, désignez chaque entrée par sa balise, dans l’ordre exact où vous l’avez connectée : <Picture 1>, <Video 1>, <Audio 1>. Indiquez ensuite quelle référence gouverne quelle partie du plan :
Utilisez <Picture 1> pour le visage et la tenue du personnage, <Video 1> pour le mouvement de caméra, et <Audio 1> pour la voix.
Dans le nœud Easy, @Image1, @Video1 et @Audio1 sont convertis pour vous en ces balises.

Contrôle de la première et de la dernière image
Deux images fixes orientent souvent un clip mieux qu’une centaine de mots de plus dans le prompt. En mode I2V, first_frame et last_frame sont tous deux facultatifs, et le modèle génère le mouvement entre eux.

Créer et harmoniser les images de début et de fin
Créez les deux images avant d’ouvrir ComfyUI. PicassoIA Image ou Seedream 5 Pro peuvent produire l’image d’ouverture, et un modèle d’édition comme PicassoIA Image Editor Pro vous permet d’ajuster cette image pour obtenir celle de fin, afin que le sujet et la lumière restent proches.
Faites correspondre le rendu de l’objectif, la direction de la lumière et l’échelle du sujet. Si la première image est un lever de soleil et la dernière un coucher, H3 doit inventer une journée entière en 15 secondes. Il peut le faire, mais le résultat ressemble à un time-lapse. Choisissez des images de fin que l’action peut atteindre de façon réaliste dans la durée du clip.
LoRA : vitesse et identité
Les idées reçues sur les LoRA autour de H3 s’embrouillent vite. Il y a en réalité deux choses distinctes : une LoRA de vitesse qui modifie le nombre d’étapes nécessaires, et une LoRA d’identité que vous entraînez sur vos propres images.

La LoRA Turbo pour la vitesse
La MiniMax-H3-Turbo-LoRA de la communauté (Apache 2.0, environ 744 Mo en bf16) réduit les étapes d’échantillonnage d’environ 20 à seulement 4.
| Réglage | Valeur |
|---|
| Étapes | 4 à 8, 6 à 8 de préférence |
| Force de la LoRA | 1,0 |
| Scheduler | simple |
| Accélération | Environ 5x sur l’échantillonnage |
| Fichier recommandé | minimax_h3_turbo_v4_step600_ema.safetensors |
L’effet pratique porte sur votre boucle d’itération. Supposons qu’un clip de test en 480p prenne environ 6 minutes à 20 étapes sur une carte de 12 à 16 Go. Une accélération de 5x sur l’échantillonnage ramènerait chaque test autour d’une minute et demie. C’est un calcul approximatif et non une mesure, et le décodage prend toujours du temps, mais cela explique pourquoi les gens utilisent Turbo pour les brouillons et la configuration complète à 20 étapes pour le rendu final.
Installez le nœud personnalisé ComfyUI-MiniMax-H3-Turbo, déposez le fichier .safetensors dans votre dossier LoRA, puis insérez le nœud LoRA Turbo entre le chargeur de modèle et le sampler d’un workflow existant.
💡 Limite connue : à 4 étapes avec un mouvement intense, la v4 peut présenter du flou de traînée et des fantômes, et le comportement audio pendant les actions intenses est encore en cours d’amélioration. Utilisez 4 étapes pour les plans statiques ou à faible mouvement, et 6 à 8 pour l’action.
Entraîner une LoRA de personnage
Un créateur a entraîné une LoRA de personnage sur une RTX 4070 de 12 Go avec ai-toolkit, en utilisant un modèle quantifié et le déchargement sur CPU. Voici les chiffres qu’il a rapportés :
| Réglage | Valeur |
|---|
| Jeu de données | 31 à 32 images en 512×512 |
| Rang de la LoRA | 16 |
| Étapes | 1000, taille de lot 1 |
| VRAM pendant l’entraînement | Environ 11,7 sur 12 Go |
| RAM système | Environ 32 à 37 Go |
| Durée | Environ 6 à 7 heures |
| Configuration indispensable | num_frames: 1 et auto_frame_count: false |
Deux détails déterminent si cela fonctionne. D’abord, si auto_frame_count reste activé, un jeu de données d’images fixes est traité comme une vidéo, et l’entraînement signale qu’aucune image n’a été trouvée. Ensuite, les plans mixtes en pied ont donné de mauvais résultats. Le créateur est passé à un jeu centré sur le visage, où celui-ci occupe l’essentiel du cadre, avec une légende simple composée d’un mot déclencheur et d’un court libellé du sujet. La LoRA finale se charge via le nœud LoraLoaderModelOnly.

💡 Évitez la LoRA H3 quand une image suffit. Si vous avez seulement besoin d’un personnage constant comme première image ou image de référence, entraînez plutôt une LoRA côté image. P Image Trainer sur PicassoIA crée une LoRA pour le modèle p-image à partir d’un zip d’au moins 10 images, avec 1000 étapes par défaut.
Les LoRA vidéo sont une autre affaire. Le même créateur a noté que l’entraînement sur des clips vidéo est probablement hors de portée avec 12 Go, et les benchmarks de la communauté indiquent 20 Go ou plus pour un entraînement vidéo pratique. Pour la plupart des configurations, la répartition raisonnable est simple : une LoRA d’identité ou des images de référence pour le personnage, et la LoRA Turbo quand le temps de rendu est le facteur limitant.
Clips plus longs et corrections courantes
Enchaîner les clips avec un contexte de mouvement
Quinze secondes constituent le plafond d’une seule passe. Le ComfyUI MiniMax H3 Extender enchaîne plusieurs clips tout en préservant la continuité. Quand vous validez un clip, son latent est mis en cache sur le disque et devient le contexte de mouvement du suivant, de sorte que le nouveau plan reprend à partir des dernières images du clip précédent.
- Prompts, seeds et durées par clip
- Modes de seed : Randomize, Fixed, Increment, Decrement
- Les mêmes limites de référence : 9 images, 3 vidéos, 3 pistes audio
- Export en H.264, H.265/HEVC ou FFV1
Installez-le depuis ComfyUI Manager ou en le clonant dans ComfyUI/custom_nodes. Planifiez toute la séquence sur papier d’abord : une ligne par clip, avec les références de personnage communes listées une seule fois, afin que chaque segment hérite de la même identité au lieu de dériver d’un clip à l’autre.

Corriger les erreurs fréquentes
| Symptôme | Cause probable | Correction |
|---|
| Un rendu en 256p échoue net | Taille inférieure au minimum | Utilisez 384p ou plus, en multiples de 32 |
| La vidéo est rendue sans son | Décodage audio absent | Ajoutez VAEDecodeAudio et chargez le VAE audio |
| Détails flous et étirés | Trop peu d’étapes | Utilisez 20 étapes et évitez de descendre sous environ 15 |
| Fantômes sur mouvement rapide avec Turbo | Réglage à 4 étapes | Passez à 6 à 8 étapes |
| L’entraînement de LoRA ne trouve aucune image | auto_frame_count est activé | Mettez-le sur false et num_frames sur 1 |
| Rendus lents sur une carte capable | Attention par défaut | Lancez avec --use-sage-attention |
Essayer sur PicassoIA
MiniMax H3 ne figure pas au catalogue de PicassoIA à l’heure où nous écrivons, mais les mêmes tâches qu’il gère dans ComfyUI ont des équivalents proches que vous pouvez utiliser dans le navigateur, sans téléchargement de 40 Go ni budget de VRAM à gérer.
| Si vous avez besoin de | Essayez ce modèle |
|---|
| Des images ou clips de référence qui gardent un sujet cohérent | Wan 2.7 R2V, qui produit du 720p ou du 1080p |
| Une seule photo transformée en mouvement | Wan 2.7 I2V |
| La famille vidéo de MiniMax | Hailuo 2.3 pour du texte vers vidéo cinématographique |
| Des itérations rapides pendant le test des prompts | LTX 2.5 Fast |
| Des clips gratuits et illimités | Seedance 2.5 Lite ou PicassoIA Video |
Une boucle pratique fonctionne bien : créez vos images de début et de fin ainsi que vos références de personnage dans PicassoIA, lancez-y quelques tests peu coûteux pour fixer la scène et le langage de caméra, puis reportez le prompt gagnant dans votre graphe H3 local pour le rendu final avec l’audio natif. Prenez une image de votre dernier test ComfyUI, déposez-la dans Wan 2.7 I2V, et comparez le mouvement avec votre clip H3. La façon la plus rapide de savoir ce que vos prompts peuvent faire est de créer quelque chose aujourd’hui : ouvrez donc PicassoIA et créez vos premières images et vidéos.