LTX 2.5 ou MiniMax H3 : quel est le meilleur modèle vidéo ouvert ?

Deux modèles vidéo à poids ouverts sont sortis en août 2026 : Lightricks LTX 2.5 et MiniMax H3. Ce comparatif en face à face passe en revue les caractéristiques, la sortie en 4K ou en 2K, la durée des clips, le son, les prix de l’API, la configuration matérielle requise en local et les restrictions de licence, pour vous aider à choisir celui qui convient à vos projets.

LTX 2.5 ou MiniMax H3 : quel est le meilleur modèle vidéo ouvert ?
Cristian Da Conceicao
Fondateur de Picasso IA

Deux modèles vidéo dont les poids peuvent être téléchargés sont arrivés à moins de dix jours d’intervalle cet été, et les créateurs en débattent depuis. MiniMax a annoncé H3 le 31 juillet 2026 sous forme de produit API, puis a publié les poids le 3 août. Lightricks a suivi le 11 août avec LTX 2.5. Les deux génèrent l’image et le son en une seule passe. Les deux promettent un rendu cinématographique. Les petits caractères de la licence rendent cependant le choix bien moins évident que ne le suggèrent les fiches techniques.

Ce comparatif s’en tient à ce qui compte quand vous avez une échéance : résolution, durée des clips, son, vitesse, prix, matériel local et qui est réellement autorisé à utiliser les poids. Je n’ai pas réalisé de benchmark en laboratoire ; tous les chiffres ci-dessous proviennent donc des spécifications publiées et des communiqués de lancement, et je signale les chiffres qui relèvent des affirmations des éditeurs.

💡 Verdict express : LTX 2.5 est le choix ouvert le plus sûr pour la plupart des utilisateurs. MiniMax H3 offre une sortie en 2K et des entrées de référence plus riches via son API, mais les poids que vous pouvez réellement télécharger sont plus limités que ne le laisse entendre l’annonce.

Monteur vidéo comparant deux clips en pause sur un bureau à double écran dans un studio loft lumineux

La réponse courte

Le gagnant en une phrase

Si vous voulez faire tourner un modèle vidéo sur votre propre machine, l’intégrer à un flux de travail ou le fine-tuner, LTX 2.5 l’emporte pour la plupart des lecteurs. Ses poids sont sur Hugging Face, il fonctionnait dans ComfyUI dès le premier jour, et sa licence communautaire est gratuite pour les organisations dont le chiffre d’affaires récurrent annuel est inférieur à 10 millions de dollars. Si vous voulez une sortie en 2K avec dialogues et un contrôle poussé par références, et que vous acceptez de payer à la seconde via une API, MiniMax H3 mérite un essai.

La réponse honnête à la question du « meilleur modèle vidéo ouvert » dépend du poids que vous accordez au mot ouvert.

BesoinMeilleur choixPourquoi
Hébergement en local avec peu de questions juridiquesLTX 2.5Poids ouverts et licence communautaire gratuite sous 10 M$ d’ARR
Clip unique le plus longLTX 2.5Jusqu’à 20 secondes sur le palier Fast
Résolution maximale annoncéeLTX 2.5Jusqu’à 4K, contre 2K pour H3
Direction riche en référencesMiniMax H3Jusqu’à 9 images, 3 clips vidéo et 3 clips audio en entrée
Dialogues multilinguesMiniMax H3Synchronisation labiale annoncée en 11 langues
Coût le plus bas par clipLTX 2.50,09 $ la seconde sur le palier Fast

Ce que « ouvert » signifie ici

Poids ouverts ne signifie pas open source, et cela ne veut pas dire gratuit pour tout le monde. Cela signifie que les fichiers du modèle peuvent être téléchargés et exécutés sur votre propre matériel. C’est ensuite la licence qui détermine ce que vous avez le droit d’en faire. Trois questions permettent d’y voir clair :

  • Droits de téléchargement : pouvez-vous obtenir les fichiers ?
  • Droits d’utilisation : pouvez-vous livrer un travail client payant avec ?
  • Droits territoriaux : êtes-vous même autorisé à les exécuter là où vous vivez ?

Les deux éditeurs utilisent des licences communautaires personnalisées assorties de seuils de chiffre d’affaires. Lisez donc le texte avant de bâtir un produit sur l’un ou l’autre.

Mains d’un technicien sortant une carte graphique d’un boîtier de PC ouvert sur un établi en acier

LTX 2.5 en bref

Les caractéristiques à connaître

Lightricks a conçu LTX 2.5 comme un modèle audio-vidéo de 22 milliards de paramètres qui génère l’image et le son ensemble. Sa fonctionnalité phare est la génération multiplan native. Demandez un plan large, un plan moyen et un gros plan : le modèle les rend comme une seule séquence qui conserve le personnage, l’éclairage et la voix d’un plan à l’autre, au lieu d’assembler des clips séparés.

Autres ajouts à noter :

  • Durée automatique : le modèle détermine la durée du clip à partir de l’action que vous décrivez.
  • Sortie 4K HDR : vidéo en haute résolution et à plage dynamique étendue, pour les travaux de finition.
  • Flux RAW : une voie conçue pour les chaînes colorimétriques professionnelles.
  • Bêta d’édition : un mode pour réviser des séquences existantes au lieu de les régénérer.

Côté vitesse, Lightricks annonce un clip de 10 secondes généré en 6,8 secondes sur deux superpuces NVIDIA GB200. C’est un chiffre de l’éditeur, obtenu sur un matériel très coûteux : prenez-le comme un plafond, pas comme une promesse pour votre bureau. Via l’API gérée, la même tâche aurait pris 23,7 secondes en 1080p, ce qui reste rapide.

Licence et écosystème

Les poids sont disponibles sur Hugging Face en plusieurs versions : le checkpoint dev complet, une version distillée pour la vitesse, et des quantifications int8 et NVFP4 pour les budgets mémoire plus serrés. La prise en charge par ComfyUI était prête le jour de la sortie, avec des modèles de flux de travail officiels pour le texte vers vidéo et l’image vers vidéo.

La licence communautaire LTX-2.x autorise le fine-tuning et l’hébergement en local, et elle est gratuite pour les organisations dont le chiffre d’affaires récurrent annuel est inférieur à 10 millions de dollars. Elle interdit de construire avec le modèle un système d’IA concurrent et interdit l’usage militaire sans accord distinct.

Directeur de la photographie réglant une caméra de cinéma sur un trépied, sur une falaise côtière à l’heure dorée

MiniMax H3 en bref

Ce qu’apporte H3

H3 est le modèle vidéo omni-modal de MiniMax, successeur de la gamme Hailuo 2.3. Il génère de 4 à 15 secondes de vidéo à 24 i/s, jusqu’en 2K, avec un son stéréo natif (dialogues, effets et ambiance de pièce) produit dans la même passe. Les communiqués de lancement mentionnent aussi des dialogues synchronisés sur les lèvres en 11 langues, et le modèle de base est annoncé à 33,1 milliards de paramètres.

Là où H3 se distingue, c’est sur la souplesse des entrées. L’API accepterait jusqu’à 9 images de référence, 3 clips vidéo de référence (15 secondes au total) et 3 clips audio, soit 12 fichiers au total, plus un prompt pouvant atteindre 7 000 caractères. Les références audio ne peuvent pas être envoyées seules. Pour la cohérence des personnages d’un plan à l’autre, c’est un niveau de contrôle de réalisation considérable.

Le tarif API annoncé au lancement était de 0,13 $ la seconde de vidéo en 2K, soit 7,80 $ la minute, avec les cinq premières images de référence gratuites, puis 0,04 $ par image supplémentaire. Vérifiez la grille tarifaire actuelle de MiniMax avant d’établir votre budget.

Équipe de collègues examinant des séquences en pause sur un grand écran mural dans une salle de réunion vitrée

Le piège de la licence

H3 a d’abord été un produit réservé à l’API. Les poids sont arrivés le 3 août sous la licence communautaire MiniMax H3, et trois points comptent :

  • Seul H3-Base a été publié. Les deux checkpoints, FL2VA et Ref2VA, sont tous deux distillés pour le CFG.
  • L’étape 2K est restée fermée. La génération locale fonctionne avec un petit côté de 768 pixels. Le module H3-Regenerate-2K n’a pas été publié en open source, et l’API exécute le pipeline 2K complet.
  • Restrictions territoriales. Plusieurs analyses de la licence, notamment des comptes rendus d’hébergeurs, indiquent que la licence exclut les États-Unis, l’Union européenne, le Royaume-Uni et la Corée du Sud, apparemment même pour l’utilisation des sorties du modèle dans ces régions. Un seuil de chiffre d’affaires de 20 millions de dollars a également été signalé.

💡 Lisez vous-même le texte de la licence avant de vous fier à un résumé tiers, celui-ci compris. Si les exclusions territoriales s’appliquent à l’endroit où vous vivez, les poids ouverts sont exclus, quelle que soit la qualité de la fiche technique.

Comparaison face à face

Résolution et durée des clips

CaractéristiqueLTX 2.5MiniMax H3
Sortie11 août 2026API le 31 juillet, poids le 3 août 2026
Taille du modèle22 milliards de paramètres33,1 milliards de paramètres
Poids ouvertsDev complet, distillé, int8, NVFP4H3-Base uniquement (FL2VA, Ref2VA)
Résolution maximaleJusqu’à 4K HDR2K via l’API, 768p côté court en local
Durée du clipJusqu’à 20 secondes (palier Fast)De 4 à 15 secondes
AudioAudio et vidéo conjointsStéréo native, dialogues en 11 langues
MultiplanSéquences multiplans nativesPlusieurs plans dans une seule génération
Entrées de référenceImage vers vidéo, première et dernière image9 images, 3 vidéos, 3 clips audio
LicenceLTX-2.x Community, gratuite sous 10 M$ d’ARRMiniMax H3 Community, limites territoriales signalées

Sur le papier, LTX 2.5 a plus de marge : jusqu’à la 4K et jusqu’à 20 secondes. Les clips longs impliquent toutefois un compromis, car le plafond de 20 secondes ne s’applique qu’en 1080p ou en dessous. H3 plafonne à 2K et 15 secondes via l’API, et à 768p en local. La résolution ne fait cependant pas la qualité : un clip 1080p propre, avec un mouvement crédible, vaut mieux qu’un clip 4K avec des mains qui fondent.

Visages, mouvement et son

Les gros plans révèlent toutes les faiblesses d’un modèle vidéo : grain de la peau, clignements, mèches de cheveux, forme des lèvres. H3 met en avant la cohérence basée sur les références et la synchronisation labiale multilingue, ce qui laisse penser que MiniMax vise les scènes portées par le dialogue. LTX 2.5 cible la même cible avec une génération audio-vidéo conjointe et des séquences multiplans qui conservent une voix stable d’un plan à l’autre.

Je ne peux pas honnêtement classer leurs visages à partir des seules fiches techniques, et personne d’autre ne le peut sans rendus comparés côte à côte. Testez avec vos propres éléments : un visage, une réplique, un mouvement de caméra.

Portrait en gros plan montrant le grain de la peau et les fins détails des cheveux près d’une fenêtre

Le son est l’autre moitié du tableau :

  • LTX 2.5 : l’audio est généré conjointement avec la vidéo, et sur LTX 2.5 Fast il peut être activé ou désactivé pour chaque rendu.
  • H3 : sortie stéréo à 32 kHz, selon une fiche technique, avec dialogues, effets et ambiance de pièce dans la même passe.

Ingénieur du son casque sur les oreilles devant une table de mixage dans un studio d’enregistrement traité acoustiquement

Vitesse et coût

La tarification à la seconde simplifie les calculs. Ce sont les prix API de la semaine de lancement tels que rapportés, et les résolutions diffèrent (H3 en 2K, LTX jusqu’à 1080p) : il ne s’agit donc pas d’un test à conditions identiques.

Durée du clipLTX 2.5 Fast (0,09 $/s)LTX 2.5 Pro (0,12 $/s)H3 en 2K (0,13 $/s)
5 secondes0,45 $0,60 $0,65 $
10 secondes0,90 $1,20 $1,30 $
15 secondes1,35 $Non disponible (plafond de 10 s)1,95 $
20 secondes1,80 $Non disponible (plafond de 10 s)Non disponible (plafond de 15 s)

Le palier Fast est le moyen le moins cher d’itérer. Le palier Pro vise le respect du prompt, les visages et la typographie, il convient donc au rendu final, une fois que les brouillons Fast vous satisfont.

Vue de dessus d’un bureau avec un carnet, un chronomètre, une calculatrice et une tasse de café

Les faire tourner sur votre propre matériel

LTX 2.5 sur une station de travail

Lightricks propose un checkpoint distillé pour la vitesse et des versions quantifiées pour des budgets mémoire plus serrés. Les versions NVFP4 ciblent la dernière architecture de NVIDIA, donc les cartes plus anciennes tireront probablement mieux parti de l’int8. Je n’ai pas trouvé de chiffre minimal de VRAM fiable dans les communiqués de lancement : consultez la fiche du modèle pour votre GPU exact.

Un premier essai raisonnable : chargez le checkpoint distillé dans ComfyUI, générez un clip de 10 secondes en 1080p, et ensuite seulement poussez vers la 4K ou des durées plus longues.

Tour de station de travail, panneau latéral retiré, posée sur un établi de garage

Les limites de H3 en local

Le dépôt de H3 est volumineux. Un guide d’un hébergeur décrit le téléchargement complet, avec toutes les quantifications, à environ 600 Go. Le modèle de base compte 33,1 milliards de paramètres denses, contre 22 milliards pour LTX 2.5, donc attendez-vous à une charge plus lourde pour votre GPU. ComfyUI a ajouté quatre nœuds H3 : EmptyMiniMaxH3LatentAV, MiniMaxH3ImageToVideo, MiniMaxH3ReferenceToVideo et MiniMaxH3SigmaShift.

Ce que vous obtenez en local, c’est le résultat de base en 768p. Le travail de finition 2K, celui qui remplit les pages marketing, vient de l’API.

Utiliser LTX 2.5 sur PicassoIA

Vous n’avez pas besoin de GPU pour essayer ce modèle. LTX 2.5 Fast fonctionne sur Picasso IA et accepte un prompt texte ou une seule photo. Au moment de la rédaction, H3 lui-même n’est pas dans le catalogue. Les modèles MiniMax les plus récents disponibles sont Hailuo 2.3 et Hailuo 2.3 Fast, ce qui constitue un test de comparaison honnête pour le rendu MiniMax.

Étape par étape

  1. Ouvrez la page LTX 2.5 Fast dans la collection texte vers vidéo.
  2. Choisissez votre entrée. Rédigez un prompt seul, ou importez une photo de première image pour l’image vers vidéo.
  3. Facultatif : ajoutez une image de dernière image et le modèle interpolera une transition entre les deux.
  4. Réglez le format, la résolution, la durée et la fréquence d’images (voir le tableau ci-dessous).
  5. Laissez Generate Audio activé si vous voulez un son synchronisé.
  6. Générez, prévisualisez le clip, puis téléchargez-le ou ajustez le prompt et relancez.

Réglages et conseils pour le prompt

RéglageOptionsRemarques
Format16:9, 9:16Paysage pour le web, portrait pour les réseaux sociaux
Résolution720p, 1080p, 2K, 4KPar défaut 1080p ; les résolutions supérieures limitent la durée
Durée2 à 20 secondesAu-delà de 10 secondes, uniquement en 720p ou 1080p avec 24 ou 25 i/s
Fréquence d’images24, 25, 48, 5048 et 50 i/s plafonnent à 10 secondes
Générer le sonActivé ou désactivéActivé par défaut

Pour les premières images, construisez l’image fixe avec un modèle d’image comme Seedream 5 Pro, puis transmettez-la au modèle vidéo. Vous contrôlez la composition avant qu’un mouvement ne soit ajouté.

Rédigez vos prompts dans l’ordre où les choses se produisent : sujet, action, mouvement de caméra, lumière, puis son. Par exemple :

Un pêcheur tire une corde sur un petit bateau en bois à l’aube. Travelling avant lent depuis la poupe, brume marine qui glisse sur l’eau, lumière ambrée et basse sur des planches mouillées. Grincement du bois, vagues douces et mouettes au loin.

Scénariste tapant des prompts sur un ordinateur portable, à une table de café près d’une fenêtre striée de pluie

Lequel choisir ?

Choisissez LTX 2.5 si

  • Vous voulez héberger ou fine-tuner le modèle sans questions territoriales.
  • Les clips de plus de 15 secondes comptent pour vous.
  • Vous itérez beaucoup et avez besoin du coût le plus bas par brouillon.
  • Vous travaillez dans ComfyUI et voulez des modèles de flux de travail dès le premier jour.
  • Vous avez besoin de la 4K HDR pour une chaîne de finition.

Choisissez H3 si

  • Vous dirigez avec de nombreuses références : visages, séquences et clips vocaux dans une seule requête.
  • Vos scènes reposent sur des dialogues multilingues.
  • Vous acceptez d’utiliser l’API et la sortie en 2K compte davantage que le contrôle local.
  • Vous avez vérifié que la licence autorise votre lieu de résidence et votre tranche de chiffre d’affaires.

Si aucun des deux ne convient, lancez le même prompt avec Kling v3 Video ou Veo 3.1 pour un troisième avis.

Faites votre propre comparaison

Les fiches techniques ne disent pas tout. Le moyen le plus rapide de trancher est de générer deux fois le même plan et de le regarder avec le son. Ouvrez LTX 2.5 Fast sur Picasso IA, collez un prompt, et générez-le en 1080p puis en 4K. Passez ensuite la même description dans Hailuo 2.3 et comparez côte à côte les visages, le mouvement et le son.

Vous voulez une première image personnalisée ? Générez-la avec les modèles d’image de PicassoIA, importez-la comme image de départ et laissez le modèle vidéo prendre le relais. Quelques essais vous en apprendront plus que n’importe quel tableau de caractéristiques, y compris celui-ci.

Partager cet article

Choisissez votre langue