Deux modèles vidéo dont les poids peuvent être téléchargés sont arrivés à moins de dix jours d’intervalle cet été, et les créateurs en débattent depuis. MiniMax a annoncé H3 le 31 juillet 2026 sous forme de produit API, puis a publié les poids le 3 août. Lightricks a suivi le 11 août avec LTX 2.5. Les deux génèrent l’image et le son en une seule passe. Les deux promettent un rendu cinématographique. Les petits caractères de la licence rendent cependant le choix bien moins évident que ne le suggèrent les fiches techniques.
Ce comparatif s’en tient à ce qui compte quand vous avez une échéance : résolution, durée des clips, son, vitesse, prix, matériel local et qui est réellement autorisé à utiliser les poids. Je n’ai pas réalisé de benchmark en laboratoire ; tous les chiffres ci-dessous proviennent donc des spécifications publiées et des communiqués de lancement, et je signale les chiffres qui relèvent des affirmations des éditeurs.
💡 Verdict express : LTX 2.5 est le choix ouvert le plus sûr pour la plupart des utilisateurs. MiniMax H3 offre une sortie en 2K et des entrées de référence plus riches via son API, mais les poids que vous pouvez réellement télécharger sont plus limités que ne le laisse entendre l’annonce.

La réponse courte
Le gagnant en une phrase
Si vous voulez faire tourner un modèle vidéo sur votre propre machine, l’intégrer à un flux de travail ou le fine-tuner, LTX 2.5 l’emporte pour la plupart des lecteurs. Ses poids sont sur Hugging Face, il fonctionnait dans ComfyUI dès le premier jour, et sa licence communautaire est gratuite pour les organisations dont le chiffre d’affaires récurrent annuel est inférieur à 10 millions de dollars. Si vous voulez une sortie en 2K avec dialogues et un contrôle poussé par références, et que vous acceptez de payer à la seconde via une API, MiniMax H3 mérite un essai.
La réponse honnête à la question du « meilleur modèle vidéo ouvert » dépend du poids que vous accordez au mot ouvert.
| Besoin | Meilleur choix | Pourquoi |
|---|
| Hébergement en local avec peu de questions juridiques | LTX 2.5 | Poids ouverts et licence communautaire gratuite sous 10 M$ d’ARR |
| Clip unique le plus long | LTX 2.5 | Jusqu’à 20 secondes sur le palier Fast |
| Résolution maximale annoncée | LTX 2.5 | Jusqu’à 4K, contre 2K pour H3 |
| Direction riche en références | MiniMax H3 | Jusqu’à 9 images, 3 clips vidéo et 3 clips audio en entrée |
| Dialogues multilingues | MiniMax H3 | Synchronisation labiale annoncée en 11 langues |
| Coût le plus bas par clip | LTX 2.5 | 0,09 $ la seconde sur le palier Fast |
Ce que « ouvert » signifie ici
Poids ouverts ne signifie pas open source, et cela ne veut pas dire gratuit pour tout le monde. Cela signifie que les fichiers du modèle peuvent être téléchargés et exécutés sur votre propre matériel. C’est ensuite la licence qui détermine ce que vous avez le droit d’en faire. Trois questions permettent d’y voir clair :
- Droits de téléchargement : pouvez-vous obtenir les fichiers ?
- Droits d’utilisation : pouvez-vous livrer un travail client payant avec ?
- Droits territoriaux : êtes-vous même autorisé à les exécuter là où vous vivez ?
Les deux éditeurs utilisent des licences communautaires personnalisées assorties de seuils de chiffre d’affaires. Lisez donc le texte avant de bâtir un produit sur l’un ou l’autre.

LTX 2.5 en bref
Les caractéristiques à connaître
Lightricks a conçu LTX 2.5 comme un modèle audio-vidéo de 22 milliards de paramètres qui génère l’image et le son ensemble. Sa fonctionnalité phare est la génération multiplan native. Demandez un plan large, un plan moyen et un gros plan : le modèle les rend comme une seule séquence qui conserve le personnage, l’éclairage et la voix d’un plan à l’autre, au lieu d’assembler des clips séparés.
Autres ajouts à noter :
- Durée automatique : le modèle détermine la durée du clip à partir de l’action que vous décrivez.
- Sortie 4K HDR : vidéo en haute résolution et à plage dynamique étendue, pour les travaux de finition.
- Flux RAW : une voie conçue pour les chaînes colorimétriques professionnelles.
- Bêta d’édition : un mode pour réviser des séquences existantes au lieu de les régénérer.
Côté vitesse, Lightricks annonce un clip de 10 secondes généré en 6,8 secondes sur deux superpuces NVIDIA GB200. C’est un chiffre de l’éditeur, obtenu sur un matériel très coûteux : prenez-le comme un plafond, pas comme une promesse pour votre bureau. Via l’API gérée, la même tâche aurait pris 23,7 secondes en 1080p, ce qui reste rapide.
Licence et écosystème
Les poids sont disponibles sur Hugging Face en plusieurs versions : le checkpoint dev complet, une version distillée pour la vitesse, et des quantifications int8 et NVFP4 pour les budgets mémoire plus serrés. La prise en charge par ComfyUI était prête le jour de la sortie, avec des modèles de flux de travail officiels pour le texte vers vidéo et l’image vers vidéo.
La licence communautaire LTX-2.x autorise le fine-tuning et l’hébergement en local, et elle est gratuite pour les organisations dont le chiffre d’affaires récurrent annuel est inférieur à 10 millions de dollars. Elle interdit de construire avec le modèle un système d’IA concurrent et interdit l’usage militaire sans accord distinct.

MiniMax H3 en bref
Ce qu’apporte H3
H3 est le modèle vidéo omni-modal de MiniMax, successeur de la gamme Hailuo 2.3. Il génère de 4 à 15 secondes de vidéo à 24 i/s, jusqu’en 2K, avec un son stéréo natif (dialogues, effets et ambiance de pièce) produit dans la même passe. Les communiqués de lancement mentionnent aussi des dialogues synchronisés sur les lèvres en 11 langues, et le modèle de base est annoncé à 33,1 milliards de paramètres.
Là où H3 se distingue, c’est sur la souplesse des entrées. L’API accepterait jusqu’à 9 images de référence, 3 clips vidéo de référence (15 secondes au total) et 3 clips audio, soit 12 fichiers au total, plus un prompt pouvant atteindre 7 000 caractères. Les références audio ne peuvent pas être envoyées seules. Pour la cohérence des personnages d’un plan à l’autre, c’est un niveau de contrôle de réalisation considérable.
Le tarif API annoncé au lancement était de 0,13 $ la seconde de vidéo en 2K, soit 7,80 $ la minute, avec les cinq premières images de référence gratuites, puis 0,04 $ par image supplémentaire. Vérifiez la grille tarifaire actuelle de MiniMax avant d’établir votre budget.

Le piège de la licence
H3 a d’abord été un produit réservé à l’API. Les poids sont arrivés le 3 août sous la licence communautaire MiniMax H3, et trois points comptent :
- Seul H3-Base a été publié. Les deux checkpoints, FL2VA et Ref2VA, sont tous deux distillés pour le CFG.
- L’étape 2K est restée fermée. La génération locale fonctionne avec un petit côté de 768 pixels. Le module H3-Regenerate-2K n’a pas été publié en open source, et l’API exécute le pipeline 2K complet.
- Restrictions territoriales. Plusieurs analyses de la licence, notamment des comptes rendus d’hébergeurs, indiquent que la licence exclut les États-Unis, l’Union européenne, le Royaume-Uni et la Corée du Sud, apparemment même pour l’utilisation des sorties du modèle dans ces régions. Un seuil de chiffre d’affaires de 20 millions de dollars a également été signalé.
💡 Lisez vous-même le texte de la licence avant de vous fier à un résumé tiers, celui-ci compris. Si les exclusions territoriales s’appliquent à l’endroit où vous vivez, les poids ouverts sont exclus, quelle que soit la qualité de la fiche technique.
Comparaison face à face
Résolution et durée des clips
| Caractéristique | LTX 2.5 | MiniMax H3 |
|---|
| Sortie | 11 août 2026 | API le 31 juillet, poids le 3 août 2026 |
| Taille du modèle | 22 milliards de paramètres | 33,1 milliards de paramètres |
| Poids ouverts | Dev complet, distillé, int8, NVFP4 | H3-Base uniquement (FL2VA, Ref2VA) |
| Résolution maximale | Jusqu’à 4K HDR | 2K via l’API, 768p côté court en local |
| Durée du clip | Jusqu’à 20 secondes (palier Fast) | De 4 à 15 secondes |
| Audio | Audio et vidéo conjoints | Stéréo native, dialogues en 11 langues |
| Multiplan | Séquences multiplans natives | Plusieurs plans dans une seule génération |
| Entrées de référence | Image vers vidéo, première et dernière image | 9 images, 3 vidéos, 3 clips audio |
| Licence | LTX-2.x Community, gratuite sous 10 M$ d’ARR | MiniMax H3 Community, limites territoriales signalées |
Sur le papier, LTX 2.5 a plus de marge : jusqu’à la 4K et jusqu’à 20 secondes. Les clips longs impliquent toutefois un compromis, car le plafond de 20 secondes ne s’applique qu’en 1080p ou en dessous. H3 plafonne à 2K et 15 secondes via l’API, et à 768p en local. La résolution ne fait cependant pas la qualité : un clip 1080p propre, avec un mouvement crédible, vaut mieux qu’un clip 4K avec des mains qui fondent.
Visages, mouvement et son
Les gros plans révèlent toutes les faiblesses d’un modèle vidéo : grain de la peau, clignements, mèches de cheveux, forme des lèvres. H3 met en avant la cohérence basée sur les références et la synchronisation labiale multilingue, ce qui laisse penser que MiniMax vise les scènes portées par le dialogue. LTX 2.5 cible la même cible avec une génération audio-vidéo conjointe et des séquences multiplans qui conservent une voix stable d’un plan à l’autre.
Je ne peux pas honnêtement classer leurs visages à partir des seules fiches techniques, et personne d’autre ne le peut sans rendus comparés côte à côte. Testez avec vos propres éléments : un visage, une réplique, un mouvement de caméra.

Le son est l’autre moitié du tableau :
- LTX 2.5 : l’audio est généré conjointement avec la vidéo, et sur LTX 2.5 Fast il peut être activé ou désactivé pour chaque rendu.
- H3 : sortie stéréo à 32 kHz, selon une fiche technique, avec dialogues, effets et ambiance de pièce dans la même passe.

Vitesse et coût
La tarification à la seconde simplifie les calculs. Ce sont les prix API de la semaine de lancement tels que rapportés, et les résolutions diffèrent (H3 en 2K, LTX jusqu’à 1080p) : il ne s’agit donc pas d’un test à conditions identiques.
| Durée du clip | LTX 2.5 Fast (0,09 $/s) | LTX 2.5 Pro (0,12 $/s) | H3 en 2K (0,13 $/s) |
|---|
| 5 secondes | 0,45 $ | 0,60 $ | 0,65 $ |
| 10 secondes | 0,90 $ | 1,20 $ | 1,30 $ |
| 15 secondes | 1,35 $ | Non disponible (plafond de 10 s) | 1,95 $ |
| 20 secondes | 1,80 $ | Non disponible (plafond de 10 s) | Non disponible (plafond de 15 s) |
Le palier Fast est le moyen le moins cher d’itérer. Le palier Pro vise le respect du prompt, les visages et la typographie, il convient donc au rendu final, une fois que les brouillons Fast vous satisfont.

Les faire tourner sur votre propre matériel
LTX 2.5 sur une station de travail
Lightricks propose un checkpoint distillé pour la vitesse et des versions quantifiées pour des budgets mémoire plus serrés. Les versions NVFP4 ciblent la dernière architecture de NVIDIA, donc les cartes plus anciennes tireront probablement mieux parti de l’int8. Je n’ai pas trouvé de chiffre minimal de VRAM fiable dans les communiqués de lancement : consultez la fiche du modèle pour votre GPU exact.
Un premier essai raisonnable : chargez le checkpoint distillé dans ComfyUI, générez un clip de 10 secondes en 1080p, et ensuite seulement poussez vers la 4K ou des durées plus longues.

Les limites de H3 en local
Le dépôt de H3 est volumineux. Un guide d’un hébergeur décrit le téléchargement complet, avec toutes les quantifications, à environ 600 Go. Le modèle de base compte 33,1 milliards de paramètres denses, contre 22 milliards pour LTX 2.5, donc attendez-vous à une charge plus lourde pour votre GPU. ComfyUI a ajouté quatre nœuds H3 : EmptyMiniMaxH3LatentAV, MiniMaxH3ImageToVideo, MiniMaxH3ReferenceToVideo et MiniMaxH3SigmaShift.
Ce que vous obtenez en local, c’est le résultat de base en 768p. Le travail de finition 2K, celui qui remplit les pages marketing, vient de l’API.
Utiliser LTX 2.5 sur PicassoIA
Vous n’avez pas besoin de GPU pour essayer ce modèle. LTX 2.5 Fast fonctionne sur Picasso IA et accepte un prompt texte ou une seule photo. Au moment de la rédaction, H3 lui-même n’est pas dans le catalogue. Les modèles MiniMax les plus récents disponibles sont Hailuo 2.3 et Hailuo 2.3 Fast, ce qui constitue un test de comparaison honnête pour le rendu MiniMax.
Étape par étape
- Ouvrez la page LTX 2.5 Fast dans la collection texte vers vidéo.
- Choisissez votre entrée. Rédigez un prompt seul, ou importez une photo de première image pour l’image vers vidéo.
- Facultatif : ajoutez une image de dernière image et le modèle interpolera une transition entre les deux.
- Réglez le format, la résolution, la durée et la fréquence d’images (voir le tableau ci-dessous).
- Laissez Generate Audio activé si vous voulez un son synchronisé.
- Générez, prévisualisez le clip, puis téléchargez-le ou ajustez le prompt et relancez.
Réglages et conseils pour le prompt
| Réglage | Options | Remarques |
|---|
| Format | 16:9, 9:16 | Paysage pour le web, portrait pour les réseaux sociaux |
| Résolution | 720p, 1080p, 2K, 4K | Par défaut 1080p ; les résolutions supérieures limitent la durée |
| Durée | 2 à 20 secondes | Au-delà de 10 secondes, uniquement en 720p ou 1080p avec 24 ou 25 i/s |
| Fréquence d’images | 24, 25, 48, 50 | 48 et 50 i/s plafonnent à 10 secondes |
| Générer le son | Activé ou désactivé | Activé par défaut |
Pour les premières images, construisez l’image fixe avec un modèle d’image comme Seedream 5 Pro, puis transmettez-la au modèle vidéo. Vous contrôlez la composition avant qu’un mouvement ne soit ajouté.
Rédigez vos prompts dans l’ordre où les choses se produisent : sujet, action, mouvement de caméra, lumière, puis son. Par exemple :
Un pêcheur tire une corde sur un petit bateau en bois à l’aube. Travelling avant lent depuis la poupe, brume marine qui glisse sur l’eau, lumière ambrée et basse sur des planches mouillées. Grincement du bois, vagues douces et mouettes au loin.

Lequel choisir ?
Choisissez LTX 2.5 si
- Vous voulez héberger ou fine-tuner le modèle sans questions territoriales.
- Les clips de plus de 15 secondes comptent pour vous.
- Vous itérez beaucoup et avez besoin du coût le plus bas par brouillon.
- Vous travaillez dans ComfyUI et voulez des modèles de flux de travail dès le premier jour.
- Vous avez besoin de la 4K HDR pour une chaîne de finition.
Choisissez H3 si
- Vous dirigez avec de nombreuses références : visages, séquences et clips vocaux dans une seule requête.
- Vos scènes reposent sur des dialogues multilingues.
- Vous acceptez d’utiliser l’API et la sortie en 2K compte davantage que le contrôle local.
- Vous avez vérifié que la licence autorise votre lieu de résidence et votre tranche de chiffre d’affaires.
Si aucun des deux ne convient, lancez le même prompt avec Kling v3 Video ou Veo 3.1 pour un troisième avis.
Faites votre propre comparaison
Les fiches techniques ne disent pas tout. Le moyen le plus rapide de trancher est de générer deux fois le même plan et de le regarder avec le son. Ouvrez LTX 2.5 Fast sur Picasso IA, collez un prompt, et générez-le en 1080p puis en 4K. Passez ensuite la même description dans Hailuo 2.3 et comparez côte à côte les visages, le mouvement et le son.
Vous voulez une première image personnalisée ? Générez-la avec les modèles d’image de PicassoIA, importez-la comme image de départ et laissez le modèle vidéo prendre le relais. Quelques essais vous en apprendront plus que n’importe quel tableau de caractéristiques, y compris celui-ci.