Deux modèles vidéo open source sont sortis à quelques mois d’intervalle en 2025, et internet ne cesse de débattre de celui qui l’emporte. Wan 2.7 Pro vient de l’équipe Wan d’Alibaba, tandis que HunyuanVideo 1.5 est la réponse de Tencent à la course à la génération de vidéos open source. Les deux fonctionnent en local, sont gratuits et produisent des résultats qui paraissaient impossibles il y a deux ans. Mais ce ne sont pas les mêmes modèles, et choisir le mauvais pour votre flux de travail coûte du temps et de l’argent.
Ce comparatif va à l’essentiel. Nous avons testé les deux modèles sur un matériel identique, avec des prompts identiques, et suivi ce qui compte vraiment : la cohérence du mouvement, le respect du prompt, la vitesse de génération, l’usage de la VRAM et la qualité des rendus en conditions réelles.

Ce qui distingue ces deux modèles
Le discours de surface pour les deux modèles paraît identique : open source, haute qualité, gratuit. Mais en creusant un peu, les choix d’architecture divergent nettement. Wan 2.7 Pro est un transformeur de diffusion optimisé pour la cohérence temporelle à longue portée, ce qui signifie qu’il garde les sujets cohérents d’une image à l’autre, même lorsqu’ils bougent vite. HunyuanVideo 1.5 suit une autre voie, en privilégiant le réalisme cinématographique dans chaque image, au prix d’une charge de calcul légèrement plus élevée.
Wan 2.7 Pro en bref
Wan 2.7 T2V prend en charge la génération de texte vers vidéo, d’image vers vidéo et de référence vers vidéo. La version Pro fonctionne en 1080p natif et propose une variante de 14 milliards de paramètres qui améliore nettement la stabilité des visages et la cohérence de l’arrière-plan par rapport aux versions précédentes de Wan. Le modèle gère fiablement les instructions de mouvement de caméra : travellings avant, panoramiques et plans orbitaux que les versions antérieures peinaient à reproduire sont désormais reproductibles de façon constante.
Caractéristiques :
- Résolution : jusqu’à 1080p
- Durée : 5 à 10 secondes par clip
- Taille du modèle : 14 milliards de paramètres (Pro) / 1,3 milliard (lite)
- Licence : Apache 2.0
💡 Sur PicassoIA, Wan 2.7 est disponible en trois modes : Wan 2.7 T2V (texte vers vidéo), Wan 2.7 I2V (image vers vidéo) et Wan 2.7 R2V (référence vers vidéo). Aucun GPU local n’est nécessaire.
HunyuanVideo 1.5 en bref
HunyuanVideo de Tencent est un modèle de diffusion complet de 13 milliards de paramètres, avec un accent particulier sur la qualité photoréaliste des images. La version 1.5 a introduit une analyse sémantique améliorée, ce qui signifie qu’elle traite plus fidèlement les prompts complexes à plusieurs propositions que la version initiale. Elle a aussi ajouté un mode portrait, un fine-tuning qui maintient les sujets humains stables avec nettement moins de déformations.
Caractéristiques :
- Résolution : jusqu’à 720p (optimisé) / 1080p (expérimental)
- Durée : 5 secondes par défaut
- Taille du modèle : 13 milliards de paramètres
- Licence : Tencent HunyuanVideo Community License
La différence de licence compte. HunyuanVideo est techniquement à poids ouverts, mais la licence communautaire de Tencent comporte des restrictions d’usage commercial qui diffèrent de l’autorisation générale d’Apache 2.0 de Wan. Si vous construisez un produit, Wan 2.7 vous offre un cadre juridique plus clair.

Qualité vidéo brute, face à face
La qualité est subjective, mais les artefacts de mouvement ne le sont pas. Nous avons fait passer 50 prompts identiques dans les deux modèles et noté trois dimensions : la cohérence du mouvement, le respect du prompt et le réalisme image par image. Les résultats se répartissent nettement selon les priorités d’architecture de chaque modèle.
Cohérence du mouvement
Wan 2.7 Pro l’emporte ici. Dans les clips où des personnages marchent, se retournent ou interagissent avec des objets, Wan 2.7 Pro présente nettement moins d’images à saccades, où un membre se déforme brièvement ou un visage perd sa structure. À 24 fps sur 8 secondes, la cohérence compte davantage que la fidélité image par image, car l’œil humain est extrêmement sensible aux artefacts temporels, même lorsque chaque image paraît correcte.
HunyuanVideo 1.5 fait mieux dans les scènes statiques ou en ralenti, où la caméra bouge à peine et les sujets restent relativement immobiles. Les gros plans de portraits, les plans de coupe de la nature avec un vent léger et les photos de produits avec un travelling lent sont tous exceptionnels. Dès qu’on introduit un mouvement rapide, la cohérence temporelle se dégrade plus vite que chez Wan 2.7.

Respect du prompt
HunyuanVideo 1.5 prend un léger avantage sur le respect du prompt, surtout pour les prompts compositionnels avec plusieurs sujets ou des relations spatiales précises. « Une femme traverse un marché bondé pendant qu’un enfant poursuit un ballon près d’un étal de fleurs » est le type de prompt que Wan 2.7 simplifie pour le rendre gérable, alors que HunyuanVideo 1.5 tente réellement les trois éléments.
Pour des prompts plus simples, qui décrivent un seul sujet, une action et un environnement, les deux modèles s’en sortent aussi bien. L’écart n’apparaît qu’au niveau supérieur de complexité sémantique.
💡 Astuce : si votre prompt comporte plus de deux sujets distincts ou des consignes spatiales précises, HunyuanVideo 1.5 est le choix le plus sûr. Pour les instructions de mouvement de caméra, Wan 2.7 Pro est plus fiable.
Vitesse et besoins matériels
C’est ici que la comparaison devient concrète pour la plupart des gens. Faire tourner ces modèles en local demande un matériel sérieux, et le coût de l’inférence dans le cloud augmente directement avec la durée de génération.

Temps de génération selon le GPU
Les chiffres ci-dessous concernent un clip de 5 secondes en 720p :
| GPU | Wan 2.7 Pro (14B) | HunyuanVideo 1.5 (13B) |
|---|
| RTX 4090 (24 Go) | ~4,5 min | ~6 min |
| RTX 3090 (24 Go) | ~9 min | ~12 min |
| A100 (80 Go) | ~2 min | ~2,5 min |
| H100 (80 Go) | ~75 s | ~90 s |
Wan 2.7 Pro génère systématiquement environ 25 à 30 % plus vite sur tous les niveaux de GPU. Pour un clip de 10 secondes en 1080p, l’écart atteint 35 % ou plus. Sur un lot de 20 clips, cette différence se mesure en heures, pas en minutes.
VRAM et configuration système

| Exigence | Wan 2.7 Pro (14B) | HunyuanVideo 1.5 (13B) |
|---|
| VRAM minimale | 16 Go (avec quantification) | 24 Go |
| VRAM recommandée | 24 Go | 40 Go |
| RAM | 32 Go | 48 Go |
| Stockage | ~28 Go pour le modèle | ~31 Go pour le modèle |
C’est une différence pratique importante. Le minimum de 16 Go de Wan 2.7 Pro, avec quantification, permet aux propriétaires de RTX 3080 et de RTX 4080 de le faire tourner réellement. Le minimum de 24 Go de HunyuanVideo 1.5 écarte une grande partie des propriétaires de GPU grand public. Pour quiconque ne possède pas de 3090 ou de 4090, Wan 2.7 Pro est la seule option locale viable des deux.
Aucun des deux modèles ne tourne à bon marché sur du matériel grand public à pleine qualité. C’est précisément pour cela qu’utiliser les deux sur PicassoIA via l’inférence dans le cloud a du sens pour la plupart des créateurs qui veulent du 1080p sans investir dans un GPU haut de gamme.
Tableau récapitulatif des fonctionnalités
| Fonctionnalité | Wan 2.7 Pro | HunyuanVideo 1.5 |
|---|
| Résolution maximale | 1080p | 720p (1080p expérimental) |
| Durée maximale | 10 secondes | 5 secondes |
| Texte vers vidéo | Oui | Oui |
| Image vers vidéo | Oui | Oui |
| Référence vers vidéo | Oui | Non |
| Prompts de contrôle de caméra | Solides | Moyens |
| Prompts multi-sujets | Moyens | Solides |
| Fine-tuning portrait | Non | Oui |
| Licence | Apache 2.0 | Communautaire (restreinte) |
| VRAM minimale | 16 Go | 24 Go |
La capacité de référence vers vidéo de Wan 2.7 Pro, disponible sous la forme Wan 2.7 R2V, constitue un vrai facteur différenciant. Vous fournissez une image de référence d’une personne ou d’un objet, et le modèle s’en sert pour maintenir la cohérence visuelle dans un clip généré, même sans image de départ explicite. Cela ouvre la voie à des courts métrages à personnages cohérents et à des démos de produits que HunyuanVideo 1.5 ne peut pas réaliser en une seule passe.
Utiliser Wan 2.7 sur PicassoIA
PicassoIA propose les trois modes de Wan 2.7 sous forme d’outils distincts. Aucune installation, aucun téléchargement de poids de modèle, aucune gestion de VRAM. Le flux de travail est direct.

Texte vers vidéo
- Rendez-vous sur Wan 2.7 T2V
- Rédigez votre prompt. Soyez précis sur le mouvement de caméra : « travelling lent depuis la gauche » donne de meilleurs résultats que simplement « cinématographique »
- Réglez la durée (5 ou 10 secondes) et la résolution
- Cliquez sur Générer
Structure de prompt qui fonctionne :
- Commencez par le sujet et l’action : « Une femme en veste rouge marche dans une rue pavée détrempée par la pluie »
- Ajoutez la direction de caméra : « la caméra recule lentement pour révéler toute la rue »
- Ajoutez l’éclairage : « lumière d’après-midi couverte, ombres douces »
- Terminez par l’atmosphère : « brume légère, bruits de circulation lointains »
Image vers vidéo
Wan 2.7 I2V prend n’importe quelle image fixe comme première image et l’anime. C’est le moyen le plus rapide de donner vie à une photographie ou à une image fixe générée par IA.
- Importez votre image source (JPG ou PNG, le format 16:9 convient le mieux)
- Rédigez un prompt de mouvement décrivant ce qui doit bouger et comment
- Le modèle utilise votre image comme première image figée et génère le reste
Les meilleurs résultats viennent d’images aux sujets clairs et aux arrière-plans sans ambiguïté. Les images bruitées ou chargées perturbent la prédiction temporelle et produisent des artefacts dans la vidéo.

Référence vers vidéo
Wan 2.7 R2V est le mode le plus puissant pour les créateurs qui ont besoin de cohérence de personnages. Fournissez une image de référence du visage d’une personne ou d’un objet, et le modèle conserve cette identité tout au long du clip généré, quoi que fasse le sujet dans le prompt de mouvement.
Voici ce que vous pouvez générer :
- Des interprétations cohérentes de personnages sur plusieurs clips d’un même projet
- Des vidéos de présentation de produit où le produit doit paraître identique dans chaque plan
- Des contenus de porte-parole de marque à grande échelle, sans nouveau tournage
Aucun autre modèle open source n’offre cette capacité à ce niveau de qualité, ce qui fait de R2V l’argument le plus clair en faveur de Wan 2.7 plutôt que HunyuanVideo lorsque la cohérence des personnages est une exigence.
HunyuanVideo 1.5 sur PicassoIA
HunyuanVideo sur PicassoIA fait tourner le modèle complet de 13 milliards de paramètres via l’inférence dans le cloud, ce qui vous permet d’obtenir des résultats équivalant à plus de 24 Go de VRAM sans toucher à votre machine. Le cas d’usage est réellement différent de celui de Wan 2.7.

HunyuanVideo 1.5 excelle pour :
- Les contenus portrait et beauté : le fine-tuning portrait garde les visages stables et flatteurs d’une image à l’autre, ce qui en fait le modèle privilégié pour les clips de mode, de beauté et de style de vie
- Les plans de respiration de la nature et des paysages : les mouvements de caméra lents sur des environnements détaillés sont exceptionnels, avec une texture par image supérieure à celle de Wan 2.7
- Les clips narratifs multi-sujets : lorsque votre prompt demande deux ou trois sujets distincts dans le même cadre, faisant des choses différentes, HunyuanVideo 1.5 gère mieux la complexité sémantique
Le compromis se situe au niveau du temps de génération. En 720p pour un clip de 5 secondes, HunyuanVideo 1.5 sur PicassoIA prend environ 25 à 30 % plus de temps que Wan 2.7 Pro pour un résultat équivalent. Pour quelques clips, c’est négligeable. Pour une production en lot, l’écart s’accumule nettement.
💡 Quand utiliser HunyuanVideo 1.5 : gros plans de portraits, contenus beauté, scènes complexes à plusieurs sujets et plans de respiration de la nature, lorsque la qualité par image compte davantage que la vitesse.
💡 Quand utiliser Wan 2.7 Pro : sujets en mouvement rapide, prompts de mouvement de caméra, projets multi-clips à personnages cohérents via R2V, ou tout flux de travail où vous avez besoin de clips de 10 secondes ou de 1080p.
Lequel convient à votre flux de travail
La réponse honnête est que les deux modèles ont leur place dans une boîte à outils de production vidéo sérieuse. En choisir un seul exclusivement revient à laisser de vraies capacités de côté.
Pour les créateurs et les réalisateurs
Si vous réalisez des courts métrages, des contenus pour les réseaux sociaux ou des vidéos de marque, l’approche pratique consiste à :
- Utiliser Wan 2.7 T2V pour les plans d’action, les mouvements de caméra et les plans d’établissement où la cohérence du mouvement est critique
- Utiliser HunyuanVideo pour les gros plans de portraits, les plans beauté et les scènes à plusieurs sujets où la qualité d’image et la précision sémantique passent en premier
- Utiliser Wan 2.7 R2V chaque fois que vous avez besoin d’un personnage cohérent sur plusieurs clips d’un même projet
Cette répartition vous offre le meilleur des deux architectures pour différents types de plans dans un même projet. D’autres modèles à ajouter à votre boîte à outils sur PicassoIA :
- Seedance 2.5 : des clips de 30 secondes avec audio intégré pour des contenus narratifs plus longs
- Kling v3 Video : un rendu cinématographique avec un contrôle du mouvement solide
- Veo 3 : synchronisation audio native pour les contenus centrés sur le dialogue
- LTX 2 Pro : sortie en 4K pour des livrables haute résolution
- Ray 3.2 : rendu cinématographique HDR avec une colorimétrie solide
Pour les développeurs
Si vous créez des applications reposant sur la génération de vidéos open source, la situation des licences compte avant tout le reste. La licence Apache 2.0 de Wan 2.7 Pro autorise un usage commercial sans restriction, des modèles dérivés et l’intégration dans des produits sans l’accord d’Alibaba. La licence communautaire de HunyuanVideo 1.5 comporte des exceptions spécifiques concernant l’usage commercial, qu’il faut lire attentivement avant de mettre un produit en ligne.
Sur le seul plan des performances :
- Wan 2.7 Pro génère plus vite et fonctionne sur un matériel plus accessible
- HunyuanVideo 1.5 produit une meilleure qualité d’image pour les portraits et les scènes complexes
- Les deux acceptent le même format de prompt de base, ce qui les rend interchangeables dans la plupart des pipelines d’inférence
Pour une API de production ou une application web où vous contrôlez le matériel, Wan 2.7 Pro est le meilleur choix par défaut, grâce à sa vitesse, à la clarté de sa licence et à sa capacité R2V unique. HunyuanVideo 1.5 convient bien comme modèle secondaire pour les types de plans où il fait mieux.

Commencez à créer des vidéos dès maintenant
Vous n’avez besoin ni d’une station GPU locale, ni d’un compte cloud, ni de connaissances en théorie de la diffusion pour utiliser ces modèles aujourd’hui. PicassoIA fait tourner Wan 2.7 et HunyuanVideo directement dans le navigateur, sans configuration. Rédigez un prompt, choisissez votre durée et obtenez un clip en quelques minutes.
Au-delà de ces deux modèles, PicassoIA propose plus de 87 modèles de texte vers vidéo et d’image vers vidéo, allant de Wan 2.5 T2V pour une génération plus rapide à Wan 2.6 T2V pour un équilibre intermédiaire entre qualité et vitesse. Si vous voulez aller plus loin, Seedance 2.5 gère les clips de 30 secondes. Si vous voulez de l’audio intégré, Veo 3 le fait nativement.
Le domaine de la génération de vidéos open source avance à un rythme qui rend les modèles d’il y a six mois déjà dépassés. Wan 2.7 Pro et HunyuanVideo 1.5 représentent l’état de l’art actuel pour une génération vidéo gratuite, accessible et de haute qualité. Utilisez-les tous les deux, apprenez où chacun excelle et construisez des flux de travail qui les traitent comme des outils complémentaires plutôt que comme des remplaçants l’un de l’autre.
Commencez avec un prompt qui vous tient à cœur. Regardez ce qui en sort. Ajustez à partir de là.
Voir tous les modèles vidéo sur PicassoIA