Tencent a lancé quelque chose d’important à la fin de 2024, et n’en a pas fait mystère. Hunyuan Video est arrivé comme un modèle de texte vers vidéo entièrement open source, doté de 13 milliards de paramètres, capable de produire des séquences cinématographiques et très dynamiques, qui rivalisaient avec ce que la plupart des API commerciales fermées facturaient à prix fort. Pour le secteur de la génération de vidéos par IA, c’était un message clair : la barre avait été relevée, et elle était désormais accessible à tous.
Ce qu’est vraiment Hunyuan Video

Hunyuan Video est un modèle de génération de vidéos à grande échelle développé par la division de recherche en IA de Tencent. Avec 13 milliards de paramètres, il se place clairement en tête des modèles vidéo open source par sa seule échelle. Le modèle accepte un prompt texte en entrée et produit des séquences vidéo qui ne sont pas seulement cohérentes visuellement, mais aussi plausibles physiquement, avec un mouvement réaliste, un éclairage constant et un comportement précis des objets d’une image à l’autre.
Ce qui le distingue de nombreuses alternatives open source antérieures, c’est le plafond de qualité. Avant Hunyuan Video, l’écart entre la génération de vidéos open source et des offres commerciales comme Sora ou Runway était visible et important. Hunyuan a réduit cet écart de manière significative.
La sortie qui a pris tout le monde de court
La plupart des grandes sorties de vidéos par IA en 2024 venaient de startups ou de laboratoires de recherche très visibles publiquement. La sortie de Tencent était différente. L’entreprise a publié simultanément les poids du modèle, l’article technique et le code d’inférence, offrant aux développeurs un accès immédiat et direct. Pas de liste d’attente, et aucune clé API nécessaire pour le tester.
Le calendrier n’était pas un hasard. L’équipe IA de Tencent travaillait depuis plus de deux ans à cet objectif, en itérant sur son infrastructure de génération d’images avant d’étendre l’architecture à la vidéo. Le résultat était un modèle qui paraissait mature plutôt qu’expérimental.
L’open source dans un monde fermé

La publication open source de Hunyuan Video a un poids pratique réel. Les chercheurs peuvent étudier l’architecture sans restriction. Les développeurs peuvent l’exécuter en local sur un matériel suffisant. Les fournisseurs de plateformes peuvent l’intégrer directement. Cette ouverture a déjà fait naître une vague de versions affinées, ciblant des styles visuels précis, des types de mouvements spécifiques et des domaines spécialisés comme l’animation de produits et la vidéo de portrait.
Pour l’écosystème en général, cela montre que Tencent entend concurrencer à la fois sur la qualité et sur l’accessibilité, et non pas seulement derrière un paywall.

La conception technique de Hunyuan Video reflète des choix délibérés qui expliquent une grande partie de son avantage en qualité. Comprendre les composants principaux permet de saisir pourquoi certains types de prompts fonctionnent mieux et comment tirer le meilleur parti du modèle.
Le Diffusion Transformer au cœur du système
Hunyuan Video repose sur une architecture Diffusion Transformer (DiT), plutôt que sur la conception plus ancienne basée sur UNet, qui dominait les premiers modèles de génération de vidéos. Les modèles DiT traitent la génération de vidéos comme un problème de modélisation de séquences, en appliquant simultanément des mécanismes d’attention de type transformer sur les dimensions spatiale et temporelle.
Cela compte en pratique. Les architectures UNet traitent bien l’information spatiale, mais peinent à maintenir des relations temporelles cohérentes sur des séquences plus longues. L’approche DiT fondée sur l’attention permet au modèle de considérer l’ensemble des images de la séquence ensemble pendant le processus de débruitage, ce qui produit un mouvement bien plus cohérent sur toute la durée de la séquence.
💡 Le backbone transformer traite les patchs de la vidéo conjointement dans l’espace et dans le temps, au lieu de traiter chaque image indépendamment. Ce seul choix architectural explique l’essentiel de l’avantage de Hunyuan Video en matière de qualité de mouvement par rapport aux anciens modèles open source.
Le flow matching plutôt que la planification du bruit

Plutôt que la planification de bruit DDPM standard utilisée par la plupart des modèles de diffusion, Hunyuan Video utilise un rectified flow matching comme objectif d’entraînement. L’effet concret, ce sont des trajectoires de débruitage plus propres pendant l’inférence. La génération tend à être plus efficace, avec moins d’étapes nécessaires pour une qualité comparable, et les sorties montrent des détails fins plus nets tout au long de la séquence.
Le flow matching est devenu l’approche d’entraînement dominante dans les modèles vidéo de nouvelle génération. C’est le même choix fondamental que celui fait dans des modèles plus récents comme Wan 2.7 T2V et LTX 2 Pro. En choisissant le flow matching pour Hunyuan Video, Tencent s’est aligné sur la direction prise par le secteur.
Un VAE 3D qui comprend le temps
Le modèle utilise un Variational Autoencoder (VAE) 3D causal pour encoder et décoder la vidéo. Les VAE d’images classiques compressent l’information spatiale en 2D. Un VAE 3D causal étend cette compression à l’information temporelle, ce qui signifie que la représentation latente capture le mouvement et le changement au fil du temps, et pas seulement l’apparence statique.
La propriété « causale » garantit que l’encodage de chaque image n’utilise que les informations des images actuelles et précédentes, jamais des suivantes. Cela préserve la cohérence temporelle en respectant le sens naturel du temps dans l’espace latent appris, et ouvre des possibilités pour des applications de streaming où les images futures ne sont pas encore disponibles au moment de l’encodage.
Ce qu’il peut vraiment faire

Les spécifications comptent moins que les résultats réels, mais elles fixent correctement les attentes. Voici ce que Hunyuan Video produit avec les réglages standard :
Spécifications de résolution et de durée
| Paramètre | Valeur |
|---|
| Résolution par défaut | 720p (1280x720) |
| Maximum pris en charge | 1080p avec optimisation |
| Durée de la séquence | 5 secondes (par défaut) |
| Formats | 16:9, 9:16, 1:1 |
| Fréquence d’images | 24 fps |
| Nombre de paramètres | 13 milliards |
La valeur par défaut de 720p est un compromis pratique. Faire tourner 13 milliards de paramètres en 1080p demande une quantité importante de VRAM. Sur un seul A100 de 80 Go, la génération en 720p d’une séquence de 5 secondes prend environ 4 à 8 minutes, selon le nombre d’étapes d’inférence et la configuration du matériel.
Qualité du mouvement et cohérence temporelle

C’est là que Hunyuan Video se distingue vraiment. La cohérence temporelle désigne la façon dont les objets, l’éclairage et les relations spatiales restent stables sur toutes les images d’une séquence. De nombreux modèles open source antérieurs produisent des séquences où les sujets changent subtilement d’apparence d’une image à l’autre, où l’éclairage saute de façon artificielle, ou où les arrière-plans dérivent d’une image à l’autre.
Hunyuan Video gère ces défaillances nettement mieux que la plupart de ses contemporains open source. Les visages restent cohérents. Le mouvement de caméra, lorsqu’il est suggéré par le prompt, paraît délibéré et fluide. Les mouvements complexes comme l’eau, le tissu et les cheveux obéissent à des règles physiquement plausibles au lieu de vaciller entre différents états.
💡 Pour obtenir les meilleurs résultats de cohérence temporelle, décrivez explicitement le mouvement de caméra dans votre prompt. Des formulations comme « poussée lente en travelling », « plan large fixe » ou « suivi doux à la caméra à l’épaule » donnent au modèle des repères de mouvement solides pour ancrer la génération.

Le paysage de la génération de vidéos par IA en 2027 est encombré. Hunyuan Video rivalise avec Sora, Kling, Runway, Wan Video et des dizaines d’autres options. Voici une comparaison honnête de sa position :
Hunyuan Video ou d’autres modèles de texte vers vidéo
Le principal compromis de Hunyuan Video oppose accessibilité et qualité. Comme il s’agit d’une publication avec poids directement disponibles, le faire tourner en local demande un matériel sérieux. Mais via les plateformes qui l’ont intégré, son avantage en qualité devient accessible sans ces exigences matérielles.
Ce en quoi Hunyuan Video prend la tête, c’est le réalisme physique et la fidélité au prompt. Il a tendance à interpréter les prompts complexes et nuancés de façon plus littérale que les modèles plus légers. Si vous rédigez une description de scène détaillée avec des conditions d’éclairage, des angles de caméra et des comportements de sujets précis, Hunyuan Video est plus susceptible de tenter de les respecter tous, plutôt que de tendre vers une interprétation générique.
Là où il est en retrait face aux options exclusivement commerciales, c’est sur la vitesse de génération et la résolution maximale. Des modèles comme Kling v3 ou Veo 3.1 produisent des résultats plus rapidement et prennent nativement en charge des séquences plus longues.
En résumé : si l’accès open source, le potentiel de fine-tuning et le réalisme physique sont vos priorités, Hunyuan Video est l’option la plus solide de sa catégorie. Si la vitesse et la facilité d’utilisation comptent davantage, les alternatives commerciales sont réellement compétitives.

Le moyen le plus accessible de générer des vidéos avec Hunyuan Video sans configurer de matériel local est la plateforme PicassoIA. Le modèle y est directement intégré, ce qui supprime la configuration GPU et la gestion des dépendances qu’exige l’exécution des poids en local.
Étape par étape sur la plateforme
Étape 1. Ouvrez la page du modèle Hunyuan Video sur PicassoIA.
Étape 2. Rédigez votre prompt texte. Soyez précis sur le sujet, l’environnement, l’éclairage et le mouvement. Les prompts vagues produisent des résultats génériques.
Étape 3. Sélectionnez votre format. Utilisez 16:9 pour les scènes en paysage, 9:16 pour les contenus verticaux ou pour les réseaux sociaux, 1:1 pour les formats carrés.
Étape 4. Définissez le nombre d’étapes d’inférence. Un plus grand nombre (40 à 50) donne une qualité supérieure au prix d’un temps de génération plus long. Moins d’étapes (20 à 25) sont plus rapides, mais perdent des détails fins.
Étape 5. Validez et attendez le rendu de votre séquence. Le temps de génération varie selon la charge de la file d’attente et les réglages choisis.
Étape 6. Examinez le résultat. Si le mouvement paraît raide, ajoutez à votre prompt un vocabulaire de mouvement plus précis. Si le sujet dérive, ajoutez « photoréaliste, cohérent dans le temps » à la fin de votre prompt.
Conseils de prompts qui fonctionnent
💡 Une structure de prompt fiable : [Sujet] [Action] dans [Environnement], [Description de l’éclairage], [Angle et mouvement de caméra], cinématographique, photoréaliste, 8K.
Quelques schémas précis améliorent systématiquement les sorties de Hunyuan Video :
- Décrivez explicitement la direction de la lumière : « lumière du matin venant de la gauche », « soleil doré en surplomb », « lumière couverte diffuse et douce »
- Nommez le comportement de la caméra : « poussée lente », « plan large fixe », « suivi doux à la caméra à l’épaule »
- Ancrez le sujet : indiquez la position et l’orientation du sujet pour réduire la dérive temporelle entre les images
- Utilisez des phrases descriptives : Hunyuan Video gère mieux les descriptions de scènes complètes que les simples listes de mots-clés
- Précisez le comportement des matières : mentionnez si les tissus doivent flotter, si l’eau doit onduler ou si les cheveux doivent bouger sous le vent
Ces détails ne coûtent rien à ajouter à un prompt et ils relèvent sensiblement le niveau minimal de qualité de ce que produit Hunyuan Video.
Quels cas d’usage conviennent le mieux

Hunyuan Video ne convient pas de la même façon à toutes les tâches de génération de vidéos. Certains cas d’usage exploitent directement ses points forts.
Créateurs de contenus et cinéastes
Pour les créateurs qui ont besoin de séquences physiquement réalistes, Hunyuan Video est actuellement l’une des meilleures options open source disponibles. Les contenus de style de vie, les scènes de nature, la visualisation architecturale et les plans de contexte pour produits en tirent tous profit grâce à sa forte simulation physique de la lumière, du mouvement et du comportement des matières.
Il fonctionne particulièrement bien sur les scènes qui exigent une présence constante du sujet. Une prise de vue de produit où le sujet et son environnement restent stables sur toute la durée de la séquence est exactement le cas où l’avantage de cohérence temporelle de Hunyuan se voit le plus clairement.
Pour les créateurs de contenus sociaux, la prise en charge du format 9:16 le rend directement utilisable pour les vidéos verticales courtes, sans recadrage ni remise en cadre, un flux de travail que des plateformes comme Seedance 2.0 et Pixverse v5.6 ont également privilégié.
Chercheurs et développeurs
Les poids ouverts font de Hunyuan Video une ressource d’une valeur unique pour le fine-tuning et l’adaptation à un domaine. La communauté de recherche a déjà produit des versions affinées ciblant des esthétiques visuelles, des styles d’animation et des domaines de contenu spécialisés. Faire tourner le modèle de base en local permet aux chercheurs de bâtir dessus d’une manière que les API fermées ne peuvent pas permettre.
Les développeurs qui intègrent la vidéo par IA dans leurs applications profitent de la possibilité d’un hébergement autonome, qui évite les coûts d’API par génération à grande échelle et conserve un contrôle total sur l’environnement d’inférence. C’est un avantage pratique réel pour les charges de production.
Flux de travail d’amélioration vidéo
Hunyuan Video s’intègre aussi naturellement dans des chaînes de production vidéo plus larges. Associez-le à un modèle de super-résolution après la génération pour faire passer une sortie en 720p à 1080p ou plus. Utilisez-le avec des outils d’amélioration vidéo par IA pour la stabilisation ou la réduction du bruit. L’architecture ouverte facilite l’intégration dans une chaîne de production, d’une façon que les modèles fermés ne peuvent pas égaler.
Essayez par vous-même
Le moyen le plus rapide de voir ce que produit réellement Hunyuan Video est de lancer un prompt directement sur PicassoIA. Rédigez une scène détaillée, précisez votre éclairage et votre angle de caméra, puis comparez le résultat avec ce que vous obtenez avec Kling v3, Wan 2.7 T2V ou Veo 3.1. Lancer le même prompt sur plusieurs modèles est la façon la plus directe de comprendre ce que fait chacun différemment, et de trouver l’outil adapté au type de contenu que vous créez.
Au-delà de la vidéo, PicassoIA vous donne accès à plus de 90 modèles de texte vers image, à des outils d’upscaling en super-résolution, à des outils de suppression d’arrière-plan et à des fonctions de synchronisation labiale, ce qui en fait un espace de travail complet pour la génération de contenus visuels à toute échelle.
Commencez avec Hunyuan Video et voyez ce que 13 milliards de paramètres open source peuvent faire de votre idée.