Le domaine de la génération de vidéos par IA open source a évolué très vite en 2024, et CogVideoX se trouve au cœur de ce changement. Publié par THUDM, le laboratoire de recherche derrière CogVLM et d’autres modèles notables, CogVideoX est un modèle texte vers vidéo basé sur la diffusion, qui produit à partir de simples prompts textuels des clips vidéo étonnamment fluides et cohérents. Il ne nécessite pas d’abonnement, ne se cache pas derrière une API propriétaire et ne dissimule pas ses poids. Cette combinaison le place dans une catégorie vraiment différente de la plupart des outils vidéo IA qui font l’actualité.
Ce qu’est réellement CogVideoX
CogVideoX est un modèle de génération vidéo à poids ouverts, construit sur une architecture de transformer de diffusion vidéo. La version phare, CogVideoX-5B, compte 5 milliards de paramètres et peut générer des clips vidéo de 6 secondes en 720x480, à 8 images par seconde. Une variante 2B plus petite existe pour les environnements aux ressources limitées, et les deux sont publiées sous des licences permissives autorisant l’usage commercial.
Le modèle a été entraîné sur un large corpus de paires texte-vidéo, ce qui lui permet de relier des descriptions en langage naturel à un mouvement visuel cohérent. Vous saisissez une description, le modèle débruite à partir d’un bruit gaussien en plusieurs étapes, et le résultat est un court clip vidéo dans lequel les objets se déplacent, la lumière évolue et les scènes passent d’une à l’autre avec une cohérence temporelle raisonnable.

Le laboratoire de recherche THUDM derrière le modèle
THUDM (Tsinghua University Department of Machine Learning) a fait ses preuves en produisant des modèles multimodaux open source performants. Avant CogVideoX, le laboratoire a publié CogVLM pour la compréhension visuelle et langagière, ainsi que GLM-4 pour la génération de texte. CogVideoX suit la même philosophie : publier des poids performants, rendre publics des rapports techniques détaillés et laisser la communauté construire dessus.
Ce soutien académique confère au modèle une crédibilité que les publications « ouvertes » purement commerciales manquent souvent. Les choix d’architecture sont documentés, l’approche d’entraînement est décrite et les limites sont énoncées honnêtement, plutôt que dissimulées dans des notes en petits caractères.
Pourquoi l’open source compte ici
Les générateurs de vidéos propriétaires comme Sora ou les API commerciales ne vous laissent aucun contrôle sur ce qu’il advient de vos données, de vos prompts ou des résultats. Ils peuvent modifier leurs tarifs, restreindre les cas d’usage ou simplement fermer. Un modèle à poids ouverts comme CogVideoX vous permet de l’héberger vous-même, de le fine-tuner sur votre propre jeu de données et de construire des chaînes de production sans dépendre d’un tiers.
Pour les créateurs, cela se traduit par un coût à long terme plus faible. Pour les développeurs, cela offre une vraie flexibilité. Pour les chercheurs, l’architecture peut être inspectée et améliorée par quiconque dispose du matériel et de l’envie nécessaires.

CogVideoX n’utilise pas de backbone UNet standard. Il repose plutôt sur un transformer à attention causale 3D, parfois appelé Expert Transformer, qui traite l’espace et le temps conjointement. Ce choix architectural est au cœur de la capacité du modèle à produire un mouvement temporellement cohérent sur l’ensemble des images d’un clip.
Le backbone de diffusion
Comme la plupart des modèles génératifs modernes, CogVideoX utilise la modélisation probabiliste par diffusion débruitante comme mécanisme central. Le modèle apprend à inverser un processus de bruit : à partir d’un latent vidéo bruité, il prédit et retire le bruit étape par étape, jusqu’à ce qu’il ne reste qu’un latent vidéo propre.
Ce qui distingue CogVideoX des premiers modèles de diffusion vidéo, c’est la manière dont il traite la dimension temporelle. La plupart des premiers modèles traitaient les images de façon relativement indépendante, ce qui entraînait du scintillement et un mouvement incohérent. CogVideoX applique une attention 3D sur les dimensions spatiale et temporelle simultanément, ce qui lui permet de raisonner sur la manière dont les pixels doivent évoluer dans le temps, plutôt que seulement sur leur emplacement dans chaque image.
Conception de l’Expert Transformer
Le backbone transformer de CogVideoX utilise une stratégie de normalisation de couche adaptative experte. Plutôt qu’un jeu unique de paramètres de normalisation pour tous les contenus, le modèle conditionne ses statistiques de normalisation sur l’entrée textuelle. Le comportement de traitement du transformer change donc selon ce que vous décrivez, ce qui rend le modèle plus sensible aux différences sémantiques entre les prompts.
Cette conception aide CogVideoX à maintenir l’identité des sujets d’une image à l’autre. Une personne décrite dans le prompt reste visuellement cohérente d’une image à l’autre, au lieu de dériver en apparence comme le faisaient certains modèles précédents.
Encodeur de texte et VAE vidéo
CogVideoX utilise T5-XXL comme encodeur de texte, le même modèle de langage de 11 milliards de paramètres que celui utilisé dans Stable Diffusion 3 et plusieurs autres générateurs haute performance. T5-XXL produit des représentations sémantiques riches à partir de prompts longs et détaillés, donnant au modèle vidéo davantage d’éléments à exploiter qu’avec des encodeurs plus simples basés sur CLIP.
Côté vidéo, le modèle utilise un auto-encodeur variationnel 3D (VAE 3D) pour compresser les images vidéo dans un espace latent compact où la diffusion a lieu, puis les décode pour revenir à l’espace des pixels. Le VAE 3D est entraîné pour encoder à la fois la structure spatiale et la dynamique temporelle, si bien que la représentation latente contient déjà l’information de mouvement avant le début du processus de diffusion.
CogVideoX face à la concurrence fermée

La comparaison honnête entre CogVideoX et les modèles propriétaires haut de gamme est nuancée. Il ne bat pas Sora 2 sur la qualité visuelle brute, et il n’égale pas le rendu cinématographique de Kling v2.6 dans ses meilleurs réglages. Mais cette comparaison passe complètement à côté de l’essentiel.
Comparer la qualité des résultats
Pour la génération générale de clips courts à partir de texte, CogVideoX-5B produit un rendu que la plupart des spectateurs jugeraient impressionnant. Les objets se déplacent avec une plausibilité physique, le mouvement de caméra suit assez bien le prompt, et les scènes tiennent la route sur les 6 secondes. La résolution native de 720x480 est modeste au regard des standards de 2027, mais suffit pour la plupart des usages web et des réseaux sociaux.
Là où CogVideoX accuse nettement du retard face aux modèles propriétaires, c’est dans les détails fins et les séquences de mouvement complexes. Les mains, le texte présent dans les scènes et les objets en mouvement rapide présentent parfois les artefacts familiers de la génération par IA. Ce sont des limites connues, documentées ouvertement par l’équipe THUDM plutôt que passées sous silence.
L’avantage des poids ouverts
Les modèles fermés vous livrent un résultat soigné, sans aucun contrôle sur le processus sous-jacent. CogVideoX vous donne les poids, ce qui signifie que vous pouvez :
- Fine-tuner le modèle sur votre propre jeu de données vidéo pour le spécialiser dans un domaine
- L’exécuter localement sur un seul A100 ou deux GPU grand public de 24 Go
- Inspecter et modifier l’architecture à des fins de recherche
- Construire des chaînes de production sans tarification à la seconde via API, dont le coût peut grimper de façon imprévisible
Pour les équipes produit qui développent des outils vidéo basés sur l’IA, le coût total de possession sur la durée favorise souvent les modèles ouverts, même lorsque le coût par inférence des API propriétaires semble plus bas au départ.
Les benchmarks qui comptent
Sur les benchmarks standards de génération vidéo comme EvalCrafter et VBench, CogVideoX-5B obtient des scores compétitifs face à des modèles qui étaient à l’état de l’art au milieu de 2024. Il se distingue particulièrement sur la cohérence sémantique (la vidéo correspond-elle au prompt ?) et la fluidité du mouvement (se déplace-t-elle sans coupures brusques ?).
| Critère | CogVideoX-5B | API fermée typique |
|---|
| Alignement sémantique | Élevé | Très élevé |
| Fluidité du mouvement | Élevée | Élevée |
| Résolution native | 720x480 | 720p à 1080p |
| Poids ouverts | Oui | Non |
| Fine-tuning possible | Oui | Non |
| Coût d’hébergement propre | ~0,01 $ à 0,05 $ | 0,05 $ à 0,50 $ et plus |
Ce que vous pouvez construire avec CogVideoX

La nature ouverte de CogVideoX en fait une brique de base, et pas seulement un produit grand public. Depuis sa sortie, développeurs et créateurs l’ont utilisé pour un large éventail d’applications, dont beaucoup seraient impossibles ou prohibitivement coûteuses avec des API fermées.
La génération texte vers vidéo en pratique
L’usage le plus direct correspond exactement à ce que son nom laisse entendre : décrivez une scène, générez un clip vidéo. CogVideoX gère une grande variété de styles de prompts, des descriptions cinématographiques (« un golden retriever qui court parmi les feuilles d’automne, en ralenti, dans une lumière chaude d’après-midi ») aux animations de concepts abstraits (« un time-lapse d’une ville qui se construit sur une terre vide pendant des décennies »).
Les prompts qui fonctionnent bien sont précis sur le sujet, l’action, le décor et l’éclairage. Les prompts vagues produisent des résultats incohérents. Les prompts détaillés qui respectent la distribution d’entraînement du modèle, c’est-à-dire des scènes réelles décrites en langage naturel, donnent systématiquement les résultats les plus solides.
Le fine-tuning pour des usages sur mesure
C’est là que CogVideoX se démarque de tous les concurrents fermés. Avec l’accès aux poids et une bibliothèque d’entraînement comme Diffusers, les équipes peuvent fine-tuner le modèle sur :
- Un acteur ou un personnage précis, pour une apparence cohérente sur plusieurs clips
- Un style visuel, comme un étalonnage colorimétrique particulier ou une esthétique de cinématographie donnée
- Un produit ou une marque, pour une génération vidéo commerciale à grande échelle
- Un domaine spécialisé avec peu de données publiques, comme la visualisation médicale ou la simulation industrielle
Le fine-tuning demande des ressources GPU conséquentes, généralement plusieurs A100 pour des délais d’exécution raisonnables, mais la possibilité même de le faire est une chose qu’aucun modèle propriétaire n’offre actuellement aux utilisateurs externes.
L’exécuter en local
CogVideoX-5B peut tourner sur un seul GPU A100 de 40 Go ou sur deux GPU grand public de 24 Go en utilisant le déchargement de modèle (model offloading). La bibliothèque Hugging Face Diffusers offre une intégration directe, si bien que la mise en place se résume à quelques lignes de Python plutôt qu’à des semaines de travail d’infrastructure.
Astuce : pour une inférence plus rapide sans sacrifier beaucoup de qualité, utilisez les versions quantifiées de CogVideoX disponibles sur Hugging Face. Elles réduisent nettement les besoins en VRAM tout en gardant une qualité de rendu proche du modèle en pleine précision.

Si vous voulez essayer CogVideoX sans mettre en place votre propre infrastructure GPU, CogVideoX 5B est disponible directement sur PicassoIA. Vous obtenez le même modèle open source, exécuté dans le cloud, sans avoir à gérer les dépendances, les versions de CUDA ni l’achat de matériel.
Instructions pas à pas
- Ouvrez CogVideoX 5B sur PicassoIA dans votre navigateur.
- Saisissez la description de votre vidéo dans le champ du prompt. Soyez précis : indiquez le sujet, l’action, l’environnement et l’éclairage.
- Ajustez le nombre d’étapes d’inférence si l’option est disponible. Un nombre d’étapes plus élevé (50 ou plus) produit un rendu plus fluide, au prix d’un temps de génération plus long.
- Cliquez sur générer et patientez pendant le rendu du clip, qui prend généralement de 60 à 120 secondes en mode cloud.
- Téléchargez ou partagez votre vidéo générée directement depuis l’interface.
Conseils pour de meilleurs prompts
- Commencez par le sujet : « Une femme en manteau rouge marchant dans une forêt enneigée » donne de meilleurs résultats que « forêt enneigée avec une femme dedans »
- Décrivez le mouvement explicitement : « la caméra pivote lentement vers la gauche » ou « le sujet se tourne vers la caméra » donne au modèle une direction claire
- Indiquez la lumière : « lumière diffuse de ciel couvert », « lumière latérale de l’heure dorée » ou « lumière chaude d’une lampe intérieure » modifient nettement l’ambiance du résultat
- Évitez les négations dans les prompts : dire ce que vous ne voulez PAS est bien moins efficace que décrire précisément ce que vous voulez
Tirer le meilleur parti des paramètres
Lorsque les étapes d’inférence sont configurables, 30 à 50 étapes représentent le meilleur compromis entre vitesse et qualité. Au-delà de 75 étapes, le résultat s’améliore rarement de façon sensible. Le guidance scale, lorsqu’il est exposé dans l’interface, contrôle la rigueur avec laquelle le modèle suit votre prompt, par opposition à une génération plus libre. Des valeurs entre 6 et 9 donnent de bons résultats pour la plupart des prompts descriptifs sur des scènes réelles.
Les limites réelles à connaître

Aucun test de modèle n’est utile s’il ne traite pas de ce qui ne fonctionne pas. CogVideoX présente des contraintes précises qui influent sur ce que vous pouvez réellement produire avec lui, et les connaître à l’avance vous épargne beaucoup de frustration.
Contraintes de résolution et de durée
Le rendu standard est en 720x480 à 8 i/s pendant environ 6 secondes. Pour les réseaux sociaux, c’est acceptable. Pour la diffusion, les plateformes de streaming ou les productions haut de gamme, cela reste en deçà des attentes actuelles. Des modèles comme LTX 2 Pro génèrent en 4K, et Wan 2.7 T2V atteint le 1080p avec des clips plus longs. Si la résolution ou la durée est votre exigence principale, ces modèles sont de meilleurs choix pour votre flux de travail.
Un suréchantillonnage du rendu avec un upscaler vidéo IA peut faire paraître le résultat de CogVideoX en 1080p, mais cela ajoute une étape de traitement et ne restitue pas les détails qui n’ont jamais été générés.
Configuration matérielle requise
Héberger CogVideoX soi-même demande un matériel conséquent. Le modèle 5B en pleine précision nécessite un GPU de 40 Go. Le modèle 2B est plus léger, mais produit un rendu nettement plus flou, avec une fidélité sémantique moindre. Pour la plupart des créateurs individuels et des petites équipes, cela signifie recourir à un service cloud plutôt qu’à une inférence locale, ce qui compense en partie les avantages financiers des poids ouverts.
Ce qu’il rate encore
- Les mains et les visages en mouvement présentent souvent des artefacts, surtout lors d’interactions complexes ou rapides
- Le texte présent dans les scènes est rarement lisible ou cohérent, une limite partagée par la plupart des modèles de génération vidéo
- Les mouvements de caméra complexes, comme les longs travellings à travers une foule, perdent en cohérence au fil de leur durée
- Les clips de plus de 6 secondes exigent d’assembler plusieurs générations, ce qui introduit des problèmes de cohérence aux raccords
Ce sont des axes de recherche actifs, et les versions affinées par la communauté ont amélioré plusieurs de ces points depuis la sortie du modèle de base, au milieu de 2024.
Le paysage plus large de la vidéo open source

CogVideoX n’est pas apparu isolément. Le paysage de la génération vidéo open source en 2024-2025 compte plusieurs solides concurrents, chacun aux atouts et aux cas d’usage différents.
Les autres modèles à suivre
Hunyuan Video de Tencent produit des clips plus longs, avec une meilleure dynamique de mouvement et une résolution plus élevée. Il demande davantage de calcul, mais représente le plafond actuel de la qualité vidéo open source en début 2025.
LTX Video de Lightricks privilégie la vitesse de génération, en produisant des clips quasiment en temps réel sur du matériel grand public. Le plafond de qualité est plus bas, mais la vitesse d’itération est nettement plus rapide pour les flux de travail qui nécessitent un prototypage rapide.
Wan 2.7 T2V de Wan-Video propose plusieurs niveaux de résolution et de solides capacités d’image vers vidéo en plus du texte vers vidéo, ce qui le rend plus polyvalent pour les flux de travail qui combinent l’animation de visuels existants et la génération de nouveaux.
Où se situe CogVideoX
CogVideoX occupe une position précise dans ce paysage : un modèle bien documenté, utilisable commercialement, ajustable par fine-tuning, avec une bonne cohérence sémantique et des besoins matériels raisonnables. Ce n’est ni l’option la plus haute en résolution, ni la plus rapide, ni la plus riche en fonctionnalités. Mais c’est le modèle dont la documentation est la plus claire, la licence la plus nette et l’un des écosystèmes de développement communautaire les plus actifs.
Pour les développeurs qui construisent sur la génération vidéo, cette combinaison de propriétés compte davantage que les scores bruts des benchmarks dans bien des scénarios réels.
Générez votre première vidéo IA dès aujourd’hui

Lire à propos de CogVideoX ne suffit pas. L’architecture est intéressante, l’histoire de l’open source est convaincante et les benchmarks sont instructifs. Mais ce qui compte vraiment, c’est de savoir si le modèle produit des clips vidéo que vous pouvez utiliser pour votre objectif créatif ou technique précis.
CogVideoX 5B sur PicassoIA vous permet de générer un clip en quelques minutes, sans aucune installation, sans matériel ni configuration. Rédigez une description précise, lancez la génération et voyez ce que le modèle fait de votre prompt.
Au-delà de CogVideoX, PicassoIA propose plus de 87 modèles texte vers vidéo, dont Kling v2.6, Wan 2.7 T2V et Sora 2, tous accessibles sans gérer d’infrastructure ni jongler avec des clés API. Si CogVideoX ne correspond pas à votre besoin, vous n’êtes qu’à un clic d’essayer un modèle complètement différent, aux atouts distincts.
La meilleure façon de se faire une véritable opinion sur un modèle de génération vidéo est de générer une vidéo avec lui. Partez d’une scène que vous connaissez bien, décrivez-la avec précision et comparez le résultat. Cette expérience directe vous en apprendra plus que n’importe quel tableau de benchmarks ou explication technique. Commencez avec CogVideoX 5B et voyez où il vous mène.