Fonctionnement de la génération de vidéos par IA expliqué simplement

Une explication claire de la manière dont l’IA de texte vers vidéo transforme réellement vos mots en images animées. De la diffusion et de l’encodage dans l’espace latent à la synthèse image par image et à la cohérence temporelle, cet article écarte le jargon et explique ce qui se passe vraiment dans des modèles comme Veo 3, Kling, Wan et Sora lorsque vous cliquez sur générer.

Fonctionnement de la génération de vidéos par IA expliqué simplement
Cristian Da Conceicao
Fondateur de Picasso IA

Vous tapez une phrase. Quelques secondes plus tard, un clip vidéo apparaît, correspondant presque exactement à vos mots, sans caméra, sans acteurs, sans table de montage. Juste un prompt et un modèle en action. Si vous avez déjà vu cela se produire sans vraiment y croire, vous n’êtes pas seul. Les mécanismes de la vidéo par IA à partir de texte sont véritablement surprenants, et la plupart des explications les rendent plus difficiles à saisir, pas plus faciles. Voici donc la version réelle : simple, exacte, et sans l’emballage marketing.

Jeune femme tapant un prompt texte sur un clavier mécanique rétroéclairé, de nuit

Ce que le modèle reçoit réellement

La vidéo par IA à partir de texte part de mots, mais ce que le modèle traite n’a rien à voir avec la phrase que vous avez tapée. Dès que vous cliquez sur générer, votre prompt est converti en une séquence de tokens, une représentation numérique de votre texte où chaque mot, ou parfois chaque fragment de mot, correspond à un nombre dans une immense table de correspondance construite pendant l’entraînement.

Cette séquence de tokens passe ensuite dans un encodeur de texte, un réseau de neurones entraîné spécifiquement pour extraire le sens du langage. La sortie de l’encodeur s’appelle un vecteur d’embedding : une longue liste de nombres à virgule flottante qui représente le sens de votre prompt dans un espace mathématique à haute dimension. Pensez-y moins comme une phrase que comme une coordonnée sur une immense carte conceptuelle. « Un chien qui sprinte sur un sable mouillé » se situe près de « un chiot qui court sur une plage » dans cet espace, et très loin de « une usine sidérurgique au crépuscule ».

Votre prompt n’est pas un scénario

Cette distinction est importante, car le modèle ne lit jamais votre prompt comme vous le lisez. Il n’analyse ni la structure narrative, ni la grammaire, ni l’enchaînement. Il travaille entièrement à partir de cet embedding compressé, et s’en sert pour orienter un processus de génération qui part d’un point totalement différent de vos mots. C’est pourquoi une formulation très précise peut changer radicalement votre résultat, alors même que le sens apparent semble identique. L’espace d’embedding est sensible au vocabulaire, à la précision et aux relations entre les concepts.

Tokens, poids et attention

La plupart des modèles actuels utilisent une variante de l’architecture transformer pour construire ces embeddings. À l’intérieur du transformer, un mécanisme d’attention permet à chaque token de regarder tous les autres tokens et d’attribuer des poids de pertinence. « Coucher de soleil » a plus de poids sémantique lorsqu’il se trouve à côté de « océan » que lorsqu’il est à côté de « entrepôt ». Ce contexte pondéré façonne l’embedding final transmis au générateur vidéo. C’est pourquoi les prompts qui incluent des descriptions relationnelles, « un chat endormi sur un vieux canapé en cuir usé à côté d’une fenêtre », tendent à produire des résultats plus justes dans l’espace que de simples listes de mots-clés.

Data scientist étudiant un schéma d’architecture de réseau de neurones sur un grand écran mural

À l’intérieur du processus de diffusion

La génération vidéo proprement dite, dans la plupart des modèles de pointe, dont Veo 3, Wan 2.6 T2V et Kling v3 Video, repose sur un processus appelé diffusion. Une fois que vous avez compris la diffusion, tout le reste de la vidéo par IA à partir de texte s’éclaire.

Partir d’un bruit pur

Le modèle ne part pas d’une toile vierge ni d’une esquisse grossière de votre scène. Il part d’un tenseur de bruit aléatoire pur, des valeurs mélangées essentiellement dénuées de sens, dans une représentation compressée de l’espace vidéo appelée espace latent. L’espace latent est un encodage plus abstrait et de plus basse résolution des données vidéo réelles. Travailler dans l’espace latent plutôt que sur les pixels bruts est ce qui rend la diffusion calculable. Manipuler une vidéo 1080p image par image dans l’espace des pixels exigerait des ressources de calcul bien au-delà du matériel actuel.

Le bruit est intentionnel. Les modèles de diffusion sont entraînés en faisant l’inverse : on prend de vrais clips vidéo, on y ajoute progressivement du bruit jusqu’à ce qu’ils deviennent une neige méconnaissable, puis on entraîne un réseau de neurones à prédire et à inverser cet ajout de bruit étape par étape.

Débruitage étape par étape

À partir de ce bruit initial, le modèle exécute une série d’étapes de débruitage, généralement entre 20 et 50 itérations selon le modèle et les réglages de qualité. À chaque étape, un réseau de neurones appelé le débruiteur, généralement un U-Net ou une architecture transformer de diffusion plus récente, reçoit trois entrées : le latent bruité courant, l’embedding textuel de votre prompt, et une valeur de pas de temps indiquant où en est le processus de débruitage. Il prédit le bruit ajouté à cette étape. Le modèle soustrait ce bruit prédit, ce qui donne un résultat un peu plus cohérent.

Répétez ce processus 30 à 50 fois, et le bruit aléatoire se résout progressivement en un clip vidéo qui reflète votre prompt.

Votre embedding textuel est présent à chaque étape de débruitage, et pas seulement à la première. Il guide le processus en continu grâce à une technique appelée guidance sans classifieur. Le débruiteur effectue deux prédictions simultanément à chaque étape : l’une conditionnée par l’embedding de votre prompt, et l’autre sans. La différence entre ces deux prédictions est amplifiée puis ajoutée à la sortie. Si vous augmentez le guidance scale, votre prompt exerce une influence plus forte sur le résultat. Si vous le poussez trop loin, le rendu devient sursaturé et des artefacts apparaissent.

Bande de film 35 mm développée posée sur une table lumineuse, montrant des images successives de mouvement

Comment les images deviennent une vidéo

Générer une seule image cohérente est un problème. Générer des dizaines ou des centaines d’images qui s’enchaînent de façon cohérente dans le temps est un problème fondamentalement plus difficile, et c’est là que la vidéo par IA à partir de texte se distingue nettement de la génération d’images à partir de texte.

Le problème de la cohérence temporelle

Une image fixe peut être évaluée isolément. Une vidéo, non. Si un modèle d’IA génère chaque image indépendamment, vous obtenez un scintillement visuel, des objets qui se déforment et des personnages dont le visage change subtilement d’une image à l’autre. Ce problème, appelé incohérence temporelle, était la limite majeure des premiers modèles vidéo à partir de texte. Regardez les premiers résultats de modèles sortis en 2023 et vous le remarquerez immédiatement : le sujet est juste, mais tout scintille et se déplace comme si la scène était filmée à travers une distorsion thermique.

Le défi central est la préservation de l’identité dans le temps. La tasse à café posée sur la table doit être la même tasse à l’image 12 et à l’image 60, sous le même angle, de la même couleur, avec la même texture. Toute dérive de la trajectoire de débruitage qui affecte une image sans affecter les images voisines apparaît comme une discontinuité visible dans le clip final.

Comment les modèles le résolvent

Les architectures modernes traitent la cohérence temporelle par plusieurs approches qui fonctionnent souvent ensemble :

  • Couches d’attention 3D : Au lieu de ne porter leur attention que sur les positions spatiales d’une seule image, ces couches permettent à chaque position de chaque image de porter son attention sur chaque autre position de l’ensemble du clip. L’image 5 influence directement l’image 6 et l’image 7.
  • Convolutions temporelles : Couches convolutives qui opèrent le long de la dimension temporelle plutôt que seulement en hauteur et en largeur, ce qui lisse le mouvement entre images adjacentes.
  • Encodage par VAE vidéo : L’auto-encodeur variationnel qui compresse la vidéo dans l’espace latent est entraîné sur des clips vidéo plutôt que sur des images isolées, de sorte qu’il apprend à encoder le mouvement comme une variable continue, et non comme une suite d’instantanés indépendants.
  • Entraînement par flow matching : Certains modèles récents, comme LTX 2.3 Pro et Seedance 2.0, utilisent des objectifs de flow matching plutôt que des calendriers de bruit de diffusion traditionnels, ce qui offre une interpolation plus fluide le long de la trajectoire de génération et une qualité de mouvement nettement meilleure.

Vue aérienne en plongée du bureau d’un chercheur couvert de documents, de graphiques et d’un ordinateur portable ouvert

Texte vers vidéo ou texte vers image

Au niveau de l’architecture, les modèles d’image et de vidéo à partir de texte partagent des idées fondamentales, mais diffèrent par leur portée et leur complexité, ce qui explique pourquoi la génération vidéo est beaucoup plus difficile et gourmande en ressources.

DimensionTexte vers imageTexte vers vidéo
Forme de sortieHauteur x LargeurHauteur x Largeur x Images
Portée de l’attentionSpatiale uniquementSpatiale + temporelle
Espace latentLatent d’image 2DLatent vidéo 3D
Données d’entraînementPaires image-légendeClips vidéo avec légendes
Calcul par générationModéréÉlevé à très élevé
Principal mode d’échecErreurs d’anatomie et de compositionIncohérence temporelle
Sensibilité au promptÉlevéeTrès élevée

Ce qui change au niveau de l’architecture

Le changement architectural le plus important est le passage de l’attention spatiale 2D à une attention spatio-temporelle 3D complète, ou au minimum à une attention spatio-temporelle factorisée. Avec l’attention 3D complète, chaque position de chaque image peut porter son attention sur chaque position de chaque autre image simultanément. Cela offre une excellente cohérence temporelle, mais passe mal à l’échelle lorsque le nombre d’images et la résolution augmentent.

Les approches factorisées alternent des passes d’attention purement spatiales et purement temporelles, en guise de compromis pratique. Cela rend la génération possible pour des durées plus longues sans croissance exponentielle de la mémoire. La plupart des modèles en production utilisent une attention factorisée, avec des couches d’attention complète sélectives à certaines profondeurs du réseau.

On estime que des modèles comme Sora 2 Pro et Veo 3.1 utilisent des architectures transformer spatio-temporelles complètes, entraînées sur d’énormes jeux de données vidéo soigneusement sélectionnés, ce qui explique pourquoi leurs résultats montrent une cohérence temporelle et une physique du mouvement nettement meilleures que celles des modèles de la génération précédente. L’écart ne tient pas seulement au calcul. Il résulte de choix d’architecture et de la qualité des données d’entraînement, qui agissent ensemble.

Trois professionnels de la création regardant des miniatures vidéo sur une tablette, dans un espace de travail partagé lumineux

Les modèles qui le font aujourd’hui

Il existe désormais plus de 80 modèles crédibles de texte vers vidéo, chacun présentant des compromis différents entre vitesse, qualité, résolution, précision du mouvement et coût. Voici un aperçu pratique.

Options haut de gamme

Ces modèles privilégient la qualité et le réalisme des résultats, souvent au prix d’un temps de génération plus long ou d’un coût plus élevé par minute :

  • Kling v3 Video : Qualité de mouvement cinématographique, avec un bon suivi des sujets et un contrôle de la composition
  • Veo 3 : Génération audio native avec la vidéo, à partir d’un seul prompt texte, une avancée notable
  • Veo 3.1 : Résultats en 1080p avec une physique du mouvement améliorée par rapport à la version précédente
  • Sora 2 Pro : Résultats haute résolution avec une bonne cohérence narrative sur la durée
  • Hailuo 2.3 : 1080p avec un rendu de personnage constant tout au long du clip
  • Seedance 2.0 : Texte vers vidéo avec audio synchronisé natif et bonne stabilité temporelle
  • Kling v2.6 : Résultats cinématographiques fiables avec des fonctions de contrôle du mouvement

Options rapides et gratuites

Ces modèles sacrifient une partie de la qualité au profit de la vitesse, ce qui les rend idéaux pour itérer sur vos prompts et tester rapidement :

  • Wan 2.5 T2V Fast : Génération rapide en 720p de bonne qualité
  • Ray Flash 2 720p : Génération vidéo gratuite en 720p avec une bonne fidélité au prompt
  • LTX Video : Vitesses de génération quasi temps réel grâce au flow matching
  • Pixverse v5 : 1080p rapide avec une gestion constante du style
  • CogVideoX 5B : Modèle à poids ouverts offrant une bonne précision du prompt vers la vidéo

💡 Astuce : Utilisez un modèle rapide pour affiner votre prompt jusqu’à ce que la scène et le mouvement vous paraissent justes. Lancez ensuite la version finale sur un modèle haut de gamme. Vous gagnerez ainsi beaucoup de temps et d’argent.

Gros plan d’une femme regardant une vidéo sur un moniteur, son visage éclairé par la lueur de l’écran

Pourquoi certaines vidéos IA sont médiocres

Même avec les meilleurs modèles disponibles, les résultats peuvent décevoir. Les causes sont généralement précises et réparables, une fois que l’on sait ce qu’il faut observer.

Modes d’échec courants

Scintillement temporel : Chaque image prise isolément paraît acceptable, mais les images voisines ne s’enchaînent pas bien. Cela arrive généralement lorsque l’architecture utilise une attention temporelle insuffisante, ou lorsque les étapes d’inférence sont réglées trop bas. Passer à un modèle doté d’un entraînement temporel plus solide, comme Kling v3 Omni Video, résout souvent le problème.

Visages qui se déforment et anatomie qui se dissout : L’anatomie humaine est extraordinairement difficile à reproduire. Le modèle a appris à partir de données vidéo où les visages et les corps bougent de manières complexes et très variables. Lorsque le processus de débruitage hésite entre deux positions plausibles, il en fait une moyenne, ce qui produit l’effet de visage fondu. Des prompts plus précis sur la pose et l’angle réduisent l’incertitude et améliorent la stabilité du résultat.

Mouvement flottant ou physiquement incorrect : La physique n’est pas modélisée explicitement dans les systèmes de diffusion. Le mouvement est approximé à partir de régularités statistiques présentes dans les données vidéo d’entraînement. Tout ce qui exige un comportement physique précis, la dynamique des tissus, l’écoulement d’un liquide, les collisions de solides rigides, a tendance à paraître faux. Pour corriger cela, décrivez explicitement le mouvement dans le prompt plutôt que de laisser le modèle le déduire.

Fuite de propriétés : Deux concepts distincts dans un prompt peuvent se mélanger spatialement de façon inattendue. « Un sac rouge sur une table blanche » peut produire une table rose, parce que les descripteurs de couleur débordent l’un sur l’autre. Séparez volontairement vos descripteurs spatiaux et précisez à quel objet appartient chaque propriété.

Dérive de la scène sur les clips plus longs : Pour les clips de plus de 6 à 8 secondes, de nombreux modèles perdent le fil de la mise en scène initiale et glissent progressivement vers une composition différente. C’est une limite connue de la taille actuelle des espaces latents vidéo. Garder des prompts centrés sur un seul mouvement continu, dans un seul lieu, aide considérablement.

💡 Astuce : Les prompts courts, précis et centrés sur une seule scène surpassent presque toujours les descriptions longues qui enchaînent plusieurs événements. Une action claire vaut mieux qu’une séquence.

Long couloir de baies serveurs avec des rangées d’équipements éclairés et des sols en béton poli

Comment utiliser Wan 2.6 T2V sur PicassoIA

Wan 2.6 T2V est l’un des modèles de texte vers vidéo à architecture ouverte les plus performants disponibles actuellement, avec une cohérence temporelle particulièrement bonne et une forte fidélité au prompt. Voici comment le lancer directement sur PicassoIA.

Étape 1 : ouvrir la page du modèle

Rendez-vous sur la page de Wan 2.6 T2V sur PicassoIA. L’interface charge immédiatement les paramètres du modèle et un champ de prompt.

Étape 2 : rédiger un prompt structuré

Construisez votre prompt par couches, et non comme un flux de conscience :

  1. Sujet d’abord : Qui ou quoi est dans le cadre, et à quoi ressemble-t-il ? (« Une femme en manteau crème »)
  2. Action ensuite : Que se passe-t-il, et comment ? (« marche lentement dans une rue pavée déserte »)
  3. Comportement de la caméra : Où se situe la caméra et comment bouge-t-elle ? (« la caméra suit par l’arrière à hauteur de taille, légère poussée vers l’avant »)
  4. Environnement : Où cela se passe-t-il et à quoi cela ressemble-t-il ? (« tôt le matin, brouillard dense, lumière grise douce et diffuse »)
  5. Atmosphère : Quelques qualificatifs finaux sur la qualité (« photoréaliste, cinématographique, sans musique »)

Étape 3 : régler vos paramètres

ParamètreValeur de départ recommandée
Durée5 secondes
Résolution720p
Guidance scale7,0 à 7,5
Étapes d’inférence30
Format16:9

Commencez prudemment. Vous pourrez toujours augmenter les étapes et la résolution une fois que votre prompt fonctionne. Les clips plus longs ont besoin de davantage d’étapes pour rester temporellement cohérents.

Étape 4 : examiner le résultat

Une fois la génération terminée, évaluez votre résultat selon trois axes :

  • Fidélité au prompt : Le contenu correspond-il à ce que vous avez décrit ?
  • Cohérence temporelle : Le sujet conserve-t-il son identité tout au long du clip ?
  • Réalisme du mouvement : La physique paraît-elle plausible ?

Étape 5 : itérer efficacement

Si quelque chose ne va pas, modifiez une seule chose à la fois dans votre prompt. Si vous avez besoin d’un délai plus court pendant vos tests, Wan 2.5 T2V Fast utilise une architecture similaire à une vitesse de génération plus élevée, de sorte que ce que vous apprenez sur vos prompts se transfère directement.

💡 Astuce : Pour obtenir les meilleurs résultats temporels avec Wan 2.6 T2V, concentrez chaque prompt sur un seul mouvement continu dans un seul lieu. Les transitions de scène et les séquences à plusieurs événements mettent à rude épreuve la cohérence du modèle.

Homme comparant deux résultats de qualité vidéo côte à côte sur un moniteur grand format

À vous de jouer

Comprendre les mécanismes est une chose. Générer réellement quelque chose en est une autre. L’écart entre un résultat médiocre et un résultat vraiment bon se réduit rapidement dès que vous savez ce que fait le modèle à chaque étape. Vous ne devinez plus. Vous savez qu’il part du bruit, qu’il débruite vers votre embedding à chaque étape, qu’il porte son attention sur le temps pour maintenir la cohérence, et qu’il se décode en pixels grâce à un décodeur appris.

Cette connaissance change la façon dont vous rédigez vos prompts. Des descriptions plus courtes. Des instructions de mouvement explicites. Une seule scène cohérente par clip. Une précision spatiale pour chaque propriété. Des attentes réalistes quant à la physique que le modèle peut raisonnablement reproduire.

PicassoIA propose plus de 80 modèles de texte vers vidéo prêts à être lancés, des points d’entrée gratuits comme Ray Flash 2 540p et Pixverse v5.6 jusqu’aux options de qualité cinématographique comme Kling v3 Omni Video et Veo 3.1. Il n’existe pas de meilleure façon de comprendre le fonctionnement de ces modèles que de lancer quelques prompts vous-même, de comparer les résultats côte à côte et de remarquer précisément où et pourquoi ils diffèrent.

Choisissez un modèle. Rédigez une phrase claire et précise. Regardez ce qui en sort. Puis modifiez une seule chose et relancez.

Femme en robe crème fluide debout au bord d’un champ de blé doré à l’heure dorée

Partager cet article

Choisissez votre langue