Référence vers vidéo avec Wan 2.7 : comment ça fonctionne vraiment

Wan 2.7 est le modèle de génération de vidéos open source le plus performant de 2027. Il propose trois modes distincts : texte vers vidéo, image vers vidéo et référence vers vidéo. Cet article détaille le fonctionnement interne de chaque mode, ce qui assure la cohérence temporelle d’une image à l’autre, et comment utiliser les trois variantes sur PicassoIA pour produire une vidéo cinématographique en 1080p à partir de n’importe quel point de départ.

Référence vers vidéo avec Wan 2.7 : comment ça fonctionne vraiment
Cristian Da Conceicao
Fondateur de Picasso IA

Wan 2.7 n’est pas une simple mise à jour incrémentale d’un modèle existant. Il représente un véritable changement d’architecture dans la manière dont la génération de vidéos open source gère simultanément le mouvement, la fidélité des sujets et la cohérence temporelle. Que vous partiez d’un prompt textuel, d’une image fixe ou d’un sujet de référence, les résultats se situent dans une tout autre catégorie que ceux des séries 2.1 et 2.5. Cet article décortique le fonctionnement réel de chacun des trois modes de Wan 2.7, pour que vous sachiez exactement quoi fournir au modèle et pourquoi.

Ce qu’est réellement Wan 2.7

Un ingénieur logiciel étudie des schémas de réseaux de neurones et des séquences d’images vidéo sur un écran transparent dans un laboratoire moderne

Wan 2.7 est un modèle de génération de vidéos fondé sur la diffusion, développé par Wan Video. Il appartient à la même famille de modèles que Wan 2.1, 2.2, 2.5 et 2.6, mais introduit une approche largement revisitée de l’attention inter-images et de la modélisation du mouvement. Le résultat est une cohérence des sujets nettement meilleure, un mouvement de caméra plus naturel et une résolution 1080p plus nette que dans toutes les versions précédentes.

Ce qui le distingue, c’est que les trois variantes partagent une même architecture de base tout en se spécialisant au niveau de la couche de conditionnement. Cette décision architecturale unique explique pourquoi T2V, I2V et R2V forment un ensemble cohérent plutôt que trois outils sans lien entre eux.

Trois modes, une seule architecture

La famille Wan 2.7 comprend trois variantes distinctes :

  • Wan 2.7 T2V : génère une vidéo à partir d’un simple prompt textuel, avec une sortie visée en 1080p.
  • Wan 2.7 I2V : prend une image fixe comme première image et l’anime dans le temps.
  • Wan 2.7 R2V : accepte une image de référence d’un sujet précis et anime ce sujet dans une nouvelle scène décrite par un prompt textuel.

Chaque mode répond à un flux de travail créatif différent. T2V convient à la conception d’un concept à partir de zéro. I2V donne vie à des photos existantes. R2V résout le problème le plus complexe : garder un personnage ou un objet particulier cohérent tout en le plaçant dans un contexte entièrement nouveau.

Ce qui a changé par rapport aux versions précédentes

La série Wan 2.5 (T2V, I2V) produisait déjà une vidéo crédible en 720p. La génération 2.6 (T2V, I2V) a franchi le cap de la qualité HD. Wan 2.7 ajoute trois éléments qu’aucune version précédente ne combinait : une voie de conditionnement dédiée à R2V, des fenêtres d’attention temporelle améliorées qui réduisent le scintillement sur les longues séquences, et un a priori de mouvement de meilleure fidélité, entraîné sur des séquences cinématographiques et non uniquement sur des vidéos du web.

Le fonctionnement du mode T2V

Gros plan en plongée de mains tapant un prompt détaillé de génération de vidéo sur un clavier mécanique, avec des photos de référence posées sur le bureau

Le texte vers vidéo est le point d’entrée le plus intuitif. Vous décrivez ce que vous voulez voir, et le modèle produit une séquence d’images qui correspond à cette description. Mais le mécanisme sous-jacent est plus intéressant que ce que laisse penser ce résumé.

Du texte aux images en mouvement

Wan 2.7 T2V fonctionne comme un modèle de diffusion latente doté d’une architecture de débruitage basée sur un transformeur. Lorsque vous soumettez un prompt, il passe d’abord par un encodeur de texte fondé sur un grand modèle de langage, qui convertit vos mots en une représentation vectorielle dense. Cette représentation conditionne l’ensemble du processus de débruitage.

Le modèle ne génère pas les images une à une. Il génère toutes les images simultanément dans un espace latent compressé, puis décode ce bloc latent en pixels à la fin. Cette approche sur la séquence complète explique pourquoi il gère le mouvement bien plus naturellement que les modèles vidéo autorégressifs : il peut s’appuyer sur les informations de l’image 12 pour décider de l’aspect de l’image 3, au lieu d’être enfermé dans une progression stricte de gauche à droite.

💡 Conseil pratique : Wan 2.7 T2V répond bien aux descriptions de mouvements de caméra. Des expressions comme « travelling avant lent », « panoramique à main levée vers la droite » ou « plan large fixe » influencent nettement le rendu, et pas seulement les descriptions du sujet.

D’où vient la cohérence temporelle

Une bande de film sur une table lumineuse montrant six images successives d’une vallée de montagne, avec un éclairage et une position des personnages constants

La cohérence temporelle est la chose la plus difficile à réussir en génération de vidéos, et c’est là que Wan 2.7 surpasse le plus nettement Wan 2.2 T2V Fast et les variantes antérieures comme Wan 2.1.

Le modèle utilise un mécanisme d’attention 3D qui opère simultanément sur les dimensions spatiales et sur la dimension temporelle. Chaque « patch » vidéo prête attention aux patchs voisins dans l’image et au même emplacement spatial dans les images adjacentes. C’est coûteux en calcul, mais cela oblige le modèle à maintenir des textures, un éclairage et une identité de sujet cohérents sur tout le clip, au lieu d’optimiser chaque image indépendamment.

Le résultat concret : les visages ne scintillent pas, la couleur des cheveux ne change pas au hasard d’une image à l’autre, et les éléments d’arrière-plan restent stables. Les modèles antérieurs avaient besoin de prompts négatifs spécifiques pour combattre ces artefacts. Avec Wan 2.7, ceux-ci sont rares plutôt que la norme.

Le fonctionnement du mode I2V

Les mains d’un photographe tenant une photo imprimée d’un lac au coucher du soleil, à côté d’un écran affichant la même scène animée avec des ondulations sur l’eau

La génération d’image vers vidéo pose une question différente de T2V : à partir de ce point de départ visuel précis, quelle est une suite plausible ? Wan 2.7 I2V est conçu spécifiquement pour cela, et son architecture de conditionnement diffère sensiblement de celle de T2V.

Votre image comme première image

Lorsque vous fournissez une image source, Wan 2.7 I2V l’encode via un encodeur visuel distinct de l’encodeur de texte, pour en extraire des représentations de caractéristiques profondes. Il concatène ensuite ces caractéristiques avec le latent bruité à chaque étape de débruitage. Il ne s’agit pas simplement de « démarrer la vidéo à partir de cette image » au sens naïf. Le modèle se réfère en permanence à la carte de caractéristiques de votre image tout au long de la génération, ce qui explique pourquoi, même dans les scènes à mouvements complexes, l’apparence du sujet d’origine reste en grande partie intacte.

Le prompt textuel que vous ajoutez à l’image agit comme un contrôleur de mouvement et de direction. Il indique au modèle ce qui doit se passer dans la scène, tandis que l’image lui indique à quoi la scène doit ressembler.

Comment le mouvement est synthétisé

Le modèle a été entraîné sur des données appariées : de véritables extraits vidéo dont certaines images précises ont servi d’entrées de conditionnement. Ce régime d’entraînement lui apprend la physique naturelle du mouvement. L’eau doit onduler vers l’extérieur, les cheveux doivent suivre une direction cohérente, les expressions du visage doivent se transformer en douceur. L’a priori de mouvement intégré au modèle agit comme un régulariseur qui maintient un mouvement naturaliste, même lorsque votre prompt est abstrait.

💡 Conseil pratique : pour I2V, les descriptions de mouvement courtes fonctionnent mieux que les longues. « Cheveux soufflés doucement vers la gauche, sourire léger, caméra fixe » donne de meilleurs résultats qu’un prompt à plusieurs propositions décrivant des actions simultanées et concurrentes. Des consignes de mouvement plus simples laissent à l’a priori de mouvement appris par le modèle plus de marge de manœuvre.

Le mode R2V est le vrai sujet

Jeune créateur de contenu tenant une photo de référence, tandis que l’écran derrière lui montre le même sujet animé dans un parc

Si T2V est pratique et I2V puissant, Wan 2.7 R2V est le mode qui résout un problème que les deux autres ne pouvaient pas traiter. La référence vers vidéo prend la photo d’une personne, d’un animal ou d’un objet précis et anime ce sujet dans une nouvelle scène que vous décrivez par un prompt textuel. L’identité visuelle du sujet est préservée, même si l’arrière-plan, l’éclairage et le mouvement sont entièrement générés.

Pourquoi la préservation du sujet compte

Avant les modèles capables de R2V, garder un personnage cohérent dans une vidéo générée par IA exigeait soit des flux de travail très techniques, comme ControlNet, le fine-tuning LoRA et l’empilement d’IP-Adapter, soit d’accepter que le personnage dérive en apparence. Aucune de ces options n’était viable pour un usage en production.

R2V change cela en ajoutant une voie de conditionnement dédiée au sujet. L’image de référence est traitée par un encodeur d’identité qui extrait des caractéristiques propres à l’apparence, distinctes du conditionnement au niveau de la scène issu du texte. Le modèle apprend à respecter ces caractéristiques d’identité sur toutes les images, en les traitant comme des contraintes strictes plutôt que comme de simples suggestions.

Le fonctionnement du conditionnement par référence

Votre image de référence est encodée deux fois. D’abord par l’encodeur visuel principal, pour capturer les caractéristiques au niveau de la scène, puis par un encodeur d’identité spécialement entraîné pour capturer les attributs d’apparence d’une personne ou d’un objet. Les deux ensembles de caractéristiques conditionnent le débruiteur à différentes échelles, les caractéristiques d’identité étant injectées dans les couches de plus haut niveau, là où l’information sémantique est représentée.

Le prompt textuel ne contrôle ensuite que le contexte de la scène et le mouvement, car la question de l’apparence du sujet a déjà reçu sa réponse grâce à l’image de référence. Cette séparation des responsabilités rend les résultats de R2V plus maîtrisés que ceux obtenus en appliquant un conditionnement IP-Adapter sur un modèle T2V standard.

Utiliser Wan 2.7 sur PicassoIA

Une femme debout devant un bureau dans un studio créatif lumineux, regardant une interface de création de vidéos par IA sur un écran

Les trois variantes de Wan 2.7 sont disponibles sur PicassoIA. Voici comment utiliser chacune d’elles efficacement.

Commencer avec T2V

Ouvrez Wan 2.7 T2V sur PicassoIA. Le champ de prompt accepte du texte libre, mais les prompts structurés donnent des résultats systématiquement meilleurs. Suivez cet ordre :

  1. Sujet : qui ou quoi se trouve dans la scène, avec les détails d’apparence.
  2. Action : ce qui se passe et comment cela bouge.
  3. Environnement : où se déroule la scène, y compris le moment de la journée.
  4. Caméra : ce que fait la caméra (fixe, panoramique, travelling, etc.).
  5. Style : photoréaliste, cinématographique, lumière naturelle, etc.

Le modèle génère en 1080p par défaut, ce qui en fait l’une des résolutions natives les plus élevées parmi les modèles vidéo open source. Le temps de génération est plus long que celui de la variante Wan 2.2 T2V Fast, mais la différence de qualité est suffisamment nette pour le justifier au-delà du simple prototypage rapide.

Animer des photos avec I2V

Importez votre image source dans Wan 2.7 I2V. L’image doit être nette, bien éclairée et contenir le sujet que vous voulez animer. Les images floues ou peu contrastées réduisent nettement la qualité du rendu, car le modèle dispose de moins d’informations visuelles pour s’ancrer.

Rédigez un prompt centré sur le mouvement. Décrivez le déplacement et l’environnement plutôt que de répéter l’apparence du sujet (le modèle la connaît déjà grâce à l’image). « Vagues qui se brisent doucement sur le rivage, lumière de l’heure dorée, plan large fixe » fonctionne mieux qu’une longue description composée qui tente de tout préciser à la fois.

R2V : animer des sujets précis

Wan 2.7 R2V demande deux entrées : une image de référence de votre sujet et un prompt textuel décrivant la nouvelle scène. Pour l’image de référence, les photos de type portrait, avec un sujet net sur un arrière-plan relativement simple, donnent les meilleurs résultats. L’encodeur d’identité fonctionne mieux lorsque le sujet n’est pas fortement masqué ni entouré d’éléments visuellement similaires.

Pour le prompt textuel, décrivez la nouvelle scène comme si le sujet de référence s’y trouvait déjà. « Marche à travers un sentier de forêt ensoleillé en automne, feuilles qui tombent, brise légère, travelling lent. » Le modèle se charge automatiquement de placer votre sujet de référence dans ce contexte.

Rédiger des prompts qui fonctionnent vraiment

Gros plan de deux fiches de prompt sur un bureau en bois : à gauche une version désordonnée et minimale, à droite une version structurée et détaillée, avec un stylo entre les deux

La qualité des rendus de Wan 2.7 dépend fortement de la qualité du prompt. Un prompt mal rédigé gaspille une génération. Un prompt bien structuré produit de manière constante une vidéo exploitable dès le premier essai.

La structure qui donne des résultats

Utilisez ce gabarit pour les prompts T2V et I2V :

[Subject + appearance] [action] in [environment], [time of day / lighting], [camera motion], photorealistic, [quality modifiers]

Prompt faible :

« Une femme marche dans une ville la nuit »

Prompt efficace :

« Une femme de fin 20 ans, vêtue d’un manteau de laine sombre, marche le long d’une rue pavée luisante de pluie, les lumières chaudes des vitrines se reflétant sur le pavé mouillé, travelling avant doux au niveau de la rue, photoréaliste, 8K »

La version structurée donne au modèle l’identité du sujet, les précisions du mouvement, l’environnement, l’éclairage, le comportement de la caméra et les consignes de qualité. Chacune de ces dimensions façonne un aspect différent du rendu.

4 erreurs qui gâchent les générations

  1. Trop d’actions simultanées. Wan 2.7 gère bien une action principale par clip. Plusieurs actions concurrentes produisent un mouvement incohérent.
  2. Oublier de préciser la caméra. Si vous ne spécifiez pas le mouvement de caméra, le modèle fait un choix qui ne correspond peut-être pas à votre intention. Nommez-le toujours.
  3. Des sujets trop abstraits. « Un sentiment de solitude » ne se génère pas bien. « Une personne assise seule sur un banc de parc, des pigeons picorant à proximité, lumière grise » fonctionne.
  4. Ignorer le format. Le modèle utilise par défaut le format 16:9. Si votre image source pour I2V est en orientation portrait, les résultats s’améliorent lorsque vous la recadrez ou la complétez pour obtenir un format 16:9 avant l’import.

Wan 2.7 face à la concurrence

Mur de moniteurs dans un studio domestique moderne affichant côte à côte quatre images fixes de vidéos générées par IA : paysage, portrait, scène côtière et scène urbaine

Wan 2.7 n’existe pas dans le vide. Voici sa position par rapport aux autres grands modèles de texte vers vidéo disponibles sur PicassoIA :

ModèleRésolution maxModesIdéal pour
Wan 2.7 T2V1080pT2VPlafond de qualité open source
Wan 2.7 I2V1080pI2VAnimer des photos fixes
Wan 2.7 R2V1080pR2VVidéo à sujet cohérent
Seedance 2.51080pT2V, I2VClips de 30 secondes avec audio natif
Kling v2.61080pT2V, I2VQualité de mouvement cinématographique
Veo 3.11080pT2VAudio natif, photoréalisme
LTX 2.3 Pro4KT2V, I2VRendu en très haute résolution
Ray 3.2HDRT2V, I2VHDR et étalonnage cinématographique

L’avantage principal de Wan 2.7 est le mode R2V, qu’aucun des concurrents listés ne propose nativement. Pour la qualité pure en T2V, Veo 3.1 et Seedance 2.5 sont très proches, et Seedance l’emporte en matière de durée de clip avec des sorties de 30 secondes. Pour la résolution maximale, LTX 2.3 Pro en 4K reste le plafond actuel. Pour l’association de la fidélité du sujet, de la qualité du mouvement et de l’accessibilité open source en 1080p, Wan 2.7 se place en tête de cet ensemble d’outils précis.

💡 Quand utiliser quel mode : si vous partez de zéro, utilisez T2V. Si vous avez une photo que vous voulez animer, utilisez I2V. Si vous devez placer un personnage cohérent dans différentes scènes, R2V est le seul mode conçu spécifiquement pour cela.

Créer votre première vidéo

Vue aérienne d’un ordinateur portable posé sur un bureau en marbre blanc, affichant une timeline de montage vidéo, à côté d’un carnet ouvert, d’un crayon et d’une tasse de café

Wan 2.7 est disponible dès maintenant dans ses trois modes sur PicassoIA, et obtenir votre premier clip est plus simple que la profondeur technique du modèle ne le laisse penser. Commencez avec Wan 2.7 T2V si vous avez un concept créatif et voulez le produire à partir d’une description textuelle. Passez à Wan 2.7 I2V lorsque vous disposez d’une image fixe que vous voulez animer. Utilisez Wan 2.7 R2V lorsque vous avez besoin qu’une personne ou un sujet précis apparaisse de façon cohérente dans plusieurs vidéos générées, sans entraînement supplémentaire.

La collection texte vers vidéo de PicassoIA vous donne aussi accès à plus de 87 modèles, aux compromis variés entre vitesse, résolution et style. Picassoia Video propose une génération gratuite et illimitée si vous voulez prototyper rapidement avant de lancer une génération de meilleure qualité avec Wan 2.7. Ray 3.2 mérite d’être essayé si la couleur cinématographique HDR est une priorité pour votre rendu.

Ce qui sépare une bonne vidéo IA d’une excellente, aujourd’hui, ne tient pas au seul choix du modèle. Cela tient à la précision du prompt et à une intention claire. Choisissez votre mode, rédigez un prompt qui précise le sujet, l’action, l’environnement, la caméra et le style, puis laissez Wan 2.7 faire ce pour quoi il a été conçu. Les rendus en 1080p d’un modèle open source à ce niveau de qualité étaient impossibles il y a dix-huit mois. Ils sont aujourd’hui accessibles à tous sur PicassoIA.

Partager cet article

Choisissez votre langue