Quelque chose a changé dans la communauté de la vidéo IA lorsque l’équipe de recherche Wan d’Alibaba a publié la version 2.7 de sa suite de génération de vidéos. Non pas à cause d’un chiffre phare, mais parce que cette sortie réunit trois modes en un : texte vers vidéo, image vers vidéo, et un tout nouveau mode référence vers vidéo, le tout dans un ensemble à poids ouverts qui rivalise avec des modèles disponibles uniquement via des API payantes. L’engouement autour de Wan 2.7 est mérité.
Ce qu’est vraiment Wan 2.7
Trois modèles, pas un seul
Le « 2.7 » ne désigne pas un modèle unique. Il s’agit de trois capacités distinctes livrées ensemble sous le même numéro de version :
- Wan 2.7 T2V : génère une vidéo en 1080p directement à partir d’un prompt textuel, sans image source.
- Wan 2.7 I2V : part d’une image fixe et l’anime pour en faire un clip vidéo cohérent.
- Wan 2.7 R2V : anime un sujet précis isolé d’une photo de référence, ce qui donne aux créateurs un contrôle fin sur ce qui bouge et sur la manière dont il bouge.
Chaque mode vise un flux de travail différent. T2V sert à créer à partir de prompts purs. I2V sert à animer des visuels existants. R2V est le vrai nouveau venu, et c’est l’élément qui attire le plus l’attention des réalisateurs et des équipes produit.
La base en 1080p compte
Avant Wan 2.7, obtenir une sortie en 1080p avec un modèle vidéo à poids ouverts nécessitait un post-traitement important ou des chaînes d’upscaling par-dessus la génération brute. Wan 2.7 T2V produit nativement du 1080p. Cela compte, car une résolution native préserve la cohérence temporelle d’une image à l’autre d’une façon qu’un upscaling après génération ne peut pas reproduire. Le flou de bougé, la netteté des contours et les détails fins de texture se dégradent lorsque les images sont redimensionnées après la synthèse. Quand le modèle génère en pleine résolution dès la première image, ces détails restent cohérents sur toute la durée du clip.

Ce qui a changé entre la 2.6 et la 2.7
La qualité du mouvement a fait un vrai pas en avant
Wan 2.6 T2V et Wan 2.6 I2V étaient déjà de bons modèles, en particulier pour les mouvements de caméra fluides et les révélations de scènes statiques. Wan 2.7 comble l’écart sur le mouvement des sujets, qui était le point faible de la 2.6. Les personnages et les objets dans les clips Wan 2.7 conservent leurs proportions plus régulièrement d’une image à l’autre, et les éléments en mouvement rapide présentent nettement moins de scintillement temporel que la version précédente.
Wan 2.5 T2V exigeait une ingénierie de prompt minutieuse pour éviter la déformation caractéristique des contours qui apparaissait lors de mouvements complexes. La version 2.7 gère cela avec nettement moins d’intervention manuelle de la part de l’utilisateur.
R2V est une catégorie à part
La plupart des modèles de vidéo IA vous proposent deux voies : décrire quelque chose par du texte, ou partir d’une image. Wan 2.7 R2V ajoute une troisième voie : extraire un sujet précis d’une photo de référence et animer ce sujet dans une nouvelle scène. Vous fournissez une image d’une personne ou d’un produit, le modèle isole ce sujet et génère du mouvement tout en conservant son apparence visuelle sur toute la durée du clip.
Préserver l’identité, la texture et les proportions dans les images synthétisées exige que le modèle dispose d’une représentation interne détaillée du sujet de référence. Wan 2.7 y parvient de façon fiable pour les sujets statiques et pour les sujets à mouvement simple.
💡 R2V est particulièrement utile pour les équipes produit. Une seule photo de produit devient un clip de présentation en rotation, sans séance de studio physique ni plateau tournant.

Vitesse et efficacité en 1080p
Une résolution plus élevée ne signifie pas toujours une génération proportionnellement plus lente. L’architecture de Wan 2.7 intègre des améliorations du backbone de type diffusion transformer qui réduisent le coût de calcul par étape en 1080p, par rapport à une passe d’upscaling naïve appliquée sur une génération de base en 720p. Cela maintient des temps de génération raisonnables pour les flux de travail itératifs, où les créateurs lancent des dizaines de variantes avant de retenir un clip final.
Le marché de la vidéo IA n’a jamais offert autant d’options. Voici une évaluation honnête des domaines où Wan 2.7 l’emporte et de ceux où il lui reste du terrain à rattraper.
Wan 2.7 ou Veo 3
Veo 3 et Veo 3.1 de Google produisent un son synchronisé natif avec la vidéo, ce que Wan 2.7 ne fait pas. La qualité cinématographique de Veo 3 est vraiment exceptionnelle, en particulier pour les scènes en extérieur avec un éclairage naturel complexe. Mais Veo 3 est une API fermée dont les coûts par génération s’accumulent rapidement en volume. Wan 2.7 est à poids ouverts, utilisable en local ou via des plateformes comme PicassoIA, à un coût par clip nettement inférieur. Pour les créateurs qui lancent des centaines d’itérations par projet, cet écart de coût est souvent décisif.
Wan 2.7 ou Sora 2
Sora 2 excelle dans les vidéos longues et les récits complexes à plusieurs scènes. La force de Wan 2.7 réside dans des clips courts et précis, avec un contrôle fin du sujet. Si vous avez besoin d’une vidéo de 30 secondes avec plusieurs transitions de scène et une parole synchronisée, Sora 2 est l’outil le plus solide. Si vous avez besoin d’un clip de 5 à 10 secondes sur un produit ou un personnage précis, avec un mouvement contrôlable, Wan 2.7 est plus pratique et nettement plus abordable.
Wan 2.7 ou Kling v2.6
Kling v2.6 de Kwai est sans doute le concurrent commercial le plus solide dans la même catégorie de qualité de mouvement. La cohérence des personnages de Kling est légèrement en avance sur Wan 2.7 pour les sujets humains aux expressions faciales complexes. Là où Wan 2.7 gagne du terrain, c’est dans la souplesse open source et le mode R2V, que Kling ne propose pas sous une forme équivalente. Kling v3, avec ses fonctions de contrôle du mouvement, est exceptionnel, mais il reste un produit uniquement payant.

Wan 2.7 dans la chronologie IA d’Alibaba
De I2VGen à Wan
Alibaba travaille dans la génération de vidéos depuis plus longtemps que beaucoup ne l’imaginent. I2VGen-XL, publié par l’équipe de recherche ali-vilab, a été l’une des premières tentatives sérieuses et open source de génération d’image vers vidéo avec une cohérence structurelle. La série Wan a pris le relais de I2VGen en adoptant une architecture de diffusion transformer qui augmente la résolution sans explosion proportionnelle du calcul.
Wan 2.1 1.3B a posé le cadre central. Wan 2.2 I2V Fast a ajouté des versions optimisées pour la vitesse, et le mode piloté par le son Wan 2.2 S2V. Wan 2.5 T2V a nettement amélioré la cohérence temporelle. Wan 2.6 T2V a relevé le plafond de résolution. La version 2.7 fait désormais de R2V une capacité de premier plan, prête pour la production, aux côtés des améliorations de qualité sur l’ensemble du modèle.

Happyhorse ou Wan : des objectifs différents
Alibaba maintient aussi la gamme Happyhorse 1.1, qui génère des vidéos jusqu’en 1080p à partir de textes ou d’images. Là où Happyhorse privilégie la fluidité cinématographique du mouvement et la cohérence stylistique sur des clips plus longs, Wan privilégie la fidélité au sujet et un contrôle précis. Ils ne sont pas en concurrence au sein de l’écosystème d’Alibaba. Happyhorse est l’outil de sortie de qualité studio pour des résultats cinématographiques fluides. Wan est l’outil de contrôle de précision pour l’animation d’un sujet donné. Happyhorse 1.0 reste disponible pour une génération plus rapide à des résolutions cibles plus basses.
PicassoIA héberge directement les trois modèles Wan 2.7. Pas de GPU local, pas de gestion de clé API, aucune installation nécessaire. Voici comment fonctionne chaque mode en pratique.
Wan 2.7 T2V : du texte au 1080p
- Ouvrez Wan 2.7 T2V sur PicassoIA.
- Rédigez un prompt détaillé décrivant la scène, le sujet, l’éclairage et le mouvement de caméra.
- Réglez la durée souhaitée du clip. Entre cinq et dix secondes, la cohérence temporelle est la meilleure.
- Lancez la génération et recevez la sortie en 1080p.
💡 Indiquez la direction de caméra dans votre prompt. « Travelling avant lent d’un plan moyen vers un gros plan » produit un mouvement nettement meilleur qu’un prompt qui ne décrit que le contenu statique de la scène.
Wan 2.7 I2V : animer n’importe quelle photo
- Ouvrez Wan 2.7 I2V sur PicassoIA.
- Importez votre image source.
- Décrivez le mouvement : ce qui bouge, dans quelle direction, à quelle vitesse.
- Le modèle génère un clip qui part de votre image et crée un mouvement cohérent à partir de là.
Les meilleures entrées pour I2V : des photos à fort contraste avec un sujet net sur un arrière-plan bien défini. Les images aux contours ambigus demandent des prompts de mouvement plus détaillés pour éviter les artefacts temporels près des limites du sujet.

Wan 2.7 R2V : animation d’un sujet précis
- Ouvrez Wan 2.7 R2V sur PicassoIA.
- Importez une image de référence du sujet que vous voulez animer.
- Décrivez en détail le mouvement souhaité et le contexte de la scène.
- Le modèle isole le sujet, préserve son apparence et synthétise le mouvement autour de lui.
Ce qui fonctionne bien en R2V : les produits, les personnages isolés, les véhicules et les animaux aux silhouettes bien distinctes. Ce qui demande un prompt soigné : les groupes de sujets qui se chevauchent, ou les arrière-plans très texturés qui rivalisent visuellement avec le sujet principal pour l’attention du modèle.
Des usages concrets qui fonctionnent vraiment
Des clips pour les réseaux sociaux à partir de photos fixes
L’usage le plus immédiat de Wan 2.7 I2V consiste à transformer la photothèque existante d’une marque en contenus vidéo courts. Une photo de nourriture devient une révélation cinématographique lente. Un cliché de mode gagne une animation subtile du tissu. Une photo de voyage reçoit une légère dérive en parallaxe qui se lit comme une vidéo native sur n’importe quel fil d’actualité. La barrière à la production de vidéos courtes baisse nettement lorsque les photos fixes sont déjà disponibles.

Prototypage de films et de publicités
Les réalisateurs utilisent Wan 2.7 T2V pour la prévisualisation. Un mouvement de caméra complexe qui prendrait une demi-journée à mettre en place sur place peut être testé sous forme de clip de 5 secondes en moins d’une minute. Si le cadrage fonctionne, le tournage physique gagne en efficacité. Sinon, rien n’est perdu, à part une minute de temps de calcul. Le modèle Wan 2.2 S2V gère aussi l’animation pilotée par le son, pour une prévisualisation approximative de la synchronisation audio.

Visualisation de produits sans studio
Wan 2.7 R2V est déjà utilisé activement par des équipes e-commerce pour générer des vues de produits en rotation à partir d’une seule photo de studio. Une montre, une basket, un flacon de soin pour la peau : importez la référence, décrivez la rotation, et le modèle produit un clip de mouvement qui exigerait autrement un plateau tournant dédié et un vidéaste. Les économies de coût et de temps à grande échelle ne sont pas marginales.

Pourquoi l’angle open source est central
L’argument du coût et du contrôle
Les API de vidéo à code source fermé facturent à la seconde de contenu généré. À tout volume de production sérieux, ce coût grimpe vite. Un modèle à poids ouverts comme Wan 2.7 peut tourner sur une instance cloud GPU à coût mensuel fixe, ou via des plateformes comme PicassoIA qui répartissent les frais d’infrastructure entre de nombreux utilisateurs. Pour les studios qui génèrent des centaines de clips par semaine, le calcul est simple : l’accès à un modèle à poids ouverts coûte souvent dix fois moins cher par clip que les alternatives en API fermée.
Au-delà du coût, les poids ouverts permettent à la communauté de faire du fine-tuning, d’étendre et d’adapter le modèle à des usages spécifiques. Les modèles fermés ne s’améliorent que lorsque leurs développeurs décident d’investir dans un cycle de mise à jour. Les modèles ouverts progressent en continu, parce que les groupes de recherche, les développeurs indépendants et les équipes commerciales contribuent tous à la base partagée.

Fine-tuning pour la cohérence de marque
Comme les poids de Wan 2.7 sont publics, le fine-tuning sur des styles visuels spécifiques est réalisable pour toute équipe disposant de ressources GPU modestes. Une société de production pourrait entraîner un adaptateur LoRA sur son style maison et obtenir des clips visuellement cohérents sur tous les actifs générés par IA de son pipeline. Un tel niveau de contrôle de marque n’est possible avec aucun modèle vidéo fermé disponible aujourd’hui, quel que soit le budget.
💡 Les poids ouverts permettent aussi l’inférence sur site. Les studios soumis à des exigences strictes de confidentialité de la propriété intellectuelle peuvent faire tourner Wan 2.7 en local, sans que le moindre contenu ne quitte leur réseau. C’est une contrainte impérative dans les domaines juridique, médical et financier, où l’usage d’API cloud est restreint.
La série Wan en un coup d’œil
Pour replacer la progression de la série, voici les principales versions de Wan accessibles sur PicassoIA :
Essayez Wan 2.7 dès maintenant
L’engouement autour de Wan 2.7 vient du fait que la génération de vidéos en 1080p à poids ouverts, avec un mode référence vers vidéo dédié, est aujourd’hui une capacité réelle et concrète. Ce n’est pas un aperçu de recherche. Ce n’est pas une liste d’attente. Les modèles sont en ligne, les résultats sont reproductibles, et vous pouvez commencer à générer des clips sans quitter votre navigateur.
PicassoIA vous donne un accès direct aux trois modes :
- Wan 2.7 T2V : saisissez un prompt, obtenez un clip en 1080p.
- Wan 2.7 I2V : importez une photo, décrivez le mouvement, regardez-la prendre vie.
- Wan 2.7 R2V : utilisez une image de référence pour animer un sujet précis, avec son apparence et son identité préservées.
Si vous voulez aller au-delà de la génération de vidéos, PicassoIA héberge aussi une suite complète de modèles texte vers image, d’upscaling en super-résolution, d’amélioration vidéo par IA, de synchronisation labiale et d’outils de génération audio. Tout est accessible depuis une seule plateforme sur picassoia.com/en/all-models. Reste à savoir à quel projet vous voulez donner vie en premier.