Pourquoi Wan 2.7 d’Alibaba fait autant parler de lui (et ce qu’il offre vraiment)

Wan 2.7 d’Alibaba est arrivé avec trois modes distincts de génération de vidéos, une qualité de sortie en 1080p et des poids ouverts que n’importe quel développeur peut faire tourner en local. Cet article détaille ce qui distingue Wan 2.7 de ses prédécesseurs, comment il se compare aux modèles vidéo les plus performants actuellement, et comment vous pouvez utiliser dès maintenant les trois modes sur PicassoIA.

Pourquoi Wan 2.7 d’Alibaba fait autant parler de lui (et ce qu’il offre vraiment)
Cristian Da Conceicao
Fondateur de Picasso IA

Quelque chose a changé dans la communauté de la vidéo IA lorsque l’équipe de recherche Wan d’Alibaba a publié la version 2.7 de sa suite de génération de vidéos. Non pas à cause d’un chiffre phare, mais parce que cette sortie réunit trois modes en un : texte vers vidéo, image vers vidéo, et un tout nouveau mode référence vers vidéo, le tout dans un ensemble à poids ouverts qui rivalise avec des modèles disponibles uniquement via des API payantes. L’engouement autour de Wan 2.7 est mérité.

Ce qu’est vraiment Wan 2.7

Trois modèles, pas un seul

Le « 2.7 » ne désigne pas un modèle unique. Il s’agit de trois capacités distinctes livrées ensemble sous le même numéro de version :

  • Wan 2.7 T2V : génère une vidéo en 1080p directement à partir d’un prompt textuel, sans image source.
  • Wan 2.7 I2V : part d’une image fixe et l’anime pour en faire un clip vidéo cohérent.
  • Wan 2.7 R2V : anime un sujet précis isolé d’une photo de référence, ce qui donne aux créateurs un contrôle fin sur ce qui bouge et sur la manière dont il bouge.

Chaque mode vise un flux de travail différent. T2V sert à créer à partir de prompts purs. I2V sert à animer des visuels existants. R2V est le vrai nouveau venu, et c’est l’élément qui attire le plus l’attention des réalisateurs et des équipes produit.

La base en 1080p compte

Avant Wan 2.7, obtenir une sortie en 1080p avec un modèle vidéo à poids ouverts nécessitait un post-traitement important ou des chaînes d’upscaling par-dessus la génération brute. Wan 2.7 T2V produit nativement du 1080p. Cela compte, car une résolution native préserve la cohérence temporelle d’une image à l’autre d’une façon qu’un upscaling après génération ne peut pas reproduire. Le flou de bougé, la netteté des contours et les détails fins de texture se dégradent lorsque les images sont redimensionnées après la synthèse. Quand le modèle génère en pleine résolution dès la première image, ces détails restent cohérents sur toute la durée du clip.

Développeur professionnel travaillant avec des outils de génération de vidéos IA sur une station de travail multi-écrans

Ce qui a changé entre la 2.6 et la 2.7

La qualité du mouvement a fait un vrai pas en avant

Wan 2.6 T2V et Wan 2.6 I2V étaient déjà de bons modèles, en particulier pour les mouvements de caméra fluides et les révélations de scènes statiques. Wan 2.7 comble l’écart sur le mouvement des sujets, qui était le point faible de la 2.6. Les personnages et les objets dans les clips Wan 2.7 conservent leurs proportions plus régulièrement d’une image à l’autre, et les éléments en mouvement rapide présentent nettement moins de scintillement temporel que la version précédente.

Wan 2.5 T2V exigeait une ingénierie de prompt minutieuse pour éviter la déformation caractéristique des contours qui apparaissait lors de mouvements complexes. La version 2.7 gère cela avec nettement moins d’intervention manuelle de la part de l’utilisateur.

R2V est une catégorie à part

La plupart des modèles de vidéo IA vous proposent deux voies : décrire quelque chose par du texte, ou partir d’une image. Wan 2.7 R2V ajoute une troisième voie : extraire un sujet précis d’une photo de référence et animer ce sujet dans une nouvelle scène. Vous fournissez une image d’une personne ou d’un produit, le modèle isole ce sujet et génère du mouvement tout en conservant son apparence visuelle sur toute la durée du clip.

Préserver l’identité, la texture et les proportions dans les images synthétisées exige que le modèle dispose d’une représentation interne détaillée du sujet de référence. Wan 2.7 y parvient de façon fiable pour les sujets statiques et pour les sujets à mouvement simple.

💡 R2V est particulièrement utile pour les équipes produit. Une seule photo de produit devient un clip de présentation en rotation, sans séance de studio physique ni plateau tournant.

Gros plan d’un moniteur de cinéma affichant une vidéo IA en 1080p aux détails de paysage nets

Vitesse et efficacité en 1080p

Une résolution plus élevée ne signifie pas toujours une génération proportionnellement plus lente. L’architecture de Wan 2.7 intègre des améliorations du backbone de type diffusion transformer qui réduisent le coût de calcul par étape en 1080p, par rapport à une passe d’upscaling naïve appliquée sur une génération de base en 720p. Cela maintient des temps de génération raisonnables pour les flux de travail itératifs, où les créateurs lancent des dizaines de variantes avant de retenir un clip final.

Comment Wan 2.7 se situe face à la concurrence

Le marché de la vidéo IA n’a jamais offert autant d’options. Voici une évaluation honnête des domaines où Wan 2.7 l’emporte et de ceux où il lui reste du terrain à rattraper.

Wan 2.7 ou Veo 3

Veo 3 et Veo 3.1 de Google produisent un son synchronisé natif avec la vidéo, ce que Wan 2.7 ne fait pas. La qualité cinématographique de Veo 3 est vraiment exceptionnelle, en particulier pour les scènes en extérieur avec un éclairage naturel complexe. Mais Veo 3 est une API fermée dont les coûts par génération s’accumulent rapidement en volume. Wan 2.7 est à poids ouverts, utilisable en local ou via des plateformes comme PicassoIA, à un coût par clip nettement inférieur. Pour les créateurs qui lancent des centaines d’itérations par projet, cet écart de coût est souvent décisif.

Wan 2.7 ou Sora 2

Sora 2 excelle dans les vidéos longues et les récits complexes à plusieurs scènes. La force de Wan 2.7 réside dans des clips courts et précis, avec un contrôle fin du sujet. Si vous avez besoin d’une vidéo de 30 secondes avec plusieurs transitions de scène et une parole synchronisée, Sora 2 est l’outil le plus solide. Si vous avez besoin d’un clip de 5 à 10 secondes sur un produit ou un personnage précis, avec un mouvement contrôlable, Wan 2.7 est plus pratique et nettement plus abordable.

Wan 2.7 ou Kling v2.6

Kling v2.6 de Kwai est sans doute le concurrent commercial le plus solide dans la même catégorie de qualité de mouvement. La cohérence des personnages de Kling est légèrement en avance sur Wan 2.7 pour les sujets humains aux expressions faciales complexes. Là où Wan 2.7 gagne du terrain, c’est dans la souplesse open source et le mode R2V, que Kling ne propose pas sous une forme équivalente. Kling v3, avec ses fonctions de contrôle du mouvement, est exceptionnel, mais il reste un produit uniquement payant.

Comparaison côte à côte des sorties de plusieurs modèles vidéo IA affichées sur un mur d’écrans d’agence média professionnelle

ModèleRésolutionOpen sourceAudioMode R2V
Wan 2.7 T2V1080pOuiNonOui
Veo 3.11080pNonOuiNon
Sora 21080pNonOuiNon
Kling v2.61080pNonNonNon
Seedance 2.51080pNonOuiNon
LTX 2.3 Pro4KNonNonNon
Ray 3.21080pNonNonNon

Wan 2.7 dans la chronologie IA d’Alibaba

De I2VGen à Wan

Alibaba travaille dans la génération de vidéos depuis plus longtemps que beaucoup ne l’imaginent. I2VGen-XL, publié par l’équipe de recherche ali-vilab, a été l’une des premières tentatives sérieuses et open source de génération d’image vers vidéo avec une cohérence structurelle. La série Wan a pris le relais de I2VGen en adoptant une architecture de diffusion transformer qui augmente la résolution sans explosion proportionnelle du calcul.

Wan 2.1 1.3B a posé le cadre central. Wan 2.2 I2V Fast a ajouté des versions optimisées pour la vitesse, et le mode piloté par le son Wan 2.2 S2V. Wan 2.5 T2V a nettement amélioré la cohérence temporelle. Wan 2.6 T2V a relevé le plafond de résolution. La version 2.7 fait désormais de R2V une capacité de premier plan, prête pour la production, aux côtés des améliorations de qualité sur l’ensemble du modèle.

Vue aérienne en plongée d’un immense couloir de centre de données abritant une ferme de serveurs GPU qui alimente la génération de vidéos IA

Happyhorse ou Wan : des objectifs différents

Alibaba maintient aussi la gamme Happyhorse 1.1, qui génère des vidéos jusqu’en 1080p à partir de textes ou d’images. Là où Happyhorse privilégie la fluidité cinématographique du mouvement et la cohérence stylistique sur des clips plus longs, Wan privilégie la fidélité au sujet et un contrôle précis. Ils ne sont pas en concurrence au sein de l’écosystème d’Alibaba. Happyhorse est l’outil de sortie de qualité studio pour des résultats cinématographiques fluides. Wan est l’outil de contrôle de précision pour l’animation d’un sujet donné. Happyhorse 1.0 reste disponible pour une génération plus rapide à des résolutions cibles plus basses.

Comment utiliser Wan 2.7 sur PicassoIA

PicassoIA héberge directement les trois modèles Wan 2.7. Pas de GPU local, pas de gestion de clé API, aucune installation nécessaire. Voici comment fonctionne chaque mode en pratique.

Wan 2.7 T2V : du texte au 1080p

  1. Ouvrez Wan 2.7 T2V sur PicassoIA.
  2. Rédigez un prompt détaillé décrivant la scène, le sujet, l’éclairage et le mouvement de caméra.
  3. Réglez la durée souhaitée du clip. Entre cinq et dix secondes, la cohérence temporelle est la meilleure.
  4. Lancez la génération et recevez la sortie en 1080p.

💡 Indiquez la direction de caméra dans votre prompt. « Travelling avant lent d’un plan moyen vers un gros plan » produit un mouvement nettement meilleur qu’un prompt qui ne décrit que le contenu statique de la scène.

Wan 2.7 I2V : animer n’importe quelle photo

  1. Ouvrez Wan 2.7 I2V sur PicassoIA.
  2. Importez votre image source.
  3. Décrivez le mouvement : ce qui bouge, dans quelle direction, à quelle vitesse.
  4. Le modèle génère un clip qui part de votre image et crée un mouvement cohérent à partir de là.

Les meilleures entrées pour I2V : des photos à fort contraste avec un sujet net sur un arrière-plan bien défini. Les images aux contours ambigus demandent des prompts de mouvement plus détaillés pour éviter les artefacts temporels près des limites du sujet.

Professionnelle de la création comparant des photos de référence imprimées avec des sorties vidéo animées par IA

Wan 2.7 R2V : animation d’un sujet précis

  1. Ouvrez Wan 2.7 R2V sur PicassoIA.
  2. Importez une image de référence du sujet que vous voulez animer.
  3. Décrivez en détail le mouvement souhaité et le contexte de la scène.
  4. Le modèle isole le sujet, préserve son apparence et synthétise le mouvement autour de lui.

Ce qui fonctionne bien en R2V : les produits, les personnages isolés, les véhicules et les animaux aux silhouettes bien distinctes. Ce qui demande un prompt soigné : les groupes de sujets qui se chevauchent, ou les arrière-plans très texturés qui rivalisent visuellement avec le sujet principal pour l’attention du modèle.

Des usages concrets qui fonctionnent vraiment

Des clips pour les réseaux sociaux à partir de photos fixes

L’usage le plus immédiat de Wan 2.7 I2V consiste à transformer la photothèque existante d’une marque en contenus vidéo courts. Une photo de nourriture devient une révélation cinématographique lente. Un cliché de mode gagne une animation subtile du tissu. Une photo de voyage reçoit une légère dérive en parallaxe qui se lit comme une vidéo native sur n’importe quel fil d’actualité. La barrière à la production de vidéos courtes baisse nettement lorsque les photos fixes sont déjà disponibles.

Jeune créatrice de contenus enregistrant une vidéo courte dans un studio domestique minimaliste de style scandinave

Prototypage de films et de publicités

Les réalisateurs utilisent Wan 2.7 T2V pour la prévisualisation. Un mouvement de caméra complexe qui prendrait une demi-journée à mettre en place sur place peut être testé sous forme de clip de 5 secondes en moins d’une minute. Si le cadrage fonctionne, le tournage physique gagne en efficacité. Sinon, rien n’est perdu, à part une minute de temps de calcul. Le modèle Wan 2.2 S2V gère aussi l’animation pilotée par le son, pour une prévisualisation approximative de la synchronisation audio.

Réalisateur prévisualisant la composition d’un plan généré par IA sur une tablette pendant un tournage en extérieur urbain à l’heure dorée

Visualisation de produits sans studio

Wan 2.7 R2V est déjà utilisé activement par des équipes e-commerce pour générer des vues de produits en rotation à partir d’une seule photo de studio. Une montre, une basket, un flacon de soin pour la peau : importez la référence, décrivez la rotation, et le modèle produit un clip de mouvement qui exigerait autrement un plateau tournant dédié et un vidéaste. Les économies de coût et de temps à grande échelle ne sont pas marginales.

Designer produit examinant une vidéo de produit en rotation générée par IA sur un ordinateur portable de studio à fond blanc épuré

Pourquoi l’angle open source est central

L’argument du coût et du contrôle

Les API de vidéo à code source fermé facturent à la seconde de contenu généré. À tout volume de production sérieux, ce coût grimpe vite. Un modèle à poids ouverts comme Wan 2.7 peut tourner sur une instance cloud GPU à coût mensuel fixe, ou via des plateformes comme PicassoIA qui répartissent les frais d’infrastructure entre de nombreux utilisateurs. Pour les studios qui génèrent des centaines de clips par semaine, le calcul est simple : l’accès à un modèle à poids ouverts coûte souvent dix fois moins cher par clip que les alternatives en API fermée.

Au-delà du coût, les poids ouverts permettent à la communauté de faire du fine-tuning, d’étendre et d’adapter le modèle à des usages spécifiques. Les modèles fermés ne s’améliorent que lorsque leurs développeurs décident d’investir dans un cycle de mise à jour. Les modèles ouverts progressent en continu, parce que les groupes de recherche, les développeurs indépendants et les équipes commerciales contribuent tous à la base partagée.

Bureau tech en espace ouvert avec une équipe diversifiée réunie autour de bureaux debout, collaborant sur le développement de la vidéo IA

Fine-tuning pour la cohérence de marque

Comme les poids de Wan 2.7 sont publics, le fine-tuning sur des styles visuels spécifiques est réalisable pour toute équipe disposant de ressources GPU modestes. Une société de production pourrait entraîner un adaptateur LoRA sur son style maison et obtenir des clips visuellement cohérents sur tous les actifs générés par IA de son pipeline. Un tel niveau de contrôle de marque n’est possible avec aucun modèle vidéo fermé disponible aujourd’hui, quel que soit le budget.

💡 Les poids ouverts permettent aussi l’inférence sur site. Les studios soumis à des exigences strictes de confidentialité de la propriété intellectuelle peuvent faire tourner Wan 2.7 en local, sans que le moindre contenu ne quitte leur réseau. C’est une contrainte impérative dans les domaines juridique, médical et financier, où l’usage d’API cloud est restreint.

La série Wan en un coup d’œil

Pour replacer la progression de la série, voici les principales versions de Wan accessibles sur PicassoIA :

VersionModeRésolution maximale
Wan 2.1 1.3BT2V720p
Wan 2.2 I2V FastI2V720p
Wan 2.2 S2VSynchro audio720p
Wan 2.5 T2VT2V1080p
Wan 2.5 I2VI2V1080p
Wan 2.6 T2VT2V1080p
Wan 2.6 I2VI2V1080p
Wan 2.7 T2VT2V1080p
Wan 2.7 I2VI2V1080p
Wan 2.7 R2VR2V1080p

Essayez Wan 2.7 dès maintenant

L’engouement autour de Wan 2.7 vient du fait que la génération de vidéos en 1080p à poids ouverts, avec un mode référence vers vidéo dédié, est aujourd’hui une capacité réelle et concrète. Ce n’est pas un aperçu de recherche. Ce n’est pas une liste d’attente. Les modèles sont en ligne, les résultats sont reproductibles, et vous pouvez commencer à générer des clips sans quitter votre navigateur.

PicassoIA vous donne un accès direct aux trois modes :

  • Wan 2.7 T2V : saisissez un prompt, obtenez un clip en 1080p.
  • Wan 2.7 I2V : importez une photo, décrivez le mouvement, regardez-la prendre vie.
  • Wan 2.7 R2V : utilisez une image de référence pour animer un sujet précis, avec son apparence et son identité préservées.

Si vous voulez aller au-delà de la génération de vidéos, PicassoIA héberge aussi une suite complète de modèles texte vers image, d’upscaling en super-résolution, d’amélioration vidéo par IA, de synchronisation labiale et d’outils de génération audio. Tout est accessible depuis une seule plateforme sur picassoia.com/en/all-models. Reste à savoir à quel projet vous voulez donner vie en premier.

Partager cet article

Choisissez votre langue