Wan 2.7 : le dernier modèle vidéo IA d’Alibaba à connaître

Wan 2.7 est le dernier modèle vidéo IA à poids ouverts d’Alibaba, proposant le texte vers vidéo, l’image vers vidéo et la référence vers vidéo dans une seule version. Cet article explique ce qui le distingue, comment il se compare aux concurrents commerciaux et comment utiliser les trois modes pour des flux de travail créatifs concrets.

Wan 2.7 : le dernier modèle vidéo IA d’Alibaba à connaître
Cristian Da Conceicao
Fondateur de Picasso IA

Wan 2.7 n’a pas été accompagné d’une tournée de présentation. Il est arrivé comme une simple sortie de modèle de l’équipe de recherche d’Alibaba, avec trois capacités distinctes regroupées dans une seule version, et en quelques heures, les benchmarks ont commencé à affluer de chercheurs qui avaient déjà récupéré les poids et lancé leurs propres tests. Un accueil de ce type en dit long sur la série Wan : elle a gagné une attention sérieuse au sein de la communauté open source de la vidéo IA.

La série Wan est la famille phare de modèles de génération vidéo d’Alibaba, développée au sein de leur division de recherche en IA. Là où de nombreuses entreprises technologiques chinoises se sont concentrées sur des outils vidéo fermés, accessibles uniquement par API, Alibaba a adopté une approche différente avec Wan, en publiant ouvertement les poids du modèle et en laissant la communauté de recherche construire dessus. Wan 2.7 poursuit cette tradition tout en franchissant un cap significatif en matière de résolution, de qualité de mouvement et de polyvalence.

Monteur vidéo professionnel travaillant dans un studio de production cinématographique

Ce qui a changé avec la version 2.7

La génération précédente, Wan 2.6 T2V, était déjà capable de générer du texte vers vidéo en 720p et d’animer des images. Wan 2.7 repousse la limite sur trois points précis :

  • Sortie native en 1080p dans les trois modes de génération
  • Cohérence temporelle améliorée, ce qui signifie moins de tremblements et de dérive dans les clips plus longs
  • La référence vers vidéo comme fonctionnalité à part entière, et non comme une réflexion après coup

💡 La cohérence temporelle est ce qui distingue la vidéo IA de qualité professionnelle des clips vacillants et incohérents qui faisaient des premiers outils de texte vers vidéo de simples numéros de salon. Wan 2.7 prend ce point très au sérieux.

Les améliorations de l’architecture portent sur le backbone de diffusion vidéo, qui gère désormais plus efficacement les longues séquences de tokens. Le résultat concret : des transitions de mouvement plus fluides, une meilleure cohérence des sujets d’une image à l’autre et des détails plus fins dans les textures complexes comme les cheveux, les tissus et les surfaces d’eau.

La lignée de Wan

Il est utile de comprendre la place de la version 2.7 dans la progression. La série a évolué rapidement :

VersionRésolutionCaractéristique principale
Wan 2.1480p / 720pBase open source solide
Wan 2.2720pVariantes rapides, prise en charge de la synchronisation audio
Wan 2.5720p-1080pMeilleur mouvement, améliorations de l’I2V
Wan 2.61080pQualité affinée, variante flash
Wan 2.71080pT2V + I2V + R2V, version complète

Chaque itération s’est construite sur la précédente plutôt que de la remplacer. La variante Wan 2.2 I2V Fast reste pertinente lorsque la vitesse prime sur la qualité maximale. Wan 2.7 est le niveau premium.

Centre de données à grande échelle alimentant l’infrastructure de génération de vidéos IA

Trois modes dans une seule version

La plupart des modèles de génération vidéo sont spécialisés. Ils font du texte vers vidéo, ou ils animent des images, mais rarement les deux à un haut niveau. Wan 2.7 propose trois modes distincts qui couvrent les flux de travail les plus courants en génération vidéo, sans que vous ayez besoin de changer d’outil.

Texte vers vidéo (T2V)

Wan 2.7 T2V prend un prompt textuel et renvoie un clip vidéo complet en 1080p. Le modèle gère le mouvement de caméra, le déplacement des sujets et la composition de la scène à partir du seul prompt. Les résultats sont nettement plus nets que ceux des versions précédentes de Wan, avec une meilleure gestion des éléments complexes du prompt, comme les scènes de foule, les effets météo et les environnements architecturaux.

Pour les prompts impliquant un mouvement physique, comme de l’eau qui coule, du feu ou un tissu agité par le vent, la version 2.7 montre la progression la plus nette par rapport à ses prédécesseurs. Le mouvement, proche de la physique, paraît plus crédible.

Image vers vidéo (I2V)

Wan 2.7 I2V anime une image fixe que vous fournissez. C’est le mode le plus utilisé dans les flux de travail réels, car il vous donne un contrôle précis sur l’image de départ. Vous ne devinez pas à quoi ressemble la scène. Vous l’apportez.

La version 2.7 gère les cas limites qui posaient problème aux modèles précédents : les visages éclairés de manière inhabituelle, les scènes avec plusieurs sujets qui se chevauchent et les plans architecturaux aux motifs géométriques répétitifs. Tous ces cas sont traditionnellement difficiles pour l’animation d’image, car le modèle doit déduire la profondeur et le mouvement sans voir l’image qui précède ou qui suit.

💡 Pour de meilleurs résultats en I2V, utilisez des images source en haute résolution avec des sujets principaux bien définis. Wan 2.7 lit la profondeur implicite de l’image et s’en sert pour générer un mouvement de parallaxe réaliste.

Référence vers vidéo (R2V)

Wan 2.7 R2V est le mode qui suscite le plus de discussions. Vous fournissez une image de référence d’un personnage ou d’un objet, et le modèle génère une vidéo mettant en scène ce sujet dans un nouveau décor ou dans un contexte de mouvement différent. Il ne s’agit pas d’animation d’image. C’est une extraction du sujet combinée à une génération de scène.

Cela a des applications évidentes dans la publicité et la narration centrée sur des personnages, ainsi que partout où vous avez besoin d’une identité visuelle cohérente sur plusieurs clips vidéo.

Directrice créative examinant une lecture vidéo sur un moniteur de production

Pourquoi la sortie en 1080p compte

Le passage à une sortie native en 1080p ressemble à une simple ligne de fiche technique. En pratique, cela change ce pour quoi vous pouvez réellement utiliser la vidéo générée par l’IA.

Résolution et qualité

Une distinction mérite d’être faite : la résolution et la qualité perçue ne sont pas la même chose. Les premiers modèles vidéo IA en 1080p effectuaient un upscaling en interne et livraient des résultats nets mais visuellement incohérents. Wan 2.7 génère le rendu nativement en 1080p, ce qui signifie que les détails fins sont réellement présents plutôt qu’interpolés. Les mèches de cheveux, le texte en arrière-plan, les motifs de tissage : tout cela tient à pleine taille.

En 720p, la vidéo IA convient parfaitement aux vignettes web, aux aperçus pour les réseaux sociaux et à la pré-visualisation rapide. Avec le plancher de qualité de Wan 2.7 en 1080p, le résultat devient exploitable pour des plans de coupe destinés à la diffusion, des contenus YouTube, des vidéos de présentation et des formats courts à vocation commerciale.

Cohérence du mouvement d’une image à l’autre

L’autre point que le 1080p oblige le modèle à réussir est la cohérence du mouvement. En basse résolution, les petites incohérences entre les images se voient moins. En 1080p, une chevelure qui change de longueur d’une image à l’autre, ou une main qui scintille en dehors de ses proportions correctes, devient immédiatement évident.

Les scores de cohérence du mouvement de Wan 2.7 sur les benchmarks standard font partie des plus élevés parmi tous les modèles vidéo à poids ouverts publiés à ce jour. Cela se constate dans la stabilité d’une image à l’autre des résultats, et ne se limite pas à un chiffre de benchmark annoncé.

Objectif de caméra cinéma professionnelle mettant en valeur la précision optique

Comment il se positionne face à la concurrence

Le marché de la vidéo IA est devenu réellement concurrentiel. Pour comparer Wan 2.7 honnêtement, il faut regarder ce que chaque modèle fait vraiment bien.

Wan 2.7 face aux modèles commerciaux fermés

Kling v3 de Kuaishou et Veo 3 de Google sont les références actuelles de la génération vidéo commerciale fermée. Les deux produisent des résultats excellents. Sora 2 d’OpenAI gère mieux que la plupart des concurrents la vidéo narrative de longue durée à l’heure actuelle.

Voici ce qui différencie Wan 2.7 :

CritèreWan 2.7Modèles commerciaux
Poids du modèle disponiblesOui (ouverts)Non
Fine-tuning personnalisé possibleOuiNon
Référence de sujet cohérenteSolide (R2V)Variable
Coût par générationFaible (auto-hébergé)Paiement à l’usage
Sortie native en 1080pOuiOui (la plupart)
Génération audio nativeNonCertains (Veo 3, Sora 2)

L’audio est le point faible le plus évident de Wan 2.7 par rapport aux modèles fermés. Veo 3 et Hailuo 02 génèrent nativement un son synchronisé. Wan 2.7 ne le fait pas. Pour les flux de travail où la musique ou l’ambiance sonore compte, vous devrez prévoir un pipeline audio séparé ou choisir un autre modèle.

L’open source comme avantage réel

La nature à poids ouverts de Wan 2.7 mérite d’être prise au sérieux comme une fonctionnalité, et pas seulement comme un argument de coût. Le fine-tuning sur des styles visuels propriétaires, l’intégration dans des pipelines personnalisés, le déploiement en environnement hors ligne, l’utilisation d’adaptations LoRA pour des sujets spécifiques : rien de tout cela n’est possible avec les modèles fermés. Wan 2.7 est réellement extensible d’une manière que Seedance 2.0 et ses équivalents fermés ne le sont pas.

Espace de travail d’un créateur de contenu optimisé pour la production vidéo

Des cas d’usage qui fonctionnent vraiment

Créateurs de contenu et vidéo sociale

Le contenu vidéo au format court est le choix évident. Wan 2.7 T2V génère des clips convaincants de 5 à 10 secondes à partir de prompts textuels, soit exactement la durée requise pour les couvertures de réseaux sociaux, les séquences d’introduction et les plans de coupe. La sortie en 1080p évite les artefacts d’upscaling lors de la publication sur les plateformes qui prennent désormais en charge le 1080p60 nativement.

Pour les créateurs de contenu, le flux de travail le plus immédiatement utile est l’I2V : prenez un visuel statique ou une photographie que vous possédez déjà, animez-le avec Wan 2.7 et obtenez une version animée en quelques minutes.

Pré-visualisation en production cinématographique

La pré-visualisation, c’est-à-dire l’ébauche de plans avant le tournage principal, nécessitait traditionnellement soit un artiste 3D qualifié, soit un studio tiers coûteux. Wan 2.7 ne remplace complètement ni l’un ni l’autre. Mais pour communiquer rapidement l’angle de caméra, le mouvement des sujets et la mise en place approximative d’une scène à un réalisateur ou à un directeur de la photographie, la pré-visualisation par vidéo IA est devenue réellement utile au niveau de qualité de la version 2.7.

Le mode R2V est particulièrement pertinent ici : vous pouvez prendre une image de référence d’un acteur ou d’un lieu et générer des idées de scènes en conservant cette identité visuelle précise.

Vidéo produit et marketing

Les démonstrations de produits, les visuels de marque orientés style de vie et les plans de coupe marketing sont les domaines où le rapport qualité-coût de Wan 2.7 devient convaincant. Un plan produit avec un mouvement simple, une scène de vie intégrant un produit, un plan d’établissement d’un lieu : tout cela est réalisable à partir de prompts ou d’images de référence en 1080p, sans budget de production vidéo complet.

Matériel GPU haute performance rendant possible la génération de vidéos IA

Comment utiliser Wan 2.7 sur PicassoIA

PicassoIA héberge les trois variantes de Wan 2.7, qui sont accessibles sans avoir à mettre en place une infrastructure GPU locale. Voici comment utiliser chacune d’elles efficacement.

Utiliser Wan 2.7 T2V

  1. Rendez-vous sur Wan 2.7 T2V sur PicassoIA
  2. Rédigez un prompt textuel détaillé décrivant votre scène, avec le sujet, l’environnement, l’éclairage et la direction du mouvement
  3. Réglez la durée (5 ou 10 secondes) selon votre besoin
  4. Sélectionnez une sortie en 1080p pour une qualité maximale
  5. Soumettez et patientez environ 60 à 90 secondes pour la génération

Astuce pour le prompt : Wan 2.7 T2V répond bien aux termes de direction de caméra. Des expressions comme « panoramique lent vers la gauche », « recul aérien » ou « plan moyen fixe » influencent sensiblement le mouvement de caméra dans le résultat.

Utiliser Wan 2.7 I2V

  1. Rendez-vous sur Wan 2.7 I2V sur PicassoIA
  2. Importez votre image source (idéalement en 1080p ou plus)
  3. Ajoutez un prompt de guidage du mouvement décrivant ce qui doit bouger et de quelle façon
  4. Gardez le prompt de mouvement court et précis, par exemple : « la caméra avance lentement, les feuilles bruissent doucement »
  5. Générez le clip et vérifiez-le en pleine résolution avant de le télécharger

Astuce sur les paramètres : si votre image comporte une ligne d’horizon marquée, le modèle l’interprète naturellement comme une occasion de travelling avant. Évitez de surcharger le prompt de mouvement avec des directions contradictoires.

Utiliser Wan 2.7 R2V

  1. Rendez-vous sur Wan 2.7 R2V sur PicassoIA
  2. Importez votre image de référence du sujet (fonctionne mieux avec un arrière-plan épuré ou un sujet bien isolé)
  3. Rédigez un prompt de scène décrivant où et comment vous voulez que le sujet apparaisse
  4. Soyez précis sur le mouvement : « le sujet marche vers l’avant sur une rue pavée, lumière d’après-midi venant de la gauche »
  5. Vérifiez la cohérence entre la référence et le personnage généré sur l’ensemble du clip

💡 R2V fonctionne au mieux lorsque votre image de référence présente un sujet bien défini et contrasté. Une photographie à fort contraste avec un arrière-plan simple donne au modèle le signal le plus net sur lequel travailler.

Deux professionnels collaborant devant une interface de production vidéo

Les véritables limites de Wan 2.7

Une évaluation honnête compte plus que le battage médiatique.

Ce avec quoi il peine

Les longs clips à continuité narrative restent difficiles. Wan 2.7 génère efficacement des clips de l’ordre de 5 à 10 secondes. Une vidéo de 60 secondes avec des personnages cohérents évoluant dans une histoire cohérente n’est pas ce pour quoi ce modèle a été conçu. C’est un problème encore non résolu pour la plupart des modèles vidéo ouverts de cette génération.

Le rendu de texte dans la vidéo est médiocre. Tout flux de travail nécessitant du texte lisible à l’écran doit passer par une composition a posteriori, et non compter sur le modèle pour le générer.

Les mouvements extrêmes, comme les sports rapides, les coupes de caméra rapides et l’action à haute fréquence d’images, produisent plus d’artefacts que le travail de caméra plus lent et réfléchi, où Wan 2.7 excelle vraiment. Travaillez avec les points forts du modèle plutôt que contre eux.

Quand opter pour d’autres solutions

Pour une génération rapide avec des exigences de qualité moindres, Wan 2.2 T2V Fast reste intéressant. Il est nettement plus rapide au prix d’une partie de la qualité. Pour la génération audio native, Veo 3 ou Hailuo 02 sont les bons choix. Pour l’animation pilotée par le son en particulier, Wan 2.2 S2V gère bien la génération vidéo synchronisée sur le son.

Écran de moniteur affichant une sortie vidéo IA cinématographique et vive

Commencez à créer des vidéos IA dès maintenant

Wan 2.7 est actuellement le modèle vidéo à poids ouverts le plus performant, avec une combinaison de résolution, de polyvalence et de cohérence qui n’a encore jamais existé à ce niveau de prix. La sortie en trois modes couvre la grande majorité des flux de travail créatifs réels sans qu’il faille un outil différent pour chaque tâche.

Le moyen le plus rapide de voir ce qu’il fait est de le lancer. PicassoIA vous donne un accès direct aux trois variantes de Wan 2.7 sans aucune installation locale : pas de GPU, pas de poids de modèle à télécharger, pas de fichiers de configuration. Vous rédigez un prompt ou importez une image, et vous obtenez une vidéo IA en 1080p en moins de deux minutes.

Essayez Wan 2.7 T2V pour générer une vidéo à partir d’un prompt textuel, Wan 2.7 I2V pour animer une image fixe que vous possédez déjà, ou Wan 2.7 R2V pour placer un sujet précis dans une scène entièrement nouvelle. Le plancher de qualité pour la génération vidéo open source a nettement progressé avec cette sortie. Il n’y a jamais eu de meilleur moment pour vous y mettre.

Équipe d’une agence créative travaillant au crépuscule avec la skyline de la ville en toile de fond

Partager cet article

Choisissez votre langue