Comment utiliser Wan 2.6 étape par étape : créer des vidéos IA impressionnantes chez vous

Wan 2.6 est le modèle de génération de vidéos open source le plus performant à ce jour, avec un mouvement plus net, un meilleur respect du prompt et un rendu cinématographique, en texte vers vidéo comme en image vers vidéo. Cet article vous guide pas à pas, de la rédaction de votre premier prompt au réglage de la résolution, de la fréquence d’images et de l’intensité du mouvement, pour obtenir un résultat de qualité professionnelle dès le premier jour.

Comment utiliser Wan 2.6 étape par étape : créer des vidéos IA impressionnantes chez vous
Cristian Da Conceicao
Fondateur de Picasso IA

Wan 2.6 marque un véritable bond en avant dans la génération de vidéos open source. Si vous suivez ce domaine, vous connaissez déjà la série Wan de l’équipe de recherche, qui a publié des résultats compétitifs. La version 2.6 va plus loin, avec une cohérence de mouvement renforcée, un meilleur rendu des détails du visage et un respect du prompt nettement amélioré. Que vous réalisiez des clips cinématographiques pour les réseaux sociaux, que vous animiez des photos de produits ou que vous construisiez un flux de travail vidéo complet, c’est le modèle à connaître en ce moment.

Ce que fait réellement Wan 2.6

Wan 2.6 est un modèle de génération de vidéos open source basé sur la diffusion. Il prend en entrée soit une description textuelle, soit une image fixe, et produit un court clip vidéo, généralement de 4 à 8 secondes, jusqu’à une résolution de 1080p. Le modèle fonctionne comme un processus de diffusion sur les latents vidéo : il affine progressivement des images bruitées pour en faire un mouvement cohérent.

Ce qui le distingue des modèles open source précédents, c’est l’échelle d’entraînement et les changements d’architecture qui lui permettent de gérer la cohérence temporelle d’une image à l’autre, en conservant le même personnage, le même éclairage et le même environnement, sans scintillement ni dérive.

Photographe examinant une image animée par IA sur l’écran d’un reflex à l’heure dorée

Les deux modes expliqués

Wan 2.6 existe en deux versions principales :

ModeEntréeIdéal pour
T2V (texte vers vidéo)Prompt textuel uniquementCréer des scènes de toutes pièces
I2V (image vers vidéo)Image fixe + prompt textuelAnimer des photos, des photos de produits, des portraits

Les deux versions sont disponibles sur PicassoIA. La version texte vers vidéo est Wan 2.6 T2V et la version image vers vidéo est Wan 2.6 I2V. Il existe aussi Wan 2.6 I2V Flash, optimisé pour la vitesse lorsque vous avez besoin d’aperçus rapides.

En quoi il diffère des versions précédentes

Wan 2.5 T2V était déjà performant, mais la version 2.6 corrige ses principales faiblesses :

  • Meilleure cohérence des visages : les visages restent constants d’une image à l’autre
  • Respect du prompt renforcé : les descriptions de scènes complexes sont suivies de manière plus littérale
  • Réalisme du mouvement amélioré : le mouvement basé sur la physique pour les tissus, les cheveux et l’eau est nettement plus crédible

Note : pour une génération plus rapide au prix d’une certaine qualité, Wan 2.2 T2V Fast reste une excellente option pour les ébauches rapides.

Avant de rédiger le moindre prompt

La plupart des mauvais résultats avec Wan 2.6 viennent de mauvais prompts. Avant de toucher aux réglages, il faut savoir comment le modèle lit votre saisie.

Jeune femme tapant sur un ordinateur portable posé sur un bureau épuré, script affiché à l’écran

L’anatomie d’un bon prompt Wan 2.6

Un prompt Wan 2.6 efficace suit cette structure :

[Sujet] + [Action/Mouvement] + [Environnement] + [Éclairage] + [Comportement de la caméra] + [Style/Ambiance]

Par exemple :

« Une femme en robe rouge marchant lentement dans un champ de blé ensoleillé, lumière dorée de l’heure du coucher du soleil venant de l’arrière, caméra avançant lentement en contre-plongée, cinématographique, 8K, photoréaliste »

Chaque élément a son utilité. Le sujet est clair. Le mouvement est défini. L’environnement est précis. L’éclairage a une direction. La caméra reçoit des instructions.

Ce que Wan 2.6 comprend le mieux

  • Verbes de mouvement : « marcher lentement », « se retourner », « couler doucement », « monter régulièrement »
  • Langage de caméra : « travelling avant », « panoramique à gauche », « plan orbital », « légère oscillation à l’épaule »
  • Précisions d’éclairage : « lumière latérale chaude », « lumière diffuse de ciel couvert », « soleil de midi dur et direct »
  • Mots d’ambiance : « brumeux », « embué », « venteux », « pluvieux », « poussiéreux »

Astuce : décrivez ce que fait la caméra, pas seulement le sujet. Wan 2.6 répond bien au langage de direction cinématographique.

Utiliser Wan 2.6 texte vers vidéo étape par étape

Voici le flux de travail de base pour créer un clip de zéro avec Wan 2.6 T2V.

Vue aérienne d’un bureau de développeur avec des réglages vidéo affichés sur les écrans

Étape 1 : rédiger la description de votre scène

Commencez par une seule phrase décrivant le sujet, l’action et l’environnement. Développez ensuite chaque élément :

  1. Ouvrez un éditeur de texte brut
  2. Écrivez votre scène principale en une ligne
  3. Ajoutez l’éclairage à la ligne 2
  4. Ajoutez le mouvement de caméra à la ligne 3
  5. Ajoutez des balises de qualité et de style à la fin

Exemple de structure :

A man in a dark coat standing at a rain-soaked city intersection at night,
neon reflections on wet pavement, slow zoom out from close face to wide street,
cinematic, photorealistic, 8K, film grain

Étape 2 : régler vos paramètres

Une fois votre prompt prêt, réglez ces paramètres avant de lancer la génération :

ParamètreValeur recommandéePourquoi
Résolution1280x720 ou 1920x1080Équilibre entre qualité et vitesse
Images81 images (environ 5 s à 16 fps)Durée standard, bon arc de mouvement
Guidance scale5,0 à 7,0Plus la valeur est élevée, plus le prompt est suivi à la lettre
Étapes30 à 50Plus d’étapes = plus net mais plus lent
SeedFixe (par exemple 42)Verrouillez-la lorsque vous trouvez une bonne variante

Étape 3 : générer et itérer

Lancez votre première génération comme une ébauche. Ne jugez pas le résultat isolément :

  • Notez ce qui a fonctionné : composition, éclairage, direction générale du mouvement
  • Notez ce qui a échoué : visages, artefacts de mouvement, objets incorrects
  • Ajustez une seule variable à la fois : modifier le prompt ET le guidance scale en même temps rend impossible l’identification de ce qui a amélioré votre résultat

Utiliser Wan 2.6 image vers vidéo étape par étape

Le flux de travail I2V commence par une image fixe. Le modèle lit la composition, la profondeur et le contenu de l’image, puis l’anime en fonction de votre prompt de mouvement.

MacBook affichant l’interface d’une plateforme de génération de vidéos IA, lumière naturelle douce d’une fenêtre

Choisir la bonne image source

Toutes les images ne s’animent pas aussi bien. Wan 2.6 I2V fonctionne au mieux lorsque :

  • Le sujet est clairement identifiable et se détache de l’arrière-plan : portraits, photos de produits à sujet unique, objets isolés
  • L’image a un éclairage naturel : un éclairage de studio plat ou des photos très surexposées donnent une animation plate
  • La composition a de la profondeur : un sujet devant un arrière-plan flou fournit au modèle des repères spatiaux plus solides

À éviter : les photos très retouchées, les images générées par IA avec des artefacts visibles, ou les images comportant plusieurs sujets complexes qui se chevauchent.

Guider l’animation avec les prompts

Pour Wan 2.6 I2V, votre prompt textuel est une directive de mouvement, et non une description de scène. Vous indiquez au modèle comment bouger ce qui se trouve déjà dans l’image :

  • Bon : « Panoramique lent vers la droite, légère brise dans les cheveux, bokeh doux qui respire »
  • Bon : « Le sujet tourne légèrement la tête vers la droite, les yeux clignent naturellement »
  • Mauvais : « Une femme debout dans une forêt » (trop descriptif, pas assez de directives de mouvement)

Astuce : pour des aperçus plus rapides avant de lancer une génération complète, Wan 2.6 I2V Flash réduit nettement le temps de génération, avec une perte de qualité minime au stade de l’ébauche.

Utiliser Wan 2.6 sur PicassoIA

PicassoIA propose à la fois Wan 2.6 T2V et Wan 2.6 I2V directement dans sa collection. Voici la marche à suivre exacte.

Bande de film montrant des images vidéo passant du flou à une qualité cinématographique nette

Étape 1 : ouvrir le modèle

Rendez-vous sur la page Wan 2.6 T2V de PicassoIA. Vous verrez le panneau de saisie à gauche et la zone d’aperçu du résultat à droite. Si vous partez d’une image fixe, ouvrez plutôt Wan 2.6 I2V.

Étape 2 : renseigner les paramètres

Pour le texte vers vidéo :

  1. Collez votre prompt dans le champ de saisie principal
  2. Ajoutez votre prompt négatif (voir la section ci-dessous)
  3. Réglez la résolution : 1280x720 pour des résultats plus rapides, 1920x1080 pour une qualité finale
  4. Réglez le nombre d’images : 81 ou 97 images conviennent bien pour une durée de clip naturelle
  5. Réglez le guidance scale : commencez à 6,0
  6. Réglez le nombre d’étapes d’inférence : 40 est une valeur par défaut solide

Pour l’image vers vidéo :

  1. Importez votre image source dans le champ d’image
  2. Rédigez votre prompt de mouvement décrivant comment la scène doit bouger
  3. Réglez la même résolution et les mêmes paramètres d’images que précédemment

Étape 3 : générer et télécharger

Cliquez sur générer. PicassoIA met votre tâche en file d’attente et lance le traitement. Le temps de génération varie selon la résolution et le nombre d’images, généralement de 2 à 5 minutes pour un clip en 720p.

Une fois terminée, la vidéo apparaît dans le panneau de résultat. Visionnez-la directement et téléchargez le fichier MP4 depuis l’interface.

Astuce : si votre premier résultat présente des artefacts visibles sur les visages ou les mains, essayez de baisser le guidance scale de 0,5 à 1,0 et relancez la génération avec la même seed. Un guidance plus bas atténue souvent les artefacts de sur-netteté.

Les réglages qui comptent vraiment

La plupart des débutants se concentrent sur l’esthétique et négligent les paramètres qui contrôlent la qualité du résultat.

Professionnel attentif fixant des moniteurs de montage vidéo en lumière dorée de l’après-midi

Résolution et nombre d’images

Voici une référence pratique pour choisir vos réglages de sortie :

RésolutionNombre d’imagesDurée approximativeCas d’usage
832x48049 images~3 sTest d’ébauche
1280x72081 images~5 sQualité standard
1920x108081 images~5 sRésultat final
1920x1080121 images~7,5 sClips longs

Pour la plupart des usages sur les réseaux sociaux, 1280x720 avec 81 images offre le meilleur compromis entre qualité et coût de génération.

Intensité du mouvement et guidance scale

Le guidance scale (aussi appelé échelle CFG) est l’un des paramètres les plus influents :

  • En dessous de 4,0 : interprétation libre, liberté créative, peut ignorer votre prompt
  • De 4,0 à 6,0 : équilibré, généralement idéal pour les scènes complexes
  • De 6,0 à 8,0 : respect strict du prompt, peut introduire une sur-netteté ou des artefacts
  • Au-delà de 8,0 : produit souvent des résultats brûlés et peu naturels

Certaines implémentations proposent aussi un curseur d’intensité du mouvement ou de motion bucket. Les valeurs basses produisent un mouvement subtil et réaliste. Les valeurs élevées créent un mouvement spectaculaire et exagéré.

Prompts négatifs efficaces

Utilisez ceci comme prompt négatif de base pour des résultats plus propres :

blurry, low quality, artifacts, distorted faces, extra limbs,
flickering, watermark, text overlay, unrealistic motion, choppy frames

Ajoutez des termes précis selon les échecs de vos générations. Si les visages se déforment, ajoutez « visage déformé, mauvaise anatomie ». Si la vidéo est trop statique, ajoutez « pas de mouvement, statique, figé ».

5 erreurs qui ruinent les résultats de Wan 2.6

Gouttes d’eau suspendues en pleine chute, détail cristallin en macro extrême sur fond blanc

Voici les erreurs les plus courantes chez les utilisateurs de Wan 2.6 qui débutent :

  1. Des prompts qui décrivent une image statique plutôt qu’un mouvement : « Une femme debout dans un champ » produit presque aucun mouvement. Ajoutez des verbes de mouvement et des instructions de caméra.

  2. Changer trop de variables à la fois : si vous modifiez en même temps le prompt, le guidance, la résolution et la seed, vous ne pourrez jamais isoler ce qui a amélioré votre résultat.

  3. Utiliser un guidance scale élevé sur des scènes complexes à plusieurs sujets : plusieurs sujets avec un CFG élevé produisent souvent des artefacts. Descendez à 4,5 à 5,5 pour les plans de foule ou à plusieurs personnes.

  4. Ignorer complètement les prompts négatifs : même un prompt négatif basique réduit nettement la fréquence des artefacts.

  5. Générer en résolution maximale dès la première ébauche : le 1080p prend nettement plus de temps à traiter. Testez votre prompt en 720p, puis lancez la version finale approuvée en pleine résolution.

Que faire de vos vidéos ensuite

Deux mains tenant un clap sur un plateau de tournage professionnel, éclairage tungstène chaud

Un clip généré n’est qu’un point de départ. Voici comment aller plus loin :

  • Augmentez sa résolution : passez-le dans un modèle d’upscaling vidéo IA pour porter la sortie 720p à une netteté équivalente au 4K.
  • Ajoutez du son : associez votre clip à une musique générée avec un modèle de génération de musique IA, ou ajoutez une narration avec la synthèse vocale.
  • Montez et enchaînez : assemblez plusieurs clips Wan 2.6 dans un logiciel de montage pour construire des séquences plus longues.
  • Créez une boucle : les clips courts, de 2 à 3 secondes, peuvent être montés en boucles sans couture pour vos contenus sur les réseaux sociaux.
  • Ajoutez une synchronisation labiale : animez un visage avec Wan 2.6, puis appliquez un modèle de synchronisation labiale pour ajouter un mouvement de bouche réaliste à n’importe quelle piste vocale.

Commencez à créer dès maintenant

Femme souriante regardant la lecture d’une vidéo sur une tablette dans un espace de travail moderne et lumineux

La barrière à la production de vidéos IA de qualité professionnelle n’a jamais été aussi basse. Avec Wan 2.6 accessible directement via PicassoIA, vous n’avez besoin ni de matériel GPU local, ni de configuration complexe. Rédigez un prompt, réglez quelques paramètres et obtenez un clip cinématographique en quelques minutes.

Le meilleur moyen de développer une intuition avec ce modèle, c’est le volume. Lancez 10 générations. Comparez ce qui a fonctionné. Gardez un journal simple des prompts qui ont donné de bons résultats. Votre taux de réussite progressera rapidement.

Ouvrez Wan 2.6 T2V sur PicassoIA et lancez votre première génération dès maintenant. Si vous partez d’une photo fixe, rendez-vous directement sur Wan 2.6 I2V. Dans les deux cas, vous aurez un clip vidéo prêt à partager en moins de cinq minutes.

Partager cet article

Choisissez votre langue